|
|
4 weeks ago | |
|---|---|---|
| .. | ||
| README.md | 4 weeks ago | |
| assignment.md | 7 months ago | |
README.md
データの定義
![]() |
|---|
| データの定義 - @nitya によるスケッチノート |
データとは、発見や情報に基づく意思決定を支援するために使用される事実、情報、観察結果、および測定値です。データポイントはデータセット内の単一のデータ単位で、データセットは複数のデータポイントの集合体です。データセットは異なる形式や構造で存在し、そのソースやデータの由来に基づくことが多いです。たとえば、企業の月次収益はスプレッドシートにあるかもしれませんが、スマートウォッチからの毎時間の心拍数データはJSON形式である可能性があります。データサイエンティストがデータセット内で異なる種類のデータを扱うことは一般的です。
このレッスンでは、データの特徴やソースに基づいたデータの識別と分類に焦点を当てます。
事前講義クイズ
データの説明方法
生データ
生データとは、データのソースから初期の状態で得られ、分析や整理がされていないデータです。データセットの内容を理解するためには、人間や解析技術が扱いやすい形式に整理する必要があります。データセットの構造は、どのように整理されているかを示し、構造化、非構造化、半構造化の3つに分類されます。これらの構造タイプはソースにより異なりますが、最終的にはこの3つのカテゴリに収まります。
定量データ
定量データは、データセット内の数値的な観察値で、一般に分析、測定、数学的利用が可能です。定量データの例には、国の人口、個人の身長、企業の四半期収益などがあります。追加の分析により、定量データから季節ごとの空気質指数(AQI)の傾向を発見したり、典型的な平日のラッシュ時の交通確率を推定したりできます。
定性データ
定性データはカテゴリー型データとも呼ばれ、定量データのように客観的に測定できないデータです。主に製品やプロセスの質を捉えた主観的な多様な形式のデータです。時に定性データは数値として扱われますが、数学的には通常使用されないもの(電話番号やタイムスタンプなど)です。定性データの例には、ビデオのコメント、車のメーカーとモデル、親しい友人の好きな色などがあります。定性データは消費者が最も好む製品を理解したり、求人履歴書の人気キーワードを特定するために使われます。
構造化データ
構造化データは、各行が同じ複数の列を持つ行と列に整理されたデータです。列は特定のタイプの値を表し、その値が示す内容を表す名前で識別され、行には実際の値が入ります。列には、その列の値が正確に表現されるように特定のルールや制限が設けられることが多いです。たとえば顧客のスプレッドシートがあり、各行が電話番号を持ち、電話番号にアルファベットが含まれないとします。この場合、電話番号列に空欄がなく数字のみを含むようなルールが適用されるかもしれません。
構造化データの利点は、他の構造化データと関連付けて整理できることです。ただし、データの構造が特定のフォーマットに基づいて設計されているため、全体の構造を変更するには多くの作業が必要になることがあります。例えば、空欄不可のメールアドレスの列を顧客のスプレッドシートに追加する場合、既存の顧客の行にどのように値を追加するかを考えなければなりません。
構造化データの例:スプレッドシート、リレーショナルデータベース、電話番号、銀行取引明細
非構造化データ
非構造化データは通常、行や列に分類できず、フォーマットやルールがありません。非構造化データは構造に制限が少ないため、新しい情報の追加が構造化データに比べて容易です。例えば、2分ごとに気圧データを記録するセンサーが温度の記録を可能にするアップデートを受けた場合、非構造化であれば既存データを変更せずに済みます。ただし、こうしたデータの分析や調査には時間がかかることがあります。たとえば、科学者が前月の平均温度をセンサーのデータから求めたい場合、破損を表す記号「e」が一部に記録されていて、データが不完全であることが判明するかもしれません。
非構造化データの例:テキストファイル、テキストメッセージ、動画ファイル
半構造化データ
半構造化データは構造化データと非構造化データの特徴を併せ持ちます。通常、行と列の形式には従いませんが、整理されており、固定フォーマットやルールに沿っていることもあります。ソースにより構造は異なり、明確な階層構造を持つものから、情報の統合が容易な柔軟なものまでさまざまです。メタデータはデータの構造や保存方法を決定する指標で、タグ、要素、エンティティ、属性など様々な名称で呼ばれます。例えば、典型的な電子メールは件名、本文、受信者リストを持ち、誰から送られたか、いつ送られたかで整理できます。
半構造化データの例:HTML、CSVファイル、JavaScript Object Notation (JSON)
データのソース
データソースはデータが生成された最初の場所、つまりデータの「所在」を指し、どのようにいつ収集されたかによって異なります。ユーザーによって生成されたデータは一次データと呼ばれ、一般利用のために収集されたデータは二次データです。たとえば、科学者グループが熱帯雨林の観察を収集した場合、それは一次データとされ、ほかの科学者と共有すれば、その共有先では二次データとなります。
データベースは一般的なデータソースで、データベース管理システムを使ってデータを保管、管理し、ユーザーはクエリと呼ばれる命令でデータを探ります。ファイルソースは音声、画像、動画ファイルやExcelのようなスプレッドシートなどがあります。インターネットはデータ配置の一般的な場所で、データベースやファイル双方があります。アプリケーションプログラミングインターフェース(API)はプログラマが外部ユーザーとデータ共有する手段を作るもので、ウェブスクレイピングはウェブページからのデータ抽出方法です。Working with Data のレッスンでは様々なデータソースの利用方法に焦点を当てています。
結論
このレッスンで学んだこと:
- データとは何か
- データの説明方法
- データの分類とカテゴライズ
- データの所在場所
🚀 チャレンジ
Kaggleはオープンデータセットの優れたソースです。データセット検索ツールを使って興味深いデータセットを見つけ、3~5件を以下の基準で分類してください:
- データは定量的か定性的か?
- データは構造化、非構造化、半構造化のどれか?
講義後クイズ
復習と自主学習
- Identify data formats というタイトルのMicrosoft Learnユニットには、構造化、半構造化、非構造化データについて詳細な説明があります。
課題
免責事項: 本書類は AI 翻訳サービス Co-op Translator を使用して翻訳されています。正確性を期していますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。原文の原語版が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の利用により生じたいかなる誤解や解釈違いについても、当方は責任を負いかねます。
