|
|
1 year ago | |
|---|---|---|
| .. | ||
| README.md | 1 year ago | |
| assignment.ipynb | 1 year ago | |
| assignment.md | 1 year ago | |
| notebook.ipynb | 1 year ago | |
README.md
データサイエンスライフサイクル: 分析
![]() |
|---|
| データサイエンスライフサイクル: 分析 - スケッチノート by @nitya |
講義前クイズ
講義前クイズ
データライフサイクルにおける分析は、提案された質問に答えたり、特定の問題を解決したりするためにデータが役立つことを確認するプロセスです。このステップでは、モデルがこれらの質問や問題に正しく対応しているかを確認することにも焦点を当てます。このレッスンでは、探索的データ分析(EDA)に焦点を当てます。EDAは、データ内の特徴や関係を定義するための手法であり、モデリングの準備に役立ちます。
ここでは、Kaggleの例のデータセットを使用し、PythonとPandasライブラリを使ってこれをどのように適用するかを示します。このデータセットには、メール内で見つかる一般的な単語の出現回数が含まれており、これらのメールの送信元は匿名です。このディレクトリ内のノートブックを使用して一緒に進めてください。
探索的データ分析
ライフサイクルのキャプチャフェーズでは、データの取得と問題や質問の特定が行われますが、データが最終結果をサポートできるかどうかはどうやって確認するのでしょうか?
データサイエンティストはデータを取得した際に以下のような質問をするかもしれません:
- この問題を解決するのに十分なデータがあるか?
- この問題に対してデータの品質は許容範囲か?
- データを通じて追加の情報を発見した場合、目標を変更または再定義するべきか?
探索的データ分析は、データを理解するプロセスであり、これらの質問に答えるだけでなく、データセットを扱う際の課題を特定するのにも役立ちます。ここでは、この目的を達成するために使用されるいくつかの手法に焦点を当てます。
データプロファイリング、記述統計、Pandas
この問題を解決するのに十分なデータがあるかどうかをどのように評価するのでしょうか?データプロファイリングは、記述統計の手法を通じてデータセットに関する一般的な情報を要約し収集することができます。データプロファイリングは、利用可能なものを理解するのに役立ち、記述統計は利用可能なものの量を理解するのに役立ちます。
以前のいくつかのレッスンでは、Pandasを使用してdescribe()関数を使い、記述統計を提供しました。この関数は、数値データに対して件数、最大値と最小値、平均、標準偏差、分位点を提供します。describe()関数のような記述統計を使用することで、データの量を評価し、追加が必要かどうかを判断できます。
サンプリングとクエリ
大規模なデータセット全体を探索するのは非常に時間がかかる作業であり、通常はコンピュータに任されることが多いです。しかし、サンプリングはデータを理解するための便利なツールであり、データセットに含まれる内容やその意味をよりよく理解するのに役立ちます。サンプルを使用することで、確率や統計を適用し、データに関する一般的な結論を導き出すことができます。サンプリングするデータ量に関する明確なルールはありませんが、サンプリングするデータが多ければ多いほど、データに関する一般化の精度が向上します。
Pandasにはsample()関数があり、ランダムなサンプル数を指定して使用することができます。
データの一般的なクエリは、持っているデータに関する一般的な質問や仮説に答えるのに役立ちます。サンプリングとは対照的に、クエリは特定の部分に焦点を当て、特定の質問に答えるためのコントロールを提供します。Pandasライブラリのquery()関数を使用すると、列を選択し、取得した行を通じてデータに関する簡単な回答を得ることができます。
可視化による探索
データが完全にクリーンアップされ分析されるまで待つ必要はありません。実際、探索中に視覚的な表現を作成することで、データ内のパターン、関係、問題を特定するのに役立ちます。さらに、可視化はデータを管理していない人々とのコミュニケーション手段を提供し、キャプチャ段階で取り上げられなかった追加の質問を共有し明確にする機会を提供します。可視化に関するセクションを参照して、視覚的に探索するための一般的な方法について学んでください。
不整合を特定するための探索
このレッスンのすべてのトピックは、欠損値や不整合な値を特定するのに役立ちますが、Pandasにはこれらをチェックするための関数が用意されています。isna()またはisnull()は欠損値をチェックすることができます。データ内のこれらの値を探索する際に重要なのは、それらがなぜそのような状態になったのかを探ることです。これにより、解決するためのアクションを決定するのに役立ちます。
講義後クイズ
課題
免責事項:
この文書は、AI翻訳サービス Co-op Translator を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があります。元の言語で記載された原文が正式な情報源と見なされるべきです。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や誤認について、当社は一切の責任を負いません。
