You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/zh-MO/1-Introduction/03-defining-data/README.md

79 lines
6.6 KiB

This file contains ambiguous Unicode characters!

This file contains ambiguous Unicode characters that may be confused with others in your current locale. If your use case is intentional and legitimate, you can safely ignore this warning. Use the Escape button to highlight these characters.

# 定義數據
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|定義數據 - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
數據是用來作出發現和支持明智決策的事實、資訊、觀察和測量。數據點是數據集中的一個單位,數據集是數據點的集合。數據集可能有不同格式和結構,通常基於其來源或數據來源。例如,一家公司的每月收入可能會存放在電子表格中,但智能手錶的每小時心率數據可能是 [JSON](https://stackoverflow.com/a/383699) 格式。數據科學家通常會在數據集中處理不同類型的數據。
本課程重點在於根據數據的特徵和來源來識別和分類數據。
## [課前測驗](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## 數據的描述方式
### 原始數據
原始數據是從其來源來的初始狀態且尚未被分析或組織的數據。為了理解數據集的情況,需要將其組織成既能被人類理解,也能被技術用於進一步分析的格式。數據集的結構說明它是如何組織的,並可分類為結構化、非結構化及半結構化。這些結構類型會依據來源而異,但最終會符合這三個類別。
### 定量數據
定量數據是數據集中以數值形式呈現的觀察結果,通常可用於分析、測量和數學計算。定量數據的例子包括:一國的人口、一人的身高或一間公司的季度收入。通過進一步分析,定量數據可用來發現空氣質量指數 (AQI) 的季節性趨勢或估算典型工作日時段交通高峰的概率。
### 定性數據
定性數據,也稱為類別數據,是無法像定量數據那樣客觀測量的數據。它通常是各種主觀數據格式,捕捉某物的品質,例如產品或過程。有時候,定性數據是數值型的,但不會用於數學計算,比如電話號碼或時間戳。定性數據的例子包括:視頻評論、汽車的品牌與型號,或你最親密朋友的最愛顏色。定性數據可用於了解消費者喜愛的產品或識別求職履歷中的熱門關鍵詞。
### 結構化數據
結構化數據是以行和列組織的數據,每一行擁有相同的列集合。列代表特定類型的值,並以名稱標示該值代表的內容,而行則包含實際的數值。欄位通常會有一套規則或限制,確保數值能準確反映該欄位。舉例來說,假設有一個客戶電子表格,每一行必須有電話號碼,而電話號碼裡絕不能有字母,則電話號碼欄會有規則確保此欄位不能空白且僅包含數字。
結構化數據的優點是可以以此組織形式與其他結構化數據建立關聯。然而,由於數據被設計成特定方式組織,若要修改整體結構會相當耗費心力。舉例來說,若要在客戶電子表格新增一欄且不可空白的電子郵件欄,就需要想辦法對現有客戶資料逐行新增該欄位的值。
結構化數據的例子:電子表格、關聯式資料庫、電話號碼、銀行帳單
### 非結構化數據
非結構化數據通常無法分類為行和列且無固定格式或使用規則。因為非結構化數據較少限制其結構所以相較於結構化數據更易添加新資訊。比方說若一個感應器每兩分鐘測量一次氣壓後來更新新增測量溫度和記錄功能對非結構化數據來說這不需改變原資料格式。然而這可能會讓分析這類數據變得更花時間。例如一位科學家想用感應器數據計算上個月的平均溫度但發現部分數據中用「e」表示感應器故障而非正常數字表示資料不完整。
非結構化數據的例子:文字檔、簡訊、影片檔
### 半結構化數據
半結構化數據具有結構化和非結構化數據的特徵。其通常不符合行列格式,但組織方式被視為有結構,且可能遵循固定格式或規則。結構因來源而異,可能是明確的層級,也可能較靈活,方便整合新資訊。元資料是幫助決定數據如何組織和儲存的指標,根據數據類型有不同名稱,常見的有標籤、元素、實體和屬性。舉例,一封典型的電子郵件會有主旨、內文與收件者群,可依發件人或發送時間組織。
半結構化數據的例子HTML、CSV檔案、JavaScript 物件表示法 (JSON)
## 數據來源
數據來源是數據產生或存放的初始位置,會根據收集方式與時間有所不同。由使用者產生的數據稱為原始數據(primary data),而從為一般用途收集而得的數據稱為次級數據(secondary data)。例如,一組科學家在雨林收集觀察資料即為原始數據,他們若將此資料分享給其他科學家,對那些使用資料者來說即為次級數據。
資料庫常見做為數據來源,依賴資料庫管理系統來託管和維護資料,用戶則使用稱為查詢的指令來探索數據。以檔案做數據來源可以是音訊、影像和影片檔,也可包含如 Excel 的電子表格。網際網路是眾多數據的常見託管地包括資料庫與檔案皆可找到。應用程式介面API允許程式設計師透過網路創建資料分享方式而網頁爬蟲則從網頁擷取資料。[Working with Data](../../../../../../../../../2-Working-With-Data) 課程深入介紹了各種數據來源的使用。
## 結語
這課我們學到:
- 甚麼是數據
- 數據如何被描述
- 如何分類與歸類數據
- 數據可以從哪裡取得
## 🚀 挑戰
Kaggle 是一個優秀的開放數據集來源。使用 [資料集搜尋工具](https://www.kaggle.com/datasets) 找到一些有趣的資料集,並依以下標準分類 3-5 個資料集:
- 該數據是定量還是定性?
- 該數據是結構化、非結構化還是半結構化?
## [課後測驗](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## 複習與自學
- 這個 Microsoft Learn 單元,標題為 [識別數據格式](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) 詳細解析了結構化、半結構化和非結構化數據。
## 作業
[分類資料集](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**免責聲明**
本文件使用 AI 翻譯服務 [Co-op Translator](https://github.com/Azure/co-op-translator) 進行翻譯。雖然我們力求準確,但請注意,自動翻譯可能包含錯誤或不準確之處。原始文件的母語版本應被視為權威來源。對於重要資訊,建議尋求專業人工翻譯。我們不對因使用本翻譯而引起的任何誤解或曲解承擔責任。
<!-- CO-OP TRANSLATOR DISCLAIMER END -->