You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/zh-TW/1-Introduction/03-defining-data/README.md

79 lines
6.6 KiB

This file contains ambiguous Unicode characters!

This file contains ambiguous Unicode characters that may be confused with others in your current locale. If your use case is intentional and legitimate, you can safely ignore this warning. Use the Escape button to highlight these characters.

# 定義資料
|![ Sketchnote 由 [(@sketchthedocs)](https://sketchthedocs.dev) 製作 ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|定義資料 - _Sketchnote 由 [@nitya](https://twitter.com/nitya) 製作_ |
資料是用於發現新知與支持明智決策的事實、資訊、觀察與測量值。資料點是資料集內單一單位的資料,而資料集則是由數個資料點組成。資料集可呈現不同的格式和結構,通常依據其來源,也就是資料來自哪裡而定。例如,一間公司的每月盈餘可能儲存在試算表中,但智慧手錶的每小時心率資料可能是以 [JSON](https://stackoverflow.com/a/383699) 格式呈現。資料科學家經常會在同一資料集中處理不同類型的資料。
本課程聚焦於依據資料特性及來源辨識與分類資料。
## [課前測驗](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## 資料的描述方式
### 原始資料
原始資料是來自其來源的初始狀態資料,尚未被分析或組織。為了理解資料集的內容,需要將其整理成讓人類以及用來進一步分析的技術能理解的格式。資料集的結構描述其組織方式,且可分類為結構化、非結構化及半結構化。這些結構類型會依據來源有所不同,但最終皆隸屬上述三種分類。
### 量化資料
量化資料是在資料集中屬於數值的觀察值通常可以被分析、測量並以數學方式使用。量化資料的例子包括一個國家的人口、一個人的身高或一間公司的季報盈餘。經過進一步分析後量化資料可用來發現空氣品質指數AQI的季節性趨勢或估計典型工作日的尖峰時段交通機率。
### 質性資料
質性資料又稱為類別資料,是無法像量化資料那樣被客觀測量的資料。它通常是各種主觀資料形式,捕捉某物的品質,例如產品或流程。有時質性資料是數值型態但通常不會用數學方式操作,如電話號碼或時間戳。質性資料的例子包括:影片留言、汽車的品牌與型號,或你最親近朋友的最愛顏色。質性資料可用來了解消費者最喜愛的產品,或辨識求職履歷中的熱門關鍵字。
### 結構化資料
結構化資料以列與欄組織,每列擁有相同的欄位集合。欄位代表特定類型的數值,並以名稱辨識欄位代表的內容,而列則包含實際數值。欄位常有特定規則或限制,以確保數值能準確代表欄位內容。例如,假設一份客戶試算表中,每列必須有電話號碼,且電話號碼內不含英文字母。電話號碼欄位可能會有規則,確保其不為空值且只包含數字。
結構化資料的優點是能以某種方式組織,使其可以與其他結構化資料建立關聯。然而,因為資料設計成特定組織形式,變更整體結構通常需要大量努力。例如,想在客戶試算表新增非空的電子郵件欄,必須想辦法為現有每列客戶填入其電子郵件資料。
結構化資料範例:試算表、關聯式資料庫、電話號碼、銀行對帳單
### 非結構化資料
非結構化資料通常無法分類成列或欄且沒有固定格式或規則。因為非結構化資料結構限制較少相較於結構化資料更容易新增資訊。例如若一個每兩分鐘測量氣壓的感測器更新為能測量與記錄溫度若資料為非結構化不需修改既有資料。然而這可能導致分析此類資料時花費更多時間。譬如一位科學家想計算前一個月感測器記錄的平均溫度卻發現某些記錄數據中用字母「e」標記感測器故障而非典型的數字表示資料不完整。
非結構化資料範例:文字檔案、簡訊、影片檔案
### 半結構化資料
半結構化資料兼具結構化與非結構化資料的特點。它通常不遵循列與欄的格式但依然以某種被視為結構化的方式組織可能遵循固定格式或規則。其結構會依據來源不同而異從明確階層到更具彈性方便整合新資訊。元資料是協助決定資料如何組織與儲存的指標根據資料類型有各種名稱常見有標籤、元素、實體與屬性。例如典型email訊息會有主旨、內容與收件者群且可根據寄件人或寄送時間組織。
半結構化資料範例HTML、CSV 檔案、JavaScript 物件表示法 (JSON)
## 資料來源
資料來源是資料產生的初始位置,也就是資料「所在的位置」,會依資料如何及何時被收集而異。由使用者產生的資料稱為原始資料,次級資料則是指由其他來源收集供一般使用的資料。例如,一群科學家在雨林收集觀察資料則被視為原始資料;若他們決定與其他科學家分享,對那些使用者而言即為次級資料。
資料庫是常見資料來源,依賴資料庫管理系統來管理及維護資料,使用者用稱為查詢的指令來探索資料。檔案作為資料來源可能包括音訊、影像和影片檔案,以及像 Excel 這類的試算表。網際網路是一個常見的資料寄存位置裡面包含資料庫與檔案。應用程式介面API允許程式設計師透過網路與外部使用者共享資料而網路爬蟲則是從網頁擷取資料的過程。[與資料共事](../../../../../../../../../2-Working-With-Data)課程講授如何使用各種資料來源。
## 結論
本課程學習了:
- 什麼是資料
- 資料如何被描述
- 資料如何被分類與歸類
- 資料可以從哪裡取得
## 🚀 挑戰
Kaggle 是極佳的公開資料集來源。使用 [資料集搜尋工具](https://www.kaggle.com/datasets) 找尋有趣的資料集,並依照以下條件分類 3-5 個資料集:
- 該資料是量化還是質性?
- 該資料是結構化、非結構化,還是半結構化?
## [課後測驗](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## 複習與自學
- 微軟學習單元 [識別資料格式](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) 詳細解析結構化、半結構化及非結構化資料。
## 作業
[分類資料集](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**免責聲明**
此文件已使用 AI 翻譯服務 [Co-op Translator](https://github.com/Azure/co-op-translator) 進行翻譯。雖然我們努力追求準確性,但請注意自動翻譯可能包含錯誤或不準確之處。原始文件的母語版本應視為權威來源。對於關鍵資訊,建議採用專業人工翻譯。我們不對因使用此翻譯所產生的任何誤解或誤譯承擔責任。
<!-- CO-OP TRANSLATOR DISCLAIMER END -->