You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/zh-HK/1-Introduction/03-defining-data
localizeflow[bot] 616a08883a
[zh-MO,zh-HK,zh-TW] chore(i18n): sync translations
2 months ago
..
README.md [zh-MO,zh-HK,zh-TW] chore(i18n): sync translations 2 months ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 6/9, 137 changes) 8 months ago

README.md

定義資料

 Sketchnote 由 (@sketchthedocs) 製作
定義資料 - Sketchnote 由 @nitya 製作

資料是用來進行發現並支持明智決策的事實、資訊、觀察和測量。資料點是資料集中一個單一的資料單位,而資料集是資料點的集合。資料集可能存在不同的格式和結構,通常根據其來源,或資料的原始來處而有所不同。例如,一間公司的每月收益可能存放在試算表中,但從智慧手錶記錄的每小時心跳率資料可能是 JSON 格式。資料科學家經常需要處理資料集中不同類型的資料。

本課程重點在於根據資料的特性和來源來識別及分類資料。

課前測驗

資料的描述方式

原始資料

原始資料是從來源處以初始狀態獲取的資料,尚未經過分析或組織。為了理解資料集中的情況,需要將其整理成既可被人類理解,也方便進行後續分析的格式。資料集的結構描述其組織方式,可分為結構化、非結構化和半結構化。這些結構類型會因來源不同而異,但最終都會屬於這三類。

定量資料

定量資料是資料集中的數值觀察資料,通常可以分析、測量並用數學方法處理。例如定量資料有:一個國家的人口、一個人的身高或一間公司的季度收益。經過額外分析,定量資料能用來發現季節性趨勢(如空氣品質指數AQI)或估算一般工作日的高峰交通概率。

定性資料

定性資料又稱分類資料,無法像定量資料那樣客觀測量。它通常是主觀的資料格式,捕捉事物或過程的品質狀態。有時候,定性資料是數字形式,但一般不以數學方式使用,如電話號碼或時間戳記。定性資料的例子有:影片評論、一部汽車的品牌和型號,或你最親密朋友的喜愛顏色。定性資料可用來了解消費者偏好產品或辨識求職履歷中的熱門關鍵字。

結構化資料

結構化資料是組織成列與欄的資料,每列都有相同的欄位集合。欄位代表某種特定類型的數值,會以名稱標示該數值的意義,而列包含實際數值。欄位通常有特定規則或限制,以確保數值正確表達該欄位。例如設想一份客戶的試算表,每列必須有電話號碼,且電話號碼中不能有字母。電話號碼欄可能會設定規則,確保此欄絕不為空且只包含數字。

結構化資料的優點是,可以以關聯方式組織與其他結構化資料連結。但因為資料設計有特定組織方式,所以修改其整體結構往往需要大量努力。例如,要在客戶試算表增加一欄電子郵件且該欄不能為空,會需要將現有客戶的資料列補齊相應欄位數值,這是個挑戰。

結構化資料的例子:試算表、關聯式資料庫、電話號碼、銀行帳單

非結構化資料

非結構化資料通常無法分類為列或欄,也沒有固定格式或規則可循。由於非結構化資料結構限制較少,較容易新增資訊。舉例,一個每兩分鐘測量氣壓的感測器新增測量溫度功能,非結構化資料無須改動既有資料就可直接加入新資料。但這可能會增加分析或調查難度。例如:科學家想從感測器資料找出過去一個月的平均溫度,卻發現某些記錄欄位有「e」代表感測器故障,資料因此不完整。

非結構化資料的例子:文字檔、簡訊、影片檔

半結構化資料

半結構化資料帶有結構化和非結構化資料的特徵。它通常不符合列與欄的格式,但以被視為結構化的方式組織,可能遵循固定格式或規則。結構形式因來源而異,從明確定義的層級結構到較靈活易整合新資訊的結構。元資料是幫助決定資料如何被組織和儲存的指標,名稱依資料類型有所不同。元資料的常見名稱有標籤(tags)、元素(elements)、實體(entities)和屬性(attributes)。例如,典型的電子郵件會有主旨、內容及收件人清單,並可依寄件人或時間組織。

半結構化資料的例子:HTML、CSV 檔案、JavaScript 物件表示法(JSON)

資料來源

資料來源是資料產生的初始地點,或它「存在」的地方,會依收集方式和時間而異。用戶直接產生的資料稱為原始資料,而為一般用途收集的則稱為次級資料。舉例,一組科學家在熱帶雨林收集觀察資料屬原始資料,他們分享給其他科學家時,對後者而言則為次級資料。

資料庫是常見資料來源,依賴資料庫管理系統來存放和維護資料,使用者透過稱為查詢的指令來探索資料。檔案作為資料來源,可以是音訊、影像、影片檔案以及像 Excel 這樣的試算表。網際網路是托管資料的常見地點,可找到資料庫及檔案。應用程式介面(API)允許程式設計師創建透過網際網路與外部用戶分享資料的方法,而網頁擷取則是從網頁抽取資料。處理資料課程著重於如何使用各種資料來源。

總結

在本課,我們學到了:

  • 什麼是資料
  • 資料如何被描述
  • 資料如何被分類和歸類
  • 資料在哪裡可被找到

🚀 挑戰

Kaggle 是開放資料集的絕佳來源。使用其 資料集搜索工具 尋找一些有趣的資料集,並根據以下標準分類 3-5 個資料集:

  • 此資料是定量還是定性?
  • 此資料是結構化、非結構化還是半結構化?

課後測驗

複習與自學

  • 本 Microsoft Learn 單元,題為 識別資料格式 詳細拆解了結構化、半結構化及非結構化資料。

作業

分類資料集


免責聲明: 本文件由 AI 翻譯服務 Co-op Translator 翻譯而成。雖然我們致力於確保準確性,但請注意,機器自動翻譯可能包含錯誤或不準確之處。原始文件的母語版本應被視為權威來源。對於重要資訊,建議進行專業人工翻譯。我們不對因使用本翻譯而產生的任何誤解或誤釋承擔責任。