You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/zh-CN/1-Introduction/03-defining-data/README.md

79 lines
6.6 KiB

This file contains ambiguous Unicode characters!

This file contains ambiguous Unicode characters that may be confused with others in your current locale. If your use case is intentional and legitimate, you can safely ignore this warning. Use the Escape button to highlight these characters.

# 定义数据
|![ 草图笔记由 [(@sketchthedocs)](https://sketchthedocs.dev) 提供 ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|定义数据 - _草图笔记作者 [@nitya](https://twitter.com/nitya)_ |
数据是用来发现新知和支持知情决策的事实、信息、观察和测量结果。数据点是一组数据中的单个数据单元,而数据集是由多个数据点组成的集合。数据集可能有不同的格式和结构,通常取决于其来源或数据的出处。例如,一家公司的月度收入可能存储在电子表格中,而来自智能手表的每小时心率数据则可能是 [JSON](https://stackoverflow.com/a/383699) 格式。数据科学家经常需要在同一数据集中处理不同类型的数据。
本课聚焦于根据特点和来源识别和分类数据。
## [课前测验](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## 数据的描述方式
### 原始数据
原始数据是从其来源以初始状态获取的数据,未被分析或组织。为了理解数据集中的内容,需要将其组织成既能被人类理解,也能被技术进一步分析的格式。数据集的结构描述了其组织方式,可分为结构化、非结构化和半结构化。这些结构类型会因来源不同而变化,但最终均属于这三类。
### 定量数据
定量数据是数据集中的数值型观察可被分析、测量并用于数学运算。定量数据的例子包括国家人口、个人身高或公司季度收益。通过深入分析定量数据可以用于发现空气质量指数AQI的季节性趋势或估计工作日高峰期交通拥堵的概率。
### 定性数据
定性数据,也称为类别数据,是无法像定量数据那样客观测量的数据。它通常表现为各种主观数据,捕捉某物的质量,例如产品或过程。有时定性数据以数字形式存在,但通常不用于数学运算,如电话号码或时间戳。定性数据的例子包括:视频评论、汽车的品牌和型号,或你最亲近朋友的最爱颜色。定性数据可用于了解消费者最喜欢哪些产品,或识别求职简历中的热门关键词。
### 结构化数据
结构化数据是组织成行和列的数据,每行拥有相同的列集合。列代表某种特定类型的值,并以名称标识该值所代表的内容,而行包含具体的数值。列通常有一套特定规则或限制,以确保其值准确反映该列。例如,假设一个客户电子表格里每行必须包含电话号码,且电话号码不包含字母字符。电话号码列可能有规则确保其不为空且仅包含数字。
结构化数据的优点是它可以以某种方式组织,使其能与其他结构化数据相关联。然而,由于数据设计为按照特定方式组织,改变其整体结构往往需要大量努力。例如,在客户电子表格中新增一个不可为空的邮箱列时,需要想办法为数据集中已有的客户行填充该邮箱列的值。
结构化数据示例:电子表格、关系型数据库、电话号码、银行账单
### 非结构化数据
非结构化数据通常无法归类到行或列中且没有格式或规则可循。由于对结构的限制较少相较于结构化数据更容易添加新信息。例如一个每两分钟记录一次气压的传感器如果升级后允许测量并记录温度只要数据是非结构化的就无需改动现有数据。然而这可能会使分析或调查这类数据所花时间更长。比如一位科学家想根据传感器数据计算上个月的平均温度但发现传感器记录的数据中有些位置用“e”替代数值表示传感器故障导致数据不完整。
非结构化数据示例:文本文件、短信、视频文件
### 半结构化数据
半结构化数据具有结构化和非结构化数据的混合特征。它通常不符合行列格式,但以被视为结构化的方式组织,可能遵循固定格式或规则。具体结构会因来源不同而变化,从严格定义的层级到允许灵活集成新信息的方式不等。元数据是帮助决定数据如何组织和存储的指示器,且名称因数据类型不同而各异。元数据的常见名称有标签、元素、实体和属性。例如,一封典型电子邮件包括主题、正文和收件人列表,可按发送人或发送时间进行组织。
半结构化数据示例HTML、CSV 文件、JavaScript 对象表示法 (JSON)
## 数据来源
数据来源是数据生成的初始位置或“存放地点”,根据采集方式和时间不同而异。由用户生成的数据称为初级数据,而由其他来源收集并供一般用途的数据称为次级数据。例如,一组科学家在雨林中收集观察数据,此数据即为初级数据;如果他们决定与其他科学家共享,则这些其他科学家使用时该数据为次级数据。
数据库是一种常见的数据来源,依靠数据库管理系统托管和维护数据,用户通过称为查询的命令进行数据探索。文件作为数据来源可以是音频、图像和视频文件,也可以是 Excel 等电子表格。因特网是托管数据的常见位置既有数据库也有文件。应用程序接口API允许程序员通过互联网与外部用户共享数据而网页抓取则从网页提取数据。[处理数据课程](../../../../../../../../../2-Working-With-Data) 聚焦于如何使用各种数据来源。
## 总结
本课我们学到了:
- 什么是数据
- 数据如何被描述
- 数据如何分类和归类
- 数据在哪些地方可以找到
## 🚀 挑战
Kaggle 是一个极好的开放数据集来源。使用 [数据集搜索工具](https://www.kaggle.com/datasets) 找到一些有趣的数据集并用以下标准分类3-5个数据集
- 数据是定量还是定性?
- 数据是结构化、非结构化还是半结构化?
## [课后测验](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## 复习与自学
- 本微软学习单元,标题为 [识别数据格式](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text),详细介绍了结构化、半结构化和非结构化数据。
## 作业
[分类数据集](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**免责声明**
本文件由 AI 翻译服务 [Co-op Translator](https://github.com/Azure/co-op-translator) 翻译完成。尽管我们力求准确,但请注意,自动翻译可能包含错误或不准确之处。原始语言版文件应视为权威来源。对于重要信息,建议使用专业人工翻译。我们对因使用本翻译而产生的任何误解或误释不承担责任。
<!-- CO-OP TRANSLATOR DISCLAIMER END -->