You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/ru/1-Introduction/03-defining-data/README.md

85 lines
16 KiB

This file contains ambiguous Unicode characters!

This file contains ambiguous Unicode characters that may be confused with others in your current locale. If your use case is intentional and legitimate, you can safely ignore this warning. Use the Escape button to highlight these characters.

<!--
CO_OP_TRANSLATOR_METADATA:
{
"original_hash": "1228edf3572afca7d7cdcd938b6b4984",
"translation_date": "2025-09-04T15:37:53+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "ru"
}
-->
# Определение данных
|![ Скетчноут от [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|Определение данных - _Скетчноут от [@nitya](https://twitter.com/nitya)_ |
Данные — это факты, информация, наблюдения и измерения, которые используются для открытия новых знаний и поддержки обоснованных решений. Точка данных — это единичная единица данных в наборе данных, который представляет собой коллекцию точек данных. Наборы данных могут быть представлены в различных форматах и структурах, обычно зависящих от их источника, то есть от того, откуда поступили данные. Например, ежемесячная прибыль компании может быть представлена в таблице, а данные о частоте сердечных сокращений за час, полученные со смарт-часов, могут быть в формате [JSON](https://stackoverflow.com/a/383699). Для специалистов по данным часто бывает обычным работать с различными типами данных в рамках одного набора данных.
Этот урок посвящен идентификации и классификации данных по их характеристикам и источникам.
## [Тест перед лекцией](https://purple-hill-04aebfb03.1.azurestaticapps.net/quiz/4)
## Как описываются данные
### Исходные данные
Исходные данные — это данные, которые поступили из своего источника в первоначальном виде и не были проанализированы или организованы. Чтобы понять, что происходит с набором данных, его необходимо организовать в формат, который будет понятен как людям, так и технологиям, которые они могут использовать для дальнейшего анализа. Структура набора данных описывает, как он организован, и может быть классифицирована как структурированная, неструктурированная и полуструктурированная. Эти типы структур зависят от источника, но в конечном итоге укладываются в эти три категории.
### Количественные данные
Количественные данные — это числовые наблюдения в наборе данных, которые обычно можно анализировать, измерять и использовать математически. Примеры количественных данных: численность населения страны, рост человека или квартальная прибыль компании. С дополнительным анализом количественные данные могут быть использованы для выявления сезонных тенденций индекса качества воздуха (AQI) или оценки вероятности пробок в час пик в обычный рабочий день.
### Качественные данные
Качественные данные, также известные как категориальные данные, — это данные, которые нельзя измерить объективно, как количественные наблюдения. Обычно это различные форматы субъективных данных, которые фиксируют качество чего-либо, например продукта или процесса. Иногда качественные данные являются числовыми, но обычно не используются математически, например номера телефонов или временные метки. Примеры качественных данных: комментарии к видео, марка и модель автомобиля или любимый цвет ваших ближайших друзей. Качественные данные могут быть использованы для понимания, какие продукты больше всего нравятся потребителям, или для выявления популярных ключевых слов в резюме соискателей.
### Структурированные данные
Структурированные данные — это данные, организованные в строки и столбцы, где каждая строка имеет одинаковый набор столбцов. Столбцы представляют значение определенного типа и идентифицируются именем, описывающим, что представляет значение, а строки содержат фактические значения. Столбцы часто имеют определенный набор правил или ограничений для значений, чтобы гарантировать, что значения точно представляют столбец. Например, представьте таблицу клиентов, где каждая строка должна содержать номер телефона, а номера телефонов никогда не содержат буквенных символов. На столбец с номерами телефонов могут быть наложены правила, чтобы он никогда не был пустым и содержал только цифры.
Преимущество структурированных данных заключается в том, что их можно организовать таким образом, чтобы они были связаны с другими структурированными данными. Однако, поскольку данные разработаны для организации определенным образом, внесение изменений в их общую структуру может потребовать значительных усилий. Например, добавление столбца с электронной почтой в таблицу клиентов, который не может быть пустым, означает, что вам нужно будет решить, как добавить эти значения в существующие строки клиентов в наборе данных.
Примеры структурированных данных: таблицы, реляционные базы данных, номера телефонов, банковские выписки.
### Неструктурированные данные
Неструктурированные данные обычно не могут быть организованы в строки или столбцы и не содержат формата или набора правил для соблюдения. Поскольку неструктурированные данные имеют меньше ограничений на свою структуру, добавление новой информации в них проще по сравнению со структурированным набором данных. Если датчик, фиксирующий данные о барометрическом давлении каждые 2 минуты, получил обновление, которое теперь позволяет ему измерять и записывать температуру, это не требует изменения существующих данных, если они неструктурированы. Однако это может усложнить анализ или исследование таких данных. Например, ученый хочет найти среднюю температуру за прошлый месяц по данным датчика, но обнаруживает, что датчик записал "e" в некоторых своих данных, чтобы указать, что он был сломан, вместо типичного числа, что делает данные неполными.
Примеры неструктурированных данных: текстовые файлы, текстовые сообщения, видеофайлы.
### Полуструктурированные данные
Полуструктурированные данные имеют особенности, которые делают их комбинацией структурированных и неструктурированных данных. Обычно они не соответствуют формату строк и столбцов, но организованы таким образом, который считается структурированным, и могут следовать фиксированному формату или набору правил. Структура будет варьироваться в зависимости от источников, например, от четко определенной иерархии до чего-то более гибкого, что позволяет легко интегрировать новую информацию. Метаданные — это индикаторы, которые помогают определить, как данные организованы и хранятся, и имеют различные названия в зависимости от типа данных. Некоторые распространенные названия метаданных: теги, элементы, сущности и атрибуты. Например, типичное электронное письмо будет иметь тему, тело и набор получателей и может быть организовано по отправителю или времени отправки.
Примеры полуструктурированных данных: HTML, файлы CSV, JavaScript Object Notation (JSON).
## Источники данных
Источник данных — это начальное место, где данные были созданы или где они "живут", и будет варьироваться в зависимости от того, как и когда они были собраны. Данные, созданные их пользователями, называются первичными данными, а вторичные данные поступают из источника, который собрал данные для общего использования. Например, группа ученых, собирающих наблюдения в тропическом лесу, будет считаться первичным источником, а если они решат поделиться ими с другими учеными, это будет считаться вторичным источником для тех, кто их использует.
Базы данных являются распространенным источником и полагаются на систему управления базами данных для размещения и поддержания данных, где пользователи используют команды, называемые запросами, для изучения данных. Файлы как источники данных могут быть аудио-, изображениями и видеофайлами, а также таблицами, такими как Excel. Интернет-источники — это распространенное место для размещения данных, где можно найти как базы данных, так и файлы. Интерфейсы прикладного программирования, также известные как API, позволяют программистам создавать способы обмена данными с внешними пользователями через интернет, а процесс веб-скрейпинга извлекает данные с веб-страницы. [Уроки в разделе Работа с данными](../../../../../../../../../2-Working-With-Data) сосредоточены на том, как использовать различные источники данных.
## Заключение
В этом уроке мы узнали:
- Что такое данные
- Как описываются данные
- Как данные классифицируются и категоризируются
- Где можно найти данные
## 🚀 Задание
Kaggle — отличный источник открытых наборов данных. Используйте [инструмент поиска наборов данных](https://www.kaggle.com/datasets), чтобы найти несколько интересных наборов данных и классифицировать 3-5 наборов данных по следующим критериям:
- Являются ли данные количественными или качественными?
- Являются ли данные структурированными, неструктурированными или полуструктурированными?
## [Тест после лекции](https://ff-quizzes.netlify.app/en/ds/)
## Обзор и самостоятельное изучение
- Этот модуль Microsoft Learn, озаглавленный [Классификация ваших данных](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data), содержит подробное описание структурированных, полуструктурированных и неструктурированных данных.
## Задание
[Классификация наборов данных](assignment.md)
---
**Отказ от ответственности**:
Этот документ был переведен с использованием сервиса автоматического перевода [Co-op Translator](https://github.com/Azure/co-op-translator). Хотя мы стремимся к точности, пожалуйста, имейте в виду, что автоматические переводы могут содержать ошибки или неточности. Оригинальный документ на его исходном языке следует считать авторитетным источником. Для получения критически важной информации рекомендуется профессиональный перевод человеком. Мы не несем ответственности за любые недоразумения или неправильные толкования, возникшие в результате использования данного перевода.