|
|
4 weeks ago | |
|---|---|---|
| .. | ||
| README.md | 4 weeks ago | |
| assignment.md | 7 months ago | |
README.md
Дефиниране на Данни
![]() |
|---|
| Дефиниране на Данни - Скетчноут от @nitya |
Данните са факти, информация, наблюдения и измервания, които се използват за правене на открития и за подпомагане на информирани решения. Точка от данни е една единица данни в набор от данни, който е колекция от точки данни. Наборите от данни могат да имат различни формати и структури, обикновено базирани на техния източник или откъде произхождат данните. Например месечните приходи на компанията може да са в електронна таблица, но почасовите данни за сърдечния ритъм от смартчасовник могат да са във формат JSON. Обичайно е за специалистите по данни да работят с различни видове данни в рамките на набор от данни.
Този урок се фокусира върху идентифициране и класифициране на данните според техните характеристики и източници.
Тест преди лекцията
Как се описват данните
Необработени Данни
Необработените данни са данни, които са дошли от своя източник в първоначалното си състояние и не са анализирани или организирани. За да се разбере какво се случва с набора от данни, той трябва да бъде организиран в формат, който може да бъде разбран както от хората, така и от използваните технологии за по-нататъшен анализ. Структурата на набора от данни описва как е организиран и може да бъде класифицирана като структурирана, неструктурирана и полуструктурирана. Тези типове структура ще варират в зависимост от източника, но в крайна сметка попадат в тези три категории.
Количествени Данни
Количествените данни са числени наблюдения в даден набор от данни, които обикновено могат да бъдат анализирани, измерени и използвани математически. Някои примери за количествени данни са: населението на дадена страна, ръстът на човек или тримесечните приходи на компания. С допълнителен анализ количествените данни могат да се използват за откриване на сезонни тенденции на Индекса за качество на въздуха (AQI) или за оценка вероятността от задръствания по време на обичайните часове на пиково движение.
Качествени Данни
Качествените данни, известни още като категорични данни, са данни, които не могат да бъдат измерени обективно като количествените данни. Обикновено това са различни формати на субективни данни, които улавят качеството на нещо, като продукт или процес. Понякога качествените данни са числени, но обичайно не се използват математически, като телефонни номера или времеви марки. Някои примери за качествени данни са: видеокоментари, марка и модел на кола или любимият цвят на най-близките ти приятели. Качествените данни могат да се използват да се разбере кои продукти са най-харесвани от потребителите или да се идентифицират популярни ключови думи в автобиографии за работа.
Структурирани Данни
Структурираните данни са данни, организирани в редове и колони, където всеки ред има същия набор от колони. Колоните представят стойност от определен тип и са идентифицирани с имена, описващи какво представлява стойността, докато редовете съдържат действителните стойности. Колоните често имат специфичен набор от правила или ограничения за стойностите, за да се гарантира, че стойностите точно представляват колоната. Например, представете си електронна таблица с клиенти, където всеки ред трябва да има телефонен номер и телефонните номера никога не съдържат буквени символи. Могат да се прилагат правила за колоната с телефонни номера, за да се гарантира, че никога не е празна и съдържа само числа.
Предимството на структурирани данни е, че те могат да бъдат организирани така, че да могат да се свързват с други структурирани данни. Въпреки това, тъй като данните са проектирани да бъдат организирани по определен начин, правенето на промени в цялостната им структура може да изисква много усилия. Например, добавянето на колона за имейл към таблица с клиенти, която не може да е празна, означава, че трябва да разберете как да добавите тези стойности към вече съществуващите редове в набора от данни.
Примери за структурирани данни: електронни таблици, релационни бази данни, телефонни номера, банкови извлечения
Неструктурирани Данни
Неструктурираните данни обикновено не могат да бъдат категоризирани в редове или колони и не съдържат формат или набор от правила за следване. Тъй като нестуктурираните данни имат по-малко ограничения върху структурата си, е по-лесно да се добави нова информация в сравнение със структуриран набор от данни. Ако сензор, който измерва барометричното налягане на всеки 2 минути, получи актуализация, която му позволява да мери и записва температура, не е нужно да се изменят съществуващите данни, ако са неструктурирани. Въпреки това, това може да направи анализа или изследването на този тип данни по-бавно. Например, учен, който иска да намери средната температура за предходния месец от сензорните данни, но открива, че сензорът е записал "е" в някои от записите си, за да отбележи, че е бил повреден, вместо обичайно число, което означава, че данните са непълни.
Примери за неструктурирани данни: текстови файлове, текстови съобщения, видео файлове
Полу-структурирани Данни
Полу-структурираните данни имат характеристики на комбинация от структурирани и неструктурирани данни. Те обикновено не съответстват на формат на редове и колони, но са организирани по начин, който се счита за структуриран и могат да следват фиксиран формат или набор от правила. Структурата варира в зависимост от източника, като може да е добре дефинирана йерархия или нещо по-гъвкаво, което позволява лесна интеграция на нова информация. Метаданните са индикатори, които помагат да се определи как са организирани и съхранявани данните и имат различни имена в зависимост от вида на данните. Някои чести имена за метаданни са тагове, елементи, единици и атрибути. Например типично имейл съобщение има тема, тяло и набор получатели и може да бъде организирано по това кой или кога е изпратено.
Примери за полу-структурирани данни: HTML, CSV файлове, JavaScript Object Notation (JSON)
Източници на Данни
Източник на данни е първоначалното място, където са генерирани данните или където „живеят“ и варира в зависимост от начина и времето на събирането им. Данните, генерирани от техния потребител(и), се наричат първични данни, докато вторичните данни идват от източник, който е събрал данни за обща употреба. Например група учени, събиращи наблюдения в тропическа гора, биха били считани за първичен източник, а ако решат да споделят данните с други учени, те ще са вторичен източник за тези, които ги използват.
Базите данни са често срещан източник и разчитат на система за управление на бази данни, за да хостват и поддържат данните, като потребителите използват команди, наречени заявки, за да изследват данните. Файловете като източници на данни могат да са аудио, изображения и видео файлове, както и електронни таблици като Excel. Интернет източниците са често място за хостване на данни, където могат да се намерят както бази данни, така и файлове. Програмните интерфейси за приложения, известни още като API, позволяват на програмистите да създават начини за споделяне на данни с външни потребители чрез интернет, докато процесът на уеб скрейпинг извлича данни от уеб страница. Уроците за работа с данни са съсредоточени върху това как да се използват различни източници на данни.
Заключение
В този урок научихме:
- Какво са данните
- Как се описват данните
- Как се класифицират и категоризират данните
- Къде могат да се намерят данните
🚀 Предизвикателство
Kaggle е отличен източник на отворени набори от данни. Използвайте инструмента за търсене на набори от данни, за да намерите някои интересни набори и класифицирайте 3-5 набора данни според следните критерии:
- Количествени или качествени са данните?
- Структурирани, неструктурирани или полу-структурирани ли са данните?
Тест след лекцията
Преглед и Самообучение
- Тази единица на Microsoft Learn, озаглавена Идентифициране на формати на данни съдържа детайлен анализ на структурирани, полу-структурирани и неструктурирани данни.
Задача
Класифициране на набори от данни
Отказ от отговорност: Този документ е преведен с помощта на AI преводачески услуга Co-op Translator. Въпреки че се стремим към точност, моля имайте предвид, че автоматизираните преводи могат да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за каквито и да е недоразумения или неправилни тълкувания, произтичащи от използването на този превод.
