You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/sr/4-Data-Science-Lifecycle/15-analyzing/README.md

10 KiB

Животни циклус науке о подацима: Анализа

 Илустрација од (@sketchthedocs)
Животни циклус науке о подацима: Анализа - Илустрација од @nitya

Квиз пре предавања

Квиз пре предавања

Анализа у животном циклусу података потврђује да подаци могу одговорити на постављена питања или решити одређени проблем. Овај корак се такође може фокусирати на потврђивање да модел исправно одговара на та питања и проблеме. Ова лекција је усмерена на истраживачку анализу података (Exploratory Data Analysis или EDA), која обухвата технике за дефинисање карактеристика и односа унутар података и може се користити за припрему података за моделирање.

Користићемо пример скупа података са Kaggle како бисмо показали како се ово може применити уз помоћ Python-а и библиотеке Pandas. Овај скуп података садржи број неких уобичајених речи које се налазе у имејловима, а извори ових имејлова су анонимни. Користите бележницу у овом директоријуму како бисте пратили лекцију.

Истраживачка анализа података

Фаза прикупљања у животном циклусу је место где се подаци добијају, као и проблеми и питања која треба решити, али како можемо знати да подаци могу подржати крајњи резултат? Подсетимо се да научник за податке може поставити следећа питања када добије податке:

  • Да ли имам довољно података за решавање овог проблема?
  • Да ли су подаци прихватљивог квалитета за овај проблем?
  • Ако откријем додатне информације кроз ове податке, да ли би требало да размотримо промену или редефинисање циљева?

Истраживачка анализа података је процес упознавања са подацима и може се користити за одговоре на ова питања, као и за идентификовање изазова у раду са скупом података. Фокусираћемо се на неке од техника које се користе за постизање овога.

Профилисање података, описна статистика и Pandas

Како проценити да ли имамо довољно података за решавање овог проблема? Профилисање података може сумирати и прикупити неке опште информације о нашем скупу података кроз технике описне статистике. Профилисање података нам помаже да разумемо шта нам је доступно, а описна статистика нам помаже да разумемо колико тога је доступно.

У неколико претходних лекција користили смо Pandas за пружање неке описне статистике помоћу describe() функције. Она пружа број, максималне и минималне вредности, средњу вредност, стандардну девијацију и квантиле за нумеричке податке. Коришћење описне статистике попут describe() функције може вам помоћи да процените колико података имате и да ли вам је потребно више.

Узорковање и упити

Истраживање свега у великом скупу података може бити веома временски захтевно и обично је задатак који се препушта рачунару. Међутим, узорковање је користан алат за разумевање података и омогућава нам боље разумевање онога што се налази у скупу података и шта он представља. Уз узорак, можете применити вероватноћу и статистику како бисте дошли до неких општих закључака о вашим подацима. Иако не постоји дефинисано правило о томе колико података треба узорковати, важно је напоменути да што више података узоркујете, то ће ваша генерализација бити прецизнија.

Pandas има sample() функцију у својој библиотеци где можете проследити аргумент о томе колико случајних узорака желите да добијете и користите.

Општи упити података могу вам помоћи да одговорите на нека општа питања и теорије које можда имате. За разлику од узорковања, упити вам омогућавају контролу и фокусирање на одређене делове података о којима имате питања. query() функција у Pandas библиотеци омогућава вам да изаберете колоне и добијете једноставне одговоре о подацима кроз редове који су добијени.

Истраживање кроз визуализације

Не морате чекати да подаци буду темељно очишћени и анализирани да бисте почели са креирањем визуализација. У ствари, имање визуелног приказа током истраживања може помоћи у идентификовању образаца, односа и проблема у подацима. Штавише, визуализације пружају начин комуникације са онима који нису укључени у управљање подацима и могу бити прилика за дељење и разјашњавање додатних питања која нису обрађена у фази прикупљања. Погледајте секцију о визуализацијама како бисте сазнали више о неким популарним начинима истраживања кроз визуелне приказе.

Истраживање ради идентификовања недоследности

Све теме у овој лекцији могу помоћи у идентификовању недостајућих или недоследних вредности, али Pandas пружа функције за проверу неких од њих. isna() или isnull() могу проверити недостајуће вредности. Један важан аспект истраживања ових вредности у вашим подацима је истраживање зашто су оне уопште настале. Ово вам може помоћи да одлучите које акције треба предузети како бисте их решили.

Квиз након предавања

Задатак

Истраживање за одговоре


Одрицање од одговорности:
Овај документ је преведен коришћењем услуге за превођење помоћу вештачке интелигенције Co-op Translator. Иако се трудимо да обезбедимо тачност, молимо вас да имате у виду да аутоматски преводи могу садржати грешке или нетачности. Оригинални документ на његовом изворном језику треба сматрати меродавним извором. За критичне информације препоручује се професионални превод од стране људи. Не преузимамо одговорност за било каква погрешна тумачења или неспоразуме који могу настати услед коришћења овог превода.