6.7 KiB
Adatelemzési életciklus: Elemzés
![]() |
|---|
| Adatelemzési életciklus: Elemzés - Sketchnote by @nitya |
Előadás előtti kvíz
Előadás előtti kvíz
Az elemzés az adatelemzési életciklusban megerősíti, hogy az adatok képesek megválaszolni a feltett kérdéseket vagy megoldani egy adott problémát. Ez a lépés arra is összpontosíthat, hogy megerősítse, hogy egy modell helyesen kezeli-e ezeket a kérdéseket és problémákat. Ez a lecke az Exploratory Data Analysis (EDA) technikáira összpontosít, amelyek segítenek meghatározni az adatok jellemzőit és kapcsolatait, valamint előkészíteni az adatokat a modellezéshez.
Egy példaként szolgáló adatállományt fogunk használni a Kaggle oldalról, hogy bemutassuk, hogyan alkalmazható ez Python és a Pandas könyvtár segítségével. Ez az adatállomány néhány gyakori szó előfordulását tartalmazza e-mailekben, az e-mailek forrásai anonimak. Használja a notebookot ebben a könyvtárban, hogy kövesse a példát.
Feltáró adatelemzés
Az életciklus gyűjtési fázisában történik az adatok megszerzése, valamint a problémák és kérdések meghatározása, de honnan tudhatjuk, hogy az adatok támogatni tudják a kívánt eredményt? Emlékezzünk, hogy egy adatelemző a következő kérdéseket teheti fel, amikor adatokat szerez:
- Van elég adat a probléma megoldásához?
- Az adatok minősége megfelelő ehhez a problémához?
- Ha további információkat fedezek fel az adatokon keresztül, érdemes-e megváltoztatni vagy újradefiniálni a célokat? A feltáró adatelemzés az adatok megismerésének folyamata, amely segíthet megválaszolni ezeket a kérdéseket, valamint azonosítani az adatállománnyal való munka kihívásait. Nézzük meg néhány technikát, amelyeket erre használhatunk.
Adatprofilozás, leíró statisztikák és Pandas
Hogyan értékelhetjük, hogy van-e elegendő adat a probléma megoldásához? Az adatprofilozás összefoglalhatja és általános információkat gyűjthet az adatállományunkról a leíró statisztikák technikáin keresztül. Az adatprofilozás segít megérteni, hogy mi áll rendelkezésünkre, míg a leíró statisztikák segítenek megérteni, hogy mennyi áll rendelkezésünkre.
Az előző leckékben már használtuk a Pandas describe() függvényét, amely megadja a darabszámot, maximum és minimum értékeket, átlagot, szórást és kvantiliseket a numerikus adatokon. Az olyan leíró statisztikák, mint a describe() függvény, segíthetnek felmérni, hogy mennyi adatunk van, és szükségünk van-e többre.
Mintavétel és lekérdezés
Egy nagy adatállomány teljes körű feltárása nagyon időigényes lehet, és általában számítógépre bízzák. Azonban a mintavétel hasznos eszköz az adatok megértéséhez, és segít jobban megérteni, hogy mi van az adatállományban és mit képvisel. Egy mintával valószínűségszámítást és statisztikát alkalmazhatunk, hogy általános következtetéseket vonjunk le az adatainkról. Bár nincs meghatározott szabály arra, hogy mennyi adatot kell mintavételezni, fontos megjegyezni, hogy minél több adatot mintavételezünk, annál pontosabb általánosítást tudunk tenni az adatokkal kapcsolatban.
A Pandas sample() függvénye lehetővé teszi, hogy megadjuk, hány véletlenszerű mintát szeretnénk kapni és használni.
Az adatok általános lekérdezése segíthet megválaszolni néhány általános kérdést és elméletet, amelyek felmerülhetnek. A mintavétellel ellentétben a lekérdezések lehetővé teszik, hogy irányítást gyakoroljunk és konkrét részekre összpontosítsunk az adatokban, amelyekkel kapcsolatban kérdéseink vannak.
A Pandas query() függvénye lehetővé teszi, hogy oszlopokat válasszunk ki, és egyszerű válaszokat kapjunk az adatokból a lekért sorokon keresztül.
Feltárás vizualizációkkal
Nem kell megvárni, amíg az adatok teljesen megtisztulnak és elemzésre kerülnek, hogy vizualizációkat készítsünk. Valójában a vizuális ábrázolás már a feltárás során segíthet azonosítani mintázatokat, kapcsolatokat és problémákat az adatokban. Továbbá, a vizualizációk lehetőséget nyújtanak arra, hogy kommunikáljunk azokkal, akik nem vesznek részt az adatok kezelésében, és alkalmat adhatnak további kérdések megosztására és tisztázására, amelyeket a gyűjtési szakaszban nem érintettünk. Tekintse meg a Vizualizációk szekciót, hogy többet megtudjon néhány népszerű vizuális feltárási módszerről.
Feltárás az inkonzisztenciák azonosítására
A lecke összes témája segíthet azonosítani hiányzó vagy inkonzisztens értékeket, de a Pandas biztosít funkciókat ezek ellenőrzésére. Az isna() vagy isnull() ellenőrizheti a hiányzó értékeket. Az adatokban található hiányzó értékek feltárásának egyik fontos része annak megértése, hogy miért kerültek oda. Ez segíthet eldönteni, hogy milyen lépéseket tegyünk ezek megoldására.
Előadás utáni kvíz
Feladat
Felelősség kizárása:
Ez a dokumentum az AI fordítási szolgáltatás, a Co-op Translator segítségével lett lefordítva. Bár törekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az eredeti nyelvén tekintendő hiteles forrásnak. Kritikus információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely a fordítás használatából eredhet.
