[sw,hu,cs] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Swahili [sw], Hungarian [hu], Czech [cs]
update-translations
localizeflow[bot] 2 months ago
parent cc094fee06
commit 4a7b559e22

@ -12,8 +12,8 @@
"language_code": "cs"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T11:14:20+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T20:56:28+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "cs"
},
@ -42,8 +42,8 @@
"language_code": "cs"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T17:57:18+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T20:59:05+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "cs"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "cs"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T20:57:31+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "cs"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-26T14:59:49+00:00",
@ -108,8 +114,8 @@
"language_code": "cs"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T11:15:56+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T20:56:00+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "cs"
},
@ -192,14 +198,14 @@
"language_code": "cs"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-26T16:48:33+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T20:59:12+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "cs"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-26T16:47:54+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T20:59:08+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "cs"
},

File diff suppressed because one or more lines are too long

@ -4,73 +4,76 @@
|:---:|
|Definování dat - _Sketchnote od [@nitya](https://twitter.com/nitya)_ |
Data jsou fakta, informace, pozorování a měření, která se používají k objevování nových poznatků a k podpoře informovaného rozhodování. Datový bod je jednotka dat v rámci datové sady, což je sbírka datových bodů. Datové sady mohou mít různé formáty a struktury, obvykle podle svého zdroje, tedy odkud data pocházejí. Například měsíční příjmy společnosti mohou být ve formátu tabulky, zatímco hodinová data o srdečním tepu ze smartwatch mohou být ve formátu [JSON](https://stackoverflow.com/a/383699). Je běžné, že datoví vědci pracují s různými typy dat v rámci jedné datové sady.
Data jsou fakta, informace, pozorování a měření, které se používají k objevům a k podpoře informovaných rozhodnutí. Datový bod je jednotlivá jednotka dat v sadě dat, což je kolekce datových bodů. Sady dat mohou mít různé formáty a struktury a obvykle budou založeny na svém zdroji, tedy odkud data pocházejí. Například měsíční výdělky společnosti mohou být v tabulce, ale hodinová data o srdečním tepu ze smartphonu mohou být ve formátu [JSON](https://stackoverflow.com/a/383699). Je běžné, že datoví vědci pracují s různými typy dat v rámci jedné sady dat.
Tato lekce se zaměřuje na identifikaci a klasifikaci dat podle jejich charakteristik a zdrojů.
Tato lekce se zaměřuje na identifikaci a klasifikaci dat podle jejich vlastností a zdrojů.
## [Kvíz před přednáškou](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Jak jsou data popisována
## [Přednáškový kvíz](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Jak jsou data popsána
### Surová data
Surová data jsou data, která pocházejí ze svého zdroje ve svém původním stavu a nebyla analyzována ani organizována. Aby bylo možné pochopit, co se děje s datovou sadou, je třeba ji uspořádat do formátu, který je srozumitelný jak pro lidi, tak pro technologie, které mohou být použity k její další analýze. Struktura datové sady popisuje, jak je organizována, a může být klasifikována jako strukturovaná, nestrukturovaná nebo polostrukturovaná. Tyto typy struktur se liší podle zdroje, ale nakonec spadají do těchto tří kategorií.
Surová data jsou data, která pocházejí ze svého zdroje ve svém počátečním stavu a nebyla analyzována ani uspořádána. Abychom pochopili, co se se sadou dat děje, musí být uspořádána do formátu, který může být chápán jak lidmi, tak technologiemi, jež je mohou dál analyzovat. Struktura sady dat popisuje, jak je uspořádána, a může být klasifikována jako strukturovaná, nestrukturovaná a polostrukturovaná. Tyto typy struktur se budou lišit v závislosti na zdroji, ale nakonec spadají do těchto tří kategorií.
### Kvantitativní data
Kvantitativní data jsou číselná pozorování v rámci datové sady, která lze obvykle analyzovat, měřit a používat matematicky. Některé příklady kvantitativních dat jsou: počet obyvatel země, výška osoby nebo čtvrtletní příjmy společnosti. S další analýzou by kvantitativní data mohla být použita k objevení sezónních trendů indexu kvality ovzduší (AQI) nebo k odhadu pravděpodobnosti dopravní špičky během běžného pracovního dne.
Kvantitativní data jsou číselná pozorování ve skupině dat a obvykle je lze analyzovat, měřit a používat matematicky. Některé příklady kvantitativních dat jsou: populace země, výška osoby nebo čtvrtletní výdělky společnosti. S další analýzou by kvantitativní data mohla být použita k objevení sezónních trendů indexu kvality ovzduší (AQI) nebo k odhadu pravděpodobnosti dopravní špičky v typický pracovní den.
### Kvalitativní data
Kvalitativní data, známá také jako kategorická data, jsou data, která nelze měřit objektivně jako kvantitativní pozorování. Obvykle se jedná o různé formáty subjektivních dat, která zachycují kvalitu něčeho, například produktu nebo procesu. Někdy jsou kvalitativní data číselná, ale obvykle se nepoužívají matematicky, například telefonní čísla nebo časové značky. Některé příklady kvalitativních dat jsou: komentáře k videím, značka a model auta nebo oblíbená barva vašich nejbližších přátel. Kvalitativní data by mohla být použita k pochopení, které produkty mají spotřebitelé nejraději, nebo k identifikaci populárních klíčových slov v životopisech uchazečů o zaměstnání.
Kvalitativní data, také známá jako kategoriální data, jsou data, která nelze objektivně měřit jako pozorování kvantitativních dat. Obvykle jde o různé formáty subjektivních dat, která zachycují kvalitu něčeho, například produktu nebo procesu. Někdy jsou kvalitativní data číselná a obvykle by nebyla používána matematicky, jako jsou telefonní čísla nebo časová razítka. Některé příklady kvalitativních dat jsou: komentáře k videím, značka a model auta nebo oblíbená barva vašich nejbližších přátel. Kvalitativní data lze použít k pochopení, které produkty mají spotřebitelé nejraději, nebo k identifikaci populárních klíčových slov v životopisech pracovních uchazečů.
### Strukturovaná data
Strukturovaná data jsou data, která jsou organizována do řádků a sloupců, kde každý řádek má stejnou sadu sloupců. Sloupce představují hodnotu určitého typu a jsou identifikovány názvem, který popisuje, co hodnota představuje, zatímco řádky obsahují skutečné hodnoty. Sloupce často mají specifickou sadu pravidel nebo omezení pro hodnoty, aby bylo zajištěno, že hodnoty přesně reprezentují sloupec. Například si představte tabulku zákazníků, kde každý řádek musí obsahovat telefonní číslo a telefonní čísla nikdy neobsahují abecední znaky. Mohou být aplikována pravidla na sloupec telefonního čísla, aby bylo zajištěno, že nikdy nebude prázdný a bude obsahovat pouze čísla.
Strukturovaná data jsou data uspořádaná do řádků a sloupců, kde každý řádek má stejnou sadu sloupců. Sloupce představují hodnotu určitého typu a jsou identifikovány názvem, který popisuje, co hodnota představuje, zatímco řádky obsahují skutečné hodnoty. Sloupce často mají specifické sady pravidel nebo omezení na hodnoty, aby bylo zajištěno, že hodnoty správně reprezentují sloupec. Například si představte tabulku zákazníků, kde každý řádek musí mít telefonní číslo a telefonní čísla nikdy neobsahují abecední znaky. Mohou být na sloupec s telefonním číslem aplikována pravidla, aby nikdy nebyl prázdný a obsahoval pouze čísla.
Výhodou strukturovaných dat je, že mohou být organizována tak, aby byla propojena s jinými strukturovanými daty. Nicméně, protože data jsou navržena tak, aby byla organizována specifickým způsobem, změny v jejich celkové struktuře mohou být náročné. Například přidání sloupce e-mailu do tabulky zákazníků, který nemůže být prázdný, znamená, že budete muset zjistit, jak přidat tyto hodnoty do existujících řádků zákazníků v datové sadě.
Výhodou strukturovaných dat je, že mohou být uspořádána tak, aby bylo možné je vztáhnout k jiným strukturovaným datům. Nicméně, protože data jsou navržena k uspořádání určitým způsobem, může být změna jejich celkové struktury náročná. Například přidání sloupce s e-mailem do tabulky zákazníků, který nesmí být prázdný, znamená, že budete muset zjistit, jak tyto hodnoty přidat k existujícím řádkům zákazníků v sadě dat.
Příklady strukturovaných dat: tabulky, relační databáze, telefonní čísla, bankovní výpisy
### Nestrukturovaná data
Nestrukturovaná data obvykle nelze kategorizovat do řádků nebo sloupců a neobsahují formát ani sadu pravidel, která by se měla dodržovat. Protože nestrukturovaná data mají méně omezení na svou strukturu, je snazší přidávat nové informace ve srovnání se strukturovanou datovou sadou. Pokud senzor, který zachycuje data o barometrickém tlaku každé 2 minuty, obdrží aktualizaci, která mu nyní umožňuje měřit a zaznamenávat teplotu, nevyžaduje to změnu existujících dat, pokud jsou nestrukturovaná. Nicméně to může prodloužit dobu analýzy nebo zkoumání tohoto typu dat. Například vědec, který chce zjistit průměrnou teplotu za předchozí měsíc z dat senzoru, ale zjistí, že senzor zaznamenal "e" v některých svých datech, aby označil, že byl rozbitý, místo typického čísla, což znamená, že data jsou neúplná.
Nestrukturovaná data obvykle nelze kategorizovat do řádků nebo sloupců a neobsahují formát ani sadu pravidel, která by bylo třeba dodržovat. Protože nestrukturovaná data mají méně omezení na svou strukturu, je snazší přidávat nové informace ve srovnání se strukturovanou sadou dat. Pokud senzor, který snímá data o barometrickém tlaku každé 2 minuty, dostane aktualizaci, která mu umožní měřit a zaznamenávat teplotu, nebude nutné měnit stávající data, pokud jsou nestrukturovaná. Toto však může znamenat, že analýza nebo zkoumání takových dat potrvá déle. Například vědec, který chce zjistit průměrnou teplotu za předchozí měsíc z dat senzoru, ale zjistí, že senzor zaznamenal v některých datech písmeno „e“ pro označení, že byl senzor rozbitý místo typického čísla, což znamená, že data nejsou kompletní.
Příklady nestrukturovaných dat: textové soubory, textové zprávy, video soubory
### Polostrukturovaná data
Polostrukturovaná data mají vlastnosti, které je činí kombinací strukturovaných a nestrukturovaných dat. Obvykle neodpovídají formátu řádků a sloupců, ale jsou organizována způsobem, který je považován za strukturovaný, a mohou dodržovat pevný formát nebo sadu pravidel. Struktura se liší podle zdrojů, od dobře definované hierarchie až po něco flexibilnějšího, co umožňuje snadnou integraci nových informací. Metadata jsou indikátory, které pomáhají rozhodnout, jak jsou data organizována a ukládána, a mají různé názvy podle typu dat. Některé běžné názvy pro metadata jsou značky, prvky, entity a atributy. Například typická e-mailová zpráva bude mít předmět, tělo a sadu příjemců a může být organizována podle toho, kdo ji poslal nebo kdy byla odeslána.
Polostrukturovaná data mají vlastnosti, které z nich činí kombinaci strukturovaných a nestrukturovaných dat. Obvykle neodpovídají formátu řádků a sloupců, ale jsou uspořádána způsobem, který je považován za strukturovaný a může dodržovat pevný formát nebo sadu pravidel. Struktura se bude lišit podle zdrojů, například od dobře definované hierarchie až po něco flexibilnějšího, co umožňuje snadnou integraci nových informací. Metadata jsou indikátory, které pomáhají rozhodnout, jak jsou data uspořádána a uložena, a mají různá jména podle typu dat. Některá běžná jména pro metadata jsou tagy, elementy, entity a atributy. Například běžný e-mail bude mít předmět, tělo a sadu příjemců a může být uspořádán podle toho, kdo nebo kdy byl odeslán.
Příklady polostrukturovaných dat: HTML, soubory CSV, JavaScript Object Notation (JSON)
Příklady polostrukturovaných dat: HTML, CSV soubory, JavaScript Object Notation (JSON)
## Zdroje dat
Zdroj dat je počáteční místo, kde byla data vytvořena, nebo kde "žijí", a liší se podle toho, jak a kdy byla shromážděna. Data generovaná uživateli jsou známá jako primární data, zatímco sekundární data pocházejí ze zdroje, který shromáždil data pro obecné použití. Například skupina vědců, která sbírá pozorování v deštném pralese, by byla považována za primární zdroj, a pokud se rozhodnou sdílet tato data s jinými vědci, byla by považována za sekundární pro ty, kteří je používají.
Zdroj dat je počáteční místo, kde byla data vytvořena nebo kde „žijí“ a bude se lišit podle toho, jak a kdy byla data shromážděna. Data generovaná svými uživateli jsou známá jako primární data, zatímco sekundární data pocházejí ze zdroje, který data shromažďoval pro obecné použití. Například skupina vědců sbírajících pozorování v deštném pralese by byla považována za primární zdroj a pokud je rozhodnou sdílet s jinými vědci, budou pro ty, kdo je používají, považována za sekundární.
Databáze jsou běžným zdrojem a spoléhají na systém správy databází, který hostuje a udržuje data, kde uživatelé používají příkazy nazývané dotazy k prozkoumání dat. Soubory jako zdroje dat mohou být zvukové, obrazové a video soubory, stejně jako tabulky, například Excel. Internetové zdroje jsou běžným místem pro hostování dat, kde lze najít databáze i soubory. Rozhraní pro programování aplikací, známá také jako API, umožňují programátorům vytvářet způsoby sdílení dat s externími uživateli prostřednictvím internetu, zatímco proces webového scrappingu extrahuje data z webové stránky. [Lekce v Práce s daty](../../../../../../../../../2-Working-With-Data) se zaměřují na to, jak používat různé zdroje dat.
Databáze jsou běžným zdrojem a spoléhají na systém pro správu databází k hostování a udržování dat, kde uživatelé používají příkazy zvané dotazy k průzkumu dat. Soubory jako zdroje dat mohou být audio, obrazové a video soubory, stejně jako tabulky typu Excel. Internetové zdroje jsou běžným místem pro hostování dat, kde lze najít databáze i soubory. Rozhraní aplikačního programování, známá také jako API, umožňují programátorům vytvářet způsoby sdílení dat s externími uživateli přes internet, zatímco proces web scrapingu extrahuje data z webové stránky. [Lekce v sekci Práce s daty](../../../../../../../../../2-Working-With-Data) se zaměřují na to, jak využívat různé zdroje dat.
## Závěr
V této lekci jsme se naučili:
- Co jsou data
- Jak jsou data popisována
- Jak jsou data popsána
- Jak jsou data klasifikována a kategorizována
- Kde lze data najít
## 🚀 Výzva
Kaggle je vynikajícím zdrojem otevřených datových sad. Použijte [nástroj pro vyhledávání datových sad](https://www.kaggle.com/datasets) k nalezení zajímavých datových sad a klasifikujte 3-5 datových sad podle těchto kritérií:
Kaggle je vynikajícím zdrojem otevřených sad dat. Použijte [nástroj pro hledání sad dat](https://www.kaggle.com/datasets), abyste našli zajímavé sady dat a klasifikovali 3-5 sad pomocí těchto kritérií:
- Jsou data kvantitativní nebo kvalitativní?
- Jsou data strukturovaná, nestrukturovaná nebo polostrukturovaná?
- Jsou data strukturovaná, nestrukturovaná, nebo polostrukturovaná?
## [Popřednáškový kvíz](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## [Kvíz po přednášce](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Přehled a samostudium
## Revize & Samostudium
- Tato jednotka Microsoft Learn s názvem [Klasifikace vašich dat](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) obsahuje podrobný rozbor strukturovaných, polostrukturovaných a nestrukturovaných dat.
- Tato jednotka Microsoft Learn, nazvaná [Identifikace formátů dat](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text), má podrobný rozbor strukturovaných, polostrukturovaných a nestrukturovaných dat.
## Úkol
[Klasifikace datových sad](assignment.md)
[Klasifikace sad dat](assignment.md)
---
**Prohlášení**:
Tento dokument byl přeložen pomocí služby pro automatický překlad [Co-op Translator](https://github.com/Azure/co-op-translator). I když se snažíme o přesnost, mějte prosím na paměti, že automatické překlady mohou obsahovat chyby nebo nepřesnosti. Původní dokument v jeho původním jazyce by měl být považován za autoritativní zdroj. Pro důležité informace se doporučuje profesionální lidský překlad. Neodpovídáme za žádné nedorozumění nebo nesprávné interpretace vyplývající z použití tohoto překladu.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Prohlášení o omezení odpovědnosti**:
Tento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). Přestože usilujeme o co největší přesnost, mějte prosím na paměti, že automatizované překlady mohou obsahovat chyby nebo nepřesnosti. Originální dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro kritické informace se doporučuje profesionální lidský překlad. Nejsme odpovědní za jakékoli nedorozumění nebo nesprávné interpretace vzniklé použitím tohoto překladu.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {},
"source": [
"# Úvod do pravděpodobnosti a statistiky\n",
"V tomto zápisníku si budeme hrát s některými koncepty, které jsme dříve probírali. Mnoho konceptů z pravděpodobnosti a statistiky je dobře zastoupeno v hlavních knihovnách pro zpracování dat v Pythonu, jako jsou `numpy` a `pandas`.\n"
"V tomto sešitě si vyzkoušíme některé z konceptů, o kterých jsme již diskutovali. Mnoho konceptů z pravděpodobnosti a statistiky je dobře zastoupeno v hlavních knihovnách pro zpracování dat v Pythonu, jako jsou `numpy` a `pandas`.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## Náhodné proměnné a rozdělení\n",
"Začněme výběrem vzorku 30 hodnot z rovnoměrného rozdělení od 0 do 9. Také vypočítáme průměr a rozptyl.\n"
"Začněme tahem vzorku 30 hodnot z rovnoměrného rozdělení od 0 do 9. Také spočítáme průměr a rozptyl.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Pro vizuální odhad, kolik různých hodnot se ve vzorku vyskytuje, můžeme nakreslit **histogram**:\n"
"Pro vizuální odhad, kolik různých hodnot ve vzorku je, můžeme vykreslit **histogram**:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## Analýza reálných dat\n",
"\n",
"Průměr a rozptyl jsou velmi důležité při analýze reálných dat. Načtěme data o baseballových hráčích z [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Průměr a rozptyl jsou velmi důležité při analýze dat ze skutečného světa. Načtěme data o baseballových hráčích z [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Používáme balíček zvaný [**Pandas**](https://pandas.pydata.org/) pro analýzu dat. O knihovně Pandas a práci s daty v Pythonu budeme mluvit později v tomto kurzu.\n",
"> Zde používáme balíček nazvaný [**Pandas**](https://pandas.pydata.org/) pro analýzu dat. O balíčku Pandas a práci s daty v Pythonu si povíme více později v tomto kurzu.\n",
"\n",
"Spočítejme průměrné hodnoty pro věk, výšku a váhu:\n"
"Vypočítejme průměrné hodnoty pro věk, výšku a váhu:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nyní se zaměřme na výšku a vypočítejme směrodatnou odchylku a rozptyl:\n"
"Nyní se zaměřme na výšku a vypočítejme směrodatnou odchylku a rozptyl: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kromě průměru dává smysl podívat se na medián a kvartily. Ty lze vizualizovat pomocí **krabicového grafu**:\n"
"Kromě průměru je rozumné se podívat na mediánovou hodnotu a kvartily. Ty lze vizualizovat pomocí **krabicového grafu**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Můžeme také vytvořit krabicové grafy podmnožin našeho datasetu, například seskupené podle role hráče.\n"
"Můžeme také vytvářet krabicové grafy podmnožin našeho datasetu, například seskupené podle role hráče.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Poznámka**: Tento diagram naznačuje, že průměrná výška prvních basemanů je vyšší než výška druhých basemanů. Později se naučíme, jak tuto hypotézu formálněji otestovat a jak ukázat, že naše data jsou statisticky významná k jejímu prokázání.\n",
"> **Poznámka**: Tento diagram naznačuje, že průměrná výška první metařů je vyšší než výška druhé metařů. Později se naučíme, jak tuto hypotézu formálněji testovat a jak prokázat, že naše data jsou statisticky významná k jejímu potvrzení. \n",
"\n",
"Věk, výška a váha jsou všechny spojité náhodné proměnné. Jaká myslíte, že je jejich distribuce? Dobrou metodou, jak to zjistit, je vykreslit histogram hodnot:\n"
"Věk, výška a váha jsou všechny spojité náhodné veličiny. Jak myslíte, že je rozdělení těchto veličin? Dobrou metodou, jak to zjistit, je vykreslení histogramu hodnot: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## Normální rozdělení\n",
"\n",
"Vytvořme umělý vzorek váh, který následuje normální rozdělení se stejným průměrem a rozptylem jako naše skutečná data:\n"
"Vytvořme umivý vzorek hmotností, který následuje normální rozdělení se stejným průměrem a rozptylem jako naše skutečná data:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Protože většina hodnot v reálném životě má normální rozdělení, neměli bychom používat uniformní generátor náhodných čísel pro generování vzorových dat. Zde je, co se stane, pokud se pokusíme vygenerovat hmotnosti s uniformním rozdělením (vygenerované pomocí `np.random.rand`):\n"
"Vzhledem k tomu, že většina hodnot v reálném životě je normálně rozložena, neměli bychom používat uniformní generátor náhodných čísel k vytvoření vzorkových dat. Zde je, co se stane, když se pokusíme generovat váhy s uniformním rozdělením (generováno pomocí `np.random.rand`):\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Intervaly spolehlivosti\n",
"\n",
"Nyní vypočítáme intervaly spolehlivosti pro váhy a výšky baseballových hráčů. Použijeme kód [z této diskuse na stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Nyní spočítejme intervaly spolehlivosti pro váhy a výšky baseballových hráčů. Použijeme kód [z této diskuse na stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## Testování hypotéz\n",
"\n",
"Pojďme prozkoumat různé role v našem datasetu baseballových hráčů:\n"
"Prozkoumejme různé role v naší datové sadě hráčů baseballu:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ověřme hypotézu, že první metaři jsou vyšší než druzí metaři. Nejjednodušší způsob, jak to udělat, je otestovat intervaly spolehlivosti:\n"
"Otestujme hypotézu, že první mety jsou vyšší než druhé mety. Nejjednodušší způsob, jak to udělat, je testovat intervaly spolehlivosti:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vidíme, že intervaly se nepřekrývají.\n",
"Můžeme vidět, že intervaly se nepřekrývají.\n",
"\n",
"Statisticky správnějším způsobem, jak dokázat hypotézu, je použití **Studentova t-testu**:\n"
"Statisticky správnější způsob, jak ověřit hypotézu, je použití **Studentova t-testu**:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"Dvě hodnoty vrácené funkcí `ttest_ind` jsou:\n",
"* p-hodnota může být považována za pravděpodobnost, že dvě rozdělení mají stejný průměr. V našem případě je velmi nízká, což znamená, že existuje silný důkaz podporující, že první metaři jsou vyšší.\n",
"* t-hodnota je mezihodnota normalizovaného rozdílu průměrů, která se používá v t-testu, a porovnává se s mezní hodnotou pro danou hladinu spolehlivosti.\n"
"* p-hodnota může být považována za pravděpodobnost, že dva rozdělení mají stejný průměr. V našem případě je velmi nízká, což znamená, že existuje silný důkaz podporující, že první metaři jsou vyšší.\n",
"* t-hodnota je mezihodnota normalizovaného rozdílu průměrů, která se používá v t-testu a porovnává se s prahovou hodnotou pro danou hodnotu spolehlivosti.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Simulace normálního rozdělení s centrální limitní větou\n",
"## Simulace normálního rozdělení pomocí centrální limitní věty\n",
"\n",
"Generátor pseudonáhodných čísel v Pythonu je navržen tak, aby nám poskytoval rovnoměrné rozdělení. Pokud chceme vytvořit generátor pro normální rozdělení, můžeme použít centrální limitní větu. Pro získání hodnoty s normálním rozdělením jednoduše spočítáme průměr vzorku vygenerovaného rovnoměrným rozdělením.\n"
"Pseudo-náhodný generátor v Pythonu je navržen tak, aby nám poskytl rovnoměrné rozdělení. Pokud chceme vytvořit generátor pro normální rozdělení, můžeme použít centrální limitní větu. Pro získání hodnoty s normálním rozdělením jednoduše vypočítáme průměr vzorku vygenerovaného rovnoměrně.\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Korelace a Evil Baseball Corp\n",
"## Korelace a Zlá Baseballová Korporace\n",
"\n",
"Korelace nám umožňuje nalézt vztahy mezi sekvencemi dat. V našem ukázkovém příkladu si představme, že existuje zlý baseballový korporát, který platí svým hráčům podle jejich výšky čím vyšší hráč je, tím více peněz dostane. Předpokládejme základní plat 1000 dolarů a dodatečný bonus od 0 do 100 dolarů, v závislosti na výšce. Vezmeme skutečné hráče z MLB a vypočítáme jejich imaginární platy:\n"
"Korelace nám umožňuje najít vztahy mezi datovými sekvencemi. V našem jednoduchém příkladu si představme zlou baseballovou korporaci, která platí svým hráčům podle jejich výšky čím vyšší hráč je, tím více peněz dostane. Předpokládejme základní plat 1000 dolarů a dodatečný bonus od 0 do 100 dolarů, závislý na výšce. Vezmeme skutečné hráče z MLB a spočítáme jejich imaginární platy:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nyní spočítejme kovarianci a korelaci těchto sekvencí. `np.cov` nám poskytne takzvanou **kovarianční matici**, což je rozšíření kovariance na více proměnných. Prvek $M_{ij}$ kovarianční matice $M$ je korelace mezi vstupními proměnnými $X_i$ a $X_j$, a hodnoty na diagonále $M_{ii}$ jsou rozptyly $X_{i}$. Podobně `np.corrcoef` nám poskytne **korelační matici**.\n"
"Nyní spočítáme kovarianci a korelaci těchto posloupností. `np.cov` nám poskytne takzvanou **kovarianční matici**, což je rozšíření kovariance na více proměnných. Prvek $M_{ij}$ kovarianční matice $M$ je korelace mezi vstupními proměnnými $X_i$ a $X_j$, a diagonální hodnoty $M_{ii}$ jsou rozptylem $X_{i}$. Podobně `np.corrcoef` nám poskytne **korelační matici**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Korelace rovná 1 znamená, že mezi dvěma proměnnými existuje silný **lineární vztah**. Lineární vztah můžeme vizuálně vidět tak, že zakreslíme jednu hodnotu proti druhé:\n"
"Korelace rovná 1 znamená, že mezi dvěma proměnnými existuje silný **lineární vztah**. Lineární vztah můžeme vizuálně vidět, když vykreslíme jednu hodnotu proti druhé:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Podívejme se, co se stane, pokud vztah není lineární. Předpokládejme, že naše společnost se rozhodla skrýt zřejmou lineární závislost mezi výškami a platy a do vzorce zavedla nějakou nelinearitu, například `sin`:\n"
"Podívejme se, co se stane, když závislost není lineární. Předpokládejme, že naše společnost se rozhodla skrýt zřejmou lineární závislost mezi výškou a platy a do vzorce zavedla nějakou nelinearitu, například `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"V tomto případě je korelace o něco menší, ale stále je docela vysoká. Nyní, aby byla vazba ještě méně zřejmá, můžeme přidat nějakou dodatečnou náhodnost přidáním náhodné proměnné k platu. Podívejme se, co se stane:\n"
"V tomto případě je korelace mírně menší, ale stále docela vysoká. Nyní, abychom vztah učinili ještě méně zřejmým, mohli bychom chtít přidat nějakou extra náhodnost přidáním náhodné proměnné k platu. Podívejme se, co se stane:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Dokážete uhodnout, proč se tečky takto srovnají do svislých linií?\n",
"> Uhádnete, proč se tečky zarovnávají do svislých linií jako tyto?\n",
"\n",
"Pozorovali jsme korelaci mezi uměle vytvořeným konceptem, jako je plat, a pozorovanou proměnnou *výška*. Podívejme se také, zda spolu korelují dvě pozorované proměnné, jako je výška a váha:\n"
"Pozorovali jsme korelaci mezi uměle vytvořeným konceptem jako je plat a pozorovanou proměnnou *výška*. Podívejme se také, zda spolu korelují dvě pozorované proměnné, například výška a váha:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Bohužel jsme nedostali žádné výsledky pouze nějaké podivné hodnoty `nan`. Je to způsobeno tím, že některé hodnoty v naší sérii nejsou definované, jsou reprezentovány jako `nan`, což způsobuje, že výsledek operace je rovněž nedefinovaný. Pohledem na matici vidíme, že problematickým sloupcem je `Weight`, protože byla spočítána samokorelace mezi hodnotami `Height`.\n",
"Bohužel jsme nedostali žádné výsledky pouze nějaké podivné hodnoty `nan`. Je to způsobeno tím, že některé hodnoty v naší sérii nejsou definované, reprezentované jako `nan`, což způsobuje, že výsledek operace je také nedefinovaný. Když se podíváme na matici, vidíme, že problémovým sloupcem je `Weight`, protože byla vypočítána korelace sama se sebou mezi hodnotami `Height`.\n",
"\n",
"> Tento příklad ukazuje důležitost **přípravy dat** a **čištění**. Bez správných dat nemůžeme nic spočítat.\n",
"> Tento příklad ukazuje důležitost **přípravy dat** a **čištění**. Bez správných dat nemůžeme nic vypočítat.\n",
"\n",
"Použijme metodu `fillna` pro doplnění chybějících hodnot a spočítejme korelaci: \n"
"Použijme metodu `fillna` k vyplnění chybějících hodnot a spočítejme korelaci:\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Existuje skutečně korelace, ale není tak silná jako v našem umělém příkladu. Pokud se podíváme na bodový graf jedné hodnoty vůči druhé, vztah by byl mnohem méně zřejmý:\n"
"Skutečně existuje korelace, ale ne tak silná jako v našem umělém příkladu. Pokud se však podíváme na bodový graf jedné hodnoty proti druhé, vztah by byl mnohem méně zřejmý:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Závěr\n",
"\n",
"V tomto sešitě jsme se naučili, jak provádět základní operace s daty pro výpočet statistických funkcí. Nyní víme, jak používat pevný aparát matematiky a statistiky k ověření některých hypotéz a jak vypočítat intervaly spolehlivosti pro libovolné proměnné na základě datového vzorku.\n"
"V tomto sešitě jsme se naučili, jak provádět základní operace s daty pro výpočet statistických funkcí. Nyní víme, jak používat pevný aparát matematiky a statistiky k prokázání některých hypotéz a jak vypočítat intervaly spolehlivosti pro libovolné proměnné na základě datového vzorku.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Zřeknutí se odpovědnosti**: \nTento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). I když usilujeme o přesnost, mějte prosím na paměti, že automatické překlady mohou obsahovat chyby nebo nepřesnosti. Originální dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro důležité informace se doporučuje profesionální lidský překlad. Nejsme odpovědní za jakákoliv nedorozumění nebo mylné výklady vyplývající z použití tohoto překladu.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Prohlášení o omezení odpovědnosti**:\nTento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). Přestože usilujeme o co největší přesnost, mějte prosím na paměti, že automatizované překlady mohou obsahovat chyby nebo nepřesnosti. Originální dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro kritické informace se doporučuje profesionální lidský překlad. Nejsme odpovědní za jakékoli nedorozumění nebo nesprávné interpretace vzniklé použitím tohoto překladu.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T18:34:38+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "cs"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## Načítání dat\n",
"\n",
"Použijeme data o nakažených COVID-19, která poskytuje [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) na [Johns Hopkins University](https://jhu.edu/). Datová sada je dostupná v [tomto GitHub repozitáři](https://github.com/CSSEGISandData/COVID-19).\n"
"Použijeme data o nakažených COVID-19, poskytovaná [Centrem pro systémovou vědu a inženýrství](https://systems.jhu.edu/) (CSSE) na [Johns Hopkins University](https://jhu.edu/). Datový soubor je dostupný v [tomto repozitáři na GitHubu](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nejnovější data můžeme načíst přímo z GitHubu pomocí `pd.read_csv`. Pokud data nejsou z nějakého důvodu dostupná, vždy můžete použít kopii dostupnou lokálně ve složce `data` - stačí odkomentovat níže uvedený řádek, který definuje `base_url`:\n"
"Nejaktuálnější data můžeme načíst přímo z GitHubu pomocí `pd.read_csv`. Pokud by však data z nějakého důvodu nebyla k dispozici, můžete vždy použít kopii dostupnou lokálně ve složce `data` stačí odkomentovat níže uvedený řádek, který definuje `base_url`:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nyní načtěme data o nakažených jednotlivcích a podívejme se, jak data vypadají:\n"
"Načtěme si nyní data o nakažených jedincích a podívejme se, jak data vypadají:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vidíme, že každý řádek tabulky definuje počet nakažených jedinců pro každou zemi a/nebo provincii a sloupce odpovídají datům. Podobné tabulky lze načíst pro další data, jako je počet uzdravených a počet úmrtí.\n"
"Můžeme vidět, že každý řádek tabulky definuje počet nakažených jedinců pro každou zemi a/nebo provincii a sloupce odpovídají datům. Podobné tabulky lze načíst i pro další data, jako je počet vyléčených a počet úmrtí.\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## Porozumění datům\n",
"\n",
"Z tabulky výše není role sloupce province jasná. Podívejme se na různé hodnoty, které se nacházejí ve sloupci `Province/State`:\n"
"Z výše uvedené tabulky není role sloupce provincie jasná. Podívejme se na různé hodnoty, které jsou ve sloupci `Province/State`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Z názvů můžeme usoudit, že země jako Austrálie a Čína mají podrobnější rozdělení na provincie. Podívejme se na informace o Číně, abychom viděli příklad:\n"
"Z názvů můžeme odvodit, že země jako Austrálie a Čína mají podrobnější rozdělení podle provincií. Podívejme se na informace o Číně, abychom viděli příklad:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Předzpracování dat\n",
"## Předzpracování dat \n",
"\n",
"Nemáme zájem rozdělovat země na další území, proto se nejprve zbavíme tohoto rozdělení a přidáme informace o všech územích dohromady, abychom získali údaje za celou zemi. To lze provést pomocí `groupby`:\n"
"Nezajímá nás rozdělení zemí na další území, proto se nejprve zbavíme tohoto rozdělení a přidáme informace o všech územích dohromady, abychom získali informace za celou zemi. To lze provést pomocí `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vidíte, že díky použití `groupby` jsou nyní všechny DataFrame indexovány podle země/regionu. Můžeme tedy přistupovat k datům pro konkrétní zemi pomocí `.loc`:|\n"
"Můžete vidět, že díky použití `groupby` jsou nyní všechny DataFrame indexovány podle Země/regionu. Můžeme tedy přistupovat k datům pro konkrétní zemi pomocí `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Poznámka** jak používáme `[3:]` k odstranění prvních tří prvků sekvence, které obsahují metadata, jež nejsou datem (sloupce Provincie/Stát a geolokační sloupce). Můžeme také tyto tři sloupce úplně odstranit:\n"
"> **Poznámka** jak používáme `[3:]` k odstranění prvních tří prvků sekvence, které obsahují metadata neobsahující datum (sloupce Provincie/Stát a zeměpisnou polohu). Můžeme také tyto tři sloupce úplně vyřadit:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Zkoumání dat\n",
"## Vyšetřování dat\n",
"\n",
"Pojďme se nyní přepnout na zkoumání konkrétní země. Vytvořme rámec, který obsahuje data o infekcích indexovaná podle data:\n"
"Pojďme se nyní přepnout k vyšetřování konkrétní země. Vytvoříme rámec, který obsahuje data o infekcích indexovaná podle data:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nyní spočítáme počet nově nakažených lidí každý den. To nám umožní vidět, jak rychle pandemie postupuje. Nejsnazší den, kdy to udělat, je použití `diff`:\n"
"Nyní vypočítáme počet nově nakažených lidí každý den. To nám umožní vidět rychlost, jakou pandemie postupuje. Nejjednodušší způsob, jak to udělat, je použít `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Můžeme vidět vysoké výkyvy v datech. Podívejme se podrobněji na jeden z měsíců:\n"
"Vidíme vysoké výkyvy v datech. Podívejme se blíže na jeden z měsíců:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Je zřejmé, že v datech dochází k týdenním výkyvům. Protože chceme být schopni vidět trendy, dává smysl vyhladit křivku výpočtem klouzavého průměru (tj. pro každý den vypočítáme průměrnou hodnotu za několik předchozích dní):\n"
"Je zřejmé, že v datech jsou týdenní výkyvy. Protože chceme být schopni vidět trendy, dává smysl vyhladit křivku výpočtem klouzavého průměru (tj. pro každý den vypočítáme průměrnou hodnotu za předchozích několik dní):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Abychom mohli porovnat několik zemí, mohli bychom chtít vzít v úvahu počet obyvatel země a porovnat procento nakažených jedinců vzhledem k populaci země. Abychom získali populaci země, načtěme dataset zemí:\n"
"Abychom mohli porovnat několik zemí, možná budeme chtít vzít v úvahu populaci země a porovnat procento nakažených vzhledem k populaci země. Abychom získali populaci země, načtěme dataset zemí:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Protože tento dataset obsahuje informace jak o zemích, tak o provinciích, abychom získali populaci celé země, musíme být trochu chytřejší:\n"
"Protože tato datová sada obsahuje informace jak o zemích, tak o provinciích, abychom získali populaci celé země, musíme být trochu chytřejší: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Výpočet $R_t$\n",
"\n",
"Abyste vili, jak nakažlivé je onemocnění, díváme se na **základní reprodukční číslo** $R_0$, které udává počet lidí, které infikovaná osoba dále nakazí. Když je $R_0$ větší než 1, je pravděpodobné, že epidemie se rozšíří.\n",
"Abychom zjistili, jak nakažlivé je onemocnění, podíváme se na **základní reprodukční číslo** $R_0$, které udává, kolik lidí nakažená osoba dále nakazí. Když je $R_0$ větší než 1, epidemie se s největší pravděpodobností rozšíří.\n",
"\n",
"$R_0$ je vlastností samotného onemocnění a nebere v úvahu některá ochranná opatření, která lidé mohou přijmout ke zpomalení pandemie. Během vývoje pandemie můžeme odhadnout reprodukční číslo $R_t$ v libovolném čase $t$. Bylo prokázáno, že toto číslo lze přibližně odhadnout tak, že vezmeme okno o délce 8 dnů a vypočítáme $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"$R_0$ je vlastnost samotné nemoci a nezohledňuje některá ochranná opatření, která lidé mohou přijmout ke zpomalení pandemie. Během průběhu pandemie můžeme odhadnout reprodukční číslo $R_t$ v libovolném čase $t$. Ukázalo se, že toto číslo lze přibližně odhadnout tak, že vezmeme okno 8 dní a vypočítáme $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"kde $I_t$ je počet nově nakažených jedinců v den $t$.\n",
"\n",
"Spočítejme $R_t$ pro naše údaje o pandemii. K tomu vezmeme posuvné okno o velikosti 8 hodnot `ninfected` a použijeme funkci k výpočtu uvedeného poměru:\n"
"Vypočítejme $R_t$ pro naše pandemická data. K tomu vezmeme pohyblivé okno 8 hodnot `ninfected` a použijeme funkci pro výpočet uvedeného poměru:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vidíte, že na grafu jsou některé mezery. Ty mohou být způsobeny buď `NaN`, nebo pokud jsou v datasetu přítomny hodnoty `inf`. `inf` může být způsobeno dělením nulou a `NaN` může znamenat chybějící data nebo nedostupnost dat pro výpočet výsledku (například na úplném začátku našeho rámce, kde není ještě k dispozici klouzavé okno o šířce 8). Aby byl graf hezčí, musíme tyto hodnoty vyplnit pomocí funkcí `replace` a `fillna`.\n",
"Můžete vidět, že v grafu jsou některé mezery. Ty mohou být způsobeny buď hodnotami `NaN`, nebo pokud se v datech vyskytují hodnoty `inf`. `inf` může být způsobeno dělením nulou a `NaN` může indikovat chybějící data nebo nedostupnost dat pro výpočet výsledku (například na úplném začátku našeho rámce, kde není ještě k dispozici klouzavé okno o šířce 8). Abychom graf zpříjemnili, potřebujeme tyto hodnoty vyplnit pomocí funkcí `replace` a `fillna`.\n",
"\n",
"Podívejme se dále na začátek pandemie. Omezíme také hodnoty na ose y tak, aby zobrazovaly jen hodnoty pod 6, abychom lépe viděli, a nakreslíme vodorovnou čáru na hodnotě 1.\n"
"Podívejme se dále na začátek pandemie. Omezíme také hodnoty na ose y tak, aby se zobrazily pouze hodnoty pod 6, abychom lépe viděli, a nakreslíme vodorovnou čáru na úrovni 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dalším zajímavým ukazatelem pandemie je **derivát**, neboli **denní rozdíl** v nových případech. Umožňuje nám jasně vidět, kdy pandemie narůstá nebo klesá.\n"
"Dalším zajímavým ukazatelem pandemie je **derivát**, neboli **denní rozdíl** nových případů. Umožňuje nám jasně vidět, kdy pandemie roste nebo klesá. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vzhledem k tomu, že v datech dochází k mnoha výkyvům způsobeným hlášením, dává smysl křivku vyhladit pomocí klouzavého průměru, aby se získal celkový obrázek. Zaměřme se znovu na první měsíce pandemie:\n"
"Vzhledem k tomu, že data obsahují spoustu výkyvů způsobených hlášením, dává smysl křivku vyhladit pomocí klouzavého průměru, abychom získali celkový přehled. Zaměřme se znovu na první měsíce pandemie:\n"
]
},
{
@ -2390,26 +2391,27 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Výzva\n",
"\n",
"Nyní je čas si s kódem a daty více pohrát! Zde je několik návrhů, které můžete vyzkoušet:\n",
"Teď je čas, abyste si více pohráli s kódem a daty! Zde je pár návrhů, s nimiž můžete experimentovat:\n",
"* Podívejte se na šíření pandemie v různých zemích.\n",
"* Vykreslete grafy $R_t$ pro několik zemí na jednom grafu pro srovnání, nebo udělejte několik grafů vedle sebe.\n",
"* Podívejte se, jak počet úmrtí a vyléčení koreluje s počtem nakažených případů.\n",
"* Pokuste se zjistit, jak dlouho typická nemoc trvá, vizuálně korrelováním míry infekce a míry úmrtí a hledáním nějakých anomálií. Možná budete muset podívat se na různé země, abyste to zjistili.\n",
"* Vypočítejte míru úmrtnosti a jak se mění v čase. Můžete chtít zohlednit délku nemoci v dnech, abyste časovou řadu před výpočtem posunuli.\n"
"* Vykreslete grafy $R_t$ pro několik zemí do jednoho grafu pro srovnání, nebo vytvořte několik grafů vedle sebe.\n",
"* Podívejte se, jak koreluje počet úmrtí a uzdravení s počtem nakažených případů.\n",
"* Pokuste se zjistit, jak dlouho obvykle nemoc trvá, tím, že vizuálně korelujete míru infekce a míru úmrtí a hledáte nějaké anomálie. Možná budete muset podívat se na různé země, abyste to zjistili.\n",
"* Vypočítejte míru úmrtnosti a jak se mění v průběhu času. Možná budete chtít zohlednit délku nemoci v dnech, abyste posunuli jeden časový řad před provedením výpočtů.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## References\n",
"## Reference\n",
"\n",
"You may look at further studies of COVID epidemic spread in the following publications:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blog post by [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Code for the above paper on GitHub](https://github.com/shwars/SlidingSIR)\n"
"Další studie šíření epidemie COVID naleznete v následujících publikacích:\n",
"* [Model skluzného SIR pro odhad Rt během pandemie COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blogový příspěvek od [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Odhad časově závislého reprodukčního čísla při globálním výskytu COVID-19](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Kód k výše uvedenému článku na GitHubu](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Prohlášení**: \nTento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). Přestože usilujeme o přesnost, mějte prosím na paměti, že automatizované překlady mohou obsahovat chyby nebo nepřesnosti. Původní dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro kritické informace se doporučuje profesionální lidský překlad. Neručíme za jakékoliv nedorozumění či nesprávné výklady vzniklé použitím tohoto překladu.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Prohlášení o omezení odpovědnosti**:\nTento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). Přestože usilujeme o co největší přesnost, mějte prosím na paměti, že automatizované překlady mohou obsahovat chyby nebo nepřesnosti. Originální dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro kritické informace se doporučuje profesionální lidský překlad. Nejsme odpovědní za jakékoli nedorozumění nebo nesprávné interpretace vzniklé použitím tohoto překladu.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# Projekt vizualizace dat Dangerous Liaisons
# Projekt vizualizace dat Nebezpečné známosti
Abyste mohli začít, ujistěte se, že máte na svém počítači nainstalované NPM a Node. Nainstalujte závislosti (npm install) a poté spusťte projekt lokálně (npm run serve):
Pro začátek je třeba zajistit, že na vašem počítači běží NPM a Node **>=20.0.0**. Nainstalujte závislosti (npm install) a poté spusťte projekt lokálně (npm run serve):
## Nastavení projektu
```
npm install
```
### Kompilace a automatické znovunačítání pro vývoj
### Kompilace a automatické znovunačtení pro vývoj
```
npm run serve
```
### Kompilace a minimalizace pro produkci
### Kompilace a minifikace pro produkci
```
npm run build
```
### Kontrola a oprava souborů
### Kontrola kódu a oprava souborů
```
npm run lint
```
### Přizpůsobení konfigurace
Podívejte se na [Konfigurační referenci](https://cli.vuejs.org/config/).
Viz [Configuration Reference](https://cli.vuejs.org/config/).
---
**Upozornění**:
Tento dokument byl přeložen pomocí služby pro automatický překlad [Co-op Translator](https://github.com/Azure/co-op-translator). I když se snažíme o přesnost, mějte prosím na paměti, že automatické překlady mohou obsahovat chyby nebo nepřesnosti. Původní dokument v jeho původním jazyce by měl být považován za závazný zdroj. Pro důležité informace se doporučuje profesionální lidský překlad. Neodpovídáme za jakékoli nedorozumění nebo nesprávné interpretace vyplývající z použití tohoto překladu.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Prohlášení o omezení odpovědnosti**:
Tento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). Přestože usilujeme o co největší přesnost, mějte prosím na paměti, že automatizované překlady mohou obsahovat chyby nebo nepřesnosti. Originální dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro kritické informace se doporučuje profesionální lidský překlad. Nejsme odpovědní za jakékoli nedorozumění nebo nesprávné interpretace vzniklé použitím tohoto překladu.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# Projekt vizualizace dat Dangerous Liaisons
# Projekt vizualizace dat Nebezpečné známosti
Než začnete, ujistěte se, že máte na svém počítači nainstalované NPM a Node. Nainstalujte závislosti (npm install) a poté spusťte projekt lokálně (npm run serve):
Pro začátek se ujistěte, že máte na svém počítači nainstalován NPM a Node **>=20.0.0**. Nainstalujte závislosti (npm install) a poté spusťte projekt lokálně (npm run serve):
## Nastavení projektu
```
npm install
```
### Kompilace a automatické obnovení pro vývoj
### Překládá a automaticky obnovuje pro vývoj
```
npm run serve
```
### Kompilace a minimalizace pro produkci
### Překládá a minimalizuje pro produkci
```
npm run build
```
### Kontrola a oprava souborů
### Provádí lintování a opravy souborů
```
npm run lint
```
### Přizpůsobení konfigurace
Podívejte se na [Konfigurační referenci](https://cli.vuejs.org/config/).
Viz [Configuration Reference](https://cli.vuejs.org/config/).
---
**Prohlášení**:
Tento dokument byl přeložen pomocí služby pro automatický překlad [Co-op Translator](https://github.com/Azure/co-op-translator). I když se snažíme o přesnost, mějte na paměti, že automatické překlady mohou obsahovat chyby nebo nepřesnosti. Původní dokument v jeho původním jazyce by měl být považován za autoritativní zdroj. Pro důležité informace se doporučuje profesionální lidský překlad. Neodpovídáme za žádná nedorozumění nebo nesprávné interpretace vyplývající z použití tohoto překladu.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Prohlášení o omezení odpovědnosti**:
Tento dokument byl přeložen pomocí AI překladatelské služby [Co-op Translator](https://github.com/Azure/co-op-translator). Přestože usilujeme o co největší přesnost, mějte prosím na paměti, že automatizované překlady mohou obsahovat chyby nebo nepřesnosti. Originální dokument v jeho mateřském jazyce by měl být považován za autoritativní zdroj. Pro kritické informace se doporučuje profesionální lidský překlad. Nejsme odpovědní za jakékoli nedorozumění nebo nesprávné interpretace vzniklé použitím tohoto překladu.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "hu"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T11:12:03+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T20:53:52+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "hu"
},
@ -42,8 +42,8 @@
"language_code": "hu"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T17:37:52+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T20:58:31+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "hu"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "hu"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T20:55:07+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "hu"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-26T14:59:40+00:00",
@ -108,8 +114,8 @@
"language_code": "hu"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T11:13:43+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T20:53:13+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "hu"
},
@ -192,14 +198,14 @@
"language_code": "hu"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-26T16:48:26+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T20:58:40+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "hu"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-26T16:47:48+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T20:58:35+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "hu"
},

File diff suppressed because one or more lines are too long

@ -1,75 +1,79 @@
# Adatok meghatározása
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|![ Sketchnote készítette: [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|Adatok meghatározása - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
|Adatok meghatározása - _Sketchnote készítette: [@nitya](https://twitter.com/nitya)_ |
Az adatok tények, információk, megfigyelések és mérések, amelyeket felfedezésekhez és megalapozott döntések támogatásához használnak. Egy adatpont egyetlen adategység egy adathalmazon belül, amely adatpontok gyűjteménye. Az adathalmazok különböző formátumokban és struktúrákban jelenhetnek meg, és általában az adat forrásától függnek, vagyis attól, hogy honnan származnak. Például egy vállalat havi bevételei lehetnek egy táblázatban, míg egy okosóra óránkénti pulzusadatai [JSON](https://stackoverflow.com/a/383699) formátumban lehetnek. Gyakori, hogy adatkutatók különböző típusú adatokkal dolgoznak egy adathalmazon belül.
Az adat tények, információk, megfigyelések és mérések, amelyeket felfedezésekhez és megalapozott döntések támogatásához használnak. Egy adatpont egyetlen adat egység egy adatkészleten belül, amely adatpontok gyűjteménye. Az adatkészletek különböző formátumokban és struktúrákban fordulhatnak elő, és általában az alapján alakulnak, hogy honnan származnak vagy honnan származik az adat. Például egy vállalat havi bevételei egy táblázatban lehetnek, míg egy okosóra által mért óránkénti pulzusadat [JSON](https://stackoverflow.com/a/383699) formátumban lehet. Az adatkutatók gyakran dolgoznak különböző típusú adatokkal egy adatkészleten belül.
Ez a lecke az adatok jellemzői és forrásai alapján történő azonosítására és osztályozására összpontosít.
Ez a lecke az adatok jellemzői és forrásai szerinti azonosítására és osztályozására fókuszál.
## [Előadás előtti kvíz](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Hogyan írjuk le az adatokat
### Nyers adatok
A nyers adatok azok az adatok, amelyek a forrásukból származnak eredeti állapotukban, és amelyeket még nem elemeztek vagy szerveztek meg. Ahhoz, hogy megértsük, mi történik egy adathalmazzal, azt olyan formátumba kell szervezni, amelyet az emberek és az általuk használt technológia is képes értelmezni. Az adathalmaz szerkezete leírja, hogyan van megszervezve, és osztályozható strukturált, strukturálatlan és félig strukturált kategóriákba. Ezek a struktúratípusok a forrástól függően változhatnak, de végül ebbe a három kategóriába sorolhatók.
A nyers adat az, amely a forrásból annak kezdeti állapotában érkezett, és még nem lett elemezve vagy rendezve. Ahhoz, hogy megértsük, mi történik egy adatkészlettel, azt olyanná kell szervezni, amit az emberek és a technológia is érteni tud, amellyel tovább elemezhető. Az adatkészlet szerkezete meghatározza, hogyan van szervezve, és osztályozható strukturált, strukturálatlan és félig strukturált kategóriákba. Ezek a struktúratípusok forrásonként eltérőek lehetnek, de végső soron ezekbe a három kategóriába sorolhatók.
### Kvantitatív adatok
A kvantitatív adatok numerikus megfigyelések egy adathalmazon belül, amelyeket általában elemezni, mérni és matematikailag használni lehet. Néhány példa a kvantitatív adatokra: egy ország népessége, egy személy magassága vagy egy vállalat negyedéves bevételei. További elemzéssel a kvantitatív adatok felhasználhatók például az Air Quality Index (AQI) szezonális trendjeinek felfedezésére vagy a csúcsforgalom valószínűségének becslésére egy tipikus munkanapon.
### Mennyiségi (kvantitatív) adatok
A mennyiségi adat egy adatkészleten belüli numerikus megfigyelés, amely általában elemezhető, mérhető és matematikailag használható. Például egy ország népessége, egy személy magassága vagy egy vállalat negyedéves bevétele. További elemzéssel a mennyiségi adatok segítségével felfedezhetőek az éves légminőségi index (AQI) szezonális trendjei vagy becsülhető a csúcsforgalmi forgalom valószínűsége egy átlagos munkanapon.
### Kvalitatív adatok
A kvalitatív adatok, más néven kategóriális adatok, olyan adatok, amelyeket nem lehet objektíven mérni, mint a kvantitatív adatok megfigyeléseit. Általában különböző formátumú szubjektív adatok, amelyek valaminek a minőségét rögzítik, például egy termék vagy folyamat esetében. Néha a kvalitatív adatok numerikusak, de nem használhatók matematikailag, mint például telefonszámok vagy időbélyegek. Néhány példa a kvalitatív adatokra: videókommentek, egy autó márkája és modellje, vagy a legközelebbi barátok kedvenc színe. A kvalitatív adatok felhasználhatók például annak megértésére, hogy mely termékeket kedvelik leginkább a fogyasztók, vagy népszerű kulcsszavak azonosítására álláspályázatokban.
### Minőségi (kvalitatív) adatok
A minőségi adat, más néven kategóriális adat olyan adat, amely nem mérhető objektíven, mint a mennyiségi adat. Általában különböző szubjektív formátumok, amelyek valami minőségét ragadják meg, például egy termék vagy folyamat minőségét. Néha a minőségi adat numerikus, de nem hagyományosan matematikailag használatos, például telefonszámok vagy időbélyegek. Példák a minőségi adatra: videókommentárok, egy autó márkája és modellje vagy a legjobb barátaid kedvenc színe. A minőségi adatokat felhasználhatjuk annak megértésére, hogy mely termékeket kedvelik leginkább a fogyasztók vagy azonosítani a népszerű kulcsszavakat álláspályázati önéletrajzokban.
### Strukturált adatok
A strukturált adatok olyan adatok, amelyek sorokba és oszlopokba vannak szervezve, ahol minden sor ugyanazt az oszlopkészletet tartalmazza. Az oszlopok egy adott típusú értéket képviselnek, és egy névvel vannak azonosítva, amely leírja, mit képvisel az érték, míg a sorok tartalmazzák a tényleges értékeket. Az oszlopok gyakran meghatározott szabályokat vagy korlátozásokat tartalmaznak az értékekre vonatkozóan, hogy biztosítsák, hogy az értékek pontosan képviseljék az oszlopot. Például képzeljünk el egy ügyfelekről szóló táblázatot, ahol minden sornak tartalmaznia kell egy telefonszámot, és a telefonszámok soha nem tartalmazhatnak betűket. Lehetnek szabályok a telefonszám oszlopra vonatkozóan, hogy az soha ne legyen üres, és csak számokat tartalmazzon.
A strukturált adat sorokba és oszlopokba rendezett adat, ahol minden sor ugyanazt az oszlopkészletet tartalmazza. Az oszlopok egy adott típus értékét képviselik, és egy névvel vannak azonosítva, amely leírja az érték jelentését, míg a sorok az aktuális értékeket tartalmazzák. Az oszlopok általában speciális szabályokkal vagy korlátozásokkal rendelkeznek az értékekre vonatkozóan, hogy biztosítsák, hogy az értékek pontosan tükrözik az oszlopot. Például képzelj el egy ügyfelekről szóló táblázatot, ahol minden sornak rendelkeznie kell telefonszámmal, és a telefonszámok soha nem tartalmaznak betűket. Lehetnek szabályok az adott telefonszám oszlopban, hogy az ne legyen üres és csak számokat tartalmazzon.
A strukturált adatok előnye, hogy olyan módon szervezhetők, hogy más strukturált adatokkal kapcsolatba hozhatók legyenek. Azonban mivel az adatokat egy adott módon kell megszervezni, az általános struktúra megváltoztatása sok erőfeszítést igényelhet. Például, ha egy e-mail oszlopot szeretnénk hozzáadni az ügyfelek táblázatához, amely nem lehet üres, akkor ki kell találnunk, hogyan adjuk hozzá ezeket az értékeket az adathalmaz meglévő ügyfél soraihoz.
A strukturált adat előnye, hogy olyan módon szervezhető, hogy más strukturált adatokkal összekapcsolható legyen. Ugyanakkor, mivel az adat egy adott módon van szervezve, a struktúrájának megváltoztatása sok munkát igényelhet. Például, ha hozzáadunk egy e-mail oszlopot az ügyféltáblázathoz, aminek nem lehet üresnek lennie, akkor ki kell találni, hogyan adjuk hozzá ezen értékeket a meglévő ügyfélsorokhoz az adatkészletben.
Példák strukturált adatokra: táblázatok, relációs adatbázisok, telefonszámok, bankszámlakivonatok
Strukturált adatok példái: táblázatok, relációs adatbázisok, telefonszámok, bankszámlakivonatok
### Strukturálatlan adatok
A strukturálatlan adatok általában nem sorokba vagy oszlopokba kategorizálhatók, és nem tartalmaznak formátumot vagy szabályrendszert, amelyet követni kell. Mivel a strukturálatlan adatoknak kevesebb korlátozása van a struktúrájukra vonatkozóan, könnyebb új információkat hozzáadni, mint egy strukturált adathalmaz esetében. Ha például egy szenzor, amely 2 percenként rögzíti a légnyomás adatokat, frissítést kap, amely lehetővé teszi számára a hőmérséklet mérését és rögzítését, nem szükséges módosítani a meglévő adatokat, ha azok strukturálatlanok. Azonban ez megnehezítheti az ilyen típusú adatok elemzését vagy vizsgálatát. Például egy tudós, aki az előző hónap átlagos hőmérsékletét szeretné megtalálni a szenzor adataiból, felfedezheti, hogy a szenzor néhány adatában "e"-t rögzített, hogy jelezze, hogy meghibásodott, ahelyett, hogy tipikus számot rögzített volna, ami azt jelenti, hogy az adatok hiányosak.
A strukturálatlan adat tipikusan nem sorokba vagy oszlopokba rendezhető, és nem követ formátumot vagy előírt szabályokat. Mivel kevesebb korlátozás van a szerkezetében, könnyebb új információt hozzáadni, mint egy strukturált adatkészlethez képest. Ha például egy szenzor, amely 2 percenként gyűjt adatot a légnyomásról, frissítésként kap egy lehetőséget a hőmérséklet mérésére és rögzítésére is, akkor nem kell módosítani a meglévő adatokat, ha azok strukturálatlanok. Ugyanakkor ez megnehezítheti az adatok elemzését vagy vizsgálatát. Például egy tudós szeretné megtalálni egy hónap átlaghőmérsékletét a szenzoradatokból, de azt találja, hogy a szenzor időnként egy "e" karaktert rögzített a helyett, hogy számadatot jegyezne fel, jelezve, hogy a szenzor meghibásodott, így az adat hiányos.
Példák strukturálatlan adatokra: szövegfájlok, szöveges üzenetek, videófájlok
Strukturálatlan adatok példái: szövegfájlok, szöveges üzenetek, videófájlok
### Félig strukturált adatok
A félig strukturált adatok olyan jellemzőkkel rendelkeznek, amelyek a strukturált és strukturálatlan adatok kombinációjává teszik őket. Általában nem felelnek meg a sorok és oszlopok formátumának, de olyan módon vannak szervezve, amely strukturáltnak tekinthető, és követhetnek egy meghatározott formátumot vagy szabályrendszert. A struktúra a források között változhat, például egy jól definiált hierarchiától valami rugalmasabbig, amely lehetővé teszi az új információk könnyű integrálását. A metaadatok olyan jelzők, amelyek segítenek eldönteni, hogyan van az adat szervezve és tárolva, és különböző nevekkel rendelkeznek az adat típusától függően. Néhány gyakori név a metaadatokra: címkék, elemek, entitások és attribútumok. Például egy tipikus e-mail üzenetnek van tárgya, szövege és címzettjei, és szervezhető az alapján, hogy ki vagy mikor küldte.
A félig strukturált adat olyan jellemzőkkel rendelkezik, amelyek a strukturált és strukturálatlan adat kombinációját alkotják. Nem jellemző rá, hogy sorokból és oszlopokból áll, de olyan módon szervezett, amely strukturáltnak tekinthető, és követhet állandó formát vagy szabálykészletet. A szerkezet forrásonként változó lehet, például egy jól definiált hierarchia vagy egy rugalmasabb, amely lehetővé teszi új információk egyszerű integrálását. A metaadatok olyan mutatók, amelyek segítenek eldönteni, hogyan van az adat szervezve és tárolva, és különböző neveken ismerhetők az adatok típusától függően. Gyakori metaadat elnevezések: címkék (tags), elemek (elements), entitások (entities) és attribútumok (attributes). Például egy tipikus e-mail üzenetnek van tárgya, törzse és címzettjei, és szervezhető azok szerint, hogy ki vagy mikor küldte.
Példák félig strukturált adatokra: HTML, CSV fájlok, JavaScript Object Notation (JSON)
Félig strukturált adatok példái: HTML, CSV fájlok, JavaScript Object Notation (JSON)
## Az adatok forrásai
Az adatforrás az a kezdeti hely, ahol az adat létrejött, vagy ahol "él", és változhat attól függően, hogyan és mikor gyűjtötték. A felhasználók által generált adatok elsődleges adatoknak számítanak, míg a másodlagos adatok olyan forrásból származnak, amely általános használatra gyűjtött adatokat. Például egy esőerdőben megfigyeléseket gyűjtő tudósok csoportja elsődleges adatnak számít, és ha úgy döntenek, hogy megosztják azt más tudósokkal, akkor azok számára másodlagos adatnak minősül.
Az adatforrás az a kezdeti hely, ahol az adat keletkezett vagy ahol "lakik", és az alapján változhat, hogy hogyan és mikor gyűjtötték. A felhasználó(k) által generált adatokat elsődleges adatnak nevezzük, míg a másodlagos adat olyan forrásból származik, amely általános használatra gyűjtött adatokat. Például egy esőerdőben megfigyeléseket gyűjtő tudósok csoportja elsődleges adatnak számít, és ha úgy döntenek, hogy megosztják más tudósokkal, az másodlagos adatnak minősül azon tudósok számára.
Az adatbázisok gyakori források, és egy adatbázis-kezelő rendszerre támaszkodnak az adatok tárolására és karbantartására, ahol a felhasználók lekérdezéseknek nevezett parancsokkal fedezik fel az adatokat. A fájlok adatforrásként lehetnek hang-, kép- és videófájlok, valamint táblázatok, mint például az Excel. Az internetes források gyakori helyek az adatok tárolására, ahol adatbázisok és fájlok is megtalálhatók. Az alkalmazásprogramozási interfészek, más néven API-k lehetővé teszik a programozók számára, hogy adatokat osszanak meg külső felhasználókkal az interneten keresztül, míg a webes adatgyűjtés egy weboldalról nyeri ki az adatokat. A [Working with Data leckék](../../../../../../../../../2-Working-With-Data) arra összpontosítanak, hogyan használjuk a különböző adatforrásokat.
A adatbázisok egy gyakori adatforrás, amelyek adatbázis-kezelő rendszeren keresztül tárolják és kezelik az adatokat, ahol a felhasználók lekérdezéseknek nevezett parancsokkal böngésznek az adatokban. Az adatforrásként szolgáló fájlok lehetnek hang-, kép- és videófájlok, valamint táblázatok, például Excel. Az internetes források is gyakoriak az adatok tárolására, ahol adatbázisokat és fájlokat egyaránt találhatunk. Az alkalmazásprogramozási felületek (API-k) lehetővé teszik a programozók számára, hogy módot teremtsenek az adatok interneten keresztüli külső felhasználóknak történő megosztására, míg a webes adatkinyerés (web scraping) weboldalakról von ki adatokat. A [Working with Data](../../../../../../../../../2-Working-With-Data) leckék arra fókuszálnak, hogyan lehet különböző adatforrásokat használni.
## Összegzés
## Összefoglaló
Ebben a leckében megtanultuk:
- Mi az adat
- Hogyan írjuk le az adatokat
- Hogyan osztályozzuk és kategorizáljuk az adatokat
- Hol találhatók az adatok
- Hol találhatók meg az adatok
## 🚀 Kihívás
## 🚀 Feladat
A Kaggle kiváló forrása a nyílt adathalmazoknak. Használja a [dataset kereső eszközt](https://www.kaggle.com/datasets), hogy találjon néhány érdekes adathalmazt, és osztályozzon 3-5 adathalmazt az alábbi kritériumok szerint:
A Kaggle egy kiváló forrás nyílt adatkészletekre. Használd a [dataset search tool](https://www.kaggle.com/datasets) eszközt, hogy találj néhány érdekes adatkészletet, és osztályozz 3-5 adatkészletet a következő szempontok szerint:
- Az adatok kvantitatívak vagy kvalitatívak?
- Az adatok mennyiségi vagy minőségi jellegűek?
- Az adatok strukturáltak, strukturálatlanok vagy félig strukturáltak?
## [Előadás utáni kvíz](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Áttekintés és önálló tanulás
- Ez a Microsoft Learn egység, amelynek címe [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data), részletesen bemutatja a strukturált, félig strukturált és strukturálatlan adatokat.
- Ez a Microsoft Learn egység, [Identify data formats](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) részletesen bemutatja a strukturált, félig strukturált és strukturálatlan adatokat.
## Feladat
[Adathalmazok osztályozása](assignment.md)
[Datasets osztályozása](assignment.md)
---
**Felelősség kizárása**:
Ez a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével lett lefordítva. Bár törekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az eredeti nyelvén tekintendő hiteles forrásnak. Kritikus információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely a fordítás használatából eredhet.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Jogi nyilatkozat**:
Ez a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével készült. Bár az pontosságra törekszünk, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az anyanyelvén tekintendő hiteles forrásnak. Fontos információk esetén professzionális emberi fordítást javasolunk. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely ebből a fordításból ered.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Bevezetés a valószínűségszámítás és statisztika témakörébe\n",
"Ebben a jegyzetfüzetben néhány korábban megvitatott fogalommal fogunk játszani. A valószínűségszámítás és statisztika sok fogalma jól képviselteti magát a Python adatfeldolgozó nagy könyvtáraiban, mint például a `numpy` és a `pandas`.\n"
"# Bevezetés a valószínűségszámításba és a statisztikába\n",
"Ebben a jegyzetfüzetben játszani fogunk néhány, korábban megbeszélt fogalommal. A valószínűségszámítás és a statisztika számos fogalma jól képviselteti magát a Python nagy adatfeldolgozó könyvtáraiban, mint például a `numpy` és a `pandas`.\n"
]
},
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Véletlen változók és eloszlások\n",
"Kezdjük egy 30 értékből álló minta húzásával egy 0 és 9 közötti egyenletes eloszlásból. Kiszámoljuk a várható értéket és a varianciát is.\n"
"## Véletlen Változók és Eloszlások\n",
"Kezdjük azzal, hogy húzunk egy 30 értékből álló mintát egy 0 és 9 közötti egyenletes eloszlásból. Kiszámoljuk az átlagot és a szórást is.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Annak vizuális becsléséhez, hogy hány különböző érték található a mintában, ábrázolhatjuk a **hisztogramot**:\n"
"A mintában található különböző értékek vizuális becsléséhez megrajzolhatjuk a **hisztogramot**:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## Valós adatok elemzése\n",
"\n",
"Az átlag és a szórás nagyon fontosak a valós adatok elemzésekor. Töltsük be az adatokat baseball-játékosokról a [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) oldalról.\n"
"Az átlag és a szórás nagyon fontosak a valós adatok elemzésekor. Töltsük be az adatokat a baseball játékosokról a [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) oldalról\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Egy olyan csomagot használunk itt, amely a [**Pandas**](https://pandas.pydata.org/) nevet viseli az adatelemzéshez. Ebben a tanfolyamban később még többet fogunk beszélni a Pandas-ról és az adattal való munkáról Pythonban.\n",
"> Itt egy [**Pandas**](https://pandas.pydata.org/) nevű csomagot használunk adatfeldolgozásra. A Pandas-szal és az adatok Pythonban való kezelésével később ebben a tanfolyamban fogunk még foglalkozni.\n",
"\n",
"Számoljuk ki az életkor, magasság és súly átlagértékeit:\n"
"Számoljuk ki az életkor, a magasság és a testsúly átlagértékeit:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Most összpontosítsunk a magasságra, és számoljuk ki a szórást és a varianciát:\n"
"Most összpontosítsunk a magasságra, és számítsuk ki a szórást és az varianciát: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Az átlag mellett érdemes megvizsgálni a mediánt és a kvartiliseket is. Ezeket egy **dobozábra** segítségével lehet megjeleníteni:\n"
"A középértéken kívül érdemes megvizsgálni a medián értéket és a kvartiliseket is. Ezeket **dobozábrával** lehet szemléltetni:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Készíthetünk dobozdiagramokat az adataink részhalmazairól is, például játékosi szerep szerint csoportosítva.\n"
"Adhatunk dobozábrákat az adataink részhalmazairól is, például játékos szerepkör szerint csoportosítva.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Megjegyzés**: Ez az ábra azt sugallja, hogy átlagosan a első bázisznál játszók magassága nagyobb, mint a második bázisnál játszóké. Később megtanuljuk, hogyan tudjuk ezt a hipotézist formálisan tesztelni, és hogyan bizonyíthatjuk, hogy adataink statisztikailag szignifikánsak ennek alátámasztására.\n",
"> **Megjegyzés**: Ez az ábra arra utal, hogy átlagosan az első alapemberek magassága nagyobb, mint a második alapembereké. Később megtanuljuk, hogyan tesztelhetjük ezt a hipotézist formálisabban, és hogyan bizonyíthatjuk, hogy adataink statisztikailag szignifikánsak ennek alátámasztására. \n",
"\n",
"Az életkor, a magasság és a testsúly mind folytonos valószínűségi változók. Ön szerint milyen eloszlásuk van? Egy jó módja, hogy kiderítsük, az, ha megrajzoljuk az értékek hisztogramját:\n"
"Az életkor, a magasság és a súly mind folytonos valószínűségi változók. Szerinted milyen eloszlásuk lehet? Egy jó módszer a kiderítésre, ha megrajzoljuk az értékek hisztogramját: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Normális eloszlás\n",
"## Normál eloszlás\n",
"\n",
"Hozzunk létre egy mesterséges súlymintát, amely normális eloszlást követ, és ugyanazzal az átlaggal és szórással rendelkezik, mint a valós adataink:\n"
"Hozzunk létre egy mesterséges súlymintát, amely normál eloszlást követ, és ugyanazzal az átlaggal és szórással rendelkezik, mint a valós adataink:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mivel a valós életben a legtöbb érték normál eloszlású, nem szabad egyenletes eloszlású véletlenszám-generátort használnunk mintadatok előállításához. Íme, mi történik, ha megpróbálunk súlyokat generálni egyenletes eloszlással (amit a `np.random.rand` generál):\n"
"Mivel a legtöbb érték a valós életben normálisan eloszlott, nem szabad egyenletes eloszlású véletlenszám-generátort használni mintaadatok generálásához. Íme, mi történik, ha megpróbálunk egyenletes eloszlású súlyokat generálni (amit a `np.random.rand` generál): \n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Bizalmi intervallumok\n",
"\n",
"Most számoljuk ki a baseball játékosok súlyára és magasságára vonatkozó bizalmi intervallumokat. A kódot [ebből a stackoverflow beszélgetésből](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) fogjuk használni:\n"
"Most számoljuk ki a bizalmi intervallumokat a baseball játékosok súlyára és magasságára. A kódot [ebből a stackoverflow beszélgetésből](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) fogjuk használni:\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## Hipotézisvizsgálat\n",
"\n",
"Vizsgáljuk meg a különböző szerepköröket a baseball játékosok adatállományában:\n"
"Fedezzük fel a különböző szerepeket a baseball játékosok adatbázisában:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Teszteljük azt a hipotézist, hogy az első bázis játékosok magasabbak, mint a második bázis játékosok. A legegyszerűbb módja ennek a konfidencia intervallumok tesztelése:\n"
"Teszteljük azt a feltevést, hogy az első alapemberek magasabbak, mint a második alapemberek. Ennek legegyszerűbb módja a konfidencia intervallumok vizsgálata:\n"
]
},
{
@ -319,7 +319,7 @@
"source": [
"Láthatjuk, hogy az intervallumok nem fedik át egymást.\n",
"\n",
"A hipotézist statisztikailag helyesebben bizonyítani egy **Student-féle t-próbával** lehet:\n"
"Egy statisztikailag helyesebb módja a hipotézis igazolásának a **Student-féle t-teszt** alkalmazása:\n"
]
},
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"A `ttest_ind` függvény által visszaadott két érték a következő:\n",
"* a p-érték tekinthető annak a valószínűségnek, hogy a két eloszlásnak azonos az átlaga. Esetünkben nagyon alacsony, ami azt jelenti, hogy erős bizonyíték van arra, hogy az első alapemberek magasabbak.\n",
"* a t-érték a normalizált átlagkülönbség köztes értéke, amelyet a t-tesztben használnak, és egy adott megbízhatósági értékhez tartozó küszöbértékkel hasonlítanak össze.\n"
"A `ttest_ind` függvény által visszaadott két érték:\n",
"* a p-érték tekinthető annak a valószínűségnek, hogy két eloszlásnak ugyanakkora az átlaga. Esetünkben ez nagyon alacsony, ami erős bizonyítékot szolgáltat arra, hogy a első alapemberek magasabbak.\n",
"* a t-érték a normalizált átlagkülönbség közbenső értéke, amelyet a t-teszt során használnak, és egy adott megbízhatósági értékhez tartozó küszöbértékkel hasonlítanak össze.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Normális eloszlás szimulálása a központi határeloszlás tételével\n",
"## Normális eloszlás szimulálása a központi határeloszlás tétellel\n",
"\n",
"A Pythonban található pszeudo-véletlenszám generátor egyenletes eloszlást biztosít számunkra. Ha normális eloszlású generátort szeretnénk készíteni, használhatjuk a központi határeloszlás tételét. Egy normális eloszlású értékhez egyszerűen egy egyenletesen generált minta átlagát számoljuk ki.\n"
"A Pythonban található pszeudovéletlen generátor egyenletes eloszlású értékeket ad. Ha normális eloszlású generátort szeretnénk készíteni, használhatjuk a központi határeloszlás tételét. Ahhoz, hogy normális eloszlású értéket kapjunk, egyszerűen kiszámítjuk egy egyenletesen generált minta átlagát.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Korreláció és a Gonosz Baseball Vállalat\n",
"\n",
"A korreláció lehetővé teszi, hogy kapcsolatokat találjunk az adat-sorozatok között. Játékszintű példánkban képzeljük el, hogy létezik egy gonosz baseball vállalat, amely a játékosait a magasságuk szerint fizeti - minél magasabb a játékos, annál több pénzt kap. Tegyük fel, hogy az alapfizetés 1000 dollár, és ehhez jár egy 0-tól 100-ig terjedő bónusz, a magasság függvényében. A valós MLB-játékosokat vesszük alapul, és kiszámoljuk képzeletbeli fizetésüket:\n"
"A korreláció lehetővé teszi, hogy adat sorozatok közötti összefüggéseket találjunk. A mi játék példánkban képzeljük el, hogy van egy gonosz baseball vállalat, amely a játékosait a magasságuk alapján fizeti - minél magasabb a játékos, annál több pénzt kap. Tegyük fel, hogy van egy alapfizetés 1000 dollár, és egy további bónusz 0 és 100 dollár között, a magasságtól függően. A valódi MLB játékosokat vesszük, és kiszámoljuk a képzeletbeli fizetésüket:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Most számoljuk ki ezeknek a sorozatoknak a kovarianciáját és korrelációját. A `np.cov` úgynevezett **kovariancia mátrixot** ad vissza, amely a kovariancia többszörös változóra való kiterjesztése. A kovariancia mátrix $M$ eleme, $M_{ij}$ az $X_i$ és $X_j$ bemeneti változók közötti kovariancia, míg a diagonális értékek, $M_{ii}$, az $X_i$ varianciáját jelentik. Hasonlóan, a `np.corrcoef` a **korrelációs mátrixot** adja vissza.\n"
"Számoljuk most ki ezen sorozatok kovarianciáját és korrelációját. Az `np.cov` egy ún. **kovariancia mátrixot** ad vissza, ami a kovariancia többváltozós kiterjesztése. A kovariancia mátrix $M$ eleme, $M_{ij}$ a bemeneti változók $X_i$ és $X_j$ közötti kovariancia, és a főátlóbeli értékek $M_{ii}$ az $X_{i}$ változó varianciái. Hasonlóképpen, az `np.corrcoef` az **korrelációs mátrixot** adja meg.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"A korreláció értéke 1 azt jelenti, hogy két változó között erős **lineáris kapcsolat** áll fenn. A lineáris kapcsolatot vizuálisan is láthatjuk, ha az egyik értéket a másikhoz ábrázoljuk:\n"
"Az 1-gyel egyenlő korreláció azt jelenti, hogy két változó között erős **lineáris kapcsolat** áll fenn. A lineáris kapcsolat vizuálisan is látható, ha az egyik értéket a másik ellen ábrázoljuk:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Lássuk, mi történik, ha a kapcsolat nem lineáris. Tegyük fel, hogy vállalatunk úgy döntött, elrejti a magasságok és fizetések közötti nyilvánvaló lineáris függőséget, és bevezet némi nemlinearitást a képletbe, például a `sin` függvényt:\n"
"Nézzük meg, mi történik, ha a kapcsolat nem lineáris. Tegyük fel, hogy a vállalatunk úgy döntött, hogy eltakarja a magasságok és fizetések közötti nyilvánvaló lineáris függőséget, és bevezetett némi nemlinearitást a képletbe, például a `sin`-t: \n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ebben az esetben a korreláció kissé kisebb, de még mindig meglehetősen magas. Most, hogy a kapcsolat még kevésbé legyen nyilvánvaló, szeretnénk hozzáadni némi extra véletlenszerűséget úgy, hogy egy véletlenszerű változót adunk a fizetéshez. Nézzük, mi történik:\n"
"Ebben az esetben a korreláció kissé kisebb, de még mindig meglehetősen magas. Most, hogy a kapcsolatot még kevésbé nyilvánvalóvá tegyük, hozzáadhatunk némi extra véletlenszerűséget azzal, hogy egy véletlenszerű változót adunk a fizetéshez. Nézzük meg, mi történik:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Kitalálod, miért rendeződnek a pontok így függőleges vonalakká?\n",
"> Kitalálod, miért állnak sorba a pontok függőleges vonalakba így?\n",
"\n",
"Megfigyeltük a mesterségesen létrehozott fogalom, azaz a fizetés és a megfigyelt változó, a *magasság* közötti összefüggést. Nézzük meg azt is, hogy a két megfigyelt változó, mint például a magasság és a súly, összefügg-e egymással:\n"
"Megfigyeltük az összefüggést egy mesterségesen alkotott fogalom, például a fizetés és a megfigyelt változó, a *magasság* között. Nézzük meg azt is, hogy két megfigyelt változó, például a magasság és a súly, korrelálnak-e egymással:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sajnos nem kaptunk eredményt - csak néhány furcsa `nan` értéket. Ennek oka, hogy a sorozatunk néhány értéke nem definiált, `nan`-ként van ábrázolva, ami az eredmény undefined jellegét is okozza. A mátrixot megnézve láthatjuk, hogy a problémás oszlop a `Weight`, mert a `Height` értékek önkorrelációját számoltuk ki.\n",
"Sajnos nem kaptunk eredményt - csak néhány furcsa `nan` értéket. Ennek az az oka, hogy a sorozatunkban néhány érték nincs definiálva, amit `nan` jelöl, és ez azzal jár, hogy a művelet eredménye is meghatározatlan lesz. A mátrixot szemügyre véve azt láthatjuk, hogy a `Weight` oszlop a problémás, mert a `Height` értékek közötti önkorrelációt számolták ki.\n",
"\n",
"> Ez a példa megmutatja az **adat-előkészítés** és a **tisztítás** fontosságát. Megfelelő adatok nélkül nem tudunk semmit kiszámolni.\n",
"> Ez a példa megmutatja az **adat-előkészítés** és **tisztítás** fontosságát. Megfelelő adatok nélkül nem tudunk semmit sem kiszámítani.\n",
"\n",
"Használjuk a `fillna` metódust a hiányzó értékek pótlására, és számoljuk ki a korrelációt: \n"
"Használjuk a `fillna` metódust a hiányzó értékek kitöltésére, és számoljuk újra a korrelációt: \n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Valóban van összefüggés, de nem olyan erős, mint mesterséges példánkban. Valóban, ha megnézzük az egyik érték a másikkal szembeni szórásdiagramját, a kapcsolat sokkal kevésbé lenne nyilvánvaló:\n"
"Valóban van egy korreláció, de nem olyan erős, mint mesterséges példánkban. Ha megnézzük az egyik érték a másikhoz viszonyított szórásdiagramját, a kapcsolat sokkal kevésbé lenne nyilvánvaló:\n"
]
},
{
@ -535,16 +535,16 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Következtetés\n",
"## Összegzés\n",
"\n",
"Ebben a jegyzetfüzetben megtanultuk, hogyan végezzünk alapműveleteket az adatokon statisztikai függvények kiszámításához. Most már tudjuk, hogyan használjuk a matematika és a statisztika egy megbízható eszköztárát ahhoz, hogy bizonyítsunk egyes hipotéziseket, és hogyan számítsuk ki a megbízhatósági intervallumokat tetszőleges változókra adott adatminta alapján.\n"
"Ebben a jegyzetfüzetben megtanultuk, hogyan hajtsunk végre alapvető műveleteket az adatokon statisztikai függvények kiszámításához. Most már tudjuk, hogyan használjunk egy megalapozott matematikai és statisztikai eszköztárat hipotézisek igazolására, és hogyan számítsunk megbízhatósági intervallumokat tetszőleges változókra egy adott adatmintából. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Tájékoztatás**:\nEzt a dokumentumot az AI fordító szolgáltatás [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével fordítottuk le. Bár a pontosságra törekszünk, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum anyanyelvén tekintendő hiteles forrásnak. Kritikus információk esetén szakmai emberi fordítást javaslunk. Nem vállalunk felelősséget az ebből eredő félreértésekért vagy téves értelmezésekért.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Jogi nyilatkozat**:\nEz a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével készült. Bár az pontosságra törekszünk, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az anyanyelvén tekintendő hiteles forrásnak. Fontos információk esetén professzionális emberi fordítást javasolunk. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely ebből a fordításból ered.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T18:33:18+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "hu"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## Adatok betöltése\n",
"\n",
"A COVID-19-fertőzöttekről szóló adatokat a [Johns Hopkins Egyetem](https://jhu.edu/) [Rendszertudomány és Mérnöki Központja](https://systems.jhu.edu/) (CSSE) biztosítja. Az adatkészlet elérhető [ebben a GitHub-tárházban](https://github.com/CSSEGISandData/COVID-19).\n"
"A COVID-19 fertőzött egyének adatait fogjuk használni, amelyet a [Johns Hopkins Egyetem](https://jhu.edu/) [Rendszertudomány és Műszaki Központja](https://systems.jhu.edu/) (CSSE) biztosít. Az adatkészlet elérhető ezen a [GitHub tárolón](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"A legfrissebb adatokat közvetlenül a GitHubról is betölthetjük a `pd.read_csv` segítségével. Ha valami okból kifolyólag az adat nem elérhető, mindig használhatod a helyileg található másolatot a `data` mappában - csak szüntesd meg az alábbi, a `base_url`-t definiáló sor megjegyzését:\n"
"A legfrissebb adatokat közvetlenül a GitHubról tölthetjük be a `pd.read_csv` segítségével. Ha valamilyen okból az adat nem érhető el, mindig használhatja az `data` mappában elérhető helyi példányt - egyszerűen törölje a megjegyzést az alábbi, a `base_url`-t definiáló sorból:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Láthatjuk, hogy a táblázat minden sora egy adott ország és/vagy tartomány fertőzöttjeinek számát határozza meg, az oszlopok pedig a dátumoknak felelnek meg. Hasonló táblázatok tölthetők be más adatokhoz is, például a gyógyultak vagy az elhunytak számához.\n"
"Láthatjuk, hogy a tábla minden egyes sora az egyes országok és/vagy tartományok fertőzöttjeinek számát határozza meg, az oszlopok pedig a dátumoknak felelnek meg. Hasonló táblázatok tölthetők be más adatokhoz is, például gyógyultak számához vagy halálozások számához.\n"
]
},
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Az adatok értelmezése\n",
"## Adatok értelmezése\n",
"\n",
"A fenti táblázatból a tartomány oszlop szerepe nem egyértelmű. Nézzük meg a `Province/State` oszlopban található különböző értékeket:\n"
"A fenti táblázatból nem világos a megyei oszlop szerepe. Nézzük meg a `Province/State` oszlopban szereplő különböző értékeket:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"A nevek alapján következtethetünk arra, hogy olyan országok, mint Ausztrália és Kína részletesebb bontással rendelkeznek tartományokra vonatkozóan. Nézzük meg a Kínára vonatkozó információkat, hogy lássuk a példát:\n"
"A nevek alapján arra következtethetünk, hogy olyan országok, mint Ausztrália és Kína, részletesebb bontással rendelkeznek tartományokra vonatkozóan. Nézzünk meg egy példát Kínára vonatkozóan:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Az adatok előfeldolgozása\n",
"## Az adatok előfeldolgozása \n",
"\n",
"Nem érdekel minket, hogy a országokat további területekre bontsuk, ezért először el fogjuk távolítani ezt a bontást, és az összes területről származó információt összeadjuk, hogy az egész országra vonatkozó adatokat kapjunk. Ezt a `groupby` használatával lehet megtenni:\n"
"Nem érdekel bennünket az országok további területekre bontása, ezért először megszabadulunk ettől a bontástól, és az információkat az összes területre együtt adjuk meg, hogy az egész országra vonatkozó adatokat kapjunk. Ezt a `groupby` segítségével lehet elvégezni:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Láthatja, hogy a `groupby` használatának köszönhetően az összes DataFrame most az Ország/Régió szerint van indexelve. Ezért egy adott ország adataihoz a `.loc` segítségével férhetünk hozzá:|\n"
"Látható, hogy a `groupby` használata miatt az összes DataFrame most már Ország/Régió szerint van indexelve. Ezért egy adott ország adataihoz a `.loc` használatával férhetünk hozzá:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Megjegyzés** hogy miként használjuk a `[3:]` szintaxist az első három elem eltávolítására egy olyan sorozatból, amely nem dátum típusú metaadatokat tartalmaz (a tartomány/állam és földrajzi hely oszlopokat). Ezeket a három oszlopot teljesen el is távolíthatjuk:\n"
"> **Megjegyzés:** Figyeld meg, hogyan használjuk a `[3:]`-t egy olyan sorozat első három elemének eltávolítására, amely nem dátumjellegű metaadatokat tartalmaz (a tartomány/állam és a földrajzi hely oszlopai). Ezeket a három oszlopot teljesen el is távolíthatjuk:\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## Az adatok vizsgálata\n",
"\n",
"Most térjünk át egy adott ország vizsgálatára. Hozzunk létre egy keretet, amely az időpontok szerint indexelt fertőzési adatokat tartalmazza:\n"
"Most vizsgáljunk meg egy adott országot. Hozzunk létre egy keretet, amely a fertőzések dátum szerinti adatait tartalmazza:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Most számoljuk ki a naponta újonnan fertőzött emberek számát. Ez lehetővé teszi számunkra, hogy lássuk, milyen gyorsan halad a világjárvány. A legegyszerűbb módja ennek a `diff` használata:\n"
"Most számoljuk ki, hány új fertőzött van naponta. Ez lehetővé teszi számunkra, hogy lássuk a járvány terjedésének sebességét. A legegyszerűbb módja ennek a `diff` használata:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Láthatunk nagy ingadozásokat az adatokban. Nézzünk meg közelebbről egy hónapot:\n"
"Nagy ingadozásokat láthatunk az adatokban. Nézzünk meg közelebbről egy hónapot:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Egyértelműen látszik, hogy az adatok heti ingadozásokat mutatnak. Mivel szeretnénk látni a trendeket, érdemes kisimítani a görbét futóátlag számításával (azaz minden napra kiszámítjuk az előző néhány nap átlagértékét):\n"
"Egyértelműen láthatóak heti ingadozások az adatokban. Mivel azt akarjuk, hogy láthatóak legyenek a trendek, érdemes kisimítani a görbét futóátlag számításával (azaz minden napra kiszámítjuk az előző néhány nap átlagértékét):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Annak érdekében, hogy több országot tudjunk összehasonlítani, érdemes lehet figyelembe venni az ország népességét, és a fertőzött egyének arányát az ország népességéhez viszonyítva összehasonlítani. Az ország népességének megszerzéséhez töltsük be az országok adatállományát:\n"
"Ahhoz, hogy több országot össze tudjunk hasonlítani, érdemes lehet figyelembe venni az ország népességét, és az ország népességéhez viszonyított fertőzött egyének százalékos arányát összehasonlítani. Az ország népességének megszerzéséhez töltsük be az országok adatállományát:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mivel ez az adatállomány mind országokra, mind tartományokra vonatkozó információkat tartalmaz, az ország teljes lakosságának megkapásához egy kicsit ügyesebbnek kell lennünk:\n"
"Mivel ez az adathalmaz országokra és tartományokra vonatkozó információkat is tartalmaz, az egész ország népességének megszerzéséhez egy kicsit ügyesebbnek kell lennünk: \n"
]
},
{
@ -2261,15 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## $R_t$ számítása\n",
"\n",
"Annak megállapításához, mennyire fertőző a betegség, megnézzük az **alap reprodukciós számot** $R_0$, amely megmutatja, hogy egy fertőzött személy hány további embert fertőzne meg. Ha $R_0$ nagyobb, mint 1, az járvány valószínűleg terjedni fog.\n",
"## $R_t$ kiszámítása\n",
"\n",
"Az $R_0$ a betegség sajátossága, és nem veszi figyelembe azokat a védelmi intézkedéseket, amelyeket az emberek megtehetnek a járvány lassítása érdekében. A járvány előrehaladása során bármely adott időpontban, $t$-kor becsülhetjük az reprodukciós számot, $R_t$. Bebizonyosodott, hogy ez a szám hozzávetőlegesen becsülhető egy 8 napos ablak alkalmazásával, és a következő képlet segítségével:\n",
"$$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ahol $I_t$ az $t$-edik napi új fertőzöttek száma.\n",
"Annak megállapításához, hogy mennyire fertőző a betegség, megnézzük az **alap reprodukciós számot** $R_0$, amely megmutatja, hogy egy fertőzött személy hány további embert fertőz meg. Amikor $R_0$ nagyobb, mint 1, a járvány valószínűleg terjedni fog.\n",
"\n",
"Számoljuk ki az $R_t$-t a mi járványadataink alapján. Ehhez egy gördülő 8 elemű `ninfected` értékablakot veszünk, és alkalmazzuk a fenti arány kiszámítására szolgáló függvényt:\n"
"$R_0$ maga a betegség tulajdonsága, és nem veszi figyelembe azokat a védőintézkedéseket, amelyeket az emberek a járvány lassítása érdekében tehetnek. A járvány előrehaladása során bármely adott időpontban $t$ becsülhetjük a reprodukciós számot $R_t$. Bebizonyították, hogy ezt a számot hozzávetőlegesen meg lehet becsülni egy 8 napos ablak segítségével, az alábbi képlettel számolva: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ahol $I_t$ az $t$ napján újonnan fertőzött egyének száma.\n",
"\n",
"Számoljuk ki az $R_t$ értékét a járványadataink alapján. Ehhez 8 értékből álló gördülő ablakot veszünk az `ninfected` értékekből, és alkalmazzuk a fenti képletet a hányados kiszámításához:\n"
]
},
{
@ -2299,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Látható, hogy a grafikonon vannak rések. Ezeket vagy `NaN`, vagy az adatállományban előforduló `inf` értékek okozhatják. Az `inf` előfordulhat 0-val való osztás miatt, míg a `NaN` hiányzó adatot jelezhet, vagy azt, hogy nem áll rendelkezésre adat az eredmény kiszámításához (például az adatkeret elején, ahol még nem elérhető a 8 szélességű gördülő ablak). A grafikon esztétikusabbá tétele érdekében ezeket az értékeket a `replace` és `fillna` függvények segítségével ki kell tölteni.\n",
"Látható, hogy vannak hézagok a grafikonon. Ezeket vagy `NaN`, vagy `inf` értékek jelenléte okozhatja az adathalmazban. Az `inf` előfordulhat, ha valamit 0-val osztunk, a `NaN` pedig hiányzó adatot jelezhet, vagy azt, hogy nincs elérhető adat az eredmény kiszámításához (mint a keretünk elején, ahol a szélességű 8-as gördülő ablak még nem elérhető). Ahhoz, hogy esztétikusabb legyen a grafikon, ki kell töltenünk ezeket az értékeket a `replace` és `fillna` függvények használatával.\n",
"\n",
"Nézzük meg továbbá a járvány elejét. Az y-tengely értékeit is korlátozni fogjuk, hogy csak a 6 alatti értékeket mutassa, a jobb áttekinthetőség érdekében, valamint vízszintes vonalat húzunk az 1-es értéknél.\n"
"Nézzük meg közelebbről a világjárvány kezdetét. Korlátozni fogjuk a y-tengely értékeit úgy, hogy csak az 6 alatti értékeket mutassa, hogy jobban látható legyen, és vízszintes vonalat rajzolunk az 1-es értéknél.\n"
]
},
{
@ -2332,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"A járvány másik érdekes mutatója a **derivált**, vagyis az új esetek **napi különbsége**. Ez lehetővé teszi számunkra, hogy egyértelműen lássuk, mikor növekszik vagy csökken a járvány.\n"
"A járvány másik érdekes mutatója a **derivált**, vagyis az új esetek **napi különbsége**. Ez lehetővé teszi, hogy egyértelműen lássuk, mikor növekszik vagy csökken a járvány. \n"
]
},
{
@ -2361,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tekintettel arra, hogy a jelentések miatt sok ingadozás van az adatokban, érdemes a görbét gördülő átlagszámítással kisimítani, hogy átfogó képet kapjunk. Koncentráljunk ismét a pandémia első hónapjaira:\n"
"Tekintettel arra, hogy a jelentésekből adódóan sok az adat-ingadozás, érdemes a görbét elmosni gördülő átlag futtatásával, hogy átfogóbb képet kapjunk. Ismét a járvány első hónapjaira koncentráljunk:\n"
]
},
{
@ -2391,26 +2391,27 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Kihívás\n",
"\n",
"Most itt az ideje, hogy többet játssz a kóddal és az adatokkal! Íme néhány javaslat, amivel kísérletezhetsz:\n",
"Most itt az ideje, hogy még többet játssz a kóddal és az adatokkal! Íme néhány javaslat, amivel kísérletezhetsz:\n",
"* Nézd meg a járvány terjedését különböző országokban.\n",
"* Ábrázold $R_t$ grafikont több országról ugyanazon a grafikonon összehasonlítás céljából, vagy készíts több grafikont egymás mellé.\n",
"* Nézd meg, hogyan korrelál a halálozások és gyógyultak száma a fertőzöttek számával.\n",
"* Próbáld meg kideríteni, mennyi ideig tart egy tipikus betegség azáltal, hogy vizuálisan összeveted a fertőzési és halálozási arányokat, és keresel néhány rendellenességet. Ehhez előfordulhat, hogy különböző országokat kell megnézned.\n",
"* Számold ki a halálozási arányt, és hogyan változik az időben. Érdemes figyelembe venni a betegség hosszát napokban, hogy el lehessen tolni az egyik idősor adatait a számítások előtt.\n"
"* Ábrázolj $R_t$ grafikonokat több országról egy grafikonon az összehasonlításhoz, vagy készíts több grafikont egymás mellé\n",
"* Nézd meg, hogyan korrelál a halálozások és gyógyulások száma a fertőzött esetek számával.\n",
"* Próbáld kideríteni, hogy egy tipikus betegség mennyi ideig tart, vizuálisan korrelálva a fertőzési rátát és a halálozási rátát, illetve keresve néhány anomáliát. Lehet, hogy különböző országokat kell megnézned ehhez.\n",
"* Számold ki a halálozási arányt és hogy az idővel hogyan változik. Érdemes lehet figyelembe venni a betegség időtartamát napokban, hogy az egyik idősorral eltolást végezz a számítások előtt\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Hivatkozások\n",
"## Referenciák\n",
"\n",
"További COVID járvány terjedésével kapcsolatos tanulmányokat megtalálhat az alábbi kiadványokban:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blogbejegyzés [Dmitry Soshnikov](http://soshnikov.com) tollából\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [A fenti tanulmány kódja a GitHubon](https://github.com/shwars/SlidingSIR)\n"
"További COVID-járványterjedési tanulmányokat megtekinthet a következő kiadványokban:\n",
"* [Sliding SIR modell az Rt becslésére a COVID járvány alatt](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blogbejegyzés [Dmitry Soshnikov](http://soshnikov.com) tollából\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Az időben változó reprodukciós szám becslése a globális COVID-19 járvány esetén](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [A fent említett tanulmány kódja a GitHub-on](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2424,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Jogi nyilatkozat**:\nEz a dokumentum az AI fordító szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével készült. Bár igyekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások tartalmazhatnak hibákat vagy pontatlanságokat. Az eredeti dokumentum az anyanyelvén tekintendő hivatalos forrásnak. Fontos információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget a fordítás használatából eredő félreértésekért vagy téves értelmezésekért.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Jogi nyilatkozat**:\nEz a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével készült. Bár az pontosságra törekszünk, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az anyanyelvén tekintendő hiteles forrásnak. Fontos információk esetén professzionális emberi fordítást javasolunk. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely ebből a fordításból ered.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# Veszélyes viszonyok adatvizualizációs projekt
# Dangerous Liaisons adatvizualizációs projekt
A kezdéshez győződj meg róla, hogy az NPM és a Node telepítve van a gépeden. Telepítsd a függőségeket (npm install), majd futtasd a projektet helyben (npm run serve):
A kezdéshez győződj meg róla, hogy a gépeden NPM és Node **>=20.0.0** fut. Telepítsd a függőségeket (npm install), majd futtasd a projektet helyileg (npm run serve):
## Projekt beállítása
```
npm install
```
### Fordítás és automatikus újratöltés fejlesztéshez
### Fejlesztéshez fordítás és forró újratöltés
```
npm run serve
```
### Fordítás és minifikálás éles környezethez
### Gyártásra fordítás és tömörítés
```
npm run build
```
### Fájlok ellenőrzése és javítása
### Fájlok lintelése és javítása
```
npm run lint
```
### Konfiguráció testreszabása
Lásd [Konfigurációs hivatkozás](https://cli.vuejs.org/config/).
Lásd a [Configuration Reference](https://cli.vuejs.org/config/).
---
**Felelősség kizárása**:
Ez a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével lett lefordítva. Bár törekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az eredeti nyelvén tekintendő hiteles forrásnak. Kritikus információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely a fordítás használatából eredhet.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Jogi nyilatkozat**:
Ez a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével készült. Bár az pontosságra törekszünk, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az anyanyelvén tekintendő hiteles forrásnak. Fontos információk esetén professzionális emberi fordítást javasolunk. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely ebből a fordításból ered.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,18 +1,18 @@
# Veszélyes viszonyok adatvizualizációs projekt
# Dangerous Liaisons adatok vizualizációs projekt
A kezdéshez győződj meg róla, hogy az NPM és a Node telepítve van a gépeden. Telepítsd a függőségeket (npm install), majd futtasd a projektet helyben (npm run serve):
A kezdéshez győződj meg róla, hogy a gépeden NPM és Node **>=20.0.0** fut. Telepítsd a függőségeket (npm install), majd futtasd a projektet helyileg (npm run serve):
## Projekt beállítása
```
npm install
```
### Fejlesztéshez fordít és automatikusan újratölt
### Fejlesztéshez fordít és hot-reload-ot végez
```
npm run serve
```
### Produkcióhoz fordít és tömörít
### Termelési célra fordít és minifikál
```
npm run build
```
@ -23,9 +23,11 @@ npm run lint
```
### Konfiguráció testreszabása
Lásd [Konfigurációs hivatkozás](https://cli.vuejs.org/config/).
Lásd a [Configuration Reference](https://cli.vuejs.org/config/).
---
**Felelősség kizárása**:
Ez a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével lett lefordítva. Bár törekszünk a pontosságra, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az eredeti nyelvén tekintendő hiteles forrásnak. Kritikus információk esetén javasolt professzionális emberi fordítást igénybe venni. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely a fordítás használatából eredhet.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Jogi nyilatkozat**:
Ez a dokumentum az AI fordítási szolgáltatás, a [Co-op Translator](https://github.com/Azure/co-op-translator) segítségével készült. Bár az pontosságra törekszünk, kérjük, vegye figyelembe, hogy az automatikus fordítások hibákat vagy pontatlanságokat tartalmazhatnak. Az eredeti dokumentum az anyanyelvén tekintendő hiteles forrásnak. Fontos információk esetén professzionális emberi fordítást javasolunk. Nem vállalunk felelősséget semmilyen félreértésért vagy téves értelmezésért, amely ebből a fordításból ered.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "sw"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T11:10:02+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T20:51:02+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "sw"
},
@ -42,8 +42,8 @@
"language_code": "sw"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T17:19:11+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T20:57:54+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "sw"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "sw"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T20:52:03+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "sw"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-26T14:59:30+00:00",
@ -108,8 +114,8 @@
"language_code": "sw"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T11:11:28+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T20:50:34+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "sw"
},
@ -192,14 +198,14 @@
"language_code": "sw"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-26T16:48:20+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T20:58:01+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "sw"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-26T16:47:41+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T20:57:58+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "sw"
},

File diff suppressed because one or more lines are too long

@ -4,72 +4,76 @@
|:---:|
|Kufafanua Data - _Sketchnote na [@nitya](https://twitter.com/nitya)_ |
Data ni ukweli, taarifa, uchunguzi na vipimo vinavyotumika kufanya ugunduzi na kusaidia maamuzi yenye ufahamu. Kipengele cha data ni kitengo kimoja cha data ndani ya seti ya data, ambayo ni mkusanyiko wa vipengele vya data. Seti za data zinaweza kuwa katika miundo na fomati tofauti, na mara nyingi zitategemea chanzo chake, au mahali data ilipotoka. Kwa mfano, mapato ya kila mwezi ya kampuni yanaweza kuwa kwenye lahajedwali lakini data ya kiwango cha moyo kwa saa kutoka kwa saa ya mkononi inaweza kuwa katika fomati ya [JSON](https://stackoverflow.com/a/383699). Ni kawaida kwa wanasayansi wa data kufanya kazi na aina tofauti za data ndani ya seti ya data.
Data ni ukweli, taarifa, maoni na vipimo vinavyotumika kufanya ugunduzi na kusaidia maamuzi yaliyo na taarifa. Kitu cha data ni kipengele kimoja cha data ndani ya seti ya data, ambayo ni mkusanyiko wa vitu vya data. Seti za data zinaweza kuja katika miundo na muundo tofauti, na kawaida zitategemea chanzo chake, au mahali data ilipotoka. Kwa mfano, mapato ya kila mwezi ya kampuni yanaweza kuwekwa katika karatasi ya kazi lakini data ya kiwango cha moyo kila saa kutoka kwa saa ya mkononi inaweza kuwa katika muundo wa [JSON](https://stackoverflow.com/a/383699). Ni kawaida kwa wataalamu wa data kufanya kazi na aina tofauti za data ndani ya seti ya data.
Somu hili linazingatia kutambua na kuainisha data kulingana na sifa zake na vyanzo vyake.
Somo hili linaangazia kutambua na kuainisha data kwa sifa zake na vyanzo vyake.
## [Maswali ya Awali ya Somu](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Jinsi Data Inavyoelezwa
## [Mtihani wa Kabla ya Somo](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Jinsi Data Inavyofafanuliwa
### Data Ghafi
Data ghafi ni data ambayo imetoka kwenye chanzo chake katika hali yake ya awali na haijachambuliwa au kupangwa. Ili kuelewa kinachotokea kwenye seti ya data, inahitaji kupangwa katika fomati inayoweza kueleweka na binadamu pamoja na teknolojia wanayoweza kutumia kuichambua zaidi. Muundo wa seti ya data unaelezea jinsi ilivyopangwa na inaweza kuainishwa kama iliyopangwa, isiyopangwa, na nusu iliyopangwa. Aina hizi za muundo zitabadilika, kulingana na chanzo lakini hatimaye zitaingia katika makundi haya matatu.
### Data Mbichi
Data mbichi ni data iliyotoka kwenye chanzo chake katika hali yake ya awali na bado haijachambuliwa au kupanga. Ili kuelewa kinachotokea na seti ya data, inahitaji kupangwa katika muundo ambao unaweza kueleweka na wanadamu pamoja na teknolojia wanayotumia kuchambua zaidi. Muundo wa seti ya data unaeleza jinsi ilivyopangwa na unaweza kuainishwa kuwa muundo uliopangwa, usiopangwa na nusu uliopangwa. Aina hizi za muundo zitabadilika kulingana na chanzo lakini hatimaye zitajumuishwa katika makundi haya matatu.
### Data ya Kiasi
Data ya kiasi ni uchunguzi wa nambari ndani ya seti ya data na mara nyingi inaweza kuchambuliwa, kupimwa, na kutumika kihisabati. Baadhi ya mifano ya data ya kiasi ni: idadi ya watu wa nchi, urefu wa mtu, au mapato ya kila robo ya kampuni. Kwa uchambuzi wa ziada, data ya kiasi inaweza kutumika kugundua mwenendo wa msimu wa Kielezo cha Ubora wa Hewa (AQI) au kukadiria uwezekano wa msongamano wa magari wakati wa saa za kazi za kawaida.
Data ya kiasi ni maoni ya nambari ndani ya seti ya data na kwa kawaida inaweza kuchambuliwa, kupimwa na kutumika kihisabati. Mifano ya data ya kiasi ni kama: idadi ya watu wa nchi, urefu wa mtu au mapato ya robo mwaka ya kampuni. Kwa uchambuzi zaidi, data ya kiasi inaweza kutumika kugundua mwelekeo wa msimu wa Kielelezo cha Ubora wa Hewa (AQI) au kukadiria uwezekano wa msongamano wa magari wakati wa saa za msongamano siku ya kazi kawaida.
### Data ya Ubora
Data ya ubora, inayojulikana pia kama data ya kategoria, ni data ambayo haiwezi kupimwa kwa njia ya malengo kama uchunguzi wa data ya kiasi. Kwa ujumla ni fomati mbalimbali za data ya maoni inayorekodi ubora wa kitu, kama bidhaa au mchakato. Wakati mwingine, data ya ubora ni ya nambari lakini haitatumika kihisabati, kama namba za simu au mihuri ya muda. Baadhi ya mifano ya data ya ubora ni: maoni ya video, chapa na modeli ya gari, au rangi unayopenda zaidi ya rafiki yako wa karibu. Data ya ubora inaweza kutumika kuelewa ni bidhaa zipi watumiaji wanapenda zaidi au kutambua maneno maarufu katika wasifu wa maombi ya kazi.
### Data ya Sifa
Data ya sifa, pia inayojulikana kama data ya aina, ni data ambayo haiwezi kupimwa kwa njia za kisayansi kama maoni ya data ya kiasi. Kwa ujumla ni aina mbalimbali za data za hisia zinazoelezea ubora wa kitu, kama bidhaa au mchakato. Wakati mwingine, data ya sifa ni nambari lakini kwa kawaida haitumiwi kihisabati, kama namba za simu au muda wa kumbukumbu. Mifano ya data ya sifa ni kama: maoni ya video, chapa na mfano wa gari au rangi pendwa ya rafiki yako wa karibu. Data ya sifa inaweza kutumika kuelewa bidhaa gani wateja wanazopenda zaidi au kutambua maneno maarufu katika wasifu wa maombi ya kazi.
### Data Iliyopangwa
Data iliyopangwa ni data ambayo imepangwa katika safu na nguzo, ambapo kila safu itakuwa na seti sawa ya nguzo. Nguzo zinawakilisha thamani ya aina fulani na zitatambuliwa kwa jina linaloelezea kile thamani inawakilisha, wakati safu zina thamani halisi. Nguzo mara nyingi zitakuwa na seti maalum ya sheria au vizuizi juu ya thamani, ili kuhakikisha kuwa thamani zinawakilisha nguzo kwa usahihi. Kwa mfano, fikiria lahajedwali la wateja ambapo kila safu lazima iwe na namba ya simu na namba za simu hazina herufi za alfabeti. Kunaweza kuwa na sheria zilizowekwa kwenye nguzo ya namba ya simu kuhakikisha kuwa haijawahi kuwa tupu na ina namba pekee.
### Data Iliyo Pangiliwa
Data iliyopangiliwa ni data iliyopangwa katika safu na nguzo, ambapo kila safu itakuwa na seti sawa ya nguzo. Nguzo zinaonesha thamani ya aina fulani na zitabainishwa na jina linaloelezea thamani hiyo, wakati safu zina maadili halisi. Nguzo mara nyingi huwa na sheria au vikwazo maalum juu ya thamani, ili kuhakikisha maadili yanawakilisha nguzo hiyo kwa usahihi. Kwa mfano fikiria karatasi ya wateja ambapo kila safu lazima iwe na namba ya simu na namba za simu hazijumuishi herufi. Kunaweza kuwa na sheria zinazotumika kwenye nguzo ya namba za simu kuhakikisha haitajiwi na inajumuisha nambari tu.
Faida ya data iliyopangwa ni kwamba inaweza kupangwa kwa njia ambayo inaweza kuhusiana na data nyingine iliyopangwa. Hata hivyo, kwa sababu data imeundwa kupangwa kwa njia maalum, kufanya mabadiliko kwenye muundo wake wa jumla kunaweza kuchukua juhudi nyingi. Kwa mfano, kuongeza nguzo ya barua pepe kwenye lahajedwali la wateja ambayo haiwezi kuwa tupu inamaanisha utahitaji kufikiria jinsi ya kuongeza thamani hizi kwenye safu zilizopo za wateja katika seti ya data.
Faida ya data iliyopangiliwa ni kwamba inaweza kupangwa kwa njia inayoweza kuhusishwa na data mingine iliyopangiliwa. Hata hivyo, kwa kuwa data imeundwa kuandaliwa katika njia maalum, kufanya mabadiliko ya jumla kwenye muundo wake kunaweza kuhitaji juhudi nyingi. Kwa mfano, kuongeza safu ya barua pepe kwenye karatasi ya wateja ambayo haipaswi kuwa tupu inamaanisha utahitaji kubaini jinsi ya kuongeza maadili haya kwenye safu zilizopo za wateja katika seti ya data.
Mifano ya data iliyopangwa: lahajedwali, hifadhidata za uhusiano, namba za simu, taarifa za benki.
Mifano ya data iliyopangiliwa: karatasi za kazi, hifadhidata za mahusiano, namba za simu, taarifa za benki
### Data Isiyopangwa
Data isiyopangwa kwa kawaida haiwezi kuainishwa katika safu au nguzo na haina fomati au seti ya sheria za kufuata. Kwa sababu data isiyopangwa ina vizuizi vichache juu ya muundo wake, ni rahisi kuongeza taarifa mpya ikilinganishwa na seti ya data iliyopangwa. Ikiwa sensa inayorekodi data ya shinikizo la anga kila dakika 2 imepokea sasisho ambalo sasa linaweza kupima na kurekodi joto, haitahitaji kubadilisha data iliyopo ikiwa ni isiyopangwa. Hata hivyo, hii inaweza kufanya uchambuzi au uchunguzi wa aina hii ya data kuchukua muda mrefu. Kwa mfano, mwanasayansi anayetaka kupata wastani wa joto la mwezi uliopita kutoka kwa data ya sensa, lakini anakuta sensa ilirekodi "e" katika baadhi ya data yake ili kuonyesha kuwa ilikuwa imeharibika badala ya namba ya kawaida, ambayo inamaanisha data haijakamilika.
### Data Isiyopangiliwa
Data isiyopangiliwa kwa kawaida haiwezi kuwekwa katika safu au nguzo na haina muundo au seti ya sheria za kufuata. Kwa kuwa data isiyopangiliwa haina vikwazo vingi juu ya muundo wake, ni rahisi kuongeza taarifa mpya ikilinganishwa na seti ya data iliyopangiliwa. Ikiwa kifaa kinachokusanya data ya shinikizo la anga kila baada ya dakika 2 kimepokea sasisho kinachoruhusu kupima na kurekodi joto, hakitaji kubadilisha data iliyopo ikiwa ni isiyo pangiliwa. Hata hivyo, hii inaweza kufanya uchambuzi au uchunguzi wa aina hii ya data kuchukua muda mrefu zaidi. Kwa mfano, mtaalamu wa sayansi anayetaka kupata wastani wa joto la mwezi uliopita kutoka kwa data za kifaa cha sensa, lakini anagundua kuwa sensa ilirekodi "e" kwenye baadhi ya data kuonyesha kwamba ilikuwa imevunjika badala ya nambari ya kawaida, inamaanisha data haikamiliki.
Mifano ya data isiyopangwa: faili za maandishi, ujumbe wa maandishi, faili za video.
Mifano ya data isiyopangiliwa: faili za maandishi, ujumbe wa maandishi, faili za video
### Data Nusu Iliyopangwa
Data nusu iliyopangwa ina sifa zinazofanya iwe mchanganyiko wa data iliyopangwa na isiyopangwa. Kwa kawaida haifuati fomati ya safu na nguzo lakini imepangwa kwa njia inayochukuliwa kuwa imepangwa na inaweza kufuata fomati maalum au seti ya sheria. Muundo utatofautiana kati ya vyanzo, kama vile uhierakia iliyoelezwa vizuri hadi kitu kilicho rahisi zaidi kinachoruhusu ujumuishaji rahisi wa taarifa mpya. Metadata ni viashiria vinavyosaidia kuamua jinsi data imepangwa na kuhifadhiwa na itakuwa na majina mbalimbali, kulingana na aina ya data. Baadhi ya majina ya kawaida ya metadata ni lebo, vipengele, vyombo, na sifa. Kwa mfano, ujumbe wa barua pepe wa kawaida utakuwa na mada, mwili, na seti ya wapokeaji na unaweza kupangwa kulingana na nani au lini ulitumwa.
### Nusu-imepangiliwa
Data nusu-imepangiliwa ina sifa zinazofanya iwe mchanganyiko wa data iliyopangiliwa na isiyopangiliwa. Kwa kawaida hailingani na muundo wa safu na nguzo lakini imepangwa kwa njia inayochukuliwa kuwa imepangwa na inaweza kufuata muundo thabiti au seti ya sheria. Muundo utabadilika kati ya vyanzo, kama daraja lililopangwa vizuri hadi kitu kinachobadilika kirahisi kinachoruhusu ushirikiano rahisi wa habari mpya. Metadata ni viashiria vinavyosaidia kuamua jinsi data ilivyo pangiliwa na kuhifadhiwa na vitakuwa na majina mbalimbali, kulingana na aina ya data. Baadhi ya majina yanayojulikana kwa metadata ni alama, vipengele, taasisi na sifa. Kwa mfano, ujumbe wa barua pepe wa kawaida utakuwa na mada, mwili na orodha ya wapokeaji na unaweza kupangwa kulingana na nani au lini ulitumwa.
Mifano ya data nusu iliyopangwa: HTML, faili za CSV, JavaScript Object Notation (JSON).
Mifano ya data nusu-imepangiliwa: HTML, faili za CSV, JavaScript Object Notation (JSON)
## Vyanzo vya Data
## Vyanzo vya Data
Chanzo cha data ni eneo la awali ambapo data ilizalishwa, au mahali inapokaa na itatofautiana kulingana na jinsi na lini ilikusanywa. Data inayozalishwa na mtumiaji wake inajulikana kama data ya msingi wakati data ya sekondari inatoka kwa chanzo ambacho kimekusanya data kwa matumizi ya jumla. Kwa mfano, kundi la wanasayansi wanaokusanya uchunguzi katika msitu wa mvua lingechukuliwa kuwa la msingi na ikiwa wataamua kushiriki na wanasayansi wengine lingechukuliwa kuwa la sekondari kwa wale wanaolitumia.
Chanzo cha data ni mahali pa awali ambapo data ilizalishwa, au mahali inapo "ishi" na kitabadilika kulingana na jinsi na lini ilikusanywa. Data inayozalishwa na mtumiaji wake inajulikana kama data ya msingi wakati data ya sekondari hutoka kwenye chanzo ambacho kimekusanya data kwa matumizi ya jumla. Kwa mfano, kundi la wataalamu wanaokusanya maoni porini lingechukuliwa kuwa data ya msingi na ikiwa wataamua kuishiriki na wataalamu wengine ingechukuliwa sekondari kwa wale wanaoitumia.
Hifadhidata ni chanzo cha kawaida na hutegemea mfumo wa usimamizi wa hifadhidata kuhifadhi na kudumisha data ambapo watumiaji hutumia amri zinazoitwa maswali kuchunguza data. Faili kama vyanzo vya data vinaweza kuwa faili za sauti, picha, na video pamoja na lahajedwali kama Excel. Vyanzo vya mtandao ni eneo la kawaida la kuhifadhi data, ambapo hifadhidata pamoja na faili zinaweza kupatikana. Programu za kiolesura cha programu, zinazojulikana pia kama APIs, huruhusu waandaaji programu kuunda njia za kushiriki data na watumiaji wa nje kupitia mtandao, wakati mchakato wa kuchota data kutoka kwa ukurasa wa wavuti unaitwa web scraping. [Masomo katika Kufanya Kazi na Data](../../../../../../../../../2-Working-With-Data) yanazingatia jinsi ya kutumia vyanzo mbalimbali vya data.
Hifadhidata ni chanzo maarufu na hutegemea mfumo wa usimamizi wa hifadhidata kuhifadhi na kudumisha data ambapo watumiaji hutumia amri zinazojulikana kama queries kuchunguza data. Faili kama vyanzo vya data vinaweza kuwa faili za sauti, picha, na video pamoja na karatasi za kazi kama Excel. Vyanzo vya mtandao ni mahali pa kawaida pa kuhifadhi data, ambapo hifadhidata pamoja na faili zinaweza kupatikana. Interfaces za programu za maombi, pia zinajulikana kama APIs huruhusu waprogramu kuunda njia za kushiriki data na watumiaji wa nje kupitia mtandao, wakati mchakato wa kuvuta data kutoka kwenye ukurasa wa mtandao unachukua data kutoka kwenye ukurasa wa wavuti. [Mafunzo katika Kufanya kazi na Data](../../../../../../../../../2-Working-With-Data) yanazingatia jinsi ya kutumia vyanzo mbalimbali vya data.
## Hitimisho
Katika somu hili tumejifunza:
Katika somo hili tumefahamu:
- Data ni nini
- Jinsi data inavyoelezwa
- Jinsi data inavyoainishwa na kuorodheshwa
- Mahali data inaweza kupatikana
- Jinsi data inavyoainishwa na kuainishwa
- Mahali pa kupata data
## 🚀 Changamoto
Kaggle ni chanzo bora cha seti za data za wazi. Tumia [zana ya kutafuta seti za data](https://www.kaggle.com/datasets) kupata seti za data za kuvutia na uainishe seti 3-5 za data kwa vigezo hivi:
Kaggle ni chanzo bora cha seti za data za wazi. Tumia [chombo cha kutafuta seti za data](https://www.kaggle.com/datasets) kupata seti za data za kuvutia na ainisha seti 3-5 kwa vigezo hivi:
- Je, data ni ya kiasi au ya ubora?
- Je, data ni iliyopangwa, isiyopangwa, au nusu iliyopangwa?
- Je data ni ya kiasi au ya sifa?
- Je data ni iliyopangiliwa, isiyopangiliwa, au nusu-imepangiliwa?
## [Maswali ya Baada ya Somu](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## [Mtihani baada ya somo](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Mapitio na Kujisomea
- Kitengo hiki cha Microsoft Learn, kinachoitwa [Ainisha Data Yako](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) kina maelezo ya kina kuhusu data iliyopangwa, nusu iliyopangwa, na isiyopangwa.
## Kazi
## Muhtasari na Kujifunza Binafsi
[Ainisha Seti za Data](assignment.md)
- Kitengo hiki cha Microsoft Learn, kilichoitwa [Kutambua muundo wa data](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) kina maelezo ya kina kuhusu data iliyopangiliwa, nusu-imepangiliwa, na isiyopangiliwa.
## Kazi ya Nyumbani
[Kuainisha Seti za Data](assignment.md)
---
**Kanusho**:
Hati hii imetafsiriwa kwa kutumia huduma ya kutafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kuhakikisha usahihi, tafadhali fahamu kuwa tafsiri za kiotomatiki zinaweza kuwa na makosa au kutokuwa sahihi. Hati ya asili katika lugha yake ya awali inapaswa kuzingatiwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu ya binadamu inapendekezwa. Hatutawajibika kwa kutoelewana au tafsiri zisizo sahihi zinazotokana na matumizi ya tafsiri hii.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Kionyozo**:
Hati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kupata usahihi, tafadhali fahamu kwamba tafsiri za kiotomatiki zinaweza kuwa na makosa au upungufu wa usahihi. Hati ya asili katika lugha yake halisi inapaswa kuchukuliwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu inayofanywa na binadamu inapendekezwa. Hatutojibu kwa kuelewa vibaya au tafsiri potofu zinazotokea kutokana na matumizi ya tafsiri hii.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {},
"source": [
"# Utangulizi wa Uwezekano na Takwimu\n",
"Katika daftari hili, tutacheza na baadhi ya dhana tulizozijadili awali. Dhana nyingi kutoka kwa uwezekano na takwimu zipo kwa uwakilishi mzuri katika maktaba kuu za usindikaji data katika Python, kama `numpy` na `pandas`.\n"
"Katika daftari hili, tutaendelea kucheza na baadhi ya dhana ambazo tumewahi kujadili hapo awali. Dhana nyingi kutoka kwenye uwezekano na takwimu zipo vizuri katika maktaba kuu za usindikaji data katika Python, kama vile `numpy` na `pandas`.\n"
]
},
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Vigezo vya Nasibu na Mgawanyo\n",
"Tuanze kwa kuchora sampuli ya thamani 30 kutoka kwenye mgawanyo wa usawa kutoka 0 hadi 9. Pia tutahesabu wastani na utofauti.\n"
"## Vigezo Nasibu na Msimamo\n",
"Tuanze kwa kuchora sampuli ya thamani 30 kutoka msaongamano usio na upendeleo kutoka 0 hadi 9. Pia tutahesabu wastani na utofauti.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ili kutathmini kitaalamu ni thamani ngapi tofauti zipo katika sampuli, tunaweza kuchora **histogramu**:\n"
"Ili kukisia kwa kuona ni thamani ngapi tofauti zipo kwenye sampuli, tunaweza kuchora **histogramu**:\n"
]
},
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Kuchambua Takwimu Halisi\n",
"## Kuchambua Data Halisi\n",
"\n",
"Wastani na utofauti ni muhimu sana wakati wa kuchambua data za dunia halisi. Hebu tupakue data kuhusu wachezaji wa baseball kutoka [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Wastani na utofauti ni muhimu sana wakati wa kuchambua data halisi ya dunia. Wacha tupakie data kuhusu wachezaji wa baseball kutoka [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -80,7 +80,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Tunatumia kifurushi kinachoitwa [**Pandas**](https://pandas.pydata.org/) hapa kwa uchambuzi wa data. Tutazungumzia zaidi kuhusu Pandas na kazi na data katika Python baadaye katika kozi hii.\n",
"> Tunatumia kifurushi kinachoitwa [**Pandas**](https://pandas.pydata.org/) hapa kwa uchambuzi wa data. Tutazungumzia zaidi kuhusu Pandas na kazi na data katika Python baadaye kwenye kozi hii.\n",
"\n",
"Hebu tukokotoe wastani wa umri, urefu na uzito:\n"
]
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sasa tutilie maanani urefu, na kuhesabu utofauti wa kawaida na utofauti wa mwelekeo:\n"
"Sasa hebu tuzingatie urefu, na tukokotoe tofauti ya kawaida na mabadiliko: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mbali na wastani, ni maana pia kuangalia thamani ya kati na robo. Hizi zinaweza kuonyeshwa kwa kutumia **box plot**:\n"
"Mbali na wastani, ni busara kuangalia thamani ya kati na robo. Hizi zinaweza kuonyeshwa kwa kutumia **chati ya sanduku**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tunaweza pia kutengeneza michoro ya sanduku ya vijumuiko vya seti yetu ya data, kwa mfano, imegawanywa kwa nafasi ya mchezaji.\n"
"Pia tunaweza kutengeneza michoro ya sanduku ya sehemu ndogo za seti yetu ya data, kwa mfano, zilizounganishwa kwa nafasi ya mchezaji.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Kumbuka**: Mchoro huu unaonyesha, kuwa kwa wastani, urefu wa wachezaji wa msingi wa kwanza ni mrefu zaidi kuliko urefu wa wachezaji wa msingi wa pili. Baadaye tutajifunza jinsi tunavyoweza kupima nadharia hii kwa njia rasmi zaidi, na jinsi ya kuonyesha kwamba data yetu ina umuhimu wa takwimu kuonyesha hivyo.\n",
"> **Kumbusho**: Mchoro huu unaonyesha, kwa wastani, urefu wa wanachama wa msingi wa kwanza ni mrefu kuliko urefu wa wanachama wa msingi wa pili. Baadaye tutajifunza jinsi ya kujaribu nadharia hii kwa njia rasmi zaidi, na jinsi ya kuonyesha kuwa data yetu ni ya takwimu muhimu kuonyesha hilo. \n",
"\n",
"Umri, urefu na uzito ni vigezo vyote vya nasibu vinavyendelea. Unaonaje mgawanyo wake? Njia nzuri ya kugundua ni kuchora histogramu ya thamani:\n"
"Umri, urefu na uzito vyote ni vigezo vya mabadiliko endelevu. Unaonaje usambazaji wao? Njia nzuri ya kugundua ni kuchora histogramu ya thamani: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Mgawanyo wa Kawaida\n",
"## Usambazaji wa Kawaida\n",
"\n",
"Tuvumbue sampuli bandia ya uzito inayofuata mgawanyo wa kawaida na wastani na utofauti sawa na data yetu halisi:\n"
"Tufanye sampuli bandia ya uzito ambayo inafuata usambazaji wa kawaida yenye wastani na utofauti sawa na data yetu halisi:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kwa kuwa thamani nyingi katika maisha halisi husambazwa kawaida, hatupaswi kutumia kizalishaji cha namba za bahati nasibu zenye usambazaji wa sawa kutengeneza data za sampuli. Hapa ni kile kinachotokea ikiwa tutajaribu kuzalisha uzito kwa usambazaji wa sawa (ulizalishwa na `np.random.rand`):\n"
"Kwa kuwa thamani nyingi katika maisha halisi husambazwa kawaida, hatupaswi kutumia jenereta ya nambari nasibu ya usambazaji wa sawa kuunda sampuli za data. Hapa ndipo panapotokea ikiwa tuta jaribu kuzalisha uzito kwa usambazaji wa sawa (ulizalishwa na `np.random.rand`):\n"
]
},
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Intervalli za Kuwa na Hakika\n",
"## Vipindi vya Kuaminika\n",
"\n",
"Sasa hebu tukokotoe intervalli za kuwa na hakika kwa uzito na urefu wa wachezaji baseball. Tutatumia msimbo [kutoka kwenye mjadala huu wa stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Sasa hebu tukokotoe vipindi vya kuaminika kwa uzito na urefu wa wachezaji wa baseball. Tutatumia msimbo [kutoka kwenye mjadala huu wa stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -280,9 +280,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Upimaji wa Nadharia\n",
"## Kupima Nadharia\n",
"\n",
"Hebu chunguza majukumu tofauti katika seti yetu ya data ya wachezaji wa baseball:\n"
"Hebu tuchunguze nyadhifa tofauti katika dataset yetu ya wachezaji wa baseball:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Hebu tuchunguze dhana kwamba Wachezaji wa Msingi wa Kwanza ni warefu zaidi kuliko Wachezaji wa Msingi wa Pili. Njia rahisi kabisa ya kufanya hivyo ni kupima tofauti za kujiamini:\n"
"Hebu jaribu dhana kwamba First Basemen ni walio ndefu zaidi kuliko Second Basemen. Njia rahisi ya kufanya hivyo ni kupima vipindi vya kuaminika:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tunaweza kuona kuwa vipindi havivuki.\n",
"Tunaweza kuona kwamba vipindi havivukani.\n",
"\n",
"Njia ya takwimu sahihi zaidi ya kuthibitisha nadharia ni kutumia **Mtihani wa Student t**:\n"
"Njia ya takwimu sahihi zaidi ya kuthibitisha nadharia ni kutumia **mtihani wa t wa Mwanafunzi**:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"Thamani mbili zinazorejeshwa na kazi ya `ttest_ind` ni:\n",
"* thamani ya p inaweza kuchukuliwa kuwa uwezekano wa mgawanyo miwili kuwa na wastani mmoja. Katika kesi yetu, ni ndogo sana, ikimaanisha kwamba kuna ushahidi thabiti unaoonyesha kuwa wachezaji wa kwanza wa msingi ni warefu zaidi.\n",
"* thamani ya t ni thamani ya wastani wa tofauti iliyosanifiwa inayotumiwa katika jaribio la t, na inalinganishwa na thamani ya kikomo kwa thamani fulani ya kuaminika.\n"
"* thamani ya p inaweza kuzingatiwa kama uwezekano wa mgawanyo miwili kuwa na wastani sawa. Katika kesi yetu, ni chini sana, ikimaanisha kuwa kuna ushahidi thabiti unaounga mkono kwamba wachezaji wa kwanza wa msingi ni warefu zaidi.\n",
"* thamani ya t ni thamani ya wastani wa tofauti iliyosawazishwa inayotumika katika mtihani wa t, na inalinganishwa na thamani ya kikomo kwa thamani fulani ya kujiamini.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Kuiga Usambazaji wa Kawaida kwa Kanuni ya Mipaka ya Kati\n",
"## Kuiga Usambazaji wa Kawaida kwa Kutumia Theoremu ya Kiwango Kati\n",
"\n",
"Kizalishaji cha nasibu kinachotumiwa katika Python kimeundwa kutupatia usambazaji wa usawa. Ikiwa tunataka kuunda kizalishaji cha usambazaji wa kawaida, tunaweza kutumia kanuni ya mipaka ya kati. Ili kupata thamani iliyosambazwa kwa kawaida, tutahesabu tu wastani wa sampuli iliyozalishwa kwa usambazaji wa usawa.\n"
"Kizalishaji kip pseudo-random katika Python kimeundwa kutupatia usambazaji wa kawaida. Ikiwa tunataka kuunda kizalishaji kwa usambazaji wa kawaida, tunaweza kutumia theoremu ya kiwango kati. Kupata thamani iliyosambazwa kawaida tutahesabu tu wastani wa sampuli iliyozalishwa kwa usambazaji wa kawaida.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Uhusiano na Evil Baseball Corp\n",
"\n",
"Uhusiano unaturuhusu kupata uhusiano kati ya mfululizo wa data. Katika mfano wetu wa toy, nduguudhare kuwa kuna kampuni ya mpira wa kikapu ya uovu ambayo hualipa wachezaji wake kulingana na urefu wao - mchezaji mrefu zaidi, ndivyo anavyopata pesa nyingi zaidi. Fikiria kuwa kuna mshahara wa msingi wa $1000, na bonasi ya ziada kutoka $0 hadi $100, kulingana na urefu. Tutachukua wachezaji halisi kutoka MLB, na kuhesabu mishahara yao ya kufikirika:\n"
"Uhusiano unaturuhusu kupata uhusiano kati ya mfululizo wa data. Katika mfano wetu mdogo, tuseme kuna kampuni ya baseball ya uovu ambayo inalipa wachezaji wake kulingana na urefu wao - mchezaji mrefu zaidi, ndiye anayepata pesa zaidi. Tuseme kuna mshahara wa msingi wa $1000, na bonasi ya ziada kutoka $0 hadi $100, kulingana na urefu. Tutachukua wachezaji halisi kutoka MLB, na kuhesabu mishahara yao ya kufikirika:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sasa hebu tuhesabu kovarians na uhusiano wa mfuatano huo. `np.cov` itatupa kile kinachoitwa **matrix ya kovarians**, ambayo ni upanuzi wa kovarians kwa vigezo vingi. Kipengele $M_{ij}$ cha matrix ya kovarians $M$ ni uhusiano kati ya vigezo vya ingizo $X_i$ na $X_j$, na thamani za mwinuko $M_{ii}$ ni variansi ya $X_{i}$. Vivyo hivyo, `np.corrcoef` itatupa **matrix ya uhusiano**.\n"
"Hebu sasa tuhifadhi kovarians na uhusiano wa mfululizo huo. `np.cov` itatupa kile kinachoitwa **matriisi ya kovarians**, ambayo ni upanuzi wa kovarians kwa vigezo vingi. Kipengele $M_{ij}$ cha matriisi ya kovarians $M$ ni uhusiano kati ya vigezo vya ingizo $X_i$ na $X_j$, na thamani za duara $M_{ii}$ ni varianza ya $X_{i}$. Vivyo hivyo, `np.corrcoef` itatupa **matriisi ya uhusiano**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Uhusiano sawa na 1 unamaanisha kwamba kuna **uhusiano wa mstari** imara kati ya vigezo viwili. Tunaweza kuiona kwa macho uhusiano wa mstari kwa kuchora thamani moja dhidi ya nyingine:\n"
"Uwiano sawa na 1 una maana kwamba kuna **uhusiano wa mstari** mkali kati ya vigezo viwili. Tunaweza kuona uhusiano wa mstari kwa kuona kwa macho tutakazoonyesha thamani moja dhidi ya nyingine:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tuchunguze ni nini kitakachotokea ikiwa uhusiano sio wa mstari. Tuseme kampuni yetu iliamua kuficha utegemezi wa mstari wazi kati ya urefu na mishahara, na kuanzisha aina ya isiyo ya mstari katika fomula, kama vile `sin`:\n"
"Tuchunguze kinachotokea ikiwa uhusiano si wa mstari moja kwa moja. Fikiria kwamba kampuni yetu iliamua kuficha utegemezi ulio wazi wa mstari moja kwa moja kati ya urefu na mishahara, na kuingiza isiyo ya mstari katika fomula, kama `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Katika kesi hii, uhusiano ni kidogo zaidi, lakini bado uko juu sana. Sasa, ili kufanya uhusiano usiwe wazi sana, tunaweza kutaka kuongeza mzunguko wa ziada kwa kuongeza kigezo chochote kisichotarajiwa kwenye mshahara. Tujaribu kuona kinachotokea:\n"
"Katika kesi hii, uhusiano ni mdogo kidogo, lakini bado ni mkubwa sana. Sasa, ili kufanya uhusiano huo usionekane wazi zaidi, tungependa kuongeza bahati kidogo kwa kuongeza kigezo chochote kisichojulikana katika mshahara. Tuchunguze kinachotokea:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Je, unaweza kubahatisha kwa nini nukta zinaungana kwenye mistari wima kama hii?\n",
"> Je, unaweza kubahatisha kwanini pointi zinaelea kuwa katika mistari wima hivi?\n",
"\n",
"Tumegundua uhusiano kati ya dhana iliyoundwa kiutengo kama mshahara na kipimo kinachoangaliwa *refu*. Tuwe pia tuone kama vipimo viwili vinavyoonekana, kama vilerefu na uzito, vina uhusiano pia:\n"
"Tumegundua uhusiano kati ya dhana iliyoundwa kwa bandia kama mshahara na kigezo kilichoangaliwa *urefu*. Acha pia tuone kama vigezo viwili vilivyoangaliwa, kama urefu na uzito, vina uhusiano pia:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kwa bahati mbaya, hatukupata matokeo yoyote - tu baadhi ya thamani za ajabu za `nan`. Hii ni kwa sababu baadhi ya thamani katika mfululizo wetu hazijafafanuliwa, zinazoonyeshwa kama `nan`, ambayo husababisha matokeo ya operesheni pia yasifafanuliwe. Kwa kuangalia matriki tunaweza kuona kuwa `Weight` ndiye safu inayosumbua, kwa sababu uhusiano wa ndani kati ya thamani za `Height` umekuwa umehesabiwa.\n",
"Kwa bahati mbaya, hatukuwa na matokeo yoyote - tu baadhi ya maadili ya ajabu `nan`. Hii ni kutokana na ukweli kwamba baadhi ya maadili katika mfululizo wetu hayajabainishwa, yanayowakilishwa kama `nan`, ambayo husababisha matokeo ya operesheni pia yasibainishwe. Kwa kuangalia matriki tunaweza kuona kwamba `Weight` ni safu yenye tatizo, kwa sababu uhusiano wa mwenyewe kati ya maadili ya `Height` umehesabiwa.\n",
"\n",
"> Mfano huu unaonyesha umuhimu wa **kuandaa data** na **kusafisha**. Bila data sahihi hata chembechembe haiwezi kuhesabiwa.\n",
"> Mfano huu unaonyesha umuhimu wa **utayarishaji wa data** na **kusafisha**. Bila data sahihi hatuwezi kuhesabu kitu chochote.\n",
"\n",
"Tuchukue njia ya `fillna` kujaza thamani zilizokosekana, na kuhesabu uhusiano:\n"
"Tuchague kutumia njia ya `fillna` kujaza maadili yaliyokosekana, na kuhesabu uhusiano:\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Kuna uhusiano kweli, lakini si ule wenye nguvu kama katika mfano wetu wa bandia. Hakika, tukitazama mchoro wa makusanyo wa thamani moja dhidi ya nyingine, uhusiano huo usingeonekana kwa urahisi sana:\n"
"Kweli kuna uhusiano, lakini si wa nguvu kama katika mfano wetu wa bandia. Kweli, tukitazama mchoro wa viwilikisho wa thamani moja dhidi ya nyingine, uhusiano ungeonekana kidogo zaidi:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Hitimisho\n",
"\n",
"Katika daftari hili tumejifunza jinsi ya kufanya shughuli za msingi kwenye data ili kuhesabu kazi za takwimu. Sasa tunajua jinsi ya kutumia vifaa vyenye sauti vya hisabati na takwimu ili kuthibitisha baadhi ya nadharia, na jinsi ya kuhesabu viwango vya kujiamini kwa vigezo mbalimbali ikitolewa sampuli ya data.\n"
"Katika daftari hili tumekuwa tukijifunza jinsi ya kufanya operesheni za msingi kwenye data ili kuhesabu kazi za takwimu. Sasa tunajua jinsi ya kutumia kifaa imara cha hisabati na takwimu ili kuthibitisha nadharia fulani, na jinsi ya kuhesabu vipindi vya kujiamini kwa vigezo vya nasibu kutokana na sampuli ya data. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Kiondoa Hukumu**:\nNyaraka hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kuhakikisha usahihi, tafadhali fahamu kwamba tafsiri za moja kwa moja zinaweza kuwa na makosa au upungufu wa usahihi. Nyaraka asilia katika lugha yake ya asili inapaswa kuzingatiwa kama chanzo cha uhakika. Kwa taarifa muhimu, tafsiri ya kitaalamu ya binadamu inashauriwa. Hatubeba dhamana kwa kutoelewana au tafsiri potofu zozote zitakazotokea kutokana na matumizi ya tafsiri hii.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Kionyozo**:\nHati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kupata usahihi, tafadhali fahamu kwamba tafsiri za kiotomatiki zinaweza kuwa na makosa au upungufu wa usahihi. Hati ya asili katika lugha yake halisi inapaswa kuchukuliwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu inayofanywa na binadamu inapendekezwa. Hatutojibu kwa kuelewa vibaya au tafsiri potofu zinazotokea kutokana na matumizi ya tafsiri hii.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T18:32:06+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "sw"
}
},
"nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Makisio ya Janga la COVID-19\n",
"# Makadirio ya Janga la COVID-19\n",
"\n",
"## Kupakia Data\n",
"\n",
"Tutatumia data ya watu waliopata maambukizi ya COVID-19, inayotolewa na [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) katika [Johns Hopkins University](https://jhu.edu/). Dataset inapatikana katika [hifadhidata hii ya GitHub](https://github.com/CSSEGISandData/COVID-19).\n"
"Tutatumia data kuhusu watu waliopatwa na COVID-19, iliyotolewa na [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) katika [Chuo Kikuu cha Johns Hopkins](https://jhu.edu/). Dataset inapatikana katika [Hifadhidata hii ya GitHub](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tunaweza kupakua data za hivi karibuni moja kwa moja kutoka GitHub tukitumia `pd.read_csv`. Ikiwa kwa sababu fulani data hazipatikani, unaweza kila wakati kutumia nakala iliyopo kiasili katika folda ya `data` - ondoa tu alama ya maoni kwenye mstari huu hapa chini unaoelezea `base_url`:\n"
"Tunaweza kupakia data za hivi karibuni moja kwa moja kutoka GitHub kwa kutumia `pd.read_csv`. Ikiwa kwa sababu fulani data haipatikani, unaweza daima kutumia nakala inayopatikana mahali hapa lokalini katika folda ya `data` - fungua tu mstari hapo chini unaoelezea `base_url`:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sasa hebu tupakue data ya watu walioambukizwa na tuelewe jinsi data inavyoonekana:\n"
"Sasa hebu tuingize data ya watu walioambukizwa na tuone data inaonekana vipi:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tunaweza kuona kwamba kila safu ya jedwali linaelezea idadi ya watu walioathirika kwa kila nchi na/au mkoa, na nguzo zinahusiana na tarehe. Jedwali kama hilo linaweza kupakiwa kwa data nyingine, kama vile idadi ya waliopona na idadi ya vifo.\n"
"Tunaweza kuona kuwa kila safu ya jedwali inabainisha idadi ya watu walioathirika kwa kila nchi na/au mkoa, na safu zinahusiana na tarehe. Jedwali kama hilo linaweza kupakiwa kwa data nyingine, kama vile idadi ya waliopona na idadi ya vifo.\n"
]
},
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Kufanya Mwelekeo wa Takwimu\n",
"## Kufanya Kieleweke cha Takwimu\n",
"\n",
"Kutoka kwenye jedwali lililoko juu, jukumu la safu ya mkoa halijaeleweka wazi. Tuchunguze maadili tofauti yaliyopo kwenye safu ya `Province/State`:\n"
"Kutoka kwenye jedwali lililopo juu, nafasi ya safu ya mkoa haijaeleweka vizuri. Hebu tazame thamani tofauti zilizopo katika safu ya `Mkoa/Serikali ya Mitaa`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kutoka kwa majina tunaweza kubaini kuwa nchi kama Australia na China zina mgawanyiko wa kina zaidi kwa mikoa. Tuweke tutaangalia taarifa za China kuona mfano:\n"
"Kutoka kwa majina tunaweza kubaini kwamba nchi kama Australia na China zina mgawanyo wa kina zaidi kwa mikoa. Tuitekee taarifa kuhusu China tuone mfano:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Kusindika Data awali\n",
"## Kuyasindika Data Mwanzoni \n",
"\n",
"Hatutaki kugawanya nchi kwa maeneo madogo zaidi, kwa hivyo kwanza tutatupa mgawanyo huu na kuongeza taarifa kwa maeneo yote pamoja, ili kupata taarifa kwa nchi nzima. Hii inaweza kufanywa kwa kutumia `groupby`:\n"
"Hatujisikii kuvunja nchi hadi mikoa ndogo zaidi, hivyo tutaanza kuondoa uainishaji huu na kuongeza taarifa za mikoa yote pamoja, ili kupata taarifa za nchi nzima. Hii inaweza kufanyika kwa kutumia `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Unaweza kuona kwamba kutokana na kutumia `groupby`, DataFrames zote sasa zimetambulishwa kwa Country/Region. Kwa hivyo tunaweza kupata data kwa nchi fulani kwa kutumia `.loc`:|\n"
"Unaweza kuona kwamba kutokana na kutumia `groupby` DataFrames zote sasa zinafikiwa kwa Country/Region. Hivyo tunaweza kupata data kwa nchi fulani kwa kutumia `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Kumbuka** jinsi tunavyotumia `[3:]` kuondoa vipengele vitatu vya mwanzo vya mfuatano vinavyoonyesha metadata isiyo ya tarehe (nguzo za Jimbo/Mkoa na jiografia). Pia tunaweza kuondoa nguzo hizo tatu kabisa:\n"
"> **Kumbuka** jinsi tunavyotumia `[3:]` kuondoa vipengele vitatu vya kwanza vya mfululizo vinavyozidi tarehe (mikoa/Maeneo na safu za jiografia). Pia tunaweza kuondoa safu hizo tatu kabisa:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Kuchunguza Takwimu\n",
"## Kichunguzi cha Data\n",
"\n",
"Sasa hebu tubadilishe kuwa tunachunguza nchi maalum. Hebu tengeneza fremu inayoshikilia data kuhusu maambukizi yaliyoainishwa kwa tarehe:\n"
"Sasa wacha tubadilishe kwa kuchunguza nchi fulani. Tufanye fremu inayo kuwa na data za maambukizi zilizoainishwa kwa tarehe:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sasa hebu tuhitishe idadi ya watu wapya walioambukizwa kila siku. Hii itaturuhusu kuona kasi ambayo janga la magonjwa linaendelea. Njia rahisi zaidi ya kufanya hivi ni kutumia `diff`:\n"
"Sasa hebu tukokotoe idadi ya watu wapya walioambukizwa kila siku. Hii itatuwezesha kuona kasi ambayo janga hili linaendelea. Njia rahisi zaidi ya kufanya hivyo ni kutumia `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tunaweza kuona mabadiliko makubwa katika data. Tuchunguze kwa karibu mwezi mmoja:\n"
"Tunaweza kuona mabadiliko makubwa katika data. Tuchukulie kwa makini mwezi mmoja kati ya hayo:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Inaonekana wazi kuwa kuna mabadiliko ya wiki katika data. Kwa sababu tunataka kuwa na uwezo wa kuona mwenendo, ina mantiki lainisha mkao kwa kuhesabu wastani unaoendelea (yaani kwa kila siku tutahesabu wastani wa siku kadhaa zilizopita):\n"
"Inaonekana wazi kwamba kuna mabadiliko ya kila wiki katika data. Kwa sababu tunataka kuwa na uwezo wa kuona mwenendo, ni busara lainisha mstatili kwa kuhesabu wastani unaoendelea (yaani kwa kila siku tutahesabu thamani ya wastani ya siku kadhaa zilizopita):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ili kuwaze kulinganisha nchi kadhaa, tungependa kuzingatia idadi ya watu wa nchi, na kulinganisha asilimia ya watu walioambukizwa kwa kuhusiana na idadi ya watu wa nchi hiyo. Ili kupata idadi ya watu wa nchi, hebu tupakue seti ya data za nchi:\n"
"Ili tuweze kulinganisha nchi kadhaa, tungependa kuzingatia idadi ya watu wa nchi hiyo, na kulinganisha asilimia ya watu walioambukizwa ikilinganishwa na idadi ya watu wa nchi hiyo. Ili kupata idadi ya watu wa nchi, hebu tupakue dataset ya nchi:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kwa sababu seti hii ya data ina habari kuhusu nchi zote na mikoa, kupata idadi ya watu wa nchi nzima tunahitaji kuwa na ujanja kidogo:\n"
"Kwa sababu seti ya data hii inajumuisha habari kuhusu nchi na mikoa, kupata idadi ya watu wa nchi nzima tunahitaji kuwa werevu kidogo: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Kuhesabu $R_t$\n",
"\n",
"Ili kuona jinsi ugonjwa unavyoenea, tunatazama **idadi ya msingi ya uzalishaji** $R_0$, ambayo inaonyesha idadi ya watu ambaye mtu aliyeambukizwa atawaambukiza zaidi. Wakati $R_0$ ni zaidi ya 1, uwezekano wa mlipuko kuenea ni mkubwa.\n",
"Ili kuona jinsi ugonjwa unavyoenea, tunatazama **idadi ya uzalishaji wa kimsingi** $R_0$, ambayo inaonyesha idadi ya watu ambao mtu mwenye maambukizi angewaambukiza zaidi. Wakati $R_0$ ni zaidi ya 1, uwezekano wa mlipuko kuenea ni mkubwa.\n",
"\n",
"$R_0$ ni sifa ya ugonjwa hiyo yenyewe, na haizingatii baadhi ya hatua za ulinzi ambazo watu wanaweza kuchukua kupunguza kasi ya janga la ugonjwa. Wakati wa maendeleo ya janga la ugonjwa, tunaweza kukadiria idadi ya uzalishaji $R_t$ kwa wakati wowote $t$. Imethibitishwa kuwa nambari hii inaweza kukadiriwa kwa kiasi kwa kuchukua dirisha la siku 8, na kuhesabu $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ambapo $I_t$ ni idadi ya watu ambao wametambuliwa kuwa na maambukizi mapya siku ya $t$.\n",
"$R_0$ ni mali ya ugonjwa wenyewe, na haizingatii baadhi ya hatua za kinga ambazo watu wanaweza kuchukua kupunguza kasi ya janga. Wakati wa maendeleo ya janga, tunaweza kukadiria idadi ya uzalishaji $R_t$ kwa wakati wowote $t$. Imekuwa wazi kuwa idadi hii inaweza kukadiriwa kwa jumla kwa kuchukua dirisha la siku 8, na kuhesabu $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ambapo $I_t$ ni idadi ya watu waliopata maambukizi mapya siku ya $t$.\n",
"\n",
"Hebu tuheshabu $R_t$ kwa data yetu ya janga la ugonjwa. Kufanya hivyo, tutachukua dirisha linalozunguka la thamani 8 za `ninfected`, na kutumia kazi hiyo kuhesabu uwiano ulio hapo juu:\n"
"Hebu tuheshabu $R_t$ kwa data ya janga letu. Ili kufanya hivi, tutachukua dirisha linaloendelea la thamani 8 za `ninfected`, na tumia kazi hiyo kuhesabu uwiano uliotajwa hapo juu:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Unaweza kuona kwamba kuna mapengo katika grafu. Hayo yanaweza kusababishwa na `NaN`, au ikiwa thamani za `inf` zipo katika seti ya data. `inf` inaweza kusababishwa na kugawanya kwa 0, na `NaN` inaweza kuonyesha data haipo, au hakuna data inayopatikana ya kuhesabu matokeo (kama mwanzoni kabisa wa fremu yetu, ambapo dirisha la kusogeza lenye upana wa 8 bado halipatikani). Ili kufanya grafu iwe nzuri zaidi, tunahitaji kujaza thamani hizo kwa kutumia kazi za `replace` na `fillna`.\n",
"Unaweza kuona kuwa kuna mapengo katika mchoro. Hayo yanaweza kusababishwa na `NaN`, au kama kuna thamani za `inf` zilizopo kwenye dataset. `inf` inaweza kusababishwa na kugawanya kwa 0, na `NaN` inaweza kuashiria data iliyokosekana, au hakuna data inayopatikana kuhesabu matokeo (kama vile mwanzoni kabisa wa fremu yetu, ambapo dirisha linalozunguka lenye upana wa 8 bado halipatikani). Kufanya mchoro kuwa mzuri zaidi, tunahitaji kujaza thamani hizo kwa kutumia njia ya `replace` na `fillna`.\n",
"\n",
"Tutaangalia zaidi mwanzoni mwa janga la virusi. Pia tutaweka kikomo kwa thamani za mhimili wa y kuonyesha tu thamani zilizo chini ya 6, ili kuona vyema zaidi, na kuchora mstari wa wima kwenye 1.\n"
"Tuwekeze zaidi mwanzoni mwa janga la mlipuko. Pia tutapunguza thamani za mhimili wa y kuonyesha thamani zilizo chini ya 6 tu, ili kuona vizuri zaidi, na kuchora mstari wima kwenye 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kinadharia kingine cha kuvutia cha janga ni **derivative**, au **tofauti ya kila siku** katika kesi mpya. Hutatupatia kufanya kuona wazi wakati janga linaongezeka au kupungua.\n"
"Kielezi kingine cha kuvutia cha janga ni **derivative**, au **tofauti ya kila siku** katika visa vipya. Inaturuhusu kuona kwa uwazi wakati janga linapoongezeka au kupungua. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kwa kuzingatia ukweli kwamba kuna mabadiliko mengi katika data yanayosababishwa na utoaji taarifa, ni busara lainisha mkao kwa kuendesha wastani unaotiririka ili kupata picha ya jumla. Rudia tena kuzingatia miezi ya mwanzo ya janga hilo:\n"
"Kwa kuzingatia kwamba kuna mabadiliko mengi katika data yanayosababishwa na utoaji ripoti, ni muhimu lainisha mwelekeo kwa kutumia wastani unaopita ili kupata picha jumla. Tuchukue tena mwezi wa mwanzo wa janga hilo: \n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Changamoto\n",
"\n",
"Sasa ni wakati wako kucheza zaidi na msimbo na data! Hapa kuna mapendekezo machache unaweza kujaribu:\n",
"* Tazama ugonjwa wa janga hili unaenea vipi katika nchi tofauti.\n",
"* Choragraphia grafu za $R_t$ kwa nchi kadhaa kwenye grafu moja kwa kulinganisha, au tengeneza grafu kadhaa kando-kando\n",
"* Angalia jinsi idadi ya vifo na uponyaji inavyohusiana na idadi ya visa vilivyoambukizwa.\n",
"* Jaribu kugundua ni muda gani ugonjwa wa kawaida hudumu kwa kuonyesha kwa macho kiwango cha maambukizi na kiwango cha vifo na kutafuta dosari fulani. Huenda utahitaji kuangalia nchi tofauti ili kufahamu hilo.\n",
"* Hesabu kiwango cha vifo na jinsi kinavyobadilika kwa wakati. Huenda ukataka kuzingatia urefu wa ugonjwa kwa siku ili kuhamisha mfululizo mmoja wa wakati kabla ya kufanya mahesabu.\n"
"Sasa ni wakati wako kucheza zaidi na msimbo na data! Hapa kuna mapendekezo machache unayoweza kujaribu:\n",
"* Tazama usambazaji wa janga katika nchi mbalimbali.\n",
"* Choragrafia michoro ya $R_t$ kwa nchi kadhaa kwenye mchoro mmoja kwa ajili ya kulinganisha, au tengeneza michoro kadhaa kando kwa kando\n",
"* Tazama jinsi idadi ya vifo na afya inavyohusiana na idadi ya maambukizo.\n",
"* Jaribu kugundua muda wa kawaida wa ugonjwa kwa kulinganisha kwa kuona ni kasi gani ya maambukizo na kiwango cha vifo na kutafuta kasoro fulani. Huenda ukahitaji kuangalia nchi tofauti ili kugundua hilo.\n",
"* Hesabu kiwango cha vifo na jinsi kinavyobadilika kwa muda. Huenda ukataka kuzingatia muda wa ugonjwa kwa siku ili kusogeza mfululizo mmoja wa wakati kabla ya kufanya mahesabu\n"
]
},
{
@ -2406,9 +2408,9 @@
"source": [
"## Marejeleo\n",
"\n",
"Unaweza kuangalia masomo zaidi ya kuenea kwa mlipuko wa COVID katika machapisho yafuatayo:\n",
"* [Mfumo wa Sliding SIR kwa Makadirio ya Rt wakati wa Janga la COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), chapisho la blogu la [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Makadirio ya Nambari ya Uzazi Inayobadilika kwa Muda kwa Mlipuko wa COVID-19 Duniani](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"Unaweza kutazama tafiti zaidi za maambukizi ya janga la COVID katika machapisho yafuatayo:\n",
"* [Mfano wa Sliding SIR kwa Makadirio ya Rt wakati wa Janga la COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), chapisho la blogu kutoka kwa [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Makadirio ya Nambari ya Uzazi Inayobadilika kwa Wakati kwa Ugonjwa wa COVID-19 Duniani](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Msimbo wa karatasi hapo juu kwenye GitHub](https://github.com/shwars/SlidingSIR)\n"
]
},
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Tangazo la Kukataa**:\nHati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kwa usahihi, tafadhali fahamu kuwa tafsiri za kiotomatiki zinaweza kuwa na makosa au hitsilafu. Hati ya asili kwa lugha yake ya mama inapaswa kuchukuliwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu inayofanywa na mtu inashauriwa. Hatutawajibika kwa kutoelewana au tafsiri zisizo sahihi zinazotokana na matumizi ya tafsiri hii.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Kionyozo**:\nHati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kupata usahihi, tafadhali fahamu kwamba tafsiri za kiotomatiki zinaweza kuwa na makosa au upungufu wa usahihi. Hati ya asili katika lugha yake halisi inapaswa kuchukuliwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu inayofanywa na binadamu inapendekezwa. Hatutojibu kwa kuelewa vibaya au tafsiri potofu zinazotokea kutokana na matumizi ya tafsiri hii.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# Mradi wa taswira ya data ya Dangerous Liaisons
# Mradi wa uonyesho wa data wa Dangerous Liaisons
Ili kuanza, hakikisha kuwa una NPM na Node zinazoendesha kwenye kompyuta yako. Sakinisha utegemezi (npm install) kisha endesha mradi huo kwa ndani (npm run serve):
Ili kuanza, unahitaji kuhakikisha kuwa una NPM na Node **>=20.0.0** vikifanye kazi kwenye mashine yako. Sakinisha utegemezi (npm install) kisha endesha mradi kwa ndani ya mashine (npm run serve):
## Usanidi wa mradi
## Usanidi wa Mradi
```
npm install
```
### Inasimbua na kupakia upya kwa maendeleo
### Hukusanya na kuendeleza kwa maendeleo
```
npm run serve
```
### Inasimbua na kupunguza kwa uzalishaji
### Hukusanya na kupunguza kwa uzalishaji
```
npm run build
```
### Inakagua na kurekebisha faili
### Hukagua na kurekebisha faili
```
npm run lint
```
### Kubinafsisha usanidi
### Binafsisha usanidi
Tazama [Marejeleo ya Usanidi](https://cli.vuejs.org/config/).
---
**Kanusho**:
Hati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kwa usahihi, tafadhali fahamu kuwa tafsiri za kiotomatiki zinaweza kuwa na makosa au kutokuwa sahihi. Hati asili katika lugha yake ya awali inapaswa kuzingatiwa kama chanzo cha mamlaka. Kwa taarifa muhimu, inashauriwa kutumia huduma ya tafsiri ya kibinadamu ya kitaalamu. Hatutawajibika kwa kutoelewana au tafsiri zisizo sahihi zinazotokana na matumizi ya tafsiri hii.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Kionyozo**:
Hati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kupata usahihi, tafadhali fahamu kwamba tafsiri za kiotomatiki zinaweza kuwa na makosa au upungufu wa usahihi. Hati ya asili katika lugha yake halisi inapaswa kuchukuliwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu inayofanywa na binadamu inapendekezwa. Hatutojibu kwa kuelewa vibaya au tafsiri potofu zinazotokea kutokana na matumizi ya tafsiri hii.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# Mradi wa taswira ya data ya Dangerous Liaisons
# Mradi wa uakisi data wa Dangerous Liaisons
Ili kuanza, unahitaji kuhakikisha kuwa NPM na Node zinafanya kazi kwenye kompyuta yako. Sakinisha utegemezi (npm install) kisha endesha mradi huu kwa ndani (npm run serve):
Ili kuanza, unahitaji kuhakikisha kwamba una NPM na Node **>=20.0.0** zikiendesha kwenye mashine yako. Sakinisha utegemezi (npm install) kisha endesha mradi ndani ya eneo lako (npm run serve):
## Usanidi wa mradi
```
npm install
```
### Hukusanya na kupakia upya kwa maendeleo
### Hukuakusanya na kupasha moto kwa ajili ya maendeleo
```
npm run serve
```
### Hukusanya na kupunguza kwa uzalishaji
### Hukuakusanya na kupunguza kwa ajili ya uzalishaji
```
npm run build
```
### Hukagua na kurekebisha faili
### Hufanya ukaguzi wa msimbo na kurekebisha faili
```
npm run lint
```
### Rekebisha usanidi
Tazama [Marejeleo ya Usanidi](https://cli.vuejs.org/config/).
Tazama [Configuration Reference](https://cli.vuejs.org/config/).
---
**Kanusho**:
Hati hii imetafsiriwa kwa kutumia huduma ya kutafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kuhakikisha usahihi, tafadhali fahamu kuwa tafsiri za kiotomatiki zinaweza kuwa na makosa au kutokuwa sahihi. Hati ya asili katika lugha yake ya awali inapaswa kuzingatiwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu ya binadamu inapendekezwa. Hatutawajibika kwa kutoelewana au tafsiri zisizo sahihi zinazotokana na matumizi ya tafsiri hii.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Kionyozo**:
Hati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI [Co-op Translator](https://github.com/Azure/co-op-translator). Ingawa tunajitahidi kupata usahihi, tafadhali fahamu kwamba tafsiri za kiotomatiki zinaweza kuwa na makosa au upungufu wa usahihi. Hati ya asili katika lugha yake halisi inapaswa kuchukuliwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya kitaalamu inayofanywa na binadamu inapendekezwa. Hatutojibu kwa kuelewa vibaya au tafsiri potofu zinazotokea kutokana na matumizi ya tafsiri hii.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save