[ta,et,pcm] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Tamil [ta], Estonian [et], Nigerian Pidgin [pcm]
update-translations
localizeflow[bot] 7 days ago
parent fc062c0410
commit edbe59f9a8

@ -12,8 +12,8 @@
"language_code": "et"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T10:27:52+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T22:30:42+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "et"
},
@ -42,8 +42,8 @@
"language_code": "et"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-10-11T15:35:12+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T22:35:02+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "et"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "et"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T22:31:46+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "et"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-10-11T15:32:32+00:00",
@ -108,8 +114,8 @@
"language_code": "et"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T10:29:11+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T22:30:11+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "et"
},
@ -192,14 +198,14 @@
"language_code": "et"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-10-11T15:57:08+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:35:10+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "et"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-10-11T15:57:19+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:35:06+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "et"
},

File diff suppressed because one or more lines are too long

@ -1,47 +1,47 @@
# Andmete määratlemine
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|![ Sketchnote autorilt [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|Andmete määratlemine - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
|Andmete määratlemine - _Sketchnote autorilt [@nitya](https://twitter.com/nitya)_ |
Andmed on faktid, teave, tähelepanekud ja mõõtmised, mida kasutatakse avastuste tegemiseks ja teadlike otsuste toetamiseks. Andmepunkt on üksik andmeühik andmekogumis, mis on andmepunktide kogum. Andmekogumid võivad olla erinevates vormingutes ja struktuurides ning tavaliselt põhinevad need nende allikal ehk kust andmed pärinevad. Näiteks ettevõtte igakuine tulu võib olla arvutustabelis, kuid nutikella tunnipõhine pulsisageduse andmestik võib olla [JSON](https://stackoverflow.com/a/383699) vormingus. On tavaline, et andmeteadlased töötavad andmekogumis erinevat tüüpi andmetega.
Andmed on faktid, info, tähelepanekud ja mõõtmised, mida kasutatakse avastuste tegemiseks ja teadlike otsuste toetamiseks. Andmepunkt on üks andmühiku indiviid andmekogumis, mis on andmepunktide kogum. Andmekogud võivad olla erinevates formaatides ja struktuurides ning tavaliselt põhinevad nende allikal ehk koht, kust andmed pärinevad. Näiteks ettevõtte igakuine tulu võib olla tabelarvutusfailis, kuid nutikella tunnipõhine südamelöögisageduse andmestik võib olla [JSON](https://stackoverflow.com/a/383699) formaadis. On tavaline, et andmeteadlased töötavad andmekogumis erinevat tüüpi andmetega.
See õppetund keskendub andmete tuvastamisele ja klassifitseerimisele nende omaduste ja allikate järgi.
See õppetund keskendub andmete tuvastamisele ja klassifitseerimisele nende omaduste ja allikate alusel.
## [Eelloengu viktoriin](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## [Eelkolleegiumi viktoriin](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Kuidas andmeid kirjeldatakse
### Toorandmed
Toorandmed on andmed, mis pärinevad nende allikast algses olekus ja mida pole analüüsitud ega organiseeritud. Selleks, et mõista, mis andmekogumis toimub, tuleb andmed organiseerida vormingusse, mida inimesed ja tehnoloogia, mida nad edasiseks analüüsiks kasutavad, suudavad mõista. Andmekogumi struktuur kirjeldab, kuidas see on organiseeritud, ja seda saab klassifitseerida struktureeritud, struktureerimata ja poolstruktureeritud andmeteks. Need struktuuritüübid varieeruvad sõltuvalt allikast, kuid lõpuks sobituvad ühte neist kolmest kategooriast.
Toorandmed on andmed, mis on pärit oma allikast algses olekus ja mida pole analüüsitud ega organiseeritud. Selleks, et mõista, mis andmekogus toimub, tuleb see korraldada inimeste ja ka tehnoloogia jaoks sellisesse formaati, mida on võimalik edasi analüüsida. Andmekogu struktuur kirjeldab, kuidas see on organiseeritud, ja seda saab klassifitseerida struktureeritud, struktureerimata ja poolstruktureeritudandmeteks. Need struktuuritüübid võivad varieeruda sõltuvalt allikast, kuid sobituvad lõpuks nende kolme kategooria alla.
### Kvantitatiivsed andmed
Kvantitatiivsed andmed on andmekogumis olevad numbrilised tähelepanekud, mida saab tavaliselt analüüsida, mõõta ja matemaatiliselt kasutada. Mõned kvantitatiivsete andmete näited on: riigi rahvaarv, inimese pikkus või ettevõtte kvartalitulu. Täiendava analüüsi abil võiks kvantitatiivseid andmeid kasutada näiteks õhukvaliteedi indeksi (AQI) hooajaliste trendide avastamiseks või tööpäeva tipptunni liikluse tõenäosuse hindamiseks.
### Kvanitatiivsed andmed
Kvantitatiivsed andmed on arvulised vaatlused andmekogus, mida tavaliselt saab analüüsida, mõõta ja kasutada matemaatiliselt. Näiteks kvantitatiivsed andmed võivad olla: riigi rahvaarv, inimese pikkus või ettevõtte kvartalitulu. Mõne täiendava analüüsiga võiks kvantitatiivseid andmeid kasutada õhukvaliteedi indeks (AQI) hooajaliste trendide avastamiseks või tipptunni liikluse tõenäosuse hindamiseks tüüpilisel tööpäeval.
### Kvalitatiivsed andmed
Kvalitatiivsed andmed, tuntud ka kui kategoorilised andmed, on andmed, mida ei saa objektiivselt mõõta nagu kvantitatiivsete andmete tähelepanekuid. Need on üldiselt subjektiivsed andmed, mis kajastavad millegi kvaliteeti, näiteks toodet või protsessi. Mõnikord on kvalitatiivsed andmed numbrilised, kuid neid ei kasutata tavaliselt matemaatiliselt, nagu telefoninumbrid või ajatemplid. Mõned kvalitatiivsete andmete näited on: videokommentaarid, auto mark ja mudel või sinu lähimate sõprade lemmikvärv. Kvalitatiivseid andmeid võiks kasutada näiteks selleks, et mõista, millised tooted tarbijatele kõige rohkem meeldivad, või populaarsete märksõnade tuvastamiseks töötaotluste CV-des.
Kvalitatiivsed andmed ehk kategoorilised andmed on andmed, mida ei saa objektiivselt mõõta nagu kvantitatiivsete andmete vaatlust. Tavaliselt on need erinevat laadi subjektiivsed andmed, mis kajastavad midagi kvaliteeti, näiteks toodet või protsessi. Mõnikord on kvalitatiivsed andmed arvulised, kuid neid ei kasutata tavaliselt matemaatiliselt, nagu telefoninumbrid või aegmärgid. Näiteks võivad kvalitatiivsed andmed olla: video kommentaarid, auto mark ja mudel või sinu lähimate sõprade lemmikvärv. Kvalitatiivseid andmeid saaks kasutada tarbijate eelistatud toodete tundmaõppimiseks või tööotsijate elulookirjeldustes populaarsete märksõnade tuvastamiseks.
### Struktureeritud andmed
Struktureeritud andmed on andmed, mis on organiseeritud ridadesse ja veergudesse, kus igal real on sama veergude komplekt. Veerud esindavad konkreetse tüübi väärtust ja neid identifitseeritakse nimega, mis kirjeldab, mida väärtus esindab, samas kui read sisaldavad tegelikke väärtusi. Veergudel on sageli konkreetne reeglite või piirangute komplekt, et tagada, et väärtused täpselt esindavad veergu. Näiteks kujutlege klientide arvutustabelit, kus igal real peab olema telefoninumber ja telefoninumbrid ei sisalda tähestikulisi märke. Telefoninumbri veerule võib rakendada reegleid, et see ei oleks kunagi tühi ja sisaldaks ainult numbreid.
Struktureeritud andmed on organiseeritud ridadeks ja veergudeks, kus igal real on sama veergude komplekt. Veerud esindavad konkreetset tüüpi väärtust ja neid tähistatakse nimega, mis kirjeldab, mida väärtus tähistab, samas kui read sisaldavad tegelikke väärtusi. Veergudel võib olla kindlaksmääratud reeglite või piirangute kogum, et tagada väärtuste täpne esindatus. Näiteks kujutle klienditabelit, kus igal real peab olema telefoninumber ja telefoninumbris ei tohi olla tähestikulisi märke. Võib kehtestada reeglid veeru jaoks, et see pole kunagi tühi ja sisaldab ainult numbreid.
Struktureeritud andmete eeliseks on see, et neid saab organiseerida viisil, mis võimaldab neid seostada teiste struktureeritud andmetega. Kuid kuna andmed on kavandatud olema organiseeritud kindlal viisil, võib selle üldstruktuuri muutmine nõuda palju pingutust. Näiteks kui lisada klientide arvutustabelisse e-posti veerg, mis ei tohi olla tühi, tuleb välja mõelda, kuidas lisada need väärtused olemasolevatele klientide ridadele andmekogumis.
Struktureeritud andmete eelis on see, et neid saab organiseerida selliselt, et neid saab siduda teiste struktureeritud andmetega. Kuid kuna andmed on mõeldud korraldatud kindlal viisil, võib üldise struktuuri muutmine nõuda palju vaeva. Näiteks kui lisada klienditabelisse e-posti veerg, mis ei tohi olla tühi, tuleb välja mõelda, kuidas neid väärtusi juba olemasolevatele ridadele lisada.
Struktureeritud andmete näited: arvutustabelid, relatsioonilised andmebaasid, telefoninumbrid, pangaväljavõtted.
Näited struktureeritud andmetest: tabelarvutusfailid, relatsioonandmebaasid, telefoninumbrid, pangaväljavõtted
### Struktureerimata andmed
Struktureerimata andmeid ei saa tavaliselt kategoriseerida ridadesse või veergudesse ning neil puudub vorming või reeglite komplekt, mida järgida. Kuna struktureerimata andmetel on vähem piiranguid nende struktuurile, on uue teabe lisamine lihtsam võrreldes struktureeritud andmekogumiga. Kui sensor, mis salvestab iga 2 minuti järel andmeid baromeetrilise rõhu kohta, saab uuenduse, mis võimaldab tal mõõta ja salvestada temperatuuri, ei nõua see olemasolevate andmete muutmist, kui need on struktureerimata. Kuid see võib muuta selliste andmete analüüsimise või uurimise ajamahukamaks. Näiteks teadlane, kes soovib leida sensori andmetest eelmise kuu keskmist temperatuuri, kuid avastab, et sensor salvestas mõnes andmes "e", et märkida, et see oli katki, mitte tüüpilist numbrit, mis tähendab, et andmed on puudulikud.
Struktureerimata andmed ei ole tavaliselt ridadesse ega veergudesse ja neil puudub kindel formaat või reeglistik. Kuna struktureerimata andmetel on struktuuri piiranguid vähem, on uue info lisamine lihtsam kui struktureeritud andmetel. Kui andurit, mis mõõdab baromeetrilist rõhku iga 2 minuti tagant, uuendatakse nii, et nüüd saab mõõta ja salvestada temperatuuri, ei pea struktureerimata andmete puhul olemasolevaid andmeid muutma. Kuid see võib muuta selliste andmete analüüsi või uurimise raskemaks või aeglasemaks. Näiteks teadlane, kes soovib leida eelmise kuu keskmise temperatuuri seniste andmete põhjal, avastab, et mõnes salvestatud andmes on sensori rikkumise tähistamiseks märgitud “e” tähis tavalise numbri asemel, mis tähendab, et andmed on puudulikud.
Struktureerimata andmete näited: tekstifailid, tekstisõnumid, videofailid.
Näited struktureerimata andmetest: tekstifailid, tekstisõnumid, videofailid
### Poolstruktureeritud andmed
Poolstruktureeritud andmetel on omadused, mis muudavad need struktureeritud ja struktureerimata andmete kombinatsiooniks. Need ei vasta tavaliselt ridade ja veergude vormingule, kuid on organiseeritud viisil, mida peetakse struktureerituks ja mis võib järgida kindlat vormingut või reeglite komplekti. Struktuur varieerub allikate vahel, näiteks hästi määratletud hierarhia või midagi paindlikumat, mis võimaldab hõlpsat uue teabe integreerimist. Metaandmed on näitajad, mis aitavad otsustada, kuidas andmed on organiseeritud ja salvestatud, ning neil on erinevad nimed, sõltuvalt andmete tüübist. Mõned metaandmete levinud nimed on sildid, elemendid, üksused ja atribuudid. Näiteks tüüpilisel e-kirjal on teema, sisu ja saajate komplekt ning seda saab organiseerida selle järgi, kellele või millal see saadeti.
Poolstruktureeritud andmed omavad omadusi, mis ühendavad struktureeritud ja struktureerimata andmeid. Need ei järgi tavaliselt ridade ja veergude formaati, kuid on organiseeritud selliselt, mida peetakse struktureerituks ja võivad järgida kindlat formaati või reeglistikku. Struktuur võib allikate lõikes varieeruda, ulatudes hästi määratletud hierarhiast kuni paindlikuma vormini, mis võimaldab lihtsat uue info integreerimist. Metaandmed on näitajad, mis aitavad otsustada, kuidas andmeid korraldatakse ja salvestatakse ning neil on erinevaid nimetusi sõltuvalt andmetüübist. Levinumad metaandmete nimetused on sildid, elemendid, üksused ja atribuudid. Näiteks tüüpilisel e-kirjal on teema, sisu ja adressaadid ning see võib olla organiseeritud selle järgi, kes ja millal selle saatis.
Poolstruktureeritud andmete näited: HTML, CSV-failid, JavaScript Object Notation (JSON).
Näited poolstruktureeritud andmetest: HTML, CSV-failid, JavaScript Object Notation (JSON)
## Andmete allikad
## Andmeallikad
Andmeallikas on algne asukoht, kus andmed loodi või kus need "elavad", ja see varieerub sõltuvalt sellest, kuidas ja millal need koguti. Kasutaja(te) poolt genereeritud andmeid nimetatakse esmasteks andmeteks, samas kui teiseseid andmeid kogub allikas üldiseks kasutamiseks. Näiteks teadlaste rühm, kes kogub tähelepanekuid vihmametsas, oleks esmane allikas, ja kui nad otsustavad seda teiste teadlastega jagada, oleks see nende jaoks teisene allikas.
Andmeallikas on koht, kus andmed algselt genereeriti või kus nad asuvad, ja see varieerub sõltuvalt sellest, kuidas ja millal andmed koguti. Kasutajate (andmete toodete) genereeritud andmeid nimetatakse esmaseks andmeteks, samas kui teisene andmestik pärineb allikast, mis on kogunud andmeid üldiseks kasutamiseks. Näiteks vihmametsa teadlaste grupi poolt kogutud tähelepanekud on esmased andmed ning kui nad otsustavad seda jagada teiste teadlastega, peetakse seda sekundaarseks nendel, kes neid kasutavad.
Andmebaasid on tavalised allikad ja tuginevad andmebaasi haldussüsteemile, et andmeid majutada ja hallata, kus kasutajad kasutavad päringuteks nimetatud käske andmete uurimiseks. Failid andmeallikatena võivad olla heli-, pildi- ja videofailid, samuti arvutustabelid nagu Excel. Interneti allikad on tavalised andmete majutamise kohad, kus võib leida nii andmebaase kui ka faile. Rakenduste programmeerimisliidesed, tuntud ka kui API-d, võimaldavad programmeerijatel luua viise andmete jagamiseks väliste kasutajatega interneti kaudu, samas kui veebikraapimine eraldab andmeid veebilehelt. [Õppetunnid andmetega töötamisest](../../../../../../../../../2-Working-With-Data) keskenduvad sellele, kuidas kasutada erinevaid andmeallikaid.
Andmebaasid on levinud allikad ja kasutavad andmebaasi haldussüsteemi andmete majutamiseks ja hooldamiseks, kus kasutajad saavad andmeid uurida päringute ehk käskude kaudu. Failid kui allikad võivad olla audio-, pildi- ja videofailid ning tabelarvutusfailid nagu Excel. Internetiallikad on tavalised koha andmete majutamiseks, kus leidub nii andmebaase kui ka faile. Rakendusliideste programmeerimisliidesed ehk API-d võimaldavad programmeerijatel luua viise, kuidas jagada andmeid väliskasutajatega interneti kaudu, samas kui veebilehitsemine võimaldab andmeid veebilehelt eraldada. [Andmetega töötamise õppetunnid](../../../../../../../../../2-Working-With-Data) keskenduvad erinevate allikate kasutamisele.
## Kokkuvõte
@ -49,27 +49,31 @@ Selles õppetunnis õppisime:
- Mis on andmed
- Kuidas andmeid kirjeldatakse
- Kuidas andmeid klassifitseeritakse ja kategoriseeritakse
- Kus andmeid võib leida
- Kuidas andmed klassifitseeritakse ja kategoriseeritakse
- Kust andmeid leida võib
## 🚀 Väljakutse
Kaggle on suurepärane avatud andmekogumite allikas. Kasuta [andmekogumite otsingutööriista](https://www.kaggle.com/datasets), et leida huvitavaid andmekogumeid ja klassifitseeri 3-5 andmekogumit järgmiste kriteeriumide alusel:
Kaggle on suurepärane avatud andmekogude allikas. Kasuta [andmekogude otsingutööriista](https://www.kaggle.com/datasets), et leida huvitavaid andmekogusid ja klassifitseeri 3-5 andmekogu järgmise kriteeriumi alusel:
- Kas andmed on kvantitatiivsed või kvalitatiivsed?
- Kas andmed on struktureeritud, struktureerimata või poolstruktureeritud?
## [Järelloengu viktoriin](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## [Pärast loengut viktoriin](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Ülevaade ja iseseisev õppimine
- Microsoft Learn üksus, pealkirjaga [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data), sisaldab üksikasjalikku jaotust struktureeritud, poolstruktureeritud ja struktureerimata andmetest.
## Ülesanne
## Ülevaade & Iseteemaks
[Andmekogumite klassifitseerimine](assignment.md)
- See Microsoft Learn moodul, pealkirjaga [Andmeformaatide tuvastamine](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text), sisaldab detailset ülevaadet struktureeritud, poolstruktureeritud ja struktureerimata andmetest.
## Kodutöö
[Andmekogude klassifitseerimine](assignment.md)
---
**Lahtiütlus**:
See dokument on tõlgitud AI tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tulenevate arusaamatuste või valesti tõlgenduste eest.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Lahtiütlus**:
See dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Sissejuhatus tõenäosusteooriasse ja statistikasse\n",
"Selles märkmikus mängime mõningate varasemalt käsitletud mõistetega. Paljud tõenäosuse ja statistika kontseptsioonid on hästi esindatud suurtes Python'i andmetöötlusteekides, nagu `numpy` ja `pandas`.\n"
"# Sissejuhatus tõenäosusteooriasse ja statistika\n",
"Selles märkmikus katsetame mõningate kontseptsioonidega, mida oleme varem käsitlenud. Paljud tõenäosuse ja statistika mõisted on hästi esindatud suuremates andmetöötluse teekides Pythoni jaoks, nagu `numpy` ja `pandas`.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## Juhuslikud muutujad ja jaotused\n",
"Alustame 30 väärtuse proovivõtmisega ühtlasest jaotusest 0 kuni 9. Samuti arvutame keskmise ja dispersiooni.\n"
"Alustame 30 väärtuse juhusliku valimiga ühtlasest jaotusest vahemikus 0 kuni 9. Arvutame ka keskmise ja dispersiooni.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Selleks, et visuaalselt hinnata, kui palju erinevaid väärtusi proovis on, saame joonistada **histogrammi**:\n"
"Visuaalseks hinnanguks, kui palju erinevaid väärtusi proovis on, saame joonistada **histogrammi**:\n"
]
},
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Tõelise andmete analüüs\n",
"## Tõeliste andmete analüüs\n",
"\n",
"Keskmine ja dispersioon on tõeliste andmete analüüsimisel väga olulised. Laadime andmed pesapallurite kohta saidilt [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Keskmine ja dispersioon on reaalse maailma andmete analüüsimisel väga olulised. Laadime alla andmed pesapallurite kohta aadressilt [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -80,7 +80,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Me kasutame siin andmete analüüsimiseks paketti [**Pandas**](https://pandas.pydata.org/). Me räägime pandast ja andmetega töötamisest Pythonis selle kursuse edasistes osades rohkem.\n",
"> Siin kasutame andmeanalüüsiks paketti nimega [**Pandas**](https://pandas.pydata.org/). Räägime sellest, kuidas Pandasega Pythonis andmetega töötada, hiljem selles kursuses rohkem.\n",
"\n",
"Arvutame keskmised väärtused vanuse, pikkuse ja kaalu jaoks:\n"
]
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nüüd keskendume pikkusele ja arvutame standardhälbe ning dispersiooni:\n"
"Nüüd keskendume pikkusele ja arvutame standardhälbe ja variatsiooni: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Keskmise kõrval on mõistlik vaadata ka mediaani väärtust ja kvartiile. Neid saab visualiseerida kasutades **kastdiagrammi**:\n"
"Lisaks keskmisele on mõistlik vaadata ka mediaani ja kvartileid. Neid saab visualiseerida kasutades **kastdiagrammi**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Me saame teha ka kastdiagramme meie andmekogu alamhulkadest, näiteks mängijate rolli järgi rühmitatult.\n"
"Me saame teha ka kastdiagramme meie andmekogumi alamhulkadest, näiteks mängija rolli järgi rühmitatult.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Märkus**: See diagramm näitab, et keskmiselt on esimesed esimesed põhitõkkepedjad pikemad kui teised põhitõkkepedjad. Hiljem õpime, kuidas seda hüpoteesi formaalsemalt testida ja kuidas tõestada, et meie andmed on statistiliselt olulised selle näitamiseks. \n",
"> **Märkus**: See diagramm viitab sellele, et keskmiselt on esimesi pesamängijaid kõrgemad kui teisi pesamängijaid. Hiljem õpime, kuidas seda hüpoteesi formaalsemalt testida ja kuidas tõestada, et meie andmed on statistiliselt olulised selle näitamiseks. \n",
"\n",
"Vanus, pikkus ja kaal on kõik pidevad juhuslikud muutujad. Mida sa arvad, milline on nende jaotus? Hea viis selle väljaselgitamiseks on joonistada väärtuste histogramm: \n"
"Vanus, pikkus ja kaal on kõik pidevad juhuslikud suurused. Mida sa arvad, milline võiks olla nende jaotus? Hea viis selle väljaselgitamiseks on kuvada väärtuste histogramm: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Normaaljaotus\n",
"## Norma jaotus\n",
"\n",
"Loon kunstliku masside valimi, mis järgib normaaljaotust sama keskmise ja dispersiooniga kui meie tegelikud andmed:\n"
"Loome kaalude tehisnäidise, mis järgib normaaljaotust sama keskmise ja dispersiooniga nagu meie tegelikud andmed:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kuna enamik elus olevatest väärtustest on normaalselt jaotunud, ei tohiks me kasutada ühtlast juhuslike arvude generaatorit proovandmete genereerimiseks. Siin on see, mis juhtub, kui proovime kaalusid genereerida ühtlase jaotusega (genereeritud `np.random.rand` abil):\n"
"Kuna enamik väärtusi päriselus on tavaliselt jaotunud, ei tohiks me sample andmete genereerimiseks kasutada ühtlast juhuarvude generaatorit. Siin on, mis juhtub, kui proovime genereerida kaalu ühtlase jaotusega (genereeritud `np.random.rand` abil):\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Usaldusvahemikud\n",
"\n",
"Arvutame nüüd pesapallimängijate kehakaalu ja pikkuse usaldusvahemikud. Kasutame koodi [selles stackoverflow arutelus](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Arvutame nüüd usaldusvahemikud pesapallimängijate kehakaaludele ja pikkustele. Kasutame koodi [sellelt stackoverflow arutelult](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## Hüpoteesi testimine\n",
"\n",
"Uurime erinevaid rolle meie pesapallimängijate andmestikus:\n"
"Uurime meie pesapalli mängijate andmestikus erinevaid rolle:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Testime hüpoteesi, et esimesed pesamehed on teistest pesameestest pikemad. Kõige lihtsam viis selleks on testida usaldusvahemikke:\n"
"Testime hüpoteesi, et esimesed esindajad on teistest esindajatest pikemad. Lihtsaim viis selleks on testida usaldusvahemikke:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Saame näha, et intervallid ei kattu.\n",
"Saame näha, et intervallid ei kattuvad.\n",
"\n",
"Statistiliselt korreksem viis hüpoteesi tõestamiseks on kasutada **Studenti t-testi**:\n"
"Statistiliselt korrektsem viis hüpoteesi tõestamiseks on kasutada **Studenti t-testi**:\n"
]
},
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Funktsiooni `ttest_ind` tagastatud kaks väärtust on:\n",
"* p-väärtust võib pidada tõenäosuseks, et kaks jaotust omavad sama keskmist väärtust. Meie puhul on see väga madal, mis tähendab, et on tugevad tõendid selle kohta, et esimestel pesuritel on suurem pikkus.\n",
"* t-väärtus on normeeritud keskmise erinevuse vaheväratlus, mida kasutatakse t-testis, ja seda võrreldakse antud usaldusväärtuse künnisega.\n"
"Kaks `ttest_ind` funktsiooni poolt tagastatud väärtust on:\n",
"* p-väärtus võib pidada tõenäosuseks, et kaks jaotust omavad sama keskmist väärtust. Meie puhul on see väga madal, mis tähendab, et on tugev tõendusmaterjal, mis toetab, et esimesed pesurite mängijad on pikemad.\n",
"* t-väärtus on normaliseeritud keskmise erinevuse vahevärtus, mida kasutatakse t-testis ja seda võrreldakse teatud usaldusväärtuse jaoks määratud läviväärtusega.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Normaalse jaotuse simuleerimine keskväärtusteooreemi abil\n",
"## Normaalse jaotuse simuleerimine keskväärtuste piiriteoreemi abil\n",
"\n",
"Juhuslike arvude generaator Pythonis on loodud tagama ühtlase jaotuse. Kui soovime luua normaaljaotusega generaatori, võime kasutada keskväärtusteooreemi. Normaaljaotusega väärtuse saamiseks arvutame lihtsalt ühtlaselt genereeritud valimi aritmeetilise keskmise.\n"
"Pythonis olev pseudo-juhuslike arvude generaator on loodud nii, et ta annaks meile ühtlase jaotuse. Kui soovime luua normaljaotusega generaatori, võime kasutada keskväärtuste piiriteoreemi. Normaalselt jaotunud väärtuse saamiseks arvutame lihtsalt ühtlaselt genereeritud valimi keskmise.\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Korrelatsioon ja Evil Baseball Corp\n",
"## Korrelatsioon ja kurjuse pesapalli korporatsioon\n",
"\n",
"Korrelatsioon võimaldab meil leida seoseid andmesarjade vahel. Meie mängulises näites kujutame ette, et on kuri pesapallifirma, kes maksab oma mängijatele vastavalt nende pikkusele mida pikem on mängija, seda rohkem raha ta saab. Oletame, et algpalk on 1000 dollarit ning lisaks saab kõrgusest sõltuva boonuse 0 kuni 100 dollarit. Võtame MLB mängijad ja arvutame nende kujuteldavad palgad:\n"
"Korrelatsioon võimaldab meil leida seoseid andmejärjestuste vahel. Meie mängulises näites kujutame ette, et eksisteerib kurjus pesapalli korporatsioon, mis maksab oma mängijatele vastavalt nende pikkusele - mida pikem mängija on, seda rohkem raha ta saab. Oletame, et baasipalk on 1000 dollarit ja lisaboonus ulatub 0 kuni 100 dollarini, sõltuvalt pikkusest. Võtame reaalsed MLB mängijad ja arvutame nende kujuteldavad palgad:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Lähme nüüd arvutama nende järjestuste kovariantsust ja korrelatsiooni. Funktsioon `np.cov` annab meile nn **kovariantsusmaatriksi**, mis on kovariantsuse laiendus mitmele muutujaile. Kovariantsusmaatriksi $M$ element $M_{ij}$ on sisendmuutujate $X_i$ ja $X_j$ omavaheline korrelatsioon ning diagonaalväärtused $M_{ii}$ on $X_i$ dispersioon. Samamoodi annab `np.corrcoef` meile **korrelatsioonimaatriksi**.\n"
"Arvutame nüüd nende järjestuste kovariantsi ja korrelatsiooni. `np.cov` annab meile nn **kovariantsusmaatriksi**, mis on kovariantsi laiendus mitmele muutujale. Kovariantsusmaatriksi $M$ element $M_{ij}$ on korrelatsioon sisendmuutujate $X_i$ ja $X_j$ vahel ning diagonaalväärtused $M_{ii}$ on $X_{i}$ dispersioon. Samamoodi annab `np.corrcoef` meile **korrelatsioonimaatriksi**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Seos, mis on võrdne 1-ga, tähendab, et kahe muutuja vahel on tugev **lineaarne seos**. Lineaarse seose saab visuaalselt näha, kui ühe väärtuse teise vastu joonistada:\n"
"Korrelatsioon, mis võrdub 1-ga, tähendab, et kahe muutuja vahel on tugev **lineaarne seos**. Lineaarse seose nägemiseks visuaalselt võime ühe väärtuse teisega graafikule panna:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vaatame, mis juhtub, kui seos ei ole lineaarne. Oletame, et meie ettevõte otsustas peita ilmset lineaarset sõltuvust pikkuste ja palkade vahel ning lisas valemisse mõningase mittelineaarsuse, näiteks `sin`:\n"
"Vaatame, mis juhtub, kui seos ei ole lineaarne. Oletame, et meie ettevõte otsustas peita ilmselge lineaarse sõltuvuse kõrguste ja palkade vahel ning lisas valemisse mõningase mittelineaarsuse, näiteks `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Selles olukorras on korrelatsioon veidi väiksem, kuid siiski üsna kõrge. Nüüd, et seost veel vähem ilmseks teha, võime soovida palgale lisada natuke juhuslikkust, lisades mõne juhusliku muutuja. Vaatame, mis juhtub:\n"
"Selles olukorras on korrelatsioon veidi väiksem, kuid siiski üsna kõrge. Nüüd, et seos oleks veelgi vähem ilmne, võime paluda lisada mingit juhuslikkust, lisades palgale mõne juhusliku muutuja. Vaatame, mis juhtub:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Kas suudad ära arvata, miks täpid reas ritta vertikaalseteks joonteks moodustuvad?\n",
"> Kas suudad arvata, miks täpid järjestuvad selliseks vertikaalseks joonteks?\n",
"\n",
"Oleme täheldanud korrelatsiooni kunstlikult loodud mõiste nagu palk ja täheldatud muutujate *pikkus* vahel. Vaatame ka, kas kaks täheldatud muutujat, nagu pikkus ja kaal, korreleeruvad:\n"
"Oleme täheldanud seost kunstlikult loodud kontseptsiooni nagu palk ja vaadeldava tunnuse *pikkus* vahel. Vaatame nüüd, kas ka kaks vaadeldavat tunnust, näiteks pikkus ja kaal, on seotud:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kahjuks me ei saanud ühtegi tulemust ainult mõned kummalised `nan` väärtused. See on tingitud sellest, et mõned meie seeria väärtused on määramata, mida tähistatakse kui `nan`, mis põhjustab operatsiooni tulemuse samuti määramatuks olemise. Vaadates maatriksit näeme, et probleemne veerg on `Weight`, kuna kõrguse väärtuste omakorpus on arvutatud.\n",
"Kahjuks ei saanud me mingeid tulemusi ainult mõned kummalised `nan` väärtused. See tuleneb sellest, et mõned meie seeria väärtused on määratlemata, mida esindab `nan`, mis põhjustab ka operatsiooni tulemuse määratlematuks jäämise. Kui vaadata maatriksit, näeme, et probleemne veerg on `Weight`, sest on arvutatud isekorrelatsioon `Height` väärtuste vahel.\n",
"\n",
"> See näide näitab **andmete ettevalmistamise** ja **puhastamise** tähtsust. Ilma korralike andmeteta ei saa me midagi arvutada.\n",
"> See näide näitab andmete **ettevalmistamise** ja **puhastamise** tähtsust. Ilma korralike andmeteta ei saa me midagi arvutada.\n",
"\n",
"Kasutame `fillna` meetodit, et täita puuduvad väärtused ja arvutame korrelatsiooni:\n"
"Kasutame `fillna` meetodit puuduvate väärtuste täitmiseks ja arvutame korrelatsiooni: \n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Tõepoolest on olemas korrelatsioon, kuid mitte nii tugev kui meie kunstlikus näites. Kui vaadata ühte väärtust teise vastu hajuvusdiagrammil, oleks seos palju vähem ilmne:\n"
"Tegelikult on olemas korrelatsioon, kuid mitte nii tugev kui meie kunstlikus näites. Tõepoolest, kui vaatame ühe väärtuse hajuvusdiagrammi teise vastu, oleks seos palju vähem ilmne:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Kokkuvõte\n",
"\n",
"Selles märkmikus oleme õppinud, kuidas andmetel põhitoiminguid teha, et arvutada statistilisi funktsioone. Nüüd teame, kuidas kasutada matemaatika ja statistika põhjalikku aparatuuri, et mõningaid hüpoteese tõestada ning kuidas arvutada usaldusvahemikke suvalistele muutujatele, kui on olemas andmete valim.\n"
"Selles märkmikus õppisime, kuidas andmetel põhitoiminguid teha, et arvutada välja statistilisi funktsioone. Nüüd teame, kuidas kasutada korralikku matemaatika ja statistika aparatuuri, et tõestada mõningaid hüpoteese, ning kuidas arvutada usaldusvahemikke suvalistele muutujatele, lähtudes andmete proovist. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Vastutusest loobumine**: \nSee dokument on tõlgitud tehisintellekti tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi me püüdleme täpsuse poole, palun arvestage, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Originaaldokument tema emakeeles peaks olema autoriteetne allikas. Tähtsate andmete puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tekkida võivate arusaamatuste või valesti mõistmiste eest.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Lahtiütlus**:\nSee dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T22:19:03+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "et"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## Andmete laadimine\n",
"\n",
"Kasutame COVID-19 nakatunud isikute andmeid, mida pakub [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) [Johns Hopkinsi Ülikoolist](https://jhu.edu/). Andmekogum on kättesaadav [selles GitHubi hoidlas](https://github.com/CSSEGISandData/COVID-19).\n"
"Kasutame COVID-19 nakatunud isikute andmeid, mida pakub [Johns Hopkinsi Ülikooli](https://jhu.edu/) [Süsteemiteaduse ja inseneriteaduse keskus](https://systems.jhu.edu/) (CSSE). Andmestik on saadaval [selles GitHubi hoidlas](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Saame kõige värskemad andmed laadida otse GitHubist kasutades `pd.read_csv`. Kui mingil põhjusel andmed ei ole saadaval, võid alati kasutada kohalikus kaustas `data` olevat koopiat - lihtsalt eemalda selle rea kommentaar, mis määratleb `base_url`:\n"
"Saame kõige uuemad andmed otse GitHubist laadida, kasutades `pd.read_csv`. Kui mingil põhjusel andmed ei ole saadaval, võite alati kasutada kohalikus kaustas `data` olevat koopiat - lihtsalt eemaldage allolevalt realt kommentaar, mis määrab `base_url`:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Näeme, et iga tabeli rida määratleb nakatunud isikute arvu iga riigi ja/või provintsi kohta ning veerud vastavad kuupäevadele. Sarnaseid tabeleid saab laadida ka teiste andmete jaoks, näiteks paranenuute arvu ja surmade arvu.\n"
"Näeme, et iga tabeli rida määratleb nakatunud inimeste arvu iga riigi ja/või provintsi kohta ning veerud vastavad kuupäevadele. Sarnaseid tabeleid saab laadida ka teiste andmete jaoks, näiteks paranenuute ja surmajuhtumite arvu kohta.\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## Andmete mõistmine\n",
"\n",
"Ülalolevast tabelist ei ole provintsi veeru roll selge. Vaatame, millised erinevad väärtused on olemas veerus `Province/State`:\n"
"Ülalolevast tabelist ei ole liiga selge, mis rolli täidab maakonna veerg. Vaatame, millised erinevad väärtused on olemas veerus `Province/State`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nimedest võime teha järelduse, et sellistel riikidel nagu Austraalia ja Hiina on provintside kaupa rohkem üksikasjalikku jaotust. Vaatame Hiina kohta infot, et näha näidet:\n"
"Nimedest võime järeldada, et sellistel riikidel nagu Austraalia ja Hiina on täpsem jaotus provintside kaupa. Otsime Hiina kohta teavet, et näha näidet:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Andmete eeltöötlemine\n",
"## Andmete eeltöötlus \n",
"\n",
"Me ei ole huvitatud riikide jaotamisest täiendavateks territooriumideks, seega eemaldame esmalt selle jaotuse ning lisame teavet kõigi territooriumide kohta kokku, et saada info kogu riigi kohta. Seda saab teha, kasutades `groupby`:\n"
"Me ei ole huvitatud riikide täiendavaks jagamiseks piirkondadeks, seega eemaldame esmalt selle jaotuse ning lisame teabe kõigi piirkondade kohta kokku, et saada info kogu riigi kohta. Seda saab teha `groupby` abil:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Näituseks, kuna kasutame `groupby`, on kõik DataFrame'id nüüd indekseeritud riigi/regiooni järgi. Seega saame konkreetse riigi andmetele ligi pääseda, kasutades `.loc`:|\n"
"Nagu näha, on kõigi DataFrame'ide indeksiteks saanud riik/region tänu `groupby` kasutamisele. Seega saame andmetele konkreetse riigi kohta ligi pääseda kasutades `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Märkus** kuidas me kasutame `[3:]`, et eemaldada järjestuse esimesed kolm elementi, mis sisaldavad mitte-kuupäevaga seotud metaandmeid (Provintsi/Osariigi ja geokoordinaatide veerud). Võime need kolm veergu ka täielikult eemaldada:\n"
"> **Märkus:** kuidas me kasutame `[3:]`, et eemaldada järjestuse esimesed kolm elementi, mis sisaldavad mitte-kuupäevaga seotud metaandmeid (provintsi/osariigi ja geolokatsiooni veerud). Samuti saame need kolm veergu täielikult eemaldada:\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## Andmete uurimine\n",
"\n",
"Nüüd vaatleme konkreetset riiki. Loome andmeraami, mis sisaldab infektsioonide andmeid kuupäeva järgi indekseeritult:\n"
"Vahetame nüüd konkreetse riigi uurimisele. Loome raamistiku, mis sisaldab nakatumiste andmeid indekseerituna kuupäeva järgi:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nüüd arvutame iga päev nakatunute uute inimeste arvu. See võimaldab meil näha, kui kiiresti pandeemia areneb. Kõige lihtsam päev selleks on kasutada `diff`:\n"
"Arvutame nüüd, mitu uut nakatunut ilmneb iga päev. See võimaldab meil näha, kui kiiresti pandeemia levib. Lihtsaim viis selleks on kasutada `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Andmeid vaadates näeme suuri kõikumisi. Vaatame lähemalt ühte kuud:\n"
"Andmeid on näha suuri kõikumisi. Vaatame lähemalt üht kuud:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"On selgelt näha, et andmetes esineb iganädalasi kõikumisi. Kuna me tahame olla võimelised nägema trende, on mõistlik kõverat tasandada, arvutades jooksva keskmise (st iga päeva jaoks arvutame eelmiste päevade keskmise väärtuse):\n"
"Andmeid on selgelt näha nädalasi kõikumisi. Kuna me tahame suundumusi näha, on mõistlik kõverat siluda jooksva keskmise arvutamisega (st iga päeva jaoks arvutame eelmiste päevade keskmise väärtuse):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Selleks, et saaks võrrelda mitut riiki, võiksime arvestada riigi elanikkonda ja võrrelda nakatunud isikute protsenti riigi elanikkonna suhtes. Riigi elanikkonna saamiseks laadime riikide andmestiku:\n"
"Selleks, et saaksime võrrelda mitut riiki, võime soovida arvestada riigi elanikkonda ja võrrelda nakatunud isikute protsenti riigi elanikkonna suhtes. Riigi elanikkonna saamiseks laadime andmestiku riikidest:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kuna see andmestik sisaldab teavet nii riikide kui ka provintside kohta, peame kogu riigi rahvaarvu saamiseks olema veidi nutikamad:\n"
"Kuna see andmestik sisaldab teavet nii riikide kui ka provintside kohta, peame kogu riigi elanikkonna saamiseks olema veidi nutikamad: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## $R_t$ arvutamine\n",
"\n",
"Et näha, kui nakkav haigus on, vaatleme **baasreproduktsiooninumbrit** $R_0$, mis näitab, mitu inimest nakatatud inimene veel nakataks. Kui $R_0$ on suurem kui 1, on epideemia tõenäoliselt levimas.\n",
"Haiguse nakkavuse hindamiseks vaatleme **põhilist paljunemisarvu** $R_0$, mis näitab, kui paljusid inimesi nakatanu omakorda nakatab. Kui $R_0$ on suurem kui 1, on epideemia tõenäoliselt laialdane.\n",
"\n",
"$R_0$ on haiguse enda omadus ega arvesta mõningaid kaitsemeetmeid, mida inimesed võivad võtta pandeemia aeglustamiseks. Pandeemia kulgu jooksul saame hinnata reproduktsiooninumbrit $R_t$ igal antud ajahetkel $t$. On näidatud, et seda arvu saab umbkaudselt hinnata, võttes 8-päevase akna ja arvutades $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"kus $I_t$ on uute nakatunud isikute arv päeval $t$.\n",
"$R_0$ on haiguse iseärasus ja ei arvesta mõningaid kaitsevahendeid, mida inimesed võivad pandeemia aeglustamiseks rakendada. Pandeemia kulgemise ajal saame hinnata paljunemisarvu $R_t$ mis tahes ajahetkel $t$. On näidatud, et seda arvu saab umbkaudselt hinnata, võttes 8-päevase akna ja arvutades $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"kus $I_t$ on uute nakatunute arv päeval $t$.\n",
"\n",
"Arvutame $R_t$ meie pandeemiandmete jaoks. Selleks võtame 8 `ninfected` väärtusega liikuva akna ja rakendame ülaltoodud suhte arvutamise funktsiooni:\n"
"Arvutame nüüd meie pandeemia andmete jaoks $R_t$. Selleks võtame 8 `ninfected` väärtusest koosneva liikuva akna ja rakendame ülaltoodud suhet arvutava funktsiooni:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Näete, et joonisel on mõned lõhed. Neid võivad põhjustada kas `NaN`, või kui andmestikus esinevad `inf` väärtused. `inf` võib tekkida jagamisel nulliga ning `NaN` võib tähistada puuduvat andmet, või andmeid pole saadaval tulemuse arvutamiseks (nagu meie raamatu alguses, kus lahtirulluva akna laius 8 pole veel saadaval). Graafiku ilusamaks muutmiseks peame need väärtused täitma, kasutades `replace` ja `fillna` funktsiooni.\n",
"Näete, et graafikus on mõned lüngad. Need võivad olla põhjustatud kas `NaN` või `inf` väärtustest andmestikus. `inf` võib tingitud olla jagamisest 0-ga, ja `NaN` võib tähistada puuduvaid andmeid või tulemuse arvutamiseks pole andmeid saadaval (nagu meie andmeraami alguses, kus laiusega 8 kerimisaken pole veel saadaval). Graafiku ilustamiseks peame need väärtused täitma, kasutades `replace` ja `fillna` funktsiooni.\n",
"\n",
"Vaatame lähemalt pandeemia algust. Piiritleme ka y-telje väärtused, et kuvada ainult väärtusi alla 6, parema ülevaate saamiseks, ning joonistame horisontaalse joone väärtusel 1.\n"
"Vaatame täpsemalt pandeemia algust. Piirame ka y-telje väärtused näitamaks ainult alla 6 olevad väärtused, et paremini näha, ning joonistame horisontaalse joone väärtusel 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Veel üks huvitav epideemia näitaja on **derivaat**, ehk **päevane erinevus** uutes juhtumites. See võimaldab meil selgelt näha, millal epideemia kasvab või kahaneb.\n"
"Teine huvitav näitaja pandeemia kohta on **tuletis** ehk **igapäevane muutus** uutes juhtumites. See võimaldab meil selgelt näha, millal pandeemia kasvab või kahaneb. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Arvestades, et andmetes esineb palju kõikumisi aruandluse tõttu, on mõistlik kõverat siluda, kasutades liikuva keskmise arvutamist, et saada üldpilt. Keskendume jälle pandeemia esimestele kuudele:\n"
"Arvestades, et andmetes on palju kõikumisi aruandluse tõttu, on mõistlik kõvera silumiseks kasutada libisevat keskmist, et saada üldpilt. Vaatame taas pandeemia esimesi kuid:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Väljakutse\n",
"\n",
"Nüüd on aeg sinul rohkem mängida koodi ja andmetega! Siin on mõned soovitused, millega võid eksperimenteerida:\n",
"* Vaata pandeemia levikut erinevates riikides.\n",
"* Joonista $R_t$ graafikud mitme riigi kohta ühele graafile võrdlemiseks või tee mitu graafikut kõrvuti.\n",
"* Uuri, kuidas surmade ja paranemiste arv korreleerub nakatunute arvuga.\n",
"* Proovi välja uurida, kui kaua tüüpiline haigus kestab, visuaalselt korreleerides nakkus- ja surmade määra ning otsides anomaaliaid. Selleks võib vaja olla vaadata erinevaid riike.\n",
"* Arvuta suremus ja kuidas see aja jooksul muutub. Võid vajada haiguse kestuse arvestamist päevades, et nihutada ühte ajaseeriat enne arvutuste tegemist.\n"
"Nüüd on aeg teil koodi ja andmetega rohkem mängida! Siin on mõned soovitused, mida võite katsetada:\n",
"* Vaadake pandeemia levikut erinevates riikides.\n",
"* Joonistage $R_t$ graafikud mitmele riigile ühele joonisele võrdlemiseks või tehke mitu joonist kõrvuti\n",
"* Vaadake, kuidas surmade ja paranemiste arv korreleerub nakatunud juhtumite arvuga.\n",
"* Püüdke visuaalselt korreleerides nakkuse määra ja surmade määra ning otsides anomaaliaid välja selgitada, kui kaua tüüpiline haigus kestab. Peate võib-olla vaatama eri riike selle välja selgitamiseks.\n",
"* Arvutage suremusmäär ja kuidas see aja jooksul muutub. Võite arvestada haiguse kestust päevades, et nihutada ühte ajaseeriat enne arvutuste tegemist\n"
]
},
{
@ -2406,10 +2408,10 @@
"source": [
"## Viited\n",
"\n",
"COVIDi epideemia leviku täiendavate uuringutega saate tutvuda järgmistes väljaannetes:\n",
"* [Libisev SIR mudel Rt hindamiseks COVIDi pandeemia ajal](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blogipostitus autorilt [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Globaalsete COVID-19 puhangute ajasõltuva reprodutseerimisarvu hindamine](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Ülalmainitud artikli kood GitHubis](https://github.com/shwars/SlidingSIR)\n"
"Järgnevatest väljaannetest võite leida COVID-epideemia leviku täiendavaid uurimusi:\n",
"* [Liuglev SIR mudel Rt hindamiseks COVID pandeemia ajal](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blogipostitus autorilt [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Aja järgi muutuva reprodutseerimisnumbri hindamine globaalse COVID-19 puhangu puhul](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Ülaltoodud artikli kood GitHubis](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Eiramine**:\nSee dokument on tõlgitud AI-tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame täpsust, tuleb meeles pidada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul on soovitatav kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tingitud väärarusaamade või valesti tõlgendamise eest.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Lahtiütlus**:\nSee dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,18 +1,18 @@
# Ohtlike suhete andmete visualiseerimise projekt
# Ohtlike Sidemete andmete visualiseerimise projekt
Alustamiseks veendu, et NPM ja Node töötavad sinu arvutis. Paigalda sõltuvused (npm install) ja käivita projekt kohalikult (npm run serve):
Alustamiseks peate veenduma, et teie arvutis töötab NPM ja Node versioon **>=20.0.0**. Installige sõltuvused (npm install) ja seejärel käivitage projekt lokaalselt (npm run serve):
## Projekti seadistamine
```
npm install
```
### Kompileerib ja rakendab muudatused arenduseks
### Koondab ja värskendab arenduse ajal kohe
```
npm run serve
```
### Kompileerib ja minimeerib tootmiseks
### Koondab ja minifieerib tootmiseks
```
npm run build
```
@ -23,9 +23,11 @@ npm run lint
```
### Kohanda konfiguratsiooni
Vaata [Konfiguratsiooni viidet](https://cli.vuejs.org/config/).
Vaata [Configuration Reference](https://cli.vuejs.org/config/).
---
**Lahtiütlus**:
See dokument on tõlgitud AI tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tulenevate arusaamatuste või valesti tõlgenduste eest.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Lahtiütlus**:
See dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,18 +1,18 @@
# Ohtlike suhete andmete visualiseerimise projekt
# Ohtlike sidemete andmete visualiseerimise projekt
Alustamiseks veendu, et NPM ja Node töötavad sinu arvutis. Paigalda sõltuvused (npm install) ja käivita projekt kohalikult (npm run serve):
Alustamiseks peab sul olema masinas paigaldatud NPM ja Node versiooniga **>=20.0.0**. Paigalda sõltuvused (npm install) ja seejärel käivita projekt lokaalselt (npm run serve):
## Projekti seadistamine
```
npm install
```
### Kompileerib ja rakendab muudatused arendamiseks
### Koostab ja laadib arendamiseks kiiresti uuesti
```
npm run serve
```
### Kompileerib ja minimeerib tootmiseks
### Koostab ja minimeerib tootmiseks
```
npm run build
```
@ -22,10 +22,12 @@ npm run build
npm run lint
```
### Kohanda konfiguratsiooni
### Kohanda seadistust
Vaata [Konfiguratsiooni viidet](https://cli.vuejs.org/config/).
---
**Lahtiütlus**:
See dokument on tõlgitud AI tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tulenevate arusaamatuste või valesti tõlgenduste eest.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Lahtiütlus**:
See dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "pcm"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T10:29:39+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T22:33:01+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "pcm"
},
@ -42,8 +42,8 @@
"language_code": "pcm"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-11-18T18:31:43+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T22:35:26+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "pcm"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "pcm"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T22:34:02+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pcm"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-11-18T18:29:11+00:00",
@ -108,8 +114,8 @@
"language_code": "pcm"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T10:30:57+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T22:32:35+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "pcm"
},
@ -192,14 +198,14 @@
"language_code": "pcm"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-11-18T18:48:22+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:35:35+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "pcm"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-11-18T18:48:37+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:35:31+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "pcm"
},

File diff suppressed because one or more lines are too long

@ -4,60 +4,60 @@
|:---:|
|Defining Data - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
Data na facts, information, wetin person observe and measure wey dem dey use to make discovery and take make better decision. One data point na one single unit of data wey dey inside dataset, wey be collection of data points. Datasets fit dey for different formats and structure, and e go usually depend on where e come from or the source of the data. For example, one company monthly earnings fit dey for spreadsheet but hourly heart rate data from smartwatch fit dey for [JSON](https://stackoverflow.com/a/383699) format. E dey normal for data scientists to dey work with different types of data inside one dataset.
Data na facts, information, observations and measurements dem wey people dey use find tori and take support better decisions. Data point na one unit data inside dataset, wey be kumpilation of data points. Datasets fit show for different formats and structures, and e go dey depend on where e come from. For example, company monthly income fit dey for spreadsheet but heart rate data wey dey comot from smartwatch fit dey for [JSON](https://stackoverflow.com/a/383699) format. E normal for data scientists to dey work with different kain data inside dataset.
This lesson go focus on how to identify and classify data based on e characteristics and e source.
Dis lesson go focus on how to sabi and classify data based on how e be and where e come from.
## [Pre-Lecture Quiz](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## How Data dey Described
## How Data is Described
### Raw Data
Raw data na data wey come from e source as e be originally and dem never analyze or arrange am. To fit understand wetin dey happen for one dataset, dem go need arrange am for format wey humans and the technology wey dem dey use fit understand. The structure of dataset dey describe how dem arrange am and e fit dey classified as structured, unstructured, and semi-structured. This type of structure go depend on the source but e go still fall under these three categories.
Raw data na data wey just come from where e start and no don analyze or organize am. To fit understand wetin dey happen for dataset, e need to organize am so that people and technology fit understand am well and fit analyze am well. How dataset take arrange na im them dey call structure and e fit be structured, unstructured or semi-structured. Dis kain structure dey different based on where e come, but e go always fit inside these three tins.
### Quantitative Data
Quantitative data na numbers wey dem observe inside dataset and e fit dey analyzed, measured, and used mathematically. Some example of quantitative data na: population of one country, height of one person, or quarterly earnings of one company. If dem analyze quantitative data well, e fit help discover seasonal trends for Air Quality Index (AQI) or estimate the chance of rush hour traffic for normal work day.
Quantitative data na numbers wey dey show inside dataset and people fit analyze am, measure am and use am for maths. Example be population for country, person height or company money for quarter. With small extra analysis, quantitative data fit help know seasonal pattern for Air Quality Index (AQI) or estimate how e go be for rush hour traffic for normal work day.
### Qualitative Data
Qualitative data, wey people dey also call categorical data, na data wey person no fit measure like quantitative data. E dey usually be different formats of data wey dey capture the quality of something, like product or process. Sometimes, qualitative data fit be numbers but e no dey used mathematically, like phone numbers or timestamps. Some example of qualitative data na: video comments, the make and model of one car, or your close friends favorite color. Qualitative data fit help understand which product customers like pass or identify popular keywords for job application resumes.
Qualitative data, wey dem also dey call categorical data, na data wey you no fit measure am like quantitative data. Na subjective data wey describe quality of product or process. Sometimes qualitative data fit get numbers but you no go use am for maths, like phone numbers or timestamps. Examples be video comments, car make and model or your friends favourite color. Qualitative data fit help understand which product people like or find out popular keywords for job resumes.
### Structured Data
Structured data na data wey dem arrange for rows and columns, where each row go get the same set of columns. Columns dey represent value of one particular type and dem go get name wey dey describe wetin the value mean, while rows dey carry the actual values. Columns go often get specific rules or restrictions for the values to make sure say the values dey represent the column well. For example, imagine one spreadsheet of customers where each row must get phone number and the phone numbers no fit get alphabetical characters. Dem fit put rules for the phone number column to make sure say e no dey empty and e only get numbers.
Structured data na data wey arrange for rows and columns, each row get the same number columns. Columns dey represent type of value wey dey inside, and e get name to show wetin e mean, while rows get the real numbers. Columns get rule or restriction so the values go correct. For example, spreadsheet for customers wey each row get phone number and phone numbers no get alphabet. Dem fit get rule for phone column to make sure no empty and na numbers only.
One benefit of structured data na say e fit dey arranged in way wey e fit relate to other structured data. But because the data dey designed to dey arranged in specific way, to change the overall structure fit take plenty effort. For example, if you wan add email column to the customer spreadsheet wey no fit dey empty, you go need figure out how you go take add these values to the existing rows of customers for the dataset.
Good side of structured data be say you fit relate am to other structured data. But because e get special way wey you suppose arrange am, to change am fit hard. For example, if you wan add email column for customer spreadsheet wey no fit dey empty, you need plan how to put email address for rows wey already get customer data.
Examples of structured data: spreadsheets, relational databases, phone numbers, bank statements
Example of structured data: spreadsheets, relational databases, phone numbers, bank statements
### Unstructured Data
Unstructured data no dey fit categorize into rows or columns and e no get format or set of rules to follow. Because unstructured data no get plenty restrictions for e structure, e dey easier to add new information compared to structured dataset. If one sensor wey dey capture data for barometric pressure every 2 minutes don get update wey go allow am measure and record temperature, e no go need change the existing data if e dey unstructured. But this fit make analyzing or investigating this type of data take longer. For example, one scientist wey wan find the average temperature of the previous month from the sensor data fit discover say the sensor record "e" for some of e data to show say e spoil instead of normal number, wey mean say the data no complete.
Unstructured data no too fit arrange for rows and columns, e no get particular format or rule. Because e no get many restriction, e easier to add new info than structured dataset. If sensor wey dey capture barometric pressure every 2 minutes get update to measure temperature, e no need change old data if e unstructured. But e fit make analysis or investigation of this data long pass. For example, scientist wey wan find average temperature for last month from sensor data, but find say sensor record "e" for some data to show say e spoil, no be normal number, so e mean data no complete.
Examples of unstructured data: text files, text messages, video files
Example of unstructured data: text files, text messages, video files
### Semi-structured
Semi-structured data get features wey make am be mix of structured and unstructured data. E no dey usually follow format of rows and columns but e dey arranged in way wey dem fit call structured and e fit follow fixed format or set of rules. The structure go vary between sources, like well-defined hierarchy to something wey dey more flexible wey go allow easy integration of new information. Metadata na indicators wey dey help decide how dem go arrange and store the data and e go get different names based on the type of data. Some common names for metadata na tags, elements, entities, and attributes. For example, one typical email message go get subject, body, and set of recipients and e fit dey arranged by who or when dem send am.
Semi-structured data get characteristics wey combine structured and unstructured data. E no dey arrange in rows and columns like structured but e get way wey people consider organized and e fit follow fixed format or rule. Structure go different base on source, from well arranged hierarchy to flexible way wey fit easily add new info. Metadata na signs wey help decide how data take arrange and store and get different names based on data type. Some metadata names na tags, elements, entities and attributes. For example, normal email get subject, body and recipients, and you fit arrange am based on who send am or when e send.
Examples of semi-structured data: HTML, CSV files, JavaScript Object Notation (JSON)
Example of semi-structured data: HTML, CSV files, JavaScript Object Notation (JSON)
## Sources of Data
Data source na the original place where the data dey come from or where e "live" and e go vary based on how and when dem collect am. Data wey e user(s) generate na primary data while secondary data dey come from source wey don collect data for general use. For example, one group of scientists wey dey collect observations for rainforest go be primary and if dem decide to share am with other scientists, e go be secondary to those wey dey use am.
Data source na the place wey data start from or where e "live" and e dey different depending on how and when dem collect am. Data wey user create na primary data, secondary data dey come from source wey collect am for general use. For example, group scientists collecting observation for rainforest na primary, but if dem share am with other scientists e go be secondary to people wey use am.
Databases na common source and dem dey rely on database management system to host and maintain the data where users dey use commands wey dem dey call queries to explore the data. Files as data sources fit be audio, image, and video files as well as spreadsheets like Excel. Internet sources na common place wey dem dey host data, where databases and files fit dey. Application programming interfaces, wey people dey call APIs, dey allow programmers create ways to share data with external users through internet, while the process of web scraping dey extract data from web page. The [lessons in Working with Data](../../../../../../../../../2-Working-With-Data) dey focus on how to use different data sources.
Databases popular source, dem use database management system host and manage data, users use commands called queries explore data. Files fit be audio, image, video and spreadsheets like Excel. Internet also be big place for data, where you go find databases and files. Application programming interfaces (APIs) help programmers create way to share data with outside users via internet. Web scraping na process to collect data from web page. [lessons in Working with Data](../../../../../../../../../2-Working-With-Data) dey show how to use different data sources.
## Conclusion
For this lesson we don learn:
For dis lesson we don learn:
- Wetin data be
- How dem dey describe data
- How people dey describe data
- How dem dey classify and categorize data
- Where dem fit find data
- Where you fit find data
## 🚀 Challenge
Kaggle na better place to find open datasets. Use the [dataset search tool](https://www.kaggle.com/datasets) to find some interesting datasets and classify 3-5 datasets with this criteria:
Kaggle na beta place to find open datasets. Use the [dataset search tool](https://www.kaggle.com/datasets) find some interesting datasets and classify 3-5 datasets with this criteria:
- The data na quantitative or qualitative?
- The data na structured, unstructured, or semi-structured?
- Na quantitative or qualitative data?
- Na structured, unstructured or semi-structured data?
## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ds/quiz/5)
@ -65,7 +65,7 @@ Kaggle na better place to find open datasets. Use the [dataset search tool](http
## Review & Self Study
- This Microsoft Learn unit, wey dem title [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) get detailed breakdown of structured, semi-structured, and unstructured data.
- Dis Microsoft Learn unit, wey dem title am [Identify data formats](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text), get detailed explanation of structured, semi-structured and unstructured data.
## Assignment
@ -74,6 +74,6 @@ Kaggle na better place to find open datasets. Use the [dataset search tool](http
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Disclaimer**:
Dis dokyument don use AI transleto service [Co-op Translator](https://github.com/Azure/co-op-translator) do di translation. Even though we dey try make am accurate, abeg sabi say machine translation fit get mistake or no dey correct well. Di original dokyument wey dey for im native language na di main source wey you go trust. For important information, e better make professional human transleto check am. We no go fit take blame for any misunderstanding or wrong interpretation wey fit happen because you use dis translation.
**Disclaimer**:
Dis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Introduction to Probability and Statistics\n",
"For dis notebook, we go play with some of di concepts we don tok before. Plenty concepts from probability and statistics dey well show for big libraries wey dey do data processing for Python, like `numpy` and `pandas`.\n"
"# Intro to Probability and Statistics\n",
"For dis notebook, we go dey play wit some of di concepts we don talk before. Plenti ideas from probability and statistics dey well represent for major libraries for data processing for Python, like `numpy` and `pandas`.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## Random Variables and Distributions\n",
"Make we start by draw sample of 30 values from one uniform distribution wey dey from 0 go 9. We go also calculate mean and variance.\n"
"Mek we start by draw sample of 30 values from one uniform distribution from 0 reach 9. We go also calculate mean and variance.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"To visually estimate how many different values dem get for the sample, we fit plot di **histogram**:\n"
"To visually estimate how many different values den dey for di sample, we fit plot di **histogram**:\n"
]
},
{
@ -80,7 +80,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> We dey use one package wey dem dey call [**Pandas**](https://pandas.pydata.org/) here for data analysis. We go talk more about Pandas and how to dey work with data for Python later for this course.\n",
"> We dey use one package wey dem dey call [**Pandas**](https://pandas.pydata.org/) here for data analysis. We go talk more about Pandas and how to waka with data for Python later for this course.\n",
"\n",
"Make we calculate average values for age, height and weight:\n"
]
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Now make we focus on height, and calculate standard deviation and variance:\n"
"Now mek we focus on height, and calculate standard deviation and variance: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Besides mean, e dey make sense to look di median value and quartiles. Dem fit show for **box plot**:\n"
"Besides di mean, e make sense to look di median value and di quartiles. Dem fit show am with **box plot**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Wi fit also make box plots of small parts of our dataset, for example, group by player role.\n"
"We fit also make box plots for small small part dem of our dataset, like how e be when we group am by player role.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Note**: Dis diagram dey show say, for average, di height of first basemen taller pass di height of second basemen. Later we go learn how to test dis hypothesis for forma way, and how to show say our data get statistical meaning to prove am. \n",
"> **Note**: Dis diagram mean say, on top finish, di height of first basemen pass di height of second basemen. Later, we go learn how we fit test dis assumption well-well, and how to show say our data get statistical meaning to prove am. \n",
"\n",
"Age, height and weight na continuous random variables. Wetin you think na di distribution dem get? One beta way to sabi na to plot di histogram of values: \n"
"Age, height and weight na all continuous random variables. Wetin you think be dia distribution? One beta way we fit find am be to draw the histogram of di values: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## Normal Distribution\n",
"\n",
"Make we create one artificial sample of weights wey follow normal distribution wey get the same mean and variance as our real data:\n"
"Make we create one artificial sample of weights wey follow normal distribution wey get the same mean and variance as the real data wey we get:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Since most values for real life dey normally distributed, we no suppose use uniform random number generator to generate sample data. Na wetin go happen if we try generate weights with uniform distribution (wey `np.random.rand` generate):\n"
"Since most values for real life dey normally distributed, we no suppose use uniform random number generator to generate sample data. Na wetin go happen if we try generate weights with uniform distribution (wey `np.random.rand` generate) be dis:\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Confidence Intervals\n",
"\n",
"Make we calculate confidence intervals for the weights and heights of baseball players now. We go use the code [from this stackoverflow discussion](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Make we calculate confidence intervals for weights and heights of baseball players now. We go use de code [from this stackoverflow discussion](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## Hypothesis Testing\n",
"\n",
"Make we check different role dem for our baseball players dataset:\n"
"Mek we explore different roles for our baseball players dataset:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Make we test di hypothesis say First Basemen tall pass Second Basemen. Di easiest way to do dis na to test di confidence intervals:\n"
"Make we test di tok say First Basemen dey taller pass Second Basemen. Di easiest way to do am na to test di confidence intervals:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"We fit see say di intervals no dey overlap.\n",
"We fit see sey di intervals no dey overlap.\n",
"\n",
"One statistically correct way to take prove di hypothesis na to use **Student t-test**:\n"
"One statistically beta wei to prove di hypothesis na to use **Student t-test**:\n"
]
},
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Di two values wey di `ttest_ind` function return na:\n",
"* p-value fit be considered as di chance say two distributions get di same mean. For our case, e low well well, meaning say e get strong evidence wey dey support say first basemen tall pass.\n",
"* t-value na di intermediate value of normalized mean difference wey dem dey use for di t-test, and dem dey compare am against one threshold value based on di confidence value wey dem set.\n"
"Di two value wey di `ttest_ind` function return na:\n",
"* p-value fit be di chance say two distribution get di same mean. For our case, e low sotay, which mean say e get strong evidence wey support say di first basemen dem taller.\n",
"* t-value na di level wey mean difference don normalize and na im dem dey use for di t-test, and dem dey compare am against one threshold value wey dem get for one confidence value.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Simulating a Normal Distribution wit di Central Limit Theorem\n",
"## Simulate Normal Distribution Wit Central Limit Theorem\n",
"\n",
"Di pseudo-random generator wey dey Python na him dem design to give us uniform distribution. If we wan create generator for normal distribution, we fit use di central limit theorem. To get normal distributed value, we go just compute di mean of uniform-generated sample.\n"
"Di pseudo-random generator for Python na to give us uniform distribution. If we wan create generator wey dey give normal distribution, we fit use central limit theorem. To get normal distribution value, we go just calculate mean of uniform-generated sample.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Correlation and Evil Baseball Corp\n",
"\n",
"Correlation dey allow us find relationship between data sequences. For our toy example, mek we pretend say one evil baseball corporation dey wey dey pay dia players base on how tall dem be - di taller di player be, di more money e go get. Make we suppose say base salary na $1000, plus bonus wey fit be from $0 to $100, depending on height. We go use real players from MLB, come calculate dia imaginary salaries:\n"
"Correlation dey help us find relation dem between data sequence dem. For our small example, mek we pretend say one evil baseball company dey wey dey pay im players based on dia height - di taller di player be, di more money wey im go get. Make we suppose say di base salary na $1000, plus one bonus from $0 reach $100, wey depend on height. We go use real players from MLB, then calculate dem imaginary salary dem:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Make we calculate covariance and correlation of those sequences now. `np.cov` go give us wetin dem dey call **covariance matrix**, wey be extension of covariance to plenti variables. The element $M_{ij}$ for covariance matrix $M$ na correlation between input variables $X_i$ and $X_j$, and the diagonal values $M_{ii}$ na the variance of $X_{i}$. Likewise, `np.corrcoef` go give us the **correlation matrix**.\n"
"Make we now calculate covariance and correlation of those sequences. `np.cov` go give us one kain **covariance matrix**, wey be extension of covariance to many variables dem. The element $M_{ij}$ for the covariance matrix $M$ na correlation between input variables $X_i$ and $X_j$, and diagonal values $M_{ii}$ na the variance of $X_{i}$. E same way, `np.corrcoef` go give us the **correlation matrix**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"One correlation wey equal to 1 mean say e get strong **linear relation** between two variables. We fit see di linear relation clearly by plotting one value against the oda:\n"
"Correlation wey equal to 1 mean say two variables get strong **linear relation**. We fit see the linear relation gidigba if we plot one value against the oda:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Make we see wetin go happen if the relation no be linear. Suppose say our company decide hide the clear linear dependence between heights and salaries, and put some non-linearity inside the formula, like `sin`:\n"
"Make we see wetin go happen if relation no be linear. Suppose say our company decide to hide the obvious linear dependency between heights and salaries, and put some non-linearity inside the formula, like `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"For dis kain case, di correlation small small reduce, but e still high well well. Now, to make di relation no too clear, we fit add some extra randomness by adding some random variable for di salary. Make we see wetin go happen:\n"
"For dis case, di correlation small small, but e still high well well. Now, if we wan make di relation no too show, we fit add extra randomness by putting some random variable for di salary. Make we see wetin go happen:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> You fit guess why di dots dem line up to vertical lines like dis?\n",
"> You fit gess why di dots dem line up into vertical line like dis?\n",
"\n",
"We don observe di connection between one artificial engineered idea like salary and di thing wey we dey observe *height*. Make we also check if di two observed variables, like height and weight, get connection too:\n"
"We don observe di connection wey dey between one artificially engineer concept like salary and di observed variable *height*. Make we try see if di two observed variables dem, like height and weight, dey relate too:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Unfortunately, we no see any results - na only some kind strange `nan` values. Dis one happen because some of di values inside our series no get definition, wey dem represent as `nan`, wey cause di result of di operation to be no defined too. If we look di matrix, we fit see say `Weight` na di column wey dey cause wahala, because self-correlation between `Height` values don already calculate.\n",
"Unfortunenitly, we no get any results - na only some strange `nan` values. Dis na becos some of di values for our series no get meaning, dem represent as `nan`, wey dey cause di result of di operation to no get meaning too. By lookin di matrix we fit see say `Weight` na di problem column, becos self-correlation between `Height` values don compute.\n",
"\n",
"> Dis example show how **data preparation** and **cleaning** important. Without correct data, we no fit calculate anything.\n",
"> Dis example dey show di importance of **data preparation** and **cleaning**. Without correct data we no fit compute anything.\n",
"\n",
"Make we use `fillna` method to fill di missing values, then calculate di correlation:\n"
"Make we use `fillna` method to fill di missing values, and compute di correlation: \n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"True true, e get correlation, but e no strong like for our artificial example. If we look the scatter plot wey show one value against the other, the relation no go too clear:\n"
"E get correlation for true, but e no strong like for our fake example. True true, if we check scatter plot wey show one value con face the oda, the relation no go too clear like dat:\n"
]
},
{
@ -535,16 +535,16 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Conclusion\n",
"## Konklushon\n",
"\n",
"For dis notebook we don learn how to perform basic operations on data to calculate statistical functions. Now we sabi how to use correct math and statistics tools to prove some hypotheses, and how to calculate confidence intervals for any variables wey get data sample.\n"
"For dis notebook, we don learn how to do basic operations for data to calculate statistical functions dem. Now we sabi how to use beta math and statistics tools to take prove some hypotheses, plus how to calculate confidence intervals for any kind variables based on data sample. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Disclaimer**:\nDis dokument don translate wit AI translation service wey dem dey call [Co-op Translator](https://github.com/Azure/co-op-translator). Even though we dey try make am correct, abeg sabi say automatic translation fit get some mistake or no too clear. The original dokument wey dem write for im correct language na the real correct source. If na serious matter, better make professional human person translate am. We no go take responsibility if person no understand or misunderstand because of dis translation.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Disclaimer**:\nDis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T22:20:00+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pcm"
}
},
"nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Estimation of COVID-19 Pandemic\n",
"# Estimɛshon of COVID-19 Pandɛmɪk\n",
"\n",
"## Loading Data\n",
"## Lodin Data\n",
"\n",
"We go use data on COVID-19 infected people dem, wey the [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) for [Johns Hopkins University](https://jhu.edu/) provide. Dataset dey available for [this GitHub Repository](https://github.com/CSSEGISandData/COVID-19).\n"
"We go use data about COVID-19 pipo wey dem don ketch, wey di [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) for [Johns Hopkins University](https://jhu.edu/) provide. Di dataset dey for [this GitHub Repository](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"We fit load di most recent data straight from GitHub wit `pd.read_csv`. If somtin make di data no dey, you fit still use di copy wey dey for your own machine for di `data` folder - just remove di comment for di line wey define `base_url`:\n"
"We fit load di most recent data straight from GitHub using `pd.read_csv`. If for any reason di data no dey, you fit always use di copy wey dey local for di `data` folder - just remove di comment for di line wey define `base_url` below:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Make we now load di data for people wey get infection and see how di data be:\n"
"Make we now load di data for di pipol wey get infection and see how di data be:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"We fit see say each row for the table dey show how many people catch the sickness for each country and/or province, and the columns na for dates. Similar tables fit load for other data, like how many people don recover and how many don die.\n"
"We fit see sey each row for di table dey show the number of people wey get disease for each country and/or province, and the column dem match to dates. Tables wey be like this one na wetin fit load for other data too, like how many people don recover and how many don die.\n"
]
},
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Making Sense of the Data\n",
"## Understanding Di Data\n",
"\n",
"From di table wey dey above di role of province column no clear. Make we see di different values wey dey for `Province/State` column:\n"
"From di table wey dey above, di role of di province column no clear. Make we check di different values wey dey inside di `Province/State` column:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"From di names we fit tok say countries like Australia and China get more detailed breakdown by provinces. Make we find information for China to see di example:\n"
"From di names, we fit talk say countries like Australia and China get more detailed breakdown by provinces. Make we look for info for China to see di example:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pre-processing the Data \n",
"## Pre-processing di Data \n",
"\n",
"We no dey interested to break countries down to more territories, so we go first comot dis breakdown and add information for all territories together, make we get info for the whole country. You fit do dis one using `groupby`:\n"
"We no dey interested to divide countries into more small parts, so first we go remove dis division and add info for all di territories together, make we get info for di whole country. You fit do am with `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"You fit see say because we use `groupby` all DataFrames dey indexed by Country/Region now. So, we fit access data for one particular country by using `.loc`:|\n"
"You fit see say because of how we take use `groupby` all DataFrames dem don dey indexed by Country/Region. So, we fit access data for one kain country by using `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Note** how we dey use `[3:]` to comot di first three elements for sequence wey get non-date metadata (di Province/State and geolocation columns). We fit also comot those three columns completely:\n"
"> **Note** how we use `[3:]` to comot di fust three tins for one sequence wey get non-date metadata (di Province/State and geolocation columns). We fit also drop dem three columns full ground:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Investigating the Data\n",
"## Investigate Di Data\n",
"\n",
"Make we now switch go investigate one specific kontri. Make we create one frame wey get data on infections wey dem index by date:\n"
"Make we switch now to investigate one confirmed kontri. Make we create one frame wey get data on infections wey dem index by date:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Now mek we calculate how many new people dem dey infect every day. Dis one go help us see how fast di pandemic dey spread. Di easiest way to do am na to use `diff`:\n"
"Now mek we calculate di number of new pipo wey catch belle each day. Dis go help us see how fast di pandemic dey progress. Di easiest way to do am na to use `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"We fit see high fluctuations for data. Make we look closer for one of di months:\n"
"We fit see say data dey change well well. Make we look one of di months closer:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"E clear say data dey get weekly wahala. Because we wan fit see di trend, e make sense to smooth di curve by calculating running average (na im mean say for each day, we go calculate di average value of di previous several days):\n"
"E clear say data get weekly wahala. Because we want fit see di trends well, e make sense make we smooth out di curve by calculate running average (dat mean for each day we go calculate average value for di previous several days):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"To fit compare plenti kontri, we fit wan consider di kontri population, and compare di percentage of pipul wey get sick based on di kontri population. To get di kontri population, make we load di kontri dataset:\n"
"To fit compare many countries, we fit wan consider the population of the country, and compare the percentage of people wey get infection based on the population of the country. To fit get the population of the country, make we load the dataset of countries:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Bicos dis dataset get information for both countries and provinces, to sabi di population for di whole country, we gats use small sharpness:\n"
"Becos dis dataset get information about both countries and provinces, to fit get di population of di whole country, we need small sharpness: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Computing $R_t$\n",
"\n",
"To see how infectious di disease dey, we go look di **basic reproduction number** $R_0$, wey talk how many people one infected person fit infect more. When $R_0$ pass 1, e mean say di epidemic fit spread.\n",
"To sabi how contagious di disease be, we dey look di **basic reproduction number** $R_0$, wey show how many pipo dem person wey get di disease fit infect again. When $R_0$ pass 1, e mean say di epidemic fit spread.\n",
"\n",
"$R_0$ na di disease own property, e no dey consider some protection wey people fit do to slow di pandemic. During di pandemic time, we fit estimate di reproduction number $R_t$ anytime for time $t$. Dem don show say dis number fit roughly calculate by tokkon tokka 8 days, den calculate $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"wey $I_t$ be di number of people wey just catch di infection for day $t$.\n",
"$R_0$ na property of di disease on top itself, e no dey consider some protection wey pipo fit use to slow down di pandemic. During di pandemic wey dey happen, we fit calculate di reproduction number $R_t$ anytime $t$. E don show say dis number fit roughly calculate by taking 8 days window, then compute $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"wey $I_t$ mean di number of new pipo wey disease catch for day $t$.\n",
"\n",
"Make we calculate $R_t$ for our pandemic data. To do dis, we go take one rolling window of 8 `ninfected` values, den apply di formula to calculate di ratio wey dey above:\n"
"Make we compute $R_t$ for our pandemic data. To do dis one, we go take rolling window of 8 `ninfected` values, then apply di function to calculate di ratio wey dey up top:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"You fit see say some gap dey for the graph. Dem fit be cause by either `NaN`, or if `inf` values dey for di dataset. `inf` fit happen if person divide by 0, and `NaN` fit mean say data dey miss, or no data dey to calculate di result (like for di very beginning of our frame, where rolling window wey get width 8 never dey yet). To make di graph fine well, we need fill those values with `replace` and `fillna` function.\n",
"You fit see say some gaps dey for di graph. Dem fit happen because of `NaN` or if `inf` values dey for di dataset. `inf` fit happen if division by 0, and `NaN` fit mean say data no dey, or no data dey to calculate the result (like for di very start of our frame, where di rolling window wey width na 8 no don show yet). To make di graph fine, we gats fill those values using `replace` and `fillna` function.\n",
"\n",
"Make we still look di beginning of di pandemic. We go also limit di y-axis values to show only values wey dey below 6, so dat we fit see better, and draw horizontal line for 1.\n"
"Make we look di beginning of di pandemic again. We go also limit di y-axis values to show only values wey dey below 6, so that we fit see am better, and draw horizontal line at 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Anoda interesting indicator of di pandemic na di **derivative**, or di **daily difference** for new cases. E dey allow us to see clear when di pandemic dey increase or dey decline.\n"
"Another interesting indicator of the pandemic na di **derivative**, or **daily difference** for new cases. E dey allow us to clear see when pandemic dey increase or dey go down. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Given di fact say plenti fluctuations dey for data because reporting, e make sense to smooth di curve by running rolling average to see di overall picture. Make we again focus for di first months of di pandemic:\n"
"Givind di fact say data get plenti fluctuation wey reporting dey cause, e make sense to smooth di curve by run rolling average to get di overal picture. Make we again focus on di first months of di pandemic:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Challenge\n",
"\n",
"Now na time for you to play more wit di code and data! Here be some suggestions wey you fit try experiment wit:\n",
"Now na time for you to play more wit di code an data! Here some tins wey you fit try:\n",
"* See how di pandemic spread for different countries.\n",
"* Plot $R_t$ graphs for plenty countries for one plot make you fit compare, or make plenty plots side-by-side\n",
"* See how di number of deaths and recoveries dey relate to number of infected cases.\n",
"* Try find out how long one normal disease dey last by visually dey compare infection rate and deaths rate and dey look for some gbege. You fit need look different countries to find dat one out.\n",
"* Calculate di fatality rate and how e dey change over time. You fit wan consider di length of di disease for days to shift one time series before you do calculations\n"
"* Make $R_t$ graphs for plenty countries for one graph make you fit compare, or make plenty graphs side-by-side\n",
"* See how di number of death and recovery join wit di number of people wey sick.\n",
"* Try find how long normal disease dey last by looking di infection rate and death rate togeder an dey watch for some palava. You fit need look different countries to sabi dat.\n",
"* Calculate di fatality rate an how e dey change as time dey go. You fit wan consider how long disease dey last in days to shift one time series before you do calculation\n"
]
},
{
@ -2406,7 +2408,7 @@
"source": [
"## References\n",
"\n",
"You fit look at more studies about how COVID epidemic take spread for the following publications:\n",
"You fit check more studies about how COVID take spread for dis kain publications:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blog post by [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Code for the above paper on GitHub](https://github.com/shwars/SlidingSIR)\n"
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Warning**: \nDis document don translate with AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we try to make am correct, abeg sabi say automated translation fit get mistakes or wrong tins. Di ogbonge original document for e own language na di correct one. If na serious matter, better make person wey sabi human translation do am. We no go responsible if anybody missunderstand or misinterpret anything wey dem see for dis translation.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Disclaimer**:\nDis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,33 +1,33 @@
# Dangerous Liaisons data visualization project
To start, make sure say NPM and Node dey run for your machine. Install di dependencies (npm install) and then run di project for your local machine (npm run serve):
To stat, you gats sure say you get NPM and Node **>=20.0.0** wey dey run for your machine. Install the dependencies (npm install) den run the project local (npm run serve):
## Project setup
```
npm install
```
### E go compile and dey reload for development
### Compiles and hot-reloads for development
```
npm run serve
```
### E go compile and reduce size for production
### Compiles and minifies for production
```
npm run build
```
### E dey check and correct files
### Lints and fixes files
```
npm run lint
```
### Make di configuration how you want am
Check [Configuration Reference](https://cli.vuejs.org/config/).
### Customize configuration
See [Configuration Reference](https://cli.vuejs.org/config/).
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Disclaimer**:
Dis dokyument don use AI transleshion service [Co-op Translator](https://github.com/Azure/co-op-translator) do di transleshion. Even as we dey try make am accurate, abeg make you sabi say machine transleshion fit get mistake or no dey correct well. Di original dokyument wey dey for im native language na di main source wey you go fit trust. For important informashon, e good make you use professional human transleshion. We no go fit take blame for any misunderstanding or wrong way you go take understand di transleshion wey dis dokyument get.
**Disclaimer**:
Dis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,18 +1,18 @@
# Dangerous Liaisons data visualization project
# Dangerous Liaisons data visualize project
To start, make sure say NPM and Node dey run for your machine. Install di dependencies (npm install) and then run di project for your local machine (npm run serve):
To start, you need make sure say you get NPM and Node **>=20.0.0** wey dey run for your machine. Install di dependencies (npm install) then run di project for your machine (npm run serve):
## Project setup
```
npm install
```
### E go compile and dey hot-reload for development
### E dey compile and hot-reload for development
```
npm run serve
```
### E go compile and minify for production
### E dey compile and minify for production
```
npm run build
```
@ -22,12 +22,12 @@ npm run build
npm run lint
```
### Make di configuration how you want am
Check [Configuration Reference](https://cli.vuejs.org/config/).
### Customize your configuration
See [Configuration Reference](https://cli.vuejs.org/config/).
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Disclaimer**:
Dis dokyument don use AI transleshion service [Co-op Translator](https://github.com/Azure/co-op-translator) do di transleshion. Even as we dey try make am accurate, abeg make you sabi say machine transleshion fit get mistake or no dey correct well. Di original dokyument wey dey for im native language na di one wey you go take as di main source. For important informashon, e good make you use professional human transleshion. We no go fit take blame for any misunderstanding or wrong meaning wey fit happen because you use dis transleshion.
**Disclaimer**:
Dis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "ta"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T10:25:41+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T22:28:14+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "ta"
},
@ -42,8 +42,8 @@
"language_code": "ta"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-10-11T15:34:43+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T22:34:31+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "ta"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "ta"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T22:29:19+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ta"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-10-11T15:32:24+00:00",
@ -108,8 +114,8 @@
"language_code": "ta"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T10:27:22+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T22:27:43+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "ta"
},
@ -192,14 +198,14 @@
"language_code": "ta"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-10-11T15:57:02+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:34:39+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "ta"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-10-11T15:57:13+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:34:34+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "ta"
},

File diff suppressed because one or more lines are too long

@ -1,76 +1,79 @@
# தரவுகளை வரையறுத்தல்
# தரவை வரையறுத்தல்
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|![ [(@sketchthedocs)](https://sketchthedocs.dev) மூலம் வரைவுக் குறிப்பு ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|தரவுகளை வரையறுத்தல் - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
|தரவை வரையறுத்தல் - _[@nitya](https://twitter.com/nitya) அவர்களுடைய வரைவுக் குறிப்பு_ |
தரவு என்பது உண்மைகள், தகவல்கள், கவனிப்புகள் மற்றும் அளவீடுகள் ஆகும், இது கண்டுபிடிப்புகளை செய்யவும், அறிவார்ந்த முடிவுகளை ஆதரிக்கவும் பயன்படுத்தப்படுகிறது. ஒரு தரவுப் புள்ளி என்பது ஒரு தரவுத்தொகுப்பில் உள்ள ஒரு தனித்துவமான தரவின் அலகாகும், இது பல தரவுப் புள்ளிகளின் தொகுப்பாகும். தரவுத்தொகுப்புகள் பல்வேறு வடிவங்களில் மற்றும் அமைப்புகளில் வரலாம், மேலும் பொதுவாக அதன் மூலத்தை அல்லது தரவு எங்கிருந்து வந்தது என்பதை அடிப்படையாகக் கொண்டிருக்கும். உதாரணமாக, ஒரு நிறுவனத்தின் மாதாந்திர வருமானம் ஒரு ஸ்பிரெட்ஷீட்டில் இருக்கலாம், ஆனால் ஸ்மார்ட்வாட்சிலிருந்து வரும் மணிநேர இதய துடிப்பு தரவு [JSON](https://stackoverflow.com/a/383699) வடிவத்தில் இருக்கலாம். ஒரு தரவியல் விஞ்ஞானி ஒரு தரவுத்தொகுப்பில் பல்வேறு வகையான தரவுகளுடன் வேலை செய்வது பொதுவானது.
தரவு என்பது கண்டுபிடிப்புகளுக்கு உதவ மற்றும் அறிவார்ந்த முடிவுகளை ஆதரிக்க பயன்படுத்தப்படும் உண்மைகள், தகவல்கள், கவனிப்புகள் மற்றும் அளவீடுகள் ஆகும். ஒரு தரவு புள்ளி என்பது ஒரு தரவு தொகுப்பிற்குள் உள்ள தனி தரவு அலகு ஆகும், இது பல தரவு புள்ளிகளைச் சேகரித்துள்ளது. தரவு தொகுப்புகள் வெவ்வேறு வடிவமைப்புகளிலும் அமைப்புகளிலும் வரக்கூடும், மற்றும் பொதுவாக அதன் மூலத்திலோ, அதாவது தரவு எங்கு வந்ததோ அதற்கு அடிப்படையாக இருக்கும். உதாரணமாக, ஒரு நிறுவனத்தின் மாதாந்திர வருமானம் காரியப்பட்டியில் இருக்கலாம் ஆனால் ஸ்மார்ட்வாட்ச் மூலம் பெறப்படும் மணிநேரம் HR தரவு [JSON](https://stackoverflow.com/a/383699) வடிவத்தில் இருக்கலாம். ஒரு தரவுத்தಜ்ஞர் பல்வேறு வகை தரவுகளுடன் ஒரு தொகுப்பிற்குள் வேலை செய்வது சாதாரணமாக இருக்கும்.
இந்த பாடம் தரவின் பண்புகள் மற்றும் அதன் மூலங்களை அடிப்படையாகக் கொண்டு அதை அடையாளம் காணவும் வகைப்படுத்தவும் கவனம் செலுத்துகிறது.
இந்த பாடம் தரவை அதன் பண்புகள் மற்றும் அதன் மூலங்களை அடிப்படையாகக் கொண்டு அடையாளம் காண்பதும் வகைப்படுத்துவதும் மீது கவனம் செலுத்துகிறது.
## [பாடத்திற்கு முன் வினாடி வினா](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## [முன்னோட்டக் கேள்வித்தாள்](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## தரவு எப்படி விவரிக்கப்படுகிறது
## தரவுகள் எப்படி விவரிக்கப்படுகின்றன
### நிகர்மானி தரவு
நிகர்மானி தரவு என்பது துவக்க மூலத்திலிருந்து வந்த மற்றும் பகுப்பாய்வு செய்யப்படாத அல்லது ஒழுங்குபடுத்தப்படாத தரவு ஆகும். ஒரு தரவு தொகுப்பில் என்ன நடக்கின்றதோ என்பதை உணர்பதற்கு, அது மனிதர்களுக்கும் பரிசோதனைக்கு பயன்படும் தொழில்நுட்பத்திற்கும் புரிந்துகொள்ளக்கூடிய வடிவத்தில் ஒழுங்குபடுத்தப்பட வேண்டும். ஒரு தரவு தொகுப்பின் அமைப்பு அது எப்படி ஒழுங்குபடுத்தபட்டுள்ளது என்பதை விவரிக்கிறது மற்றும் அமைப்பு, அமைக்கப்படாத மற்றும் அரை-சூழலியல் என வகைப்படுத்தப்படலாம். இந்த அமைப்பு வகைகள் மூலத்தின் அடிப்படையால் மாறுபடும், ஆனால் இவை மூன்று பிரிவுகளிலும் இறுதி கட்டத்தில் பொருந்தும்.
### மூலதரவு
மூலதரவு என்பது அதன் மூலத்திலிருந்து அதன் ஆரம்ப நிலையில் வந்த தரவாகும், மேலும் இது பகுப்பாய்வு செய்யப்படவில்லை அல்லது ஒழுங்குபடுத்தப்படவில்லை. ஒரு தரவுத்தொகுப்பில் என்ன நடக்கிறது என்பதைப் புரிந்துகொள்ள, அதை மனிதர்களால் புரிந்துகொள்ளக்கூடிய வடிவமாகவும், மேலும் அதை மேலும் பகுப்பாய்வு செய்ய பயன்படுத்தக்கூடிய தொழில்நுட்பத்தால் புரிந்துகொள்ளக்கூடியதாகவும் ஒழுங்குபடுத்த வேண்டும். ஒரு தரவுத்தொகுப்பின் அமைப்பு அது எப்படி ஒழுங்குபடுத்தப்பட்டுள்ளது என்பதை விவரிக்கிறது மற்றும் அமைப்புக்கூடானது, அமைப்பில்லாதது மற்றும் பகுதி அமைப்புக்கூடானது என வகைப்படுத்தப்படலாம். இந்த அமைப்பின் வகைகள் மூலத்தைப் பொறுத்து மாறுபடும், ஆனால் இறுதியில் இந்த மூன்று வகைகளில் ஒன்றில் பொருந்தும்.
### அளவிடக்கூடிய தரவு
அளவிடக்கூடிய தரவு என்பது தரவு தொகுப்பில் எண்கணக்கான கவனிப்புகள் ஆகும் மற்றும் பொதுவாக கணித ரீதியாக பகுப்பாய்வு செய்யப்படும், அளவிடப்படும் மற்றும் பயன்படுத்தப்படும். சில அளவிடக்கூடிய தரவு உதாரணங்கள்: ஒரு நாட்டின் மக்கள் தொகை, ஒரு நபரின் உயரம் அல்லது ஒரு நிறுவனத்தின் காலாண்டு வருமானம். சில கூடுதல் பகுப்பாய்வின் மூலம், அளவிடக்கூடிய தரவை பயன்படுத்தி காற்று தரநிலைய सूचकांक (AQI)ன் பருவநிலை போக்குகளை கண்டுபிடிக்கலாம் அல்லது ஒரு சாதாரண வேலை நாளில் பிஸியாக இருக்கும் சாலை நேர போக்குவரத்து சாத்தியத்தைக் கணக்கிடலாம்.
### அளவீட்டு தரவு
அளவீட்டு தரவு என்பது ஒரு தரவுத்தொகுப்பில் உள்ள எண் சார்ந்த கவனிப்புகள் ஆகும், மேலும் பொதுவாக பகுப்பாய்வு செய்ய, அளவிட மற்றும் கணித ரீதியாக பயன்படுத்த முடியும். அளவீட்டு தரவின் சில உதாரணங்கள்: ஒரு நாட்டின் மக்கள் தொகை, ஒரு நபரின் உயரம் அல்லது ஒரு நிறுவனத்தின் காலாண்டு வருமானம். கூடுதல் பகுப்பாய்வுடன், அளவீட்டு தரவை காற்று தரம் குறியீட்டின் (AQI) பருவ நிலை போக்குகளை கண்டறிய அல்லது ஒரு சாதாரண வேலை நாளில் பிஸியான நேர போக்குவரத்தின் சாத்தியத்தை மதிப்பீடு செய்ய பயன்படுத்தலாம்.
### தரவரிசைக்கூடிய தரவு
தரவரிசைக்கூடிய தரவு, அதேபோல் வர்க்கீகக் தரவாக அழைக்கப்படும், அளவிடக்கூடிய தரவு போன்று அதிவேகமாக அளவிட முடியாத தரவு ஆகும். இது பொதுவாக பல்முக தரப்பட்ட பார்வை தரவுகளாக இருக்கும், எ.கா ஒரு தயாரிப்பு அல்லது செயல்முறை தரத்தை பற்றிய தரவு. சில நேரங்களில், தரவரிசைக்கூடிய தரவு எண்கணக்காக கிடைக்கும் ஆனால் பொதுவாக கணித ரீதியாக பயன்படுத்தப்படுவதில்லை, உதாரணமாக தொலைபேசி எண்கள் அல்லது நேரஅம்சங்கள். சில தரவரிசைக்கூடிய தரவு உதாரணங்கள்: வீடியோ கருத்துக்கள், ஒரு காரின் உற்பத்தியாளரும் மாதிரியும் அல்லது உங்கள் அருகிலுள்ள நண்பர்களின் பிடித்த நிறம். தரவரிசைக்கூடிய தரவை பயன்படுத்தி எந்த தயாரிப்புகளை பயனர்கள் மிகவும் விரும்புகிறார்கள் என்பதை தெரிந்து கொள்ளலாம் அல்லது வேலைவாய்ப்பு விண்ணப்பங்கள் சுருக்கங்களில் பிரபலமான முக்கியவாக்கியங்களை அடையாளம் காணலாம்.
### தரவின் தரம்
தரத்தின் தரவு, அல்லது வகை தரவு என அழைக்கப்படும், அளவீட்டு தரவின் கவனிப்புகளைப் போல 객ப்பாக அளவிட முடியாத தரவாகும். இது பொதுவாக ஒரு பொருள் அல்லது செயல்முறை பற்றிய தரத்தைப் பதிவு செய்யும் பல்வேறு வடிவங்களில் உள்ள சுப்ஜெக்டிவ் தரவாகும். சில நேரங்களில், தரத்தின் தரவு எண் வடிவத்தில் இருக்கும், ஆனால் பொதுவாக கணித ரீதியாக பயன்படுத்தப்படாது, உதாரணமாக தொலைபேசி எண்கள் அல்லது நேர முத்திரைகள். தரத்தின் தரவின் சில உதாரணங்கள்: வீடியோ கருத்துகள், ஒரு கார் மாடல் மற்றும் வகை அல்லது உங்கள் நெருங்கிய நண்பர்களின் பிடித்த நிறம். தரத்தின் தரவை நுகர்வோர் எந்த தயாரிப்புகளை மிகவும் விரும்புகிறார்கள் என்பதைப் புரிந்துகொள்ள அல்லது வேலை விண்ணப்ப ரெஸ்யூம்களில் பிரபலமான முக்கிய வார்த்தைகளை அடையாளம் காண பயன்படுத்தலாம்.
### கட்டமைக்கப்பட்ட தரவு
கட்டமைக்கப்பட்ட தரவு என்பது வரிகளை மற்றும் நெடுவரிசைகளை கொண்டதாகும், ஒவ்வொரு வரியிலும் அதே வகை நெடுவரிசைகள் இருக்கும். நெடுவரிசைகள் ஒரு குறிப்பிட்ட வகைப்பாட்டின் மதிப்பை பிரதிநிதித்துவப்படுத்துகின்றன மற்றும் அந்த மதிப்பை என்ன பிரதிநிதித்துவப்படுத்துகிறது என்பதனை விவரிக்கும் பெயருடன் அடையாளம் காணப்படுகின்றன, ஆனால் வரிகள் உண்மையான மதிப்புகளை கொண்டிருக்கும். மதிப்புகள் துல்லியமாக நெடுவரிசையை பிரதிநிதித்துவப்படுத்துவதற்காக நெடுவரிசைகள் மீது குறிப்பிட்ட விதிமுறைகள் அல்லது கட்டுப்பாடுகள் இருக்கலாம். உதாரணமாக, ஒரு வாடிக்கையாளர் ஸ்பிரெட்ஷீட்டில் ஒவ்வொரு வரியிலும் ஒரு தொலைபேசி எண் இருக்க வேண்டும் மற்றும் தொலைபேசி எண்கள் எழுத்துக்களைக் கொண்டிரக்கக்கூடாது. தொலைபேசி எண் நெடுவரிசையில் அந்த மதிப்புகள் எப்போதும் இருப்பதாகவும் எண்கள் மட்டுமே உள்ளதாகவும் விதிமுறைகள் இருக்கலாம்.
### அமைப்புக்கூடான தரவு
அமைப்புக்கூடான தரவு என்பது வரிசைகள் மற்றும் நெடுவரிசைகளில் ஒழுங்குபடுத்தப்பட்ட தரவாகும், இதில் ஒவ்வொரு வரிசையும் ஒரே தொகுப்பின் நெடுவரிசைகளைக் கொண்டிருக்கும். நெடுவரிசைகள் ஒரு குறிப்பிட்ட வகையின் மதிப்பை பிரதிநிதித்துவப்படுத்தும், மேலும் மதிப்பு எதை பிரதிநிதித்துவப்படுத்துகிறது என்பதை விவரிக்கும் பெயருடன் அடையாளம் காணப்படும், அதே நேரத்தில் வரிசைகள் உண்மையான மதிப்புகளை கொண்டிருக்கும். நெடுவரிசைகள் பொதுவாக மதிப்புகள் சரியாக நெடுவரிசையை பிரதிநிதித்துவப்படுத்துவதை உறுதிப்படுத்துவதற்கான குறிப்பிட்ட விதிகள் அல்லது கட்டுப்பாடுகளை கொண்டிருக்கும். உதாரணமாக, ஒவ்வொரு வரிசையும் ஒரு தொலைபேசி எண்ணைக் கொண்டிருக்கும் மற்றும் தொலைபேசி எண்களில் எழுத்துக்கள் இருக்காது என ஒரு வாடிக்கையாளர் ஸ்பிரெட்ஷீட்டை கற்பனை செய்யுங்கள். தொலைபேசி எண் நெடுவரிசையில் விதிகள் பொருத்தப்பட்டிருக்கலாம், இது வெறுமையாக இருக்கக்கூடாது மற்றும் எண்களை மட்டுமே கொண்டிருக்க வேண்டும்.
கட்டமைக்கப்பட்ட தரவின் ஒரு நன்மை என்னவெனில், அது மற்ற கட்டமைக்கப்பட்ட தரவுடன் தொடர்புபடுத்தக்கூடிய விதத்தில் ஒழுங்குபடுத்தப்படக்கூடியது. இருப்பினும், தரவு குறிப்பிட்ட முறையில் ஒழுங்குபடுத்தப்பட இருப்பதால், அதன் பொது அமைப்பில் மாற்றங்களைச் செய்ய அதிக முயற்சி தேவைப்படும். எடுத்துக்காட்டாக, வாடிக்கையாளர் ஸ்பிரெட்ஷீட்டில் காலியற்ற ஈமெயில் நெடுவரிசையை சேர்க்குவதை நினைத்தால், நீங்கள் அந்த மதிப்புகளை ஏற்கனவே உள்ள வாடிக்கையாளர் பத்திகளுக்கு எவ்வாறு சேர்க்க முடியும் என்று புரிந்து கொள்ள வேண்டும்.
அமைப்புக்கூடான தரவின் ஒரு நன்மை என்னவென்றால், இது மற்ற அமைப்புக்கூடான தரவுடன் தொடர்பு கொள்ளும் வகையில் ஒழுங்குபடுத்தப்படலாம். ஆனால், தரவு ஒரு குறிப்பிட்ட முறையில் ஒழுங்குபடுத்தப்படுவதால், அதன் ஒட்டுமொத்த அமைப்பில் மாற்றங்களைச் செய்ய அதிக முயற்சியை எடுத்துக்கொள்ள வேண்டும். உதாரணமாக, வாடிக்கையாளர் ஸ்பிரெட்ஷீட்டில் ஒரு மின்னஞ்சல் நெடுவரிசையைச் சேர்ப்பது, இது வெறுமையாக இருக்கக்கூடாது, நீங்கள் இந்த மதிப்புகளை தரவுத்தொகுப்பில் உள்ள வாடிக்கையாளர்களின் தற்போதைய வரிசைகளுக்கு எப்படி சேர்ப்பீர்கள் என்பதை கண்டுபிடிக்க வேண்டும்.
கட்டமைக்கப்பட்ட தரவு உதாரணங்கள்: ஸ்பிரெட்ஷீட்கள், உறவுக் தரவுத்தளங்கள், தொலைபேசி எண்கள், வங்கி அறிக்கைகள்
அமைப்புக்கூடான தரவின் உதாரணங்கள்: ஸ்பிரெட்ஷீட்டுகள், தொடர்புடைய தரவுத்தொகுப்புகள், தொலைபேசி எண்கள், வங்கி அறிக்கைகள்
### கட்டமைக்கப்படாத தரவு
கட்டமைக்கப்படாத தரவு பொதுவாக வரிகளுக்கும் நெடுவரிசைகளுக்கும் பிரிக்க முடியாது மற்றும் ஒரு வடிவமைப்போ விதிமுறைகளோ இல்லாமல் இருக்கும். கட்டமைக்கப்படாத தரவை அமைப்பின்மை குறைவாக இருப்பதால் புதிய தகவல்களைச் சேர்ப்பது எளிதாக இருக்கும். உதாரணமாக, ஒரு சென்சர் இருமிடையில் ஒன்றுமுறை விமான அழுத்தத்தை பதிவு செய்தால், தற்போழுது அது வெப்பநிலை அளவிடும் மற்றும் பதிவு செய்யும் போன்ற புதுப்பிப்பை பெற்றிருந்தால், அதற்கு பிற்பட்ட தரவை மாற்ற தேவையில்லை. இருப்பினும், இந்த வகை தரவை பகுப்பாய்வு செய்வது அல்லது ஆராய்ச்சி செய்வது நீண்ட நேரம் ஆகலாம். உதாரணமாக, ஒரு விஞ்ஞானி கடந்த மாத வெப்பநிலையில் சென்சர் தரவை பெற விரும்பினால், சென்சர் சில பதிவில் "e" என பதியப்பட்டிருப்பதை கண்டுபிடிக்கிறான்; இது சென்சர் உடைந்திருந்தது என்பதைக் குறிக்கிறது, என்பது அந்த தரவு முழுமையாக இல்லை என்பதை அர்த்தம்.
### அமைப்பில்லாத தரவு
அமைப்பில்லாத தரவை பொதுவாக வரிசைகள் அல்லது நெடுவரிசைகளில் வகைப்படுத்த முடியாது, மேலும் இது ஒரு வடிவம் அல்லது பின்பற்ற வேண்டிய விதிகளை கொண்டிருக்காது. அமைப்பில்லாத தரவின் அமைப்பில் குறைவான கட்டுப்பாடுகள் உள்ளதால், ஒரு அமைப்புக்கூடான தரவுத்தொகுப்புடன் ஒப்பிடும்போது புதிய தகவல்களைச் சேர்ப்பது எளிதாக இருக்கும். ஒரு சென்சார் ஒவ்வொரு 2 நிமிடத்திற்கும் மழைமண்டல அழுத்தத்தைப் பதிவு செய்யும் தரவைப் பெறுகிறது, மேலும் இது வெப்பநிலையை அளவிட மற்றும் பதிவு செய்ய அனுமதிக்கும் புதுப்பிப்பைப் பெற்றுள்ளது, இது அமைப்பில்லாதது என்றால், உள்ளமைந்த தரவை மாற்ற தேவையில்லை. ஆனால், இந்த வகையான தரத்தை பகுப்பாய்வு அல்லது ஆராய்வது அதிக நேரம் எடுத்துக்கொள்ளலாம். உதாரணமாக, சென்சார் தரவிலிருந்து கடந்த மாதத்தின் சராசரி வெப்பநிலையை கண்டறிய விரும்பும் ஒரு விஞ்ஞானி, ஆனால் சென்சார் சில தரவுகளில் "e" ஐ பதிவு செய்தது, இது முற்றிலும் எண் அல்ல, சென்சார் பழுதடைந்தது என்பதை குறிக்கிறது, எனவே தரவு முழுமையாக இல்லை.
கட்டமைக்கப்படாத தரவு உதாரணங்கள்: உரை கோப்புகள், உரை செய்திகள், வீடியோ கோப்புகள்
அமைப்பில்லாத தரவின் உதாரணங்கள்: உரை கோப்புகள், உரை செய்திகள், வீடியோ கோப்புகள்
### அரை-கட்டமைக்கப்பட்ட தரவு
அரை-கட்டமைக்கப்பட்ட தரவுக்கு கட்டமைக்கப்பட்ட மற்றும் கட்டமைக்கப்படாத தருவுகளின் கட்டளைகளை கொண்ட தன்மைகள் உள்ளன. அது பொதுவாக வரிசைகள் மற்றும் நெடுவரிசைகளின் வடிவமைப்பின் கீழ் வராது, ஆனால் கட்டமைக்கப்பட்டதாகக் கணக்கிடப்படும் வகையில் ஒழுங்குபடுத்தப்படுகிறது மற்றும் குறிப்பிடப்பட்ட வடிவிலக்கோ விதிமுறைகளோ பின்பற்றப்படலாம். அமைப்பு மூலங்களுக்கு ஏற்ப மாறுபடும், சிலநர்கள் நன்றாக வரிசைப்படுத்தப்பட்ட வரிசை மற்றும் சில மிகவும் சுலபமாக புதிய தகவல்களைக் கொண்டுவர அனுமதிக்கும் வகை உள்ளன. மெட்டாடேட்டா என்பது தரவு எவ்வாறு ஒழுங்குபடுத்தப்பட்டுள்ளது மற்றும் சேமிக்கப்பட்டுள்ளது என்பதை தீர்மானிக்க உதவுகின்ற குறியீடுகள் மற்றும் தரவின் வகையைப் பொறுத்து பல பெயர்களைக் கொண்டிருக்கும். பொதுவான மெட்டாடேட்டா பெயர்கள்: குறிச்சொற்கள், கூறுகள், நிறுவனங்கள் மற்றும் பண்புகள். உதாரணமாக, ஒரு சாதாரண ஈமெயில் செய்தியில் ஒரு பொருள், உள்ளடக்கம் மற்றும் பெறுநர்களின் தொகுப்பு இருக்கும் மற்றும் அது யார் அல்லது எப்போது அனுப்பப்பட்டது என்று ஒழுங்குபடுத்தப்படலாம்.
### பகுதி அமைப்புக்கூடானது
பகுதி அமைப்புக்கூடான தரவின் அம்சங்கள், அமைப்புக்கூடான மற்றும் அமைப்பில்லாத தரவின் கலவையாக இருக்கும். இது பொதுவாக வரிசைகள் மற்றும் நெடுவரிசைகளின் வடிவத்திற்குப் பொருந்தாது, ஆனால் அமைப்புக்கூடானதாகக் கருதப்படும் வகையில் ஒழுங்குபடுத்தப்பட்டுள்ளது மற்றும் ஒரு நிலையான வடிவம் அல்லது விதிகளை பின்பற்றலாம். அமைப்பு மூலங்களைப் பொறுத்து மாறுபடும், உதாரணமாக, நன்கு வரையறுக்கப்பட்ட மரபு அல்லது புதிய தகவல்களை எளிதாக ஒருங்கிணைக்க அனுமதிக்கும் ஒரு நெகிழ்வான அமைப்பு. மெட்டாடேட்டா என்பது தரவை எப்படி ஒழுங்குபடுத்தி சேமிக்க வேண்டும் என்பதை முடிவு செய்ய உதவும் குறிகாட்டிகள் ஆகும், மேலும் தரவின் வகையைப் பொறுத்து பல்வேறு பெயர்களைக் கொண்டிருக்கும். மெட்டாடேட்டாவின் சில பொதுவான பெயர்கள்: குறிச்சொற்கள், கூறுகள், அமைப்புகள் மற்றும் பண்புகள். உதாரணமாக, ஒரு சாதாரண மின்னஞ்சல் செய்தியில் ஒரு தலைப்பு, உடல் மற்றும் ஒரு தொகுப்பு பெறுநர்கள் இருக்கும், மேலும் இது யார் அல்லது எப்போது அனுப்பப்பட்டது என்பதைப் பொறுத்து ஒழுங்குபடுத்தப்படலாம்.
பகுதி அமைப்புக்கூடான தரவின் உதாரணங்கள்: HTML, CSV கோப்புகள், JavaScript Object Notation (JSON)
அரை-கட்டமைக்கப்பட்ட தரவு உதாரணங்கள்: HTML, CSV கோப்புகள், JavaScript பொருள் குறிப்பு (JSON)
## தரவின் மூலங்கள்
தரவின் மூலமானது தரவு உருவாக்கப்பட்ட ஆரம்ப இடமாகும், அல்லது அது "வாழும்" இடமாகும், மேலும் இது எப்போது மற்றும் எப்படி சேகரிக்கப்பட்டது என்பதைப் பொறுத்து மாறுபடும். அதன் பயனர்(கள்) மூலம் உருவாக்கப்பட்ட தரவை முதன்மை தரவாக அழைக்கப்படுகிறது, ஆனால் பொதுவாக பயன்படுத்த சேகரிக்கப்பட்ட தரவின் மூலத்திலிருந்து வரும் தரவை இரண்டாம் நிலை தரவாக அழைக்கப்படுகிறது. உதாரணமாக, ஒரு குழு விஞ்ஞானிகள் மழைக்காடுகளில் கவனிப்புகளைச் சேகரிக்கிறார்கள் என்றால், இது முதன்மை தரவாகக் கருதப்படும், மேலும் அவர்கள் அதை மற்ற விஞ்ஞானிகளுடன் பகிர முடிவு செய்தால், அதை பயன்படுத்தும் அவர்களுக்கு இது இரண்டாம் நிலை தரவாகக் கருதப்படும்.
தரவு மூலம் என்பது தரவு எங்கே உருவாக்கப்பட்டதோ அல்லது அதன் "வாழும்" துவக்க இடம் ஆகும் மற்றும் அது எவ்வாறு மற்றும் எப்போது சேகரிக்கப்பட்டதன் அடிப்படையில் மாறும். அதன் பயனர்களால் உருவாக்கப்படும் தரவை முதன்மை தரவு என அழைக்கப்படுகிறது, மற்றொரு தரவு பொதுவான பயன்பாட்டிற்கு சேகரிக்கப்பட்ட தரவு மூலத்திலிருந்து வரும் என்றால் அதனை இரண்டாம் நிலை தரவு என்று குறிப்பிடலாம். உதாரணமாக, ஒரு காடான ஆய்வாளர்கள் பார்வையிடும், அது முதன்மை என்றும் அவர்கள் மற்ற ஆய்வாளர்களுடன் பகிர்வதற்கு தீர்மானித்தால், அது பயன்படுத்தும் ஆய்வாளர்களுக்கு இரண்டாம் நிலை ஆகும்.
தரவுத்தொகுப்புகள் ஒரு பொதுவான மூலமாகும், மேலும் தரவை ஹோஸ்ட் மற்றும் பராமரிக்க தரவுத்தொகுப்பு மேலாண்மை அமைப்பை நம்புகின்றன, இதில் பயனர்கள் கேள்விகள் எனப்படும் கட்டளைகளைப் பயன்படுத்தி தரவை ஆராய்கிறார்கள். கோப்புகள் தரவின் மூலமாக இருக்கலாம், இது ஆடியோ, படங்கள் மற்றும் வீடியோ கோப்புகள் மற்றும் Excel போன்ற ஸ்பிரெட்ஷீட்டுகளாக இருக்கலாம். இணைய மூலங்கள் தரவை ஹோஸ்ட் செய்ய பொதுவான இடமாகும், இதில் தரவுத்தொகுப்புகள் மற்றும் கோப்புகள் காணப்படலாம். பயன்பாட்டு நிரலாக்க இடைமுகங்கள், APIகள் என அழைக்கப்படும், இணையத்தின் மூலம் வெளிப்புற பயனர்களுடன் தரவைப் பகிர வழிகளை உருவாக்க நிரலாக்கர்களுக்கு அனுமதிக்கின்றன, அதே நேரத்தில் வலைத் தேடல் ஒரு வலைப்பக்கத்திலிருந்து தரவை எடுக்கிறது. [தரவுடன் வேலை செய்வது பற்றிய பாடங்கள்](../../../../../../../../../2-Working-With-Data) பல்வேறு தரவின் மூலங்களை எப்படி பயன்படுத்துவது என்பதை மையமாகக் கொண்டுள்ளது.
தரவுத்தளங்கள் பொதுவான மூலமாக இருப்பது; தரவுத்தள நிர்வாக அமைப்பால் தரவு நடத்தப்படுகின்றது மற்றும் பயனர்கள் கேள்விகள் எனப்படும் கட்டளைகளைப் பயன்படுத்தி தரவை ஆராய்கின்றனர். கோப்புகள் ஆகியவையாக ஆடியோ, படம் மற்றும் வீடியோ கோப்புகளாக இருக்கலாம், மேலும் எக்செல் போன்ற ஸ்பிரெட்ஷீட்களும் ஆகும். இணைய மூலங்கள் பரவலாக உள்ளன; அதில் தரவுத்தளங்களும், கோப்புகளும் உள்ளன. பயன்பாட்டு நிரலாக்க இடைமுகங்கள், அதாவது APIs, நிரலாளர்கள் வெளியூர் பயனர்களுடன் இணையத்திலாக தரவை பகிர வழிகளை உருவாக்க அனுமதிக்கின்றன, அதேசமயம் வலைப்பதிவு என்பதில் இணையப் பக்கத்திலிருந்து தரவு எடுக்கப்படுகிறது. [தரவு உடன் பணியாற்றுதல்](../../../../../../../../../2-Working-With-Data) பாடங்களில் பல்வேறு தரவு மூலங்களைப் பயன்படுத்துவது குறித்த பாடங்கள் உள்ளன.
## முடிவு
## முடிவுரை
இந்த பாடத்தில் நாம் கற்றுக்கொண்டது:
இந்த பாடத்தில் நாம் கற்றுக்கொண்டோம்:
- தரவு என்ன
- தரவை எப்படி விவரிக்கலாம்
- தரவை எப்படி வகைப்படுத்தி பிரிக்கலாம்
- தரவை எங்கு கண்டுபிடிக்கலாம்
- தரவு என்பது என்
- தரவு எப்படி விவரிக்கப்படுகிறது
- தரவு எப்படி வகைப்படுத்தப்படுகிறது மற்றும் வகைகள்படுத்தப்படுகிறது
- தரவு எங்கு காணப்படலாம்
## 🚀 சவால்
Kaggle என்பது திறந்த தரவுத்தொகுப்புகளுக்கான சிறந்த மூலமாகும். [தரவுத்தொகுப்பு தேடல் கருவி](https://www.kaggle.com/datasets) ஐப் பயன்படுத்தி சில 흥மையான தரவுத்தொகுப்புகளை கண்டறிந்து, இந்த அளவுகோலுடன் 3-5 தரவுத்தொகுப்புகளை வகைப்படுத்துங்கள்:
காகிள் (Kaggle) திறந்த தரவு தொகுப்புகளுக்கான சிறந்த மூலமாகும். [தரவு தொகுப்பு தேடல் கருவியை](https://www.kaggle.com/datasets) பயன்படுத்தி சில சுவாரசியமான தரவு தொகுப்புகளைத் தேடுங்கள் மற்றும் 3-5 தரவு தொகுப்புகளை கீழ்காணும் அளவுகோலின் படி வகைப்படுத்துங்கள்:
- தரவு அளவிடக்கூடியதா அல்லது தரவரிசைக்கூடியதா?
- தரவு கட்டமைக்கப்பட்டதா, கட்டமைக்கப்படாததா அல்லது அரை-கட்டமைக்கப்பட்டதா?
## [பாடம் முடிவுக்குப் பிறகு கூற்றுக் கேள்வி](https://ff-quizzes.netlify.app/en/ds/quiz/5)
- தரவு அளவீட்டு (Quantitative) அல்லது தரத்தின் தரவா (Qualitative)?
- தரவு அமைப்புக்கூடானது, அமைப்பில்லாதது அல்லது பகுதி அமைப்புக்கூடானதா?
## [பாடத்திற்குப் பின் வினாடி வினா](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## மதிப்பீடு மற்றும் சுயபயிற்சி
## மீளாய்வு மற்றும் தானாக படிப்பு
- Microsoft Learn யூனிட், [உங்கள் தரவை வகைப்படுத்துங்கள்](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) என்ற தலைப்பில் அமைப்புக்கூடான, பகுதி அமைப்புக்கூடான மற்றும் அமைப்பில்லாத தரவின் விரிவான பிரிவைக் கொண்டுள்ளது.
- [தரவு வடிவங்களை அடையாளம் காண்கிறோம்](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) என்ற தலைப்பில் உள்ள இந்த மைக்ரோசாஃப்ட் கற்றல் அலகு கட்டமைக்கப்பட்ட, அரை-கட்டமைக்கப்பட்ட மற்றும் கட்டமைக்கப்படாத தரவுகளின் விரிவான பகுப்பாய்வை வழங்குகிறது.
## பணிக்கட்டளை
## பணிகள்
[தரவுத்தொகுப்புகளை வகைப்படுத்துதல்](assignment.md)
[தரவு தொகுப்புகளை வகைப்படுத்தல்](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கின்றோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Probability மற்றும் புள்ளியியலுககு அறிமுகம்\n",
"இந்த நோட்புக்கில், நாம் முந்தையதாக விவாதித்த சில கருத்துகளுடன் விளையாடப் போகிறோம். Probability மற்றும் புள்ளியியல் தொடர் கருத்துகள் Python இல் தரவு செயலாக்கத்திற்கான முக்கியமான நூலகங்களில், உதாரணமாக `numpy` மற்றும் `pandas` ஆகியவற்றில் நன்றாக பிரதிநிதித்துவம் பெறப்பட்டுள்ளன.\n"
"# சாத்தியத்தன்மை மற்றும் புள்ளியியல் அறிமுகம்\n",
"இந்த நோட்புக் இல், நாம் முன்பு விவாதித்த சில கருத்துக்களுடன் விளையாடப் போகிறோம். சாத்தியத்தன்மை மற்றும் புள்ளியியல் சார்ந்த பல கருத்துகள் Python இல் தரவு செயலாக்கத்திற்கான முக்கிய நூலகங்களில், உதாரணமாக `numpy` மற்றும் `pandas` எல்லாம் நன்கு பிரதிநிதித்துவம் பெறப்பட்டுள்ளன.\n"
]
},
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## சீரற்ற மாறிகள் மற்றும் ஒதுக்கீடுகள்\n",
"0 முதல் 9 வரை உள்ள சமவெளி ஒதுக்கீட்டில் இருந்து 30 மதிப்புகளின் மாதிரியை வரையறுக்க ஆரம்பிப்போம். நாமும் சராசரி மற்றும் வேறுபாட்டை கணக்கிடப் போகிறோம்.\n"
"## சீரற்ற மாறிகள் மற்றும் பகிர்வுகள்\n",
"0 முதல் 9 வரை உள்ள ஒரே அளவுக் கொள்கலிலிருந்து 30 மதிப்புகளின் ஒரு மாதிரியை வரைவேண்டாம். நாமும் சராசரி மற்றும் வேறுபாட்டை கணக்கிடுவோம்.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"மாதிரியில் எத்தனை வேறு மதிப்புகள் உள்ளன என்பதை காட்சிப்படுத்தக் கணிக்க, நாம் **வரிசைப்படம்** போடலாம்:\n"
"மாதிரியில் எத்தனை வெவ்வேறு மதிப்புகள் உள்ளன என்று கண்ணோட்டமாகக் கணக்கிட, நாம் **வரிசைக்கோட்டு வரைபடம்** வரைந்து பார்க்கலாம்:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## உண்மையான தரவுகளை பகுப்பாய்வு செய்தல்\n",
"\n",
"சராசரி மற்றும் பரவல் உண்மையான உலக தரவுகளை பகுப்பாய்வு செய்யும் போது மிகவும் முக்கியமானவை. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) இல் இருந்து பேஸ்பால் வீரர்களை பற்றிய தரவுகளை நாம் ஏற்றுக்கொள்வோம்\n"
"உண்மை உலக தரவுகளை பகுப்பாய்வு செய்யும் போது சராசரி மற்றும் மாற்றமளவு மிகவும் முக்கியமானவை. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) இருந்து பேஸ்பால் வீரர்களுக்கான தரவை ஏற்றுவோம்\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> நாங்கள் தரவு विश्लेषणத்துக்காக [**Pandas**](https://pandas.pydata.org/) என் தொகுப்பை இங்கே பயன்படுத்துகிறோம். இந்தப் பாடத்திலே பின்னர் Pandas மற்றும் Python-ல் தரவோடு வேலை செய்யும் முறைகள் பற்றி மேலும் விரிவாக பேச உள்ளோம்.\n",
"> நாம் இங்கே தரவு பகுப்பாய்விக்காக [**Pandas**](https://pandas.pydata.org/) எனும் தொகுப்பை பயன்படுத்துகிறோம். Python இல் Pandas மற்றும் தரவுடன் வேலை செய்வதில் மேலும் இந்த பாடநெறியில் தாங்கள் அறிந்துகொள்வோம்.\n",
"\n",
"வயது, உயரம் மற்றும் எடை ஆகியவற்றுக்கு சராசரி மதிப்புகளை கணக்கிடுவோம்:\n"
"வருகை, உயரம் மற்றும் உடல் எடையின் சராசரி மதிப்புகளை கணக்கிடுவோம்:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"இப்போது உயரத்தின் மீது கவனம் செலுத்தி, நிலையான விலகலும் வேரியன்சும் கணக்கிடுவோம்:\n"
"இப்போது உயரத்துக்கு கவனம் செலுத்தி, எடைசிதுபத்தையும் வேறுபாடையும் கணக்கிடுவோம்: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"சராசரி மதிப்புக்கு கூடுதலாக, நடுப்புள்ளி மதிப்பும் காலாண்டுகள் மதிப்புகளும் பார்க்க பொருள் உள்ளது. அவை **பெட்டிக் வரைபடம்** பயன்படுத்தி காண்பிக்க முடியும்:\n"
"சராசரிக்கு கூடுதலாக, மைய மதிப்பு மற்றும் நான்காம் பாகங்களைப் பார்ப்பது பொருத்தமானது. அவை **பாக்ஸ் பிளாட்** ஐ பயன்படுத்தி காட்சிப்படுத்தலாம்:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நாம் எங்கள் தரவுத்தொகுப்பின் துணைப்பிரிவுகளுக்கு, உதாரணமாக, வீரர் பங்கின்படி குழுவாக்கப்பட்டவையாகவும், பெட்டி வரைபடங்களை உருவாக்கலாம்.\n"
"நமது தரவுத்தொகுப்பின் துணைவகுப்புகளின் பெட்டிக் கட்டங்களையும் உருவாக்கலாம், எடுத்துக்காட்ட olarak, வீரர் பங்கை அடிப்படையாகக் கொண்டிருக்கும். \n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **குறிப்பு**: இந்த விளக்கப்படம் அடிப்படையில், முதலாவது பாஸ்மேன்களின் உயரம் இரண்டாம் பாஸ்மேன்களின் உயரத்தைவிட அதிகமாக இருக்கிறது என்பதைக் காட்டுகிறது. பின்னர், நாம் இந்த கர்த்தையை இன்னும் முறையாக எப்படி சோதிப்பது மற்றும் எங்கள் தரவு புள்ளிவிவர ரீதியாக முக்கியமானதா என்பதை எவ்வாறு காண்பிப்பது என்பதை கற்கப்போகிறோம். \n",
"> **குறிப்பு**: இந்த வரைபடம், சராசரியாக முதலாவது பாஸ்மேன் உயரங்கள் இரண்டாவது பாஸ்மேன் உயரங்களைவிட அதிகமானவை என்று கூறுகிறது. பின்னர், இந்த கூற்றை எவ்வாறு முறையான முறையில் சோதிக்கலாம் மற்றும் எமது தரவு புள்ளியியல் ரீதியாக முக்கியமானது என்பதை எவ்வாறு நிரூபிக்கலாம் என்பதை அறிந்துகொள்ளப்போகிறோம். \n",
"\n",
"வயது, உயரம் மற்றும் எடை அனைத்தும் தொடர்ச்சியான சீரற்ற மாறிலிகள் ஆகும். அவைகளின் விநியோகம் என்னவாக இருக்கும் என்று நீங்கள் நினைக்கிறீர்களா? அதை அறிய ஒரு நல்ல வழி மதிப்புகளின் ஹிஸ்டோகிராமை வரைபடமாக்குவது ஆகும்: \n"
"வயது, உயரம் மற்றும் எடை அனைத்தும் தொடர்ச்சியான சீரற்ற மாறிலிகள். அவற்றின் பகிர்வை நீங்கள் என்ன என்று நினைக்கிறீர்கள்? மதிப்புகளின் வரிசைப்படி வரைவாய் வரைபாட்டை (ஹிஸ்டோகிராம்) வரைதல் ஒரு நல்ல முறையாகும்: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## சாதாரண விநியோகம்\n",
"## சாதாரண பகிர்வு\n",
"\n",
"நாம் எங்கள் உண்மையான தரவுகளுக்கு அதே சராசரி மற்றும் வேறுபாட்டுடன் சாதாரண விநியோகத்தை பின்பற்றும் ஒரு செயற்கை எடைகளின் மாதிரியை உருவாக்குவோம்:\n"
"நம்முடைய உண்மையான தரவுகளின் அதே சராசரி மற்றும் மாறுபாட்டுடன் கூடிய சாதாரண பகிர்வை பின்பற்றும் செயற்கை அளவைக் கொடுப்பதாக உருவாக்குவோம்:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"அஸல் வாழ்கையில் பெரும்பாலான மதிப்புகள் சாதாணமாக பரவியுள்ளதனால், மாதிரி தரவை உருவாக்க ஒரே மாதிரியான பரவல் கொண்ட சீரான சீரான எண் உருவாக்கியை பயன்படுத்த கூடாது. நீர் சீரான பரவல் கொண்ட ( `np.random.rand` மூலம் உருவாக்கப்பட்ட) எடை உருவாக்க முயன்றால் என்ன நடக்கும் என்பதை இங்கே காணலாம்:\n"
"உண்மையான வாழ்க்கையில் பெரும்பாலான மதிப்புகள் சாதாரணமாக توزيعப்படுவதால், மாதிரித் தரவை உருவாக்க ஒரே மாதிரியான சீரான சீரற்ற எண் உருவாக்கியை பயன்படுத்தக் கூடாது. சீரான توزيع ஆக எடைகளை உருவாக்க முயன்றால் என்ன நிகழ்கிறது என்பதை இங்கே காணலாம் (`np.random.rand` மூலம் உருவாக்கப்பட்டது):\n"
]
},
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"##நம்பிக்கை இடைவெளிகள்\n",
"## நம்பிக்கை இடைவெளிகள்\n",
"\n",
"இப்போது பேஸ்பால் வீரர்களின் எடைகள் மற்றும் உயரங்கள் பற்றிய நம்பிக்கை இடைவெளிகளை கணக்கிடுவோம். நாங்கள் [இந்த ஸ்டாக் ஓவர்ஃப்ளோ உரையாடலிலிருந்து](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) குறியீட்டை பயன்படுத்துவோம்:\n"
"இப்போது நாம் பேஸ்பால் வீரர்களின் எடைகள் மற்றும் உயரங்களுக்கு நம்பிக்கை இடைவெளிகளை கணக்கிடுவோம். நாம் இந்தக் கோடை [இந்த stackoverflow விவாதத்திலிருந்து](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) பயன்படுத்துகிறோம்:\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -280,9 +280,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## கருதுகோள் சோதனை\n",
"## ஊகசோதனை\n",
"\n",
"நமது பேஸ்பால் வீரர்கள் தரவுத்தொகுப்பில் உள்ள பலவிதமான பாத்திரங்களை ஆராய்வோம்:\n"
"நாம் எமது பேஸ்பால் வீரர் தரவுத்தொகுப்பில் உள்ள வெவ்வேறு பாத்திரங்களை ஆராய்ந்து பார்க்கலாம்:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"முதலாவது பாச்மேன் இரண்டாவது பாச்மேன் விட உயரமாக இருக்கிறார்களா என்பதனை பரிசோதிக்கலாம். இது செய்யும் எளிய வழி நம்பிக்கை இடைவெளிகளை சோதிப்பது ஆகும்:\n"
"முதன்மை பேஸ்மேன்கள் இரண்டாவது பேஸ்மேன்களுக்கு விட உயரமாக இருப்பதாக உள்ள கருத்தை பரிசோதிப்போம். இதைச் செய்வதற்கான எளிதான வழி நம்பிக்கைக் கோட்டுகளை தேர்வு செய்வதே ஆகும்:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நாம் காணக்கூடியது, இடைவெளிகள் ஒருவருக்கொருவர் மடங்கு ஆகவில்லை.\n",
"இடைவேளைகள் ஒரே நேரத்தில் இல்லாததை நாம் பார்க்க முடிகிறது.\n",
"\n",
"கணக்கீட்டிலும் மிக முக்கியமான முறையாக இந்த கோரிக்கையை நிரூபிப்பதற்கு **ஸ்டூடென்ட் t-சோதனை** பயன்படுத்த வேண்டும்:\n"
"கருத்தை பறைசாற்றுவதற்கு புள்ளியியல் ரீதியாக சரியான வழி **ஸ்டூடென்ட் t-சோதனை** பயன்படுத்துவது ஆகும்:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"`ttest_ind` செயல்பாடு வழங்கும் இரண்டு மதிப்புகள்:\n",
"* p-மதிப்பு என்பது இரண்டு விநியோகங்களின் சராசரி ஒரே மாதிரியானதாக இருக்க வாய்ப்பு என்று கருதக்கூடியது. எங்கள் வழக்கில், இது மிகவும் குறைவாக உள்ளது, அதாவது முதல் பேஸ்மேன் பேர் அதிக உயரம் இருப்பதை ஆதரிக்கும் வலுவான பதிவு உள்ளது.\n",
"* t-மதிப்பு என்பது சீரமைக்கப்பட்ட சராசரி வேறுபாட்டின் இடைநிலை மதிப்பு, இது t-சோதனையில் பயன்படுத்தப்படுகிறது மற்றும் விசுவாசத்தன்மை மதிப்பிற்கு ஏற்ப ஒரு நுழைவுக் மதிப்புடன் ஒப்பிடப்படுகிறது.\n"
"* p-மதிப்பு என்பது இரண்டு பகிர்வுகளின் சராசரி ஒரே மாதிரியானவை என்பதற்கான சாத்தியமாக கருதப்படலாம். எங்கள் விவகாரத்தில், இது மிகவும் குறைவாக உள்ளது, இது முதல் பேஸ்மேன் உயரமாக இருப்பதற்கான பலமான ஆதாரத்தை குறிக்கின்றது.\n",
"* t-மதிப்பு என்பது t-சோதனையில் பயன்படுத்தப்படும் சாதாரணப்படுத்தப்பட்ட சராசரி வேறுபாட்டின் நடுநிலை மதிப்பாகும், மேலும் இது கொடுக்கப்பட்ட நம்பிக்கை மதிப்பிற்கான எல்லை மதிப்புடன் ஒப்பிடப்படுகிறது.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## மத்திய வரம்பு கோட்பாட்டுடன் ஒரு சாதாரண பகிர்வு முன்மொழிதல்\n",
"## மைய வரம்பு கோட்பாட்டுடன் சாதாரண பங்கீட்டைக் கண்காணித்தல்\n",
"\n",
"Python இல் அழைப்பு-சீரற்ற ஜெனெரேட்டர் ஒரு சமமானப் பகிர்வை வழங்க உருவாக்கப்பட்டிருக்கிறது. நாமும் சாதாரண பகிர்வுக்கு ஜெனெரேட்டர் உருவாக்க விரும்பினால், நாுடய மத்திய வரம்பு கோட்பாட்டை பயன்படுத்தலாம். சாதாரணமாக பகிரப்பட்ட ஒரு மதிப்பை பெற, நாமே சமமான முறையில் உருவாக்கப்பட்ட எடுத்துக்காட்டு ஒரு சராசரியை கணக்கிடுவோம்.\n"
"பைத்தானில் உள்ள புது-சீரற்ற உருவாக்கி ஒரு ஒரே மாதிரிப் பங்கீடு வழங்க உருவாக்கப்பட்டது. நாம் சாதாரண பங்கீட்டுக்கான உருவாக்கியை உருவாக்க விரும்பினால், மைய வரம்பு கோட்பாட்டைப் பயன்படுத்தலாம். சாதாரணமாக பங்கீட்டுப்பெறும் மதிப்பை பெற நாம் ஒட்டுமொத்தமாக உருவாக்கப்பட்ட மாதிரியின் சராசரியை கணக்கிடுவோம்.\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## தொடர்பு மற்றும் தீய பேஸ்பால் கார்ப்\n",
"## தொடர்பு மற்றும் தீய பேஸ்பால் கார்ப்பரேஷன்\n",
"\n",
"தொடர்பு எங்களுக்கு தரவு வரிசைகளுக்கு இடையேயான உறவுகளை கண்டுபிடிக்க உதவுகிறது. நமது விளையாட்டு உதாரணத்தில், உயரத்தின் அடிப்படையில் தனது வீரர்களுக்கு சம்பளம் பணம் வழங்கும் ஒரு தீய பேஸ்பால் நிறுவனமிருக்கிறது என்று கொள்ளுங்கள் - வீரர் உயரமாக இருக்கிறான் என்றால், அவன்/அவள் அதிக பணம் பெறுவான். ஒரு அடிப்படை சம்பளமாக $1000 இருக்கிறது என்று எடுத்துக் கொள்வோம், மேலும் உயரத்தின் அடிப்படையில் $0 முதல் $100 வரை கூடுதல் போனஸ் உள்ளது. நாங்கள் MLB இருந்து உண்மையான வீரர்களை எடுத்துக் கொண்டு, அவற்றின் கற்பனை சம்பளங்களை கணக்கிடுவோம்:\n"
"தொடர்பு மூலம் நாம் தரவு தொடர்களுக்கு இடையிலான உறவுகளை கண்டறிய முடியும். நமது விளையாட்டு உதாரணத்தில், ஒரு தீய பேஸ்பால் கம்பெனி தங்கள் வீரர்களுக்கு அவர்களின் உயரத்துக்கு ஏற்ப சம்பளம் கொடுப்பதாக நினைக்கலாம் - உயரமானவர் વધારે பணம் பெறுவார். அடிப்படையான சம்பளம் $1000, மேலும் உயரம் அடிப்படையில் $0 முதல் $100 வரை ஒரு கூடுதல் போனஸ் உள்ளது என எடுத்துக்கொள்வோம். நாங்கள் MLB-இல் இருந்து உண்மையான வீரர்களை எடுத்துக் கொண்டு, அவர்களது கற்பனை சம்பளங்களை கணக்கிடுவோம்:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நாம் இப்போது அந்த தொடர்களின் சகசரணம் மற்றும் தொடர்பை கணக்கிடுவோம். `np.cov` என்கிறது நமக்கு **சகசரண_MATRIX** எனப்படும் ஒன்றை வழங்கும், இது பல மாறிலிகளுக்கு சகசரணத்தின் விரிவாக்கமாகும். சகசரண MATRIX $M$ இன் உறுப்பு $M_{ij}$ என்பது உள்ளீடு மாறிலிகள் $X_i$ மற்றும் $X_j$ இடையேயுள்ள தொடர்பு ஆகும், மேலும் கோணம் $M_{ii}$ என்பது $X_i$ இன் பரவலாகும். அதேபோல், `np.corrcoef` நமக்கு **தொடர்பு_MATRIX** வழங்கும்.\n"
"இப்போது அந்த தொடர்களின் கூட்டாற்பாட்டையும் தொடர்பட்டுக் கூர்தலையும் கணக்கிடுவோம். `np.cov`என்பது நமக்கு **கூட்டாற்பாட்டு அட்டவணையை** வழங்கும், இது பல மாறிலிகளுக்கு கூட்டாற்பாட்டின் விரிவாக்கம் ஆகும். கூட்டாற்பாட்டு அட்டவணை $M$ இன் கூறு $M_{ij}$ என்பது உள்ளீட்டு மாறிலிகள் $X_i$ மற்றும் $X_j$ ஆகியவற்றுக்கிடையேயான தொடர்பு ஆகும், மேலும் ஒருமுக எழுத்து வடிவிலுள்ள मानங்கள் $M_{ii}$ என்பது $X_{i}$ இன் பரவலாகும். அதேபோல், `np.corrcoef` நமக்கு **தொடர்புச் சுருக்க அட்டவணையை** வழங்கும்.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ஒரு தொடர்பு 1 ஆக இருந்தால், இரண்டு மாறிலிகள் இடையில் ஒரு வலுவான ** сы்ததேச தொடர்பு** உள்ளது என்பதை 의미ப்படுத்தும். ஒருவனை மற்றவைக்கு எதிராக வரைபடம் வரைவதன் மூலம் இந்த сы்ததேச தொடர்பை தமிழில் காண முடியும்:\n"
"1 என்ற தொடர்பு என்பது இரண்டு மாறிலிகள் இடையில் ஒரு வலுவான **எழுத்து சார்ந்த உறவு** இருப்பதை குறிக்கும். ஒருவருடைய மதிப்பை மற்றவர்மீது வரைதல் மூலம் எழுத்து சார்ந்த உறவைக் காணலாம்:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நேரியல் தொடர்பு இல்லாவிடில் என்ன நடக்கும் என்பதை பார்க்கலாம். எங்கள் நிறுவனமானது உயரங்களுக்கும் சம்பளங்களுக்கும் இடையிலான தெளிவான நேரியல் சார்பை மறைத்து, சூத்திரத்தில் சில நேரியல் அல்லாத தன்மைகளை, உதாரணமாக `sin` ஐ அறிமுகப்படுத்தியது என்று கருதுக:\n"
"தொடர்பு நேரியல் அல்லாதது என்றால் என்ன நடக்கும் என்று பார்ப்போம். நமது நிறுவனமானது உயரங்களுக்கும் சம்பளங்களுக்குமான தெளிவான நேரியல் சார்பை மறைக்க முடிவு செய்தது, மேலும் சூத்திரத்தில் `sin` போன்ற ஒரு தவிர்க்க முடியாத மாறுபாட்டை அறிமுகப்படுத்தியது என்று கருதுக: \n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"இந்தக் காரணத்தில், தொடர்பு கொஞ்சம் குறைவாக உள்ளது, ஆனால் அது இன்னும் 꽤 உயர்ந்துள்ளது. இப்போது, தொடர்பை மேலும் தெளிவற்றதாக்க, சம்பளத்திற்கு சில சம்பவ மாறிலியைச் சேர்த்து கொஞ்சம் கூடுதல் சீரற்றத்தை நாங்கள் சேர்க்க விருப்பமுண்டாகலாம். என்ன நடக்கும் என்று பார்ப்போம்:\n"
"இந்த நிலையில், தொடர்பு சிறிது குறைவாக உள்ளது, ஆனால் அது இன்னும் மிகவும் உயர்ந்ததே ஆகும். இப்போது, அந்த உறவை இன்னும் குறைவாகத் தெரியப்படுத்த, சம்பளத்திற்கு சில கூடுதல் சீரில்லாத தன்மைகளைச் சேர்க்க விரும்பலாம். என்ன நடக்கும் என்று பார்ப்போம்:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> நீங்கள் எண்ணவுமா எதனால் குத்துக்கள் இந்த மாதிரியாக நேர்கொண்ட பத்திகளாக வருகிறதென்பதை?\n",
"> இந்தப் புள்ளிகள் இப்படி செங்குத்து கோடுகளாக வரிசைப்படுத்தப்படுவது ஏன் என்று நீங்கள் கணிக்க முடியுமா?\n",
"\n",
"சம்பளத்தை போன்ற செயற்கையாக வடிவமைக்கப்பட்ட கருத்து மற்றும் *உயரமா* என்கிற கவனிக்கப்பட்ட மாறி ஆகிய இரண்டிற்கும் இடையில் உள்ள தொடர்பை நாம் கவனித்துள்ளோம். உயரமும் எடையும் என்ற இரு கவனிக்கப்பட்ட மாறிகளும் தொடர்புடையவைகளா என்பதையும் பார்ப்போம்:\n"
"சம்பளம் போன்ற செயற்கையாக வடிவமைக்கப்பட்ட கருத்து மற்றும் நோக்கப்பட்ட மாறிலி *உடலளவு* இடையேயான தொடர்பை நாம் கவனித்துள்ளோம். உயரம் மற்றும் எடை போன்ற இரண்டு நோக்கப்பட்ட மாறிலிகளும் தொடர்புடையவையா என்று பார்ப்போம்:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"துரதிருஷ்டவசமாக, எங்களுக்கு எந்த முடிவுகளும் கிடைக்கவில்லை - சில விசித்திரமான `nan` மதிப்புகள் மட்டுமே இலவசமாகச் சேர்ந்துள்ளன. இதன் காரணம், நமது தொடரில் சில மதிப்புகள் வரையறுக்கப்படவில்லை, அவை `nan` எனக் குறிக்கப்பட்டுள்ளன, இது செயலியின் முடிவும் வரையறுக்கப்படவில்லை என்பதை ஏற்படுத்துகிறது. மாதிரிக்கட்டத்தை பார்த்து நாம் கண்டுபிடிக்கலாம் `Weight` என்பது சிக்கலான நுழைவாக உள்ளது, ஏனெனில் `Height` மதிப்புகளுக்கிடையேயான தன்னிச்சையான தொடர்பு கணக்கிடப்பட்டுள்ளது.\n",
"துரதிருஷ்டவசமாக, எங்களுக்கு எந்த முடிவுகளும் கிடைக்கவில்லை - சில அசாதாரண `nan` மதிப்புகள் மட்டும் கிடைத்தன. இது எமது வரிசை மதிப்புகளில் சில வரையறுக்கப்படாதவை, `nan` எனக் காணப்படுவது காரணமாக, செயல்பாட்டின் முடிவு கூட வரையறுக்கப்படாததாக மாறுகிறது. அட்டவணையைப் பார்க்கும்போது `Weight` என்பது பிரச்சனையான பத்தி என்பதை நாங்கள் காணலாம், ஏனெனில் `Height` மதிப்புக்கிடையேயான சுய தொடர்பு கணக்கிடப்பட்டுள்ளது.\n",
"\n",
"> இந்த எடுத்துக்காட்டு **தரவு தயாரிப்பு** மற்றும் **சுத்தம் செய்வதன்** முக்கியத்துவத்தை காட்டுகிறது. சரியான தரவு இல்லாமல் எதையும்தான் கணக்கிட முடியாது.\n",
"> இந்த உதாரணம் **தரவு முன்னோட்டம்** மற்றும் **தெளிவேற்றத் திறன்** என்பவற்றின் முக்கியத்துவத்தை காட்டுகிறது. சரியான தரவின்றி எதையும் கணக்கிட முடியாது.\n",
"\n",
"இறந்த மதிப்புகளை நிரப்ப `fillna` முறைஅமைப்பைப் பயன்படுத்த நாம் தொடர்பை கணக்கிடுவோம்:\n"
"`fillna` முறையை பயன்படுத்தி இழந்த மதிப்புகளை நிரப்பி, தொடர்பை கணக்கிடுவோம்:\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"உண்மையில் ஒரு தொடர்பு உள்ளது, ஆனால் எங்கள் செயற்கை உதாப்பில் இருந்ததைப்போல் மிகக் கூடுதல் வேதனை அல்ல. உண்மையில், ஒரு மதிப்பை மற்றொன்றுடன் எதிர்கொண்டுள்ள ஸ்காட்டர் பிளாடைப் பார்த்தால், அந்த உறவு அதிவேகமாக தெளிவாக இருக்காது:\n"
"உண்மையில் ஒரு தொடர்பு உள்ளது, ஆனால் எங்கள் செயற்கை எடுத்துக்காட்டில் உள்ளதைப் போன்ற பலத்த தொடர்பு அல்ல. உண்மையில், நாம் ஒரு மதிப்பை மற்றொன்றுடன் ஒப்பிடும் புள்ளி வரைபடத்தைப் பார்த்தால், அந்த தொடர்பு மிகவும் தெளிவாக இருக்காது:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## முடிவு\n",
"\n",
"இந்த நோட்டுபுக்-ல் நாங்கள் தரவுகளில் அடிப்படையான செயல்பாடுகளை எப்படி செய்ய வேண்டும் என்பதை கற்றுக்கொண்டோம், அதனால் புள்ளியியல் செயல்பாடுகளை கணக்கிடலாம். சில முன்னோக்கிய கருத்துக்களை சான்று காட்ட எங்களுக்குப் பயன்படும் கணிதம் மற்றும் புள்ளியியலின் ஒரு நன்றாக நிறுவப்பட்ட கருவியை எப்படிச் பயன்படுத்துவது மற்றும் தரவு மாதிரிக்கு கொடுக்கப்பட்ட குட்டிய சுட்டிக்குறிப்புக்கான நம்பிக்கைக் கோடுகளை எப்படிச் கணக்கிடுவது என்பதை நாங்கள் இப்போது அறிவோம்.\n"
"இந்த நோட்புக் இல், தரவு மீது அடிப்படையான செயல்பாடுகளை எப்படி செய்ய வேண்டும் மற்றும் புள்ளியியல் செயல்பாடுகளை எப்படி கணக்கிடுவது என்று கற்றுக்கொண்டோம். சில கருதுகோள்களை நிரூபிக்க கணிதம் மற்றும் புள்ளியியல் பற்றிய உறுதியான கருவியை எப்படி பயன்படுத்துவது என்பதை நாம் இப்போது அறிந்துள்ளோம், மற்றும் தரவு மாதிரியைப் பயன்படுத்தி சீரற்ற மாறிலிகளுக்கு நம்பகத்தன்மை இடைவெளிகளை எப்படி கணக்கிடுவது என்பதைப் பற்றி அறிவோம்.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**குறிப்பு**: \nஇந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைக் கொண்டு மொழிமாற்றம் செய்யப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சித்தாலும், தானாக மேற்கொள்ளப்பட்ட மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை நினைவில் கொள்ளவும். அதன் மூலமொழி ஆவணம் நம்பகமான ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழி மொழிபெயர்ப்பை பரிந்துரைக்கிறோம். இந்த மொழிபெயர்ப்பின் பயன்பாட்டால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கும் நாங்கள் பொறுப்புலை.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**மறுப்பு**:\nஇந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T22:18:02+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ta"
}
},
"nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# COVID-19 பாண்டமிக் மதிப்பீடு\n",
"# COVID-19 பரவலான தொற்று மதிப்பீடு\n",
"\n",
"## தரவு ஏற்றுதல்\n",
"\n",
"நாங்கள் COVID-19 பாதிக்கப்பட்ட நபர்களின் தரவுகளைப் பயன்படுத்த உள்ளோம், இது [Johns Hopkins பல்கலைக்கழகம்](https://jhu.edu/)யிலுள்ள [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) வழங்கியதாகும். தரவுத்தொகுப்பு [இந்த GitHub சேமிப்பகத்தில்](https://github.com/CSSEGISandData/COVID-19) கிடைக்கிறது.\n"
"நாங்கள் COVID-19 பாதிக்கப்பட்ட நபர்களைப் பற்றிய தரவுகளை [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ஆகிய [Johns Hopkins University](https://jhu.edu/) வழங்கியவை பயன்படுத்தவுள்ளோம். தரவுத்தொகுப்பு [இந்த GitHub Repository](https://github.com/CSSEGISandData/COVID-19) இல் கிடைக்கிறது.\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நாம் `pd.read_csv` பயன்படுத்தி GitHub இல் இருந்து நேரடியாக சமீபத்திய தரவை ஏற்றிக்கொள்ள முடியும். ஏதேனும் காரணம் நீங்களால் தரவு கிடைக்காதிருந்தால், நீங்கள் எப்போதும் உள்ளூர் `data` கோப்பகத்தில் இருக்கும் நகலை பயன்படுத்தலாம் - கீழே உள்ள `base_url` எனும் வரியை டீகமெண்ட் செய்யவும்:\n"
"நாம் சமீபத்திய தரவுகளை நேரடியாக GitHub-இல் இருந்து `pd.read_csv` பயன்படுத்தி ஏற்றலாம். ஏதேனும் காரணத்திற்காக தரவு கிடைக்காவிட்டால், நிரந்தரமாக உள்ள `data` கோப்புறையில் உள்ள நகலை எப்போதும் பயன்படுத்தலாம் - கீழே `base_url`-ஐ வரையறுக்கும் வரியை குறிக்கோடுகள் அகற்றி இயக்கவும்:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"இப்போது தொற்றாளர்களுக்கான தரவுகளை ஏற்றுவோம் மற்றும் அந்த தரவு எப்படி இருக்கிறது என்பதை பார்ப்போம்:\n"
"இப்போது பாதிக்கப்பட்ட நபர்களுக்கான தரவை ஏற்றுவோம் மற்றும் தரவு எப்படி இருக்கும் என்று பார்ப்போம்:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நாம் பார்க்க முடிகிறது ஒவ்வொரு வரிசையும் அட்டவணையில் ஒவ்வொரு நாட்டிற்கும் மற்றும்/அல்லது மாகாணத்திற்குமான தொற்றுற்ற நபர்களின் எண்ணிக்கையை வரையறுக்கின்றது, மற்றும் நெடுவரிசைகள் தேதிகளை குறிக்கின்றன. மீண்டவர்களின் எண்ணிக்கை மற்றும் இறப்புகளின் எண்ணிக்கை போன்ற பிற தரவுகளுக்காகவும் இதுபோன்ற அட்டவணைகள் ஏற்றப்படலாம்.\n"
"அட்டவணையின் ஒவ்வொரு வரிசையும் ஒவ்வொரு நாட்டிற்கும் மற்றும்/அல்லது பிராந்தியத்திற்கும் பாதிக்கப்பட்ட நபர்களின் எண்ணிக்கையை குறிப்பிடுகின்றது, மற்றும் நிாவலை க்கணிக அல்லது நாட்கள் என்பதை ஒவ்வொரு நெடுவரிசையும் குறிக்கின்றது. மீண்டும் குணமடைந்தோர் மற்றும் இறந்தோர் எண்ணிக்கை போன்ற பிற தரவுகளுக்கான ஒத்த அட்டவணைகள் ஏற்றப்படும்.\n"
]
},
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## தரவுகளை புரிந்துகொள்ளுதல்\n",
"## தரவின் அர்த்தத்தைப் புரிந்து கொள்வது\n",
"\n",
"மேலுள்ள அட்டவணையில், மாநில பிரிவு பங்கு தெளிவாக இல்லை. `Province/State` பகுதியிலுள்ள வேறுபட்ட மதிப்புகளை பார்க்கலாம்:\n"
"மேல் அட்டவணையிலிருந்து, 'province' பத்தியின் பங்கு தெளிவாக இல்லை. `Province/State` பத்தியில் உள்ள வெவ்வேறு மதிப்புகளைப் பார்த்துவிடலாம்:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"பெயர்களிலிருந்து, ஆஸ்திரேலியா மற்றும் சீனா போன்ற நாடுகளுக்கு மாகாணங்களின்படி விரிவான வகைப்படுத்தல் உள்ளதாக நாம் முடிவு செய்யலாம். எடுத்துக்காட்டாக சீனாவைப் பார்ப்போம்:\n"
"பெயர்களிலிருந்து ஆஸ்திரேலியா மற்றும் சீனா போன்ற நாடுகள் அதிக விரிவான பிரிவுகளை வழங்கும் என்று நாம் முடிவெடுக்கலாம். உதாரணமாக சீனாவைப் பற்றி தகவல் காண்போம்:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## தரவை முன்கூட்டியே செயலாக்குதல் \n",
"## தரவுகளை முன் செயலாக்கல் \n",
"\n",
"நாம் நாடுகளை மேலதிக பிரிவுகளாக உடைக்க விருப்பமில்லை, எனவே முதலில் இந்த உடைப்பை நீக்கி, அனைத்து பிரிவுகளுக்குமான தகவலை சேர்க்கப்போகிறோம், முழு நாட்டிற்கான தகவலை பெற. இது `groupby` பயன்படுத்தி செய்யலாம்:\n"
"நாங்கள் நாடுகளை மேலும் பிரிவுகளாக உடைக்க ஆர்வமாக இருக்கிறோம், எனவே முதலில் இந்த பிரிப்பை அகற்றி, அனைத்து பிரிவுகளின் தகவல்களையும் சேர்த்து, முழு நாட்டிற்குமான தகவலைப் பெறுவோம். இது `groupby` பயன்படுத்தி செய்ய முடியும்:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"`groupby` பயன்படுத்துவதால் அனைத்து DataFrameகளும் இப்போது Country/Region மூலம் குறியிடப்பட்டுள்ளன என்பதை நீங்கள் காணலாம். ஆகவே, ஒரு குறிப்பிட்ட நாட்டின் தரவை `.loc` பயன்படுத்தி அணுகலாம்:|\n"
"`groupby` பயன்படுத்துவதால் அனைத்து DataFrameகளும் இப்போது Country/Region மூலம் குறியிடப்பட்டுள்ளன என்று நீங்கள் பார்க்க முடியும். ஆகையால், நாங்கள் குறிப்பிட்ட நாட்டிற்கான தரவுகளை `.loc` பயன்படுத்தி அணுகலாம்:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **குறிப்பு** முதலில் உள்ள மூன்று உறுப்புகளை ([3:]) எப்படி நீக்குவது என்பதை கவனியுங்கள், அவற்றில் தேதியல்லாத மெட்டाडேட்டா (அமர்ந்த இடம்/மாவட்டம் மற்றும் இட மருத்துவக் கோரிக்கைகள்) அடங்கும். அந்த மூன்று பத்திகளையும் முழுமையாக நீக்கலாம்:\n"
"> **கவனம்** எவ்வாறு `[3:]` என்பதை பயன்படுத்தி ஆரம்ப மூன்று உறுப்புகளை அகற்றுகிறோம், அவை அநிதி மேட்டா தரவுகளைக் கொண்டுள்ளன (மாவட்டம்/மாநிலம் மற்றும் இடம் அமைவிடம் நெடுவரிசைகள்). நாம் அந்த மூன்று நெடுவரிசைகளையும் முழுமையாக நீக்கலாம்:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## தரவைப்பரிசீலனை\n",
"## தரவுகளை வினவுதல்\n",
"\n",
"இப்போது ஒரு குறிப்பிட்ட நாட்டை பரிசீலிக்க ஆதி மாறுவோம். தேதியின்படி அதிர்வுகளைக் கொண்ட தரவை உட்படுத்தும் ஒரு கட்டமைப்பை உருவாக்குவோம்:\n"
"இப்போது ஒரு குறிப்பிட்ட நாட்டை விசாரணை செய்வதற்கு மாறுவோம். தேதி அடிப்படையில் குறியிடப்பட்ட தொற்றுகளுக்கான தரவை கொண்ட ஒரு கட்டமைப்பை உருவாக்குவோம்:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"இப்போது ஒவ்வொரு நாளும் புதியமாக தொற்றுநோயாளிகளின் எண்ணிக்கையை கணக்கிடுவோம். இது தொற்று நோய் எவ்வாறு விரைந்து நிகழ்த்துகின்றது என்பதைக் காண உதவும். இதை செய்ய 가장 எளிதான நாள் `diff` ஐ பயன்படுத்துவதாகும்:\n"
"இப்போது ஒவ்வொரு நாளும் புதிய பாதிக்கப்பட்டவர்களின் எண்ணிக்கையை கணக்கிடுவோம். இது பரவல் எந்த வேகத்தில் முன்னேறுகிறது என்பதை பார்க்க உதவும். இதை செய்யக்கூடிய எளிமையான முறையாக `diff` பயன்படுத்துவது ஆகும்:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நாம் தரவுகளில் உயர் அதிர்வுகளை காணலாம். வாரிகளில் ஒன்றை நன்கு பார்க்கலாம்:\n"
"தரவுகளில் அதிக மாற்றங்களை நாம் பார்க்க முடிகிறது. வாருங்கள் ஒன்று மாதங்களில் ஒன்றை நெருக்கமாக பார்க்கலாம்:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"தரவில் வாராந்திர மாறுதல்கள் தெளிவாக தெரிகிறது. நாமும் போக்குகளை பார்க்க விரும்புகிறோம் என்பதால், இயக்கம் சராசரியை கணக்கிட்டு (அதாவது ஒவ்வொரு நாளுக்கும் முன்பே உள்ள பல நாட்களின் சராசரி மதிப்பை கணக்கிடுவோம்) வளைவுக்குக் குத்துணர்தலைச் சரிசெய்வது அர்த்தமுள்ளது:\n"
"தரவுகளில் வாராந்திர ஒருகட்ட மாற்றங்கள் இருக்கின்றன என்பது தெளிவாக தோன்றுகிறது. நாங்கள் போக்குகளை பார் ய விரும்புகிறோம் என்பதால், இயங்கும் சராசரி கணக்கிடுவதன் மூலம் வளைவைக் க்ளியேர் செய்வது முறையாகும் (அதாவது ஒவ்வொரு நாளுக்கும் முந்தைய பல நாட்களின் சராசரியைக் கணக்கிடுவோம்): \n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"பல நாடுகளை ஒப்பிடக்கூடிய வகையில், அந்த நாட்டின் மக்கள் தொகையை கருத்தில் கொள்ள விரும்பலாம், மற்றும் நாட்டின் மக்கள் தொகையின் சார்பில் பாதிக்கப்பட்டோர் சதவீதத்தை ஒப்பிடலாம். நாட்டின் மக்கள் தொகையை பெற, நாடுகளின் தரவுத் தொகுப்பை ஏற்றுவோம்:\n"
"பல நாடுகளை ஒப்பிடக் கூடிய வகையில், அந்த நாட்டின் மக்கள் தொகையை கருத்தில் கொண்டு நோயுற்ற நபர்களின் சதவிகிதத்தை நாட்டின் மக்கள் தொகையைப் பொருத்து ஒப்பிட விரும்பலாம். நாட்டின் மக்கள் தொகையைப் பெற, நாட்டுகளின் தரவுத்தொகுப்பை ஏற்கலாம்:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"இந்த தரவுத்தொகுப்பு இரு நாடுகளுக்கும் மாகாணங்களுக்கும் தகவல்களை கொண்டிருப்பதால், முழு நாட்டின் மக்கள் தொகையை பெற நாம் கொஞ்சம் புத்திசாலித்தனமாக இருக்க வேண்டியுள்ளது:\n"
"இந்த தரவுத் தொகுப்பு நாடுகளுக்கும் மாகாணங்களுக்கும் பற்றிய தகவலை கொண்டுள்ளது என்பதால், முழு நாட்டின் மக்கள் தொகையை பெற நாங்கள் கொஞ்சம் புத்திசாலியாக இருக்க வேண்டும்: \n"
]
},
{
@ -2261,15 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## கணக்கிடுதல் $R_t$\n",
"\n",
"உறுப்பிட்ட நோயின் பரவலைப் பார்க்க, நாம் **அடிப்படை பரவல் எண்** $R_0$ ஐப் பார்க்கிறோம், இது ஒரு பாதிக்கப்பட்ட நபர் மேலுமொரு பாதிப்பவர்களின் எண்ணிக்கையை குறிக்கிறது. $R_0$ 1 க்கும் மேலாக இருந்தால், தொற்று நிலவும் என்பதன் சாத்தியம் அதிகமாகும்.\n",
"நோய் எவ்வளவு தொற்றுநிலை என்றதை பார்க்க, நாம் **அடிப்படைக் கூட்டல் எண்** $R_0$-ஐப் பார்ப்போம், இது ஒரு பிடிக்கப்பட்ட நபர் மேலும் எத்தனை நபர்களை தொற்றுசெய்யலாம் என்பதைக் கூறுகிறது. $R_0$ 1-க்கு மேல் இருந்தால், பெருநோய் வீற்றுக்கொள்ள வாய்ப்பு அதிகம்.\n",
"\n",
"$R_0$ என்பது நோயின் தன்மையை மட்டுமே குறிக்கிறது, மேலும் மக்களின் சில பாதுகாப்பு நடவடிக்கைகளை பிரதிபலிக்காது, அவை தொற்றினை நெருக்கமாகக் கட்டுப்படுத்த உதவும். தொற்று நிலவரத்தின் போது, நாம் எந்த நேரத்திலும் $t$ இற்கான பரவல் எண் $R_t$ ஐ மதிப்பிடலாம். இந்த எண்ணை சுமார் 8 நாட்களுக்கான ஜன்னலை எடுத்துப் பெருக்கி கணக்கிடலாம் என்று நிரூபிக்கப்பட்டுள்ளது:\n",
"$$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"இதில் $I_t$ என்பது $t$ அன்று புதிய பாதிக்கப்பட்டவர்களின் எண்ணிக்கை.\n",
"$R_0$ என்பது நோயின் தன்மையே, மேலும் பெருநோயை தடுக்க மனிதர்கள் எடுக்கக்கூடிய சில பாதுகாப்பு நடவடிக்கைகள் இதிலே எடுத்துக் கொள்ளப்படாது. பெருநோய் வளர்ச்சியின் போது, நாம் எந்த நேரத்திலும் $t$இல் கூட்டல் எண் $R_t$ ஐ மதிப்பிடலாம். இந்த எண்ணை சுமார் 8 நாட்கள் கால சாளரத்தில் கொண்டு, கீழ்காணும் சமன்பாட்டை பயன்படுத்தி மதிப்பிட முடியும்: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"இங்கே $I_t$ என்பது நாள் $t$-இல் புதிதாக பிடிக்கப்பட்டவர்களின் எண்ணிக்கை.\n",
"\n",
"நாம் எங்கள் தொற்றுநோய் தரவினைப் பயன்படுத்தி $R_t$ ஐ கணக்கிடுவோம். இதற்காக, 8 `ninfected` மதிப்புகளுடன் ஒரு இடைவெளி ஜன்னலை எடுத்து, மேலுள்ள விகிதத்தை கணக்கிடும் செயல்பாட்டை செயல்படுத்துவோம்:\n"
"நமது பெருநோய் தரவுகளுக்கு $R_t$-ஐ கணக்கிடுவோம். இதற்காக, நாம் தொடுக்கும் ஜன்னல் 8 `ninfected` மதிப்புகளை எடுத்துக்கொண்டு மேல்காணும் விகிதத்தை கணக்கிடும் செயல்பாட்டை நடைமுறைப்படுத்துவோம்:\n"
]
},
{
@ -2299,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"நீங்கள் பார்க்க முடியும், வரைவில் சில இடைவெளிகள் உள்ளன. அவை `NaN` அல்லது தரவுத்தொகுப்பில் `inf` மதிப்புகள் இருந்தால் ஏற்படலாம். `inf` என்பது பூஜ்யத்தால் வகுத்தல் காரணமாக ஏற்படக்கூடும், மற்றும் `NaN` என்பது தரவு இல்லாததை அல்லது முடிவை கணக்கிட தேவையான தரவு கிடைக்காததைக் குறிக்கக்கூடும் (எங்கள் தொகுதியின் தொடக்கத்தில், அகலம் 8 கொண்ட சுழற்சி ஜன்னல் இன்னும் கிடைக்காத போது போல). வரைவைக் கண்ணியமாக்க, நாம் அந்த மதிப்புகளை `replace` மற்றும் `fillna` செயல்பாடுகளைப் பயன்படுத்தி நிரப்ப வேண்டும்.\n",
"கிராப்-ல் சில இடைவெளிகள் உள்ளதை நீங்கள் காணலாம். அவை `NaN` காரணமாகவோ, அல்லது தரவுத் தொகுதியில் `inf` மதிப்புகள் இருப்பதால் ஏற்படலாம். `inf` பாகுபாடு 0-ஆல் செய்யும்போது ஏற்படலாம், மேலும் `NaN` குறைந்த தரவை எதுவும் இல்லாது இருப்பதை அல்லது முடிவைப் பெற தேவையான தரவு இல்லை என்பதைக் குறிக்கலாம் (எங்களைப் போலவே, எங்கள் ஃப்ரேமின் ஆரம்பத்தில், அங்குள்ள 8 அகலம் கொண்ட உருண்டக ஜன்னல் இன்னும் கிடைக்காதது போல). கிராப்-ஐ சிறப்பாக செய்ய, அந்த மதிப்புகளை `replace` மற்றும் `fillna` செயல்பாடுகளைப் பயன்படுத்தி நிரப்ப வேண்டியிருக்கும்.\n",
"\n",
"பாண்டமிக் தொடக்கத்தை நாம் மேலும் பார்ப்போம். அதிகமாக காட்டு கொள்ள y-அச்சு மதிப்புகளை 6 க்குக் கீழ்ப்படியாக மட்டுப்படுத்தி பார்க்கிறோம், மேலும் 1 என்ற இடத்தில் ஒரு குறுக்கெழுத்து கோட்டை வரைபடத்தில் வரைவோம்.\n"
"தொற்றுநோய் ஆரம்பத்தை அதாவது ஆரம்பகாலத்தைக் அருகிலிருந்து மோசமாக பார்க்கலாம். சிறப்பாக பார்க்க y-அச்சு மதிப்புகளை 6-க்குக் கீழ் மட்டுமே காட்சிப்படுத்தவும், 1 என்பதில் ஒரு குறுக்குக்கோளை வரையவும் செய்வோம்.\n"
]
},
{
@ -2332,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"தோற்றுவாயின் மற்றொரு சுவாரஸ்யமான குறியீடு **ஒப்புக்கோள்**, அல்லது புதிய வழக்கு எண்ணில் **தினசரி வேறுபாடு** ஆகும். இது தொற்றுநோய் அதிகரிக்கிறதா அல்லது குறைகிறதா என்பதை நமக்கு தெளிவாக காண்வதற்கு உதவுகிறது.\n"
"பாண்டமிக் பற்றிய மற்றொரு சுவாரஸ்யமான குறியீடு **வேதியியல் வேறுபாடு** அல்லது புதிய வழக்குகளில் **தினசரி வித்தியாசம்** ஆகும். இது பாண்டமிக் அதிகரிக்கும் போது அல்லது குறையும்போதை தெளிவாக பார்க்க உதவுகிறது.\n"
]
},
{
@ -2361,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"அறிவிக்கப்பட்டதின் காரணமாக தரவுகளில் நிறைய மாற்றங்கள் உள்ளதை கருத்தில் கொண்டு, மொத்த படத்தைப் பெற ரோலிங் சராசரி இயக்கி வளைவை மென்மையாக்குவது பொருத்தமாகும். மீண்டும் சமத்திற்கு வரும் மாதங்களில் கவனம் செலுத்துவோம்:\n"
"தகவலறிக்குவதால் உண்டாகும் பல்வேறு வேறுபாடுகள் உள்ளதால், மொத்த பார்ப்பை பெற சராசரி மாறன் ஓட்ட வளைவைக் குறைக்குவது பொருத்தமாக இருக்கும். வியாதி பரவல் ஆரம்ப மாதங்களுக்கு மீண்டும் கவனம் செலுத்துவோம்:\n"
]
},
{
@ -2391,26 +2391,27 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## சவால்\n",
"\n",
"இப்பொழுது நீங்கள் குறியீடு மற்றும் தரவுடன் மேலும் விளையாட நேரம் வந்துவிட்டது! நீங்கள் முயற்சிக்கக்கூடிய சில பரிந்துரைகள் இங்கே உள்ளன:\n",
"* விவிந்த நாடுகளில் பரவல் எவ்வாறு உள்ளது என்பதைப் பார்க்கவும்.\n",
"* ஒவ்வொரு நாட்டிற்கும் $R_t$ வரைபடங்களை ஒப்பிட ஒன்றே ஒரு வரைபடத்தில் அல்லது ஒரே நேரத்தில் பல வரைபடங்களை உருவாக்கவும்\n",
"* இறப்புகளின் மற்றும் குணமடைந்தவர்களின் எண்ணிக்கை எவ்வாறு தொற்றாளர்களின் எண்ணிக்கையுடன் தொடர்புடையது என்பதைப் பாருங்கள்.\n",
"* ஒரு சாதாரண நோய் எவ்வளவு காலம் நீடிக்கிறது என்பதை தொற்று விகிதம் மற்றும் இறப்பு விகிதத்துடன் காட்சிப்படுத்தி பார்க்கவும் மற்றும் சில விதிவிலக்குகளை தேடவும். இதை கண்டுபிடிக்க பல நாடுகளைப் பார்க்க வேண்டியிருக்கலாம்.\n",
"* இறப்பு விகிதத்தை கணக்கிடவும் அது காலப்போக்கில் எப்படி மாறுகிறது என்பதையும் பார்க்கவும். கணக்கீட்டுக்கு முன் நோயின் நீண்டகாலத்தை கவனிக்க நாள்களை எடுத்துக்கொள்ளலாம்.\n"
"இப்பது நீங்கள் குறியீடு மற்றும் தரவுடன் மேலும் விளையாட நேரம் வந்துள்ளது! இங்கே நீங்கள் முயற்சிக்கக்கூடிய சில பரிந்துரைகள் உள்ளன:\n",
"* வேறு நாடுகளில் நோய்த்தொற்றின் பரவலை பார்க்கவும்.\n",
"* ஒப்பீட்டிற்காக பல நாடுகளுக்கான $R_t$ கோட்டுகளை ஒரு வரைபடத்தில் வரைதல், அல்லது பல வரைபடங்களை பக்கம்மேல் அமைத்தல்\n",
"* இறப்புகளின் மற்றும் குணமடைந்தவர்களின் எண்ணிக்கை பாதிக்கப்பட்டவர்களின் எண்ணிக்கையுடன் எப்படி தொடர்புடையது என்பதைப் பாருங்கள்.\n",
"* நோய் பொதுவாக எவ்வளவு காலம் நீடிக்கும் என்பதைத் தெரிந்து கொள்ள முயற்சியுங்கள், தொற்றுநிலை மற்றும் இறப்பு விகிதங்களை கண்ணோட்டமாக ஒப்பிட்டு சில விசித்திரங்களை தேடுங்கள். அதை கண்டறிய பல்வேறு நாடுகள் பார்க்க வேண்டியிருக்கலாம்.\n",
"* இறப்பு விகிதத்தை கணக்கிடுங்கள் மற்றும் அது காலத்திற்குள் எப்படி மாறுகிறது என்பதை அறியுங்கள். கணக்கீடுகளை செய்யும்முன் ஒரு நேர தொடர்களை மாற்ற, நோய் நீண்டகாலம் கிரகிக்கப்படுகிறதை கணக்கில் கொள்ளலாம்\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## குறிப்பு\n",
"## குறிப்பு விவரங்கள்\n",
"\n",
"COVID தொற்று பரவல் குறித்து விரிவான ஆராய்ச்சிகளை பின்வரும் வெளியீடுகளில் பார்க்கலாம்:\n",
"* [COVID தொற்று காலத்தில் Rt மதிப்பீட்டுக்கான ஸ்லைடிங் SIR மாடல்](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com) அவர்களின் வலை பதிவில்\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [உலகளாவிய COVID-19 பரவலுக்கான காலத்திற்கு பொருத்தமான புதுமுறை வெள்ளை எண்ணிக்கை மதிப்பீடு](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [மேலே உள்ள கட்டுரைக்கான GitHub குறியீடு](https://github.com/shwars/SlidingSIR)\n"
"கீழ்க்கண்ட வெளியீடுகளில் COVID எபிடெமிக் பரவலைப் பற்றி மேலதிக ஆய்வுகளைப் பார்க்கலாம்:\n",
"* [COVID தொற்றுக் காலத்தில் Rt கணக்கிடும் ஸ்லைடிங் SIR மாதிரி](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com) என்ற எழுத்தாளரின் வலைப்பதிவு பதிவுகள்\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [உலகளாவிய COVID-19 பரவலுக்கு நேரம் சார்ந்த பரபரப்புக் குறியீட்டுக்கான மதிப்பீடு](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [மேலே குறிப்பிடப்பட்ட கட்டுரைக்கு GitHub இல் உள்ள குறியீடு](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2424,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**பிரகடனம்**:\nஇந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) மூலம் மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சித்தாலும், தானாக இயங்கும் மொழிபெயர்ப்புகள் பிழைகள் அல்லது தவறுகளை கொண்டிருக்கலாம் என்பதை நினைவில் வைக்கவும். உள்ளூர் மொழியில் உள்ள அசல் ஆவணம் அதிகாரப்பூர்வமான மூலமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்குத் தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படும். இந்த மொழிபெயர்ப்பின் பயன்படுத்துவதால் ஏற்பட்டுள்ள எந்த தவறும் அல்லது தவறான புரிதல்களுக்கும் நாம் பொறுப்பில்லை.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**மறுப்பு**:\nஇந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# அபாயகரமான தொடர்புகள் தரவுக் காட்சிப்படுத்தல் திட்டம்
# டேஞ்சரஸு லய்ட்சன்ஸ் தரவு காட்சிப்படுத்தும் திட்டம்
தொடங்குவதற்கு, உங்கள் கணினியில் NPM மற்றும் Node இயங்குகிறதா என்பதை உறுதிப்படுத்த வேண்டும். சார்புகளை நிறுவவும் (npm install) மற்றும் பின்னர் திட்டத்தை உள்ளூரில் இயக்கவும் (npm run serve):
தொடங்க, உங்கள் மெயினில் NPM மற்றும் Node **>=20.0.0** இயங்குவதை உறுதிப்படுத்த வேண்டும். பொறுப்பீடுகளை நிறுவுங்கள் (npm install) பின்னர் திட்டத்தை உள்ளூர் இயங்க செய்யவும் (npm run serve):
## திட்ட அமைப்பு
```
npm install
```
### மேம்பாட்டிற்காக தொகுத்து, தானாக மீண்டும் ஏற்றுகிறது
### மேம்பாட்டுக்காக தொகுக்கும் மற்றும் சூடுபரிசீலனை செய்யும்
```
npm run serve
```
### உற்பத்திக்காக தொகுத்து, சுருக்குகிறது
### வெளியீட்டுக்காக தொகுக்கும் மற்றும் சுருக்கப்படும்
```
npm run build
```
### கோப்புகளை சீரமைத்து, பிழைகளை சரிசெய்கிறது
### கோப்புகளை சோதித்து திருத்துகிறது
```
npm run lint
```
### அமைப்பை தனிப்பயனாக்கவும்
[அமைப்பு குறிப்பு](https://cli.vuejs.org/config/) பார்க்கவும்.
### கட்டமைப்பை தனிப்பயன் செய்யவும்
[Configuration Reference](https://cli.vuejs.org/config/) ஐ பார்.
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கிறோம், ஆனால் தானியக்க மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளுங்கள். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# அபாயகரமான தொடர்புகள் தரவுக் காட்சிப்படுத்தல் திட்டம்
# அபாயகரமான தொடர்புகள் தரவுத் திரைப்பிழை நெறித் திட்டம்
ொடங்குவதற்கு, உங்கள் கணினியில் NPM மற்றும் Node இயங்குகிறதா என்பதை உறுதிப்படுத்த வேண்டும். சார்புகளை நிறுவவும் (npm install) மற்றும் பின்னர் திட்டத்தை உள்ளூரில் இயக்கவும் (npm run serve):
ுவக்குவதற்கு, உங்கள் கணினியில் NPM மற்றும் Node **>=20.0.0** இயங்குகிறது என்பதை உறுதி செய்ய வேண்டும். சார்புகளை நிறுவவும் (npm install) பின்னர் இடதுசாரி திட்டத்தை இயக்கவும் (npm run serve):
## திட்ட அமைப்பு
```
npm install
```
### மேம்பாட்டிற்காக தொகுத்து, தானாக மீண்டும் ஏற்றுகிறது
### வெகுஜன வளர்ச்சிக்காக தொகுக்கவும், சூடான மறுசுழற்சி செய்யவும்
```
npm run serve
```
### உற்பத்திக்காக தொகுத்து, சுருக்குகிறது
### உற்பத்திக்காக தொகுக்கவும், சுருக்கவும்
```
npm run build
```
### கோப்புகளை சீரமைத்து, பிழைகளை சரிசெய்கிறது
### கோப்புகளை ஆராய்ந்து திருத்தவும்
```
npm run lint
```
### மைப்பை தனிப்பயனாக்கவும்
[அமைப்பு குறிப்பு](https://cli.vuejs.org/config/) பார்க்கவும்.
### கட்டமைப்பை தனிப்பயனாக்கவும்
பார்க்கவும் [Configuration Reference](https://cli.vuejs.org/config/).
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையை பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கின்றோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளுங்கள். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save