[ta,et,pcm] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Tamil [ta], Estonian [et], Nigerian Pidgin [pcm]
update-translations
localizeflow[bot] 1 month ago
parent c40c66d479
commit 1c9a1915e8

@ -101,6 +101,12 @@
"source_file": "8-Reinforcement/2-Gym/images/cartpole.png",
"language_code": "et"
},
"catplot.e73fc35fdf96242b.webp": {
"original_hash": "90cd4782a2f9b40dec8218b224b29c1c",
"translation_date": "2026-07-14T00:25:17+00:00",
"source_file": "2-Regression/2-Data/images/catplot.png",
"language_code": "et"
},
"centroid.097fde836cf6c918.webp": {
"original_hash": "c8f866ed446563d8e59087f1bca1f97d",
"translation_date": "2026-01-16T17:39:07+00:00",
@ -383,6 +389,12 @@
"source_file": "2-Regression/3-Linear/images/heatmap.png",
"language_code": "et"
},
"heatmap.bd98dce43b404c57.webp": {
"original_hash": "7f2f2fbd993018bc01346e1eb8ae692e",
"translation_date": "2026-07-14T00:25:29+00:00",
"source_file": "2-Regression/2-Data/images/heatmap.png",
"language_code": "et"
},
"hierarchical.bf59403aa43c8c47.webp": {
"original_hash": "50b9bc3298659c463ae76564ca645b12",
"translation_date": "2026-01-16T17:38:49+00:00",
@ -473,6 +485,12 @@
"source_file": "2-Regression/3-Linear/images/linear.png",
"language_code": "et"
},
"lineplot.f9034ba47b1e30ee.webp": {
"original_hash": "b3959c0ed0f02f668009c76b95c4ebbb",
"translation_date": "2026-07-14T00:25:34+00:00",
"source_file": "2-Regression/2-Data/images/lineplot.png",
"language_code": "et"
},
"lobe.2fa0806408ef9923.webp": {
"original_hash": "e6ec71dbe350aef39135dbf88bc89163",
"translation_date": "2026-01-16T17:36:13+00:00",
@ -743,6 +761,12 @@
"source_file": "2-Regression/3-Linear/images/recipes.png",
"language_code": "et"
},
"relplot.a03837d8f0329cec.webp": {
"original_hash": "4733544cb1c2e58e987087283e66b4a5",
"translation_date": "2026-07-14T00:25:22+00:00",
"source_file": "2-Regression/2-Data/images/relplot.png",
"language_code": "et"
},
"scaled.91897dfbaa26ca4a.webp": {
"original_hash": "789c70fafe6f6dd6e377a90b66e7d740",
"translation_date": "2026-01-16T17:49:32+00:00",

Binary file not shown.

After

Width:  |  Height:  |  Size: 3.5 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 7.3 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 12 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 6.3 KiB

@ -101,6 +101,12 @@
"source_file": "8-Reinforcement/2-Gym/images/cartpole.png",
"language_code": "pcm"
},
"catplot.e73fc35fdf96242b.webp": {
"original_hash": "90cd4782a2f9b40dec8218b224b29c1c",
"translation_date": "2026-07-14T00:25:18+00:00",
"source_file": "2-Regression/2-Data/images/catplot.png",
"language_code": "pcm"
},
"centroid.097fde836cf6c918.webp": {
"original_hash": "c8f866ed446563d8e59087f1bca1f97d",
"translation_date": "2026-01-16T17:39:11+00:00",
@ -383,6 +389,12 @@
"source_file": "2-Regression/3-Linear/images/heatmap.png",
"language_code": "pcm"
},
"heatmap.bd98dce43b404c57.webp": {
"original_hash": "7f2f2fbd993018bc01346e1eb8ae692e",
"translation_date": "2026-07-14T00:25:31+00:00",
"source_file": "2-Regression/2-Data/images/heatmap.png",
"language_code": "pcm"
},
"hierarchical.bf59403aa43c8c47.webp": {
"original_hash": "50b9bc3298659c463ae76564ca645b12",
"translation_date": "2026-01-16T17:38:53+00:00",
@ -473,6 +485,12 @@
"source_file": "2-Regression/3-Linear/images/linear.png",
"language_code": "pcm"
},
"lineplot.f9034ba47b1e30ee.webp": {
"original_hash": "b3959c0ed0f02f668009c76b95c4ebbb",
"translation_date": "2026-07-14T00:25:36+00:00",
"source_file": "2-Regression/2-Data/images/lineplot.png",
"language_code": "pcm"
},
"lobe.2fa0806408ef9923.webp": {
"original_hash": "e6ec71dbe350aef39135dbf88bc89163",
"translation_date": "2026-01-16T17:36:20+00:00",
@ -743,6 +761,12 @@
"source_file": "2-Regression/3-Linear/images/recipes.png",
"language_code": "pcm"
},
"relplot.a03837d8f0329cec.webp": {
"original_hash": "4733544cb1c2e58e987087283e66b4a5",
"translation_date": "2026-07-14T00:25:24+00:00",
"source_file": "2-Regression/2-Data/images/relplot.png",
"language_code": "pcm"
},
"scaled.91897dfbaa26ca4a.webp": {
"original_hash": "789c70fafe6f6dd6e377a90b66e7d740",
"translation_date": "2026-01-16T17:49:33+00:00",

Binary file not shown.

After

Width:  |  Height:  |  Size: 3.6 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 7.4 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 12 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 6.4 KiB

@ -101,6 +101,12 @@
"source_file": "8-Reinforcement/2-Gym/images/cartpole.png",
"language_code": "ta"
},
"catplot.e73fc35fdf96242b.webp": {
"original_hash": "90cd4782a2f9b40dec8218b224b29c1c",
"translation_date": "2026-07-14T00:25:16+00:00",
"source_file": "2-Regression/2-Data/images/catplot.png",
"language_code": "ta"
},
"centroid.097fde836cf6c918.webp": {
"original_hash": "c8f866ed446563d8e59087f1bca1f97d",
"translation_date": "2026-01-16T17:39:04+00:00",
@ -383,6 +389,12 @@
"source_file": "2-Regression/3-Linear/images/heatmap.png",
"language_code": "ta"
},
"heatmap.bd98dce43b404c57.webp": {
"original_hash": "7f2f2fbd993018bc01346e1eb8ae692e",
"translation_date": "2026-07-14T00:25:27+00:00",
"source_file": "2-Regression/2-Data/images/heatmap.png",
"language_code": "ta"
},
"hierarchical.bf59403aa43c8c47.webp": {
"original_hash": "50b9bc3298659c463ae76564ca645b12",
"translation_date": "2026-01-16T17:38:44+00:00",
@ -473,6 +485,12 @@
"source_file": "2-Regression/3-Linear/images/linear.png",
"language_code": "ta"
},
"lineplot.f9034ba47b1e30ee.webp": {
"original_hash": "b3959c0ed0f02f668009c76b95c4ebbb",
"translation_date": "2026-07-14T00:25:33+00:00",
"source_file": "2-Regression/2-Data/images/lineplot.png",
"language_code": "ta"
},
"lobe.2fa0806408ef9923.webp": {
"original_hash": "e6ec71dbe350aef39135dbf88bc89163",
"translation_date": "2026-01-16T17:36:06+00:00",
@ -743,6 +761,12 @@
"source_file": "2-Regression/3-Linear/images/recipes.png",
"language_code": "ta"
},
"relplot.a03837d8f0329cec.webp": {
"original_hash": "4733544cb1c2e58e987087283e66b4a5",
"translation_date": "2026-07-14T00:25:20+00:00",
"source_file": "2-Regression/2-Data/images/relplot.png",
"language_code": "ta"
},
"scaled.91897dfbaa26ca4a.webp": {
"original_hash": "789c70fafe6f6dd6e377a90b66e7d740",
"translation_date": "2026-01-16T17:49:31+00:00",

Binary file not shown.

After

Width:  |  Height:  |  Size: 3.7 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 7.8 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 12 KiB

Binary file not shown.

After

Width:  |  Height:  |  Size: 6.5 KiB

@ -24,8 +24,8 @@
"language_code": "et"
},
"1-Introduction/3-fairness/README.md": {
"original_hash": "9a6b702d1437c0467e3c5c28d763dac2",
"translation_date": "2025-10-11T11:26:33+00:00",
"original_hash": "0f00d72169a0d37eecfd16d71e01700a",
"translation_date": "2026-07-14T00:20:25+00:00",
"source_file": "1-Introduction/3-fairness/README.md",
"language_code": "et"
},
@ -54,8 +54,8 @@
"language_code": "et"
},
"2-Regression/1-Tools/README.md": {
"original_hash": "fa81d226c71d5af7a2cade31c1c92b88",
"translation_date": "2025-10-11T11:43:52+00:00",
"original_hash": "0b8635427b582d03ea4ab7089b93e505",
"translation_date": "2026-07-14T00:18:55+00:00",
"source_file": "2-Regression/1-Tools/README.md",
"language_code": "et"
},
@ -72,8 +72,8 @@
"language_code": "et"
},
"2-Regression/2-Data/README.md": {
"original_hash": "7c077988328ebfe33b24d07945f16eca",
"translation_date": "2025-10-11T11:47:54+00:00",
"original_hash": "a58b2c4d16c6b122643391745ac15af6",
"translation_date": "2026-07-14T00:19:41+00:00",
"source_file": "2-Regression/2-Data/README.md",
"language_code": "et"
},
@ -89,6 +89,12 @@
"source_file": "2-Regression/2-Data/solution/Julia/README.md",
"language_code": "et"
},
"2-Regression/2-Data/solution/notebook.ipynb": {
"original_hash": "96b95f8cf473481f2f371de8156f1571",
"translation_date": "2026-07-13T23:59:50+00:00",
"source_file": "2-Regression/2-Data/solution/notebook.ipynb",
"language_code": "et"
},
"2-Regression/3-Linear/README.md": {
"original_hash": "8b776e731c35b171d316d01d0e7b1369",
"translation_date": "2026-04-26T19:25:13+00:00",
@ -581,6 +587,19 @@
"source_file": "TROUBLESHOOTING.md",
"language_code": "et"
},
"__translation_failures__": {
"sketchnotes/LICENSE.md": {
"original_hash": "fba3b94d88bfb9b81369b869a1e9a20f",
"source_file": "sketchnotes/LICENSE.md",
"language_code": "et",
"failure_date": "2026-07-14T00:17:39+00:00",
"status": "failed",
"error_type": "TranslationIncompleteError",
"error_message": "Markdown translation remained incomplete for chunk 1.1.1 of 'LICENSE.md', and the chunk could not be split further.",
"translator_version": "0.20.0",
"failure_policy_version": 1
}
},
"docs/_sidebar.md": {
"original_hash": "68dd06c685f6ce840e0acfa313352e7c",
"translation_date": "2025-10-11T11:48:54+00:00",

@ -1,148 +1,167 @@
# Masinõppe lahenduste loomine vastutustundliku tehisintellektiga
# Vastutustundliku tehisintellektiga masinõppe lahenduste loomine
![Vastutustundliku tehisintellekti kokkuvõte masinõppes sketšimärkmetes](../../../../translated_images/et/ml-fairness.ef296ebec6afc98a.webp)
> Sketšimärkmed: [Tomomi Imura](https://www.twitter.com/girlie_mac)
![Vastutustundliku tehisintellekti kokkuvõte masinõppes joonistatud märkmetena](../../../../translated_images/et/ml-fairness.ef296ebec6afc98a.webp)
> Joonismärkus autorilt [Tomomi Imura](https://www.twitter.com/girlie_mac)
## [Loengu-eelne viktoriin](https://ff-quizzes.netlify.app/en/ml/)
## [Eel-loengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
## Sissejuhatus
Selles õppekavas hakkate avastama, kuidas masinõpe mõjutab meie igapäevaelu. Juba praegu on süsteemid ja mudelid seotud igapäevaste otsustusprotsessidega, nagu tervishoiudiagnoosid, laenu heakskiitmine või pettuste tuvastamine. Seetõttu on oluline, et need mudelid töötaksid hästi ja pakuksid usaldusväärseid tulemusi. Nagu iga tarkvararakendus, võivad ka tehisintellekti süsteemid eksida ootustes või anda soovimatuid tulemusi. Seetõttu on hädavajalik mõista ja selgitada tehisintellekti mudeli käitumist.
Selles õppekavas hakkate avastama, kuidas masinõpe mõjutab ja võib mõjutada meie igapäevaelu. Juba praegu osalevad süsteemid ja mudelid igapäevastes otsustusülesannetes, nagu tervishoiudiagnoosid, laenude heakskiitmine või pettuste tuvastamine. Seepärast on oluline, et need mudelid töötaksid hästi ja pakuksid usaldusväärseid tulemusi. Nagu iga tarkvararakenduse puhul, võivad ka tehisintellekti süsteemid mitte vastata ootustele või anda soovimatuid tulemusi. Seetõttu on oluline mõista ja osata selgitada tehisintellekti mudeli käitumist.
Kujutage ette, mis juhtub, kui andmed, mida kasutate mudelite loomiseks, ei sisalda teatud demograafilisi rühmi, nagu rass, sugu, poliitilised vaated, religioon, või esindavad neid ebaproportsionaalselt. Mis saab siis, kui mudeli väljund eelistab teatud demograafilist rühma? Millised on tagajärjed rakendusele? Lisaks, mis juhtub siis, kui mudelil on kahjulik tulemus? Kes vastutab tehisintellekti süsteemi käitumise eest? Need on mõned küsimused, mida selles õppekavas uurime.
Kujutage ette, mis võib juhtuda, kui andmed, mida kasutate nende mudelite loomiseks, puudutavad teatud demograafilisi rühmi, näiteks rassi, sugu, poliitilist vaadet, usku või esindavad selliseid rühmi ebaproportsionaalselt. Mis saab siis, kui mudeli väljundit tõlgendatakse ühekülgselt mõne demograafilise rühma kasuks? Millised on tagajärjed rakendusele? Lisaks, mis juhtub, kui mudel annab kahjuliku tulemuse inimestele? Kes vastutab tehisintellekti süsteemi käitumise eest? Need on mõned küsimused, mida selles õppekavas uurime.
Selles õppetükis:
- Tõstate teadlikkust masinõppe õiglusest ja sellega seotud kahjudest.
- Tutvute praktika ja ebatavaliste stsenaariumide uurimisega, et tagada usaldusväärsus ja ohutus.
- Saate aru, miks on oluline luua kaasavaid süsteeme, mis võimestavad kõiki.
- Uurite, kui tähtis on kaitsta inimeste ja andmete privaatsust ja turvalisust.
- Näete, kui oluline on "klaaskasti" lähenemine tehisintellekti mudelite käitumise selgitamiseks.
- Mõistate, kuidas vastutus on hädavajalik tehisintellekti süsteemide usalduse loomiseks.
- Suurendate teadlikkust õiglusest masinõppes ja sellega seotud kahjudest.
- Tutvute haruliste juhtumite ja ebatavaliste stsenaariumite uurimise praktikaga, et tagada usaldusväärsus ja ohutus.
- Saate aru vajadusest võimestada kõiki, kujundades kaasavaid süsteeme.
- Uurite, kui tähtis on kaitsta andmete ja inimeste privaatsust ja turvalisust.
- Näete, kui oluline on läbipaistva lähenemisega selgitada tehisintellekti mudelite käitumist.
- Olete teadlik sellest, kui oluline on vastutus, et ehitada usaldust tehisintellekti süsteemide vastu.
## Eeltingimus
## Eelteadmised
Eeltingimusena palun läbige "Vastutustundliku tehisintellekti põhimõtted" õppeprogramm ja vaadake allolevat videot:
Eelteadmise jaoks palun läbitage „Vastutustundliku tehisintellekti põhimõtted“ õpperada ja vaadake allolevat videot sellel teemal:
Lisateavet vastutustundliku tehisintellekti kohta leiate siit: [Õppeprogramm](https://docs.microsoft.com/learn/modules/responsible-ai-principles/?WT.mc_id=academic-77952-leestott)
Lisateavet vastutustundliku tehisintellekti kohta leiate järgides seda [Õpperada](https://docs.microsoft.com/learn/modules/responsible-ai-principles/?WT.mc_id=academic-77952-leestott)
[![Microsofti lähenemine vastutustundlikule tehisintellektile](https://img.youtube.com/vi/dnC8-uUZXSc/0.jpg)](https://youtu.be/dnC8-uUZXSc "Microsofti lähenemine vastutustundlikule tehisintellektile")
[![Microsofti lähenemine vastutustundlikule tehisintellektile](https://img.youtube.com/vi/dnC8-uUZXSc/0.jpg)](https://youtu.be/dnC8-uUZXSc "Microsofti lähenemine vastutustundlikule AI-le")
> 🎥 Klõpsake ülaloleval pildil, et vaadata videot: Microsofti lähenemine vastutustundlikule tehisintellektile
> 🎥 Klõpsake ülaloleval pildil video vaatamiseks: Microsofti lähenemine vastutustundlikule tehisintellektile
## Õiglus
Tehisintellekti süsteemid peaksid kohtlema kõiki õiglaselt ja vältima sarnaste inimrühmade erinevat kohtlemist. Näiteks kui tehisintellekti süsteemid annavad juhiseid meditsiinilise ravi, laenutaotluste või töölevõtmise kohta, peaksid nad tegema samad soovitused kõigile, kellel on sarnased sümptomid, finantsolukord või professionaalsed kvalifikatsioonid. Igaüks meist kannab endaga kaasas pärilikke eelarvamusi, mis mõjutavad meie otsuseid ja tegevusi. Need eelarvamused võivad ilmneda andmetes, mida kasutame tehisintellekti süsteemide treenimiseks. Selline manipuleerimine võib mõnikord juhtuda tahtmatult. Sageli on raske teadlikult märgata, millal andmetesse eelarvamusi lisate.
Tehisintellekti süsteemid peaksid kõigi suhtes käituma õiglaselt ega tohi mõjutada sarnaseid inimrühmi erinevalt. Näiteks kui tehisintellekti süsteemid annavad juhiseid meditsiinilise ravi, laenutaotluste või töölevõtmise kohta, peaksid nad tegema samad soovitused kõigile, kellel on sarnased sümptomid, rahalised olud või kutseoskused. Me kõik kanname kaasas päritud eelarvamusi, mis mõjutavad meie otsuseid ja tegusid. Need eelarvamused võivad olla nähtavad andmetes, mida kasutame tehisintellekti süsteemide koolitamiseks. Selline manipulatsioon võib juhtuda sageli tahtmatult. Teadlikult on sageli keeruline teada, millal andmetesse eelarvamus sisse juhitakse.
**"Ebaõiglus"** hõlmab negatiivseid mõjusid või "kahjusid" inimrühmale, näiteks rassi, soo, vanuse või puude alusel. Peamised õigusega seotud kahjud võib jagada järgmiselt:
**„Ebaõiglus“** hõlmab negatiivseid mõjusid või „kahjusid“ teatud inimrühma jaoks, näiteks rassi, soo, vanuse või puude seisundi alusel määratletud rühmasid. Peamised õiglusest tulenevad kahjud võib klassifitseerida järgmiselt:
- **Jaotamine**, kui näiteks sugu või etnilist kuuluvust eelistatakse teisele.
- **Teenuse kvaliteet**. Kui treenite andmeid ühe konkreetse stsenaariumi jaoks, kuid tegelikkus on palju keerulisem, viib see halvasti toimiva teenuseni. Näiteks käte seebidosaator, mis ei suutnud tuvastada tumedanahalisi inimesi. [Viide](https://gizmodo.com/why-cant-this-soap-dispenser-identify-dark-skin-1797931773)
- **Halvustamine**. Ebaõiglane kriitika ja kellegi või millegi sildistamine. Näiteks pildisildistamise tehnoloogia, mis kurikuulsalt ekslikult sildistas tumedanahaliste inimeste pilte gorilladena.
- **Üle- või alaesindatus**. Idee, et teatud rühma ei nähta teatud ametis, ja iga teenus või funktsioon, mis seda jätkuvalt edendab, aitab kaasa kahjule.
- **Stereotüpiseerimine**. Teatud rühma seostamine eelnevalt määratud omadustega. Näiteks inglise ja türgi keele vahel tõlkiv süsteem võib eksida sõnadega, millel on sooga seotud stereotüüpsed seosed.
- **Jaotus**, kui näiteks üks sugu või etniline rühm saab teise ees eelise.
- **Teenuse kvaliteet**. Kui treenite mudelit ainult konkreetse stsenaariumi jaoks, kuid tegelikkus on palju keerukam, viib see kehva teeninduse tulemuseni. Näiteks käsiseebidosaator, mis tundus olevat võimetu märkama tumeda nahaga inimesi. [Allikas](https://gizmodo.com/why-cant-this-soap-dispenser-identify-dark-skin-1797931773)
- **Määrimine**. Ebaõiglane kriitika ja märgistamine kellegi või millegi kohta. Näiteks pildituvastustehnoloogia ekslikult märkis tumeda nahavärviga inimeste pilte gorilladena.
- **Liigne või vähene esindatus**. Mõte on see, et teatud rühma ei ole nähtud teatud ametis ja mis tahes teenus või funktsioon, mis jätkab seda edendamist, põhjustab kahju.
- **Stereotüüpimine**. Antud rühma seostamine eelmääratud omadustega. Näiteks inglise ja türgi keele tõlketehnoloogia võib sisaldada ebatäpseid tõlkeid seoses sõnadega, mis on seotud sugude stereotüüpiga.
![Tõlge türgi keelde](../../../../translated_images/et/gender-bias-translate-en-tr.f185fd8822c2d437.webp)
> Tõlge türgi keelde
![tõlge türgi keelde](../../../../translated_images/et/gender-bias-translate-en-tr.f185fd8822c2d437.webp)
> tõlge türgi keelde
![Tõlge tagasi inglise keelde](../../../../translated_images/et/gender-bias-translate-tr-en.4eee7e3cecb8c70e.webp)
> Tõlge tagasi inglise keelde
![tõlge tagasi inglise keelde](../../../../translated_images/et/gender-bias-translate-tr-en.4eee7e3cecb8c70e.webp)
> tõlge tagasi inglise keelde
Tehisintellekti süsteemide kavandamisel ja testimisel peame tagama, et tehisintellekt oleks õiglane ega oleks programmeeritud tegema eelarvamuslikke või diskrimineerivaid otsuseid, mida ka inimestel on keelatud teha. Õigluse tagamine tehisintellektis ja masinõppes jääb keeruliseks sotsiaal-tehniliseks väljakutseks.
Tehisintellekti süsteemide loomisel ja testimisel peame tagama, et AI oleks õiglane ega oleks programmeeritud tegema kallutatud või diskrimineerivaid otsuseid, mida ka inimestel on keelatud teha. Õigluse tagamine tehisintellektis ja masinõppes on siiski keeruline sotsiaal-tehniline väljakutse.
### Usaldusväärsus ja ohutus
Usalduse loomiseks peavad tehisintellekti süsteemid olema usaldusväärsed, ohutud ja järjepidevad nii tavapärastes kui ka ootamatutes tingimustes. Oluline on teada, kuidas tehisintellekti süsteemid käituvad erinevates olukordades, eriti kui tegemist on eranditega. Tehisintellekti lahenduste loomisel tuleb keskenduda sellele, kuidas lahendused suudavad toime tulla mitmesuguste olukordadega, millega nad kokku puutuvad. Näiteks peab isesõitev auto seadma inimeste ohutuse esikohale. Seetõttu peab autot juhtiv tehisintellekt arvestama kõiki võimalikke stsenaariume, millega auto võib kokku puutuda, nagu öö, äikesetormid või lumetormid, tänaval jooksvad lapsed, lemmikloomad, teetööd jne. Kui hästi tehisintellekti süsteem suudab usaldusväärselt ja ohutult toime tulla laia valiku tingimustega, peegeldab see andmeteadlase või tehisintellekti arendaja disaini- või testimisprotsessi taset.
Usalduse loomiseks peavad tehisintellekti süsteemid olema usaldusväärsed, ohutud ja järjepidevad nii tavatingimustes kui ka ootamatutes olukordades. On oluline teada, kuidas tehisintellekti süsteemid käituvad erinevates olukordades, eriti haruldastes juhtumites. Masinõppelahenduste loomisel tuleb pöörata suurt tähelepanu sellele, kuidas käsitleda AI lahenduste võimalikke olukordi. Näiteks peab isesõitev auto panema inimeste ohutuse esikohale. Seetõttu peab autot juhiv AI arvestama kõigi võimalike stsenaariumitega, millega auto võib kokku puutuda, nagu öö, äikesetormid või lumetormid, tänavat ületavad lapsed, lemmikloomad, teetööd jms. Kuidas hästi suudab AI süsteem usaldusväärselt ja ohutult toime tulla erinevate tingimustega, peegeldab andmeteadlase või AI arendaja kavandamisel või testimisel arvestatud ettevalmistuse taset.
> [🎥 Klõpsake siia, et vaadata videot: ](https://www.microsoft.com/videoplayer/embed/RE4vvIl)
> [🎥 Klõpsake siia video vaatamiseks: ](https://www.microsoft.com/videoplayer/embed/RE4vvIl)
### Kaasavus
Tehisintellekti süsteemid peaksid olema loodud kaasama ja võimestama kõiki. Tehisintellekti süsteemide kavandamisel ja rakendamisel tuvastavad andmeteadlased ja tehisintellekti arendajad süsteemis potentsiaalsed takistused, mis võivad tahtmatult inimesi välistada. Näiteks on maailmas 1 miljard puudega inimest. Tehisintellekti arenguga saavad nad igapäevaelus hõlpsamini juurde pääseda laiale hulgale teabele ja võimalustele. Takistuste kõrvaldamine loob võimalusi innovatsiooniks ja tehisintellekti toodete arendamiseks paremate kogemustega, mis toovad kasu kõigile.
Tehisintellekti süsteemid peaksid olema loodud nii, et kaasavad ja jõustavad kõiki. AI süsteemide loomisel ja rakendamisel tuvastavad andmeteadlased ja arendajad süsteemis potentsiaalsed takistused, mis võivad tahtmatult inimesi välistada. Näiteks maailmas on miljard puudega inimest. AI arenguga pääsevad nad oma igapäevaelus hõlpsamalt ligi erinevale infole ja võimalustele. Takistuste kõrvaldamine loob võimalused uuendusteks ja arendab AI tooteid paremate kogemustega, mis kasu toovad kõigile.
> [🎥 Klõpsake siia, et vaadata videot: kaasavus tehisintellektis](https://www.microsoft.com/videoplayer/embed/RE4vl9v)
> [🎥 Klõpsake siia video vaatamiseks: kaasavus tehisintellektis](https://www.microsoft.com/videoplayer/embed/RE4vl9v)
### Turvalisus ja privaatsus
Tehisintellekti süsteemid peaksid olema ohutud ja austama inimeste privaatsust. Inimesed usaldavad vähem süsteeme, mis seavad ohtu nende privaatsuse, teabe või elu. Masinõppe mudelite treenimisel toetume andmetele, et saavutada parimaid tulemusi. Selle käigus tuleb arvestada andmete päritolu ja terviklikkusega. Näiteks, kas andmed on kasutaja esitatud või avalikult kättesaadavad? Järgmisena, andmetega töötades on oluline arendada tehisintellekti süsteeme, mis suudavad kaitsta konfidentsiaalset teavet ja taluda rünnakuid. Kuna tehisintellekt muutub üha levinumaks, muutub privaatsuse kaitsmine ja olulise isikliku ning ärilise teabe turvalisuse tagamine üha kriitilisemaks ja keerulisemaks. Privaatsuse ja andmete turvalisuse küsimused vajavad tehisintellekti puhul erilist tähelepanu, kuna andmetele juurdepääs on hädavajalik, et tehisintellekti süsteemid saaksid teha täpseid ja informeeritud ennustusi ning otsuseid inimeste kohta.
AI süsteemid peaksid olema ohutud ja austama inimeste privaatsust. Inimestel on väiksem usaldus süsteemidesse, mis panevad ohtu nende privaatsuse, info või elu. Masinõppemudelite koolitamisel sõltume andmetest, et saavutada parimad tulemused. Selle juures tuleb arvestada andmete päritolu ja terviklikkust. Näiteks, kas andmed esitas kasutaja või olid need avalikult kättesaadavad? Järgmiseks on oluline arendada AI süsteeme, mis kaitsevad konfidentsiaalset infot ja taluvad rünnakuid. AI laiemaks levikuks muutub privaatsuse kaitse ja olulise isiku- ning ärilise info turvalisus üha kriitilisemaks ja keerulisemaks. Privaatsuse ja andmeturbe probleemid vajavad AI puhul eriti head tähelepanu, sest ligipääs andmetele on AI süsteemide jaoks hädavajalik täpsete ja teadlike prognooside ning otsuste tegemiseks.
> [🎥 Klõpsake siia, et vaadata videot: turvalisus tehisintellektis](https://www.microsoft.com/videoplayer/embed/RE4voJF)
> [🎥 Klõpsake siia video vaatamiseks: turvalisus tehisintellektis](https://www.microsoft.com/videoplayer/embed/RE4voJF)
- Tööstus on teinud privaatsuse ja turvalisuse valdkonnas märkimisväärseid edusamme, mida on oluliselt edendanud sellised regulatsioonid nagu GDPR (üldine andmekaitse määrus).
- Kuid tehisintellekti süsteemide puhul peame tunnistama pinget, mis tekib vajadusest koguda rohkem isikuandmeid, et muuta süsteemid isiklikumaks ja tõhusamaks ja privaatsuse säilitamise vahel.
- Nagu internetiga ühendatud arvutite sünni puhul, näeme ka tehisintellektiga seotud turvalisusküsimuste suurt kasvu.
- Samal ajal on tehisintellekti kasutatud turvalisuse parandamiseks. Näiteks enamik kaasaegseid viirusetõrje skannereid põhineb tehisintellekti heuristikal.
- Peame tagama, et meie andmeteaduse protsessid sobituksid harmooniliselt uusimate privaatsuse ja turvalisuse praktikatega.
- Tööstusena oleme saavutanud märkimisväärseid edusamme privaatsuse ja turvalisuse valdkonnas, mida on oluliselt toetanud sellised regulatsioonid nagu GDPR (üldine andmekaitse määrus).
- Kuid tehisintellekti süsteemides peame tunnistama pingeid, mis on andmekoguse suurenemise vajaduse ja privaatsuse vahel, et muuta süsteeme isikupärasemaks ja efektiivsemaks.
- Nagu interneti ja ühendatud arvutite sünniga, on meil ka AI-ga seotud turvalisusega seotud probleemide arv märkimisväärselt kasvanud.
- Samal ajal on AI-d kasutatud ka turvalisuse parandamiseks. Näiteks on enamik tänapäeva viirusetõrjetarkvara võimsad AI heuristikale toetuvad skannerid.
- Peame tagama, et meie andmeteaduse protsessid sobituksid harmooniliselt uusimate privaatsus- ja turvatavadega.
### Läbipaistvus
Tehisintellekti süsteemid peaksid olema arusaadavad. Läbipaistvuse oluline osa on tehisintellekti süsteemide ja nende komponentide käitumise selgitamine. Tehisintellekti süsteemide mõistmise parandamine nõuab, et sidusrühmad mõistaksid, kuidas ja miks need toimivad, et nad saaksid tuvastada võimalikke jõudlusprobleeme, ohutus- ja privaatsusprobleeme, eelarvamusi, välistavaid tavasid või soovimatuid tulemusi. Usume ka, et need, kes kasutavad tehisintellekti süsteeme, peaksid olema ausad ja avameelsed, kui, miks ja kuidas nad otsustavad neid rakendada. Samuti peaksid nad selgitama kasutatavate süsteemide piiranguid. Näiteks kui pank kasutab tehisintellekti süsteemi, et toetada tarbijate laenuotsuseid, on oluline uurida tulemusi ja mõista, millised andmed mõjutavad süsteemi soovitusi. Valitsused hakkavad tehisintellekti tööstusharudes reguleerima, seega peavad andmeteadlased ja organisatsioonid selgitama, kas tehisintellekti süsteem vastab regulatiivsetele nõuetele, eriti kui esineb soovimatu tulemus.
### Läbipaistvus
AI süsteemid peaksid olema arusaadavad. Läbipaistvuse oluline osa on tehisintellekti süsteemide ja nende komponentide käitumise selgitamine. AI süsteemide parema mõistmise tagamiseks peavad sidusrühmad mõistma, kuidas ja miks need töötavad, et tuvastada võimalikke jõudlusprobleeme, ohutus- ja privaatsusküsimusi, eelarvamusi, välistavaid praktikaid või soovimatuid tulemusi. Usume ka, et need, kes AI süsteeme kasutavad, peaksid ausalt ja avameelselt selgitama, millal, miks ja kuidas nad otsustavad neid rakendada. Samuti piiranguid nende süsteemide suhtes, mida nad kasutavad. Näiteks kui pank kasutab tehisintellekti süsteemi tarbijalaenude otsuste toetamiseks, on oluline analüüsida tulemusi ja mõista, millised andmed mõjutavad süsteemi soovitusi. Valitsused hakkavad AI-d erinevates valdkondades reguleerima, seega peavad andmeteadlased ja organisatsioonid selgitama, kas tehisintellekti süsteem vastab regulatiivsetele nõuetele, eriti kui toimub soovimatu tulemus.
> [🎥 Klõpsake siia, et vaadata videot: läbipaistvus tehisintellektis](https://www.microsoft.com/videoplayer/embed/RE4voJF)
> [🎥 Klõpsake siia video vaatamiseks: läbipaistvus tehisintellektis](https://www.microsoft.com/videoplayer/embed/RE4voJF)
- Kuna tehisintellekti süsteemid on nii keerulised, on raske mõista, kuidas need töötavad ja tulemusi tõlgendada.
- See arusaamise puudumine mõjutab nende süsteemide haldamist, rakendamist ja dokumenteerimist.
- Veelgi olulisem on see, et see arusaamise puudumine mõjutab otsuseid, mis tehakse nende süsteemide toodetud tulemuste põhjal.
- Kuna AI süsteemid on nii keerulised, on raske aru saada, kuidas need töötavad ja tulemusi tõlgendada.
- See arusaamatus mõjutab seda, kuidas neid süsteeme haldatakse, rakendatakse ja dokumenteeritakse.
- Veelgi olulisem on see, et arusaamatus mõjutab otsuseid, mis tehakse nendesüsteemides toodetud tulemuste põhjal.
### Vastutus
Inimesed, kes kavandavad ja rakendavad tehisintellekti süsteeme, peavad vastutama selle eest, kuidas nende süsteemid toimivad. Vastutuse vajadus on eriti oluline tundlike tehnoloogiate, nagu näotuvastus, puhul. Viimasel ajal on näotuvastustehnoloogia järele olnud kasvav nõudlus, eriti õiguskaitseorganisatsioonide poolt, kes näevad tehnoloogia potentsiaali näiteks kadunud laste leidmisel. Kuid need tehnoloogiad võivad valitsuse poolt potentsiaalselt ohustada kodanike põhiõigusi, võimaldades näiteks konkreetsete isikute pidevat jälgimist. Seetõttu peavad andmeteadlased ja organisatsioonid vastutama selle eest, kuidas nende tehisintellekti süsteem mõjutab üksikisikuid või ühiskonda.
Tehisintellekti süsteeme kujundavad ja juurutavad inimesed peavad olema vastutavad oma süsteemide toimimise eest. Vastutuse vajadus on eriti oluline tundlike tehnoloogiate, näiteks näotuvastuse puhul. Viimasel ajal on kasvanud nõudlus näotuvastustehnoloogia järele, eriti õiguskaitseorganisatsioonide poolt, kes näevad tehnoloogias potentsiaali näiteks kadunud laste leidmisel. Kuid neid tehnoloogiaid võiks valitsus kasutada oma kodanike põhivabaduste ohustamiseks, näiteks võimaldades konkreetsete isikute pidevat jälgimist. Seega peavad andmeteadlased ja organisatsioonid olema vastutavad selle eest, kuidas nende AI süsteemi mõju mõjutab üksikisikuid või ühiskonda.
[![Juhtiv tehisintellekti teadlane hoiatab näotuvastuse massilise järelvalve eest](../../../../translated_images/et/accountability.41d8c0f4b85b6231.webp)](https://www.youtube.com/watch?v=Wldt8P5V6D0 "Microsofti lähenemine vastutustundlikule AI-le")
> 🎥 Klõpsake ülaloleval pildil video vaatamiseks: hoiatused näotuvastuse massilise järelvalve kohta
Lõppkokkuvõttes on üks suurimaid küsimusi meie põlvkonnale, kes toob AI esmakordselt ühiskonda, kuidas tagada, et arvutid jäävad inimeste suhtes vastutavaks ning kuidas tagada, et arvuteid kujundavad inimesed jäävad vastutavaks kõigi teiste ees.
## Mõjuhinnang
[![Juhtiv tehisintellekti teadlane hoiatab massilise jälgimise eest näotuvastuse kaudu](../../../../translated_images/et/accountability.41d8c0f4b85b6231.webp)](https://www.youtube.com/watch?v=Wldt8P5V6D0 "Microsofti lähenemine vastutustundlikule tehisintellektile")
Enne masinõppemudeli koolitamist on oluline läbi viia mõjuhinnang, et mõista AI süsteemi eesmärki; milline on kavandatud kasutus; kus see juurutatakse; ja kes süsteemiga suhtleb. Need on abiks süsteemi hindajatele või testijatele, et teada, milliseid tegureid tuleb riskide ja oodatavate tagajärgede tuvastamisel arvestada.
> 🎥 Klõpsake ülaloleval pildil, et vaadata videot: Hoiatused massilise jälgimise eest näotuvastuse kaudu
Mõjuhinnangu läbiviimisel keskendutakse järgmistele valdkondadele:
Lõppkokkuvõttes on üks suurimaid küsimusi meie põlvkonnale, kui esimesele põlvkonnale, kes toob tehisintellekti ühiskonda, kuidas tagada, et arvutid jääksid inimestele vastutavaks ja kuidas tagada, et arvutite disainerid jääksid vastutavaks kõigi teiste ees.
* **Negatiivne mõju üksikisikutele**. Oluline on olla teadlik piirangutest või nõuetest, toetust mittesaavast kasutusest või teadaolevatest piirangutest, mis takistavad süsteemi jõudlust, et tagada süsteemi ohutu kasutamine.
* **Andmenõuded**. Mõistmine, kuidas ja kus süsteem andmeid kasutab, võimaldab hindajatel uurida, milliseid andmenõudeid tuleks arvesse võtta (nt GDPR või HIPAA andmekaitsenõuded). Kontrollige ka, kas andmete allikas ja kogus on piisavad mudeli koolitamiseks.
* **Mõjude kokkuvõte**. Koostage võimalikest kahjudest nimekiri, mis võivad süsteemi kasutusest tekkida. Läbi masinõppe kogu elutsükli vaadake üle, kas tuvastatud probleemid on leevendatud või lahendatud.
* **Rakendatavad eesmärgid** kõigi kuue põhialuse jaoks. Hinnake, kas iga põhimõtte eesmärgid on täidetud ja kas esinevad lüngad.
## Mõju hindamine
Enne masinõppe mudeli treenimist on oluline läbi viia mõju hindamine, et mõista tehisintellekti süsteemi eesmärki; milline on kavandatud kasutus; kus seda rakendatakse; ja kes süsteemiga suhtleb. Need on kasulikud hindajatele või testijatele, et teada saada, milliseid tegureid arvestada võimalike riskide ja oodatavate tagajärgede tuvastamisel.
## Silumistegevused vastutustundliku AI-ga
Mõju hindamise fookusvaldkonnad:
Sarnaselt tarkvararakenduse silumisele on AI süsteemi silumine vajalik protsess süsteemi vigade tuvastamiseks ja lahendamiseks. Paljud tegurid võivad mõjutada mudeli ootuspärast ja vastutustundlikku toimimist. Enamik traditsioonilisi mudelijõudluse mõõdikuid on mudeli tulemuslikkuse kvantitatiivsed agregaadid, mis ei piisa selleks, et analüüsida, kuidas mudel rikub vastutustundliku AI põhimõtteid. Lisaks on masinõppemudel must kast, mis teeb keeruliseks selle väljundi põhjendamise või vea tekke selgitamise. Selle kursuse edenedes õpime kasutama Vastutustundliku AI juhtpaneeli AI süsteemide silumiseks. Juhtpaneel pakub terviklikku tööriista andmeteadlastele ja arendajatele, et teha järgmist:
* **Kahjulik mõju üksikisikutele**. Oluline on olla teadlik piirangutest või nõuetest, mittetoetatud kasutusest või teadaolevatest piirangutest, mis takistavad süsteemi toimimist, et tagada, et süsteemi ei kasutata viisil, mis võiks üksikisikutele kahju tekitada.
* **Andmete nõuded**. Süsteemi andmekasutuse mõistmine võimaldab hindajatel uurida andmenõudeid, mida tuleb arvesse võtta (nt GDPR või HIPAA andmereeglid). Lisaks tuleb uurida, kas andmete allikas või kogus on treenimiseks piisav.
* **Mõju kokkuvõte**. Koostage nimekiri võimalikest kahjudest, mis võivad süsteemi kasutamisest tuleneda. Masinõppe elutsükli jooksul vaadake üle, kas tuvastatud probleemid on leevendatud või lahendatud.
* **Rakendatavad eesmärgid** kuue põhiväärtuse jaoks. Hinnake, kas iga põhimõtte eesmärgid on täidetud ja kas on mingeid puudujääke.
* **Vigade analüüs**. Mudeli vea jaotuse tuvastamiseks, mis võib mõjutada süsteemi õiglust või usaldusväärsust.
* **Mudeli ülevaade**. Avastada, kus mudeli jõudluses esineb erinevusi andmekogumite vahel.
* **Andmete analüüs**. Andmete jaotuse mõistmiseks ja võimaliku kallutatuse tuvastamiseks, mis võib põhjustada õiglus-, kaasavuse ja usaldusväärsuse probleeme.
* **Mudeli tõlgendatavus**. Mõista, mis mõjutab või suunab mudeli prognoose. See aitab selgitada mudeli käitumist, mis on oluline läbipaistvuse ja vastutuse saavutamiseks.
## Vastutustundliku tehisintellektiga silumine
Sarnaselt tarkvararakenduse silumisele on tehisintellekti süsteemi silumine vajalik protsess süsteemi probleemide tuvastamiseks ja lahendamiseks. On palju tegureid, mis võivad põhjustada mudeli ootustele mittevastavat või vastutustundetut toimimist. Enamik traditsioonilisi mudeli jõudluse mõõdikuid on kvantitatiivsed koondandmed mudeli jõudluse kohta, mis ei ole piisavad, et analüüsida, kuidas mudel rikub vastutustundliku tehisintellekti põhimõtteid. Lisaks on masinõppe mudel must kast, mis teeb selle tulemuste põhjuseid raskesti mõistetavaks või selgitab eksimusi. Hiljem selles kursuses õpime kasutama vastutustundliku tehisintellekti juhtpaneeli, et aidata tehisintellekti süsteeme siluda. Juhtpaneel pakub terviklikku tööriista andmeteadlastele ja tehisintellekti arendajatele, et teha:
## 🚀 Väljakutse
Kahjude ennetamiseks peaksime:
- omama mitmekesist tausta ja vaatenurki süsteemide loomisel töötavate inimeste seas
- investeerima andmestikesse, mis peegeldavad meie ühiskonna mitmekesisust
- arendama paremaid meetodeid kogu masinõppe elutsükli jooksul, et avastada ja parandada vastutustundlikku AI-d esinevaid probleeme
Mõelge reaalse elu olukordadele, kus mudeli usaldusväärsus on ehituses ja kasutuses ilmne. Mida muud tuleks kaaluda?
## [Järgneva loengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
* **Vigade analüüs**. Tuvastada mudeli veajaotust, mis võib mõjutada süsteemi õiglust või usaldusväärsust.
* **Mudeli ülevaade**. Avastada, kus mudeli jõudluses esineb erinevusi andmekoortide vahel.
* **Andmete analüüs
## Ülevaade ja iseseisev õppimine
Selles tunnis õppisite masinõppe õiglus- ja ebaõigluskontseptsioonide põhitõdesid.
Vaadake seda töötuba, et teemadesse süveneda:
Selles õppetükis olete õppinud mõningaid masinõppe õiglust ja ebaõiglust käsitlevate mõistete põhialuseid.
Vaadake seda töötuba, et teemadesse põhjalikumalt süveneda:
- Vastutustundliku tehisintellekti poole püüdlemine: Põhimõtete rakendamine praktikas, autorid Besmira Nushi, Mehrnoosh Sameki ja Amit Sharma
- Vastutustundliku tehisintellekti poole: põhimõtete rakendamine praktikas, esinejad Besmira Nushi, Mehrnoosh Sameki ja Amit Sharma
[![Vastutustundliku tehisintellekti tööriistakast: avatud lähtekoodiga raamistik vastutustundliku tehisintellekti loomiseks](https://img.youtube.com/vi/tGgJCrA-MZU/0.jpg)](https://www.youtube.com/watch?v=tGgJCrA-MZU "RAI Toolbox: Avatud lähtekoodiga raamistik vastutustundliku tehisintellekti loomiseks")
[![Vastutustundliku tehisintellekti tööriistakomplekt: avatud lähtekoodiga raamistik vastutustundliku tehisintellekti loomiseks](https://img.youtube.com/vi/tGgJCrA-MZU/0.jpg)](https://www.youtube.com/watch?v=tGgJCrA-MZU "RAI Toolbox: An open-source framework for building responsible AI")
> 🎥 Klõpsake ülaloleval pildil, et vaadata videot: RAI Toolbox: Avatud lähtekoodiga raamistik vastutustundliku tehisintellekti loomiseks, autorid Besmira Nushi, Mehrnoosh Sameki ja Amit Sharma
> 🎥 Klõpsake ülaloleval pildil video vaatamiseks: Vastutustundliku tehisintellekti tööriistakomplekt, esitavad Besmira Nushi, Mehrnoosh Sameki ja Amit Sharma
Lugege ka:
Samuti lugege:
- Microsofti RAI ressursikeskus: [Vastutustundliku tehisintellekti ressursid Microsoft AI](https://www.microsoft.com/ai/responsible-ai-resources?activetab=pivot1%3aprimaryr4)
- Microsofti vastutustundliku tehisintellekti ressursside keskpunkt: [Responsible AI Resources Microsoft AI](https://www.microsoft.com/ai/responsible-ai-resources?activetab=pivot1%3aprimaryr4)
- Microsofti FATE uurimisrühm: [FATE: Õiglus, vastutus, läbipaistvus ja eetika tehisintellektis - Microsoft Research](https://www.microsoft.com/research/theme/fate/)
- Microsofti FATE uurimisrühm: [FATE: õiglus, vastutus, läbipaistvus ja eetika tehisintellektis - Microsoft Research](https://www.microsoft.com/research/theme/fate/)
RAI tööriistakast:
RAI Toolbox:
- [Vastutustundliku tehisintellekti tööriistakasti GitHubi hoidla](https://github.com/microsoft/responsible-ai-toolbox)
- [Vastutustundliku tehisintellekti tööriistakomplekti GitHub reposiit](https://github.com/microsoft/responsible-ai-toolbox)
Lugege Azure Machine Learningu tööriistade kohta, mis aitavad tagada õiglust:
Lugege Azure Machine Learning vahendite kohta, mis aitavad tagada õigluse:
- [Azure Machine Learning](https://docs.microsoft.com/azure/machine-learning/concept-fairness-ml?WT.mc_id=academic-77952-leestott)
## Ülesanne
[Uurige RAI tööriistakasti](assignment.md)
[Uurige RAI Toolboxi](assignment.md)
---
**Vastutusest loobumine**:
See dokument on tõlgitud AI tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta arusaamatuste või valesti tõlgenduste eest, mis võivad tuleneda selle tõlke kasutamisest.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Lahtiütlus**:
See dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,120 +1,121 @@
# Alusta Pythoni ja Scikit-learniga regressioonimudelite jaoks
# Alustamine Pythoniga ja Scikit-learn regressioonimudelite jaoks
![Regressioonide kokkuvõte visuaalses märkmes](../../../../translated_images/et/ml-regression.4e4f70e3b3ed446e.webp)
![Regressioonide kokkuvõte visandina](../../../../translated_images/et/ml-regression.4e4f70e3b3ed446e.webp)
> Visuaalne märge: [Tomomi Imura](https://www.twitter.com/girlie_mac)
> Visand, autor [Tomomi Imura](https://www.twitter.com/girlie_mac)
## [Eelloengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
## [Eeloengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
> ### [See õppetund on saadaval ka R-is!](../../../../2-Regression/1-Tools/solution/R/lesson_1.html)
> ### [See õppetund on saadaval ka R keeles!](../../../../2-Regression/1-Tools/solution/R/lesson_1.html)
## Sissejuhatus
Nendes neljas õppetunnis õpid, kuidas luua regressioonimudeleid. Arutame peagi, milleks need vajalikud on. Enne alustamist veendu, et sul on õiged tööriistad paigas!
Nendes neljas õppetükis õpid, kuidas ehitada regressioonimudeleid. Peagi räägime, milleks neid kasutatakse. Kuid enne kui midagi teed, veendu, et sul oleksid õiged tööriistad valmis protsessi alustamiseks!
Selles õppetunnis õpid:
Selles õppetükis õpid, kuidas:
- Kuidas seadistada oma arvuti kohalike masinõppe ülesannete jaoks.
- Kuidas töötada Jupyteri märkmikega.
- Kuidas kasutada Scikit-learni, sealhulgas selle paigaldamist.
- Kuidas uurida lineaarset regressiooni praktilise harjutuse kaudu.
- Konfigureerida oma arvutit kohalike masinõppe ülesannete jaoks.
- Töötada Jupyter Notebookidega.
- Kasutada Scikit-learn'i, sealhulgas paigaldamist.
- Uurida lineaarset regressiooni praktilise ülesande kaudu.
## Paigaldused ja seadistused
[![ML algajatele - Seadista oma tööriistad masinõppemudelite loomiseks](https://img.youtube.com/vi/-DfeD2k2Kj0/0.jpg)](https://youtu.be/-DfeD2k2Kj0 "ML algajatele - Seadista oma tööriistad masinõppemudelite loomiseks")
[![Masinõpe algajatele - Seadista oma tööriistad masinõppemudelite ehitamiseks](https://img.youtube.com/vi/-DfeD2k2Kj0/0.jpg)](https://youtu.be/-DfeD2k2Kj0 "Masinõpe algajatele - Seadista oma tööriistad masinõppemudelite ehitamiseks")
> 🎥 Klõpsa ülaloleval pildil, et vaadata lühikest videot arvuti seadistamisest ML jaoks.
> 🎥 Klõpsa ülalolevale pildile lühikese video jaoks, mis näitab arvuti seadistamist masinõppe jaoks.
1. **Paigalda Python**. Veendu, et [Python](https://www.python.org/downloads/) on sinu arvutisse paigaldatud. Pythonit kasutatakse paljude andmeteaduse ja masinõppe ülesannete jaoks. Enamik arvutisüsteeme sisaldab juba Pythonit. Kasulikud [Python Coding Packs](https://code.visualstudio.com/learn/educators/installers?WT.mc_id=academic-77952-leestott) võivad samuti seadistamist lihtsustada.
1. **Paigalda Python**. Veendu, et arvutisse on paigaldatud [Python](https://www.python.org/downloads/). Pythoni kasutatakse paljudes andmeteaduse ja masinõppe ülesannetes. Enamik arvutisüsteeme sisaldab Pythonit juba vaikimisi. Lisaks on saadaval kasulikud [Python Coding Packs](https://code.visualstudio.com/learn/educators/installers?WT.mc_id=academic-77952-leestott), mis lihtsustavad seadistamist mõne kasutaja jaoks.
Mõned Python kasutusviisid nõuavad ühte versiooni tarkvarast, samas kui teised vajavad teist versiooni. Seetõttu on kasulik töötada [virtuaalses keskkonnas](https://docs.python.org/3/library/venv.html).
Mõningad Pythoni kasutusviisid nõuavad ühte tarkvaraversiooni, teised teist. Seetõttu on kasulik töötada [virtuaalses keskkonnas](https://docs.python.org/3/library/venv.html).
2. **Paigalda Visual Studio Code**. Veendu, et Visual Studio Code on sinu arvutisse paigaldatud. Järgi neid juhiseid, et [paigaldada Visual Studio Code](https://code.visualstudio.com/) põhilise paigalduse jaoks. Selles kursuses kasutad Pythonit Visual Studio Code'is, seega võib olla kasulik tutvuda, kuidas [Visual Studio Code'i seadistada](https://docs.microsoft.com/learn/modules/python-install-vscode?WT.mc_id=academic-77952-leestott) Python arenduseks.
2. **Paigalda Visual Studio Code**. Veendu, et Visual Studio Code on sinu arvutis paigaldatud. Järgi juhiseid visual studio koodi [paigaldamiseks](https://code.visualstudio.com/). Selles kursuses kasutad Pythoni Visual Studio Codes, nii et võib olla kasulik värskendada teadmisi, kuidas [Visual Studio Code'i seadistada Python arenduseks](https://docs.microsoft.com/learn/modules/python-install-vscode?WT.mc_id=academic-77952-leestott).
> Tutvu Pythoniga, läbides selle [õppemoodulite kogumiku](https://docs.microsoft.com/users/jenlooper-2911/collections/mp1pagggd5qrq7?WT.mc_id=academic-77952-leestott)
> Tutvu Pythoniga lähemalt, läbides selle kogumi [Õpi moodulid](https://docs.microsoft.com/users/jenlooper-2911/collections/mp1pagggd5qrq7?WT.mc_id=academic-77952-leestott)
>
> [![Seadista Python Visual Studio Code'iga](https://img.youtube.com/vi/yyQM70vi7V8/0.jpg)](https://youtu.be/yyQM70vi7V8 "Seadista Python Visual Studio Code'iga")
> [![Seadista Python Visual Studio Codeiga](https://img.youtube.com/vi/yyQM70vi7V8/0.jpg)](https://youtu.be/yyQM70vi7V8 "Seadista Python Visual Studio Codeiga")
>
> 🎥 Klõpsa ülaloleval pildil, et vaadata videot: Python kasutamine VS Code'is.
> 🎥 Klõpsa ülalolevale pildile video vaatamiseks: Pythoni kasutamine VS Codeis.
3. **Paigalda Scikit-learn**, järgides [neid juhiseid](https://scikit-learn.org/stable/install.html). Kuna pead kasutama Python 3, on soovitatav kasutada virtuaalset keskkonda. Kui paigaldad seda teeki M1 Macile, on ülaltoodud lehel spetsiaalsed juhised.
3. **Paigalda Scikit-learn** järgides [selleid juhiseid](https://scikit-learn.org/stable/install.html). Kuna vajad Python 3 kasutamist, on soovitatav kasutada virtuaalkeskkonda. Kui paigaldate seda teeki M1 Mac süsteemile, on ülalkirjeldatud lingil erijuhised.
4. **Paigalda Jupyter Notebook**. Pead [paigaldama Jupyter paketi](https://pypi.org/project/jupyter/).
1. **Paigalda Jupyter Notebook**. Pead paigaldama [Jupyter paketi](https://pypi.org/project/jupyter/).
## Sinu ML arenduskeskkond
## Sinu masinõppe arenduskeskkond
Sa hakkad kasutama **märkmikke**, et arendada oma Python koodi ja luua masinõppemudeleid. Seda tüüpi fail on andmeteadlaste seas levinud tööriist ja neid saab tuvastada nende laiendi `.ipynb` järgi.
Kasutad **notebooke**, et arendada oma Pythoni koodi ja luua masinõppemudeleid. See failitüüp on andmeteadlaste seas populaarne, neid saab tuvastada faililaiendi `.ipynb` järgi.
Märkmikud on interaktiivne keskkond, mis võimaldab arendajal nii koodi kirjutada kui ka märkmeid lisada ja dokumentatsiooni koostada, mis on eksperimentaalsete või uurimuslike projektide jaoks väga kasulik.
Notebookid on interaktiivne keskkond, mis võimaldab arendajal nii koodi kirjutada kui märkmeid lisada ning dokumentatsiooni kirjutada. See on eriti kasulik eksperimenteerimise või uurimusprojektide korral.
[![ML algajatele - Seadista Jupyter märkmikud regressioonimudelite loomiseks](https://img.youtube.com/vi/7E-jC8FLA2E/0.jpg)](https://youtu.be/7E-jC8FLA2E "ML algajatele - Seadista Jupyter märkmikud regressioonimudelite loomiseks")
[![Masinõpe algajatele - Seadista Jupyter Notebookid regressioonimudelite ehituse alustamiseks](https://img.youtube.com/vi/7E-jC8FLA2E/0.jpg)](https://youtu.be/7E-jC8FLA2E "Masinõpe algajatele - Seadista Jupyter Notebookid regressioonimudelite ehituse alustamiseks")
> 🎥 Klõpsa ülaloleval pildil, et vaadata lühikest videot selle harjutuse läbiviimisest.
> 🎥 Klõpsa ülalolevale pildile lühikese video jaoks, mis selgitab viisi.
### Harjutus - töö märkmikuga
### Harjutus - töötamine notebookiga
Selles kaustas leiad faili _notebook.ipynb_.
1. Ava _notebook.ipynb_ Visual Studio Code'is.
1. Ava _notebook.ipynb_ Visual Studio Codes.
Jupyter server käivitub koos Python 3+ versiooniga. Märkmikus leiad alasid, mida saab `käivitada`, koodilõike. Koodilõiku saab käivitada, valides ikooni, mis näeb välja nagu mängimise nupp.
Järgnevalt käivitub Jupyteri server koos Python 3+ keskkonnaga. Notebookis on kohti, mida saab `run` käivitada, need on koodilõigud. Koodibloki käivitamiseks vali ikoon, mis näeb välja nagu esitamisnupp.
2. Vali `md` ikoon ja lisa veidi markdowni ning järgmine tekst **# Tere tulemast oma märkmikku**.
1. Vali `md` ikoon ja lisa natuke markdowni tekstina: **# Welcome to your notebook**.
Järgmisena lisa veidi Python koodi.
Seejärel lisa natuke Pythoni koodi.
3. Kirjuta **print('hello notebook')** koodilõiku.
4. Vali nool, et koodi käivitada.
1. Kirjuta koodiblokki **print('hello notebook')**.
1. Vali nool, et koodi käivitada.
Näed järgmist väljundit:
Sa peaksid nägema väljatrükki:
```output
hello notebook
```
![VS Code avatud märkmikuga](../../../../translated_images/et/notebook.4a3ee31f396b8832.webp)
![VS Code koos avatuna oleva notebookiga](../../../../translated_images/et/notebook.4a3ee31f396b8832.webp)
Sa saad oma koodi vaheldumisi kommentaaridega täiendada, et märkmikku ise dokumenteerida.
Sa võid oma koodi lisada kommentaare, et notebook iseenesest dokumenteeriks seda.
✅ Mõtle hetkeks, kui erinev on veebiarendaja töökeskkond võrreldes andmeteadlase omaga.
✅ Mõtle korraks, kui erinev on veebiarendaja töökeskkond võrreldes andmeteadlase omaga.
## Scikit-learniga alustamine
Nüüd, kui Python on sinu kohalikus keskkonnas seadistatud ja oled Jupyter märkmikega mugav, on aeg saada sama mugavaks Scikit-learniga (häälda `sci` nagu `science`). Scikit-learn pakub [ulatuslikku API-d](https://scikit-learn.org/stable/modules/classes.html#api-ref), mis aitab sul ML ülesandeid täita.
Nüüd, kui Python on sinu lokaalses keskkonnas seadistatud ja sa oled Jupyter Notebookidega harjunud, tutvume ka Scikit-learniga (hääldus 'sci' nagu 'science'). Scikit-learn pakub [ulatuslikku API-t](https://scikit-learn.org/stable/modules/classes.html#api-ref), mis aitab sul masinõppe ülesandeid teha.
Nende [veebisaidi](https://scikit-learn.org/stable/getting_started.html) järgi on "Scikit-learn avatud lähtekoodiga masinõppe teek, mis toetab juhendatud ja juhendamata õppimist. See pakub ka mitmesuguseid tööriistu mudelite sobitamiseks, andmete eeltöötluseks, mudelite valikuks ja hindamiseks ning palju muid kasulikke funktsioone."
Nende [veebilehe](https://scikit-learn.org/stable/getting_started.html) kohaselt: "Scikit-learn on avatud lähtekoodiga masinõppe teek, mis toetab juhendatud ja juhendamata õppimist. See pakub ka erinevaid tööriistu mudelite sobitamiseks, andmete ettevalmistamiseks, mudeli valikuks ja hindamiseks ning palju muud."
Selles kursuses kasutad Scikit-learni ja teisi tööriistu, et luua masinõppemudeleid, mis täidavad nn "traditsioonilise masinõppe" ülesandeid. Oleme teadlikult vältinud närvivõrke ja süvaõpet, kuna need on paremini kaetud meie tulevases "AI algajatele" õppekavas.
Selles kursuses kasutad Scikit-learn'i ja teisi tööriistu tavapäraste masinõppe mudelite ehitamiseks. Oleme teadlikult vältinud närvivõrke ja süvaõpet, sest need on põhjalikumalt käsitletud meie tulevases õppekavas 'Tehisintellekt algajatele'.
Scikit-learn muudab mudelite loomise ja nende hindamise lihtsaks. See keskendub peamiselt numbriliste andmete kasutamisele ja sisaldab mitmeid valmisandmekogumeid, mida saab kasutada õppematerjalidena. Samuti sisaldab see eelvalmistatud mudeleid, mida õpilased saavad proovida. Uurime protsessi, kuidas laadida eelpakendatud andmeid ja kasutada sisseehitatud hindajat esimese ML mudeli loomiseks Scikit-learniga, kasutades põhiandmeid.
Scikit-learn teeb mudelite ehitamise ja nende hindamise lihtsalt teostatavaks. See on keskendunud peamiselt numbrilistele andmetele ning sisaldab arenguks mitmeid valmis andmekogumeid ja mudelimalle. Uurimegi kõigepealt, kuidas laadida ettevalmistatud andmeid ja kasutada sisse ehitatud hinnangut esimeseks ML mudeliks Scikit-learniga koos lihtsate andmetega.
## Harjutus - sinu esimene Scikit-learn märkmik
## Harjutus - sinu esimene Scikit-learn notebook
> See õpetus on inspireeritud [lineaarse regressiooni näitest](https://scikit-learn.org/stable/auto_examples/linear_model/plot_ols.html#sphx-glr-auto-examples-linear-model-plot-ols-py) Scikit-learni veebisaidil.
> Selle juhendi inspiratsiooniks oli Scikit-learn'i veebisaidilt leitav [lineaarse regressiooni näide](https://scikit-learn.org/stable/auto_examples/linear_model/plot_ols.html#sphx-glr-auto-examples-linear-model-plot-ols-py).
[![ML algajatele - Sinu esimene lineaarse regressiooni projekt Pythonis](https://img.youtube.com/vi/2xkXL5EUpS0/0.jpg)](https://youtu.be/2xkXL5EUpS0 "ML algajatele - Sinu esimene lineaarse regressiooni projekt Pythonis")
> 🎥 Klõpsa ülaloleval pildil, et vaadata lühikest videot selle harjutuse läbiviimisest.
[![Masinõpe algajatele - sinu esimene lineaarse regressiooni projekt Pythonis](https://img.youtube.com/vi/2xkXL5EUpS0/0.jpg)](https://youtu.be/2xkXL5EUpS0 "Masinõpe algajatele - sinu esimene lineaarse regressiooni projekt Pythonis")
Failis _notebook.ipynb_, mis on seotud selle õppetunniga, kustuta kõik lahtrid, vajutades prügikasti ikooni.
> 🎥 Klõpsa ülalolevale pildile, et vaadata lühikest videot selle ülesande kohta.
Selles osas töötad väikese diabeedi andmekogumiga, mis on Scikit-learnis õppimise eesmärgil sisse ehitatud. Kujuta ette, et tahad testida ravi diabeediga patsientide jaoks. Masinõppemudelid võivad aidata kindlaks teha, millised patsiendid reageeriksid ravile paremini, tuginedes muutujate kombinatsioonidele. Isegi väga lihtne regressioonimudel, kui seda visualiseerida, võib näidata teavet muutujate kohta, mis aitaksid korraldada teoreetilisi kliinilisi katseid.
Failis _notebook.ipynb_, mis käib selle õppetüki juurde, kustuta kõik lahtrid, vajutades 'prügikasti' ikooni.
✅ Regressioonimeetodeid on palju erinevaid ja millise valid, sõltub küsimusest, millele vastust otsid. Kui tahad ennustada tõenäolist pikkust inimesele teatud vanuses, kasutaksid lineaarset regressiooni, kuna otsid **numbrilist väärtust**. Kui sind huvitab, kas teatud köök peaks olema vegan või mitte, otsid **kategooria määramist**, seega kasutaksid logistilist regressiooni. Õpid logistilisest regressioonist hiljem rohkem. Mõtle veidi, milliseid küsimusi saad andmetelt küsida ja milline neist meetoditest oleks sobivam.
Selles osas töötad väikese diabeediandmestikuga, mis on Scikit-learn'i sisse ehitatud õppeotstarbel. Kujuta ette, et soovid testida raviviisi diabeetikutele. Masinõppemudelid võivad aidata otsustada, millised patsiendid reageerivad ravile paremini, tuginedes erinevate muutujate kombineeritud väärtustele. Isegi väga lihtne regressioonimudel võib visualiseerituna näidata infot muutujate kohta, mis aitavad teoreetilisi kliinilisi katseid paremini planeerida.
Alustame ülesandega.
✅ Regressioonimeetodeid on palju ning millist valida, sõltub sellest, mida soovid leida. Kui tahad ennustada inimese tõenäolist pikkust teatud vanuses, kasutad lineaarset regressiooni, sest otsid **numbrilist väärtust**. Kui tahad teada, kas mingi köögi tüüp on vegan või mitte, otsid **kategooria määratlust**, siis kasutad logistilist regressiooni. Logistilise regressiooni kohta õpid hiljem veel. Mõtle, milliseid küsimusi sa andmetelt küsida võid ja milline meetod oleks sobivam.
### Teekide importimine
Alustame nüüd selle ülesandega.
### Impordi teegid
Selle ülesande jaoks impordime mõned teegid:
- **matplotlib**. See on kasulik [graafikute tööriist](https://matplotlib.org/) ja kasutame seda joondiagrammi loomiseks.
- **matplotlib**. Kasulik [graafikutööriist](https://matplotlib.org/), mida kasutame joondiagrammi loomiseks.
- **numpy**. [numpy](https://numpy.org/doc/stable/user/whatisnumpy.html) on kasulik teek numbriliste andmete käsitlemiseks Pythonis.
- **sklearn**. See on [Scikit-learn](https://scikit-learn.org/stable/user_guide.html) teek.
Impordi mõned teegid, mis aitavad ülesande täitmisel.
Impordi vajalikud teegid, et ülesannet täita.
1. Lisa impordid, kirjutades järgmise koodi:
1. Lisa import käsud, kirjutades järgmist kood:
```python
import matplotlib.pyplot as plt
@ -122,26 +123,26 @@ Impordi mõned teegid, mis aitavad ülesande täitmisel.
from sklearn import datasets, linear_model, model_selection
```
Ülal impordid `matplotlib`, `numpy` ja impordid `datasets`, `linear_model` ja `model_selection` teegist `sklearn`. `model_selection` kasutatakse andmete jagamiseks treening- ja testkomplektideks.
Ülal tood imports `matplotlib`, `numpy` ja lisaks `datasets`, `linear_model` ning `model_selection` `sklearn` teegist. `model_selection` kasutatakse andmete jagamiseks treening- ja testkoguks.
### Diabeedi andmekogum
### Diabeedi andmestik
Sisseehitatud [diabeedi andmekogum](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) sisaldab 442 diabeediga seotud andmeproovi, millel on 10 tunnuse muutujat, millest mõned on:
Sisse ehitatud [diabeedi andmestik](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) sisaldab 442 proovimaterjali diabeedi kohta, 10 tunnusega, millest mõned on:
- age: vanus aastates
- bmi: kehamassiindeks
- bp: keskmine vererõhk
- s1 tc: T-rakud (teatud tüüpi valged verelibled)
- vanus: vanus aastates
- kehakaaluindeks (BMI)
- vererõhk (bp)
- s1 tc: T-rakud (valgete vereliblede tüüp)
✅ See andmekogum sisaldab tunnuse muutujana "sugu", mis on oluline diabeedi uurimisel. Paljud meditsiinilised andmekogumid sisaldavad sellist binaarset klassifikatsiooni. Mõtle veidi, kuidas sellised kategooriad võivad teatud osa elanikkonnast ravist välja jätta.
✅ Selle andmestiku tunnusena on “sugu”, mis on oluline diabeediuuringutes. Paljud meditsiinilised andmestikud sisaldavad sellist binaarset klassifikatsiooni. Mõtle, kuidas sellised kategooriad võivad mõjutada ja vähendada osade elanikkonna ravile pääsemist.
Nüüd laadi X ja y andmed.
Laadi nüüd X ja y andmed.
> 🎓 Pea meeles, et see on juhendatud õppimine ja vajame nimetatud 'y' sihtmärki.
> 🎓 Pea meeles, see on juhendatud õppimine ja meil peab olema nimetatud eesmärk `y`.
Uues koodilahtris laadi diabeedi andmekogum, kutsudes `load_diabetes()`. Sisend `return_X_y=True` näitab, et `X` on andmemaatriks ja `y` on regressiooni sihtmärk.
Uues koodilahtris lae diabeedi andmestik funktsiooniga `load_diabetes()`. Parameeter `return_X_y=True` annab teada, et `X` on andmemaatriks ja `y` regressiooni eesmärgi vektor.
1. Lisa mõned print-käsud, et näidata andmemaatriksi kuju ja selle esimest elementi:
1. Lisa mõned print käsud, et kuvada andmemaatriksi kuju ja esimene element:
```python
X, y = datasets.load_diabetes(return_X_y=True)
@ -149,9 +150,9 @@ Uues koodilahtris laadi diabeedi andmekogum, kutsudes `load_diabetes()`. Sisend
print(X[0])
```
Saad vastuseks tupli. Mida teed, on tupli kahe esimese väärtuse määramine vastavalt `X` ja `y`. Loe rohkem [tuplite kohta](https://wikipedia.org/wiki/Tuple).
Tagastuseks on tuple, mille kaks esimest väärtust määrad `X` ja `y` muutujatele. Loe rohkem [tupleide kohta](https://wikipedia.org/wiki/Tuple).
Näed, et need andmed sisaldavad 442 üksust, mis on kujundatud 10 elemendiga massiivideks:
Näed, et selles andmestikus on 442 üksust, mis on kuju 10 elemendiga massiividena:
```text
(442, 10)
@ -159,39 +160,39 @@ Uues koodilahtris laadi diabeedi andmekogum, kutsudes `load_diabetes()`. Sisend
-0.04340085 -0.00259226 0.01990842 -0.01764613]
```
✅ Mõtle veidi andmete ja regressiooni sihtmärgi vahelisele seosele. Lineaarne regressioon ennustab seoseid tunnuse X ja sihtmuutuja y vahel. Kas leiad diabeedi andmekogumi [sihtmärgi](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) dokumentatsioonist? Mida see andmekogum näitab, arvestades sihtmärki?
✅ Mõtle natuke seosele andmete ja regressiooni eesmärgi vahel. Lineaarne regressioon ennustab seost tunnuse X ja eesmärgi y vahel. Kas leiad dokumentatsioonist diabeedi andmestiku [eesmärgi](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset)? Mida see andmestik näitab, arvestades eesmärki?
2. Järgmisena vali osa sellest andmekogumist, mida graafikul kuvada, valides andmekogumi 3. veeru. Seda saab teha, kasutades `:` operaatorit kõigi ridade valimiseks ja seejärel valides 3. veeru indeksi (2) abil. Samuti saad andmed kujundada 2D massiiviks - nagu graafiku jaoks vajalik - kasutades `reshape(n_rows, n_columns)`. Kui üks parameetritest on -1, arvutatakse vastav mõõde automaatselt.
2. Vali nüüd sellest andmestikust osa, mille joonistad, valides andmestiku 3. veeru. Seda saad teha, kasutades operaatorit `:` kõigi ridade valimiseks ja seejärel veeru valimiseks indeksi (2) abil. Andmeid vajadusel ümberkujunda 2D-massiiviks joonistamiseks, kasutades `reshape(n_rows, n_columns)`. Kui üks parameetritest on -1, arvutatakse selle mõõt automaatselt.
```python
X = X[:, 2]
X = X.reshape((-1,1))
```
Igal ajal prindi andmed välja, et kontrollida nende kuju.
Vahel prindi alati andmed välja, et veenduda vormingus.
3. Nüüd, kui andmed on graafiku jaoks valmis, saad näha, kas masin suudab määrata loogilise jaotuse numbrite vahel selles andmekogumis. Selleks pead jagama nii andmed (X) kui ka sihtmärgi (y) test- ja treeningkomplektideks. Scikit-learnil on selleks lihtne viis; saad jagada oma testandmed kindlas punktis.
3. Nüüd, kui tead, et andmed on joonistamiseks valmis, vaatame, kas masin saab aidata loogilist jaotust arvude vahel selgitada. Selleks on vaja jagada nii andmed (X) kui ka eesmärk (y) test- ja treeningkoguks. Scikit-learn pakub lihtsat meetodit andmete jagamiseks antud punktist.
```python
X_train, X_test, y_train, y_test = model_selection.train_test_split(X, y, test_size=0.33)
```
4. Nüüd oled valmis oma mudelit treenima! Laadi lineaarse regressiooni mudel ja treeni seda oma X ja y treeningkomplektidega, kasutades `model.fit()`:
4. Nüüd oled valmis mudelit treenima! Lae lineaarse regressiooni mudel ja treeni seda oma X ja y treeningkoguga, kasutades `model.fit()`:
```python
model = linear_model.LinearRegression()
model.fit(X_train, y_train)
```
`model.fit()` on funktsioon, mida näed paljudes ML teekides, nagu TensorFlow
`model.fit()` on funktsioon, mida näed paljudes ML teekides nagu TensorFlow.
5. Seejärel loo ennustus, kasutades testandmeid, funktsiooni `predict()` abil. Seda kasutatakse joone joonistamiseks kõige sobivamasse kohta andmegruppide vahel.
5. Seejärel loo ennustus testandmete põhjal, kasutades funktsiooni `predict()`. Seda kasutatakse joonistades joon mudeli andmegruppide vahel.
```python
y_pred = model.predict(X_test)
```
6. Nüüd on aeg andmeid graafikul kuvada. Matplotlib on selleks ülesandeks väga kasulik tööriist. Loo hajusdiagramm kõigist X ja y testandmetest ning kasuta ennustust, et joonistada joon kõige sobivamasse kohta mudeli andmegruppide vahel.
6. Nüüd on aeg näidata andmeid graafikus. Matplotlib on selleks väga kasulik vahend. Loo hajuvusdiagramm kõigist X ja y testandmetest ning kasuta ennustust, et joonistada joon kõige loogilisemasse kohta mudeli andmerühmituse vahele.
```python
plt.scatter(X_test, y_test, color='black')
@ -202,29 +203,32 @@ Uues koodilahtris laadi diabeedi andmekogum, kutsudes `load_diabetes()`. Sisend
plt.show()
```
![hajusdiagramm, mis näitab diabeediga seotud andmepunkte](../../../../translated_images/et/scatterplot.ad8b356bcbb33be6.webp)
✅ Mõtle veidi, mis siin toimub. Sirgjoon kulgeb läbi paljude väikeste andmepunktide, kuid mida see täpselt teeb? Kas näed, kuidas saaksid seda joont kasutada, et ennustada, kuhu uus, seni nägemata andmepunkt peaks graafiku y-telje suhtes sobituma? Proovi sõnastada selle mudeli praktiline kasutus.
![hajuvusdiagramm, mis näitab diabeedi andmepunkte](../../../../translated_images/et/scatterplot.ad8b356bcbb33be6.webp)
Palju õnne, sa ehitasid oma esimese lineaarse regressioonimudeli, tegid sellega ennustuse ja kuvad selle graafikul!
✅ Mõtle natuke selle üle, mis siin toimub. Sirgjoon jookseb läbi paljude väikeste andmepunktide, aga mida see täpselt teeb? Kas näed, kuidas sa peaksid saama seda joont kasutada selleks, et ennustada, kuhu uus, nähtamata andmepunkt võiks suhtega plot'i y-teljele sobituda? Proovi sõnastada praktiline kasutusvõimalus selle mudeli jaoks.
Palju õnne, sa ehitasid oma esimese lineaarse regressioonimudeli, tegid selle abil ennustuse ja kuvastasid selle plot'is!
---
## 🚀Väljakutse
Kuvage graafikul mõni muu muutuja sellest andmestikust. Vihje: muuda seda rida: `X = X[:,2]`. Arvestades selle andmestiku sihtmärki, mida saate avastada diabeedi kui haiguse progresseerumise kohta?
## [Loengu järgne viktoriin](https://ff-quizzes.netlify.app/en/ml/)
Kuvada selle andmekogu mõni teine muutuja. Vihje: muuda seda rida: `X = X[:,2]`. Arvestades selle andmekogu sihtmärki, mida sa suudad avastada diabeedi haiguse progresseerumise kohta?
## [Loengu järeltest](https://ff-quizzes.netlify.app/en/ml/)
## Ülevaade ja iseseisev õppimine
## Ülevaade & Iseõpe
Selles juhendis töötasite lihtsa lineaarse regressiooniga, mitte univariatiivse või mitme muutujaga regressiooniga. Lugege veidi nende meetodite erinevuste kohta või vaadake [seda videot](https://www.coursera.org/lecture/quantifying-relationships-regression-models/linear-vs-nonlinear-categorical-variables-ai2Ef).
Selles juhendis töötasid sa lihtsa lineaarse regressiooniga, mitte univariatiivse või mitme muutujaga lineaarse regressiooniga. Loe veidi nende meetodite erinevustest või vaata seda [videot](https://www.coursera.org/lecture/quantifying-relationships-regression-models/linear-vs-nonlinear-categorical-variables-ai2Ef)
Lugege rohkem regressiooni kontseptsiooni kohta ja mõelge, millistele küsimustele saab selle tehnikaga vastata. Võtke see [juhend](https://docs.microsoft.com/learn/modules/train-evaluate-regression-models?WT.mc_id=academic-77952-leestott), et süvendada oma arusaamist.
Loe rohkem regressiooni kontseptsioonist ja mõtle, milliseid küsimusi selle tehnikaga saab vastata. Võta see [juhend](https://docs.microsoft.com/learn/modules/train-evaluate-regression-models?WT.mc_id=academic-77952-leestott), et oma arusaama süvendada.
## Ülesanne
## Kodune ülesanne
[Teistsugune andmestik](assignment.md)
[Teine andmekogu](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Lahtiütlus**:
See dokument on tõlgitud AI tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tulenevate arusaamatuste või valesti tõlgenduste eest.
See dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,62 +1,62 @@
# Ehita regressioonimudel Scikit-learniga: andmete ettevalmistamine ja visualiseerimine
# Ehita regressioonimudel Scikit-learn kasutades: andmete ettevalmistamine ja visualiseerimine
![Andmete visualiseerimise infograafika](../../../../translated_images/et/data-visualization.54e56dded7c1a804.webp)
![Andmete visualiseerimise infograafik](../../../../translated_images/et/data-visualization.54e56dded7c1a804.webp)
Infograafika autor: [Dasani Madipalli](https://twitter.com/dasani_decoded)
Infograafik autorilt [Dasani Madipalli](https://twitter.com/dasani_decoded)
## [Eelloengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
## [Eel-loengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
> ### [See õppetund on saadaval ka R-is!](../../../../2-Regression/2-Data/solution/R/lesson_2.html)
> ### [See õppetund on saadaval R-is!](../../../../2-Regression/2-Data/solution/R/lesson_2.html)
## Sissejuhatus
Nüüd, kui sul on olemas tööriistad, et alustada masinõppe mudelite loomist Scikit-learniga, oled valmis hakkama oma andmetele küsimusi esitama. Andmetega töötades ja ML-lahendusi rakendades on väga oluline osata esitada õigeid küsimusi, et avada oma andmekogumi potentsiaal.
Nüüd, kui sul on olemas tööriistad masinaõppemudeli ehitamiseks Scikit-learn abil, oled valmis oma andmetest küsimusi esitama. Andmetega töötades ja masinõpperakendusi kasutades on väga oluline mõista, kuidas esitada õigeid küsimusi, et oma andmekogu potentsiaali õigesti avada.
Selles õppetunnis õpid:
Selles õppetükis õpid:
- Kuidas valmistada andmeid mudeli loomiseks.
- Kuidas ette valmistada andmeid mudeli koostamiseks.
- Kuidas kasutada Matplotlibi andmete visualiseerimiseks.
- Kuidas kasutada Seaborni väljendusrikkamate andmevisualiseeringute loomiseks.
## Õige küsimuse esitamine oma andmetele
Küsimus, millele vastust otsid, määrab, millist tüüpi ML-algoritme sa kasutad. Vastuse kvaliteet sõltub suuresti sinu andmete olemusest.
Sulle vajaliku vastuse küsimus määrab, milliseid ML-algoritme sa kasutad. Ja vastuse kvaliteet sõltub tugevalt sinu andmete olemusest.
Vaata [andmeid](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv), mis on selle õppetunni jaoks ette nähtud. Sa saad avada selle .csv-faili VS Code'is. Kiire pilk näitab kohe, et seal on tühje kohti ja segu stringidest ning numbrilistest andmetest. Seal on ka kummaline veerg nimega 'Package', kus andmed on segu 'sacks', 'bins' ja muudest väärtustest. Tegelikult on andmed üsna segased.
Vaata [andmeid](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv), mis on selle õppetunni jaoks esitatud. Saad selle .csv faili avada VS Codes. Esmane kiire ülevaade näitab kohe, et andmetes on tühjad väljad ja segamini on nii tekstid kui ka numbrilised andmed. On ka kummaline veerg nimega 'Package', kus andmed on segamini 'kottide', 'kastide' ja teiste väärtustega. Tegelikult on andmed üsna segased.
[![ML algajatele - Kuidas analüüsida ja puhastada andmekogumit](https://img.youtube.com/vi/5qGjczWTrDQ/0.jpg)](https://youtu.be/5qGjczWTrDQ "ML algajatele - Kuidas analüüsida ja puhastada andmekogumit")
[![Masinõpe algajatele - Kuidas analüüsida ja puhastada andmestikku](https://img.youtube.com/vi/5qGjczWTrDQ/0.jpg)](https://youtu.be/5qGjczWTrDQ "Masinõpe algajatele - Kuidas analüüsida ja puhastada andmestikku")
> 🎥 Klõpsa ülaloleval pildil, et vaadata lühikest videot, mis käsitleb andmete ettevalmistamist selle õppetunni jaoks.
> 🎥 Klõpsa ülalolevale pildile, et vaadata lühivideot, kus näidatakse, kuidas õppetunni andmeid ette valmistada.
Tegelikult ei ole väga tavaline, et sulle antakse andmekogum, mis on täiesti valmis ML-mudeli loomiseks. Selles õppetunnis õpid, kuidas valmistada ette toorandmeid, kasutades standardseid Python'i teeke. Samuti õpid erinevaid tehnikaid andmete visualiseerimiseks.
Tegelikult pole väga tavaline, et sulle kingitakse andmestik, mis on täiesti valmis masinõppemudeli loomiseks. Selles õppetükis õpid, kuidas ette valmistada toores andmestik, kasutades standardseid Python'i raamatukogusid. Samuti õpid erinevaid tehnikaid andmete visualiseerimiseks.
## Juhtumiuuring: 'kõrvitsaturg'
Selles kaustas leiad .csv-faili juurkaustas `data`, nimega [US-pumpkins.csv](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv), mis sisaldab 1757 rida andmeid kõrvitsaturu kohta, rühmitatuna linnade kaupa. Need on toorandmed, mis on saadud [Specialty Crops Terminal Markets Standard Reports](https://www.marketnews.usda.gov/mnp/fv-report-config-step1?type=termPrice) kaudu, mida levitab Ameerika Ühendriikide Põllumajandusministeerium.
Selles kaustas leiad juurkaustast `data` kausta .csv faili nimega [US-pumpkins.csv](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv), mis sisaldab 1757 andmerida kõrvitsaturu kohta, sorteeritud linnade kaupa. See on toores andmestik, mis pärineb [Specialty Crops Terminal Markets Standard Reports](https://www.marketnews.usda.gov/mnp/fv-report-config-step1?type=termPrice) aruannetest, mida levitab USA Põllumajandusministeerium.
### Andmete ettevalmistamine
Need andmed on avalikus domeenis. Neid saab alla laadida paljudes eraldi failides, iga linna kohta, USDA veebisaidilt. Et vältida liiga paljusid eraldi faile, oleme kõik linnade andmed üheks tabeliks kokku liitnud, seega oleme andmeid juba veidi _ette valmistanud_. Järgmine samm on andmetele lähemalt pilk heita.
Need andmed on avalikus omandis. Neid saab alla laadida paljudes eraldi failides, iga linna kohta, USDA veebisaidilt. Koputades, et vältida liiga paljusid eraldi faile, oleme ühendanud kõik linnade andmed üheks tabeliks, seega oleme juba veidi andmeid _valmistanud_. Järgmisena vaatame andmetele lähemalt.
### Kõrvitsaandmed - esialgsed järeldused
### Kõrvitsaandmed - esimesed järeldused
Mida sa nende andmete kohta märkad? Sa juba nägid, et seal on segu stringidest, numbritest, tühjadest kohtadest ja kummalistest väärtustest, mida tuleb mõista.
Millist küsimust sa võiksid nendele andmetele esitada, kasutades regressioonitehnikat? Näiteks: "Prognoosi kõrvitsa müügihinda teatud kuu jooksul." Vaadates andmeid uuesti, on vaja teha mõned muudatused, et luua ülesande jaoks vajalik andmestruktuur.
Mida sa märkad nende andmete kohta? Sa juba nägid, et seal on segamini tekstid, numbrid, tühjad väljad ja kummalised väärtused, mida pead mõistma.
Millise küsimuse võid esitada nende andmete kohta, kasutades regressioonitehnikat? Näiteks "Ennusta kõrvitsa hind müügil antud kuul". Andmeid vaadates tuleb mõningaid muudatusi teha, et luua sobiv andmestruktuur ülesande täitmiseks.
## Harjutus - analüüsi kõrvitsaandmeid
Kasutame [Pandas](https://pandas.pydata.org/) (nimi tähistab `Python Data Analysis`), mis on väga kasulik tööriist andmete kujundamiseks, et analüüsida ja ette valmistada kõrvitsaandmeid.
Kasuta [Pandas](https://pandas.pydata.org/), (nimi tuleneb sõnadest `Python Data Analysis`), väga kasulikku tööriista andmete kujundamiseks, et analüüsida ja ette valmistada neid kõrvitsaandmeid.
### Esmalt kontrolli puuduvate kuupäevade olemasolu
### Esiteks, vaata puuduvad kuupäevad
Esmalt tuleb astuda samme, et kontrollida puuduvate kuupäevade olemasolu:
Esmalt pead kontrollima puuduvate kuupäevade olemasolu:
1. Konverteeri kuupäevad kuu formaati (need on USA kuupäevad, seega formaat on `MM/DD/YYYY`).
2. Ekstraheeri kuu uude veergu.
1. Muuda kuupäevad kuu formaati (need on USA kuupäevad, seega formaat on `KK/PP/AAAA`).
2. Eemalda kuu uusasse veergu.
Ava _notebook.ipynb_ fail Visual Studio Code'is ja impordi tabel uude Pandase andmeraami.
Ava Visual Studio Codes fail _notebook.ipynb_ ja impordi tabel uude Pandase andmeraami.
1. Kasuta `head()` funktsiooni, et vaadata esimesi viit rida.
1. Kasuta funktsiooni `head()`, et vaadata esimesi viit rida.
```python
import pandas as pd
@ -64,28 +64,28 @@ Ava _notebook.ipynb_ fail Visual Studio Code'is ja impordi tabel uude Pandase an
pumpkins.head()
```
✅ Millist funktsiooni kasutaksid viimase viie rea vaatamiseks?
✅ Millist funktsiooni kasutaksid viimaste viie rea vaatamiseks?
1. Kontrolli, kas praeguses andmeraamis on puuduvad andmed:
1. Kontrolli, kas andmeraamis on puuduvaid andmeid:
```python
pumpkins.isnull().sum()
```
Seal on puuduvad andmed, kuid võib-olla see ei ole ülesande jaoks oluline.
Puuduvad andmed on olemas, kuid võib-olla see ei mõjuta antud ülesannet.
1. Et muuta oma andmeraamiga töötamine lihtsamaks, vali ainult vajalikud veerud, kasutades `loc` funktsiooni, mis ekstraheerib algsest andmeraamist ridade (esimene parameeter) ja veergude (teine parameeter) grupi. Allpool olev väljend `:` tähendab "kõik read".
1. Tee oma andmebaasiga lihtsam töötada, valides ainult vajalikud veerud, kasutades `loc` funktsiooni, mis väljavõtab originaalandmebaasist rea (esimene parameeter) ja veeru (teine parameeter). Avaldis `:` tähendab allpool "kõik read".
```python
columns_to_select = ['Package', 'Low Price', 'High Price', 'Date']
pumpkins = pumpkins.loc[:, columns_to_select]
```
### Teiseks, määrake kõrvitsa keskmine hind
### Teiseks, määra kõrvitsa keskmine hind
Mõtle, kuidas määrata kõrvitsa keskmine hind teatud kuus. Milliseid veerge sa selleks ülesandeks valiksid? Vihje: sul on vaja 3 veergu.
Mõtle, kuidas määrata kõrvitsa keskmine hind kindlal kuul. Milliseid veerge sa selleks valiksid? Vihje: vajate kolme veergu.
Lahendus: arvuta `Low Price` ja `High Price` veergude keskmine, et täita uus Price veerg, ja konverteeri Date veerg, et näidata ainult kuud. Õnneks, vastavalt ülaltoodud kontrollile, ei ole kuupäevade või hindade osas puuduvat teavet.
Lahendus: arvuta veergude `Low Price` ja `High Price` keskmine, et täita uus veerg Price, ja muuda Date veerg nii, et näidatakse ainult kuud. Õnneks, nagu eelnev kontroll näitas, puuduvad andmed kuupäevade või hindade osas.
1. Keskmise arvutamiseks lisa järgmine kood:
@ -96,35 +96,35 @@ Lahendus: arvuta `Low Price` ja `High Price` veergude keskmine, et täita uus Pr
```
Võid vabalt printida mis tahes andmeid, mida soovid kontrollida, kasutades `print(month)`.
Kui soovid, võid printida andmeid, nt `print(month)`, et kontrollida.
2. Nüüd kopeeri konverteeritud andmed uude Pandase andmeraami:
2. Nüüd kopeeri muudetud andmed uude Pandase andmeraami:
```python
new_pumpkins = pd.DataFrame({'Month': month, 'Package': pumpkins['Package'], 'Low Price': pumpkins['Low Price'],'High Price': pumpkins['High Price'], 'Price': price})
```
Kui prindid oma andmeraami välja, näed puhast ja korrastatud andmekogumit, mille põhjal saad ehitada uue regressioonimudeli.
Andmeraami printimine näitab sulle puhtaid ja korras andmeid, millele saad ehitada oma regressioonimudeli.
### Aga oota! Siin on midagi kummalist
Kui vaatad `Package` veergu, müüakse kõrvitsaid mitmes erinevas konfiguratsioonis. Mõned müüakse '1 1/9 bushel' mõõtühikutes, mõned '1/2 bushel' mõõtühikutes, mõned kõrvitsa kaupa, mõned naela kaupa ja mõned suurtes kastides, mille laius varieerub.
Kui vaatad `Package` veergu, müüakse kõrvitsaid paljudes erinevates kogustes. Mõned müüakse '1 1/9 bushel' mõõtudes, mõned '1/2 bushel' mõõtudes, mõned tükiti, mõned kilo kohta ja mõned suurtes kastides erinevate laiustega.
> Kõrvitsaid tundub olevat väga raske ühtlaselt kaaluda
> Kõrvitsaid paistab olevat raske ühtlaselt kaaluda
Originaalandmetesse süvenedes on huvitav, et kõik, mille `Unit of Sale` on 'EACH' või 'PER BIN', omavad ka `Package` tüüpi tolli, bin'i või 'each' kaupa. Kõrvitsaid tundub olevat väga raske ühtlaselt kaaluda, seega filtreerime need, valides ainult kõrvitsad, mille `Package` veerus on string 'bushel'.
Originaalandmetes on huvitav, et kõik müügitüübid `Unit of Sale` väärtusega 'EACH' või 'PER BIN' on seotud ka `Package` tüübile tolli või kasti või 'üksik' põhise andmetega. Kõrvitsaid on raske ühtlaselt kaaluda, nii et filtreerime neid, valides ainult kõrvitsaid, mille `Package` veerus on sõna 'bushel'.
1. Lisa filter faili algusesse, .csv importimise alla:
1. Lisa faili algusesse filter, pärast .csv importi:
```python
pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]
```
Kui prindid andmed nüüd välja, näed, et saad ainult umbes 415 rida andmeid, mis sisaldavad kõrvitsaid bushel'i kaupa.
Kui nüüd andmeid prindid, näed, et saad ainult umbes 415 rida kõrvitsaid bushelites.
### Aga oota! Veel üks asi, mida teha
### Aga oota! Veel üks asi mida teha
Kas märkasid, et bushel'i kogus varieerub ridade kaupa? Pead hindade normaliseerimiseks tegema matemaatilisi arvutusi, et näidata hinda bushel'i kohta.
Kas märkasid, et busheli suurus erineb ridade lõikes? Pead hindade normaliseerimiseks näitama hinda ühe busheli kohta, tee seda matemaatiliselt.
1. Lisa need read pärast plokki, mis loob new_pumpkins andmeraami:
@ -134,38 +134,38 @@ Kas märkasid, et bushel'i kogus varieerub ridade kaupa? Pead hindade normalisee
new_pumpkins.loc[new_pumpkins['Package'].str.contains('1/2'), 'Price'] = price/(1/2)
```
✅ Vastavalt [The Spruce Eats](https://www.thespruceeats.com/how-much-is-a-bushel-1389308), bushel'i kaal sõltub toodangu tüübist, kuna see on mahu mõõtühik. "Näiteks tomatite bushel peaks kaaluma 56 naela... Lehed ja rohelised võtavad rohkem ruumi vähem kaaluga, seega spinati bushel on ainult 20 naela." See kõik on üsna keeruline! Ärgem vaevugem bushel'i-naela konversiooni tegemisega ja hinnastagem bushel'i kaupa. Kõik see kõrvitsate bushel'ite uurimine näitab aga, kui oluline on mõista oma andmete olemust!
✅ Vastavalt [The Spruce Eats](https://www.thespruceeats.com/how-much-is-a-bushel-1389308) järgi sõltub busheli kaal toote tüübist, kuna see on mahtmõõde. "Näiteks tomatite bushel peaks kaaluma 56 naela... Lehed ja rohelised võtavad rohkem ruumi vähem kaalu tõttu, seega spinati bushel kaalub ainult 20 naela." See on üsna keeruline! Me ei viitsi teha busheli- ja naela konversiooni, vaid hindame hinda lihtsalt busheli kohta. Kõik see uurimine näitab, kui tähtis on mõista oma andmete olemust!
Nüüd saad analüüsida hinnaühikut nende bushel'i mõõtühiku alusel. Kui prindid andmed veel kord välja, näed, kuidas need on standardiseeritud.
Nüüd saad analüüsida hinnastamist ühiku kohta, mis põhineb busheli mõõdul. Kui prindid andmed veel kord, näed, et see on standardiseeritud.
✅ Kas märkasid, et kõrvitsad, mida müüakse pool-bushel'i kaupa, on väga kallid? Kas oskad välja selgitada, miks? Vihje: väikesed kõrvitsad on palju kallimad kui suured, tõenäoliselt seetõttu, et neid on bushel'is palju rohkem, arvestades ühe suure õõnsa pirukakõrvitsa poolt hõivatud kasutamata ruumi.
✅ Kas märkasid, et poolbusheli kaupa müüdavad kõrvitsad on väga kallid? Kas suudad aru saada, miks? Vihje: väiksed kõrvitsad on palju kallimad kui suured, tõenäoliselt sellepärast, et bushelis on neid palju rohkem, kuna ühe suure aukliku piruka kõrvale jääb palju kasutamata ruumi.
## Visualiseerimisstrateegiad
## Visualiseerimise strateegiad
Andmeteadlase roll on näidata andmete kvaliteeti ja olemust, millega ta töötab. Selleks luuakse sageli huvitavaid visualiseeringuid, nagu graafikud, diagrammid ja joonised, mis näitavad andmete erinevaid aspekte. Nii on võimalik visuaalselt näidata seoseid ja lünki, mida muidu oleks raske avastada.
Andmeteadlase ülesanne on näidata töötatavate andmete kvaliteeti ja olemust. Selleks loovad nad tihti huvitavaid visualiseeringuid ehk jooniseid, graafikuid ja tabeleid, mis näitavad andmete erinevaid aspekte. Nii suudavad nad näidata visuaalselt seoseid ja lünki, mida muidu on raske avastada.
[![ML algajatele - Kuidas visualiseerida andmeid Matplotlibiga](https://img.youtube.com/vi/SbUkxH6IJo0/0.jpg)](https://youtu.be/SbUkxH6IJo0 "ML algajatele - Kuidas visualiseerida andmeid Matplotlibiga")
[![Masinõpe algajatele - Kuidas visualiseerida andmeid Matplotlibiga](https://img.youtube.com/vi/SbUkxH6IJo0/0.jpg)](https://youtu.be/SbUkxH6IJo0 "Masinõpe algajatele - Kuidas visualiseerida andmeid Matplotlibiga")
> 🎥 Klõpsa ülaloleval pildil, et vaadata lühikest videot, mis käsitleb andmete visualiseerimist selle õppetunni jaoks.
> 🎥 Klõpsa ülalolevale pildile, et vaadata lühivideot, mis näitab, kuidas selle õppetunni andmeid visualiseerida.
Visualiseeringud aitavad ka määrata, milline masinõppe tehnika on andmete jaoks kõige sobivam. Näiteks hajuvusdiagramm, mis näib järgivat joont, viitab sellele, et andmed sobivad hästi lineaarse regressiooni harjutuseks.
Visualiseeringud aitavad ka määrata masinõppetehnika andmete jaoks. Näiteks hajuvusdiagramm, mille punktid paistavad järgivat joont, viitab, et andmed sobivad hästi lineaarse regressiooni ülesandeks.
Üks andmete visualiseerimise teek, mis töötab hästi Jupyter'i märkmikes, on [Matplotlib](https://matplotlib.org/) (mida nägid ka eelmises õppetunnis).
Üks andmevisualiseerimise teek, mis sobib hästi Jupyteri märkmikesse, on [Matplotlib](https://matplotlib.org/) (mida sa juba eelnevalt nägid).
> Saa rohkem kogemusi andmete visualiseerimisega [nendes juhendites](https://docs.microsoft.com/learn/modules/explore-analyze-data-with-python?WT.mc_id=academic-77952-leestott).
> Saavuta rohkem kogemusi andmete visualiseerimisel [nendes juhendites](https://docs.microsoft.com/learn/modules/explore-analyze-data-with-python?WT.mc_id=academic-77952-leestott).
## Harjutus - katseta Matplotlibiga
## Harjutus - eksperimenteeri Matplotlibiga
Proovi luua mõned põhilised graafikud, et kuvada just loodud andmeraami. Mida näitaks põhiline joongraafik?
Proovi luua mõned lihtsad joonised, et kuvada oma äsja loodud andmeraami. Mida näitaks lihtne joondiagramm?
1. Impordi Matplotlib faili algusesse, Pandase importimise alla:
1. Impordi faili alguses Matplotlib, Pandase importide alla:
```python
import matplotlib.pyplot as plt
```
1. Käivita kogu märkmik uuesti, et värskendada.
1. Lisa märkmiku lõppu lahter, et kuvada andmed kastina:
1. Lisa märkmiku lõppu lahter, mis joonistab andmed karbidiagrammina:
```python
price = new_pumpkins.Price
@ -174,17 +174,17 @@ Proovi luua mõned põhilised graafikud, et kuvada just loodud andmeraami. Mida
plt.show()
```
![Hajuvusdiagramm, mis näitab hinna ja kuu suhet](../../../../translated_images/et/scatterplot.b6868f44cbd2051c.webp)
![Hajuvusdiagramm, mis näitab hinna ja kuu seost](../../../../translated_images/et/scatterplot.b6868f44cbd2051c.webp)
Kas see on kasulik graafik? Kas miski selles üllatab sind?
Kas see joonis on kasulik? Kas miski sind selle juures üllatab?
See ei ole eriti kasulik, kuna see lihtsalt kuvab sinu andmed punktide hajuvusena antud kuus.
See ei ole eriti kasulik, sest see kuvab lihtsalt andmed hajutatult punktidena antud kuus.
### Muuda see kasulikuks
### Tee sellest kasulik
Et graafikud kuvaksid kasulikke andmeid, tuleb andmeid tavaliselt kuidagi rühmitada. Proovime luua graafiku, kus y-telg näitab kuud ja andmed demonstreerivad andmete jaotust.
Kasulike diagrammide saamiseks tuleb tavaliselt andmeid kuidagi rühmitada. Proovime luua joonise, kus y-teljel on kuud ning andmed näitavad jaotust.
1. Lisa lahter, et luua rühmitatud tulpdiagramm:
1. Lisa lahter, mis loob rühmitatud tulpdiagrammi:
```python
new_pumpkins.groupby(['Month'])['Price'].mean().plot(kind='bar')
@ -193,25 +193,102 @@ Et graafikud kuvaksid kasulikke andmeid, tuleb andmeid tavaliselt kuidagi rühmi
![Tulpdiagramm, mis näitab hinna ja kuu suhet](../../../../translated_images/et/barchart.a833ea9194346d76.webp)
See on kasulikum andmete visualiseerimine! Näib, et kõrvitsate kõrgeim hind esineb septembris ja oktoobris. Kas see vastab sinu ootustele? Miks või miks mitte?
See on kasulikum andmete visualiseerimine! Tundub, et kõrvitsate kõrgeim hind on septembris ja oktoobris. Kas see vastab sinu ootustele? Miks või miks mitte?
## Harjutus - eksperimenteeri Seaborniga
Matplotlib on võimas, kuid võib nõuda palju koodi poleeritud diagrammide loomiseks. [Seaborn](https://seaborn.pydata.org/) on raamatukogu, mis ehitatud _Matplotlibi peale_, mõeldud statistiliste andmete visualiseerimiseks. See töötab otse Pandase andmeraamidega, rakendab atraktiivseid vaikestiile ning võimaldab luua informatiivseid diagramme palju vähem koodiga. Kuna Seaborn tagastab Matplotlibi objekte, saad kasutada kõike, mida tead Matplotlibi kohta, tulemuse täiendavaks häälestamiseks.
> Kui sul Seaborni veel ei ole, paigalda see käsuga `pip install seaborn`.
1. Impordi Seaborn märkmiku algusesse koos ülejäänud importidega. Tavaliselt imporditakse see nimega `sns`:
```python
import seaborn as sns
```
### Hajuvusgraafikud suhete näitamiseks
Suur osa andmete uurimisest enne mudeli koostamist on otsida _seoseid_ muutujate vahel. [Hajuvusdiagramm](https://en.wikipedia.org/wiki/Scatter_plot) on selleks üks parimaid tööriistu: kui punktid paistavad järgivat joont, võivad kaks muutujat olla korreleeritud, mis on hea märk, et lineaarne regressioonimudel võib toimida.
1. Reproduseeri eelmine hinna-ja-kuu hajuvusdiagramm, seekord kasutades Seaborni [`relplot()`](https://seaborn.pydata.org/generated/seaborn.relplot.html) (seoseline diagramm), mis töötab otse sinu andmeraami veergudega:
```python
sns.relplot(x="Price", y="Month", data=new_pumpkins)
```
![Seaborni hajuvusdiagramm, mis näitab hinna ja kuu suhet](../../../../translated_images/et/relplot.a03837d8f0329cec.webp)
Märka, kuidas sa annad _veerunimed_ ja andmeraami ning Seaborn hoolitseb teljesiltide eest ise.
2. Võid lülituda joondiagrammile, andes argumendiks `kind="line"`. Seaborn joonistab isegi varjutatud ala, mis näitab joone ümber usaldusvahemikku:
```python
sns.relplot(x="Price", y="Month", kind="line", data=new_pumpkins)
```
![Seaborni joondiagramm, mis näitab hinna ja kuu suhet](../../../../translated_images/et/lineplot.f9034ba47b1e30ee.webp)
See konkreetne andmestik on üsna mürarikas, seega joondiagramm pole kõige selgem valik — kuid see näitab, kui lihtsalt saab Seabornis diagrammitüüpe vahetada.
### Tulpdiagrammid jaotusnäitajate kuvamiseks
Varem grupeerisite andmed käsitsi, et Matplotlibiga luua tulpdiagramm. Seaborn'i [`catplot()`](https://seaborn.pydata.org/generated/seaborn.catplot.html) (kategoriadiagramm) suudab teha grupeerimise ja agregatsiooni teie eest. Vaikimisi näitab `kind="bar"` iga kategooria keskmist koos musta joonisega, mis näitab usaldusintervalli.
1. Looge kuu keskmise hinna tulpdiagramm:
```python
sns.catplot(x="Month", y="Price", data=new_pumpkins, kind="bar")
```
![Seaborn tulpdiagramm, mis näitab hinna jaotust kuude lõikes](../../../../translated_images/et/catplot.e73fc35fdf96242b.webp)
See kinnitab, mida nägite Matplotlibiga — hinnad on tipphetkel septembris ja oktoobris — kuid Seaborn visualiseerib ka, kui palju hind iga kuu sees _muutub_.
### Soojuskaardid korrelatsioonide näitamiseks
Hajuvusdiagrammid võrdlevad korraga kahte muutujat. Kui teil on mitu numbrilist veergu, võimaldab [soojuskaart](https://en.wikipedia.org/wiki/Heat_map) korraga vaadata iga veerupaaride vahelise seose tugevust. See on levinud viis tuvastada, millised tunnused on kõige korreleeritumad enne, kui valida, mida mudelile sisendiks anda (ja sarnast diagrammi kasutatakse hiljem klassifikatsiooni segadusmaatriksite kuvamiseks).
1. Koostage Pandasega korrelatsioonimaatriks ja joonistage see Seaborni [`heatmap()`](https://seaborn.pydata.org/generated/seaborn.heatmap.html) abil. Valik `annot=True` trükib korrelatsiooniväärtused iga lahtri peale:
```python
correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()
sns.heatmap(correlations, annot=True, cmap="coolwarm")
```
![Seaborni soojuskaart, mis näitab korrelatsioone numbriliste veergude vahel](../../../../translated_images/et/heatmap.bd98dce43b404c57.webp)
Väärtused, mis on lähedal `1`-le (või `-1`-le), tähendavad, et veerud on tugevalt _lineaarselt_ korreleeritud. Märkige, kuidas `Low Price` ja `High Price` on peaaegu täiuslikult korreleeritud. `Month` aga näitab ainult nõrka lineaarset korrelatsiooni hinnaga — kuigi ülaltoodud tulpdiagramm näitas selget hooajalist tippu septembris ja oktoobris. See on tähtis õppetund: korrelatsioonikordaja mõõdab ainult _äärtesirge_ seoseid, seega võib see hooajalisi või muid mittelineaarseid mustreid mitte tuua esile. ✅ Miks on kasulik vaadata nii soojuskaarti kui ka näiteks tulpdiagrammi enne, kui otsustate, milliseid veerge kasutada?
### Matplotlib või Seaborn?
Mõlemad teegid on teadmiste väärt:
- **Matplotlib** annab teile väga peene kontrolli iga diagrammi elemendi üle ja on aluseks peaaegu igale teisele Pythonis kasutatavale graafikuteegile.
- **Seaborn** pakub kõrgema taseme funktsioone ja atraktiivseid vaikeväärtusi statistiliste diagrammide jaoks, töötab otse DataFrame'idega ja on sageli kiirem esmaseks andmeanalüüsiks.
Tavaliselt kasutataksegi Seaborni, et kiiresti andmeid avastada, ning vajadusel liigub seejärel detailseks kohandamiseks Matplotlibi.
---
## 🚀Väljakutse
Uuri erinevaid visualiseerimise tüüpe, mida Matplotlib pakub. Millised tüübid sobivad kõige paremini regressiooniprobleemide jaoks?
Uurige Matplotlibi ja Seaborni erinevaid visualiseerimise tüüpe. Millised on regressiooniprobleemide jaoks kõige sobivamad?
## [Järelloengu viktoriin](https://ff-quizzes.netlify.app/en/ml/)
## [Loengu järel test](https://ff-quizzes.netlify.app/en/ml/)
## Ülevaade ja iseseisev õpe
## Kordamine ja iseseisev õppimine
Vaata erinevaid viise andmete visualiseerimiseks. Koosta nimekiri erinevatest teekidest ja märgi, millised sobivad kõige paremini teatud tüüpi ülesannete jaoks, näiteks 2D-visualiseeringud vs. 3D-visualiseeringud. Mida sa avastad?
Vaadake üle erinevad viisid andmete visualiseerimiseks. Koostage nimekiri saadaolevatest teekidest ja märkige, millised sobivad konkreetselt erinevate ülesannete jaoks, näiteks 2D vs 3D visualiseerimine. Mida te avastate?
## Ülesanne
## Kodune ülesanne
[Visualiseerimise uurimine](assignment.md)
---
**Vastutusest loobumine**:
See dokument on tõlgitud AI tõlketeenuse [Co-op Translator](https://github.com/Azure/co-op-translator) abil. Kuigi püüame tagada täpsust, palume arvestada, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algses keeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitame kasutada professionaalset inimtõlget. Me ei vastuta arusaamatuste või valesti tõlgendamise eest, mis võivad tuleneda selle tõlke kasutamisest.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Lahtiütlus**:
See dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -222,6 +222,7 @@
"source": [
"import pandas as pd\n",
"import matplotlib.pyplot as plt\n",
"import seaborn as sns\n",
"pumpkins = pd.read_csv('../../data/US-pumpkins.csv')\n",
"\n",
"pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]\n",
@ -385,18 +386,78 @@
"plt.ylabel(\"Pumpkin Price\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Visualiseerimine Seaborniga\n",
"\n",
"[Seaborn](https://seaborn.pydata.org/) on ehitatud Matplotlibi peale ja töötab otse andmeraamidega, võimaldades väga vähese koodiga kiiresti luua atraktiivseid statistilisi jooniseid.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### Hajuvusgraafikud suhete näitamiseks\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.relplot(x=\"Price\", y=\"Month\", data=new_pumpkins)"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.relplot(x=\"Price\", y=\"Month\", kind=\"line\", data=new_pumpkins)"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### Tulbadiagrammid jaotuste näitamiseks\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.catplot(x=\"Month\", y=\"Price\", data=new_pumpkins, kind=\"bar\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### Soojuskaardid korrelatsioonide näitamiseks\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": []
"source": [
"correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()\n",
"sns.heatmap(correlations, annot=True, cmap=\"coolwarm\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"\n---\n\n**Lahtiütlus**: \nSee dokument on tõlgitud, kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi püüame tagada täpsust, palun arvestage, et automaatsed tõlked võivad sisaldada vigu või ebatäpsusi. Algne dokument selle algkeeles tuleks lugeda autoriteetseks allikaks. Olulise teabe puhul on soovitatav kasutada professionaalset inimtõlget. Me ei vastuta selle tõlke kasutamisest tulenevate arusaamatuste või valede tõlgenduste eest.\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Lahtiütlus**:\nSee dokument on tõlgitud kasutades AI tõlketeenust [Co-op Translator](https://github.com/Azure/co-op-translator). Kuigi me püüdleme täpsuse poole, palun pange tähele, et automatiseeritud tõlgetes võib esineda vigu või ebatäpsusi. Originaaldokument selle emakeeles tuleks pidada autoriteetseks allikaks. Olulise teabe puhul soovitatakse kasutada professionaalset inimtõlget. Me ei vastuta selle tõlkega seotud eksimustest või valesti mõistmistest.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -426,13 +487,7 @@
"hash": "70b38d7a306a849643e446cd70466270a13445e5987dfa1344ef2b127438fa4d"
}
},
"orig_nbformat": 2,
"coopTranslator": {
"original_hash": "95726f0b8283628d5356a4f8eb8b4b76",
"translation_date": "2025-10-11T12:24:49+00:00",
"source_file": "2-Regression/2-Data/solution/notebook.ipynb",
"language_code": "et"
}
"orig_nbformat": 2
},
"nbformat": 4,
"nbformat_minor": 2

@ -24,8 +24,8 @@
"language_code": "pcm"
},
"1-Introduction/3-fairness/README.md": {
"original_hash": "9a6b702d1437c0467e3c5c28d763dac2",
"translation_date": "2025-11-18T18:22:42+00:00",
"original_hash": "0f00d72169a0d37eecfd16d71e01700a",
"translation_date": "2026-07-14T00:25:06+00:00",
"source_file": "1-Introduction/3-fairness/README.md",
"language_code": "pcm"
},
@ -54,8 +54,8 @@
"language_code": "pcm"
},
"2-Regression/1-Tools/README.md": {
"original_hash": "fa81d226c71d5af7a2cade31c1c92b88",
"translation_date": "2025-11-18T18:39:40+00:00",
"original_hash": "0b8635427b582d03ea4ab7089b93e505",
"translation_date": "2026-07-14T00:22:47+00:00",
"source_file": "2-Regression/1-Tools/README.md",
"language_code": "pcm"
},
@ -72,8 +72,8 @@
"language_code": "pcm"
},
"2-Regression/2-Data/README.md": {
"original_hash": "7c077988328ebfe33b24d07945f16eca",
"translation_date": "2025-11-18T18:44:12+00:00",
"original_hash": "a58b2c4d16c6b122643391745ac15af6",
"translation_date": "2026-07-14T00:24:32+00:00",
"source_file": "2-Regression/2-Data/README.md",
"language_code": "pcm"
},
@ -89,6 +89,12 @@
"source_file": "2-Regression/2-Data/solution/Julia/README.md",
"language_code": "pcm"
},
"2-Regression/2-Data/solution/notebook.ipynb": {
"original_hash": "96b95f8cf473481f2f371de8156f1571",
"translation_date": "2026-07-14T00:00:02+00:00",
"source_file": "2-Regression/2-Data/solution/notebook.ipynb",
"language_code": "pcm"
},
"2-Regression/3-Linear/README.md": {
"original_hash": "8b776e731c35b171d316d01d0e7b1369",
"translation_date": "2026-04-26T19:26:27+00:00",
@ -581,6 +587,19 @@
"source_file": "TROUBLESHOOTING.md",
"language_code": "pcm"
},
"__translation_failures__": {
"sketchnotes/LICENSE.md": {
"original_hash": "fba3b94d88bfb9b81369b869a1e9a20f",
"source_file": "sketchnotes/LICENSE.md",
"language_code": "pcm",
"failure_date": "2026-07-14T00:22:18+00:00",
"status": "failed",
"error_type": "TranslationIncompleteError",
"error_message": "Markdown translation remained incomplete for chunk 1.1.1 of 'LICENSE.md', and the chunk could not be split further.",
"translator_version": "0.20.0",
"failure_policy_version": 1
}
},
"docs/_sidebar.md": {
"original_hash": "68dd06c685f6ce840e0acfa313352e7c",
"translation_date": "2025-11-18T18:45:38+00:00",

@ -1,4 +1,4 @@
# How to Build Machine Learning Solutions Wey Get Responsible AI
# Di Build Machine Learning solutions with responsible AI
![Summary of responsible AI in Machine Learning in a sketchnote](../../../../translated_images/pcm/ml-fairness.ef296ebec6afc98a.webp)
> Sketchnote by [Tomomi Imura](https://www.twitter.com/girlie_mac)
@ -7,22 +7,22 @@
## Introduction
For dis curriculum, you go start to sabi how machine learning dey affect our everyday life. Even now, systems and models dey involved for daily decision-making tasks, like health care diagnosis, loan approval or to catch fraud. So, e dey important say these models go work well to give results wey people fit trust. Just like any software application, AI systems fit fail or give result wey no dey okay. Na why e dey important to sabi and fit explain how AI model dey behave.
For dis curriculum, you go start to discover how machine learning fit impact and dey impact our everyday life. Even now, systems and models dey involved for daily decision-making tasks, like health care diagnoses, loan approvals or detecting fraud. So, e important say make these models dey work well to deliver results wey people fit trust. Just like any software application, AI systems fit miss expectations or get bad outcome. Na why e dey important to fit sabi and explain how AI model dey behave.
Imagine wetin fit happen if the data wey you dey use to build these models no get some kind people, like race, gender, political view, religion, or e dey represent some people too much. Wetin go happen if the model dey favor one group over another? Wetin be the result for the application? Plus, wetin go happen if the model give bad result wey go harm people? Who go take responsibility for how the AI system dey behave? Na these kind questions we go look for dis curriculum.
Imagine wetin fit happen if di data wey you dey use to build these models no get some people groups, like race, gender, political view, religion, or if e too represent some groups pass others. Wetin if di model result show say e dey favor some group? Wetin dat mean for di app? Plus, wetin fit happen if di model run bad and e harm people? Who suppose take charge for di AI system behavior? Na some questions we go tok about for dis curriculum.
For dis lesson, you go:
- Learn why fairness for machine learning and fairness-related wahala dey important.
- Sabi how to check outliers and unusual situations to make sure say e dey reliable and safe.
- Understand why e dey important to design systems wey go include everybody.
- See why e dey necessary to protect privacy and security of data and people.
- Understand why e dey good to explain how AI models dey behave (glass box approach).
- Know why accountability dey important to build trust for AI systems.
- Make you sabi why fairness be important for machine learning and the harm wey fit come from unfairness.
- Make you dey familiar with how to find outliers and unusual situations to make sure sey everything go well and safe.
- Understand why e necessary to make sure say we design systems wey include everybody.
- Explore why e important to protect data and people privacy and security.
- See why e good to get clear way to explain how AI models dey behave.
- Remember say accountability na key to build trust for AI systems.
## Prerequisite
Before you start, make sure say you don take the "Responsible AI Principles" Learn Path and watch the video below about the topic:
As prerequisite, abeg make you do the "Responsible AI Principles" Learn Path and watch di video wey dey below about di topic:
Learn more about Responsible AI by following this [Learning Path](https://docs.microsoft.com/learn/modules/responsible-ai-principles/?WT.mc_id=academic-77952-leestott)
@ -32,15 +32,15 @@ Learn more about Responsible AI by following this [Learning Path](https://docs.m
## Fairness
AI systems suppose treat everybody fairly and no dey affect similar groups differently. For example, if AI systems dey give advice for medical treatment, loan application, or employment, e suppose give the same advice to people wey get similar symptoms, financial situation, or qualifications. As humans, we dey carry bias wey dey affect our decisions and actions. These biases fit show for the data wey we dey use to train AI systems. Sometimes, e fit happen by mistake. E dey hard to sabi when you dey add bias for data.
AI systems suppose treat everybody fair and no make different groups of people suffer different kain wahala. For example, if AI systems dey show guidance on medical treatment, loan applications, or work, dem suppose recommend the same thing to everyone wey get similar symptoms, financial situation, or qualifications. Every one of us as human get bias wey we inherit wey affect how we dey decide and act. These biases fit show for data wey we use train AI systems. Sometimes, dis kain manipulation no be done on purpose. E hard to sabi when you dey put bias for data without wahala.
**“Unfairness”** mean negative impact or “harms” for one group of people, like race, gender, age, or disability. The main fairness-related harms fit be:
**“Unfairness”** mean di negative effect, or “harm”, wey fit happen to group of people like dem wey be defined by race, gender, age, or disability. The main fairness wahala fit be:
- **Allocation**, if one gender or ethnicity dey favored over another.
- **Quality of service**. If you train data for one specific situation but reality dey more complex, e go make the service no perform well. For example, hand soap dispenser wey no fit sense people wey get dark skin. [Reference](https://gizmodo.com/why-cant-this-soap-dispenser-identify-dark-skin-1797931773)
- **Denigration**. To criticize or label something or someone unfairly. For example, image labeling technology wey mistakenly call dark-skinned people gorillas.
- **Over- or under-representation**. When one group no dey seen for one profession, and any service wey dey promote that na harm.
- **Stereotyping**. To connect one group with pre-assigned attributes. For example, language translation system between English and Turkish fit get mistake because of words wey dey stereotype gender.
- **Allocation**, if gender or ethnicity dem for example dey favored pass others.
- **Quality of service**. If you train data for one kain situation but the real thing na complex pass, e go make service poor. For example, one hand soap dispenser wey no fit sabi people with dark skin. [Reference](https://gizmodo.com/why-cant-this-soap-dispenser-identify-dark-skin-1797931773)
- **Denigration**. To unfairly talk bad or label something or someone. Like how one image labeling system misslabel images of dark-skinned people as gorillas.
- **Over- or under- representation**. The idea be say some group no dey some profession, and if any service or function dey promote dis, e dey cause harm.
- **Stereotyping**. To join one group with certain qualities wey people don pre-decide. For example, one language translation system between English and Turkish fit get mistake because some words get stereotypical links to gender.
![translation to Turkish](../../../../translated_images/pcm/gender-bias-translate-en-tr.f185fd8822c2d437.webp)
> translation to Turkish
@ -48,96 +48,100 @@ AI systems suppose treat everybody fairly and no dey affect similar groups diffe
![translation back to English](../../../../translated_images/pcm/gender-bias-translate-tr-en.4eee7e3cecb8c70e.webp)
> translation back to English
When we dey design and test AI systems, we need to make sure say AI dey fair and no dey programmed to make biased or discriminatory decisions, wey humans no suppose make. To make AI and machine learning fair na one big sociotechnical challenge.
When you dey design and test AI system, e good to make sure say AI dey fair and no program make am do biased or discriminatory decisions, wey humans also no suppose do. Make AI and machine learning fair still get serious challenge for society and technology.
### Reliability and safety
To build trust, AI systems suppose dey reliable, safe, and consistent for normal and unexpected conditions. E dey important to sabi how AI systems go behave for different situations, especially outliers. When we dey build AI solutions, we need to focus well on how to handle different situations wey the AI go face. For example, self-driving car suppose put people safety first. The AI wey dey power the car suppose think about all the possible situations wey the car fit face like night, thunderstorms, blizzards, kids wey dey run cross road, pets, road construction, etc. How well AI system fit handle different conditions reliably and safely go show how the data scientist or AI developer take plan and test the system.
To make people trust dem, AI systems need to be reliable, safe, and steady for normal and unexpected situations. E important to know how AI systems go behave for different situations, especially for outliers. When we dey build AI solutions, we must focus well on how to handle all kinds different situation wey AI fit face. For example, self-driving car suppose put people's safety first. So, the AI inside the car must think about all possible things wey fit happen like night, thunderstorm or blizzard, pikin wey dey run cross road, animals, road work, and so on. How well AI system handle all these things fit show how well data scientist or AI developer plan am from the start.
> [🎥 Click the here for a video: ](https://www.microsoft.com/videoplayer/embed/RE4vvIl)
### Inclusiveness
AI systems suppose dey designed to involve and empower everybody. When data scientists and AI developers dey design AI systems, dem suppose identify and fix barriers wey fit exclude people by mistake. For example, 1 billion people wey get disabilities dey for the world. With AI, dem fit access plenty information and opportunities easily for their daily life. If we fix these barriers, e go create chance to innovate and make AI products wey go give better experience wey go benefit everybody.
AI systems suppose dey design to involve and empower everybody. When data scientists and AI developers dey design and put AI systems, dem go find and fix any barrier wey fit stop people from using the system. For example, 1 billion people get disabilities for di world. With AI progress, dem fit reach plenty info and chance easier for their daily life. If we fix barriers, e go create chance to make better AI products wey go benefit everybody.
> [🎥 Click the here for a video: inclusiveness in AI](https://www.microsoft.com/videoplayer/embed/RE4vl9v)
### Security and privacy
AI systems suppose dey safe and respect people privacy. People no go trust systems wey dey put their privacy, information, or life at risk. When we dey train machine learning models, we dey depend on data to get better results. So, we need to check where the data come from and if e dey okay. For example, na user submit the data or e dey public? Next, as we dey work with the data, e dey important to develop AI systems wey fit protect confidential information and resist attacks. As AI dey grow, to protect privacy and secure personal and business information dey more critical and complex. Privacy and data security matter need special attention for AI because data na the main thing wey AI systems dey use to make correct predictions and decisions about people.
AI systems suppose dey safe and respect people privacy. People no dey trust systems wey fit threaten their privacy, info, or life. When we dey train machine learning models, we dey rely on data to make better results. But we must think about where data come from and if e trustworthy. For example, data fit be user submitted or public data. As we dey work with data, e important to make AI systems wey fit protect secret info and resist attacks. As AI dey increase, to protect privacy and keep important personal and business info safe na serious and hard work. Privacy and data security matter well well for AI because AI need data to make correct and informed prediction and decisions about people.
> [🎥 Click the here for a video: security in AI](https://www.microsoft.com/videoplayer/embed/RE4voJF)
- As industry, we don make big progress for Privacy & security, especially because of regulations like GDPR (General Data Protection Regulation).
- But for AI systems, we need to balance the need for more personal data to make systems better and privacy.
- Just like when internet start, we dey see plenty security wahala related to AI.
- At the same time, AI dey help improve security. For example, most modern anti-virus scanners dey use AI today.
- We need to make sure say our Data Science processes dey work well with the latest privacy and security practices.
- As an industry we don make big progress for Privacy & security, especially with laws like GDPR (General Data Protection Regulation).
- But for AI systems we must know say e dey tension between needing more personal data to make systems better and the need for privacy.
- Just like how internet bring more security problems, AI dey bring more security challenges too.
- But AI dey also help improve security. For example, many modern anti-virus scanners dey use AI heuristics now.
- We suppose make sure say our Data Science process go well with the latest privacy and security practices.
### Transparency
AI systems suppose dey easy to understand. Transparency mean to explain how AI systems and their parts dey behave. To improve understanding of AI systems, stakeholders need to sabi how and why dem dey work so dem fit identify performance wahala, safety and privacy concerns, bias, exclusionary practices, or mistakes. People wey dey use AI systems suppose dey honest about when, why, and how dem dey use am. Plus, dem suppose talk about the limitations of the systems. For example, if bank dey use AI system to help with lending decisions, e dey important to check the results and sabi which data dey influence the system recommendations. Governments don dey regulate AI for different industries, so data scientists and organizations suppose explain if AI system meet regulatory requirements, especially when e give bad result.
### Transparency
AI systems suppose dey easy to understand. One important part of transparency na to explain how AI systems and their parts dey behave. To improve understanding of AI systems, stakeholders must sabi how and why dem dey work so dem fit find any performance wahala, safety and privacy risks, bias, exclusion, or unintended outcomes. We also believe say people wey use AI systems suppose dey honest about when, why, and how dem choose to use am. Plus the limits of the system dem dey use. For example, if bank dey use AI to help them decide who to lend money, e important to check di results and sabi which data affect the AI system recommendations. Governments don begin dey regulate AI for different industries so data scientists and organizations must fit show if AI system meet regulation, especially if e get bad result.
> [🎥 Click the here for a video: transparency in AI](https://www.microsoft.com/videoplayer/embed/RE4voJF)
- Because AI systems dey complex, e dey hard to understand how dem dey work and interpret the results.
- This lack of understanding dey affect how dem dey manage, use, and document the systems.
- This lack of understanding dey also affect the decisions wey people dey make with the results wey the systems dey give.
- Because AI systems complex well well, e hard to understand how dem work and explain results.
- This kain lack of understanding affect how dem dey manage, operate, and document these systems.
- More importantly, this lack of understanding affect decisions wey people dey make from the results wey AI systems produce.
### Accountability
The people wey dey design and use AI systems suppose take responsibility for how their systems dey work. Accountability dey very important for sensitive technologies like facial recognition. Recently, demand for facial recognition technology don dey grow, especially from law enforcement wey wan use am to find missing children. But these technologies fit make government use am to take away people freedom, like to dey monitor specific people every time. So, data scientists and organizations need to take responsibility for how their AI system dey affect people or society.
People wey design and deploy AI systems must take responsibility for how their systems dey work. Accountability matter plenty for sensitive tech like facial recognition. Recently, demand for facial recognition don grow, especially for law enforcement wey dey find missing pikin. But this technology fit also be used by government to put people fundamental freedoms for risk like continuous surveillance on particular people. So, data scientists and organizations must be responsible for how their AI systems impact people or society.
[![Leading AI Researcher Warns of Mass Surveillance Through Facial Recognition](../../../../translated_images/pcm/accountability.41d8c0f4b85b6231.webp)](https://www.youtube.com/watch?v=Wldt8P5V6D0 "Microsoft's Approach to Responsible AI")
> 🎥 Click the image above for a video: Warnings of Mass Surveillance Through Facial Recognition
At the end, one big question for our generation, as the first generation wey dey bring AI to society, na how we go make sure say computers go dey accountable to people and how we go make sure say the people wey dey design computers go dey accountable to everybody.
At last, one big question for our generation, as di first wey dey bring AI to society, be how to make sure say computers go still take responsibility to people and how to make sure people wey design the computers go still get responsibility to everybody else.
## Impact assessment
Before you train machine learning model, e dey important to do impact assessment to sabi the purpose of the AI system; wetin dem wan use am do; where dem go use am; and who go dey interact with the system. Dis go help reviewer(s) or testers to sabi wetin to check when dem dey look for risks and expected results.
Before you train machine learning model, e important to do impact assessment to understand why AI system dey build; how e go take work; where dem go put am; and who go dey interact with am. This go help testers or reviewers sabi wetin to consider when dem dey check risk and wetin fit happen.
These be wetin you suppose focus on when you dey do impact assessment:
The following na areas to focus on when you dey do impact assessment:
* **Adverse impact on individuals**. Make you sabi if any restriction or condition, unsupported use or limitation fit make system no work well. This go help make sure system no harm individuals.
* **Data requirements**. Make you understand how and where system go use data to help reviewers check data requirements (like GDPR or HIPAA). Also check if data source or quantity enough for training.
* **Summary of impact**. List all possible harm wey fit happen because of system use. For whole ML lifecycle, check if these issues dem try fix.
* **Applicable goals** for all six core principles. Check if goals of each principle don meet and if any gap dey.
* **Adverse impact on individuals**. Sabi any restriction or requirements, unsupported use or any known limitations wey fit make the system no perform well. This go help make sure say the system no go harm people.
* **Data requirements**. Sabi how and where the system go use data so reviewers fit check any data requirements wey you need to follow (e.g., GDPR or HIPPA data regulations). Plus, check if the source or quantity of data dey enough for training.
* **Summary of impact**. Gather list of potential harms wey fit happen if you use the system. For the ML lifecycle, check if the issues wey you identify don dey fixed or addressed.
* **Applicable goals** for each of the six core principles. Check if the goals for each principle don dey met and if gaps dey.
## Debugging with responsible AI
Just like how we dey debug software application, debugging AI system na process to find and fix issues for the system. Plenty things fit make model no perform as e suppose or no dey responsible. Most traditional model performance metrics dey give numbers wey no dey enough to check how model dey break responsible AI principles. Plus, machine learning model na black box wey dey hard to understand wetin dey drive the result or explain mistake. Later for this course, we go learn how to use Responsible AI dashboard to debug AI systems. The dashboard dey give data scientists and AI developers tool to do:
Like how you go take debug software app, debugging AI system na important way to find and fix wahala for system. Plenty things fit cause model no perform well or no dey responsible. Most normal model performance metrics na just number wey just sum model performance which no fit show how model fit break responsible AI principles. Plus, machine learning model na black box wey hard to sabi wetin dey cause result or explain when e make mistake. Later for this course, we go learn how to use Responsible AI dashboard to help debug AI systems. Dashboard na a tool wey data scientists and AI developers go use to do:
* **Error analysis**. To find error pattern wey fit affect system fairness or reliability.
* **Model overview**. To find difference for model performance for different data groups.
* **Data analysis**. To understand data pattern and find any bias wey fit cause fairness, inclusiveness, and reliability problems.
* **Model interpretability**. To understand wetin affect or influence model prediction. Dis dey help explain model behavior, wey important for transparency and accountability.
* **Error analysis**. To check the error distribution of the model wey fit affect fairness or reliability.
* **Model overview**. To find where the model performance dey different across data groups.
* **Data analysis**. To check the data distribution and find any bias for the data wey fit cause fairness, inclusiveness, and reliability wahala.
* **Model interpretability**. To sabi wetin dey affect or influence the model predictions. This go help explain the model behavior, wey dey important for transparency and accountability.
## 🚀 Challenge
To stop harms from happening, we suppose:
To stop harms from showing at first, we suppose:
- Get people wey get different backgrounds and perspectives to work on systems.
- Invest for datasets wey show the diversity of our society.
- Develop better methods for the machine learning lifecycle to detect and fix responsible AI issues when dem happen.
- get different kinds background and perspectives among people wey dey work on systems
- invest in datasets wey show the diversity of our society
- develop better ways throughout machine learning life cycle to find and fix responsible AI problems when e happen
Think about real-life situations wey show say model no dey trustworthy for model-building and usage. Wetin else we suppose consider?
Think about real life situations wey model no fit be trusted for building and use. Wetin else we suppose consider?
## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ml/)
## Review & Self Study
For dis lesson, you don learn some basic tins about fairness and unfairness for machine learning.
Watch dis workshop to sabi more about di topics:
For dis lesson, you don learn some basics about di tins dem wey concern fairness and unfairness for machine learning.
Make you watch dis workshop make you fit sabi di matter well-well:
- How to pursue responsible AI: How to carry principles enter practice by Besmira Nushi, Mehrnoosh Sameki and Amit Sharma
- For di chase of responsible AI: How to take principles put for practice by Besmira Nushi, Mehrnoosh Sameki and Amit Sharma
[![Responsible AI Toolbox: An open-source framework for building responsible AI](https://img.youtube.com/vi/tGgJCrA-MZU/0.jpg)](https://www.youtube.com/watch?v=tGgJCrA-MZU "RAI Toolbox: An open-source framework for building responsible AI")
> 🎥 Click di image wey dey up for video: RAI Toolbox: An open-source framework for building responsible AI by Besmira Nushi, Mehrnoosh Sameki, and Amit Sharma
> 🎥 Click di picture wey dey above for video: RAI Toolbox: An open-source framework for building responsible AI by Besmira Nushi, Mehrnoosh Sameki, and Amit Sharma
Still read:
E good make you read:
- Microsoft RAI resource center: [Responsible AI Resources Microsoft AI](https://www.microsoft.com/ai/responsible-ai-resources?activetab=pivot1%3aprimaryr4)
@ -147,7 +151,7 @@ RAI Toolbox:
- [Responsible AI Toolbox GitHub repository](https://github.com/microsoft/responsible-ai-toolbox)
Read about Azure Machine Learning tools wey fit help make sure fairness dey:
Read about Azure Machine Learning tool dem wey dey help hold fairness:
- [Azure Machine Learning](https://docs.microsoft.com/azure/machine-learning/concept-fairness-ml?WT.mc_id=academic-77952-leestott)
@ -159,5 +163,5 @@ Read about Azure Machine Learning tools wey fit help make sure fairness dey:
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Disclaimer**:
Dis dokyument don use AI transleshion service [Co-op Translator](https://github.com/Azure/co-op-translator) do di transleshion. Even as we dey try make am accurate, abeg make you sabi say automatik transleshion fit get mistake or no dey correct well. Di original dokyument for im native language na di one wey you go take as di correct source. For important informashon, e good make professional human transleshion dey use. We no go fit take blame for any misunderstanding or wrong interpretation wey go happen because you use dis transleshion.
Dis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,4 +1,4 @@
# Start wit Python and Scikit-learn for regression models
# Start to run Python and Scikit-learn for regression models
![Summary of regressions in a sketchnote](../../../../translated_images/pcm/ml-regression.4e4f70e3b3ed446e.webp)
@ -10,61 +10,61 @@
## Introduction
For dis four lessons, you go learn how to build regression models. We go talk wetin dem dey use am do soon. But before you start anything, make sure say you get all di correct tools wey you need to start di process!
For dis four lessons, you go learn how to build regression models. We go talk about wetin dem dey use am for soon. But before you start anything, make sure say you get correct tool dem set well to start di work!
For dis lesson, you go learn how to:
- Set up your computer for local machine learning tasks.
- Work wit Jupyter notebooks.
- Use Scikit-learn, including installation.
- Try linear regression wit one hands-on exercise.
- Arrange your computer for local machine learning work.
- Use Jupyter Notebooks.
- Use Scikit-learn, including how to install am.
- Explore linear regression with hand-on exercise.
## Installations and configurations
[![ML for beginners - Setup your tools ready to build Machine Learning models](https://img.youtube.com/vi/-DfeD2k2Kj0/0.jpg)](https://youtu.be/-DfeD2k2Kj0 "ML for beginners -Setup your tools ready to build Machine Learning models")
> 🎥 Click di image above for one short video wey go show you how to configure your computer for ML.
> 🎥 Click the image above for short video wey go show how to arrange your computer for ML.
1. **Install Python**. Make sure say [Python](https://www.python.org/downloads/) dey your computer. You go use Python for plenty data science and machine learning tasks. Most computers already get Python installed. You fit also use [Python Coding Packs](https://code.visualstudio.com/learn/educators/installers?WT.mc_id=academic-77952-leestott) to make setup easy for some people.
1. **Install Python**. Make sure say [Python](https://www.python.org/downloads/) don install for your computer. You go use Python for many data science and machine learning waka. Most computers don already get Python. E still dey useful to get [Python Coding Packs](https://code.visualstudio.com/learn/educators/installers?WT.mc_id=academic-77952-leestott) for some people to easy setup.
Some Python tasks dey need one version of di software, while others dey need another version. Because of dis, e good to work inside [virtual environment](https://docs.python.org/3/library/venv.html).
Some Python use demand one version of the software, others need another version. So e good to work inside [virtual environment](https://docs.python.org/3/library/venv.html).
2. **Install Visual Studio Code**. Make sure say Visual Studio Code dey your computer. Follow dis instructions to [install Visual Studio Code](https://code.visualstudio.com/) for di basic installation. You go use Python inside Visual Studio Code for dis course, so e go make sense to learn how to [configure Visual Studio Code](https://docs.microsoft.com/learn/modules/python-install-vscode?WT.mc_id=academic-77952-leestott) for Python development.
2. **Install Visual Studio Code**. Make sure say you get Visual Studio Code install for your computer. Follow [these instructions](https://code.visualstudio.com/) to install Visual Studio Code well. You go use Python for Visual Studio Code for dis course, so e good to sabi how to [configure Visual Studio Code](https://docs.microsoft.com/learn/modules/python-install-vscode?WT.mc_id=academic-77952-leestott) for Python dev work.
> Make yourself comfortable wit Python by working through dis collection of [Learn modules](https://docs.microsoft.com/users/jenlooper-2911/collections/mp1pagggd5qrq7?WT.mc_id=academic-77952-leestott)
> Make yourself familiar with Python by going through dis collection of [Learn modules](https://docs.microsoft.com/users/jenlooper-2911/collections/mp1pagggd5qrq7?WT.mc_id=academic-77952-leestott)
>
> [![Setup Python with Visual Studio Code](https://img.youtube.com/vi/yyQM70vi7V8/0.jpg)](https://youtu.be/yyQM70vi7V8 "Setup Python with Visual Studio Code")
>
> 🎥 Click di image above for one video: using Python inside VS Code.
> 🎥 Click the picture above for video: how to use Python inside VS Code.
3. **Install Scikit-learn**, by following [dis instructions](https://scikit-learn.org/stable/install.html). Since you need to make sure say you dey use Python 3, e good to use virtual environment. If you dey install dis library for M1 Mac, special instructions dey di page wey dem link above.
3. **Install Scikit-learn**, follow [these instructions](https://scikit-learn.org/stable/install.html). Since you need use Python 3, e good make you use virtual environment. If you dey install this library for M1 Mac, the page get special instructions.
4. **Install Jupyter Notebook**. You go need to [install di Jupyter package](https://pypi.org/project/jupyter/).
1. **Install Jupyter Notebook**. You go need to [install the Jupyter package](https://pypi.org/project/jupyter/).
## Your ML authoring environment
You go use **notebooks** to develop your Python code and create machine learning models. Dis type of file na common tool for data scientists, and you fit identify dem by di suffix or extension `.ipynb`.
You go use **notebooks** to write your Python code and create machine learning models. Dis kain file na common tool for data scientists, and you go sabi am by their suffix or extension `.ipynb`.
Notebooks na interactive environment wey allow di developer to code and add notes plus write documentation around di code. E dey very helpful for experimental or research-oriented projects.
Notebooks na interactive environment wey make developer fit both code and add notes and write documentation around di code wey dey helpful for experimental or research work.
[![ML for beginners - Set up Jupyter Notebooks to start building regression models](https://img.youtube.com/vi/7E-jC8FLA2E/0.jpg)](https://youtu.be/7E-jC8FLA2E "ML for beginners - Set up Jupyter Notebooks to start building regression models")
> 🎥 Click di image above for one short video wey go show you how to do dis exercise.
> 🎥 Click di picture above for short video to follow dis exercise.
### Exercise - work wit notebook
### Exercise - work with notebook
For dis folder, you go see di file _notebook.ipynb_.
For dis folder, you go find file _notebook.ipynb_.
1. Open _notebook.ipynb_ inside Visual Studio Code.
1. Open _notebook.ipynb_ for Visual Studio Code.
Jupyter server go start wit Python 3+ started. You go see areas for di notebook wey you fit `run`, pieces of code. You fit run one code block by selecting di icon wey look like play button.
Jupyter server go start wit Python 3+ go on. You go see parts of di notebook wey you fit `run`, pieces of code. You fit run code block by clicking di icon wey look like play button.
2. Select di `md` icon and add small markdown, plus di following text **# Welcome to your notebook**.
1. Click di `md` icon and add small markdown, plus dis text **# Welcome to your notebook**.
Next, add some Python code.
3. Type **print('hello notebook')** inside di code block.
4. Select di arrow to run di code.
1. Type **print('hello notebook')** for code block.
1. Click di arrow to run di code.
You go see di printed statement:
@ -72,49 +72,50 @@ For dis folder, you go see di file _notebook.ipynb_.
hello notebook
```
![VS Code wit notebook open](../../../../translated_images/pcm/notebook.4a3ee31f396b8832.webp)
![VS Code with a notebook open](../../../../translated_images/pcm/notebook.4a3ee31f396b8832.webp)
You fit mix your code wit comments to self-document di notebook.
You fit put your code together with comments to explain your notebook.
✅ Think small about how web developer working environment dey different from data scientist own.
✅ Think small abeg how different web developer work environment be from data scientist.
## Up and running wit Scikit-learn
## Up and running with Scikit-learn
Now wey Python don dey set up for your local environment, and you don dey comfortable wit Jupyter notebooks, make we also dey comfortable wit Scikit-learn (pronounce am `sci` like `science`). Scikit-learn dey provide [extensive API](https://scikit-learn.org/stable/modules/classes.html#api-ref) to help you do ML tasks.
Now wey Python don set for your lokal environment, and you don sabi Jupyter Notebooks well, make we try Scikit-learn (you go talk am `sci` like `science`). Scikit-learn get [plenty API](https://scikit-learn.org/stable/modules/classes.html#api-ref) wey go help you do ML work.
According to their [website](https://scikit-learn.org/stable/getting_started.html), "Scikit-learn na open source machine learning library wey support supervised and unsupervised learning. E also dey provide different tools for model fitting, data preprocessing, model selection and evaluation, plus many other utilities."
According to their [website](https://scikit-learn.org/stable/getting_started.html), "Scikit-learn na open source machine learning library wey dey support supervised and unsupervised learning. E still get tools for model fitting, data preprocessing, model selection and evaluation, plus many other utilities."
For dis course, you go use Scikit-learn and other tools to build machine learning models to do wetin we dey call 'traditional machine learning' tasks. We don avoid neural networks and deep learning on purpose, as dem dey better covered for our upcoming 'AI for Beginners' curriculum.
For dis course, you go use Scikit-learn and other tools to build machine learning models wey dem dey call 'traditional machine learning' tasks. We no include neural networks and deep learning because we go talk about dem for our 'AI for Beginners' curriculum wey dey come.
Scikit-learn dey make am easy to build models and evaluate dem for use. E dey mainly focus on using numeric data and e get several ready-made datasets wey you fit use as learning tools. E also get pre-built models wey students fit try. Make we explore di process of loading prepackaged data and using one built-in estimator first ML model wit Scikit-learn wit some basic data.
Scikit-learn dey easy to use to build models and check dem. E mainly dey use numeric data and get many ready-made datasets for learning. E also get built models wey students fit try. Make we check how to load prepackaged data and use built-in estimator first ML model with Scikit-learn with some basic data.
## Exercise - your first Scikit-learn notebook
> Dis tutorial na inspiration from di [linear regression example](https://scikit-learn.org/stable/auto_examples/linear_model/plot_ols.html#sphx-glr-auto-examples-linear-model-plot-ols-py) for Scikit-learn website.
> Dis tutorial come from [linear regression example](https://scikit-learn.org/stable/auto_examples/linear_model/plot_ols.html#sphx-glr-auto-examples-linear-model-plot-ols-py) for Scikit-learn web site.
[![ML for beginners - Your First Linear Regression Project in Python](https://img.youtube.com/vi/2xkXL5EUpS0/0.jpg)](https://youtu.be/2xkXL5EUpS0 "ML for beginners - Your First Linear Regression Project in Python")
> 🎥 Click di image above for one short video wey go show you how to do dis exercise.
> 🎥 Click picture above for short video to follow dis exercise.
For di _notebook.ipynb_ file wey dey dis lesson, clear all di cells by pressing di 'trash can' icon.
For _notebook.ipynb_ file wey dey for dis lesson, clear all the cells by pressing di 'trash can' icon.
For dis section, you go work wit one small dataset about diabetes wey dey built into Scikit-learn for learning purposes. Imagine say you wan test one treatment for diabetic patients. Machine Learning models fit help you determine which patients go respond better to di treatment, based on combinations of variables. Even one very basic regression model, when you visualize am, fit show information about variables wey go help you arrange your theoretical clinical trials.
For dis part, you go work wit small dataset about diabetes wey dey inside Scikit-learn for learning. Imagine say you wan test treatment for diabetic patients. Machine Learning models fit help you see which patient go respond better, based on combination of variables. Even simple regression model, if you show am, fit show info about variables wey fit help arrange your clinical trials idea.
Plenty types of regression methods dey, and di one wey you go pick depend on di answer wey you dey look for. If you wan predict di probable height for person wey get one given age, you go use linear regression, as you dey find **numeric value**. If you wan discover whether one type of food suppose be vegan or not, you dey look for **category assignment** so you go use logistic regression. You go learn more about logistic regression later. Think small about some questions wey you fit ask of data, and which of dis methods go make sense.
Their different types of regression, and which one you use go depend on the answer you want. If you want predict height for person of one age, you go use linear regression, as you want **numeric value**. If you wan find if one kin food na vegan or no, you dey find **category** so you go use logistic regression. You go learn more on logistic regression later. Think small about questions wey you fit ask data, and which method go fit.
Make we start dis task.
Make we start dis task now.
### Import libraries
For dis task we go import some libraries:
For dis work we go import some libraries:
- **matplotlib**. E dey useful as [graphing tool](https://matplotlib.org/) and we go use am to create line plot.
- **numpy**. [numpy](https://numpy.org/doc/stable/user/whatisnumpy.html) na useful library for handling numeric data inside Python.
- **sklearn**. Dis na di [Scikit-learn](https://scikit-learn.org/stable/user_guide.html) library.
- **matplotlib**. E good [graphing tool](https://matplotlib.org/) and we go use am to form line plot.
- **numpy**. [numpy](https://numpy.org/doc/stable/user/whatisnumpy.html) na good library for numeric data for Python.
- **sklearn**. Na [Scikit-learn](https://scikit-learn.org/stable/user_guide.html) library dis one.
Import some libraries to help wit your tasks.
Import libraries wey go help for your work.
1. Add imports by typing di following code:
1. Add imports by typing this code:
```python
import matplotlib.pyplot as plt
@ -122,26 +123,26 @@ Import some libraries to help wit your tasks.
from sklearn import datasets, linear_model, model_selection
```
Above you dey import `matplotlib`, `numpy` and you dey import `datasets`, `linear_model` and `model_selection` from `sklearn`. `model_selection` dey used to split data into training and test sets.
For here, you dey import `matplotlib`, `numpy` and you dey import `datasets`, `linear_model` and `model_selection` from `sklearn`. `model_selection` na for divide data into training and test sets.
### Di diabetes dataset
### The diabetes dataset
Di built-in [diabetes dataset](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) get 442 samples of data about diabetes, wit 10 feature variables, some of dem include:
The built-in [diabetes dataset](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) get 442 samples of data about diabetes, with 10 feature variables, like:
- age: age in years
- age: age inside years
- bmi: body mass index
- bp: average blood pressure
- s1 tc: T-Cells (one type of white blood cells)
- s1 tc: T-Cells (kind of white blood cells)
✅ Dis dataset get di concept of 'sex' as feature variable wey dey important for research about diabetes. Plenty medical datasets dey include dis type of binary classification. Think small about how categorizations like dis fit exclude some parts of di population from treatments.
✅ Dis dataset get the idea of 'sex' as feature wey important for diabetes research. Many medical dataset get this kind binary classification. Think small about how this kind categories for exclude some people from treatments.
Now, load di X and y data.
Now, gbe the X and y data come.
> 🎓 Remember, dis na supervised learning, and we need one named 'y' target.
> 🎓 Remember say, dis one na supervised learning, so we need to get named 'y' target.
For new code cell, load di diabetes dataset by calling `load_diabetes()`. Di input `return_X_y=True` dey signal say `X` go be data matrix, and `y` go be regression target.
For new code cell, load diabetes dataset by calling `load_diabetes()`. The input `return_X_y=True` mean say `X` go be data matrix, and `y` go be regression target.
1. Add some print commands to show di shape of di data matrix and di first element:
1. Add print commands to show the shape of data matrix and first element:
```python
X, y = datasets.load_diabetes(return_X_y=True)
@ -149,9 +150,9 @@ For new code cell, load di diabetes dataset by calling `load_diabetes()`. Di inp
print(X[0])
```
Wetin you dey get back as response na tuple. Wetin you dey do na to assign di two first values of di tuple to `X` and `y` respectively. Learn more [about tuples](https://wikipedia.org/wiki/Tuple).
Wetin you go get back na tuple. What you dey do be assign first two values of tuple to `X` and `y`. Learn more [about tuples](https://wikipedia.org/wiki/Tuple).
You fit see say dis data get 442 items shaped inside arrays of 10 elements:
You fit see say data get 442 items wey shaped as arrays of 10 elements:
```text
(442, 10)
@ -159,39 +160,39 @@ For new code cell, load di diabetes dataset by calling `load_diabetes()`. Di inp
-0.04340085 -0.00259226 0.01990842 -0.01764613]
```
✅ Think small about di relationship between di data and di regression target. Linear regression dey predict relationships between feature X and target variable y. You fit find di [target](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) for di diabetes dataset for di documentation? Wetin dis dataset dey show, given di target?
✅ Think small about how data relate to regression target. Linear regression dey predict how feature X and target y relate. You fit find [target](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) for diabetes dataset inside di documentation? Wetin this dataset dey show with dat target?
2. Next, select one portion of dis dataset to plot by selecting di 3rd column of di dataset. You fit do dis by using di `:` operator to select all rows, and then select di 3rd column using di index (2). You fit also reshape di data to be 2D array - as e dey required for plotting - by using `reshape(n_rows, n_columns)`. If one of di parameter na -1, di corresponding dimension go dey calculated automatically.
2. Next, choose part of dataset to plot by choosing 3rd column. You fit select all rows with `:` operator, then choose 3rd column with index (2). You fit reshape data to be 2D array - like dis plotting need - by using `reshape(n_rows, n_columns)`. If any parameter be -1, e go calculate that dimension automatically.
```python
X = X[:, 2]
X = X.reshape((-1,1))
```
✅ Anytime, print out di data to check di shape.
✅ Anytime you fit print data to check shape.
3. Now wey you don get data ready to plot, you fit see if machine fit help determine one logical split between di numbers for dis dataset. To do dis, you need to split both di data (X) and di target (y) into test and training sets. Scikit-learn get one straightforward way to do dis; you fit split your test data for one given point.
3. Now wey data ready for plotting, make we see if machine fit help decide better split for numbers for this dataset. To do so, you need split data (X) and target (y) into test and training sets. Scikit-learn get easy way to do dis; you fit split your test data for any place you want.
```python
X_train, X_test, y_train, y_test = model_selection.train_test_split(X, y, test_size=0.33)
```
4. Now you don ready to train your model! Load di linear regression model and train am wit your X and y training sets using `model.fit()`:
4. Now you fit train your model! Load linear regression model and train am with your X and y training sets using `model.fit()`:
```python
model = linear_model.LinearRegression()
model.fit(X_train, y_train)
```
`model.fit()` na function wey you go see for plenty ML libraries like TensorFlow
`model.fit()` na function wey you go see for many ML libraries like TensorFlow
5. Then, create one prediction using test data, using di function `predict()`. Dis go dey used to draw di line between di numbers for di dataset.
5. Then create prediction with test data by using `predict()`. E go help draw line between data groups
```python
y_pred = model.predict(X_test)
```
6. Now na time to show di data for one plot. Matplotlib na very useful tool for dis task. Create scatterplot of all di X and y test data, and use di prediction to draw one line for di most correct place, between di model data groupings.
6. Now time don reach to show data for plot. Matplotlib be very useful tool for this type work. Create scatterplot for all X and y test data, then use prediction to draw line for right place between model data groups.
```python
plt.scatter(X_test, y_test, color='black')
@ -202,31 +203,32 @@ For new code cell, load di diabetes dataset by calling `load_diabetes()`. Di inp
plt.show()
```
![scatterplot wey dey show datapoints about diabetes](../../../../translated_images/pcm/scatterplot.ad8b356bcbb33be6.webp)
✅ Tink small small about wetin dey happen here. One straight line dey waka pass plenty small dots wey be data, but wetin e dey really do? You fit see how you go fit use dis line take predict where new data wey you never see go fit enter for the plot y axis? Try talk the practical use of dis model.
![scatterplot wey show datapoints about diabetes](../../../../translated_images/pcm/scatterplot.ad8b356bcbb33be6.webp)
Congrats, you don build your first linear regression model, use am predict something, and show am for one plot!
✅ Think small about wetin dey happen here. One straight line dey run through plenti small dots of data, but wetin e dey really do? You fit see as you suppose use dis line take predict where new, never see data point suppose join inside the plot's y axis? Try talk am for word how this model fit work for real life.
Congrats, you don build your first linear regression model, create prediction with am, plus show am for one plot!
---
## 🚀Challenge
Plot another variable from dis dataset. Hint: change dis line: `X = X[:,2]`. Based on dis dataset target, wetin you fit discover about how diabetes dey progress as disease?
Plot one different variable from dis dataset. Hint: change this line: `X = X[:,2]`. Based on dis dataset target, wetin you fit discover about how diabetes dey progress as disease?
## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ml/)
## Review & Self Study
For dis tutorial, you work with simple linear regression, no be univariate or multiple linear regression. Read small about the difference between dis methods, or check [dis video](https://www.coursera.org/lecture/quantifying-relationships-regression-models/linear-vs-nonlinear-categorical-variables-ai2Ef).
For dis tutorial, you work with simple linear regression, no be univariate or multiple linear regression. Read small about the difference between dem methods, or try check [dis video](https://www.coursera.org/lecture/quantifying-relationships-regression-models/linear-vs-nonlinear-categorical-variables-ai2Ef)
Read more about regression concept and tink about the kind questions wey dis technique fit answer. Take dis [tutorial](https://docs.microsoft.com/learn/modules/train-evaluate-regression-models?WT.mc_id=academic-77952-leestott) to understand am well well.
Read more about regression concept and think about kind questions wey dis method fit answer. Take dis [tutorial](https://docs.microsoft.com/learn/modules/train-evaluate-regression-models?WT.mc_id=academic-77952-leestott) to sabi am well well.
## Assignment
[A different dataset](assignment.md)
[One different dataset](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Disclaimer**:
Dis dokyument don use AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator) do di translation. Even as we dey try make am accurate, abeg sabi say automated translations fit get mistake or no dey correct well. Di original dokyument wey dey for im native language na di main source wey you go fit trust. For important information, e good make professional human translation dey use. We no go fit take blame for any misunderstanding or wrong interpretation wey fit happen because you use dis translation.
Dis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,4 +1,4 @@
# Build regression model wit Scikit-learn: prepare and show data
# Build a regression model using Scikit-learn: prepare and visualize data
![Data visualization infographic](../../../../translated_images/pcm/data-visualization.54e56dded7c1a804.webp)
@ -10,51 +10,51 @@ Infographic by [Dasani Madipalli](https://twitter.com/dasani_decoded)
## Introduction
Now wey you don get all di tools wey you need to start machine learning model building wit Scikit-learn, you fit begin dey ask beta questions about your data. As you dey work wit data and dey use ML solutions, e dey very important to sabi how to ask di correct question so you fit unlock di potential wey dey your dataset.
Now wey you don get all di tools wey you need to start to dey build machine learning model with Scikit-learn, you don ready to start dey ask questions about your data. As you dey work with data and apply ML solutions, e important well well to sabi how to ask correct question to fit unlock all di powers wey dey inside your dataset.
For dis lesson, you go learn:
- How to prepare your data for model-building.
- How to use Matplotlib to show data.
- How to take use Matplotlib for data visualization.
- How to take use Seaborn for more expressive data visualization.
## Ask di correct question about your data
## How to ask the correct question about your data
Di question wey you wan answer go determine di type of ML algorithm wey you go use. Di quality of di answer wey you go get go depend well-well on di kind data wey you get.
The question wey you wan find answer go determine which kind ML algorithms you go use. And how correct di answer go be depend wella on di nature of your data.
Check di [data](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) wey dem provide for dis lesson. You fit open dis .csv file for VS Code. If you look am small, you go see say e get blanks and mix of strings and numbers. E still get one strange column wey dem call 'Package' wey di data dey mix between 'sacks', 'bins' and other values. Di data sef no dey clean.
Look di [data](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) wey dem provide for dis lesson. You fit open dis .csv file for VS Code. If you look am quickly, e show say e get blanks and mix of strings and numeric data. E still get one kain strange column wey dem call 'Package' wey di data na mix of 'sacks', 'bins' and other values. Di data, truth be told, na small gbege.
[![ML for beginners - How to Analyze and Clean a Dataset](https://img.youtube.com/vi/5qGjczWTrDQ/0.jpg)](https://youtu.be/5qGjczWTrDQ "ML for beginners - How to Analyze and Clean a Dataset")
> 🎥 Click di image wey dey up for short video wey go show how to prepare di data for dis lesson.
> 🎥 Click di picture wey dey above for short video wey dey show how to prepare di data for dis lesson.
E no dey common to get dataset wey don ready to use for ML model straight. For dis lesson, you go learn how to prepare raw dataset wit standard Python libraries. You go still learn different ways to show di data.
For fact, e no too common to get dataset wey ready complete to use build ML model straight from di beginning. For dis lesson, you go learn how to prepare raw dataset with standard Python libraries. You go learn plenty ways to visualize di data too.
## Case study: 'di pumpkin market'
## Case study: 'the pumpkin market'
For dis folder, you go see one .csv file for di root `data` folder wey dem call [US-pumpkins.csv](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) wey get 1757 lines of data about di market for pumpkins, wey dem arrange by city. Dis na raw data wey dem collect from di [Specialty Crops Terminal Markets Standard Reports](https://www.marketnews.usda.gov/mnp/fv-report-config-step1?type=termPrice) wey United States Department of Agriculture dey share.
Inside dis folder, you go find .csv file for di root `data` folder called [US-pumpkins.csv](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) wey get 1757 lines of data about pumpkin market, sorted by city groupings. Dis na raw data wey dem comot from di [Specialty Crops Terminal Markets Standard Reports](https://www.marketnews.usda.gov/mnp/fv-report-config-step1?type=termPrice) wey United States Department of Agriculture dey distribute.
### Prepare data
### Preparing data
Dis data dey public domain. You fit download am as plenty separate files, per city, from di USDA website. To avoid too many separate files, we don join all di city data into one spreadsheet, so we don _prepare_ di data small. Next, make we look di data well.
Dis data dey public domain. You fit download am as many small small files, per city, for USDA website. To avoid too many small files, we don join all di city data into one spreadsheet, so we don already _prepare_ di data small. Next, make we look di data well well.
### Di pumpkin data - early conclusions
Wetin you notice about dis data? You don already see say e get mix of strings, numbers, blanks and strange values wey you go need understand.
Wetin be di question wey you fit ask about dis data, using Regression technique? How about "Predict di price of pumpkin wey dem dey sell for one month"? If you look di data again, you go see say e get some changes wey you go need make to create di data structure wey go work for di task.
Wetin you notice for dis data? You see say e get mix of strings, numbers, blanks and strange values wey you go need make sense.
Which kind question you fit ask this data with Regression technique? Wetin about "Predict di price of pumpkin wey dem dey sell for given month". If you look di data again, e get some changes wey you go do make data fit the structure wey this work need.
## Exercise - analyze di pumpkin data
Make we use [Pandas](https://pandas.pydata.org/), (di name mean `Python Data Analysis`) one tool wey dey very useful to shape data, to analyze and prepare dis pumpkin data.
Make we use [Pandas](https://pandas.pydata.org/), (di name mean `Python Data Analysis`) wey na tool wey make am easy to shape data, to analyze and prepare dis pumpkin data.
### First, check for missing dates
You go first need to check for missing dates:
You go first need do step to check if any date dey miss:
1. Change di dates to month format (di format na US dates, so e be `MM/DD/YYYY`).
2. Take di month put for new column.
1. Change di dates to month format (dis na US dates, so format na `MM/DD/YYYY`).
2. Cut di month come put for new column.
Open di _notebook.ipynb_ file for Visual Studio Code and import di spreadsheet into new Pandas dataframe.
Open _notebook.ipynb_ file for Visual Studio Code and import di spreadsheet into new Pandas dataframe.
1. Use di `head()` function to see di first five rows.
@ -64,30 +64,30 @@ Open di _notebook.ipynb_ file for Visual Studio Code and import di spreadsheet i
pumpkins.head()
```
✅ Wetin be di function wey you go use to see di last five rows?
✅ Wetin function you go use to see last five rows?
1. Check if di current dataframe get missing data:
1. Check if any data dey miss for current dataframe:
```python
pumpkins.isnull().sum()
```
E get missing data, but e fit no matter for di task wey you wan do.
Some data dey miss, but e fit no matter for dis work.
1. To make di dataframe easy to work wit, select only di columns wey you need, using di `loc` function wey dey extract from di original dataframe group of rows (di first parameter) and columns (di second parameter). Di expression `:` for di example below mean "all rows".
1. To make your dataframe easy to work with, select only di columns wey you need, using `loc` function wey go pick some rows (first parameter) and columns (second parameter) from di original dataframe. `:` for dis case mean "all rows".
```python
columns_to_select = ['Package', 'Low Price', 'High Price', 'Date']
pumpkins = pumpkins.loc[:, columns_to_select]
```
### Second, find di average price of pumpkin
### Second, find average price of pumpkin
Think about how you go fit find di average price of pumpkin for one month. Wetin be di columns wey you go pick for dis task? Hint: you go need 3 columns.
Think how to find average price of pumpkin for one month. Which columns you go choose for dis work? Hint: you go need 3 columns.
Solution: take di average of di `Low Price` and `High Price` columns to fill di new Price column, and change di Date column to show only di month. Lucky for us, di check wey we do before show say e no get missing data for dates or prices.
Solution: take average of `Low Price` and `High Price` columns to make new Price column, and change Date column to show only month. Luckily, from di check above, no date or price data dey missing.
1. To calculate di average, add dis code:
1. To calculate average, add dis code:
```python
price = (pumpkins['Low Price'] + pumpkins['High Price']) / 2
@ -96,37 +96,38 @@ Solution: take di average of di `Low Price` and `High Price` columns to fill di
```
Feel free to print any data wey you wan check using `print(month)`.
You fit print any data you wan check with `print(month)`.
2. Now, copy di converted data into fresh Pandas dataframe:
2. Now, copy your converted data enter new Pandas dataframe:
```python
new_pumpkins = pd.DataFrame({'Month': month, 'Package': pumpkins['Package'], 'Low Price': pumpkins['Low Price'],'High Price': pumpkins['High Price'], 'Price': price})
```
If you print di dataframe, e go show clean, tidy dataset wey you fit use build your new regression model.
If you print your dataframe, e go show you clean, tidy dataset wey you fit use build your new regression model.
### But wait! Something dey strange here
### But wait! Something dey odd here
If you check `Package` column, pumpkins dey sell for many different ways. Some dey sell for '1 1/9 bushel' measurements, some for '1/2 bushel', some per pumpkin, some per pound, and some dey large boxes wey get different widths.
If you look di `Package` column, you go see say pumpkins dey sell for different ways. Some dey sell for '1 1/9 bushel', some for '1/2 bushel', some per pumpkin, some per pound, and some for big boxes wey get different sizes.
> E be like say e hard well well to weigh pumpkins the same way always
> Pumpkins dey hard to weigh well-well
When you dey check original data, e get one thing interest - anything wey get `Unit of Sale` wey equal 'EACH' or 'PER BIN' still get `Package` type wey be per inch, per bin or 'each'. E be like say e dey really hard to weigh pumpkins the same consistent way, so make we use filter take only pumpkins wey get 'bushel' string for their `Package` column.
If you check di original data, e dey interesting say anything wey get `Unit of Sale` as 'EACH' or 'PER BIN' still get `Package` type per inch, per bin, or 'each'. Pumpkins dey hard to weigh well-well, so make we filter dem by selecting only pumpkins wey get di string 'bushel' for their `Package` column.
1. Add filter for di top of di file, under di initial .csv import:
1. Add one filter for top of di file, under di initial .csv import:
```python
pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]
```
If you print di data now, you go see say you dey only get di 415 rows of data wey dey contain pumpkins by di bushel.
If you print di data now, you fit see say you dey only get di 415 or something rows of data wey get pumpkins by di bushel.
### But wait! One more thing dey to do
### But wait! E still get one more thing to do
You notice say di bushel amount dey different for each row? You go need normalize di pricing so e go show di pricing per bushel, so do some math to standardize am.
You notice say di bushel amount dey change for each row? You need to normalize di pricing so dat e go show di price per bushel, so make you do some math to standardize am.
1. Add dis lines after di block wey dey create di new_pumpkins dataframe:
1. Add these lines after di block wey dey create di new_pumpkins dataframe:
```python
new_pumpkins.loc[new_pumpkins['Package'].str.contains('1 1/9'), 'Price'] = price/(1 + 1/9)
@ -134,38 +135,38 @@ You notice say di bushel amount dey different for each row? You go need normaliz
new_pumpkins.loc[new_pumpkins['Package'].str.contains('1/2'), 'Price'] = price/(1/2)
```
✅ According to [The Spruce Eats](https://www.thespruceeats.com/how-much-is-a-bushel-1389308), di weight of bushel dey depend on di type of produce, as e dey measure volume. "Bushel of tomatoes, for example, suppose weigh 56 pounds... Leaves and greens dey take more space wit less weight, so bushel of spinach na only 20 pounds." E dey complicated! Make we no bother wit bushel-to-pound conversion, instead make we price by di bushel. All dis study of bushels of pumpkins show how e dey important to understand di nature of your data!
✅ According to [The Spruce Eats](https://www.thespruceeats.com/how-much-is-a-bushel-1389308), weight of bushel dey depend on di kind produce, as na volume measurement e be. "A bushel of tomatoes, for example, suppose weigh 56 pounds... Leaves and greens dey take more space but get less weight, so bushel of spinach na only 20 pounds." E dey quite complicated! Make we no try convert bushel to pound, but instead price am by di bushel. All dis study of bushels of pumpkins show well well how e important to sabi di nature of your data!
Now, you fit analyze di pricing per unit based on their bushel measurement. If you print di data one more time, you go see how e don standardize.
Now, you fit analyze di pricing per unit based on their bushel measurement. If you print di data one more time, you go fit see how e standarize.
✅ You notice say pumpkins wey dem dey sell by half-bushel dey very expensive? You fit figure out why? Hint: small pumpkins dey more expensive than big ones, probably because plenty dey per bushel, as big hollow pie pumpkin dey take space.
✅ You notice say pumpkins wey dem sell by di half-bushel dey very expensive? You fit figure why? Hint: small pumpkins dey cost pass big ones, probably because plenty small pumpkins dey one bushel, while one big hollow pie pumpkin dey waste space.
## Visualization Strategies
Part of di work of data scientist na to show di quality and nature of di data wey dem dey work wit. To do dis, dem dey create interesting visualizations, or plots, graphs, and charts, wey dey show different parts of di data. Dis way, dem fit show relationships and gaps wey dey hard to see.
Part of di work wey data scientist dey do na to show di quality and nature of di data wey dem dey work with. To do dis, dem dey often create correct visualizations, like plots, graphs, and charts, wey go show different sides of di data. With dis kind taf taf, dem fit visually show relationships and gaps wey hard to see normally.
[![ML for beginners - How to Visualize Data with Matplotlib](https://img.youtube.com/vi/SbUkxH6IJo0/0.jpg)](https://youtu.be/SbUkxH6IJo0 "ML for beginners - How to Visualize Data with Matplotlib")
> 🎥 Click di image wey dey up for short video wey go show how to visualize di data for dis lesson.
> 🎥 Click di picture above for short video wey dey show how to visualize di data for dis lesson.
Visualizations fit still help you decide di machine learning technique wey go work well for di data. Scatterplot wey dey follow line, for example, dey show say di data fit work well for linear regression exercise.
Visualizations fit also help decide which machine learning method go best for di data. For example, if scatterplot dey follow one line, e show say di data good for linear regression.
One data visualization library wey dey work well for Jupyter notebooks na [Matplotlib](https://matplotlib.org/) (you don see am for di previous lesson).
One data visualization library wey dey work well for Jupyter notebooks na [Matplotlib](https://matplotlib.org/) (wey you also see for di last lesson).
> Get more experience wit data visualization for [dis tutorials](https://docs.microsoft.com/learn/modules/explore-analyze-data-with-python?WT.mc_id=academic-77952-leestott).
> Get more experience with data visualization inside [these tutorials](https://docs.microsoft.com/learn/modules/explore-analyze-data-with-python?WT.mc_id=academic-77952-leestott).
## Exercise - try Matplotlib
## Exercise - experiment with Matplotlib
Try create some basic plots to show di new dataframe wey you don create. Wetin basic line plot go show?
Try create some basic plots to show di new dataframe wey you just create. Wetin basic line plot fit show?
1. Import Matplotlib for di top of di file, under di Pandas import:
1. Import Matplotlib for top of file under Pandas import:
```python
import matplotlib.pyplot as plt
```
1. Rerun di whole notebook to refresh.
1. For di bottom of di notebook, add cell to plot di data as box:
1. Run di complete notebook again to refresh.
1. For bottom of di notebook, add one cell to plot di data as box:
```python
price = new_pumpkins.Price
@ -176,15 +177,15 @@ Try create some basic plots to show di new dataframe wey you don create. Wetin b
![A scatterplot showing price to month relationship](../../../../translated_images/pcm/scatterplot.b6868f44cbd2051c.webp)
Dis plot dey useful? E surprise you?
Na useful plot dis? E surprise you for any way?
E no too useful as e just dey show di data as spread of points for di month.
E no too useful as e only show your data spread as points for different months.
### Make am useful
To get charts wey dey useful, you go need group di data somehow. Make we try create plot wey di y axis dey show di months and di data dey show di distribution.
To make charts show useful data, you usually need to group di data somehow. Make we try create one plot wey di y axis dey show di months and di data dey show how data dey distribute.
1. Add cell to create grouped bar chart:
1. Add one cell to create grouped bar chart:
```python
new_pumpkins.groupby(['Month'])['Price'].mean().plot(kind='bar')
@ -193,19 +194,94 @@ To get charts wey dey useful, you go need group di data somehow. Make we try cre
![A bar chart showing price to month relationship](../../../../translated_images/pcm/barchart.a833ea9194346d76.webp)
Dis na more useful data visualization! E dey show say di highest price for pumpkins dey September and October. E match wetin you dey expect? Why or why not?
Dis one na more useful data visualization! E seem to show say highest price for pumpkin dey happen for September and October. E match your expectation? Why or why not?
## Exercise - experiment with Seaborn
Matplotlib strong well well, but e fit need plenty code to make one fine fine chart. [Seaborn](https://seaborn.pydata.org/) na library wey build _on top of_ Matplotlib designed for statistical data visualization. E dey work directly with Pandas dataframes, get nice default styles, and let you create correct plots with less code. Because Seaborn dey return Matplotlib objects, you fit still use everything wey you sabi about Matplotlib to fine-tune di result.
> If you never get Seaborn installed, install am with `pip install seaborn`.
1. Import Seaborn for top of di notebook, under di other imports. Dem normally dey import am as `sns`:
```python
import seaborn as sns
```
### Scatter plots to show relationships
One big part of exploring data before you build model na to look for _relationships_ between variables. [Scatter plot](https://en.wikipedia.org/wiki/Scatter_plot) na one of di best tools for dis: if points dey follow one line, di two variables fit dey correlated, which be good sign say linear regression model fit work.
1. Recreate di price-to-month scatter plot from before, dis time use Seaborn's [`relplot()`](https://seaborn.pydata.org/generated/seaborn.relplot.html) (relational plot), wey dey work directly with your dataframe columns:
```python
sns.relplot(x="Price", y="Month", data=new_pumpkins)
```
![A Seaborn scatterplot showing price to month relationship](../../../../translated_images/pcm/relplot.a03837d8f0329cec.webp)
Notice how you pass di _column names_ and di dataframe, and Seaborn go handle di axis labels for you.
2. You fit change am to line plot by passing `kind="line"`. Seaborn even go draw one shaded band wey dey show di confidence interval around di line:
```python
sns.relplot(x="Price", y="Month", kind="line", data=new_pumpkins)
```
![A Seaborn line plot showing price to month relationship](../../../../translated_images/pcm/lineplot.f9034ba47b1e30ee.webp)
Dis data too noisy small, so line plot no be di clearest choice here — but e show how e easy you fit change chart types inside Seaborn.
### Bar charts to show distributions
Before, you bin group di data by hand to create bar chart wit Matplotlib. Seaborn's [`catplot()`](https://seaborn.pydata.org/generated/seaborn.catplot.html) (categorical plot) fit do di grouping and aggregation for you. By default `kind="bar"` dey show di mean of each category plus one black line wey dey show di confidence interval.
1. Make bar chart of average price per month:
```python
sns.catplot(x="Month", y="Price", data=new_pumpkins, kind="bar")
```
![A Seaborn bar chart showing the price distribution per month](../../../../translated_images/pcm/catplot.e73fc35fdf96242b.webp)
Dis dey confirm wetin you see wit Matplotlib — prices dey peak around September and October — but Seaborn also dey show how much di price _dey change_ inside each month.
### Heatmaps to show correlations
Scatter plots dey compare two variables at once. When you get plenty numeric columns, one [heatmap](https://en.wikipedia.org/wiki/Heat_map) go let you see how strong di relationship between _every_ pair of columns be at the same time. Dis na common way to find which features get strong correlation before you choose wetin to put inside model (and di same kain chart dey used later to show confusion matrices for classification).
1. Make correlation matrix wit Pandas, then draw am wit Seaborn's [`heatmap()`](https://seaborn.pydata.org/generated/seaborn.heatmap.html). Di `annot=True` option dey print di correlation values for each cell:
```python
correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()
sns.heatmap(correlations, annot=True, cmap="coolwarm")
```
![A Seaborn heatmap showing correlations between the numeric columns](../../../../translated_images/pcm/heatmap.bd98dce43b404c57.webp)
Values wey close to `1` (or `-1`) mean say di columns get strong _linear_ correlation. See as `Low Price` and `High Price` almost get perfect correlation. `Month`, however, only show small linear correlation with price — even though di bar chart above show one clear seasonal peak for September and October. Dat important lesson be say: di correlation coefficient only measure _straight-line_ relationship, so e fit miss seasonal or other non-linear patterns. ✅ Why e useful to look both heatmap *and* charts like di bar chart before you decide which columns to use?
### Matplotlib or Seaborn?
Both libraries worth to sabi:
- **Matplotlib** dey give you fine control over every part of chart and na di foundation nearly every other Python plotting library build on top.
- **Seaborn** dey provide higher-level functions and better defaults for statistical charts, e work direct wit dataframes, and e quick pass sometimes for exploratory data analysis.
Normal workflow na to use Seaborn first to explore your data quick, then fall back to Matplotlib if you need customize details.
---
## 🚀Challenge
Check di different types of visualization wey Matplotlib dey offer. Which types dey best for regression problems?
Explore di different types of visualization wey Matplotlib and Seaborn dey offer. Which ones best for regression problems?
## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ml/)
## Review & Self Study
Look di many ways wey dey to visualize data. Make list of di different libraries wey dey available and note which one dey best for di type of task, like 2D visualizations vs. 3D visualizations. Wetin you discover?
Look di many ways wey you fit visualize data. Make list of the libraries wey dey available and note which one best for particular task, like 2D visualizations vs 3D visualizations. Wetin you discover?
## Assignment
@ -215,5 +291,5 @@ Look di many ways wey dey to visualize data. Make list of di different libraries
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Disclaimer**:
Dis dokyument don use AI transleshion service [Co-op Translator](https://github.com/Azure/co-op-translator) do di transleshion. Even as we dey try make am accurate, abeg make you sabi say automatik transleshion fit get mistake or no dey correct well. Di original dokyument wey dey for im native language na di one wey you go take as di main source. For important mata, e good make you use professional human transleshion. We no go fit take blame for any misunderstanding or wrong interpretation wey fit happen because you use dis transleshion.
Dis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,7 +4,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Linear Regression for Pumpkins - Lesson 2\n"
"## Linear Regression for Pumpkins - Lekshon 2\n"
]
},
{
@ -222,6 +222,7 @@
"source": [
"import pandas as pd\n",
"import matplotlib.pyplot as plt\n",
"import seaborn as sns\n",
"pumpkins = pd.read_csv('../../data/US-pumpkins.csv')\n",
"\n",
"pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]\n",
@ -385,18 +386,78 @@
"plt.ylabel(\"Pumpkin Price\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Visualize wit Seaborn\n",
"\n",
"[Seaborn](https://seaborn.pydata.org/) dey built ontop Matplotlib and e dey work direct wit dataframes, wey make am fast to create fine statistical plots wit small code.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### Scatter plots to show relationships\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.relplot(x=\"Price\", y=\"Month\", data=new_pumpkins)"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.relplot(x=\"Price\", y=\"Month\", kind=\"line\", data=new_pumpkins)"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### Bar charts to show distributions\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.catplot(x=\"Month\", y=\"Price\", data=new_pumpkins, kind=\"bar\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### Heatmaps wey show correlations\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": []
"source": [
"correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()\n",
"sns.heatmap(correlations, annot=True, cmap=\"coolwarm\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Disclaimer**: \nDis dokyument don use AI transleshion service [Co-op Translator](https://github.com/Azure/co-op-translator) do di transleshion. Even as we dey try make am correct, abeg make you sabi say automatik transleshion fit get mistake or no dey accurate well. Di original dokyument wey dey im native language na di one wey you go take as di correct source. For important mata, e good make you use professional human transleshion. We no go fit take blame for any misunderstanding or wrong interpretation wey fit happen because you use dis transleshion.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Disclaimer**:\nDis document don translate wit AI translation service [Co-op Translator](https://github.com/Azure/co-op-translator). Even tho we dey try make am correct, abeg make you know say automated translation fit get errors or mistakes. Di original document for dia own language na im be di correct source. For important info, make person wey sabi human translation do am. We no go responsible for any misunderstanding or wrong understanding wey fit happen because of dis translation.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -426,13 +487,7 @@
"hash": "70b38d7a306a849643e446cd70466270a13445e5987dfa1344ef2b127438fa4d"
}
},
"orig_nbformat": 2,
"coopTranslator": {
"original_hash": "95726f0b8283628d5356a4f8eb8b4b76",
"translation_date": "2025-11-18T19:19:37+00:00",
"source_file": "2-Regression/2-Data/solution/notebook.ipynb",
"language_code": "pcm"
}
"orig_nbformat": 2
},
"nbformat": 4,
"nbformat_minor": 2

@ -24,8 +24,8 @@
"language_code": "ta"
},
"1-Introduction/3-fairness/README.md": {
"original_hash": "9a6b702d1437c0467e3c5c28d763dac2",
"translation_date": "2025-10-11T11:25:50+00:00",
"original_hash": "0f00d72169a0d37eecfd16d71e01700a",
"translation_date": "2026-07-14T00:11:23+00:00",
"source_file": "1-Introduction/3-fairness/README.md",
"language_code": "ta"
},
@ -54,8 +54,8 @@
"language_code": "ta"
},
"2-Regression/1-Tools/README.md": {
"original_hash": "fa81d226c71d5af7a2cade31c1c92b88",
"translation_date": "2025-10-11T11:43:13+00:00",
"original_hash": "0b8635427b582d03ea4ab7089b93e505",
"translation_date": "2026-07-14T00:09:09+00:00",
"source_file": "2-Regression/1-Tools/README.md",
"language_code": "ta"
},
@ -72,8 +72,8 @@
"language_code": "ta"
},
"2-Regression/2-Data/README.md": {
"original_hash": "7c077988328ebfe33b24d07945f16eca",
"translation_date": "2025-10-11T11:47:18+00:00",
"original_hash": "a58b2c4d16c6b122643391745ac15af6",
"translation_date": "2026-07-14T00:10:20+00:00",
"source_file": "2-Regression/2-Data/README.md",
"language_code": "ta"
},
@ -89,6 +89,12 @@
"source_file": "2-Regression/2-Data/solution/Julia/README.md",
"language_code": "ta"
},
"2-Regression/2-Data/solution/notebook.ipynb": {
"original_hash": "96b95f8cf473481f2f371de8156f1571",
"translation_date": "2026-07-13T23:59:38+00:00",
"source_file": "2-Regression/2-Data/solution/notebook.ipynb",
"language_code": "ta"
},
"2-Regression/3-Linear/README.md": {
"original_hash": "8b776e731c35b171d316d01d0e7b1369",
"translation_date": "2026-04-26T19:23:55+00:00",
@ -331,7 +337,7 @@
},
"6-NLP/4-Hotel-Reviews-1/README.md": {
"original_hash": "8d32dadeda93c6fb5c43619854882ab1",
"translation_date": "2025-10-11T11:34:02+00:00",
"translation_date": "2026-07-14T00:07:26+00:00",
"source_file": "6-NLP/4-Hotel-Reviews-1/README.md",
"language_code": "ta"
},
@ -415,7 +421,7 @@
},
"7-TimeSeries/2-ARIMA/README.md": {
"original_hash": "917dbf890db71a322f306050cb284749",
"translation_date": "2025-10-11T11:58:44+00:00",
"translation_date": "2026-07-14T00:14:45+00:00",
"source_file": "7-TimeSeries/2-ARIMA/README.md",
"language_code": "ta"
},
@ -511,7 +517,7 @@
},
"9-Real-World/1-Applications/README.md": {
"original_hash": "83320d6b6994909e35d830cebf214039",
"translation_date": "2025-10-11T11:49:19+00:00",
"translation_date": "2026-07-14T00:13:35+00:00",
"source_file": "9-Real-World/1-Applications/README.md",
"language_code": "ta"
},
@ -523,7 +529,7 @@
},
"9-Real-World/2-Debugging-ML-Models/README.md": {
"original_hash": "df2b538e8fbb3e91cf0419ae2f858675",
"translation_date": "2025-10-11T11:51:15+00:00",
"translation_date": "2026-07-14T00:12:36+00:00",
"source_file": "9-Real-World/2-Debugging-ML-Models/README.md",
"language_code": "ta"
},
@ -581,6 +587,19 @@
"source_file": "TROUBLESHOOTING.md",
"language_code": "ta"
},
"__translation_failures__": {
"sketchnotes/LICENSE.md": {
"original_hash": "fba3b94d88bfb9b81369b869a1e9a20f",
"source_file": "sketchnotes/LICENSE.md",
"language_code": "ta",
"failure_date": "2026-07-14T00:05:38+00:00",
"status": "failed",
"error_type": "TranslationIncompleteError",
"error_message": "Markdown translation remained incomplete for chunk 1.2.1 of 'LICENSE.md', and the chunk could not be split further.",
"translator_version": "0.20.0",
"failure_policy_version": 1
}
},
"docs/_sidebar.md": {
"original_hash": "68dd06c685f6ce840e0acfa313352e7c",
"translation_date": "2025-10-11T11:48:44+00:00",

@ -1,140 +1,167 @@
# பொறுப்பான AI மூலம் இயந்திரக் கற்றல் தீர்வுகளை உருவாக்குதல்
# பொறுப்புள்ள AI உடன் இயந்திர அறிதல் தீர்வுகளை கட்டமைத்தல்
![இயந்திரக் கற்றலில் பொறுப்பான AI-யின் சுருக்கம்](../../../../translated_images/ta/ml-fairness.ef296ebec6afc98a.webp)
> ஸ்கெட்ச் நோட்: [Tomomi Imura](https://www.twitter.com/girlie_mac)
![Machine Learning இல் பொறுப்புள்ள AI சுருக்கம் ஒரு ஸ்கெட்ச்னோட்](../../../../translated_images/ta/ml-fairness.ef296ebec6afc98a.webp)
> ஸ்கெட்ச்னோட் வழங்கியவர் [Tomomi Imura](https://www.twitter.com/girlie_mac)
## [முன்-வகுப்பு வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [முன்-பாதுகாப்பு வினாடிக்குறிப்பு](https://ff-quizzes.netlify.app/en/ml/)
## அறிமுகம்
இந்த பாடத்திட்டத்தில், இயந்திரக் கற்றல் எவ்வாறு மற்றும் எவ்வளவு நம் அன்றாட வாழ்க்கையை பாதிக்கிறது என்பதை நீங்கள் ஆராயத் தொடங்குவீர்கள். இன்றே, சுகாதார பரிசோதனைகள், கடன் அனுமதிகள் அல்லது மோசடிகளை கண்டறிதல் போன்ற அன்றாட முடிவெடுக்கும் பணிகளில் அமைப்புகள் மற்றும் மாதிரிகள் ஈடுபட்டுள்ளன. எனவே, இந்த மாதிரிகள் நம்பகமான முடிவுகளை வழங்குவதற்காக நன்றாக செயல்படுவது முக்கியம். எந்த மென்பொருள் பயன்பாட்டைப் போலவே, AI அமைப்புகள் எதிர்பார்ப்புகளை பூர்த்தி செய்ய முடியாமல் போகலாம் அல்லது விரும்பத்தகாத முடிவுகளை ஏற்படுத்தலாம். அதனால், AI மாதிரியின் நடத்தை மற்றும் செயல்பாட்டை புரிந்து கொள்ளவும் விளக்கவும் முடியும் என்பதில் முக்கியத்துவம் உள்ளது.
இந்த பாடத்திட்டத்தில், இயந்திர அறிதல் எப்படியும் எங்கள் தினசரி வாழ்க்கையை பாதித்து வருகிறது என்பதை நீங்கள் அறிதல் செய்ய தொடங்குவீர்கள். இப்போது கூட, உத்திகள் மற்றும் மாதிரிகள் தினசரி தீர்மானங்களை செய்ய உதவுகின்றன, உதாரணமாக மருத்துவ التشخیصகள், கடன் அனுமதிகள் அல்லது மோசடி கண்டறிதல் போன்றவை. ஆகவே, இந்த மாதிரிகள் நம்பத்தகுந்த முடிவுகளை வழங்குவதற்கு நல்ல முறையில் செயல்படுவது முக்கியம். எந்த மென்பொருள் பயன்பாட்டும் போல, AI அமைப்புகள் எதிர்பார்ப்புகளை பூர்த்தி செய்யாமலோ தவறான முடிவுகளை தருவதோ இருக்கலாம். அதனால் AI மாதிரியின் நடத்தை புரிந்து விளக்க முடிவது அவசியமே.
நீங்கள் பயன்படுத்தும் தரவுகள் சில சமூகங்களை (இனம், பாலினம், அரசியல் பார்வை, மதம் போன்றவை) குறைவாக அல்லது அதிகமாக பிரதிநிதித்துவப்படுத்தும்போது என்ன நடக்கலாம் என்று கற்பனை செய்யுங்கள். மாதிரியின் வெளியீடு சில சமூகங்களுக்கு ஆதரவாகப் பொருள் கொள்ளப்பட்டால் என்ன? பயன்பாட்டிற்கு அதன் விளைவுகள் என்ன? மேலும், மாதிரி எதிர்மறை முடிவுகளை ஏற்படுத்தி மக்களுக்கு தீங்கு விளைவிக்கும்போது என்ன நடக்கிறது? AI அமைப்பின் நடத்தைக்கு யார் பொறுப்பானவர்? இந்த பாடத்திட்டத்தில் நாம் இந்த கேள்விகளை ஆராய்வோம்.
நீங்கள் உருவாக்கும் மாதிரிகளின் தரவு சில இனக்கூட்டங்கள், பாலினம், அரசியல் பார்வை, மதம் போன்றவற்றை கொண்டிராதது அல்லது அவற்றை தவறாக பிரதிபலிக்கும் போது என்ன நடக்கும் என்று கற்பனை செய்யுங்கள். மாதிரியின் முடிவுகள் சில இனக்கூட்டங்களை ஆதரிக்கப்படுமாறு வலைபார்க்கப்படும்போது என்ன நடக்கும்? பயன்பாட்டிற்கான விளைவுகள் என்ன? கூடுதலாக, மாதிரி எதிர்மறை முடிவை கொண்டதும் அது மனிதர்களுக்கு தீங்கு விளைவித்தால் என்ன? AI அமைப்புகளின் நடத்தைக்கான பொறுப்பாளர் யார்? இந்தக் கேள்விகள் இந்த பாடத்திட்டத்தில் ஆராயப்படும்.
இந்த பாடத்தில், நீங்கள்:
இந்த பாடத்தில் நீங்கள்:
- இயந்திரக் கற்றலில் நியாயமான செயல்பாட்டின் முக்கியத்துவத்தைப் பற்றிய விழிப்புணர்வை அதிகரிக்கவும், நியாயமற்ற செயல்பாடுகளால் ஏற்படும் பாதிப்புகளைப் புரிந்து கொள்ளவும்.
- நம்பகத்தன்மை மற்றும் பாதுகாப்பை உறுதிப்படுத்த அசாதாரண சூழல்களை ஆராயும் நடைமுறையை அறிந்து கொள்ளவும்.
- அனைவரையும் அதிகாரமளிக்க, உள்ளடக்கிய அமைப்புகளை வடிவமைப்பதின் தேவையைப் புரிந்து கொள்ளவும்.
- தரவின் மற்றும் மக்களின் தனியுரிமை மற்றும் பாதுகாப்பை பாதுகாப்பது எவ்வளவு முக்கியம் என்பதை ஆராயவும்.
- AI மாதிரிகளின் நடத்தை விளக்குவதற்கான "கண்ணாடி பெட்டி" அணுகுமுறையின் முக்கியத்துவத்தைப் பாருங்கள்.
- AI அமைப்புகளில் நம்பகத்தன்மையை உருவாக்க பொறுப்புணர்வு எவ்வளவு அவசியம் என்பதை மனதில் கொள்ளவும்.
- இயந்திர அறிதல் மற்றும் நீதித்தன்மை தொடர்பான தீங்குகளைப் பற்றிய உங்கள் விழிப்புணர்வை உயர்த்துவீர்கள்.
- நம்பகத்தன்மை மற்றும் பாதுகாப்பை உறுதிப்படுத்த, விசித்திரமான மற்றும் தவிர்க்க முடியாத சூழல்களை ஆராயும் பழக்கம் பற்றி அறிந்து கொள்வீர்கள்.
- அனைவரையும் சாமர்த்தியமிக்க அமைப்புகளை வடிவமைக்கும் தேவையை புரிந்து கொள்வீர்கள்.
- தரவ மற்றும் மக்களின் தனியுரிமை மற்றும் பாதுகாப்பை எவ்வாறு பாதுகாப்பது என்பது முக்கியத்தை ஆராய்வீர்கள்.
- AI மாதிரிகளின் நடத்தை விளக்க ஒரு தெளிவான அணுகுமுறையின் முக்கியத்துவத்தை காண்பீர்கள்.
- AI அமைப்புகளில் நம்பிக்கை உருவாக்க பொறுப்புக்கூறல் அவசியம் என்பதை நினைவில் வைப்பீர்கள்.
## முன் அறிவு
## முன்னோட்டம்
முன் அறிவாக, "Responsible AI Principles" கற்றல் பாதையை எடுத்துக் கொள்ளவும் மற்றும் கீழே உள்ள வீடியோவைப் பாருங்கள்:
முன்னோட்டமாக, "பொறுப்புள்ள AI கொள்கைகள்" கற்றல் பாதையைப் பின்பற்றவும் கீழுள்ள காணொளியை பாருங்கள்:
[Responsible AI கற்றல் பாதையைப் பற்றி மேலும் அறிக](https://docs.microsoft.com/learn/modules/responsible-ai-principles/?WT.mc_id=academic-77952-leestott)
பொறுப்புள்ள AI பற்றி மேலும் அறிய இந்த [கற்றல் பாதையை](https://docs.microsoft.com/learn/modules/responsible-ai-principles/?WT.mc_id=academic-77952-leestott) பின்பற்றவும்
[![Microsoft's Approach to Responsible AI](https://img.youtube.com/vi/dnC8-uUZXSc/0.jpg)](https://youtu.be/dnC8-uUZXSc "Microsoft's Approach to Responsible AI")
[![Microsoft இன் பொறுப்புள்ள AI அணுகுமுறை](https://img.youtube.com/vi/dnC8-uUZXSc/0.jpg)](https://youtu.be/dnC8-uUZXSc "Microsoft இன் பொறுப்புள்ள AI அணுகுமுறை")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து வீடியோவைப் பாருங்கள்: Microsoft's Approach to Responsible AI
> 🎥 மேலுள்ள படத்தில் கிளிக் செய்து காணொளியை பாருங்கள்: Microsoft இன் பொறுப்புள்ள AI அணுகுமுறை
## நியாயமான செயல்பாடு
## நீதித்தன்மை
AI அமைப்புகள் அனைவரையும் நியாயமாக நடத்த வேண்டும் மற்றும் ஒரே மாதிரியான குழுக்களை வேறுபட்ட முறையில் பாதிக்காமல் இருக்க வேண்டும். உதாரணமாக, AI அமைப்புகள் மருத்துவ சிகிச்சை, கடன் விண்ணப்பங்கள் அல்லது வேலை வாய்ப்புகள் குறித்து வழிகாட்டுதல் வழங்கும்போது, ஒரே மாதிரியான அறிகுறிகள், நிதி சூழ்நிலைகள் அல்லது தொழில்முறை தகுதிகள் கொண்ட அனைவருக்கும் ஒரே பரிந்துரைகளை வழங்க வேண்டும். மனிதர்களாகிய நம்மில் ஒவ்வொருவரும் எங்கள் முடிவுகள் மற்றும் செயல்களில் தாக்கம் செலுத்தும் மரபு சார்ந்த பாகுபாடுகளை கொண்டிருக்கிறோம். இந்த பாகுபாடுகள் AI அமைப்புகளைப் பயிற்றுவிக்க பயன்படுத்தும் தரவுகளில் வெளிப்படலாம். சில நேரங்களில் இது தவறுதலாக நிகழலாம். தரவுகளில் பாகுபாடுகளை அறிமுகப்படுத்தும் போது நீங்கள் விழிப்புணர்வுடன் இருக்க முடியாதது பெரும்பாலும் கடினமாக இருக்கும்.
AI அமைப்புகள் அனைவரிடத்திலும் நீதியான முறையில் நடத்த வேண்டும் மற்றும் ஒரே மாதிரிக்குழுக்களை வேறுபட்ட முறையில் பாதிக்க கூடாது. உதாரணமாக, மருத்துவச் சிகிச்சை, கடன் விண்ணப்பங்கள், வேலை வாய்ப்பு போன்றவற்றில் AI அமைப்புகள் ஒரே அறிகுறிகள், நிதி சூழ்கள் அல்லது தொழில்முறை தகுதிகள் கொண்ட அனைவருக்கும் ஒரே பரிந்துரைகளை வழங்க வேண்டும். ஒவ்வொரு மனிதனும் உள்ளபடி பாரபட்சங்கள் கொண்டிருப்பது வழக்கமாகும், அவை AI அமைப்புகளை பயிற்சி தர தரவுகளில் எளிதில் தெரியும். இத்தகைய மாற்றல்கள் சில நேரங்களில்意ப்படாமல் நிகழலாம். தரவை உள்ளடக்கியபோது பாரபட்சத்தை உணர்ந்து உணர்ச்சியாக உணர்வது கடினம்.
**"நியாயமற்ற செயல்பாடு"** என்பது ஒரு குழுவினருக்கு (இனம், பாலினம், வயது அல்லது மாற்றுத்திறனுடைய நிலை போன்றவை) ஏற்படும் எதிர்மறை தாக்கங்கள் அல்லது "பாதிப்புகள" குறிக்கிறது. முக்கிய fairness-ஐப் பற்றிய பாதிப்புகள் பின்வருமாறு வகைப்படுத்தப்படலாம்:
**“நீதியற்ற தன்மை”** என்பது ஒரு குழுவுக்கான (வங்கிகள், பாலினம், வயது, வலிமை நிலை போன்றவை அடிப்படையாக கொண்ட) எதிர்மறை தாக்கங்களை குறிக்கிறது. முக்கிய நீதியற்ற தீங்குகள் வகைப்படுத்தப்படலாம்:
- **Allocation**: ஒரு பாலினம் அல்லது இனத்தை மற்றொன்றின் மீது முன்னுரிமை அளித்தல்.
- **Quality of service**: ஒரு குறிப்பிட்ட சூழ்நிலைக்காக தரவுகளைப் பயிற்றுவிக்கும்போது, ஆனால் உண்மை மிகவும் சிக்கலானது, இது குறைந்த செயல்திறன் கொண்ட சேவையை உருவாக்குகிறது. உதாரணமாக, கருமை நிறத்தினரைக் கண்டறிய முடியாத கை சோப்பு விநியோகிப்பான். [Reference](https://gizmodo.com/why-cant-this-soap-dispenser-identify-dark-skin-1797931773)
- **Denigration**: ஒருவரை அல்லது ஒன்றை அநியாயமாக விமர்சித்து குறை கூறுதல். உதாரணமாக, ஒரு படத்தை லேபிள் செய்யும் தொழில்நுட்பம் கருமை நிறத்தினரின் படங்களை குரங்குகளாக தவறாக லேபிள் செய்தது.
- **Over- or under-representation**: ஒரு குறிப்பிட்ட குழு ஒரு குறிப்பிட்ட தொழிலில் காணப்படாதது, மற்றும் எந்த சேவையோ அல்லது செயல்பாடோ அதை தொடர்ந்து ஊக்குவிக்கிறது என்றால் அது பாதிப்பை ஏற்படுத்துகிறது.
- **Stereotyping**: ஒரு குறிப்பிட்ட குழுவை முன்கூட்டியே ஒதுக்கப்பட்ட பண்புகளுடன் தொடர்புபடுத்துதல். உதாரணமாக, ஆங்கிலம் மற்றும் துருக்கி மொழி இடையேயான மொழிபெயர்ப்பு அமைப்பு பாலினத்துடன் தொடர்புடைய வார்த்தைகளில் தவறுகள் ஏற்படலாம்.
- **பிரிப்பு**, உதாரணமாக ஒரு பாலினம் அல்லது இனப்பேருந்து மற்றவருக்கு முன்னுரிமை அளிக்கும் போது.
- **சேவை தரம்**. ஒரு குறிப்பிட்ட சூழலுக்கான தரவை பயிற்சி செய்தால் ஆனால் நிஜம் அதிக சிக்கலானது என்றால் சேவை மோசமாக செயல்படும். எடுத்துக்காட்டு, கருப்பு தோலுடையவர்களை உணர முடியாத கை சோப்புக் குவியல். [காண Reference](https://gizmodo.com/why-cant-this-soap-dispenser-identify-dark-skin-1797931773)
- **முறைப்பாடு**. தவறாக விமர்சித்து யாரோரை அல்லது ஒன்றை குறைவாக குறிக்க. உதாரணமாக, கருப்பு தோலுடையவர்களுக்கு உருவப்படங்களை கொங்குகுட்டிகள் என தவறாக அடையாளம் கண்டு புகழடைந்த படம் அடையாளமிடும் தொழில்நுட்பம்.
- **அதிகப்படியான அல்லது குறைவான பிரதிநிதித்துவம்**. ஒரு குழுவை ஒரு தொழிலில் காணாததும், அந்த சேவையை முன்மொழியும் எந்த அமைப்பும் தீங்காக கருதப்படுகிறது.
- **கற்பனை முறைகள்**. குறிப்பிட்ட குழுவை முன்காணிக்கப்பட்ட பண்புகளுடன் இணைப்பது. உதாரணமாக, ஆங்கிலம் மற்றும் துருக்கிய மொழி மாறுதல் அமைப்பில் பாலினத்தைப் பற்றிய முறைப்பாடு காரணமாக தவறுகள் இருக்கும்.
![துருக்கி மொழிக்கு மொழிபெயர்ப்பு](../../../../translated_images/ta/gender-bias-translate-en-tr.f185fd8822c2d437.webp)
> துருக்கி மொழிக்கு மொழிபெயர்ப்பு
![டுர்க்கிஷ் மொழிக்கு மொழிபெயர்ப்பு](../../../../translated_images/ta/gender-bias-translate-en-tr.f185fd8822c2d437.webp)
> டுர்க்கிஷ் மொழிக்கு மொழிபெயர்ப்பு
![ஆங்கிலத்திற்கு மீண்டும் மொழிபெயர்ப்பு](../../../../translated_images/ta/gender-bias-translate-tr-en.4eee7e3cecb8c70e.webp)
> ஆங்கிலத்திற்கு மீண்டும் மொழிபெயர்ப்ப
![மீண்டும் ஆங்கிலம் மொழியில் மொழிபெயர்க்கப்பட்டது](../../../../translated_images/ta/gender-bias-translate-tr-en.4eee7e3cecb8c70e.webp)
> மீண்டும் ஆங்கிலம் மொழியில் மொழிபெயர்க்கப்பட்டத
AI அமைப்புகளை வடிவமைக்கும் மற்றும் சோதிக்கும் போது, AI நியாயமாக இருக்க வேண்டும் மற்றும் மனிதர்களுக்கு தடை செய்யப்பட்ட பாகுபாடான அல்லது பாகுபாடான முடிவுகளை எடுக்காமல் இருக்க வேண்டும் என்பதை உறுதிப்படுத்த வேண்டும். AI மற்றும் இயந்திரக் கற்றலில் நியாயத்தை உறுதிப்படுத்துவது ஒரு சிக்கலான சமூக-தொழில்நுட்ப சவாலாகவே உள்ளது.
AI அமைப்புகளை வடிவமைக்கும் மற்றும் சோதிக்கும் போது, AI நீதி புறக்கும் அல்லது விரிவடையும் வண்ணம் திட்டமிடலை தவிர்க்க வேண்டும் என்று உறுதி செய்ய வேண்டும். மனிதர்களும் செய்யக் கூடாத பாகுபாடான முடிவுகளை AI அமைப்புகள் வழங்கக்கூடாது. AI மற்றும் இயந்திர அறிதலில் நீதியை உறுதி செய்வது ஒரு சிக்கலான சமூக தொழில்நுட்பப் பணி.
### நம்பகத்தன்மை மற்றும் பாதுகாப்பு
நம்பகத்தன்மையை உருவாக்க, AI அமைப்புகள் சாதாரண மற்றும் எதிர்பாராத சூழல்களில் நம்பகமான, பாதுகாப்பான மற்றும் நிலையானாக இருக்க வேண்டும். AI அமைப்புகள் பல்வேறு சூழல்களில் எப்படி நடந்து கொள்கின்றன என்பதை அறிந்து கொள்வது முக்கியம், குறிப்பாக அவை அசாதாரண சூழல்களில் இருக்கும்போது. AI தீர்வுகளை உருவாக்கும்போது, AI தீர்வுகள் சந்திக்கும் பல்வேறு சூழல்களை எவ்வாறு கையாள்வது என்பதைப் பற்றிய கவனம் அதிகமாக இருக்க வேண்டும். உதாரணமாக, ஒரு சுய இயக்க வாகனம் மக்களின் பாதுகாப்பை முக்கிய முன்னுரிமையாகக் கொள்ள வேண்டும். எனவே, வாகனத்தை இயக்கும் AI இரவு, மின்னல் மழை அல்லது பனிச்சறுக்கு, தெருவில் ஓடும் குழந்தைகள், செல்லப்பிராணிகள், சாலை அமைப்புகள் போன்ற அனைத்து சாத்தியமான சூழல்களையும் கருத்தில் கொள்ள வேண்டும். AI அமைப்பு பல்வேறு சூழல்களை நம்பகமாகவும் பாதுகாப்பாகவும் கையாளும் திறன், தரவியல் விஞ்ஞானி அல்லது AI டெவலப்பர் வடிவமைப்பு அல்லது சோதனை செய்யும் போது எடுத்துக் கொண்ட எதிர்பார்ப்பின் அளவை பிரதிபலிக்கிறது.
நம்பிக்கையைக் கட்டியெழுப்ப AI அமைப்புகள் நம்பகமான, பாதுகாப்பான மற்றும் நிலையானவையாக இருக்க வேண்டும். AI அமைப்புகள் பல்வேறு சூழல்களில் எப்படி நடந்து கொள்வது என்பது முக்கியம், குறிப்பாக அசாதாரணச் சூழல்களில். AI தீர்வுகளை உருவாக்கும் போது, AI தீர்வுகள் சந்திக்கும் பல்வேறு சூழல்களை எப்படி கையாள்வது என்பது முக்கிய கவனம் பெற வேண்டும். ஒரு சுய இயக்கும் கார் மனிதர்களின் பாதுகாப்பை முதன்மைமாக நினைத்துக் கொள்ள வேண்டும். எனவே, காரின் AI அனைத்து சாத்தியமான சூழல்கள் (இரவு, மின்னிவடிவம், பனி, தெருக்கள் கடப்பவர்களின் பிள்ளைகள், செல்லப் பறவைகள், சாலை கட்டுமானங்கள்) ஆகியவற்றைக் கவனத்தில கொள்ள வேண்டும். AI அமைப்பின் எப்படி பல்வேறு சூழல்களை நம்பகமாக மற்றும் பாதுகாப்பாக கையாளும் என்பது வடிவமைப்பாளரின் கணிப்புக் திறனைக் காட்டும்.
> [🎥 வீடியோவைப் பார்க்க இங்கே கிளிக் செய்யவும்: ](https://www.microsoft.com/videoplayer/embed/RE4vvIl)
> [🎥 காணொளிக்குச் செல்ல இங்கே கிளிக் செய்யவும்: ](https://www.microsoft.com/videoplayer/embed/RE4vvIl)
### உள்ளடக்கம்
### சமவாய்மை
AI அமைப்புகள் அனைவரையும் ஈர்க்கவும் அதிகாரமளிக்கவும் வடிவமைக்கப்பட வேண்டும். AI அமைப்புகளை வடிவமைக்கும் மற்றும் செயல்படுத்தும் போது, தரவியல் விஞ்ஞானிகள் மற்றும் AI டெவலப்பர்கள், அமைப்பில் உள்ள மக்கள் தவறுதலாக விலக்கப்படக்கூடிய தடைகளை அடையாளம் காணவும் மற்றும் தீர்க்கவும். உதாரணமாக, உலகளவில் 1 பில்லியன் மாற்றுத்திறனுடையவர்கள் உள்ளனர். AI-யின் முன்னேற்றத்துடன், அவர்கள் தங்கள் அன்றாட வாழ்க்கையில் தகவல் மற்றும் வாய்ப்புகளை எளிதாக அணுக முடியும். தடைகளை தீர்ப்பதன் மூலம், அனைவருக்கும் பயனளிக்கும் சிறந்த அனுபவங்களுடன் AI தயாரிப்புகளை புதுமை செய்யவும் உருவாக்கவும் வாய்ப்புகள் உருவாகின்றன.
AI அமைப்புகள் அனைவரையும் ஈடுப்படுத்த மற்றும் அதிகாரப்படுத்த வடிவமைக்கப்பட வேண்டும். AI அமைப்புகளை வடிவமைக்கும் போது தரவியலாளர்கள் மற்றும் AI உருவாக்குநர்கள் தடைகளை கண்டறிந்து சரிசெய்ய வேண்டும், அது தவறுதலாக சிலரை பின்னடைவைச் செய்யாமல். உலகில் ஒரு பில்லியன் பேர் மாற்றுத் திறனாளிகளாக உள்ளனர். AI முன்னேற்றத்தால், அவர்கள் தினசரி வாழ்க்கையில் தகவல் மற்றும் வாய்ப்புகளை எளிதில் அடைய முடியும். தடைகளை எதிர்கொண்டு AI பொருட்களை மேம்படுத்தி அனைவருக்கும் நன்மைகள் தரும் அனுபவங்களை உருவாக்க இது வாய்ப்பை உருவாக்குகிறது.
> [🎥 வீடியோவைப் பார்க்க இங்கே கிளிக் செய்யவும்: AI-யில் உள்ளடக்கம்](https://www.microsoft.com/videoplayer/embed/RE4vl9v)
> [🎥 சமவாய்மை பற்றிய காணொளிக்குச் செல்ல இங்கே கிளிக் செய்யவும்](https://www.microsoft.com/videoplayer/embed/RE4vl9v)
### பாதுகாப்பு மற்றும் தனியுரிமை
AI அமைப்புகள் பாதுகாப்பாகவும் மக்களின் தனியுரிமையை மதிக்கவும் இருக்க வேண்டும். தனியுரிமை, தகவல் அல்லது வாழ்க்கையை ஆபத்தில் ஆழ்த்தும் அமைப்புகளில் மக்கள் குறைவான நம்பிக்கையை கொண்டிருக்கிறார்கள். இயந்திரக் கற்றல் மாதிரிகளைப் பயிற்றுவிக்கும்போது, சிறந்த முடிவுகளை உருவாக்க தரவுகளை நம்புகிறோம். இதைச் செய்யும்போது, தரவின் மூலமும் முழுமையும் கருத்தில் கொள்ளப்பட வேண்டும். உதாரணமாக, தரவு பயனர் சமர்ப்பித்ததா அல்லது பொதுமக்களுக்கு கிடைக்குமா? அடுத்ததாக, தரவுடன் வேலை செய்யும் போது, AI அமைப்புகள் ரகசிய தகவல்களைப் பாதுகாக்கவும் மற்றும் தாக்குதல்களை எதிர்க்கவும் உருவாக்கப்பட வேண்டும். AI அதிகமாக பரவுவதால், தனியுரிமையைப் பாதுகாப்பதும் முக்கியமான தனிப்பட்ட மற்றும் வணிக தகவல்களைப் பாதுகாப்பதும் மிகவும் முக்கியமாகவும் சிக்கலாகவும் மாறுகிறது. AI-க்கு குறிப்பாக தரவினை அணுகுதல் அவசியம், ஏனெனில் AI அமைப்புகள் மக்களுக்கான துல்லியமான மற்றும் தகவலளிக்கப்பட்ட கணிப்புகள் மற்றும் முடிவுகளை எடுக்க தரவின் மீது நம்பிக்கையுடன் இருக்க வேண்டும்.
AI அமைப்புகள் பாதுகாப்பாகவும் மக்களின் தனியுரிமையை மதிப்பதாகவும் இருக்க வேண்டும். தனியுரிமை, தகவல் அல்லது வியாழ்கை பாதிப்புக்கு உள்ளாக்கும் அமைப்புகளில் மக்கள் குறைவான நம்பிக்கை கொண்டுள்ளனர். இயந்திர அறிதல் மாதிரிகளை பயிற்சி செய்யும் போது, சிறந்த முடிவுகளை வழங்க தரவை நம்புகிறோம். தரவின் மூலமும் நேர்மையும் கவனிக்கப்பட வேண்டும். எடுத்துக்காட்டு, தரவு பயனர் வழங்கியது என்பதா அல்லது பொதுவாகக் கிடைத்தது என்றோடு? அடுத்ததாக, தரவுடன் வேலை செய்வதில் ரகசிய தகவலை பாதுகாக்கும் மற்றும் தாக்குதல்களை எதிர்க்கும் AI அமைப்புகளை உருவாக்குவது அவசியம். AI அதிகரிக்கும் போது, தனியுரிமை மற்றும் முக்கிய தனிநபர் மற்றும் வணிகத் தகவலை பாதுகாப்பது முக்கியமும் சிக்கலானதும் ஆகிவிட்டது. தனியுரிமை மற்றும் தரவு பாதுகாப்பு பிரச்சனைகள் AI இல் அதிக கவனத்தை தேவைப்படுகிறது, ஏனெனில் தரவை அணுகுதல் AI அமைப்புகளுக்கு மனிதர்களைப் பற்றிய துல்லியமான மற்றும் அறிவுரைத்திறன் predictions அளிக்க தேவையானது.
> [🎥 வீடியோவைப் பார்க்க இங்கே கிளிக் செய்யவும்: AI-யில் பாதுகாப்பு](https://www.microsoft.com/videoplayer/embed/RE4voJF)
> [🎥 பாதுகாப்பு பற்றிய காணொளிக்குச் செல்ல இங்கே கிளிக் செய்யவும்](https://www.microsoft.com/videoplayer/embed/RE4voJF)
- தொழில்துறையில், GDPR போன்ற ஒழுங்குமுறைகளால் வழிநடத்தப்பட்டு தனியுரிமை மற்றும் பாதுகாப்பில் பெரிய முன்னேற்றங்கள் சம்பந்தப்பட்டுள்ளன.
- ஆனால் AI அமைப்புகளுடன், அவற்றை அதிக தனிப்பட்ட மற்றும் செயல்திறனுள்ள ஆக்க கடுமையான தனியுரிமை இடைபிரச்சினை உள்ளது.
- இணையதள இணைந்த கணினிகள் பிறப்போடு போலவே, AI தொடர்பான பாதுகாப்பு பிரச்சனைகளும் பெருகிக் கொண்டு உள்ளது.
- அதே சமயம் AI பாதுகாப்பை மேம்படுத்த பயன்படுத்தப்படுகின்றது. உதாரணமாக, நவீன அன்டி வைரஸ் கண்காணிப்பாளர்கள் இன்று AI heuristic கள் மூலம் இயங்குகின்றன.
- எங்கள் தரவியல் செயல்முறை சமீபத்திய தனியுரிமை மற்றும் பாதுகாப்பு நடைமுறைகளுடன் ஒத்திசைக்கப்பட்டிருக்க வேண்டும்.
- தொழில்துறையாக, GDPR (General Data Protection Regulation) போன்ற விதிமுறைகளால் ஊக்குவிக்கப்பட்டு, தனியுரிமை மற்றும் பாதுகாப்பில் முக்கிய முன்னேற்றங்களை நாம் செய்துள்ளோம்.
- ஆனால் AI அமைப்புகளுடன், அமைப்புகளை மேலும் தனிப்பட்ட மற்றும் செயல்திறனுடையதாக மாற்ற தனிப்பட்ட தரவின் தேவையை மற்றும் தனியுரிமையை நாம் ஏற்றுக்கொள்ள வேண்டும்.
- இணையத்துடன் இணைக்கப்பட்ட கணினிகள் உருவாகிய பிறப்புடன், AI தொடர்பான பாதுகாப்பு பிரச்சினைகளின் எண்ணிக்கையில் பெரும் உயர்வு ஏற்பட்டுள்ளது.
- அதே நேரத்தில், பாதுகாப்பை மேம்படுத்த AI பயன்படுத்தப்பட்டுள்ளதை நாம் பார்த்துள்ளோம். உதாரணமாக, பெரும்பாலான நவீன வைரஸ் எதிர்ப்பு ஸ்கேனர் இன்று AI ஹியூரிஸ்டிக்ஸ் மூலம் இயக்கப்படுகின்றன.
- தரவியல் விஞ்ஞான செயல்முறைகள் சமீபத்திய தனியுரிமை மற்றும் பாதுகாப்பு நடைமுறைகளுடன் ஒத்திசைவாக கலக்கப்படுவதை நாம் உறுதிப்படுத்த வேண்டும்.
### வெளிப்படைத்தன்மை
AI அமைப்புகள் புரிந்துகொள்ள வழிமுறையாக இருக்க வேண்டும். வெளிப்படையான தன்மையின் முக்கிய பகுதியாக AI அமைப்புகளின் நடத்தை மற்றும் கூறுகளை விளக்க வேண்டும். AI அமைப்புகளை மேம்படுத்த stakeholders எவ்வாறு மற்றும் ஏன் இயங்குகின்றன என்பதைக் புரிந்து கொள்ள வேண்டும், மேலும் செயல்திறன் பிரச்சனைகள், பாதுகாப்பு மற்றும் தனியுரிமைக் கவலைகள், பாகுபாடு, நீக்கம் நடைமுறைகள் அல்லது எதிர்பாராத முடிவுகளை கண்டறிய வேண்டும். AI அமைப்புகளைப் பயன்படுத்துவோர் எப்போது, எப்போது ஏன், எப்படி பயன்படுத்துகிறார்கள் என்பதில் நேர்மையாக இருக்க வேண்டும். பயன்படுத்தும் அமைப்புகளின் வரம்புகளையும் மீறாது விளக்க வேண்டும். உதாரணமாக, வங்கி AI அமைப்பை விருப்ப கடன் முடிவுகள் ஆதரிக்க பயன்படுத்தினால், முடிவுகளை ஆய்வு செய்து எந்த தரவு பரிந்துரைகளை பாதிக்கிறது எனப் புரிந்து கொள்வது அவசியம். அரசு தொழில்களில் AI ஐ ஒழுங்குபடுத்த ஆரம்பித்துள்ளது; ஆகையால் டேட்டா அறிவியலாளர்களும் நிறுவனங்களும் AI அமைப்புகள் விதி கடைப்பிடிப்பைப் பூர்த்தி செய்கிறதா என்று விளக்க வேண்டும், குறிப்பாக தீய முடிவுகள் இருந்தால்.
> [🎥 வெளிப்படைத்தன்மை பற்றிய காணொளிக்குச் செல்ல இங்கே கிளிக் செய்யவும்](https://www.microsoft.com/videoplayer/embed/RE4voJF)
- AI அமைப்புகள் மிகவும் சிக்கலானவை என்பதனால் அவை எப்படி இயங்குகின்றன என புரிந்து கொள்ளவும் முடிவுகளை விவரிக்கவும் கடினம்.
- இந்த புரிதல் இல்லாத தன்மை பின்வரும் பணிக்கு பாதிப்பை உண்டாக்குகின்றது: நன்கு நிர்வகிக்க, செயல்படுத்தவும், ஆவணப்படுத்தவும்.
- இதேபோல், இந்த புரிதல் இல்லாத தன்மை AI அமைப்புகள் உருவாக்கும் முடிவுகளை பயன்படுத்தி எடுக்கப்படும் முடிவுகளின் மீது மிகப்பெரும் தாக்கம் செலுத்துகிறது.
### பொறுப்புக்கூறல்
AI அமைப்புகளை வடிவமைத்து வெளியிடும் நபர்கள் அவற்றின் செயல்பாடுகளுக்குப் பொறுப்பேற்க வேண்டும். முகம் அடையாளம் போல் பொறுப்புக்கூறல் மிகவும் அவசியம். சமீபத்தில், முகம் அடையாள தொழில்நுட்பத்திற்கு வருகையாளர்களிடமிருந்து அதிகத்தலைவாக கோரிக்கை ஏற்பட்டுள்ளது, குறிப்பாக பறந்துபோன பிள்ளைகளை கண்டுபிடிக்க போலீஸ் அமைப்புகள் இதை பயன்படுத்துகின்றன. ஆனால் இந்த தொழில்நுட்பம் அரசு அதன் குடிமக்களின் அடிப்படையான சுதந்திரங்களை இழுக்க செய்ய பயன்படுத்தப்படலாம், உதாரணமாக குறிப்பிட்ட நபர்களின் தொடர்ச்சியான கண்காணிப்பை இயல்புறுத்தல். இதனால் தரவியல் அறிவியலாளர்கள் மற்றும் நிறுவனங்கள் AI அமைப்பு நபர்களுக்கு அல்லது சமுதாயத்திற்கு ஏற்பும் தாக்கங்களை பொறுப்பாக ஏற்றுக்கொள்ள வேண்டும்.
[![முகம் அடையாளத்தின் மூலம் பொதுக்கண்காணிப்புக்கு எச்சரிக்கை அளிக்கும் தலைமை AI ஆராய்ச்சியாளர்](../../../../translated_images/ta/accountability.41d8c0f4b85b6231.webp)](https://www.youtube.com/watch?v=Wldt8P5V6D0 "Microsoft இன் பொறுப்புள்ள AI அணுகுமுறை")
> 🎥 மேலுள்ள படத்தில் கிளிக் செய்து காணொளியை பாருங்கள்: முகம் அடையாளத்தின் மூலம் பொதுக்கண்காணிப்பு எச்சரிக்கை
முற்றிலும், AI சமுதாயத்திற்கு கொண்டு வரும் முதல் தலைமுறையாக நாங்கள், கணினிகள் மக்களுக்கு பொறுப்பாயிருப்பதை எவ்வாறு உறுதி செய்வது மற்றும் கணினிகள் வடிவமைக்கும் மக்கள் மற்ற அனைவருக்கும் பொறுப்பாயிருப்பதை எவ்வாறு உறுதி செய்வது என்பது பெரிய கேள்வி ஆகும்.
## தாக்கம் மதிப்பீடு
இயந்திர அறிதல் மாதிரியை பயிற்சி செய்ய முன்னர், AI அமைப்பின் நோக்கம் என்ன என்பதை புரிந்து கொண்டு, உபயோக நோக்கம்; எங்கு அதன் செயல்பாடு; யார் அமைப்புடன் தொடர்பு கொள்ளும் என்பதை அறிந்து ஒரு தாக்கம் மதிப்பீடு செய்ய வேண்டும். இது சோதனை அல்லது மதிப்பீடு செய்யும் நபர்களுக்கு அமைப்பின் பாதிப்பு காரணிகள் மற்றும் எதிர்பார்க்கப்படும் விளைவுகளை அறிந்து எளிதாக்கும்.
தாக்கம் மதிப்பீடு செய்யும்போது கவனம் செலுத்த வேண்டிய பகுதிகள்:
* **நபர்களுக்கு எதிர்மறையான தாக்கம்**. எந்தவொரு கட்டுப்பாடுகள், தேவைகள், ஆதரிக்கப்படாத பயன்பாடு அல்லது அறியப்பட்ட வரம்புகள் அமைப்பின் செயல்திறனை பாதிப்பவை இருக்கலாம் என்ற அறிவு முக்கியம், அது நபர்களுக்கு தீங்கு விளைவிப்பதைத் தடுக்கும்.
* **தரவு தேவைகள்**. அமைப்பு தரவை எப்படி எங்கு பயன்படுத்தும் என்பதில் புரிதலை உருவாக்குவது, மேம்படுத்துனர்கள் தரவு தேவைகளை (உதா., GDPR அல்லது HIPAA தரவு விதிகள்) கவனத்தில் கொள்ள உதவும். மேலும், தரவு மூலமும் அளவும் பயிற்சிக்க மோசமாக இருக்குமா என ஆராய்க.
* **தாக்கம் சுருக்கம்**. அமைப்பினைப் பயன்படுத்தி வரும் சாத்தியமான தீங்குகளின் பட்டியலை சேகரிக்கவும். முழு ML வாழ்நாள் நிலத்தில், இவை சரிசெய்யப்பட்டதா அல்லது நிர்வகிக்கப்பட்டதா என பரிசீலனை செய்யவும்.
* **ஆறு முக்கியக் கொள்கைகளுக்கு பொருந்தக்கூடிய குறிக்கோள்கள்**. ஒவ்வொரு கொள்கை குறிக்கோளும் பூர்த்தியாயிற்றா? இடைவெளிகள் உள்ளனவா? என மதிப்பிடவும்.
AI அமைப்புகள் புரிந்துகொள்ளக்கூடியதாக இருக்க வேண்டும். வெளிப்படைத்தன்மையின் முக்கியமான பகுதி AI அமைப்புகள் மற்றும் அவற்றின் கூறுகளின் நடத்தை விளக்குவதில் உள்ளது. AI அமைப்புகளைப் புரிந்துகொள்ளும் திறனை மேம்படுத்த, பங்குதாரர்கள் அவை எவ்வாறு மற்றும் ஏன் செயல்படுகின்றன என்பதைப் புரிந்துகொள்ள வேண்டும், இதனால் செயல்திறன் பிரச்சினைகள், பாதுகாப்பு மற்றும் தனியுரிமை கவலைகள், பாகுபாடுகள், விலக்கப்பட்ட நடைமுறைகள் அல்லது எதிர்பாராத விளைவுகளை அடையாளம் காண முடியும். AI அமைப்புகளைப் பயன்படுத்தும்வர்கள் அவற்றை எப்போது, ஏன், எப்படி பயன்படுத்த முடிவு செய்கிறார்கள் என்பதைப் பற்றியும், அவர்கள் பயன்படுத்தும் அமைப்புகளின் வரம்புகளைப் பற்றியும் நேர்மையாகவும் வெளிப்படையாகவும் இருக்க வேண்டும் என்று நாங்கள் நம்புகிறோம். உதாரணமாக, ஒரு வங்கி அதன் நுகர்வோர் கடன் முடிவுகளை ஆதரிக்க AI அமைப்பை பயன்படுத்தினால், முடிவுகளைப் பரிசீலிக்கவும் மற்றும் அமைப்பின் பரிந்துரைகளை எந்த தரவுகள் பாதிக்கின்றன என்பதைப் புரிந்துகொள்ளவும் முக்கியம். அரசாங்கங்கள் தொழில்துறைகளில் AI-யை ஒழுங்குபடுத்தத் தொடங்குகின்றன, எனவே தரவியல் விஞ்ஞானிகள் மற்றும் அமைப்புகள் AI அமைப்பு ஒழுங்குமுறை தேவைகளை பூர்த்தி செய்கிறதா என்பதை விளக்க வேண்டும், குறிப்பாக விரும்பத்தகாத முடிவு ஏற்பட்டால்.
> [🎥 வீடியோவைப் பார்க்க இங்கே கிளிக் செய்யவும்: AI-யில் வெளிப்படைத்தன்மை](https://www.microsoft.com/videoplayer/embed/RE4voJF)
## பொறுப்புள்ள AI உடன் பிழைதிருத்தல்
- AI அமைப்புகள் மிகவும் சிக்கலானவை என்பதால், அவை எவ்வாறு செயல்படுகின்றன மற்றும் முடிவுகளை விளக்குவது கடினமாக உள்ளது.
- இந்த புரிதலின்欠பாடு, இந்த அமைப்புகள் எவ்வாறு நிர்வகிக்கப்படுகின்றன, செயல்படுத்தப்படுகின்றன மற்றும் ஆவணப்படுத்தப்படுகின்றன என்பதை பாதிக்கிறது.
- மேலும் முக்கியமாக, இந்த அமைப்புகள் உருவாக்கும் முடிவுகளைப் பயன்படுத்தி எடுக்கப்படும் முடிவுகளை இந்த欠பாடு பாதிக்கிறது.
மென்பொருள் பயன்பாட்டைப் போல, AI அமைப்புகளுக்கான பிழைதிருத்தலும் அவற்றின் பிரச்சனைகளை கண்டறிந்து தீர்ப்பது அவசியம். மாதிரி எதிர்பார்த்தது போல செயல்படவில்லையெனில் பல காரணிகள் இருக்கலாம். பெரும்பான்மையான மரபு மாதிரி செயல்திறன் கணக்கீடுகள் மாதிரியின் செயல்திறன் அளவுகளின் எண் தொகுப்புகள் மட்டுமே ஆகும்; இவை AI பொறுப்பாக்க கொள்கைகளை மீறுது என்பதை ஆராய்வதற்கு போதுமானதல்ல. மேலும், இயந்திர அறிதல் மாதிரி ஒரு இரகசியப் பெட்டியாக இருக்கின்றது, அதனால் அதன் முடிவை தெளிவாக உணர்வது அல்லது பிழை செய்தால் விளக்குவது கடினமாகும். இந்த பாடத்திட்டத்தில் பின்னர், பொறுப்புள்ள AI டாஷ் போர்டு பயன்படுத்தி AI அமைப்புகளை பிழைதிருத்துவது கற்றுக்கொள்வோம். டாஷ்போர்டு ஒரு ஒருங்கிணைந்த கருவி, தரவியலாளர்கள் மற்றும் AI உருவாக்குநர்களுக்காக பின்வரும் பணிகளை செய்ய உதவுகிறது:
### பொறுப்புணர்வு
* **பிழை பகுப்பு**. அமைப்பில் நீதித்தன்மை அல்லது நம்பகத்தன்மைக்கு பாதிப்பூட்டும் பிழை பகிர்வு கண்டறிதல்.
* **மாதிரி பார்வை**. தரவு குழுக்களில் மாதிரி செயல்திறனில் உள்ள வேறுபாடுகளை கண்டறிதல்.
* **தரவு பகுப்பு**. தரவு பகிர்வு புரிந்துகொள்ளல் மற்றும் நீதித்தன்மை, சமவாய்மை மற்றும் நம்பகத்தன்மை பிரச்சனைகளுக்கு காரணமான பாகுபாடுகளை கண்டறிதல்.
* **மாதிரி விளக்கம்**. மாதிரியில் எது அதன் தீர்வுகளை பாதிக்கிறது என்பதைக் புரிந்து கொள்ளுதல். இது வெளிப்படைத்தன்மைக்கும் பொறுப்புக்கூறலுக்கும் முக்கியம்.
AI அமைப்புகளை வடிவமைக்கும் மற்றும் செயல்படுத்தும் மக்கள், அவர்களின் அமைப்புகள் எவ்வாறு செயல்படுகின்றன என்பதற்கான பொறுப்பை ஏற்க வேண்டும். முகம் அடையாளம் காணும் போன்ற நுண்ணறிவு தொழில்நுட்பங்களுடன் பொறுப்புணர்வு மிகவும் முக்கியமானது. சமீபத்தில், முகம் அடையாளம் காணும் தொழில்நுட்பத்திற்கான தேவை அதிகரித்துள்ளது, குறிப்பாக காணாமல் போன குழந்தைகளை கண்டறிதல் போன்ற பயன்பாடுகளில் தொழில்நுட்பத்தின் சாத்தியத்தைப் பார்க்கும் சட்ட அமலாக்க அமைப்புகளிடமிருந்து. இருப்பினும், இந்த தொழில்நுட்பங்கள் ஒரு அரசாங்கத்தால் அதன் குடிமக்களின் அடிப்படை சுதந்திரங்களை ஆபத்தில் ஆழ்த்துவதற்காக, உதாரணமாக, குறிப்பிட்ட நபர்களின் தொடர்ச்சியான கண்காணிப்பை இயக்குவதற்காக பயன்படுத்தப்படலாம். எனவே, AI அமைப்பு தனிநபர்கள் அல்லது சமுதாயத்தை எவ்வாறு பாதிக்கிறது என்பதற்கான பொறுப்பை தரவியல் விஞ்ஞானிகள் மற்றும் அமைப்புகள் ஏற்க வேண்டும்.
[![Leading AI Researcher Warns of Mass Surveillance Through Facial Recognition](../../../../translated_images/ta/accountability.41d8c0f4b85b6231.webp)](https://www.youtube.com/watch?v=Wldt8P5V6D0 "Microsoft's Approach to Responsible AI")
## 🚀 சவால்
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து வீடியோவைப் பாருங்கள்: முகம் அடையாளம் காணுதல் மூலம் பெருமளவு கண்காணிப்பு பற்றிய எச்சரிக்கை
தீங்கு ஏற்படுத்தப்படுவதை தடுக்க நாம் செய்ய வேண்டும்:
இயந்திரக் கற்றல் மற்றும் AI-யை சமுதாயத்திற்கு கொண்டு வருகிற முதல் தலைமுறையாகிய நம் தலைமுறைக்கான மிகப்பெரிய கேள்விகளில் ஒன்று, கணினிகள் மக்களுக்கு பொறுப்பானதாக இருக்க வேண்டும் என்பதை எப்படி உறுதிப்படுத்துவது மற்றும் கணினிகளை வடிவமைக்கும் மக்கள் மற்றவர்களுக்கு பொறுப்பானவர்களாக இருக்க வேண்டும் என்பதை எப்படி உறுதிப்படுத்துவது என்பதாகும்.
- அமைப்புகளை உருவாக்கும் மக்கள் பல்வேறு பின்னணி மற்றும் பார்வைகளைக் கொண்டிருக்க வேண்டும்
- எமது சமுதாயத்தின் பல்வேறு தரவுத்தொகுப்புகளில் முதலீடு செய்ய வேண்டும்
- பொறுப்புள்ள AI ஏற்பட்டால் அதை கண்டறிந்து சரி செய்ய இயந்திர அறிதல் வாழ்நாளில் சிறந்த முறைகளை மேம்படுத்த வேண்டும்
## தாக்க மதிப்பீடு
மாதிரியை உருவாக்கும் மற்றும் பயன்படுத்தும் போது அதன் நம்பிக்கையற்ற தன்மை உணரக்கூடிய நிலைமைகள் பற்றி யோசியுங்கள். மேலும் என்ன கவனிக்கப்பட வேண்டும்?
இயந்திரக் கற்றல் மாதிரியைப் பயிற்றுவிக்கும்முன், AI அமைப்பின் நோக்கம், அதன் திட்டமிடப்பட்ட பயன்பாடு, அது எங்கு பயன்படுத்தப்படும், மற்றும் அமைப்புடன் யார் தொடர்பு கொள்ளப் போகிறார்கள் என்பதைப் புரிந்து கொள்ள தாக்க மதிப்பீட்டை நடத்துவது முக்கியம். இது அமைப்பை மதிப்பீடு செய்யும் மதிப்பீட்டாளர்(கள்) அல்லது சோதனையாளர்களுக்கு, சாத்தியமான ஆபத்துகள் மற்றும் எதிர்பார்க்கப்படும் விளைவுகளை அடையாளம் காணும்போது எந்த காரணிகளை கருத்தில் கொள்ள வேண்டும் என்பதை அறிய உதவுகிறது.
## [பிறகு-பாடம் வினாடிக்குறிப்பு](https://ff-quizzes.netlify.app/en/ml/)
தாக்க மதிப்பீட்டை நடத்தும்போது கவனம் செலுத்த வேண்டிய பகுதிகள் பின்வருமாறு:
## மீளாய்வு & சுயநிலை கற்றல்
* **தனிநபர்களுக்கு எதிர்மறை தாக்கம்**: அமைப்பின் செயல்திறனைத் தடுக்கும் எந்தவொரு கட்டுப்பாடு அல்லது தேவைகள், ஆதரிக்கப்படாத பயன்பாடு அல்லது அறியப்பட்ட வரம்புகள் பற்றிய விழிப்புணர்வுடன் இருக்க வேண்டும்.
* **தரவு தேவைகள்**: அமைப்பு தரவுகளை எவ்வாறு மற்றும் எங்கு பயன்படுத்தும் என்பதைப் புரிந்துகொள்வது, நீங்கள் கவனமாக இருக்க வேண்டிய எந்த தரவுத் தேவைகளை (எ.கா., GDPR அல்லது HIPPA தரவுத் விதிமுறைகள்) ஆராய்வதற்கு மதிப்பீட்டாளர்களுக்கு உதவுகிறது. மேலும், பயிற்சிக்கான தரவின் மூல அல்லது அளவு போதுமானதா என்பதைப் பரிசீலிக்கவும்.
* **தாக்கத்தின் சுருக்கம்**: அமைப்பைப் பயன்படுத்துவதால் ஏற்படக்கூடிய சாத்தியமான பாதிப்புகளின் பட்டியலைச் சேகரிக்கவும். ML வாழ்க்கைச் சுழற்சியின் முழு காலத்திலும், அடையாளம் காணப்பட்ட பிரச்சினைகள் குறைக்கப்பட்டதா அல்லது தீர்க்கப்பட்டதா என்பதை மதிப்பீடு செய்யவும்.
* **ஆரம்ப
## மதிப்பீடு மற்றும் சுயபயிற்சி
இந்த பாடத்தில், இயந்திரக் கற்றலில் நியாயம் மற்றும் அநியாயம் பற்றிய அடிப்படைகளை நீங்கள் கற்றுக்கொண்டீர்கள்.
இந்த படிப்பில், நீங்கள் இயந்திரக் கற்றலில் நியாயமாகத் தன்மையும் அவநியாயமாகத் தன்மையும் பற்றிய சில அடிப்படைக் கருத்துக்களை கற்றுக்கொண்டிருக்கிறீர்கள்.
இந்த தலைப்புகளை மேலும் ஆழமாகப் புரிந்துகொள்ள இந்த வேலைகளைக் காணுங்கள்:
இந்த கருத்துக்களில் ஆழமாக சென்று பதிவு செய்ய, இந்த பணிமனை காணுங்கள்:
- பொறுப்பான AI-யை நோக்கி: கொள்கைகளை நடைமுறைக்கு கொண்டு வருவது - Besmira Nushi, Mehrnoosh Sameki மற்றும் Amit Sharma
- பொறுப்பான AI நோக்கில்: 원칙ங்களை நடைமுறையில் கொண்டு வருதல், Besmira Nushi, Mehrnoosh Sameki மற்றும் Amit Sharma இணைக்கையில்
[![பொறுப்பான AI Toolbox: பொறுப்பான AI உருவாக்குவதற்கான ஓர் திறந்த மூல அமைப்பு](https://img.youtube.com/vi/tGgJCrA-MZU/0.jpg)](https://www.youtube.com/watch?v=tGgJCrA-MZU "RAI Toolbox: பொறுப்பான AI உருவாக்குவதற்கான ஓர் திறந்த மூல அமைப்பு")
[![Responsible AI Toolbox: An open-source framework for building responsible AI](https://img.youtube.com/vi/tGgJCrA-MZU/0.jpg)](https://www.youtube.com/watch?v=tGgJCrA-MZU "RAI Toolbox: An open-source framework for building responsible AI")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்யவும்: RAI Toolbox: Besmira Nushi, Mehrnoosh Sameki மற்றும் Amit Sharma ஆகியோரின் பொறுப்பான AI உருவாக்குவதற்கான ஓர் திறந்த மூல அமைப்பு
> 🎥 மேலே உள்ள படமாக்குக்குக் கிளிக் செய்து காணொளியைப் பாருங்கள்: பொறுப்பான AI டூல்பாக்ஸ்: Besmira Nushi, Mehrnoosh Sameki, மற்றும் Amit Sharma ஆட்களால் உருவாக்கப்பட்ட ஓர் திறந்த மூலக் கட்டமைப்பு
மேலும் படிக்க:
மேலும், வாசிக்கவும்:
- Microsoft-இன் RAI வள மையம்: [பொறுப்பான AI வளங்கள் Microsoft AI](https://www.microsoft.com/ai/responsible-ai-resources?activetab=pivot1%3aprimaryr4)
- மைக்ரோசாஃப்ட் RAI வளக்கழகம்: [Responsible AI Resources Microsoft AI](https://www.microsoft.com/ai/responsible-ai-resources?activetab=pivot1%3aprimaryr4)
- Microsoft-இன் FATE ஆராய்ச்சி குழு: [FATE: AI-யில் நியாயம், பொறுப்புணர்வு, வெளிப்படைத்தன்மை மற்றும் நெறிமுறை - Microsoft Research](https://www.microsoft.com/research/theme/fate/)
- மைக்ரோசாஃப்ட் FATE ஆராய்ச்சி குழு: [FATE: Fairness, Accountability, Transparency, and Ethics in AI - Microsoft Research](https://www.microsoft.com/research/theme/fate/)
RAI Toolbox:
RAI டூல்பாக்ஸ்:
- [Responsible AI Toolbox GitHub repository](https://github.com/microsoft/responsible-ai-toolbox)
Azure Machine Learning-இன் நியாயத்தை உறுதிப்படுத்தும் கருவிகள் பற்றி படிக்க:
Azure இயந்திரக் கற்றல் நியாயத்தினை உறுதி செய்யும் கருவிகள் பற்றி வாசிக்கவும்:
- [Azure Machine Learning](https://docs.microsoft.com/azure/machine-learning/concept-fairness-ml?WT.mc_id=academic-77952-leestott)
## பணிக்கூற்று
## பணிக
[RAI Toolbox-ஐ ஆராயுங்கள்](assignment.md)
[RAI டூல்பாக்ஸை ஆய்வு செய்யவும்](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கின்றோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளுங்கள். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,120 +1,121 @@
# Python மற்றும் Scikit-learn மூலம் Regression மாடல்களை உருவாக்க தொடங்குங்கள
# Python மற்றும் Scikit-learn இல் regression மாதிரிகளுடன் தொடங்குதல
![Regression மாடல்களின் சுருக்கம் sketchnote வடிவில்](../../../../translated_images/ta/ml-regression.4e4f70e3b3ed446e.webp)
![sketchnote இல் regressions சுருக்கம்](../../../../translated_images/ta/ml-regression.4e4f70e3b3ed446e.webp)
> Sketchnote: [Tomomi Imura](https://www.twitter.com/girlie_mac)
> [Tomomi Imura](https://www.twitter.com/girlie_mac) அவர்களின் ஸ்கெட்ச் நோட்
## [முன்-பாடம் வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [முன்னணி வகுப்புக்கான வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
> ### [இந்த பாடம் R-ல் கிடைக்கிறது!](../../../../2-Regression/1-Tools/solution/R/lesson_1.html)
> ### [இந்த பாடம் R உள்ளடக்கத்தில் உள்ளது!](../../../../2-Regression/1-Tools/solution/R/lesson_1.html)
## அறிமுகம்
இந்த நான்கு பாடங்களில், நீங்கள் regression மாடல்களை உருவாக்குவது எப்படி என்பதை அறிந்து கொள்ளுவீர்கள். இவை எதற்காக பயன்படுத்தப்படுகின்றன என்பதை விரைவில் விவாதிக்கப் போகிறோம். ஆனால், நீங்கள் ஏதேனும் செய்யும் முன், சரியான கருவிகளை அமைத்துக் கொள்ளுங்கள்!
இந்த நான்கு பாடங்களில், நீங்கள் regression மாதிரிகள் எவ்வாறு உருவாக்கப்படுகின்றன என்பதை அறிந்துகொள்ளப்போகிறீர்கள். இவற்றின் பயன்பாடு யாது என்பது விரைவில் விவாதிக்கப்படும். ஆனாலும் உங்கள் செயல்முறை தொடங்குவதற்கு முன் சரியான கருவிகள் உங்களிடம் இருக்கின்றனவா என்பதை உறுதிசெய்யுங்கள்!
இந்த பாடத்தில், நீங்கள் கற்றுக்கொள்ளப் போவது:
இந்த பாடத்தில் நீங்கள் கற்றுக்கொள்ளப்போகிர்கள்:
- உங்கள் கணினியை உள்ளூர் machine learning பணிகளுக்கு அமைத்தல்.
- Jupyter notebooks-ஐப் பயன்படுத்துதல்.
- Scikit-learn-ஐ நிறுவல் உட்பட பயன்படுத்துதல்.
- Linear regression-ஐ ஒரு செயல்முறை பயிற்சியுடன் ஆராய்தல்.
- உள்ளூர் கணினி கற்றல் பணிகளுக்கு உங்கள் கணினியை அமைத்தல்.
- Jupyter Notebooks- உடன் பணியாற்றல்.
- Scikit-learn ஐ பயன்படுத்துதல், நிறுவலுடன் சேர்த்து.
- நடைமுறைப் பயிற்சியுடன் கூட linear regression ஐ ஆராய்தல்.
## நிறுவல் மற்றும் அமைப்புகள்
## நிறுவல்கள் மற்றும் அமைப்புகள்
[![ML ஆரம்பம் - Machine Learning மாடல்களை உருவாக்க உங்கள் கருவிகளை அமைத்தல்](https://img.youtube.com/vi/-DfeD2k2Kj0/0.jpg)](https://youtu.be/-DfeD2k2Kj0 "ML ஆரம்பம் - Machine Learning மாடல்களை உருவாக்க உங்கள் கருவிகளை அமைத்தல்")
[![ஆரம்பக்கார ML பயனாளிகளுக்கு - உங்கள் கருவிகளை தயார் செய்து மெஷின் கற்றல் மாதிரிகள் உருவாக்குதல்](https://img.youtube.com/vi/-DfeD2k2Kj0/0.jpg)](https://youtu.be/-DfeD2k2Kj0 "ஆரம்பக்கார ML பயனாளிகளுக்கு - உங்கள் கருவிகளை தயார் செய்து மெஷின் கற்றல் மாதிரிகள் உருவாக்குதல்")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து ML அமைப்புகளை அமைப்பதற்கான குறுகிய வீடியோவைப் பாருங்கள்.
> 🎥 மேலுள்ள படத்தை கிளிக் செய்து, ML ன் கீழ் கணினி அமைப்பை அமைப்பதற்கான சுருக்க வீடியோவை பார்க்கவும்.
1. **Python-ஐ நிறுவுங்கள்**. [Python](https://www.python.org/downloads/) உங்கள் கணினியில் நிறுவப்பட்டுள்ளதா என்பதை உறுதிப்படுத்துங்கள். Python பல தரவியல் அறிவியல் மற்றும் machine learning பணிகளுக்கு பயன்படுத்தப்படும். பெரும்பாலான கணினி அமைப்புகளில் Python ஏற்கனவே நிறுவப்பட்டிருக்கும். [Python Coding Packs](https://code.visualstudio.com/learn/educators/installers?WT.mc_id=academic-77952-leestott) போன்றவை சில பயனர்களுக்கு அமைப்பை எளிதாக்க உதவுகின்றன.
1. **Python ஐ நிறுவுக**. உங்கள் கணினியில் [Python](https://www.python.org/downloads/) நிறுவப்பட்டுள்ளது என்பதை உறுதிசெய்யுங்கள். பல தரவு அறிவியல் மற்றும் மெஷின் கற்றல் பணிகளுக்கு Python பயன்படுத்தப்படுகிறது. பெரும்பாலான கணினி செயல்பாட்டு அமைப்புகளில் Python ஏற்கனவே நிறுவப்பட்டுள்ளது. சில பயன்களுக்காக, அமைப்பை எளிதாக்கும் [Python Coding Packs](https://code.visualstudio.com/learn/educators/installers?WT.mc_id=academic-77952-leestott) கூட கிடைக்கின்றன.
Python-ஐப் பயன்படுத்தும் சில பயன்பாடுகள் ஒரு பதிப்பை தேவைப்படுத்தும், மற்றவை வேறு பதிப்பை தேவைப்படுத்தும். இதனால், [virtual environment](https://docs.python.org/3/library/venv.html) பயன்படுத்துவது பயனுள்ளதாக இரக்கும்.
ஆனால் Python ன் சில பயன்பாடுகள் ஒரே பதிப்பைத் தேவைப்படுத்தும், மற்றவை வேறு பதிப்பை வேண்டலாம். அதனால் [virtual environment](https://docs.python.org/3/library/venv.html) பயன்படுத்துவது பயனுள்ளது.
2. **Visual Studio Code-ஐ நிறுவுங்கள்**. Visual Studio Code உங்கள் கணினியில் நிறுவப்பட்டுள்ளதா என்பதை உறுதிப்படுத்துங்கள். [Visual Studio Code-ஐ நிறுவ](https://code.visualstudio.com/) இந்த வழிமுறைகளைப் பின்பற்றுங்கள். இந்த பாடத்தில் Python-ஐ Visual Studio Code-ல் பயன்படுத்தப் போகிறீர்கள், எனவே Python மேம்பாட்டுக்கான [Visual Studio Code-ஐ அமைப்பது](https://docs.microsoft.com/learn/modules/python-install-vscode?WT.mc_id=academic-77952-leestott) எப்படி என்பதைப் புரிந்துகொள்ளுங்கள்.
2. **Visual Studio Code ஐ நிறுவுக**. உங்கள் கணினியில் Visual Studio Code நிறுவப்பட்டுள்ளதா என உறுதிசெய்யவும். அடிப்படையான நிறுவலுக்கு [Visual Studio Code ஐ நிறுவும்](https://code.visualstudio.com/) படிகள் பின்பற்றவும். இந்த பாடத்தில் நீங்கள் Visual Studio Code இல் Python பயன்படுத்தப்போகின்றீர்கள், எனவே Python அபிவிருத்திக்கான [Visual Studio Code அமைப்புகள்](https://docs.microsoft.com/learn/modules/python-install-vscode?WT.mc_id=academic-77952-leestott) பற்றியும் தெரிந்து கொள்வது நல்லது.
> Python-ஐப் பயன்படுத்துவதில் நன்கு பழக [Learn modules](https://docs.microsoft.com/users/jenlooper-2911/collections/mp1pagggd5qrq7?WT.mc_id=academic-77952-leestott) தொகுப்பைச் சோதிக்கவும்.
> Python உடன் பழக [Learn modules](https://docs.microsoft.com/users/jenlooper-2911/collections/mp1pagggd5qrq7?WT.mc_id=academic-77952-leestott) தொகுப்பைப் பயன்படுத்துங்கள்.
>
> [![Visual Studio Code-இல் Python அமைப்பது](https://img.youtube.com/vi/yyQM70vi7V8/0.jpg)](https://youtu.be/yyQM70vi7V8 "Visual Studio Code-இல் Python அமைப்பது")
> [![Visual Studio Code உடன் Python அமைப்பு](https://img.youtube.com/vi/yyQM70vi7V8/0.jpg)](https://youtu.be/yyQM70vi7V8 "Visual Studio Code உடன் Python அமைப்பு")
>
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து Python-ஐ VS Code-இல் பயன்படுத்துவது பற்றிய வீடியோவைப் பாருங்கள்.
> 🎥 மேலுள்ள படத்தை கிளிக் செய்து VS Code இல் Python பயன்படுத்தும் வீடியோவை காணவும்.
3. **Scikit-learn-ஐ நிறுவுங்கள்**, [இந்த வழிமுறைகளை](https://scikit-learn.org/stable/install.html) பின்பற்றுங்கள். Python 3-ஐ பயன்படுத்த வேண்டும் என்பதால், virtual environment-ஐ பயன்படுத்த பரிந்துரைக்கப்படுகிறது. குறிப்பாக, M1 Mac-ல் இந்த நூலகத்தை நிறுவுவதற்கு, மேலே இணைக்கப்பட்டுள்ள பக்கத்தில் சிறப்பு வழிமுறைகள் உள்ளன.
3. **Scikit-learn ஐ நிறுவுக**, [இந்தக் கட்டளைகள்](https://scikit-learn.org/stable/install.html) வழிமுறைகளை பின்பற்றி. Python 3 ஐப் பயன்படுத்தியிருப்பது அவசியம், அதனால் virtual environment பயன்படுத்துவதே நல்லது. குறிப்பாக M1 Mac இல் நிறுவும் போது மேலுள்ள பக்கத்தில் குறிப்பிட்டுள்ள தனித்துவமான வழிமுறைகள் உள்ளன.
4. **Jupyter Notebook-ஐ நிறுவுங்கள்**. [Jupyter package](https://pypi.org/project/jupyter/) ஐ நிறுவ வேண்டும்.
1. **Jupyter Notebook ஐ நிறுவுக**. [Jupyter தொகுப்பை நிறுவ](https://pypi.org/project/jupyter/) வேண்டும்.
## உங்கள் ML எழுத்து சூழல்
## உங்கள் ML எழுத்துப்படைமை
Python குறியீடுகளை உருவாக்கவும் machine learning மாடல்களை உருவாக்கவும் நீங்கள் **notebooks**-ஐப் பயன்படுத்தப் போகிறீர்கள். இந்த வகை கோப்பு தரவியல் விஞ்ஞானிகளுக்கு பொதுவான கருவியாகும், மேலும் அவற்றை `.ipynb` என்ற suffix அல்லது extension மூலம் அடையாளம் காணலாம்.
நீங்கள் Python கோ드를 உருவாக்கவும் மெஷின் கற்றல் மாதிரிகள் உருவாக்கவும் **notebooks** பயன்படுத்தப்போகிறீர்கள். இந்த வகை கோப்புகள் தரவு அறிவியலாளர்களுக்கு பொதுவான கருவி ஆகும், அவை `.ipynb` என்ற உச்சரிப்பு அல்லது நீட்டிப்பால் அடையாளம் காணப்படுகின்றன.
Notebooks என்பது ஒரு தொடர்பு சூழல் ஆகும், இது code எழுதவும், குறியீட்டின் சுற்றியுள்ள குறிப்புகள் மற்றும் ஆவணங்களை எழுதவும் டெவலப்பருக்கு அனுமதிக்கிறது, இது பரிசோதனை அல்லது ஆராய்ச்சி சார்ந்த திட்டங்களுக்கு மிகவும் உதவியாக இருக்கும்.
Notebooks என்பது code எழுதுவதோடு சேர்த்து குறிப்புகள் சேர்க்கவும் மற்றும் கோட் குறித்து ஆவணப்படுத்தல் செய்யவும் உதவும் துறைமுகச் சூழல் ஆகும், இது பரிசோதனை அல்லது ஆராய்ச்சி நோக்கங்களில் மிகவும் உதவுகிறது.
[![ML ஆரம்பம் - Regression மாடல்களை உருவாக்க Jupyter Notebooks அமைப்பது](https://img.youtube.com/vi/7E-jC8FLA2E/0.jpg)](https://youtu.be/7E-jC8FLA2E "ML ஆரம்பம் - Regression மாடல்களை உருவாக்க Jupyter Notebooks அமைப்பது")
[![ஆரம்பக்கார ML பயனாளிகளுக்கு - Jupyter Notebooks அமைத்து regression மாதிரிகள் உருவாக்க தொடங்கு](https://img.youtube.com/vi/7E-jC8FLA2E/0.jpg)](https://youtu.be/7E-jC8FLA2E "ஆரம்பக்கார ML பயனாளிகளுக்கு - Jupyter Notebooks அமைத்து regression மாதிரிகள் உருவாக்க தொடங்கு")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து இந்த பயிற்சியைச் செய்ய குறுகிய வீடியோவைப் பாருங்கள்.
> 🎥 மேலள்ள படத்தை கிளிக் செய்து இந்த பயிற்சியை காணவும்.
### பயிற்சி - ஒரு notebook-ஐப் பயன்படுத்துதல்
### பயிற்சி - ஒரு notebook உடன் பணியாற்றல்
இந்த கோப்புறையில், _notebook.ipynb_ என்ற கோப்பு உள்ளது.
இந்த கோப்பகத்தில், _notebook.ipynb_ என்ற கோப்பை காணலாம்.
1. _notebook.ipynb_ Visual Studio Code-ல் திறக்கவும்.
1. Visual Studio Code இல் _notebook.ipynb_ ஐ திறக்கவும்.
Python 3+ உடன் Jupyter server தொடங்கும். Notebook-இல் `run` செய்யக்கூடிய பகுதிகளை காணலாம், குறியீட்டு துண்டுகள். Play button போன்ற ஐகானைத் தேர்வு செய்வதன் மூலம் குறியீட்டு துண்டை இயக்கலாம்.
Python 3+ கொண்டு Jupyter சேவை துவங்கும். notebook இல் சில பகுதிகள் `run` செய்ய கூடிய குறியீடு துண்டுகள். ஒரு குறியீடு அலகை இயக்க, பிளே பொத்தானைப் போன்ற ஐகானை தேர்ந்தெடுக்க வேண்டும்.
2. `md` ஐகானைத் தேர்வு செய்து, ஒரு markdown மற்றும் **# Welcome to your notebook** என்ற உரையைச் சேர்க்கவும்.
1. `md` ஐகானை தேர்ந்தெடுத்து குறைவான markdown மற்றும் **# Welcome to your notebook** என எழுது.
அடுத்ததாக, சில Python குறியீட்டுகளைச் சேர்க்கவும்.
அடுத்ததாக சில Python குறியீடுகளை சேர்க்கவும்.
3. Code block-இல் **print('hello notebook')** எனத் தட்டச்சு செய்யவும்.
4. குறியீட்டை இயக்க ஐகானைத் தேர்வு செய்யவும்.
1. குறியீடு பகுதி இல் **print('hello notebook')** என தட்டச்சு செய்க.
1. குறியீட்டைக் இயக்க அம்புத்திற்குக் கீழே இருக்கும் அம்பையைக் கிளிக் செய்க.
நீங்கள் அச்சிடப்பட்ட உரையைப் பார்க்க வேண்டும்:
அச்சிடப்பட்ட கூற்று கீழ்க்காணும்:
```output
hello notebook
```
![VS Code-இல் notebook திறக்கப்பட்டுள்ள screenshot](../../../../translated_images/ta/notebook.4a3ee31f396b8832.webp)
![ஒரு notebook திறந்திருக்கும் VS Code](../../../../translated_images/ta/notebook.4a3ee31f396b8832.webp)
உங்கள் குறியீட்டுடன் குறிப்புகளை இணைத்து notebook-ஐ சுய ஆவணமாக்கலாம்.
நீங்கள் բացառவும் பின்னூட்டங்களுடன் உங்கள் குறியீட்டை இணையடுக்கலாம், இது notebook ஐ தானாக ஆவணப்படுத்த உதவும்.
✅ ஒரு வினாடி யோசிக்கவும்: ஒரு web developer-இன் வேலை சூழல் மற்றும் ஒரு data scientist-இன் வேலை சூழல் எவ்வளவு வேறுபட்டது?
✅ ஒரு நிமிடம் யோசிக்கவும்: வலை வடிவமைப்பாளரின் வேலை சூழல் மற்றும் ஒரு தரவு அறிவியலாளரின் வேலை சூழல் எப்படி வேறுபடுகிறது.
## Scikit-learn-ஐ பயன்படுத்த தொடங்குதல்
## Scikit-learn உடன் தொடங்குதல்
Python உங்கள் உள்ளூர் சூழலில் அமைக்கப்பட்டு, Jupyter notebooks-இல் நீங்கள் வசதியாக உள்ளீர்கள், Scikit-learn-ஐ பயன்படுத்துவதிலும் வசதியாக இருக்கலாம். Scikit-learn [விரிவான API](https://scikit-learn.org/stable/modules/classes.html#api-ref) வழங்குகிறது, இது ML பணிகளைச் செய்ய உதவுகிறது.
இப்போது Python உங்கள் உள்ளூரில் அமைக்கப்பட்டுவிட்டது, Jupyter Notebooks உடன் நீங்கள் பழகியுள்ளீர்கள், இனி Scikit-learn உடனும் பழகுவோம் (`sci` என்றபடி உயிரியல் அறிவியலால் உச்சரிக்க). Scikit-learn ML பணிகளைச் செய்ய உதவும் [பெரிய API](https://scikit-learn.org/stable/modules/classes.html#api-ref) வழங்குகிறது.
அவர்களின் [வலைத்தளத்தின்](https://scikit-learn.org/stable/getting_started.html) படி, "Scikit-learn என்பது திறந்த மூல machine learning நூலகமாகும், இது supervised மற்றும் unsupervised learning-ஐ ஆதரிக்கிறது. இது மாடல் பொருத்துதல், தரவின் முன்னேற்பாடு, மாடல் தேர்வு மற்றும் மதிப்பீடு, மற்றும் பல பயன்பாடுகளுக்கான கருவிகளை வழங்குகிறது."
அவர்களின் [வலைத்தளத்தின்படி](https://scikit-learn.org/stable/getting_started.html), "Scikit-learn என்பது மேற்பார்வையிடப்பட்ட மற்றும் மேற்பார்வையிடப்படாத கற்றலைக் குறைக்கும் திறன் கொண்ட திறந்த மூல மெஷின் கற்றல் நூலகம். இது மாதிரி பொருத்தல், தரவு முன்னோத்தல், மாதிரி தேர்வு மற்றும் மதிப்பீடு உள்ளிட்ட பல கருவிகள் வழங்குகிறது."
இந்த பாடத்தில், Scikit-learn மற்றும் பிற கருவிகளைப் பயன்படுத்தி machine learning மாடல்களை உருவாக்கப் போகிறீர்கள், இது 'சாதாரண machine learning' பணிகளைச் செய்ய உதவுகிறது. நாங்கள் neural networks மற்றும் deep learning-ஐ தவிர்த்துள்ளோம், ஏனெனில் அவை 'AI for Beginners' பாடத்திட்டத்தில் விரிவாக கற்பிக்கப்படும்.
இந்த பாடத்தில், நீங்கள் Scikit-learn மற்றும் பிற கருவிகளை பயன்படுத்தி 'சார்பான மெஷின் கற்றல்' பணிகளைச் செய்வீர்கள். நியூரல் நெட்வொர்க்கள் மற்றும் ஆழமான கற்றல் இவற்றை தவிர்த்துள்ளோம், அவை வரும் 'AI for Beginners' பாடத்திட்டத்தில் விரிவாக கற்றுக்கொடுக்கப்படும்.
Scikit-learn-ஐப் பயன்படுத்தி மாடல்களை உருவாக்கவும், அவற்றை மதிப்பீடு செய்யவும் எளிதாக உள்ளது. இது முக்கியமாக எண் தரவுகளைப் பயன்படுத்துவதில் கவனம் செலுத்துகிறது மற்றும் கற்றல் கருவிகளாக பயன்படுத்த pre-made datasets-ஐ கொண்டுள்ளது. இது மாணவர்கள் முயற்சிக்க pre-built models-ஐ கொண்டுள்ளது. முதலில் Scikit-learn-ஐப் பயன்படுத்தி prepackaged data-ஐ ஏற்றுதல் மற்றும் ஒரு built-in estimator மூலம் ஒரு அடிப்படை ML மாடலை உருவாக்குதல் ஆகியவற்றை ஆராய்வோம்.
Scikit-learn உருவாக்க மற்றும் மதிப்பீடு செய்ய எளிதாக்குகிறது. இது பெரும்பாலும் எண் தரவை எடுத்து செயல்படுகிறது மற்றும் பல தயார் செய்யப்பட்ட தரவு தொகுப்புகளும் மாதிரிகள் உள்ளன. அவற்றை முயற்சி செய்ய மாணவர்கள் பயன்படுத்தலாம். முதலில் உபகரிக்கப்பட்ட தரவு ஏற்றுதல் மற்றும் உள்ளமைக்கப்பட்ட எஸ்டிமேட்டர் மூலம் எடுக்கப்படும் முதல் ML மாதிரி பற்றி ஆய்வோம்.
## பயிற்சி - உங்கள் முதல் Scikit-learn notebook
> இந்த பயிற்சி Scikit-learn-இன் [linear regression உதாரணத்தால்](https://scikit-learn.org/stable/auto_examples/linear_model/plot_ols.html#sphx-glr-auto-examples-linear-model-plot-ols-py) ஊக்கமளிக்கப்பட்டது.
> இந்த பயிற்சிக்கு ஊக்குவிப்பாக Scikit-learn வலைத்தளத்தில் உள்ள [linear regression உதாரணம்](https://scikit-learn.org/stable/auto_examples/linear_model/plot_ols.html#sphx-glr-auto-examples-linear-model-plot-ols-py) உள்ளது.
[![ML ஆரம்பம் - Python-இல் உங்கள் முதல் Linear Regression திட்டம்](https://img.youtube.com/vi/2xkXL5EUpS0/0.jpg)](https://youtu.be/2xkXL5EUpS0 "ML ஆரம்பம் - Python-இல் உங்கள் முதல் Linear Regression திட்டம்")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து இந்த பயிற்சியைச் செய்ய குறுகிய வீடியோவைப் பாருங்கள்.
[![ஆரம்பக் கர ML பயனாளிகள் - உங்கள் முதல் Linear Regression திட்டம் Python இல்](https://img.youtube.com/vi/2xkXL5EUpS0/0.jpg)](https://youtu.be/2xkXL5EUpS0 "ஆரம்பக் கர ML பயனாளிகள் - உங்கள் முதல் Linear Regression திட்டம் Python இல்")
இந்த பாடத்துடன் தொடர்புடைய _notebook.ipynb_ கோப்பில், 'trash can' ஐகானை அழுத்துவதன் மூலம் அனைத்து cells-ஐ அழிக்கவும்.
> 🎥 மேலுள்ள படத்தை கிளிக் செய்து இந்த பயிற்சியை காணவும்.
இந்த பகுதியில், Scikit-learn-இல் கற்றல் நோக்கங்களுக்காக உள்ள diabetes dataset-ஐப் பயன்படுத்தப் போகிறீர்கள். Diabetes நோயாளிகளுக்கான சிகிச்சையைச் சோதிக்க விரும்புகிறீர்கள் என்று கற்பனை செய்யுங்கள். Machine Learning மாடல்கள், மாறிகள் கூட்டங்களின் அடிப்படையில் எந்த நோயாளிகள் சிகிச்சைக்கு சிறந்த முறையில் பதிலளிக்க முடியும் என்பதைத் தீர்மானிக்க உதவலாம். ஒரு அடிப்படை regression மாடல் கூட, visualization மூலம், உங்கள் கற்பனை மருத்துவ பரிசோதனைகளை ஒழுங்கமைக்க உதவும் மாறிகள் பற்றிய தகவல்களை காட்டலாம்.
இந்த பாடத்தின் தொடர்புடைய _notebook.ipynb_ கோப்பில் அனைத்து செல்களையும் 'துப்பாக்கி' ஐகானை அழுத்தி அழிக்கவும்.
✅ பல வகையான regression முறைகள் உள்ளன, மேலும் நீங்கள் தேர்ந்தெடுப்பது உங்கள் கேள்விக்கு நீங்கள் தேடும் பதிலின் அடிப்படையில் இருக்கும். ஒரு குறிப்பிட்ட வயதுடைய நபரின் உயரத்தை கணிக்க விரும்பினால், நீங்கள் **எண் மதிப்பு** தேடுகிறீர்கள் என்பதால் linear regression-ஐப் பயன்படுத்துவீர்கள். ஒரு உணவின் வகை vegan ஆக கருதப்பட வேண்டுமா என்பதை கண்டறிய விரும்பினால், நீங்கள் **வகை ஒதுக்கீடு** தேடுகிறீர்கள், எனவே logistic regression-ஐப் பயன்படுத்துவீர்கள். Logistic regression பற்றி நீங்கள் பின்னர் மேலும் கற்றுக்கொள்வீர்கள். தரவின் மீது நீங்கள் கேட்கக்கூடிய சில கேள்விகள் மற்றும் எந்த முறைகள் பொருத்தமானவை என்பதைப் பற்றி சிந்தியுங்கள்.
இந்தக் பகுதியில், கிளிநோய்களுக்கான சிறிய தரவு தொகுப்புடன் பணிபுரிகின்றீர்கள், இது Scikit-learn இல் கற்றல் நோக்கத்திற்காக உள்ளது. ஒரு சிகிச்சையை கணுக்கால நோயாளிகளுக்கு சோதிக்க விரும்பினால், மெஷின் கற்றல் மாதிரிகள் எந்த நோயாளிகள் சிறப்பாக பதில் அளிக்கக்கூடியார்கள் என்று உதவியாக இருக்கலாம், பல மாறிலிகள் அடிப்படையில். மிக அடிப்படையான regression மாதிரி கூட மாறிலிகள் பற்றி தகவல் காட்ட வாய்ப்பு உள்ளது, அது உங்கள் கருத்து செயலாக்கங்களை அமைக்க உதவும்.
இப்போது இந்த பணியைத் தொடங்குவோம்.
✅ பல regression முறைமைகள் உள்ளன, எது தேர்வு செய்வது என்பதை நீங்கள் எதிர்பார்க்கும் பதிலின் அடிப்படையில் தீர்மானிக்க வேண்டும். உதாரணமாக, ஒரு குறிப்பிட்ட வயதுக்கான ஒருவரின் உயரம் கணிப்பதற்கு linear regression உகந்தது, ஏனெனில் நீங்கள் ஒரு **எண் மதிப்பை** தேடுகிறீர்கள். ஒரு உணவுப் பரிமாணம் வேகன் தட்டியோடு பொருந்துமா என்று கண்டுபிடிக்க விரும்பினால், நீங்கள் **வகை வகுப்பு** தேடுகிறீர்கள், அதற்கு logistic regression பயன்படுத்தப்படும். அதன் பற்றி பிறகு கற்றுக்கொள்வீர்கள். தரவுகளிடமிருந்து கேள்விகள் என்ன என்பதையும், எந்த regression முறைகள் பொருத்தமானவை என்பதையும் சிந்தியுங்கள்.
### நூலகங்களை இறக்குமதி செய்யுங்கள்
இப்போதெல்லாம் செயல்படுவோம்.
இந்த பணிக்காக சில நூலகங்களை இறக்குமதி செய்ய ேண்டும்:
### நூலகங்களை இறக்குமதி செய்யவும்
- **matplotlib**. இது ஒரு பயனுள்ள [graphing tool](https://matplotlib.org/) ஆகும், மேலும் line plot உருவாக்க இது பயன்படுத்தப்படும்.
- **numpy**. [numpy](https://numpy.org/doc/stable/user/whatisnumpy.html) என்பது Python-இல் எண் தரவுகளை கையாள பயனுள்ள நூலகமாகும்.
இந்த பணிக்காக சில நூலகங்களை இறக்குமதி செய்வோம்:
- **matplotlib**. இது பயனுள்ள [வரைபட கருவி](https://matplotlib.org/) ஆகும், மற்றும் நாங்கள் ஒரு கோடு வரைபடம் உருவாக்க பயன்படுகின்றோம்.
- **numpy**. [numpy](https://numpy.org/doc/stable/user/whatisnumpy.html) என்பது Python இல் எண் தரவை கையாள உதவும் நூலகம்.
- **sklearn**. இது [Scikit-learn](https://scikit-learn.org/stable/user_guide.html) நூலகம்.
உங்கள் பணிகளுக்கு உதவ சில நூலகங்களை இறக்குமதி செய்யுங்கள்.
உங்கள் பணிக்கு உதவும் நூலகங்களை இறக்குமதி செய்யவும்.
1. கீழே உள்ள குறியீட்டை தட்டச்சு செய்து imports சேர்க்கவும்:
1. கீழ்க்காணும் குறியீட்டை டைப் செய்து இறக்குமதிகளைச் செய்யவும்:
```python
import matplotlib.pyplot as plt
@ -122,26 +123,26 @@ Scikit-learn-ஐப் பயன்படுத்தி மாடல்கள
from sklearn import datasets, linear_model, model_selection
```
மேலே நீங்கள் `matplotlib`, `numpy` மற்றும் `sklearn`-இல் இருந்து `datasets`, `linear_model` மற்றும் `model_selection`-ஐ இறக்குமதி செய்கிறீர்கள். `model_selection` தரவுகளை training மற்றும் test sets-ஆகப் பிரிக்க பயன்படுத்தப்படுகிறது.
மேற்கோள்: நீங்கள் `matplotlib`, `numpy` ஆகியவற்றையும், `sklearn` இலிருந்து `datasets`, `linear_model`, மற்றும் `model_selection` ஐ இறக்குமதி செய்து கொண்டிருக்கிறீர்கள். `model_selection` உடன் தரவுகளை பயிற்சி மற்றும் சோதனை தொகுதிகள் ஆகப் பிரிக்கின்றீர்கள்.
### Diabetes dataset
### கிளிநோய் தரவு தொகுப்பு
Scikit-learn-இல் உள்ள [diabetes dataset](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) diabetes பற்றிய 442 மாதிரிகளை கொண்டுள்ளது, இதில் 10 feature variables உள்ளன, அவற்றில் சில:
உள்ளமைக்கப்பட்ட [கிளிநோய் dataset](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) 442 மாதிரிகளைக் கொண்டுள்ளது, 10 பண்புகளுடன், அவற்றில் சில:
- age: வயது ஆண்டுகளில்
- வயது: வயது ஆண்டுகளில்
- bmi: உடல் பருமன் குறியீடு
- bp: சராசரி இரத்த அழுத்தம்
- s1 tc: T-Cells (ஒரு வகை வெள்ளை இரத்த அணுக்கள்)
- bp: மத்திய இரத்த அழுத்தம்
- s1 tc: T-மதுக்கள் (ஒவ்வொரு வெள்ளை உமிழ்மதுக்கள் வகை)
✅ இந்த dataset 'sex' என்ற feature variable-ஐ diabetes பற்றிய ஆராய்ச்சிக்கான முக்கிய அம்சமாகக் கொண்டுள்ளது. பல மருத்துவ datasets binary classification போன்றவற்றை உள்ளடக்கியுள்ளன. இவை மக்கள் தொகையின் சில பகுதிகளை சிகிச்சைகளிலிருந்து விலக்குவதற்கு எப்படி வழிவகுக்கின்றன என்பதை சிந்தியுங்கள்.
✅ இந்த dataset-ல் 'செக்ஸ்' எனும் binary வகுப்பு உண்டு, இது கிளிநோய் ஆராய்ச்சி பயனுள்ள ஒன்று. பல மருத்துவ தரவுத் தொகுப்புகள் இத்தகைய binary வகுப்பு கொண்டுள்ளன. இவ்வாறு வகைப்படுத்தல்கள் மக்கள் தொகையின் சில பகுதிகளை சிகிச்சைகளிலிருந்து விலக்கக்கூடும் என்று சிந்தியுங்கள்.
இப்போது X மற்றும் y தரவுகளை ஏற்றுங்ள்.
இப்போது, X மற்றும் y தரவுகளை ஏற்றுக.
> 🎓 இது supervised learning என்பதை நினைவில் கொள்ளுங்கள், மேலும் named 'y' target தேவை.
> 🎓 நினைவில் கொள், இது மேற்பார்வையுடன் கற்றல் எனும் அம்சம், எனவே பெயரிடப்பட்ட 'y' இலக்கு தேவை.
ஒரு புதிய code cell-இல், `load_diabetes()` ஐ அழைத்து diabetes dataset-ஐ ஏற்றுங்கள். `return_X_y=True` எனும் input, `X` data matrix ஆகவும், `y` regression target ஆகவும் இருக்கும் என்பதை சுட்டிக்காட்டுகிறது.
புதிய குறியீடு செல்களில், `load_diabetes()` ஐ அழைத்துக் கொண்டு diabetes dataset-ஐ ஏற்கவும். உள்ளீடு `return_X_y=True` என்பது `X` என்பது தரவுப் புள்ளிகளுக்கான மேட்ரிக்ஸ் ஆகும், `y` என்பது regression இலக்காக இருக்கும்.
1. Data matrix மற்றும் அதன் முதல் உருப்படியின் வடிவத்தை காட்ட print commands சேர்க்கவும்:
1. தரவு மேட்ரிக்ஸின் வடிவமைப்பையும் அதன் முதல் பொருளையும் அச்சிடுவதற்கான print கட்டளைகள் சேர்க்கவும்:
```python
X, y = datasets.load_diabetes(return_X_y=True)
@ -149,9 +150,9 @@ Scikit-learn-இல் உள்ள [diabetes dataset](https://scikit-learn.org/
print(X[0])
```
நீங்கள் பெறும் பதில் tuple ஆகும். Tuple-இன் முதல் இரண்டு மதிப்புகளை முறையே `X` மற்றும் `y`-க்கு ஒதுக்குகிறீர்கள். [Tuples பற்றி](https://wikipedia.org/wiki/Tuple) மேலும் அறிக.
நீங்கள் பெறுகின்ற விடை ஒரு tuple ஆகும். இதன் முதல் இரண்டு மதிப்புகளைவெவ்விலுமாக `X` மற்றும் `y` க்கு ஒதுக்குகிறீர்கள். [tuple பற்றி மேலும் தெரியுமா](https://wikipedia.org/wiki/Tuple).
இந்த data 442 உருப்படிகளை 10 உருப்படிகளின் arrays வடிவில் கொண்டுள்ளது என்பதை நீங்கள் காணலாம்:
இந்த தரவு 442 உருப்படியைக் கொண்டு 10 உறுப்புகளின் வரிசைகள் வடிவத்தில் உள்ளது:
```text
(442, 10)
@ -159,39 +160,39 @@ Scikit-learn-இல் உள்ள [diabetes dataset](https://scikit-learn.org/
-0.04340085 -0.00259226 0.01990842 -0.01764613]
```
Data மற்றும் regression target இடையேயான தொடர்பைப் பற்றி சிந்தியுங்கள். Linear regression feature X மற்றும் target variable y இடையேயான தொடர்புகளை கணிக்கிறது. Diabetes dataset-க்கு [target](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) என்ன என்பதை documentation-இல் கண்டுபிடிக்க முடியுமா? இந்த dataset என்ன காட்டுகிறது?
தரவு மற்றும் regression இலக்குக்கிடையிலான உறவினைப் பற்றிக் சிந்தியுங்கள். Linear regression அம்ச X மற்றும் இலக்கு y இடையிலான உறவுகளை கணக்கிடுகிறது. கிளிநோய் dataset இன் [இலக்கு](https://scikit-learn.org/stable/datasets/toy_dataset.html#diabetes-dataset) ஆவணத்தில் உள்ளதா? இந்த dataset எதை விளக்குகிறது என்பதைக் கவனித்து பார்க்கவும்.
2. Dataset-இன் ஒரு பகுதியை plot செய்ய 3rd column-ஐத் தேர்ந்தெடுக்கவும். `:` operator-ஐப் பயன்படுத்தி அனைத்து rows-ஐத் தேர்ந்தெடுக்கவும், பின்னர் index (2) மூலம் 3rd column-ஐத் தேர்ந்தெடுக்கவும். Plot செய்ய 2D array-ஆக data-ஐ reshape செய்ய `reshape(n_rows, n_columns)` ஐப் பயன்படுத்தவும். Parameter-ல் ஒன்று -1 என்றால், தொடர்புடைய அளவுகள் தானாக கணக்கிடப்படும்.
2. அடுத்ததாக, dataset இன் ஒரு பகுதியை வரைபடமாகக் காட்ட 3வது நெடு நெடுவரிசையைத் (index 2) தேர்ந்தெடுக்கவும். இதற்கு உங்கள் எல்லா வரிசைகளையும் `:` மூலம் தேர்வு செய்து 3வது நெடுவரிசையை நினைவில் கொள்ளவும். 2D வரிசையாக மாற்றவும் `reshape(n_rows, n_columns)` பயன்படுத்தவும். ஒரு அளவுரு -1 என்றால் அந்த பரிமాణம் தானாகக் கணக்கிடப்படும்.
```python
X = X[:, 2]
X = X.reshape((-1,1))
```
✅ எந்த நேரத்திலும், data-ஐ print செய்து அதன் வடிவத்தைச் சரிபார்க்கவும்.
✅ எந்த நேரமும் தரவின் வடிவமைப்பைக் கண்காணிக்க print செய்யலாம்.
3. Data plot செய்ய தயாராக உள்ளதால், இந்த dataset-இல் எண்களின் இடைவெளியை machine கண்டறிய உதவுமா என்பதைப் பார்க்கலாம். இதற்காக, data (X) மற்றும் target (y) இரண்டையும் test மற்றும் training sets-ஆகப் பிரிக்க வேண்டும். Scikit-learn-இல் இதைச் செய்ய எளிய வழி உள்ளது; test data-ஐ ஒரு குறிப்பிட்ட புள்ளியில் பிரிக்கலாம்.
3. இப்போது வரைபடத் தயாரான தரவுடன் இயந்திரம் எண் தொகுதிகளில் உரியபடி பிரிக்க உதவுமா என காணலாம். அதற்காக நீங்கள் தரவு (X) மற்றும் இலக்கு (y) இரண்டோ பயிற்சி மற்றும் சோதனை தொகுதிகளாக்க வேண்டும். Scikit-learn இதற்கான எளிய முறையை வழங்குகிறது; நீங்கள் சோதனை தரவை ஒரு குறிப்பிட்ட இடத்தில் பிரிக்கலாம்.
```python
X_train, X_test, y_train, y_test = model_selection.train_test_split(X, y, test_size=0.33)
```
4. இப்போது உங்கள் மாடலை train செய்ய தயாராக உள்ளீர்கள்! Linear regression model-ஐ ஏற்றவும் மற்றும் `model.fit()` ஐப் பயன்படுத்தி உங்கள் X மற்றும் y training sets-ஐ train செய்யவும்:
4. இப்போது உங்கள் மாதிரியை பயிற்சி செய்ய தயாராக இருக்கின்றீர்கள்! linear regression மாதிரியை ஏற்று உங்கள் X மற்றும் y பயிற்சி தொகுதிகள் கொண்டு `model.fit()` பயன்படுத்தி பயிற்சி செய்யுங்கள்:
```python
model = linear_model.LinearRegression()
model.fit(X_train, y_train)
```
`model.fit()` என்பது TensorFlow போன்ற பல ML நூலகங்களில் நீங்கள் காணும் ஒரு function ஆகும்.
`model.fit()` என்பது TensorFlow போன்ற பல ML நூலகங்களில் காணப்படும் செயல்பாடு
5. பின்னர், test data-ஐப் பயன்படுத்தி prediction உருவாக்கவும், இது data குழுக்களுக்கிடையில் line-ஐ வரைய பயன்படுத்தப்படும்.
5. பிறகு சோதனை தரவை பயன்படுத்தி `predict()` செயல்பாடு மூலம் முன்னறிவிப்பு உருவாக்கவும். இது தரவு குழுக்களில் இடையே கோடு வரைதல் பயன்படும்
```python
y_pred = model.predict(X_test)
```
6. இப்போது data-ஐ plot-இல் காட்ட நேரம். Matplotlib இந்த பணிக்குப் பயனுள்ள கருவியாகும். அனைத்து X மற்றும் y test data-களின் scatterplot உருவாக்கவும், மற்றும் model-ஐ data குழுக்களுக்கிடையில் மிகச் சரியான இடத்தில் line-ஐ வரைய prediction-ஐப் பயன்படுத்தவும்.
6. இப்போது தரவை வரைபடத்தில் காட்டும் நேரம். Matplotlib இந்த பணிக்கு மிகவும் பயனுள்ள கருவி. அனைத்து X மற்றும் y சோதனை தரவுகளையும் scatterplot ஆக உருவாக்கவும், மாடல் தரவு குழுக்களுக்கு இடையே அதிர்வெண் மூலம் வரிக்காட்டவும்.
```python
plt.scatter(X_test, y_test, color='black')
@ -202,29 +203,32 @@ Scikit-learn-இல் உள்ள [diabetes dataset](https://scikit-learn.org/
plt.show()
```
![Diabetes பற்றிய datapoints-ஐ காட்டும் scatterplot](../../../../translated_images/ta/scatterplot.ad8b356bcbb33be6.webp)
✅ இங்கே என்ன நடக்கிறது என்பதைப் பற்றி சிறிது யோசிக்கவும். ஒரு நேர்கோடு பல சிறிய தரவுப் புள்ளிகளின் வழியாக ஓடுகிறது, ஆனால் அது உண்மையில் என்ன செய்கிறது? புதிய, பார்க்கப்படாத தரவுப் புள்ளி ஒரு வரைபடத்தின் y அச்சுடன் தொடர்புடைய இடத்தில் பொருந்த வேண்டும் என்பதை நீங்கள் எப்படி கணிக்க முடியும் என்பதைப் பார்க்க முடியுமா? இந்த மாதிரியின் நடைமுறை பயன்பாட்டை வார்த்தைகளில் விளக்க முயற்சிக்கவும்.
![கிளிநோய் தொடர்பான தரவுப் புள்ளிகளைக் காட்டும் scatterplot](../../../../translated_images/ta/scatterplot.ad8b356bcbb33be6.webp)
வாழ்த்துக்கள், நீங்கள் உங்கள் முதல் நேரியல் மடங்கல் மாதிரியை உருவாக்கி, அதைப் பயன்படுத்தி ஒரு கணிப்பு செய்து, அதை ஒரு வரைபடத்தில் காட்டியுள்ளீர்கள்!
✅ இங்கே என்ன நடக்கிறது என்று கொஞ்சம் யோசிக்கவும். ஒரு நேர்கோடு பல சிறிய தரவுத் துளிகளுக்கு வழியாக ஓடுகிறது, ஆனால் அது دقیகமாக என்ன செய்கிறது? ஒரு புதிய, பார்க்காத தரவு புள்ளி துணைத் தொடரின் y அச்சை ஒப்பிடும்போது எங்கே பொருந்தவேண்டும் என்பதை எவ்வாறு முன்னறிவிக்க இந்த கோட்டை நீங்கள் எப்படி பயன்படுத்த முடியும் என்பதைக் காண முடியுமா? இந்த மாதிரியின் நடைமுறைப் பயன்பாட்டை வார்த்தைகளால் எடுத்துரைக்க முயற்சியுங்கள்.
வாழ்த்துக்கள், நீங்கள் உங்கள் முதல் நேரியல் வெளியீட்டு மாதிரியை கட்டமைத்தீர்கள், அதுடன் ஒரு முன்னறிவிப்பு உருவாக்கினீர்கள் மற்றும் அதை ஒரு வரைபடத்தில் காட்டு வாட்சியுங்கள்!
---
## 🚀சவால்
இந்த தரவுத்தொகுப்பில் இருந்து வேறு ஒரு மாறியை வரைபடமாக்கவும். குறிப்புகள்: இந்த வரியைத் திருத்தவும்: `X = X[:,2]`. இந்த தரவுத்தொகுப்பின் இலக்கை அடிப்படையாகக் கொண்டு, நீரிழிவு நோயின் முன்னேற்றம் பற்றியதை நீங்கள் கண்டறிய முடிகிறதா?
## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
இந்த தரவுத்தொகுதியிலிருந்து வேறுபட்ட மாறியை வரைபடப்படுத்துங்கள். குறிப்பு: இந்த வரியை திருத்துங்கள்: `X = X[:,2]`. இந்த தரவுத்தொகுதியின் இலக்கை கருத்தில் கொண்டு, நீரிழிவு (டையபட்டீஸ்) நோயின் முன்னேற்றம் பற்றி என்ன கண்டறிய முடிகிறது?
## [பாடம் பின்னர் கேள்விப்பட்டு](https://ff-quizzes.netlify.app/en/ml/)
## மதிப்பீடு & சுயபடிப்ப
## மதிப்பாய்வு & சுயமடைவ
இந்த பாடத்தில், நீங்கள் எளிய நேரியல் மடங்கல் முறையைப் பயன்படுத்தினீர்கள், ஆனால் ஒருமாறி அல்லது பலமாறி மடங்கல் முறைகளைப் பயன்படுத்தவில்லை. இந்த முறைகளின் இடையிலான வேறுபாடுகள் பற்றி சிறிது படிக்கவும் அல்லது [இந்த வீடியோவை](https://www.coursera.org/lecture/quantifying-relationships-regression-models/linear-vs-nonlinear-categorical-variables-ai2Ef) பாருங்கள்.
இந்த பயிற்சியில், நீங்கள் சாதாரண நேரியல் வெளியீட்டோடு பணியாற்றினீர்கள், ஒருமுறை அல்லது பல நேரியல் வெளியீட்டை விட மாறுபட்டது. இந்த முறைமைகளுக்கு இடையேயான வித்தியாசங்களை கொஞ்சம் படியுங்கள், அல்லது [இந்த காணொளியை](https://www.coursera.org/lecture/quantifying-relationships-regression-models/linear-vs-nonlinear-categorical-variables-ai2Ef) பாருங்கள்
மடங்கல் என்ற கருத்து பற்றி மேலும் படித்து, இந்த தொழில்நுட்பம் மூலம் எந்த வகையான கேள்விகளுக்கு பதில் அளிக்க முடியும் என்பதை யோசிக்கவும். உங்கள் புரிதலை ஆழமாக்க இந்த [பயிற்சியை](https://docs.microsoft.com/learn/modules/train-evaluate-regression-models?WT.mc_id=academic-77952-leestott) எடுத்துக்கொள்ளவும்.
வெளியீட்டு கருத்து பற்றி மேலும் படியுங்கள் மற்றும் இந்த தொழில்நுட்பம் மூலம் எந்தவுப்போன்ற கேள்விகள் பதில் பெற முடியும் என்பதை யோசியுங்கள். உங்கள் புரிதலை ஆழப்படுத்த இந்த [பயிற்சியை](https://docs.microsoft.com/learn/modules/train-evaluate-regression-models?WT.mc_id=academic-77952-leestott) எடுத்துக்கொள்ளுங்கள்.
## பணிக்கான ஒதுக்கீடு
## பணித் திட்டம்
[வேறு ஒரு தரவுத்தொகுப்பு](assignment.md)
[வேறுபட்ட தரவுத்தொகுப்பு](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையை பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கின்றோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,62 +1,62 @@
# Scikit-learn பயன்படுத்தி ஒரு ரிக்ரஷன் மாடல் உருவாக்குதல்: தரவுகளை தயாரித்து காட்சிப்படுத்துதல்
# Scikit-learn பயன்படுத்தி ஒரு எதிர்காலக் கணிப்பு மாதிரியை உருவாக்குதல்: தரவைத் தயாரித்து காட்சி போதித்தல்
![தரவு காட்சிப்படுத்தல் தகவல் வரைபடம்](../../../../translated_images/ta/data-visualization.54e56dded7c1a804.webp)
![தரவு காட்சிப்படுத்தல் தகவலுரு](../../../../translated_images/ta/data-visualization.54e56dded7c1a804.webp)
தகவல் வரைபடம்: [Dasani Madipalli](https://twitter.com/dasani_decoded)
தகவலுரு [டசானி மடிப்பள்ளி](https://twitter.com/dasani_decoded) அவர்களால்
## [முன்-வகுப்பு வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [முன்னுரைக்கு முன் வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
> ### [இந்த பாடம் R-ல் கிடைக்கிறது!](../../../../2-Regression/2-Data/solution/R/lesson_2.html)
## அறிமுகம்
Scikit-learn-ஐப் பயன்படுத்தி மெஷின் லெர்னிங் மாடல் உருவாக்கத் தேவையான கருவிகளை நீங்கள் அமைத்த பிறகு, உங்கள் தரவுகளுக்கு கேள்விகள் கேட்கத் தயாராக இருக்கிறீர்கள். தரவுகளுடன் வேலை செய்யும் போது மற்றும் ML தீர்வுகளைப் பயன்படுத்தும் போது, உங்கள் தரவுத்தொகுப்பின் திறன்களை சரியாகத் திறக்க சரியான கேள்வியை கேட்பது மிகவும் முக்கியம்.
நீங்கள் Scikit-learn பயன்படுத்தி இயந்திரக் கற்றல் மாதிரி உருவாக்கத் தொடங்க தேவையான கருவிகளுடன் என்டு உள்ளீர்கள், இப்போது உங்கள் தரவில் கேள்விகள் கேட்கத் தயாராக இருக்கிறீர்கள். தரவு மற்றும் இயந்திரக் கற்றல் தீர்வுகளை பயன்படுத்தும்போது, உங்கள் தரவுக் குத்தகைகள் திறக்கச் சரியான கேள்வி கேட்கும் முறை மிகவும் முக்கியமான ஒன்று.
ந்த பாடத்தில், நீங்கள் கற்றுக்கொள்வீர்கள்:
ப்பாடத்தில், நீங்கள் கற்றுக்கொள்ள உணடு:
- மாடல் உருவாக்கத்திற்கான தரவுகளை எப்படி தயாரிப்பது.
- தரவுகளை காட்சிப்படுத்த Matplotlib-ஐ எப்படி பயன்படுத்துவது.
- மாதிரி கட்டமைப்புக்கு உங்கள் தரவை nasıl தயார் செய்வது.
- தரவு காட்சிப்படுத்தும் நோக்கத்திற்காக Matplotlib ஐ எப்படி பயன்படுத்துவது.
- மேலும் வெளிப்படையான தரவு காட்சிப்படுத்துவதற்காக Seaborn ஐ எப்படி பயன்படுத்துவது.
## உங்கள் தரவுகளுக்கு சரியான கேள்வியை கேட்பது
## உங்கள் தரவுக்கு சரியான கேள்வி கேட்குதல்
உங்களுக்கு பதில் தேவைப்படும் கேள்வி எந்த வகையான ML அல்காரிதங்களை நீங்கள் பயன்படுத்துவீர்கள் என்பதைத் தீர்மானிக்கும். மேலும், நீங்கள் பெறும் பதிலின் தரம் உங்கள் தரவின் தன்மைக்கு மிகவும் சார்ந்தது.
உங்கள் கேள்வி அடிப்படையில் நீங்கள் எந்த வகை இயந்திரக் கற்றல் ஆல்கொரித்ம்களை பயன்படுத்துவீர்கள் என்று தீர்மானிக்கிறது. மீண்டும் பெற்ற பதிலின் தரம் உங்கள் தரவின் இயல்புத்தன்மைக்கு மிகுந்த சார்ந்தது.
இந்த பாடத்திற்கான [தரவை](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) பாருங்கள். இந்த .csv கோப்பை நீங்கள் VS Code-ல் திறக்கலாம். ஒரு விரைவான பார்வை உடனடியாக வெற்றிடங்கள் மற்றும் சரங்கள் மற்றும் எண்களைக் கலந்த தரவுகள் உள்ளன என்பதை காட்டுகிறது. 'Package' எனும் ஒரு விசித்திரமான பத்தி உள்ளது, இதில் 'sacks', 'bins' மற்றும் பிற மதிப்புகள் கலந்துள்ளன. உண்மையில், இந்த தரவு கொஞ்சம் குழப்பமாக உள்ளது.
இந்த பாடத்திற்கு கொடுக்கப்பட்டுள்ள [தரவை](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) பாருங்கள். இந்த .csv கோப்பை VS Code இல் திறக்கலாம். விரைவான பார்வையில், வெற்றிடங்கள் மற்றும் எழுத்து மற்றும் எண் கலவையுடைய தரவுகள் உள்ளன என்பதைக் காட்டுகிறது. 'Package' எனும் ஒரு அசாதாரண நெடுவரிசையும் உள்ளது, அங்கு தரவு 'sacks', 'bins' மற்றும் பிற மதிப்புகளின் கலவையாக உள்ளது. உண்மையில், தரவு கொஞ்சம் குழப்பமானது.
[![ML for beginners - How to Analyze and Clean a Dataset](https://img.youtube.com/vi/5qGjczWTrDQ/0.jpg)](https://youtu.be/5qGjczWTrDQ "ML for beginners - How to Analyze and Clean a Dataset")
[![ML தொடக்கர்களுக்கான - Dataset ஐ பகுப்பாய்வு செய்து சுத்தம் செய்வது எப்படி](https://img.youtube.com/vi/5qGjczWTrDQ/0.jpg)](https://youtu.be/5qGjczWTrDQ "ML தொடக்கர்களுக்கான - Dataset ஐ பகுப்பாய்வு செய்து சுத்தம் செய்வது எப்படி")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து இந்த பாடத்திற்கான தரவுகளைத் தயாரிக்க ஒரு குறுகிய வீடியோவைப் பாருங்கள்.
> 🎥 இந்த படத்தை கிளிக் செய்து, பாடத்திற்கான தரவைத் தயாரிக்கும் ஒரு குறுகிய வீடியோவை காணலாம்.
உண்மையில், ML மாடல் உருவாக்கத்திற்குத் தயாராக இருக்கும் ஒரு தரவுத்தொகுப்பை பெறுவது மிகவும் அரிது. இந்த பாடத்தில், Python நூலகங்களைப் பயன்படுத்தி ஒரு மூல தரவுத்தொகுப்பை எப்படி தயாரிப்பது என்பதை நீங்கள் கற்றுக்கொள்வீர்கள். மேலும், தரவுகளை காட்சிப்படுத்த பல்வேறு நுட்பங்களை நீங்கள் கற்றுக்கொள்வீர்கள்.
உண்மையில், ஒரு இயந்திரக் கற்றல் மாதிரியை உருவாக்குவதற்கு முழுமையாக தயாராகக் கிடைக்கும் தரவை பெறுவது சாதாரணம் அல்ல. இப்பாடத்தில், நீங்கள் அசல் தரவை ஸ்டாண்டர்ட் Python நூலகங்களைப் பயன்படுத்தி எப்படி தயார் செய்வது என்று கற்றுக்கொள்வீர்கள். மேலும், தரவை காட்சிப்படுத்த பல்வேறு நுட்பங்களையும் கற்றுக்கொள்வீர்கள்.
## வழக்குக் கதை: 'பூசணிக்காய் சந்தை'
## உயர் ஆய்வு: 'கத்திரிக்காய் சந்தை'
இந்த கோப்பகத்தில், [US-pumpkins.csv](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) எனும் ஒரு .csv கோப்பு உள்ளது, இது 1757 வரிசைகளைக் கொண்டது, பூசணிக்காய்களின் சந்தை பற்றிய தகவல்களை நகரங்களின் அடிப்படையில் தொகுத்து வழங்குகிறது. இது [Specialty Crops Terminal Markets Standard Reports](https://www.marketnews.usda.gov/mnp/fv-report-config-step1?type=termPrice) மூலம் அமெரிக்க விவசாயத்துறை வழங்கிய தரவுகளிலிருந்து எடுக்கப்பட்டது.
இந்த கோப்பகத்தில், ரூட் `data` கோப்பகத்தில் உள்ள [US-pumpkins.csv](https://github.com/microsoft/ML-For-Beginners/blob/main/2-Regression/data/US-pumpkins.csv) எனப்படும் .csv கோப்பை காணலாம், இது நகரங்கள் படி வகைப்படுத்தப்பட்ட கத்திரிக்காய் சந்தைக்கு 1757 வரிசை தரவுகள் கொண்டுள்ளது. இது [Specialty Crops Terminal Markets Standard Reports](https://www.marketnews.usda.gov/mnp/fv-report-config-step1?type=termPrice) மூலம் விவசாயத்துறை வழங்கிய அசல் தரவு ஆகும்.
### தரவுகளை தயாரித்தல்
### தரவை தயார் செய்தல்
இந்த தரவு பொது உரிமத்தில் உள்ளது. இது USDA வலைத்தளத்தில் இருந்து பல தனித்தனியான கோப்புகளாக, நகரத்தின் அடிப்படையில் பதிவிறக்கம் செய்ய முடியும். மிக அதிகமான தனித்தனியான கோப்புகளைத் தவிர்க்க, அனைத்து நகர தரவுகளையும் ஒரு ஸ்பிரெட்ஷீட்டில் இணைத்துள்ளோம், எனவே நாம் ஏற்கனவே தரவுகளை கொஞ்சம் _தயாரித்துள்ளோம்_. அடுத்ததாக, தரவுகளை நெருக்கமாகப் பார்ப்போம்.
இந்த தரவு பொதுத்துறை உரிமம் கொண்டது. USDA இணையதளத்தில் பல நகரங்களுக்கு தனித்தனியாக பல கோப்புகளில் பதிவிறக்கம் செய்யலாம். பல கோப்புகளை தவிர்க்க, அனைத்து நகரங்களின் தரவையும் நாம் ஒரே பத்திரிக்கையில் இணைத்துள்ளோம், ஆகவே நாம் ஏற்கனவே சில அளவுக்கு தரவை _தயார்_ செய்துள்ளோம். அடுத்து, தரவை நன்கு பார்ப்போம்.
### பூசணிக்காய் தரவுகள் - ஆரம்பக் கருத்துகள்
### கத்திரிக்காய் தரவு - ஆரம்ப முடிவுகள்
இந்த தரவுகள் பற்றி நீங்கள் என்ன கவனிக்கிறீர்கள்? நீங்கள் ஏற்கனவே சரங்கள், எண்கள், வெற்றிடங்கள் மற்றும் விசித்திரமான மதிப்புகள் கலந்துள்ளதைப் பார்த்தீர்கள், இதை நீங்கள் புரிந்துகொள்ள வேண்டும்.
இந்த தரவின் பற்றி என்ன கவனித்தீர்கள்? எழுத்துக்குறிகள், எண்கள், வெற்றிடங்கள் மற்றும் அதிர்வுதியான மதிப்புகள் கலந்துள்ளதைக் நீங்கள் ஏற்கனவே பார்த்துள்ளீர்கள்.
Regression நுட்பத்தைப் பயன்படுத்தி, இந்த தரவுகளுக்கு நீங்கள் எந்த கேள்வியை கேட்கலாம்? "ஒரு குறிப்பிட்ட மாதத்தில் விற்பனைக்கு உள்ள பூசணிக்காயின் விலையை கணிக்கவும்" என்ற கேள்வி எப்படி? தரவுகளை மீண்டும் பார்த்தால், இந்த பணிக்குத் தேவையான தரவமைப்பை உருவாக்க சில மாற்றங்களைச் செய்ய வேண்டும்.
இந்த தரவுக்கு Regression தொழில்நுட்பம் பயன்படுத்தி எந்த கேள்வியை கேட்கலாம்? எடுத்துக்காட்டு "ஒரு கொடுக்கப்பட்ட மாதத்தில் விற்பனைக்கு இருக்கும் கத்திரிக்காய் விலை கணிக்கவும்". தரவை மீண்டும் பார்த்தால், இந்த பணிக்குத் தேவையான தரவு கட்டமைப்பை உருவாக்க சில மாற்றங்கள் செய்யப்பட வேண்டும்.
## பயிற்சி - கத்திரிக்காய் தரவை பகுப்பாய்வு செய்தல்
## பயிற்சி - பூசணிக்காய் தரவுகளை பகுப்பாய்வு செய்யுங்கள்
கத்திரிக்காய் தரவை பகுப்பாய்வு செய்து தயார் செய்ய [Pandas](https://pandas.pydata.org/), (`Python Data Analysis` என்ற பொருளைப் பார்க்கிறது) என்று அழைக்கப்படும் பயனுள்ள கருவி பயன்படுத்துவோம்.
[Pandas](https://pandas.pydata.org/) (இது `Python Data Analysis` என்பதற்கான சுருக்கமாகும்) எனும் கருவியைப் பயன்படுத்தி, இந்த பூசணிக்காய் தரவுகளை பகுப்பாய்வு செய்து தயாரிக்கலாம்.
### முதலில், காணவில்லை உள்ள தேதிகளை சரிபார்
### முதலில், தேதிகள் காணாமல் போனதா என்பதைச் சரிபார்க்கவும்
முதலில் காணவில்லை இருக்கும் தேதிகளைச் சரிபார்க்க சில செயல்கள் செய்ய வேண்டும்:
முதலில், தேதிகள் காணாமல் போனதா என்பதைச் சரிபார்க்க சில நடவடிக்கைகளை எடுக்க வேண்டும்:
1. தேதிகளை மாத வடிவமைப்புக்கு மாற்று (இவை அமெரிக்க தேதிகள், ஆகவே வடிவம் `MM/DD/YYYY` ஆகும்).
2. மாதத்தைக் புதிய நெடுவரிசையில் எடு.
1. தேதிகளை மாத வடிவத்திற்கு மாற்றவும் (இவை US தேதிகள், எனவே வடிவம் `MM/DD/YYYY`).
2. மாதத்தை ஒரு புதிய பத்தியில் எடுக்கவும்.
Visual Studio Code இல் _notebook.ipynb_ கோப்பைத் திறந்து, பத்திரிக்கையை புதிய Pandas தரவுத்தொகுதியில் இறக்குமதி செய்க.
Visual Studio Code-ல் _notebook.ipynb_ கோப்பைத் திறந்து, ஸ்பிரெட்ஷீட்டை புதிய Pandas dataframe-க்கு இறக்குமதி செய்யுங்கள்.
1. முதல் ஐந்து வரிசைகளைப் பார்க்க `head()` செயல்பாட்டைப் பயன்படுத்தவும்.
1. முதல் ஐந்து வரிசைகளை காண `head()` வகையைப் பயன்படுத்துக.
```python
import pandas as pd
@ -64,30 +64,30 @@ Visual Studio Code-ல் _notebook.ipynb_ கோப்பைத் திறந
pumpkins.head()
```
✅ கடைசி ஐந்து வரிசைகளைப் பார்க்க நீங்கள் எந்த செயல்பாட்டைப் பயன்படுத்துவீர்கள்?
✅ கடைசி ஐந்து வரிசைகளை காண எந்த வகையை நீங்கள் பயன்படுத்துவீர்கள்?
1. தற்போதைய dataframe-ல் காணாமல் போன தரவுகள் உள்ளதா என்பதைச் சரிபார்க்கவும்:
1. தற்போதைய தரவுத்தொகுதியில் காணவில்லை உள்ள தரவு உள்ளதா என்பதை சரிபார்:
```python
pumpkins.isnull().sum()
```
காணாமல் போன தரவுகள் உள்ளன, ஆனால் இது தற்போதைய பணிக்குத் தேவையில்லை.
காணவில்லை உள்ள தரவு உள்ளது, ஆனால் இது பணிக்குப் பெரிதாக பாதிப்பதில்லை.
1. உங்கள் dataframe-ஐ எளிதாக வேலை செய்ய, `loc` செயல்பாட்டைப் பயன்படுத்தி, உங்களுக்கு தேவையான பத்திகளை மட்டும் தேர்ந்தெடுக்கவும். இது முதன்மை dataframe-ல் இருந்து வரிசைகள் (முதல் அளவுருவாக) மற்றும் பத்திகள் (இரண்டாவது அளவுருவாக) எடுக்க உதவுகிறது. கீழே உள்ள `:` என்ற வெளிப்பாடு "அனைத்து வரிசைகள்" என்று பொருள்.
1. உங்கள் தரவுத்தொகுதியை எளிதாக கையாள `loc` வகையைப் பயன்படுத்தி தேவைப்படும் நெடுவரிசைகள் மற்றும் நெடுவரிசைகளை மட்டுமே தேர்ந்தெடுக்கவும். கீழே `:` என்ற அகராதி "அனைத்து வரிசைகள்" என்பதைக் குறிக்கிறது.
```python
columns_to_select = ['Package', 'Low Price', 'High Price', 'Date']
pumpkins = pumpkins.loc[:, columns_to_select]
```
### இரண்டாவது, பூசணிக்காயின் சராசரி விலையைத் தீர்மானிக்கவும்
### இரண்டாவது, கத்திரிக்காயின் சராசரி விலையை தீர்மானி
ஒரு குறிப்பிட்ட மாதத்தில் பூசணிக்காயின் சராசரி விலையைத் தீர்மானிக்க எப்படி யோசிப்பீர்கள்? இந்த பணிக்குத் தேவையான பத்திகளை நீங்கள் எவ்வாறு தேர்ந்தெடுப்பீர்கள்? குறிப்புகள்: உங்களுக்கு 3 பத்திகள் தேவைப்படும்.
கொடுக்கப்பட்ட மாதத்தில் கத்திரிக்காயின் சராசரி விலையை எப்படி தீர்மானிப்பதற்கான எண்ணத்தை செய்யவும். இந்த பணிக்காக எந்த நெடுவரிசைகள் தேவை? குறிப்பு: 3 நெடுவரிசைகள் தேவைப்படும்.
தீர்வு: `Low Price` மற்றும் `High Price` பத்திகளின் சராசரியை எடுத்து புதிய Price பத்தியை நிரப்பவும், மேலும் Date பத்தியை மாதத்தை மட்டும் காட்ட மாற்றவும். மேலே உள்ள சரிபார்ப்பின் படி, தேதிகள் அல்லது விலைகளுக்கு காணாமல் போன தரவுகள் இல்லை.
தீர்வு: `Low Price` மற்றும் `High Price` நெடுவரிசைகளின் சராசரியை எடுத்துக்கொண்டு புதிய `Price` நெடுவரிசையை நிரப்பவும் மற்றும் `Date` நெடுவரிசையை மாதத்தை மட்டும் காட்ட மாற்றவும். மேலே செய்யப்பட்ட சரிபார்ப்பின் படி, தேதிகளுககாக அல்லது விலைகளுக்காக காணவில்லை உள்ள தரவு எதுவும் இல்லை.
1. சராசரியை கணக்கிட, பின்வரும் குறியீட்டைச் சேர்க்கவும்:
1. சராசரியைக் கணக்கிட இந்த குறியீட்டைச் சேர்க்கவும்:
```python
price = (pumpkins['Low Price'] + pumpkins['High Price']) / 2
@ -96,37 +96,37 @@ Visual Studio Code-ல் _notebook.ipynb_ கோப்பைத் திறந
```
`print(month)` பயன்படுத்தி எந்த தரவையும் சரிபார்க்க நீங்கள் விரும்பினால் அச்சிடலாம்.
செல்லாக்கடுங்க `print(month)` பற்றி உங்கள் விருப்பப்படி தரவைப் பிரிண்ட் செய்யலாம்.
2. இப்போது, உங்கள் மாற்றிய தரவுகளை புதிய Pandas dataframe-க்கு நகலெடுக்கவும்:
2. இப்போது, உங்கள் மாற்றப்பட்ட தரவை புதிய Pandas தரவுத்தொகுதியில் நகலெடுக்கவும்:
```python
new_pumpkins = pd.DataFrame({'Month': month, 'Package': pumpkins['Package'], 'Low Price': pumpkins['Low Price'],'High Price': pumpkins['High Price'], 'Price': price})
```
உங்கள் dataframe-ஐ அச்சிடுவது, உங்கள் புதிய ரிக்ரஷன் மாடலை உருவாக்க ஒரு சுத்தமான, ஒழுங்கான தரவுத்தொகுப்பை காட்டும்.
உங்கள் தரவுத்தொகுதியை அச்சிடுவது நீங்கள் புதிய, சுத்தமான தரவுத்தொகுதியை காண்பிக்கும், அதில் நீங்கள் உங்கள் புதிய எதிர்காலக் கணிப்பு மாதிரியைக் கட்டலாம்.
### ஆனால் காத்திருங்கள்! இங்கு ஏதோ விசித்திரமாக உள்ளது
### ஆனால் வந்து! இதோ ஒன்று விசித்திரம்
`Package` பத்தியைப் பாருங்கள், பூசணிக்காய்கள் பல்வேறு அமைப்புகளில் விற்கப்படுகின்றன. சில '1 1/9 bushel' அளவுகளில் விற்கப்படுகின்றன, சில '1/2 bushel' அளவுகளில், சில பூசணிக்காய் ஒன்றுக்கு, சில பவுண்டுக்கு, மற்றும் சில பெரிய பெட்டிகளில் விற்கப்படுகின்றன.
`Package` நெடுவரிசையைப் பாருங்கள், கத்திரிக்காய் பல்வேறு அமைப்புகளில் விற்கப்படுகிறார்கள். சில '1 1/9 bushel' அளவுகளில், சில '1/2 bushel' அளவுகளில், சில கதிரிக்காய்களுக்கு மற்றும் சில பவுண்ட் அளவுகளில், மற்றும் சில பெரிய பெட்டிகளில் விற்பனையாக இருக்கின்றன.
> பூசணிக்காய்களை சீராக எடுப்பது மிகவும் கடினம்
> கத்திரிக்காய்களை ஒழுங்காக எடை அளவிடுவது மிகவும் கடுமையானது என தோன்றுகிறது
மூல தரவுகளை ஆராய்ந்தால், `Unit of Sale` 'EACH' அல்லது 'PER BIN' என்றால், `Package` வகை அங்குலம், பின், அல்லது 'each' ஆகவும் உள்ளது. பூசணிக்காய்களை சீராக எடுப்பது மிகவும் கடினம், எனவே `Package` பத்தியில் 'bushel' என்ற சரம் உள்ள பூசணிக்காய்களை மட்டும் தேர்ந்தெடுப்பதன் மூலம் அவற்றை வடிகட்டலாம்.
அசல் தரவினை விரிவாக பார்த்தால், `Unit of Sale` 'EACH' அல்லது 'PER BIN' என்பதாக இருந்தால், அது `Package` வகை அங்குலம் ஒட்டுமொத்த, தொகுதி, அல்லது 'ஒவ்வொன்றும்' என்பதாக உள்ளது. கத்திரிக்காய்களை ஒழுங்காக எடை அளவிடுவது கடினமாய் உள்ளது, ஆகவே `Package` நெடுவரிசையில் 'bushel' என்ற சொல் உள்ள கத்திரிக்காய்களை மட்டும் தேர்ந்தெடுத்து வடிகட்டுவோம்.
1. ஆரம்ப .csv இறக்குமதியின் கீழ் கோப்பின் மேல் ஒரு வடிகட்டலைச் சேர்க்கவும்:
1. கோப்பு மேலே, ஆரம்ப .csv இறக்குமதியின் கீழ் ஒரு வடிகட்டுதலை சேர்க்கவும்:
```python
pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]
```
தரவுகளை இப்போது அச்சிடினால், நீங்கள் 'bushel' உள்ள 415 வரிசைகள் மட்டுமே பெறுவதை காணலாம்.
இப்போது நீங்கள் தரவை அச்சிடினால், 'bushel' உள்ள கத்திரிக்காய்களின் சுமார் 415 வரிசைகளை மட்டும் பெறுகிறீர்கள்.
### ஆனால் காத்திருங்கள்! இன்னும் ஒரு வேலை செய்ய வேண்டும்
### ஆனால் வந்து! இன்னும் ஒரு நடவடிக்கை உள்ளது
Bushel அளவு ஒவ்வொரு வரிசையிலும் மாறுவதை நீங்கள் கவனித்தீர்களா? நீங்கள் bushel அளவின் அடிப்படையில் விலையை காட்டுவதற்கு விலையை சீரமைக்க வேண்டும், எனவே அதை சீரமைக்க சில கணக்குகளைச் செய்யுங்கள்.
ஒவ்வொரு வரிசையும் பயனுள்ள bushel அளவு மாறுகிறதா? விலையை ஒரு bushelக்கு ஏற்ப சீரமைக்க வேண்டும், ஆகவே சீரமைப்பு கணக்கீடு செய்யவும்.
1. புதிய_pumpkins dataframe உருவாக்கும் தொகுதியின் கீழ் இந்த வரிகளைச் சேர்க்கவும்:
1. `new_pumpkins` தரவுத்தொகுதி உருவாக்கிய பின்புறம் கீழ்காணும் வரிசைகளை சேர்க்கவும்:
```python
new_pumpkins.loc[new_pumpkins['Package'].str.contains('1 1/9'), 'Price'] = price/(1 + 1/9)
@ -134,38 +134,38 @@ Bushel அளவு ஒவ்வொரு வரிசையிலும் ம
new_pumpkins.loc[new_pumpkins['Package'].str.contains('1/2'), 'Price'] = price/(1/2)
```
✅ [The Spruce Eats](https://www.thespruceeats.com/how-much-is-a-bushel-1389308) படி, bushel-இன் எடை உற்பத்தியின் வகைக்கு ஏற்ப மாறுபடும், ஏனெனில் இது ஒரு அளவளவின் அளவீடு. "உதாரணமாக, ஒரு bushel of tomatoes 56 பவுண்டுகள் எடையுடன் இருக்க வேண்டும்... இலைகள் மற்றும் பச்சை கீரைகள் அதிக இடத்தை எடுக்கும், எனவே ஒரு bushel of spinach 20 பவுண்டுகள் மட்டுமே." இது மிகவும் சிக்கலானது! பூசணிக்காய்களின் bushel-to-pound மாற்றத்தை செய்யாமல், bushel அடிப்படையில் விலை நிர்ணயிக்கலாம். பூசணிக்காய்களின் bushel பற்றிய இந்த ஆய்வு, உங்கள் தரவின் தன்மையைப் புரிந்துகொள்வது மிகவும் முக்கியம் என்பதை காட்டுகிறது!
✅ [The Spruce Eats](https://www.thespruceeats.com/how-much-is-a-bushel-1389308) படி, bushel எடை தயாரிப்பு வகை அடிப்படையில் மாறும், ஏனெனில் இது அளவு அளவிடுதலைச் சொல்கிறது. "உதாரணமாக, தக்காளி bushel 56 பவுண்ட் எடையுள்ளது ... இலைகள் மற்றும் பச்சை மணைகள் அதிக இடம் பிடிக்கின்றன ஆனால் குறைந்த எடை கொண்டுள்ளதால், பச்சை spinach bushel 20 பவுண்ட் மட்டுமே." இது எல்லாம் சிக்கலானது! bushel-ஐ பவுண்டாக மாற்றாது, bushel அடிப்படையில் விலையை நிர்ணயிப்போம். இந்த bushel கத்திரிக்காய் ஆய்வு உங்கள் தரவின் இயல்பை புரிந்து கொள்ள மிகவும் முக்கியம் என்பதை காட்டுகிறது!
இப்போது, bushel அளவின் அடிப்படையில் விலையைப் பகுப்பாய்வு செய்யலாம். தரவுகளை ஒரு முறை மேலும் அச்சிடினால், அது சீரமைக்கப்பட்டதை நீங்கள் காணலாம்.
இப்போது, bushel அளவின் அடிப்படையில் அலகின் விலையை பகுப்பாய்வு செய்யலாம். தரவை மீண்டும் அச்சிடுங்கள், அது எப்படி சீரமைக்கப்பட்டுள்ளது என்பதை காணலாம்.
✅ பாதி-bushel மூலம் விற்கப்படும் பூசணிக்காய்கள் மிகவும் விலையுயர்ந்தவை என்பதை நீங்கள் கவனித்தீர்களா? ஏன் என்பதை நீங்கள் கண்டுபிடிக்க முடியுமா? குறிப்புகள்: சிறிய பூசணிக்காய்கள் பெரியவற்றை விட மிகவும் விலையுயர்ந்தவை, ஏனெனில் ஒரு பெரிய வெற்று பை பூசணிக்காயால் எடுக்கப்படும் பயன்படுத்தப்படாத இடத்தை விட, ஒரு bushel-இல் பல சிறிய பூசணிக்காய்கள் இருக்கும்.
✅ பாதி bushel விற்கப்படும் கத்திரிக்காய் மிகவும் விலையுயர்ந்தது என்பதை நீங்கள் கவனித்தீர்களா? ஏன் என முடிவு செய்ய முடியுமா? குறிப்பு: சிறிய கத்திரிக்காய்கள் பெரியதுக்களைவிட மிகுந்த விலை கொண்டவை என்பதால், ஒரு பெரிய துளைக்குழியுள்ள பை கத்திரிக்காயால் பிடிக்கப்பெறும் இடம் தவிர்க்கப்பட்டு, bushel-க்கு அதிக எண்ணிக்கை இருக்கும் என்பதால் அதற்குக் காரணமாக இருக்கலாம்.
## காட்சிப்படுத்தல் த்திகள்
## காட்சிப்படுத்தல் த்திரங்கள்
தரவுகளுடன் வேலை செய்யும் தரவுத் விஞ்ஞானியின் பங்கு, அவர்கள் வேலை செய்யும் தரவின் தரத்தையும் தன்மையையும் காட்டுவது. இதைச் செய்ய, அவர்கள் தரவின் பல்வேறு அம்சங்களை காட்டும் சுவாரஸ்யமான காட்சிப்படுத்தல்களை, அல்லது பிளாட்கள், கிராஃப்கள் மற்றும் வரைபடங்களை உருவாக்குகிறார்கள். இந்த வழியில், அவர்கள் கண்ணுக்குத் தெரியாத உறவுகள் மற்றும் இடைவெளிகளை காட்சிப்படுத்த முடிகிறது.
தரவு அறிவியல் வல்லுநர்களின் பங்கு, வேலை செய்கிற தரவின் தரம் மற்றும் இயலை பரிசுத்தமாக்குவதுதான். இதற்காக, அவர்கள் சுவாரஸ்யமான காட்சிப்படுத்தல்களை, வரைபடங்கள், கிராப்கள் மற்றும் அட்டவணைகள் மூலம் தரவை ரடெண்டு காட்டுகின்றனர். இதை வழியாக தொடர்புகளையும் கூடுதலாக தெரியாத இடைவெளிகளையும் காட்சிப்படுத்த முடிகிறது.
[![ML for beginners - How to Visualize Data with Matplotlib](https://img.youtube.com/vi/SbUkxH6IJo0/0.jpg)](https://youtu.be/SbUkxH6IJo0 "ML for beginners - How to Visualize Data with Matplotlib")
[![ML தொடக்கர்களுக்கான - Matplotlib மூலம் தரவை காட்சிப்படுத்துவது எப்படி](https://img.youtube.com/vi/SbUkxH6IJo0/0.jpg)](https://youtu.be/SbUkxH6IJo0 "ML தொடக்கர்களுக்கான - Matplotlib மூலம் தரவை காட்சிப்படுத்துவது எப்படி")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து இந்த பாடத்திற்கான தரவுகளை காட்சிப்படுத்த ஒரு குறுகிய வீடியோவைப் பாருங்கள்.
> 🎥 இந்த படத்தை கிளிக் செய்து, பாடத்திற்கான தரவை காட்சிப்படுத்தும் குறுகிய வீடியோவை காணலாம்.
காட்சிப்படுத்தல்கள் தரவுக்கு மிகவும் பொருத்தமான மெஷின் லெர்னிங் நுட்பத்தைத் தீர்மானிக்க உதவலாம். ஒரு வரியைப் பின்பற்றும் போல தோன்றும் scatterplot, உதாரணமாக, தரவுகள் ஒரு நேரியல் ரிக்ரஷன் பயிற்சிக்குத் தகுந்தவை என்பதை காட்டுகிறது.
காட்சிப்படுத்தல்கள், தரவுக்கு ஏற்ற இயந்திரக் கற்றல் தொழில்நுட்பத்தை தீர்மானிக்கவும் உதவு. உதாரணமாக, ஒரு நிலையான கோட்டை பின்பற்றும் scatterplot அத்தகைய தரவு வரிசைக்கான Linear Regression பயிற்சிக்கு நல்ல தேர்வு என்பதை காட்டுகிறது.
Jupyter notebooks-ல் நன்றாக வேலை செய்யும் ஒரு தரவுக் காட்சிப்படுத்தல் நூலகம் [Matplotlib](https://matplotlib.org/) (நீங்கள் முந்தைய பாடத்தில் இதைப் பார்த்தீர்கள்).
Jupyter நோட்புக் ஆகியவற்றில் நன்றாக வேலை செய்யும் தரவு காட்சிப்படுத்தல் நூலகம் ஒன்று [Matplotlib](https://matplotlib.org/) ஆகும் (இதைக் கடந்த பாடத்தில் நீங்கள் பார்த்தீர்கள்).
> [இந்த பயிற்சிகளில்](https://docs.microsoft.com/learn/modules/explore-analyze-data-with-python?WT.mc_id=academic-77952-leestott) தரவுக் காட்சிப்படுத்தலில் மேலும் அனுபவம் பெறுங்கள்.
> [இந்த பயிற்சிகளில்](https://docs.microsoft.com/learn/modules/explore-analyze-data-with-python?WT.mc_id=academic-77952-leestott) தரவு காட்சிப்படுத்தலில் கூடுதல் அனுபவம் பெறுங்கள்.
## பயிற்சி - Matplotlib-ஐப் பயன்படுத்தி முயற்சிக்கவும
## பயிற்சி - Matplotlib ஐ பயன்படுத்தி முயற்சி செய்யுங்கள
நீங்கள் உருவாக்கிய புதிய dataframe-ஐ காட்சிப்படுத்த சில அடிப்படை பிளாட்களை உருவாக்க முயற்சிக்கவும். ஒரு அடிப்படை வரி பிளாட் என்ன காட்டும்?
நீங்கள் இப்போது உருவாக்கிய புதிய தரவுத்தொகுதியைப் பயன்படுத்தி அடிப்படை கோட்பாடுகளை உருவாக்க முயற்சி செய்யுங்கள். ஒரு அடிப்படை கோட்டுக் கோட்டு என்ன காட்டும்?
1. Pandas இறக்குமதியின் கீழ் கோப்பின் மேல் Matplotlib-ஐ இறக்குமதி செய்யுங்கள்:
1. கோப்பு மேலே, Pandas இறக்குமதிக்குப் பின் Matplotlib ஐ இறக்குமதி செய்க:
```python
import matplotlib.pyplot as plt
```
1. முழு notebook-ஐ மீண்டும் இயக்கி புதுப்பிக்கவும்.
1. notebook-இன் கீழே ஒரு cell சேர்த்து தரவுகளை ஒரு பெட்டியாக பிளாட் செய்யுங்கள்:
1. முழு நோட்புக் ஐ மறுகட்ட இயக்கு.
1. நோட்புக் அடியில், தரவுத்தொகுதியை பாக்சாக காட்டு ஒரு செலினை சேர்க்கவும்:
```python
price = new_pumpkins.Price
@ -174,44 +174,121 @@ Jupyter notebooks-ல் நன்றாக வேலை செய்யும
plt.show()
```
![மாதத்திற்கான விலை உறவைக் காட்டும் scatterplot](../../../../translated_images/ta/scatterplot.b6868f44cbd2051c.webp)
![விலை மற்றும் மாத உறவைக் gösteren ஒரு scatterplot](../../../../translated_images/ta/scatterplot.b6868f44cbd2051c.webp)
இது ஒரு பயனுள்ள பிளாட் ஆகும்? இதைப் பற்றி உங்களுக்கு ஏதேனும் ஆச்சரியம் இருக்கிறதா?
இது பயனுள்ள பிளாட் தானா? இதில் உங்களை ஏதேனும் அதிர்ச்சியடையவைக்குமா?
இது குறிப்பாக பயனுள்ளதாக இல்லை, ஏனெனில் இது உங்கள் தரவுகளை ஒரு குறிப்பிட்ட மாதத்தில் புள்ளிகளின் பரப்பாக மட்டுமே காட்டுகிறது.
இது குறிப்பாக பயனுள்ளதாக இல்லை, ஏனெனில் ஒரு மாதத்தில் உள்ள உங்கள் தரவை புள்ளிகள் பரவலாகக் காட்டுகிறது மட்டும்.
### இதை பயனுள்ளதாக மாற்றுங்கள்
### இதை பயனுள்ளதாக மாற்று
ட்டைகள் பயனுள்ள தரவுகளை காட்ட, நீங்கள் பொதுவாக தரவுகளை எவ்விதமாகக் குழுவாக்க வேண்டும். தரவுகள் விநியோகத்தை காட்டும் ஒரு பிளாட்டை உருவாக்க முயற்சிக்கலாம், இதில் y அச்சு மாதங்களை காட்டுகிறது.
யனுள்ள தரவை காட்சிப்படுத்த, தரவினை எப்போது எடு வேறு வகையில் குழுவாக்க வேண்டும். வாரிசையின் y அச்சு மாதங்களை காட்டும் ஒரு காட்சி உருவட்ச் பண்ண முயற்சி செய்யுங்கள், மேலும் தரவு பகிர்ச்சி காட்டும்.
1. தரவுகளை குழுவாக்கிய பட்டை வரைபடம் உருவாக்க ஒரு cell சேர்க்கவும்:
1. முலநோக்கில் ஒரு குழுவாகப்பட்ட பட்டை விளக்கப்படம் உருவாக்க ஒரு செல்களைச் சேர்க்கவும்:
```python
new_pumpkins.groupby(['Month'])['Price'].mean().plot(kind='bar')
plt.ylabel("Pumpkin Price")
```
![மாதத்திற்கான விலை உறவைக் காட்டும் பட்டை வரைபடம்](../../../../translated_images/ta/barchart.a833ea9194346d76.webp)
![விலை மற்றும் மாத உறவைக் காட்டும் பட்டை விளக்கப்படம்](../../../../translated_images/ta/barchart.a833ea9194346d76.webp)
இது மிகவும் பயனுள்ள தரவு காட்சிப்படுத்தல்! கத்திரிக்காய்களின் அதிகபட்ச விலை செப்டம்பர் மற்றும் அக்டோபர் மாதங்களில் நிகழ்ந்ததாகத் தெரிவிக்கிறது. இது உங்கள் எதிர்ப்பார்ப்புக்கு ஏற்றதா? ஏன் அல்லது ஏன் இல்லை என்பதை விவாதிக்கவும்.
## பயிற்சி - Seaborn உடன் முயற்சி செய்யுங்கள்
Matplotlib பலவீனமான ஒன்று, ஆனால் ஒரு பிராட்டோயை முழுமையாக உருவாக்க அதன் பயன்பாடு அதிகமாகும். [Seaborn](https://seaborn.pydata.org/) என்பது Matplotlib மேல் கட்டப்பட்ட ஒரு நூலகமாகும், இது புள்ளிவிவர தரவு காட்சிப்படுத்தலுக்காக வடிவமைக்கப்பட்டுள்ளது. இது நேரடியாக Pandas தரவுத்தொகுதிகளுடன் வேலை செய்கிறது, அழகான முன்னிருப்பு வடிவமைப்புகளை பயன்படுத்துகிறது மற்றும் குறைவான குறியீட்டு மூலம் தகவலாகச் செய்யும் பிளாட்டுகளை உருவாக்க அனுமதிக்கிறது. Seaborn Matplotlib பொருட்களை வழங்குவதால், Matplotlib பற்றி நீங்கள் ஏற்கனவே அறிந்த அனைத்தையும் பயன்படுத்தி முடிவுகளை நுணுக்கமாகக் காட்டலாம்.
> நீங்கள் இன்னும் Seaborn நிறுவவில்லை என்றால், `pip install seaborn` கொண்டு நிறுவுங்கள்.
1. நோட்புக் மற்றும் மற்ற இறக்குமதிகளுக்கு கீழ் Seaborn ஐ இறக்குமதி செய்க. வழக்கமாக இது `sns` என்றழைக்கப்படுகிறது:
```python
import seaborn as sns
```
### தொடர்புகளை காட்ட ஸ்காட்டர் பிளாட்டுகள்
மாதிரி கட்டுப்படுத்த முன் தரவின்போது _தொடர்புகள்_ தேடும் ஒரு பெரிய பகுதி. ஒரு [ஸ்காட்டர் பிளாட்](https://en.wikipedia.org/wiki/Scatter_plot) இதற்கான சிறந்த கருவிகளில் ஒன்றாகும்: புள்ளிகள் கோட்டு பின்பற்றுவதாக தோன்றினால், இரண்டு மாறிலிகள் தொடர்புடையதாயிருக்கலாம், இது ஒரு நல்ல அடையாளம் அந்தக் கோட்டர் Regression மாதிரி வேலை செய்யும்.
1. முன்பு இருந்த விலை-மாத ஸ்காட்டர் பிளாட் Seaborn இன் [`relplot()`](https://seaborn.pydata.org/generated/seaborn.relplot.html) (உறவு பிளாக்) கொண்டு மீண்டும் உருவாக்குங்கள், இது நேரடியாக உங்கள் தரவுத்தொகுதியில் உள்ள நெடுவரிசைகளுடன் வேலை செய்யும்:
```python
sns.relplot(x="Price", y="Month", data=new_pumpkins)
```
![விலை மற்றும் மாத உறவுக் காட்டும் Seaborn ஸ்காட்டர் பிளாட்](../../../../translated_images/ta/relplot.a03837d8f0329cec.webp)
எப்படி நீங்கள் _நெடுவரிசை பெயர்களையும்_ மற்றும் தரவுத்தொகுதியையும் அனுப்புகிறீர்கள் மற்றும் Seaborn அதன் அச்சு தலைப்புக்களை கவனிக்கும் என்பதை கவனிக்கவும்.
2. நீங்கள் `kind="line"` என அனுப்பி கோட்டு பிளாட்டுக்கு மாற்றலாம். Seaborn கோட்டின் சுற்றிலும் நம்பிக்கை இடைவெளியை காட்டும் மூடி பட்டையை கூட வரைந்திருக்கும்:
```python
sns.relplot(x="Price", y="Month", kind="line", data=new_pumpkins)
```
![விலை மற்றும் மாத உறவைக் காட்டும் Seaborn கோட்டு பிளாட்](../../../../translated_images/ta/lineplot.f9034ba47b1e30ee.webp)
இந்த குறிப்பிட்ட தரவு கொஞ்சம் சத்தமாக உள்ளது, ஆகையால் கோட்டு பிளாட் மிகவும் தெளிவான தேர்வு அல்ல - ஆனால் Seaborn-ல் எப்படி எளிதாக விளக்கப்பட வகைகளை மாற்றலாம் என்பதை காட்டுகிறது.
### பகிர்ச்சிகளை காட்ட பட்டை விளக்கப்படங்கள்
முன்பு நீங்கள் கைமுறையில் தரவுகளை குழுத்து செய்து Matplotlib கொண்டு ஒரு பட்டியல் வரைபடத்தை உருவாக்கி இருந்தீர்கள். Seaborn இன் [`catplot()`](https://seaborn.pydata.org/generated/seaborn.catplot.html) (வகைபடுத்தப்பட்ட வரைபடம்) உங்கள் சார்பாக குழுத்தலும் கூட்டுத்தலும் செய்ய முடியும். இயல்புநிலையில் `kind="bar"` ஒவ்வொரு வகையின் சராசரி மதிப்பையும் நம்பகத்தன்மை பரப்பை குறிக்கும் கருப்பு கோடு உடன் காட்டுகிறது.
1. மாதம் ஒன்றுக்கான சராசரி விலையின் பட்டியல் வரைபடத்தை உருவாக்கவும்:
```python
sns.catplot(x="Month", y="Price", data=new_pumpkins, kind="bar")
```
![A Seaborn bar chart showing the price distribution per month](../../../../translated_images/ta/catplot.e73fc35fdf96242b.webp)
இது Matplotlib மூலம் நீங்கள் பார்த்ததை உறுதிப்படுத்துகிறது — விலைகள் செப்டம்பர் மற்றும் அக்டோபர் மாதங்களில் உச்சக்கட்டத்தில் இருக்கும் — ஆனால் Seaborn ஒவ்வொரு மாதத்திற்குள் விலை _மாறுபடுவதை_ காணக்கூடியவாறு காட்சிப்படுத்துகிறது.
### தொடர்புகளை காண காட்டும் ஹீட்மேப்கள்
இரு மாறிலிகளை ஒரே நேரத்தில் ஒப்பிட ஸ்காட்டர் வரைபடங்கள் பயன்படுகின்றன. பல நுண்ணணுக்களை கொண்டுள்ள போது, [ஹீட்மேப்](https://en.wikipedia.org/wiki/Heat_map) ஒவ்வொரு ஜோடிப் பத்திகளுக்கும் இடையேயான உறவின் வலிமையை ஒரே நேரத்தில் பார்க்க உதவுகிறது. இது எந்த அம்சங்கள் அதிகமாக தொடர்புடையவை என்பதை கண்டுபிடிக்க பொதுவாக பயன்படுத்தப்படும் வழி, பின்னர் எந்த பத்திகளை மாதிரியில் பயன்படுத்துவது என்று தீர்மானிக்கப் பயன்படும் (அதே வகையான வரைபடம் தரவுத்தொகுப்புகளுக்கான குழப்ப அட்டவணைகளை காட்டும் போது பெறப்படுகிறது).
1. Pandas கொண்டு தொடர்பு அக Matrிக்ஸ் உருவாக்கி பிறகு Seaborn இன் [`heatmap()`](https://seaborn.pydata.org/generated/seaborn.heatmap.html) மூலம் வரையவும். `annot=True` விருப்பம் ஒவ்வொரு செலிலும் தொடர்பு மதிப்புக்களை அச்சிடும்:
```python
correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()
sns.heatmap(correlations, annot=True, cmap="coolwarm")
```
![A Seaborn heatmap showing correlations between the numeric columns](../../../../translated_images/ta/heatmap.bd98dce43b404c57.webp)
`1` (அல்லது `-1`) க்கு அருகிலுள்ள மதிப்புகள் பத்திகள் மிகவும் _சேர்க்கப்பட்டவை_ என்பதைக் குறிக்கின்றன. `Low Price` மற்றும் `High Price` இணைப்புகள் மிக நெருக்கமாக இருப்பதை கவனியுங்கள். மற்றுபுறம், `Month` விலை தொடர்பாக தளர்ந்த நேர்காணல் வெளிப்படுத்துகிறது — மேலுள்ள பட்டியல் வரைபடம் செப்டம்பர் மற்றும் அக்டோபர் மாதங்களில் தெளிவான பருவ உச்சியை காட்டினாலும். இது முக்கிய பாடம்: தொடர்பு கூட்டுத்தகங்கள் _சரள கோப்பு_ குறிகளையே அளவிடுகிறது, ஆகையால் பருவ அல்லது பிற அலகாற்றாத நுணுக்கங்களைக் காணாமலிருக்கலாம். ✅ தொடர்பு ஹீட்மேப் *மற்றும்* பட்டியல் வரைபடம் ஆகிய இரண்டையும் பார்க்கும் பயனில்லை ஏன் என்பதை விளக்கவும்.
### Matplotlib அல்லது Seaborn?
இரு நூலகங்களும் அறிந்திருப்பது பயனுள்ளது:
- **Matplotlib** ஒரு வரைபடத்தின் ஒவ்வொரு அங்கத்தையும் நுணுக்கமாக கட்டுப்படுத்த அனுமதிக்கிறது மற்றும் Python இல் பல இடர்பாட கலைமுறை நூலகத்துக்கான அடித்தளம் ஆகும்.
- **Seaborn** மதிப்பீட்டு வரைபடங்களுக்கு மேல்நிலை செயல்பாடுகள் மற்றும் கவர்ச்சிகராக இருப்பதை வழங்குகிறது, dataframes உடனடியாக வேலை செய்கிறது மற்றும் ஆராய்ச்சி தரவு பகுப்பாய்வுக்கு விரைவாக பயன்படுகிறது.
இது ஒரு பயனுள்ள தரவுக் காட்சிப்படுத்தல்! பூசணிக்காய்களின் மிக உயர்ந்த விலை செப்டம்பர் மற்றும் அக்டோபரில் உள்ளது என்று தோன்றுகிறது. இது உங்கள் எதிர்பார்ப்பை பூர்த்தி செய்கிறதா? ஏன் அல்லது ஏன் இல்லை?
பொதுவான பணிச் சீரமைப்பு ஆராய்ச்சிக்காக Seaborn கையாளவும், பின்னர் தேவையான சிறப்பம்சங்களுக்கு Matplotlib க்கு செல்லவும் ஆகும்.
---
## 🚀சவால்
Matplotlib வழங்கும் பல்வேறு வகையான காட்சிப்படுத்தல்களை ஆராயுங்கள். Regression பிரச்சினைகளுக்கு எந்த வகைகள் மிகவும் பொருத்தமானவை?
Matplotlib மற்றும் Seaborn வழங்கும் பல்வேறு வகையான காட்சிப்படுத்தல்களை ஆராயுங்கள். எந்த வகைகள் பிணைப்பு பிரச்சினைகளுக்கு அதிக பொருத்தமாகும்?
## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [பாட முடிவு வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## மதிப்பீடு & சுயபடிப்பு
## விமர்சனம் & சுயமரியாதை
தரவுகளை காட்சிப்படுத்த பல்வேறு வழிகளைப் பாருங்கள். கிடைக்கும் நூலகங்களின் பட்டியலை உருவாக்கி, 2D காட்சிப்படுத்தல்களுக்கு எதிராக 3D காட்சிப்படுத்தல்களுக்கு சிறந்தவை எவை என்பதை குறிப்பிட்டு, குறிப்பிட்ட வகையான பணிகளுக்கு சிறந்தவை எவை என்பதை கவனியுங்கள். நீங்கள் என்ன கண்டுபிடிக்கிறீர்கள்?
தரவை காட்சிப்படுத்தும் பல வழிகளை பாருங்கள். பல நூலகங்களின் பட்டியலை தயார் செய்து, 2D மற்றும் 3D காட்சிப்படுத்தலுக்கு ஏற்றவையாக எவை என்பதை குறிப்பிடுங்கள். நீங்கள் என்ன கண்டறிந்தீர்கள்?
## பணிக்கட்டளை
## பணிகள்
[காட்சிப்படுத்தல்களை ஆராய்வது](assignment.md)
[காட்சிப்படுத்தலை ஆராய்தல்](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கிறோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,7 +4,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## பம்ப்கின்களுக்கான நேரியல் ரெக்ரஷன் - பாடம் 2\n"
"## பூசணிக்காய்க்கான நேரியல் வரிசை கணக்கு - பாடம் 2\n"
]
},
{
@ -222,6 +222,7 @@
"source": [
"import pandas as pd\n",
"import matplotlib.pyplot as plt\n",
"import seaborn as sns\n",
"pumpkins = pd.read_csv('../../data/US-pumpkins.csv')\n",
"\n",
"pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]\n",
@ -385,18 +386,78 @@
"plt.ylabel(\"Pumpkin Price\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## சியாபார்னுடன் காட்சி வடிவமைத்தல்\n",
"\n",
"[Seaborn](https://seaborn.pydata.org/) என்பது Matplotlib மேல் கட்டமைக்கப்பட்டு, நேரடியாக டேட்டாபிரேம்களோடு செயல்படுகிறது, சேர்மணமான புள்ளியியல் வரைபடங்களை மிக குறுகிய குறியீட்டுடன் விரைவில் உருவாக்க உதவுகிறது.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### உறவுகளை mostrar செய்ய திரை புள்ளி வரைபடங்கள்\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.relplot(x=\"Price\", y=\"Month\", data=new_pumpkins)"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.relplot(x=\"Price\", y=\"Month\", kind=\"line\", data=new_pumpkins)"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### பகிர்வுகளைக் காட்ட பர்த் சார்ட்கள்\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"sns.catplot(x=\"Month\", y=\"Price\", data=new_pumpkins, kind=\"bar\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"### தொடர்புகளை காண்பிக்க ஹீட்மேப்புகள்\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"metadata": {},
"outputs": [],
"source": []
"source": [
"correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()\n",
"sns.heatmap(correlations, annot=True, cmap=\"coolwarm\")"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"\n---\n\n**குறிப்பு**: \nஇந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கிறோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**மறுப்பு**:\nஇந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -426,13 +487,7 @@
"hash": "70b38d7a306a849643e446cd70466270a13445e5987dfa1344ef2b127438fa4d"
}
},
"orig_nbformat": 2,
"coopTranslator": {
"original_hash": "95726f0b8283628d5356a4f8eb8b4b76",
"translation_date": "2025-10-11T12:24:45+00:00",
"source_file": "2-Regression/2-Data/solution/notebook.ipynb",
"language_code": "ta"
}
"orig_nbformat": 2
},
"nbformat": 4,
"nbformat_minor": 2

@ -1,188 +1,210 @@
# ஹோட்டல் விமர்சனங்களுடன் உணர்ச்சி பகுப்பாய்வு - தரவுகளை செயலாக்குதல்
# ஹோட்டல் மதிப்பாய்வுகளுடன் உணர்வுப்பூர்வமான பகுப்பாய்வு - தரவுகளை செயலாக்குதல்
இந்த பகுதியில், நீங்கள் முந்தைய பாடங்களில் உள்ள தொழில்நுட்பங்களைப் பயன்படுத்தி ஒரு பெரிய தரவுத்தொகுப்பின் ஆராய்ச்சி தரவுப் பகுப்பாய்வைச் செய்வீர்கள். பல்வேறு பத்திகளின் பயன்தன்மையைப் பற்றிய நல்ல புரிதலைப் பெற்ற பிறகு, நீங்கள் கற்றுக்கொள்வீர்கள்:
இந்த பிரிவு முன் பாடங்களில் கற்றுக்கொண்ட நுட்பங்களைப் பயன்படுத்தி ஒரு பெரிய தரவுத்தொகுப்பின் ஆராய்ச்சி தரவு பகுப்பாய்வைச் செய்வீர்கள். பல்வேறு நெடுவரிசைகளின் பயன்பாட்டைப் புரிந்துகொண்ட பிறகு, நீங்கள் கற்றுக்கொள்ளப்போகும்போது:
- தேவையற்ற பத்திகளை எப்படி நீக்குவது
- உள்ளமைந்த பத்திகளை அடிப்படையாகக் கொண்டு புதிய தரவுகளை எப்படி கணக்கிடுவது
- இறுதி சவாலில் பயன்படுத்தும் வகையில் பெறப்பட்ட தரவுத்தொகுப்பை எப்படி சேமிக்க வேண்டும்
- தேவையில்லாத நெடுவரிசைகளை எப்படி அகற்றுவது
- உள்ள நெடுவரிசைகளின் அடிப்படையில் சில புதிய தரவுகளை எப்படி கணக்கிடுவது
- இறுதிப் பயிற்சிக்கான பயன்படுத்துவதற்கான உருவாக்கப்பட்ட தரவுத்தொகுப்பை எப்படி சேமிப்பது
## [பாடத்திற்கு முந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [முன்பாடப் தேர்வு](https://ff-quizzes.netlify.app/en/ml/)
### அறிமுகம்
ப்போது வரை, உரை தரவுகள் எண் வகை தரவுகளிலிருந்து எவ்வாறு மாறுபடுகின்றன என்பதைப் பற்றி நீங்கள் கற்றுக்கொண்டுள்ளீர்கள். மனிதனால் எழுதப்பட்ட அல்லது பேசப்பட்ட உரை என்றால், அதில் முறை மற்றும் அடிக்கடி பயன்படுத்தப்படும் வார்த்தைகள், உணர்ச்சி மற்றும் அர்த்தத்தை கண்டறிய முடியும். இந்தப் பாடம் உங்களை ஒரு உண்மையான சவாலுடன் கூடிய ஒரு உண்மையான தரவுத்தொகுப்புக்குள் அழைத்துச் செல்கிறது: **[ஐரோப்பாவில் 515K ஹோட்டல் விமர்சனங்கள் தரவுகள்](https://www.kaggle.com/jiashenliu/515k-hotel-reviews-data-in-europe)** மற்றும் [CC0: பொது டொமைன் உரிமம்](https://creativecommons.org/publicdomain/zero/1.0/) உடன் சேர்க்கப்பட்டுள்ளது. இது Booking.com இல் இருந்து பொது ஆதாரங்களில் இருந்து சேகரிக்கப்பட்டது. இந்த தரவுத்தொகுப்பின் உருவாக்குனர் ஜியாஷென் லியூ.
துவரை நீங்கள் கற்றுக்கொண்டிருக்கின்றீர்கள், உரை தரவு எண் தரவுகளுக்கு முற்றிலும் வேறுபடுகிறது. அது மனிதனால் எழுதப்பட்ட அல்லது பேசப்பட்டதாயிருந்தால், அதில் உள்ள மாதிரிகள், மீண்டும் தோன்றல்கள், உணர்வு மற்றும் பொருளைக் கண்டுபிடிக்க முடியும். இந்த பாடம் நிஜ தரவுத்தொகுப்பில் நிஜ சவாலைத் தாங்கி உங்களை கொண்டு செல்கிறது: **[ஐரோப்பாவில் 515 கே ஹோட்டல் மதிப்பாய்வுகள் தரவு](https://www.kaggle.com/jiashenliu/515k-hotel-reviews-data-in-europe)** மற்றும் ஒரு [CC0: பொது துறை உரிமம்](https://creativecommons.org/publicdomain/zero/1.0/) கொண்டது. இது Booking.com இன் பொது மூலங்களிலிருந்து சேகரிக்கப்பட்டது. இந்த தரவுத்தொகுப்பின் உருவாக்குனர் ஜியாஷென் லியூ.
### தயாரிப்ப
### தயார் செய்வத
உங்களுக்கு தேவையானவை:
* Python 3 பயன்படுத்தி .ipynb நோட்புக்குகளை இயக்கும் திறன்
* Python 3 பயன்படுத்தி .ipynb நோட்புக்-களை இயக்கும் திறன்
* pandas
* NLTK, [உங்கள் கணினியில் நிறுவ வேண்டும்](https://www.nltk.org/install.html)
* இந்த NLP பாடங்களுடன் தொடர்புடைய `/data` அடைவில் பதிவிறக்கம் செய்யக்கூடிய [515K ஹோட்டல் விமர்சனங்கள் தரவுகள்](https://www.kaggle.com/jiashenliu/515k-hotel-reviews-data-in-europe) தரவுத்தொகுப்பு. இது சுமார் 230 MB ஆகும்.
* NLTK, [இதை நீங்கள் உள்ளூர் முறையில் நிறுவ வேண்டும்](https://www.nltk.org/install.html)
* இந்த தரவுத்தொகுப்பு Kaggle இல் கிடைக்கிறது [515K Hotel Reviews Data in Europe](https://www.kaggle.com/jiashenliu/515k-hotel-reviews-data-in-europe). இது சுமார் 230 MB அளவுக்கு உள்ளது. அதை இந்த NLP பாடங்களுக்கான ரூட் `/data` அடைவுக்கு பதிவிறக்கம் செய்யவும்.
## ஆராய்ச்சி தரவுப் பகுப்பாய்வு
## ஆராய்ச்சி தரவு பகுப்பாய்வு
இந்த சவால், உணர்ச்சி பகுப்பாய்வு மற்றும் விருந்தினரின் மதிப்பீட்டு மதிப்புகளைப் பயன்படுத்தி ஒரு ஹோட்டல் பரிந்துரை போட்டை உருவாக்குவதை நோக்கமாகக் கொண்டுள்ளது. நீங்கள் பயன்படுத்தும் தரவுத்தொகுப்பில் 6 நகரங்களில் உள்ள 1493 வெவ்வேறு ஹோட்டல்களின் விமர்சனங்கள் அடங்கும்.
இந்த சவால் நீங்கள் உணர்வுப்பூர்வமான பகுப்பாய்வைக் கொண்டு மற்றும் விருந்தினர் மதிப்பீடு மதிப்பெண்களைப் பயன்படுத்தி ஒரு ஹோட்டல் பரிந்துரை செயற்கை நுண்ணறிவு அமைப்பை உருவாக்குகிறீர்கள் என்று கருதுகிறது. நீங்கள் பயன்படுத்தவிருக்கும் தரவுத்தொகுப்பில் 6 நகரங்களில் உள்ள 1493 வெவ்வேறு ஹோட்டல்களின் மதிப்பாய்வுகள் உள்ளன.
Python, ஹோட்டல் விமர்சனங்களின் தரவுத்தொகுப்பு மற்றும் NLTK இன் உணர்ச்சி பகுப்பாய்வைப் பயன்படுத்தி, நீங்கள் கண்டறிய முடியும்:
பைதான், ஹோட்டல் மதிப்பாய்வுகளின் தரவுத்தொகுப்பு மற்றும் NLTK உணர்வு பகுப்பாய்வு மூலம் நீங்கள் கண்டுபிடிக்க முடியும்:
* விமர்சனங்களில் அதிகமாக பயன்படுத்தப்படும் வார்த்தைகள் மற்றும் சொற்றொடர்கள் என்ன?
* ஒரு ஹோட்டலை விவரிக்கும் அதிகாரப்பூர்வ *டேக்கள்* விமர்சன மதிப்பீடுகளுடன் தொடர்புடையதா? (எ.கா. *இளம் குழந்தைகளுடன் குடும்பம்* என்ற டேக் கொண்ட ஹோட்டலுக்கு எதிர்மறையான விமர்சனங்கள் அதிகமாக உள்ளதா? இது *தனிப்பட்ட பயணிகளுக்கு* சிறந்தது என்பதை குறிக்கிறதா?)
* NLTK உணர்ச்சி மதிப்பீடுகள் ஹோட்டல் விமர்சகரின் எண் மதிப்பீட்டுடன் 'ஒத்துப்போகிறதா'?
* மதிப்பாய்வுகளில் மிக அதிகம் பயன்படுத்தப்படும் வார்த்தைகள் மற்றும் சொற்றொடர்கள் என்ன?
* ஹோட்டலை விவரிக்கும் அதிகாரப்பூர்வ *டேக்கள்* மதிப்பாய்வு மதிப்பெண்களுடன் தொடர்புடையதா (உதா: ஒரு ஹோட்டலின் *இளம் குழந்தைகளுடன் குடும்பம்* என்ற மதிப்பாய்வுகள் *தனித்து பயணிப்பவர்* என்ற மதிப்பாய்வுகளுக்குக் காட்டிலும் அதிகமாக எதிர்மறையா? இது *தனிப்பட்ட பயணிகளுக்கு* மேலாண்மை சிறந்ததாக இருத்தலையே குறிக்கக்கூடும்?)
* NLTK உணர்வு மதிப்பெண்கள் ஹோட்டல் மதிப்பாய்வாளர் அளித்த எண் மதிப்பெண்களுடன் 'ஒரே கருத்தில் உள்ளன'வா?
#### தரவுத்தொகுப்பு
நீங்கள் பதிவிறக்கம் செய்து உள்ளூர் சேமித்துள்ள தரவுத்தொகுப்பை ஆராய்வோம். அந்த கோப்பை VS Code அல்லது Excel போன்ற எடிட்டரில் திறக்கவும்.
நீங்கள் பதிவிறக்கம் செய்து உள்ளூரில் சேமித்துள்ள தரவுத்தொகுப்பை ஆராய்வோம். ஒரு தொகுப்பியில், உதாரணமாக VS Code அல்லது Excelல் கோப்பைப் திறக்கவும்.
தரவுத்தொகுப்பில் உள்ள தலைப்புகள் பின்வருமாறு உள்ளன:
தரவுத்தொகுப்பில் தலைப்புகள் பின்வருமாறு உள்ளன:
*Hotel_Address, Additional_Number_of_Scoring, Review_Date, Average_Score, Hotel_Name, Reviewer_Nationality, Negative_Review, Review_Total_Negative_Word_Counts, Total_Number_of_Reviews, Positive_Review, Review_Total_Positive_Word_Counts, Total_Number_of_Reviews_Reviewer_Has_Given, Reviewer_Score, Tags, days_since_review, lat, lng*
இவை கீழே கொடுக்கப்பட்டுள்ளவாறு குழுவாக பிரிக்கப்பட்டுள்ளன:
##### ஹோட்டல் பத்திகள்
இவை கீழ்வருமாறு பிரிக்கப்பட்டுள்ளன:
##### ஹோட்டல் நெடுவரிசைகள்
* `Hotel_Name`, `Hotel_Address`, `lat` (அட்சரேகை), `lng` (நெடுகோடு)
* *lat* மற்றும் *lng*ப் பயன்படுத்தி, ஹோட்டல் இடங்களை காட்டும் வரைபடத்தை Python மூலம் வரைந்து காட்டலாம் (எதிர்மறை மற்றும் நேர்மறை விமர்சனங்களுக்கு வண்ண குறியீடு செய்யலாம்)
* Hotel_Address எங்களுக்கு தெளிவாக பயனுள்ளதாக இல்லை, மேலும் எளிதாக வரிசைப்படுத்த மற்றும் தேட ஒரு நாட்டுடன் அதை மாற்றுவோம்
* `Hotel_Name`, `Hotel_Address`, `lat` (அட்சரேகை), `lng` (நீளிரேகை)
* *lat* மற்றும் *lng* பயன்படுத்தி பைதானில் ஹோட்டல் இருப்பிடங்களை வரைபடமாக உருவாக்கலாம் (எதிர்மறை மற்றும் நேர்மறை மதிப்பாய்வுகளுக்காக வண்ணமயமாக்கலாம்)
* Hotel_Address எங்களுக்கு தெளிவாக பயன்படுவதில்லை, அதனால் நாம் இதனை ஒரு நாட்டுக்காக மாற்றி எளிதான வரிசைப்படுத்தல் மற்றும் தேடலுக்கு மாற்றலாம்
**ஹோட்டல் மெட்டா-விமர்சன பத்திகள்**
**ஹோட்டல் மெட்டா-மதிப்பாய்வு நெடுவரிசைகள்**
* `Average_Score`
* தரவுத்தொகுப்பு உருவாக்குனரின் படி, இந்த பத்தி *கடந்த ஆண்டில் உள்ள சமீபத்திய கருத்து அடிப்படையில் கணக்கிடப்பட்ட ஹோட்டலின் சராசரி மதிப்பெண்* ஆகும். இது ஒரு விசித்திரமான முறையாகத் தோன்றுகிறது, ஆனால் இது சேகரிக்கப்பட்ட தரவாகும், எனவே நாங்கள் அதை தற்போதைக்கு அப்படியே எடுத்துக்கொள்வோம்.
* தரவுத்தொகுப்பின் உருவாக்குனர் கூறியதில், இந்த நெடுவரிசை *கடந்த ஆண்டு புதிய கருத்தின் அடிப்படையில் கணக்கிடப்பட்ட ஹோட்டலின் சராசரி மதிப்பெண்* ஆகும். இது மதிப்பெண்களை கணக்கிடும் அசாதாரண வழி போல தெரிந்தாலும், தரவு எரி பெறப்பட்டதுக்காக இதனை தற்போது பெறப்பட்டதாக கருதலாம்.
✅ இந்த தரவின் பிற பத்திகளை அடிப்படையாகக் கொண்டு சராசரி மதிப்பெண்ணை கணக்கிட வேறு வழி ஒன்றை நீங்கள் யோசிக்க முடியுமா?
✅ இந்த தரவுத்தொகுப்பில் உள்ள மற்ற நெடுவரிசைகளின் அடிப்படையில், சராசரி மதிப்பெண் கணக்கிட வேறொரு வழி உங்களுக்குத் தெரிகிறதா?
* `Total_Number_of_Reviews`
* இந்த ஹோட்டல் பெற்றுள்ள மொத்த விமர்சனங்களின் எண்ணிக்கை - இது தரவுத்தொகுப்பில் உள்ள விமர்சனங்களை குறிக்கிறதா என்பதை (சில குறியீடுகளை எழுதாமல்) தெளிவாகக் கூற முடியாது.
* இந்த ஹோட்டல் பெற்ற முழு மதிப்பாய்வுகளின் எண்ணிக்கை - இவை தரவுத்தொகுப்பில் உள்ள மதிப்பாய்வுகளா என்பது தெளிவில்லை (சில குறியீடு எழுதாமல்)
* `Additional_Number_of_Scoring`
* இது ஒரு மதிப்பீடு அளிக்கப்பட்டது என்றாலும், விமர்சகர் எந்த நேர்மறை அல்லது எதிர்மறை விமர்சனத்தையும் எழுதவில்லை என்பதைக் குறிக்கிறது
* இது ஒரு மதிப்பெண் அளிக்கப்பட்டது என்றாலும் மதிப்பாய்வாளர் நேர்மறை அல்லது எதிர்மறை மதிப்பாய்வை எழுதவில்லை என்ற பொருள்
**விமர்சன பத்திகள்**
**மதிப்பாய்வு நெடுவரிசைகள்**
- `Reviewer_Score`
- இது குறைந்தபட்சம் 1 தசம புள்ளி கொண்ட எண் மதிப்பாகும், குறைந்தபட்ச மதிப்பான 2.5 மற்றும் அதிகபட்ச மதிப்பான 10 இடையே இருக்கும்.
- ஏன் 2.5 குறைந்தபட்ச மதிப்பாக உள்ளது என்பது விளக்கப்படவில்லை.
- இது குறைந்தபட்சம் மற்றும் அதிகபட்சம் மதிப்புகள் 2.5 மற்றும் 10 இடையேயான மிக உயர பருமனுடன் ஒரு எண் மதிப்பு ஆகும்
- 2.5 என்பது மிகக் குறைந்த மதிப்பெண் என்பதை ஏன் என்று விளக்கப்படவில்லை
- `Negative_Review`
- ஒரு விமர்சகர் எதுவும் எழுதவில்லை என்றால், இந்த புலத்தில் "**No Negative**" இருக்கும்.
- ஒரு விமர்சகர் எதிர்மறை விமர்சன பத்தியில் நேர்மறை விமர்சனத்தை எழுதலாம் என்பதை கவனிக்கவும் (எ.கா. "இந்த ஹோட்டலில் எந்த தவறும் இல்லை").
- மதிப்பாய்வாளர் எதுவும் எழுதவில்லை என்றால், இந்த நெடுவரிசையில் "**எந்த எதிர்மறையும் இல்லை**" என்று இருக்கும்
- கவனிக்கவும், மதிப்பாய்வாளர் நேர்மறை மதிப்பாய்வை எதிர்மறை மதிப்பாய்வு நெடுவரிசையில் எழுதக்கூடும் (உதா: "இந்த ஹோட்டலில் எதுவும் கெட்டதில்லை")
- `Review_Total_Negative_Word_Counts`
- அதிக எதிர்மறை சொல் எண்ணிக்கை குறைந்த மதிப்பீட்டை குறிக்கிறது (உணர்ச்சியை சரிபார்க்காமல்).
- அதிக எதிர்மறை வார்த்தை எண்ணிக்கை குறைந்த மதிப்பெண் என்பதை குறிக்கலாம் (உணர்வு சோதனை செய்யாமல்)
- `Positive_Review`
- ஒரு விமர்சகர் எதுவும் எழுதவில்லை என்றால், இந்த புலத்தில் "**No Positive**" இருக்கும்.
- ஒரு விமர்சகர் நேர்மறை விமர்சன பத்தியில் எதிர்மறை விமர்சனத்தை எழுதலாம் என்பதை கவனிக்கவும் (எ.கா. "இந்த ஹோட்டலில் எந்த நல்லதும் இல்லை").
- மதிப்பாய்வாளர் எதுவும் எழுதவில்லை என்றால், இந்த நெடுவரிசையில் "**எந்த நேர்மறையும் இல்லை**" என்று இருக்கும்
- கவனிக்கவும், மதிப்பாய்வாளர் எதிர்மறை மதிப்பாய்வை நேர்மறை நெடுவரிசையில் எழுதக்கூடும் (உதா: "இந்த ஹோட்டலில் நல்லதெதுவும் இல்லை")
- `Review_Total_Positive_Word_Counts`
- அதிக நேர்மறை சொல் எண்ணிக்கை அதிக மதிப்பீட்டை குறிக்கிறது (உணர்ச்சியை சரிபார்க்காமல்).
- அதிக நேர்மறை வார்த்தை எண்ணிக்கை அதிக மதிப்பெண் என்பதை குறிக்கலாம் (உணர்வு சோதனை செய்யாமல்)
- `Review_Date` மற்றும் `days_since_review`
- ஒரு விமர்சனத்திற்கு புதியதா அல்லது பழையதா என்பதை அளவிடலாம் (பழைய விமர்சனங்கள் புதியவற்றைப் போல துல்லியமாக இருக்காது, ஏனெனில் ஹோட்டல் மேலாண்மை மாறியிருக்கலாம் அல்லது புதுப்பிப்பு செய்யப்பட்டிருக்கலாம் அல்லது ஒரு நீச்சல் குளம் சேர்க்கப்பட்டிருக்கலாம்).
- ஒரு புதியவை அல்லது பழையவை என்ற அளவுகோல் மதிப்பாய்வுக்கு பொருந்தக்கூடும் (பழைய மதிப்பாய்வுகள் இன்றையவை போல துல்லியமாக இருக்காது, காரணம் ஹோட்டல் மேலாண்மை மாறியிருப்பது, புதுப்பிப்புகள் நடந்திருப்பது, அல்லது ஒரு குளம் சேர்க்கப்பட்டதுபோன்றவை)
- `Tags`
- இவை ஒரு விமர்சகர் தங்களை விவரிக்கத் தேர்ந்தெடுக்கக்கூடிய குறுகிய விளக்கங்கள் (எ.கா. தனியாக அல்லது குடும்பத்துடன்), அவர்கள் பெற்ற அறை வகை, தங்கிய நாட்களின் எண்ணிக்கை மற்றும் விமர்சனம் சமர்ப்பிக்கப்பட்ட சாதன வ ஆகியவை.
- துரதிர்ஷ்டவசமாக, இந்த டேக்களைப் பயன்படுத்துவது சிக்கலானது, அவற்றின் பயன்தன்மையைப் பற்றிய கீழே உள்ள பிரிவை சரிபார்க்கவும்.
- இவை சுருக்கமாக மதிப்பாய்வாளர் தங்களை விவரிக்க தேர்ந்தெடுக்கக்கூடிய குறிப்பு வார்த்தைகள் (உதா: தனித்து பயணி அல்லது குடும்பம்), அவர்கள் பெற்ற அறையின் வகை, தங்கிய கால அளவு மற்றும் மதிப்பாய்வு சமர்ப்பிக்கப்பட்ட சாதனம் போன்றவை
- வருத்தமாக, இந்த டேக்கள் பயன்படுத்துவதில் சிக்கல்கள் உள்ளன, கீழே உள்ள பகுதி இவற்றின் பயனுள்ள தன்மையை விவரிக்கிறது
**விமர்சகர் பத்திகள்**
**மதிப்பாய்வாளர் நெடுவரிசைகள்**
- `Total_Number_of_Reviews_Reviewer_Has_Given`
- இது பரிந்துரை மாதிரியில் ஒரு காரணியாக இருக்கலாம், உதாரணமாக, நூற்றுக்கணக்கான விமர்சனங்களை கொண்ட அதிக விமர்சகர்கள் நேர்மறை விட எதிர்மறையாக இருக்க வாய்ப்பு அதிகம் என்பதை நீங்கள் தீர்மானிக்க முடிந்தால். இருப்பினும், குறிப்பிட்ட விமர்சனத்தின் விமர்சகர் ஒரு தனித்துவமான குறியீடு மூலம் அடையாளம் காணப்படவில்லை, எனவே விமர்சனங்களின் தொகுப்புடன் இணைக்க முடியாது. 100 அல்லது அதற்கு மேற்பட்ட விமர்சனங்களைக் கொண்ட 30 விமர்சகர்கள் உள்ளனர், ஆனால் இது பரிந்துரை மாதிரிக்கு எவ்வாறு உதவ முடியும் என்பதைப் பார்க்க கடினமாக உள்ளது.
- பரிந்துரை மாதிரியில் இதுவும் முக்கியமான பங்கு வகிக்கலாம், உதாரணமாக, நூற்றுக்கணக்கான மதிப்பாய்வுகள் வழங்கும் மதிப்பாய்வாளர்கள் எதிர்மறை நம்பிக்கை அதிகம் இருக்கலாம். எனினும், எந்த மதிப்பாய்வாளர் என்பது தனித்துவ குறியீட்டால் அடையாளம் காணப்படாததால், மதிப்பாய்வுகளுடன் இணைக்க முடியாது. 100 அல்லது அதற்கு மேற்பட்ட மதிப்பாய்வுகள் வழங்கிய 30 மதிப்பாய்வாளர்கள் உள்ளனர், ஆனால் அது பரிந்துரை மாதிரிக்கு உதவுவது சிக்கலாகும்.
- `Reviewer_Nationality`
- சிலர் சில தேசியத்தவர்களுக்கு நேர்மறை அல்லது எதிர்மறை விமர்சனங்களை வழங்க அதிக வாய்ப்பு உள்ளது என்று நினைக்கலாம். உங்கள் மாதிரிகளில் இப்படியான கருத்துக்களை உருவாக்குவதில் கவனமாக இருங்கள். இவை தேசிய (மற்றும் சில சமயங்களில் இன) கற்பனைகள், மேலும் ஒவ்வொரு விமர்சகரும் அவர்களின் அனுபவத்தின் அடிப்படையில் விமர்சனத்தை எழுதிய தனிநபர்களாக இருந்தனர். அவர்கள் தேசியத்துவம் விமர்சன மதிப்பீட்டின் காரணம் என்று நினைப்பது நியாயமாக்க முடியாதது.
- சிலர் குறிப்பிட்ட தேசியத்துவம் கொண்டவர்கள் நேர்மறை அல்லது எதிர்மறை மதிப்பாய்வை அளிக்க வாய்ப்பு அதிகம் என நினைக்கலாம். இவ்விதமான சிந்தனைகளை உங்கள் மாதிரிகளில் நன்கு பரிசீலித்து உள்ளிடுங்கள். இவை தேசிய (சில சமயங்களில் இன) பொதுக்காணோன், ஒவ்வொரு மதிப்பாய்வாளரும் தங்களது அனுபவத்தின் அடிப்படையில் தனிப்பட்டவர். இது பல்வேறு பார்வைகளால் வடிகட்டி இருக்கும், மருந்து முன் தங்கிய ஹோட்டல், பயண தொலைவு மற்றும் அவர்களின் தனிப்பட்ட மனநிலை போன்றவை. அதன் தேசியத்துவம் மதிப்பெண் காரணமென்று நினைப்பது இங்கே நியாயப்படுத்துவது கடினம்.
##### உதாரணங்கள்
##### எடுத்துக்காட்டு
| சராசரி மதிப்பெண் | மொத்த விமர்சனங்கள் | விமர்சகர் மதிப்பெண் | எதிர்மறை <br />விமர்சனம் | நேர்மறை விமர்சனம் | டேக்கள் |
| சராசரி மதிப்பெண் | மொத்த மதிப்பாய்வுகளின் எண்ணிக்கை | மதிப்பாய்வாளர் மதிப்பெண் | எதிர்மறை <br />மதிப்பாய்வு | நேர்மறை மதிப்பாய்வு | டேக்கள் |
| -------------- | ---------------------- | ---------------- | :------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------- | ----------------------------------------------------------------------------------------- |
| 7.8 | 1945 | 2.5 | இது தற்போது ஒரு ஹோட்டல் அல்ல, ஆனால் ஒரு கட்டுமான தளம். நான் ஒரு நீண்ட பயணத்திற்குப் பிறகு ஓய்வெடுக்கும்போது மற்றும் அறையில் வேலை செய்யும்போது, ​​காலையில் மற்றும் முழு நாளும் ஏற்றுக்கொள்ள முடியாத கட்டுமான சத்தத்தால் பயமுறுத்தப்பட்டேன். மக்கள் முழு நாளும் வேலை செய்தனர், அதாவது பக்கத்து அறைகளில் ஜாக்ஹாமர்களுடன். நான் ஒரு அறை மாற்றத்தை கேட்டேன், ஆனால் அமைதியான அறை கிடைக்கவில்லை. விஷயங்களை மேலும் மோசமாக்க, நான் அதிகமாக கட்டணம் வசூலிக்கப்பட்டது. நான் மிகவும் தாமதமாக வெளியேறினேன், ஏனெனில் நான் அதிகாலை விமானத்தை விட்டு வெளியேற வேண்டியிருந்தது, மேலும் ஒரு பொருத்தமான பில் கிடைத்தது. ஒரு நாளுக்குப் பிறகு, ஹோட்டல் முன்பதிவு செய்யப்பட்ட விலையை மீறி மற்றொரு கட்டணத்தை என் ஒப்புதலின்றி செய்தது. இது ஒரு மோசமான இடம். இங்கே முன்பதிவு செய்து உங்களை தண்டிக்க வேண்டாம். | எதுவும் இல்லை. மோசமான இடம். விலகி இருங்கள் | வணிக பயணம் ஜோடி ஸ்டாண்டர்ட் டபுள் அறை 2 இரவுகள் தங்கியுள்ளனர் |
| 7.8 | 1945 | 2.5 | இது அவருக்கு ஹோட்டல் இல்லை, ஆனால் கட்டுமான தளம் தான். காலை முதல் முழு நாள் ஒலி தொடர்பான அசுத்தத்தில் நான் துயரப்பட்டேன். மக்கள் அருகில் ஜாக்ஹாமர்கள் கொண்டு வேலை செய்தனர். அறையிலிருந்து மாற்றிக்கொள்ள கேட்டேன், அமைதியான அறை கிடைக்கவில்லை. மேலும் அதிக கட்டணம் வசூலிக்கப்பட்டது. சந்தியா புறப்பட்ட போது சரியான பில் கிடைத்தது. ஆனால் பிறகு ஹோட்டல் அனுமதி இல்லாமல் கூடுதல் கட்டணம் வசூலித்து கொண்டது. இது மோசமான இடம். இங்கே பதிவு செய்யும் முன் நினைக்கவும் | எதுவும் இல்லை மோசமான இடம் அருகே சென்று விடுங்கள் | வணிக பயணம் ஜோடி ஸ்டாண்டர்டு இரட்டையர் அறை 2 இரவுகள் தங்கினர் |
இந்த விமர்சகர் இந்த ஹோட்டலில் மகிழ்ச்சியான தங்குமிடம் அனுபவிக்கவில்லை என்பதை நீங்கள் காணலாம். ஹோட்டலுக்கு 7.8 என்ற நல்ல சராசரி மதிப்பெண் மற்றும் 1945 விமர்சனங்கள் உள்ளன, ஆனால் இந்த விமar்சகர் 2.5 மதிப்பெண் அளித்து, அவர்களின் தங்குமிடம் எவ்வளவு மோசமாக இருந்தது என்பதைப் பற்றி 115 வார்த்தைகளை எழுதியுள்ளார். Positive_Review பத்தியில் அவர்கள் எதுவும் எழுதவில்லை என்றால், எந்த நேர்மறை அம்சமும் இல்லை என்று நீங்கள் ஊகிக்கலாம், ஆனால் அவர்கள் எச்சரிக்கையாக 7 வார்த்தைகளை எழுதியுள்ளனர்.
போலவே, இந்த விருந்தினர் ஹோட்டலில் சந்தோஷமாக தங்கவில்லை. ஹோட்டல் சராசரி மதிப்பெண் 7.8 மற்றும் 1945 மதிப்பாய்வுகள் இருந்தாலும், இந்த மதிப்பாய்வாளர் 2.5 மதிப்பெண் கொடுத்தார் மற்றும் 115 வார்த்தைகள் கொண்டு எதிர்மறை அனுபவத்தை விவரித்தார். அவர்கள் நேர்மறை மதிப்பாய்வு அளவுக் கல்லில் எதுவும் எழுதவில்லை என்றால், நேர்மறை இல்லை என்று எண்ணலாம். ஆனால் 7 வார்த்தைகளில் எச்சரிக்கை எழுதுவார். வார்த்தைகளின் பொருள் அல்லது உணர்வு பாராமல் எண்ணினால், மதிப்பாய்வாளரின் நோக்கத்தை தவறாக புரிந்துகொள்ளலாம். 2.5 என்பதெல்லாம் குழப்பமாக இருக்கிறது, ஏனெனில், இந்த ஹோட்டல் தங்கல் மிகவும் மோசமாக இருந்தால் ஏன் மதிப்பெண் கொடுத்தார்? தரவுத்தொகுப்பை ஆராயும் போது குறைந்தபட்ச மதிப்பெண் 2.5 என்றே இருக்கின்றது, 0 அல்ல. அதிகபட்ச மதிப்பெண் 10 ஆகும்.
##### டேக்கள்
மேலே குறிப்பிடப்பட்டுள்ளபடி, முதலில், தரவுகளை வகைப்படுத்த `Tags` ஐப் பயன்படுத்தும் யோசனை பொருத்தமாகத் தோன்றுகிறது. துரதிர்ஷ்டவசமாக, இந்த டேக்கள் ஒரே மாதிரியாக இல்லை, அதாவது ஒரு குறிப்பிட்ட ஹோட்டலில் *Single room*, *Twin room*, மற்றும் *Double room* போன்ற விருப்பங்கள் இருக்கலாம், ஆனால் மற்றொரு ஹோட்டலில், அவை *Deluxe Single Room*, *Classic Queen Room*, மற்றும் *Executive King Room* ஆக இருக்கலாம்.
மேல் கூறியதுபோல், முதலில் `Tags` பயன்படுத்தி தரவை வகைப்படுத்துவது நியாயமாக தெரிகிறதா. ஆனால் இவை ஒரே மாதிரியானவை அல்ல என்றும் அதனால் ஒரு ஹோட்டலில் *Single room*, *Twin room*, *Double room* என்ற டேக்கள் இருந்தாலும் அடுத்த ஹோட்டலில் அவை *Deluxe Single Room*, *Classic Queen Room*, *Executive King Room* என்று இருக்கும். இதனால பல விதமான வகைகள் கூடும்.
1. அனைத்து சொற்களையும் ஒரே தரநிலைக்கு மாற்ற முயற்சிக்கலாம், இது மிகவும் கடினம், ஏனெனில் ஒவ்வொரு வழியிலும் மாற்றம் செய்யும் பாதை என்ன என்பதை தெளிவாகக் கூற முடியாது.
2. ஒரு NLP அணுகுமுறையை எடுத்து, ஒவ்வொரு ஹோட்டலுக்கும் பொருந்தும் *Solo*, *Business Traveller*, அல்லது *Family with young kids* போன்ற சில சொற்களின் அடிக்கடி தோன்றும் எண்ணிக்கையை அளவிடலாம், மேலும் அதை பரிந்துரையில் உள்ளடக்கலாம்.
1. அனைத்து சொற்களையும் ஒரே நிலைக்கு மாற்ற முயற்சிப்பது, இது மிகவும் கடினம். ஏனெனில் ஒவ்வொரு வேறுபாடு பாதையும் தெளிவாக இல்லை (உதா: *Classic single room* என்பது *Single room* ஆகும், ஆனால் *Superior Queen Room with Courtyard Garden or City View* ஐ சரியாக மாற்றுவது கடினம்)
1. ஒரு NLP முறையைப் பயன்படுத்தி *Solo*, *Business Traveller*, அல்லது *Family with young kids* போன்ற சொற்களின் மீள்தொடர்ந்ததைக் கணக்கிட்டு ஒவ்வொரு ஹோட்டலுக்கு பொருந்தும் பின்பு பரிந்துரையில் பங்கு சேர்க்கலாம்
டேக்கள் பொதுவாக (ஆனால் எப்போதும் அல்ல) ஒரு 필்டில் இருந்து 5-6 comma பிரிக்கப்பட்ட மதிப்புகளாக இருக்கும்; இது *பயண வகை*, *விருந்தினர் வகை*, *அறை வகை*, *தங்கிய நாட்கள்* மற்றும் *மதிப்பாய்வு சமர்ப்பிக்கப்பட்ட சாதனம்* என்ற வரிசைப்படி இருக்கும். ஆனால் சில மதிப்பாய்வாளர்கள் ஒவ்வொரு நெடுவரிசையையும் நிரப்பவில்லை என்பதால் மதிப்புகள் இடையில் தவறுகள் இருப்பது சாதாரணம்.
எடுத்துக்காட்டாக, *Type of group* என்ற நெடுவரிசையில் 1025 தனித்துவமான விருப்பங்கள் உள்ளன, ஆனால் சில அவை குடும்பத்தை குறிக்காது; சில அறை வகையாகவும் இருக்கும். குடும்பத்தை குறிப்பிடும் வார்த்தைகளை மட்டும் பார்த்தால் *Family room* போன்ற பல மதிப்புகள் வரலாம். *with* சொற்களை மட்டும் எண்ணினால், 80,000 க்கும் மேற்பட்ட பதிவுகளில் "Family with young children" அல்லது "Family with older children" போன்ற வார்த்தைகள் இருப்பதை காணலாம்.
இதன் பொருள், டேக்கள் நெடுவரிசை முழுமையாக பயனற்றது அல்ல, ஆனால் இதைப் பயனுள்ளதாக மாற்ற சில பணிகள் செய்ய வேண்டியிருக்கும்.
##### சராசரி ஹோட்டல் மதிப்பெண்
தரவுத்தொகுப்பில் சில விசித்திரமான அல்லது முரண்பாடுகள் உள்ளன, ஆனால் அவை உங்கள் மாதிரிகளை உருவாக்கும்போது நீங்கள் அவற்றை கவனத்தில் கொள்ள வேண்டும்.
இந்த ஹோட்டல்கள் ஒரு விலகல் (outlier) ஆக இருக்கக்கூடும், மற்றும் பெரும்பாலான மதிப்பீடுகள் பொருந்தலாம் (ஆனால் சில காரணங்களுக்காக சில மதிப்பீடுகள் பொருந்தாமல் இருக்கலாம்) என்ற சாத்தியத்தைக் கருத்தில் கொண்டு, அடுத்ததாக ஒரு சிறிய நிரலாக்கத்தை எழுதுவோம், தரவுத்தொகுப்பில் உள்ள மதிப்பீடுகளை ஆராய்ந்து, அவற்றின் சரியான பயன்பாட்டை (அல்லது பயன்பாட்டின்மையை) தீர்மானிக்க.
இந்த தரவுத்தொகுப்பில் அசாதாரணங்கள் அல்லது முரண்பாடுகள் உள்ளன, எனது புரிதலைவிட அசுத்தமாகும், ஆனால் இது உங்களுக்கு அவற்றைப் பற்றி விழிப்புணர்வு தரும். இதுபற்றி நீங்கள் கண்டுபிடித்தால், தயவுசெய்து பேசும் பிரிவில் பகிரவும்!
சராசரி மதிப்பெண் மற்றும் மதிப்பாய்வுகளின் எண்ணிக்கையை குறிக்கும் நெடுவரிசைகள் இவையே:
1. Hotel_Name
2. Additional_Number_of_Scoring
3. Average_Score
4. Total_Number_of_Reviews
5. Reviewer_Score
> 🚨 கவனிக்க வேண்டிய ஒரு குறிப்பை
இந்த தரவுத்தொகுப்பில் மிக அதிக மதிப்பாய்வுகளுடன் உள்ள ஹோட்டல் *Britannia International Hotel Canary Wharf* ஆகும், அதில் 4789 மதிப்பாய்வுகள் உள்ளன. ஆனால் இதன் `Total_Number_of_Reviews` மதிப்பு 9086 ஆகும். இது மதிப்பாய்வு இல்லா பல மதிப்பெண்கள் உள்ளன என்று குறிக்கலாம். கூடுதலாக, `Additional_Number_of_Scoring` மதிப்பு 2682 ஆகும். இதையும் சேர்த்தால் 4747+2682=7471 ஆகும், இது `Total_Number_of_Reviews` 9086 க்கு 1615 குறைவாகும்.
`Average_Score` நெடுவரிசையைப் பார்க்கும் போது, இது தரவுத்தொகுப்பில் உள்ள மதிப்பாய்வுகளின் சராசரி என நினைக்கலாம், ஆனால் Kaggle சொல்கிறது "*கடந்த ஆண்டு புதிய கருத்தின் அடிப்படையில் கணக்கிடப்பட்ட ஹோட்டலின் சராசரி மதிப்பெண்*". இது பயனுள்ளதில்லை போல. நாங்கள் தரவுத்தொகுப்பில் உள்ள மதிப்பாய்வு மதிப்பெண்களின் சராசரி மதிப்பை கணக்கிடலாம். அதே ஹோட்டலை எடுத்துக்கொண்டால், சராசரி மதிப்பெண் 7.1 ஆக உள்ளது, ஆனால் எங்கள் கணக்கீடு (தரவுத்தொகுப்பை உள்ள Reviewer_Score சராசரி) 6.8 ஆகும். இது நெருக்கமாக இருந்தாலும், ஓர் வேறுபாடு உள்ளது. `Additional_Number_of_Scoring` மதிப்புகளில் உள்ள மதிப்பெண்கள் சராசரியை 7.1க்குச் சென்று மேம்படுத்தியதாக நினைக்கலாம். ஒரு சோதனைக்கோ அல்லது சான்று இல்லாததால், `Average_Score`, `Additional_Number_of_Scoring` மற்றும் `Total_Number_of_Reviews` ஆகியவற்றைப் பயன்படுத்துவது அல்லது நம்புவது கடினம், ஏனெனில் அவை எங்களிடம் இல்லாத தரவின் அடிப்படையிலேயே இருக்கலாம்.
மேலும் குழப்பமாக, இரண்டாம் அதிக மதிப்பாய்வுகளின் ஹோட்டல் கணக்கிடப்பட்ட சராசரி மதிப்பெண் 8.12 ஆகும், தரவுத்தொகுப்பு Average_Score 8.1 ஆகும். இது உண்மையான மதிப்பெண் எதிர்யோ அல்லது முதல் ஹோட்டல் முரண்பாடா?
இந்த ஹோட்டல் ஒரு வித்தியாசமானிருக்கக்கூடும் என்ற சாத்தியக்கூறில், மேலும் ஒருபகுதி மதிப்புகள் சரியாக பொருந்தக்கூடும் (ஆனால் ஏதோ காரணத்திற்காக சில பொருந்தாது) என, நம்முடைய தரவுத்தொகுப்பில் உள்ள மதிப்புகளை ஆராயவும் மதிப்புகளின் சரியான பயன்பாட்டை (அல்லது பயன்பாடு இல்லை) தீர்மானிக்கவும் ஒரு சின்ன திட்டம் எழுதப்போறோம்.
> 🚨 எச்சரிக்கை குறிப்பு
>
> இந்த தரவுத்தொகுப்புடன் வேலை செய்யும்போது, நீங்கள் உரையிலிருந்து ஏதாவது கணக்கிடும் நிரல்களை எழுதுவீர்கள், ஆனால் நீங்கள் உரையை நேரடியாக வாசிக்கவோ அல்லது பகுப்பாய்வு செய்யவோ தேவையில்லை. இது இயற்கை மொழி செயலாக்கத்தின் (NLP) சாராம்சம், ஒரு மனிதன் செய்யாமல் பொருள் அல்லது உணர்வை புரிந்துகொள்வது. ஆனால், சில நேரங்களில் நீங்கள் சில எதிர்மறை மதிப்பீடுகளை வாசிக்கலாம். நான் உங்களை அதை செய்ய வேண்டாம் என்று கேட்டுக்கொள்கிறேன், ஏனெனில் நீங்கள் அதை செய்ய தேவையில்லை. சில மதிப்பீடுகள் முட்டாள்தனமானவை அல்லது பொருத்தமற்றவை, உதாரணமாக "வானிலை சிறப்பாக இல்லை", இது ஹோட்டலின் கட்டுப்பாட்டுக்கு அப்பாற்பட்டது, அல்லது யாருக்கும் கட்டுப்படுத்த முடியாதது. ஆனால், சில மதிப்பீடுகளில் இருண்ட பக்கம் உள்ளது. சில நேரங்களில் எதிர்மறை மதிப்பீடுகள் இனவெறி, பாலினவெறி, அல்லது வயதுவெறி கொண்டதாக இருக்கலாம். இது துரதிர்ஷ்டவசமானது, ஆனால் பொதுவான இணையதளத்திலிருந்து சேகரிக்கப்பட்ட தரவுத்தொகுப்பில் எதிர்பார்க்கக்கூடியது. சில மதிப்பீடர்கள் நீங்கள் வெறுப்பாக, அசௌகரியமாக, அல்லது மனவருத்தமாக உணரக்கூடிய மதிப்பீடுகளை விடுகிறார்கள். உணர்வை அளவிட நிரல்களை பயன்படுத்துவது நல்லது, நீங்கள் நேரடியாக வாசித்து மனவருத்தம் அடைவதை விட. அதுவும், இது ஒரு சிறிய பகுதியே எழுதுகிறார்கள், ஆனால் அவர்கள் இருப்பது உண்மை.
> இந்த தரவுத்தொகுப்புடன் வேலை செய்யும் போது, நீங்கள் உரையைக் கைக் கணக்கிடும் பொருளை கணக்கிடும் கோ드를 எழுதுவீர்கள், உரையை நீங்கள் நேரடியாக வாசிக்கவோ ஆய்வுசெய்யவோ வேண்டாம். இது NLPயின் சாராம்சம், மனிதர் செய்ய வேண்டாமலே அர்த்தம் அல்லது உணர்வை பகுப்பாய்வு செய்வது. இருப்பினும், சில நேரங்களில் நீங்கள் சில எதிர்மறை மதிப்புரைகளை வாசிக்க நேரலாம். வாசிக்க வேண்டாம் என்று நான் அறிவுறுத்துகிறேன், ஏனெனில் அவசியமில்லை. அதில் சில அவமானமடையக்கூடியவைகள், அல்லது தொடர்பில்லாத எதிர்மறை ஹோட்டல் மதிப்புரைகள், உதாரணமாக "வானிலை சிறந்ததல்ல" என்பதுபோன்றவை உள்ளன, ஹோட்டலின் கட்டுப்பாட்டுக்குபரி அப்போதுமில்லை. ஆனால் சில மதிப்புரைகளுக்கு ஒரு மோசமான பக்கம் உண்டு. சில நேரங்களில் எதிர்மறை மதிப்புரைகள் இனவெறிப்படையானவையா, பாலின மாதிரியானவையா அல்லது வயதுபெற்றவர்களுக்கானவை ஆவாக இருக்கக் கூடும். இது துரதிர்ஷ்டமானது, ஆனால் பொதுவான இணையதளத்தில் இருந்து சேகரிக்கப்பட்ட தரவுகளுக்கு இது எதிர்பார்க்கத்தக்கது. சில மதிப்புரையாளர்கள் அவமானமளிக்கக்கூடிய, அசௌகரியமான அல்லது மனநிறைக்கும் மதிப்புரைகளை விடுகின்றனர். அவைகளை நீங்கள் நேரடியாக வாசித்து மனம் காய்ச்சிக்கொள்ளாமல், அந்த உணர்வை அளவிடவும் கோடிங் செய்வதும் சிறந்தது. அதாவது, அப்படி எழுதுவோர் ஒரு சிறிய மரபில் மட்டுமே உள்ளனர், ஆனால் இருந்தே இருக்கின்றனர்.
## பயிற்சி - தரவுத்தொகுப்பை ஆராய்வது
### தரவுகளை ஏற்றுதல்
## பயிற்சி - தரவு ஆராய்ச்சி
### தரவை ஏற்றுகொள
தரவுகளை கண்ணோட்டமாக ஆராய்வது போதுமானது, இப்போது நீங்கள் சில நிரல்களை எழுதுவீர்கள் மற்றும் சில பதில்களை பெறுவீர்கள்! இந்த பகுதி pandas நூலகத்தை பயன்படுத்துகிறது. உங்கள் முதல் பணியாக, நீங்கள் CSV தரவுகளை ஏற்றவும் வாசிக்கவும் முடியும் என்பதை உறுதிப்படுத்த வேண்டும். pandas நூலகத்தில் ஒரு வேகமான CSV ஏற்றும் செயலி உள்ளது, மற்றும் முடிவுகள் முந்தைய பாடங்களில் போல dataframe-ல் வைக்கப்படும். நாம் ஏற்றும் CSV-ல் அரை மில்லியனுக்கும் மேற்பட்ட வரிசைகள் உள்ளன, ஆனால் 17 மட்டுமே நெடுவரிசைகள் உள்ளன. pandas உங்களுக்கு dataframe-ஐ தொடர்பு கொள்ள பல சக்திவாய்ந்த வழிகளை வழங்குகிறது, அதில் ஒவ்வொரு வரிசையிலும் செயல்பாடுகளை செய்யும் திறனும் அடங்கும்.
தரவை கண்விடிப்பில் பார்த்துவிட்டு போதுமானது, இப்போது நீங்கள் சில கோடுகளை எழுதிவிட்டு பதில்களைக் கண்டறியப் போகிறீர்கள்! இந்தப் பகுதி pandas நூலகத்தை பயன்படுத்துகிறது. உங்கள் முதல் பணியாக CSV தரவை ஏற்றிக்கொள்ளுதல் மற்றும் வாசிப்பதை உறுதி செய்ய வேண்டும். pandas நூலகம் விரைவாக CSVஐ ஏற்றுகிறது, முடிவை ஒரு dataframe இல் வைக்கிறது, முந்தைய பாடங்களுபோல். நம்மால் ஏற்றுக்கொண்ட CSV வாழ்க்கையில் அரை மில்லியன் கட்டங்கள் (rows) மற்றும் 17 த полкоர்கள் (columns) இருக்கின்றன. pandas தான் data frame ஐ திறம்பட செயலாற்ற பல வழிகளை தருகிறது, அதில் ஒவ்வொரு வரியிலும் விதிகள் செய்யும் திறன் உண்டு.
இப்பாடத்தில் இங்கிருந்து, சில நிரல்குறிப்புகள் மற்றும் அவற்றின் விளக்கங்கள் மற்றும் முடிவுகள் என்ன பொருள் கொண்டது என்பதற்கான விவாதம் இருக்கும். உங்கள் நிரலுக்கு _notebook.ipynb_ ஐ பயன்படுத்தவும்.
இப்பாடத்தில் இதற்கு பிறகு சில குறியீட்டு துணுக்குகள், சிலவுரைகள் மற்றும் முடிவுகளின் விளக்கங்கள் இருக்கும். உங்கள் குறியீட்டிற்கு இணைக்கப்பட்ட _notebook.ipynb_ஐ பயன்படுத்தவும்.
ாம் பயன்படுத்தும் தரவுத்தொகுப்பை ஏற்றுவதில் தொடங்குவோம்:
ீங்கள் பயன்படுத்தப்போகும் தரவு கோப்பை ஏற்றுவதை ஆரம்பிப்போம்:
```python
# Load the hotel reviews from CSV
# CSV இலிருந்து ஹோட்டல் விமர்சனங்களை ஏற்றவும்
import pandas as pd
import time
# importing time so the start and end time can be used to calculate file loading time
# கோப்பு ஏற்றும் நேரத்தை கணக்கிட தொடக்க மற்றும் முடிவு நேரத்தை பயன்படுத்துவதற்காக நேரத்தை இறக்குமதி செய்தல்
print("Loading data file now, this could take a while depending on file size")
start = time.time()
# df is 'DataFrame' - make sure you downloaded the file to the data folder
# df என்பது 'DataFrame' - கோப்பை டேட்டா கோப்புறையில் நீங்கள் பதிவிறக்கம் செய்திருக்கிறீர்கள் என்பதை உறுதிப்படுத்துக
df = pd.read_csv('../../data/Hotel_Reviews.csv')
end = time.time()
print("Loading took " + str(round(end - start, 2)) + " seconds")
```
தரவுகள் ஏற்றப்பட்டவுடன், அதில் சில செயல்பாடுகளை செய்யலாம். உங்கள் நிரலின் அடுத்த பகுதிக்காக இந்த நிரலை மேல் பகுதியில் வைத்திருங்கள்.
இப்போது தரவு ஏற்றிக் கொண்டுவிட்டதால், அதில் சில செயல்பாடுகளை செய்யலாம். அடுத்த பகுதியின் உள்ளீட்டின் மேல் இந்தக் கோடுகளை வைக்கவும்.
## தரவுகளை ஆராய்வது
## தரவை ஆராய்க
இந்தக் கட்டத்தில், தரவுகள் ஏற்கனவே *சுத்தமாக* உள்ளது, அதாவது இது வேலை செய்ய தயாராக உள்ளது, மற்றும் ஆங்கில எழுத்துக்களை மட்டுமே எதிர்பார்க்கும் அல்காரிதம்களை தடுமாறச் செய்யக்கூடிய பிற மொழிகளில் எழுத்துக்கள் இல்லை.
இந்நிலையில், தரவு ஏற்கனவே *தூய்மையாக* உள்ளது, அதாவது அதுடன் வேலை செய்ய தயாராக உள்ளது, மற்றும் ஏற்றுத்திறன் கொண்ட ஆல்கொரித்முகள் எதிர்பார்க்கும் ஆங்கில எழுத்துகளுக்கு மட்டுமே உள்ள தொந்தர்களைக் கொண்டிருக்கவில்லை.
நீங்கள் ஆரம்ப செயலாக்கம் தேவைப்படும் தரவுகளுடன் வேலை செய்ய வேண்டியிருக்கலாம், ஆனால் இந்த முறை அவசியமில்லை. நீங்கள் செய்ய வேண்டியிருந்தால், ஆங்கிலமல்லாத எழுத்துக்களை எப்படி கையாளுவீர்கள்?
சில நேரங்களில் நீங்கள் NLP நுட்பங்களைப் பயன்படுத்துவதற்கு முன் தரவை வடிவமைக்க முன் சுழற்று வேலை செய்ய வேண்டி வாய்ப்பு இருக்கலாம், ஆனால் இப்போதும் இல்லை. நீங்கள் செய்ய வேண்டுமானால், ஆங்கிலங்களால் அல்லாத எழுத்துக்களை எப்படி கையாள்வீர்கள்?
தரவுகள் ஏற்றப்பட்டவுடன், நீங்கள் அதை நிரல்களுடன் ஆராய முடியும் என்பதை உறுதிப்படுத்த ஒரு நிமிடம் எடுத்துக்கொள்ளுங்கள். `Negative_Review` மற்றும் `Positive_Review` நெடுவரிசைகளில் கவனம் செலுத்த விரும்புவது மிகவும் எளிது. அவை உங்கள் NLP அல்காரிதம்களுக்கு இயற்கை உரையால் நிரப்பப்பட்டுள்ளன. ஆனால் காத்திருக்கவும்! NLP மற்றும் உணர்வை ஆராய்வதற்கு முன், pandas மூலம் தரவுத்தொகுப்பில் கொடுக்கப்பட்ட மதிப்பீடுகள் நீங்கள் கணக்கிடும் மதிப்பீடுகளுடன் பொருந்துகிறதா என்பதை உறுதிப்படுத்த கீழே உள்ள நிரலை பின்பற்ற வேண்டும்.
ஒரு நிமிடம் எடுத்து, தரவை ஏற்றிவிட்டு நாம் அந்த தரவை குறியீடு மூலம் ஆராய முடியும் என்று உறுதி செய்யுங்கள். நீங்கள் அசல் கவனம் செலுத்தி ஆளுடைய நிலை அமைதியற்று `Negative_Review` மற்றும் `Positive_Review` நெடுவரிசைகளில் இருப்பதைக் கவனிக்கலாம். அவை உங்கள் NLP ஆல்கொரிதங்களுக்குப் இயற்கை உரைகளை கொண்டுள்ளன. ஆனால் காத்திருங்கள்! NLP மற்றும் உணர்வு பொருள்மொழியில் இறங்குவதற்கு முன்பு, கீழுள்ளக் கோடுகளை பின்பற்று, தரவுத்தொகுப்பில் உள்ள மதிப்புகள் pandas மூலம் நீங்கள் கணக்கிடும் மதிப்புகளுடன் பொருந்துகிறதா என்று உறுதி செய்யுங்கள்.
## Dataframe செயல்பாடுகள்
இந்த பாடத்தில் முதல் பணியாக, தரவுத்தொகுப்பை (மாற்றாமல்) ஆராயும் நிரலை எழுதுவதன் மூலம் பின்வரும் உறுதிப்படுத்தல்களை சரிபார்க்க வேண்டும்.
> பல நிரலாக்க பணிகளுக்கு பல வழிகள் உள்ளன, ஆனால் நல்ல ஆலோசனை என்னவென்றால், நீங்கள் அதை எளிதாகவும், சிக்கலற்றதாகவும் செய்ய வேண்டும், குறிப்பாக நீங்கள் எதிர்காலத்தில் இந்த நிரலை மீண்டும் பார்க்கும்போது புரிந்துகொள்ள எளிதாக இருக்கும். Dataframe-களுடன், ஒரு விரிவான API உள்ளது, இது நீங்கள் விரும்பும் செயல்பாட்டை திறமையாக செய்ய ஒரு வழியை அடிக்கடி கொண்டிருக்கும்.
இப்பாடத்தின் முதல் பணி தேதி அட்டவணையை மாற்றாமல் பார்ப்பதற்கான கோடுகளை எழுதுவதன் மூலம் கீழ்க்காணும் உறுதிப்படுத்தல்கள் சரியானதா என்பதை பரிசோதிப்பது ஆகும்.
பின்வரும் கேள்விகளை நிரலாக்க பணிகளாக கருதி, தீர்வை பார்க்காமல் பதிலளிக்க முயற்சிக்கவும்.
> பல நிரல் பணிகளிற்கு போல், இதற்கு பல வழிகள் உள்ளன, ஆனால் நல்ல ஆலோசனை எளிய மற்றும் புரிந்து கொள்ள எளிதான முறையை எடுத்துக் கொள்வதாகும், குறிப்பாக நீங்கள் எதிர்காலத்தில் இந்தக் குறியீட்டை மீண்டும் பார்க்கும்போது. Dataframe க்கான நிறைய விரிவான APIகள் உள்ளன, அவை உங்கள் தேவைக்கு திறம்பட செயல்படும் வழியை தரும்.
1. நீங்கள் ஏற்றிய dataframe-இன் *shape* ஐ அச்சிடுங்கள் (shape என்பது வரிசைகள் மற்றும் நெடுவரிசைகளின் எண்ணிக்கை)
2. மதிப்பீட்டாளர் தேசியத்திற்கான அதிர்வெண் எண்ணிக்கை கணக்கிடுங்கள்:
1. `Reviewer_Nationality` நெடுவரிசைக்கு எத்தனை தனித்துவமான மதிப்பீடுகள் உள்ளன, அவை என்ன?
2. தரவுத்தொகுப்பில் எந்த மதிப்பீட்டாளர் தேசியம் மிகவும் பொதுவானது (நாடு மற்றும் மதிப்பீடுகளின் எண்ணிக்கையை அச்சிடவும்)?
3. அடுத்த 10 மிகவும் பொதுவான தேசியங்கள் மற்றும் அவற்றின் அதிர்வெண் எண்ணிக்கை என்ன?
3. மிக அதிகமாக மதிப்பீடு செய்யப்பட்ட ஹோட்டல் ஒவ்வொரு 10 மிக அதிக மதிப்பீட்டாளர் தேசியங்களுக்கு என்ன?
4. தரவுத்தொகுப்பில் ஹோட்டல் ஒன்றுக்கு எத்தனை மதிப்பீடுகள் உள்ளன (ஹோட்டலின் அதிர்வெண் எண்ணிக்கை)?
5. தரவுத்தொகுப்பில் ஒவ்வொரு ஹோட்டலுக்கும் மதிப்பீட்டாளர் மதிப்பீடுகளின் சராசரியை கணக்கிடுவதன் மூலம் சராசரி மதிப்பீட்டை கணக்கிடலாம், `Calc_Average_Score` என்ற தலைப்புடன் dataframe-க்கு ஒரு புதிய நெடுவரிசையை சேர்க்கவும்.
6. எந்த ஹோட்டல்கள் (1 தசம இடம் வரை வட்டமிடப்பட்ட) `Average_Score` மற்றும் `Calc_Average_Score` மதிப்பீடுகளை ஒரே மாதிரியானவை கொண்டுள்ளன?
1. ஒரு Series (வரிசை) ஐ வாதமாக எடுத்துக்கொண்டு மதிப்பீடுகளை ஒப்பிட்டு, மதிப்பீடுகள் சமமாக இல்லாதபோது ஒரு செய்தியை அச்சிடும் Python செயல்பாட்டை எழுத முயற்சிக்கவும். பின்னர் `.apply()` முறைமையை பயன்படுத்தி ஒவ்வொரு வரிசையையும் செயல்பாட்டுடன் செயல்படுத்தவும்.
7. `Negative_Review` நெடுவரிசை மதிப்பீடுகள் "No Negative" என்று உள்ள எத்தனை வரிசைகள் உள்ளன என்பதை கணக்கிடவும் மற்றும் அச்சிடவும்.
8. `Positive_Review` நெடுவரிசை மதிப்பீடுகள் "No Positive" என்று உள்ள எத்தனை வரிசைகள் உள்ளன என்பதை கணக்கிடவும் மற்றும் அச்சிடவும்.
9. `Positive_Review` நெடுவரிசை மதிப்பீடுகள் "No Positive" **மற்றும்** `Negative_Review` மதிப்பீடுகள் "No Negative" என்று உள்ள எத்தனை வரிசைகள் உள்ளன என்பதை கணக்கிடவும் மற்றும் அச்சிடவும்.
கீழ்க்காணும் கேள்விகளை குறியீட்டு பணிகளாக கருதி, தீர்வை பாராமல் சமாதானம் செய்வதற்கு முயற்சி செய்யுங்கள்.
### நிரல்குறிப்பு பதில்கள்
1. நீங்கள் இப்போது ஏற்றிய data frame இன் *shape*ஐ (வரிசைகளும் பாதிகளும்) அச்சிடுக.
2. மதிப்புரையாளர்களின் தேசியத்தன்மைகளுக்கான அடிக்கடி எண்ணிக்கையை கணக்கிடுக:
1. `Reviewer_Nationality` நெடுவரியில் எந்தெந்த தனித்துவமான மதிப்புகள் இருக்கின்றன மற்றும் அவை எத்தனை?
2. தரவுத்தொகுப்பில் அதிகபட்சமாக இருக்கும் மதிப்புரையாளர் தேசியத்தன்மை எது (நாட்டு பெயர் மற்றும் மதிப்புரை எண்ணிக்கையை அச்சிடுக)?
3. அடுத்த 10 அதிக அங்கீகாரம் பெறும் தேசியங்கள் மற்றும் அவற்றின் எண்ணிக்கை என்ன?
3. மேலே கூறிய முன் 10 அதிக மதிப்புரையாளர்கள் நாடுகளுக்கான அதிக மதிப்புரைகள் பெற்ற ஹோட்டல்கள் எவை?
4. ஹோட்டல் வெவ்வேறு மதிப்புரைகளுக்கு எத்தனை மதிப்புரை இருக்கின்றன (ஹோட்டல் அடிப்படையில் எண்ணிக்கை)?
5. `Average_Score` என்ற ஒவ்வொரு ஹோட்டலுக்கும் ஒரு நெடுவரிசை இருந்தாலும், நீங்கள் ஒவ்வொரு ஹோட்டலுக்கும் அனைத்து மதிப்புரையாளர்களிடமிருந்து கிடைக்கும் சராசரி மதிப்பை கண்டறியலாம். உங்கள் dataframe இல் `Calc_Average_Score` என்ற புதிய நெடுவரிசையைக் கூட்டி அதில் கணக்கிடப்பட்ட சராசரியை நிரப்பவும்.
6. எந்த ஹோட்டல்களுக்காவது (1 தசம இடம் வரை சுற்றிய முடிவில்) `Average_Score` மற்றும் `Calc_Average_Score` மதிப்புகள் ஒரே மாதிரி உள்ளனவா?
1. ஒரு பைத்தான் செயல்பாட்டை எழுத முயற்சி செய்யுங்கள், அது ஒரு Series (வரிசை) ஆவணமாக எடுத்துக்கொண்டு மதிப்புகளை ஒப்பிட்டு, மதிப்புகள் இணைவதில்லையான போது ஒரு செய்தியை அச்சிடும். பின்னர் `.apply()` முறையை பயன்படுத்தி எல்லா வரிகளையும் செயலாக்கவும்.
7. `Negative_Review` நெடுவரிசையின் மதிப்புகள் "No Negative" என்ற உள்ளவற்றின் எண்ணிக்கையை கணக்கிட்டு அச்சிடுக
8. `Positive_Review` நெடுவரிசையின் மதிப்புகள் "No Positive" என்ற உள்ளவற்றின் எண்ணிக்கையை கணக்கிட்டு அச்சிடுக
9. `Positive_Review` நெடுவரியில் "No Positive" மற்றும் `Negative_Review` நெடுவரியில் "No Negative" ஆகிய இரண்டையும் கொண்டுள்ள வரிசைகளின் எண்ணிக்கையை கணக்கிட்டு அச்சிடுக
### கோட் பதில்கள்
1. நீங்கள் ஏற்றிய dataframe-இன் *shape* ஐ அச்சிடுங்கள் (shape என்பது வரிசைகள் மற்றும் நெடுவரிசைகளின் எண்ணிக்கை)
1. நீங்கள் எடுத்து ஏற்றிய data frame இன் *shape*ஐ அச்சிடுக (வரிசைகள் மற்றும் காலமுறைகள் எத்தனை)
```python
print("The shape of the data (rows, cols) is " + str(df.shape))
> The shape of the data (rows, cols) is (515738, 17)
```
2. மதிப்பீட்டாளர் தேசியத்திற்கான அதிர்வெண் எண்ணிக்கை கணக்கிடுங்கள்:
2. மதிப்புரையாளர்களின் தேசியத்தன்மைகளுக்கான அடிக்கடி எண்ணிக்கையை கணக்கிடுக:
1. `Reviewer_Nationality` நெடுவரிசைக்கு எத்தனை தனித்துவமான மதிப்பீடுகள் உள்ளன, அவை என்ன?
2. தரவுத்தொகுப்பில் எந்த மதிப்பீட்டாளர் தேசியம் மிகவும் பொதுவானது (நாடு மற்றும் மதிப்பீடுகளின் எண்ணிக்கையை அச்சிடவும்)?
1. `Reviewer_Nationality` நெடுவரியில் எந்தெந்த தனித்துவமான மதிப்புகள் உள்ளன, அவை எத்தனை?
2. தரவுத்தொகுப்பில் அதிகபட்சமாக இருக்கும் மதிப்புரையாளர்கள் தேசியத்தன்மை எது (நாடு மற்றும் மதிப்புரைகள் எண்ணிக்கை அச்சிடுக)?
```python
# value_counts() creates a Series object that has index and values in this case, the country and the frequency they occur in reviewer nationality
# value_counts() ஒரு கோட் பொருள் உருவாக்குகிறது, இதில் இந்தக் கோயில் index மற்றும் மதிப்புகள் உள்ளன, நாட்டும் அவர்கள் விமர்சகர் தேசியத்திலுள்ள நிகழ்ச்சி எண் ஆகும்
nationality_freq = df["Reviewer_Nationality"].value_counts()
print("There are " + str(nationality_freq.size) + " different nationalities")
# print first and last rows of the Series. Change to nationality_freq.to_string() to print all of the data
# Series இன் முதல் மற்றும் கடைசி வரிகளை அச்சிடுங்கள். அனைத்து தரவையும் அச்சிட nationality_freq.to_string() என மாற்றவும்
print(nationality_freq)
There are 227 different nationalities
@ -200,12 +222,12 @@ print("Loading took " + str(round(end - start, 2)) + " seconds")
Name: Reviewer_Nationality, Length: 227, dtype: int64
```
3. அடுத்த 10 மிகவும் பொதுவான தேசியங்கள் மற்றும் அவற்றின் அதிர்வெண் எண்ணிக்கை என்ன?
3. அடுத்த 10 அதிகமாக கண்ட NATIONALITIES மற்றும் அவற்றின் அடிக்கடி எண்ணிக்கை எவை?
```python
print("The highest frequency reviewer nationality is " + str(nationality_freq.index[0]).strip() + " with " + str(nationality_freq[0]) + " reviews.")
# Notice there is a leading space on the values, strip() removes that for printing
# What is the top 10 most common nationalities and their frequencies?
# மதிப்புகளில் முன்னிலையில் ஒரு இடைவெளி உள்ளது, அதை அச்சிட strip() அகற்றுகிறது
# மிக பொதுவான 10 தேசியங்களை மற்றும் அவற்றின் நிகழ்ச்சிகளை என்ன?
print("The next 10 highest frequency reviewer nationalities are:")
print(nationality_freq[1:11].to_string())
@ -223,15 +245,15 @@ print("Loading took " + str(round(end - start, 2)) + " seconds")
France 7296
```
3. மிக அதிகமாக மதிப்பீடு செய்யப்பட்ட ஹோட்டல் ஒவ்வொரு 10 மிக அதிக மதிப்பீட்டாளர் தேசியங்களுக்கு என்ன?
3. மேலே கூறப்பட்ட 10 அதிக மதிப்புரையாளர்கள் நாட்டுக்களுக்கு அதிக மதிப்புரைகள் பெற்ற ஹோட்டல்கள் எவை?
```python
# What was the most frequently reviewed hotel for the top 10 nationalities
# Normally with pandas you will avoid an explicit loop, but wanted to show creating a new dataframe using criteria (don't do this with large amounts of data because it could be very slow)
# மேல்நாட்டு 10 முக்கிய மனையியல் கொண்ட மக்கள் மிகவும் அடிக்கடி மதிப்பாய்வு செய்திருந்த ஹோட்டல் எது
# சாதாரணமாக pandas உடன் நீங்கள் ஒரு நேரடி மடக்கு தவிர்ப்பீர்கள், ஆனால் நகலெடுக்க ஒரு புதிய டேட்டாபிரேமை உருவாக்கி காண்பிக்க விரும்பினேன் (பெரிய அளவிலான தரவுகளுடன் இதைப் பயன்படுத்த வேண்டாம், ஏனெனில் இது மிகவும் மெதுவாக இருக்கலாம்)
for nat in nationality_freq[:10].index:
# First, extract all the rows that match the criteria into a new dataframe
# முதலில், விதிப்பா்றலுடன் பொருந்தும் அனைத்து வரிகளையும் புதிய டேட்டாபிரேமில் எடுக்கவும்
nat_df = df[df["Reviewer_Nationality"] == nat]
# Now get the hotel freq
# இப்போது ஹோட்டல் பயன்முறை எண்ணிக்கை பெறுக
freq = nat_df["Hotel_Name"].value_counts()
print("The most reviewed hotel for " + str(nat).strip() + " was " + str(freq.index[0]) + " with " + str(freq[0]) + " reviews.")
@ -247,16 +269,16 @@ print("Loading took " + str(round(end - start, 2)) + " seconds")
The most reviewed hotel for Canada was St James Court A Taj Hotel London with 61 reviews.
```
4. தரவுத்தொகுப்பில் ஹோட்டல் ஒன்றுக்கு எத்தனை மதிப்பீடுகள் உள்ளன (ஹோட்டலின் அதிர்வெண் எண்ணிக்கை)?
4. தரவுத்தொகுப்பில் ஹோட்டல்கள் வெவ்வேறு மதிப்புரைகளுக்குத் தோன்றும் எண்ணிக்கை எவ்வளவு?
```python
# First create a new dataframe based on the old one, removing the uneeded columns
# பழையதின் அடிப்படையில் புதிய டேட்டாபிரேம் ஒன்றை முதலில் உருவாக்கி, தேவையற்ற காலங்களை அகற்றவும்
hotel_freq_df = df.drop(["Hotel_Address", "Additional_Number_of_Scoring", "Review_Date", "Average_Score", "Reviewer_Nationality", "Negative_Review", "Review_Total_Negative_Word_Counts", "Positive_Review", "Review_Total_Positive_Word_Counts", "Total_Number_of_Reviews_Reviewer_Has_Given", "Reviewer_Score", "Tags", "days_since_review", "lat", "lng"], axis = 1)
# Group the rows by Hotel_Name, count them and put the result in a new column Total_Reviews_Found
# வரிசைகளை Hotel_Name மூலம் குழுவாக்கி, அவற்றை எண்ணி, முடிவை புதிய காலமான Total_Reviews_Found இல் வைக்கவும்
hotel_freq_df['Total_Reviews_Found'] = hotel_freq_df.groupby('Hotel_Name').transform('count')
# Get rid of all the duplicated rows
# அனைத்து நகலான வரிசைகளையும் நீக்கவும்
hotel_freq_df = hotel_freq_df.drop_duplicates(subset = ["Hotel_Name"])
display(hotel_freq_df)
```
@ -270,31 +292,31 @@ print("Loading took " + str(round(end - start, 2)) + " seconds")
| Hotel Wagner | 135 | 10 |
| Hotel Gallitzinberg | 173 | 8 |
நீங்கள் கவனிக்கலாம், *தரவுத்தொகுப்பில் எண்ணப்பட்ட* முடிவுகள் `Total_Number_of_Reviews` மதிப்பீடுடன் பொருந்தவில்லை. இந்த மதிப்பீடு ஹோட்டல் கொண்டிருந்த மொத்த மதிப்பீடுகளை பிரதிநிதித்துவப்படுத்தியது, ஆனால் அனைத்தும் சேகரிக்கப்படவில்லை, அல்லது வேறு கணக்கீடு. `Total_Number_of_Reviews` மாடலில் பயன்படுத்தப்படவில்லை, ஏனெனில் இது தெளிவற்றது.
நீங்கள் கவனிப்பீர்கள், தரவுத்தொகுப்பில் எண்ணப்பட்ட முடிவுகள் `Total_Number_of_Reviews` மதிப்பிற்கு பொருந்தவில்லை. இந்த தரவுத்தொகுப்பில் அந்த மதிப்பு ஹோட்டலுக்கு கிடைத்த மதிப்புரைகளின் மொத்த எண் அல்லது சில கூடுதல் கணக்கின் காரணமாக இருக்கலாம். இந்த `Total_Number_of_Reviews` நம்முடைய மாதிரியில் பயன்படுத்தப்படவில்லை.
5. `Average_Score` என் நெடுவரிசை தரவுத்தொகுப்பில் உள்ள ஒவ்வொரு ஹோட்டலுக்கும், மதிப்பீட்டாளர் மதிப்பீடுகளின் சராசரியை கணக்கிடுவதன் மூலம் சராசரி மதிப்பீட்டை கணக்கிடலாம். `Calc_Average_Score` என்ற தலைப்புடன் dataframe-க்கு ஒரு புதிய நெடுவரிசையை சேர்க்கவும். `Hotel_Name`, `Average_Score`, மற்றும் `Calc_Average_Score` நெடுவரிசைகளை அச்சிடவும்.
5. ஒவ்வொரு ஹோட்டலுக்கும் `Average_Score` எனும் நெடுவரிசைத் தரவுத்தொகுப்பில் இருந்தாலும், நீங்கள் ஹோட்டலுக்கு வரும் அனைத்து மதிப்புரையாளர்களின் மதிப்பைப் கொண்டு சராசரி மதிப்பைத் தொகுக்கலாம். உங்கள் dataframe இல் `Calc_Average_Score` எனும் புதிய நெடுவரிசையைச் சேர்க்கவும், அதில் கணக்கிடப்பட்ட சராசரி மதிப்பு இருக்கும். `Hotel_Name`, `Average_Score`, மற்றும் `Calc_Average_Score` என்று உள்ள நெடுவரிசைகளைப் பிரிண்ட் செய்யுங்கள்.
```python
# define a function that takes a row and performs some calculation with it
# ஒரு வரியை எடுத்துக் கொண்டு அதனுடன் சில கணக்கீடுகளை செய்யும் ஒரு செயல்பாட்டை வரையறு
def get_difference_review_avg(row):
return row["Average_Score"] - row["Calc_Average_Score"]
# 'mean' is mathematical word for 'average'
# 'mean' என்பது 'சராசரி' என்பதற்கான கணித சொல்
df['Calc_Average_Score'] = round(df.groupby('Hotel_Name').Reviewer_Score.transform('mean'), 1)
# Add a new column with the difference between the two average scores
# இரண்டு சராசரி மதிப்பெண்களுக்கிடையேயான வித்தியாசத்துடன் புதிய நெடுவரிசையைச் சேர்க்கவும்
df["Average_Score_Difference"] = df.apply(get_difference_review_avg, axis = 1)
# Create a df without all the duplicates of Hotel_Name (so only 1 row per hotel)
# Hotel_Name-ன் அனைத்து நகல் வரிசைகளும் இல்லாமல் ஒரு df உருவாக்கவும் (அதாவது ஒரு ஹோட்டலுக்கு ஒரு வரியாக)
review_scores_df = df.drop_duplicates(subset = ["Hotel_Name"])
# Sort the dataframe to find the lowest and highest average score difference
# குறைந்த மற்றும் அதிக சராசரி மதிப்பெண் வித்தியாசத்தை கண்டறிய dataframe-ஐ வரிசைப்படுத்தவும்
review_scores_df = review_scores_df.sort_values(by=["Average_Score_Difference"])
display(review_scores_df[["Average_Score_Difference", "Average_Score", "Calc_Average_Score", "Hotel_Name"]])
```
நீங்கள் `Average_Score` மதிப்பீடு மற்றும் கணக்கிடப்பட்ட சராசரி மதிப்பீடு ஏன் சில நேரங்களில் வேறுபடுகிறது என்று ஆச்சரியப்படலாம். சில மதிப்பீடுகள் பொருந்துகின்றன, ஆனால் மற்றவை வேறுபாடு கொண்டுள்ளன, ஏன் என்பதை நாம் அறிய முடியாது, எனவே இந்த வழக்கில், நாம் கொண்டிருக்கும் மதிப்பீடுகளை பயன்படுத்தி சராசரியை நாமே கணக்கிடுவது பாதுகாப்பானது. அதுவும், வேறுபாடுகள் பொதுவாக மிகவும் சிறியவை, தரவுத்தொகுப்பின் சராசரி மற்றும் கணக்கிடப்பட்ட சராசரியில் மிக அதிக வேறுபாடு கொண்ட ஹோட்டல்கள் இவை:
நீங்கள் கூடவே சந்தேகம் கொள்ளலாம், ஏன் `Average_Score` கோவைக்கு கணக்கிடப்பட்ட சராசரி மதிப்புடன் நேர்கொண்ட வேறுபாடுகள் இருப்பது என்று. சில மதிப்புகள் ஒத்துள்ளது, சில வேறுபாடு உள்ளது என்பதற்கு காரணம் தெரியாது, எனவே இந்த நிலைமையில் நம்மால் கொண்டுள்ள மதிப்புரைகளை வைத்து சராசரி மதிப்பைத் துணை கணக்கிடுவது சிறந்தது. பொதுவாக வேறுபாடுகள் மிகச் சின்னவையாக இருப்பதால், இங்கே தரவுத்தொகுப்பின் சராசரி மற்றும் கணக்கிடப்பட்ட சராசரிக்கு மிக உயர்ந்த வேறுபாடு உள்ள ஹோட்டல்கள்:
| Average_Score_Difference | Average_Score | Calc_Average_Score | Hotel_Name |
| :----------------------: | :-----------: | :----------------: | ------------------------------------------: |
@ -310,16 +332,16 @@ print("Loading took " + str(round(end - start, 2)) + " seconds")
| 0.9 | 8.6 | 7.7 | MARQUIS Faubourg St Honor Relais Ch teaux |
| 1.3 | 7.2 | 5.9 | Kube Hotel Ice Bar |
1 மதிப்பீடு மட்டுமே 1-க்கு மேற்பட்ட வேறுபாடு கொண்டுள்ளது, எனவே வேறுபாட்டை புறக்கணித்து கணக்கிடப்பட்ட சராசரி மதிப்பீட்டை பயன்படுத்தலாம்.
1 ஐ விட அதிக வேறுபாடு கொண்ட ஹோட்டல் ஒன்று மட்டுமே இருப்பதால், வேறுபாடுகளை புறக்கணித்து கணக்கிடப்பட்ட சராசரி மதிப்பைப் பயன்படுத்தலாம் என்று அர்த்தம்.
6. `Negative_Review` நெடுவரிசை மதிப்பீடுகள் "No Negative" என்று உள்ள எத்தனை வரிசைகள் உள்ளன என்பதை கணக்கிடவும் மற்றும் அச்சிடவும்.
6. `Negative_Review` நெடுவரியின் மதிப்புகள் "No Negative" என உள்ள வரிசைகளின் எண்ணிக்கையை கணக்கிட்டு அச்சிடுக
7. `Positive_Review` நெடுவரிசை மதிப்பீடுகள் "No Positive" என்று உள்ள எத்தனை வரிசைகள் உள்ளன என்பதை கணக்கிடவும் மற்றும் அச்சிடவும்.
7. `Positive_Review` நெடுவரியின் மதிப்புகள் "No Positive" என உள்ள வரிசைகளின் எண்ணிக்கையை கணக்கிட்டு அச்சிடுக
8. `Positive_Review` நெடுவரிசை மதிப்பீடுகள் "No Positive" **மற்றும்** `Negative_Review` மதிப்பீடுகள் "No Negative" என்று உள்ள எத்தனை வரிசைகள் உள்ளன என்பதை கணக்கிடவும் மற்றும் அச்சிடவும்.
8. `Positive_Review` மதிப்பீடு "No Positive" மற்றும் `Negative_Review` மதிப்பீடு "No Negative" குறிக்கும் வரிசைகள் எத்தனை என்பதையும் கணக்கிட்டு அச்சிடுக
```python
# with lambdas:
# லம்ப்டாக்களுடன்:
start = time.time()
no_negative_reviews = df.apply(lambda x: True if x['Negative_Review'] == "No Negative" else False , axis=1)
print("Number of No Negative reviews: " + str(len(no_negative_reviews[no_negative_reviews == True].index)))
@ -338,12 +360,12 @@ print("Loading took " + str(round(end - start, 2)) + " seconds")
Lambdas took 9.64 seconds
```
## மற்றொரு வழி
## வேறொரு வழி
Lambda-களை பயன்படுத்தாமல் உருப்படிகளை எண்ணும் மற்றொரு வழி, மற்றும் வரிசைகளை எண்ண sum-ஐ பயன்படுத்தவும்:
Lambdaகள் இல்லாமல் பொருட்களை எண்ணும் வேறொரு வழியும், வரிசைகளை எண்ண sum பயன்படுத்தவும்:
```python
# without lambdas (using a mixture of notations to show you can use both)
# லாம்ப்டாக்கள் இல்லாமல் (இரண்டையும் பயன்படுத்த கூடுமென்பதை காண்பிக்க குறியீட்டுகளின் கலவை)
start = time.time()
no_negative_reviews = sum(df.Negative_Review == "No Negative")
print("Number of No Negative reviews: " + str(no_negative_reviews))
@ -363,26 +385,28 @@ Lambda-களை பயன்படுத்தாமல் உருப்ப
Sum took 0.19 seconds
```
நீங்கள் கவனித்திருக்கலாம், `Negative_Review` மற்றும் `Positive_Review` நெடுவரிசைகளுக்கு "No Negative" மற்றும் "No Positive" மதிப்பீடுகளை கொண்ட 127 வரிசைகள் உள்ளன. அதாவது மதிப்பீட்டாளர் ஹோட்டலுக்கு ஒரு எண் மதிப்பீட்டை கொடுத்தார், ஆனால் ஒரு நேர்மறை அல்லது எதிர்மறை மதிப்பீட்டை எழுத மறுத்தார். அதிர்ஷ்டவசமாக, இது ஒரு சிறிய வரிசைகளின் தொகை (127/515738, அல்லது 0.02%), எனவே இது எங்கள் மாடல் அல்லது முடிவுகளை எந்த ஒரு குறிப்பிட்ட திசையில் சாய்க்காது, ஆனால் மதிப்பீடுகள் இல்லாத வரிசைகள் கொண்ட தரவுத்தொகுப்பை நீங்கள் எதிர்பார்க்கவில்லை, எனவே இந்த தரவுகளை ஆராய்ந்து இவ்வாறான வரிசைகளை கண்டறிவது மதிப்புமிக்கது.
நீங்கள் கவனித்திருப்பீர்கள், `Negative_Review` மற்றும் `Positive_Review` நெடுவரிசைகளில் "No Negative" மற்றும் "No Positive" என்ற இரண்டு மதிப்புக்களையும் கொண்ட 127 வரிசைகள் உள்ளன. இதன் அர்த்தம், மதிப்புரையாளர் ஹோட்டலுக்கு எண்ணிக்கை மதிப்பெண்ணை அளித்திருந்தாலும், நல்லது அல்லது கெட்டது என்று மதிப்புரை வழங்க மறுத்துள்ளார். அதிர்ஷ்டவசமாக, இது மிகவும் குறைந்த வரிசைகள் மட்டுமே (இது 515738 இல் 127, அல்லது 0.02%), எனவே இது நமது மாதிரியை பக்குவமாக மாற்றாது, ஆனால் மதிப்புரைகளுக்கு மதிப்புரைகள் இல்லாத வரிசைகள் இருக்கலாம் என்று அறிந்து கொள்ள அது ஆராய்ந்தது நல்லது.
தரவுத்தொகுப்பை நீங்கள் ஆராய்ந்த பிறகு, அடுத்த பாடத்தில் நீங்கள் தரவுகளை வடிகட்டி, சில உணர்வு பகுப்பாய்வுகளைச் சேர்ப்பீர்கள்.
இப்போது நீங்கள் தரவுத்தொகுப்பை ஆராய்ந்துவிட்டீர்கள், அடுத்த பாடத்தில் தரவை வடிகட்டி, சில உணர்வு பகுப்பாய்வைச் சேர்க்கப்போறோம்.
---
## 🚀சவால்
## 🚀 சவால்
இந்த பாடம், முந்தைய பாடங்களில் பார்த்தது போல, உங்கள் தரவுகளை அதன் குறைபாடுகளுடன் புரிந்துகொள்வது செயல்பாடுகளை செய்யும் முன் மிகவும் முக்கியமானது என்பதை விளக்குகிறது. உரை அடிப்படையிலான தரவுகள், குறிப்பாக, கவனமாக ஆராயப்பட வேண்டும். பல உரை-மிகுந்த தரவுத்தொகுப்புகளை ஆராய்ந்து, ஒரு மாடலில் பாகுபாடு அல்லது சாய்ந்த உணர்வை அறிமுகப்படுத்தக்கூடிய பகுதிகளை கண்டறிய முயற்சிக்கவும்.
இந்தப் பாடம் முந்தைய பாடங்களில் பார்த்தபடி, தரவு மற்றும் அதன் தனித்தன்மைகளை செயல்படுத்துவதற்கு முன் புரிந்து கொள்வது எவ்வளவு முக்கியம் என்பதை வெளிப்படுத்துகிறது. உரைப் பெற்ற தரவுகளாக இருக்கும்போது சிறப்பாக கவனமாக அவற்றை ஆராயவும். மாறுபாடுகள் அல்லது வலுவான உணர்வுகளை மாதிரியில் கொண்டு வரக்கூடிய பகுதிகளை கண்டுபிடிக்க தகவல்களைத் தேடிக்கொள்ளுங்கள்.
## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [பாடம் முடிவுக்குப் பின்னர் வினாக்கள்](https://ff-quizzes.netlify.app/en/ml/)
## மதிப்பீடு & சுயபயிற்சி
## மதிப்பாய்வு மற்றும் சுயபயிற்சி
உரையுடன் மற்றும் உரை-மிகுந்த மாடல்களை உருவாக்க முயற்சிக்கும் போது பயன்படுத்தக்கூடிய கருவிகளை கண்டறிய [இந்த Learning Path on NLP](https://docs.microsoft.com/learn/paths/explore-natural-language-processing/?WT.mc_id=academic-77952-leestott) ஐ எடுத்துக்கொள்ளுங்கள்.
உரை மற்றும் சொற்காட்சிகளுடனான மாதிரிகள் உருவாக்கும்போது முயற்சிக்க தேவையான கருவிகளை இந்த [NLP வெற்றியடையும் பாதையை](https://docs.microsoft.com/learn/paths/explore-natural-language-processing/?WT.mc_id=academic-77952-leestott)ப் பயன்படுத்தி கண்டறியவும்.
## பணிக்கட்டளை
## பணிகள்
[NLTK](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. எங்கள் தரச்செயல்முறையை உறுதிப்படுத்த முயற்சிக்கிறோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,53 +1,76 @@
# ARIMA மூலம் நேர்முகம் கணிப்ப
# ARIMA உடன் நேர வரிசை முன்னறிவ
முந்தைய பாடத்தில், நேர்முகம் கணிப்பு பற்றிய சில அடிப்படைகளை நீங்கள் கற்றுக்கொண்டீர்கள் மற்றும் ஒரு குறிப்பிட்ட காலத்தில் மின்சார சுமை மாறுபாடுகளை காட்டும் தரவுத்தொகுப்பை ஏற்றீர்கள்.
முந்தைய பாடத்தில், நீங்கள் நேர வரிசை முன்னறிவைப் பற்றி சிறிது அறிந்துகொண்டு, ஒரு காலப் பரப்பில் மின்சார சுமையின் வீழ்ச்சிகளை காட்டும் தரவுத்தொகுப்பை ஏற்றினீர்கள்.
[![ARIMA அறிமுகம்](https://img.youtube.com/vi/IUSk-YDau10/0.jpg)](https://youtu.be/IUSk-YDau10 "ARIMA அறிமுகம்")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்யவும்: ARIMA மாதிரிகள் பற்றிய சுருக்கமான அறிமுகம். உதாரணம் R-ல் செய்யப்பட்டுள்ளது, ஆனால் கருத்துக்கள் பொதுவானவை.
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து காணொளியைப் பாருங்கள்: ARIMA மாதிரிகளுக்கான ஒரு சுருக்கமான அறிமுகம். எடுத்துக்காட்டு R இல் செய்யப்பட்டிருப்பாலும், கருத்துகள் உலகளாவியமானவை.
## [பாடத்திற்கு முன் வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [முன்னிலை தேர்வுக்கான வினாக்களஞ்சியம்](https://ff-quizzes.netlify.app/en/ml/)
## அறிமுகம்
இந்த பாடத்தில், [ARIMA: *A*uto*R*egressive *I*ntegrated *M*oving *A*verage](https://wikipedia.org/wiki/Autoregressive_integrated_moving_average) மூலம் மாதிரிகளை உருவாக்க ஒரு குறிப்பிட்ட முறையை நீங்கள் கற்றுக்கொள்வீர்கள். ARIMA மாதிரிகள் குறிப்பாக [non-stationarity](https://wikipedia.org/wiki/Stationary_process) காட்டும் தரவுகளுக்கு பொருத்தமாக இருக்கும்.
இந்த பாடத்தில், நீங்கள் குறிப்பிட்ட ஒரு முறையை கண்டறியப்போகிறீர்கள், அதனை [ARIMA: *A*uto*R*egressive *I*ntegrated *M*oving *A*verage](https://wikipedia.org/wiki/Autoregressive_integrated_moving_average) என்று அழைக்கப்படுகிறது. ARIMA மாதிரிகள் குறிப்பாக [நிலைமையற்றவை](https://wikipedia.org/wiki/Stationary_process) என்று காட்டும் தரவுக்கு மிகச் சிறந்தவை.
## பொதுவான கருத்துக்கள்
## பொதுவான கருத்துகள்
ARIMA-யுடன் வேலை செய்ய, சில முக்கிய கருத்துகளை நீங்கள் அறிந்திருக்க வேண்டும்:
ARIMA உடன் பணியாற்ற, நீங்கள் சில கருத்துக்களை அறிந்திருக்க வேண்டும்:
- 🎓 **Stationarity**. புள்ளியியல் பார்வையில், stationarity என்பது நேரத்தில் மாற்றியமைக்கும்போது அதன் விநியோகம் மாறாத தரவுகளை குறிக்கிறது. Non-stationary தரவுகள், பின்னர், பருவத்தால் ஏற்படும் மாறுபாடுகளை காட்டுகிறது, அவற்றை பகுப்பாய்வு செய்ய மாற்றம் செய்ய வேண்டும். உதாரணமாக, பருவத்தால் ஏற்படும் மாறுபாடுகளை 'seasonal-differencing' மூலம் நீக்கலாம்.
- 🎓 **நிலைமைமையாக்கம்**. புள்ளிவிவரம் சார்ந்த நியாயத்தில், நிலைமைமையாக்கம் என்பது நேரம் மாறினாலும் தரவின் பகிர்வு மாறாததை குறிக்கும். நிலைமையற்ற தரவு என்பது படிமங்கள் காரணமாக வீழ்ச்சிகளை காட்டும், அவற்றை பகுப்பாய்வு செய்ய மாற்றப்படాలి. காலக்கட்ட விருப்பம் உதாரணமாக தரவில் வீழ்ச்சிகளை அறிமுகம் செய்ய முடியும், அதை 'காலக்கட்ட பாகுபாடு' மூலம் நீக்க முடியும்.
- 🎓 **[Differencing](https://wikipedia.org/wiki/Autoregressive_integrated_moving_average#Differencing)**. Differencing என்பது non-stationary தரவுகளை stationarity ஆக மாற்றுவதற்கான செயல்முறையாகும், அதாவது அதன் non-constant trend-ஐ நீக்குவது. "Differencing ஒரு நேர்முகத் தொடரின் நிலையை மாற்றுவதைக் குறைக்கிறது, trend மற்றும் seasonality-ஐ நீக்கி, அதன் சராசரியை நிலைப்படுத்துகிறது." [Shixiong et al-இன் ஆய்வு](https://arxiv.org/abs/1904.07632)
- 🎓 **[பரிசோதனை](https://wikipedia.org/wiki/Autoregressive_integrated_moving_average#Differencing)**. பரிசோதனை தரவுக்கான ஒரு முறை, இதன் மூலம் நிலைமையற்ற தரவை நிலைமைமையாக்கமாக மாற்ற, அதன் நிலைமையற்ற படிமத்தை அகற்றும். "பரிசோதனை நேர வரிசையின் நிலையின் மாற்றங்களை அகற்றி, படிமம் மற்றும் காலக்கட்ட விருப்பத்தை நீக்கும், இதனால் நேர வரிசையின் சராசரி நிலையானதாக இருக்கும்." [Shixiong et al மூலம் கட்டுரை](https://arxiv.org/abs/1904.07632)
## நேர்முகத்தின் சூழலில் ARIMA
## நேர வரிசை சூழலில் ARIMA
நேர்முகத் தரவுகளை மாதிரியாக்க ARIMA எவ்வாறு உதவுகிறது என்பதை நன்கு புரிந்துகொள்ள அதன் பகுதிகளைப் பார்ப்போம்.
ARIMA இன் பகுதிகளை ஆராய்ந்து, இது எவ்வாறு நேர வரிசையை மாதிரியாக்கில் உதவுகிறது மற்றும் எவ்வாறு எதிர்காலம் கணிப்பதில் உதவுகிறது என்று புரிந்துகொள்ளலாம்.
- **AR - AutoRegressive**. Autoregressive மாதிரிகள், பெயரிலேயே உள்ளது போல, உங்கள் தரவின் முந்தைய மதிப்புகளை 'பின்' நோக்கி பார்த்து அவற்றைப் பகுப்பாய்வு செய்கின்றன. இந்த முந்தைய மதிப்புகள் 'lags' என்று அழைக்கப்படுகின்றன. உதாரணமாக, மாதாந்திர பென்சில் விற்பனை தரவுகள். ஒவ்வொரு மாதத்தின் விற்பனை மொத்தம் 'evolving variable' ஆகக் கருதப்படும். இந்த மாதிரி "evolving variable of interest is regressed on its own lagged (i.e., prior) values." [wikipedia](https://wikipedia.org/wiki/Autoregressive_integrated_moving_average)
- **AR - தானாகும் பின்விளைவு**. AutoRegressive மாதிரிகள், பெயரே சொல்வது போல, உங்கள் தரவின் முந்தைய மதிப்புகளைப் பார்க்கின்றன மற்றும் அவற்றைப் பற்றி ஊகிக்கின்றன. இந்த முந்தைய மதிப்புகள் 'தாமதங்கள்' என அழைக்கப்படுகின்றன. உதாரணமாக, மாதாந்திர பேன்சில்கள் விற்பனையை காட்டும் தரவு. ஒவ்வொரு மாததிலும் விற்பனை மொத்தம் 'மாறுபடும் மாறி' ஆக கருதப்படுகிறது. இந்த மாதிரியானது "தாயாரிப்பு மாறி தனது தாமத மதிப்புகளுக்கு மீண்டும் சாரப்படுகிறது." [விக்கிபீடியா](https://wikipedia.org/wiki/Autoregressive_integrated_moving_average)
- **I - Integrated**. 'ARMA' மாதிரிகளுடன் ஒப்பிடும்போது, ARIMA-யில் உள்ள 'I' அதன் *[integrated](https://wikipedia.org/wiki/Order_of_integration)* அம்சத்தை குறிக்கிறது. Non-stationarity-ஐ நீக்க differencing படிகள் பயன்படுத்தப்படும் போது தரவுகள் 'integrated' ஆகின்றன.
- **I - ஒருங்கிணைப்பு**. ARMA மாதிரிகளுக்கு மாறாக, ARIMA இன் 'I' அதன் *[ஒருங்கிணைக்கப்பட்ட](https://wikipedia.org/wiki/Order_of_integration)* அம்சத்தை குறிக்கிறது. தரவு 'ஒருங்கிணைக்கப்படுகிறது' எனும் போது, நிலைமையற்ற தன்மையை நீக்கும் பரிசோதனைச் செயல்முறைகள் செயல்படுத்தப்படுகின்றன.
- **MA - Moving Average**. [Moving-average](https://wikipedia.org/wiki/Moving-average_model) அம்சம் தற்போதைய மற்றும் முந்தைய lags மதிப்புகளைப் பார்த்து output variable-ஐ தீர்மானிக்கிறது.
- **MA - நகரும் சராசரி**. இந்த மாதிரியின் [நகரும் சராசரி](https://wikipedia.org/wiki/Moving-average_model) அம்சம், தற்போதைய மற்றும் முந்தைய தாமத மதிப்புகளைக் கவனித்து முடிவு செய்யும் வெளியீட்டு மாறி ஆகும்.
முக்கியமாக: ARIMA நேர்முகத் தரவின் சிறப்பு வடிவத்துக்கு மிக அருகில் பொருந்தும் மாதிரியை உருவாக்க பயன்படுத்தப்படுகிறது.
சுருக்கமாக: ARIMA நேர வரிசை தரவை மிக நுணுக்கமாக மாதிரியாக்க பயன்படுத்தப்படுகிறது.
## பயிற்சி - ARIMA மாதிரியை உருவாக்கவும
## பயிற்சி - ARIMA மாதிரி உருவாக்குதல
இந்த பாடத்தில் [_/working_](https://github.com/microsoft/ML-For-Beginners/tree/main/7-TimeSeries/2-ARIMA/working) கோப்புறையை திறந்து [_notebook.ipynb_](https://github.com/microsoft/ML-For-Beginners/blob/main/7-TimeSeries/2-ARIMA/working/notebook.ipynb) கோப்பை கண்டறியவும்.
இந்த பாடத்தில் உள்ள [_/working_](https://github.com/microsoft/ML-For-Beginners/tree/main/7-TimeSeries/2-ARIMA/working) கோப்புறையை திறந்து [_notebook.ipynb_](https://github.com/microsoft/ML-For-Beginners/blob/main/7-TimeSeries/2-ARIMA/working/notebook.ipynb) கோப்பை கண்டுகொள்ளுங்கள்.
1. `statsmodels` Python நூலகத்தை ஏற்றவும்; இது ARIMA மாதிரிகளுக்கு தேவைப்படும்.
1. `statsmodels` பைத்தான் நூலகத்தை ஏற்ற வெளியொட்டையை இயக்குங்கள்; இதன் மூலம் ARIMA மாதிரிகள் பயன்படுத்தப்பட வேண்டும்.
1. தேவையான நூலகங்களை ஏற்றவும்
1. தேவையான நூலகங்களை ஏற்று.
1. தரவுகளை `/data/energy.csv` கோப்பிலிருந்து Pandas dataframe-இல் ஏற்றவும் மற்றும் பார்வையிடவும்:
1. இப்போது, தரவு வரைபடப்படுத்த தேவையான மேலும் சில நூலகங்களை ஏற்றுங்கள்:
```python
import os
import warnings
import matplotlib.pyplot as plt
import numpy as np
import pandas as pd
import datetime as dt
import math
from pandas.plotting import autocorrelation_plot
from statsmodels.tsa.statespace.sarimax import SARIMAX
from sklearn.preprocessing import MinMaxScaler
from common.utils import load_data, mape
from IPython.display import Image
%matplotlib inline
pd.options.display.float_format = '{:,.2f}'.format
np.set_printoptions(precision=2)
warnings.filterwarnings("ignore") # எச்சரிக்கை செய்திகளை பிற்புறிக்காக குறிப்பிடு
```
1. `/data/energy.csv` கோப்பிலிருந்து தரவை Pandas தரவுத்தொடர்வாக்கி (dataframe) ஆக ஏற்று பாருங்கள்:
```python
energy = load_data('./data')[['load']]
energy.head(10)
```
1. 2012 ஜனவரி முதல் 2014 டிசம்பர் வரை கிடைக்கும் அனைத்து மின்சார தரவுகளையும் வரைபடமாக்கவும். இந்த தரவுகளை முந்தைய பாடத்தில் பார்த்ததால் எந்த ஆச்சரியமும் இருக்காது:
1. ஜனவரி 2012 முதல் டிசம்பர் 2014 வரை உள்ள அனைத்து எரிசக்தி தரவும் வரைபடம் படுத்துங்கள். இது முந்தைய பாடத்தில் பார்த்த தரவு, அதனால் ஆச்சரியமிடவதில்லை:
```python
energy.plot(y='load', subplots=True, figsize=(15, 8), fontsize=12)
@ -56,22 +79,22 @@ ARIMA-யுடன் வேலை செய்ய, சில முக்கி
plt.show()
```
இப்போது, ஒரு மாதிரியை உருவாக்குவோம்!
இப்போது, ஒரு மாதிரியை உருவாக்குவோம்!
### பயிற்சி மற்றும் சோதனை தரவுத்தொகுப்புகளை உருவாக்கவும
### பயிற்சி மற்றும் சோதனை தரவுத்தொகுப்புகளை உருவாக்குதல
தரவுகளை ஏற்றிய பிறகு, அதை பயிற்சி மற்றும் சோதனை தொகுப்புகளாக பிரிக்கவும். பயிற்சி தொகுப்பில் உங்கள் மாதிரியை பயிற்சி செய்யவும். வழக்கமாக, மாதிரி பயிற்சி முடிந்த பிறகு, அதன் துல்லியத்தை சோதனை தொகுப்பைப் பயன்படுத்தி மதிப்பீடு செய்யவும். மாதிரி எதிர்கால காலகட்டங்களில் இருந்து தகவலைப் பெறாமல் இருக்க, சோதனை தொகுப்பு பயிற்சி தொகுப்பின் பின்னர் காலகட்டத்தை உள்ளடக்க வேண்டும்.
இப்போது உங்கள் தரவு ஏற்றப்பட்டுள்ளது, அதை பயிற்சி மற்றும் சோதனை தொகுதிகளாக பிரிக்கலாம். உங்கள் மாதிரியை பயிற்சி தொகுதியில் பயிற்றுவிப்பீர்கள். சாதாரணமாக, மாதிரி பயிற்சியாயிற்றுப்பின்னர், அதன் நம்பகதன்மையை சோதனை தொகுதியில் மதிப்பீடு செய்வீர்கள். சோதனை தொகுதி பயிற்சி தொகுதியில் இருந்து பின்னர் காலப் பகுதியை உள்ளடக்க வேண்டும், மாதிரி எதிர்கால காலங்களிலிருந்து தகவல் பெறாமல் இருக்க.
1. 2014 செப்டம்பர் 1 முதல் அக்டோபர் 31 வரை இரண்டு மாத காலத்தை பயிற்சி தொகுப்புக்கு ஒதுக்கவும். சோதனை தொகுப்பு 2014 நவம்பர் 1 முதல் டிசம்பர் 31 வரை இரண்டு மாத காலத்தை உள்ளடக்கும்:
1. 2014 செப்டம்பர் 1 முதல் அக்டோபர் 31 வரை இரண்டு மாத காலத்தை பயிற்சி தொகுதிக்கு ஒதுக்குங்கள். சோதனை தொகுதியில் 2014 நவம்பர் 1 முதல் டிசம்பர் 31 வரை இரண்டு மாத காலம் இருக்கும்:
```python
train_start_dt = '2014-11-01 00:00:00'
test_start_dt = '2014-12-30 00:00:00'
```
இந்த தரவுகள் தினசரி மின்சார பயன்பாட்டை பிரதிபலிப்பதால், ஒரு வலுவான பருவ முறை உள்ளது, ஆனால் சமீபத்திய நாட்களில் பயன்பாட்டுடன் மிகவும் ஒத்ததாக உள்ளது.
இந்த தரவு நாள்தோறும் எரிசக்தி பயன்பாட்டை பிரதிபலிக்கும், ஒரு வலுவான காலக்கட்ட முறை உள்ளது, ஆனால் சமீபத்திய நாட்களில் உள்ள பயன்பாட்டுடன் மிகவும் ஒத்துப்போகிறது.
1. வேறுபாடுகளை காட்சிப்படுத்தவும்:
1. வேறுபாடுகளை காட்சிப்படுத்துங்கள்:
```python
energy[(energy.index < test_start_dt) & (energy.index >= train_start_dt)][['load']].rename(columns={'load':'train'}) \
@ -82,17 +105,17 @@ ARIMA-யுடன் வேலை செய்ய, சில முக்கி
plt.show()
```
![பயிற்சி மற்றும் சோதனை தரவுகள்](../../../../translated_images/ta/train-test.8928d14e5b91fc94.webp)
![பயிற்சி மற்றும் சோதனை தரவு](../../../../translated_images/ta/train-test.8928d14e5b91fc94.webp)
எனவே, தரவுகளை பயிற்சி செய்ய ஒரு சிறிய கால சாளரத்தைப் பயன்படுத்துவது போதுமானதாக இருக்கும்.
ஆகையால், தரவை பயிற்றுவிக்க பொது நேரம் குறைந்த ஒரு சாளரம் போலும் போதுமானது.
> குறிப்பு: ARIMA மாதிரியை பொருத்த பயன்படுத்தும் செயல்பாடு fitting போது in-sample validation பயன்படுத்துவதால், validation தரவுகளை தவிர்க்கலாம்.
> குறிப்பு: ARIMA மாதிரியை பொருந்தும் செயல்பாட்டில் உள்ள மாதிரி உள்ளடக்கங்களில் எடுத்துக்காட்டு நிறைவு செய்யும் போது நாம் தேர்வான தரவை தவிர்க்கிறோம்.
### பயிற்சிக்கான தரவுகளை தயாரிக்கவும்
### பயிற்சிக்கான தரவை தயாரிப்பது
ரவுகளை வடிகட்டி மற்றும் அளவீடு செய்வதன் மூலம் பயிற்சிக்கான தரவுகளை தயாரிக்க வேண்டும். தரவுத்தொகுப்பை தேவையான காலகட்டங்கள் மற்றும் நெடுவரிசைகளை மட்டும் உள்ளடக்க வடிகட்டவும், தரவுகளை 0,1 இடைவெளியில் project செய்ய அளவீடு செய்யவும்.
இப்போது, உங்கள் தரவை வடிகட்டி மற்றும் அளவீட்டு செயல்களை செய்து பயிற்சிக்கு தயாரிக்க வேண்டும். உங்கள் தரவுத்தொகுப்பை தேவையான காலப்பகுதிகள் மற்றும் பத்திகளுக்காக மட்டும் வடிகட்டி, தரவை 0,1 இடைவெளியில் வரும் வகையில் அளவீடு செய்யவும்.
1. முதலில் குறிப்பிடப்பட்ட காலகட்டங்கள் மற்றும் 'load' நெடுவரிசை மட்டும் உள்ளடக்க தரவுத்தொகுப்பை வடிகட்டவும்:
1. முதலில், மேலே கூறிய காலப்பகுதிகளை மற்றும் தேவையான 'load' பத்தி மற்றும் தேதியுடன் மட்டுமே அடக்கம் செய்யும் வகையில் தரவுத்தொகுப்பை வடிகட்டுங்கள்:
```python
train = energy.copy()[(energy.index >= train_start_dt) & (energy.index < test_start_dt)][['load']]
@ -102,14 +125,14 @@ ARIMA-யுடன் வேலை செய்ய, சில முக்கி
print('Test data shape: ', test.shape)
```
தரவின் வடிவத்தை நீங்கள் காணலாம்:
தரவு வடிவத்தைப் பார்க்கலாம்:
```output
Training data shape: (1416, 1)
Test data shape: (48, 1)
```
1. தரவுகளை (0, 1) வரம்பில் அளவீடு செய்யவும்.
1. தரவை (0, 1) வரையறையில் அளவீடு செய்யவும்.
```python
scaler = MinMaxScaler()
@ -117,7 +140,7 @@ ARIMA-யுடன் வேலை செய்ய, சில முக்கி
train.head(10)
```
1. அசல் தரவுடன் ஒப்பிடும் அளவீடு செய்யப்பட்ட தரவுகளை காட்சிப்படுத்தவும்:
1. ஆரம்ப தரவு மற்றும் அளவீடு செய்யப்பட்ட தரவை காட்சிப்படுத்துங்கள்:
```python
energy[(energy.index >= train_start_dt) & (energy.index < test_start_dt)][['load']].rename(columns={'load':'original load'}).plot.hist(bins=100, fontsize=12)
@ -125,50 +148,50 @@ ARIMA-யுடன் வேலை செய்ய, சில முக்கி
plt.show()
```
![அசல்](../../../../translated_images/ta/original.b2b15efe0ce92b87.webp)
![அசல்](../../../../translated_images/ta/original.b2b15efe0ce92b87.webp)
> அசல் தரவுகள்
> அசல் தரவு
![அளவீடு செய்யப்பட்ட](../../../../translated_images/ta/scaled.e35258ca5cd3d43f.webp)
![அளவிடப்பட்டது](../../../../translated_images/ta/scaled.e35258ca5cd3d43f.webp)
> அளவீடு செய்யப்பட்ட தரவுகள்
> அளவீடு செய்யப்பட்ட தரவு
1. இப்போது அளவீடு செய்யப்பட்ட தரவுகளை சரிசெய்த பிறகு, சோதனை தரவுகளை அளவீடு செய்யவும்:
1. ஒருவேளை, நீங்கள் அளவிடப்பட்ட தரவை அளவீடு செய்து விட்டீர்கள், இப்போது சோதனை தரவையும் அளவீடு செய்யுங்கள்:
```python
test['load'] = scaler.transform(test)
test.head()
```
### ARIMA-ஐ செயல்படுத்தவும
### ARIMA ஐ செயல்படுத்துதல
இப்போது ARIMA-ஐ செயல்படுத்த நேரம்! நீங்கள் முன்பு நிறுவிய `statsmodels` நூலகத்தைப் பயன்படுத்துவீர்கள்.
ARIMA ஐ தற்போது செயல்படுத்த நேரம்! நீங்கள் முன்னர் நிறுவிய `statsmodels` நூலகத்தை இப்போது பயன்படுத்தப்போகிறீர்கள்.
இப்போது சில படிகளை பின்பற்ற வேண்டும்:
இப்போது நீங்கள் பல படிகள் பின்பற்ற வேண்டும்
1. `SARIMAX()`-ஐ அழைத்து மாதிரியின் அளவுருக்களை: p, d, மற்றும் q அளவுருக்கள், மற்றும் P, D, மற்றும் Q அளவுருக்கள் வழங்கி மாதிரியை வரையறுக்கவும்.
2. `fit()` செயல்பாட்டை அழைத்து பயிற்சி தரவுக்கான மாதிரியை தயாரிக்கவும்.
3. `forecast()` செயல்பாட்டை அழைத்து முன்னறிவிப்பு செய்யவும் மற்றும் முன்னறிவிப்பு செய்ய வேண்டிய படிகள் (the `horizon`) குறிப்பிடவும்.
1. `SARIMAX()` ஐ அழைத்து மாதிரி அளவுருக்கள் p, d, மற்றும் q, மற்றும் P, D, மற்றும் Q அளவுருக்களை கடந்து மாதிரியை வரையறுக்கவும்.
2. பயிற்சி தரவுக்கான மாதிரியை fit() செயல்பாட்டை அழைத்து தயார் செய்யவும்.
3. எண்ணிக்கையை (`horizon`) குறிப்பிட்டு `forecast()` செயல்பாட்டை அழைத்து முன்னறிவுகளை செய்யவும்.
> 🎓 இந்த அளவுருக்கள் எதற்காக? ARIMA மாதிரியில், நேர்முகத்தின் முக்கிய அம்சங்களை: பருவம், போக்கு, மற்றும் சத்தம் மாதிரியாக்க உதவும் 3 அளவுருக்கள் உள்ளன:
> 🎓 இந்த அனைத்து அளவுருக்கள் எதற்காக இருக்கின்றன? ARIMA மாதிரியில் 3 அளவுருக்கள் உள்ளன, அவை நேர வரிசையின் முக்கிய அம்சங்களான காலக்கட்டி, படிமம் மற்றும் சத்தத்தை மாதிரியாக்க உதவுகின்றன. அவை:
`p`: மாதிரியின் auto-regressive அம்சத்துடன் தொடர்புடைய அளவுரு, இது *முந்தைய* மதிப்புகளை உள்ளடக்குகிறது.
`d`: மாதிரியின் integrated பகுதிக்கு தொடர்புடைய அளவுரு, இது நேர்முகத் தொடரில் *differencing* (🎓 differencing-ஐ நினைவில் கொள்ளுங்கள் 👆?) அளவை பாதிக்கிறது.
`q`: மாதிரியின் moving-average பகுதிக்கு தொடர்புடைய அளவுரு.
`p`: மாதிரியின் தானாகும் பின்விளைவு அம்சத்திற்கு தொடர்புடைய அளவுரு, இது *ஏற்றி* மதிப்புகளைச் சேர்க்கிறது.
`d`: மாதிரியின் ஒருங்கிணைந்த பகுதியுக்கான அளவுரு, இது நேர வரிசையில் *பரிசோதனை* (🎓 மேல் பரிசோதனை நினைவுகூரவும் 👆) அளவுக்கு பாதிப்பை ஏற்படுத்துகிறது.
`q`: நகரும் சராசரி பகுதியுக்கான அளவுரு.
> குறிப்பு: உங்கள் தரவுகளில் பருவ அம்சம் இருந்தால் - இந்த தரவுகளில் உள்ளது - , seasonal ARIMA மாதிரி (SARIMA) பயன்படுத்த வேண்டும். அந்த நேரத்தில், `p`, `d`, மற்றும் `q`-க்கு ஒத்த seasonal கூறுகளை விவரிக்க `P`, `D`, மற்றும் `Q` அளவுருக்கள் தேவைப்படும்.
> குறிப்பு: உங்கள் தரவில் காலக்கட்டு அம்சம் இருந்தால் - இந்தப் பதிவு அதுபோலவே உள்ளது - , காலக்கட்டி ARIMA மாதிரி (SARIMA) பயன்படுத்தப்படும். அந்த நிலைமைக்கான தனிப்பட்ட அளவுருக்கள்: `P`, `D`, மற்றும் `Q` இவை `p`, `d`, மற்றும் `q` எனும் அளவுருக்களின் காலக்கட்ட அம்சங்களுக்கான இணைப்புகளாகும்.
1. உங்கள் விருப்பமான horizon மதிப்பை அமைக்க தொடங்குங்கள். 3 மணி நேரம் முயற்சிக்கலாம்:
1. முதலில் உங்கள் விருப்பமான கணிப்புப் பரப்பை அமைக்கவும். எடுத்துக்காட்டாக 3 மணி நேரத்திற்கு முயற்சி செய்யுங்கள்:
```python
# Specify the number of steps to forecast ahead
# முன்னால் கணிக்க படவுள்ள படிகளின் எண்ணிக்கை குறிப்பிடுக
HORIZON = 3
print('Forecasting horizon:', HORIZON, 'hours')
```
ARIMA மாதிரியின் அளவுருக்களுக்கு சிறந்த மதிப்புகளை தேர்ந்தெடுப்பது சற்று சிக்கலானது மற்றும் நேரம் பிடிக்கும். [`pyramid` நூலகத்தின்](https://alkaline-ml.com/pmdarima/0.9.0/modules/generated/pyramid.arima.auto_arima.html) `auto_arima()` செயல்பாட்டைப் பயன்படுத்த பரிந்துரைக்கலாம்.
ARIMA மாதிரி அளவுருக்களின் சிறந்த மதிப்புகளை தேர்வு செய்வது சிரமமாக இருக்கலாம், ஏனெனில் அது சுயபரிசோதி மற்றும் நேரம் எடுக்கும். நீங்கள் [`pyramid` நூலகத்தின் `auto_arima()`](https://alkaline-ml.com/pmdarima/0.9.0/modules/generated/pyramid.arima.auto_arima.html) செயல்பாட்டைப் பயன்படுத்தலாம்,
1. தற்போது சில கையேடு தேர்வுகளை முயற்சித்து ஒரு நல்ல மாதிரியை கண்டறியவும்.
1. இப்போது சில கையாலான தேர்வுகளைச் செய்து நல்ல மாதிரியை கண்டறிய முயற்சி செய்க.
```python
order = (4, 1, 0)
@ -180,23 +203,23 @@ ARIMA-யுடன் வேலை செய்ய, சில முக்கி
print(results.summary())
```
முடிவுகளின் ஒரு அட்டவணை அச்சிடப்படுகிறது.
முடிவுகளின் அட்டவணை அச்சிடப்படும்.
நீங்கள் உங்கள் முதல் மாதிரியை உருவாக்கியுள்ளீர்கள்! இப்போது அதை மதிப்பீடு செய்ய ஒரு வழியை கண்டறிய வேண்டும்.
உங்கள் முதல் மாதிரியை நீங்கள் உருவாக்கியுள்ளீர்கள்! இப்போது அதை மதிப்பீடு செய்ய வேண்டும்.
### உங்கள் மாதிரியை மதிப்பீடு செய்யவும
### உங்கள் மாதிரியை மதிப்பீடு செய்யுங்கள
உங்கள் மாதிரியை மதிப்பீடு செய்ய, `walk forward` validation எனப்படும் முறையை செயல்படுத்தலாம். நடைமுறையில், நேர்முக மாதிரிகள் புதிய தரவுகள் கிடைக்கும் ஒவ்வொரு முறையும் மீண்டும் பயிற்சி செய்யப்படுகின்றன. இது ஒவ்வொரு நேரக்கட்டத்திலும் சிறந்த முன்னறிவிப்பை செய்ய மாதிரியை அனுமதிக்கிறது.
உங்கள் மாதிரியை மதிப்பீடு செய்ய, `walk forward` எனப்படும் சரிபார்ப்பை செய்யலாம். நடைமுறையில், நேர வரிசை மாதிரிகள் புதிய தரவு கிடைக்கும்போது மீண்டும் பயிற்சிக்கப்படுகின்றன. இது மாதிரிக்கு ஒவ்வொரு நேரத்திலும் சிறந்த முன்னறிவை செய்கிறது.
இந்த தொழில்நுட்பத்தைப் பயன்படுத்தி நேர்முகத் தொடரின் தொடக்கத்தில் இருந்து, பயிற்சி தரவுத்தொகுப்பில் மாதிரியை பயிற்சி செய்யவும். பின்னர், அடுத்த நேரக்கட்டத்தில் ஒரு முன்னறிவிப்பு செய்யவும். முன்னறிவிப்பு அறியப்பட்ட மதிப்புடன் மதிப்பீடு செய்யப்படுகிறது. பின்னர் பயிற்சி தொகுப்பு அறியப்பட்ட மதிப்பை உள்ளடக்க விரிவாக்கப்படுகிறது, மற்றும் செயல்முறை மீண்டும் செய்யப்படுகிறது.
நேர வரிசையின் ஆரம்பத்தில் இருந்து இந்த முறையை பின்பற்றி, பயிற்சி தரவுடன் மாதிரியை பயிற்றுவிக்கவும். பிறகு அடுத்த நேரத்திற்கான முன்னறிவை செய்யவும். முன்னறிவு அறிவான மதிப்புடன் ஒப்பிடப்படுகிறது. பிறகு பயிற்சி தொகுதி அந்த மதிப்பை சேர்க்கும் வகையில் விரிவடைகிறது மற்றும் செயல்முறை மீண்டும் நடக்கிறது.
> குறிப்பு: பயிற்சி தொகுப்பு சாளரத்தை நிலையாக வைத்திருப்பது பயிற்சியை மேலும் திறமையாக செய்ய உதவும், ஒவ்வொரு முறையும் நீங்கள் பயிற்சி தொகுப்பில் புதிய கண்காணிப்பைச் சேர்க்கும் போது, தொகுப்பின் தொடக்கத்தில் இருந்து கண்காணிப்பை நீக்க வேண்டும்.
> குறிப்பு: பயிற்சி தொகுதி சாளரத்தை நிலையானதாக்கி வைத்திருக்க வேண்டும், இதனால் ஒவ்வொரு முறையும் புதிய மதிப்பை இணைக்கும் போது தொடக்கத்தின் மதிப்பை நீக்குங்கள்.
இந்த செயல்முறை மாதிரி நடைமுறையில் எப்படி செயல்படும் என்பதை மேலும் வலுவான மதிப்பீட்டை வழங்குகிறது. இருப்பினும், இது பல மாதிரிகளை உருவாக்குவதற்கான கணினி செலவுடன் வருகிறது. தரவுகள் சிறியதாக இருந்தால் அல்லது மாதிரி எளிமையானதாக இருந்தால் இது ஏற்றுக்கொள்ளக்கூடியது, ஆனால் அளவிலான தரவுகளுக்கு இது சிக்கலாக இருக்கலாம்.
இந்த செயல்முறை மாதிரி நடைமுறையில் எவ்வாறு செயல்படும் என்பதை நன்றாக மதிப்பீடு செய்ய உதவுகிறது. ஆனால், இது அதிக மாதிரிகளை உருவாக்குவதால் கணினி செலவு அதிகரிக்கிறது. தரவு சிறியதாகவும் மாதிரி எளிமையாகவும் இருந்தால் இது ஏற்றுக்கொள்ளத்தக்கது, ஆனால் பெரிய அளவில் சிக்கல் இருக்கலாம்.
Walk-forward validation நேர்முக மாதிரி மதிப்பீட்டின் தங்க நிலைமையாகும் மற்றும் உங்கள் சொந்த திட்டங்களுக்கு பரிந்துரைக்கப்படுகிறது.
நடைமுறை சோதனை செயல்முறை நேர வரிசை மாதிரி மதிப்பீட்டின் சரித்திர நிலையானது மற்றும் உங்கள் சொந்த திட்டங்களுக்கு பரிந்துரைக்கப்படுகிறது.
1. ஒவ்வொரு HORIZON படிக்கட்டிற்கான சோதனை தரவுப் புள்ளியை உருவாக்கவும்.
1. முதலில், ஒவ்வொரு HORIZON படியும் சரிபார்க்கும் தரவு புள்ளியை உருவாக உருவாக்குங்கள்.
```python
test_shifted = test.copy()
@ -216,13 +239,13 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
| 2014-12-30 | 03:00:00 | 0.27 | 0.30 | 0.41 |
| 2014-12-30 | 04:00:00 | 0.30 | 0.41 | 0.57 |
தரவுகள் அதன் horizon புள்ளிக்கு ஏற்ப கிடைமட்டமாக மாற்றப்படுகின்றன.
தரவு அதன் கணிப்புப் புள்ளிக்கேற்ப ஆகாரமாக மாற்றப்பட்டுள்ளது.
1. சோதனை தரவுகளில் முன்னறிவிப்புகளை இந்த sliding window அணுகுமுறையைப் பயன்படுத்தி சோதனை தரவின் நீளத்திற்கு சமமான ஒரு மடக்கத்தில் செய்யவும்:
1. சோதனை தரவில் இந்த நகரும் சாளரம் முறையை ஒரு சுழற்சியில் பயன்படுத்தி கணிப்புகளைச் செய்யுங்கள்:
```python
%%time
training_window = 720 # dedicate 30 days (720 hours) for training
training_window = 720 # பயிற்சிக்கு 30 நாட்கள் (720 மணி நேரம்) ஒதுக்கி வைக்கவும்
train_ts = train['load']
test_ts = test_shifted
@ -241,14 +264,14 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
yhat = model_fit.forecast(steps = HORIZON)
predictions.append(yhat)
obs = list(test_ts.iloc[t])
# move the training window
# பயிற்சி சாளரத்தை நகர்த்தவும்
history.append(obs[0])
history.pop(0)
print(test_ts.index[t])
print(t+1, ': predicted =', yhat, 'expected =', obs)
```
பயிற்சி நடைபெறுவதை நீங்கள் காணலாம்:
நீங்கள் பயிற்சி நிகழ்வை காணலாம்:
```output
2014-12-30 00:00:00
@ -261,7 +284,7 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
3 : predicted = [0.27 0.28 0.32] expected = [0.2739480752014323, 0.26812891674127126, 0.3025962399283795]
```
1. முன்னறிவிப்புகளை உண்மையான load-ஐ ஒப்பிடவும்:
1. கணிப்புகளை உண்மை 'load' உடன் ஒப்பிடுங்கள்:
```python
eval_df = pd.DataFrame(predictions, columns=['t+'+str(t) for t in range(1, HORIZON+1)])
@ -272,28 +295,30 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
eval_df.head()
```
வெளியீடு
| | | timestamp | h | prediction | actual |
| --- | ---------- | --------- | --- | ---------- | -------- |
| 0 | 2014-12-30 | 00:00:00 | t+1 | 3,008.74 | 3,023.00 |
| 1 | 2014-12-30 | 01:00:00 | t+1 | 2,955.53 | 2,935.00 |
| 2 | 2014-12-30 | 02:00:00 | t+1 | 2,900.17 | 2,899.00 |
| 3 | 2014-12-30 | 03:00:00 | t+1 | 2,917.69 | 2,886.00 |
| 4 | 2014-12-30 | 04:00:00 | t+1 | 2,946.99 | 2,963.00 |
வெளியீடு
| | | timestamp | h | prediction | actual |
| --- | ---------- | --------- | --- | ---------- | -------- |
| 0 | 2014-12-30 | 00:00:00 | t+1 | 3,008.74 | 3,023.00 |
| 1 | 2014-12-30 | 01:00:00 | t+1 | 2,955.53 | 2,935.00 |
| 2 | 2014-12-30 | 02:00:00 | t+1 | 2,900.17 | 2,899.00 |
| 3 | 2014-12-30 | 03:00:00 | t+1 | 2,917.69 | 2,886.00 |
| 4 | 2014-12-30 | 04:00:00 | t+1 | 2,946.99 | 2,963.00 |
மணிநேர தரவின் முன்னறிவிப்பை, உண்மையான load-ஐ ஒப்பிடவும். இது எவ்வளவு துல்லியமாக உள்ளது?
அங்குள்ள கடிகார தரவின் கணிப்பைப் பார்க்கவும், அது உண்மையான 'load' உடன் ஒப்பிடுகையில் எவ்வளவு துல்லியமாக உள்ளது?
### மாதிரி துல்லியத்தைச் சரிபார்க்கவும்
### மாதிரி துல்லியத்தைப் பரிசோதிக்கவும்
முன்னறிவிப்புகளின் mean absolute percentage error (MAPE)-ஐ சோதனை செய்து உங்கள் மாதிரியின் துல்லியத்தைச் சரிபார்க்கவும்.
உங்கள் மாதிரியின் துல்லியத்தை அனைத்து கணிப்புகளின் சராசரி முழுமையான சதவீத பிழை (MAPE) மூலம் சோதிக்குங்கள்.
> **🧮 கணிதத்தை காட்டம்**
> **🧮 கணிதத்தை எனக்கு காட்டு**
>
> ![MAPE](../../../../translated_images/ta/mape.fd87bbaf4d346846.webp)
>
> [MAPE](https://www.linkedin.com/pulse/what-mape-mad-msd-time-series-allameh-statistics/) என்பது மேலே கொடுக்கப்பட்ட சமன்பாட்டின் மூலம் வரையறுக்கப்பட்ட விகிதமாக கணிப்பு துல்லியத்தை காட்ட பயன்படுத்தப்படுகிறது. உண்மையான<sub>t</sub> மற்றும் கணிக்கப்பட்ட<sub>t</sub> இடையேயான வேறுபாடு உண்மையான<sub>t</sub> மூலம் வகுக்கப்படுகிறது. "இந்த கணக்கீட்டில் உள்ள முழு மதிப்பு ஒவ்வொரு கணிக்கப்பட்ட நேர புள்ளிக்கும் சேர்க்கப்பட்டு, பொருத்தப்பட்ட புள்ளிகளின் எண்ணிக்கையால் n வகுக்கப்படுகிறது." [wikipedia](https://wikipedia.org/wiki/Mean_absolute_percentage_error)
> [MAPE](https://www.linkedin.com/pulse/what-mape-mad-msd-time-series-allameh-statistics/) முன்னறிவு துல்லியத்தை மேற்கண்ட சூத்திரத்தால் கணக்கிடும் விகிதமாக பயன்படுத்தப்படுகிறது. உண்மை<sub>t</sub> மற்றும் கணிக்கப்பட்ட<sub>t</sub> இடையேயான வேறுபாடு உண்மை<sub>t</sub> உடன் வகுக்கப்படுகிறது. "இந்த கணக்கீட்டில் முற்றிலும் மதிப்பு ஒவ்வொரு முன்னறிவிடப்பட்ட பண்டைய புள்ளிக்குமான கூட்டு, அத்துடன் பொருந்திய புள்ளிகளின் எண்ணிக்கையால் (n) வகுக்கப்படுகிறது." [விக்கிப்பீடியா](https://wikipedia.org/wiki/Mean_absolute_percentage_error)
1. சமன்பாட்டை குறியீட்டில் வெளிப்படுத்தவும்:
1. குறியீட்டில் சமன்பாட்டை வெளிப்படுத்துதல்:
```python
if(HORIZON > 1):
@ -301,15 +326,15 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
print(eval_df.groupby('h')['APE'].mean())
```
1. ஒரு படியின் MAPE ஐ கணக்கிடவும்:
1. ஒரு படியின் MAPE ஐ கணக்கிடுங்கள்:
```python
print('One step forecast MAPE: ', (mape(eval_df[eval_df['h'] == 't+1']['prediction'], eval_df[eval_df['h'] == 't+1']['actual']))*100, '%')
```
ஒரு படி கணிப்பு MAPE: 0.5570581332313952 %
ஒரு படி முன்னறிக்கை MAPE: 0.5570581332313952 %
1. பல படி கணிப்பு MAPE ஐ அச்சிடவும்:
1. பல படி முன்னறிக்கையின் MAPE ஐ அச்சிடுங்கள்:
```python
print('Multi-step forecast MAPE: ', mape(eval_df['prediction'], eval_df['actual'])*100, '%')
@ -319,17 +344,17 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
Multi-step forecast MAPE: 1.1460048657704118 %
```
ஒரு சிறந்த குறைந்த எண்ணிக்கை சிறந்தது: MAPE 10 என்றால், அது 10% தவறாக உள்ளது என்று பொருள்.
ஒரு சிறந்த குறைந்த எண் சிறந்தது: MAPE 10 கொண்ட முன்னறிக்கை 10% விலகியுள்ளது என்று கருதவும்.
1. ஆனால் எப்போதும் போல, இந்த மாதிரியான துல்லிய அளவீட்டை கண்ணுக்கு தெளிவாக பார்க்க எளிதாக இருக்கும், எனவே இதை வரைபடமாக வரைவோம்:
1. ஆனால் எப்போதும் உள்ளது போல், இந்த வகையான துல்லியம் அளவுகோலை காட்சி வடிவில் பார்க்க எளிதாகும், ஆகவே அதை வரைபடமாக்கலாம்:
```python
if(HORIZON == 1):
## Plotting single step forecast
## ஒரே படி முன்னறிவிப்பை வரைபடம் செய்வது
eval_df.plot(x='timestamp', y=['actual', 'prediction'], style=['r', 'b'], figsize=(15, 8))
else:
## Plotting multi step forecast
## பல படிகள் முன்னறிவிப்பை வரைபடம் செய்வது
plot_df = eval_df[(eval_df.h=='t+1')][['timestamp', 'actual']]
for t in range(1, HORIZON+1):
plot_df['t+'+str(t)] = eval_df[(eval_df.h=='t+'+str(t))]['prediction'].values
@ -349,27 +374,29 @@ Walk-forward validation நேர்முக மாதிரி மதிப்
plt.show()
```
![ஒரு நேர வரிசை மாதிரி](../../../../translated_images/ta/accuracy.2c47fe1bf15f44b3.webp)
![ஒரு கால வரிசை மாதிரி](../../../../translated_images/ta/accuracy.2c47fe1bf15f44b3.webp)
🏆 ஒரு மிக அழகான வரைபடம், நல்ல துல்லியத்துடன் ஒரு மாதிரியை காட்டுகிறது. நல்ல வேலை!
🏆 ஒரு மிகவும் சிறந்த வரைபடம், நல்ல துல்லியம் கொண்ட மாதிரியை காட்டுகிறது. நன்றாக செயற்கை!
---
## 🚀சவால்
ஒரு நேர வரிசை மாதிரியின் துல்லியத்தை சோதிக்க பல வழிகளை ஆராயுங்கள். இந்த பாடத்தில் நாங்கள் MAPE பற்றி பேசுகிறோம், ஆனால் நீங்கள் பயன்படுத்தக்கூடிய பிற முறைகள் உள்ளதா? அவற்றை ஆராய்ந்து குறிப்பிட்டு எழுதுங்கள். [இங்கே](https://otexts.com/fpp2/accuracy.html) ஒரு பயனுள்ள ஆவணம் கிடைக்கிறது.
கால வரிசை மாதிரியின் துல்லியத்தை சோதிக்கும் வழிகளை ஆராயுங்கள். இந்த பாடத்தில் நாம் MAPE ஐ தொட touchுகின்றோம், ஆனால் நீங்கள் பயன்படுத்தக்க பிற முறைமைகள் உள்ளதா? அவற்றை ஆராய்ந்து குறிப்பு இடுங்கள். உதவிக்குரிய ஆவணம் [இங்கே](https://otexts.com/fpp2/accuracy.html) காணலாம்
## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [பாடம் முடிந்த பிறகு வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## மதிப்பீடு & சுயபடிப்ப
## மதிப்பாய்வு & சுயஅறிவ
இந்த பாடம் ARIMA உடன் நேர வரிசை கணிப்பின் அடிப்படைகளை மட்டுமே தொடுகிறது. [இந்த களஞ்சியத்தை](https://microsoft.github.io/forecasting/) மற்றும் அதன் பல்வேறு மாதிரி வகைகளை ஆராய்ந்து நேர வரிசை மாதிரிகளை உருவாக்கும் பிற வழிகளை அறிய உங்கள் அறிவை ஆழமாக்க நேரம் ஒதுக்குங்கள்.
இந்த பாடம் ARIMA உடன் கால வரிசை முன்னறிக்கையின் அடிப்படைகளை மட்டுமே தொடுகிறது. [இந்த களஞ்சியத்தை](https://microsoft.github.io/forecasting/) மற்றும் அதன் பல்வேறு மாதிரி வகைகளை ஆராய்ந்து உங்கள் அறிவைப் பராமரிக்கவும், கால வரிசை மாதிரிகளை உருவாக்கும் பிற வழிகளைக் கற்றுக்கொள்வதும் சிறந்தது.
## பணிக்கட்டளை
## பணித் த simultaneous செயல்
[ஒரு புதிய ARIMA மாதிரி](assignment.md)
[புதிய ARIMA மாதிரி](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கிறோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளுங்கள். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,125 +1,155 @@
# Postscript: இயல்புநிலை உலகில் இயந்திரக் கற்றல்
# பின்னூட்டம்: இயந்திரக் கல்வி நிஜ உலகில்
![Sketchnote: இயல்புநிலை உலகில் இயந்திரக் கற்றலின் சுருக்கம்](../../../../translated_images/ta/ml-realworld.26ee274671615577.webp)
> Sketchnote: [Tomomi Imura](https://www.twitter.com/girlie_mac) உருவாக்கியது
இந்த பாடத்திட்டத்தில், தரவுகளை பயிற்சிக்கத் தயார்படுத்தவும், இயந்திரக் கற்றல் மாதிரிகளை உருவாக்கவும் பல வழிகளை நீங்கள் கற்றுக்கொண்டீர்கள். நீங்கள் பாரம்பரிய ரிக்ரஷன், கிளஸ்டரிங், வகைப்படுத்தல், இயற்கை மொழி செயலாக்கம் மற்றும் நேரம் வரிசை மாதிரிகளை உருவாக்கினீர்கள். வாழ்த்துக்கள்! இப்போது, இதற்கெல்லாம் என்ன பயன் என்று நீங்கள் கேட்கலாம்... இந்த மாதிரிகளின் இயல்புநிலை பயன்பாடுகள் என்ன?
![நிஜ உலகில் இயந்திரக் கல்வியின் சுருக்கக் குறிப்பு ஒரு ஸ்கெட்ச்நோட்டில்](../../../../translated_images/ta/ml-realworld.26ee274671615577.webp)
> ஸ்கெட்ச்நோட் [Tomomi Imura](https://www.twitter.com/girlie_mac) என்பவரால்
தொழில்துறையில் AI மீது அதிக ஆர்வம் காணப்படுகிறது, இது பொதுவாக ஆழமான கற்றலை பயன்படுத்துகிறது. இருப்பினும், பாரம்பரிய இயந்திரக் கற்றல் மாதிரிகளுக்கு fortfarande மதிப்புள்ள பயன்பாடுகள் உள்ளன. இன்றே நீங்கள் சிலவற்றைப் பயன்படுத்தக்கூடும்! இந்த பாடத்தில், எட்டு வெவ்வேறு தொழில்துறைகள் மற்றும் பொருள்-துறை பகுதிகள் இந்த மாதிரிகளை எவ்வாறு பயன்படுத்தி தங்கள் பயன்பாடுகளை மேலும் செயல்திறன், நம்பகத்தன்மை, புத்திசாலித்தனம் மற்றும் பயனாளர்களுக்கு மதிப்புமிக்கதாக மாற்றுகின்றன என்பதை நீங்கள் ஆராய்வீர்கள்.
இந்த பாடத்திட்டத்தில், நீங்கள் பயிற்சிக்காக தரவைத் தயார் செய்வதற்கும் இயந்திரக் கல்வி மாதிரிகளை உருவாக்குவதற்குமான பல வழிகளை கற்றுக்கொண்டீர்கள். நீங்கள் ஒரு தொடர் பாரம்பரிய வினைத்திறன், தொகுப்பு, வகைப்படுத்தல், இயற்கை மொழி செயலாக்கம் மற்றும் கால வரிசை மாதிரிகளை உருவாக்கி உள்ளீர்கள். வாழ்த்துகள்! இப்போது, இவையென்னைவ அடிக்கடி வினவலாம்... இந்த மாதிரிகளின் நிஜ உலக பயன்பாடுகள் என்ன?
## [பாடத்துக்கு முன் வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
தொழிற்துறையில் பெரும்பாலும் ஆழ்ந்த கற்றலை பயன்படுத்துகின்ற AIக்கு பெரும் ஆர்வம் இருந்தாலும், பாரம்பரிய இயந்திரக் கல்வி மாதிரிகளுக்கும் இன்னும் மதிப்புமிக்க பயன்பாடுகள் உள்ளன. நீங்கள் இன்று கூட சிலவற்றை பயன்படுத்தி இருப்பீர்கள்! இந்த பாடத்தில், எட்டுப்பிரிவுகள் மற்றும் தலைமைத் துறை துறைகள் இவை மாதிரிகள் பயன்படுத்தப்படுவதால் அவற்றின் பயன்பாடுகள் மேலும் திறமையானது, நம்பகமானது, அறிவார்ந்தது மற்றும் பயனர்களுக்கு பெருமளவு மதிப்புள்ளவையாகக்கூடிய விதம் ஆராய்பீர்கள்.
## [முன்-பாடத்திட்டத் தேர்வு](https://ff-quizzes.netlify.app/en/ml/)
## 💰 நிதி
நிதி துறை இயந்திரக் கற்றலுக்கு பல வாய்ப்புகளை வழங்குகிறது. இந்த துறையில் உள்ள பல பிரச்சினைகள் ML பயன்படுத்தி மாதிரி அமைக்கவும் தீர்க்கவும் ஏற்றதாக உள்ளன.
நிதி துறையில் இயந்திரக் கல்விக்கான பல வாய்ப்புகள் உள்ளன. இந்த பகுதியின் பல பிரச்சனைகள் இயந்திரக் கல்வி பயன்படுத்தி மாதிரிகள் செய்து தீர்க்கக்கூடியவை.
### கிரெடிட் கார்டு மோசடி கண்டறிதல்
### கடன் அட்டை மோசடி கண்டறிதல்
நாம் [k-means clustering](../../5-Clustering/2-K-Means/README.md) பற்றி முன்பே கற்றுக்கொண்டோம், ஆனால் இது கிரெடிட் கார்டு மோசடிகளுடன் தொடர்புடைய பிரச்சினைகளை எவ்வாறு தீர்க்க உதவுகிறது?
நாங்கள் பாடத்தில் முன்பு [k-மீன்ஸ் தொகுப்பு](../../5-Clustering/2-K-Means/README.md) பற்றி கற்றோம், ஆனால் கடன் அட்டை மோசடியுடன் தொடர்புடைய பிரச்சனைகளை இதைப் பயன்படுத்தி எப்படி தீர்க்கலாம்?
k-means clustering கிரெடிட் கார்டு மோசடி கண்டறிதல் தொழில்நுட்பத்தில் **outlier detection** எனப்படும் முறையில் உதவுகிறது. Outliers, அல்லது தரவின் ஒரு தொகுப்பைப் பற்றிய கவனிப்புகளில் உள்ள மாற்றங்கள், கிரெடிட் கார்டு சாதாரணமாக பயன்படுத்தப்படுகிறதா அல்லது ஏதோ விசித்திரமானது நடக்கிறதா என்பதை எங்களுக்குத் தெரிவிக்க முடியும். கீழே இணைக்கப்பட்டுள்ள ஆய்வுக் கட்டுரையில், k-means clustering algorithm பயன்படுத்தி கிரெடிட் கார்டு தரவுகளை வரிசைப்படுத்தி, ஒவ்வொரு பரிவர்த்தனையையும் அது எவ்வளவு outlier ஆக தோன்றுகிறது என்பதை அடிப்படையாகக் கொண்டு ஒரு கிளஸ்டருக்கு ஒதுக்கலாம். பின்னர், மோசடிகள் மற்றும் சட்டபூர்வமான பரிவர்த்தனைகளுக்கான மிக ஆபத்தான கிளஸ்டர்களை மதிப்பீடு செய்யலாம்.
[Reference](https://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.680.1195&rep=rep1&type=pdf)
k-மீன்ஸ் தொகுப்பு, கடன் அட்டை மோசடி கண்டறிதலில் பயன்படுத்தப்படும் **வெளிப்படையான கண்டறிதல்** முறையில் உதவுகிறது. ஒரு தரவு தொகுப்பின் குறிப்புகள் சார்ந்த அசாதாரணங்கள் (அதாவது வெளிப்படைகள்) கடன் அட்டை சாதாரணமாக பயன்படுத்தப்படுகிறதா அல்லது ஏதேனும் விதமாக மாறுகிறதா என்று சொல்லாமல் இருக்காது. கீழுள்ள கட்டுரையில் காட்டப்பட்டுள்ளபடி, கடன் அட்டை தரவை k-மீன்ஸ் தொகுப்பு ஆல்காரிதம் மூலம் வகைப்படுத்தி ஒவ்வொரு பரிவர்த்தனையையும் வெளிப்படையாக இருக்கிற அளவுக்கு பொறுத்து ஒரு தொகுப்பிற்கு நியமிக்கலாம். பின்னர், மோசடி மற்றும் சட்டபூர்வ பரிவர்த்தனைகளுக்கு மிக ஆபத்தான தொகுப்புகளை மதிப்பீடு செய்யலாம்.
[குறிப்பு](https://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.680.1195&rep=rep1&type=pdf)
### செல்வ மேலாண்மை
### பணச் செயல்பாட்டு மேலாண்மை
செல்வ மேலாண்மையில், ஒரு தனிநபர் அல்லது நிறுவனம் தங்கள் வாடிக்கையாளர்களின் சார்பில் முதலீடுகளை நிர்வகிக்கிறது. அவர்களின் வேலை நீண்ட காலத்தில் செல்வத்தை நிலைநிறுத்தவும் வளர்த்தெடுக்கவும் ஆகும், எனவே நல்ல செயல்திறன் கொண்ட முதலீடுகளைத் தேர்ந்தெடுப்பது அவசியம்.
பணச் செயல்பாட்டு மேலாண்மையில், ஒரு தனிநபர் அல்லது நிறுவனம் உளம் வாடிக்கையாளர்களின் பங்குகளை கையாள்கிறது. அவர்கள் பணத்தை நீண்டு வளர்த்துக் கொள்ள வேண்டியது அவசியம், ஆகையால் நன்கு செயல்படும் பங்குகளைத் தேர்ந்தெடுக்க வேண்டும்.
ஒரு குறிப்பிட்ட முதலீடு எவ்வாறு செயல்படுகிறது என்பதை மதிப்பீடு செய்யும் ஒரு வழி புள்ளியியல் ரிக்ரஷன் மூலம். [Linear regression](../../2-Regression/1-Tools/README.md) ஒரு நிதி ஒரு குறிப்பிட்ட அளவீட்டுடன் ஒப்பிடும்போது எப்படி செயல்படுகிறது என்பதைப் புரிந்துகொள்ள ஒரு மதிப்புமிக்க கருவியாகும். மேலும், ரிக்ரஷனின் முடிவுகள் புள்ளியியல் ரீதியாக முக்கியத்துவம் வாய்ந்ததா அல்லது அவை வாடிக்கையாளரின் முதலீடுகளை எவ்வளவு பாதிக்குமென்று நாம் அறியலாம். கூடுதலாக, பல ரிக்ரஷன் பயன்படுத்தி உங்கள் பகுப்பாய்வை விரிவாக்கலாம், இதில் கூடுதல் ஆபத்து காரகங்களை கணக்கில் கொள்ளலாம். இது ஒரு குறிப்பிட்ட நிதிக்கு எவ்வாறு வேலை செய்யும் என்பதைப் பற்றிய உதாரணத்திற்காக, ரிக்ரஷன் பயன்படுத்தி நிதி செயல்திறனை மதிப்பீடு செய்வதற்கான கட்டுரையை கீழே பார்க்கவும்.
[Reference](http://www.brightwoodventures.com/evaluating-fund-performance-using-regression/)
ஒரு குறிப்பிட்ட பங்கு எப்படி செயல்படுகிறது என்பதை மதிப்பிடுவதற்கான ஒரு வழி புள்ளியியல் வினைத்திறன். [ரேகை வினைத்திறன்](../../2-Regression/1-Tools/README.md) ஒரு நன்கு பயனுள்ள கருவி ஆகும், குறிப்பிட்ட பங்கு சில வழிகாட்டிகளுடன் எவ்வாறு செயல்படுகிறது என்பதை விளக்க. அதன் கண்ணோட்டத்தில் உள்ள பெறுபேறுகள் புள்ளியியலால் முக்கியமா இல்லையா என்பதையும், வாடிக்கையாளரின் முதலீடுகளுக்கு எவ்வளவு தாக்கம் விளைவிக்கும் என்பதையும் கருத்தில் கொள்ளலாம். மேலும் இது மேலதிகக் காரணிகளையும் எடுத்துக் கொண்டு பல வினைத்திறனை பயன்படுத்தி பகுப்பாய்வை விரிவாக்குவீர்கள். ஒரு சில பங்கு செயல்பாட்டை மதிப்பிடும் கீழ்காணும் கட்டுரையை காணவும்.
[குறிப்பு](http://www.brightwoodventures.com/evaluating-fund-performance-using-regression/)
## 🎓 கல்வி
கல்வித் துறையும் ML பயன்படுத்தக்கூடிய ஒரு மிகவும் சுவாரஸ்யமான பகுதி. தேர்வுகள் அல்லது கட்டுரைகளில் மோசடி கண்டறிதல் அல்லது திருத்த செயல்முறையில் உள்ள bias (தவறான அல்லது நோக்கமற்ற) போன்ற சுவாரஸ்யமான பிரச்சினைகளைத் தீர்க்கலாம்.
கல்வி துறையும் இயந்திரக் கல்வி பயன்பாட்டிற்கு மிகவும் சுவாரஸ்யமான பகுதியாகும். தேர்வுகளில் மோசடி கண்டறிதல் அல்லது திருத்துநிலை தேர்வுகளில் அனுபவங்கள் உள்ள சில உறுதிப்பத்திர பிரச்சனைகள் போன்றவை கூர்ந்து அறியப்பட வேண்டியவை.
### மாணவர்களின் நடத்தை கணிக்க
### மாணவர் நடத்தை எதிர்பார்ப்பு
[Coursera](https://coursera.com), ஒரு ஆன்லைன் திறந்த பாடநெறி வழங்குநர், பல பொறியியல் முடிவுகளை விவரிக்கும் ஒரு சிறந்த தொழில்நுட்ப வலைப்பதிவைக் கொண்டுள்ளது. இந்த வழக்குக் கற்றலில், அவர்கள் ஒரு regression line வரைந்து, குறைந்த NPS (Net Promoter Score) மதிப்பீடு மற்றும் பாடநெறி தக்கவைத்தல் அல்லது விலகல் இடையே எந்த தொடர்பும் உள்ளதா என்பதை ஆராய முயற்சித்தனர்.
[Reference](https://medium.com/coursera-engineering/controlled-regression-quantifying-the-impact-of-course-quality-on-learner-retention-31f956bd592a)
ஆன்லைன் திறந்த பாடக் கோர்ஸ் வழங்குநர் [Coursera](https://coursera.com), ஒன்று தொழில்நுட்ப வலைப்பதிவில் பல பொறியியல் முடிவுகளின் விவரங்களை பகிர்கிறது. இக்கேஸ்ஸ்டடியில், நெடுங்கோட்டை சார்பு (Regression) கோடுவரிசை வரைதியாக குறைந்த NPS மதிப்பும் பாடத்திட்டத் துவக்கப்படுத்தல் அல்லது விட்டுவிடும் காரியத்துடனான தொடர்பை ஆராய்ந்தனர்.
[குறிப்பு](https://medium.com/coursera-engineering/controlled-regression-quantifying-the-impact-of-course-quality-on-learner-retention-31f956bd592a)
### bias குறைப்பது
### பாகுபாட்டை குறைத்தல்
[Grammarly](https://grammarly.com), எழுத்து உதவியாளர், எழுத்துப் பிழைகள் மற்றும் இலக்கண பிழைகளை சரிபார்க்கிறது, அதன் தயாரிப்புகளில் நவீன [இயற்கை மொழி செயலாக்க அமைப்புகளை](../../6-NLP/README.md) பயன்படுத்துகிறது. அவர்கள் தங்கள் தொழில்நுட்ப வலைப்பதிவில், ML இல் பாலின bias ஐ எவ்வாறு கையாளுகிறார்கள் என்பதைப் பற்றிய ஒரு சுவாரஸ்யமான வழக்குக் கற்றலை வெளியிட்டனர், இது எங்கள் [நீதி அறிமுக பாடத்தில்](../../1-Introduction/3-fairness/README.md) நீங்கள் கற்றுக்கொண்டீர்கள்.
[Reference](https://www.grammarly.com/blog/engineering/mitigating-gender-bias-in-autocorrect/)
எழுத்துப் பெருக்கி [Grammarly](https://grammarly.com) அதன் முக்கிய தயாரிப்புகளில் நுட்பமான [இயற்கை மொழி செயலாக்கக் கணினிகள்](../../6-NLP/README.md) பயன்படுத்துகிறது. அவர்கள் தொழில்நுட்ப வலைப்பதிவில் இயந்திரக் கல்வியில் பாலின பாகுபாட்டை எப்படி கடந்தனர் என்பதைப் பற்றிய சுவாரஸ்யமான வழக்குக் கணக்கை இடையே வெளியிட்டனர், இது நமது [நியாயமான தன்மையே உரையாடல்](../../1-Introduction/3-fairness/README.md) பாடத்தில் கற்றிருந்தீர்கள்.
[குறிப்பு](https://www.grammarly.com/blog/engineering/mitigating-gender-bias-in-autocorrect/)
## 👜 சில்லறை வணிகம்
சில்லறை வணிகத் துறை ML பயன்படுத்துவதில் நிச்சயமாக பல நன்மைகளைப் பெற முடியும், இது வாடிக்கையாளர் பயணத்தை மேம்படுத்துவதிலிருந்து சரக்கு கையிருப்பை சிறந்த முறையில் நிர்வகிப்பதற்கு வரை.
சில்லறை வணிக துறையும் இயந்திரக் கல்வியின் உதவியில் பல பயன்பாடுகள் பெறுகிறது, உதாரணத்திற்கு சிறந்த வாடிக்கையாளர் பயணம் உருவாக்குதல் முதல் சரக்கு வைப்புக்கு அச்சரியமாக நிர்வாகம் செய்வதுவே உண்டு.
### வாடிக்கையாளர் பயணத்தை தனிப்பயனாக்குதல்
### வாடிக்கையாளர் பயண தனிப்பயன் செய்யல்
Wayfair, mööbel போன்ற வீட்டுப் பொருட்களை விற்கும் நிறுவனம், வாடிக்கையாளர்களுக்கு தங்கள் சுவை மற்றும் தேவைகளுக்கு பொருந்தக்கூடிய பொருட்களை கண்டுபிடிக்க உதவுவது மிகவும் முக்கியம். இந்த கட்டுரையில், நிறுவனத்தின் பொறியாளர்கள் ML மற்றும் NLP பயன்படுத்தி "வாடிக்கையாளர்களுக்கு சரியான முடிவுகளை வெளிப்படுத்த" எவ்வாறு உதவுகிறார்கள் என்பதை விவரிக்கிறார்கள். குறிப்பாக, அவர்களின் Query Intent Engine வாடிக்கையாளர் விமர்சனங்களில் entity extraction, classifier training, asset மற்றும் opinion extraction மற்றும் sentiment tagging ஆகியவற்றைப் பயன்படுத்தி உருவாக்கப்பட்டுள்ளது. இது ஆன்லைன் சில்லறை வணிகத்தில் NLP எவ்வாறு வேலை செய்கிறது என்பதற்கான பாரம்பரிய பயன்பாட்டின் ஒரு உதாரணமாகும்.
[Reference](https://www.aboutwayfair.com/tech-innovation/how-we-use-machine-learning-and-natural-language-processing-to-empower-search)
Wayfair என்ற வீட்டு பொருட்களை விற்பனை செய்தும் நிறுவனம் வாடிக்கையாளர்களுக்கு அவர்களது விருப்பத்திற்கும் தேவைகளுக்கும் ஏற்ப பொருட்களை கண்டுபிடிக்க உதவுவதை முன்னுரிமையாகக் கொண்டு செயல்படுகிறது. இக்கட்டுரையில், நிறுவன பொறியியர்கள் எப்படி இயந்திரக் கல்வி மற்றும் இயற்கை மொழி செயலாக்கத்தை பயன்படுத்தி "வாடிக்கையாளர்களுக்கு சரியான முடிவுகளை தருகிறார்கள்" என்பதை விவரிக்கிறார்கள். குறிப்பாக, அவர்களது கேள்வி நோக்கம் இயந்திரம் உரைத் தொடர்பாளர் அடிப்படையில் அமைக்கப்பட்டுள்ளது, இது ஒன்றாக புலன் எடுக்கும், வகைப்பாடு பயிற்சி, சொத்து மற்றும் கருத்துகள் எடுக்கும் மற்றும் வாடிக்கையாளர் விமர்சனங்களில் உணர்ச்சிப் பிரிவினை குறிக்கிறது. இது ஆன்லைன் சில்லறை வணிகத்தில் இயற்கை மொழி செயலாக்கத்தின் பாரம்பரிய பயன்பாடு ஆகும்.
[குறிப்பு](https://www.aboutwayfair.com/tech-innovation/how-we-use-machine-learning-and-natural-language-processing-to-empower-search)
### சரக்கு நிர்வாகம்
[StitchFix](https://stitchfix.com) போன்ற புதுமையான, துரிதமான நிறுவனங்கள், நுகர்வோருக்கு ஆடை அனுப்பும் ஒரு பெட்டி சேவை, பரிந்துரைகள் மற்றும் சரக்கு நிர்வாகத்திற்காக ML மீது மிகவும் நம்பிக்கை வைக்கின்றன. அவர்களின் ஸ்டைலிங் குழுக்கள் மற்றும் வணிகக் குழுக்கள் இணைந்து வேலை செய்கின்றன: "எங்கள் தரவுத் விஞ்ஞானிகளில் ஒருவர் ஒரு genetic algorithm ஐ tinkering செய்து, அது இன்று இல்லை ஆனால் வெற்றிகரமான ஆடை துண்டு என்னவாக இருக்கும் என்பதை கணிக்க ஆடைக்கு பயன்படுத்தினார். அதை வணிகக் குழுவிற்கு கொண்டு வந்தோம், இப்போது அவர்கள் அதை ஒரு கருவியாகப் பயன்படுத்தலாம்."
[Reference](https://www.zdnet.com/article/how-stitch-fix-uses-machine-learning-to-master-the-science-of-styling/)
உடன்படா [StitchFix](https://stitchfix.com) போன்ற முன்னேற்றமான, விரைவான நிறுவனங்கள், பெரிய அளவில் பரிந்துரைகள் மற்றும் சரக்கு நிர்வாகத்திற்காக இயந்திரக் கல்வி heavily சார்ந்துள்ளன. அவர்கள் ஸ்டைலிங் அணி வணிக அணியுடன் சேர்ந்து பணியாற்றுகின்றனர்: "எங்கள் தரவு விஞ்ஞானிகளுள் ஒருவர் மரபணு ஆல்காரிதமுடன் கோடுமைகளை குத்திக் கொண்டு அதை தாராளமாக பயன்பாட்டிற்கு கொண்டு வந்தார், இது இன்றைய இல்லை என்றெண்ணப்படும் வெற்றிகரமான ஒரு அணிகலன் ஆகும். இதனை வணிக அணிக்கு வழங்கினோம் மற்றும் இப்போது அவர்கள் அதை கருவியாக பயன்படுத்த முடிகிறது."
[குறிப்பு](https://www.zdnet.com/article/how-stitch-fix-uses-machine-learning-to-master-the-science-of-styling/)
## 🏥 சுகாதார பராரிபபு
## 🏥 சுகாதாரம்
சுகாதார பராமரிப்பு துறை ஆராய்ச்சி பணிகளை மேலும் செயல்திறனாகவும், logistic பிரச்சினைகளை (மீண்டும் நோயாளிகளை அனுமதித்தல் அல்லது நோய்களை பரவாமல் தடுக்குதல் போன்றவை) மேலும் சிறப்பாகவும் மாற்ற ML ஐ பயன்படுத்தலாம்.
சுகாதாரத் துறையிலும் ஆய்வுக் பணிகள் மற்றும் மீண்டும் சேர்க்கப்படும் நோயாளிகள், நோய்கள் பரவுவதைத் தடுக்கும் போன்ற தீர்வுகள் போன்றவற்றைப் பயன்படுத்திக் கொள்ள இயந்திரக் கல்வி பயன்படும்.
### மருத்துவ பரிசோதனைகளை நிர்வகித்தல்
### மருத்துவ சோதனை மேலாண்மை
மருந்து தயாரிப்பாளர்களுக்கு மருத்துவ பரிசோதனைகளில் toxicity ஒரு முக்கிய கவலை. எவ்வளவு toxicity ஏற்றுக்கொள்ளக்கூடியது? இந்த ஆய்வில், பல மருத்துவ பரிசோதனை முறைகளை பகுப்பாய்வு செய்ததில், மருத்துவ பரிசோதனை முடிவுகளின் வாய்ப்புகளை கணிக்க ஒரு புதிய அணுகுமுறை உருவாக்கப்பட்டது. குறிப்பாக, அவர்கள் random forest பயன்படுத்தி [classifier](../../4-Classification/README.md) உருவாக்க முடிந்தது, இது மருந்துகளின் குழுக்களை வேறுபடுத்த முடியும்.
[Reference](https://www.sciencedirect.com/science/article/pii/S2451945616302914)
மருத்துவ சோதனைகளில் நச்சுக்களம் மருந்து தயாரிப்பாளர்களுக்கு பெரிய கவலை. எவ்வளவு நச்சுத்தன்மை நிலைத்திருக்க வேண்டும்? இந்த ஆய்வில், பல்வேறு மருத்துவ சோதனை முறைகளை பகுப்பாய்வு செய்தபடி புதிய முறையை உருவாக்கி சோதனை முடிவுகளை எதிர்பார்க்க முடிந்தது. குறிப்பாக, அவர்கள் ஸாதாரண காடும் [வகைப்படுத்துகை](../../4-Classification/README.md) உருவாக்குவதற்கு ராண்டம் ஃபாரெஸ்ட் பயன்படுத்தினர், இது மருந்துத் தொகுதிகளுக்கு இடையில் வேறுபாட்டைக் காண்கிறது.
[குறிப்பு](https://www.sciencedirect.com/science/article/pii/S2451945616302914)
### மருத்துவமனை மீண்டும் அனுமதி நிர்வாகம்
### மருத்துவமனை மீண்டும் சேர்க்கை மேலாண்மை
மருத்துவமனை பராமரிப்பு செலவானது, குறிப்பாக நோயாளிகள் மீண்டும் அனுமதிக்கப்பட வேண்டியபோது. இந்த ஆய்வு ஒரு நிறுவனம் [clustering](../../5-Clustering/README.md) algorithm பயன்படுத்தி மீண்டும் அனுமதிக்கப்பட வேண்டிய சாத்தியத்தை கணிக்க ML ஐ எவ்வாறு பயன்படுத்துகிறது என்பதை விவரிக்கிறது. இந்த கிளஸ்டர்கள் "மீண்டும் அனுமதிக்கப்பட வேண்டிய குழுக்களை கண்டறிய உதவுகின்றன, அவை ஒரு பொதுவான காரணத்தைப் பகிர்ந்து கொள்ளக்கூடும்."
[Reference](https://healthmanagement.org/c/healthmanagement/issuearticle/hospital-readmissions-and-machine-learning)
மருத்துவமனை பராமரிப்பு செலவுத்தெரிகிறது, குறிப்பாக நோயாளிகள் மீண்டும் சேர்க்கப்படும்போது. இந்த கட்டுரை ஒரு நிறுவனமானது எப்படி [தொகுப்பு](../../5-Clustering/README.md) ஆல்காரிதங்களைப் பயன்படுத்தி மீண்டும் சேர்க்கை சாத்தியத்தை முன்கூட்டியே கணிக்கிறது என்பதை ஆராய்கிறது. இவை "பகிரப்பட்ட காரணங்களை பகிர்ந்த கொள்ளக்கூடிய மீண்டும் சேர்க்கை குழுக்களை கண்டறிய" உதவுகின்றன.
[குறிப்பு](https://healthmanagement.org/c/healthmanagement/issuearticle/hospital-readmissions-and-machine-learning)
### நோய் மேலாண்மை
சமீபத்திய தொற்றுநோய் ML நோய்களை பரவாமல் தடுக்க உதவக்கூடிய வழிகளை வெளிச்சமிட்டுள்ளது. இந்த கட்டுரையில், ARIMA, logistic curves, linear regression மற்றும் SARIMA ஆகியவற்றின் பயன்பாட்டை நீங்கள் அடையாளம் காணலாம். "இந்த வேலை இந்த வைரஸின் பரவல் விகிதத்தை கணக்கிடவும், அதனால் மரணங்கள், மீட்பு மற்றும் உறுதிப்படுத்தப்பட்ட வழக்குகளை கணிக்கவும் முயற்சிக்கிறது, இதனால் நாங்கள் மேலும் தயாராகவும் உயிர்வாழவும் உதவலாம்."
[Reference](https://www.ncbi.nlm.nih.gov/pmc/articles/PMC7979218/)
சமீபத்திய பரவலான பான்டமிக் இயந்திரக் கல்வி நோய் பரப்பை நிறுத்துவதில் உதவும் விதத்தை வெளிப்படுத்தியுள்ளது. இதில், ARIMA, Logistic வரிகளும், நேரியல் வினைத்திறனும், SARIMA ஆகியவை அடங்கும். "இந்த பணியால் இந்த வைரஸ் பரவுவின் வீதத்தை கணக்கிட்டு இறப்புகள், குணமடையும் விகிதங்கள் மற்றும் உறுதிப்படுத்தப்பட்ட நோயாளிகள் எண்ணிக்கையை முன்னோக்கி கணிக்க முடிகிறது ஆகையால் சிறப்பாகத் தயாராகித் தவிர்க்க உதவும்."
[குறிப்பு](https://www.ncbi.nlm.nih.gov/pmc/articles/PMC7979218/)
## 🌲 இயற்கை மற்றும் பசுமை தொழில்நுட்பம்
## 🌲 இயற்கை மற்றும் பச்சைப் தொழில்நுட்பம்
இயற்கை மற்றும் சூழலியல் பல நுண்ணிய அமைப்புகளை கொண்டுள்ளது, இதில் விலங்குகள் மற்றும் இயற்கையின் இடையிலான தொடர்பு முக்கியமாகிறது. இந்த அமைப்புகளை துல்லியமாக அளவிடவும், ஏதாவது நடக்கும்போது சரியான நடவடிக்கை எடுக்கவும் முக்கியம்.
இயற்கையும் சுற்றுச்சூழலையும் பல நுணுக்கமான அமைப்புகளை கொண்டுள்ளது, உயிரினங்களும் இயற்கையின் தொடர்பும் முக்கிய பங்கு வகிக்கின்றன. இக்குழப்பங்களை சரியான முறை அளவிடுவது அவசியம் மற்றும் காடு கேளிக்கை அல்லது உயிரினக் கூட்டம் குறைவதுபோன்ற ஒன்று ஏற்பட்டால் சரியான செயல்பாடு வேண்டும்.
### காடுகளை நிர்வகித்தல்
### காடு மேலாண்மை
நீங்கள் [Reinforcement Learning](../../8-Reinforcement/README.md) பற்றி முன்பே கற்றுக்கொண்டீர்கள். இது இயற்கையில் முறைமைகளை கணிக்க முயற்சிக்கும் போது மிகவும் பயனுள்ளதாக இருக்க முடியும். குறிப்பாக, இது காட்டுத் தீ மற்றும் ஆக்கிரமிப்பு இனங்களின் பரவலைப் போன்ற சூழலியல் பிரச்சினைகளை கண்காணிக்க பயன்படுத்தப்படலாம். கனடாவில், ஒரு ஆராய்ச்சியாளர்கள் குழு Reinforcement Learning பயன்படுத்தி satellite images மூலம் காட்டுத் தீ முறைமைகளை உருவாக்கினர். "spatially spreading process (SSP)" எனப்படும் புதுமையான முறையைப் பயன்படுத்தி, அவர்கள் காட்டுத் தீயை "landscape இல் எந்த cell இல் agent ஆக" கற்பனை செய்தனர். "தீ ஒரு இடத்திலிருந்து எந்த நேரத்திலும் எடுக்கக்கூடிய நடவடிக்கைகளின் தொகுப்பில் வடக்கு, தெற்கு, கிழக்கு அல்லது மேற்கு பரவுதல் அல்லது பரவாமல் இருக்குதல் அடங்கும்.
நீங்கள் முந்தைய பாடங்களில் [புதுக்கூறு கற்றல்](../../8-Reinforcement/README.md) பற்றி கற்றீர்கள். இயற்கை அமைப்புகளை எதிர்பார்க்க இது மிகவும் உதவுகிறது. குறிப்பாக, காடுகளின் தீ விபத்தினையும் நுகர்ந்த கிழங்குகளின் பரவலையும் கண்காணிக்க பயன்படுத்தப்படுகிறது. கனடாவில், ஒரு குழுக் ஆராய்ச்சியாளர்கள் ரிமோட் செட்டிலைக் காட்சிகளிலிருந்து காடுதீ விபத்து இயக்கத் துறையைக் கட்டியமைக்க புதுக்கூறு கற்றலை பயன்படுத்தினர். "பரப்பியலுக்கு இடையில் இடங்கள் ஒன்றிலிருந்து தீ பரவுவதற்கான கணிப்பு மற்றும் பிற்கால நகர்வு SSP" என்ற புதிய முறையை அவர்கள் உருவாக்கினர். "காட்டை தீ எதுவும் பரப்பாமல் தங்கு வாய்ப்பும், வடக்கு, தெற்கு, கிழக்கு மற்றும் மேற்கு நோக்கி பரப்புவதை உள்ளடக்கியது."
இந்த அணுகுமுறை வழக்கமான RL அமைப்பை மாற்றுகிறது, ஏனெனில் தொடர்புடைய Markov Decision Process (MDP) உடனடித் தீ பரவலுக்கான முறைமைகள் ஒரு அறியப்பட்ட செயல்பாடு ஆகும்." இந்த குழு பயன்படுத்திய பாரம்பரிய algorithm களைப் பற்றிய மேலும் விவரங்களை கீழே உள்ள இணைப்பில் படிக்கவும்.
[Reference](https://www.frontiersin.org/articles/10.3389/fict.2018.00006/full)
இந்த முறையில் சாதாரண புதுக்கூறு கற்றலைத் தோற்றமைப்பு மறுவடிவமைக்கப்பட்டுள்ளது ஏனென்றால், Markov தீர்மான செயல்முறை (MDP) இயல்பு தீ விரைவான பரப்புக்கான ஒரு வெளிப்படையான செயல்பாடாகும்." மேலும் இந்த குழு பயன்படுத்திய பாரம்பரிய ஆல்காரிதங்களை கீழ்காணும் இணைப்பில் படிக்கவும்.
[குறிப்பு](https://www.frontiersin.org/articles/10.3389/fict.2018.00006/full)
### விலங்குகளின் இயக்கத்தை உணருதல்
### உயிரின இயக்கம் உணர்தல்
ஆழமான கற்றல் விலங்குகளின் இயக்கங்களை காட்சிப்படுத்துவதில் புரட்சியை உருவாக்கியுள்ளதாலும் (நீங்கள் உங்கள் சொந்த [polar bear tracker](https://docs.microsoft.com/learn/modules/build-ml-model-with-azure-stream-analytics/?WT.mc_id=academic-77952-leestott) ஐ இங்கே உருவாக்கலாம்), பாரம்பரிய ML இ still இந்த பணியில் ஒரு இடம் உள்ளது.
ஆழ்ந்த கற்றல் உயிரினங்களின் இயக்கத்தை கண்டு பிடிக்கும் துறையில் புரட்சி ஏற்படுத்தியிருந்தாலும் (உதாரணத்திற்கு நீங்களும் [தனது ப polar bear tracker](https://docs.microsoft.com/learn/modules/build-ml-model-with-azure-stream-analytics/?WT.mc_id=academic-77952-leestott) உருவாக்கலாம்), பாரம்பரிய இயந்திரக் கல்விக்கும் இக்கட்டளையில் இடம் உள்ளது.
கிராம விலங்குகளின் இயக்கங்களை கண்காணிக்க சென்சார்கள் மற்றும் IoT இந்த வகையான காட்சித் செயலாக்கத்தைப் பயன்படுத்துகின்றன, ஆனால் தரவுகளை முன் செயலாக்க அடிப்படையான ML தொழில்நுட்பங்கள் பயனுள்ளதாக உள்ளன. உதாரணமாக, இந்த ஆய்வில், ஆடுகளின் நிலைகள் பல classifier algorithm களைப் பயன்படுத்தி கண்காணிக்கப்பட்டு பகுப்பாய்வு செய்யப்பட்டது. பக்கம் 335 இல் ROC curve ஐ நீங்கள் அடையாளம் காணலாம்.
[Reference](https://druckhaus-hofmann.de/gallery/31-wj-feb-2020.pdf)
பண்ணை உயிரின இயக்கங்களை கண்டறியும் கண்காணிப்பு மற்றும் இண்டெர்நெட் ஆஃப் திங்ஸ் (IoT) இந்த பாரம்பரிய மாதிரிகளுக்கு அடிப்படையில் உள்ளது, ஆனால் அடிப்படையான இயந்திரக் கல்வி முறைகள் தரவை முன் செயலாக்குவதற்கு பயன்படுகின்றன. உதாரணமாக, இந்த கட்டுரையில் செட்டில் நிற்கும் ஆடு நிலைகளை கண்காணித்து வகைப்பாட்டு ஆல்காரிதங்களுடன் பகுப்பாய்வு செய்யப்பட்டது. பக்கம் 335ல் உள்ள ROC வளைவு கிடைக்கும்.
[குறிப்பு](https://druckhaus-hofmann.de/gallery/31-wj-feb-2020.pdf)
### ⚡️ ஆற்றல் மேலாண்மை
### ⚡️ சக்தி மேலாண்மை
நாங்கள் [time series forecasting](../../7-TimeSeries/README.md) பாடங்களில், smart parking meters ஐ supply மற்றும் demand ஐப் புரிந்துகொண்டு ஒரு நகரத்திற்கு வருவாய் உருவாக்க பயன்படுத்தும் கருத்தை எடுத்துக்கொண்டோம். இந்த கட்டுரை smart metering அடிப்படையில், regression மற்றும் time series forecasting இணைந்து, அயர்லாந்தில் எதிர்கால ஆற்றல் பயன்பாட்டை கணிக்க உதவியது என்பதை விரிவாக விவரிக்கிறது.
[Reference](https://www-cdn.knime.com/sites/default/files/inline-images/knime_bigdata_energy_timeseries_whitepaper.pdf)
[கால வரிசை முன்கூட்டிச் சுட்டல்](../../7-TimeSeries/README.md) பாடங்களில், ஊர் வருமானத்தை மேம்படுத்த கூர்மையான பார்க்கிங் நோக்கிகள் பற்றிய கருத்தைக் கொண்டோம். இந்த கட்டுரை, சிறந்த பகுதியில் தொகுப்பு, வினைத்திறன் மற்றும் கால வரிசை முன்கூட்டிச் சுட்டல் ஒன்றிணைந்து அயர்லாந்தில் எதிர்கால சக்தி பயன்பாட்டை முன்னறிவிக்க உதவுகிறதென விரிவாக விவரிக்கின்றது.
[குறிப்பு](https://www-cdn.knime.com/sites/default/files/inline-images/knime_bigdata_energy_timeseries_whitepaper.pdf)
## 💼 காப்பீடு
காப்பீட்டு துறை ML ஐ பயன்படுத்தி பொருளாதார மற்றும் actuarial மாதிரிகளை உருவாக்கவும், மேம்படுத்தவும் பயன்படுத்துகிறது.
காப்பீட்டு துறையும் இயந்திரக் கல்வியை நிதி மற்றும் பரிசோதனை மாதிரிகளை கட்டமைக்கவும் மேம்படுத்தவும் பயன்படுத்துகிறது.
### нестабильность மேலாண்மை
MetLife, ஒரு வாழ்க்கைக் காப்பீடு வழங்குநர், அவர்கள் நிதி மாதிரிகளில் нестабильность எப்படி பகுப்பாய்வு செய்து குறைக்கின்றனர் என்பதில் தெளிவாக உள்ளனர். இந்த கட்டுரையில் நீங்கள் பைனரி மற்றும் ஒடிகோனல் வகைப்பாட்டின் காட்சியீடுகளை காணலாம். முன்கூட்டியான காட்சியீடுகளையும் உண்டு.
[குறிப்பு](https://investments.metlife.com/content/dam/metlifecom/us/investments/insights/research-topics/macro-strategy/pdf/MetLifeInvestmentManagement_MachineLearnedRanking_070920.pdf)
## 🎨 கலை, பண்பாடு மற்றும் இலக்கியம்
கலைகளில், உதாரணமாக பத்திரிக்கைத் துறையில், பல சுவாரஸ்ய பிரச்சனைகள் உள்ளன. போலி செய்திகளை கண்டறிதல் மிகப்பெரிய பிரச்சனை, ஏனெனில் அது மக்கள் கருத்துக்களை ప్రభావித்து ஜனநாயக அரசின்மையை கூட விளைவிக்க முடிகிறது. அருங்காட்சியகங்களும் அதன் தயாரிப்புகளுக்கு ML பயன்படுத்துவதில் பல உதவிகளை பெற முடியும், போல் பொருட்கள் மற்றும் வள திட்டமிடல் ஆகியவற்றிலும்.
### போலி செய்தி கண்டறிதல்
இன்றைய ஊடகங்களில் போலி செய்தி கண்டறிதல் பூனை மற்றும் எலி விளையாட்டாய் மாறியுள்ளது. இந்த கட்டுரையில், பல ML முறைமைகள் இணைந்த ஒரு முறைமை சோதிக்கப்படலாம் என்றும் சிறந்த மாதிரி வேரியக்கப்படலாம் என்றும் ஆராய்ச்சியாளர்கள் பரிந்துரைக்கின்றனர்: "இந்த முறைமை இயற்கை மொழி செயலாக்கத்தை பயன்படுத்தி தரவிலிருந்து அம்சங்களை எடுத்து பின்னர் ஒரு Naive Bayes, Support Vector Machine (SVM), Random Forest (RF), Stochastic Gradient Descent (SGD), மற்றும் Logistic Regression (LR) போன்ற இயந்திரக் கல்வி வகைப்படுத்திகள் பயிற்சிக்குப் பயன்படுத்தப்படுகிறது."
[குறிப்பு](https://www.irjet.net/archives/V7/i6/IRJET-V7I6688.pdf)
இந்த கட்டுரை, பல ML துறைகளின் பொன்மைகள் இணைந்து போலி செய்திகளை பரவுவதைத் தடக்க மற்றும் உண்மையான சேதங்களை இழக்க உதவ முடியும் என்பதைக் காட்டுகிறது; இதில் COVID சிகிச்சைகள் பற்றிய வதந்திகள் பரவுவதால் எதிர்ப்பு அக்கடைகளை தூண்டும்.
### அருங்காட்சியக இயந்திரக் கல்வி
கலை அருங்காட்சியகங்கள் AI புரட்சியின் முன்றிலிருக்கின்றன, இதில் திரட்டல்களையும் டிஜிட்டல் வடிவமைப்புகளையும் உருவாக்குதல் மற்றும் பொருட்களுக்கு இடையேயான தொடர்புக்களை கண்டுபிடிப்பது மொசமானது ஆகிறது. [In Codice Ratio](https://www.sciencedirect.com/science/article/abs/pii/S0306457321001035#:~:text=1.,studies%20over%20large%20historical%20sources.) போன்ற திட்டங்கள் வசதியற்ற சேமிப்பகங்கள் போன்றவை (வத்திக்கான் ஆவணங்கள்) கிரகித்தல் உதவுகின்றன. ஆனால் அருங்காட்சியகத்தின் வணிகக் கூறும் ML மாதிரிகளால் நன்மை பெறுகிறது.
உதாரணமாக, சிகாகோ கலை நிறுவனம் எந்தவாறு பார்வையாளர்கள் ஆர்வம் காட்டுகிறார்கள் மற்றும் எப்போது கண்காட்சிகளில் கலந்து கொள்வார்கள் என்பதைக் கணிக்க மாதிரிகள் கட்டியது. நோக்கம் ஒவ்வொரு முறை பயனர் அருங்காட்சியகத்தை பார்வையிடும் போதும் தனிப்பயனாக்கப்பட்ட சிறந்த பார்வையாளர் அனுபவங்களை உருவாக்குவதே. "வருட 2017-ல், மாதிரி பங்கு மற்றும் அங்கீகார மதிப்பை 1 சதவீத துல்லியத்தில் கணித்தது என்றும் சிகாகோ கலை நிறுவனத்தின் மூத்த துணைத் தலைவர் Andrew Simnick கூறுகிறார்."
[குறிப்பு](https://www.chicagobusiness.com/article/20180518/ISSUE01/180519840/art-institute-of-chicago-uses-data-to-make-exhibit-choices)
## 🏷 மார்க்கெட்டிங்
### வாடிக்கையாளர் பிரிவினை
மிகவும் விளைவளிக்கும் மார்க்கெட்டிங் திட்டங்கள் வாடிக்கையாளர்களை பல்வேறு குழுக்களாக பாகுபடுத்தும் வழியில் இலக்கு செய்கின்றன. இந்த கட்டுரையில் தொகுப்பு ஆல்காரிதங்கள் மூலம் வேறுபட்ட மார்க்கெட்டிங்கை ஆதரிப்பது விவரிக்கப்படுகிறது. வேறுபடுத்தப்பட்ட மார்க்கெட்டிங் நிறுவனங்களுக்கு பிராண்ட் அறிமுகத்தை மேம்படுத்தவும், அதிக வாடிக்கையாளர்களை அடையவும், அதிக வருமானம் வரட்டும் உதவுகிறது.
[குறிப்பு](https://ai.inqline.com/machine-learning-for-marketing-customer-segmentation/)
### மாறுபாட்டை நிர்வகித்தல்
## 🚀 சவால்
MetLife, ஒரு வாழ்க்கை காப்பீட்டு வழங்குநர், தங்கள் பொருளாதார மாதிரிகளில் மாறுபாட்டை எவ்வாறு பகுப்பாய்வு செய்து குறைக்கிறார்கள் என்பதை வெளிப்படையாக விவரிக்கிறது. இந்த கட்டுரையில் binary மற்றும் ordinal classification காட்சிகளை நீங்கள் காணலாம். நீங்கள் forecasting காட்சிகளையும் காணலாம்.
[Reference](https://investments.metlife.com/content/dam/metlifecom/us/investments/insights/research-topics/macro-strategy/pdf/MetLifeInvestmentManagement_MachineLearnedRanking_070920.pdf)
இந்த பாடத்திட்டத்தில் கற்றுக் கொண்ட சில தொழில்நுட்பங்களைக் பயன்படுத்தி லாபம் பெறும் மற்றொரு துறையை கண்டுபிடித்து, அது இயந்திரக் கல்வியை எப்படி பயன்படுத்துகிறது என்பதை ஆராயவும்.
## 🎨 கலை, கலாச்சாரம் மற்றும் இலக்கியம்
கலைகளில், உதாரணமாக பத்திரிகைத் துறையில், பல சுவாரஸ்யமான பிரச்சினைகள் உள்ளன. போலி செய்திகளை கண்டறிதல் ஒரு பெரிய பிரச்சினையாக உள்ளது, இது மக்களின் கருத்தை பாதிக்கவும், ஜனநாயகங்களை சிதைக்கவும் நிரூபிக்கப்பட்டுள்ளது. அருங்காட்சியகங்கள் கூட ML ஐ artifacts க்கு இடையிலான இணைப்புகளை கண்டறிதல் முதல் res
## [பாடத்திற்குப் பிறகு வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [பாடத்துக்குப் பிறகு குறும்படம்](https://ff-quizzes.netlify.app/en/ml/)
## மதிப்பீடு & சுயபடிப்பு
## மதிப்பாய்வு மற்றும் சுயபடிப்பு
Wayfair தரவியல் அறிவியல் குழு, தங்கள் நிறுவனத்தில் எவ்வாறு இயந்திரக் கற்றலை (ML) பயன்படுத்துகிறார்கள் என்பதை விளக்கும் பல 흥미로운 வீடியோக்களை வழங்கியுள்ளது. [ஒரு பார்வை இடுங்கள்](https://www.youtube.com/channel/UCe2PjkQXqOuwkW1gw6Ameuw/videos)!
வேய்பேர் தரவு அறிவியல் குழுவிற்கு அவர்கள் நிறுவனத்தில் எவ்வாறு எம்எல் பயன்படுத்துகிறார்கள் என்பதைக் குறித்த சில சுவாரஸ்யமான காணொளிகள் உள்ளன. [பார்க்கத்](https://www.youtube.com/channel/UCe2PjkQXqOuwkW1gw6Ameuw/videos) அது மதிப்பிடத்திற்குரியது!
## பணிக்கூற்று
## பணிக
[ML தேடல் வேட்டை](assignment.md)
[ஒரு எம்எல் செங்கட்டிய வேடிக்கை வேட்டை](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கின்றோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை தயவுசெய்து கவனத்தில் கொள்ளுங்கள். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,149 +1,179 @@
# பிந்தைய குறிப்புகள்: பொறுப்பான AI டாஷ்போர்டு கூறுகளைப் பயன்படுத்தி இயந்திரக் கற்றல் மாடல் பிழை சரிசெய்தல்
# பின்னூட்டம்: பொறுப்பான AI டாஷ்போர்டு கூறுகளைப் பயன்படுத்தி இயந்திரக் கற்பிப்பில் மாடல் பிழைதிரியல்
## [முன்-வகுப்பு வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## [முன்-பாடக் கணக்கு](https://ff-quizzes.netlify.app/en/ml/)
## அறிமுகம்
இயந்திரக் கற்றல் நம் அன்றாட வாழ்க்கையைப் பாதிக்கிறது. AI, நம் தனிப்பட்ட வாழ்க்கையையும் சமூகத்தையும் பாதிக்கும் முக்கியமான அமைப்புகளில், மருத்துவம், நிதி, கல்வி மற்றும் வேலைவாய்ப்பு போன்ற துறைகளில் நுழைந்து வருகிறது. உதாரணமாக, சுகாதார பரிசோதனைகள் அல்லது மோசடிகளை கண்டறிதல் போன்ற தினசரி முடிவெடுக்கும் பணிகளில் அமைப்புகள் மற்றும் மாடல்கள் ஈடுபடுகின்றன. இதனால், AI முன்னேற்றங்கள் மற்றும் அதிவேகமாக ஏற்றுக்கொள்ளப்படுவதற்கு சமூகத்தின் எதிர்பார்ப்புகள் மற்றும் விதிமுறைகள் உருவாகின்றன. AI அமைப்புகள் எதிர்பார்ப்புகளை பூர்த்தி செய்ய முடியாத பகுதிகளை தொடர்ந்து வெளிப்படுத்துகின்றன; புதிய சவால்களை உருவாக்குகின்றன; மற்றும் அரசாங்கங்கள் AI தீர்வுகளை ஒழுங்குபடுத்தத் தொடங்குகின்றன. எனவே, இந்த மாடல்கள் அனைவருக்கும் நியாயமான, நம்பகமான, உள்ளடக்கிய, வெளிப்படையான மற்றும் பொறுப்பான முடிவுகளை வழங்குவதற்காக ஆய்வு செய்யப்படுவது முக்கியம்.
இயந்திரக் கற்பிப்பு நமது தினசரிய வாழ்வில் பெரும் தாக்கங்களை ஏற்படுத்துகிறது. AI நம்மை மற்றும் நமது சமூகத்தையும் பாதிக்கும் மிக முக்கியமான சில அமைப்புகளில் திகழ்கிறது, மருத்துவம், நிதி, கல்வி மற்றும் வேலைவாய்ப்பு ஆகியவற்றில் இருந்து. உதாரணமாக, அமைப்புகள் மற்றும் மாதிரிகள் தினசரி முடிவெடுக்க வேண்டிய பணிகளில் ஈடுபட்டுள்ளன, உதாரணமாக மருத்துவ பரிசோதனைகள் அல்லது மோசடி கண்டறிதல் போன்றவை. இதனால், AI முன்னேற்றங்கள் மற்றும் அதனை விரைவில் ஏற்றுக்கொள்ளல் சமூக எதிர்பார்ப்புகள் வளர்ந்துவரும் விதி மற்றும் கட்டுப்பாடுகளுடன் சந்திக்கப்படுகிறது. AI அமைப்புகள் தொடர்ந்து எதிர்பார்ப்புகளை பூர்த்தி செய்ய விட்டு வைக்கக் காணப்படுகிறன; புதிய சிக்கல்களை வெளிப்படுத்துகின்றன; அரசுகள் AI தீர்வுகளை கட்டுப்படுத்தத் தொடங்கி விட்டன. எனவே, இந்த மாதிரிகளை அனைவருக்கும் நேர்மையாக, நம்பகத்தன்மையுடன், ஒருங்கிணைந்த, வெளிப்படையான மற்றும் பொறுப்பான முடிவுகளை வழங்க மதிப்பாய்வு செய்வது முக்கியம்.
ந்த பாடத்திட்டத்தில், ஒரு மாடலில் பொறுப்பான AI பிரச்சினைகள் உள்ளதா என்பதை மதிப்பீடு செய்ய பயன்படும் நடைமுறை கருவிகளைப் பார்ப்போம். பாரம்பரிய இயந்திரக் கற்றல் பிழை சரிசெய்தல் நுட்பங்கள் பொதுவாக தொகுத்த கணக்கீடுகள், உதாரணமாக சராசரி துல்லியம் அல்லது சராசரி பிழை இழப்பை அடிப்படையாகக் கொண்டவை. நீங்கள் இந்த மாடல்களை உருவாக்க பயன்படுத்தும் தரவுகளில் சில மக்கள் தொகை, உதாரணமாக இனம், பாலினம், அரசியல் பார்வை, மதம் போன்றவை இல்லாதபோது என்ன நடக்கலாம் என்று கற்பனை செய்யுங்கள். அல்லது மாடலின் வெளியீடு சில மக்கள் தொகைக்கு ஆதரவாக விளக்கப்படும்போது என்ன நடக்கும்? இது இந்த நுணுக்கமான அம்சக் குழுக்களின் அதிக அல்லது குறைவான பிரதிநிதித்துவத்தை அறிமுகப்படுத்தி, மாடலின் நியாயம், உள்ளடக்கம் அல்லது நம்பகத்தன்மை பிரச்சினைகளை உருவாக்கலாம். மேலும், இயந்திரக் கற்றல் மாடல்கள் "கருப்பு பெட்டிகள்" என்று கருதப்படுகின்றன, இது ஒரு மாடலின் கணிப்புகளை என்ன இயக்குகிறது என்பதைப் புரிந்து கொள்ளவும் விளக்கவும் கடினமாக்குகிறது. போதுமான கருவிகள் இல்லாமல் ஒரு மாடலின் நியாயம் அல்லது நம்பத்தன்மையை சரிசெய்தல் மற்றும் மதிப்பீடு செய்யும் போது, தரவியல் விஞ்ஞானிகள் மற்றும் AI டெவலப்பர்கள் எதிர்கொள்ளும் சவால்கள் இவை.
க்கற்க்குறிப்பில், மாதிரி பொறுப்பான AI பிரச்சனைகள் உள்ளதோ இல்லையோ என்பது மதிப்பாய்வதற்கான நடைமுறை கருவிகளை பார்க்கப்போகிறோம். பாரம்பரிய இயந்திரக் கற்பிப்பு பிழைதிரியல் தொழில்நுட்பங்கள் பெரும்பாலும் கூட்டு துல்லியத்திற்கோ அல்லது சராசரி பிழை இழப்பிற்கோ அடிப்படையாக கணக்கிடப்படுகின்றன. நீங்கள் உருவாக்கும் மாதிரிகளுக்காக பயன்படுத்தும் தரவை இனம், பிறப்பு, பாலினம், அரசியல் பார்வை, மதம் போன்ற சில மக்கள் குழுக்களை குறைவாகக் கொண்டிருந்தால் என்ன ஆகும் என்று நினைத்துக் பார்க்கவும். மாதிரியின் வெளியீடு சில மக்கள் குழுக்களை ஆதரிக்க வரையறுக்கப்பட்டால்? இதில் அந்த உணர்ச்சி வாய்ந்த அடையாளக்குச் சூழல்களில் அதிகம் அல்லது குறைவாக பிரதிநிதித்துவம் ஏற்படுவதால், மாதிரியில் நியாயம், ஒருங்கிணைவு அல்லது நம்பகத்தன்மை பிரச்சனைகள் உருவாகுகின்றன. இன்னும் ஒன்று, இயந்திரக் கற்பிப்பு மாதிரிகள் கருப்பு பெட்டிகள் என கருதப்படுகின்றன, அதனால் மாதிரியின் முன்னறிவிப்பிற்கான காரணங்களை புரியவோ விளக்கவோ கடினமாகிறது. இந்த அனைத்தும் தரவு அறிவியலாளர்கள் மற்றும் AI மேம்படுத்துநர்களுக்கு தேவையான கருவிகள் இல்லாதபோது அவ்வாறு எதிர்கொள்ளும் சவால்கள் ஆகும், மாதிரியின் நியாயம் அல்லது நம்பத்தன்மையை மதிப்பீடு செய்ய.
இந்த பாடத்தில், உங்கள் மாடல்களை பிழை சரிசெய்தல் பற்றி நீங்கள் கற்றுக்கொள்வீர்கள்:
இந்த பாடத்தில், நீங்கள் உங்கள் மாதிரிகளை பிழைதிரியலில் பயன்படுத்த தொடங்குவீர்கள்:
- **பிழை பகுப்பாய்வு**: உங்கள் தரவின் பகிர்மானத்தில் மாடலுக்கு அதிக பிழை விகிதங்கள் உள்ள இடங்களை அடையாளம் காணுங்கள்.
- **மாடல் மேற்பார்வை**: மாடலின் செயல்திறன் அளவுகோள்களில் வேறுபாடுகளை கண்டறிய தரவுக் குழுக்களுக்கிடையே ஒப்பீட்டு பகுப்பாய்வு செய்யுங்கள்.
- **தரவு பகுப்பாய்வு**: உங்கள் தரவின் அதிக அல்லது குறைவான பிரதிநிதித்துவம் எங்கு இருக்கலாம் என்பதை ஆராய்ந்து, உங்கள் மாடல் ஒரு தரவுக் குழுவுக்கு ஆதரவாக சாய்ந்திருக்க வாய்ப்பு உள்ளதா என்பதைப் பாருங்கள்.
- **அம்ச முக்கியத்துவம்**: மாடலின் கணிப்புகளை உலகளாவிய அல்லது உள்ளூர் அளவில் எந்த அம்சங்கள் இயக்குகின்றன என்பதைப் புரிந்து கொள்ளுங்கள்.
- **பிழை பகுப்பாய்வு**: உங்கள் தரவு விநியோகத்தில் மாதிரி அதிக பிழை வீதம் காணப்படும் இடங்களை கண்டறியுங்கள்.
- **மாதிரி அவலோசனை**: வெவ்வேறு தரவு பகுதியில் மாதிரியின் செயல்திறன் அளவுகோல்களில் பன்முக வேறுபாடுகளை கண்டறிய ஒப்பிட்டுப் பார்வை நடத்துங்கள்.
- **தரவு பகுப்பாய்வு**: உங்கள் மாதிரியை ஒரு தரவு மக்கள் தொகை மற்றொன்றை விட அதிகமாக ஆதரிக்க அல்லது குறையாக பிரதிநிதித்துவம் செய்கிற இடங்களை ஆராயுங்கள்.
- **அமைப்பு முக்கியத்துவம்**: உலகளாவிய அல்லது உள்ளூர் மட்டத்தில் உங்கள் மாதிரியின் முன்னறிவிப்பை இயக்கும் அம்சங்களை புரிந்துகொள்ளுங்கள்.
## முன்னோட்டம்
## முன்னணிப் பகுதி
முன்னோட்டமாக, [டெவலப்பர்களுக்கான பொறுப்பான AI கருவிகள்](https://www.microsoft.com/ai/ai-lab-responsible-ai-dashboard) மதிப்பீடு செய்யவும்.
முன்னணி, தயவுசெய்து மீள்தரவேற்றலுக்கு [பொறுப்பான AI கருவிகள் மேம்படுத்துநர்களுக்கான](https://www.microsoft.com/ai/ai-lab-responsible-ai-dashboard) பார்த்துக் கொள்ளவும்.
> ![பொறுப்பான AI கருவிகள் பற்றிய GIF](../../../../9-Real-World/2-Debugging-ML-Models/images/rai-overview.gif)
> ![பொறுப்பான AI கருவிகள் குறித்த கிஃப்](../../../../9-Real-World/2-Debugging-ML-Models/images/rai-overview.gif)
## பிழை பகுப்பாய்வு
பாரம்பரிய மாடல் செயல்திறன் அளவுகோள்கள் துல்லியத்தை அளவிட பயன்படுத்தப்படுகின்றன, அவை பெரும்பாலும் சரியான மற்றும் தவறான கணிப்புகளின் அடிப்படையில் கணக்கீடுகள். உதாரணமாக, ஒரு மாடல் 89% துல்லியமாக உள்ளது மற்றும் 0.001 பிழை இழப்புடன் உள்ளது என்று தீர்மானித்தல் நல்ல செயல்திறனாகக் கருதப்படலாம். பிழைகள் உங்கள் அடிப்படை தரவுத்தொகுப்பில் ஒரே மாதிரியான முறையில் பகிரப்படவில்லை. நீங்கள் 89% மாடல் துல்லிய மதிப்பெண் பெறலாம், ஆனால் மாடல் 42% நேரத்தில் தோல்வியடையும் உங்கள் தரவின் பல பகுதிகளை கண்டறியலாம். குறிப்பிட்ட தரவுக் குழுக்களுடன் இந்த தோல்வி முறைமைகளின் விளைவுகள் நியாயம் அல்லது நம்பகத்தன்மை பிரச்சினைகளை உருவாக்கலாம். மாடல் எங்கு நன்றாக செயல்படுகிறது அல்லது இல்லை என்பதைப் புரிந்து கொள்வது அவசியம். உங்கள் மாடலில் அதிக தவறுகள் உள்ள தரவுப் பகுதிகள் முக்கியமான தரவுக் குழுவாக இருக்கலாம்.
சரியான எதிர்பார்ப்புகளை கொண்டு துல்லியத்தை கணக்கிடுவதில் பயன்படுத்தப்படும் பாரம்பரிய மாதிரி செயல்திறன் அளவுகோல்கள் பெரும்பாலும் துல்லியமான மற்றும் தவறான முன்னறிவிப்புகளின் அடிப்படையில் கணக்கிடப்படுகின்றன. உதாரணமாக, மாதிரி 89% துல்லியத்துடன் 0.001 பிழை இழப்பைக் கொண்டுள்ளது என நிரூபித்தால் நல்ல செயல்திறன் என கருதலாம். பிழைகள் பொதுவாக உங்கள் அடிப்படை தரவு தொகுப்பில் சமமாக பரவவில்லையென்று காணப்படுகின்றன. 89% மாதிரி துல்லியத்தைப் பெற்றாலும், மாதிரி சில தரவு பிரிவுகளில் 42% தவறான முன்னறிவிப்பைச் செய்யும் என்று கண்டுபிடிக்கலாம். சில தரவு குழுக்களுடன் இந்த தோல்வி முறை ஏற்பட்டால், அது நியாயம் அல்லது நம்பகத்தன்மை பிரச்சனைகளுக்கு வழிவகுக்கும். மாதிரி நன்றாக செயல்படுகையில் அல்லது செய்யாமல் இருக்கும் பகுதிகளை புரிந்துகொள்ளுவது அவசியம். உங்கள் மாதிரியில் அதிக தவறுகள் உள்ள இடங்கள் முக்கியமான தரவு மக்கள் தொகை என 판்பட்டுக் கொள்ளப்படலாம்.
![மாடல் பிழைகளை பகுப்பாய்வு மற்றும் சரிசெய்தல்](../../../../translated_images/ta/ea-error-distribution.117452e1177c1dd8.webp)
![மாதிரி பிழைகளை பகுப்பாய்வு செய்து பிழை தீர்வு](../../../../translated_images/ta/ea-error-distribution.117452e1177c1dd8.webp)
RAI டாஷ்போர்டில் உள்ள பிழை பகுப்பாய்வு கூறு மாடல் தோல்வி பல்வேறு குழுக்களுக்கிடையே எவ்வாறு பகிரப்பட்டுள்ளது என்பதை மரக்காட்சி மூலம் விளக்குகிறது. இது உங்கள் தரவுத்தொகுப்பில் அதிக பிழை விகிதம் உள்ள அம்சங்கள் அல்லது பகுதிகளை அடையாளம் காண உதவுகிறது. மாடலின் தவறான கணிப்புகள் எங்கு அதிகமாக உள்ளன என்பதைப் பார்த்து, நீங்கள் அடிப்படை காரணத்தை ஆராயத் தொடங்கலாம். மேலும், தரவுக் குழுக்களை உருவாக்கி அவற்றில் பகுப்பாய்வு செய்யலாம். இந்த தரவுக் குழுக்கள் பிழை சரிசெய்தல் செயல்முறையில் உதவுகின்றன, ஏனெனில் ஒரு குழுவில் மாடல் செயல்திறன் நல்லது, ஆனால் மற்றொன்றில் தவறாக உள்ளது என்பதை தீர்மானிக்க உதவுகின்றன.
RAI டாஷ்போர்டில் உள்ள பிழை பகுப்பாய்வு கூறு பல கொஹார்ட்களில் மாதிரி தோல்வி எவ்வாறு பரவியுள்ளது என்பதை மரம் வடிவமாக காட்டுகிறது. இது குறிப்பிட்ட அம்சங்கள் அல்லது அதிக பிழை வீதம் உள்ள பகுதிகளை கண்டறிய உதவுகிறது. மாதிரியின் அதிக தவறுகள் எங்கு உள்ளன என்று பார்த்து, மூல காரணத்தைக் கண்டுபிடிக்க தொடங்கலாம். கொஹார்ட்கள் உருவாக்கி அவற்றில் பகுப்பாய்வு செய்யவும் முடியும். அந்த கொஹார்ட்கள் மூலம் ஒரு பகுதியின் செயல்திறன் ஏன் நல்லதும் மற்றொன்றின் விரோதமானதும் என்பதை தெரிந்து கொள்ளலாம்.
![பிழை பகுப்பாய்வு](../../../../translated_images/ta/ea-error-cohort.6886209ea5d438c4.webp)
மரக்காட்சியில் உள்ள காட்சி குறியீடுகள் பிரச்சினை பகுதிகளை விரைவாக அடையாளம் காண உதவுகின்றன. உதாரணமாக, மரக்கிளை ஒரு ஆழமான சிவப்பு நிறத்துடன் இருந்தால், பிழை விகிதம் அதிகமாக இருக்கும்.
மரம் வரைபடத்தில் உள்ள காட்சி குறியீடுகள் சிக்கல் உள்ள பகுதிகளை விரைவில் கண்டுபிடிக்க உதவுகின்றன. உதாரணமாக, ஒரு மர மூலக்கூடியின் சிவப்பு நிறம் காÇழுவ காட்டின் நிறம் ஆழமா இருந்தால், அதற்கு பிழை வீதம் அதிகம் என்று அர்த்தம்.
ஹீட் மேப் என்பது மற்றொரு காட்சி செயல்பாடு, இது ஒரு அல்லது இரண்டு அம்சங்களைப் பயன்படுத்தி பிழை விகிதத்தை ஆராய்ந்து, மாடல் பிழைகளுக்கு காரணமாக இருக்கும் அம்சங்களை முழு தரவுத்தொகுப்பில் அல்லது குழுக்களில் கண்டறிய உதவுகிறது.
ஹீட் மேப் என்பது மாதிரி பிழைகளுக்கு பங்கேற்பு அளிக்கும் ஒரு அம்சத்தை அல்லது இரண்டு அம்சங்களை பயன்படுத்தி பிழை வீதத்தை ஆராயஒரு வேறொரு காட்சி உதவி.
![பிழை பகுப்பாய்வு ஹீட் மேப்](../../../../translated_images/ta/ea-heatmap.8d27185e28cee383.webp)
![பிழை பகுப்பாய்வு ஹீட்மேப்](../../../../translated_images/ta/ea-heatmap.8d27185e28cee383.webp)
பிழை பகுப்பாய்வை நீங்கள் பயன்படுத்த வேண்டிய சூழல்கள்:
பிழை பகுப்பாய்வை நீங்கள் பயன்படுத்த வேண்டும் எனின்:
* மாடல் தோல்விகள் உங்கள் தரவுத்தொகுப்பில் மற்றும் பல உள்ளீடு மற்றும் அம்ச பரிமாணங்களில் எவ்வாறு பகிரப்பட்டுள்ளன என்பதை ஆழமாகப் புரிந்து கொள்ளுங்கள்.
* தொகுத்த செயல்திறன் அளவுகோள்களை உடைத்து, தவறான குழுக்களை தானாகவே கண்டறிந்து, உங்கள் இலக்கு முறைமைகள் தொடர்பான தகவல்களை வழங்குங்கள்.
* மாதிரி தோல்விகள் தரவு தொகுப்பு மற்றும் பல உள்ளீடு மற்றும் அம்ச பரிமாணங்களில் எப்போதெல்லாம் எங்கு பரவுகின்றன என்பதை ஆழ்ந்த புரிதல் பெற.
* கூட்டு செயல்திறன் அளவுகோல்களை உடைத்து பிழை உள்ள கொஹார்ட்களை தானாக கண்டறிந்து நோக்கிச் செயற்படுத்த அங்கீகாரம் பெறுதல்.
## மாடல் மேற்பார்வ
## மாதிரி அவலோசன
ஒரு இயந்திரக் கற்றல் மாடலின் செயல்திறனை மதிப்பீடு செய்வது அதன் நடத்தை பற்றிய முழுமையான புரிதலைப் பெற வேண்டும். இது பிழை விகிதம், துல்லியம், மீட்டெடுப்பு, துல்லியமான கணிப்பு அல்லது MAE (Mean Absolute Error) போன்ற பல அளவுகோள்களை மதிப்பீடு செய்வதன் மூலம் அடைய முடியும். ஒரு செயல்திறன் அளவுகோள் சிறப்பாகத் தோன்றலாம், ஆனால் மற்றொரு அளவுகோளில் தவறுகள் வெளிப்படலாம். மேலும், முழு தரவுத்தொகுப்பில் அல்லது குழுக்களில் அளவுகோள்களை ஒப்பிட்டு வேறுபாடுகளை கண்டறிவது மாடல் எங்கு நன்றாக செயல்படுகிறது அல்லது இல்லை என்பதை வெளிச்சமிட உதவுகிறது. இது குறிப்பாக உணர்திறன் கொண்ட அம்சங்கள் மற்றும் உணர்திறன் இல்லாத அம்சங்கள் (உதாரணமாக, நோயாளியின் இனம், பாலினம் அல்லது வயது) ஆகியவற்றின் மத்தியில் மாடலின் செயல்திறனைப் பார்ப்பதில் முக்கியம், மாடலின் சாத்தியமான அநியாயத்தை வெளிப்படுத்த உதவுகிறது. உதாரணமாக, உணர்திறன் கொண்ட அம்சங்களைக் கொண்ட குழுவில் மாடல் அதிக பிழைகளைச் செய்யும் என்பதை கண்டறிதல், மாடலின் சாத்தியமான அநியாயத்தை வெளிப்படுத்தலாம்.
இயந்திரக் கற்பிப்பு மாதிரியின் செயல்திறனை மதிப்பாய்வு செய்வதற்கு அதன் நடத்தையை முழுமையாகப் புரிந்து கொள்வது தேவை. பிழை வீதம், துல்லியம், மீள்கூறு, துல்லியத்தன்மை, அல்லது MAE (சராசரி முழுமையான பிழை) போன்ற பல அளவுகோல்களை மதிப்பீடு செய்து செயல்திறன் வேறுபாடுகளை கண்டறியலாம். ஒரு செயல்திறன் அளவுகோல் சிறப்பாக தோன்றினாலும் மற்றொன்று பிழைகளை வெளிப்படுத்தலாம். மேலும், முழு தரவு தொகுப்பிலும் கொஹார்ட்களிலும் வேறுபாடுகளை ஒப்பிட்டு பார்க்க பாதுகாப்பானது, அது மாதிரி எங்கு நன்றாக செயல்படுகிறது அல்லது இல்லை என்பதை வெளிச்சம் வீசும். இதற்கு முக்கியம், உணர்ச்சி வாய்ந்த மற்றும் உணர்ச்சி இல்லாத அம்சங்களின் இடையேயான வேறுபாடுகளை காண்பது (எ.கா., நோயாளியின் இனப் பாரம்பரியம், பாலினம் அல்லது வயது) மாதிரியில் உள்ள சாத்தியமான நியாயமற்ற தன்மையை வெளிப்படுத்த.
RAI டாஷ்போர்டின் மாடல் மேற்பார்வை கூறு, தரவுக் குழுக்களில் மாடலின் நடத்தை ஒப்பிடுவதற்கான திறனைக் கொடுப்பதுடன், குழுவில் தரவின் பிரதிநிதித்துவத்தின் செயல்திறன் அளவுகோள்களை பகுப்பாய்வு செய்ய உதவுகிறது.
RAI டாஷ்போர்டின் மாதிரி அவலோசனை கூறு, ஒரு கொஹார்டில் தரவு பிரதிநிதித்துவ செயல்திறன் அளவுகோல்களை மட்டும் அல்லாமல், வேறுபட்ட கொஹார்ட்களுக்கு இடையேயான மாதிரி நடத்தையை ஒப்பிடும் திறனையும் அளிக்கிறது.
![டாஷ்போர்டில் மாடல் மேற்பார்வை - தரவுக் குழுக்கள்](../../../../translated_images/ta/model-overview-dataset-cohorts.dfa463fb527a35a0.webp)
![தரவு கொஹார்ட்கள் - RAI டாஷ்போர்டில் மாதிரி அவலோசனை](../../../../translated_images/ta/model-overview-dataset-cohorts.dfa463fb527a35a0.webp)
கூறின் அம்ச அடிப்படையிலான பகுப்பாய்வு செயல்பாடு, குறிப்பிட்ட அம்சத்தில் உள்ள தரவின் துணைக்குழுக்களை குறுகிய அளவில் அடையாளம் காண உதவுகிறது. உதாரணமாக, டாஷ்போர்டில் உள்ள உள்ளமை intelligence, பயனர் தேர்ந்தெடுத்த அம்சத்திற்கான குழுக்களை தானாக உருவாக்குகிறது (உதாரணமாக, *"time_in_hospital < 3"* அல்லது *"time_in_hospital >= 7"*). இது ஒரு பயனருக்கு பெரிய தரவுக் குழுவிலிருந்து ஒரு குறிப்பிட்ட அம்சத்தை தனிமைப்படுத்தி, மாடலின் தவறான முடிவுகளின் முக்கியமான தாக்கம் உள்ளதா என்பதைப் பார்க்க உதவுகிறது.
கூறின் அம்ச அடிப்படையிலான பகுப்பாய்வு செயல்பாடு, குறிப்பிட்ட அம்சத்தில் உள்ள தரவு உபகுழுக்களை துல்லியமாக சிதறல் அளவிட உதவுகிறது. உதாரணமாக, டாஷ்போர்டில் ஏற்கனவே உள்ள நுண்ணறிவு, பயனர் தேர்ந்தெடுத்த அம்சம் (உதாரணமாக *"time_in_hospital < 3"* அல்லது *"time_in_hospital >= 7"*) ஆகியவற்றுக்காக தானாகவே கொஹார்ட்களை உருவாக்க முடியும். இது ஒரு பெரிய தரவு குழுவிலிருந்து குறிப்பிட்ட ஒரு அம்சத்தை தனிமைப்படுத்தி, மாதிரியின் தவறான வெளியீடுகளுக்கு அதன் தாக்கம் அதிகமானதா என்று தெரிந்து கொள்வதற்கு உதவுகிறது.
![டாஷ்போர்டில் மாடல் மேற்பார்வை - அம்சக் குழுக்கள்](../../../../translated_images/ta/model-overview-feature-cohorts.c5104d575ffd0c80.webp)
![அம்ச கொஹார்ட்கள் - RAI டாஷ்போர்டில் மாதிரி அவலோசனை](../../../../translated_images/ta/model-overview-feature-cohorts.c5104d575ffd0c80.webp)
மாடல் மேற்பார்வை கூறு இரண்டு வகையான வேறுபாடு அளவுகோள்களை ஆதரிக்கிறது:
மாதிரி அவலோசனை கூறு இரு வகையான வேறுபாடு அளவுகோல்களை ஆதரிக்கிறது:
**மாடல் செயல்திறனில் வேறுபாடு**: இந்த அளவுகோள்களின் தொகுப்புகள், தரவின் துணைக்குழுக்களுக்கிடையே தேர்ந்தெடுக்கப்பட்ட செயல்திறன் அளவுகோளின் மதிப்புகளில் உள்ள வேறுபாட்டை (மாறுபாடு) கணக்கிடுகின்றன. சில உதாரணங்கள்:
**மாதிரி செயல்திறன் வேறுபாடு**: இந்த அளவுகோல்கள் தேர்வு செய்யப்பட்ட செயல்திறன் அளவுகோலின் மதிப்புகளில் தரவு உபகுழுக்களுக்கிடையேயான வேறுபாட்டை (வித்தியாசத்தை) கணக்கிடுகின்றன. இதற்கு சில உதாரணங்கள்:
* துல்லிய விகிதத்தில் வேறுபாடு
* பிழை விகிதத்தில் வேறுபாடு
* துல்லியமான கணிப்பில் வேறுபாடு
* மீட்டெடுப்பில் வேறுபாடு
* சராசரி முழுமையான பிழையில் (MAE) வேறுபாடு
* துல்லிய வதத்தில் வேறுபாடு
* பிழை வதத்தில் வேறுபாடு
* துல்லியத்தில் வேறுபாடு
* மீள்கூறில் வேறுபாடு
* சராசரி முழுமையான பிழை (MAE) இல் வேறுபாடு
**தேர்வு விகிதத்தில் வேறுபாடு**: இந்த அளவுகோள், தரவின் துணைக்குழுக்களுக்கிடையே தேர்வு விகிதத்தில் (சிறந்த கணிப்பு) உள்ள வேறுபாட்டை கொண்டுள்ளது. இதற்கான ஒரு உதாரணம் கடன் ஒப்புதல் விகிதங்களில் வேறுபாடு. தேர்வு விகிதம் என்பது ஒவ்வொரு வகுப்பில் உள்ள தரவுப் புள்ளிகளின் பகுதி (இரட்டை வகைப்பாட்டில்) அல்லது கணிப்பு மதிப்புகளின் பகிர்மானம் (மறுமதிப்பீட்டில்).
**தேர்வு வீதத்தில் வேறுபாடு**: இந்த அளவுகோல் உபகுழுக்களில் தேர்வு வீதம் (நன்மைக்குரிய முன்னறிவிப்பு) இடையேயான வித்தியாசத்தைக் கொண்டுள்ளது. உதாரணமாக கடன் அனுமதி வீதத்தில் வேறுபாடு. தேர்வு வீதம் என்பது ஒவ்வொரு வகுப்பிலும் தரவு புள்ளிகள் 1 ஆக வகைப்படுத்தப்படுகிற அளவுகோல் (இரு வகைப்படுத்தலில்) அல்லது முன்னறிவிப்பு மதிப்புகளின் விநியோகம் (மீளாடல் முறையில்).
## தரவு பகுப்பாய்வு
> "தரவை நீண்ட நேரம் சித்திரவதை செய்தால், அது எதற்கும் ஒப்புக்கொள்ளும்" - ரொனால்ட் கோஸ்
> "நீங்கள் தரவை நீண்ட நேரம் வலித்து பேச வைக்கின்றீர்கள் என்றால் அது எதை வேண்டுமானாலும் ஒப்புக்கொள்ளும்" - ரொனால்ட் கோஸ்
இந்த கூற்று மிகுந்ததாகத் தோன்றினாலும், தரவை எந்த முடிவையும் ஆதரிக்க மாற்றம் செய்ய முடியும் என்பது உண்மை. இந்த மாற்றம் சில நேரங்களில் தவறுதலாக நடக்கலாம். மனிதர்களாக, நமக்கு அனைவருக்கும் பாகுபாடு உள்ளது, மேலும் தரவுகளில் பாகுபாட்டை அறிமுகப்படுத்தும் போது அதை உணர்ந்து கொள்ளுவது கடினம். AI மற்றும் இயந்திரக் கற்றலில் நியாயத்தை உறுதிப்படுத்துவது இன்னும் ஒரு சிக்கலான சவாலாகவே உள்ளது.
இந்த கூற்றானது கடுமைபடியாக தெரிகிறது என்றாலும், தரவை எந்த முடிவையும் ஆதரிக்க ஏதாவது வகையில் மோசடியாக மாற்றலாம் என்பது உண்மை. சில சமயங்களில் இப்படிப் பண்படுத்தல் 意 危யல்லாமல் நிகழலாம். மனிதர்களுக்கு ஒவ்வொருவருக்கும் மதிப்பிலக்கணம் உள்ளது, மற்றும் எப்பொழுதெல்லாம் தரவில் மதிப்பிலக்கணம் கொண்டுவரப்படுகிறதென்று அப்படியே உணர்வது கடினம். AI மற்றும் இயந்திரக் கற்பிப்பில் நியாயத்தை உறுதி செய்வது சிக்கலான சவால் ஆகின்றது.
தரவு பாரம்பரிய மாடல் செயல்திறன் அளவுகோள்களுக்கு ஒரு பெரிய மறைமுகமாகும். உங்களுக்கு அதிக துல்லிய மதிப்பெண்கள் இருக்கலாம், ஆனால் இது உங்கள் தரவுத்தொகுப்பில் உள்ள அடிப்படை தரவுப் பாகுபாட்டை எப்போதும் பிரதிபலிக்காது. உதாரணமாக, ஒரு நிறுவனத்தில் நிர்வாக நிலைகளில் 27% பெண்கள் மற்றும் 73% ஆண்கள் உள்ள பணியாளர்களின் தரவுத்தொகுப்பில், இந்த தரவின் அடிப்படையில் பயிற்சி அளிக்கப்பட்ட வேலைவாய்ப்பு விளம்பர AI மாடல், மூத்த நிலை வேலைவாய்ப்புகளுக்கு பெரும்பாலும் ஆண் பார்வையாளர்களை இலக்காகக் கொண்டிருக்கலாம். இந்த சமநிலையற்ற தன்மை மாடலின் கணிப்பை ஒரு பாலினத்திற்கு ஆதரவாக சாய்த்தது. இது AI மாடலில் பாலின பாகுபாடு உள்ள ஒரு நியாய பிரச்சினையை வெளிப்படுத்துகிறது.
பாரம்பரிய மாதிரி செயல்திறன் அளவுகோல்கள் தரவு பக்கவிளைவுகளில் பெரும் புறக்கணிப்பு கண்டிருக்கின்றன. உங்களுக்கு உயர் துல்லியம் மதிப்பெண்கள் கிடைக்கலாம், ஆனாலும் அது உங்கள் தரவு தொகுப்பில் உள்ள அடிப்படை மதிப்பிலக்கணத்தை ஏற்படுத்தக்கூடும் என்று வேண்டாம். உதாரணமாக, ஒரு நிறுவனத்தில் பணியாளர்களின் தொகுப்பில் 27% பெண்கள் நிர்வாகப் பணிகளில் மற்றும் 73% ஆண்கள் அதே நிலையில் இருந்தால், அந்த தரவின் அடிப்படையில் பயிற்சி பெறுமாயிருக்கும் வேலைவாய்ப்பு AI மாதிரி பெரும்பாலும் ஆண் பார்வையாளர்களை இலக்கு செய்யும். இந்த தரவு சமநிலைமையின்மை மாதிரியின் முன்னறிவிப்பை ஓர் பாலினத்திற்கு மேலோட்டமாக சாய்க்கிறது. இது AI மாதிரியில் பாலின மதிப்பிலக்கணம் என்ற நியாய பிரச்சனையை வெளிப்படுத்துகிறது.
RAI டாஷ்போர்டில் உள்ள தரவு பகுப்பாய்வு கூறு, தரவுத்தொகுப்பில் அதிக மற்றும் குறைவான பிரதிநிதித்துவம் உள்ள பகுதிகளை அடையாளம் காண உதவுகிறது. இது தரவின் சமநிலையற்ற தன்மை அல்லது குறிப்பிட்ட தரவுக் குழுவின் பிரதிநிதித்துவம் இல்லாமை காரணமாக பிழைகள் மற்றும் நியாய பிரச்சினைகளை அறிய உதவுகிறது. இது பயனர்களுக்கு கணிப்பிடப்பட்ட மற்றும் உண்மையான முடிவுகள், பிழை குழுக்கள் மற்றும் குறிப்பிட்ட அம்சங்களை அடிப்படையாகக் கொண்ட தரவுத்தொகுப்புகளை காட்சிப்படுத்தும் திறனை வழங்குகிறது. சில நேரங்களில் குறைவாக பிரதிநிதித்துவம் செய்யப்பட்ட தரவுக் குழுவை கண்டறிதல், மாடல் நன்றாக கற்றுக்கொள்ளவில்லை என்பதை வெளிப்படுத்தலாம், இதனால் அதிக தவறுகள் ஏற்படுகின்றன. தரவுப் பாகுபாடு கொண்ட மாடல் என்பது ஒரு நியாய பிரச்சினை மட்டுமல்ல, மாடல் உள்ளடக்கமானது அல்லது நம்பகமானது அல்ல என்பதை காட்டுகிறது.
RAI டாஷ்போர்டில் உள்ள தரவு பகுப்பாய்வு கூறு தரவு தொகுதியில் அதிகம் அல்லது குறைவாக பிரதிநிதித்துவம் உள்ள பகுதிகளை கண்டுபிடிக்க உதவுகிறது. இது பிழை மற்றும் நியாய பிரச்சனைகளின் மூலக்காரணத்தை கண்டுபிடிக்க உதவுகிறது, குறிப்ப particular் குறிப்பிட்ட தரவு சமூகத்தின் பிரதிநிதித்துவம் குறைவாக அல்லது அளவுக்கு அதிகமாக இருக்கும்போது. இது பயனர்களுக்கு முன்னறிவு மற்றும் உண்மையான விளைவுகளின் அடிப்படை மற்றும் பிழைக் குழுக்களை, குறிப்பிட்ட அம்சங்களை அடிப்படையாக வைத்து தரவு தொகுப்பினை காட்சிப்படுத்தும் திறனை வழங்குகிறது. சில சமயங்களில் குறைந்த பிரதிநிதித்துவம் உள்ள தொடர்பற்ற தரவு குழு மாடல் நன்றாக கற்றுக்கொள்ளவில்லை என்பதையும் வெளிப்படுத்தும், அதனால் அதிக பிழைகள் ஏற்பட்டிருக்கலாம். ஒரு மாதிரி தரவு மதிப்பிலக்கணம் கொண்டிருந்தால், அது நியாய பிரச்சனை மட்டுமல்ல, அது மாதிரி ஒருங்கிணைந்ததும் நம்பகமானதுமில்லாததுமானது என்பதையும் காட்டும்.
![RAI டாஷ்போர்டில் தரவு பகுப்பாய்வு கூறு](../../../../translated_images/ta/dataanalysis-cover.8d6d0683a70a5c1e.webp)
தரவு பகுப்பாய்வை நீங்கள் பயன்படுத்த வேண்டிய சூழல்கள்:
* உங்கள் தரவுத்தொகுப்பின் புள்ளிவிவரங்களை ஆராய்ந்து, உங்கள் தரவை பல பரிமாணங்களில் (குழுக்களாகவும் அழைக்கப்படும்) துண்டிக்க பல வடிகட்டிகளைத் தேர்ந்தெடுக்கவும்.
* உங்கள் தரவுத்தொகுப்பின் பகிர்மானத்தை பல குழுக்களிலும் அம்சக் குழுக்களிலும் புரிந்து கொள்ளுங்கள்.
* நியாயம், பிழை பகுப்பாய்வு மற்றும் காரணம் தொடர்பான உங்கள் கண்டுபிடிப்புகள் (மற்ற கூறுகளிலிருந்து பெறப்பட்டவை) உங்கள் தரவுத்தொகுப்பின் பகிர்மானத்தின் விளைவாக உள்ளதா என்பதை தீர்மானிக்கவும்.
* பிரதிநிதித்துவ பிரச்சினைகள், லேபிள் சத்தம், அம்ச சத்தம், லேபிள் பாகுபாடு மற்றும் இதே போன்ற காரணங்களால் ஏற்படும் பிழைகளை சரிசெய்ய மேலும் தரவை எங்கு சேகரிக்க வேண்டும் என்பதை முடிவு செய்யவும்.
தரவு பகுப்பாய்வை நீங்கள் பயன்படுத்த வேண்டும் எனில்:
* வேறுபட்ட வடிகட்டிகளை தேர்ந்தெடுத்து உங்கள் தரவை பல பரிமாணங்களாக (கொஹார்ட்களாக) பிரித்து தரவுத் புள்ளிவிவரங்களை ஆராயுங்கள்.
* உங்கள் தரவு தொகுப்பின் விநியோகம் வேறுபட்ட கொஹார்ட்களிலும் அம்சக் குழுக்களிலும் எப்படிக் இருக்கும் என்பதை புரிந்துகொள்ளுங்கள்.
* உங்கள் கண்டுபிடிப்புகள் (நியாயம், பிழை பகுப்பாய்வு, மற்றும் காரணப்பூர்வம்) பிற டாஷ்போர்டு கூறுகளிலிருந்து பெறப்பட்டாலும் அவை உங்கள் தரவு விநியோகம் காரணமா என்பதை நிரூபிக்கவும்.
* பிரதிநிதித்துவ பிரச்சனைகள், லேபிள் ஒலி, அம்ச ஒலி, லேபிள் மதிப்பிலக்கணம் போன்ற பிரச்சனைகள் வந்த பிழைகளை குறைக்க கூடுதல் தரவை எந்த இடத்தில் சேகரிக்க வேண்டும் என்பதைக் கட்டாயமாகத் தீர்மானிக்கவும்.
## மாதிரி விளக்கம்
இயந்திரக் கற்பிப்பு மாதிரிகள் பெரும்பாலும் கருப்பு பெட்டிகள். ஒரு மாதிரி முன்னறிவிப்பை இயக்கும் முக்கிய தரவு அம்சங்கள் என்ன என்பதை புரிந்துகொள்ள கடினம். ஆனால், ஒரு மாதிரி ஏன் குறிப்பிட்ட முன்கூட்டிய முடிவை எடுத்தது என்பதை வெளிப்படையாக வழங்குவது அவசியம். உதாரணமாக, AI அமைப்பு 30 நாட்களுக்குள் மீண்டும் மருத்துவமனைக்கு அனுமதிக்கப்படக்கூடிய ஆழ்ந்த பட்டியலாளர் ஒரு நோயாளி என்று முன்னறிவித்து இருந்தால், அது அதன் முடிவுக்கு வழிவகுக்கும் ஆதார தரவை வழங்க முடியும். ஆதார தகவல்கள் மருத்துவர்களுக்கு அல்லது மருத்துவமனைக்கு தெளிவான தீர்வுகள் எடுக்க உதவும். மேலும, ஒவ்வொரு நோயாளிக்கு மாதிரி ஏன் அந்த முடிவை எடுத்தது என்பதை விளக்குவது மருத்துவக் கட்டுப்பாடுகளுக்கு பொறுப்புக் காட்ட உதவும். மனிதர்களின் வாழ்வில் பாதிப்புகளை ஏற்படுத்தும் வகையில் இயந்திரக் கற்பிப்பு மாதிரிகளை பயன்படுத்தும் போது, மாதிரியின் நடத்தையை விளக்கும் மற்றும் புரியும் திறன் மிக அவசியம். மாதிரி விளக்கம் மற்றும் விளக்கம் பின்வரும் சூழலில் கேள்விகளுக்கு பதிலளிக்க உதவும்:
* மாதிரி பிழைத்திறனை ஆராய்வு: என் மாதிரி ஏன் இந்த பிழையை செய்தது? எப்படி மேம்படுத்தலாம்?
* மனித-AI ஒத்துழைப்பு: மாதிரியின் முடிவுகளை எப்படித் புரிந்து நம்பலாம்?
* கட்டுப்பாட்டு இணக்கம்: என் மாதிரி சட்ட தேவைகளை பூர்த்தி செய்கிறதா?
RAI டாஷ்போர்டின் அம்ச முக்கியத்துவ கூறு, மாதிரி முன்னறிவிப்புகளை பிழைதிரியலுக்கு உதவியும், மாதிரியின் நடத்தை வழிவகுக்கும் அம்சங்களை விளக்கும் முழுமையான புரிதலை வழங்கவும் உதவுகிறது. இது இயந்திரக் கற்பிப்பு வல்லுநர்கள் மற்றும் முடிவு எடுக்குநர்களுக்கு மாதிரி நடத்தை விளக்க மற்றும் சான்றுகளைச் சுட்டிக்காட்ட உதவும் கருவியாகும். பின்பு, பயனர்கள் உலகளாவிய மற்றும் உள்ளூர் விளக்கங்களை ஆராயலாம். உலகளாவிய விளக்கங்கள், ஒரு மாதிரியின் மொத்த முன்னறிவிப்பை பாதிக்கும் முக்கிய அம்சங்களின் பட்டியலை வழங்கும். உள்ளூர் விளக்கங்கள், தனிப்பட்ட வழக்கிற்கான முன்னறிவிப்பை ஏற்படுத்திய அம்சங்களை காட்டும். உள்ளூர் விளக்கங்களை மதிப்பீடு செய்வது ஒரு குறிப்பிட்ட வழக்கின் பிழைதிரியல் அல்லது ஆய்வுக்கு உதவும், மாதிரி அப்படியானா சரியான முன்னறிவிப்பை செய்ததாக அல்லது தவறானதாக வைக்க காரணங்களை அறியவும்.
![RAI டாஷ்போர்டின் அம்ச முக்கியத்துவ கூறு](../../../../translated_images/ta/9-feature-importance.cd3193b4bba3fd4b.webp)
* உலகளாவிய விளக்கங்கள்: உதாரணமாக, சர்க்கரை நோய் மருத்துவமனை மீண்டும் அடையாளம் மாதிரியின் மொத்த நடத்தையை எவ்வாறு பாதிக்கும் அம்சங்கள் என்ன?
* உள்ளூர் விளக்கங்கள்: உதாரணமாக, 60 வயதுக்கு மேற்பட்ட சர்க்கரை நோயாளர், முன் மருத்துவமனை அனுமதிப்புகளுடன், 30 நாட்களுக்குள் மீண்டும் அனுமதிக்கப்படுவாரா என்று முன்னறிவிக்கப்பட்ட காரணம் என்ன?
வெவ்வேறு கொஹார்டுகளில் மாதிரியின் செயல்திறனை ஆராயும் பிழைதிரியல் செயலியில், அம்ச முக்கியத்துவம் அப்படியான தரவு பாகங்களில் அம்சத்தின் தாக்கத்தின் மட்டத்தை காட்டுகிறது. இது ஒரு மாதிரி தவறான முன்னறிவிப்புகள் உண்டாக்கும் போது அதனை ஒப்பிட்டு விசித்திரங்களை வெளிப்படுத்த உதவுகிறது. அம்ச முக்கியத்துவம் ஒரு அம்சத்தில் உள்ள மதிப்புகள் மாதிரியின் முடிவுகளை நேர்மறையாக அல்லது எதிர்மறையாக பாதித்ததை காட்டும். உதாரணமாக, மாதிரிக்கு தவறான முன்னறிவிப்பு இருந்தால், கூறு அந்தப் பின்னறிவிப்பை சந்திக்க வைத்த அம்சங்கள் அல்லது அதன் மதிப்புக்களை துல்லியமாக அறிய உதவும். இந்த விவரம் பிழைத்திரியலில் மட்டுமல்லாமல், வெளிப்படைத்தன்மை மற்றும் பொறுப்புக் காட்சிகள் வழங்கவும் உதவுகிறது. கடைசியாக, இந்த கூறு நியாயமான பிரச்சனைகள் இருப்பதைக் கண்டறிய உதவும். உதாரணமாக, இனப்பெருக்கம் அல்லது பாலினம் போன்ற உணர்ச்சி வாய்ந்த அம்சம் ஒரு மாதிரியின் முன்னறிவிப்பில் உண்டாகும் மிக முக்கிய தாக்குவாக இருந்தால், அது இனப்பெருக்கம் அல்லது பாலின மதிப்பிலக்கணம் உள்ளதற்கு ஒரே சில அச்சுறுத்தல் ஆகும்.
![அம்ச முக்கியத்துவம்](../../../../translated_images/ta/9-features-influence.3ead3d3f68a84029.webp)
விளக்கத்தை நீங்கள் பயன்படுத்த வேண்டும் எனில்:
* உங்கள் AI அமைப்பின் முன்னறிவிப்புகள் எவ்வளவு நம்பத்தக்கமானவை என்பதைப் புரிந்து கொண்டு முன்னறிவிப்புகளுக்கு முக்கியமான அம்சங்கள் என்ன என்பதை புரிந்துகொள்ளுங்கள்.
* உங்கள் மாதிரியை முதலில் புரிந்து கொண்டு அது உடல்நலமாக அம்சங்களை பயன்படுத்துகின்றதா அல்லது பொய் தொடர்புகளை மட்டுமே பயன்படுத்துகின்றதா என்பதை கண்டுபிடித்து பிழைதிரியலை அணுகுங்கள்.
* உணர்ச்சி வாய்ந்த அம்சங்களில் அல்லது அவற்றோடு அதிக தொடர்புடைய அம்சங்களில் அடிப்படையிலான முன்னறிவிப்புகளை உருவாக்கி மாதிரி உண்மையில் நியாயமற்றதும் உள்ளதா என்பதை வெளிப்படுத்துங்கள்.
* உள்ளூர் விளக்கங்களை உருவாக்கி உங்கள் மாதிரியின் முடிவுகளில் பயனாளர்களின் நம்பிக்கையை உருவாக்குங்கள்.
* AI அமைப்பின் கட்டுப்பாட்டு ஆய்வை முடித்து மாதிரிகளை மதிப்பீடு செய்து மனிதர்களின் மீது மாதிரி முடிவுகளின் தாக்கத்தை கண்காணியுங்கள்.
## மாடல் விளக்கத்தன்மை
## முடிவு
இயந்திரக் கற்றல் மாடல்கள் "கருப்பு பெட்டிகள்" ஆகும். ஒரு மாடலின் கணிப்பை இயக்கும் முக்கிய தரவின் அம்சங்களைப் புரிந்து கொள்வது சவாலாக இருக்கலாம். ஒரு மாடல் ஏன் ஒரு குறிப்பிட்ட கணிப்பைச் செய்கிறது என்பதை விளக்குவதற்கு வெளிப்படைத்தன்மையை வழங்குவது முக்கியம். உதாரணமாக, ஒரு AI அமைப்பு ஒரு நீரிழிவு நோயாளி 30 நாட்களுக்குள் மீண்டும் மருத்துவமனையில் சேர்க்கப்படுவார் என்று கணிக்கிறதானால், அதன் கணிப்புக்கு வழிவகுத்த ஆதரவு தரவை வழங்க வேண்டும். ஆதரவு தரவுக் குறியீடுகள் வெளிப்படைத்தன்மையை வழங்குகின்றன, இது மருத்துவர்கள் அல்லது மருத்துவமனைகள் நன்கு தகவலளிக்கப்பட்ட முடிவுகளை எடுக்க உதவுகிறது. மேலும், ஒரு தனிப்பட்ட நோயாளிக்கான கணிப்பை ஏன் ஒரு மாடல் செய்தது என்பதை விளக்குவதால், சுகாதார விதிமுறைகளுடன் பொறுப்புத்தன்மை ஏற்படுகிறது. மனிதர்களின் வாழ்க்கையை பாதிக்கும் வகையில் இயந்திரக் கற்றல் மாடல்களைப் பயன்படுத்தும் போது, ​​மாடலின் நடத்தை என்னவால் பாதிக்கப்படுகிறது என்பதைப் புரிந்து கொள்ளவும் விளக்கவும் முக்கியம். மாடல் விளக்கத்தன்மை மற்றும் விளக்கத்தன்மை, பின்வரும் சூழல்களில் கேள்விகளுக்கு பதிலளிக்க உதவுகிறது:
அனைத்து RAI டாஷ்போர்டு கூறுகளும் சமூகத்திற்கு குறைவான தீங்கு விளைவிக்கும் மற்றும் நம்பகத்தன்மை அதிகமான இயந்திரக் கற்பிப்பு மாதிரிகள் உருவாக்க உதவும் நடைமுறை கருவிகள் ஆகும். இது மனித உரிமைகளுக்கு அசுரங் காக்குதல், குறிப்பிட்ட குழுக்களை வாழ்க்கை வாய்ப்புகளிலிருந்து விலக்கு வைப்பது மற்றும் உடல் அல்லது உளவியல் காயங்களுக்கு ஆபத்துகள் ஏற்படுத்த்வதை தடுக்க உதவும். இது உங்கள் மாதிரியின் முடிவுகளில் உள்ள நம்பிக்கையை உருவாக்கும் உள்ளூர் விளக்கங்களையும் உருவாக்க உதவும். சில அபாத்துக்கள் கீழ்க்காணும் வகையில் வகைப்படுத்தப்படலாம்:
* மாடல் பிழை சரிசெய்தல்: என் மாடல் இந்த தவறை ஏன் செய்தது? என் மாடலை எப்படி மேம்படுத்தலாம்?
* மனித-AI ஒத்துழைப்பு: மாடலின் முடிவுகளை நான் எப்படி புரிந்து கொள்ளலாம் மற்றும் நம்பலாம்?
* ஒழுங்குமுறை இணக்கம்: என் மாடல் சட்ட தேவைகளை பூர்த்தி செய்கிறதா?
- **வினியோகம்**, உதாரணமாக ஒரு பாலினம் அல்லது இனப்பெருக்கம் மற்றொன்றுடன் ஒப்பிடும்போது விருப்பம் பெற்றால்.
- **சேவை தரம்**. நீங்கள் ஒரு குறிப்பிட்ட சூழ்நிலையில் தரவை பயிற்சி செய்தாலும், உண்மை அதிக சிக்கலானதாக இருந்தால், அது மோசமான சேவை செயல்திறனை ஏற்படுத்தும்.
- **சாதாரண மனப்பான்மைகள்**. ஒரு குழுவுக்கு முன்பிருந்தே வழங்கப்பட்ட பண்புகளைக் கூட்டுசெலுத்துதல்.
RAI டாஷ்போர்டின் அம்ச முக்கியத்துவ கூறு, மாடல் கணிப்புகளை எவ்வாறு செய்கிறது என்பதை முழுமையாகப் புரிந்து கொள்ளவும் பிழை சரிசெய்தல் செய்யவும் உதவுகிறது. இது இயந்திரக் கற்றல் நிபுணர்கள் மற்றும் முடிவெடுப்பாளர்களுக்கு, மாடலின் நடத்தை மீது தாக்கம் செலுத்தும் அம்சங்களின் ஆதாரத்தை விளக்கவும் காட்டவும் ஒரு பயனுள்ள
- **தூற்றுதல்**. ஒருவரை அல்லது ஒன்றை அநியாயமாக விமர்சித்து குற்றம் சாட்டுவது.
- **அதிகமாக அல்லது குறைவாக பிரதிநிதித்துவம்**. ஒரு குறிப்பிட்ட குழு ஒரு குறிப்பிட்ட தொழிலில் காணப்படுவதில்லை என்ற கருத்து, மேலும் அதை தொடர்ந்து ஊக்குவிக்கும் எந்த சேவையோ அல்லது செயல்பாடோ பாதிப்பை ஏற்படுத்துகிறது.
- **எதிர்ப்புரை**. ஏமாற்றமாகக் கண்டிப்பது மற்றும் எதையோ அல்லது யாரையோ லேசாக குறிக்கோள் வைக்கிறது.
- **அதிகப்படியான அல்லது குறைந்தமையான பிரதிநிதித்துவம்**. குறிப்பிட்ட ஒரு குழு ஒரு குறிப்பிட்ட தொழிலில் பார்க்கப்படவில்லை என்று கருத்து, மேலும் எந்த சேவை அல்லது செயல்பாடு அதை முன்னிலைப்படுத்தியதால் சேதம் ஏற்படுகிறது.
### Azure RAI டாஷ்போர்டு
### அசூர் RAI டாஷ்போர்டு
[Azure RAI டாஷ்போர்டு](https://learn.microsoft.com/en-us/azure/machine-learning/concept-responsible-ai-dashboard?WT.mc_id=aiml-90525-ruyakubu) என்பது Microsoft உட்பட முன்னணி கல்வி நிறுவனங்கள் மற்றும் அமைப்புகள் உருவாக்கிய திறந்த மூல கருவிகளின் அடிப்படையில் உருவாக்கப்பட்டுள்ளது. இது தரவியல் விஞ்ஞானிகள் மற்றும் AI டெவலப்பர்களுக்கு மாதிரி நடத்தை பற்றி சிறந்த புரிதலைப் பெறவும், AI மாதிரிகளில் இருந்து விரும்பத்தகாத பிரச்சினைகளை கண்டறிந்து சரிசெய்யவும் உதவுகிறது.
[அசூர் RAI டாஷ்போர்டு](https://learn.microsoft.com/en-us/azure/machine-learning/concept-responsible-ai-dashboard?WT.mc_id=aiml-90525-ruyakubu) முதன்மை கல்வி நிறுவனங்களும் நிறுவங்களும் உருவாக்கிய ஓபன்-சோর্স கருவிகளின் அடிப்படையில் கட்டப்பட்டு, தகவல் அறிவியலாளர்கள் மற்றும் AI உருவாக்குனர்களுக்கு மாதிரியின் நடத்தையை நன்றாக புரிந்துகொள்ள மற்றும் AI மாதிரிகளில் இருந்து விரும்பாத பிரச்சனைகளை கண்டறிந்து குறைக்க உதவுகிறது.
- RAI டாஷ்போர்டின் [ஆவணங்களை](https://learn.microsoft.com/en-us/azure/machine-learning/how-to-responsible-ai-dashboard?WT.mc_id=aiml-90525-ruyakubu) சரிபார்த்து, பல்வேறு கூறுகளை எப்படி பயன்படுத்துவது என்பதை அறிக.
- RAI டாஷ்போர்ட [ஆவணங்களை](https://learn.microsoft.com/en-us/azure/machine-learning/how-to-responsible-ai-dashboard?WT.mc_id=aiml-90525-ruyakubu) பார்க்கவேண்டும் என்பவற்றின் வேறுபட்ட கூறுகளை பயன்படுத்துவதைக் கற்றுக்கொள்ளுங்கள்.
- Azure Machine Learning இல் மேலும் பொறுப்பான AI சூழல்களை சரிசெய்ய RAI டாஷ்போர்டின் [மாதிரி நோட்புக்குகளை](https://github.com/Azure/RAI-vNext-Preview/tree/main/examples/notebooks) பாருங்கள்.
- அசூர் மெஷின் லெர்னிங் இல் இன்னும் பொறுப்பான AI நிலைகளுக்கு பிழைத்தீர்க்க RAI டாஷ்போர்டு [மேல்நோட்டங்களை](https://github.com/Azure/RAI-vNext-Preview/tree/main/examples/notebooks) பார்க்கவும்.
---
## 🚀 சவால்
புள்ளிவிவர அல்லது தரவுப் பாகுபாடுகள் முதலில் அறிமுகமாகாமல் இருக்க, நாம்:
புள்ளிவிவர அல்லது தரவு பாகுபாடுகள் முதலில் அறிமுகப்படுத்தப்படாமல் இருக்க, நாம்:
- அமைப்புகளில் பணிபுரியும் மக்களிடையே பன்முகத்தன்மையும் பார்வைகளின் பல்வகைமையும் கொண்டிருக்க வேண்டும்
- நமது சமுதாயத்தின் பன்முகத்தன்மையை பிரதிபலிக்கும் தரவுத்தொகுப்புகளில் முதலீடு செய்ய வேண்டும்
- பாகுபாடு நிகழும் போது அதை கண்டறிந்து சரிசெய்ய சிறந்த முறைகளை உருவாக்க வேண்டும்
- அமைப்புகளில் பணிபுரியும் மனிதர்களிடையே பன்முகத் தலையங்கங்கள் மற்றும் பார்வைகள் இருக்க வேண்டும்
- நமது சமூகத்தின் பன்முகத்தன்மையை பிரதிபலிக்கும் தரவுத்தொகுதிகளில் முதலீடு செய்ய வேண்டும்
- பாகுபாடுகளை கண்டறிந்து திருத்துவதற்கான சிறந்த முறைகளை உருவாக்க வேண்டும்
மாதிரிகளை உருவாக்குவதிலும் பயன்படுத்துவதிலும் அநியாயம் தெளிவாக தெரியும் உண்மையான சூழல்களைப் பற்றி சிந்தியுங்கள். இன்னும் என்னை நாம் கருத்தில் கொள்ள வேண்டும்?
மாதிரி உருவாக்குதல் மற்றும் பயன்பாட்டில் நியாயமற்ற நிலைகள் காணப்படும் நிஜ உலக நிலையைப் பற்றி சிந்தியுங்கள். இன்னும் என்னை கருத்தில் கொள்ள வேண்டும்?
## [பாடத்திற்குப் பிந்தைய வினாடி வினா](https://ff-quizzes.netlify.app/en/ml/)
## மதிப்பீடு & சுயபடிப்பு
## [பாடம் முடிந்த பின் வினாடி கேள்விக்கட்டு](https://ff-quizzes.netlify.app/en/ml/)
## விமர்சனம் மற்றும் சுய ஆய்வு
இந்த பாடத்தில், இயந்திர கற்றலில் பொறுப்பான AI ஐ இணைக்கும் சில நடைமுறை கருவிகளை நீங்கள் கற்றுக்கொண்டீர்கள்.
இந்த பாடத்தில், நீங்கள் பொறுப்பான AI ஐ மெஷின் லெர்னிங்கில் ஒருங்கிணைக்க சில நடைமுறை கருவிகளை கற்றுக்கொண்டீர்கள்.
இந்த பணிமனைப் பார்வையிட இந்த தலைப்புகளில் மேலும் ஆழமாக செல்வதற்கான வீடியோவைப் பாருங்கள்:
இந்த செயல்முறை இயக்கத்தைக் கவனித்தால், அந்தக் களத்தில் மேலும் ஆழமாகலardırச் செய்யலாம்:
- பொறுப்பான AI டாஷ்போர்டு: நடைமுறையில் RAI ஐ செயல்படுத்துவதற்கான ஒரே இடம் - Besmira Nushi மற்றும் Mehrnoosh Sameki
- Besmira Nushi மற்றும் Mehrnoosh Sameki எழுதிய பொறுப்பான AI டாஷ்போர்டு: உட்பயன்பாட்டில் RAI ஐ செயல்படுத்த ஒரு ஒற்றை கட்சி கடை
[![பொறுப்பான AI டாஷ்போர்டு: நடைமுறையில் RAI ஐ செயல்படுத்துவதற்கான ஒரே இடம்](https://img.youtube.com/vi/f1oaDNl3djg/0.jpg)](https://www.youtube.com/watch?v=f1oaDNl3djg "பொறுப்பான AI டாஷ்போர்டு: நடைமுறையில் RAI ஐ செயல்படுத்துவதற்கான ஒரே இடம் - Besmira Nushi மற்றும் Mehrnoosh Sameki")
[![பொறுப்பான AI டாஷ்போர்டு: உட்பயன்பாட்டில் RAI ஐ செயல்படுத்த ஒரு ஒற்றை கட்சி கடை](https://img.youtube.com/vi/f1oaDNl3djg/0.jpg)](https://www.youtube.com/watch?v=f1oaDNl3djg "பொறுப்பான AI டாஷ்போர்டு: உட்பயன்பாட்டில் RAI ஐ செயல்படுத்த ஒரு ஒற்றை கட்சி கடை")
> 🎥 மேலே உள்ள படத்தை கிளிக் செய்து வீடியோவைப் பாருங்கள்: பொறுப்பான AI டாஷ்போர்டு: Besmira Nushi மற்றும் Mehrnoosh Sameki மூலம் நடைமுறையில் RAI ஐ செயல்படுத்துவதற்கான ஒரே இடம்
> 🎥 மேலே புகைப்படத்தைக் கிளிக் செய்து வீடியோவைப் பாருங்கள்: Besmira Nushi மற்றும் Mehrnoosh Sameki எழுதிய பொறுப்பான AI டாஷ்போர்டு: உட்பயன்பாட்டில் RAI ஐ செயல்படுத்த ஒரு ஒற்றை கட்சி கடை
பொறுப்பான AI மற்றும் நம்பகமான மாதிரிகளை உருவாக்குவது எப்படி என்பதைப் பற்றி மேலும் அறிய பின்வரும் பொருட்களை மேற்கோளாகக் கொள்ளுங்கள்:
பொறுப்பான AI அங்கீகாரம் மற்றும் நம்பகமான மாதிரிகளை உருவாக்கும் முறைகளைப் பற்றி மேலும் அறிய கீழ்க்காணும் tàiல்களைப் பயன்படுத்தவும்:
- ML மாதிரிகளை சரிசெய்ய Microsoft இன் RAI டாஷ்போர்டு கருவிகள்: [பொறுப்பான AI கருவி வளங்கள்](https://aka.ms/rai-dashboard)
- Microsoft இன் RAI டாஷ்போர்டு கருவிகள் மூலம் ML மாதிரிகளை பிழைத்தீர்க்க: [பொறுப்பான AI கருவிகள் வளங்கள்](https://aka.ms/rai-dashboard)
- பொறுப்பான AI கருவி தொகுப்பை ஆராயுங்கள்: [Github](https://github.com/microsoft/responsible-ai-toolbox)
- பொறுப்பான AI கருவிப்பெட்டியை ஆராயுங்கள்: [Github](https://github.com/microsoft/responsible-ai-toolbox)
- Microsoft இன் RAI வள மையம்: [பொறுப்பான AI வளங்கள் Microsoft AI](https://www.microsoft.com/ai/responsible-ai-resources?activetab=pivot1%3aprimaryr4)
- Microsoft இன் FATE ஆராய்ச்சி குழு: [FATE: AI இல் நியாயம், பொறுப்பு, வெளிப்படைத் தன்மை மற்றும் நெறிமுறைகள் - Microsoft Research](https://www.microsoft.com/research/theme/fate/)
- Microsoft இன் FATE ஆராய்ச்சி குழு: [FATE: AI இல் நீதி, பொறுப்புணர்வு, வெளிப்படையானம் மற்றும் ஒழுக்கநிலை - Microsoft Research](https://www.microsoft.com/research/theme/fate/)
## பணிக்குறிப்பு
## பணிமுறை
[RAI டாஷ்போர்டை ஆராயுங்கள்](assignment.md)
[RAI டாஷ்போர்டு ஆராய்ச்சி](assignment.md)
---
**குறிப்பு**:
இந்த ஆவணம் [Co-op Translator](https://github.com/Azure/co-op-translator) என்ற AI மொழிபெயர்ப்பு சேவையைப் பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கின்றோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறான தகவல்கள் இருக்கக்கூடும் என்பதை கவனத்தில் கொள்ளவும். அதன் தாய்மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கங்களுக்கு நாங்கள் பொறுப்பல்ல.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**மறுப்பு**:
இந்த ஆவணம் AI மொழிபெயர்ப்பு சேவை [Co-op Translator](https://github.com/Azure/co-op-translator) பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சி செய்துள்ளோம், ஆனால் தானாக செய்யப்படும் மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கலாம் என்பதை கவனத்தில் கொள்ளவும். அசல் ஆவணம் அதன் தாய்மொழியில் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்நுட்பமான மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்கள் அல்லது தவறான விளக்கத்திற்கும் நாங்கள் பொறுப்பில்வில்லை.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save