|
|
4 months ago | |
|---|---|---|
| .. | ||
| README.md | 4 months ago | |
| assignment.md | 7 months ago | |
README.md
Mbinu za Kujifunza kwa Mashine
Mchakato wa kujenga, kutumia, na kutunza mifano ya kujifunza kwa mashine na data wanayotumia ni mchakato tofauti kabisa na workflows nyingi nyingine za maendeleo. Katika somo hili, tutaondoa mashaka kuhusu mchakato huu, na kutoa muhtasari wa mbinu kuu unazohitaji kujua. Utajifunza:
- Kuelewa michakato inayounga mkono kujifunza kwa mashine kwa kiwango cha juu.
- Kuchunguza dhana za msingi kama 'mifano', 'utabiri', na 'data ya mafunzo'.
Jaribio la kabla ya somo
🎥 Bonyeza picha hapo juu kwa video fupi inayoelezea somo hili.
Utangulizi
Kwa kiwango cha juu, ufundi wa kuunda michakato ya kujifunza kwa mashine (ML) unajumuisha hatua kadhaa:
- Amua swali. Michakato mingi ya ML huanza kwa kuuliza swali ambalo haliwezi kujibiwa na programu rahisi yenye masharti au mzunguko wa sheria. Maswali haya mara nyingi yanahusiana na utabiri unaotegemea mkusanyiko wa data.
- Kusanya na andaa data. Ili kujibu swali lako, unahitaji data. Ubora na, wakati mwingine, wingi wa data yako utaamua jinsi unavyoweza kujibu swali lako la awali. Kuonyesha data kwa njia ya picha ni sehemu muhimu ya hatua hii. Hatua hii pia inajumuisha kugawanya data kuwa kundi la mafunzo na la majaribio ili kujenga mfano.
- Chagua njia ya mafunzo. Kulingana na swali lako na asili ya data yako, unahitaji kuchagua jinsi unavyotaka kufundisha mfano ili kuonyesha data yako kwa usahihi na kutoa utabiri sahihi dhidi yake. Hii ni sehemu ya mchakato wako wa ML inayohitaji utaalamu maalum na mara nyingi majaribio mengi.
- Fanya mafunzo ya mfano. Ukitumia data yako ya mafunzo, utatumia algoritimu mbalimbali kufundisha mfano kutambua mifumo ndani ya data. Mfano unaweza kutumia uzito wa ndani unaoweza kubadilishwa ili kutoa kipaumbele kwa sehemu fulani za data juu ya nyingine ili kujenga mfano bora.
- Tathmini mfano. Unatumia data ambayo haujawahi kuona hapo awali (data yako ya majaribio) kutoka kwa mkusanyiko wako kuona jinsi mfano unavyofanya kazi.
- Sahihisha vigezo. Kulingana na utendaji wa mfano wako, unaweza kurudia mchakato kwa kutumia vigezo tofauti, au tofauti, vinavyoendesha tabia ya algoritimu zinazotumika kufundisha mfano.
- Kifanya utabiri. Tumia data mpya kujaribu usahihi wa mfano wako.
Swali gani la kuuliza
Kompyuta zina ujuzi maalum wa kugundua mifumo iliyofichwa ndani ya data. Huduma hii ni muhimu sana kwa watafiti wenye maswali kuhusu eneo fulani ambayo hayawezi kujibiwa kwa urahisi kwa kuunda mzunguko wa sheria kwa masharti. Kwa mfano, kazi ya kihesabu, mtaalamu wa data anaweza kuunda sheria zilizotengenezwa kwa mikono kuhusu vifo vya wavutaji sigara dhidi ya wasiovuta sigara.
Hata hivyo, wakati vigezo vingine vingi vinapowekezwa, mfano wa ML unaweza kuwa bora zaidi kutabiri viwango vya vifo vya baadaye kulingana na historia ya afya ya zamani. Mfano wa furaha zaidi unaweza kuwa kutabiri hali ya hewa kwa mwezi wa Aprili katika eneo fulani kulingana na data inayojumuisha latitude, longitude, mabadiliko ya tabianchi, umbali na bahari, mifumo ya mteremko wa upepo wa jet, na zaidi.
✅ Huu jedwali la slaidi kuhusu mifano ya hali ya hewa unatoa mtazamo wa kihistoria wa kutumia ML katika uchambuzi wa hali ya hewa.
Kazi za kabla ya kujenga
Kabla ya kuanza kujenga mfano wako, kuna kazi kadhaa unazohitaji kukamilisha. Ili kujaribu swali lako na kuunda nadharia inayotokana na utabiri wa mfano, unahitaji kutambua na kusanidi vipengele kadhaa.
Data
Ili kujibu swali lako kwa uhakika wowote, unahitaji kiasi kizuri cha data ya aina sahihi. Kuna mambo mawili unayohitaji kufanya hapo:
- Kusanya data. Ukizingatia somo la awali kuhusu usawa katika uchambuzi wa data, kusanya data yako kwa makini. Fahamu vyanzo vya data hii, upendeleo wowote unaoweza kuwa nao, na andika chanzo chake.
- Andaa data. Kuna hatua kadhaa katika mchakato wa maandalizi ya data. Huenda ukahitaji kukusanya data na kuifanya iwe sawa ikiwa inatoka vyanzo tofauti. Unaweza kuboresha ubora na wingi wa data kwa njia mbalimbali kama kubadilisha mistari kuwa nambari (kama tunavyofanya katika Kupanga Kundi). Pia unaweza kuzalisha data mpya, kulingana na asili (kama tunavyofanya katika Uainishaji). Unaweza kusafisha na kuhariri data (kama tutakavyofanya kabla ya somo la Tovuti App). Hatimaye, unaweza kuhitaji kuipanga nasibu na kuchanganya, kulingana na mbinu zako za mafunzo.
✅ Baada ya kukusanya na kuchakata data yako, chukua muda kuona kama muundo wake utakuruhusu kutatua swali ulilokusudia. Huenda data isitende vyema katika kazi uliyopewa, kama tunavyogundua katika masomo yetu ya Kupanga Kundi!
Sifa na Lengo
Sifa ni kipengele kinachopimika cha data yako. Katika seti nyingi za data huonyeshwa kama kichwa cha safu kama 'tarehe', 'ukubwa' au 'rangi'. Kigezo cha sifa yako, kawaida huwakilishwa kama X katika nambari, kinawakilisha kigezo cha kuingiza kitakachotumika kufundisha mfano.
Lengo ni kitu unachojaribu kutabiri. Lengo, kawaida huwakilishwa kama y katika nambari, linaonyesha jibu la swali unalojaribu kuuliza kwa data yako: mwezi wa Desemba, ni rangi gani za malenge zitakuwa nafuu zaidi? San Francisco, ni maeneo gani yatakuwa na bei bora zaidi ya mali isiyohamishika? Wakati mwingine lengo pia hurejelewa kama sifa ya lebo.
Kuchagua kigezo chako cha sifa
🎓 Uchaguzi wa Sifa na Utoaji Sifa Je, unajua jinsi ya kuchagua kigezo wapi wakati wa kujenga mfano? Huenda upite katika mchakato wa uchaguzi wa sifa au utoaji sifa kuchagua vigezo sahihi kwa mfano bora zaidi. Hata hivyo, si vitu sawa: "Utoaji sifa huunda sifa mpya kutoka kwa kazi za sifa za awali, wakati uchaguzi wa sifa hurudisha sehemu ndogo ya sifa." (chanzo)
Onyesha data yako kwa picha
Sehemu muhimu ya zana za mtaalamu wa data ni uwezo wa kuonyesha data kwa picha kwa kutumia maktaba bora kama Seaborn au MatPlotLib. Kuonyesha data kwa picha kunaweza kukufanya ugundue uhusiano wa siri unaoweza kutumia. Mchoro wako pia unaweza kusaidia kugundua upendeleo au data isiyo sawa (kama tunavyogundua katika Uainishaji).
Gawanya seti yako ya data
Kabla ya mafunzo, unahitaji kugawanya seti yako ya data katika sehemu mbili au zaidi za saizi isiyo sawa lakini bado zinazoonesha data vizuri.
- Mafunzo. Sehemu hii ya seti ya data imeundwa kwa mfano wako kufundisha. Seti hii inajumuisha sehemu kubwa ya seti ya awali.
- Majaribio. Seti ya majaribio ni kundi huru la data, mara nyingi hutolewa kutoka kwa data ya awali, unayotumia kuthibitisha utendaji wa mfano ulioujengwa.
- Uthibitishaji. Seti ya uthibitishaji ni kundi dogo la huru la mifano unayotumia kusahihisha hyperparameters, au usanifu, wa mfano ili kuboresha mfano. Kulingana na ukubwa wa data yako na swali unalouliza, huenda usihitaji kujenga seti hii ya tatu (kama tunavyoona katika Utabiri wa Mfululizo wa Muda).
Kujenga mfano
Ukishaji data yako ya mafunzo, lengo lako ni kujenga mfano, au uwakilishi wa takwimu wa data yako, kwa kutumia algoritimu mbalimbali kufundisha. Kufundisha mfano kumfanya afahamu data na kutoa makadirio kuhusu mifumo anaogundua, kuthibitisha, na kukubali au kukataa.
Amua njia ya mafunzo
Kulingana na swali lako na asili ya data yako, utaamua njia ya kuifundisha. Kupitia nyaraka za Scikit-learn - tunayochukua katika kozi hii - unaweza kuchunguza njia nyingi za kufundisha mfano. Kulingana na uzoefu wako, huenda utajaribu njia tofauti tofauti kujenga mfano bora zaidi. Huenda upite kwa mchakato ambapo wataalamu wa data hutathmini utendaji wa mfano kwa kuipatia data isiyoonekana, kuangalia usahihi, upendeleo, na masuala mengine yanayopunguza ubora, na kuchagua njia bora ya kufundisha kwa kazi iliyopo.
Fundisha mfano
Ukiwa na data yako ya mafunzo, uko tayari 'kuifit' ili kuunda mfano. Utaona katika maktaba nyingi za ML nambari 'model.fit' - ni wakati huu unapowasilisha parameter yako ya sifa kama safu ya maadili (kawaida 'X') na parameter ya lengo (kawaida 'y').
Tathmini mfano
Mara mchakato wa mafunzo umekamilika (huenda ukachukua mizunguko mingi, au 'epochs', kufundisha mfano mkubwa), utaweza kutathmini ubora wa mfano kwa kutumia data ya majaribio kupima utendaji wake. Data hii ni sehemu ndogo ya data ya awali ambayo mfano haujawahi kuchambua. Unaweza kuchapisha jedwali la viashiria kuhusu ubora wa mfano wako.
🎓 Kufit wa mfano
Katika muktadha wa kujifunza kwa mashine, kufit wa mfano kunahusu usahihi wa kazi msingi wa mfano unapojaribu kuchambua data isiyojulikana kwao.
🎓 Underfitting na overfitting ni matatizo ya kawaida yanayopunguza ubora wa mfano, wakati mfano unafit kwa kiasi kisichotosheleza au kwa kiasi kikubwa mno. Hii husababisha mfano kutoa utabiri ulio karibu sana au mbali mno na data ya mafunzo. Mfano uliopitiliza (overfit) hutabiri data ya mafunzo vizuri mno kwa sababu umejifunza kwa undani maelezo na kelele ya data. Mfano usiofaa (underfit) haupo sahihi kwa vile hauwezi kuchambua data ya mafunzo au data isiyojulikana kwa usahihi.
Infographic na Jen Looper
Sahihisha vigezo
Mara mafunzo ya awali yanapokamilika, tazama ubora wa mfano na fikiria kuuboresha kwa kubadilisha 'hyperparameters' zake. Soma zaidi kuhusu mchakato katika nyaraka.
Utabiri
Huu ni wakati ambapo unaweza kutumia data mpya kabisa kujaribu usahihi wa mfano wako. Katika mazingira ya ML 'waliyozishika', ambapo unajenga mali za wavuti kutumika mfano kwenye uzalishaji, mchakato huu unaweza kuhusisha ukusanyaji wa maingizo ya mtumiaji (bonyeza kitufe, kwa mfano) kuweka kigezo na kukituma kwa mfano kwa madhumuni ya utambuzi au tathmini.
Katika masomo haya, utagundua jinsi ya kutumia hatua hizi kuandaa, kujenga, kujaribu, kutathmini, na kutabiri - vitendo vyote vya mtaalamu wa data na zaidi, unapoendelea na safari yako ya kuwa mhandisi wa ML wa 'full stack'.
🚀Changamoto
Chora mchoro wa mtiririko unaoonyesha hatua za mtaalamu wa ML. Unaona wapi mwenyewe kwa sasa katika mchakato? Unatarajia kupata shida wapi? Nini kinaonekana rahisi kwako?
Jaribio la baada ya somo
Mapitio & Kujifunza Peke Yako
Tafuta mtandaoni mahojiano na wataalamu wa data wanaozungumzia kazi zao za kila siku. Hapa kuna moja.
Kazi ya Nyumbani
Tangazo la Hukumu:
Hati hii imetafsiriwa kwa kutumia huduma ya tafsiri ya AI Co-op Translator. Wakati tunajitahidi kwa usahihi, tafadhali fahamu kuwa tafsiri za moja kwa moja zinaweza kuwa na makosa au upungufu wa usahihi. Hati ya asili katika lugha yake halisi inapaswa kuzingatiwa kama chanzo cha mamlaka. Kwa taarifa muhimu, tafsiri ya mtaalamu wa binadamu inapendekezwa. Hatuwezi kuwajibika kwa kutoelewana au tafsiri zisizo sahihi zinazotokana na matumizi ya tafsiri hii.

