25 KiB
మెషీన్ లెర్నింగ్ సాంకేతికతలు
మెషీన్ లెర్నింగ్ మోడల్స్ మరియు అవి ఉపయోగించే డేటాను నిర్మించడం, ఉపయోగించడం మరియు నిర్వహించడం అనేది అనేక ఇతర అభివృద్ధి పనితీరుల నుండి పూర్తిగా భిన్నమైన ప్రక్రియ. ఈ పాఠంలో, మేము ఈ ప్రక్రియను సులభతరం చేస్తాము మరియు మీరు తెలుసుకోవలసిన ప్రధాన సాంకేతికతలను వివరించబోతున్నాము. మీరు:
- మెషీన్ లెర్నింగ్ ఆధారమైన ప్రక్రియలను ఉన్నతస్థాయిలో అర్థం చేసుకుంటారు.
- 'మోడల్స్', 'ప్రిడిక్షన్స్', మరియు 'ట్రైనింగ్ డేటా' వంటి ప్రాథమిక భావనలు తోచుకుంటారు.
ప్రీ-లెక్చర్ క్విజ్
🎥 ఈ పాఠాన్ని వివరించే చిన్న వీడియో కోసం పై చిత్రం క్లిక్ చేయండి.
పరిచయం
మెషీన్ లెర్నింగ్ (ML) ప్రక్రియలను సృష్టించడం అంటే అనేక దశల కలయికగా ఉంటుంది:
- ప్రశ్నను నిర్ణయించండి. ఎక్కువ ML ప్రక్రియలు సరళ కండిషనల్ ప్రోగ్రామ్ లేదా నియమాల ఆధారిత ఇంజిన్ ద్వారా సమాధానం చెప్పలేని ప్రశ్నతో ప్రారంభమవుతాయి. ఈ ప్రశ్నలు సాధారణంగా డేటా సేకరణ ఆధారంగా భవిష్యత్ అంచనాల చుట్టూ ఉంటాయి.
- డేటా సేకరించి సిద్ధం చేసుకోండి. మీ ప్రశ్నకు సమాధానం చెప్పడానికి మీరు డేటా అవసరం. డేటా గുണాత్మకత మరియు కొన్నిసార్లు పరిమాణం మీ ఆరంభ ప్రశ్నకు మీరు ఎంత బాగా సమాధానం చెప్పగలరో నిర్ణయిస్తుంది. ఈ దశలో డేటా విజువలైజేషన్ చాలా ముఖ్యం. ఈ దశలో డేటాను ట్రెయినింగ్ మరియు టెస్టింగ్ గ్రూపులుగా విభజించడం కూడా ఉంటుంది.
- ట్రైనింగ్ పద్ధతి ఎంచుకోండి. మీ ప్రశ్న మరియు డేటా స్వభావాన్ని బట్టి, మోడల్ ను ఉత్తమంగా ప్రతిబింబించడానికి మరియు ఖచ్చితంగా అంచనా వేయడానికి మీరు ఎలా ట్రెయిన్ చేయాలనుకుంటున్నారో ఎంచుకోవాలి. ఇది మీ ML ప్రక్రియలో ప్రత్యేక నైపుణ్యం మరియు చాలాసార్లు చాలా ప్రయోగాలు అవసరమయ్యే భాగం.
- మోడల్ ట్రెయిన్ చేయండి. మీరు ట్రెయినింగ్ డేటా ఉపయోగించి వివిధ అల్గోరిథమ్ల ద్వారా ప్యాటర్న్లను గుర్తించేందుకు మోడల్ ను ట్రెయిన్ చేస్తారు. మోడల్ అనేకమైన అంతర్గత బరువులను ఉపయోగించి డేటాలో కొన్ని భాగాలపై ఎక్కువ ప్రాధాన్యత ఇవ్వడానికి సర్దుబాటు చేయవచ్చు.
- మోడల్ ను అంచనా వేయండి. మీ సేకరించిన డేటా నుండి ఇప్పటివరకూ చూసిన విషయం కాని డేటా (టెస్టింగ్ డేటా) ఉపయోగించి మోడల్ ప్రదర్శనను పరిశీలిస్తారు.
- పారామీటర్ సర్దుబాటు. మోడల్ ప్రదర్శన ఆధారంగా, మీరు ట్రెయినింగ్ అల్గోరిథమ్ నడిపే వివిధ పారామీటర్లను మారుస్తూ ప్రక్రియను పునరావృతం చేయవచ్చు.
- అంచనా వేయండి. కొత్త ఇన్పుట్లను ఉపయోగించి మోడల్ ఖచ్చితత్వాన్ని పరీక్షించండి.
ఎలాంటి ప్రశ్న అడగాలి
కంప్యూటర్లు డేటాలో దాగిన నమూనాలు కనుగొనడంలో ప్రత్యేక నైపుణ్యం కలిగి ఉంటాయి. ఈ ఉపయోగకరత అనేక రంగాలలో సులభంగా పరిష్కరించలేని ప్రశ్నలను ఎవరిదైనా అడగడానికి సహాయం చేస్తుంది. ఉదాహరణకు, ఒక్క వ్యక్తి ఆరోగ్య చరిత్ర ఆధారంగా భవిష్యత్ మరణాల రేట్లను అంచనా వేసేందుకు ML మోడల్ ఉపయోగపడవచ్చు.
రెండవ ఉదాహరణకి, ఎпрిల్ నెలలో ఇచ్చిన ప్రాంతంలో వాతావరణ అంచనాలు latitude, longitude, వాతావరణ మార్పులు, సముద్రం సమీపత, జెట్ స్ట్రీమ్ నమూనాలు వంటి డేటాను ఉపయోగించి చేయవచ్చు.
✅ ఈ స్లైడ్ డెక్ వాతావరణ నమూనాలపై ইতিহাসాత్మక దృష్టికోణాన్ని ML ఉపయోగంతో అందిస్తుంది.
నిర్మాణానికి ముందున్న పనులు
మీ మోడల్ నిర్మాణం మొదలుపెట్టేముందు కొన్ని పనులు పూర్తి చేయాలి. ఒక మోడల్ భవిష్యత్ అంచనాలపై మీరు మీ ప్రశ్నను పరీక్షించడానికి మరియు హైపోతసిస్ చేయడానికి, మీరు కొన్ని అంశాలను గుర్తించి సెట్ చేసుకోవాలి.
డేటా
మీ ప్రశ్నకు నిశ్చయంగా సమాధానం చెప్పడానికి సరైన రకమైన పెద్ద డేటా అవసరం. ఈ సమయంలో మీరు చేయవలసింది:
- డేటా సేకరించండి. గత పాఠంలో డేటా న్యాయవంతత్వంపై నేర్చుకున్నట్లు, జాగ్రత్తగా డేటాను సేకరించండి. డేటా మూలాలపై జాగ్రత్త వహించండి, దానికి సంబంధించిన అహంకారాలు (biases) తెలుసుకోండి మరియు మూలాన్ని డాక్యుమెంట్ చేయండి.
- డేటా సిద్ధం చేయండి. డేటా సిద్ధం చేసే ప్రక్రియలో అనేక దశలు ఉంటాయి. మీ డేటా వేర్వేరు మూలాల నుండి వస్తే, ఒకే రూపంలో మార్చడం అవసరం. మీ డేటా నాణ్యత మరియు పరిమాణాన్ని మెరుగుపరచడానికి స్ట్రింగ్స్ని నంబర్లుగా మార్చడం వంటి మార్గాలు స్వీకరించవచ్చు (మనము క్లస్టరింగ్ లో చేయడం). మీరు కొత్త డేటా కూడా సృష్టించవచ్చు (మనము వర్గీకరణ లో చేయడం). మీరు డేటాను శుభ్రపరచడం మరియు సవరించవచ్చు (వెబ్ యాప్ పాఠం ముందు). చివరిగా, ట్రెయినింగ్ సాంకేతికతల ఆధారంగా డేటాను రాండమ్ చేసుకోవచ్చు మరియు షఫుల్ చేయవచ్చు.
✅ డేటాను సేకరించి ప్రాసెస్ చేసిన తర్వాత, దాని ఆకారం మీ ప్రశ్నను సమర్థవంతంగా పరిష్కరించగలదా అని చూడండి. మనం క్లస్టరింగ్ పాఠాలలో చూచినట్లు, కొన్నిసార్లు డేటా పనితీరు తక్కువగా ఉండవచ్చు!
ఫీచర్స్ మరియు లక్ష్యం
ఫీచర్ అనేది మీ డేటా యొక్క కొలవగల గుణం. చాలా డేటాసెట్లలో ఇది కాలమ్ పేర్లుగా ఉంటుంది, ఉదా: 'తేదీ', 'పరిమాణం', లేదా 'రంగు'. మీ ఫీచర్ వేరియబుల్ సాధారణంగా కోడ్ లో X ద్వారా సూచించబడుతుంది, ఇది మోడల్ ట్రెయిన్ చేయడానికి ఉపయోగించే ఇన్పుట్ వేరియబుల్.
లక్ష్యం అంటే మీరు అంచనా వేయాలనుకుంటున్న విషయం. లక్ష్యం సాధారణంగా కోడ్ లో y ద్వారా సూచించబడుతుంది, ఇది మీరు అడగాలనుకుంటున్న ప్రశ్నకు సమాధానం: డిసెంబర్ నెలలో, ఏ రంగు తో కాకులు చౌకగా ఉంటాయి? శాన్ ఫ్రాన్సిస్కో లో ఏ ప్రాంతాల్లో ఉత్తమ ఆస్తి ధర ఉంటుంది? లక్ష్యాన్ని లేబుల్ అట్రిబ్యూట్ అని కూడా పిలుస్తారు.
ఫీచర్ వేరియబుల్ ఎంచుకోవడం
🎓 ఫీచర్ ఎంపిక మరియు ఫీచర్ ఎక్స్ట్రాక్షన్ మోడల్ క్రియేటింగ్ సమయంలో ఎటువంటి వేరియబుల్ ఎంచుకోవాలో ఎలా తెలుసుకోవాలి? మీరు పనితీరు మెరుగైన ఫీచర్లను ఎంచుకునేందుకు ఫీచర్ ఎంపిక లేదా ఫీచర్ ఎక్స్ట్రాక్షన్ ప్రక్రియలను అనుసరిస్తారు. అవి ఒకే విషయం కావు: "ఫీచర్ ఎక్స్ట్రాక్షన్ అనేది అసలు ఫీచర్ల నుండి కొత్త ఫీచర్లను సృష్టించడం, ఫీచర్ ఎంపిక అనేది ఫీచర్లలో ఒక ఉపసమితి ఎంపిక చేయడం." (మూలం)
డేటాను విజువలైజ్ చేయండి
డేటా సెయింటిస్ట్ సాధనాలలో మేజరు పార్ట్ డేటాను వ్యూయలైజ్ చేయగల సామర్థ్యం. సీబోర్న్ లేదా మ్యాట్ప్లాట్లిబ్ వంటి గొప్ప లైబ్రరీలను ఉపయోగించి మీరు డేటాను విజువలైజ్ చేయవచ్చు. ఇలా చేస్తే దాగున్న సంబంధాలను కనుగొనడం సులభం అవుతుంది. మీ విజువలైజేషన్స్ బయస్ లేదా అసమతులిత డేటాను కూడా బయట పారవేయడానికి సహాయపడతాయి (వర్గీకరణ లో చూశాం).
డేటాసెట్ విభజించండి
ట్రెయినింగ్కు ముందు, మీరు డేటాను రెండు లేదా దానికంటే ఎక్కువ భాగాలుగా విభజించాలి, వాటి పరిమాణాలు సమానంగా లేకపోయినా, డేటాను బాగానే ప్రాతినిధ్యం వహించాలి.
- ట్రెయినింగ్. ఈ డేటా మోడల్ ట్రెయినింగ్ కోసం ఉపయోగిస్తారు. ఇది అసలు డేటాసెట్ యొక్క ముఖ్య భాగం.
- టెస్టింగ్. టెస్టింగ్ డేటా ఒక స్వతంత్ర గ్రూప్ డేటా, సాధారణంగా అసలు డేటా నుంచి తీసుకున్నది, దీన్ని మోడల్ పనితీరు నిర్ధారించడానికి ఉపయోగిస్తారు.
- వెలిడేషన్. వెలిడేషన్ సెట్ చిన్న స్వతంత్ర ఉదాహరణల సమూహం, దీన్ని మోడల్ హైపరparameters లేదా నిర్మాణం సవరించడానికి ఉపయోగిస్తారు. మీ డేటా పరిమాణం మరియు ప్రశ్న ఆధారంగా, మీరు ఈ మూడవ సెట్ అవసరం లేకపోవచ్చు (టైమ్ సిరీస్ ఫోర్కాస్టింగ్ లో).
మోడల్ నిర్మించడం
ట్రెయినింగ్ డేటా ఉపయోగించి, మీరు వివిధ అల్గోరిథమ్లను ఉపయోగించి మోడల్ లేదా మీ డేటా యొక్క గణాంకాత్మక ప్రాతినిధ్యం నిర్మించడానికి ట్రెయిన్ చేస్తారు. మోడల్ను ట్రెయిన్ చేస్తే, అది డేటాలో తీసుకువచ్చిన నమూనాలను గుర్తించి అంచనా వేయగలుగుతుంది, తన అనుమానాలను కూడా ధృవీకరించడంతో పాటు అంగీకరించవచ్చు లేదా తిరస్కరించవచ్చు.
ట్రెయినింగ్ పద్ధతిని నిర్ణయించండి
మీ ప్రశ్న మరియు డేటా స్వభావం బట్టి, మీరు ఒక పద్ధతిని ఎంచుకుంటారు. ఈ కోర్సులో ఉపయోగించే Scikit-learn డాక్యుమెంటేషన్లో మీరు వివిధ మోడల్ ట్రెయినింగ్ పద్ధతులు తెలుసుకోవచ్చు. మీ అనుభవం ప్రకారం, అద్భుతమైన మోడల్ సంపాదించడానికి మీరు అనేక పద్ధతులను ప్రయత్నించాల్సి ఉండవచ్చు. డేటా శాస్త్రవేత్తలు ఒకసారి కోల్పోయిన డేటా ఫీడ్ చేసి లోపాలు, పక్షపాతం మరియు ఇతర నాణ్యత సమస్యలను పరిశీలించి, ఆ పని కోసం సరైన ట్రెయినింగ్ పద్ధతిని ఎంచుకుంటారు.
మోడల్ ట్రెయిన్ చేయండి
మీ ట్రెయినింగ్ డేటాతో, మీరు 'model.fit' అనే కోడ్లో ఇన్పుట్ ఫీచర్ వేరియబుల్ (సాధారణంగా 'X') మరియు లక్ష్య వేరియబుల్ ('y') పంపించి మోడల్ ట్రెయిన్ చేస్తారు.
మోడల్ను అంచనా వేయండి
ట్రెయినింగ్ ప్రక్రియ పూర్తయ్యాక (బహుశా ఎన్నో iterations లేదా 'epochs' పట్టవచ్చు), మీరు టెస్ట్ డేటా ఉపయోగించి మోడల్ నాణ్యతను అంచనా వేయవచ్చు. ఈ డేటా మొదటి డేటా సెట్ నుండి తీసుకున్నది కాని, మోడల్ ముందుగానే ఉపయోగించలేదు. మీరు మీ మోడల్ నాణ్యతపై గణాంక పట్టికను ప్రింట్ చేయవచ్చు.
🎓 మోడల్ ఫిట్టింగ్
మెషీన్ లెర్నింగ్ సందర్భంలో, మోడల్ ఫిట్టింగ్ అంటే మోడల్ యొక్క ఆధారభూత ఫంక్షన్ కొత్త డేటాను విశ్లేషించేటప్పుడు ఖచ్చితత్వం.
🎓 అండర్ఫిట్టింగ్ మరియు ఓవర్ఫిట్టింగ్ అనేవి సాధారణ సమస్యలు, ఇవి మోడల్ నాణ్యతను తగ్గిస్తాయి. మోడల్ బాగా సరిపోకపోవడం లేదా ఎక్కువ సరిపోయి ట్రెయినింగ్ డేటాతో కూడిన శబ్దం కూడా నేర్చుకోవడం వల్ల పరిస్థితి కలుగుతుంది. ఓవర్ఫిట్ మోడల్ ట్రెయినింగ్ డేటాను చాలా బాగా అంచనా వేస్తుంది కానీ అదే విధంగా సాధారణీకరించలేకపోవచ్చు. అండర్ఫిట్ మోడల్ ట్రెయినింగ్ డేటాను కూడా ఖచ్చితంగా విశ్లేషించలేకపోతుంది.
ఇన్ఫోగ్రాఫిక్: జెన్ లూపర్
పారామీటర్ సర్దుబాటు
మీ ప్రారంభ ట్రెయినింగ్ పూర్తయ్యాక మోడల్ నాణ్యతను పరిశీలించి, 'హైపర్పారామీటర్'లను సర్దుబాటు చేసి మెరుగుపరచుకోండి. ఈ ప్రక్రియ గురించి మరింత డాక్యుమెంటేషన్లో చదవండి.
అంచనా
ఇది మీరు పూర్తిగా కొత్త డేటాను మీ మోడల్ ఖచ్చితత్వం పరీక్షించడానికి ఉపయోగించే దశ. 'అప్లైడ్' ML సెట్టింగ్లో, మీరు ప్రొడక్షన్లో మోడల్ ఉపయోగించడానికి వెబ్ ఆస్తులను తయారుచేస్తున్నప్పుడు, యూజర్ ఇన్పుట్ (ఉదా: బటన్ నొక్కడం) సేకరించి, దాన్ని మోడల్కు పంపించి అంచనా చేయించవచ్చు.
ఈ పాఠాల్లో, మీరు ఈ దశల ద్వారా డేటాను సిద్ధం చేయడం, నిర్మించడం, పరీక్షించడం, అంచనా వేయడం, మరియు అంచనా వేయడం నేర్చుకుంటారు — డేటా శాస్త్రవేత్తల అలవాట్లు మరియు మరింత, ఒక 'ఫుల్ స్టాక్' ML ఇంజనీర్ అవడంలో మీ ప్రయాణంలో.
🚀సవాలు
ML ప్రాక్టీషనర్ దశలను ప్రతిబింబించే ఫ్లో చార్ట్ రూపొందించండి. మీరు ప్రస్తుతం ఏ దశలో ఉన్నారు? మీరు ఎక్కడ కష్టాన్ని ఎదుర్కొంటారని భావిస్తున్నారు? మీకు ఏది సులభంగా అనిపిస్తుంది?
పోస్ట్-లెక్చర్ క్విజ్
సమీక్ష & స్వయంఅధ్యయనం
డేటా శాస్త్రవేత్తల ఇంటర్వ్యూలను ఆన్లైన్లో వెతకండి, వారు వారి రోజువారీ పని గురించి మాట్లాడతారు. ఇక్కడ ఒకటి ఉంది.
అసైన్మెంట్
డిస్క్లెయిమర్:
ఈ డాక్యుమెంట్ AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి శ్రమిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో తప్పులు లేదా అసత్యతలు ఉండే అవకాశముంది. అసలు డాక్యుమెంట్ native భాషలో ఉన్నదే అధికారపూర్వక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదాన్ని సూచించబడుతుంది. ఈ అనువాదం వలన కలిగే ఏదైనా అపవాదాలు లేదా తప్పుదారులు విషయానికి మేము బాధ్యులు కాదు.

