You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
ML-For-Beginners/translations/te/1-Introduction/4-techniques-of-ML
localizeflow[bot] d177b6f2d8
chore(i18n): sync translations with latest source changes (chunk 1/1, 12 changes)
4 months ago
..
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 12 changes) 4 months ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 300 changes) 7 months ago

README.md

మెషీన్ లెర్నింగ్ సాంకేతికతలు

మెషీన్ లెర్నింగ్ మోడల్స్ మరియు అవి ఉపయోగించే డేటాను నిర్మించడం, ఉపయోగించడం మరియు నిర్వహించడం అనేది అనేక ఇతర అభివృద్ధి పనితీరుల నుండి పూర్తిగా భిన్నమైన ప్రక్రియ. ఈ పాఠంలో, మేము ఈ ప్రక్రియను సులభతరం చేస్తాము మరియు మీరు తెలుసుకోవలసిన ప్రధాన సాంకేతికతలను వివరించబోతున్నాము. మీరు:

  • మెషీన్ లెర్నింగ్ ఆధారమైన ప్రక్రియలను ఉన్నతస్థాయిలో అర్థం చేసుకుంటారు.
  • 'మోడల్స్', 'ప్రిడిక్షన్స్', మరియు 'ట్రైనింగ్ డేటా' వంటి ప్రాథమిక భావనలు తోచుకుంటారు.

ప్రీ-లెక్చర్ క్విజ్

ML for beginners - Techniques of Machine Learning

🎥 ఈ పాఠాన్ని వివరించే చిన్న వీడియో కోసం పై చిత్రం క్లిక్ చేయండి.

పరిచయం

మెషీన్ లెర్నింగ్ (ML) ప్రక్రియలను సృష్టించడం అంటే అనేక దశల కలయికగా ఉంటుంది:

  1. ప్రశ్నను నిర్ణయించండి. ఎక్కువ ML ప్రక్రియలు సరళ కండిషనల్ ప్రోగ్రామ్ లేదా నియమాల ఆధారిత ఇంజిన్ ద్వారా సమాధానం చెప్పలేని ప్రశ్నతో ప్రారంభమవుతాయి. ఈ ప్రశ్నలు సాధారణంగా డేటా సేకరణ ఆధారంగా భవిష్యత్ అంచనాల చుట్టూ ఉంటాయి.
  2. డేటా సేకరించి సిద్ధం చేసుకోండి. మీ ప్రశ్నకు సమాధానం చెప్పడానికి మీరు డేటా అవసరం. డేటా గുണాత్మకత మరియు కొన్నిసార్లు పరిమాణం మీ ఆరంభ ప్రశ్నకు మీరు ఎంత బాగా సమాధానం చెప్పగలరో నిర్ణయిస్తుంది. ఈ దశలో డేటా విజువలైజేషన్ చాలా ముఖ్యం. ఈ దశలో డేటాను ట్రెయినింగ్ మరియు టెస్టింగ్ గ్రూపులుగా విభజించడం కూడా ఉంటుంది.
  3. ట్రైనింగ్ పద్ధతి ఎంచుకోండి. మీ ప్రశ్న మరియు డేటా స్వభావాన్ని బట్టి, మోడల్ ను ఉత్తమంగా ప్రతిబింబించడానికి మరియు ఖచ్చితంగా అంచనా వేయడానికి మీరు ఎలా ట్రెయిన్ చేయాలనుకుంటున్నారో ఎంచుకోవాలి. ఇది మీ ML ప్రక్రియలో ప్రత్యేక నైపుణ్యం మరియు చాలాసార్లు చాలా ప్రయోగాలు అవసరమయ్యే భాగం.
  4. మోడల్ ట్రెయిన్ చేయండి. మీరు ట్రెయినింగ్ డేటా ఉపయోగించి వివిధ అల్గోరిథమ్ల ద్వారా ప్యాటర్న్లను గుర్తించేందుకు మోడల్ ను ట్రెయిన్ చేస్తారు. మోడల్ అనేకమైన అంతర్గత బరువులను ఉపయోగించి డేటాలో కొన్ని భాగాలపై ఎక్కువ ప్రాధాన్యత ఇవ్వడానికి సర్దుబాటు చేయవచ్చు.
  5. మోడల్ ను అంచనా వేయండి. మీ సేకరించిన డేటా నుండి ఇప్పటివరకూ చూసిన విషయం కాని డేటా (టెస్టింగ్ డేటా) ఉపయోగించి మోడల్ ప్రదర్శనను పరిశీలిస్తారు.
  6. పారామీటర్ సర్దుబాటు. మోడల్ ప్రదర్శన ఆధారంగా, మీరు ట్రెయినింగ్ అల్గోరిథమ్ నడిపే వివిధ పారామీటర్లను మారుస్తూ ప్రక్రియను పునరావృతం చేయవచ్చు.
  7. అంచనా వేయండి. కొత్త ఇన్‌పుట్లను ఉపయోగించి మోడల్ ఖచ్చితత్వాన్ని పరీక్షించండి.

ఎలాంటి ప్రశ్న అడగాలి

కంప్యూటర్లు డేటాలో దాగిన నమూనాలు కనుగొనడంలో ప్రత్యేక నైపుణ్యం కలిగి ఉంటాయి. ఈ ఉపయోగకరత అనేక రంగాలలో సులభంగా పరిష్కరించలేని ప్రశ్నలను ఎవరిదైనా అడగడానికి సహాయం చేస్తుంది. ఉదాహరణకు, ఒక్క వ్యక్తి ఆరోగ్య చరిత్ర ఆధారంగా భవిష్యత్ మరణాల రేట్లను అంచనా వేసేందుకు ML మోడల్ ఉపయోగపడవచ్చు.

రెండవ ఉదాహరణకి, ఎпрిల్ నెలలో ఇచ్చిన ప్రాంతంలో వాతావరణ అంచనాలు latitude, longitude, వాతావరణ మార్పులు, సముద్రం సమీపత, జెట్ స్ట్రీమ్ నమూనాలు వంటి డేటాను ఉపయోగించి చేయవచ్చు.

స్లైడ్ డెక్ వాతావరణ నమూనాలపై ইতিহাসాత్మక దృష్టికోణాన్ని ML ఉపయోగంతో అందిస్తుంది.

నిర్మాణానికి ముందున్న పనులు

మీ మోడల్ నిర్మాణం మొదలుపెట్టేముందు కొన్ని పనులు పూర్తి చేయాలి. ఒక మోడల్ భవిష్యత్ అంచనాలపై మీరు మీ ప్రశ్నను పరీక్షించడానికి మరియు హైపోతసిస్ చేయడానికి, మీరు కొన్ని అంశాలను గుర్తించి సెట్ చేసుకోవాలి.

డేటా

మీ ప్రశ్నకు నిశ్చయంగా సమాధానం చెప్పడానికి సరైన రకమైన పెద్ద డేటా అవసరం. ఈ సమయంలో మీరు చేయవలసింది:

  • డేటా సేకరించండి. గత పాఠంలో డేటా న్యాయవంతత్వంపై నేర్చుకున్నట్లు, జాగ్రత్తగా డేటాను సేకరించండి. డేటా మూలాలపై జాగ్రత్త వహించండి, దానికి సంబంధించిన అహంకారాలు (biases) తెలుసుకోండి మరియు మూలాన్ని డాక్యుమెంట్ చేయండి.
  • డేటా సిద్ధం చేయండి. డేటా సిద్ధం చేసే ప్రక్రియలో అనేక దశలు ఉంటాయి. మీ డేటా వేర్వేరు మూలాల నుండి వస్తే, ఒకే రూపంలో మార్చడం అవసరం. మీ డేటా నాణ్యత మరియు పరిమాణాన్ని మెరుగుపరచడానికి స్ట్రింగ్స్‌ని నంబర్లుగా మార్చడం వంటి మార్గాలు స్వీకరించవచ్చు (మనము క్లస్టరింగ్ లో చేయడం). మీరు కొత్త డేటా కూడా సృష్టించవచ్చు (మనము వర్గీకరణ లో చేయడం). మీరు డేటాను శుభ్రపరచడం మరియు సవరించవచ్చు (వెబ్ యాప్ పాఠం ముందు). చివరిగా, ట్రెయినింగ్ సాంకేతికతల ఆధారంగా డేటాను రాండమ్ చేసుకోవచ్చు మరియు షఫుల్ చేయవచ్చు.

డేటాను సేకరించి ప్రాసెస్ చేసిన తర్వాత, దాని ఆకారం మీ ప్రశ్నను సమర్థవంతంగా పరిష్కరించగలదా అని చూడండి. మనం క్లస్టరింగ్ పాఠాలలో చూచినట్లు, కొన్నిసార్లు డేటా పనితీరు తక్కువగా ఉండవచ్చు!

ఫీచర్స్ మరియు లక్ష్యం

ఫీచర్ అనేది మీ డేటా యొక్క కొలవగల గుణం. చాలా డేటాసెట్లలో ఇది కాలమ్ పేర్లుగా ఉంటుంది, ఉదా: 'తేదీ', 'పరిమాణం', లేదా 'రంగు'. మీ ఫీచర్ వేరియబుల్ సాధారణంగా కోడ్ లో X ద్వారా సూచించబడుతుంది, ఇది మోడల్ ట్రెయిన్ చేయడానికి ఉపయోగించే ఇన్‌పుట్ వేరియబుల్.

లక్ష్యం అంటే మీరు అంచనా వేయాలనుకుంటున్న విషయం. లక్ష్యం సాధారణంగా కోడ్ లో y ద్వారా సూచించబడుతుంది, ఇది మీరు అడగాలనుకుంటున్న ప్రశ్నకు సమాధానం: డిసెంబర్ నెలలో, ఏ రంగు తో కాకులు చౌకగా ఉంటాయి? శాన్ ఫ్రాన్సిస్కో లో ఏ ప్రాంతాల్లో ఉత్తమ ఆస్తి ధర ఉంటుంది? లక్ష్యాన్ని లేబుల్ అట్రిబ్యూట్ అని కూడా పిలుస్తారు.

ఫీచర్ వేరియబుల్ ఎంచుకోవడం

🎓 ఫీచర్ ఎంపిక మరియు ఫీచర్ ఎక్స్‌ట్రాక్షన్ మోడల్ క్రియేటింగ్ సమయంలో ఎటువంటి వేరియబుల్ ఎంచుకోవాలో ఎలా తెలుసుకోవాలి? మీరు పనితీరు మెరుగైన ఫీచర్‌లను ఎంచుకునేందుకు ఫీచర్ ఎంపిక లేదా ఫీచర్ ఎక్స్‌ట్రాక్షన్ ప్రక్రియలను అనుసరిస్తారు. అవి ఒకే విషయం కావు: "ఫీచర్ ఎక్స్‌ట్రాక్షన్ అనేది అసలు ఫీచర్‌ల నుండి కొత్త ఫీచర్‌లను సృష్టించడం, ఫీచర్ ఎంపిక అనేది ఫీచర్‌లలో ఒక ఉపసమితి ఎంపిక చేయడం." (మూలం)

డేటాను విజువలైజ్ చేయండి

డేటా సెయింటిస్ట్ సాధనాలలో మేజరు పార్ట్ డేటాను వ్యూయలైజ్ చేయగల సామర్థ్యం. సీబోర్న్ లేదా మ్యాట్ప్లాట్‌లిబ్ వంటి గొప్ప లైబ్రరీలను ఉపయోగించి మీరు డేటాను విజువలైజ్ చేయవచ్చు. ఇలా చేస్తే దాగున్న సంబంధాలను కనుగొనడం సులభం అవుతుంది. మీ విజువలైజేషన్స్ బయస్ లేదా అసమతులిత డేటాను కూడా బయట పారవేయడానికి సహాయపడతాయి (వర్గీకరణ లో చూశాం).

డేటాసెట్ విభజించండి

ట్రెయినింగ్‌కు ముందు, మీరు డేటాను రెండు లేదా దానికంటే ఎక్కువ భాగాలుగా విభజించాలి, వాటి పరిమాణాలు సమానంగా లేకపోయినా, డేటాను బాగానే ప్రాతినిధ్యం వహించాలి.

  • ట్రెయినింగ్. ఈ డేటా మోడల్ ట్రెయినింగ్ కోసం ఉపయోగిస్తారు. ఇది అసలు డేటాసెట్ యొక్క ముఖ్య భాగం.
  • టెస్టింగ్. టెస్టింగ్ డేటా ఒక స్వతంత్ర గ్రూప్ డేటా, సాధారణంగా అసలు డేటా నుంచి తీసుకున్నది, దీన్ని మోడల్ పనితీరు నిర్ధారించడానికి ఉపయోగిస్తారు.
  • వెలిడేషన్. వెలిడేషన్ సెట్ చిన్న స్వతంత్ర ఉదాహరణల సమూహం, దీన్ని మోడల్ హైపరparameters లేదా నిర్మాణం సవరించడానికి ఉపయోగిస్తారు. మీ డేటా పరిమాణం మరియు ప్రశ్న ఆధారంగా, మీరు ఈ మూడవ సెట్ అవసరం లేకపోవచ్చు (టైమ్ సిరీస్ ఫోర్కాస్టింగ్ లో).

మోడల్ నిర్మించడం

ట్రెయినింగ్ డేటా ఉపయోగించి, మీరు వివిధ అల్గోరిథమ్‌లను ఉపయోగించి మోడల్ లేదా మీ డేటా యొక్క గణాంకాత్మక ప్రాతినిధ్యం నిర్మించడానికి ట్రెయిన్ చేస్తారు. మోడల్‌ను ట్రెయిన్ చేస్తే, అది డేటాలో తీసుకువచ్చిన నమూనాలను గుర్తించి అంచనా వేయగలుగుతుంది, తన అనుమానాలను కూడా ధృవీకరించడంతో పాటు అంగీకరించవచ్చు లేదా తిరస్కరించవచ్చు.

ట్రెయినింగ్ పద్ధతిని నిర్ణయించండి

మీ ప్రశ్న మరియు డేటా స్వభావం బట్టి, మీరు ఒక పద్ధతిని ఎంచుకుంటారు. ఈ కోర్సులో ఉపయోగించే Scikit-learn డాక్యుమెంటేషన్లో మీరు వివిధ మోడల్ ట్రెయినింగ్ పద్ధతులు తెలుసుకోవచ్చు. మీ అనుభవం ప్రకారం, అద్భుతమైన మోడల్ సంపాదించడానికి మీరు అనేక పద్ధతులను ప్రయత్నించాల్సి ఉండవచ్చు. డేటా శాస్త్రవేత్తలు ఒకసారి కోల్పోయిన డేటా ఫీడ్ చేసి లోపాలు, పక్షపాతం మరియు ఇతర నాణ్యత సమస్యలను పరిశీలించి, ఆ పని కోసం సరైన ట్రెయినింగ్ పద్ధతిని ఎంచుకుంటారు.

మోడల్ ట్రెయిన్ చేయండి

మీ ట్రెయినింగ్ డేటాతో, మీరు 'model.fit' అనే కోడ్‌లో ఇన్‌పుట్ ఫీచర్ వేరియబుల్ (సాధారణంగా 'X') మరియు లక్ష్య వేరియబుల్ ('y') పంపించి మోడల్ ట్రెయిన్ చేస్తారు.

మోడల్‌ను అంచనా వేయండి

ట్రెయినింగ్ ప్రక్రియ పూర్తయ్యాక (బహుశా ఎన్నో iterations లేదా 'epochs' పట్టవచ్చు), మీరు టెస్ట్ డేటా ఉపయోగించి మోడల్ నాణ్యతను అంచనా వేయవచ్చు. ఈ డేటా మొదటి డేటా సెట్ నుండి తీసుకున్నది కాని, మోడల్ ముందుగానే ఉపయోగించలేదు. మీరు మీ మోడల్ నాణ్యతపై గణాంక పట్టికను ప్రింట్ చేయవచ్చు.

🎓 మోడల్ ఫిట్టింగ్

మెషీన్ లెర్నింగ్ సందర్భంలో, మోడల్ ఫిట్టింగ్ అంటే మోడల్ యొక్క ఆధారభూత ఫంక్షన్ కొత్త డేటాను విశ్లేషించేటప్పుడు ఖచ్చితత్వం.

🎓 అండర్‌ఫిట్టింగ్ మరియు ఓవర్‌ఫిట్టింగ్ అనేవి సాధారణ సమస్యలు, ఇవి మోడల్ నాణ్యతను తగ్గిస్తాయి. మోడల్ బాగా సరిపోకపోవడం లేదా ఎక్కువ సరిపోయి ట్రెయినింగ్ డేటాతో కూడిన శబ్దం కూడా నేర్చుకోవడం వల్ల పరిస్థితి కలుగుతుంది. ఓవర్‌ఫిట్ మోడల్ ట్రెయినింగ్ డేటాను చాలా బాగా అంచనా వేస్తుంది కానీ అదే విధంగా సాధారణీకరించలేకపోవచ్చు. అండర్‌ఫిట్ మోడల్ ట్రెయినింగ్ డేటాను కూడా ఖచ్చితంగా విశ్లేషించలేకపోతుంది.

overfitting model

ఇన్ఫోగ్రాఫిక్: జెన్ లూపర్

పారామీటర్ సర్దుబాటు

మీ ప్రారంభ ట్రెయినింగ్ పూర్తయ్యాక మోడల్ నాణ్యతను పరిశీలించి, 'హైపర్‌పారామీటర్'లను సర్దుబాటు చేసి మెరుగుపరచుకోండి. ఈ ప్రక్రియ గురించి మరింత డాక్యుమెంటేషన్‌లో చదవండి.

అంచనా

ఇది మీరు పూర్తిగా కొత్త డేటాను మీ మోడల్ ఖచ్చితత్వం పరీక్షించడానికి ఉపయోగించే దశ. 'అప్లైడ్' ML సెట్టింగ్‌లో, మీరు ప్రొడక్షన్‌లో మోడల్ ఉపయోగించడానికి వెబ్ ఆస్తులను తయారుచేస్తున్నప్పుడు, యూజర్ ఇన్‌పుట్ (ఉదా: బటన్ నొక్కడం) సేకరించి, దాన్ని మోడల్‌కు పంపించి అంచనా చేయించవచ్చు.

ఈ పాఠాల్లో, మీరు ఈ దశల ద్వారా డేటాను సిద్ధం చేయడం, నిర్మించడం, పరీక్షించడం, అంచనా వేయడం, మరియు అంచనా వేయడం నేర్చుకుంటారు — డేటా శాస్త్రవేత్తల అలవాట్లు మరియు మరింత, ఒక 'ఫుల్ స్టాక్' ML ఇంజనీర్ అవడంలో మీ ప్రయాణంలో.


🚀సవాలు

ML ప్రాక్టీషనర్ దశలను ప్రతిబింబించే ఫ్లో చార్ట్ రూపొందించండి. మీరు ప్రస్తుతం ఏ దశలో ఉన్నారు? మీరు ఎక్కడ కష్టాన్ని ఎదుర్కొంటారని భావిస్తున్నారు? మీకు ఏది సులభంగా అనిపిస్తుంది?

పోస్ట్-లెక్చర్ క్విజ్

సమీక్ష & స్వయంఅధ్యయనం

డేటా శాస్త్రవేత్తల ఇంటర్వ్యూలను ఆన్‌లైన్‌లో వెతకండి, వారు వారి రోజువారీ పని గురించి మాట్లాడతారు. ఇక్కడ ఒకటి ఉంది.

అసైన్‌మెంట్

డేటా శాస్త్రవేత్త ఇంటర్వ్యూ


డిస్క్లెయిమర్:
ఈ డాక్యుమెంట్ AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి శ్రమిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో తప్పులు లేదా అసత్యతలు ఉండే అవకాశముంది. అసలు డాక్యుమెంట్ native భాషలో ఉన్నదే అధికారపూర్వక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదాన్ని సూచించబడుతుంది. ఈ అనువాదం వలన కలిగే ఏదైనా అపవాదాలు లేదా తప్పుదారులు విషయానికి మేము బాధ్యులు కాదు.