You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
ML-For-Beginners/translations/te/1-Introduction/4-techniques-of-ML/README.md

125 lines
25 KiB

# మెషీన్ లెర్నింగ్ సాంకేతికతలు
మెషీన్ లెర్నింగ్ మోడల్స్ మరియు అవి ఉపయోగించే డేటాను నిర్మించడం, ఉపయోగించడం మరియు నిర్వహించడం అనేది అనేక ఇతర అభివృద్ధి పనితీరుల నుండి పూర్తిగా భిన్నమైన ప్రక్రియ. ఈ పాఠంలో, మేము ఈ ప్రక్రియను సులభతరం చేస్తాము మరియు మీరు తెలుసుకోవలసిన ప్రధాన సాంకేతికతలను వివరించబోతున్నాము. మీరు:
- మెషీన్ లెర్నింగ్ ఆధారమైన ప్రక్రియలను ఉన్నతస్థాయిలో అర్థం చేసుకుంటారు.
- 'మోడల్స్', 'ప్రిడిక్షన్స్', మరియు 'ట్రైనింగ్ డేటా' వంటి ప్రాథమిక భావనలు తోచుకుంటారు.
## [ప్రీ-లెక్చర్ క్విజ్](https://ff-quizzes.netlify.app/en/ml/)
[![ML for beginners - Techniques of Machine Learning](https://img.youtube.com/vi/4NGM0U2ZSHU/0.jpg)](https://youtu.be/4NGM0U2ZSHU "ML for beginners - Techniques of Machine Learning")
> 🎥 ఈ పాఠాన్ని వివరించే చిన్న వీడియో కోసం పై చిత్రం క్లిక్ చేయండి.
## పరిచయం
మెషీన్ లెర్నింగ్ (ML) ప్రక్రియలను సృష్టించడం అంటే అనేక దశల కలయికగా ఉంటుంది:
1. **ప్రశ్నను నిర్ణయించండి**. ఎక్కువ ML ప్రక్రియలు సరళ కండిషనల్ ప్రోగ్రామ్ లేదా నియమాల ఆధారిత ఇంజిన్ ద్వారా సమాధానం చెప్పలేని ప్రశ్నతో ప్రారంభమవుతాయి. ఈ ప్రశ్నలు సాధారణంగా డేటా సేకరణ ఆధారంగా భవిష్యత్ అంచనాల చుట్టూ ఉంటాయి.
2. **డేటా సేకరించి సిద్ధం చేసుకోండి**. మీ ప్రశ్నకు సమాధానం చెప్పడానికి మీరు డేటా అవసరం. డేటా గുണాత్మకత మరియు కొన్నిసార్లు పరిమాణం మీ ఆరంభ ప్రశ్నకు మీరు ఎంత బాగా సమాధానం చెప్పగలరో నిర్ణయిస్తుంది. ఈ దశలో డేటా విజువలైజేషన్ చాలా ముఖ్యం. ఈ దశలో డేటాను ట్రెయినింగ్ మరియు టెస్టింగ్ గ్రూపులుగా విభజించడం కూడా ఉంటుంది.
3. **ట్రైనింగ్ పద్ధతి ఎంచుకోండి**. మీ ప్రశ్న మరియు డేటా స్వభావాన్ని బట్టి, మోడల్ ను ఉత్తమంగా ప్రతిబింబించడానికి మరియు ఖచ్చితంగా అంచనా వేయడానికి మీరు ఎలా ట్రెయిన్ చేయాలనుకుంటున్నారో ఎంచుకోవాలి. ఇది మీ ML ప్రక్రియలో ప్రత్యేక నైపుణ్యం మరియు చాలాసార్లు చాలా ప్రయోగాలు అవసరమయ్యే భాగం.
4. **మోడల్ ట్రెయిన్ చేయండి**. మీరు ట్రెయినింగ్ డేటా ఉపయోగించి వివిధ అల్గోరిథమ్ల ద్వారా ప్యాటర్న్లను గుర్తించేందుకు మోడల్ ను ట్రెయిన్ చేస్తారు. మోడల్ అనేకమైన అంతర్గత బరువులను ఉపయోగించి డేటాలో కొన్ని భాగాలపై ఎక్కువ ప్రాధాన్యత ఇవ్వడానికి సర్దుబాటు చేయవచ్చు.
5. **మోడల్ ను అంచనా వేయండి**. మీ సేకరించిన డేటా నుండి ఇప్పటివరకూ చూసిన విషయం కాని డేటా (టెస్టింగ్ డేటా) ఉపయోగించి మోడల్ ప్రదర్శనను పరిశీలిస్తారు.
6. **పారామీటర్ సర్దుబాటు**. మోడల్ ప్రదర్శన ఆధారంగా, మీరు ట్రెయినింగ్ అల్గోరిథమ్ నడిపే వివిధ పారామీటర్లను మారుస్తూ ప్రక్రియను పునరావృతం చేయవచ్చు.
7. **అంచనా వేయండి**. కొత్త ఇన్‌పుట్లను ఉపయోగించి మోడల్ ఖచ్చితత్వాన్ని పరీక్షించండి.
## ఎలాంటి ప్రశ్న అడగాలి
కంప్యూటర్లు డేటాలో దాగిన నమూనాలు కనుగొనడంలో ప్రత్యేక నైపుణ్యం కలిగి ఉంటాయి. ఈ ఉపయోగకరత అనేక రంగాలలో సులభంగా పరిష్కరించలేని ప్రశ్నలను ఎవరిదైనా అడగడానికి సహాయం చేస్తుంది. ఉదాహరణకు, ఒక్క వ్యక్తి ఆరోగ్య చరిత్ర ఆధారంగా భవిష్యత్ మరణాల రేట్లను అంచనా వేసేందుకు ML మోడల్ ఉపయోగపడవచ్చు.
రెండవ ఉదాహరణకి, ఎпрిల్ నెలలో ఇచ్చిన ప్రాంతంలో వాతావరణ అంచనాలు latitude, longitude, వాతావరణ మార్పులు, సముద్రం సమీపత, జెట్ స్ట్రీమ్ నమూనాలు వంటి డేటాను ఉపయోగించి చేయవచ్చు.
✅ ఈ [స్లైడ్ డెక్](https://www2.cisl.ucar.edu/sites/default/files/2021-10/0900%20June%2024%20Haupt_0.pdf) వాతావరణ నమూనాలపై ইতিহাসాత్మక దృష్టికోణాన్ని ML ఉపయోగంతో అందిస్తుంది.
## నిర్మాణానికి ముందున్న పనులు
మీ మోడల్ నిర్మాణం మొదలుపెట్టేముందు కొన్ని పనులు పూర్తి చేయాలి. ఒక మోడల్ భవిష్యత్ అంచనాలపై మీరు మీ ప్రశ్నను పరీక్షించడానికి మరియు హైపోతసిస్ చేయడానికి, మీరు కొన్ని అంశాలను గుర్తించి సెట్ చేసుకోవాలి.
### డేటా
మీ ప్రశ్నకు నిశ్చయంగా సమాధానం చెప్పడానికి సరైన రకమైన పెద్ద డేటా అవసరం. ఈ సమయంలో మీరు చేయవలసింది:
- **డేటా సేకరించండి**. గత పాఠంలో డేటా న్యాయవంతత్వంపై నేర్చుకున్నట్లు, జాగ్రత్తగా డేటాను సేకరించండి. డేటా మూలాలపై జాగ్రత్త వహించండి, దానికి సంబంధించిన అహంకారాలు (biases) తెలుసుకోండి మరియు మూలాన్ని డాక్యుమెంట్ చేయండి.
- **డేటా సిద్ధం చేయండి**. డేటా సిద్ధం చేసే ప్రక్రియలో అనేక దశలు ఉంటాయి. మీ డేటా వేర్వేరు మూలాల నుండి వస్తే, ఒకే రూపంలో మార్చడం అవసరం. మీ డేటా నాణ్యత మరియు పరిమాణాన్ని మెరుగుపరచడానికి స్ట్రింగ్స్‌ని నంబర్లుగా మార్చడం వంటి మార్గాలు స్వీకరించవచ్చు (మనము [క్లస్టరింగ్](../../5-Clustering/1-Visualize/README.md) లో చేయడం). మీరు కొత్త డేటా కూడా సృష్టించవచ్చు (మనము [వర్గీకరణ](../../4-Classification/1-Introduction/README.md) లో చేయడం). మీరు డేటాను శుభ్రపరచడం మరియు సవరించవచ్చు ([వెబ్ యాప్](../../3-Web-App/README.md) పాఠం ముందు). చివరిగా, ట్రెయినింగ్ సాంకేతికతల ఆధారంగా డేటాను రాండమ్ చేసుకోవచ్చు మరియు షఫుల్ చేయవచ్చు.
✅ డేటాను సేకరించి ప్రాసెస్ చేసిన తర్వాత, దాని ఆకారం మీ ప్రశ్నను సమర్థవంతంగా పరిష్కరించగలదా అని చూడండి. మనం [క్లస్టరింగ్](../../5-Clustering/1-Visualize/README.md) పాఠాలలో చూచినట్లు, కొన్నిసార్లు డేటా పనితీరు తక్కువగా ఉండవచ్చు!
### ఫీచర్స్ మరియు లక్ష్యం
[ఫీచర్](https://www.datasciencecentral.com/profiles/blogs/an-introduction-to-variable-and-feature-selection) అనేది మీ డేటా యొక్క కొలవగల గుణం. చాలా డేటాసెట్లలో ఇది కాలమ్ పేర్లుగా ఉంటుంది, ఉదా: 'తేదీ', 'పరిమాణం', లేదా 'రంగు'. మీ ఫీచర్ వేరియబుల్ సాధారణంగా కోడ్ లో `X` ద్వారా సూచించబడుతుంది, ఇది మోడల్ ట్రెయిన్ చేయడానికి ఉపయోగించే ఇన్‌పుట్ వేరియబుల్.
లక్ష్యం అంటే మీరు అంచనా వేయాలనుకుంటున్న విషయం. లక్ష్యం సాధారణంగా కోడ్ లో `y` ద్వారా సూచించబడుతుంది, ఇది మీరు అడగాలనుకుంటున్న ప్రశ్నకు సమాధానం: డిసెంబర్ నెలలో, ఏ **రంగు** తో కాకులు చౌకగా ఉంటాయి? శాన్ ఫ్రాన్సిస్కో లో ఏ ప్రాంతాల్లో ఉత్తమ ఆస్తి **ధర** ఉంటుంది? లక్ష్యాన్ని లేబుల్ అట్రిబ్యూట్ అని కూడా పిలుస్తారు.
### ఫీచర్ వేరియబుల్ ఎంచుకోవడం
🎓 **ఫీచర్ ఎంపిక మరియు ఫీచర్ ఎక్స్‌ట్రాక్షన్** మోడల్ క్రియేటింగ్ సమయంలో ఎటువంటి వేరియబుల్ ఎంచుకోవాలో ఎలా తెలుసుకోవాలి? మీరు పనితీరు మెరుగైన ఫీచర్‌లను ఎంచుకునేందుకు ఫీచర్ ఎంపిక లేదా ఫీచర్ ఎక్స్‌ట్రాక్షన్ ప్రక్రియలను అనుసరిస్తారు. అవి ఒకే విషయం కావు: "ఫీచర్ ఎక్స్‌ట్రాక్షన్ అనేది అసలు ఫీచర్‌ల నుండి కొత్త ఫీచర్‌లను సృష్టించడం, ఫీచర్ ఎంపిక అనేది ఫీచర్‌లలో ఒక ఉపసమితి ఎంపిక చేయడం." ([మూలం](https://wikipedia.org/wiki/Feature_selection))
### డేటాను విజువలైజ్ చేయండి
డేటా సెయింటిస్ట్ సాధనాలలో మేజరు పార్ట్ డేటాను వ్యూయలైజ్ చేయగల సామర్థ్యం. సీబోర్న్ లేదా మ్యాట్ప్లాట్‌లిబ్ వంటి గొప్ప లైబ్రరీలను ఉపయోగించి మీరు డేటాను విజువలైజ్ చేయవచ్చు. ఇలా చేస్తే దాగున్న సంబంధాలను కనుగొనడం సులభం అవుతుంది. మీ విజువలైజేషన్స్ బయస్ లేదా అసమతులిత డేటాను కూడా బయట పారవేయడానికి సహాయపడతాయి ([వర్గీకరణ](../../4-Classification/2-Classifiers-1/README.md) లో చూశాం).
### డేటాసెట్ విభజించండి
ట్రెయినింగ్‌కు ముందు, మీరు డేటాను రెండు లేదా దానికంటే ఎక్కువ భాగాలుగా విభజించాలి, వాటి పరిమాణాలు సమానంగా లేకపోయినా, డేటాను బాగానే ప్రాతినిధ్యం వహించాలి.
- **ట్రెయినింగ్**. ఈ డేటా మోడల్ ట్రెయినింగ్ కోసం ఉపయోగిస్తారు. ఇది అసలు డేటాసెట్ యొక్క ముఖ్య భాగం.
- **టెస్టింగ్**. టెస్టింగ్ డేటా ఒక స్వతంత్ర గ్రూప్ డేటా, సాధారణంగా అసలు డేటా నుంచి తీసుకున్నది, దీన్ని మోడల్ పనితీరు నిర్ధారించడానికి ఉపయోగిస్తారు.
- **వెలిడేషన్**. వెలిడేషన్ సెట్ చిన్న స్వతంత్ర ఉదాహరణల సమూహం, దీన్ని మోడల్ హైపరparameters లేదా నిర్మాణం సవరించడానికి ఉపయోగిస్తారు. మీ డేటా పరిమాణం మరియు ప్రశ్న ఆధారంగా, మీరు ఈ మూడవ సెట్ అవసరం లేకపోవచ్చు ([టైమ్ సిరీస్ ఫోర్కాస్టింగ్](../../7-TimeSeries/1-Introduction/README.md) లో).
## మోడల్ నిర్మించడం
ట్రెయినింగ్ డేటా ఉపయోగించి, మీరు వివిధ అల్గోరిథమ్‌లను ఉపయోగించి మోడల్ లేదా మీ డేటా యొక్క గణాంకాత్మక ప్రాతినిధ్యం నిర్మించడానికి ట్రెయిన్ చేస్తారు. మోడల్‌ను ట్రెయిన్ చేస్తే, అది డేటాలో తీసుకువచ్చిన నమూనాలను గుర్తించి అంచనా వేయగలుగుతుంది, తన అనుమానాలను కూడా ధృవీకరించడంతో పాటు అంగీకరించవచ్చు లేదా తిరస్కరించవచ్చు.
### ట్రెయినింగ్ పద్ధతిని నిర్ణయించండి
మీ ప్రశ్న మరియు డేటా స్వభావం బట్టి, మీరు ఒక పద్ధతిని ఎంచుకుంటారు. ఈ కోర్సులో ఉపయోగించే [Scikit-learn డాక్యుమెంటేషన్](https://scikit-learn.org/stable/user_guide.html)లో మీరు వివిధ మోడల్ ట్రెయినింగ్ పద్ధతులు తెలుసుకోవచ్చు. మీ అనుభవం ప్రకారం, అద్భుతమైన మోడల్ సంపాదించడానికి మీరు అనేక పద్ధతులను ప్రయత్నించాల్సి ఉండవచ్చు. డేటా శాస్త్రవేత్తలు ఒకసారి కోల్పోయిన డేటా ఫీడ్ చేసి లోపాలు, పక్షపాతం మరియు ఇతర నాణ్యత సమస్యలను పరిశీలించి, ఆ పని కోసం సరైన ట్రెయినింగ్ పద్ధతిని ఎంచుకుంటారు.
### మోడల్ ట్రెయిన్ చేయండి
మీ ట్రెయినింగ్ డేటాతో, మీరు 'model.fit' అనే కోడ్‌లో ఇన్‌పుట్ ఫీచర్ వేరియబుల్ (సాధారణంగా 'X') మరియు లక్ష్య వేరియబుల్ ('y') పంపించి మోడల్ ట్రెయిన్ చేస్తారు.
### మోడల్‌ను అంచనా వేయండి
ట్రెయినింగ్ ప్రక్రియ పూర్తయ్యాక (బహుశా ఎన్నో iterations లేదా 'epochs' పట్టవచ్చు), మీరు టెస్ట్ డేటా ఉపయోగించి మోడల్ నాణ్యతను అంచనా వేయవచ్చు. ఈ డేటా మొదటి డేటా సెట్ నుండి తీసుకున్నది కాని, మోడల్ ముందుగానే ఉపయోగించలేదు. మీరు మీ మోడల్ నాణ్యతపై గణాంక పట్టికను ప్రింట్ చేయవచ్చు.
🎓 **మోడల్ ఫిట్టింగ్**
మెషీన్ లెర్నింగ్ సందర్భంలో, మోడల్ ఫిట్టింగ్ అంటే మోడల్ యొక్క ఆధారభూత ఫంక్షన్ కొత్త డేటాను విశ్లేషించేటప్పుడు ఖచ్చితత్వం.
🎓 **అండర్‌ఫిట్టింగ్** మరియు **ఓవర్‌ఫిట్టింగ్** అనేవి సాధారణ సమస్యలు, ఇవి మోడల్ నాణ్యతను తగ్గిస్తాయి. మోడల్ బాగా సరిపోకపోవడం లేదా ఎక్కువ సరిపోయి ట్రెయినింగ్ డేటాతో కూడిన శబ్దం కూడా నేర్చుకోవడం వల్ల పరిస్థితి కలుగుతుంది. ఓవర్‌ఫిట్ మోడల్ ట్రెయినింగ్ డేటాను చాలా బాగా అంచనా వేస్తుంది కానీ అదే విధంగా సాధారణీకరించలేకపోవచ్చు. అండర్‌ఫిట్ మోడల్ ట్రెయినింగ్ డేటాను కూడా ఖచ్చితంగా విశ్లేషించలేకపోతుంది.
![overfitting model](../../../../translated_images/te/overfitting.1c132d92bfd93cb6.webp)
> ఇన్ఫోగ్రాఫిక్: [జెన్ లూపర్](https://twitter.com/jenlooper)
## పారామీటర్ సర్దుబాటు
మీ ప్రారంభ ట్రెయినింగ్ పూర్తయ్యాక మోడల్ నాణ్యతను పరిశీలించి, 'హైపర్‌పారామీటర్'లను సర్దుబాటు చేసి మెరుగుపరచుకోండి. ఈ ప్రక్రియ గురించి మరింత [డాక్యుమెంటేషన్‌లో చదవండి](https://docs.microsoft.com/en-us/azure/machine-learning/how-to-tune-hyperparameters?WT.mc_id=academic-77952-leestott).
## అంచనా
ఇది మీరు పూర్తిగా కొత్త డేటాను మీ మోడల్ ఖచ్చితత్వం పరీక్షించడానికి ఉపయోగించే దశ. 'అప్లైడ్' ML సెట్టింగ్‌లో, మీరు ప్రొడక్షన్‌లో మోడల్ ఉపయోగించడానికి వెబ్ ఆస్తులను తయారుచేస్తున్నప్పుడు, యూజర్ ఇన్‌పుట్ (ఉదా: బటన్ నొక్కడం) సేకరించి, దాన్ని మోడల్‌కు పంపించి అంచనా చేయించవచ్చు.
ఈ పాఠాల్లో, మీరు ఈ దశల ద్వారా డేటాను సిద్ధం చేయడం, నిర్మించడం, పరీక్షించడం, అంచనా వేయడం, మరియు అంచనా వేయడం నేర్చుకుంటారు — డేటా శాస్త్రవేత్తల అలవాట్లు మరియు మరింత, ఒక 'ఫుల్ స్టాక్' ML ఇంజనీర్ అవడంలో మీ ప్రయాణంలో.
---
## 🚀సవాలు
ML ప్రాక్టీషనర్ దశలను ప్రతిబింబించే ఫ్లో చార్ట్ రూపొందించండి. మీరు ప్రస్తుతం ఏ దశలో ఉన్నారు? మీరు ఎక్కడ కష్టాన్ని ఎదుర్కొంటారని భావిస్తున్నారు? మీకు ఏది సులభంగా అనిపిస్తుంది?
## [పోస్ట్-లెక్చర్ క్విజ్](https://ff-quizzes.netlify.app/en/ml/)
## సమీక్ష & స్వయంఅధ్యయనం
డేటా శాస్త్రవేత్తల ఇంటర్వ్యూలను ఆన్‌లైన్‌లో వెతకండి, వారు వారి రోజువారీ పని గురించి మాట్లాడతారు. ఇక్కడ [ఒకటి](https://www.youtube.com/watch?v=Z3IjgbbCEfs) ఉంది.
## అసైన్‌మెంట్
[డేటా శాస్త్రవేత్త ఇంటర్వ్యూ](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**డిస్క్లెయిమర్**:
ఈ డాక్యుమెంట్ AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి శ్రమిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో తప్పులు లేదా అసత్యతలు ఉండే అవకాశముంది. అసలు డాక్యుమెంట్ native భాషలో ఉన్నదే అధికారపూర్వక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదాన్ని సూచించబడుతుంది. ఈ అనువాదం వలన కలిగే ఏదైనా అపవాదాలు లేదా తప్పుదారులు విషయానికి మేము బాధ్యులు కాదు.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->