|
|
4 months ago | |
|---|---|---|
| .. | ||
| README.md | 4 months ago | |
| assignment.md | 7 months ago | |
README.md
मशीन लर्निंग की तकनीकें
मशीन लर्निंग मॉडल बनाने, उपयोग करने, और बनाए रखने की प्रक्रिया और उनके द्वारा उपयोग किए गए डेटा की प्रक्रिया कई अन्य विकास वर्कफ़्लो से बहुत अलग होती है। इस पाठ में, हम इस प्रक्रिया को सरल बनाएंगे और मुख्य तकनीकों का सारांश प्रस्तुत करेंगे जिन्हें आपको जानना आवश्यक है। आप:
- उच्च स्तर पर मशीन लर्निंग के पीछे की प्रक्रियाओं को समझेंगे।
- 'मॉडल', 'पूर्वानुमान', और 'प्रशिक्षण डेटा' जैसे मूल अवधारणाओं का अन्वेषण करेंगे।
प्री-लेक्चर क्विज़
🎥 इस पाठ को समझाने वाला संक्षिप्त वीडियो देखने के लिए ऊपर दिए चित्र पर क्लिक करें।
परिचय
उच्च स्तर पर, मशीन लर्निंग (ML) प्रक्रियाओं को बनाने की कारीगरी कई चरणों से मिलकर होती है:
- प्रश्न तय करें। अधिकांश ML प्रक्रियाएं ऐसे प्रश्न पूछने से शुरू होती हैं जिनका उत्तर सरल कंडीशनल प्रोग्राम या नियम-आधारित इंजन द्वारा नहीं दिया जा सकता। ये प्रश्न अक्सर डेटा के संग्रह के आधार पर पूर्वानुमान से संबंधित होते हैं।
- डेटा इकट्ठा करें और तैयार करें। अपने प्रश्न का उत्तर देने के लिए आपको डेटा की आवश्यकता होती है। आपके डेटा की गुणवत्ता और कभी-कभार मात्रा निर्धारित करेगी कि आप अपने प्रारंभिक प्रश्न का कितना अच्छा उत्तर दे सकते हैं। डेटा का दृश्यांकन इस चरण का एक महत्वपूर्ण हिस्सा है। इस चरण में डेटा को प्रशिक्षण और परीक्षण समूहों में विभाजित करना भी शामिल है ताकि मॉडल बनाया जा सके।
- प्रशिक्षण विधि चुनें। आपके प्रश्न और डेटा की प्रकृति के अनुसार, आपको यह चुनना होगा कि आप मॉडल को कैसे प्रशिक्षित करेंगे ताकि यह आपके डेटा को सबसे अच्छी तरह दर्शाए और उसके विरुद्ध सटीक पूर्वानुमान कर सके। यह आपका ML प्रक्रिया का वह हिस्सा है जिसमें विशेषज्ञता और अक्सर काफी प्रयोग की आवश्यकता होती है।
- मॉडल प्रशिक्षित करें। अपने प्रशिक्षण डेटा का उपयोग करके, आप विभिन्न एल्गोरिदम का उपयोग करके मॉडल को डेटा में पैटर्न पहचानने के लिए प्रशिक्षित करेंगे। मॉडल आंतरिक भार (वेट्स) का लाभ उठा सकता है जिन्हें समायोजित किया जा सकता है ताकि डेटा के कुछ हिस्सों को प्राथमिकता देकर बेहतर मॉडल बनाया जा सके।
- मॉडल का मूल्यांकन करें। आप अपने एकत्र किए गए समूह से पहले कभी न देखे गए डेटा (परीक्षण डेटा) का उपयोग करके मॉडल के प्रदर्शन को देखेंगे।
- पैरामीटर ट्यूनिंग। आपके मॉडल के प्रदर्शन के आधार पर, आप मॉडल को प्रशिक्षित करने के लिए उपयोग किए गए एल्गोरिदम के व्यवहार को नियंत्रित करने वाले विभिन्न पैरामीटर या वेरिएबल का उपयोग करके प्रक्रिया को फिर से कर सकते हैं।
- पूर्वानुमान करें। अपने मॉडल की सटीकता जांचने के लिए नए इनपुट का उपयोग करें।
किस प्रश्न को पूछना चाहिए
कंप्यूटर डेटा में छिपे पैटर्न खोजने में विशेष रूप से कुशल होते हैं। यह उपयोगिता शोधकर्ताओं के लिए बहुत मददगार होती है जिनके पास ऐसे प्रश्न होते हैं जिन्हें कंडीशनली आधारित नियम इंजन बनाकर आसानी से उत्तर नहीं दिया जा सकता। उदाहरण के लिए, एक सांख्यिकी कार्य में, एक डेटा वैज्ञानिक स्मोकर्स और नॉन-स्मोकर्स की मृत्यु दर के बारे में हस्तनिर्मित नियम बना सकता है।
जब अन्य कई चर इस समीकरण में लाए जाते हैं, तो ML मॉडल पिछले स्वास्थ्य इतिहास के आधार पर भविष्य की मृत्यु दर का पूर्वानुमान लगाने में अधिक कुशल साबित हो सकता है। एक और सुखद उदाहरण हो सकता है किसी स्थान में अप्रैल माह के लिए मौसम पूर्वानुमान बनाना, जिसमें अक्षांश, देशांतर, जलवायु परिवर्तन, समुद्र के निकटता, जेट स्ट्रीम के पैटर्न, और अधिक शामिल हो सकते हैं।
✅ यह स्लाइड डेक मौसम मॉडल पर ML के उपयोग का ऐतिहासिक दृष्टिकोण प्रदान करता है।
पूर्व-निर्माण कार्य
मॉडल बनाने से पहले, आपको कई कार्य पूरे करने होंगे। अपने प्रश्न का परीक्षण करने और मॉडल की भविष्यवाणियों के आधार पर एक अनुमान बनाने के लिए, आपको कई तत्वों की पहचान और कॉन्फ़िगर करना होगा।
डेटा
अपने प्रश्न का किसी प्रकार की निश्चितता के साथ उत्तर देने के लिए, आपको सही प्रकार के पर्याप्त डेटा की आवश्यकता होती है। इस चरण में आपको दो काम करने होंगे:
- डेटा इकट्ठा करें। डेटा विश्लेषण में निष्पक्षता पर पिछले पाठ को ध्यान में रखते हुए, सावधानी से डेटा एकत्र करें। डेटा के स्रोतों के प्रति जागरूक रहें, इसमें मौजूद किसी भी अंतर्निहित पक्षपात से अवगत रहें, और इसके स्रोत का दस्तावेजीकरण करें।
- डेटा तैयार करें। डेटा तैयारी प्रक्रिया में कई चरण होते हैं। यदि डेटा विभिन्न स्रोतों से आया हो तो आपको डेटा को संयोजित और सामान्यीकृत करने की आवश्यकता हो सकती है। आप विभिन्न विधियों से डेटा की गुणवत्ता और मात्रा बढ़ा सकते हैं, जैसे स्ट्रिंग को संख्याओं में बदलना (जैसा कि हम क्लस्टरिंग में करते हैं)। आप मूल डेटा के आधार पर नया डेटा उत्पन्न भी कर सकते हैं (जैसा कि हम क्लासिफिकेशन में करते हैं)। आप डेटा को साफ़ और संपादित भी कर सकते हैं (जैसा कि हम वेब ऐप पाठ से पहले करेंगे)। अंत में, आपको इसे यादृच्छिक (रैंडमाइज़) और शफल करने की आवश्यकता हो सकती है, जो आपकी प्रशिक्षण तकनीकों पर निर्भर करता है।
✅ डेटा एकत्र करने और संसाधित करने के बाद, यह जाँचने के लिए थोड़ा समय निकालें कि क्या इसका स्वरूप आपके लक्ष्यित प्रश्न को संबोधित करने की अनुमति देगा। हो सकता है कि डेटा आपके दिए गए कार्य में अच्छा प्रदर्शन न करे, जैसा कि हम अपने क्लस्टरिंग पाठों में देखते हैं!
फीचर्स और टारगेट
एक फीचर आपके डेटा की एक मापनीय संपत्ति है। कई डेटासेट में इसे कॉलम हेडिंग के रूप में व्यक्त किया जाता है जैसे 'दिनांक', 'आकार' या 'रंग'। आपकी फीचर वेरिएबल, जो आमतौर पर कोड में X के रूप में निरूपित होती है, वह इनपुट वेरिएबल होती है जिसका उपयोग मॉडल को प्रशिक्षण देने के लिए किया जाएगा।
एक टारगेट वह चीज़ है जिसे आप पूर्वानुमान लगाने की कोशिश कर रहे हैं। टारगेट, जो आमतौर पर कोड में y के रूप में निरूपित होता है, वह प्रश्न का उत्तर होता है जो आप अपने डेटा से पूछना चाहते हैं: दिसंबर में, कौन से रंग के कद्दू सबसे सस्ते होंगे? सैन फ्रांसिस्को में, कौन से इलाके सबसे अच्छी रियल एस्टेट कीमत रखेंगे? कभी-कभी टारगेट को लेबल एट्रिब्यूट भी कहा जाता है।
अपनी फीचर वेरिएबल चुनना
🎓 फीचर चयन और फीचर एक्सट्रैक्शन मॉडल बनाते समय आप कैसे जानते हैं कि कौन सा वेरिएबल चुनें? आप सबसे प्रभावी मॉडल के लिए उपयुक्त वेरिएबल चुनने हेतु फीचर चयन या फीचर एक्सट्रैक्शन की प्रक्रिया से गुजरेंगे। हालांकि ये दोनों एक समान नहीं हैं: "फीचर एक्सट्रैक्शन मूल फीचर्स के फंक्शन्स से नए फीचर्स बनाता है, जबकि फीचर चयन फीचर्स के एक उपसमूह को लौटाता है।" (स्रोत)
अपने डेटा का दृश्यांकन करें
डेटा वैज्ञानिक के टूलकिट में डेटा को कई उत्कृष्ट लाइब्रेरी जैसे Seaborn या MatPlotLib का उपयोग करके विज़ुअलाइज़ करने की शक्ति एक महत्वपूर्ण पहलू है। अपने डेटा को दृश्यमान रूप में प्रस्तुत करने से आप छिपे हुए सहसंबंधों को खोज सकते हैं जिनका आप लाभ उठा सकते हैं। आपकी विज़ुअलाइज़ेशन मदद कर सकती है पक्षपात या असंतुलित डेटा खोजने में (जैसा कि हम क्लासिफिकेशन में पाते हैं)।
अपने डेटासेट को विभाजित करें
प्रशिक्षण से पहले, आपको अपने डेटासेट को दो या अधिक असमान आकार के लेकिन डेटा का अच्छा प्रतिनिधित्व करने वाले भागों में विभाजित करना होगा।
- प्रशिक्षण। इस डेटासेट के हिस्से का उपयोग मॉडल को प्रशिक्षित करने के लिए किया जाता है। यह सेट मूल डेटासेट का अधिकांश हिस्सा होता है।
- परीक्षण। परीक्षण डेटासेट एक स्वतंत्र डेटा समूह होता है, जो अक्सर मूल डेटा से एकत्र किया जाता है, जिसे आप बने मॉडल के प्रदर्शन की पुष्टि करने के लिए उपयोग करते हैं।
- मान्यकरण। एक मान्यकरण सेट एक छोटा स्वतंत्र समूह होता है जिसे आप मॉडल के हाइपरपैरामीटर या वास्तुकला को ठीक करने के लिए उपयोग करते हैं ताकि मॉडल में सुधार किया जा सके। आपके डेटा के आकार और प्रश्न के अनुसार, इस तीसरे सेट को बनाना आवश्यक नहीं हो सकता (जैसा कि हम टाइम सीरीज फोरकास्टिंग में नोट करते हैं)।
मॉडल बनाना
अपने प्रशिक्षण डेटा का उपयोग करते हुए, आपका लक्ष्य विभिन्न एल्गोरिदम का उपयोग करके अपने डेटा का एक सांख्यिकीय प्रतिनिधित्व या मॉडल बनाना है और उसे प्रशिक्षित करना है। मॉडल को प्रशिक्षित करने से वह डेटा के प्रति उजागर होता है और इसमें पाए गए पैटर्न के बारे में अनुमानों को बनाने, सत्यापित करने, और स्वीकार या अस्वीकार करने की अनुमति मिलती है।
प्रशिक्षण विधि तय करें
प्रश्न और आपके डेटा की प्रकृति के अनुसार, आप इसे प्रशिक्षित करने के लिए एक विधि चुनेंगे। Scikit-learn के प्रलेखन के माध्यम से - जिसका उपयोग हम इस पाठ्यक्रम में करते हैं - आप मॉडल प्रशिक्षित करने के कई तरीके तलाश सकते हैं। आपके अनुभव के अनुसार, आपको सर्वोत्तम मॉडल बनाने के लिए कई विभिन्न विधियाँ आजमानी पड़ सकती हैं। आप उस प्रक्रिया से गुजरेंगे जिसमें डेटा वैज्ञानिक एक मॉडल के प्रदर्शन का मूल्यांकन करते हैं, उसे अनदेखे डेटा खिलाकर, सटीकता, पक्षपात और अन्य गुणवत्ता-घटाने वाले मुद्दों को जांचकर, और कार्य के लिए सबसे उपयुक्त प्रशिक्षण विधि चुनते हैं।
मॉडल प्रशिक्षण करें
अपने प्रशिक्षण डेटा के साथ, आप इसे फिट करने के लिए तैयार होते हैं ताकि मॉडल बनाया जा सके। आप पाएंगे कि कई ML लाइब्रेरियों में कोड 'model.fit' होता है - यह वह क्षण होता है जब आप अपनी फीचर वेरिएबल को मानों की सरणी के रूप में (आमतौर पर 'X') और टारगेट वेरिएबल (आमतौर पर 'y') को भेजते हैं।
मॉडल का मूल्यांकन करें
जब प्रशिक्षण प्रक्रिया पूरी हो जाती है (एक बड़े मॉडल को प्रशिक्षित करने में कई पुनरावृत्तियां, या 'एपोक' लग सकते हैं), आप परीक्षण डेटा का उपयोग करके मॉडल की गुणवत्ता का मूल्यांकन कर पाएंगे। यह डेटा मूल डेटा का एक उपसमुच्चय होता है जिसे मॉडल ने पहले कभी विश्लेषित नहीं किया होता। आप अपने मॉडल की गुणवत्ता पर मेट्रिक्स की तालिका भी प्रिंट कर सकते हैं।
🎓 मॉडल फिटिंग
मशीन लर्निंग के संदर्भ में, मॉडल फिटिंग उस मॉडल के अंतर्निहित फ़ंक्शन की सटीकता को दर्शाती है जो अनजाने डेटा का विश्लेषण करने का प्रयास करता है।
🎓 अंडरफिटिंग और ओवरफिटिंग सामान्य समस्याएं हैं जो मॉडल की गुणवत्ता को कम करती हैं, क्योंकि मॉडल या तो ठीक से फिट नहीं होता या बहुत अधिक फिट हो जाता है। इससे मॉडल की भविष्यवाणियाँ या तो प्रशिक्षण डेटा के बहुत निकट होती हैं या बहुत दूर। एक ओवरफिट मॉडल प्रशिक्षण डेटा को बहुत अच्छी तरह से भविष्यवाणी करता है क्योंकि उसने डेटा के विवरण और शोर को बहुत अच्छी तरह सीख लिया है। एक अंडरफिट मॉडल सटीक नहीं होता क्योंकि वह न तो अपने प्रशिक्षण डेटा को और न ही अभी देखा नहीं गया डेटा को सही ढंग से विश्लेषित कर पाता है।
इन्फोग्राफिक Jen Looper द्वारा
पैरामीटर ट्यूनिंग
एक बार आपकी प्रारंभिक प्रशिक्षण प्रक्रिया पूरी हो जाने के बाद, मॉडल की गुणवत्ता पर नजर डालें और इसके 'हाइपरपैरामीटर' को सुधारने पर विचार करें। प्रक्रिया के बारे में और पढ़ें प्रलेखन में।
पूर्वानुमान
यह वह क्षण है जब आप पूरी तरह नए डेटा का उपयोग करके अपने मॉडल की सटीकता का परीक्षण कर सकते हैं। एक 'प्रयुक्त' ML सेटिंग में, जहां आप उत्पादन के लिए वेब संसाधन बना रहे होते हैं, यह प्रक्रिया उपयोगकर्ता इनपुट (उदाहरण के लिए, एक बटन प्रेस) एक वेरिएबल सेट करने और उसे पूर्वानुमान या मूल्यांकन के लिए मॉडल को भेजने को शामिल कर सकती है।
इन पाठों में, आप सीखेंगे कि इन चरणों का उपयोग कैसे करना है — तैयारी, निर्माण, परीक्षण, मूल्यांकन, और पूर्वानुमान लगाना — डेटा वैज्ञानिक के सभी कार्यों और अधिक के रूप में, जब आप एक 'फुल स्टैक' ML इंजीनियर बनने की यात्रा पर आगे बढ़ते हैं।
🚀चुनौती
एक फ्लो चार्ट बनाएं जो एक ML विशेषज्ञ के चरणों को दर्शाता हो। अब आप प्रक्रिया में खुद को कहाँ देखते हैं? आपको कहाँ कठिनाई होने की उम्मीद है? आपके लिए क्या आसान प्रतीत होता है?
पोस्ट-लेक्चर क्विज़
समीक्षा और स्वअध्ययन
ऑनलाइन खोजें उन डेटा वैज्ञानिकों के साक्षात्कार जिनमें वे अपने दैनिक कार्य के बारे में चर्चा करते हैं। यहाँ एक है।
असाइनमेंट
एक डेटा वैज्ञानिक का साक्षात्कार लें
अस्वीकरण:
यह दस्तावेज़ AI अनुवाद सेवा Co-op Translator का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता के लिए प्रयासरत हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या असंगतियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही आधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सलाह दी जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।

