You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/hi/1-Introduction/01-defining-data-science
localizeflow[bot] ce373b3975
chore(i18n): sync translations with latest source changes (chunk 1/1, 69 changes)
5 months ago
..
solution chore(i18n): sync translations with latest source changes (chunk 1/1, 69 changes) 5 months ago
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 69 changes) 5 months ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 213 changes) 6 months ago
notebook.ipynb chore(i18n): sync translations with latest source changes (chunk 1/1, 69 changes) 5 months ago

README.md

डेटा साइंस की परिभाषा

 स्केच नोट (@sketchthedocs) द्वारा
डेटा साइंस की परिभाषा - @nitya द्वारा स्केच नोट

डेटा साइंस की परिभाषा वीडियो

प्री-लेक्चर क्विज़

डेटा क्या है?

हमारे रोज़मर्रा के जीवन में, हम हमेशा डेटा से घिरे रहते हैं। आप जो पाठ अभी पढ़ रहे हैं, वह भी डेटा है। आपके स्मार्टफोन में आपके दोस्तों के फोन नंबरों की सूची डेटा है, और आपकी घड़ी पर दिखने वाला वर्तमान समय भी डेटा है। मनुष्य के रूप में, हम स्वाभाविक रूप से डेटा के साथ काम करते हैं, जैसे कि हमारे पास कितना पैसा है इसे गिनना या अपने दोस्तों को पत्र लिखना।

हालांकि, कंप्यूटर के निर्माण के साथ डेटा बहुत अधिक महत्वपूर्ण हो गया। कंप्यूटर का मुख्य कार्य गणना करना है, लेकिन उन्हें काम करने के लिए डेटा की आवश्यकता होती है। इसलिए, हमें यह समझने की आवश्यकता है कि कंप्यूटर डेटा को कैसे संग्रहीत और संसाधित करते हैं।

इंटरनेट के आगमन के साथ, डेटा को संभालने वाले उपकरणों के रूप में कंप्यूटर की भूमिका बढ़ गई। अगर आप सोचें, तो अब हम कंप्यूटर का उपयोग गणना के बजाय डेटा प्रोसेसिंग और संचार के लिए अधिक करते हैं। जब हम किसी दोस्त को ई-मेल लिखते हैं या इंटरनेट पर कुछ जानकारी खोजते हैं - तो हम मूल रूप से डेटा बना रहे हैं, संग्रहीत कर रहे हैं, संचारित कर रहे हैं और हेरफेर कर रहे हैं।

क्या आप याद कर सकते हैं कि आपने आखिरी बार कंप्यूटर का उपयोग वास्तव में कुछ गणना करने के लिए कब किया था?

डेटा साइंस क्या है?

विकिपीडिया में, डेटा साइंस को एक वैज्ञानिक क्षेत्र के रूप में परिभाषित किया गया है जो संरचित और असंरचित डेटा से ज्ञान और अंतर्दृष्टि निकालने के लिए वैज्ञानिक विधियों का उपयोग करता है, और डेटा से प्राप्त ज्ञान और क्रियाशील अंतर्दृष्टि को विभिन्न अनुप्रयोग क्षेत्रों में लागू करता है।

इस परिभाषा में डेटा साइंस के निम्नलिखित महत्वपूर्ण पहलुओं को उजागर किया गया है:

  • डेटा साइंस का मुख्य लक्ष्य डेटा से ज्ञान निकालना है, दूसरे शब्दों में - डेटा को समझना, कुछ छिपे हुए संबंधों को खोजना और एक मॉडल बनाना।
  • डेटा साइंस वैज्ञानिक विधियों का उपयोग करता है, जैसे कि संभावना और सांख्यिकी। वास्तव में, जब डेटा साइंस शब्द पहली बार पेश किया गया था, तो कुछ लोगों ने तर्क दिया कि डेटा साइंस केवल सांख्यिकी के लिए एक नया आकर्षक नाम है। आजकल यह स्पष्ट हो गया है कि यह क्षेत्र बहुत व्यापक है।
  • प्राप्त ज्ञान को कुछ क्रियाशील अंतर्दृष्टि उत्पन्न करने के लिए लागू किया जाना चाहिए, यानी व्यावहारिक अंतर्दृष्टि जिसे आप वास्तविक व्यावसायिक स्थितियों में लागू कर सकते हैं।
  • हमें संरचित और असंरचित दोनों डेटा पर काम करने में सक्षम होना चाहिए। हम इस पाठ्यक्रम में बाद में विभिन्न प्रकार के डेटा पर चर्चा करेंगे।
  • अनुप्रयोग क्षेत्र एक महत्वपूर्ण अवधारणा है, और डेटा वैज्ञानिकों को अक्सर समस्या क्षेत्र में कम से कम कुछ हद तक विशेषज्ञता की आवश्यकता होती है, उदाहरण के लिए: वित्त, चिकित्सा, विपणन, आदि।

डेटा साइंस का एक और महत्वपूर्ण पहलू यह है कि यह अध्ययन करता है कि डेटा को कंप्यूटर का उपयोग करके कैसे एकत्रित, संग्रहीत और संचालित किया जा सकता है। जबकि सांख्यिकी हमें गणितीय नींव प्रदान करता है, डेटा साइंस गणितीय अवधारणाओं को लागू करता है ताकि वास्तव में डेटा से अंतर्दृष्टि प्राप्त की जा सके।

जिम ग्रे के अनुसार, डेटा साइंस को विज्ञान के एक अलग प्रतिमान के रूप में देखा जा सकता है:

  • अनुभवजन्य, जिसमें हम मुख्य रूप से अवलोकन और प्रयोगों के परिणामों पर निर्भर करते हैं।
  • सैद्धांतिक, जहां नए अवधारणाएं मौजूदा वैज्ञानिक ज्ञान से उत्पन्न होती हैं।
  • गणनात्मक, जहां हम कुछ गणनात्मक प्रयोगों के आधार पर नए सिद्धांतों की खोज करते हैं।
  • डेटा-आधारित, जो डेटा में संबंधों और पैटर्न की खोज पर आधारित है।

अन्य संबंधित क्षेत्र

चूंकि डेटा सर्वव्यापी है, डेटा साइंस स्वयं भी एक व्यापक क्षेत्र है, जो कई अन्य विषयों को छूता है।

डेटाबेस
एक महत्वपूर्ण विचार यह है कि डेटा को कैसे संग्रहीत किया जाए, यानी इसे इस तरह से संरचित करना जो तेज़ प्रसंस्करण की अनुमति देता है। संरचित और असंरचित डेटा को संग्रहीत करने के लिए विभिन्न प्रकार के डेटाबेस हैं, जिन्हें हम अपने पाठ्यक्रम में विचार करेंगे
बिग डेटा
अक्सर हमें बहुत बड़ी मात्रा में डेटा को संग्रहीत और संसाधित करने की आवश्यकता होती है जिसमें अपेक्षाकृत सरल संरचना होती है। उस डेटा को कंप्यूटर क्लस्टर पर वितरित तरीके से संग्रहीत करने और इसे कुशलतापूर्वक संसाधित करने के लिए विशेष दृष्टिकोण और उपकरण हैं।
मशीन लर्निंग
डेटा को समझने का एक तरीका यह है कि एक मॉडल बनाएं जो वांछित परिणाम की भविष्यवाणी करने में सक्षम हो। डेटा से मॉडल विकसित करना मशीन लर्निंग कहलाता है। आप हमारे मशीन लर्निंग फॉर बिगिनर्स पाठ्यक्रम को देख सकते हैं ताकि इसके बारे में अधिक जान सकें।
कृत्रिम बुद्धिमत्ता
मशीन लर्निंग का एक क्षेत्र जिसे कृत्रिम बुद्धिमत्ता (AI) कहा जाता है, भी डेटा पर निर्भर करता है, और इसमें उच्च जटिलता वाले मॉडल बनाना शामिल है जो मानव विचार प्रक्रियाओं की नकल करते हैं। एआई विधियां अक्सर हमें असंरचित डेटा (जैसे प्राकृतिक भाषा) को संरचित अंतर्दृष्टि में बदलने की अनुमति देती हैं।
विज़ुअलाइज़ेशन
बहुत अधिक डेटा मानव के लिए समझने योग्य नहीं होता है, लेकिन एक बार जब हम उस डेटा का उपयोग करके उपयोगी विज़ुअलाइज़ेशन बनाते हैं, तो हम डेटा को बेहतर तरीके से समझ सकते हैं और कुछ निष्कर्ष निकाल सकते हैं। इसलिए, जानकारी को विज़ुअलाइज़ करने के कई तरीकों को जानना महत्वपूर्ण है - कुछ ऐसा जिसे हम अपने पाठ्यक्रम के सेक्शन 3 में कवर करेंगे। संबंधित क्षेत्रों में इन्फोग्राफिक्स और सामान्य रूप से मानव-कंप्यूटर इंटरैक्शन शामिल हैं।

डेटा के प्रकार

जैसा कि हमने पहले ही उल्लेख किया है, डेटा हर जगह है। हमें बस इसे सही तरीके से कैप्चर करना है! संरचित और असंरचित डेटा के बीच अंतर करना उपयोगी है। पहला आमतौर पर किसी अच्छी तरह से संरचित रूप में प्रस्तुत किया जाता है, अक्सर एक तालिका या कई तालिकाओं के रूप में, जबकि दूसरा केवल फाइलों का संग्रह होता है। कभी-कभी हम अर्ध-संरचित डेटा के बारे में भी बात कर सकते हैं, जिसमें कुछ प्रकार की संरचना होती है जो बहुत भिन्न हो सकती है।

संरचित अर्ध-संरचित असंरचित
लोगों की सूची उनके फोन नंबरों के साथ लिंक के साथ विकिपीडिया पेज एनसाइक्लोपीडिया ब्रिटानिका का पाठ
पिछले 20 वर्षों में हर मिनट में एक इमारत के सभी कमरों में तापमान JSON प्रारूप में वैज्ञानिक पत्रों का संग्रह जिसमें लेखक, प्रकाशन की तारीख और सारांश शामिल हैं कॉर्पोरेट दस्तावेजों के साथ फ़ाइल शेयर
इमारत में प्रवेश करने वाले सभी लोगों की उम्र और लिंग का डेटा इंटरनेट पेज निगरानी कैमरे से कच्चा वीडियो फीड

डेटा कहां से प्राप्त करें

डेटा के कई संभावित स्रोत हैं, और उन्हें सूचीबद्ध करना असंभव होगा! हालांकि, आइए कुछ सामान्य स्थानों का उल्लेख करें जहां आप डेटा प्राप्त कर सकते हैं:

  • संरचित
    • इंटरनेट ऑफ थिंग्स (IoT), जिसमें विभिन्न सेंसरों से डेटा शामिल है, जैसे तापमान या दबाव सेंसर, बहुत उपयोगी डेटा प्रदान करते हैं। उदाहरण के लिए, यदि एक कार्यालय भवन IoT सेंसर से सुसज्जित है, तो हम लागत को कम करने के लिए हीटिंग और लाइटिंग को स्वचालित रूप से नियंत्रित कर सकते हैं।
    • सर्वेक्षण जो हम उपयोगकर्ताओं से खरीदारी के बाद या वेबसाइट पर जाने के बाद पूरा करने के लिए कहते हैं।
    • व्यवहार का विश्लेषण उदाहरण के लिए, हमें यह समझने में मदद कर सकता है कि उपयोगकर्ता साइट में कितनी गहराई तक जाते हैं, और साइट छोड़ने का सामान्य कारण क्या है।
  • असंरचित
    • पाठ अंतर्दृष्टि का एक समृद्ध स्रोत हो सकता है, जैसे समग्र भावना स्कोर, या कीवर्ड और अर्थ निकालना।
    • छवियां या वीडियो। निगरानी कैमरे से एक वीडियो का उपयोग सड़क पर यातायात का अनुमान लगाने और लोगों को संभावित ट्रैफिक जाम के बारे में सूचित करने के लिए किया जा सकता है।
    • वेब सर्वर लॉग्स का उपयोग यह समझने के लिए किया जा सकता है कि हमारी साइट के कौन से पेज सबसे अधिक बार देखे जाते हैं, और कितने समय तक।
  • अर्ध-संरचित
    • सोशल नेटवर्क ग्राफ उपयोगकर्ता व्यक्तित्व और जानकारी फैलाने में संभावित प्रभावशीलता के बारे में डेटा के महान स्रोत हो सकते हैं।
    • जब हमारे पास पार्टी से तस्वीरों का एक गुच्छा होता है, तो हम लोगों के एक-दूसरे के साथ तस्वीरें लेने का ग्राफ बनाकर समूह गतिशीलता डेटा निकालने की कोशिश कर सकते हैं।

विभिन्न संभावित डेटा स्रोतों को जानकर, आप विभिन्न परिदृश्यों के बारे में सोच सकते हैं जहां डेटा साइंस तकनीकों का उपयोग स्थिति को बेहतर तरीके से जानने और व्यावसायिक प्रक्रियाओं में सुधार करने के लिए किया जा सकता है।

डेटा के साथ आप क्या कर सकते हैं

डेटा साइंस में, हम डेटा यात्रा के निम्नलिखित चरणों पर ध्यान केंद्रित करते हैं:

1) डेटा अधिग्रहण
पहला कदम डेटा एकत्र करना है। जबकि कई मामलों में यह एक सीधा प्रक्रिया हो सकती है, जैसे कि वेब एप्लिकेशन से डेटाबेस में डेटा आना, कभी-कभी हमें विशेष तकनीकों का उपयोग करने की आवश्यकता होती है। उदाहरण के लिए, IoT सेंसर से डेटा भारी हो सकता है, और यह एक अच्छा अभ्यास है कि सभी डेटा को आगे की प्रक्रिया से पहले एकत्र करने के लिए बफरिंग एंडपॉइंट्स जैसे IoT हब का उपयोग करें।
2) डेटा संग्रहण
डेटा को संग्रहीत करना चुनौतीपूर्ण हो सकता है, खासकर यदि हम बड़े डेटा की बात कर रहे हैं। यह तय करते समय कि डेटा को कैसे संग्रहीत किया जाए, यह अनुमान लगाना समझ में आता है कि आप भविष्य में डेटा को कैसे क्वेरी करना चाहेंगे। डेटा को संग्रहीत करने के कई तरीके हैं:
  • एक रिलेशनल डेटाबेस तालिकाओं का संग्रह संग्रहीत करता है, और उन्हें क्वेरी करने के लिए SQL नामक एक विशेष भाषा का उपयोग करता है। आमतौर पर, तालिकाओं को विभिन्न समूहों में व्यवस्थित किया जाता है जिन्हें स्कीमा कहा जाता है। कई मामलों में हमें डेटा को मूल रूप से स्कीमा में फिट करने के लिए परिवर्तित करने की आवश्यकता होती है।
  • एक NoSQL डेटाबेस, जैसे CosmosDB, डेटा पर स्कीमा लागू नहीं करता है, और अधिक जटिल डेटा संग्रहीत करने की अनुमति देता है, उदाहरण के लिए, पदानुक्रमित JSON दस्तावेज़ या ग्राफ। हालांकि, NoSQL डेटाबेस में SQL की समृद्ध क्वेरी क्षमताएं नहीं होती हैं, और वे संदर्भीय अखंडता को लागू नहीं कर सकते हैं, यानी तालिकाओं में डेटा कैसे संरचित है और तालिकाओं के बीच संबंधों को नियंत्रित करने वाले नियम।
  • डेटा लेक संग्रहण कच्चे, असंरचित रूप में डेटा के बड़े संग्रह के लिए उपयोग किया जाता है। डेटा लेक का अक्सर बड़े डेटा के साथ उपयोग किया जाता है, जहां सभी डेटा एक मशीन में फिट नहीं हो सकता है, और इसे सर्वरों के क्लस्टर द्वारा संग्रहीत और संसाधित किया जाना चाहिए। Parquet डेटा प्रारूप है जो अक्सर बड़े डेटा के साथ उपयोग किया जाता है।
3) डेटा प्रसंस्करण
यह डेटा यात्रा का सबसे रोमांचक हिस्सा है, जिसमें डेटा को उसके मूल रूप से उस रूप में बदलना शामिल है जिसे विज़ुअलाइज़ेशन/मॉडल प्रशिक्षण के लिए उपयोग किया जा सकता है। असंरचित डेटा जैसे पाठ या छवियों से निपटने के दौरान, हमें डेटा से विशेषताएं निकालने के लिए कुछ एआई तकनीकों का उपयोग करने की आवश्यकता हो सकती है, इस प्रकार इसे संरचित रूप में बदलना।
4) विज़ुअलाइज़ेशन / मानव अंतर्दृष्टि
अक्सर, डेटा को समझने के लिए, हमें इसे विज़ुअलाइज़ करने की आवश्यकता होती है। हमारे टूलबॉक्स में कई अलग-अलग विज़ुअलाइज़ेशन तकनीकों के साथ, हम अंतर्दृष्टि प्राप्त करने के लिए सही दृश्य पा सकते हैं। अक्सर, एक डेटा वैज्ञानिक को "डेटा के साथ खेलना" होता है, इसे कई बार विज़ुअलाइज़ करना और कुछ संबंधों की तलाश करना। इसके अलावा, हम सांख्यिकीय तकनीकों का उपयोग करके एक परिकल्पना का परीक्षण कर सकते हैं या डेटा के विभिन्न टुकड़ों के बीच सहसंबंध साबित कर सकते हैं।
5) एक भविष्यवाणी मॉडल का प्रशिक्षण
क्योंकि डेटा साइंस का अंतिम लक्ष्य डेटा के आधार पर निर्णय लेने में सक्षम होना है, हम मशीन लर्निंग की तकनीकों का उपयोग करके एक भविष्यवाणी मॉडल बनाना चाह सकते हैं। हम फिर इसका उपयोग समान संरचनाओं वाले नए डेटा सेट का उपयोग करके भविष्यवाणी करने के लिए कर सकते हैं।

बेशक, वास्तविक डेटा के आधार पर, कुछ चरण गायब हो सकते हैं (जैसे, जब हमारे पास पहले से ही डेटाबेस में डेटा होता है, या जब हमें मॉडल प्रशिक्षण की आवश्यकता नहीं होती है), या कुछ चरणों को कई बार दोहराया जा सकता है (जैसे डेटा प्रसंस्करण)।

डिजिटलीकरण और डिजिटल परिवर्तन

पिछले दशक में, कई व्यवसायों ने व्यापार निर्णय लेने में डेटा के महत्व को समझना शुरू कर दिया। व्यवसाय चलाने के लिए डेटा साइंस सिद्धांतों को लागू करने के लिए, पहले कुछ डेटा एकत्र करना आवश्यक है, यानी व्यापार प्रक्रियाओं को डिजिटल रूप में अनुवाद करना। इसे डिजिटलीकरण के रूप में जाना जाता है। इस डेटा पर डेटा साइंस तकनीकों को लागू करना निर्णयों को मार्गदर्शन करने के लिए महत्वपूर्ण उत्पादकता वृद्धि (या यहां तक कि व्यवसाय पिवट) का कारण बन सकता है, जिसे डिजिटल परिवर्तन कहा जाता है।

आइए एक उदाहरण पर विचार करें। मान लें कि हमारे पास एक डेटा साइंस पाठ्यक्रम है (जैसे यह) जिसे हम छात्रों को ऑनलाइन वितरित करते हैं, और हम इसे सुधारने के लिए डेटा साइंस का उपयोग करना चाहते हैं। हम इसे कैसे कर सकते हैं?

हम "क्या डिजिटलीकृत किया जा सकता है?" पूछकर शुरू कर सकते हैं। सबसे सरल तरीका यह होगा कि प्रत्येक छात्र को प्रत्येक मॉड्यूल को पूरा करने में लगने वाले समय को मापा जाए, और प्रत्येक मॉड्यूल के अंत में एक बहुविकल्पीय परीक्षण देकर प्राप्त ज्ञान को मापा जाए। सभी छात्रों के बीच औसत समय-से-पूर्णता को मापकर, हम यह पता लगा सकते हैं कि कौन से मॉड्यूल छात्रों के लिए सबसे अधिक कठिनाइयों का कारण बनते हैं, और उन्हें सरल बनाने पर काम कर सकते हैं।

आप तर्क कर सकते हैं कि यह दृष्टिकोण आदर्श नहीं है, क्योंकि मॉड्यूल्स की लंबाई अलग-अलग हो सकती है। शायद समय को मॉड्यूल की लंबाई (अक्षरों की संख्या में) के हिसाब से विभाजित करना और उन मानों की तुलना करना अधिक उचित होगा।

जब हम बहुविकल्पीय परीक्षणों के परिणामों का विश्लेषण करना शुरू करते हैं, तो हम यह पता लगाने की कोशिश कर सकते हैं कि कौन से अवधारणाओं को समझने में छात्रों को कठिनाई होती है, और उस जानकारी का उपयोग सामग्री को बेहतर बनाने के लिए कर सकते हैं। ऐसा करने के लिए, हमें परीक्षणों को इस तरह से डिज़ाइन करना होगा कि प्रत्येक प्रश्न किसी विशेष अवधारणा या ज्ञान के हिस्से से जुड़ा हो।

अगर हम इसे और भी जटिल बनाना चाहते हैं, तो हम प्रत्येक मॉड्यूल के लिए लिया गया समय छात्रों की आयु श्रेणी के साथ तुलना कर सकते हैं। हमें यह पता चल सकता है कि कुछ आयु श्रेणियों के लिए मॉड्यूल पूरा करने में अनुचित रूप से अधिक समय लगता है, या छात्र इसे पूरा करने से पहले ही छोड़ देते हैं। यह हमें मॉड्यूल के लिए आयु अनुशंसाएँ प्रदान करने में मदद कर सकता है और गलत अपेक्षाओं से लोगों की असंतोष को कम कर सकता है।

🚀 चुनौती

इस चुनौती में, हम डेटा साइंस के क्षेत्र से संबंधित अवधारणाओं को खोजने की कोशिश करेंगे, और इसके लिए हम टेक्स्ट का विश्लेषण करेंगे। हम डेटा साइंस पर एक विकिपीडिया लेख लेंगे, टेक्स्ट को डाउनलोड और प्रोसेस करेंगे, और फिर एक वर्ड क्लाउड बनाएंगे, जो इस तरह दिखेगा:

डेटा साइंस के लिए वर्ड क्लाउड

कोड को पढ़ने के लिए notebook.ipynb पर जाएं। आप कोड को चला सकते हैं और देख सकते हैं कि यह वास्तविक समय में सभी डेटा ट्रांसफॉर्मेशन कैसे करता है।

अगर आपको Jupyter Notebook में कोड चलाना नहीं आता है, तो इस लेख को देखें।

पोस्ट-लेक्चर क्विज़

असाइनमेंट्स

क्रेडिट्स

यह पाठ ♥️ के साथ Dmitry Soshnikov द्वारा लिखा गया है।


अस्वीकरण:
यह दस्तावेज़ AI अनुवाद सेवा Co-op Translator का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवाद में त्रुटियां या अशुद्धियां हो सकती हैं। मूल भाषा में दस्तावेज़ को आधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।