|
|
4 weeks ago | |
|---|---|---|
| .. | ||
| README.md | 4 weeks ago | |
| assignment.md | 7 months ago | |
README.md
डेटा परिभाषित करना
![]() |
|---|
| डेटा परिभाषित करना - स्केचनोट द्वारा @nitya |
डेटा तथ्यों, जानकारी, अवलोकनों और मापों का समूह है जिसका उपयोग खोज करने और सूचित निर्णय लेने के लिए किया जाता है। एक डेटा पॉइंट डेटा का एक एकल यूनिट होता है जो एक डेटा सेट में होता है, जो डेटा पॉइंट्स का संग्रह होता है। डेटा सेट विभिन्न प्रारूपों और संरचनाओं में हो सकते हैं, और आमतौर पर इसके स्रोत या जहाँ से डेटा आया है, उस पर आधारित होते हैं। उदाहरण के लिए, एक कंपनी की मासिक आमदनी स्प्रेडशीट में हो सकती है लेकिन स्मार्टवॉच से हर घंटे की हृदय गति डेटा JSON प्रारूप में हो सकता है। यह सामान्य है कि डेटा वैज्ञानिक एक डेटा सेट के भीतर विभिन्न प्रकार के डेटा के साथ काम करते हैं।
यह पाठ डेटा की विशेषताओं और इसके स्रोतों के आधार पर डेटा की पहचान और वर्गीकरण पर केंद्रित है।
प्री-लेक्चर क्विज़
डेटा का वर्णन कैसे किया जाता है
कच्चा डेटा
कच्चा डेटा वह डेटा है जो अपने स्रोत से उसके प्रारंभिक स्थिति में आया है और जिसका विश्लेषण या संगठन नहीं किया गया है। यह समझने के लिए कि डेटा सेट में क्या हो रहा है, इसे एक ऐसे प्रारूप में व्यवस्थित करना आवश्यक होता है जिसे मनुष्य और तकनीक दोनों समझ सकें और आगे विश्लेषण कर सकें। डेटा सेट की संरचना यह बताती है कि यह कैसे व्यवस्थित है और इसे संरचित, असंरचित और अर्द्ध-संरचित के रूप में वर्गीकृत किया जा सकता है। इन संरचनात्मक प्रकारों में भिन्नता होती है, जो स्रोत पर निर्भर करती है लेकिन अंततः ये तीन श्रेणियों में फिट होती हैं।
मात्रात्मक डेटा
मात्रात्मक डेटा डेटा सेट के भीतर संख्यात्मक अवलोकन होते हैं और आमतौर पर इसका विश्लेषण, मापन और गणितीय उपयोग किया जा सकता है। मात्रात्मक डेटा के कुछ उदाहरण हैं: किसी देश की जनसंख्या, किसी व्यक्ति की ऊँचाई या किसी कंपनी की तिमाही आय। कुछ अतिरिक्त विश्लेषण के साथ, मात्रात्मक डेटा का उपयोग मौसम गुणवत्ता सूचकांक (AQI) के मौसमी रुझान खोजने या सामान्य कार्य दिवस में ट्रैफिक की संभावना का अनुमान लगाने के लिए किया जा सकता है।
गुणात्मक डेटा
गुणात्मक डेटा, जिसे श्रेणीबद्ध डेटा भी कहा जाता है, वह डेटा है जिसे मात्रात्मक डेटा के अवलोकनों की तरह वस्तुनिष्ठ रूप से मापा नहीं जा सकता। यह आमतौर पर विभिन्न प्रकार के व्यक्तिपरक डेटा होते हैं जो किसी वस्तु, जैसे किसी उत्पाद या प्रक्रिया की गुणवत्ता को कैप्चर करते हैं। कभी-कभी, गुणात्मक डेटा संख्यात्मक हो सकता है जिसे सामान्यतः गणितीय रूप से उपयोग नहीं किया जाता, जैसे फोन नंबर या टाइमस्टैम्प। गुणात्मक डेटा के कुछ उदाहरण हैं: वीडियो टिप्पणियाँ, कार का मॉडल और मेक, या आपके सबसे करीबी मित्रों का पसंदीदा रंग। गुणात्मक डेटा का उपयोग यह समझने के लिए किया जा सकता है कि उपभोक्ता कौन से उत्पाद सबसे अधिक पसंद करते हैं या नौकरी आवेदन रिज्यूमे में लोकप्रिय कीवर्ड की पहचान करने के लिए।
संरचित डेटा
संरचित डेटा वह डेटा होता है जो पंक्तियों और स्तंभों में व्यवस्थित होता है, जहाँ प्रत्येक पंक्ति में समान स्तंभ होते हैं। स्तंभ किसी विशेष प्रकार के मान का प्रतिनिधित्व करते हैं और एक नाम के साथ पहचाने जाते हैं जो बताता है कि मान क्या दर्शाता है, जबकि पंक्तियाँ वास्तविक मानों को रखती हैं। स्तंभों में अक्सर मानों के लिए विशिष्ट नियम या प्रतिबंध होते हैं, ताकि मान स्तंभ का सटीक प्रतिनिधित्व करें। उदाहरण के लिए, कल्पना कीजिए एक ग्राहक स्प्रेडशीट जिसमें प्रत्येक पंक्ति में फोन नंबर होना अनिवार्य है और फोन नंबरों में कभी भी अक्षर नहीं होते। फोन नंबर स्तंभ में नियम लागू हो सकते हैं जो सुनिश्चित करें कि वह खाली न हो और केवल संख्या ही हो।
संरचित डेटा का एक लाभ यह है कि इसे इस तरह व्यवस्थित किया जा सकता है कि यह अन्य संरचित डेटा से संबंधित हो सके। हालांकि, क्योंकि डेटा को एक विशिष्ट तरीके से व्यवस्थित करने के लिए डिज़ाइन किया गया है, इसकी संरचना में बदलाव करना काफी मेहनत का काम हो सकता है। उदाहरण के लिए, ग्राहक स्प्रेडशीट में एक ईमेल स्तंभ जोड़ना जो खाली नहीं हो सकता, इसका मतलब होगा कि आपको मौजूदा ग्राहकों की पंक्तियों में इन मानों को जोड़ने का तरीका खोजने की आवश्यकता होगी।
संरचित डेटा के उदाहरण: स्प्रेडशीट, रिलेशनल डेटाबेस, फोन नंबर, बैंक स्टेटमेंट्स
असंरचित डेटा
असंरचित डेटा आमतौर पर पंक्तियों या स्तंभों में वर्गीकृत नहीं किया जा सकता और इसका कोई विशेष प्रारूप या नियम नहीं होता जिसे पालन किया जाना चाहिए। क्योंकि असंरचित डेटा की संरचना पर कम प्रतिबंध होते हैं, इसलिए नया जानकारी जोड़ना आसान होता है, विशेष रूप से संरचित डेटा सेट की तुलना में। यदि कोई संवेदी यंत्र जो हर 2 मिनट में वायुमंडलीय दबाव पर डेटा कैप्चर करता है उसे अपडेट मिला है कि अब यह तापमान भी माप और रिकॉर्ड कर सकता है, तो असंरचित डेटा में मौजूदा डेटा को बदलने की आवश्यकता नहीं होती। हालांकि, इस प्रकार के डेटा का विश्लेषण या जांच अधिक समय ले सकती है। उदाहरण के लिए, एक वैज्ञानिक जो पिछले महीने के औसत तापमान को ज्ञात करना चाहता है, लेकिन पाता है कि सेंसर ने अपनी कुछ रिकॉर्ड की गई डेटा में "e" दर्ज किया है ताकि यह संकेत मिले कि यह टूटा हुआ था, जो दर्शाता है कि डेटा अधूरा है।
असंरचित डेटा के उदाहरण: टेक्स्ट फाइलें, टेक्स्ट मैसेज, वीडियो फाइलें
अर्द्ध-संरचित
अर्द्ध-संरचित डेटा में संरचित और असंरचित डेटा दोनों के गुण होते हैं। यह आमतौर पर पंक्तियों और स्तंभों के प्रारूप का पालन नहीं करता लेकिन इसे इस तरह व्यवस्थित किया जाता है जिसे संरचित माना जाता है और यह निश्चित प्रारूप या नियमों का पालन कर सकता है। संरचना स्रोतों के बीच भिन्न होती है, जैसे कि पूर्ण परिभाषित अनुक्रमणिका से लेकर कुछ अधिक लचीला जो नई जानकारी को आसानी से एकीकृत करने की अनुमति देता है। मेटाडेटा ऐसे संकेतक होते हैं जो यह तय करते हैं कि डेटा कैसे व्यवस्थित और संग्रहित किया गया है और इनके विभिन्न नाम हो सकते हैं, जो डेटा के प्रकार पर निर्भर करते हैं। मेटाडेटा के कुछ सामान्य नाम टैग, एलिमेंट्स, एंटिटीज़ और एट्रिब्यूट्स हैं। उदाहरण के लिए, एक आम ईमेल संदेश में विषय, मुख्य भाग और प्राप्तकर्ताओं का सेट होगा और इसे यह निर्धारित करने के लिए व्यवस्थित किया जा सकता है कि किसने और कब भेजा।
अर्द्ध-संरचित डेटा के उदाहरण: HTML, CSV फाइलें, JavaScript Object Notation (JSON)
डेटा के स्रोत
डेटा स्रोत वह प्रारंभिक स्थान होता है जहाँ डेटा उत्पन्न हुआ था, या जहाँ यह "रहता" है और यह इस बात पर निर्भर करता है कि इसे कैसे और कब एकत्रित किया गया था। उपयोगकर्ता द्वारा उत्पन्न डेटा को प्राथमिक डेटा कहा जाता है जबकि द्वितीयक डेटा उस स्रोत से आता है जिसने सामान्य उपयोग के लिए डेटा एकत्र किया है। उदाहरण के लिए, एक समूह जिसे वैज्ञानिक बारहमासी वन में अवलोकन एकत्र कर रहे हैं, उसे प्राथमिक माना जाएगा और यदि वे इसे अन्य वैज्ञानिकों के साथ साझा करने का निर्णय लेते हैं, तो इसका उपयोग करने वालों के लिए इसे द्वितीयक माना जाएगा।
डेटाबेस एक सामान्य स्रोत होते हैं और डेटा को होस्ट और बनाए रखने के लिए डेटाबेस प्रबंधन प्रणाली पर निर्भर करते हैं जहाँ उपयोगकर्ता डेटा का पता लगाने के लिए क्वेरी नामक कमांड का उपयोग करते हैं। डेटा स्रोत के रूप में फाइलें ऑडियो, छवि और वीडियो फाइलें हो सकती हैं साथ ही Excel जैसी स्प्रेडशीट भी हो सकती हैं। इंटरनेट स्रोत डेटा होस्ट करने के लिए एक सामान्य स्थान है जहाँ डेटाबेस के साथ फाइलें भी पाई जा सकती हैं। एप्लीकेशन प्रोग्रामिंग इंटरफेस, जिन्हें API भी कहा जाता है, प्रोग्रामरों को इंटरनेट के माध्यम से बाहरी उपयोगकर्ताओं के साथ डेटा साझा करने के तरीके बनाने की अनुमति देते हैं, जबकि वेब स्क्रैपिंग डेटा को वेब पेज से निकालने की प्रक्रिया है। वर्किंग विथ डेटा में पाठ विभिन्न डेटा स्रोतों का उपयोग कैसे करें इस पर ध्यान केंद्रित करते हैं।
निष्कर्ष
इस पाठ में हमने सीखा:
- डेटा क्या है
- डेटा का वर्णन कैसे किया जाता है
- डेटा को कैसे वर्गीकृत और श्रेणीबद्ध किया जाता है
- डेटा कहाँ पाया जा सकता है
🚀 चुनौती
Kaggle खुली डेटा सेट्स का एक उत्कृष्ट स्रोत है। डेटासेट खोज उपकरण का उपयोग करके कुछ दिलचस्प डेटा सेट खोजें और 3-5 डेटा सेट्स को इस मानदंड के साथ वर्गीकृत करें:
- क्या डेटा मात्रात्मक है या गुणात्मक?
- क्या डेटा संरचित, असंरचित, या अर्द्ध-संरचित है?
पोस्ट-लेक्चर क्विज़
समीक्षा और स्व-अध्ययन
- यह Microsoft Learn यूनिट, जिसका शीर्षक है डेटा प्रारूप की पहचान, संरचित, अर्द्ध-संरचित, और असंरचित डेटा का विस्तृत विवरण है।
असाइनमेंट
अस्वीकरण: इस दस्तावेज़ का अनुवाद AI अनुवाद सेवा Co-op Translator का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।
