You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/hi/1-Introduction/03-defining-data
localizeflow[bot] f6b3630c7e
[ja,ko,hi] chore(i18n): sync translations
4 weeks ago
..
README.md [ja,ko,hi] chore(i18n): sync translations 4 weeks ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 213 changes) 7 months ago

README.md

डेटा परिभाषित करना

 स्केचनोट द्वारा (@sketchthedocs)
डेटा परिभाषित करना - स्केचनोट द्वारा @nitya

डेटा तथ्यों, जानकारी, अवलोकनों और मापों का समूह है जिसका उपयोग खोज करने और सूचित निर्णय लेने के लिए किया जाता है। एक डेटा पॉइंट डेटा का एक एकल यूनिट होता है जो एक डेटा सेट में होता है, जो डेटा पॉइंट्स का संग्रह होता है। डेटा सेट विभिन्न प्रारूपों और संरचनाओं में हो सकते हैं, और आमतौर पर इसके स्रोत या जहाँ से डेटा आया है, उस पर आधारित होते हैं। उदाहरण के लिए, एक कंपनी की मासिक आमदनी स्प्रेडशीट में हो सकती है लेकिन स्मार्टवॉच से हर घंटे की हृदय गति डेटा JSON प्रारूप में हो सकता है। यह सामान्य है कि डेटा वैज्ञानिक एक डेटा सेट के भीतर विभिन्न प्रकार के डेटा के साथ काम करते हैं।

यह पाठ डेटा की विशेषताओं और इसके स्रोतों के आधार पर डेटा की पहचान और वर्गीकरण पर केंद्रित है।

प्री-लेक्चर क्विज़

डेटा का वर्णन कैसे किया जाता है

कच्चा डेटा

कच्चा डेटा वह डेटा है जो अपने स्रोत से उसके प्रारंभिक स्थिति में आया है और जिसका विश्लेषण या संगठन नहीं किया गया है। यह समझने के लिए कि डेटा सेट में क्या हो रहा है, इसे एक ऐसे प्रारूप में व्यवस्थित करना आवश्यक होता है जिसे मनुष्य और तकनीक दोनों समझ सकें और आगे विश्लेषण कर सकें। डेटा सेट की संरचना यह बताती है कि यह कैसे व्यवस्थित है और इसे संरचित, असंरचित और अर्द्ध-संरचित के रूप में वर्गीकृत किया जा सकता है। इन संरचनात्मक प्रकारों में भिन्नता होती है, जो स्रोत पर निर्भर करती है लेकिन अंततः ये तीन श्रेणियों में फिट होती हैं।

मात्रात्मक डेटा

मात्रात्मक डेटा डेटा सेट के भीतर संख्यात्मक अवलोकन होते हैं और आमतौर पर इसका विश्लेषण, मापन और गणितीय उपयोग किया जा सकता है। मात्रात्मक डेटा के कुछ उदाहरण हैं: किसी देश की जनसंख्या, किसी व्यक्ति की ऊँचाई या किसी कंपनी की तिमाही आय। कुछ अतिरिक्त विश्लेषण के साथ, मात्रात्मक डेटा का उपयोग मौसम गुणवत्ता सूचकांक (AQI) के मौसमी रुझान खोजने या सामान्य कार्य दिवस में ट्रैफिक की संभावना का अनुमान लगाने के लिए किया जा सकता है।

गुणात्मक डेटा

गुणात्मक डेटा, जिसे श्रेणीबद्ध डेटा भी कहा जाता है, वह डेटा है जिसे मात्रात्मक डेटा के अवलोकनों की तरह वस्तुनिष्ठ रूप से मापा नहीं जा सकता। यह आमतौर पर विभिन्न प्रकार के व्यक्तिपरक डेटा होते हैं जो किसी वस्तु, जैसे किसी उत्पाद या प्रक्रिया की गुणवत्ता को कैप्चर करते हैं। कभी-कभी, गुणात्मक डेटा संख्यात्मक हो सकता है जिसे सामान्यतः गणितीय रूप से उपयोग नहीं किया जाता, जैसे फोन नंबर या टाइमस्टैम्प। गुणात्मक डेटा के कुछ उदाहरण हैं: वीडियो टिप्पणियाँ, कार का मॉडल और मेक, या आपके सबसे करीबी मित्रों का पसंदीदा रंग। गुणात्मक डेटा का उपयोग यह समझने के लिए किया जा सकता है कि उपभोक्ता कौन से उत्पाद सबसे अधिक पसंद करते हैं या नौकरी आवेदन रिज्यूमे में लोकप्रिय कीवर्ड की पहचान करने के लिए।

संरचित डेटा

संरचित डेटा वह डेटा होता है जो पंक्तियों और स्तंभों में व्यवस्थित होता है, जहाँ प्रत्येक पंक्ति में समान स्तंभ होते हैं। स्तंभ किसी विशेष प्रकार के मान का प्रतिनिधित्व करते हैं और एक नाम के साथ पहचाने जाते हैं जो बताता है कि मान क्या दर्शाता है, जबकि पंक्तियाँ वास्तविक मानों को रखती हैं। स्तंभों में अक्सर मानों के लिए विशिष्ट नियम या प्रतिबंध होते हैं, ताकि मान स्तंभ का सटीक प्रतिनिधित्व करें। उदाहरण के लिए, कल्पना कीजिए एक ग्राहक स्प्रेडशीट जिसमें प्रत्येक पंक्ति में फोन नंबर होना अनिवार्य है और फोन नंबरों में कभी भी अक्षर नहीं होते। फोन नंबर स्तंभ में नियम लागू हो सकते हैं जो सुनिश्चित करें कि वह खाली न हो और केवल संख्या ही हो।

संरचित डेटा का एक लाभ यह है कि इसे इस तरह व्यवस्थित किया जा सकता है कि यह अन्य संरचित डेटा से संबंधित हो सके। हालांकि, क्योंकि डेटा को एक विशिष्ट तरीके से व्यवस्थित करने के लिए डिज़ाइन किया गया है, इसकी संरचना में बदलाव करना काफी मेहनत का काम हो सकता है। उदाहरण के लिए, ग्राहक स्प्रेडशीट में एक ईमेल स्तंभ जोड़ना जो खाली नहीं हो सकता, इसका मतलब होगा कि आपको मौजूदा ग्राहकों की पंक्तियों में इन मानों को जोड़ने का तरीका खोजने की आवश्यकता होगी।

संरचित डेटा के उदाहरण: स्प्रेडशीट, रिलेशनल डेटाबेस, फोन नंबर, बैंक स्टेटमेंट्स

असंरचित डेटा

असंरचित डेटा आमतौर पर पंक्तियों या स्तंभों में वर्गीकृत नहीं किया जा सकता और इसका कोई विशेष प्रारूप या नियम नहीं होता जिसे पालन किया जाना चाहिए। क्योंकि असंरचित डेटा की संरचना पर कम प्रतिबंध होते हैं, इसलिए नया जानकारी जोड़ना आसान होता है, विशेष रूप से संरचित डेटा सेट की तुलना में। यदि कोई संवेदी यंत्र जो हर 2 मिनट में वायुमंडलीय दबाव पर डेटा कैप्चर करता है उसे अपडेट मिला है कि अब यह तापमान भी माप और रिकॉर्ड कर सकता है, तो असंरचित डेटा में मौजूदा डेटा को बदलने की आवश्यकता नहीं होती। हालांकि, इस प्रकार के डेटा का विश्लेषण या जांच अधिक समय ले सकती है। उदाहरण के लिए, एक वैज्ञानिक जो पिछले महीने के औसत तापमान को ज्ञात करना चाहता है, लेकिन पाता है कि सेंसर ने अपनी कुछ रिकॉर्ड की गई डेटा में "e" दर्ज किया है ताकि यह संकेत मिले कि यह टूटा हुआ था, जो दर्शाता है कि डेटा अधूरा है।

असंरचित डेटा के उदाहरण: टेक्स्ट फाइलें, टेक्स्ट मैसेज, वीडियो फाइलें

अर्द्ध-संरचित

अर्द्ध-संरचित डेटा में संरचित और असंरचित डेटा दोनों के गुण होते हैं। यह आमतौर पर पंक्तियों और स्तंभों के प्रारूप का पालन नहीं करता लेकिन इसे इस तरह व्यवस्थित किया जाता है जिसे संरचित माना जाता है और यह निश्चित प्रारूप या नियमों का पालन कर सकता है। संरचना स्रोतों के बीच भिन्न होती है, जैसे कि पूर्ण परिभाषित अनुक्रमणिका से लेकर कुछ अधिक लचीला जो नई जानकारी को आसानी से एकीकृत करने की अनुमति देता है। मेटाडेटा ऐसे संकेतक होते हैं जो यह तय करते हैं कि डेटा कैसे व्यवस्थित और संग्रहित किया गया है और इनके विभिन्न नाम हो सकते हैं, जो डेटा के प्रकार पर निर्भर करते हैं। मेटाडेटा के कुछ सामान्य नाम टैग, एलिमेंट्स, एंटिटीज़ और एट्रिब्यूट्स हैं। उदाहरण के लिए, एक आम ईमेल संदेश में विषय, मुख्य भाग और प्राप्तकर्ताओं का सेट होगा और इसे यह निर्धारित करने के लिए व्यवस्थित किया जा सकता है कि किसने और कब भेजा।

अर्द्ध-संरचित डेटा के उदाहरण: HTML, CSV फाइलें, JavaScript Object Notation (JSON)

डेटा के स्रोत

डेटा स्रोत वह प्रारंभिक स्थान होता है जहाँ डेटा उत्पन्न हुआ था, या जहाँ यह "रहता" है और यह इस बात पर निर्भर करता है कि इसे कैसे और कब एकत्रित किया गया था। उपयोगकर्ता द्वारा उत्पन्न डेटा को प्राथमिक डेटा कहा जाता है जबकि द्वितीयक डेटा उस स्रोत से आता है जिसने सामान्य उपयोग के लिए डेटा एकत्र किया है। उदाहरण के लिए, एक समूह जिसे वैज्ञानिक बारहमासी वन में अवलोकन एकत्र कर रहे हैं, उसे प्राथमिक माना जाएगा और यदि वे इसे अन्य वैज्ञानिकों के साथ साझा करने का निर्णय लेते हैं, तो इसका उपयोग करने वालों के लिए इसे द्वितीयक माना जाएगा।

डेटाबेस एक सामान्य स्रोत होते हैं और डेटा को होस्ट और बनाए रखने के लिए डेटाबेस प्रबंधन प्रणाली पर निर्भर करते हैं जहाँ उपयोगकर्ता डेटा का पता लगाने के लिए क्वेरी नामक कमांड का उपयोग करते हैं। डेटा स्रोत के रूप में फाइलें ऑडियो, छवि और वीडियो फाइलें हो सकती हैं साथ ही Excel जैसी स्प्रेडशीट भी हो सकती हैं। इंटरनेट स्रोत डेटा होस्ट करने के लिए एक सामान्य स्थान है जहाँ डेटाबेस के साथ फाइलें भी पाई जा सकती हैं। एप्लीकेशन प्रोग्रामिंग इंटरफेस, जिन्हें API भी कहा जाता है, प्रोग्रामरों को इंटरनेट के माध्यम से बाहरी उपयोगकर्ताओं के साथ डेटा साझा करने के तरीके बनाने की अनुमति देते हैं, जबकि वेब स्क्रैपिंग डेटा को वेब पेज से निकालने की प्रक्रिया है। वर्किंग विथ डेटा में पाठ विभिन्न डेटा स्रोतों का उपयोग कैसे करें इस पर ध्यान केंद्रित करते हैं।

निष्कर्ष

इस पाठ में हमने सीखा:

  • डेटा क्या है
  • डेटा का वर्णन कैसे किया जाता है
  • डेटा को कैसे वर्गीकृत और श्रेणीबद्ध किया जाता है
  • डेटा कहाँ पाया जा सकता है

🚀 चुनौती

Kaggle खुली डेटा सेट्स का एक उत्कृष्ट स्रोत है। डेटासेट खोज उपकरण का उपयोग करके कुछ दिलचस्प डेटा सेट खोजें और 3-5 डेटा सेट्स को इस मानदंड के साथ वर्गीकृत करें:

  • क्या डेटा मात्रात्मक है या गुणात्मक?
  • क्या डेटा संरचित, असंरचित, या अर्द्ध-संरचित है?

पोस्ट-लेक्चर क्विज़

समीक्षा और स्व-अध्ययन

  • यह Microsoft Learn यूनिट, जिसका शीर्षक है डेटा प्रारूप की पहचान, संरचित, अर्द्ध-संरचित, और असंरचित डेटा का विस्तृत विवरण है।

असाइनमेंट

डेटासेट वर्गीकरण


अस्वीकरण: इस दस्तावेज़ का अनुवाद AI अनुवाद सेवा Co-op Translator का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।