|
|
4 weeks ago | |
|---|---|---|
| .. | ||
| README.md | 4 weeks ago | |
| assignment.md | 7 months ago | |
README.md
डेटा परिभाषित करणे
![]() |
|---|
| डेटा परिभाषित करणे - Sketchnote by @nitya |
डेटा म्हणजे तथ्ये, माहिती, निरीक्षणे आणि मोजमाप जे शोध लावण्यासाठी आणि सूचित निर्णयांना आधार देण्यासाठी वापरले जातात. एक डेटा पॉइंट म्हणजे डेटासेटमधील एकल डेटा युनिट, जे डेटा पॉइंट्सचा संच असतो. डेटासेट विविध स्वरूपांमध्ये आणि रचनांमध्ये येऊ शकतात, आणि सहसा ते त्याच्या स्त्रोतावर किंवा डेटा कुठून आला आहे यावर आधारित असते. उदाहरणार्थ, एखाद्या कंपनीचे मासिक उत्पन्न स्प्रेडशीटमध्ये असू शकते, तर स्मार्टवॉचमधील तासाचा हृदय गती डेटा JSON स्वरूपात असू शकतो. डेटासायंटिस्टसाठी डेटासेटमधील वेगवेगळ्या प्रकारच्या डेटासोबत काम करणे सामान्य आहे.
हा धडा डेटाच्या वैशिष्ट्यांनुसार आणि त्याच्या स्त्रोतांनुसार डेटा ओळखणे आणि वर्गीकृत करण्यात केंद्रित आहे.
पूर्व व्याख्यान क्विझ
डेटा कसा वर्णन केला जातो
कच्चा डेटा
कच्चा डेटा म्हणजे स्त्रोताकडून आलेला प्रारंभिक स्थितीतला डेटा जो विश्लेषित किंवा संघटित केलेला नाही. डेटासेटमध्ये काय सुरू आहे हे समजून घेण्यासाठी, असा डेटा मनुष्य आणि वापरातील तंत्रज्ञानाने समजण्यासारख्या स्वरूपात संघटित करणे आवश्यक असते. डेटासेटची रचना कशी संघटित आहे हे वर्णन करते आणि ती संरचित, असंरचित आणि अर्ध-संरचित अशा प्रकारांमध्ये वर्गीकृत केली जाऊ शकते. या रचनांच्या प्रकारांमध्ये फरक स्त्रोतातील आधारे असतो, पण तीनही प्रकारांत येतो.
मोजमापात्मक डेटा
मोजमापात्मक डेटा म्हणजे डेटासेटमध्ये असलेली संख्यात्मक निरीक्षणे, जी सामान्यतः विश्लेषित, मोजले आणि गणितीयरीत्या वापरली जाऊ शकतात. मोजमापात्मक डेटाचे काही उदाहरणे: एखाद्या देशाचे लोकसंख्या, एखाद्या व्यक्तीची उंची किंवा एखाद्या कंपनीचे तिमाही उत्पन्न. काही अतिरिक्त विश्लेषणाने, मोजमापात्मक डेटा वापरून एअर क्वालिटी इंडेक्स (AQI) चे मौसमी ट्रेंड शोधले किंवा सामान्य कामाच्या दिवशी ट्रॅफिकच्या गर्दीची शक्यता अंदाजित केली जाऊ शकते.
गुणात्मक डेटा
गुणात्मक डेटा, ज्याला वर्गीकृत डेटा देखील म्हणतात, असे डेटा आहे जे मोजमापात्मक डेटाप्रमाणे वस्तुनिष्ठपणे मोजले जाऊ शकत नाही. तो सामान्यतः काही वस्तूची गुणवत्ता टिपणारे किंवा प्रक्रियेच्या स्वरूपातील विविध प्रकारचे व्यक्तिनिष्ठ डेटा असतो. कधी-कधी, गुणात्मक डेटा संख्यात्मक असू शकतो पण सामान्यतः गणितीयरीत्या वापरला जात नाही, जसे फोन नंबर किंवा टाइमस्टॅम्प. गुणात्मक डेटाचे काही उदाहरणे: व्हिडिओवरील टिप्पण्या, कारचा मेक आणि मॉडेल किंवा तुमच्या जवळच्या मित्राचा आवडता रंग. गुणात्मक डेटा वापरून ग्राहकांना कोणती उत्पादने सर्वात आवडतात हे समजून घेता येते किंवा नोकरी अर्जातील लोकप्रिय कीवर्ड ओळखता येतात.
संरचित डेटा
संरचित डेटा असा डेटा आहे जो ओळी आणि स्तंभांमध्ये संघटित असतो, जिथे प्रत्येक ओळीमध्ये समान संचाचे स्तंभ असतात. स्तंभ विशिष्ट प्रकाराचे मूल्य दर्शवतात आणि त्याला एक नाव दिले जाते जे त्या मूल्याचे प्रतिनिधित्व काय करते हे स्पष्ट करते, तर ओळी वास्तविक मूल्ये ठेवतात. स्तंभावर अनेकदा विशिष्ट नियम किंवा निर्बंध असतात, जे सुनिश्चित करतात की मूल्य स्तंभाचे अचूक प्रतिनिधित्व करते. उदाहरणार्थ, ग्राहकांच्या स्प्रेडशीटमध्ये प्रत्येक ओळीत फोन नंबर असावा आणि फोन नंबरमध्ये अक्षरे नसावीत. फोन नंबर स्तंभावर अशी नियम लागू असू शकतात की तो कधीही रिक्त राहू नये आणि फक्त संख्या असाव्यात.
संरचित डेटाचा एक फायदा म्हणजे तो अशा प्रकारे संघटित केला जाऊ शकतो की तो इतर संरचित डेटाशी संबंधित होऊ शकतो. मात्र, डेटा विशिष्ट स्वरूपात रहाण्यासाठी डिझाइन केलेला असल्यामुळे त्याच्या एकूण रचनेत बदल करणे फारसे सोपे नसते. उदाहरणार्थ, ग्राहकांच्या स्प्रेडशीटमध्ये एक ईमेल स्तंभ भरावा जो कधीही रिक्त राहू नये, तर सध्याच्या ओळीत त्या मूल्यांना कसे भरायचे ते ठरवावे लागेल.
संरचित डेटाची उदाहरणे: स्प्रेडशीट्स, रिलेशनल डेटाबेस, फोन नंबर, बँक स्टेटमेंट्स
असंरचित डेटा
असंरचित डेटा सामान्यतः ओळी किंवा स्तंभात वर्गीकृत केला जात नाही आणि त्यात एखादा निश्चित स्वरूप किंवा नियमांचा संच नसतो. असंरचित डेटावरच्या रचनेवर कमी निर्बंध असल्यामुळे नवीन माहिती जोडणे अधिक सोपे असते, तुलना करता संरचित डेटासेटशी. जर दोन मिनिटांनी बारोमेट्रिक प्रेशर मोजणारा सेन्सर आता तापमान मोजण्याची आणि रेकॉर्ड करण्याची क्षमता प्राप्त करतो, तर असंरचित असल्यास विद्यमान डेटामध्ये कोणीही बदल करावे लागत नाही. मात्र, अशा डेटाचे विश्लेषण किंवा तपासणी जास्त वेळ घेऊ शकते. उदाहरणार्थ, एखाद्या शास्त्रज्ञाला गेल्या महिन्याचा सरासरी तापमान शोधायचे आहे, पण तो पाहतो की काही सेन्सर डेटामध्ये "e" नोंदले आहे जे म्हणजे तो तोडला होता, ज्यामुळे डेटा अपूर्ण आहे.
असंरचित डेटाची उदाहरणे: टेक्स्ट फाईल्स, मजकूर संदेश, व्हिडिओ फाईल्स
अर्ध-संरचित
अर्ध-संरचित डेटा म्हणजे अशी वैशिष्ट्ये ज्यामुळे तो संरचित आणि असंरचित डेटा यांचा संगम आहे. तो सामान्यतः ओळी आणि स्तंभांच्या स्वरूपाला पूर्णपणे अनुसरित नाही पण एका रचनेत संघटित आहे आणि निश्चित स्वरूप किंवा नियमांचा संच असू शकतो. रचना स्त्रोतांनुसार वेगळी असू शकते, जसे विशिष्ट हायरेरकी ते अधिक लवचिक जे नवीन माहिती सोप्या प्रकारे एकत्रित करण्यास परवानगी देते. मेटाडेटा हे निर्देशांक असतात जे ठरवतात की डेटा कसा संघटित आणि संचयित आहे आणि त्याला विभिन्न प्रकारांनुसार नावे दिली जातात. मेटाडेटासाठी काही सामान्य नावे म्हणजे टॅग्स, घटक, एकक आणि गुणधर्म. उदाहरणार्थ, एक सर्वसाधारण ईमेल संदेशात विषय, मजकूर आणि प्राप्तकर्त्यांचा संच असतो आणि त्याला कोणी किंवा कधी पाठवले यावर आधारित संघटित केले जाऊ शकते.
अर्ध-संरचित डेटाची उदाहरणे: HTML, CSV फाईल्स, JavaScript ऑब्जेक्ट नोटेशन (JSON)
डेटाचे स्त्रोत
डेटा स्रोत म्हणजे डेटा कुठे तयार झाला आहे किंवा "कुठे राहतो" याचा प्रारंभिक ठिकाण, जो गोळा कसा आणि केव्हा केला आहे त्यावर अवलंबून बदलतो. ज्याने डेटा तयार केला आहे तो प्राइमरी डेटा म्हणतात, तर सेकंडरी डेटा हा असा डेटा असतो जो सामान्य वापरासाठी संग्रहित केला जातो. उदाहरणार्थ, जर एखादा वैज्ञानिक समूह रेनफॉरेस्टमध्ये निरीक्षणे गोळा करत असेल तर तो प्राथमिक डेटा मानला जाईल आणि जर तो इतर वैज्ञानिकांसोबत शेअर करण्यात आला तर ज्यांना वापरण्यासाठी मिळालेला आहे त्यांच्या दृष्टीने तो द्वितीयक डेटा ठरेल.
डेटाबेस हा एक सामान्य स्रोत आहे आणि डेटा होस्ट व व्यवस्थापित करण्यासाठी डेटाबेस व्यवस्थापन प्रणालीवर अवलंबून असतो, जिथे वापरकर्ते क्वेरीज नावाच्या आदेशांचा वापर करून डेटाच्या शोध घेतात. डेटा स्रोत म्हणून फाईल्समध्ये ऑडिओ, प्रतिमा आणि व्हिडिओ फाईल्स तसेच Excel सारख्या स्प्रेडशीट्स असू शकतात. इंटरनेट हे देखील डेटा होस्ट करण्याचे सामान्य स्थान आहे, जिथे डेटाबेस तसेच फाईल्स आढळू शकतात. API (अॅप्लिकेशन प्रोग्रॅमिंग इंटरफेस) प्रोग्रॅमरना इंटरनेटवरून बाह्य वापरकर्त्यांसोबत डेटा शेअर करण्याचे मार्ग तयार करण्यास अनुमती देतात, तर वेब स्क्रॅपिंग प्रक्रियेमुळे वेब पृष्ठातून डेटा काढला जातो. डेटासोबत काम करणे मधील धडे विविध डेटा स्रोतांचा वापर कसा करायचा यावर लक्ष केंद्रित करतात.
निष्कर्ष
या धड्यात आपण शिकले:
- डेटा म्हणजे काय
- डेटा कसा वर्णन केला जातो
- डेटा कसा वर्गीकृत आणि श्रेणीबद्ध केला जातो
- डेटा कुठे सापडतो
🚀 आव्हान
Kaggle हा उघड्या डेटासेटचा उत्तम स्रोत आहे. डेटासेट शोध उपकरणाचा वापर करून काही मनोरंजक डेटासेट शोधा आणि त्यापैकी 3-5 डेटासेट खालील निकषांनुसार वर्गीकृत करा:
- डेटा मोजमापात्मक आहे का गुणात्मक?
- डेटा संरचित, असंरचित, की अर्ध-संरचित आहे का?
व्याख्यानानंतरचा क्विझ
पुनरावलोकन आणि स्वअध्ययन
- या Microsoft Learn युनिटमध्ये, ज्याचे शीर्षक डेटा स्वरूपांची ओळख आहे, संरचित, अर्ध-संरचित आणि असंरचित डेटा यांचे सविस्तर विश्लेषण आहे.
असाइनमेंट
अस्वीकरण: हा दस्तऐवज AI भाषांतर सेवा Co-op Translator चा वापर करून अनुवादित केला आहे. जरी आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेची कमतरता असू शकते. मूळ दस्तऐवज त्याच्या मूळ भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराच्या वापरामुळे उद्भवणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थलावणीसाठी आम्ही जबाबदार नाही.
