14 KiB
डेटा सायन्स जीवनचक्र: विश्लेषण
![]() |
|---|
| डेटा सायन्स जीवनचक्र: विश्लेषण - Sketchnote by @nitya |
पूर्व-व्याख्यान प्रश्नमंजूषा
पूर्व-व्याख्यान प्रश्नमंजूषा
डेटा जीवनचक्रातील विश्लेषण हे सुनिश्चित करते की डेटा प्रस्तावित प्रश्नांची उत्तरे देऊ शकतो किंवा विशिष्ट समस्येचे निराकरण करू शकतो. या टप्प्यात मॉडेल योग्य प्रकारे प्रश्न आणि समस्यांचे निराकरण करत आहे का हे देखील तपासले जाते. या धड्याचा मुख्य फोकस एक्सप्लोरेटरी डेटा अॅनालिसिस (EDA) वर आहे, ज्यामध्ये डेटा मधील वैशिष्ट्ये आणि संबंध परिभाषित करण्याच्या तंत्रांचा समावेश आहे आणि डेटा मॉडेलिंगसाठी तयार करण्यासाठी वापरला जाऊ शकतो.
आम्ही Kaggle मधील एक उदाहरण डेटासेट वापरणार आहोत, ज्याद्वारे Python आणि Pandas लायब्ररीसह हे कसे लागू करता येईल हे दाखवले जाईल. या डेटासेटमध्ये ईमेलमध्ये आढळणाऱ्या काही सामान्य शब्दांची संख्या आहे, आणि या ईमेलचे स्रोत अज्ञात आहेत. या डिरेक्टरीतील notebook वापरून तुम्ही शिकण्याची प्रक्रिया सुरू करू शकता.
एक्सप्लोरेटरी डेटा अॅनालिसिस
जीवनचक्रातील डेटा कॅप्चर टप्प्यात डेटा मिळवला जातो तसेच समस्यांचे आणि प्रश्नांचे विश्लेषण केले जाते, पण आपल्याला कसे कळेल की डेटा अंतिम निकालासाठी उपयुक्त आहे? डेटा सायंटिस्ट डेटा मिळवल्यानंतर खालील प्रश्न विचारू शकतो:
- या समस्येचे निराकरण करण्यासाठी माझ्याकडे पुरेसा डेटा आहे का?
- या समस्येसाठी डेटा स्वीकारण्यायोग्य गुणवत्तेचा आहे का?
- जर मला या डेटामधून अतिरिक्त माहिती मिळाली, तर आपण उद्दिष्टे बदलण्याचा किंवा पुन्हा परिभाषित करण्याचा विचार करावा का?
एक्सप्लोरेटरी डेटा अॅनालिसिस म्हणजे डेटाशी परिचित होण्याची प्रक्रिया आहे आणि ती या प्रश्नांची उत्तरे देण्यासाठी तसेच डेटासेटसह काम करताना येणाऱ्या आव्हानांची ओळख पटवण्यासाठी वापरली जाऊ शकते. चला, हे साध्य करण्यासाठी वापरल्या जाणाऱ्या काही तंत्रांवर लक्ष केंद्रित करूया.
डेटा प्रोफाइलिंग, वर्णनात्मक आकडेवारी, आणि Pandas
आपल्याकडे या समस्येचे निराकरण करण्यासाठी पुरेसा डेटा आहे का हे कसे मूल्यांकन करावे? डेटा प्रोफाइलिंग तांत्रिक पद्धतींच्या माध्यमातून आपल्या डेटासेटबद्दल सामान्य माहिती संकलित आणि संक्षेपित करू शकते. डेटा प्रोफाइलिंग आपल्याला काय उपलब्ध आहे हे समजण्यास मदत करते, आणि वर्णनात्मक आकडेवारी आपल्याला किती गोष्टी उपलब्ध आहेत हे समजण्यास मदत करते.
आम्ही काही मागील धड्यांमध्ये Pandas वापरून describe() function च्या मदतीने वर्णनात्मक आकडेवारी प्रदान केली आहे. हे संख्यात्मक डेटावर गणना, कमाल आणि किमान मूल्ये, सरासरी, मानक विचलन आणि क्वांटाइल्स प्रदान करते. describe() सारख्या वर्णनात्मक आकडेवारीच्या मदतीने तुम्ही तुमच्याकडे किती डेटा आहे आणि तुम्हाला अधिक डेटा आवश्यक आहे का हे मूल्यांकन करू शकता.
सॅम्पलिंग आणि क्वेरी करणे
मोठ्या डेटासेटमधील सर्वकाही एक्सप्लोर करणे खूप वेळखाऊ असते आणि सामान्यतः संगणकावर सोपवले जाते. मात्र, सॅम्पलिंग हे डेटाचे समजून घेण्यासाठी उपयुक्त साधन आहे आणि ते डेटासेटमध्ये काय आहे आणि ते काय दर्शवते याबद्दल चांगले समज देऊ शकते. सॅम्पलिंगसह, तुम्ही संभाव्यता आणि आकडेवारी लागू करू शकता आणि तुमच्या डेटाबद्दल काही सामान्य निष्कर्ष काढू शकता. जरी किती डेटा सॅम्पल करावा याबद्दल निश्चित नियम नसला तरी, तुम्ही जितका अधिक डेटा सॅम्पल कराल तितकी तुमची सामान्यीकरण अधिक अचूक होईल.
Pandas मध्ये sample() function आहे, ज्यामध्ये तुम्ही किती रँडम सॅम्पल्स हवे आहेत हे सांगू शकता आणि वापरू शकता.
डेटाच्या सामान्य क्वेरी करणे तुम्हाला काही सामान्य प्रश्न आणि सिद्धांतांची उत्तरे देण्यास मदत करू शकते. सॅम्पलिंगच्या तुलनेत, क्वेरी तुम्हाला विशिष्ट भागांवर नियंत्रण ठेवण्याची आणि तुमच्या डेटाबद्दल विशिष्ट प्रश्नांवर लक्ष केंद्रित करण्याची परवानगी देते. Pandas लायब्ररीमधील query() function तुम्हाला कॉलम निवडण्याची आणि पंक्तींच्या माध्यमातून डेटाबद्दल सोप्या उत्तरांची प्राप्ती करण्याची परवानगी देते.
व्हिज्युअलायझेशन्ससह एक्सप्लोर करणे
डेटा पूर्णपणे स्वच्छ आणि विश्लेषित होईपर्यंत तुम्हाला व्हिज्युअलायझेशन्स तयार करण्याची वाट पाहण्याची गरज नाही. खरं तर, एक्सप्लोरेशन करताना व्हिज्युअल प्रतिनिधित्व असणे डेटा मधील नमुने, संबंध, आणि समस्यांची ओळख पटवण्यास मदत करू शकते. शिवाय, व्हिज्युअलायझेशन्स डेटा व्यवस्थापनात सहभागी नसलेल्या लोकांशी संवाद साधण्याचे साधन प्रदान करतात आणि कॅप्चर टप्प्यात संबोधित न केलेल्या अतिरिक्त प्रश्नांची स्पष्टता देण्याची संधी असते. व्हिज्युअलायझेशन्स एक्सप्लोर करण्याच्या लोकप्रिय पद्धतींबद्दल अधिक जाणून घेण्यासाठी Visualizations विभाग पहा.
विसंगती ओळखण्यासाठी एक्सप्लोर करणे
या धड्यातील सर्व विषय गहाळ किंवा विसंगत मूल्ये ओळखण्यास मदत करू शकतात, पण Pandas काही यासाठी फंक्शन्स प्रदान करते. isna() किंवा isnull() गहाळ मूल्ये तपासू शकते. तुमच्या डेटामधील गहाळ मूल्ये एक्सप्लोर करताना एक महत्त्वाचा भाग म्हणजे ती गहाळ का झाली याचे कारण शोधणे. हे तुम्हाला त्यांचे निराकरण करण्यासाठी काय करावे याचा निर्णय घेण्यास मदत करू शकते.
व्याख्यानानंतरची प्रश्नमंजूषा
असाइनमेंट
उत्तर शोधण्यासाठी एक्सप्लोर करणे
अस्वीकरण:
हा दस्तऐवज AI भाषांतर सेवा Co-op Translator वापरून भाषांतरित करण्यात आला आहे. आम्ही अचूकतेसाठी प्रयत्नशील असलो तरी, कृपया लक्षात ठेवा की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेचा अभाव असू शकतो. मूळ भाषेतील दस्तऐवज हा अधिकृत स्रोत मानला जावा. महत्त्वाच्या माहितीसाठी व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराचा वापर करून उद्भवलेल्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थासाठी आम्ही जबाबदार राहणार नाही.
