You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/mr/4-Data-Science-Lifecycle/15-analyzing/README.md

13 KiB

डेटा सायन्स जीवनचक्र: विश्लेषण

 Sketchnote by (@sketchthedocs)
डेटा सायन्स जीवनचक्र: विश्लेषण - Sketchnote by @nitya

व्याख्यानपूर्व प्रश्नमंजूषा

व्याख्यानपूर्व प्रश्नमंजूषा

डेटा जीवनचक्रातील विश्लेषण हे निश्चित करते की डेटा प्रस्तावित प्रश्नांची उत्तरे देऊ शकतो किंवा विशिष्ट समस्या सोडवू शकतो. या टप्प्यात मॉडेल योग्य प्रकारे प्रश्न आणि समस्या सोडवत आहे का हे देखील तपासले जाते. या धड्याचा मुख्य फोकस एक्सप्लोरेटरी डेटा अ‍ॅनालिसिस (EDA) वर आहे, ज्यामध्ये डेटामधील वैशिष्ट्ये आणि संबंध परिभाषित करण्याच्या तंत्रांचा समावेश आहे आणि डेटा मॉडेलिंगसाठी तयार करण्यासाठी वापरला जाऊ शकतो.

आम्ही Kaggle मधील एक उदाहरण डेटासेट वापरणार आहोत, ज्यामध्ये Python आणि Pandas लायब्ररीसह हे कसे लागू करता येईल हे दाखवले जाईल. या डेटासेटमध्ये ईमेलमध्ये आढळणाऱ्या काही सामान्य शब्दांची संख्या आहे, आणि या ईमेलचे स्रोत अनामिक आहेत. या डिरेक्टरीतील notebook वापरून तुम्ही शिकण्यास सुरुवात करू शकता.

एक्सप्लोरेटरी डेटा अ‍ॅनालिसिस

जीवनचक्रातील डेटा कॅप्चर टप्प्यात डेटा मिळवला जातो तसेच समस्या आणि प्रश्न निश्चित केले जातात, पण आपल्याला कसे कळेल की डेटा अंतिम निकालासाठी उपयुक्त आहे? डेटा सायंटिस्ट डेटा मिळवल्यानंतर खालील प्रश्न विचारू शकतो:

  • या समस्येचे निराकरण करण्यासाठी माझ्याकडे पुरेसा डेटा आहे का?
  • या समस्येसाठी डेटा स्वीकारण्यायोग्य गुणवत्तेचा आहे का?
  • जर मला या डेटामधून अतिरिक्त माहिती मिळाली तर, आपण उद्दिष्टे बदलण्याचा किंवा पुन्हा परिभाषित करण्याचा विचार करावा का? एक्सप्लोरेटरी डेटा अ‍ॅनालिसिस म्हणजे डेटाशी परिचित होण्याची प्रक्रिया आहे आणि या प्रश्नांची उत्तरे देण्यासाठी तसेच डेटासेटसह काम करताना येणाऱ्या अडचणी ओळखण्यासाठी वापरली जाऊ शकते. चला, हे साध्य करण्यासाठी वापरल्या जाणाऱ्या काही तंत्रांवर लक्ष केंद्रित करूया.

डेटा प्रोफाइलिंग, वर्णनात्मक आकडेवारी, आणि Pandas

आपल्याकडे या समस्येचे निराकरण करण्यासाठी पुरेसा डेटा आहे का हे कसे मूल्यांकन करावे? डेटा प्रोफाइलिंग तांत्रिक पद्धतींच्या माध्यमातून आपल्या डेटासेटबद्दल काही सामान्य माहिती संक्षेपाने देऊ शकते. डेटा प्रोफाइलिंग आपल्याला काय उपलब्ध आहे हे समजण्यास मदत करते, आणि वर्णनात्मक आकडेवारी आपल्याला किती गोष्टी उपलब्ध आहेत हे समजण्यास मदत करते.

आम्ही काही मागील धड्यांमध्ये Pandas वापरून describe() function च्या मदतीने काही वर्णनात्मक आकडेवारी प्रदान केली आहे. हे संख्यात्मक डेटावर गणना, कमाल आणि किमान मूल्ये, सरासरी, मानक विचलन आणि क्वांटाइल्स प्रदान करते. describe() सारख्या वर्णनात्मक आकडेवारीचा वापर करून तुम्ही तुमच्याकडे किती डेटा आहे आणि तुम्हाला अधिक डेटा आवश्यक आहे का हे मूल्यांकन करू शकता.

सॅम्पलिंग आणि क्वेरी करणे

मोठ्या डेटासेटमधील सर्वकाही एक्सप्लोर करणे खूप वेळखाऊ असते आणि सामान्यतः संगणकावर सोपवले जाते. तथापि, सॅम्पलिंग हे डेटाचे समजून घेण्यासाठी एक उपयुक्त साधन आहे आणि डेटासेटमध्ये काय आहे आणि ते काय दर्शवते याबद्दल चांगले समज प्राप्त करण्यास मदत करते. सॅम्पलिंगसह, तुम्ही संभाव्यता आणि आकडेवारी लागू करून तुमच्या डेटाबद्दल काही सामान्य निष्कर्ष काढू शकता. जरी किती डेटा सॅम्पल करावा याबद्दल निश्चित नियम नसला तरी, तुम्ही जितका अधिक डेटा सॅम्पल कराल तितकी तुमची सामान्यीकरण अधिक अचूक होईल. Pandas मध्ये sample() function आहे जिथे तुम्ही किती रँडम सॅम्पल्स हवे आहेत हे सांगू शकता.

डेटाच्या सामान्य क्वेरी केल्याने तुम्हाला काही सामान्य प्रश्न आणि सिद्धांतांची उत्तरे मिळू शकतात. सॅम्पलिंगच्या विपरीत, क्वेरी तुम्हाला विशिष्ट भागांवर नियंत्रण ठेवण्याची आणि तुमच्या डेटाबद्दल प्रश्न विचारण्याची परवानगी देते. Pandas लायब्ररीमधील query() function तुम्हाला कॉलम निवडण्याची आणि पंक्तींच्या माध्यमातून डेटाबद्दल सोप्या उत्तरांची प्राप्ती करण्याची परवानगी देते.

व्हिज्युअलायझेशन्ससह एक्सप्लोरेशन

डेटा पूर्णपणे स्वच्छ आणि विश्लेषित होईपर्यंत तुम्हाला व्हिज्युअलायझेशन्स तयार करण्याची वाट पाहण्याची गरज नाही. खरं तर, एक्सप्लोरेशन करताना व्हिज्युअल प्रतिनिधित्व असणे डेटामधील नमुने, संबंध आणि समस्या ओळखण्यास मदत करू शकते. शिवाय, व्हिज्युअलायझेशन्स डेटा व्यवस्थापनात सहभागी नसलेल्या लोकांसोबत संवाद साधण्याचे साधन प्रदान करतात आणि कॅप्चर टप्प्यात संबोधित न केलेल्या अतिरिक्त प्रश्नांची स्पष्टता देण्याची संधी असते. व्हिज्युअलायझेशन्स एक्सप्लोरेशनच्या लोकप्रिय पद्धतींबद्दल अधिक जाणून घेण्यासाठी Visualizations विभाग पहा.

विसंगती ओळखण्यासाठी एक्सप्लोरेशन

या धड्यातील सर्व विषय गहाळ किंवा विसंगत मूल्ये ओळखण्यास मदत करू शकतात, परंतु Pandas काही मूल्ये तपासण्यासाठी फंक्शन्स प्रदान करते. isna() किंवा isnull() गहाळ मूल्ये तपासू शकते. तुमच्या डेटामधील गहाळ मूल्ये एक्सप्लोर करताना एक महत्त्वाचा भाग म्हणजे ती गहाळ का झाली याचे कारण शोधणे. हे तुम्हाला त्यांचे निराकरण करण्यासाठी कोणती कृती करावी हे ठरवण्यास मदत करू शकते.

व्याख्यानोत्तर प्रश्नमंजूषा

असाइनमेंट

उत्तर शोधण्यासाठी एक्सप्लोरेशन


अस्वीकरण:
हा दस्तऐवज AI भाषांतर सेवा Co-op Translator वापरून भाषांतरित करण्यात आला आहे. आम्ही अचूकतेसाठी प्रयत्नशील असलो तरी, कृपया लक्षात ठेवा की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेचा अभाव असू शकतो. मूळ भाषेतील दस्तऐवज हा अधिकृत स्रोत मानावा. महत्त्वाच्या माहितीसाठी व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराचा वापर करून निर्माण होणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थासाठी आम्ही जबाबदार राहणार नाही.