# डाटा साइन्सको परिभाषा | ![ स्केच नोट [(@sketchthedocs)](https://sketchthedocs.dev) द्वारा ](../../sketchnotes/01-Definitions.png) | | :----------------------------------------------------------------------------------------------------: | | डाटा साइन्सको परिभाषा - _[@nitya](https://twitter.com/nitya) द्वारा स्केच नोट_ | --- [![डाटा साइन्सको परिभाषा भिडियो](../../../../translated_images/ne/video-def-ds.6623ee2392ef1abf.webp)](https://youtu.be/beZ7Mb_oz9I) ## [पूर्व-व्याख्यान क्विज](https://ff-quizzes.netlify.app/en/ds/quiz/0) ## डाटा के हो? हाम्रो दैनिक जीवनमा हामी सधैं डाटाले घेरिएका हुन्छौं। तपाईं अहिले पढ्दै गरेको पाठ डाटा हो। तपाईंको स्मार्टफोनमा तपाईंका साथीहरूको फोन नम्बरको सूची डाटा हो, साथै तपाईंको घडीमा देखाइएको वर्तमान समय पनि डाटा हो। मानिसको रूपमा, हामी स्वाभाविक रूपमा डाटासँग काम गर्छौं, जस्तै हामीसँग भएको पैसा गन्नु वा साथीहरूलाई पत्र लेख्न। तर, कम्प्युटरको निर्माणसँगै डाटाको महत्त्व धेरै बढ्यो। कम्प्युटरको मुख्य भूमिका गणना गर्नु हो, तर तिनीहरूलाई काम गर्न डाटाको आवश्यकता हुन्छ। त्यसैले, हामीले बुझ्न आवश्यक छ कि कम्प्युटरले डाटालाई कसरी भण्डारण र प्रक्रिया गर्छ। इन्टरनेटको उदयसँगै, डाटा ह्यान्डल गर्ने उपकरणको रूपमा कम्प्युटरको भूमिका बढ्यो। यदि तपाईं यसबारे सोच्नुहुन्छ भने, हामी अहिले कम्प्युटरलाई गणनाको सट्टा डाटा प्रशोधन र सञ्चारको लागि बढी प्रयोग गर्छौं। जब हामी साथीलाई इमेल लेख्छौं वा इन्टरनेटमा केही जानकारी खोज्छौं - हामी मूलतः डाटा सिर्जना, भण्डारण, प्रसारण, र हेरफेर गर्दैछौं। > के तपाईंलाई याद छ कि अन्तिम पटक कहिले कम्प्युटरलाई वास्तवमा केही गणना गर्न प्रयोग गर्नुभएको थियो? ## डाटा साइन्स के हो? [विकिपिडिया](https://en.wikipedia.org/wiki/Data_science) मा **डाटा साइन्स** लाई *वैज्ञानिक विधिहरू प्रयोग गरेर संरचित र असंरचित डाटाबाट ज्ञान र अन्तर्दृष्टि निकाल्ने, र विभिन्न अनुप्रयोग क्षेत्रहरूमा डाटाबाट प्राप्त ज्ञान र व्यावहारिक अन्तर्दृष्टि लागू गर्ने वैज्ञानिक क्षेत्र* भनेर परिभाषित गरिएको छ। यस परिभाषाले डाटा साइन्सका निम्न महत्त्वपूर्ण पक्षहरूलाई उजागर गर्दछ: * डाटा साइन्सको मुख्य उद्देश्य भनेको डाटाबाट **ज्ञान निकाल्नु** हो, अर्थात् - डाटालाई **बुझ्नु**, केही लुकेका सम्बन्धहरू पत्ता लगाउनु र **मोडेल** निर्माण गर्नु। * डाटा साइन्सले **वैज्ञानिक विधिहरू** प्रयोग गर्दछ, जस्तै सम्भाव्यता र तथ्याङ्क। वास्तवमा, जब *डाटा साइन्स* शब्द पहिलो पटक प्रस्तुत गरियो, केही व्यक्तिहरूले तर्क गरे कि डाटा साइन्स केवल तथ्याङ्कको लागि नयाँ आकर्षक नाम हो। आजकल यो क्षेत्र धेरै व्यापक भएको स्पष्ट छ। * प्राप्त ज्ञानलाई केही **व्यावहारिक अन्तर्दृष्टि** उत्पादन गर्न लागू गर्नुपर्छ, अर्थात् वास्तविक व्यापार परिस्थितिहरूमा लागू गर्न सकिने व्यावहारिक अन्तर्दृष्टि। * हामीले **संरचित** र **असंरचित** दुवै डाटामा काम गर्न सक्षम हुनुपर्छ। हामी यस कोर्सको क्रममा डाटाका विभिन्न प्रकारहरूबारे पछि छलफल गर्नेछौं। * **अनुप्रयोग क्षेत्र** महत्त्वपूर्ण अवधारणा हो, र डाटा वैज्ञानिकहरूले प्रायः समस्या क्षेत्रमा कम्तिमा केही हदसम्म विशेषज्ञता आवश्यक पर्दछ, उदाहरणका लागि: वित्त, चिकित्सा, मार्केटिङ, आदि। > डाटा साइन्सको अर्को महत्त्वपूर्ण पक्ष भनेको यसले कम्प्युटर प्रयोग गरेर डाटा कसरी संकलन, भण्डारण र सञ्चालन गर्न सकिन्छ भन्ने अध्ययन गर्दछ। तथ्याङ्कले हामीलाई गणितीय आधार प्रदान गर्दछ भने, डाटा साइन्सले वास्तवमा डाटाबाट अन्तर्दृष्टि निकाल्न गणितीय अवधारणाहरू लागू गर्दछ। डाटा साइन्सलाई हेर्ने एउटा तरिका (जिम ग्रे [Jim Gray](https://en.wikipedia.org/wiki/Jim_Gray_(computer_scientist)) द्वारा श्रेय दिइएको) भनेको यसलाई विज्ञानको छुट्टै परिपाटी मान्नु हो: * **अनुभवजन्य**, जसमा हामी प्रायः अवलोकन र प्रयोगको परिणाममा निर्भर गर्दछौं। * **सैद्धान्तिक**, जहाँ नयाँ अवधारणाहरू विद्यमान वैज्ञानिक ज्ञानबाट उत्पन्न हुन्छन्। * **गणनात्मक**, जहाँ हामी केही गणनात्मक प्रयोगहरूमा आधारित नयाँ सिद्धान्तहरू पत्ता लगाउँछौं। * **डाटा-आधारित**, डाटामा सम्बन्ध र ढाँचाहरू पत्ता लगाउने आधारमा। ## अन्य सम्बन्धित क्षेत्रहरू डाटा सर्वव्यापी भएकाले, डाटा साइन्स आफैं पनि एक व्यापक क्षेत्र हो, जसले धेरै अन्य विषयहरूलाई छोएको छ।
डाटाबेस
महत्त्वपूर्ण कुरा भनेको डाटालाई कसरी भण्डारण गर्ने हो, अर्थात् यसलाई छिटो प्रशोधन गर्न अनुमति दिने तरिकामा संरचना कसरी गर्ने। संरचित र असंरचित डाटा भण्डारण गर्ने विभिन्न प्रकारका डाटाबेसहरू छन्, जुन हाम्रो कोर्समा हामी विचार गर्नेछौं
बिग डाटा
प्रायः हामीलाई धेरै ठूलो मात्रामा डाटा भण्डारण र प्रशोधन गर्न आवश्यक पर्दछ जसको संरचना अपेक्षाकृत सरल हुन्छ। त्यस्तो डाटालाई कम्प्युटर क्लस्टरमा वितरित तरिकामा भण्डारण गर्न र कुशलतापूर्वक प्रशोधन गर्न विशेष दृष्टिकोण र उपकरणहरू छन्।
मेसिन लर्निङ
डाटालाई बुझ्ने एउटा तरिका भनेको मोडेल निर्माण गर्नु हो जसले चाहिएको परिणामको भविष्यवाणी गर्न सक्दछ। डाटाबाट मोडेल विकास गर्ने प्रक्रियालाई मेसिन लर्निङ भनिन्छ। यसबारे थप जान्नको लागि तपाईं हाम्रो मेसिन लर्निङ फर बिगिनर्स पाठ्यक्रम हेर्न चाहनुहुन्छ।
कृत्रिम बुद्धिमत्ता
मेसिन लर्निङको एक क्षेत्र जसलाई कृत्रिम बुद्धिमत्ता (AI) भनिन्छ, डाटामा निर्भर गर्दछ, र यसले मानव सोच प्रक्रियाको नक्कल गर्ने उच्च जटिलता मोडेलहरू निर्माण समावेश गर्दछ। AI विधिहरूले प्रायः असंरचित डाटालाई (जस्तै प्राकृतिक भाषा) संरचित अन्तर्दृष्टिमा परिणत गर्न अनुमति दिन्छ।
भिजुअलाइजेसन
मानवका लागि विशाल मात्रामा डाटा बुझ्न गाह्रो हुन्छ, तर जब हामी उक्त डाटाको उपयोगी भिजुअलाइजेसनहरू सिर्जना गर्छौं, हामी डाटालाई बढी बुझ्न सक्छौं र केही निष्कर्ष निकाल्न सक्छौं। त्यसैले, जानकारीलाई भिजुअलाइज गर्ने धेरै तरिकाहरू जान्नु महत्त्वपूर्ण छ - केही कुरा जुन हामी सेक्शन ३ मा कभर गर्नेछौं। सम्बन्धित क्षेत्रहरूमा इन्फोग्राफिक्स, र सामान्यतया मानव-कम्प्युटर अन्तरक्रिया समावेश छन्।
## डाटाका प्रकारहरू जसरी हामीले पहिले नै उल्लेख गरिसकेका छौं, डाटा हरेक ठाउँमा छ। हामीले यसलाई सही तरिकाले समात्न मात्र आवश्यक छ! **संरचित** र **असंरचित** डाटाबीच भिन्नता गर्न उपयोगी हुन्छ। पहिलो प्रायः केही राम्रोसँग संरचित रूपमा प्रस्तुत गरिन्छ, प्रायः तालिका वा तालिकाहरूको रूपमा, जबकि दोस्रो केवल फाइलहरूको संग्रह हो। कहिलेकाहीं हामी **अर्ध-संरचित** डाटाको बारेमा पनि कुरा गर्न सक्छौं, जसमा केही प्रकारको संरचना हुन्छ जुन धेरै फरक हुन सक्छ। | संरचित | अर्ध-संरचित | असंरचित | | ---------------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------- | --------------------------------------- | | व्यक्तिहरूको सूची उनीहरूको फोन नम्बरहरूसहित | विकिपिडिया पृष्ठहरू लिंकहरूसहित | इनसाइक्लोपीडिया ब्रिटानिकाको पाठ | | पछिल्लो २० वर्षको प्रत्येक मिनेटमा भवनका सबै कोठाहरूको तापक्रम | लेखकहरू, प्रकाशनको मिति, र सारांश सहित JSON ढाँचामा वैज्ञानिक कागजातहरूको संग्रह | निगरानी क्यामेराबाट कच्चा भिडियो फिड | | भवनमा प्रवेश गर्ने सबै व्यक्तिहरूको उमेर र लिङ्गको डाटा | इन्टरनेट पृष्ठहरू | कर्पोरेट कागजातहरूसहितको फाइल शेयर | ## डाटा कहाँबाट प्राप्त गर्ने डाटाका धेरै सम्भावित स्रोतहरू छन्, र तिनीहरू सबै सूचीबद्ध गर्न असम्भव हुनेछ! तर, हामी डाटा प्राप्त गर्न सकिने केही सामान्य स्थानहरूको उल्लेख गरौं: * **संरचित** - **इन्टरनेट अफ थिङ्स** (IoT), विभिन्न सेन्सरहरूबाट डाटा सहित, जस्तै तापक्रम वा दबाब सेन्सरहरू, धेरै उपयोगी डाटा प्रदान गर्दछ। उदाहरणका लागि, यदि कार्यालय भवन IoT सेन्सरहरूले सुसज्जित छ भने, हामी लागत कम गर्न स्वतः तातो र प्रकाश नियन्त्रण गर्न सक्छौं। - **सर्वेक्षणहरू** जुन हामीले प्रयोगकर्ताहरूलाई खरिद पछि वा वेब साइट भ्रमण गरेपछि पूरा गर्न अनुरोध गर्छौं। - **व्यवहारको विश्लेषण**ले, उदाहरणका लागि, हामीलाई बुझ्न मद्दत गर्न सक्छ कि प्रयोगकर्ता साइटमा कति गहिरो जान्छ, र साइट छोड्ने सामान्य कारण के हो। * **असंरचित** - **पाठहरू** अन्तर्दृष्टिको धनी स्रोत हुन सक्छ, जस्तै समग्र **भावनात्मक स्कोर**, वा कीवर्ड र अर्थपूर्ण अर्थ निकाल्ने। - **छविहरू** वा **भिडियो**। निगरानी क्यामेराबाट आएको भिडियोले सडकमा ट्राफिकको अनुमान गर्न र सम्भावित ट्राफिक जामको बारेमा मानिसहरूलाई जानकारी दिन प्रयोग गर्न सकिन्छ। - वेब सर्भर **लॉगहरू**ले हाम्रो साइटका कुन पृष्ठहरू प्रायः भ्रमण गरिन्छन्, र कति समयको लागि भनेर बुझ्न प्रयोग गर्न सकिन्छ। * अर्ध-संरचित - **सोसल नेटवर्क** ग्राफहरूले प्रयोगकर्ताको व्यक्तित्व र जानकारी फैलाउनको सम्भावित प्रभावकारिताको बारेमा डाटाको उत्कृष्ट स्रोत हुन सक्छ। - जब हामीसँग पार्टीबाट धेरै तस्बिरहरू छन्, हामी मानिसहरूले एक अर्कासँग तस्बिर लिँदै गरेको ग्राफ निर्माण गरेर **समूह गतिशीलता** डाटा निकाल्न प्रयास गर्न सक्छौं। डाटाका विभिन्न सम्भावित स्रोतहरू जान्नाले तपाईंलाई डाटा साइन्स प्रविधिहरू लागू गर्न सकिने विभिन्न परिदृश्यहरूको बारेमा सोच्न मद्दत गर्न सक्छ, स्थिति राम्रोसँग जान्न र व्यापार प्रक्रियाहरू सुधार गर्न। ## डाटाबाट के गर्न सकिन्छ डाटा साइन्समा, हामी डाटाको यात्रा निम्न चरणहरूमा केन्द्रित गर्छौं:
१) डाटा प्राप्ति
पहिलो चरण भनेको डाटा संकलन गर्नु हो। धेरै अवस्थामा यो सरल प्रक्रिया हुन सक्छ, जस्तै वेब एप्लिकेसनबाट डाटाबेसमा डाटा आउने। कहिलेकाहीं हामीलाई विशेष प्रविधिहरू प्रयोग गर्न आवश्यक पर्दछ। उदाहरणका लागि, IoT सेन्सरहरूबाट डाटा भारी हुन सक्छ, र सबै डाटा थप प्रशोधन अघि संकलन गर्न IoT हब जस्ता बफरिङ अन्त बिन्दुहरू प्रयोग गर्नु राम्रो अभ्यास हो।
२) डाटा भण्डारण
डाटा भण्डारण चुनौतीपूर्ण हुन सक्छ, विशेष गरी यदि हामी ठूलो डाटाको कुरा गर्दैछौं भने। डाटा कसरी भण्डारण गर्ने निर्णय गर्दा, भविष्यमा डाटालाई सोधपुछ गर्न चाहने तरिका अनुमान गर्नु उचित हुन्छ। डाटा भण्डारण गर्नका लागि धेरै तरिकाहरू छन्:
३) डाटा प्रशोधन
यो डाटा यात्राको सबैभन्दा रोमाञ्चक भाग हो, जसमा डाटालाई यसको मूल रूपबाट भिजुअलाइजेसन/मोडेल प्रशिक्षणको लागि प्रयोग गर्न सकिने रूपमा रूपान्तरण गर्ने समावेश छ। असंरचित डाटाको सामना गर्दा जस्तै पाठ वा छविहरू, हामीले डाटाबाट विशेषताहरू निकाल्न केही AI प्रविधिहरू प्रयोग गर्न आवश्यक हुन सक्छ, यसरी यसलाई संरचित रूपमा रूपान्तरण गर्दै।
४) भिजुअलाइजेसन / मानव अन्तर्दृष्टि
डाटालाई बुझ्नको लागि, हामीले यसलाई प्रायः भिजुअलाइज गर्न आवश्यक छ। हाम्रो उपकरण बक्समा धेरै विभिन्न भिजुअलाइजेसन प्रविधिहरू भएकोले, हामी अन्तर्दृष्टि बनाउन सही दृश्य पाउन सक्छौं। प्रायः, डाटा वैज्ञानिकले "डाटासँग खेल्न" आवश्यक छ, यसलाई धेरै पटक भिजुअलाइज गर्दै केही सम्बन्धहरूको खोजी गर्दै। साथै, हामीले केही डाटाका टुक्राहरू बीचको सम्बन्ध प्रमाणित गर्न वा परीक्षण गर्न तथ्याङ्कीय प्रविधिहरू प्रयोग गर्न सक्छौं।
५) भविष्यवाणी मोडेल प्रशिक्षण
किनकि डाटा साइन्सको अन्तिम लक्ष्य भनेको डाटाको आधारमा निर्णय लिन सक्षम हुनु हो, हामीले मेसिन लर्निङ प्रविधिहरू प्रयोग गरेर भविष्यवाणी मोडेल निर्माण गर्न चाहन सक्छौं। त्यसपछि हामी यसलाई समान संरचनाहरू भएका नयाँ डाटा सेटहरू प्रयोग गरेर भविष्यवाणी गर्न प्रयोग गर्न सक्छौं।
पक्कै पनि, वास्तविक डाटाको आधारमा, केही चरणहरू हराउन सक्छन् (जस्तै, जब हामीसँग पहिले नै डाटाबेसमा डाटा छ, वा जब हामीलाई मोडेल प्रशिक्षण आवश्यक छैन), वा केही चरणहरू धेरै पटक दोहोर्याउन सकिन्छ (जस्तै डाटा प्रशोधन)। ## डिजिटलाइजेसन र डिजिटल रूपान्तरण पछिल्लो दशकमा, धेरै व्यवसायहरूले व्यापार निर्णयहरू गर्दा डाटाको महत्त्वलाई बुझ्न थालेका छन्। व्यापार चलाउन डाटा साइन्सका सिद्धान्तहरू लागू गर्न, पहिलो चरण भनेको केही डाटा संकलन गर्नु हो, अर्थात् व्यापार प्रक्रियाहरूलाई डिजिटल रूपमा अनुवाद गर्नु। यसलाई **डिजिटलाइजेसन** भनिन्छ। यस डाटामा डाटा साइन्स प्रविधिहरू लागू गरेर निर्णयहरू मार्गदर्शन गर्नाले उत्पादकत्वमा महत्वपूर्ण वृद्धि (वा व्यापारको नयाँ दिशा) ल्याउन सक्छ, जसलाई **डिजिटल रूपान्तरण** भनिन्छ। एक उदाहरणलाई विचार गरौं। मानौं हामीसँग डाटा साइन्स कोर्स (जस्तै यो) छ जुन हामी विद्यार्थीहरूलाई अनलाइन प्रदान गर्छौं, र हामी यसलाई सुधार गर्न डाटा साइन्स प्रयोग गर्न चाहन्छौं। हामी यसलाई कसरी गर्न सक्छौं? हामी "के डिजिटलाइज गर्न सकिन्छ?" भनेर सोधेर सुरु गर्न सक्छौं। सबैभन्दा सरल तरिका भनेको प्रत्येक विद्यार्थीलाई प्रत्येक मोड्युल पूरा गर्न लाग्ने समय मापन गर्नु हो, र प्रत्येक मोड्युलको अन्त्यमा बहुविकल्पीय परीक्षण दिएर प्राप्त ज्ञान मापन गर्नु हो। सबै विद्यार्थीहरूमा समय-देखि-समाप्ति औसत गरेर, हामी पत्ता लगाउन सक्छौं कि कुन मोड्युलहरूले विद्यार्थीहरूलाई सबैभन्दा धेरै कठिनाइहरू निम्त्याउँछन्, र तिनीहरूलाई सरल बनाउन काम गर्न सक्छौं। > तपाईं बहस गर्न सक्नुहुन्छ कि यो दृष्टिकोण आदर्श होइन, किनभने मोड्युलहरू विभिन्न लम्बाइका हुन सक्छन्। समयलाई मोड्युलको लम्बाइ (अक्षरहरूको संख्या) द्वारा विभाजन गर्नु र ती मानहरू तुलना गर्नु सम्भवतः बढी न्यायसंगत हुनेछ। जब हामी बहुविकल्पीय परीक्षणहरूको नतिजा विश्लेषण गर्न थाल्छौं, हामी विद्यार्थीहरूले कुन अवधारणाहरू बुझ्न कठिनाइ भोगिरहेका छन् भनेर पत्ता लगाउन सक्छौं, र त्यस जानकारीलाई सामग्री सुधार गर्न प्रयोग गर्न सक्छौं। त्यसका लागि, हामीले परीक्षणहरू यसरी डिजाइन गर्नुपर्छ कि प्रत्येक प्रश्नले निश्चित अवधारणा वा ज्ञानको टुक्रासँग मेल खान्छ। यदि हामी अझ जटिल हुन चाहन्छौं भने, हामी प्रत्येक मोड्युलको लागि लिएको समयलाई विद्यार्थीहरूको उमेर समूहसँग तुलना गर्न सक्दछौं। हामी पत्ता लगाउन सक्छौं कि केही उमेर समूहहरूको लागि मोड्युल पूरा गर्न अनुपयुक्त रूपमा धेरै समय लाग्छ, वा विद्यार्थीहरूले मोड्युल पूरा गर्नु अघि नै छोड्छन्। यसले हामीलाई मोड्युलको लागि उमेर सिफारिसहरू प्रदान गर्न मद्दत गर्न सक्छ, र गलत अपेक्षाबाट हुने असन्तुष्टिलाई न्यूनतम गर्न सक्छ। ## 🚀 चुनौती यस चुनौतीमा, हामी डेटा साइन्सको क्षेत्रमा सान्दर्भिक अवधारणाहरू पत्ता लगाउने प्रयास गर्नेछौं। हामी डेटा साइन्सको विषयमा विकिपिडिया लेख लिनेछौं, पाठ डाउनलोड र प्रक्रिया गर्नेछौं, र त्यसपछि यस्तो वर्ड क्लाउड बनाउनेछौं: ![डेटा साइन्सको लागि वर्ड क्लाउड](../../../../translated_images/ne/ds_wordcloud.664a7c07dca57de0.webp) कोड पढ्नका लागि [`notebook.ipynb`](../../../../1-Introduction/01-defining-data-science/notebook.ipynb ':ignore') मा जानुहोस्। तपाईं कोड चलाउन सक्नुहुन्छ, र वास्तविक समयमा सबै डेटा रूपान्तरणहरू कसरी प्रदर्शन हुन्छन् हेर्न सक्नुहुन्छ। > यदि तपाईंलाई Jupyter Notebook मा कोड कसरी चलाउने थाहा छैन भने, [यो लेख](https://soshnikov.com/education/how-to-execute-notebooks-from-github/) हेर्नुहोस्। ## [पाठ-पछिको क्विज](https://ff-quizzes.netlify.app/en/ds/quiz/1) ## असाइनमेन्टहरू * **कार्य १**: माथिको कोडलाई परिमार्जन गरेर **Big Data** र **Machine Learning** क्षेत्रका सान्दर्भिक अवधारणाहरू पत्ता लगाउनुहोस्। * **कार्य २**: [डेटा साइन्स परिदृश्यहरूको बारेमा सोच्नुहोस्](assignment.md) ## श्रेय यो पाठ [Dmitry Soshnikov](http://soshnikov.com) द्वारा ♥️ सहित लेखिएको हो। --- **अस्वीकरण**: यो दस्तावेज AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको छ। हामी शुद्धताको लागि प्रयास गर्छौं, तर कृपया ध्यान दिनुहोस् कि स्वचालित अनुवादमा त्रुटि वा अशुद्धता हुन सक्छ। यसको मूल भाषा मा रहेको मूल दस्तावेजलाई आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीको लागि, व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न हुने कुनै पनि गलतफहमी वा गलत व्याख्याको लागि हामी जिम्मेवार हुने छैनौं।