[ja,ko,hi] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Japanese [ja], Korean [ko], Hindi [hi]
update-translations
localizeflow[bot] 2 months ago
parent 4a7b559e22
commit f6b3630c7e

@ -12,8 +12,8 @@
"language_code": "hi"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-28T09:15:20+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:07:17+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "hi"
},
@ -42,8 +42,8 @@
"language_code": "hi"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T15:05:08+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T21:09:45+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "hi"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "hi"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:08:20+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "hi"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-24T21:15:27+00:00",
@ -108,8 +114,8 @@
"language_code": "hi"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-28T09:16:43+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:06:45+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "hi"
},
@ -192,14 +198,14 @@
"language_code": "hi"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-24T22:34:50+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:09:52+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "hi"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-24T22:34:18+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:09:48+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "hi"
},

File diff suppressed because one or more lines are too long

@ -1,48 +1,47 @@
# डेटा को परिभाषित करना
# डेटा परिभाषित करना
|![ स्केच नोट [(@sketchthedocs)](https://sketchthedocs.dev) द्वारा ](../../sketchnotes/03-DefiningData.png)|
|![ स्केचनोट द्वारा [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|डेटा को परिभाषित करना - _[@nitya](https://twitter.com/nitya) द्वारा स्केच नोट_ |
|डेटा परिभाषित करना - _स्केचनोट द्वारा [@nitya](https://twitter.com/nitya)_ |
डेटा तथ्य, जानकारी, अवलोकन और माप है जो खोज करने और सूचित निर्णय लेने में सहायता के लिए उपयोग किए जाते हैं। एक डेटा पॉइंट डेटा का एक एकल इकाई है जो एक डेटा सेट के भीतर होता है, जो डेटा पॉइंट्स का संग्रह होता है। डेटा सेट विभिन्न प्रारूपों और संरचनाओं में आ सकते हैं, और आमतौर पर यह उनके स्रोत या डेटा के उत्पन्न होने के स्थान पर आधारित होते हैं। उदाहरण के लिए, किसी कंपनी की मासिक आय स्प्रेडशीट में हो सकती है, लेकिन स्मार्टवॉच से प्राप्त घंटेवार हार्ट रेट डेटा [JSON](https://stackoverflow.com/a/383699) प्रारूप में हो सकता है। डेटा वैज्ञानिकों के लिए यह सामान्य है कि वे एक डेटा सेट के भीतर विभिन्न प्रकार के डेटा के साथ काम करें।
डेटा तथ्यों, जानकारी, अवलोकनों और मापों का समूह है जिसका उपय खोज करने और सूचित निर्णय लेने के लिए किया जाता है। एक डेटा पॉइंट डेटा का एक एकल यूनिट होता है जो एक डेटा सेट में होता है, जो डेटा पॉइंट्स का संग्रह होता है। डेटा सेट विभिन्न प्रारूपों और संरचनाओं में हो सकते हैं, और आमतौर पर इसके स्रोत या जहाँ से डेटा आया है, उस पर आधारित होते हैं। उदाहरण के लिए, एक कंपनी की मासिक आमदनी स्प्रेडशीट में हो सकती है लेकिन स्मार्टवॉच से हर घंटे की हृदय गति डेटा [JSON](https://stackoverflow.com/a/383699) प्रारूप में हो सकता है। यह सामान्य है कि डेटा वैज्ञानिक एक डेटा सेट के भीतर विभिन्न प्रकार के डेटा के साथ काम कर हैं।
यह पाठ डेटा की विशेषताओं और उसके स्रोतों के आधार पर उसे पहचानने और वर्गीकृत करने पर केंद्रित है।
यह पाठ डेटा की विशेषताओं और इसके स्रोतों के आधार पर डेटा की पहचान और वर्गीकरण पर केंद्रित है।
## [प्री-लेक्चर क्विज़](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## डेटा का वर्णन कैसे किया जाता है
### कच्चा डेटा
कच्चा डेटा वह डेटा है जो अपने स्रोत से अपनी प्रारंभिक अवस्था में आता है और जिसका विश्लेषण या संगठन नहीं किया गया है। यह समझने के लिए कि डेटा सेट में क्या हो रहा है, इसे एक ऐसे प्रारूप में व्यवस्थित करने की आवश्यकता होती है जिसे मनुष्य और वह तकनीक समझ सके जो इसे आगे विश्लेषण करने के लिए उपयोग की जा सकती है। डेटा सेट की संरचना यह बताती है कि इसे कैसे व्यवस्थित किया गया है और इसे संरचित, असंरचित और अर्ध-संरचित के रूप में वर्गीकृत किया जा सकता है। ये संरचना प्रकार स्रोत के आधार पर भिन्न होंगे लेकिन अंततः इन तीन श्रेणियों में फिट होंगे
कच्चा डेटा वह डेटा है जो अपने स्रोत से उसके प्रारंभिक स्थिति में आया है और जिसका विश्लेषण या संगठन नहीं किया गया है। यह समझने के लिए कि डेटा सेट में क्या हो रहा है, इसे एक ऐसे प्रारूप में व्यवस्थित करना आवश्यक होता है जिसे मनुष्य और तकनीक दोनों समझ सकें और आगे विश्लेषण कर सकें। डेटा सेट की संरचना यह बताती है कि यह कैसे व्यवस्थित है और इसे संरचित, असंरचित और अर्द्ध-संरचित के रूप में वर्गीकृत किया जा सकता है। इन संरचनात्मक प्रकारों में भिन्नता होती है, जो स्रोत पर निर्भर करती है लेकिन अंततः ये तीन श्रेणियों में फिट होती हैं।
### मात्रात्मक डेटा
मात्रात्मक डेटा डेटा सेट के भीतर संख्यात्मक अवलोकन होते हैं और आमतौर पर इन्हें विश्लेषण, माप और गणितीय रूप से उपयोग किया जा सकता है। मात्रात्मक डेटा के कुछ उदाहरण हैं: किसी देश की जनसंख्या, किसी व्यक्ति की ऊचाई या किसी कंपनी की तिमाही आय। कुछ अतिरिक्त विश्लेषण के साथ, मात्रात्मक डेटा का उपयोग वायु गुणवत्ता सूचकांक (AQI) के मौसमी रुझानों की खोज करने या एक सामान्य कार्य दिवस पर ट्रैफिक की संभावना का अनुमान लगाने के लिए किया जा सकता है।
मात्रात्मक डेटा डेटा सेट के भीतर संख्यात्मक अवलोकन होते हैं और आमतौर पर इसका विश्लेषण, मापन और गणितीय उपयोग किया जा सकता है। मात्रात्मक डेटा के कुछ उदाहरण हैं: किसी देश की जनसंख्या, किसी व्यक्ति की ऊचाई या किसी कंपनी की तिमाही आय। कुछ अतिरिक्त विश्लेषण के साथ, मात्रात्मक डेटा का उपयोग मौसम गुणवत्ता सूचकांक (AQI) के मौसमी रुझान खोजने या सामान्य कार्य दिवस में ट्रैफिक की संभावना का अनुमान लगाने के लिए किया जा सकता है।
### गुणात्मक डेटा
गुणात्मक डेटा, जिसे श्रेणीबद्ध डेटा भी कहा जाता है, वह डेटा है जिसे मात्रात्मक डेटा के अवलोकन की तरह वस्तुनिष्ठ रूप से मापा नहीं जा सकता। यह आमतौर पर विभिन्न प्रारूपों में व्यक्तिपरक डेटा होता है जो किसी उत्पाद या प्रक्रिया की गुणवत्ता को कैप्चर करता है। कभी-कभी, गुणात्मक डेटा संख्यात्मक होता है लेकिन इसे आमतौर पर गणितीय रूप से उपयोग नहीं किया जाता, जैसे फोन नंबर या टाइमस्टैम्प। गुणात्मक डेटा के कुछ उदाहरण हैं: वीडियो टिप्पणियां, कार का ब्रांड और मॉडल या आपके सबसे करीबी दोस्तों का पसंदीदा रंग। गुणात्मक डेटा का उपयोग यह समझने के लिए किया जा सकता है कि उपभोक्ताओं को कौन से उत्पाद सबसे अधिक पसंद हैं या नौकरी आवेदन रिज्यूमे में लोकप्रिय कीवर्ड की पहचान करने के लिए।
गुणात्मक डेटा, जिसे श्रेणीबद्ध डेटा भी कहा जाता है, वह डेटा है जिसे मात्रात्मक डेटा के अवलोकनों की तरह वस्तुनिष्ठ रूप से मापा नहीं जा सकता। यह आमतौर पर विभिन्न प्रकार के व्यक्तिपरक डेटा होते हैं जो किसी वस्तु, जैसे किसी उत्पाद या प्रक्रिया की गुणवत्ता को कैप्चर करते हैं। कभी-कभी, गुणात्मक डेटा संख्यात्मक हो सकता है जिसे सामान्यतः गणितीय रूप से उपयोग नहीं किया जाता, जैसे फोन नंबर या टाइमस्टैम्प। गुणात्मक डेटा के कुछ उदाहरण हैं: वीडियो टिप्पणियाँ, कार का मॉडल और मेक, या आपके सबसे करीबी मित्रों का पसंदीदा रंग। गुणात्मक डेटा का उपयोग यह समझने के लिए किया जा सकता है कि उपभोक्ता कौन से उत्पाद सबसे अधिक पसंद करते हैं या नौकरी आवेदन रिज्यूमे में लोकप्रिय कीवर्ड की पहचान करने के लिए।
### संरचित डेटा
संरचित डेटा वह डेटा है जो पंक्तियों और स्तंभों में व्यवस्थित होता है, जहा प्रत्येक पंक्ति में समान सेट के स्तंभ होते हैं। स्तंभ किसी विशेष प्रकार के मान का प्रतिनिधित्व करते हैं और यह नाम द्वारा पहचाने जाते हैं जो यह बताता है कि मान क्या दर्शाता है, जबकि पंक्तिया वास्तविक मानों को रखती हैं। स्तंभों में अक्सर मानों पर एक विशिष्ट सेट के नियम या प्रतिबंध होते हैं, ताकि यह सुनिश्चित किया जा सके कि मान सटीक रूप से स्तंभ का प्रतिनिधित्व करते हैं। उदाहरण के लिए, ग्राहकों की एक स्प्रेडशीट की कल्पना करें जहां प्रत्येक पंक्ति में एक फोन नंबर होना चाहिए और फोन नंबरों में कभी भी वर्णमाला के अक्षर नहीं होते। फोन नंबर स्तंभ पर नियम लागू किए जा सकते हैं ताकि यह सुनिश्चित किया जा सके कि यह कभी खाली न हो और केवल संख्याएं ही हो
संरचित डेटा वह डेटा होता है जो पंक्तियों और स्तंभों में व्यवस्थित होता है, जहा प्रत्येक पंक्ति में समान स्तंभ होते हैं। स्तंभ किसी विशेष प्रकार के मान का प्रतिनिधित्व करते हैं और एक नाम के साथ पहचाने जाते हैं जो बताता है कि मान क्या दर्शाता है, जबकि पंक्तिया वास्तविक मानों को रखती हैं। स्तंभों में अक्सर मानों के लिए विशिष्ट नियम या प्रतिबंध होते हैं, ताकि मान स्तंभ का सटीक प्रतिनिधित्व करें। उदाहरण के लिए, कल्पना कीजिए एक ग्राहक स्प्रेडशीट जिसमें प्रत्येक पंक्ति में फोन नंबर होना अनिवार्य है और फोन नंबरों में कभी भी अक्षर नहीं होते। फोन नंबर स्तंभ में नियम लागू हो सकते हैं जो सुनिश्चित करें कि वह खाली न हो और केवल संख्या ही हो।
संरचित डेटा का एक लाभ यह है कि इसे इस तरह से व्यवस्थित किया जा सकता है कि इसे अन्य संरचित डेटा से संबंधित किया जा सके। हालांकि, क्योंकि डेटा को एक विशिष्ट तरीके से व्यवस्थित करने के लिए डिज़ाइन किया गया है, इसकी समग्र संरचना में परिवर्तन करना काफी प्रयास ले सकता है। उदाहरण के लिए, ग्राहक स्प्रेडशीट में एक ईमेल स्तंभ जोड़ना जो खाली नहीं हो सकता, इसका मतलब है कि आपको यह पता लगाना होगा कि आप मौजूदा ग्राहकों की पंक्तियों में इन मानों को कैसे जोड़ेंगे
संरचित डेटा का एक लाभ यह है कि इसे इस तरह व्यवस्थित किया जा सकता है कि यह अन्य संरचित डेटा से संबंधित हो सके। हालांकि, क्योंकि डेटा को एक विशिष्ट तरीके से व्यवस्थित करने के लिए डिज़ाइन किया गया है, इसकी संरचना में बदलाव करना काफी मेहनत का काम हो सकता है। उदाहरण के लिए, ग्राहक स्प्रेडशीट में एक ईमेल स्तंभ जोड़ना जो खाली नहीं हो सकता, इसका मतलब होगा कि आपको मौजूदा ग्राहकों की पंक्तियों में इन मानों को जोड़ने का तरीका खोजने की आवश्यकता होगी
संरचित डेटा के उदाहरण: स्प्रेडशीट, रिलेशनल डेटाबेस, फोन नंबर, बैंक स्टेटमेंट
संरचित डेटा के उदाहरण: स्प्रेडशीट, रिलेशनल डेटाबेस, फोन नंबर, बैंक स्टेटमेंट्स
### असंरचित डेटा
असंरचित डेटा आमतौर पर पंक्तियों या स्तंभों में वर्गीकृत नहीं किया जा सकता और इसमें कोई प्रारूप या नियमों का सेट नहीं होता। क्योंकि असंरचित डेटा की संरचना पर कम प्रतिबंध होते हैं, इसकी तुलना में नए जानकारी को जोड़ना आसान होता है। यदि एक सेंसर जो हर 2 मिनट पर वायुमंडलीय दबाव का डेटा कैप्चर करता है, उसे एक अपडेट प्राप्त होता है जो अब इसे तापमान को मापने और रिकॉर्ड करने की अनुमति देता है, तो यदि यह असंरचित है तो मौजूदा डेटा को बदलने की आवश्यकता नहीं होती। हालांकि, इस प्रकार के डेटा का विश्लेषण या जांच करने में अधिक समय लग सकता है। उदाहरण के लिए, एक वैज्ञानिक जो पिछले महीने के औसत तापमान को सेंसर के डेटा से निकालना चाहता है, लेकिन यह पता चलता है कि सेंसर ने अपने रिकॉर्ड किए गए डेटा में "e" दर्ज किया है ताकि यह नोट किया जा सके कि यह टूट गया था, जिससे डेटा अधूरा हो गया
असंरचित डेटा आमतौर पर पंक्तियों या स्तंभों में वर्गीकृत नहीं किया जा सकता और इसका कोई विशेष प्रारूप या नियम नहीं होता जिसे पालन किया जाना चाहिए। क्योंकि असंरचित डेटा की संरचना पर कम प्रतिबंध होते हैं, इसलिए ा जानकारी जोड़ना आसान होता है, विशेष रूप से संरचित डेटा सेट की तुलना में। यदि कोई संवेदी यंत्र जो हर 2 मिनट में वायुमंडलीय दबाव पर डेटा कैप्चर करता है उसे अपडेट मिला है कि अब यह तापमान भी माप और रिकॉर्ड कर सकता है, तो असंरचित डेटा में मौजूदा डेटा को बदलने की आवश्यकता नहीं होती। हालांकि, इस प्रकार के डेटा का विश्लेषण या जांच अधिक समय ले सकती है। उदाहरण के लिए, एक वैज्ञानिक जो पिछले महीने के औसत तापमान को ज्ञात करना चाहता है, लेकिन पाता है कि सेंसर ने अपनी कुछ रिकॉर्ड की गई डेटा में "e" दर्ज किया है ताकि यह संकेत मिले कि यह टूटा हुआ था, जो दर्शाता है कि डेटा अधूरा है
असंरचित डेटा के उदाहरण: टेक्स्ट फाइलें, टेक्स्ट संदेश, वीडियो फाइलें
असंरचित डेटा के उदाहरण: टेक्स्ट फाइलें, टेक्स्ट मैसेज, वीडियो फाइलें
### अर्ध-संरचित डेटा
अर्ध-संरचित डेटा में ऐसी विशेषताएं होती हैं जो इसे संरचित और असंरचित डेटा का संयोजन बनाती हैं। यह आमतौर पर पंक्तियों और स्तंभों के प्रारूप का पालन नहीं करता लेकिन इसे इस तरह से व्यवस्थित किया जाता है जिसे संरचित माना जाता है और यह एक निश्चित प्रारूप या नियमों का सेट का पालन कर सकता है। संरचना स्रोतों के बीच भिन्न होगी, जैसे कि एक अच्छी तरह से परिभाषित पदानुक्रम से लेकर कुछ अधिक लचीला जो नई जानकारी के आसान एकीकरण की अनुमति देता है। मेटाडेटा संकेतक होते हैं जो यह तय करने में मदद करते हैं कि डेटा कैसे व्यवस्थित और संग्रहीत किया गया है और डेटा के प्रकार के आधार पर इनके विभिन्न नाम होते हैं। मेटाडेटा के कुछ सामान्य नाम हैं टैग, तत्व, इकाइयां और विशेषताएं। उदाहरण के लिए, एक सामान्य ईमेल संदेश में एक विषय, बॉडी और प्राप्तकर्ताओं का सेट होता है और इसे किसने या कब भेजा गया था के आधार पर व्यवस्थित किया जा सकता है।
### अर्द्ध-संरचित
अर्द्ध-संरचित डेटा में संरचित और असंरचित डेटा दोनों के गुण होते हैं। यह आमतौर पर पंक्तियों और स्तंभों के प्रारूप का पालन नहीं करता लेकिन इसे इस तरह व्यवस्थित किया जाता है जिसे संरचित माना जाता है और यह निश्चित प्रारूप या नियमों का पालन कर सकता है। संरचना स्रोतों के बीच भिन्न होती है, जैसे कि पूर्ण परिभाषित अनुक्रमणिका से लेकर कुछ अधिक लचीला जो नई जानकारी को आसानी से एकीकृत करने की अनुमति देता है। मेटाडेटा ऐसे संकेतक होते हैं जो यह तय करते हैं कि डेटा कैसे व्यवस्थित और संग्रहित किया गया है और इनके विभिन्न नाम हो सकते हैं, जो डेटा के प्रकार पर निर्भर करते हैं। मेटाडेटा के कुछ सामान्य नाम टैग, एलिमेंट्स, एंटिटीज़ और एट्रिब्यूट्स हैं। उदाहरण के लिए, एक आम ईमेल संदेश में विषय, मुख्य भाग और प्राप्तकर्ताओं का सेट होगा और इसे यह निर्धारित करने के लिए व्यवस्थित किया जा सकता है कि किसने और कब भेजा
अर्ध-संरचित डेटा के उदाहरण: HTML, CSV फाइलें, जावास्क्रिप्ट ऑब्जेक्ट नोटेशन (JSON)
अर्द्ध-संरचित डेटा के उदाहरण: HTML, CSV फाइलें, JavaScript Object Notation (JSON)
## डेटा के स्रोत
डेटा स्रोत वह प्रारंभिक स्थान है जहां डेटा उत्पन्न हुआ था, या जहां यह "रहता" है और यह इस बात पर निर्भर करेगा कि इसे कैसे और कब एकत्र किया गया। उपयोगकर्ता द्वारा उत्पन्न डेटा को प्राथमिक डेटा कहा जाता है जबकि द्वितीयक डेटा उस स्रोत से आता है जिसने सामान्य उपयोग के लिए डेटा एकत्र किया है। उदाहरण के लिए, वैज्ञानिकों का एक समूह जो वर्षावन में अवलोकन एकत्र करता है, उसे प्राथमिक माना जाएगा और यदि वे इसे अन्य वैज्ञानिकों के साथ साझा करने का निर्णय लेते हैं तो इसे उन लोगों के लिए द्वितीयक माना जाएगा जो इसका उपयोग करते हैं
डेटा स्रोत वह प्रारंभिक स्थान होता है जहाँ डेटा उत्पन्न हुआ था, या जहाँ यह "रहता" है और यह इस बात पर निर्भर करता है कि इसे कैसे और कब एकत्रित किया गया था। उपयोगकर्ता द्वारा उत्पन्न डेटा को प्राथमिक डेटा कहा जाता है जबकि द्वितीयक डेटा उस स्रोत से आता है जिसने सामान्य उपयोग के लिए डेटा एकत्र किया है। उदाहरण के लिए, एक समूह जिसे वैज्ञानिक बारहमासी वन में अवलोकन एकत्र कर रहे हैं, उसे प्राथमिक माना जाएगा और यदि वे इसे अन्य वैज्ञानिकों के साथ साझा करने का निर्णय लेते हैं, तो इसका उपयोग करने वालों के लिए इसे द्वितीयक माना जाएगा।
डेटाबेस एक सामान्य स्रोत हैं और डेटाबेस प्रबंधन प्रणाली पर निर्भर करते हैं जो डेटा को होस्ट और बनाए रखता है, जहां उपयोगकर्ता डेटा का पता लगाने के लिए क्वेरी नामक कमांड का उपयोग करते हैं। फाइलें डेटा स्रोत के रूप में ऑडियो, इमेज और वीडियो फाइलें हो सकती हैं, साथ ही एक्सेल जैसी स्प्रेडशीट भी। इंटरनेट स्रोत डेटा को होस्ट करने के लिए एक सामान्य स्थान है, जहां डेटाबेस और फाइलें दोनों पाई जा सकती हैं। एप्लिकेशन प्रोग्रामिंग इंटरफेस, जिसे API भी कहा जाता है, प्रोग्रामर को इंटरनेट के माध्यम से बाहरी उपयोगकर्ताओं के साथ डेटा साझा करने के तरीके बनाने की अनुमति देता है, जबकि वेब स्क्रैपिंग प्रक्रिया वेब पेज से डेटा निकालती है। [डेटा के साथ काम करने वाले पाठ](../../../../../../../../../2-Working-With-Data) विभिन्न डेटा स्रोतों का उपयोग करे पर केंद्रित हैं।
डेटाबेस एक सामान्य स्रोत होते हैं और डेटा को होस्ट और बनाए रखने के लिए डेटाबेस प्रबंधन प्रणाली पर निर्भर करते हैं जहाँ उपयोगकर्ता डेटा का पता लगाने के लिए क्वेरी नामक कमांड का उपयोग करते हैं। डेटा स्रोत के रूप में फाइलें ऑडियो, छवि और वीडियो फाइलें हो सकती हैं साथ ही Excel जैसी स्प्रेडशीट भी हो सकती हैं। इंटरनेट स्रोत डेटा होस्ट करने के लिए एक सामान्य स्थान है जहाँ डेटाबेस के साथ फाइलें भी पाई जा सकती हैं। एप्लीकेशन प्रोग्रामिंग इंटरफेस, जिन्हें API भी कहा जाता है, प्रोग्रामरों को इंटरनेट के माध्यम से बाहरी उपयोगकर्ताओं के साथ डेटा साझा करने के तरीके बनाने की अनुमति देते हैं, जबकि वेब स्क्रैपिंग डेटा को वेब पेज से निकालने की प्रक्रिया है। [वर्किंग विथ डेटा में पाठ](../../../../../../../../../2-Working-With-Data) विभिन्न डेटा स्रोतों का उपयोग कैसे करें इस पर ध्यान केंद्रित करते हैं।
## निष्कर्ष
@ -51,26 +50,30 @@
- डेटा क्या है
- डेटा का वर्णन कैसे किया जाता है
- डेटा को कैसे वर्गीकृत और श्रेणीबद्ध किया जाता है
- डेटा कहा पाया जा सकता है
- डेटा कहा पाया जा सकता है
## 🚀 चुनौती
Kaggle खुल डेटा सेट्स का एक उत्कृष्ट स्रोत है। [डेटा सेट खोज उपकरण](https://www.kaggle.com/datasets) का उपयोग करके कुछ रोचक डेटा सेट खोजें और 3-5 डेटा सेट को इस मानदंड के साथ वर्गीकृत करें:
Kaggle खुल डेटा सेट्स का एक उत्कृष्ट स्रोत है। [डेटासेट खोज उपकरण](https://www.kaggle.com/datasets) का उपयोग करके कुछ दिलचस्प डेटा सेट खोजें और 3-5 डेटा सेट्स को इस मानदंड के साथ वर्गीकृत करें:
- क्या डेटा मात्रात्मक है या गुणात्मक?
- क्या डेटा संरचित, असंरचित या अर्ध-संरचित है?
- क्या डेटा संरचित, असंरचित, या अर्द्ध-संरचित है?
## [पोस्ट-लेक्चर क्विज़](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## समीक्षा और स्व-अध्ययन
- Microsoft Learn का यह यूनिट, जिसका शीर्षक है [अपने डेटा को वर्गीकृत करें](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data), संरचित, अर्ध-संरचित और असंरचित डेटा का विस्तृत विवरण प्रदान करता है।
- यह Microsoft Learn यूनिट, जिसका शीर्षक है [डेटा प्रारूप की पहचान](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text), संरचित, अर्द्ध-संरचित, और असंरचित डेटा का विस्तृत विवरण है।
## असाइनमेंट
[डेटा सेट्स को वर्गीकृत करना](assignment.md)
[डेटासेट वर्गीकरण](assignment.md)
---
**अस्वीकरण**:
यह दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता सुनिश्चित करने का प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवाद में त्रुटियां या अशुद्धियां हो सकती हैं। मूल भाषा में उपलब्ध मूल दस्तावेज़ को प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम जिम्मेदार नहीं हैं।
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**:
इस दस्तावेज़ का अनुवाद AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# संभावा और सांख्यिकी का परिचय\n",
"इस नोटबुक में, हम कुछ उन अवधारणाओं के साथ प्रयोग करेंगे जिन पर हमने पहले चर्चा की है। संभावना और सांख्यिकी की कई अवधारणाएं पाइथन में डेटा प्रोसेसिंग के लिए प्रमुख लाइब्रेरियों जैसे `numpy` और `pandas` में अच्छी तरह से प्रस्तुत हैं।\n"
"# संभाव्यता और सांख्यिकी का परिचय\n",
"इस नोटबुक में, हम कुछ ऐसे अवधारणाओं के साथ खेलेंगे जिन पर हमने पहले चर्चा की है। संभाव्यता और सांख्यिकी की कई अवधारणाएं पायथन में डेटा प्रोसेसिंग के प्रमुख लाइब्रेरीज जैसे `numpy` और `pandas` में अच्छी तरह से मौजूद हैं।\n"
]
},
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## रैंडम वेरिएबल्स और वितरण\n",
"चलो 0 से 9 तक के यूनिफ़ॉर्म वितरण से 30 मानों का एक नमूना बनाते हैं। हम साथ ही माध्य और और मापांक भी गणना करेंगे।\n"
"## यादृच्छिक चर और वितरण\n",
"चलिए 0 से 9 तक के समान वितरण से 30 मानों का एक नमूना निकालना शुरू करते हैं। हम माध्य और वैरिएंस भी गणना करेंगे।\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"नमूने में कितनी विभिन्न मान हैं, यह दृश्य रूप से अनुमान लगाने के लिए, हम **हिस्टोग्राम** बना सकते हैं:\n"
"नमूने में कितने अलग-अलग मान हैं, इसका दृश्यात्मक अनुमान लगाने के लिए, हम **हिस्टोग्राम** बना सकते हैं:\n"
]
},
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## वास्तविक डेटा का विश्लेषण करना\n",
"## वास्तविक डेटा का विश्लेषण\n",
"\n",
"मीन और विचरण वास्तविक दुनिया के डेटा का विश्लेषण करते समय बहुत महत्वपूर्ण होते हैं। आइए बेसबॉल खिलाड़ियों के डेटा को [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) से लोड करें\n"
"वास्तविक दुनिया के डेटा का विश्लेषण करते समय माध्य और विचरण बहुत महत्वपूर्ण होते हैं। आइए बेसबॉल खिलाड़ियों के बारे में डेटा [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) से लोड करें\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> हम डेटा विश्लेषण के लिए यहाँ [**Pandas**](https://pandas.pydata.org/) नामक एक पैकेज का उपयोग कर रहे हैं। हम इस कोर्स में बाद में Pandas और Python में डेटा के साथ काम करने के बारे में अधिक चर्चा करेंगे।\n",
"> हम यहां डेटा विश्लेषण के लिए [**Pandas**](https://pandas.pydata.org/) नामक एक पैकेज का उपयोग कर रहे हैं। इस पाठ्यक्रम में हम बाद में Pandas और पायथन में डेटा के साथ काम करने के बारे में और बात करेंगे।\n",
"\n",
"आइए आयु, ऊंचाई और वजन के औसत मान का गणना करें:\n"
"चलिए आयु, ऊंचाई और वजन के औसत मान की गणना करते हैं:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"अब चलिए ऊंचाई पर ध्यान केंद्रित करते हैं, और मानक विचलन और परिवर्तन गणना करते हैं:\n"
"अब ऊंचाई पर ध्यान केंद्रित करते हैं, और मानक विचलन तथा विचरण की गणना करते हैं: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"औसत के अतिरिक्त, मध्यिका मान और क्वार्टाइल पर भी ध्यान देना समझदारी है। इन्हें **बॉक्स प्लॉट** का उपयोग करके चित्रित किया जा सकता है:\n"
"औसत के अलावा, माध्यिका मान और चतुर्थांशों को देखना भी समझदारी होगी। इन्हें एक **बॉक्स प्लॉट** का उपयोग करके दर्शाया जा सकता है:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"हम अपने डेटासेट के उपसमूहों के बॉक्स प्लॉट भी बना सकते हैं, उदाहरण के लिए, खिलाड़ी की भूमिका के अनुसार समूहित।\n"
"हम अपने डेटासेट के उपसमूहों के भी बॉक्स प्लॉट बना सकते हैं, उदाहरण के लिए, खिलाड़ी भूमिका द्वारा समूहित। \n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **ध्यान दें**: यह चित्र सुझाव देता है कि औसतन, पहले बेसमैन की ऊँचाई दूसरे बेसमैन की ऊँचाई से अधिक होती है। बाद में हम सीखेंगे कि हम इस परिकल्पना का अधिक औपचारिक रूप से परीक्षण कैसे कर सकते हैं, और कैसे यह दर्शा सकते हैं कि हमारा डेटा सांख्यिकीय रूप से महत्वपूर्ण है। \n",
"> **नोट**: यह आरेख सुझाव देता है कि औसतन, पहले बेसमैन की ऊंचाई दूसरे बेसमैन की ऊंचाई से अधिक होती है। बाद में हम सीखेंगे कि हम इस परिकल्पना का अधिक औपचारिक रूप से परीक्षण कैसे कर सकते हैं, और यह कैसे प्रदर्शित कर सकते हैं कि हमारे डेटा में यह सांख्यिकीय रूप से महत्वपूर्ण है। \n",
"\n",
"आयु, ऊंचाई और वजन सभी निरंतर यादृच्छिक चर हैं। आपको क्या लगता है कि उनका वितरण क्या है? यह पता लगाने का एक अच्छा तरीका है मानों का हिस्टोग्राम बनाना: \n"
"उम्र, ऊंचाई और वजन सभी सतत यादृच्छिक चर हैं। आपको क्या लगता है कि उनका वितरण क्या होगा? पता लगाने का एक अच्छा तरीका है कि मानों का हिस्टोग्राम बनाएं: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## सामान्य वितरण\n",
"\n",
"आइए एक कृत्रिम वजन नमूना बनाते हैं जो हमारे वास्तविक डेटा के समान माध्य और विचरण के साथ सामान्य वितरण का पालन करता है:\n"
"आइए एक कृत्रिम वजन का नमूना बनाएं जो हमारे वास्तविक डेटा के समान माध्य और विचरण के साथ सामान्य वितरण का पालन करता है:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"चूंकि वास्तविक जीवन में अधिकांश मान सामान्य वितरण के होते हैं, हमें नमूना डेटा उत्पन्न करने के लिए एक समान यादृच्छिक संख्या जनरेटर का उपयोग नहीं करना चाहिए। यहां यह है कि अगर हम समान वितरण (जो `np.random.rand` द्वारा उत्पन्न होता है) के साथ वजन उत्पन्न करने की कोशिश करें तो क्या होता है:\n"
"चूँकि असल जीवन में अधिकांश मान सामान्य रूप से वितरित होते हैं, हमें नमूना डेटा उत्पन्न करने के लिए एक समान यादृच्छिक संख्या जनरेटर का उपयोग नहीं करना चाहिए। यह है जो होता है अगर हम समान वितरण के साथ वज़न उत्पन्न करने की कोशिश करें (जो `np.random.rand` द्वारा उत्पन्न होता है): \n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## विश्वास अंतराल\n",
"\n",
"अब आइए बेसबॉल खिलाड़ियों के वजन और कद के लिए विश्वास अंतराल की गणना कर हैं। हम इस कोड का उपयोग करेंगे [इस stackoverflow चर्चा से](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"आइए अब बेसबॉल खिलाड़ियों के वजन और ऊंचाई के लिए विश्वास अंतराल की गणना करें। हम इस कोड का उपयोग करेंगे [इस स्टैकओवरफ्लो चर्चा से](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## परिकल्पना परीक्षण\n",
"\n",
"आइए हमारे बेसबॉल खिलाड़ियों के डेटासेट में विभिन्न भूमिकाओं का पता लगाएं:\n"
"चलिए अपने बेसबॉल खिलाड़ियों के डेटासेट में विभिन्न भूमिकाओं का अन्वेषण करते हैं:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"आइए यह परीक्षण कर हैं कि क्या पहला बेसमैन दूसरे बेसमैन से लंबा होता है। इसे जांचने का सबसे सरल तरीका है विश्वास अंतराल का परीक्षण करना:\n"
"आइए यह परिकल्पना परीक्षण करें कि पहला बेसमैन दूसरे बेसमैन से लंबा होता है। इसे परीक्षण करने का सबसे सरल तरीका विश्वास अंतराल का परीक्षण करना है:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"हम देख सकते हैं कि इंटरवल ओवरलैप नहीं होते हैं।\n",
"हम देख सकते हैं कि अंतराल ओवरलैप नहीं करते हैं।\n",
"\n",
"सिद्धांत को प्रमाणित करने का एक सांख्यिकीय रूप से अधिक सही तरीका **Student t-test** का उपयोग करना है:\n"
"परिकल्पना को साबित करने का एक सांख्यिकीय रूप से अधिक सही तरीका है **स्टूडेंट t-परीक्षण** का उपयोग करना:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"`ttest_ind` फ़ंक्शन द्वारा लौटाए गए दो मान हैं:\n",
"* p-मूल्य को दो वितरणों के समान माध्य होने की संभावना के रूप में माना जा सकता है। हमारे मामले में, यह बहुत कम है, जिसका मतलब है कि पहले बेसमैन लंबे होने का मजबूत साक्ष्य है।\n",
"* t-मूल्य सामान्यीकृत माध्य अंतर का मध्यवर्ती मान है जिसका उपयोग t-परीक्षण में किया जाता है, और इसे एक दिए गए विश्वसनीयता मान के लिए एक सीमा मान के खिलाफ तुलना किया जाता है।\n"
"* p-मूल्य को दो वितरणों के समान माध्य होने की संभावना के रूप में माना जा सकता है। हमारे मामले में, यह बहुत कम है, जिसका अर्थ है कि पहले बेसमेन के लंबे होने के पक्ष में मजबूत साक्ष्य हैं।\n",
"* t-मूल्य सामान्यीकृत माध्य भेद का मध्यवर्ती मान है जिसका उपयोग t-टेस्ट में किया जाता है, और इसे दिए गए विश्वसनीयता मान के लिए एक सीमा मान के खिलाफ तुलना की जाती है।\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## केंद्रीय सीमा प्रमेय के साथ सामान्य वितरण का अनुकरण\n",
"## केंद्रीय सीमा प्रमेय के साथ सामान्य वितरण का सिमुलेशन करना\n",
"\n",
"Python में छद्म-संयोजक जनरेटर हमें समान वितरण प्रदान करने के लिए डिज़ाइन किया गया है। यदि हम सामान्य वितरण के लिए एक जनरेटर बनाना चाहते हैं, तो हम केंद्रीय सीमा प्रमेय का उपयोग कर सकते हैं। सामान्य वितरण मान प्राप्त करने के लिए हम समान-जनित नमूने का औसत ही गणना करेंगे।\n"
"पाइथन में छद्म-यादृच्छिक जनरेटर हमें समान वितरण देने के लिए डिज़ाइन किया गया है। यदि हम सामान्य वितरण के लिए एक जनरेटर बनाना चाहते हैं, तो हम केंद्रीय सीमा प्रमेय का उपयोग कर सकते हैं। एक सामान्य रूप से वितरित मान प्राप्त करने के लिए हम बस समान-जनरेट किए गए नमूने का माध्य निकालेंगे।\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## सहसंबंध और ईविल बेसबॉल कॉर्प\n",
"## सहसंबंध और evil बेसबॉल कॉर्पोरेशन\n",
"\n",
"सहसंबंध हमें डेटा अनुक्रमों के बीच संबंध खोजने की अनुमति देता है। हमारे खिलौने के उदाहरण में, चलिए कल्पना करते हैं कि एक ईविल बेसबॉल कॉर्पोरेशन है जो अपने खिलाड़ियों को उनकी ऊँचाई के अनुसार भुगतान करता है - खिलाड़ी जितना लंबा होगा, उसे उतनी अधिक राशि मिलेगी। मान लीजिए कि एक मूल वेतन $1000 है, और ऊँचाई के आधार पर $0 से $100 तक का अतिरिक्त बोनस है। हम MLB के असली खिलाड़ियों को लेंगे, और उनकी काल्पनिक सैलरी की गणना करेंगे:\n"
"सहसंबंध हमें डेटा अनुक्रमों के बीच संबंध खोजने की अनुमति देता है। हमारे खिलौने के उदाहरण में, चलो कल्पना करते हैं कि एक evil बेसबॉल कॉर्पोरेशन है जो अपने खिलाड़ियों को उनकी ऊंचाई के अनुसार भुगतान करता है - जितना खिलाड़ी ऊँचा होता है, उतना अधिक पैसा वह/वह प्राप्त करता है। मान लीजिए कि एक आधार वेतन $1000 है, और ऊंचाई के आधार पर $0 से $100 तक का अतिरिक्त बोनस है। हम MLB के असली खिलाड़ियों को लेंगे, और उनके काल्पनिक वेतन की गणना करेंगे:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"अब आइए उन अनुक्रमों का सह-प्रवणता (covariance) और सहसंबंध (correlation) निकालते हैं। `np.cov` हमें तथाकथित **covariance matrix** देगा, जो कई चरों के लिए सह-प्रवणता का विस्तार है। सह-प्रवणता मैट्रिक्स $M$ का तत्व $M_{ij}$ इनपुट चरों $X_i$ और $X_j$ के बीच सहसंबंध होता है, और मुख्य विकर्ण के मान $M_{ii}$ $X_{i}$ का विचलन (variance) होता है। इसी तरह, `np.corrcoef` हमें **correlation matrix** देगा।\n"
"आइए अब उन अनुक्रमों का सहवरण (covariance) और सहसंबंध (correlation) गणना करें। `np.cov` हमें एक तथाकथित **covariance matrix** देगा, जो सहवरण का बहु-वेरिएबल्स के लिए विस्तार है। सहवरण मैट्रिक्स $M$ का तत्व $M_{ij}$ इनपुट वेरिएबल्स $X_i$ और $X_j$ के बीच सहसंबंध है, और विकर्ण मान $M_{ii}$ $X_{i}$ का प्रसरण (variance) है। इसी प्रकार, `np.corrcoef` हमें **correlation matrix** देगा।\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"संबंध का मान 1 होना यह दर्शाता है कि दो चर के बीच एक मजबूत **रेखीय संबंध** है। हम एक मान को दूसरे के खिलाफ प्लॉट करके रेखीय संबंध को दृश्य रूप से देख सकते हैं:\n"
"1 के बराबर सहसंबंध का अर्थ है कि दो चरों के बीच एक मजबूत **रेखीय संबंध** है। हम एक मान को दूसरे के खिलाफ प्लॉट करके रेखीय संबंध को दृश्य रूप से देख सकते हैं:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"आइए देखते हैं कि अगर संबंध रैखिक न हो तो क्या होता है। मान लीजिए कि हमारी कंपनी ने ऊंचाई और वेतन के बीच स्पष्ट रैखिक निर्भरता को छिपाने का निर्णय लिया, और सूत्र में कुछ गैर-रैखिकता शामिल की, जैसे कि `sin`:\n"
"चलिए देखते हैं अगर संबंध रैखिक न हो तो क्या होगा। मान लीजिए कि हमारी कंपनी ने ऊंचाई और वेतन के बीच स्पष्ट रैखिक निर्भरता को छिपाने का फैसला किया, और सूत्र में कुछ गैर-रैखिकता, जैसे `sin`, जोड़ी: \n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"इस मामले में, सहसंबंध थोड़ा कम है, लेकिन यह अभी भी काफी उच्च है। अब, संबंध को और भी कम स्पष्ट बनाने के लिए, हम वेतन में कुछ यादृच्छिक परिवर्तन जोड़ सकते हैं। देखते हैं क्या होता है:\n"
"इस मामले में, सहसंबंध थोड़ा कम है, लेकिन यह अभी भी काफी उच्च है। अब, संबंध को और भी कम स्पष्ट बनाने के लिए, हम वेतन में कुछ यादृच्छिक चर जोड़कर अतिरिक्त यादृच्छिकता जोड़ना चाह सकते हैं। देखते हैं क्या होता है:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> क्या आप अंदाजा लगा सकते हैं कि डॉट्स इस तरह लंबवत रेखाओं में क्यों सजी हुई हैं?\n",
"> क्या आप यह अनुमान लगा सकते हैं कि बिंदु इस तरह ऊर्ध्वाधर रेखाओं में क्यों व्यवस्थित हो जाते हैं?\n",
"\n",
"हमने एक कृत्रिम रूप से निर्मित अवधारणा जैसे वेतन और देखे गए चर *ऊंचाई* के बीच सहसंबंध देखा है। आइए देखें कि क्या दो देखे गए चर, जैसे ऊंचाई और वजन, भी सहसंबंधित हैं:\n"
"हमने वेतन जैसे कृत्रिम रूप से निर्मित अवधारणा और देखे गए चर *ऊंचाई* के बीच सहसंबंध का अवलोकन किया है। आइए देखें कि क्या दो देखे गए चर, जैसे ऊंचाई और वजन, भी सहसंबंधित हैं:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"दुर्भाग्यवश, हमें कोई परिणाम नहीं मिला - केवल कुछ अजीब `nan` मान। इसका कारण यह है कि हमारी सीरीज के कुछ मान अपरिभाषित हैं, जिन्हें `nan` के रूप में दर्शाया गया है, जो ऑपरेशन के परिणाम को भी अपरिभाषित बना देता है। मैट्रिक्स को देखकर हम देख सकते हैं कि `Weight` समस्या वाला कॉलम है, क्योंकि `Height` मानों के बीच स्वयं सहसंबंध की गणना की गई है।\n",
"दुर्भाग्यवश, हमें कोई परिणाम प्राप्त नहीं हुआ - केवल कुछ अजीब `nan` मान। इसका कारण यह है कि हमारी श्रृंखला के कुछ मान अनिर्धारित हैं, जिन्हें `nan` के रूप में प्रदर्शित किया गया है, जो ऑपरेशन के परिणाम को भी अनिर्धारित बना देता है। मैट्रिक्स को देखकर हम देख सकते हैं कि `Weight` समस्या वाले कॉलम हैं, क्योंकि `Height` मानों के बीच स्व-सहसंबंध की गणना की गई है।\n",
"\n",
"> यह उदाहरण **डेटा तैयारी** और **सफाई** के महत्व को दर्शाता है। सही डेटा के बिना हम कुछ भी गणना नहीं कर सकते।\n",
"> यह उदाहरण **डेटा तैयारी** और **सफाई** के महत्व को दर्शाता है। उचित डेटा के बिना हम कुछ भी गणना नहीं कर सकते।\n",
"\n",
"आइए `fillna` मेथड का उपयोग करके गायब मानों को भरें, और सहसंबंध की गणना करें:\n"
"आइए `fillna` विधि का उपयोग करके लापता मान भरें, और सहसंबंध की गणना करें: \n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"वास्तव में एक सहसंबंध है, लेकिन हमारे कृत्रिम उदाहरण जितना मजबूत नहीं है। वास्तव में, यदि हम एक मान की तुलना दूसरे मान से स्कैटर प्लॉट में देखें, तो संबंध उतना स्पष्ट नहीं होगा:\n"
"वास्तव में एक सहसंबंध है, लेकिन हमारे कृत्रिम उदाहरण जितना मजबूत नहीं है। वास्तव में, यदि हम एक मान को दूसरे के खिलाफ स्कैटर प्लॉट देखें, तो यह संबंध बहुत कम स्पष्ट होगा:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## निष्कर्ष\n",
"\n",
"इस नोटबुक में हमने सीखा कि आंकड़ों पर आधारभूत क्रियाएं कैसे करें ताकि सांख्यिकीय कार्यों की गणना की जा सके। अब हम जानते हैं कि कुछ अनुमानों को साबित करने के लिए गणित और सांख्यिकी के एक मजबूत उपकरण का उपयोग कैसे करें, और एक डेटा नमूने के आधार पर मनमाने चर के लिए विश्वास अंतराल कैसे गणना करें।\n"
"इस नोटबुक में हमने डेटा पर मूलभूत क्रियाएं करने के तरीके सीखे हैं ताकि सांख्यिकीय कार्यों की गणना की जा सके। अब हमें पता है कि कुछ परिकल्पनाओं को साबित करने के लिए गणित और सांख्यिकी के एक मजबूत उपकरण का उपयोग कैसे करें, और डेटा नमूने के आधार पर यादृच्छिक चर के लिए विश्वास अंतराल कैसे गणना करें। \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**: \nइस दस्तावेज़ का अनुवाद AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयासरत हैं, कृपया ध्यान रखें कि स्वचालित अनुवाद में त्रुटियाँ या गलतियाँ हो सकती हैं। मूल भाषा में उपलब्ध दस्तावेज़ को आधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी भ्रामकता या गलतफहमी के लिए हम जिम्मेदार नहीं हैं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nइस दस्तावेज़ का अनुवाद AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T11:01:38+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "hi"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## डेटा लोड करना\n",
"\n",
"हम COVID-19 संक्रमित व्यक्तियों के डेटा का उपयोग करेंगे, जो [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) द्वारा [Johns Hopkins University](https://jhu.edu/) में प्रदान किया गया है। डेटा सेट [इस GitHub रिपॉजिटरी](https://github.com/CSSEGISandData/COVID-19) में उपलब्ध है।\n"
"हम COVID-19 संक्रमित व्यक्तियों का डेटा उपयोग करेंगे, जो [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) द्वारा [Johns Hopkins University](https://jhu.edu/) में प्रदान किया गया है। डेटासेट [इस GitHub Repository](https://github.com/CSSEGISandData/COVID-19) में उपलब्ध है।\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"हम सबसे हाल का डेटा सीधे GitHub से `pd.read_csv` का उपयोग करके लोड कर सकते हैं। यदि किसी कारण से डेटा उपलब्ध नहीं है, तो आप हमेशा `data` फ़ोल्डर में स्थानीय रूप से उपलब्ध कॉपी का उपयोग कर सकते हैं - बस नीचे उस लाइन की अनकॉमेंट करें जो `base_url` को परिभाषित करती है:\n"
"हम सीधे GitHub से सबसे हाल का डेटा `pd.read_csv` का उपयोग करके लोड कर सकते हैं। यदि किसी कारणवश डेटा उपलब्ध नहीं है, तो आप हमेशा `data` फ़ोल्डर में स्थानीय रूप से उपलब्ध कॉपी का उपयोग कर सकते हैं - बस नीचे उस लाइन के कॉमेंट को हटाएं जो `base_url` को परिभाषित करती है:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"अब संक्रमित व्यक्तियों के लिए डेटा लोड कर हैं और देख हैं कि डेटा कैसा दिखता है:\n"
"आइए अब संक्रमित व्यक्तियों के लिए डेटा लोड करें और देखें कि डेटा कैसा दिखता है:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"हम देख सकते हैं कि तालिका की प्रत्येक पंक्ति प्रत्येक देश और/या प्रांत के लिए संक्रमित व्यक्तियों की संख्या को परिभाषित करती है, और स्तंभ तिथियों के अनुरूप होते हैं। इसी तरह की तालिकाए अन्य डेटा के लिए भी लोड की जा सकती हैं, जैसे ठीक हुए लोगों की संख्या और मृत्यु की संख्या।\n"
"हम देख सकते हैं कि तालिका की प्रत्येक पंक्ति प्रत्येक देश और/या प्रांत के लिए संक्रमित व्यक्तियों की संख्या को परिभाषित करती है, और कॉलम तिथियों के अनुरूप होते हैं। इसी तरह की तालिकाए अन्य डेटा के लिए भी लोड की जा सकती हैं, जैसे ठीक होने वालों की संख्या और मृत्यु की संख्या।\n"
]
},
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## डेटा का अर्थ लगाना\n",
"## डेटा का अर्थ निकालना\n",
"\n",
"ऊपर दी गई तालिका से प्रांत कॉलम की भूमिका स्पष्ट नहीं है। चलिए देखते हैं कि `Province/State` कॉलम में कौन-कौन से अलग-अलग मान मौजूद हैं:\n"
"ऊपर की तालिका से प्रांत कॉलम की भूमिका स्पष्ट नहीं है। आइए देखें कि `Province/State` कॉलम में कौन-कौन से विभिन्न मान मौजूद हैं:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"नामों से हम निष्कर्ष निकाल सकते हैं कि ऑस्ट्रेलिया और चीन जैसे देशों के पास प्रांतों द्वारा अधिक विस्तृत विभाजन हैं। आइए उदाहरण देखने के लिए चीन की जानकारी देखें:\n"
"नामों से हम यह निष्कर्ष निकाल सकते हैं कि ऑस्ट्रेलिया और चीन जैसे देशों के पास प्रांतों द्वारा अधिक विस्तृत वर्गीकरण है। आइए चीन पर जानकारी देखें ताकि उदाहरण समझ सकें:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## डेटा की पूर्व-संसाधना\n",
"## डेटा का पूर्व-प्रसंस्करण \n",
"\n",
"हम देशों को आगे क्षेत्रों में विभाजित करने में रुचि नहीं रखते हैं, इसलिए हम पहले इस विभाजन को हटा देंगे और सभी क्षेत्रों की जानकारी एक साथ जोड़ेंगे, ताकि पूरे देश की जानकारी प्राप्त हो सके। इसे `groupby` का उपयोग करके किया जा सकता है:\n"
"हम देशों को और अधिक क्षेत्रों में बांटने में रुचि नहीं रखते हैं, इसलिए हम पहले इस विभाजन को हटा देंगे और सभी क्षेत्रों की जानकारी एक साथ जोड़ेंगे, ताकि पूरे देश की जानकारी प्राप्त हो सके। यह `groupby` का उपयोग करके किया जा सकता है:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"आप देख सकते हैं कि `groupby` का उपयोग करने के कारण सभी DataFrames अब Country/Region द्वारा अनुक्रमित हैं। इसलिए हम `.loc` का उपयोग करके किसी विशिष्ट देश का डेटा एक्सेस कर सकते हैं:|\n"
"आप देख सकते हैं कि `groupby` का उपयोग करने के कारण सभी DataFrame अब Country/Region द्वारा इंडेक्स किए गए हैं। इसलिए, हम किसी विशिष्ट देश के लिए डेटा को `.loc` का उपयोग करके एक्सेस कर सकते हैं:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **नोट** करें कि हम `[3:]` का उपयोग कैसे करते हैं ताकि एक अनुक्रम के पहले तीन तत्वों को हटा सकें जिनमें गैर-तिथि मेटाडेटा होता है (प्रांत/राज्य और भू-स्थान कॉलम)। हम उन तीन कॉलमों को पूरी तरह से भी हटा सकते हैं:\n"
"> **ध्यान दें** कि हम `[3:]` का उपयोग कैसे करते हैं ताकि पहले तीन तत्वों को हटाया जा सके जो गैर-तारीख मेटाडेटा (प्रांत/राज्य और भौगोलिक स्थिति कॉलम) होते हैं। हम उन तीन कॉलमों को पूरी तरह से हटा भी सकते हैं:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## डेटा की जांच करना\n",
"## डेटा का परीक्षण करना\n",
"\n",
"अब चलिए एक विशेष देश की जांच करते हैं। चलिए एक फ्रेम बनाते हैं जिसमें तारीख के हिसाब से संक्रमण का डेटा शामिल हो:\n"
"अब चलिए एक विशिष्ट देश की जांच करते हैं। चलिए एक फ्रेम बनाते हैं जिसमें तारीख के अनुसार संक्रमण का डेटा हो:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"अब हम हर दिन नए संक्रमित लोगों की संख्या की गणना करते हैं। इससे हमें यह देखने में मदद मिलेगी कि महामारी कितनी तेज़ी से फैल रही है। इसे करने का सबसे आसान तरीका `diff` का उपयोग करना है:\n"
"अब चलिए हर दिन नए संक्रमित लोगों की संख्या की गणना करते हैं। इससे हमें महामारी कितनी तेज़ी से फैल रही है यह देखने में मदद मिलेगी। इसे करने का सबसे आसान तरीका `diff` का उपयोग करना है:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"हम डेटा में उच्च उतार-चढ़ाव देख सकते हैं। चलिए एक महीने पर करीब से नजर डालते हैं:\n"
"हम डेटा में उच्च उतार-चढ़ाव देख सकते हैं। आइए किसी एक महीने को करीब से देखें:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"यह स्पष्ट रूप से दिखता है कि डेटा में साप्ताहिक उतार-चढ़ाव हैं। क्योंकि हम रुझानों को देखना चाहते हैं, इसलिए यह समझदारी होगी कि घुमाव को चिकना किया जाए चलती औसत की गणना करके (अर्थात हर दिन के लिए हम पिछले कई दिनों का औसत मान निकालेंगे):\n"
"यह स्पष्ट रूप से दिखता है कि डेटा में साप्ताहिक उतार-चढ़ाव हैं। क्योंकि हम रुझानों को देख पाने में सक्षम होना चाहते हैं, इसलिए यह समझदारी होगी कि चलती औसत की गणना करके वक्र को स्मूद करें (अर्थात हर दिन के लिए हम पिछले कई दिनों का औसत मान निकालेंगे):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"कई देशों की तुलना करने के लिए, हम देश की जनसंख्या को ध्यान में रखना चाहेंगे, और देश की जनसंख्या के संबंध में संक्रमित व्यक्तियों के प्रतिशत की तुलना करेंगे। देश की जनसंख्या प्राप्त करने के लिए, आइए देशों का डेटासेट लोड करें:\n"
"कई देशों की तुलना करने में सक्षम होने के लिए, हम देश की जनसंख्या को ध्यान में रखना चाह सकत हैं, और देश की जनसंख्या के सापेक्ष संक्रमित व्यक्तियों का प्रतिशत तुलना करना चाह सकते हैं। देश की जनसंख्या प्राप्त करने के लिए, आइए देशों का डेटासेट लोड करें:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"क्योंकि इस डेटा सेट में दोनों देशों और प्रांतों की जानकारी शामिल है, पूरे देश की आबादी प्राप्त करने के लिए हमें थोड़ा चालाक होना होगा:\n"
"क्योंकि इस डेटासेट में दोनों देशों और प्रांतों की जानकारी शामिल है, पूरे देश की जनसंख्या प्राप्त करने के लिए हमें थोड़ा चतुर होना होगा: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## गणना करना $R_t$\n",
"\n",
"यह देखने के लिए कि रोग कितना संक्रामक है, हम **मूल प्रजनन संख्या** $R_0$ देखते हैं, जो बताती है कि एक संक्रमित व्यक्ति आगे कितने लोगों को संक्रमित करेगा। जब $R_0$ 1 से अधिक होता है, तो महामारी फैलने की संभावना होती है।\n",
"## $R_t$ की गणना\n",
"\n",
"$R_0$ रोग की एक विशेषता है, और इसमें वे कुछ सुरक्षात्मक उपाय शामिल नहीं होते जिन्हें लोग महामारी को धीमा करने के लिए अपना सकते हैं। महामारी की प्रगति के दौरान, हम किसी भी दिए गए समय $t$ पर प्रजनन संख्या $R_t$ का अनुमान लगा सकते हैं। यह दिखाया गया है कि इस संख्या का लगभग अनुमान 8 दिनों की एक विंडो लेकर लगाया जा सकता है, और गणना की जा सकती है $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"यह देखने के लिए कि रोग कितना संक्रामक है, हम **मूल प्रसार संख्या** $R_0$ देखते हैं, जो यह सूचित करती है कि एक संक्रमित व्यक्ति कितने लोगों को आगे संक्रमित करेगा। जब $R_0$ 1 से अधिक होता है, तो महामारी फैलने की संभावना होती है।\n",
"\n",
"$R_0$ स्वयं रोग की एक संपत्ति है, और यह कुछ सुरक्षात्मक उपायों को ध्यान में नहीं रखता जो लोग महामारी को धीमा करने के लिए कर सकते हैं। महामारी की प्रगति के दौरान, हम किसी भी दिए गए समय $t$ पर पुनरुत्पादन संख्या $R_t$ का अनुमान लगा सकते हैं। यह दिखाया गया है कि इस संख्या का मोटे तौर पर अनुमान 8 दिनों की विंडो लेकर किया जा सकता है, और गणना की जा सकती है $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"जहाँ $I_t$ दिन $t$ पर नए संक्रमित व्यक्तियों की संख्या है।\n",
"\n",
"आइए हमारे महामारी डेटा के लिए $R_t$ की गणना करें। ऐसा करने के लिए, हम 8 `ninfected` मानों की एक रोलिंग विंडो लेंगे, और ऊपर दिए गए अनुपात की गणना के लिए फ़ंक्शन लगाएंगे:\n"
"आइए हमारे महामारी डेटा के लिए $R_t$ की गणना करें। ऐसा करने के लिए, हम 8 `ninfected` मानों की घुमावदार विंडो लेंगे, और ऊपर दिए गए अनुपात को गणना करने का फ़ंक्शन लागू करेंगे:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"आप देख सकते हैं कि ग्राफ़ में कुछ अंतराल हैं। ये या तो `NaN` के कारण हो सकते हैं, यदि डेटा सेट में `inf` मान मौजूद हैं। `inf` विभाजन द्वारा 0 के कारण हो सकता है, और `NaN` यह संकेत दे सकता है कि डेटा गायब है, या परिणाम की गणना करने के लिए कोई डेटा उपलब्ध नहीं है (जैसे हमारे फ्रेम की शुरुआत में, जहाँ 8 चौड़ाई की रोलिंग विंडो अभी उपलब्ध नहीं है)। ग्राफ को बेहतर बनाने के लिए, हमें उन मानों को `replace` और `fillna` फ़ंक्शन का उपयोग करके भरना होगा।\n",
"आप देख सकते हैं कि ग्राफ़ में कुछ अंतराल हैं। ये या तो `NaN` के कारण हो सकते हैं, अगर डेटासेट में `inf` मान मौजूद हों। `inf` ज़ीरो से विभाजन के कारण हो सकता है, और `NaN` दर्शा सकता है कि डेटा गायब है, या परिणाम की गणना के लिए कोई डेटा उपलब्ध नहीं है (जैसे हमारे फ्रेम की शुरुआत में, जहां चौड़ाई 8 की रोलिंग विंडो अभी उपलब्ध नहीं है)। ग्राफ को बेहतर बनाने के लिए, हमें उन मानों को `replace` और `fillna` फ़ंक्शन की मदद से भरना पड़ता है।\n",
"\n",
"आइए महामारी की शुरुआत को और देखें। हम y-अक्ष के मानों को भी 6 से नीचे के मान दिखाने क सीमित करेंगे, ताकि बेहतर देख सके, और 1 पर एक क्षैतिज रेखा खींचेंगे।\n"
"आइए महामारी की शुरुआत को और देखें। हम y-अक्ष के मानों को 6 से नीचे के मान दिखाने के लिए सीमित करेंगे, ताकि बेहतर देखा जा सके, और 1 पर एक क्षैतिज रेखा बनाएंगे।\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"महामारी का एक अन्य रोचक संकेतक है **व्युत्पन्न**, या नए मामलों में **दैनिक अंतर**। इससे हमें स्पष्ट रूप से यह देखने में मदद मिलती है कि महामारी बढ़ रही है या घट रही है।\n"
"महामारी का एक और रोचक संकेतक **व्युत्पन्न** या नए मामलों में **दैनिक अंतर** है। यह हमें स्पष्ट रूप से देखने की अनुमति देता है कि महामारी कब बढ़ रही है या घट रही है। \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"यह तथ्य देखते हुए कि रिपोर्टिंग के कारण डेटा में बहुत सारे उतार-चढ़ाव होते हैं, कुल मिलाकर तस्वीर पाने के लिए रोलिंग एवरेज चलाकर कर्व को स्मूद करना समझदारी होगी। आइए फिर से महामारी के पहले महीनों पर ध्यान दें:\n"
"चूंकि रिपोर्टिंग के कारण डेटा में बहुत सारी उतार-चढ़ाव होते हैं, इसलिए समग्र चित्र प्राप्त करने के लिए रोलिंग एवरेज चलाकर कर्व को स्मूथ करना समझदारी है। आइए फिर से महामारी के पहले महीनों पर ध्यान दें:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Challenge\n",
"\n",
"अब आपके लिए कोड और डेटा के साथ और अधिक खेलने का समय है! यहाँ कुछ सुझाव दिए गए हैं जिनके साथ आप प्रयोग कर सकते हैं:\n",
"* विभिन्न देशों में महामारी के फैलाव को देखें।\n",
"* तुलना के लिए कई देशों के $R_t$ ग्राफ़ एक प्लॉट पर बनाएं, या कई प्लॉट्स एक साथ बनाएं।\n",
"* देखें कि मृत्यु और ठीक होने की संख्या संक्रमित मामलों की संख्या के साथ कैसे सहसंबंधित है।\n",
"* विज़ुअल रूप से संक्रमण दर और मृत्यु दर का सहसंबंध करके और कुछ विषमताओं को देखकर पता लगाने की कोशिश करें कि एक सामान्य रोग कितना समय तक चलता है। इसके लिए आपको विभिन्न देशों को देखना पड़ सकता है।\n",
"* मृत्यु दर की गणना करें और यह समय के साथ कैसे बदलती है। गणनाएँ करने से पहले रोग की अवधि (दिनों में) को ध्यान में रखते हुए एक समय श्रृंखला को स्थानांतरित करना चाह सकते हैं।\n"
"## चुनौती\n",
"\n",
"अब आपके लिए कोड और डेटा के साथ अधिक खेलने का समय है! यहाँ कुछ सुझाव दिए गए हैं जिनके साथ आप प्रयोग कर सकते हैं:\n",
"* विभिन्न देशों में महामारी के प्रसार को देखें।\n",
"* तुलना के लिए कई देशों के $R_t$ ग्राफ़ एक ही प्लॉट पर बनाएं, या कई प्लॉट्स को एक साथ साइड-बाय-साइड बनाएं।\n",
"* देखें कि मृत्यु और स्वस्थ होने की संख्या संक्रमित मामलों की संख्या के साथ कैसे संबंधित है।\n",
"* देखें कि एक सामान्य बीमारी कितनी लंबी चलती है, संक्रमण दर और मृत्यु दर को विज़ुअली संबंधित करके और कुछ विसंगतियों को खोजकर। इसके लिए आपको विभिन्न देशों को देखना पड़ सकता है।\n",
"* घातकता दर की गणना करें और यह समय के साथ कैसे बदलती है। गणना करने से पहले बीमारी की अवधि (दिनों में) को ध्यान में रखते हुए एक समय श्रृंखला को स्थगित करना चाह सकते हैं।\n"
]
},
{
@ -2406,10 +2408,10 @@
"source": [
"## संदर्भ\n",
"\n",
"आप निम्नलिखित प्रकाशनों में COVID महामारी के प्रसार के आगे के अध्ययन देख सकते हैं:\n",
"* [COVID महामारी के दौरान Rt अनुमान के लिए स्लाइडिंग SIR मॉडल](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ब्लॉग पोस्ट द्वारा [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [वैश्विक COVID-19 प्रकोप के लिए समय-निर्भर पुनरुत्पादन संख्या का अनुमान](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [GitHub पर ऊपर के पेपर के लिए कोड](https://github.com/shwars/SlidingSIR)\n"
"आप निम्नलिखित प्रकाशनों में COVID महामारी के प्रसार के और अध्ययन देख सकते हैं:\n",
"* [COVID महामारी के दौरान Rt अनुमान के लिए स्लाइडिंग SIR मॉडल](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ब्लॉग पोस्ट [दिमित्रि सोश्निकोव](http://soshnikov.com) द्वारा\n",
"* टी.पेत्रोवा, डी.सोश्निकोव, ए.ग्रुनिन। [वैश्विक COVID-19 प्रकोप के लिए समय-निर्भर पुनरुत्पादन संख्या का अनुमान](https://www.preprints.org/manuscript/202006.0289/v1)। *प्रिप्रिंट्स* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [ऊपर दिए गए पेपर के लिए GitHub पर कोड](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**: \nयह दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके अनुवादित किया गया है। जबकि हम गुणवत्ता और सटीकता का प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या असंगतियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में अधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानवीय अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम जिम्मेदार नहीं हैं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nइस दस्तावेज़ का अनुवाद AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,29 +1,33 @@
# डेंजरस लिआज़ॉन्स डेटा विज़ुअलाइज़ेशन प्रोजेक्ट
# डेंजरस लायज़न्स डेटा विज़ुअलाइज़ेशन प्रोजेक्ट
शुरू करने के लिए, सुनिश्चित करें कि आपके सिस्टम पर NPM और Node चल रहे हैं। डिपेंडेंसीज़ इंस्टॉल करें (npm install) और फिर प्रोजेक्ट को लोकल चलाएं (npm run serve):
शुरू करने के लिए, आपको यह सुनिश्चित करना होगा कि आपके मशीन पर NPM और Node **>=20.0.0** चल रहा हो। निर्भरताएं इंस्टॉल करें (npm install) और फिर प्रोजेक्ट को लोकल रूप से चलाएं (npm run serve):
## प्रोजेक्ट सेटअप
```
npm install
```
### डेवलपमेंट के लिए कम्पाइल और हॉट-रिलोड्स
### विकास के लिए कंपाइल और हॉट-रिलोड
```
npm run serve
```
### प्रोडक्शन के लिए कम्पाइल और मिनिफाई
### उत्पादन के लिए कंपाइल और मिनिफाई
```
npm run build
```
### फाइल्स को लिंट और फिक्स करें
### लिंट करता है और फाइलें ठीक करता है
```
npm run lint
```
### कॉन्फ़िगरेशन को कस्टमाइज़ करें
[कॉन्फ़िगरेशन रेफरेंस](https://cli.vuejs.org/config/) देखें
### कॉन्फ़िगरेशन अनुकूलित करें
देखें [Configuration Reference](https://cli.vuejs.org/config/)
**अस्वीकरण**:
यह दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवाद में त्रुटियां या अशुद्धियां हो सकती हैं। मूल भाषा में उपलब्ध मूल दस्तावेज़ को आधिकारिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**:
इस दस्तावेज़ का अनुवाद AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,29 +1,33 @@
# डेंजरस लिआज़ॉन्स डेटा विज़ुअलाइज़ेशन प्रोजेक्ट
# खतरनाक संबंध डेटा विज़ुअलाइज़ेशन प्रोजेक्ट
शुरू करने के लिए, सुनिश्चित करें कि आपके सिस्टम पर NPM और Node चल रहे हैं। डिपेंडेंसीज़ इंस्टॉल करें (npm install) और फिर प्रोजेक्ट को लोकल रूप से चलाएं (npm run serve):
शुरू करने के लिए, आपको यह सुनिश्चित करना होगा कि आपके सिस्टम पर NPM और Node **>=20.0.0** चल रहे हों। निर्भरताएँ इंस्टॉल करें (npm install) और फिर प्रोजेक्ट को स्थानीय रूप से चलाएं (npm run serve):
## प्रोजेक्ट सेटअप
```
npm install
```
### डेवलपमेंट के लिए कंपाइल और हॉट-रिलोड्स
### विकास के लिए संकलन और हॉट-रिलोड
```
npm run serve
```
### प्रोडक्शन के लिए कंपाइल और मिनिफाई
### उत्पादन के लिए संकलन और मिनिफ़ाई
```
npm run build
```
### फाइल्स को लिंट और फिक्स करें
### फ़ाइलों की लिंटिंग और सुधार
```
npm run lint
```
### कॉन्फ़िगरेशन को कस्टमाइज़ करें
[Configuration Reference](https://cli.vuejs.org/config/) देखें
### कॉन्फ़िगरेशन कस्टमाइज़ करें
देखें [Configuration Reference](https://cli.vuejs.org/config/)।
**अस्वीकरण**:
यह दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके अनुवादित किया गया है। जबकि हम सटीकता सुनिश्चित करने का प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवाद में त्रुटियां या अशुद्धियां हो सकती हैं। मूल भाषा में उपलब्ध मूल दस्तावेज़ को प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**:
इस दस्तावेज़ का अनुवाद AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) का उपयोग करके किया गया है। जबकि हम सटीकता के लिए प्रयास करते हैं, कृपया ध्यान दें कि स्वचालित अनुवादों में त्रुटियाँ या अशुद्धियाँ हो सकती हैं। मूल दस्तावेज़ अपनी मूल भाषा में ही प्रामाणिक स्रोत माना जाना चाहिए। महत्वपूर्ण जानकारी के लिए, पेशेवर मानव अनुवाद की सिफारिश की जाती है। इस अनुवाद के उपयोग से उत्पन्न किसी भी गलतफहमी या गलत व्याख्या के लिए हम उत्तरदायी नहीं हैं।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "ja"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-28T09:11:22+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:02:06+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "ja"
},
@ -42,8 +42,8 @@
"language_code": "ja"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T12:52:04+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T21:08:43+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "ja"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "ja"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:03:07+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ja"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-25T16:38:29+00:00",
@ -108,8 +114,8 @@
"language_code": "ja"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-28T09:12:48+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:01:35+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "ja"
},
@ -192,14 +198,14 @@
"language_code": "ja"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-25T18:04:26+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:08:50+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "ja"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-25T18:03:45+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:08:47+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "ja"
},

File diff suppressed because one or more lines are too long

@ -1,75 +1,79 @@
# データの定義
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|![ [(@sketchthedocs)](https://sketchthedocs.dev) によるスケッチノート](../../sketchnotes/03-DefiningData.png)|
|:---:|
|データの定義 - _スケッチノート by [@nitya](https://twitter.com/nitya)_ |
|データの定義 - _[@nitya](https://twitter.com/nitya) によるスケッチノート_ |
データとは、発見を行い、情報に基づいた意思決定を支援するために使用される事実、情報、観察、測定値のことです。データポイントはデータセット内の単一のデータ単位であり、データポイントの集合がデータセットです。データセットはさまざまな形式や構造で提供されることがあり、その出所、つまりデータがどこから来たかに基づいていることが一般的です。例えば、企業の月次収益はスプレッドシートに記録されるかもしれませんが、スマートウォッチからの毎時の心拍数データは[JSON](https://stackoverflow.com/a/383699)形式であるかもしれません。データサイエンティストがデータセット内で異なる種類のデータを扱うことはよくあります。
データとは、発見や情報に基づく意思決定を支援するために使用される事実、情報、観察結果および測定値です。データポイントはデータセット内の単一のデータ単位で、データセットは複数のデータポイントの集合体です。データセットは異なる形式や構造で存在し、そのソースやデータの由来に基づくことが多いです。たとえば、企業の月次収益はスプレッドシートにあるかもしれませんが、スマートウォッチからの毎時の心拍数データは[JSON](https://stackoverflow.com/a/383699)形式である可能性があります。データサイエンティストがデータセット内で異なる種類のデータを扱うことは一般的です。
このレッスンでは、データの特性とその出所によってデータを識別し分類することに焦点を当てます。
このレッスンでは、データの特徴やソースに基づいたデータの識別と分類に焦点を当てます。
## [講義クイズ](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## データの記述方法
## [事前講義クイズ](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## データの説明方法
### 生データ
生データとは、出所から得られた初期状態のデータであり、分析や整理が行われていないものです。データセットで何が起きているのかを理解するためには、人間やそれをさらに分析するために使用する技術が理解できる形式に整理する必要があります。データセットの構造はその整理方法を記述し、構造化データ、非構造化データ、半構造化データとして分類されます。これらの構造の種類は出所によって異なりますが、最終的にはこれら3つのカテゴリに収まります。
生データとは、データのソースから初期の状態で得られ、分析や整理がされていないデータです。データセットの内容を理解するためには、人間や解析技術が扱いやすい形式に整理する必要があります。データセットの構造は、どのように整理されているかを示し、構造化、非構造化、半構造化の3つに分類されます。これらの構造タイプはソースにより異なりますが、最終的にはこの3つのカテゴリに収まります。
### 定量データ
定量データはデータセット内の数値的な観察であり、通常は分析、測定、数学的に使用することができます。定量データの例としては、国の人口、個人の身長、企業の四半期収益などがあります。さらに分析を加えることで、定量データを使用して季節的な空気質指数AQIの傾向を発見したり、典型的な勤務日のラッシュアワー交通の確率を推定したりすることができます。
定量データは、データセット内の数値的な観察値で、一般に分析、測定、数学的利用が可能です。定量データの例には、国の人口、個人の身長、企業の四半期収益などがあります。追加の分析により、定量データから季節ごとの空気質指数AQIの傾向を発見したり、典型的な平日のラッシュ時の交通確率を推定したりできます。
### 定性データ
定性データ(カテゴリカルデータとも呼ばれる)は、定量データの観察のように客観的に測定することができないデータです。一般的には、製品やプロセスの品質を捉える主観的なデータのさまざまな形式です。時には、定性データが数値であっても数学的に使用されることは通常ありません。例えば、電話番号やタイムスタンプなどです。定性データの例としては、ビデオコメント、車のメーカーとモデル、親しい友人の好きな色などがあります。定性データは、消費者が最も好きな製品を理解したり、求人応募履歴書で人気のあるキーワードを特定したりするために使用されることがあります。
定性データはカテゴリー型データとも呼ばれ、定量データのように客観的に測定できないデータです。主に製品やプロセスの質を捉えた主観的な多様な形式のデータです。時に定性データは数値として扱われますが、数学的には通常使用されないもの(電話番号やタイムスタンプなど)です。定性データの例には、ビデオのコメント、車のメーカーとモデル、親しい友人の好きな色などがあります。定性データは消費者が最も好む製品を理解したり、求人履歴書の人気キーワードを特定するために使われます。
### 構造化データ
構造化データは、行と列に整理されたデータであり、各行が同じセットの列を持つものです。列は特定のタイプの値を表し、その値が何を表しているかを記述する名前で識別されます。一方、行には実際の値が含まれます。列には、値が正確に列を表すようにするための特定のルールや制限が設けられることがよくあります。例えば、顧客のスプレッドシートを想像してみてください。各行には電話番号が必要であり、電話番号にはアルファベット文字が含まれないというルールがあるかもしれません。電話番号列が空でなく、数字のみを含むようにするルールが適用されることがあります
構造化データは、各行が同じ複数の列を持つ行と列に整理されたデータです。列は特定のタイプの値を表し、その値が示す内容を表す名前で識別され、行には実際の値が入ります。列には、その列の値が正確に表現されるように特定のルールや制限が設けられることが多いです。たとえば顧客のスプレッドシートがあり、各行が電話番号を持ち、電話番号にアルファベットが含まれないとします。この場合、電話番号列に空欄がなく数字のみを含むようなルールが適用されるかもしれません
構造化データの利点は、他の構造化データと関連付けることができるように整理されることです。しかし、データが特定の方法で整理されるように設計されているため、その全体的な構造を変更するには多くの労力が必要になることがあります。例えば、顧客スプレッドシートに空でないメール列を追加する場合、データセット内の既存の顧客行にこれらの値をどのように追加するかを考える必要があります
構造化データの利点は、他の構造化データと関連付けて整理できることです。ただし、データの構造が特定のフォーマットに基づいて設計されているため、全体の構造を変更するには多くの作業が必要になることがあります。例えば、空欄不可のメールアドレスの列を顧客のスプレッドシートに追加する場合、既存の顧客の行にどのように値を追加するかを考えなければなりません
構造化データの例: スプレッドシート、リレーショナルデータベース、電話番号、銀行明細
構造化データの例スプレッドシート、リレーショナルデータベース、電話番号、銀行取引明細
### 非構造化データ
非構造化データは通常、行や列に分類することができず、形式やルールのセットを持たないデータです。非構造化データはその構造に制限が少ないため、構造化データセットと比較して新しい情報を追加するのが簡単です。例えば、2分ごとに気圧データを記録するセンサーが温度を測定して記録する機能を追加された場合、非構造化データであれば既存のデータを変更する必要はありません。しかし、このタイプのデータを分析したり調査したりするのに時間がかかることがあります。例えば、科学者がセンサーのデータから先月の平均温度を見つけたいと思ったが、センサーが壊れていることを示すために記録データの一部に「e」を記録していた場合、データが不完全であることが判明するかもしれません。
非構造化データは通常、行や列に分類できず、フォーマットやルールがありません。非構造化データは構造に制限が少ないため、新しい情報の追加が構造化データに比べて容易です。例えば、2分ごとに気圧データを記録するセンサーが温度の記録を可能にするアップデートを受けた場合、非構造化であれば既存データを変更せずに済みます。ただし、こうしたデータの分析や調査には時間がかかることがあります。たとえば、科学者が前月の平均温度をセンサーのデータから求めたい場合、破損を表す記号「e」が一部に記録されていて、データが不完全であることが判明するかもしれません。
非構造化データの例: テキストファイル、テキストメッセージ、ビデオファイル
非構造化データの例:テキストファイル、テキストメッセージ、動画ファイル
### 半構造化データ
半構造化データは構造化データと非構造化データの特徴を組み合わせたものです。通常、行と列の形式には従いませんが、構造化と見なされる方法で整理されており、固定形式やルールのセットに従うことがあります。構造は出所によって異なり、明確に定義された階層から新しい情報を簡単に統合できる柔軟なものまでさまざまです。メタデータはデータがどのように整理され保存されるかを決定する指標であり、データの種類に応じてさまざまな名前が付けられます。メタデータの一般的な名前には、タグ、要素、エンティティ、属性などがあります。例えば、典型的な電子メールメッセージには件名、本文、受信者のセットがあり、送信者や送信日時によって整理することができます。
半構造化データは構造化データと非構造化データの特徴を併せ持ちます。通常、行と列の形式には従いませんが、整理されており、固定フォーマットやルールに沿っていることもあります。ソースにより構造は異なり、明確な階層構造を持つものから、情報の統合が容易な柔軟なものまでさまざまです。メタデータはデータの構造や保存方法を決定する指標で、タグ、要素、エンティティ、属性など様々な名称で呼ばれます。例えば、典型的な電子メールは件名、本文、受信者リストを持ち、誰から送られたか、いつ送られたかで整理できます。
半構造化データの例: HTML、CSVファイル、JavaScript Object Notation (JSON)
半構造化データの例HTML、CSVファイル、JavaScript Object Notation (JSON)
## データの出所
## データのソース
データの出所とは、データが生成された初期の場所、または「存在している」場所のことであり、収集方法や収集時期によって異なります。ユーザーによって生成されたデータは一次データと呼ばれ、一般的な使用のために収集されたデータは二次データと呼ばれます。例えば、熱帯雨林で観察を収集する科学者のグループは一次データと見なされ、他の科学者と共有することを決定した場合、それを使用する人々にとっては二次データと見なされます。
データソースはデータが生成された最初の場所、つまりデータの「所在」を指し、どのようにいつ収集されたかによって異なります。ユーザーによって生成されたデータは一次データと呼ばれ、一般利用のために収集されたデータは二次データです。たとえば、科学者グループが熱帯雨林の観察を収集した場合、それは一次データとされ、ほかの科学者と共有すれば、その共有先では二次データとなります。
データベースは一般的な出所であり、データをホストし維持するためにデータベース管理システムに依存しています。ユーザーはクエリと呼ばれるコマンドを使用してデータを探索します。データソースとしてのファイルには、音声、画像、ビデオファイル、Excelのようなスプレッドシートが含まれます。インターネットはデータをホストする一般的な場所であり、データベースやファイルが見つかることがあります。アプリケーションプログラミングインターフェースAPIは、プログラマーがインターネットを介して外部ユーザーとデータを共有する方法を作成することを可能にし、ウェブスクレイピングはウェブページからデータを抽出するプロセスです。[データの操作に関するレッスン](../../../../../../../../../2-Working-With-Data)では、さまざまなデータソースの使用方法に焦点を当てています。
データベースは一般的なデータソースで、データベース管理システムを使ってデータを保管、管理し、ユーザーはクエリと呼ばれる命令でデータを探ります。ファイルソースは音声、画像、動画ファイルやExcelのようなスプレッドシートなどがあります。インターネットはデータ配置の一般的な場所で、データベースやファイル双方があります。アプリケーションプログラミングインターフェースAPIはプログラマが外部ユーザーとデータ共有する手段を作るもので、ウェブスクレイピングはウェブページからのデータ抽出方法です。[Working with Data](../../../../../../../../../2-Working-With-Data) のレッスンでは様々なデータソースの利用方法に焦点を当てています。
## 結論
このレッスンでは以下を学びました:
このレッスンで学んだこと:
- データとは何か
- データの記述方法
- データの分類とカテゴリ化方法
- データがどこで見つかるか
- データの説明方法
- データの分類とカテゴライズ
- データの所在場所
## 🚀 チャレンジ
Kaggleはオープンデータセットの優れたソースです。[データセット検索ツール](https://www.kaggle.com/datasets)を使用して興味深いデータセットを見つけ、以下の基準で35のデータセットを分類してください:
Kaggleはオープンデータセットの優れたソースです。[データセット検索ツール](https://www.kaggle.com/datasets)を使って興味深いデータセットを見つけ、35件を以下の基準で分類してください
- データは定量的か定性的か?
- データは構造化、非構造化、または半構造化か?
- データは構造化、非構造化、半構造化のどれか?
## [講義後クイズ](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## 復習と自己学習
- Microsoft Learnのユニット[Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data)では、構造化データ、半構造化データ、非構造化データの詳細な内訳が提供されています。
## 復習と自主学習
- [Identify data formats](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) というタイトルのMicrosoft Learnユニットには、構造化、半構造化、非構造化データについて詳細な説明があります。
## 課題
[データセットの分類](assignment.md)
[Classifying Datasets](assignment.md)
---
**免責事項**:
この文書はAI翻訳サービス[Co-op Translator](https://github.com/Azure/co-op-translator)を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があります。元の言語で記載された文書を正式な情報源としてお考えください。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や解釈の誤りについて、当方は責任を負いません。
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**免責事項**
本書類は AI 翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を期していますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。原文の原語版が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の利用により生じたいかなる誤解や解釈違いについても、当方は責任を負いかねます。
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# 確率と統計の入門\n",
"このノートブックでは、以前に議論したいくつかの概念を試してみます。確率と統計の多くの概念は、Pythonの主要なデータ処理ライブラリである`numpy`や`pandas`などに豊富に含まれています。\n"
"# 確率と統計の紹介\n",
"このノートブックでは、以前に議論したいくつかの概念を扱います。確率と統計の多くの概念は、`numpy` や `pandas` のようなPythonの主要なデータ処理ライブラリに豊富に実装されています。\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## 確率変数と分布\n",
"0から9までの一様分布から30個の値のサンプルを抽出するところから始めましょう。平均と分散も計算します。\n"
"0から9の一様分布から30個のサンプルを抽出するところから始めましょう。また、平均と分散も計算します。\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"サンプル内にいくつの異なる値があるかを視覚的に推定するために、**ヒストグラム**をプロットすることができます:\n"
"サンプル内にどれだけ異なる値があるかを視覚的に推定するために、<strong>ヒストグラム</strong>をプロットできます:\n"
]
},
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 実データの析\n",
"## 実データの析\n",
"\n",
"平均値と分散は実世界のデータを分析する際に非常に重要です。[SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) から野球選手のデータを読み込みましょう\n"
"平均と分散は実世界のデータを解析する上で非常に重要です。[SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) から野球選手のデータを読み込みましょう\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> ここではデータ分析のために[**Pandas**](https://pandas.pydata.org/)というパッケージを使用しています。このコースの後半でPandasおよびPythonでのデータ操作について詳しく説明します。\n",
"> ここではデータ分析のために [**Pandas**](https://pandas.pydata.org/) というパッケージを使用しています。このコースの後半で、PandasやPythonでのデータ操作についてさらに詳しく説明します。\n",
"\n",
"年齢、身長、体重の平均値を計算してみましょう:\n"
"年齢、身長、体重の平均値を計算してみましょう\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"では、身長に注目して、標準偏差と分散を計算しましょう:\n"
"今度は身長に注目して、標準偏差と分散を計算しましょう: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"平均に加えて、中央値と四分位数を見ることも理にかなっています。これらは**箱ひげ図**を使って視覚化できます:\n"
"平均に加えて、中央値や四分位数を見ることも意味があります。これらは<strong>箱ひげ図</strong>を使って視覚化できます:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"データセットのサブセット、例えばプレイヤーの役割ごとにグループ化したものの箱ひげ図も作成できます。\n"
"データセットのサブセットでボックスプロットを作成することもできます。例えば、プレイヤーの役割ごとにグループ化した場合などです。\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **注意**: この図は、平均的に一塁手の身長が二塁手の身長より高いことを示唆しています。後ほど、この仮説をより正式に検証する方法や、データが統計的に有意であることを示す方法を学びます。\n",
"> <strong>注意</strong>: この図は、平均してファーストベースマンの身長がセカンドベースマンの身長より高いことを示唆しています。後ほど、この仮説をより正式に検証、データが統計的に有意であることを示す方法を学びます。 \n",
"\n",
"年齢、身長、体重はすべて連続型の確率変数です。これらの分布はどのようになっていると思いますか?調べる良い方法は、値のヒストグラムをプロットすることです:\n"
"年齢、身長、体重はいずれも連続確率変数です。これらの分布はどのようなものでしょうか?調べる良い方法は、値のヒストグラムをプロットすることです: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## 正規分布\n",
"\n",
"実際のデータと同じ平均と分散を持つ正規分布に従う人工的な体重のサンプルを作成しましょう:\n"
"実際のデータと同じ平均と分散を持つ正規分布に従う重みの人工サンプルを作成しましょう:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"実際の多くの値は正規分布しているため、サンプルデータを生成する際に一様乱数生成器を使用すべきではありません。以下は、一様分布(`np.random.rand`で生成)を使って体重を生成しようとした場合に起こることです:\n"
"実際のほとんどの値は正規分布に従うため、サンプルデータを生成するのに一様乱数生成器を使うべきではありません。ここでは、一様分布(`np.random.rand` によって生成)で体重を生成しようとした場合に起こることを示します:\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## 信頼区間\n",
"\n",
"野球選手の体重と身長の信頼区間を計算してみましょう。コードは[このstackoverflowの議論](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data)から使用します:\n"
"野球選手の体重と身長の信頼区間を計算してみましょう。[このstackoverflowの議論](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data)のコードを使用します:\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## 仮説検定\n",
"\n",
"ベースボール選手のデータセットで異なる役割を見てみましょう:\n"
"野球選手のデータセットで異なる役割を見てみましょう:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ファーストベースマンがセカンドベースマンよりも背が高いという仮説を検証してみましょう。これを行う最も簡単な方法は、信頼区間を検定することです。\n"
"一塁手が二塁手より背が高いという仮説を検証しましょう。これを行う最も簡単な方法は、信頼区間を検定することです:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"区間が重なっていないことがわかります。\n",
"インターバルが重なっていないことがわかります。\n",
"\n",
"仮説を証明するために統計的により正確な方法は、**Studentのt検定**を使用することです:\n"
"仮説を証明する、統計的により正確な方法は、<strong>スチューデントのt検定</strong>を使用することです。\n"
]
},
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"`ttest_ind` 関数によって返される2つの値は以下の通りです:\n",
"* p値は、2つの分布が同じ平均を持つ確率と考えることができます。今回の場合、この値は非常に低く、ファーストベースマンの方が身長が高いという強い証拠を示しています。\n",
"* t値はt検定で使用される正規化された平均差の中間値であり、与えられた信頼度に対する閾値と比較されます。\n"
"`ttest_ind` 関数が返す2つの値は次の通りです:\n",
"* p値は、2つの分布が同じ平均を持つ確率と考えられます。本例では非常に低く、ファーストベースマンの方が背が高いことを強く支持する証拠があります。\n",
"* t値はt検定で使用される正規化された平均差の中間値で、与えられた信頼度に対して閾値と比較されます。\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## 中央極限定理による正規分布のシミュレーション\n",
"## 中心極限定理を用いた正規分布のシミュレーション\n",
"\n",
"Pythonの擬似乱数生成器は一様分布を提供するように設計されています。正規分布の生成器を作成したい場合、中央極限定理を使用できます。正規分布に従う値を得るために、一様に生成されたサンプルの平均を計算するだけです。\n"
"Python の擬似乱数ジェネレーターは一様分布を生成するように設計されています。正規分布のジェネレーターを作成したい場合は、中心極限定理を利用できます。正規分布に従う値を得るには、一様分布から生成されたサンプルの平均を計算するだけです。\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 相関とイービル・ベースボール・コープ\n",
"## 相関とEvil Baseball Corp\n",
"\n",
"相関はデータ列間の関係を見つけることを可能にします。おもちゃの例として、悪のベースボール会社が選手の身長に応じて報酬を支払っていると仮定しましょう — 選手が背が高いほど、もらえるお金も多くなります。基本給は1000ドルで、身長に応じて0ドルから100ドルの追加ボーナスがあります。実際のMLB選手のデータを使い、架空の給与を計算します:\n"
"相関はデータ列間の関係を見つけることを可能にします。おもちゃの例として、悪質な野球会社が選手の身長に応じて給料を支払っているとしましょう。選手が高ければ高いほど、より多くのお金をもらえます。基本給は1000ドルで、身長に応じて0ドルから100ドルの追加ボーナスがあるとします。MLBの実在の選手を取り上げ、彼らの架空の給料を計算します:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"それではこれらのシーケンスの共分散と相関を計算しましょう。`np.cov` はいわゆる **共分散行列** を返します。これは共分散を複数の変数に拡張したものです。共分散行列 $M$ の要素 $M_{ij}$ は入力変数 $X_i$ と $X_j$ の共分散であり、対角要素 $M_{ii}$ は $X_i$ の分散です。同様に、`np.corrcoef` は **相関行列** を返します。\n"
"それではこれらのシーケンスの共分散と相関を計算しましょう。`np.cov` はいわゆる<strong>共分散行列</strong>を返します。これは、複数の変数に対する共分散の拡張です。共分散行列 $M$ の要素 $M_{ij}$ は入力変数 $X_i$ と $X_j$ の共分散であり、対角値 $M_{ii}$ は $X_{i}$ の分散です。同様に、`np.corrcoef` は<strong>相関行列</strong>を返します。\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"相関係数が1であるということは、2つの変数の間に強い**線形関係**があることを意味します。片方の値をもう片方に対してプロットすることで、線形関係を視覚的に確認できます。\n"
"相関係数が1であるということは、2つの変数間に強い<strong>線形関係</strong>があることを意味します。片方の値を他方の値に対してプロットすることで、線形関係を視覚的に確認できます:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"関係が線形でない場合に何が起こるか見てみましょう。私たちの会社が身長と給与の明らかな線形依存性を隠し、式に `sin` のような非線形性を導入したとしましょう:\n"
"関係が線形でない場合に何が起こるか見てみましょう。私たちの企業が身長と給与の明らかな線形依存関係を隠し、`sin` のような非線形性を式に導入したと仮定します。\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"この場合、相関はやや小さくなりますが、それでもかなり高いです。さて、この関係をさらに分かりにくくするために、給料にランダムな変数を加えていくつかのランダム性を追加したいかもしれません。何が起こるか見てみましょう:\n"
"この場合、相関はやや小さくなりますが、それでもかなり高いままです。さて、関係性をさらに目立たなくするために、給与にランダムな変数をいくつか追加して余分なランダム性を加えたいかもしれません。何が起こるか見てみましょう:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> なぜ点がこのように縦に並ぶか予想できますか?\n",
"> なぜ点がこのように縦の線に並ぶのか、わかりますか?\n",
"\n",
"私たちは、給与のような人工的に設計された概念と観測された変数*身長*との相関を観察しました。では、身長や体重のような2つの観測変数も相関するか見てみましょう:\n"
"人工的に作られた概念である給与と、観察された変数である<em>身長</em>との相関を観察しました。今度は身長と体重のような2つの観察された変数が相関しているかも見てみましょう:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"残念ながら、結果は得られず、奇妙な `nan` の値だけが表示されました。これは、シリーズ内のいくつかの値が未定義で `nan` として表されているためであり、そのため計算結果も未定義になるからです。行列を見ると、`Weight` が問題のある列であることがわかります。なぜなら、`Height` の値同士の自己相関が計算されているからです。\n",
"残念ながら、結果は得られませんでした — いくつかの奇妙な `nan` 値が返されただけです。これは、系列の一部の値が未定義で `nan` として表されているためであり、その結果、計算結果も未定義になってしまうからです。行列を見ると、`Weight` が問題のある列であることがわかります。なぜなら、`Height` の値同士の自己相関が計算されているからです。\n",
"\n",
"> この例は、**データ準備**と**クリーニング**の重要性を示しています。適切なデータがなければ、何も計算できません。\n",
"> この例は、<strong>データの準備</strong>および<strong>クリーニング</strong>の重要性を示しています。適切なデータがなければ、何も計算できません。\n",
"\n",
"`fillna` メソッドを使って欠損値を埋め、相関を計算してみましょう\n"
"`fillna` メソッドを使って欠損値を埋め、相関を計算してみましょう\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"実際に相関は存在しますが、我々の人工的な例ほど強くはありません。実際、一方の値をもう一方の値に対して散布図で見ると、その関係ははるかに分かりにくいでしょう:\n"
"実際に相関関係はありますが、私たちの人工的な例ほど強いものではありません。実際、ある値と別の値の散布図を見ると、その関係ははるかに明白ではありません: \n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## 結論\n",
"\n",
"このノートブックでは、統計関数を計算するためにデータに対して基本的な操作を行う方法を学びました。数学と統計の確かな手法を使っていくつかの仮説を検証する方法や、データサンプルから任意の変数の信頼区間を計算する方法がわかりました。\n"
"このノートブックでは、統計関数を計算するためのデータに対する基本的な操作方法を学びました。数学と統計の適切な手法を用いて仮説を検証する方法や、データサンプルから任意の変数の信頼区間を計算する方法がわかりました。\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**免責事項** \n本書類はAI翻訳サービス「Co-op Translator」https://github.com/Azure/co-op-translatorを使用して翻訳されました。正確性の確保に努めておりますが、自動翻訳には誤りや不正確な表現が含まれる場合があります。原文の言語で記載されたオリジナル文書が正式な情報源となります。重要な情報については、専門の翻訳者による翻訳を推奨します。本翻訳の利用により生じた誤解や解釈の違いに関して、当社は一切の責任を負いません。\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**免責事項**\n本書類は AI 翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を期していますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。原文の原語版が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の利用により生じたいかなる誤解や解釈違いについても、当方は責任を負いかねます。\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T10:59:16+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ja"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## データの読み込み\n",
"\n",
"[ジョンズ・ホプキンス大学](https://jhu.edu/)の[システム科学工学センター](https://systems.jhu.edu/)CSSEによって提供されたCOVID-19感染者のデータを使用します。データセットは[このGitHubリポジトリ](https://github.com/CSSEGISandData/COVID-19)で入手可能です。\n"
"[Johns Hopkins University](https://jhu.edu/)の[Center for Systems Science and Engineering](https://systems.jhu.edu/)CSSEが提供するCOVID-19感染者データを使用します。データセットは[this GitHub Repository](https://github.com/CSSEGISandData/COVID-19)で利用可能です。\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"私たちは `pd.read_csv` を使って、GitHub から最新のデータを直接読み込むことができます。もし何らかの理由でデータが利用できない場合は、常に `data` フォルダーにあるローカルのコピーを使用することができます。以下の `base_url` を定義している行のコメントを外してください。\n"
"`pd.read_csv`を使用して、最新のデータをGitHubから直接読み込むことができます。何らかの理由でデータが利用できない場合は、`data`フォルダーにあるローカルのコピーを使用することもできます。その場合は、`base_url`を定義している以下の行のコメントを外してください。\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"それでは感染者のデータを読み込み、データの様子を見てみましょう:\n"
"それでは感染者のデータを読み込み、データの様子を見てみましょう:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"表の各行はそれぞれの国および/または州の感染者数を定義しており、列は日付に対応していることがわかります。回復者数や死亡者数などの他のデータについても同様の表を読み込むことができます。\n"
"表の各行は各国および/または州の感染者数を示し、列は日付に対応していることがわかります。同様の表は、回復者数や死亡者数など、他のデータにも読み込むことができます。\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## データの理解\n",
"\n",
"上の表からは `Province/State` 列の役割がはっきりしません。`Province/State` 列に存在する異なる値を見てみましょう:\n"
"上の表からは、province 列の役割が明確ではありません。`Province/State` 列にある異なる値を見てみましょう:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"名前から、オーストラリアや中国のような国は州ごとにより詳細な分があることが推測できます。例として中国情報を見てみましょう:\n"
"名前から、オーストラリアや中国のような国は州や省ごとにより詳細な分があることが推測できます。例として中国に関する情報を見てみましょう:\n"
]
},
{
@ -1323,7 +1323,7 @@
"source": [
"## データの前処理\n",
"\n",
"国をさらに細かい地域に分解することには興味がないため、まずこの分解を取り除き、すべての地域の情報をまとめて国全体の情報を取得します。これは `groupby` を使って行うことができます。\n"
"国をさらに細かい地域に分けることには関心がないため、まずこの細分化を取り除き、すべての地域の情報をまとめて国全体の情報を取得します。これは `groupby` を使用して行うことができます:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"`groupby` を使ったため、すべてのデータフレームが現在 Country/Region をインデックスにしていることがわかります。したがって、特定の国のデータには `.loc` を使ってアクセスできます。|\n"
"`groupby` を使用したため、すべての DataFrame が国/地域をインデックスとしていることがわかります。したがって、特定の国のデータには `.loc` を使ってアクセスできます。|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **注意** 最初の3つの要素州/県や地理位置情報の列などの日付以外のメタデータを含む)を削除するために `[3:]` を使用していることに注目してください。これらの3つの列を完全に削除することもできます:\n"
"> <strong>注意</strong> `[3:]` を使って日付以外のメタデータ(州/都道府県と位置情報の列を含む最初の3つの要素を削除する方法に注目してください。この3つの列をすべて削除することもできます\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## データの調査\n",
"\n",
"それでは、特定の国の調査に切り替えましょう。日付をインデックスとした感染データを含むフレームを作成します:\n"
"次に、特定の国の調査に切り替えましょう。日付でインデックスされた感染データを含むフレームを作成します:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"それでは、毎日の新たに感染した人の数を計算しましょう。これにより、パンデミックの進行速度を確認できます。一番簡単な方法は `diff` を使うことです:\n"
"さて、毎日新たに感染した人の数を計算しましょう。これにより、パンデミックが進行する速度を確認できます。最も簡単な方法は `diff` を使うことです:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"データには明らかに週ごとの変動があります。トレンドを把握したいため、曲線を平滑化するために移動平均を計算することが理にかなっています(つまり、各日に対して直近数日の平均値を計算します):\n"
"データには明らかに週ごとの変動が見られます。トレンドを把握したいため、移動平均を計算して曲線を滑らかにするのが理にかなっています(つまり各日について、過去数日の平均値を計算します): \n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"いくつかの国を比較できるようにするために、その国の人口を考慮し、国の人口に対する感染者の割合を比較したいかもしれません。国の人口を取得するために、国のデータセットを読み込みましょう:\n"
"複数の国を比較できるようにするために、国の人口を考慮し、感染者数の国の人口に対する割合を比較したい場合があります。国の人口を取得するために、国のデータセットを読み込みましょう:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"このデータセットには国と州の両方の情報が含まれているため、国全体の人口を取得するには少し工夫が必要です。\n"
"このデータセットには国と州の両方の情報が含まれているため、国全体の人口を得るには少し工夫が必要です: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Computing $R_t$\n",
"\n",
"感染症の伝染力を見るために、**基本再生産数** $R_0$ を見ます。これは、感染者1人がさらに感染させる人数を示します。$R_0$が1より大きいと、流行は拡大しやすいことを意味します。\n",
"## $R_t$ の計算\n",
"\n",
"$R_0$ は病気自体の特性であり、人々がパンデミックの進行を遅らせるために取る防護策は考慮されていません。パンデミックの進行中には、任意の時点 $t$ で再生産数 $R_t$ を推定できます。この数はおおよそ8日間のウィンドウを取って以下で計算できます$$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ここで $I_t$ は日 $t$ の新規感染者数です。\n",
"感染症の感染力を知るために、感染者1人がさらに感染させる人数を示す <strong>基本再生産数</strong> $R_0$ を見ます。$R_0$ が1より大きい場合、流行は拡大する可能性があります。\n",
"\n",
"パンデミックデータに対して $R_t$ を計算してみましょう。そのために、8日間の `ninfected` 値のローリングウィンドウを取り、上記の比率を計算する関数を適用します:\n"
"$R_0$ は病気そのものの特性であり、人々がパンデミックの進行を遅らせるために取る防護措置は考慮しません。パンデミックの進行中、任意の時点 $t$ における再生産数 $R_t$ を推定できます。この数値は8日間の区間を取り、以下の式で概算できることが示されています。$$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ここで $I_t$ は日 $t$ に新たに感染した人数です。\n",
"\n",
"パンデミックデータについて $R_t$ を計算してみましょう。そのために、8日間の `ninfected` の値のローリングウィンドウを取り、上記の比率を計算する関数を適用します。\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"グラフにいくつか隙間があるのがわかります。これらは、データセットに `NaN` または `inf` の値が存在することが原因である可能性があります。`inf` はゼロ除算によって引き起こされることがあり、`NaN` は欠損データや計算結果を得るためのデータが利用できないことを示している場合があります例えば、幅8のローリングウィンドウがまだ利用可能でないフレームの初めの部分など)。グラフを見やすくするために、`replace` と `fillna` 関数を使ってこれらの値を埋める必要があります。\n",
"グラフにいくつかギャップがあることがわかります。これらはデータセットに `NaN` または `inf` の値が存在することが原因です。`inf` は 0 での除算によって引き起こされることがあり、`NaN` はデータの欠損や結果を計算するためのデータが利用できないことを示す場合があります例えば、幅8のローリングウィンドウがまだ利用でないフレームの非常に初めの部分など)。グラフをより見やすくするために、`replace` と `fillna` 関数を使ってこれらの値を埋める必要があります。\n",
"\n",
"パンデミックの初期部分をさらに詳しく見ていきましょう。より見やすくするためにy軸の値を6未満に制限し、かつ1の位置に水平線を描画します。\n"
"パンデミックの初期をさらに見ていきましょう。より見やすくするために、y軸の値を6以下に制限し、水平線を1に引きます。\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"パンデミックのもう一つの興味深い指標は、**微分**、または新規感染者数の**日別差分**です。これにより、パンデミックが増加しているか減少しているかを明確に把握することができます。\n"
"パンデミックのもう一つの興味深い指標は、<strong>導関数</strong>、または新規感染者数の<strong>日次差分</strong>です。これにより、パンデミックが増加しているか減少しているかを明確に把握できます。\n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"報告によるデータの変動が多いという事実を考えると、全体像を把握するために移動平均を用いて曲線を平滑化するのは理にかなっています。再びパンデミックの最初の数か月に注目しましょう:\n"
"報告によってデータに多くの変動があることを考えると、全体像を把握するためにローリング平均を実行して曲線を平滑化するのは理にかなっています。再びパンデミック初期の数か月に焦点を当てましょう:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 課題\n",
"\n",
"さて、コードとデータを使ってもっと遊んでみましょう!以下はいくつかの実験の提案です:\n",
"* さまざまな国でのパンデミックの広がりを見てみましょう。\n",
"* 複数の国の$R_t$グラフを1つのグラフにプロットして比較したり、複数のグラフを並べて表示したりしましょう。\n",
"* 死亡数や回復数が感染者数とどのように相関しているかを調べてみましょう。\n",
"* 感染率と死亡率を視覚的に比較して、典型的な病気がどれくらい続くかを見つけてみましょう。異常値を探すために異なる国を調べる必要があるかもしれません。\n",
"* 致死率を計算し、それが時間とともにどのように変化するかを見てみましょう。計算を行う前に病気の期間(日数)を考慮して、時系列の片方をシフトさせることが必要かもしれません。\n"
"## チャレンジ\n",
"\n",
"ここからはコードとデータをもっと使って遊んでみましょう!以下はいくつか試せる提案です:\n",
"* パンデミックの広がりを異なる国で見てみる。\n",
"* 複数の国の $R_t$ グラフを1つのプロットに重ねて比較する、もしくは並べて複数のグラフを作る。\n",
"* 死亡者数や回復者数が感染者数とどのように相関するかを確認する。\n",
"* 感染率と死亡率を視覚的に相関させ、異常を探ることで典型的な病気の期間を調べてみる。これを見つけるには異なる国を調べる必要があるかもしれません。\n",
"* 死亡率を計算し、時間経過でどう変化するかを調べる。計算の前に病気の期間日数を考慮し、1つの時系列をシフトするとよいかもしれません。\n"
]
},
{
@ -2406,10 +2408,10 @@
"source": [
"## References\n",
"\n",
"以下の出版物でCOVID流行のさらなる研究を見ることができます\n",
"* [COVIDパンデミック中のRt推定のためのスライディングSIRモデル](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/)、[Dmitry Soshnikov](http://soshnikov.com) によるブログ投稿\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [世界的COVID-19流行のための時間依存的再生産数の推定](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [上記論文のGitHubでのコード](https://github.com/shwars/SlidingSIR)\n"
"You may look at further studies of COVID epidemic spread in the following publications:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blog post by [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Code for the above paper on GitHub](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**免責事項** \n本書類はAI翻訳サービス「[Co-op Translator](https://github.com/Azure/co-op-translator)」を使用して翻訳されました。正確性に努めておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご了承ください。原文はあくまで正式な情報源としてご参照ください。重要な情報については、専門の翻訳者による翻訳を推奨いたします。本翻訳の利用によって生じた誤解や誤訳について、当方は一切の責任を負いかねます。\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**免責事項**\n本書類は AI 翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を期していますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。原文の原語版が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の利用により生じたいかなる誤解や解釈違いについても、当方は責任を負いかねます。\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -2451,4 +2453,4 @@
},
"nbformat": 4,
"nbformat_minor": 2
}
}

@ -1,23 +1,23 @@
# 危険な関係 データビジュアライゼーションプロジェクト
# Dangerous Liaisons データ可視化プロジェクト
始めるには、マシンにNPMとNodeがインストールされていることを確認してください。依存関係をインストールnpm installし、プロジェクトをローカルで実行しますnpm run serve:
始めるには、マシンで NPM と Node **>=20.0.0** が実行されていることを確認してください。依存関係をインストールし (npm install)、プロジェクトをローカルで実行します (npm run serve):
## プロジェクトセットアップ
## プロジェクトセットアップ
```
npm install
```
### 開発用のコンパイルとホットリロード
### 開発用にコンパイルおよびホットリロード
```
npm run serve
```
### 本番用のコンパイルと最小化
### 本番用にコンパイルおよびミニファイ
```
npm run build
```
### ファイルのリンと修正
### ファイルのリンティングと修正
```
npm run lint
```
@ -25,5 +25,9 @@ npm run lint
### 設定のカスタマイズ
[Configuration Reference](https://cli.vuejs.org/config/) を参照してください。
**免責事項**:
この文書は、AI翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知ください。元の言語で記載された文書が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や誤解釈について、当方は一切の責任を負いません。
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**免責事項**
本書類は AI 翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を期していますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。原文の原語版が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の利用により生じたいかなる誤解や解釈違いについても、当方は責任を負いかねます。
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,18 +1,18 @@
# 危険な関係 データビジュアライゼーションプロジェクト
# Dangerous Liaisons データビジュアライゼーションプロジェクト
始めるには、マシンにNPMとNodeがインストールされていることを確認してください。依存関係をインストールnpm installし、その後プロジェクトをローカルで実行してくださいnpm run serve:
始めるには、お使いのマシンに NPM Node **>=20.0.0** がインストールされて実行されていることを確認してください。依存関係をインストールnpm installし、その後ローカルでプロジェクトを実行しますnpm run serve:
## プロジェクトセットアップ
```
npm install
```
### 開発用のコンパイルとホットリロード
### 開発用にコンパイルしてホットリロード
```
npm run serve
```
### 本番用のコンパイルと最小化
### 本番用にコンパイルして圧縮
```
npm run build
```
@ -23,7 +23,11 @@ npm run lint
```
### 設定のカスタマイズ
[Configuration Reference](https://cli.vuejs.org/config/) を参照してください。
詳細は [Configuration Reference](https://cli.vuejs.org/config/) をご覧ください。
**免責事項**:
この文書は、AI翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を追求しておりますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知ください。元の言語で記載された文書が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。この翻訳の使用に起因する誤解や誤解釈について、当社は責任を負いません。
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**免責事項**
本書類は AI 翻訳サービス [Co-op Translator](https://github.com/Azure/co-op-translator) を使用して翻訳されています。正確性を期していますが、自動翻訳には誤りや不正確な部分が含まれる可能性があることをご承知おきください。原文の原語版が正式な情報源とみなされるべきです。重要な情報については、専門の人間による翻訳を推奨します。本翻訳の利用により生じたいかなる誤解や解釈違いについても、当方は責任を負いかねます。
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "ko"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-28T09:13:18+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:04:42+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "ko"
},
@ -42,8 +42,8 @@
"language_code": "ko"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T13:09:36+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T21:09:13+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "ko"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "ko"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:05:49+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ko"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-25T16:38:36+00:00",
@ -108,8 +114,8 @@
"language_code": "ko"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-28T09:14:48+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:04:05+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "ko"
},
@ -192,14 +198,14 @@
"language_code": "ko"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-25T18:04:33+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:09:21+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "ko"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-25T18:03:52+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:09:17+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "ko"
},

File diff suppressed because one or more lines are too long

@ -1,70 +1,71 @@
# 데이터 정의하기
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|![ [(@sketchthedocs)](https://sketchthedocs.dev) 의 스케치노트 ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|데이터 정의하기 - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
|데이터 정의하기 - _[@nitya](https://twitter.com/nitya) 의 스케치노트_ |
데이터는 발견을 하고 정보에 기반한 결정을 지원하기 위해 사용되는 사실, 정보, 관찰 및 측정값입니다. 데이터 포인트는 데이터셋 내에서 단일 단위의 데이터이며, 데이터셋은 데이터 포인트의 모음입니다. 데이터셋은 다양한 형식과 구조로 제공될 수 있으며, 일반적으로 데이터의 출처 또는 데이터가 어디에서 왔는지에 따라 달라집니다. 예를 들어, 회사의 월별 수익은 스프레드시트에 있을 수 있지만 스마트워치에서 수집된 시간별 심박수 데이터는 [JSON](https://stackoverflow.com/a/383699) 형식일 수 있습니다. 데이터 과학자들은 데이터셋 내에서 다양한 유형의 데이터를 다루는 경우가 흔합니다.
데이터는 발견을 하고 정보에 입각한 결정을 지원하기 위해 사용되는 사실, 정보, 관찰 및 측정치입니다. 데이터 포인트는 데이터 집합 내의 단일 데이터 단위이며, 데이터 집합은 데이터 포인트들의 모음입니다. 데이터 집합은 다양한 형식과 구조로 제공될 수 있으며, 보통 데이터가 어디서 왔는가 즉, 출처에 따라 달라집니다. 예를 들어, 회사의 월간 수익은 스프레드시트에 있을 수 있지만, 스마트워치에서 측정한 시간별 심박수 데이터는 [JSON](https://stackoverflow.com/a/383699) 형식일 수 있습니다. 데이터 과학자들이 데이터 집합 내에서 다양한 유형의 데이터를 다루는 것은 흔한 일입니다.
이 강의는 데이터의 특성과 출처에 따라 데이터를 식별하고 분류하는 데 중점을 둡니다.
## [강의 전 퀴즈](https://ff-quizzes.netlify.app/en/ds/quiz/4)
이 수업은 데이터의 특성과 출처별로 데이터를 식별하고 분류하는 데 중점을 둡니다.
## [사전 강의 퀴즈](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## 데이터가 설명되는 방식
### 원시 데이터
원시 데이터는 초기 상태에서 출처로부터 온 데이터로, 분석되거나 조직되지 않은 상태입니다. 데이터셋에서 무슨 일이 일어나고 있는지 이해하려면, 인간과 데이터를 추가로 분석하는 데 사용할 기술이 이해할 수 있는 형식으로 조직되어야 합니다. 데이터셋의 구조는 데이터가 어떻게 조직되어 있는지를 설명하며, 구조화된 데이터, 비구조화된 데이터, 반구조화된 데이터로 분류될 수 있습니다. 이러한 구조 유형은 출처에 따라 다르지만 궁극적으로 이 세 가지 범주에 속합니다.
원시 데이터는 출처에서 처음 받은 상태로, 분석되거나 정리되지 않은 데이터입니다. 데이터 집합에서 무슨 일이 일어나고 있는지 이해하려면, 이를 사람이 이해할 수 있고 추가 분석에 사용하는 기술도 이해할 수 있는 형식으로 조직할 필요가 있습니다. 데이터 집합의 구조는 어떻게 조직되는지를 설명하며, 구조화된, 비구조화된, 준구조화된 것으로 분류할 수 있습니다. 이 구조 유형은 출처에 따라 다르지만 궁극적으로 이 세 가지 범주에 들어갑니다.
### 정량적 데이터
정량적 데이터는 데이터셋 내에서 수치적 관찰값이며, 일반적으로 분석, 측정 및 수학적으로 사용할 수 있습니다. 정량적 데이터의 예로는 국가의 인구, 사람의 키, 회사의 분기별 수익 등이 있습니다. 추가 분석을 통해 정량적 데이터는 대기질 지수(AQI)의 계절적 추세를 발견하거나 일반적인 근무일의 러시아워 교통 확률을 추정하는 데 사용할 수 있습니다.
정량적 데이터는 데이터 집합 내의 수치적 관찰로, 일반적으로 분석, 측정 및 수학적으로 사용될 수 있습니다. 정량적 데이터의 예로는 한 국가의 인구, 개인의 키, 회사의 분기별 수익 등이 있습니다. 추가 분석을 통해 정량적 데이터는 대기질 지수(AQI)의 계절별 추세를 발견하거나 평일 출근 시간 트래픽 확률을 추정하는 데 사용될 수 있습니다.
### 정성적 데이터
정성적 데이터는 범주형 데이터라고도 하며, 정량적 데이터의 관찰값처럼 객관적으로 측정할 수 없는 데이터입니다. 일반적으로 제품이나 프로세스의 품질을 포착하는 다양한 형식의 주관적 데이터입니다. 때로는 정성적 데이터가 숫자로 표현되지만 일반적으로 수학적으로 사용되지 않습니다. 예를 들어 전화번호나 타임스탬프가 이에 해당합니다. 정성적 데이터의 예로는 비디오 댓글, 자동차의 제조사와 모델, 가장 친한 친구의 좋아하는 색상이 있습니다. 정성적 데이터는 소비자가 가장 좋아하는 제품을 이해하거나 구직 신청서에서 인기 있는 키워드를 식별하는 데 사용할 수 있습니다.
정성적 데이터, 즉 범주형 데이터는 정량적 데이터 관찰처럼 객관적으로 측정할 수 없는 데이터입니다. 이는 보통 제품이나 프로세스의 품질과 같은 무언가의 특성을 포착하는 다양한 주관적 데이터 형식입니다. 때때로 정성적 데이터는 수치적일 수 있으나 일반적으로 수학적으로 사용되지는 않습니다. 예를 들어 전화번호나 타임스탬프가 있습니다. 정성적 데이터의 예로는 동영상 댓글, 자동차 제조사와 모델, 가장 친한 친구의 좋아하는 색깔 등이 있습니다. 정성적 데이터는 소비자가 가장 좋아하는 제품을 이해하거나 구직 이력서에서 인기 키워드를 식별하는 데 사용할 수 있습니다.
### 구조화된 데이터
구조화된 데이터는 행과 열로 조직된 데이터로, 각 행은 동일한 열 집합을 가집니다. 열은 특정 유형의 값을 나타내며, 값이 무엇을 나타내는지 설명하는 이름으로 식별됩니다. 행은 실제 값을 포함합니다. 열은 값이 열을 정확히 나타내도록 특정 규칙이나 제한을 가질 수 있습니다. 예를 들어, 고객의 스프레드시트에서 각 행은 전화번호를 가져야 하며, 전화번호는 알파벳 문자를 포함하지 않아야 합니다. 전화번호 열에 규칙을 적용하여 비어 있지 않고 숫자만 포함되도록 할 수 있습니다.
구조화된 데이터는 행과 열로 조직된 데이터로, 각각의 행이 동일한 열 집합을 가집니다. 열은 특정 유형의 값을 나타내며, 해당 값이 무엇을 의미하는지 설명하는 이름으로 식별됩니다. 행은 실제 값을 포함합니다. 열에는 종종 값들이 해당 열을 정확히 나타내도록 하기 위한 특정 규칙이나 제한이 있습니다. 예를 들어, 고객 명부 스프레드시트에서 각 행에는 반드시 전화번호가 있어야 하고, 전화번호에는 알파벳 문자가 포함되지 않아야 한다고 가정할 때, 전화번호 열에는 비어 있지 않고 숫자만 포함하는 규칙이 적용될 수 있습니다.
구조화된 데이터의 장점은 다른 구조화된 데이터와 연관될 수 있도록 조직될 수 있다는 점입니다. 그러나 데이터가 특정 방식으로 조직되도록 설계되었기 때문에 전체 구조를 변경하는 데 많은 노력이 필요할 수 있습니다. 예를 들어, 고객 스프레드시트에 비어 있을 수 없는 이메일 열을 추가하려면 기존 고객 행에 이러한 값을 추가하는 방법을 찾아야 합니다.
구조화된 데이터의 장점은 다른 구조화된 데이터와 관계를 맺을 수 있도록 조직될 수 있다는 점입니다. 그러나 데이터가 특정 방식으로 조직되도록 설계되었기 때문에 전체 구조를 변경하는 데 많은 노력이 필요할 수 있습니다. 예를 들어, 고객 스프레드시트에 비어있으면 안 되는 이메일 열을 추가하면, 기존 데이터 집합 내 고객 행들에 새 값을 어떻게 추가할지 결정해야 합니다.
구조화된 데이터의 예: 스프레드시트, 관계형 데이터베이스, 전화번호, 은행 명세서
### 비구조화된 데이터
비구조화된 데이터는 일반적으로 행과 열로 분류할 수 없으며, 형식이나 따를 규칙을 포함하지 않습니다. 비구조화된 데이터는 구조화된 데이터셋에 비해 구조에 대한 제한이 적기 때문에 새로운 정보를 추가하기가 더 쉽습니다. 예를 들어, 2분마다 기압 데이터를 캡처하는 센서가 온도를 측정하고 기록할 수 있도록 업데이트를 받았다면, 비구조화된 데이터라면 기존 데이터를 변경할 필요가 없습니다. 그러나 이러한 유형의 데이터를 분석하거나 조사하는 데 시간이 더 걸릴 수 있습니다. 예를 들어, 과학자가 센서 데이터에서 지난달 평균 온도를 찾고 싶어 하지만 센서가 고장났음을 나타내기 위해 일부 기록된 데이터에 "e"를 기록한 경우, 데이터가 불완전하다는 것을 발견할 수 있습니다.
비구조화된 데이터는 일반적으로 행이나 열로 분류할 수 없고 따를 형식이나 규칙이 없습니다. 비구조화된 데이터는 구조화된 데이터에 비해 규제가 적어 새 정보를 추가하기가 더 쉽습니다. 예를 들어, 2분마다 대기압을 측정하는 센서가 온도를 측정하고 기록할 수 있도록 업데이트를 받았을 때, 비구조화 데이터라면 기존 데이터를 변경하지 않고도 온도 정보를 추가할 수 있습니다. 하지만 이런 경우 데이터를 분석하거나 조사하는 데 시간이 더 걸릴 수 있습니다. 예를 들어, 과학자가 센서 데이터로 지난달 평균 온도를 찾으려 했으나, 일부 기록에서 센서가 고장났음을 표시하기 위해 실제 숫자 대신 "e"라는 값을 기록해 데이터가 불완전하다는 사실을 발견하는 경우가 그렇습니다.
비구조화된 데이터의 예: 텍스트 파일, 문자 메시지, 비디오 파일
비구조화된 데이터의 예: 텍스트 파일, 문자 메시지, 동영상 파일
### 반구조화된 데이터
반구조화된 데이터는 구조화된 데이터와 비구조화된 데이터의 특징을 결합한 데이터입니다. 일반적으로 행과 열 형식에 맞지 않지만 구조화된 것으로 간주될 수 있는 방식으로 조직되며, 고정된 형식이나 규칙을 따를 수 있습니다. 구조는 출처에 따라 다르며, 잘 정의된 계층 구조에서 새로운 정보를 쉽게 통합할 수 있는 더 유연한 구조까지 다양합니다. 메타데이터는 데이터가 어떻게 조직되고 저장되는지를 결정하는 데 도움을 주는 지표이며, 데이터 유형에 따라 다양한 이름을 가집니다. 메타데이터의 일반적인 이름으로는 태그, 요소, 엔티티, 속성이 있습니다. 예를 들어, 일반적인 이메일 메시지는 제목, 본문, 수신자 집합을 가지며, 발신자나 발송 시점에 따라 조직될 수 있습니다.
### 준구조화 데이터
준구조화 데이터는 구조화된 데이터와 비구조화된 데이터의 특징을 조합한 것입니다. 일반적으로 행과 열 형식을 따르지 않지만, 구조화된 것으로 간주되는 방식으로 조직되며 고정 형식 또는 규칙 집합을 따를 수 있습니다. 구조는 출처에 따라 달라지며, 명확한 계층 구조부터 새로운 정보를 쉽게 통합할 수 있는 더 유연한 형태까지 다양합니다. 메타데이터는 데이터가 어떻게 조직되고 저장되는지를 결정하는 데 도움을 주는 지표이며, 데이터 유형에 따라 다양한 이름을 가집니다. 일반적인 메타데이터 이름으로는 태그, 요소, 엔티티, 속성이 있습니다. 예를 들어, 일반적인 이메일 메시지는 제목, 본문, 수신자 집합을 가지고 있으며, 누가 언제 보냈는지에 따라 정리할 수 있습니다.
반구조화된 데이터의 예: HTML, CSV 파일, JavaScript Object Notation (JSON)
준구조화 데이터의 예: HTML, CSV 파일, JavaScript Object Notation (JSON)
## 데이터 출처
## 데이터 출처
데이터 출처는 데이터가 생성된 초기 위치 또는 "존재하는" 위치를 의미하며, 수집된 방법과 시점에 따라 달라집니다. 사용자가 생성한 데이터는 기본 데이터로 알려져 있으며, 일반적인 사용을 위해 데이터를 수집한 출처에서 제공된 데이터는 보조 데이터로 간주됩니다. 예를 들어, 열대우림에서 관찰을 수집하는 과학자 그룹은 기본 데이터로 간주되며, 이를 다른 과학자들과 공유하기로 결정하면 이를 사용하는 사람들에게는 보조 데이터로 간주됩니다.
데이터 출처는 데이터가 생성된 최초 위치, 즉 데이터가 "존재하는" 곳이며, 데이터가 수집된 방식과 시기에 따라 달라집니다. 사용자가 생성한 데이터는 1차 데이터(primary data)라 하며, 일반적인 사용을 위해 데이터가 수집된 출처의 데이터는 2차 데이터(secondary data)로 간주됩니다. 예를 들어, 한 무리의 과학자들이 열대 우림에서 관찰한 데이터를 수집한다면 1차 데이터로 간주되며, 이 데이터를 다른 과학자들과 공유한다면 이를 사용하는 사람들에게는 2차 데이터가 됩니다.
데이터베이스는 일반적인 출처이며, 데이터베이스 관리 시스템을 통해 데이터를 호스팅하고 유지 관리하며, 사용자는 쿼리라는 명령을 사용하여 데이터를 탐색합니다. 파일은 오디오, 이미지, 비디오 파일뿐만 아니라 Excel과 같은 스프레드시트로 데이터 출처가 될 수 있습니다. 인터넷은 데이터베이스와 파일을 포함하여 데이터를 호스팅하는 일반적인 위치입니다. 애플리케이션 프로그래밍 인터페이스(API)는 프로그래머가 인터넷을 통해 외부 사용자와 데이터를 공유하는 방법을 만들 수 있도록 하며, 웹 스크래핑은 웹 페이지에서 데이터를 추출하는 과정입니다. [데이터 작업하기](../../../../../../../../../2-Working-With-Data) 강의는 다양한 데이터 출처를 사용하는 방법에 중점을 둡니다.
데이터베이스는 흔한 출처이며, 데이터베이스 관리 시스템을 사용해 데이터를 호스팅하고 관리하며, 사용자는 쿼리라는 명령어로 데이터를 탐색합니다. 데이터 출처로서의 파일은 오디오, 이미지, 비디오 파일과 Excel과 같은 스프레드시트가 있습니다. 인터넷 출처는 데이터베이스와 파일 모두를 호스팅하는 일반적인 장소입니다. 응용 프로그래밍 인터페이스(API)는 인터넷을 통해 외부 사용자와 데이터를 공유할 수 있게 해주며, 웹 스크래핑은 웹 페이지에서 데이터를 추출하는 과정입니다. [데이터 다루기 수업](../../../../../../../../../2-Working-With-Data)은 다양한 데이터 출처를 활용하는 방법에 중점을 둡니다.
## 결론
강의에서 우리는 다음을 배웠습니다:
번 수업에서 배운 내용:
- 데이터란 무엇인가
- 데이터가 어떻게 설명되는
- 데이터가 어떻게 분류되고 범주화되는
- 데이터를 어디에서 찾을 수 있는가
- 데이터가 무엇인지
- 데이터가 어떻게 설명되는
- 데이터가 어떻게 분류되고 범주화되는
- 데이터가 어디에서 발견될 수 있는지
## 🚀 도전
## 🚀 도전 과제
Kaggle은 공개 데이터셋의 훌륭한 출처입니다. [데이터셋 검색 도구](https://www.kaggle.com/datasets)를 사용하여 흥미로운 데이터셋을 찾아 다음 기준으로 3-5개의 데이터셋을 분류하세요:
Kaggle은 공개 데이터셋의 훌륭한 출처입니다. [데이터셋 검색 도구](https://www.kaggle.com/datasets)를 사용해 흥미로운 데이터셋을 찾아보고, 다음 기준으로 3-5개의 데이터셋을 분류해 보세요:
- 데이터가 정량적인가, 정성적인가?
- 데이터가 구조화된 데이터, 비구조화된 데이터, 반구조화된 데이터인가?
- 데이터가 정량적인지 정성적인지?
- 데이터가 구조화된, 비구조화된, 준구조화된 중 무엇인지?
## [강의 후 퀴즈](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## 복습 및 자기 학습
- Microsoft Learn의 [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) 유닛은 구조화된 데이터, 반구조화된 데이터, 비구조화된 데이터에 대한 자세한 설명을 제공합니다.
## 복습 및 자기주도 학습
- 이 Microsoft Learn 단원, [데이터 형식 식별하기](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text)에서는 구조화된, 준구조화된, 비구조화된 데이터에 대한 자세한 분류를 제공합니다.
## 과제
@ -72,5 +73,7 @@ Kaggle은 공개 데이터셋의 훌륭한 출처입니다. [데이터셋 검색
---
**면책 조항**:
이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 위해 최선을 다하고 있으나, 자동 번역에는 오류나 부정확성이 포함될 수 있습니다. 원본 문서를 해당 언어로 작성된 상태에서 권위 있는 자료로 간주해야 합니다. 중요한 정보의 경우, 전문적인 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**면책 조항**:
이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역은 오류나 부정확한 부분이 있을 수 있음을 유의하시기 바랍니다. 원본 문서의 원어본이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문가의 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# 확률 통계 소개\n",
"이 노트북에서는 이전에 논의했던 몇 가지 개념들을 실습해 보겠습니다. 확률과 통계의 많은 개념들은 Python의 데이터 처리 주요 라이브러리인 `numpy`와 `pandas`에 잘 구현되어 있습니다.\n"
"# 확률 통계 소개\n",
"이 노트북에서는 이전에 논의한 몇 가지 개념을 다뤄볼 것입니다. 확률과 통계의 많은 개념은 `numpy` 및 `pandas`와 같은 Python의 주요 데이터 처리 라이브러리에서 잘 구현되어 있습니다.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## 확률 변수와 분포\n",
"0부터 9까지의 균등 분포에서 30개의 값을 샘플링해 봅시다. 또한 평균과 분산도 계산할 것입니다.\n"
"0부터 9까지의 균등 분포에서 30개의 샘플 값을 추출하는 것으로 시작하겠습니다. 또한 평균과 분산도 계산할 것입니다.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"샘플에 몇 개의 서로 다른 값이 있는지 시각적으로 추정하기 위해, 우리는 **히스토그램**을 그릴 수 있습니다:\n"
"샘플에 서로 다른 값이 몇 개 있는지 시각적으로 추정하기 위해, 우리는 <strong>히스토그램</strong>을 그릴 수 있습니다:\n"
]
},
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 실제 데이터 분석\n",
"## 실제 데이터 분석하기\n",
"\n",
"평균과 분산은 실제 데이터를 분석할 때 매우 중요합니다. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)에서 야구 선수에 대한 데이터를 불러와 보겠습니다.\n"
"평균과 분산은 실제 데이터를 분석할 때 매우 중요합니다. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)에서 야구 선수들에 관한 데이터를 불러와 봅시다.\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> 우리는 데이터 분석을 위해 [**Pandas**](https://pandas.pydata.org/)라는 패키지를 사용하고 있습니다. 이 과정의 후반부에서 Pandas와 파이썬에서 데이터 작업에 대해 더 자세히 다룰 것입니다.\n",
"> 여기서는 데이터 분석을 위해 [**Pandas**](https://pandas.pydata.org/)라는 패키지를 사용하고 있습니다. 이 과정에서 나중에 Pandas와 파이썬으로 데이터 작업하는 방법에 대해 더 자세히 다룰 예정입니다.\n",
"\n",
"나이, 키, 몸무게의 평균 값을 계산해 보겠습니다:\n"
"나이, 키, 몸무게의 평균값을 계산해 봅시다:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"이제 키에 집중하여 표준 편차와 분산을 계산해 봅시다:\n"
"이제 키에 집중하고, 표준 편차와 분산을 계산해 봅시다: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"평균 외에도 중앙값과 사분위수를 살펴보는 것이 의미가 있습니다. 이는 **박스 플롯**을 사용하여 시각화할 수 있습니다:\n"
"평균 외에도 중앙값과 사분위수를 살펴보는 것이 타당합니다. 이들은 <strong>상자 그림(box plot)</strong>을 사용하여 시각화할 수 있습니다:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"데이터셋의 일부 집합, 예를 들어 선수 역할별로 그룹화된 박스 플롯도 만들 수 있습니다.\n"
"또한 플레이어 역할별로 그룹화된 데이터셋의 하위 집합에 대한 상자 그림을 만들 수도 있습니다.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **노트**: 이 다이어그램은 평균적으로 1루수의 키가 2루수의 키보다 더 크다는 것을 시사합니다. 나중에 우리는 이 가설을 더 공식적으로 테스트하는 방법과 데이터가 통계적으로 유의미함을 입증하는 방법을 배울 것입니다. \n",
"> <strong>참고</strong>: 이 도표는 평균적으로 1루수의 키가 2루수의 키보다 크다는 것을 시사합니다. 나중에 이 가설을 보다 형식적으로 검증하는 방법과 데이터가 통계적으로 유의미함을 입증하는 방법을 배울 것입니다. \n",
"\n",
"나이, 키, 체중은 모두 연속형 확률 변수입니다. 이들의 분포는 어떤 형태일까요? 알아내는 좋은 방법은 값들의 히스토그램을 그려보는 것입니다: \n"
"나이, 키, 체중은 모두 연속 확률 변수입니다. 이들의 분포가 어떨지 생각해 보셨나요? 이를 알아내는 좋은 방법은 값들의 히스토그램을 그려보는 것입니다. \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## 정규 분포\n",
"\n",
"실제 데이터와 동일한 평균과 분산을 갖는 정규 분포를 따르는 인공적인 무게 샘플을 만들어 봅시다:\n"
"실제 데이터와 동일한 평균과 분산을 가지는 정규 분포를 따르는 인위적인 가중치 샘플을 만들어 봅시다:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"대부분의 실제 이 정규 분포를 따르기 때문에, 우리는 샘플 데이터를 생성할 때 균등 난수 생성기를 사용해서는 안 됩니다. 다음은 균등 분포( `np.random.rand`로 생성)로 무게를 생성하려고 할 때 발생하는 상황입니다:\n"
"실제 생활에서 대부분의 값이 정규 분포를 따르기 때문에, 샘플 데이터를 생성할 때 균등 난수 생성기를 사용해서는 안 됩니다. 다음은 균등 분포로 체중을 생성하려고 할 때 발생하는 결과입니다(`np.random.rand`로 생성됨):\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## 신뢰 구간\n",
"\n",
"이제 야구 선수들의 몸무게와 키에 대한 신뢰 구간을 계산해 보겠습니다. 우리는 [이 스택오버플로우 토론](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data)의 코드를 사용할 것입니다:\n"
"이제 야구 선수들의 몸무게와 키에 대한 신뢰 구간을 계산해 봅시다. 우리는 [이 스택오버플로우 토론](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data)의 코드를 사용할 것입니다:\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## 가설 검정\n",
"\n",
"야구 선수 데이터 세트에서 다양한 역할을 살펴봅시다:\n"
"야구 선수 데이터에서 다양한 역할을 살펴봅시다:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"일루미니티스트들을 원래보다 더 높다는 가설을 테스트해 봅시다. 가장 간단한 방법은 신뢰 구간을 테스트하는 것입니다:\n"
"1루수가 2루수보다 키가 크다는 가설을 검증해 봅시다. 이를 가장 간단하게 하는 방법은 신뢰 구간을 검증하는 것입니다:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"우리는 구간들이 겹치지 않는다는 것을 볼 수 있습니다.\n",
"구간들이 겹치지 않는 것을 볼 수 있습니다.\n",
"\n",
"가설을 증명하는 통계적으로 더 정확한 방법은 **스튜던트 t-검정**을 사용하는 것입니다:\n"
"가설을 증명하는 통계적으로 더 올바른 방법은 <strong>스튜던트 t-검정</strong>을 사용하는 것입니다:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"`ttest_ind` 함수가 반환하는 두 값은 다음과 같습니다:\n",
"* p-값은 두 분포가 같은 평균을 가질 확률로 간주할 수 있습니다. 우리 경우에는 매우 낮아서, 1루수가 더 키가 크다는 강한 증거를 지원한다는 의미입니다.\n",
"* t-값은 t-검정에 사용되는 정규화된 평균 차이의 중간 값이며, 주어진 신뢰 값에 대한 임계값과 비교됩니다.\n"
"* p-값은 두 분포가 같은 평균을 가질 확률로 간주될 수 있습니다. 우리의 경우 매우 낮은 값을 가지므로, 1루수가 더 키가 크다는 강력한 증거를 의미합니다.\n",
"* t-값은 t-검정에 사용되는 정규화된 평균 차이의 중간값이며, 주어진 신뢰값에 대한 임계값과 비교됩니다.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## 중심 극한 정리를 이용한 정규 분포 시뮬레이션\n",
"## 중심극한정리를 이용한 정규분포 시뮬레이션\n",
"\n",
"파이썬의 의사 난수 생성기는 균등 분포를 제공하도록 설계되어 있습니다. 만약 정규 분포를 위한 생성기를 만들고 싶다면, 중심 극한 정리를 사용할 수 있습니다. 정규분포 값을 얻기 위해서는 단순히 균등 분포로 생성된 샘플의 평균을 계산하면 됩니다.\n"
"Python의 의사난수 생성기는 균일 분포를 제공하도록 설계되어 있습니다. 정규분포 생성기를 만들고 싶다면 중심극한정리를 사용할 수 있습니다. 정규분포 값을 얻기 위해서는 균일 분포에서 생성된 샘플의 평균을 계산하면 됩니다.\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 상관관계와 악 야구 회사\n",
"## 상관관계와 악의적인 야구 회사\n",
"\n",
"상관관계는 데이터 시퀀스 간의 관계를 찾을 수 있게 해줍니다. 예제로, 키에 따라 선수들에게 급여를 지급하는 악덕 야구 회사가 있다고 가정해봅시다 - 키가 클수록 더 많은 돈을 받습니다. 기본 급여는 $1000이고, 키에 따라 $0에서 $100 사이의 추가 보너스가 있다고 합시다. MLB의 실제 선수 데이터를 이용해 가상의 급여를 계산해보겠습니다:\n"
"상관관계는 데이터 시퀀스 간의 관계를 찾을 수 있게 해줍니다. 우리의 예제에서는 악의적인 야구 회사가 선수 키에 따라 급여를 지급한다고 가정해 봅시다 - 키가 클수록 더 많은 돈을 받습니다. 기본 급여는 $1000이고, 키에 따라 $0에서 $100까지의 추가 보너스가 있다고 가정합니다. 우리는 실제 MLB 선수들을 사용해서 그들의 가상의 급여를 계산해 보겠습니다:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"이제 해당 시퀀스들의 공분산과 상관관계를 계산해 보겠습니다. `np.cov`는 소위 **공분산 행렬**을 제공합니다. 이는 공분산을 다변수로 확장한 것입니다. 공분산 행렬 $M$의 원소 $M_{ij}$는 입력 변수 $X_i$와 $X_j$ 간의 공분산이며, 대각선 값 $M_{ii}$는 $X_i$의 분산입니다. 마찬가지로, `np.corrcoef`는 **상관 행렬**을 제공합니다.\n"
"이제 이 시퀀스들의 공분산과 상관관계를 계산해 보겠습니다. `np.cov`는 여러 변수에 대한 공분산 확장인 <strong>공분산 행렬</strong>을 제공합니다. 공분산 행렬 $M$의 원소 $M_{ij}$는 입력 변수 $X_i$와 $X_j$ 사이의 상관관계이며, 대각 원소 $M_{ii}$는 $X_{i}$의 분산입니다. 마찬가지로 `np.corrcoef`는 <strong>상관행렬</strong>을 제공합니다.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"상관계수가 1이라는 것은 두 변수 사이에 강한 **선형 관계**가 있음을 의미합니다. 한 값을 다른 값에 대해 플로팅하여 선형 관계를 시각적으로 확인할 수 있습니다:\n"
"상관관계가 1이라는 것은 두 변수 간에 강한 <strong>선형 관계</strong>가 있음을 의미합니다. 한 값을 다른 값에 대해 플로팅하여 선형 관계를 시각적으로 확인할 수 있습니다:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"관계가 선형이 아닐 때 어떤 일이 일어나는지 봅시다. 우리 회사가 키와 급여 사이의 명백한 선형 의존성을 숨기고, 공식에 `sin`과 같은 비선형성을 도입했다고 가정해봅시다:\n"
"관계가 선형이 아닐 경우 어떤 일이 벌어지는지 봅시다. 가령 우리 회사가 키와 급여 사이의 명백한 선형 의존성을 숨기고, `sin`과 같은 비선형성을 공식에 도입했다고 가정해 봅시다:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"이 경우 상관관계는 약간 작지만 여전히 꽤 높습니다. 이제 관계를 덜 명확하게 만들기 위해 급여에 무작위 변수를 추가하여 약간의 추가 무작위성을 더할 수 있습니다. 어떤 일이 일어나는지 봅시다:\n"
"이 경우 상관관계는 약간 작지만 여전히 꽤 높습니다. 이제 관계를 더 덜 명확하게 만들기 위해 급여에 임의의 변수를 추가하여 추가적인 무작위성을 더하고 싶을 수 있습니다. 무슨 일이 일어나는지 살펴봅시다:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> 왜 점들이 이렇게 수직선으로 배열되는지 추측할 수 있나요?\n",
"> 왜 이렇게 점들이 세로선으로 정렬되는지 추측할 수 있나요?\n",
"\n",
"우리는 급여와 같은 인위적으로 만들어진 개념과 관찰된 변수 *키* 사이의 상관관계를 관찰했습니다. 이제 키와 몸무게 같은 두 관찰된 변수도 상관관계가 있는지 살펴보겠습니다:\n"
"우리는 임금과 같은 인위적으로 설계된 개념과 관측된 변수 <em>키</em> 사이의 상관관계를 관찰했습니다. 키와 몸무게 같은 두 관측된 변수도 서로 상관관계가 있는지 살펴보겠습니다:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"불행하게도, 우리는 아무런 결과도 얻지 못했고, 이상한 `nan` 값들만 보였습니다. 이는 시리즈의 일부 값들이 정의되지 않았고 `nan`으로 표시되어 연산 결과도 정의되지 않기 때문입니다. 행렬을 보면 `Weight`가 문제의 컬럼임을 알 수 있는데, 이는 `Height` 값들 사이의 자기 상관관계가 계산되었기 때문입니다.\n",
"불행하게도, 우리는 결과를 얻지 못했고 이상한 `nan` 값들만 얻었습니다. 이는 시리즈의 일부 값들이 정의되지 않았고 `nan`으로 표시되어 있어 연산 결과도 정의되지 않기 때문입니다. 행렬을 보면 `Weight`가 문제의 열임을 알 수 있는데, 이는 `Height` 값들 간의 자기 상관관계가 계산되었기 때문입니다.\n",
"\n",
"> 이 예시는 **데이터 준비**와 **정제**의 중요성을 보여줍니다. 적절한 데이터 없이는 아무것도 계산할 수 없습니다.\n",
"> 이 예제는 <strong>데이터 준비</strong>와 <strong>정리</strong>의 중요성을 보여줍니다. 적절한 데이터 없이는 아무것도 계산할 수 없습니다.\n",
"\n",
"`fillna` 메서드를 사용하여 누락된 값을 채우고, 상관관계를 계산해 보겠습니다:\n"
"누락된 값을 채우기 위해 `fillna` 메서드를 사용하고 상관관계를 계산해 봅시다: \n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"실제로 상관관계는 존재하지만, 우리의 인위적인 예만큼 강하지는 않습니다. 실제로 한 값을 다른 값에 대해 산점도로 살펴보면, 그 관계는 훨씬 덜 명확할 것입니다:\n"
"실제로 상관관계가 존재하지만, 우리가 만든 인공적인 예만큼 강하지는 않습니다. 실제로 한 값을 다른 값에 대해 산점도로 살펴보면, 그 관계는 훨씬 덜 명확할 것입니다:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## 결론\n",
"\n",
"이 노트북에서는 통계 함수를 계산하기 위해 데이터에 대해 기본 연산을 수행하는 방법을 배웠습니다. 이제 우리는 몇 가지 가설을 증명하기 위해 수학과 통계의 견고한 도구를 사용하는 방법과 데이터 샘플이 주어졌을 때 임의 변수에 대한 신뢰 구간을 계산하는 방법을 알게 되었습니다.\n"
"이 노트북에서는 통계 함수를 계산하기 위해 데이터에 대한 기본 연산을 수행하는 방법을 배웠습니다. 이제 우리는 몇 가지 가설을 입증하기 위해 수학과 통계의 탄탄한 도구를 사용하는 방법과 주어진 데이터 샘플로부터 임의의 변수에 대한 신뢰 구간을 계산하는 방법을 알게 되었습니다.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**면책 조항**: \n이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 이용하여 번역되었습니다. 정확성을 위해 노력하고 있으나, 자동 번역에는 오류나 부정확성이 포함될 수 있음을 유의해 주시기 바랍니다. 원본 문서는 해당 언어의 원문이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문 인간 번역을 권장합니다. 본 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해서는 당사가 책임을 지지 않습니다.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**면책 조항**:\n이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역은 오류나 부정확한 부분이 있을 수 있음을 유의하시기 바랍니다. 원본 문서의 원어본이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문가의 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T11:00:20+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ko"
}
},
"nbformat": 4,

@ -6,9 +6,9 @@
"source": [
"# COVID-19 팬데믹 추정\n",
"\n",
"## 데이터 로\n",
"## 데이터 로\n",
"\n",
"우리는 [Johns Hopkins University](https://jhu.edu/)의 [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE)에서 제공하는 COVID-19 감염자 데이터로 작업할 것입니다. 데이터셋은 [이 GitHub 저장소](https://github.com/CSSEGISandData/COVID-19)에서 이용할 수 있습니다.\n"
"우리는 [Johns Hopkins University](https://jhu.edu/)의 [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE)에서 제공하는 COVID-19 감염자 데이터를 사용할 것입니다. 데이터셋은 [이 GitHub 저장소](https://github.com/CSSEGISandData/COVID-19)에서 확인할 수 있습니다.\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"가장 최근 데이터를 GitHub에서 `pd.read_csv`를 사용하여 직접 불러올 수 있습니다. 만약 어떤 이유로 데이터가 사용 불가능한 경우, `data` 폴더에 로컬에 있는 복사본을 항상 사용할 수 있습니다 - `base_url`을 정의하는 아래 라인의 주석 처리를 해제하기만 하면 됩니다:\n"
"`pd.read_csv`를 사용하여 GitHub에서 가장 최근 데이터를 직접 불러올 수 있습니다. 어떤 이유로든 데이터가 없을 경우, `data` 폴더에 로컬로 저장된 복사본을 항상 사용할 수 있습니다 - 아래에서 `base_url`을 정의하는 줄의 주석을 해제하면 됩니다:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"이제 감염된 개인에 대한 데이터를 불러와서 데이터가 어떻게 생겼는지 확인해 봅시다:\n"
"이제 감염된 개인의 데이터를 불러와서 데이터가 어떻게 생겼는지 살펴보겠습니다:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"우리는 표의 각 행이 각 국가 및/또는 주의 감염자 수를 정의하고, 열은 날짜에 해당함을 알 수 있습니다. 회복자 수 및 사망자 수와 같은 다른 데이터에 대해서도 유사한 표를 불러올 수 있습니다.\n"
"표의 각 행은 각 국가 및/또는 주의 감염자 수를 정의하고, 열은 날짜에 해당함을 알 수 있습니다. 회복자 수 및 사망자 수와 같은 다른 데이터에 대해서도 유사한 표를 불러올 수 있습니다.\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## 데이터 이해하기\n",
"\n",
"위 표에서 province 열의 역할이 명확하지 않습니다. `Province/State` 열에 존재하는 다양한 값을 살펴보겠습니다:\n"
"위 표에서 Province 열의 역할이 명확하지 않습니다. `Province/State` 열에 있는 다양한 값을 살펴보겠습니다:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"이름들로부터 호주와 중국 같은 나라들이 더 세분화된 주별 구분을 가지고 있다는 것을 알 수 있습니다. 중국에 대한 정보를 찾아서 예를 살펴봅시다:\n"
"이름에서 우리는 호주나 중국과 같은 국가들이 더 상세한 주 단위 분류를 가지고 있음을 유추할 수 있습니다. 예시를 보기 위해 중국에 관한 정보를 살펴봅시다:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 데이터 전처리\n",
"## 데이터 전처리 \n",
"\n",
"우리는 국가를 더 세부 영토로 나누는 데 관심이 없으므로, 먼저 이 세부 구분을 제거하고 모든 영토의 정보를 합쳐서 전체 국가에 대한 정보를 얻으려고 합니다. 이는 `groupby`를 사용하여 수행할 수 있습니다:\n"
"우리는 국가를 더 세부 지역으로 나누는 데 관심이 없으므로, 먼저 이 세부 지역 구분을 제거하고 모든 지역 정보를 합쳐서 국가 전체에 대한 정보를 얻을 것입니다. 이는 `groupby`를 사용하여 할 수 있습니다:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"`groupby`를 사용했기 때문에 모든 DataFrame이 이제 Country/Region으로 인덱싱되는 것을 볼 수 있습니다. 따라서 `.loc`를 사용하여 특정 국가의 데이터를 접근할 수 있습니다:|\n"
"`groupby`를 사용했기 때문에 모든 DataFrame이 이제 국가/지역별로 인덱싱된 것을 볼 수 있습니다. 따라서 `.loc`를 사용하여 특정 국가의 데이터를 접근할 수 있습니다:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **참고** 우리가 날짜가 아닌 메타데이터(주/도 및 지리 위치 열)를 포함하는 시퀀스의 처음 세 요소를 제거하기 위해 `[3:]`를 어떻게 사용하는지 주목하세요. 또한 세 개의 열을 완전히 삭제할 수도 있습니다:\n"
"> <strong>참고</strong>로, 우리는 `[3:]`를 사용하여 비날짜 메타데이터(주/도 및 지리 위치 열)를 포함하는 시퀀스의 처음 세 요소를 제거합니다. 또한 해당 세 열을 완전히 삭제할 수도 있습니다:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 데이터 조사\n",
"## 데이터 조사하기\n",
"\n",
"이제 특정 국가를 조사해 보겠습니다. 날짜별로 색인이 지정된 감염 데이터가 포함된 프레임을 만들어 보겠습니다:\n"
"이제 특정 국가를 조사해 봅시다. 날짜별로 색인된 감염 데이터가 포함된 프레임을 만들어 봅시다:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"데이터에서 큰 변동을 볼 수 있습니다. 한 달을 좀 더 자세히 살펴보겠습니다:\n"
"데이터에서 높은 변동성을 볼 수 있습니다. 한 달을 더 자세히 살펴보겠습니다:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"데이터에 주간 변동이 분명히 보입니다. 추세를 확인할 수 있도록, 곡선을 부드럽게 하기 위해 이동 평균을 계산하는 것이 합리적입니다(즉, 각 날짜에 대해 이전 몇 일간의 평균 값을 계산합니다):\n"
"데이터에 주간 변동이 분명히 보입니다. 추세를 볼 수 있도록 곡선을 부드럽게 만드는 것이 좋기 때문에, 이동 평균을 계산하는 것이 합리적입니다(즉, 각 날짜에 대해 이전 며칠간의 평균 값을 계산합니다):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"여러 국가를 비교하기 위해서는 국가의 인구수를 고려하고, 국가의 인구에 대한 감염자 비율을 비교하고 싶을 수 있습니다. 국가의 인구를 얻기 위해, 국가 데이터셋을 불러오겠습니다:\n"
"여러 국가를 비교할 수 있도록, 각 국가의 인구를 고려하고 해당 국가 인구 대비 감염자 비율을 비교하고자 할 수 있습니다. 국가 인구 데이터를 얻기 위해, 국가 데이터셋을 불러오겠습니다:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"이 데이터셋에는 국가와 주에 대한 정보가 모두 포함되어 있기 때문에, 전체 국가의 인구를 얻으려면 약간 영리하게 접근해야 합니다:\n"
"이 데이터셋은 국가와 도(省)에 대한 정보를 모두 포함하고 있기 때문에, 국가 전체의 인구를 얻으려면 약간의 요령이 필요합니다: \n"
]
},
{
@ -2261,13 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## $R_t$ 계산하기\n",
"\n",
"질병의 전염성을 알아보기 위해, 감염된 사람이 추가로 감염시킬 사람 수를 나타내는 **기본 재생산 수** $R_0$를 봅니다. $R_0$가 1보다 크면, 전염병이 확산될 가능성이 높습니다.\n",
"질병의 감염력을 보기 위해, 감염된 사람이 추가로 감염시킬 사람 수를 나타내는 **기본 재생산 지수** $R_0$를 살펴봅니다. $R_0$가 1보다 크면, 역병이 확산될 가능성이 높습니다.\n",
"\n",
"$R_0$는 질병 자체의 특성이며, 사람들이 전염병 확산을 늦추기 위해 취할 수 있는 일부 예방 조치를 고려하지 않습니다. 전염병이 진행되는 동안, 임의의 시간 $t$에서 재생산 수 $R_t$를 추정할 수 있습니다. 이 수는 8일간의 윈도우(window)를 취해서 다음과 같이 대략 추정할 수 있음이 밝혀졌습니다: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$ 여기서 $I_t$는 $t$일에 신규 감염자 수입니다.\n",
"$R_0$는 질병 자체의 속성으로, 사람들이 팬데믹을 늦추기 위해 취할 수 있는 보호 조치들은 고려하지 않습니다. 팬데믹 진행 중에는 주어진 시간 $t$에서 재생산 지수 $R_t$를 추정할 수 있습니다. 이 수치는 약 8일간 창을 취하여 다음과 같이 계산할 수 있음이 증명되었습니다. $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"여기서 $I_t$는 $t$일에 새로 감염된 사람 수입니다.\n",
"\n",
"우리의 전염병 데이터에 대해 $R_t$를 계산해 봅시다. 이를 위해 8개의 `ninfected` 값을 굴러가는 윈도우(rolling window)로 잡고, 위 비율을 계산하는 함수를 적용할 것입니다:\n"
"팬데믹 데이터에 대해 $R_t$를 계산해 봅시다. 이를 위해 8일간 `ninfected` 값을 롤링 윈도우로 취하고, 위 비율을 계산하는 함수를 적용할 것입니다:\n"
]
},
{
@ -2297,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"그래프에 간격이 있는 것을 볼 수 있습니다. 이러한 간격은 데이터셋에 `NaN`이 있거나 `inf` 값이 존재하는 경우 발생할 수 있습니다. `inf`는 0으로 나누었을 때 발생할 수 있고, `NaN`은 누락된 데이터나 결과를 계산할 수 있는 데이터가 없는 경우를 나타낼 수 있습니다(예를 들어, 폭 8의 롤링 윈도우가 아직 사용할 수 없는 프레임의 아주 초반 부분). 그래프를 더 보기 좋게 만들기 위해서는 `replace`와 `fillna` 함수를 사용하여 이러한 값을 채워야 합니다.\n",
"그래프에 일부 간격이 있는 것을 볼 수 있습니다. 이러한 간격은 데이터셋에 `inf` 값이 존재하는 경우 또는 `NaN` 때문에 발생할 수 있습니다. `inf`는 0으로 나누기 때문에 발생할 수 있고, `NaN`은 누락된 데이터이거나 결과를 계산할 수 없는 데이터를 나타낼 수 있습니다(예: 가중치가 8인 롤링 윈도우가 아직 사용 불가능했던 프레임 초반부). 그래프를 더 보기 좋게 만들기 위해서는 `replace`와 `fillna` 함수를 사용해 해당 값을 채워야 합니다.\n",
"\n",
"팬데믹 초기 부분을 좀 더 살펴보겠습니다. 더 잘 보기 위해 y축 값을 6 이하로 제한하고, 1 위치에 수평선을 그릴 것입니다.\n"
"팬데믹 초반을 좀 더 살펴보겠습니다. 또한 y축 값을 6 이하로 제한하여 더 잘 보이도록 하고, 1 위치에 수평선을 그릴 것입니다.\n"
]
},
{
@ -2330,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"팬데믹의 또 다른 흥미로운 지표는 **미분값** 또는 신규 확진자의 **일일 차이**입니다. 이를 통해 팬데믹이 증가하고 있는지 감소하고 있는지를 명확하게 확인할 수 있습니다.\n"
"팬데믹의 또 다른 흥미로운 지표는 <strong>도함수</strong>, 즉 신규 확진자의 <strong>일일 차이</strong>입니다. 이를 통해 팬데믹이 증가하고 있는지 감소하고 있는지를 명확히 알 수 있습니다. \n"
]
},
{
@ -2359,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"보고에 의해 데이터에 많은 변동이 발생한다는 사실을 고려할 때, 전체적인 그림을 얻기 위해 이동 평균을 실행하여 곡선을 부드럽게 만드는 것이 합리적입니다. 다시 팬데믹 초기 몇 달에 집중해 봅시다:\n"
"보고에 의해 데이터에 많은 변동이 발생한다는 점을 감안할 때, 전체적인 윤곽을 파악하기 위해 이동 평균을 적용하여 곡선을 부드럽게 하는 것이 합리적입니다. 다시 한 번 팬데믹 초기 몇 달에 주목해 보겠습니다:\n"
]
},
{
@ -2389,26 +2391,27 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## 챌린지\n",
"\n",
"이제 코드와 데이터를 가지고 더 재미있게 놀아볼 시간입니다! 다음은 실험해볼 수 있는 몇 가지 제안입니다: \n",
"* 다양한 국가에서의 팬데믹 확산을 확인해보세요. \n",
"* 여러 국가의 $R_t$ 그래프를 한 그래프에 겹쳐 비교하거나, 여러 그래프를 나란히 배치해보세요. \n",
"* 사망자 수와 회복자 수가 감염자 수와 어떻게 상관관계가 있는지 살펴보세요. \n",
"* 감염률과 사망률을 시각적으로 비교하여 질병이 일반적으로 얼마나 오래 지속되는지, 이상 현상을 찾아보세요. 이를 위해 여러 국가를 살펴볼 필요가 있을 수 있습니다. \n",
"* 치명률을 계산하고 시간이 지남에 따라 어떻게 변하는지 분석하세요. 계산 전에 질병 지속 기간(일 수)을 고려하여 시계열 데이터를 시차 조정해보는 것도 좋습니다.\n"
"## 도전 과제\n",
"\n",
"이제 코드와 데이터로 더 많이 놀아볼 시간입니다! 다음은 실험해볼 수 있는 몇 가지 제안입니다:\n",
"* 여러 국가에서 팬데믹의 확산 양상을 살펴보세요.\n",
"* 여러 국가의 $R_t$ 그래프를 한 그래프에 겹쳐서 비교하거나, 나란히 여러 그래프를 만들어 보세요.\n",
"* 사망자 수와 회복자 수가 감염자 수와 어떻게 상관관계가 있는지 확인해보세요.\n",
"* 감염률과 사망률을 시각적으로 비교하고 이상 현상을 찾아보면서 보통 질병이 얼마나 오래 지속되는지 알아내 보세요. 이를 알아내기 위해서는 다양한 국가를 살펴볼 필요가 있을 수 있습니다.\n",
"* 치명률을 계산하고 시간이 지남에 따라 어떻게 변하는지 알아보세요. 계산을 하기 전에 하루 단위의 병의 지속 기간을 고려하여 한 시계열 데이터를 이동시켜야 할 수도 있습니다.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## References\n",
"## 참고 문헌\n",
"\n",
"COVID 전염병 확산에 관한 추가 연구는 다음 출판물에서 확인할 수 있습니다:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com)의 블로그 게시물\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Global COVID-19 Outbreak에 대한 시간 의존적 재생산 수 추정](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [위 논문에 대한 GitHub 코드](https://github.com/shwars/SlidingSIR)\n"
"COVID 전염병 확산에 대한 추가 연구는 다음 출판물을 참조할 수 있습니다:\n",
"* [COVID 팬데믹 동안 Rt 추정을 위한 슬라이딩 SIR 모델](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com)의 블로그 게시물\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [전 세계 COVID-19 발병에 대한 시간 의존적 재생산 수 추정](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [위 논문 코드 깃허브](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2422,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**면책 조항**: \n이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 위해 노력하고 있으나, 자동 번역에는 오류나 부정확성이 포함될 수 있음을 양지해 주시기 바랍니다. 원본 문서의 원어 버전이 권위 있는 출처로 간주되어야 합니다. 중요한 정보의 경우에는 전문 인력에 의한 번역을 권장합니다. 본 번역의 사용으로 인해 발생하는 모든 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**면책 조항**:\n이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역은 오류나 부정확한 부분이 있을 수 있음을 유의하시기 바랍니다. 원본 문서의 원어본이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문가의 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,29 +1,33 @@
# 위험한 관계 데이터 시각화 프로젝트
# 위험한 연관성 데이터 시각화 프로젝트
시작하려면, NPM과 Node가 컴퓨터에서 실행되고 있는지 확인해야 합니다. 의존성을 설치한 후(npm install), 프로젝트를 로컬에서 실행하세요(npm run serve):
시작하려면, NPM과 Node <strong>>=20.0.0</strong>이 머신에서 실행 중인지 확인해야 합니다. 의존성을 설치하세요 (npm install) 그리고 프로젝트를 로컬에서 실행하세요 (npm run serve):
## 프로젝트 설정
```
npm install
```
### 개발을 위한 컴파일 및 핫 리로드
### 개발용으로 컴파일하고 핫 리로드
```
npm run serve
```
### 프로덕션을 위한 컴파일 및 최소화
### 프로덕션용으로 컴파일하고 압축
```
npm run build
```
### 파일 린트 및 수정
### 린트 검사 파일 수정
```
npm run lint
```
### 구성 사용자 정의
### 구성 설정 사용자화
[Configuration Reference](https://cli.vuejs.org/config/)를 참조하세요.
**면책 조항**:
이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 위해 최선을 다하고 있지만, 자동 번역에는 오류나 부정확성이 포함될 수 있습니다. 원본 문서의 원어 버전을 권위 있는 출처로 간주해야 합니다. 중요한 정보의 경우, 전문적인 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 책임을 지지 않습니다.
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**면책 조항**:
이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역은 오류나 부정확한 부분이 있을 수 있음을 유의하시기 바랍니다. 원본 문서의 원어본이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문가의 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,29 +1,33 @@
# 위험한 관계 데이터 시각화 프로젝트
# 위험한 연애 데이터 시각화 프로젝트
시작하려면, NPM과 Node가 컴퓨터에서 실행되고 있는지 확인해야 합니다. 의존성을 설치한 후(npm install), 프로젝트를 로컬에서 실행하세요(npm run serve):
시작하려면, NPM과 Node <strong>>=20.0.0</strong>이 머신에서 실행 중인지 확인해야 합니다. 의존성을 설치하세요 (npm install) 그리고 나서 프로젝트를 로컬에서 실행하세요 (npm run serve):
## 프로젝트 설정
```
npm install
```
### 개발을 위한 컴파일 및 핫 리로드
### 개발을 위해 컴파일하고 핫 리로드
```
npm run serve
```
### 프로덕션을 위한 컴파일 및 최소화
### 프로덕션을 위해 컴파일하고 압축
```
npm run build
```
### 파일 검사 및 수정
### 파일들을 린트하고 수정
```
npm run lint
```
### 구성 사용자 정의
### 구성 맞춤 설정
[Configuration Reference](https://cli.vuejs.org/config/)를 참조하세요.
**면책 조항**:
이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 위해 최선을 다하고 있으나, 자동 번역에는 오류나 부정확성이 포함될 수 있습니다. 원본 문서의 원어 버전을 권위 있는 출처로 간주해야 합니다. 중요한 정보의 경우, 전문적인 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**면책 조항**:
이 문서는 AI 번역 서비스 [Co-op Translator](https://github.com/Azure/co-op-translator)를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역은 오류나 부정확한 부분이 있을 수 있음을 유의하시기 바랍니다. 원본 문서의 원어본이 권위 있는 자료로 간주되어야 합니다. 중요한 정보의 경우, 전문가의 인간 번역을 권장합니다. 이 번역 사용으로 인해 발생하는 오해나 잘못된 해석에 대해 당사는 책임을 지지 않습니다.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save