[bn,mr,ne] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Bengali [bn], Marathi [mr], Nepali [ne]
update-translations
localizeflow[bot] 2 months ago
parent 3a859a4006
commit 7ab673484e

@ -12,8 +12,8 @@
"language_code": "bn" "language_code": "bn"
}, },
"1-Introduction/01-defining-data-science/notebook.ipynb": { "1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec", "original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-02-28T08:23:16+00:00", "translation_date": "2026-07-17T20:29:19+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb", "source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "bn" "language_code": "bn"
}, },
@ -42,8 +42,8 @@
"language_code": "bn" "language_code": "bn"
}, },
"1-Introduction/03-defining-data/README.md": { "1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339", "original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2025-09-06T07:19:03+00:00", "translation_date": "2026-07-17T20:36:18+00:00",
"source_file": "1-Introduction/03-defining-data/README.md", "source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "bn" "language_code": "bn"
}, },
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md", "source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "bn" "language_code": "bn"
}, },
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T20:30:25+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "bn"
},
"1-Introduction/README.md": { "1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949", "original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-27T08:44:01+00:00", "translation_date": "2025-08-27T08:44:01+00:00",
@ -108,8 +114,8 @@
"language_code": "bn" "language_code": "bn"
}, },
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": { "2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38", "original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-02-28T08:24:39+00:00", "translation_date": "2026-07-17T20:28:48+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb", "source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "bn" "language_code": "bn"
}, },
@ -192,14 +198,14 @@
"language_code": "bn" "language_code": "bn"
}, },
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": { "3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e", "original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2025-08-27T10:12:19+00:00", "translation_date": "2026-07-17T20:36:25+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md", "source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "bn" "language_code": "bn"
}, },
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": { "3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e", "original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2025-08-27T10:11:42+00:00", "translation_date": "2026-07-17T20:36:21+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md", "source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "bn" "language_code": "bn"
}, },

File diff suppressed because one or more lines are too long

@ -1,69 +1,71 @@
# ডেটা সংজ্ঞায়িত করা # ডেটা সংজ্ঞায়িত করা
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)| |![ স্কেচনোট by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:| |:---:|
|ডেটা সংজ্ঞায়িত করা - _স্কেচনোট [@nitya](https://twitter.com/nitya) দ্বারা_ | |ডেটা সংজ্ঞায়িত করা - _স্কেচনোট by [@nitya](https://twitter.com/nitya)_ |
ডেটা হলো তথ্য, পর্যবেক্ষণ এবং পরিমাপ যা আবিষ্কার করতে এবং সঠিক সিদ্ধান্ত গ্রহণে সহায়তা করতে ব্যবহৃত হয়। একটি ডেটা পয়েন্ট হলো একটি ডেটাসেটে থাকা একক ডেটার ইউনিট, যেখানে ডেটাসেট হলো একাধিক ডেটা পয়েন্টের সমষ্টি। ডেটাসেট বিভিন্ন ফরম্যাট এবং কাঠামোতে আসতে পারে এবং সাধারণত এটি তার উৎস বা ডেটা কোথা থেকে এসেছে তার উপর ভিত্তি করে তৈরি হয়। উদাহরণস্বরূপ, একটি কোম্পানির মাসিক আয়ের তথ্য স্প্রেডশিটে থাকতে পারে, কিন্তু একটি স্মার্টওয়াচ থেকে প্রতি ঘণ্টার হার্ট রেটের ডেটা [JSON](https://stackoverflow.com/a/383699) ফরম্যাটে থাকতে পারে। ডেটা বিজ্ঞানীরা প্রায়শই একটি ডেটাসেটের মধ্যে বিভিন্ন ধরনের ডেটা নিয়ে কাজ করেন। ডেটা হলো তথ্য, সংবাদ, পর্যবেক্ষণ এবং পরিমাপ যা আবিষ্কার করার জন্য এবং তথ্যভিত্তিক সিদ্ধান্ত গ্রহণে ব্যবহৃত হয়। একটি ডেটা পয়েন্ট হলো একটি ডেটাসেটের মধ্যে একটি একক ডেটা ইউনিট, যেখানে ডেটাসেট হল ডেটা পয়েন্টের সংগ্রহ। ডেটাসেট বিভিন্ন ফরম্যাট এবং কাঠামোতে আসতে পারে, এবং সাধারণত তার উৎস বা ডেটা কোথা থেকে এসেছে তার উপর নির্ভর করে থাকে। উদাহরণস্বরূপ, একটি কোম্পানির মাসিক আয় হয়তো একটি স্প্রেডশীট ফরম্যাটে থাকবে, কিন্তু একটি স্মার্টওয়াচ থেকে প্রতি ঘণ্টার হার্ট রেট ডেটা [JSON](https://stackoverflow.com/a/383699) ফরম্যাটে থাকতে পারে। ডেটা বিজ্ঞানীরা সাধারণত একটি ডেটাসেটের মধ্যে বিভিন্ন ধরনের ডেটার সাথে কাজ করে থাকেন।
এই পাঠটি ডেটার বৈশিষ্ট্য এবং উৎস অনুযায়ী ডেটা চিহ্নিত করা এবং শ্রেণীবদ্ধ করার উপর আলোকপাত ে। এই পাঠটি ডেটার বৈশিষ্ট্য এবং এর উৎস দ্বারা ডেটাকে সনাক্তকরণ এবং শ্রেণীবদ্ধ করার উপর কেন্দ্রিত
## [ূর্ব-লেকচার কুইজ](https://ff-quizzes.netlify.app/en/ds/quiz/4) ## [্রী-লেকচার কুইজ](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## ডেটা কীভাবে বর্ণনা করা হয় ## কীভাবে ডেটা বর্ণনা করা হয়
### কাঁচা ডেটা ### কাঁচা ডেটা
কাঁচা ডেটা হলো সেই ডেটা যা তার উৎস থেকে প্রাথমিক অবস্থায় এসেছে এবং যা এখনও বিশ্লেষণ বা সংগঠিত করা হয়নি। একটি ডেটাসেটের সাথে কী ঘটছে তা বোঝার জন্য এটি এমন একটি ফরম্যাটে সংগঠিত করতে হবে যা মানুষ এবং তারা যে প্রযুক্তি ব্যবহার করে তা উভয়ের জন্যই বোধগম্য। একটি ডেটাসেটের কাঠামো বর্ণনা করে এটি কীভাবে সংগঠিত হয়েছে এবং এটি কাঠামোগত, অ-কাঠামোগত এবং আধা-কাঠামোগত হিসাবে শ্রেণীবদ্ধ করা যেতে পারে। এই কাঠামোগুলি উৎসের উপর নির্ভর করে পরিবর্তিত হবে, তবে শেষ পর্যন্ত এই তিনটি শ্রেণীর মধ্যে পড়বে। কাঁচা ডেটা হলো এমন ডেটা যা তার উৎস থেকে প্রাথমিক অবস্থায় এসেছে এবং এখনও বিশ্লেষণ বা সংগঠিত হয়নি। একটি ডেটাসেট কী ঘটছে তা বোঝার জন্য, এটি এমন একটি ফরম্যাটে সংগঠিত করতে হয় যা মানুষ এবং প্রযুক্তির জন্য বোঝা সহজ হয়, যা তারা পরবর্তীতে বিশ্লেষণ করতে পারে। একটি ডেটাসেটের কাঠামো বর্ণনা করে কীভাবে এটি সংগঠিত, এবং এটি শ্রেণীবদ্ধ হতে পারে কাঠামোবদ্ধ, অ-কাঠামোবদ্ধ এবং অর্ধ-কাঠামোবদ্ধ। এই কাঠামোর ধরন উৎস অনুসারে পরিবর্তিত হতে পারে, কিন্তু অবশেষে এগুলো এই তিন শ্রেণীর মধ্যে পড়বে।
### পরিমাণগত ডেটা ### পরিমাণগত ডেটা
পরিমাণগত ডেটা হলো একটি ডেটাসেটে থাকা সংখ্যাসূচক পর্যবেক্ষণ যা সাধারণত বিশ্লেষণ, পরিমাপ এবং গাণিতিকভাবে ব্যবহার করা যায়। পরিমাণগত ডেটার কিছু উদাহরণ হলো: একটি দেশের জনসংখ্যা, একজন ব্যক্তির উচ্চতা বা একটি কোম্পানির ত্রৈমাসিক আয়। কিছু অতিরিক্ত বিশ্লেষণের মাধ্যমে, পরিমাণগত ডেটা ব্যবহার করে বায়ুর গুণমান সূচকের (AQI) ঋতুভিত্তিক প্রবণতা আবিষ্কার করা বা একটি সাধারণ কর্মদিবসে রাশ আওয়ারের ট্রাফিকের সম্ভাবনা অনুমান করা যেতে পারে। পরিমাণগত ডেটা হলো একটি ডেটাসেটের মধ্যে সংখ্যাসূচক পর্যবেক্ষণ এবং সাধারণত এটি বিশ্লেষণ, পরিমাপ এবং গাণিতিকভাবে ব্যবহার করা যায়। পরিমাণগত ডেটার কিছু উদাহরণ হলো: একটি দেশের জনসংখ্যা, একজন ব্যক্তির উচ্চতা, বা একটি কোম্পানির ত্রৈমাসিক আয়। কিছু অতিরিক্ত বিশ্লেষণের মাধ্যমে, পরিমাণগত ডেটা ব্যবহার করে এয়ার কোয়ালিটি ইনডেক্স (AQI) এর মৌসুমি প্রবণতা আবিষ্কার করা বা একটি সাধারণ কাজের দিনের রাশ আওয়ার ট্রাফিকের সম্ভাবনা অনুমান করা যেতে পারে।
### গুণগত ডেটা ### গুণগত ডেটা
গুণগত ডেটা, যা শ্রেণীবদ্ধ ডেটা নামেও পরিচিত, এমন ডেটা যা পরিমাণগত ডেটার মতো উদ্দেশ্যমূলকভাবে পরিমাপ করা যায় না। এটি সাধারণত বিভিন্ন ফরম্যাটের বিষয়ভিত্তিক ডেটা যা কোনো পণ্য বা প্রক্রিয়ার গুণমান ধারণ করে। কখনও কখনও, গুণগত ডেটা সংখ্যাসূচক হয় এবং সাধারণত গাণিতিকভাবে ব্যবহার করা হয় না, যেমন ফোন নম্বর বা টাইমস্ট্যাম্প। গুণগত ডেটার কিছু উদাহরণ হলো: ভিডিও মন্তব্য, একটি গাড়ির মডেল এবং ব্র্যান্ড বা আপনার সবচেয়ে কাছের বন্ধুর প্রিয় রং। গুণগত ডেটা ব্যবহার করে বোঝা যেতে পারে কোন পণ্যগুলি ভোক্তারা সবচেয়ে বেশি পছন্দ করে বা চাকরির আবেদনপত্রের রেজুমেতে জনপ্রিয় কীওয়ার্ড চিহ্নিত করা যেতে পারে। গুণগত ডেটা, যা শ্রেণীবদ্ধ ডেটা নামেও পরিচিত, এমন ডেটা যা পরিমাণগত ডেটার মত বৈজ্ঞানিকভাবে পরিমাপ করা যায় না। এটি সাধারণত বিভিন্ন ধরনের বিষয়ভিত্তিক ডেটা যা কিছু পণ্যের বা প্রক্রিয়ার গুণমান ধারণ করে। কখনও কখনও গুণগত ডেটা সংখ্যাসূচক হলেও সাধারণত গাণিতিকভাবে ব্যবহার করা হয় না, যেমন ফোন নম্বর বা টাইমস্ট্যাম্প। গুণগত ডেটার কিছু উদাহরণ হলো: ভিডিও মন্তব্য, একটি গাড়ির মডেল এবং নির্মাতা, অথবা আপনার সবচেয়ে কাছের বন্ধুর প্রিয় রং। গুণগত ডেটা ব্যবহার করে গ্রাহকরা কোন পণ্য সবচেয়ে বেশি পছন্দ করে তা বোঝা বা চাকরির আবেদনের রিজুমে থেকে জনপ্রিয় কীওয়ার্ড সনাক্ত করা যেতে পারে।
### কাঠামোগত ডেটা ### কাঠামোবদ্ধ ডেটা
কাঠামোগত ডেটা হলো এমন ডেটা যা সারি এবং কলামে সংগঠিত থাকে, যেখানে প্রতিটি সারির একই সেটের কলাম থাকে। কলামগুলো একটি নির্দিষ্ট ধরনের মানকে উপস্থাপন করে এবং এটি কী উপস্থাপন করে তা বর্ণনা করার জন্য একটি নাম দ্বারা চিহ্নিত হয়, আর সারিগুলোতে প্রকৃত মান থাকে। কলামগুলো প্রায়শই একটি নির্দিষ্ট নিয়ম বা সীমাবদ্ধতার অধীনে থাকে, যাতে মানগুলো সঠিকভাবে কলামটি উপস্থাপন করে। উদাহরণস্বরূপ, কাস্টমারদের একটি স্প্রেডশিট কল্পনা করুন যেখানে প্রতিটি সারিতে একটি ফোন নম্বর থাকতে হবে এবং ফোন নম্বরগুলোতে কখনও বর্ণমালা থাকবে না। ফোন নম্বর কলামে এমন নিয়ম প্রয়োগ করা হতে পারে যাতে এটি কখনও খালি না থাকে এবং শুধুমাত্র সংখ্যা থাকে। কাঠামোবদ্ধ ডেটা হলো এমন ডেটা যা সারি এবং কলামে সংগঠিত, যেখানে প্রতিটি সারিতে একই ধরনের কলাম থাকে। কলামগুলি একটি নির্দিষ্ট ধরণের মান উপস্থাপন করে এবং একটি নাম দ্বারা সনাক্ত করা হয় যা মানটি কী বোঝায় তা বর্ণনা করে, যখন সারিগুলো আসল মানগুলো ধারণ করে। কলামগুলোর মান সঠিকভাবে উপস্থাপনের জন্য নির্দিষ্ট নিয়ম বা বিধিনিষেধ থাকতে পারে। উদাহরণস্বরূপ, কল্পনা করুন একটি গ্রাহকদের স্প্রেডশীট যেখানে প্রতিটি সারিতে ফোন নম্বর থাকতে হবে এবং ফোন নম্বরের মধ্যে কখনই বর্ণমালা থাকবে না। ফোন নম্বরের কলামে এমন নিয়ম থাকতে পারে যাতে এটি কখনও খালি না থাকে এবং শুধুমাত্র সংখ্যা থাকে।
কাঠামোগত ডেটার একটি সুবিধা হলো এটি এমনভাবে সংগঠিত করা যায় যাতে এটি অন্যান্য কাঠামোগত ডেটার সাথে সম্পর্কিত হতে পারে। তবে, যেহেতু ডেটা একটি নির্দিষ্ট উপায়ে সংগঠিত হওয়ার জন্য ডিজাইন করা হয়েছে, এর সামগ্রিক কাঠামো পরিবর্তন করতে অনেক প্রচেষ্টা প্রয়োজন হতে পারে। উদাহরণস্বরূপ, কাস্টমার স্প্রেডশিটে একটি ইমেইল কলাম যোগ করা যা খালি থাকতে পারবে না, এর মানে হলো আপনাকে বিদ্যমান কাস্টমারদের সারিতে এই মানগুলো কীভাবে যোগ করবেন তা বের করতে হবে। কাঠামোবদ্ধ ডেটার একটি সুবিধা হলো এটি এমনভাবে সংগঠিত করা যায় যাতে এটি অন্যান্য কাঠামোবদ্ধ ডেটার সাথে সম্পর্কিত হতে পারে। তবে, যেহেতু এই ডেটাগুলো একটি নির্দিষ্টভাবে সংগঠিত হওয়ার জন্য ডিজাইন করা হয়েছে, তাই এর সামগ্রিক কাঠামো পরিবর্তন করতে অনেক পরিশ্রম প্রয়োজন হতে পারে। উদাহরণস্বরূপ, গ্রাহকদের স্প্রেডশীটে একটি ইমেল কলাম যোগ করা যা কখনও খালি হতে পারবে না, এর মানে হলো আপনাকে ভাবতে হবে কীভাবে এই মানগুলো বিদ্যমান গ্রাহকদের সারিতে যোগ করবেন।
কাঠামোগত ডেটার উদাহরণ: স্প্রেডশিট, রিলেশনাল ডেটাবেস, ফোন নম্বর, ব্যাংক স্টেটমেন্ট কাঠামোবদ্ধ ডেটার উদাহরণ: স্প্রেডশীট, রিলেশনাল ডাটাবেস, ফোন নম্বর, ব্যাংক স্টেটমেন্ট
### অ-কাঠামোগত ডেটা ### অ-কাঠামোবদ্ধ ডেটা
অ-কাঠামোগত ডেটা সাধারণত সারি বা কলামে শ্রেণীবদ্ধ করা যায় না এবং এটি কোনো ফরম্যাট বা নিয়মের সেট অনুসরণ করে না। অ-কাঠামোগত ডেটার কাঠামোতে কম সীমাবদ্ধতা থাকার কারণে এটি একটি কাঠামোগত ডেটাসেটের তুলনায় নতুন তথ্য যোগ করা সহজ। উদাহরণস্বরূপ, একটি সেন্সর যা প্রতি ২ মিনিটে বায়ুমণ্ডলীয় চাপের ডেটা সংগ্রহ করে, যদি এটি আপডেট পায় যা এখন তাপমাত্রা পরিমাপ এবং রেকর্ড করতে সক্ষম হয়, তবে এটি যদি অ-কাঠামোগত হয় তবে বিদ্যমান ডেটা পরিবর্তন করার প্রয়োজন হয় না। তবে, এই ধরনের ডেটা বিশ্লেষণ বা তদন্ত করতে বেশি সময় লাগতে পারে। উদাহরণস্বরূপ, একজন বিজ্ঞানী যিনি সেন্সরের ডেটা থেকে আগের মাসের গড় তাপমাত্রা খুঁজে বের করতে চান, কিন্তু আবিষ্কার করেন যে সেন্সরটি কিছু ডেটায় "e" রেকর্ড করেছে এটি ভাঙা ছিল তা নির্দেশ করতে, যার মানে ডেটা অসম্পূর্ণ। অ-কাঠামোবদ্ধ ডেটা সাধারণত সারি বা কলামে শ্রেণীবদ্ধ করা যায় না এবং এতে কোনও নির্দিষ্ট ফরম্যাট বা নিয়মাবলী থাকে না। যেহেতু অ-কাঠামোবদ্ধ ডেটার কাঠামোতে কম বিধিনিষেধ থাকে, তাই নতুন তথ্য যোগ করা তুলনামূলক সহজ। উদাহরণস্বরূপ, যদি একটি সেন্সর প্রতি ২ মিনিটে বায়ুবিদ্যুতীয় চাপ মাপছে এবং এখন এটি তাপমাত্রাও মাপতে সক্ষম হয়েছে, তাহলে যদি ডেটা অ-কাঠামোবদ্ধ হয় তবে বিদ্যমান ডেটা পরিবর্তন করার দরকার পড়বে না। তবে, এই ধরনের ডেটা বিশ্লেষণ বা তদন্তে বেশি সময় লাগতে পারে। যেমন, একজন বিজ্ঞানী গত মাসের গড় তাপমাত্রা বের করতে চাইলে দেখেন কিছু ডেটায় “e” লেখা আছে, যা বোঝায় সেন্সরটি ভাঙ্গা ছিল, সাধারণ সংখ্যার পরিবর্তে, যা ডেটাকে অসম্পূর্ণ করে তোলে।
অ-কাঠামোগত ডেটার উদাহরণ: টেক্সট ফাইল, টেক্সট মেসেজ, ভিডিও ফাইল অ-কাঠামোবদ্ধ ডেটার উদাহরণ: টেক্সট ফাইল, টেক্সট মেসেজ, ভিডিও ফাইল
### আধা-কাঠামোগত ডেটা ### অর্ধ-কাঠামোবদ্ধ ডেটা
আধা-কাঠামোগত ডেটার এমন বৈশিষ্ট্য রয়েছে যা এটিকে কাঠামোগত এবং অ-কাঠামোগত ডেটার সংমিশ্রণ করে তোলে। এটি সাধারণত সারি এবং কলামের ফরম্যাট অনুসরণ করে না তবে এমনভাবে সংগঠিত থাকে যা কাঠামোগত বলে বিবেচিত হয় এবং একটি নির্দিষ্ট ফরম্যাট বা নিয়মের সেট অনুসরণ করতে পারে। কাঠামো উৎসের উপর নির্ভর করে পরিবর্তিত হয়, যেমন একটি সুসংজ্ঞায়িত শ্রেণীবিন্যাস থেকে আরও নমনীয় কিছু যা নতুন তথ্য সহজে সংহত করার অনুমতি দেয়। মেটাডেটা হলো সূচক যা নির্ধারণ করতে সাহায্য করে ডেটা কীভাবে সংগঠিত এবং সংরক্ষণ করা হবে এবং এটি ডেটার ধরন অনুযায়ী বিভিন্ন নাম পায়। মেটাডেটার কিছু সাধারণ নাম হলো ট্যাগ, উপাদান, সত্তা এবং বৈশিষ্ট্য। উদাহরণস্বরূপ, একটি সাধারণ ইমেইল বার্তা একটি বিষয়, মূল অংশ এবং প্রাপকদের একটি সেট থাকবে এবং এটি কে বা কখন পাঠানো হয়েছে তার দ্বারা সংগঠিত করা যেতে পারে। অর্ধ-কাঠামোবদ্ধ ডেটার বৈশিষ্ট্য রয়েছে যা এটিকে কাঠামোবদ্ধ এবং অ-কাঠামোবদ্ধ ডেটার সংমিশ্রণ করে তোলে। এটি সাধারণত সারি এবং কলামের ফরম্যাট অনুসরণ করে না, তবে একটি নির্দিষ্ট রীতিনীতি বা নিয়মাবলী অনুসরণ করে সংগঠিত হয় যা কাঠামোবদ্ধ বলে বিবেচিত। কাঠামো উৎস অনুসারে পরিবর্তিত হতে পারে, যেমন একটি ভাল সংজ্ঞায়িত শ্রেণী কাঠামো থেকে শুরু করে কিছু সহজাত যা নতুন তথ্যের সহজ সংযোজনের অনুমতি দেয়। মেটাডেটা হলো নির্দেশক যা নির্ধারণ করে কীভাবে ডেটা সংগঠিত এবং সংরক্ষিত হয় এবং এর বিভিন্ন নাম থাকতে পারে, যেমন ট্যাগ, উপাদান, সত্তা এবং বৈশিষ্ট্য। উদাহরণস্বরূপ, একটি সাধারণ ইমেল মেসেজের সাবজেক্ট, বডি এবং প্রাপকগণের একটি সেট থাকবে এবং এটি প্রেরক বা প্রেরণের সময় অনুযায়ী সংগঠিত হতে পারে।
আধা-কাঠামোগত ডেটার উদাহরণ: HTML, CSV ফাইল, জাভাস্ক্রিপ্ট অবজেক্ট নোটেশন (JSON) অর্ধ-কাঠামোবদ্ধ ডেটার উদাহরণ: HTML, CSV ফাইল, JavaScript অবজেক্ট নোটেশন (JSON)
## ডেটার উৎস ## ডেটার উৎস
ডেটার উৎস হলো সেই প্রাথমিক স্থান যেখানে ডেটা তৈরি হয়েছে বা যেখানে এটি "বসবাস করে" এবং এটি কীভাবে এবং কখন সংগ্রহ করা হয়েছে তার উপর ভিত্তি করে পরিবর্তিত হয়। ব্যবহারকারী দ্বারা তৈরি ডেটা প্রাথমিক ডেটা নামে পরিচিত, আর মাধ্যমিক ডেটা হলো এমন একটি উৎস থেকে আসে যা সাধারণ ব্যবহারের জন্য ডেটা সংগ্রহ করেছে। উদাহরণস্বরূপ, একটি বিজ্ঞানীদের দল যদি একটি রেইনফরেস্টে পর্যবেক্ষণ সংগ্রহ করে তবে এটি প্রাথমিক ডেটা হিসাবে বিবেচিত হবে এবং যদি তারা এটি অন্য বিজ্ঞানীদের সাথে শেয়ার করে তবে এটি তাদের জন্য মাধ্যমিক ডেটা হিসাবে বিবেচিত হবে। ডেটা সোর্স হলো সেই প্রাথমিক অবস্থান যেখানে ডেটা তৈরি হয়েছে, বা যেখানে এটি "থাকে" এবং এটি কীভাবে এবং কখন সংগ্রহ করা হয়েছে তার উপর পরিবর্তিত হয়। ব্যবহারকারী দ্বারা তৈরি ডেটাকে প্রাথমিক ডেটা বলা হয়, যখন গৃহীত ডেটা এমন উত্স থেকে আসে যা সাধারণ ব্যবহারের জন্য ডেটা সংগ্রহ করেছে। উদাহরণস্বরূপ, একটি দল বিজ্ঞানী যারা একটি রেইনফরেস্টে পর্যবেক্ষণ সংগ্রহ করছেন, তারা প্রাথমিক ডেটা হিসেবে বিবেচিত হবেন, এবং যদি তারা এটি অন্য বিজ্ঞানীদের সাথে শেয়ার করেন, তবে এটি সেকেন্ডারি হিসেবে বিবেচিত হবে যারা এটি ব্যবহার করে।
েটাবেস হলো একটি সাধারণ উৎস এবং এটি একটি ডেটাবেস ম্যানেজমেন্ট সিস্টেমের উপর নির্ভর করে ডেটা হোস্ট এবং রক্ষণাবেক্ষণ করতে, যেখানে ব্যবহারকারীরা ডেটা অনুসন্ধানের জন্য কোয়েরি নামক কমান্ড ব্যবহার করে। ফাইলগুলো ডেটার উৎস হতে পারে, যেমন অডিও, ইমেজ এবং ভিডিও ফাইল, পাশাপাশি এক্সেলের মতো স্প্রেডশিট। ইন্টারনেট উৎস হলো ডেটা হোস্ট করার একটি সাধারণ স্থান, যেখানে ডেটাবেস এবং ফাইল উভয়ই পাওয়া যেতে পারে। অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস, যা API নামে পরিচিত, প্রোগ্রামারদের ইন্টারনেটের মাধ্যমে বহিরাগত ব্যবহারকারীদের সাথে ডেটা শেয়ার করার উপায় তৈরি করতে দেয়, যেখানে ওয়েব স্ক্র্যাপিং একটি ওয়েব পেজ থেকে ডেটা বের করে। [ডেটার সাথে কাজ করার পাঠ](../../../../../../../../../2-Working-With-Data) বিভিন্ন ডেটা উৎস কীভাবে ব্যবহার করত হয় তার উপর আলোপাত করে। াটাবেস একটি সাধারণ উৎস এবং এটি একটি ডাটাবেস ম্যানেজমেন্ট সিস্টেমের ওপর নির্ভর করে ডেটা হোস্ট এবং বজায় রাখতে, যেখানে ব্যবহারকারীরা কুয়েরি নামে কমান্ড ব্যবহার করে ডেটা অন্বেষণ করে। ফাইল ডেটার উৎস হতে পারে অডিও, ছবি, ভিডিও ফাইল এবং স্প্রেডশীট যেমন এক্সেল। ইন্টারনেট উৎস হচ্ছে ডেটা হোস্ট করার একটি সাধারণ অবস্থান, যেখানে ডাটাবেস এবং ফাইল উভয়ই পাওয়া যায়। অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস (API) প্রোগ্রামারদের জন্য একটি মাধ্যম যা ইন্টারনেটের মাধ্যমে বহিরাগত ব্যবহারকারীদের সাথে ডেটা ভাগ করার পথ সৃষ্টি করে, এবং ওয়েব স্ক্র্যাপিং একটি ওয়েব পেজ থেকে ডেটা উত্তোলন করে। [ডেটার সাথে কাজ করার পাঠগুলো](../../../../../../../../../2-Working-With-Data) বিভিন্ন ডেটা উৎস ব্যবহারের উপর কেন্দ্রিত
## উপসংহার ## উপসংহার
এই পাঠে আমরা শিখেছি: এই পাঠে আমরা শিখেছি:
- ডেটা কী - ডেটা কী
- ডেটা কীভাবে বর্ণনা করা হয় - কিভাবে ডেটা বর্ণনা করা হয়
- ডেটা কীভাবে শ্রেণীবদ্ধ এবং শ্রেণীকরণ করা হয় - কিভাবে ডেটা শ্রেণীবদ্ধ এবং ক্যাটাগরাইজ করা হয়
- ডেটা কোথায় পাওয়া যায় - ডেটা কোথায় পাওয়া যায়
## 🚀 চ্যালেঞ্জ ## 🚀 চ্যালেঞ্জ
Kaggle হলো উন্মুক্ত ডেটাসেটের একটি চমৎকার উৎস। [ডেটাসেট অনুসন্ধান টুল](https://www.kaggle.com/datasets) ব্যবহার করে কিছু আকর্ষণীয় ডেটাসেট খুঁজুন এবং এই মানদণ্ড অনুযায়ী ৩-৫টি ডেটাসেট শ্রেণীবদ্ধ করুন: Kaggle হলো ওপেন ডেটাসেটের একটি চমৎকার উৎস। [ডেটাসেট সার্চ টুল](https://www.kaggle.com/datasets) ব্যবহার করে কিছু আকর্ষণীয় ডেটাসেট খুঁজে বের করুন এবং নিম্নলিখিত মানদণ্ড দিয়ে ৩-৫ ডেটাসেট শ্রেণীবদ্ধ করুন:
- ডেটা কি পরিমাণগত নাকি গুণগত? - ডেটা কি পরিমাণগত নাকি গুণগত?
- ডেটা কি কাঠামোগত, অ-কাঠামোগত, নাকি আধা-কাঠামোগত? - ডেটা কি কাঠামোবদ্ধ, অ-কাঠামোবদ্ধ, না অর্ধ-কাঠামোবদ্ধ?
## [পোস্ট-লেকচার কুইজ](https://ff-quizzes.netlify.app/en/ds/quiz/5) ## [পোস্ট-লেকচার কুইজ](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## পুনরালোচনা ও স্ব-অধ্যয়ন
- Microsoft Learn-এর এই ইউনিট, [আপনার ডেটা শ্রেণীবদ্ধ করুন](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) শিরোনামে, কাঠামোগত, আধা-কাঠামোগত এবং অ-কাঠামোগত ডেটার একটি বিস্তারিত বিশ্লেষণ প্রদান করে।
## পর্যালোচনা ও আত্ম-অধ্যয়ন
- এই Microsoft Learn ইউনিট, [ডেটা ফরম্যাট চিহ্নিতকরণ](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) টাইটেল সহ, কাঠামোবদ্ধ, অর্ধ-কাঠামোবদ্ধ, ও অ-কাঠামোবদ্ধ ডেটার বিস্তারিত বিশ্লেষণ দেয়।
## অ্যাসাইনমেন্ট ## অ্যাসাইনমেন্ট
@ -71,5 +73,7 @@ Kaggle হলো উন্মুক্ত ডেটাসেটের একট
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**অস্বীকৃতি**: **অস্বীকৃতি**:
এই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনুবাদ করা হয়েছে। আমরা যথাসম্ভব সঠিক অনুবাদ প্রদানের চেষ্টা করি, তবে অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। মূল ভাষায় থাকা নথিটিকে প্রামাণিক উৎস হিসেবে বিবেচনা করা উচিত। গুরুত্বপূর্ণ তথ্যের জন্য, পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদ ব্যবহারের ফলে কোনো ভুল বোঝাবুঝি বা ভুল ব্যাখ্যা হলে আমরা দায়বদ্ধ থাকব না। এই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। যদিও আমরা শুদ্ধতার জন্য চেষ্টা করি, অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। মূল নথিটি তার স্বভাষায় কর্তৃত্বপূর্ণ উৎস হিসেবে বিবেচিত হওয়া উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদের ব্যবহারে প্রয়োজনীয় ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়বদ্ধ নই।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {}, "metadata": {},
"source": [ "source": [
"# সম্ভাবনা এবং পরিসংখ্যানের পরিচিতি\n", "# সম্ভাবনা এবং পরিসংখ্যানের পরিচিতি\n",
"এই নোটবুকে, আমরা পূর্বে আলোচনা করা কিছু ধারণার সাথে খেলাব। সম্ভাবনা এবং পরিসংখ্যানের অনেক ধারণা পাইথনের ডেটা প্রসেসিংয়ের প্রধান লাইব্রেরিগুলিতে ভালভাবে উপস্থাপিত রয়েছে, যেমন `numpy` এবং `pandas`।\n" "এই নোটবুকে, আমরা পূর্বে আলোচনা করা কিছু ধারণার সাথে খেলাধুলা করব। সম্ভাবনা এবং পরিসংখ্যানের অনেক ধারণা পাইথনে ডেটা প্রক্রিয়াকরণের প্রধান লাইব্রেরিগুলিতে ভালভাবে উপস্থাপিত, যেমন `numpy` এবং `pandas`।\n"
] ]
}, },
{ {
@ -24,8 +24,8 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## র‍্যান্ডম ভেরিয়েবল এবং বণ্টনসমূহ\n", "## র‍্যান্ডম ভেরিয়েবল এবং বিতরণ\n",
"চলুন 0 থেকে 9 পর্যন্ত একটি সমজাতীয় বণ্টন থেকে ৩০টি মানের একটি নমুনা আঁকি। আমরা গড় এবং বৈচিত্র্যও হিসাব করব।\n" "চলুন 0 থেকে 9 পর্যন্ত ইউনিফর্ম বিতরণ থেকে 30টি মানের একটি নমুনা আঁকা শুরু করি। আমরা গড় এবং বৈচিত্র্যও গণনা করব।\n"
] ]
}, },
{ {
@ -44,7 +44,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"নমুনায় কতগুলি ভিন্ন মান রয়েছে তা بصریভাবে অনুমান করতে, আমরা **হিস্টোগ্রাম** অঙ্কন করতে পারি:\n" "নমুনাটিতে কতগুলি ভিন্ন মান রয়েছে তা চাক্ষুষভাবে অনুমান করতে, আমরা **হিস্টোগ্রাম** প্লট করতে পারি:\n"
] ]
}, },
{ {
@ -63,7 +63,7 @@
"source": [ "source": [
"## বাস্তব ডেটা বিশ্লেষণ\n", "## বাস্তব ডেটা বিশ্লেষণ\n",
"\n", "\n",
"গড় এবং বৈচিত্র্য বাস্তব-জগতের ডেটা বিশ্লেষণে খুবই গুরুত্বপূর্ণ। চলুন [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) থেকে বেসবল খেলোয়াড়দের ডেটা লোড করি।\n" "গড় এবং বৈচিত্র্য বাস্তব বিশ্বের ডেটা বিশ্লেষণে খুবই গুরুত্বপূর্ণ। চলুন [SOCR MLB উচ্চতা/ওজন ডেটা](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) থেকে বেসবল খেলোয়াড়দের ডেটা লোড করি\n"
] ]
}, },
{ {
@ -80,9 +80,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> আমরা এখানে ডটা বিশ্লেষণের জন্য [**Pandas**](https://pandas.pydata.org/) নামক একটি প্যাকেজ ব্যবহার করছি। আমরা এই কোর্সের পরবর্তী অংশে Pandas এবং পাইথনে ডেটার সাথে কাজ করার বিষয়ে আরও আলোচনা করব।\n", "> আমরা এখানে ডটা বিশ্লেষণের জন্য [**Pandas**](https://pandas.pydata.org/) নামক একটি প্যাকেজ ব্যবহার করছি। আমরা এই কোর্সে পরে Pandas এবং পাইথনে ডাটার সাথে কাজ করার ব্যাপারে আরও কথা বলব।\n",
"\n", "\n",
"চলুন বয়স, উচ্চতা এবং ওজনের গড় মান গণনা করি:\n" "চলুন বয়স, উচ্চতা এবং ওজনের গড় মান হিসাব করি:\n"
] ]
}, },
{ {
@ -98,7 +98,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"এখন চলুন উচ্চতার ওপর মনোযোগ দেওয়া যাক, এবং স্ট্যান্ডার্ড ডিভিয়েশন ও বৈচিত্র্য (ভ্যারিয়েন্স) গণনা করা যাক:\n" "এখন উচ্চতার দিকে নজর দেওয়া যাক, এবং স্ট্যান্ডার্ড ডেভিয়েশন এবং ভ্যারিয়েন্স গণনা করি: \n"
] ]
}, },
{ {
@ -126,7 +126,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"গড়ের পাশাপাশি, মধ্যমমান এবং চতুর্থাংশগুলো দেখা বোধগম্য। সেগুলোকে **বক্স প্লট** ব্যবহার করে দৃশ্যমান করা যায়:\n" "গড়ের পাশাপাশি, প্রেসিল এবং কোয়ার্টাইলগুলি দেখা যৌক্তিক। সেগুলো **বক্স প্লট** ব্যবহার করে ভিজ্যুয়ালাইজ করা যায়:\n"
] ]
}, },
{ {
@ -136,7 +136,7 @@
"outputs": [], "outputs": [],
"source": [ "source": [
"plt.figure(figsize=(10,2))\n", "plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n", "plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n", "plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n", "plt.tight_layout()\n",
"plt.show()" "plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আমরা আমাদের ডেটাসেটের উপসেটগুলির বক্স প্লটও করতে পারি, উদাহরণস্বরূপ, প্লেয়ারের ভূমিকা অনুযায়ী গোষ্ঠীবদ্ধ করে।\n" "আমরা আমাদের ডেটাসেটের উপসেটের বক্স প্লটও তৈরি করতে পারি, যেমন, খেলোয়াড়ের চরিত্র অনুযায়ী গোষ্ঠীবদ্ধ \n"
] ]
}, },
{ {
@ -165,9 +165,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> **নোট**: এই চিত্রটি নির্দেশ করে, যে গড়ে প্রথম বেসম্যানদের উচ্চতা দ্বিতীয় বেসম্যানদের উচ্চতার চেয়ে বেশি। পরে আমরা শিখব কীভাবে এই অনুমানটিকে আরও আনুষ্ঠানিকভাবে পরীক্ষা করা যায়, এবং কীভাবে প্রদর্শন করা যায় যে আমাদের ডেটা পরিসংখ্যানগতভাবে তা প্রদর্শনের জন্য গুরুত্বপূর্ণ। \n", "> **দ্রষ্টব্য**: এই ডায়াগ্রামটি সংকেত দেয়, যে গড়ে, প্রথম বেসম্যানদের উচ্চতা দ্বিতীয় বেসম্যানদের উচ্চতার থেকে বেশি। পরবর্তীতে আমরা শিখব যে কিভাবে আমরা এই অনুমানটি আরও আনুষ্ঠানিকভাবে পরীক্ষা করতে পারি, এবং কিভাবে প্রদর্শন করতে পারি যে আমাদের তথ্য সাংখ্যিকভাবে তা গুরুত্বপূর্ণ। \n",
"\n", "\n",
"বয়স, উচ্চতা এবং ওজন সবই ধারাবাহিক র্যান্ডম ভেরিয়েবল। আপনি কী মনে করেন তাদের বন্টন কী হতে পারে? একটি ভাল উপায় হল মানগুলির হিস্টোগ্রাম আঁকা: \n" "বয়স, উচ্চতা এবং ওজন সবই ধারাবাহিক র্যান্ডম ভ্যারিয়েবেল। আপনি কী মনে করেন তাদের বন্টন কী রকম? একটি ভাল উপায় হল মানগুলোর হিস্টোগ্রাম আঁকা: \n"
] ]
}, },
{ {
@ -188,9 +188,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## Normal Distribution\n", "## স্বাভাবিক বণ্টন\n",
"\n", "\n",
"চলুন একটি কৃত্রিম ওজন নমুনা তৈরি করি যা আমাদের বাস্তব ডেটার সমান গড় এবং বৈচিত্র্যের সাথে একটি স্বাভাবিক বণ্টন অনুসরণ করে:\n" "আসুন একটি কৃত্রিম ওজনের নমুনা তৈরি করি যা একটি স্বাভাবিক বণ্টন অনুসরণ করে এবং যার গড় এবং পার্থক্য আমাদের প্রকৃত ডেটার মতোই:\n"
] ]
}, },
{ {
@ -231,7 +231,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"কারণ বাস্তবে অধিকাংশ মান সাধারণত স্বাভাবিক বণ্টিত থাকে, আমরা নমুনা ডেটা তৈরির জন্য ইউনিফর্ম র্যান্ডম নম্বর জেনারেটর ব্যবহার করা উচিত নয়। এখানে কী হয় যখন আমরা ইউনিফর্ম ডিস্ট্রিবিউশন দিয়ে ওজন তৈরি করার চেষ্টা করি (যা `np.random.rand` দ্বারা তৈরি):\n" "যেহেতু বাস্তব জীবনের বেশিরভাগ মান গড়ে স্বাভাবিক বন্টিত হয়, তাই আমাদের নমুনা তথ্য তৈরি করতে একটি সমান সম্ভাবনার র্যান্ডম সংখ্যা জেনারেটর ব্যবহার করা উচিত নয়। এখানে কী ঘটে যদি আমরা সমান বন্টন দিয়ে ওজন তৈরি করার চেষ্টা করি (যা `np.random.rand` দ্বারা তৈরি): \n"
] ]
}, },
{ {
@ -251,9 +251,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## বিশ্বাসযোগ্যতা অন্তর\n", "## বিশ্বাসযোগ্যতা অন্তর \n",
"\n", "\n",
"এবার চলুন বেসবল খেলোয়াড়দের ওজন এবং উচ্চতার জন্য বিশ্বাসযোগ্যতা অন্তর গণনা করি। আমরা [এই স্ট্যাকওভারফ্লো আলোচনার](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) কোড ব্যবহার করব:\n" "এখন আমরা বেসবল খেলোয়াড়দের ওজন এবং উচ্চতার জন্য বিশ্বাসযোগ্যতার অন্তর গণনা করব। আমরা [এই স্ট্যাকওভারফ্লো আলোচনা থেকে](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) কোডটি ব্যবহার করব:\n"
] ]
}, },
{ {
@ -272,7 +272,7 @@
" return m, h\n", " return m, h\n",
"\n", "\n",
"for p in [0.85, 0.9, 0.95]:\n", "for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n", " m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")" " print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
] ]
}, },
@ -280,9 +280,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## অনুমান পরীক্ষা\n", "## হাইপোথিসিস টেস্টিং\n",
"\n", "\n",
"চলুন আমাদের বেসবল খেলোয়াড়দের ডেটাসেটে বিভিন্ন ভূমিকা অন্বেষণ করি:\n" "চলুন আমাদের বেসবল প্লেয়ারদের ডেটাসেটে বিভিন্ন ভূমিকা অনুসন্ধান করি:\n"
] ]
}, },
{ {
@ -298,7 +298,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"চলুন এই অনুমানটি পরীক্ষা করি যে প্রথম বেসম্যানরা দ্বিতীয় বেসম্যানদের চেয়ে লম্বা। এটি পরীক্ষা করার সবচেয়ে সহজ উপায় হলো আত্মবিশ্বাসের ইন্টারভাল পরীক্ষা করা:\n" "প্রথম বেসব্যামেনদের উচ্চতা দ্বিতীয় বেসব্যামেনদের থেকে বেশি এই অনুমান পরীক্ষা করি। এটি করার সবচেয়ে সহজ উপায় হল কনফিডেন্স ইন্টারভ্যাল পরীক্ষা করা:\n"
] ]
}, },
{ {
@ -317,9 +317,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আমরা দেখতে পাচ্ছি যে অন্তরগুলি ওভারল্যাপ করছে না।\n", "আমরা দেখতে পাচ্ছি যে ইন্টারভ্যালগুলি ওভারল্যাপ করছে না।\n",
"\n", "\n",
"পরিসংখ্যানগতভাবে আরও সঠিক উপায় হ'ল হাইপোথিসিস প্রমাণ করার জন্য **স্টুডেন্ট টি-টেস্ট** ব্যবহার করা:\n" "একটি পরিসংখ্যানগতভাবে আরও সঠিক পদ্ধতি হাইপোথিসিস প্রমাণ করার জন্য হলো **স্টুডেন্ট টি-টেস্ট** ব্যবহার করা:\n"
] ]
}, },
{ {
@ -338,18 +338,18 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"`ttest_ind` ফাংশন দ্বারা ফেরত আসা দুটি মান হল:\n", "`ttest_ind` ফাংশন দ্বারা ফেরত দেওয়া দুইটি মান হল:\n",
"* p-মানকে দুইটি বন্টনের একই গড় থাকার সম্ভাবনা হিসেবে বিবেচনা করা যেতে পারে। আমাদের ক্ষেত্রে, এটি খুব কম, যার অর্থ প্রথম বেসম্যানরা লম্বা হওয়ার পক্ষে শক্তিশালী প্রমাণ পাওয়া গেছে।\n", "* p-মানকে দুইটি বন্টনের একই গড় থাকার সম্ভাবনা হিসেবে রা যেতে পারে। আমাদের ক্ষেত্রে, এটি খুব কম, যার অর্থ প্রথম বেসম্যানরা আরও লম্বা এমন শক্তপোক্ত প্রমাণ রয়েছে।\n",
"* t-মান হলো স্বাভাবিককৃত গড় পার্থক্যের মধ্যবর্তী মান যা t-পরীক্ষায় ব্যবহৃত হয়, এবং এটি নির্দিষ্ট আস্থা মানের জন্য একটি সীমা মানের সাথে তুলনা করা হয়।\n" "* t-মান হল স্বাভাবিককৃত গড় ব্যবধানের মধ্যবর্তী মান যা t-পরীক্ষায় ব্যবহার হয়, এবং এটি নির্দিষ্ট আস্থা মানের জন্য একটি থ্রেশহোল্ড মানের বিরুদ্ধে তুলনা করা হয়।\n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## মধ্যবিন্দু সীমা থিওরেম ব্যবহার করে একটি স্বাভাবিক বণ্টনের অনুকরণ\n", "## কেন্দ্রীয় সীমার থিওরেম দিয়ে একটি স্বাভাবিক বণ্টনের সিমুলেশন\n",
"\n", "\n",
"পাইথনে ছদ্ম-যাদৃচ্ছিক জেনারেটরটি আমাদের একটি সমজাতীয় বণ্টন দিতে ডিজাইন করা হয়েছে। যদি আমরা একটি স্বাভাবিক বণ্টনের জন্য একটি জেনারেটর তৈরি করতে চাই, তাহলে আমরা মধ্যবিন্দু সীমা থিওরেম ব্যবহার করতে পারি। একটি স্বাভাবিক বণ্টিত মান পেতে আমরা কেবল সমজাতীয়ভাবে তৈরি একটি নমুনার গড় গণনা করব।\n" "পাইথনের ছদ্ম-সাম্প্রতিক জেনারেটর আমাদের জন্য একটি সমবণ্টন প্রদান করার জন্য ডিজাইন করা হয়েছে। যদি আমরা স্বাভাবিক বণ্টনের জন্য একটি জেনারেটর তৈরি করতে চাই, তাহলে আমরা কেন্দ্রীয় সীমার থিওরেম ব্যবহার করতে পারি। স্বাভাবিক বণ্টিত মান পাওয়ার জন্য আমরা কেবল একটি সমবণ্টিত-উত্পন্ন নমুনার গড় গণনা করব।\n"
] ]
}, },
{ {
@ -373,9 +373,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## সম্পর্ক এবং ইভিল বেসবল কর্পোরেশন\n", "## সংশ্লেষ এবং ইভিল বেসবল কর্প\n",
"\n", "\n",
"সম্পর্ক আমাদের ডেটা সিকুয়েন্সগুলোর মধ্যে সম্পর্ক খুঁজে পেতে সাহায্য করে। আমাদের খেলনা উদাহরণে, ধরা যাক একটি ইভিল বেসবল কর্পোরেশন রয়েছে যা তার খেলোয়াড়দের তাদের উচ্চতার ওপর ভিত্তি করে বেতন দেয় - খেলোয়াড় যত লম্বা, তিনি তত বেশি টাকা পান। ধরা যাক একটি ভিত্তিক বেতন $১০০০, এবং উচ্চতার ওপর ভিত্তি করে $ থেকে $১০০ পর্যন্ত অতিরিক্ত বোনাস রয়েছে। আমরা MLB-এর আসল খেলোয়াড়দের নিয়ে তাদের কাল্পনিক বেতন হিসাব করব:\n" "সংশ্লেষ আমাদের ডেটা সিকোয়েন্সের মধ্যে সম্পর্ক খুঁজে পেতে সাহায্য করে। আমাদের খেলনা উদাহরণে, ধরে নিই যে একটি ইভিল বেসবল কর্পোরেশন আছে যারা তাদের খেলোয়াড়দের উচ্চতার ভিত্তিতে অর্থ প্রদান করে - খেলোয়াড় যত লম্বা, তত বেশি টাকা পায়। ধরুন একটি মূল বেতন $১০০০ এবং উচ্চতার উপর নির্ভর করে অতিরিক্ত $ থেকে $১০০ পর্যন্ত বোনাস রয়েছে। আমরা এমএলবির প্রকৃত খেলোয়াড়দের নিয়ে তাদের কাল্পনিক বেতন হিসাব করব:\n"
] ]
}, },
{ {
@ -384,7 +384,7 @@
"metadata": {}, "metadata": {},
"outputs": [], "outputs": [],
"source": [ "source": [
"heights = df['Height'].fillna(method='pad')\n", "heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n", "salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])" "print(list(zip(heights, salaries))[:10])"
] ]
@ -393,7 +393,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"এখন চলুন ঐ সিকোয়েন্সগুলোর কোভেরিয়েন্স এবং সম্পর্ক হিসাব করি। `np.cov` আমাদের একটি sogenannten **কোভেরিয়েন্স ম্যাট্রিক্স** দেবে, যা একাধিক ভেরিয়েবল এর জন্য কোভেরিয়েন্সের একটি সম্প্রসারণ। কোভেরিয়েন্স ম্যাট্রিক্স $M$ এর উপাদান $M_{ij}$ হল ইনপুট ভেরিয়েবলের $X_i$ এবং $X_j$ এর মধ্যে সম্পর্ক, এবং ডায়াগোনাল মান $M_{ii}$ হলো $X_i$ এর বৈচিত্র্য। একইভাবে, `np.corrcoef` আমাদের **সম্পর্ক ম্যাট্রিক্স** দেবে।\n" "এখন আসুন সেই সিকোয়েন্সগুলোর সহযোগিতা এবং সহসাময়িকতা হিসাব করি। `np.cov` আমাদের একটি sogenannte **সহযোগিতা ম্যাট্রিক্স** দেবে, যা একাধিক ভেরিয়েবলের জন্য সহযোগিতার একটি সম্প্রসারণ। সহযোগিতা ম্যাট্রিক্স $M$ এর উপাদান $M_{ij}$ হল ইনপুট ভেরিয়েবল $X_i$ এবং $X_j$ এর মধ্যে সম্পর্ক, এবং তির্যক মান $M_{ii}$ হল $X_{i}$ এর বৈচিত্র্য। অনুরূপভাবে, `np.corrcoef` আমাদের **সহসাময়িকতা ম্যাট্রিক্স** দেবে।\n"
] ]
}, },
{ {
@ -411,7 +411,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"একটি সহসর্মতা সমান ১ অর্থ হলো দুইটি ভেরিয়েবলের মধ্যে একটি শক্তিশালী **রৈখিক সম্পর্ক** রয়েছে। আমরা একটি মানকে অন্য মানের বিপরীত দিকে প্লট করে রৈখিক সম্পর্ক দৃশ্যমানভাবে দেখতে পারি:\n" "সহগ ১ এর সমান অর্থ হল দুটি চলকের মধ্যে একটি শক্তিশালী **রৈখিক সম্পর্ক** রয়েছে। আমরা একটির বিপরীতে অন্যটির মান আঁকিয়ে রৈখিক সম্পর্কটি দৃশ্যত দেখতে পারি:\n"
] ]
}, },
{ {
@ -430,7 +430,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"চলুন দেখি কি হয় যদি সম্পর্কটা সরলরেখীয় না হয়। ধরুন আমাদের কর্পোরেশন উচ্চতা এবং বেতরের মধ্যে স্পষ্ট সরলরেখীয় নির্ভরতাকে লুকানোর সিদ্ধান্ত নিয়েছে, এবং সূত্রে কিছু অ-সরলরেখীয়তা যেমন `sin` যোগ করেছে:\n" "চলুন দেখি কি হয় যদি সম্পর্কটি রৈখিক না হয়। ধরুণ আমাদের কর্পোরেশন উচ্চতা এবং বেতনের মধ্যে স্পষ্ট রৈখিক নির্ভরতা লুকিয়ে রাখতে চেয়েছিল, এবং সূত্রে কিছু অ-রৈখিকতা যেমন `sin` যোগ করেছিল:\n"
] ]
}, },
{ {
@ -447,7 +447,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"এই ক্ষেত্রে, সম্পর্কটি একটু কম হলেও তা এখনও যথেষ্ট উচ্চ। এবার, সম্পর্কটি আরও কম স্পষ্ট করতে, আমরা বেতন প্রথমে একটি র্যাণ্ডম পরিবর্তক যোগ করে কিছু অতিরিক্ত র‍্যানডমনেস যোগ করতে চাইতে পারি। চলুন দেখি কী হয়:\n" "এই ক্ষেত্রে, সহপ্রবণতা অল্প কম, তবে এটি এখনও যথেষ্ট বেশি। এখন, সম্পর্কটি আরও কম স্পষ্ট করতে, আমরা বেতনের সাথে কিছু অপ্রত্যাশিত পরিবর্তন যোগ করতে চাইতে পারি। চলুন দেখি কী ঘটে: \n"
] ]
}, },
{ {
@ -476,9 +476,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> আপনি কি অনুমান করতে পারেন কেন ডটগুলো এইভাবে খাড়া লাইনে সারিবদ্ধ হয়?\n", "> আপনি কি অনুমান করতে পারেন কেন বিন্দুগুলি এই ধরনের উল্লম্ব রেখায় সাজানো হয়েছে?\n",
"\n", "\n",
"আমরা একটি কৃত্রিমভাবে নির্মিত ধারণা যেমন বেতন এবং পর্যবেক্ষিত পরিবর্তনশীল *উচ্চতা* এর মধ্যকার সম্পর্ক লক্ষ্য করেছি। এবার আমরা দেখতে চাই দুইটি পর্যবেক্ষিত পরিবর্তনশীল, যেমন উচ্চতা এবং ওজন, তাদের মধ্যেও কি সম্পর্ক আছে কিনা:\n" "আমরা কৃত্রিমভাবে তৈরি ধারণা যেমন বেতন এবং পর্যবেক্ষিত পরিবর্তনশীল *উচ্চতা* এর মধ্যে সম্পর্ক পর্যবেক্ষণ করেছি। চলুন দেখি দুইটি পর্যবেক্ষিত পরিবর্তনশীল যেমন উচ্চতা এবং ওজনের মধ্যেও সম্পর্ক আছে কি না:\n"
] ]
}, },
{ {
@ -494,11 +494,11 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"দুর্ভাগ্যবশত, আমরা কোনো ফলাফল পাইনি - শুধুমাত্র কিছু অদ্ভুত `nan` মান। এর কারণ হল আমাদের সিরিজের কিছু মান অনির্ধারিত, যা `nan` হিসেবে উপস্থাপিত হয়েছে, যা অপারেশনের ফলাফলকেও অনির্ধারিত করে তোলে। ম্যাট্রিক্সটির দিকে নজর দিলে দেখা যায় যে `Weight` হল সমস্যা সৃষ্টিকারী কলাম, কারণ `Height` মানগুলির মধ্যে স্ব-কোরিলেশন গণনা করা হয়েছে।\n", "দুর্ভাগ্যবশত, আমরা কোনো ফলাফল পাইনি - কেবল কিছু অদ্ভুত `nan` মান। এর কারণ হল আমাদের সিরিজের কিছু মান অজ্ঞাত, যা `nan` হিসেবে পরিচিত, যা অপারেশনের ফলাফলকেও অজ্ঞাত করে তোলে। ম্যাট্রিক্স দেখে আমরা দেখতে পাই যে `Weight` সমস্যা মূলক কলাম, কারণ `Height` মানগুলোর স্ব-করণীয়তা হিসাব করা হয়েছে।\n",
"\n", "\n",
"> এই উদাহরণটি **ডেটা প্রস্তুতি** এবং **পরিষ্কারর** গুরুত্ব দেখায়। সঠিক ডেটা ছাড়া আমরা কিছুই গণনা করতে পারব না।\n", "> এই উদাহরণটি **ডেটা প্রস্তুতি** এবং **পরিষ্কার করার** গুরুত্ব দেখায়। সঠিক ডেটা ছাড়া আমরা কিছুই হিসাব করতে পারি না।\n",
"\n", "\n",
"চলুন হারিয়ে যাওয়া মানগুলি পূরণের জন্য `fillna` পদ্ধতি ব্যবহার করি এবং কোরিলেশন গণনা করি:\n" "আসুন `fillna` পদ্ধতি ব্যবহার করে অনুপস্থিত মানগুলো পূরণ করি, এবং করেলেশন হিসাব করি: \n"
] ]
}, },
{ {
@ -507,14 +507,14 @@
"metadata": {}, "metadata": {},
"outputs": [], "outputs": [],
"source": [ "source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])" "np.corrcoef(df['Height'].ffill(), df['Weight'])"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"অবশ্যই একটি সংযোগ বিদ্যমান, তবে আমাদের কৃত্রিম উদাহরণের মত এতটা শক্তিশালী নয়। আসলে, যদি আমরা একটি মানকে অন্যটির বিরুদ্ধে স্থানচিত্রিত করি, সম্পর্ক অনেক কম স্পষ্ট হবে:\n" "আসলেই একটি সম্পর্ক রয়েছে, তবে আমাদের কৃত্রিম উদাহরণের মত এতটা জোরালো নয়। আসলে, যদি আমরা এক মানের বিরুদ্ধে অন্য মানের স্ক্যাটার প্লট দেখি, তবে সম্পর্কটি অনেক কম সুস্পষ্ট হবে:\n"
] ]
}, },
{ {
@ -537,14 +537,14 @@
"source": [ "source": [
"## উপসংহার\n", "## উপসংহার\n",
"\n", "\n",
"এই নোটবুকে আমরা শিখেছি কীভাবে ডেটার ওপর মৌলিক অপারেশনগুলো সম্পাদন করে পরিসংখ্যানগত ফাংশনগুলি গণনা করা যায়। এখন আমরা জানি কীভাবে গণিত এবং পরিসংখ্যানের একটি শক্তিশালী যন্ত্রপাতি ব্যবহার করে কিছু অনুমান প্রমাণ করতে হয়, এবং কীভাবে একটি ডেটা নমুনা থেকে ইচ্ছা মতো ভেরিয়েবলের জন্য আত্মবিশ্বাসের অন্তরালা গণনা করতে হয়।\n" "এই নোটবুকে আমরা শিখেছি কিভাবে ডেটার উপর মৌলিক অপারেশন সম্পাদন করে পরিসংখ্যানগত ফাংশন হিসাব করতে হয়। আমরা এখন জানি কিভাবে গণিত এবং পরিসংখ্যানের একটি শক্তিশালী যন্ত্র ব্যবহার করে কিছু অনুমান প্রমাণ করতে হয়, এবং কিভাবে একটি ডেটা নমুনা থেকে যেকোনো চলকের জন্য আত্মবিশ্বাসের ইন্টারভ্যাল হিসাব করতে হয়।\n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**অস্বীকারোক্তি**: \nএই নথিটি AI অনুবাদক সেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। যদিও আমরা যথাসম্ভব যথার্থতার চেষ্টা করি, তবুও দয়া করে মাথায় রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসুস্পষ্টতা থাকতে পারে। মূল নথিটি তার নিজ ভাষায় কর্তৃত্বপূর্ণ উৎস হিসাবে বিবেচিত হওয়া উচিত। জরুরি তথ্যের জন্য পেশাদার মানব অনুবাদ পরামর্শ দেওয়া হয়। এই অনুবাদের ব্যবহার থেকে উদ্ভূত কোনো ভ্রান্তিমূলক অর্থ বা ভুল ব্যাখ্যার জন্য আমরা দায়ী নই।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n" "---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**অস্বীকৃতি**:\nএই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। যদিও আমরা শুদ্ধতার জন্য চেষ্টা করি, অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। মূল নথিটি তার স্বভাষায় কর্তৃত্বপূর্ণ উৎস হিসেবে বিবেচিত হওয়া উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদের ব্যবহারে প্রয়োজনীয় ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়বদ্ধ নই।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
] ]
} }
], ],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python", "nbconvert_exporter": "python",
"pygments_lexer": "ipython3", "pygments_lexer": "ipython3",
"version": "3.9.6" "version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T11:51:47+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "bn"
} }
}, },
"nbformat": 4, "nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"# COVID-19 মহামারীর মূল্যায়ন\n", "# কোভিড-১৯ মহামারীর মূল্যায়ন\n",
"\n", "\n",
"## ডেটা লোড করা\n", "## ডেটা লোড করা\n",
"\n", "\n",
"আমরা COVID-19 আক্রান্ত ব্যক্তিদের উপর তথ্য ব্যবহার করব, যা [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) থেকে সরবরাহ করা হয়েছে [Johns Hopkins University](https://jhu.edu/) তে। ডেটাসেটটি [এই GitHub রিপোজিটরি](https://github.com/CSSEGISandData/COVID-19) তে উপলব্ধ।\n" "আমরা [জনস হপকিন্স বিশ্ববিদ্যালয়](https://jhu.edu/) এর [সেন্টার ফর সিস্টেমস সায়েন্স অ্যান্ড ইঞ্জিনিয়ারিং](https://systems.jhu.edu/) (CSSE) দ্বারা সরবরাহিত কোভিড-১৯ সংক্রমিত ব্যক্তিদের তথ্য ব্যবহার করব। ডেটাসেট [এই গিটহাব রিপোজিটরিতে](https://github.com/CSSEGISandData/COVID-19) উপলব্ধ। \n"
] ]
}, },
{ {
@ -27,7 +27,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আমরা সরাসরি GitHub থেকে `pd.read_csv` ব্যবহার করে সর্বশেষ ডেটা লোড করতে পারি। যদি কোনো কারণে ডেটা পাওয়া না যায়, তাহলে আপনি সবসময় `data` ফোল্ডারে স্থানীয়ভাবে উপলব্ধ কপি ব্যবহার করতে পারেন - নিচের লাইনটি আনকোমেন্ট করুন যা `base_url` নির্ধারণ করে:\n" "আমরা সরাসরি GitHub থেকে `pd.read_csv` ব্যবহার করে সর্বশেষ তথ্য লোড করতে পারি। যেকোনো কারণে তথ্যটি যদি উপলব্ধ না থাকে, আপনি সর্বদা `data` ফোল্ডারে স্থানীয়ভাবে উপলব্ধ কপি ব্যবহার করতে পারেন - শুধু নিচের লাইনটি আনকমেন্ট করুন যা `base_url` সংজ্ঞায়িত করে:\n"
] ]
}, },
{ {
@ -48,7 +48,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"এখন আসুন সংক্রমিত ব্যক্তিদের জন্য ডেটা লোড করি এবং দেখি ডেটা কেমন দেখাচ্ছে:\n" "চলুন এবার সংক্রমিত ব্যক্তিদের জন্য ডেটা লোড করি এবং দেখি ডেটা কেমন দেখাচ্ছে:\n"
] ]
}, },
{ {
@ -265,7 +265,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আমরা দেখতে পাচ্ছি যে এই টেবিলের প্রতিটি সারি প্রতিটি দেশ এবং/অথবা প্রদেশের জন্য সংক্রমিত ব্যক্তিদের সংখ্যা নির্ধারণ করে, এবং কলামগুলো তারিখগুলির সাথে সম্পর্কিত। অন্যান্য তথ্যের জন্যও অনুরূপ টেবিল লোড করা যেতে পারে, যেমন সুস্থ হওয়া ব্যক্তিদের সংখ্যা এবং মৃত্যুর সংখ্যা।\n" "আমরা দেখতে পাচ্ছি যে টেবিলের প্রতিটি সারি প্রতিটি দেশ এবং/অথবা প্রদেশের জন্য সংক্রমিত ব্যক্তির সংখ্যা নির্ধারণ করে, এবং কলামগুলি তারিখের সঙ্গে সম্পর্কিত। অনুরূপ টেবিল অন্যান্য ডেটার জন্য লোড করা যেতে পারে, যেমন সুস্থ হওয়া ব্যক্তির সংখ্যা এবং মৃত্যুর সংখ্যা। \n"
] ]
}, },
{ {
@ -282,9 +282,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## ডেটার অর্থ বের করা\n", "## ডেটার অর্থ বোঝা\n",
"\n", "\n",
"উপরের সারণি থেকে প্রদেশ কলামের ভূমিকা স্পষ্ট নয়। চলুন দেখি `Province/State` কলামে কোন কোন ভিন্ন মানগুলি রয়েছে:\n" "উপরের টেবিল থেকে প্রদেশ কলামের ভূমিকা স্পষ্ট নয়। আসুন দেখি `Province/State` কলামে কি কি বিভিন্ন মান রয়েছে:\n"
] ]
}, },
{ {
@ -322,7 +322,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"নামগুলি থেকে আমরা অনুমান করতে পারি যে অস্ট্রেলিয়া এবং চীনের মতো দেশগুলির প্রদেশভিত্তিক আরও বিস্তারিত বিভাজন রয়েছে। উদাহরণ দেখতে চীনের তথ্য খুঁজে দেখা যাক:\n" "নামগুলি থেকে আমরা বুঝতে পারি যে অস্ট্রেলিয়া এবং চৈনা মতো দেশগুলির প্রদেশ অনুসারে আরো বিস্তারিত ভাগ রয়েছে। উদাহরণ দেখতে চীনের তথ্য খুঁজে বের করি:\n"
] ]
}, },
{ {
@ -1321,9 +1321,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## ডেটা প্রি-প্রসেসিং\n", "## ডেটা প্রি-প্রসেসিং \n",
"\n", "\n",
"আমরা দেশগুলোকে আরও অঞ্চলে ভাগ করতে আগ্রহী নই, তাই প্রথমেই আমরা এই বিভাজনটি সরিয়ে ফেলব এবং সকল অঞ্চলের তথ্য একসাথে যোগ করব, যাতে পুরো দেশের জন্য তথ্য পাওয়া যায়। এটি `groupby` ব্যবহার করে করা যেতে পারে:\n" "আমরা দেশগুলোকে আরও ছোট অঞ্চলে ভাগ করতে আগ্রহী নই, তাই আমরা প্রথমে এই বিভাজনটি সরিয়ে দেব এবং সমস্ত অঞ্চলের তথ্য একত্রিত করে দেশটির মোট তথ্য পাব। এটি `groupby` ব্যবহার করে করা যেতে পারে:\n"
] ]
}, },
{ {
@ -1578,7 +1578,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আপনি দেখতে পাচ্ছেন যে `groupby` ব্যবহারের কারণে সকল DataFrame এখন Country/Region দ্বারা সূচিবদ্ধ হয়েছে। তাই আমরা `.loc` ব্যবহার করে নির্দিষ্ট দেশের ডেটা অ্যাক্সেস করতে পারি:|\n" "আপনি দেখতে পাচ্ছেন যে `groupby` ব্যবহারের কারণে সব DataFrame এখন Country/Region দ্বারা index করা হয়েছে। অতএব আমরা `.loc` ব্যবহার করে নির্দিষ্ট একটি দেশের ডেটা অ্যাক্সেস করতে পারি:|\n"
] ]
}, },
{ {
@ -1607,7 +1607,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> **দ্রষ্টব্য** কীভাবে আমরা `[3:]` ব্যবহার করি প্রথম তিনটি এলিমেন্ট সরানোর জন্য যেগুলোতে নন-তারিখ মেটাডেটা থাকে (প্রদেশ/রাষ্ট্র এবং ভূ-অবস্থান কলামগুলি)। আমরা সেই তিনটি কলাম সম্পূর্ণভাবেdrop দিতে পারি:\n" "> **দ্রষ্টব্য** আমরা কীভাবে `[3:]` ব্যবহার করে একটি সিকোয়েন্সের প্রথম তিনটি উপাদান অপসারণ করি যা অ-তারিখ মেটাডেটা (প্রদেশ/রাজ্য এবং ভৌগলিক অবস্থান কলাম) ধারণ করে তা লক্ষ্য করুন। আমরা সম্পূর্ণ তিনটি কলামও সরিয়ে দিতে পারি:\n"
] ]
}, },
{ {
@ -1625,9 +1625,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## তথ্য তদন্ত করা\n", "## ডেটা তদন্ত করা\n",
"\n", "\n",
"চলুন এখন নির্দিষ্ট একটি দেশ তদন্ত করা শুরু করি। চলুন একটি ফ্রেম তৈরি করি যা সংক্রমণের তথ্য তারিখ অনুযায়ী সূচিবদ্ধ থাকবে:\n" "এখন চলুন একটি নির্দিষ্ট দেশের তদন্ত করি। চলুন একটি ফ্রেম তৈরি করি যা তারিখ অনুযায়ী সূচিকৃত সংক্রমণের ডেটা ধারণ করে:\n"
] ]
}, },
{ {
@ -1793,7 +1793,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"এখন প্রতিদিন নতুন সংক্রমিত ব্যক্তিদের সংখ্যা গণনা করি। এটি আমাদেরকে মহামারীর প্রসারের গতি দেখতে সাহায্য করবে। এটি করার সবথেকে সহজ উপায় হল `diff` ব্যবহার করা:\n" "এখন চলুন প্রতিদিন নতুন সংক্রমিত মানুষের সংখ্যা হিসাব করি। এটি আমাদের মহামারী কত দ্রুতগতিতে অগ্রসর হচ্ছে তা দেখতে সাহায্য করবে। এটি করার সবচেয়ে সহজ উপায় হল `diff` ব্যবহার করা:\n"
] ]
}, },
{ {
@ -1823,7 +1823,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আমরা তথ্যের মধ্যে উচ্চ পরিবর্তন দেখতে পাচ্ছি। চলুন একটি মাসের কাছে থেকে দেখুন:\n" "আমরা ডেটায় উচ্চ ওঠানামা দেখতে পাচ্ছি। চলুন মাসগুলোর একটিতে একটু কাছ থেকে দেখি:\n"
] ]
}, },
{ {
@ -1852,7 +1852,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"স্পষ্টভাবেই দেখতে পাচ্ছি যে ডেটায় সাপ্তাহিক ওঠা-নামা রয়েছে। কারণ আমরা প্রবণতাগুলি দেখতে চাই, তাই কার্ভটি মসৃণ করার জন্য রানিং এভারেজ হিসাব করাই যুক্তিযুক্ত (অর্থাৎ প্রতিটি দিনের জন্য আমরা পূর্বের কয়েক দিনের গড় মান হিসাব করব):\n" "এটি স্পষ্টভাবে দেখা যাচ্ছে যে ডেটাতে সাপ্তাহিক ওঠাপড়া রয়েছে। যেহেতু আমরা প্রবণতাগুলি দেখতে পারতে চাই, তাই কার্ভকে মসৃণ করার জন্য রানিং এভারেজ গণনা করা অর্থবোধক (অর্থাৎ প্রতিটি দিনের জন্য আমরা পূর্বের কয়েকটি দিনের গড় মান গণনা করব):\n"
] ]
}, },
{ {
@ -1882,7 +1882,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"একাধিক দেশের তুলনা করতে আমাদের হয়তো দেশের জনসংখ্যাকে বিবেচনায় নিতে হবে, এবং দেশের জনসংখ্যার সম্ভাব্য আক্রান্ত ব্যক্তিদের শতাংশের সাথে তুলনা করতে হবে। দেশের জনসংখ্যা পাওয়ার জন্য, চলুন দেশের তথ্যসংগ্রহ লোড করি:\n" "একাধিক দেশ তুলনা করার জন্য, আমরা হয়তো দেশের জনসংখ্যাকে বিবেচনায় নিতে চাই, এবং দেশের জনসংখ্যার তুলনায় সংক্রমিত ব্যক্তিদের শতাংশ তুলনা করতে চাই। দেশের জনসংখ্যা পাওয়ার জন্য, চলুন দেশগুলোর ডেটাসেট লোড করি:\n"
] ]
}, },
{ {
@ -2153,7 +2153,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"যখন এই ডেটাসেটে উভয় দেশ এবং প্রদেশের তথ্য রয়েছে, পুরো দেশের জনসংখ্যা পেতে আমাদের একটু বুদ্ধিমত্তার প্রয়োজন:\n" "কারণ এই ডেটাসেটে দেশ এবং প্রদেশ দুইয়ের তথ্য রয়েছে, পুরো দেশের জনসংখ্যা পেতে আমাদের একটু বুদ্ধিদীপ্ত হতে হবে: \n"
] ]
}, },
{ {
@ -2261,14 +2261,15 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## হিসাব করা $R_t$\n",
"\n", "\n",
"দেখতে যে রোগটি কতটা সংক্রামক, আমরা **মৌলিক প্রজনন সংখ্যা** $R_0$ দেখি, যা নির্দেশ করে যে একটি সংক্রামিত ব্যক্তি কতজনকে আরও সংক্রামিত করতে পারে। যখন $R_0$ একের বেশি হয়, তখন মহামারী ছড়িয়ে পড়ার সম্ভাবনা থাকে।\n", "## $R_t$ হিসাব করা\n",
"\n", "\n",
"$R_0$ রোগটির নিজস্ব একটি গুণ, এবং এটি কিছু সুরক্ষামূলক ব্যবস্থা বিবেচনায় নেয় না যা মানুষ মহামারী ধীর করার জন্য নিতে পারে। মহামারী চলাকালীন, আমরা যেকোনো সময় $t$-তে প্রজনন সংখ্যা $R_t$ অনুমান করতে পারি। এটি প্রমাণিত হয়েছে যে এই সংখ্যাটি প্রায় ৮ দিনের একটি উইন্ডো নিয়ে হিসাব করে আনুমানিক নির্ণয় করা যেতে পারে, এবং হিসাব করা হয় $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n", "রোগ কতটা সংক্রামক তা দেখতে, আমরা **মৌলিক উৎপাদন সংখ্যা** $R_0$ দেখি, যা নির্দেশ করে যে একজন সংক্রামিত ব্যক্তি পরবর্তীতে কতজনকে সংক্রামিত করবে। যখন $R_0$ 1 এর বেশি হয়, তখন মহামারী ছড়ানোর সম্ভাবনা থাকে।\n",
"যেখানে $I_t$ হলো দিন$t$-তে নতুন সংক্রামিত ব্যক্তিদের সংখ্যা।\n",
"\n", "\n",
"আমাদের মহামারী তথ্যের জন্য $R_t$ হিসাব করি। এটি করতে, আমরা ৮ দিনের `ninfected` মানের একটি চলমান উইন্ডো নেব, এবং উপরের অনুপাত হিসাব করতে ফাংশন প্রয়োগ করব:\n" "$R_0$ নিজেই রোগের একটি বৈশিষ্ট্য, এবং কিছু সুরক্ষামূলক ব্যবস্থা যা মানুষ মহামারী ধীর করার জন্য নিতে পারে তা বিবেচনায় নেয় না। মহামারীর প্রগতি চলাকালীন, আমরা যে কোন নির্দিষ্ট সময় $t$ সময়ে উৎপাদন সংখ্যা $R_t$ অনুমান করতে পারি। দেখানো হয়েছে যে এই সংখ্যা আনুমানিক হিসাব করার জন্য ৮ দিনের একটি উইন্ডো নিলে $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$ হিসাব করা যায়\n",
"যেখানে $I_t$ হলো $t$ দিনেই নতুন সংক্রামিত ব্যক্তির সংখ্যা।\n",
"\n",
"চলুন আমাদের মহামারীর ডেটা থেকে $R_t$ হিসাব করি। এর জন্য, আমরা ৮ টির একটি চলমান উইন্ডো নেব `ninfected` মানগুলোর, এবং উপরের অনুপাত হিসাব করার ফাংশন প্রয়োগ করব:\n"
] ]
}, },
{ {
@ -2298,9 +2299,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"আপনি দেখতে পারেন যে গ্রাফে কিছু ফাঁক রয়েছে। সেগুলি হতে পারে `NaN` দ্বারা, যদি ডেটাসেটে `inf` মান উপস্থিত থাকে। `inf` হতে পারে শূন্য দিয়ে ভাগ করার কারণে, এবং `NaN` নির্দেশ করতে পারে অনুপস্থিত ডাটা, অথবা ফলাফল হিসাব করার জন্য ডাটা নেই (যেমন আমাদের ফ্রেমের শুরুতে, যেখানে প্রস্থ ৮ এর রোলিং উইন্ডো এখনও উপলব্ধ নয়)। গ্রাফকে আরও সুন্দর করতে, আমাদের সেই মানগুলো `replace` এবং `fillna` ফাংশন ব্যবহার করে পূরণ করতে হবে।\n", "আপনি দেখতে পাচ্ছেন গ্রাফে কিছু ফাঁক আছে। তা `NaN` দ্বারা হতে পারে, যদি `inf` মান সেট ডেটাতে উপস্থিত থাকে। `inf` হতে পারে শূন্যের দ্বারা ভাগ করার কারণে, এবং `NaN` নির্দেশ করতে পারে অনুপস্থিত ডেটা, বা ফলাফল গণনার জন্য কোনো ডেটা উপলব্ধ নেই (যেমন আমাদের ফ্রেমের শুরুতে, যেখানে পর্দার প্রস্থ ৮ এখনও উপলব্ধ হয়নি)। গ্রাফটি আরও সুন্দর করতে, আমাদের সেই মানগুলি `replace` এবং `fillna` ফাংশন ব্যবহার করে পূরণ করতে হবে।\n",
"\n", "\n",
"চলুন মহামারীর শুরু আরও দেখতে যাই। আমরা y-অক্ষের মানগুলোকেও সীমাবদ্ধ করব মাত্র ৬ এর নিচে মান দেখানোর জন্য, যাতে আরও ভালো দেখা যায়, এবং ১ এ একটি অনুভূমিক রেখা আঁকব।\n" "চলুন মহামারীর শুরুতে আরও নজর দেওয়া যাক। আমরা y-অক্ষের মানগুলি সীমাবদ্ধ করব শুধুমাত্র ৬ এর নিচে মানগুলি দেখানোর জন্য, যাতে ভালোভাবে দেখা যায়, এবং ১ এ একটি অনুভূমিক রেখা আঁকব।\n"
] ]
}, },
{ {
@ -2331,7 +2332,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"মহামারীর আরেকটি আকর্ষণীয় সূচক হল **ডেরিভেটিভ**, বা নতুন মামলায় **দৈনিক পার্থক্য**। এটি আমাদের স্পষ্টভাবে দেখতে সাহায্য করে কখন মহামারী বৃদ্ধি পাচ্ছে বা কমছে।\n" "মহামারীর আরেকটি এক্ষেত্রোপযোগী সূচক হল **ডেরিভেটিভ**, বা নতুন মামলাগুলোর **দৈনিক পার্থক্য**। এটি আমাদের স্পষ্টভাবে দেখতে সাহায্য করে কখন মহামারি বাড়ছে বা কমছে। \n"
] ]
}, },
{ {
@ -2360,7 +2361,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"প্রতিবেদন থেকে সৃষ্ট তথ্যের অনেক প্রতিচক্রিয়া থাকা সত্যটি বিবেচনা করে, সামগ্রিক চিত্র পেতে পুনরাবৃত্ত গড় চালিয়ে রেখাকে মসৃণ করা যুক্তিযুক্ত। চলুন আবার মহামারীর প্রথম মাসগুলিতে মনোযোগ দিইঃ\n" "রিপোর্টিংয়ের কারণে তথ্যের অনেক ওঠানামা থাকার পরিপ্রেক্ষিতে, সামগ্রিক চিত্র পেতে রোলিং এভারেজ চালিয়ে কার্ভটি মসৃণ করা যুক্তিযুক্ত। চলুন আবার মহামারীর প্রথম মাসগুলোতে মনোযোগ দিই:\n"
] ]
}, },
{ {
@ -2390,14 +2391,15 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"\n",
"## চ্যালেঞ্জ\n", "## চ্যালেঞ্জ\n",
"\n", "\n",
"এখন আপনার জন্য কোড এবং ডাটার সাথে আরও খেলাধুলা করার সময় হয়েছে! আপনি নিচের কয়েকটি প্রস্তাবনার মাধ্যমে পরীক্ষা-নিরীক্ষা করতে পারেন:\n", "এখন আপনার কোড এবং ডেটার সাথে আরও খেলাধুলার সময় এসেছে! এখানে কয়েকটি পরামর্শ রয়েছে যা আপনি পরীক্ষা করতে পারেন:\n",
"* বিভিন্ন দেশে মহামারির বিস্তার দেখুন।\n", "* বিভিন্ন দেশে মহামারর বিস্তার দেখুন।\n",
"* তুলনার জন্য এক প্লটে বিভিন্ন দেশের $R_t$ গ্রাফ আঁকুন, অথবা পাশাপাশি কয়েকটি প্লট তৈরি করুন\n", "* তুলনার জন্য এক প্লটে একাধিক দেশের $R_t$ গ্রাফ আঁকুন, অথবা একাধিক প্লট পাশাপাশি তৈরি করুন\n",
"* মৃত ও সুস্থ হওয়ার সংখ্যা কীভাবে সংক্রমিত কেসের সংখ্যার সাথে সম্পর্কিত তা দেখুন।\n", "* মৃত্যু এবং সুস্থতার সংখ্যা সংক্রমিত ক্ষেত্রের সংখ্যার সাথে কীভাবে সম্পর্কযুক্ত তা দেখুন।\n",
"* সংক্রমণ হার এবং মৃত্যুহারের ভিজ্যুয়াল সম্পর্ক করে এবং কিছু অস্বাভাবিকতা খুঁজে দেখে একটি সাধারণ রোগ কতক্ষণ স্থায়ী হয় তা বের করার চেষ্টা করুন। আপনি এটা খুঁজে পেতে বিভিন্ন দেশ দেখতে হতে পারে।\n", "* সংক্রমণের হার এবং মৃত্যুহার ভিজ্যুয়ালি সম্পর্কিত করে এবং কিছু অস্বাভাবিকতা খুঁজে বের করে সাধারণত একটি রোগ কতদিন স্থায়ী হয় তা বের করার চেষ্টা করুন। আপনি তা বের করতে বিভিন্ন দেশ দেখতে হতে পারে।\n",
"* মৃত্যুহার হিসাব করুন এবং এটি সময়ের সাথে কিভাবে পরিবর্তিত হয় তা দেখুন। হিসাব করার আগে সময় শিফট করার জন্য রোগের দৈর্ঘ্য দিন হিসাবে বিবেচনায় নিতে পারেন।\n" "* মারাত্মকতার হার গণনা করুন এবং কিভাবে এটি সময়ের সাথে পরিবর্তিত হয়। আপনি গণনা করার আগে রোগের দৈর্ঘ্য দিনের মধ্যে বিবেচনায় নিতে চাইতে পারেন এক টাইম সিরিজ সরে যেতে\n"
] ]
}, },
{ {
@ -2406,10 +2408,10 @@
"source": [ "source": [
"## রেফারেন্সসমূহ\n", "## রেফারেন্সসমূহ\n",
"\n", "\n",
"নিম্নোক্ত প্রকাশনাগুলিতে COVID মহামারীর বিস্তার সম্পর্কিত আরও গবেষণা দেখা যেতে পারে:\n", "আপনি নিম্নলিখিত প্রকাশনাগুলিতে COVID মহামারির প্ৰসার সম্পর্কিত আরও গবেষণা দেখতে পারে:\n",
"* [COVID মহামারী চলাকালীন Rt অনুমানের জন্য স্লাইডিং SIR মডেল](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ব্লগ পোস্ট [Dmitry Soshnikov](http://soshnikov.com) কর্তৃক\n", "* [COVID মহামারি চলাকালীন Rt মূল্যায়নের জন্য স্লাইডিং SIR মডেল](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ব্লগ পোস্ট [Dmitry Soshnikov](http://soshnikov.com) দ্বারা\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [বিশ্বব্যাপী COVID-19 প্রাদুর্ভাবের জন্য সময়-নির্ভর পুনরুত্পাদন সংখ্যা অনুমান](https://www.preprints.org/manuscript/202006.0289/v1)। *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n", "* T.Petrova, D.Soshnikov, A.Grunin. [বিশ্ব COVID-19 প্রাদুর্ভাবের জন্য সময়-সাপেক্ষ পুনরুত্পাদন সংখ্যা অনুমান](https://www.preprints.org/manuscript/202006.0289/v1)। *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [উপরোক্ত পেপারটির কোড GitHub এ](https://github.com/shwars/SlidingSIR)\n" "* [উক্ত পেপারের জন্য কোড GitHub-এ](https://github.com/shwars/SlidingSIR)\n"
] ]
}, },
{ {
@ -2423,7 +2425,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**দ্যাখিলকরণ**: \nএই নথিটি এআই অনুবাদ সেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। আমরা সঠিকতার জন্য চেষ্টা করি, তবে অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা ভুল থাকতে পারে। মূল নথিটি এর নিজ ভাষায় সর্বোচ্চ সমঝোতার উৎস হিসেবে বিবেচনা করা উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদের পরামর্শ দেওয়া হয়। এই অনুবাদের ব্যবহারে যে কোনো ভুল বোঝাবুঝি বা ভুলার্থের জন্য আমরা দায়ী নই।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n" "---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**অস্বীকৃতি**:\nএই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। যদিও আমরা শুদ্ধতার জন্য চেষ্টা করি, অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। মূল নথিটি তার স্বভাষায় কর্তৃত্বপূর্ণ উৎস হিসেবে বিবেচিত হওয়া উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদের ব্যবহারে প্রয়োজনীয় ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়বদ্ধ নই।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
] ]
} }
], ],

@ -1,31 +1,33 @@
# বিপজ্জনক সম্পর্ক ডেটা ভিজ্যুয়ালাইজেশন প্রকল্প # ডেঞ্জারাস লিয়াজোনস ডেটা ভিজ্যুয়ালাইজেশন প্রকল্প
শুরু করার জন্য, নিশ্চিত করুন যে আপনার মেশিনে NPM এবং Node চালু রয়েছে। ডিপেনডেন্সিগুলি ইনস্টল করুন (npm install) এবং তারপর প্রকল্পটি লোকালভাবে চালান (npm run serve): শুরু করতে, আপনাকে নিশ্চিত করতে হবে যে আপনার মেশিনে NPM এবং Node **>=20.0.0** চলমান আছে। নির্ভরশীলতাগুলো ইনস্টল করুন (npm install) এবং তারপর প্রকল্পটি লোকালি চালান (npm run serve):
## প্রকল্প সেটআপ ## প্রকল্প সেটআপ
``` ```
npm install npm install
``` ```
### ডেভেলপমেন্টের জন্য কম্পাইল এবং হট-রিলোড ### বিকাশের জন্য কম্পাইল এবং হট-রিলোড করে
``` ```
npm run serve npm run serve
``` ```
### প্রোডাকশনের জন্য কম্পাইল এবং মিনিফাই ### উৎপাদনের জন্য কম্পাইল এবং মিনিফাই করে
``` ```
npm run build npm run build
``` ```
### ফাইল লিন্ট এবং ঠিক করা ### লিন্ট করে এবং ফাইলগুলো ঠিক করে
``` ```
npm run lint npm run lint
``` ```
### কনফিগারেশন কাস্টমাইজ করুন ### কনফিগারেশন কাস্টমাইজ করুন
[Configuration Reference](https://cli.vuejs.org/config/) দেখুন দেখুন [Configuration Reference](https://cli.vuejs.org/config/)।
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**অস্বীকৃতি**: **অস্বীকৃতি**:
এই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনুবাদ করা হয়েছে। আমরা যথাসম্ভব সঠিক অনুবাদের চেষ্টা করি, তবে অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। নথিটির মূল ভাষায় লেখা সংস্করণটিকেই প্রামাণিক উৎস হিসেবে বিবেচনা করা উচিত। গুরুত্বপূর্ণ তথ্যের জন্য, পেশাদার মানব অনুবাদ ব্যবহার করার পরামর্শ দেওয়া হচ্ছে। এই অনুবাদ ব্যবহারের ফলে সৃষ্ট কোনো ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়ী নই। এই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। যদিও আমরা শুদ্ধতার জন্য চেষ্টা করি, অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। মূল নথিটি তার স্বভাষায় কর্তৃত্বপূর্ণ উৎস হিসেবে বিবেচিত হওয়া উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদের ব্যবহারে প্রয়োজনীয় ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়বদ্ধ নই।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# বিপজ্জনক সম্পর্ক ডেটা ভিজ্যুয়ালাইজেশন প্রকল্প # ডেঞ্জারাস লিয়োজন্স ডেটা ভিজ্যুয়ালাইজেশন প্রকল্প
শুরু করার জন্য, নিশ্চিত করুন যে আপনার মেশিনে NPM এবং Node চালু রয়েছে। ডিপেনডেন্সিগুলি ইনস্টল করুন (npm install) এবং তারপর প্রকল্পটি লোকালভাবে চালান (npm run serve): শুরু করতে, আপনাকে নিশ্চিত করতে হবে যে আপনার মেশিনে NPM এবং Node **>=20.0.0** চলছে। dependencies গুলো ইনস্টল করুন (npm install) এবং তারপর প্রকল্পটি লোকালি চালান (npm run serve):
## প্রকল্প সেটআপ ## প্রকল্প সেটআপ
``` ```
npm install npm install
``` ```
### ডেভেলপমেন্টের জন্য কম্পাইল এবং হট-রিলোড ### ডেভেলপমেন্টের জন্য কম্পাইল এবং হট-রিলোড করে
``` ```
npm run serve npm run serve
``` ```
### প্রোডাকশনের জন্য কম্পাইল এবং মিনিফাই ### প্রোডাকশনের জন্য কম্পাইল এবং মিনিফাই করা
``` ```
npm run build npm run build
``` ```
### ফাইল লিন্ট এবং ঠিক করা ### ফাইলগুলো লিন্ট এবং ঠিক করে
``` ```
npm run lint npm run lint
``` ```
### কনফিগারেশন কাস্টমাইজ করুন ### কনফিগারেশন কাস্টমাইজ করুন
[Configuration Reference](https://cli.vuejs.org/config/) দেখুন দেখুন [Configuration Reference](https://cli.vuejs.org/config/)।
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**অস্বীকৃতি**: **অস্বীকৃতি**:
এই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনুবাদ করা হয়েছে। আমরা যথাসম্ভব সঠিক অনুবাদের চেষ্টা করি, তবে অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। নথিটির মূল ভাষায় লেখা সংস্করণটিকেই প্রামাণিক উৎস হিসেবে বিবেচনা করা উচিত। গুরুত্বপূর্ণ তথ্যের জন্য, পেশাদার মানব অনুবাদ ব্যবহার করার পরামর্শ দেওয়া হয়। এই অনুবাদ ব্যবহারের ফলে সৃষ্ট কোনো ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়ী নই। এই নথিটি AI অনুবাদ পরিষেবা [Co-op Translator](https://github.com/Azure/co-op-translator) ব্যবহার করে অনূদিত হয়েছে। যদিও আমরা শুদ্ধতার জন্য চেষ্টা করি, অনুগ্রহ করে মনে রাখবেন যে স্বয়ংক্রিয় অনুবাদে ত্রুটি বা অসঙ্গতি থাকতে পারে। মূল নথিটি তার স্বভাষায় কর্তৃত্বপূর্ণ উৎস হিসেবে বিবেচিত হওয়া উচিত। গুরুত্বপূর্ণ তথ্যের জন্য পেশাদার মানব অনুবাদ সুপারিশ করা হয়। এই অনুবাদের ব্যবহারে প্রয়োজনীয় ভুল বোঝাবুঝি বা ভুল ব্যাখ্যার জন্য আমরা দায়বদ্ধ নই।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "mr" "language_code": "mr"
}, },
"1-Introduction/01-defining-data-science/notebook.ipynb": { "1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec", "original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-02-28T08:25:12+00:00", "translation_date": "2026-07-17T20:32:02+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb", "source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "mr" "language_code": "mr"
}, },
@ -42,8 +42,8 @@
"language_code": "mr" "language_code": "mr"
}, },
"1-Introduction/03-defining-data/README.md": { "1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339", "original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2025-09-06T07:37:12+00:00", "translation_date": "2026-07-17T20:36:52+00:00",
"source_file": "1-Introduction/03-defining-data/README.md", "source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "mr" "language_code": "mr"
}, },
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md", "source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "mr" "language_code": "mr"
}, },
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T20:33:10+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "mr"
},
"1-Introduction/README.md": { "1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949", "original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-27T17:02:07+00:00", "translation_date": "2025-08-27T17:02:07+00:00",
@ -108,8 +114,8 @@
"language_code": "mr" "language_code": "mr"
}, },
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": { "2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38", "original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-02-28T08:26:43+00:00", "translation_date": "2026-07-17T20:31:28+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb", "source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "mr" "language_code": "mr"
}, },
@ -192,14 +198,14 @@
"language_code": "mr" "language_code": "mr"
}, },
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": { "3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e", "original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2025-08-27T18:16:03+00:00", "translation_date": "2026-07-17T20:37:01+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md", "source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "mr" "language_code": "mr"
}, },
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": { "3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e", "original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2025-08-27T18:15:34+00:00", "translation_date": "2026-07-17T20:36:56+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md", "source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "mr" "language_code": "mr"
}, },

File diff suppressed because one or more lines are too long

@ -4,45 +4,44 @@
|:---:| |:---:|
|डेटा परिभाषित करणे - _Sketchnote by [@nitya](https://twitter.com/nitya)_ | |डेटा परिभाषित करणे - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
डेटा म्हणजे तथ्ये, माहिती, निरीक्षणे आणि मोजमापे, जी शोध लावण्यासाठी आणि माहितीपूर्ण निर्णयांना पाठिंबा देण्यासाठी वापरली जातात. डेटा पॉइंट म्हणजे डेटासेटमधील एकक डेटा युनिट, जो डेटा पॉइंट्सच्या संग्रहाचा भाग असतो. डेटासेट्स वेगवेगळ्या स्वरूपात आणि संरचनांमध्ये येऊ शकतात आणि सामान्यतः त्याच्या स्रोतावर आधारित असतात, म्हणजे डेटा कुठून आला आहे. उदाहरणार्थ, एखाद्या कंपनीचे मासिक उत्पन्न स्प्रेडशीटमध्ये असू शकते, तर स्मार्टवॉचमधील तासागणिक हृदय गती डेटा [JSON](https://stackoverflow.com/a/383699) स्वरूपात असू शकतो. डेटा वैज्ञानिकांना डेटासेटमध्ये वेगवेगळ्या प्रकारच्या डेटासोबत काम करणे सामान्य आहे. डेटा म्हणजे तथ्ये, माहिती, निरीक्षणे आणि मोजमाप जे शोध लावण्यासाठी आणि सूचित निर्णयांना आधार देण्यासाठी वापरले जातात. एक डेटा पॉइंट म्हणजे डेटासेटमधील एकल डेटा युनिट, जे डेटा पॉइंट्सचा संच असतो. डेटासेट विविध स्वरूपांमध्ये आणि रचनांमध्ये येऊ शकतात, आणि सहसा ते त्याच्या स्त्रोतावर किंवा डेटा कुठून आला आहे यावर आधारित असते. उदाहरणार्थ, एखाद्या कंपनीचे मासिक उत्पन्न स्प्रेडशीटमध्ये असू शकते, तर स्मार्टवॉचमधील तासाचा हृदय गती डेटा [JSON](https://stackoverflow.com/a/383699) स्वरूपात असू शकतो. डेटासायंटिस्टसाठी डेटासेटमधील वेगवेगळ्या प्रकारच्या डेटासोबत काम करणे सामान्य आहे.
या धड्याचा उद्देश डेटाच्या वैशिष्ट्यांनुसार आणि त्याच्या स्रोतांनुसार डेटा ओळखणे आणि वर्गीकरण करणे आहे. हा धडा डेटाच्या वैशिष्ट्यांनुसार आणि त्याच्या स्त्रोतांनुसार डेटा ओळखणे आणि वर्गीकृत करण्यात केंद्रित आहे.
## [पूर्व-व्याख्यान प्रश्नमंजुषा](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## [पूर्व व्याख्यान क्विझ](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## डेटा कसा वर्णन केला जातो ## डेटा कसा वर्णन केला जातो
### कच्चा डेटा ### कच्चा डेटा
कच्चा डेटा म्हणजे त्याच्या स्रोतातून आलेला डेटा, जो त्याच्या सुरुवातीच्या अवस्थेत असतो आणि ज्याचे विश्लेषण किंवा आयोजन केलेले नसते. डेटासेटमधील घडणाऱ्या गोष्टींचा अर्थ लावण्यासाठी, तो अशा स्वरूपात आयोजित करणे आवश्यक आहे, जो मानवांसाठी तसेच तंत्रज्ञानासाठी समजण्यास सोपा असेल, जे पुढील विश्लेषणासाठी वापरले जाऊ शकते. डेटासेटची रचना त्याचे आयोजन कसे केले जाते हे वर्णन करते आणि ती संरचित, असंरचित आणि अर्ध-संरचित अशा प्रकारांमध्ये वर्गीकृत केली जाऊ शकते. या प्रकारांची रचना स्रोतावर अवलंबून बदलते, परंतु शेवटी ती या तीन श्रेणींमध्ये बसते. कच्चा डेटा म्हणजे स्त्रोताकडून आलेला प्रारंभिक स्थितीतला डेटा जो विश्लेषित किंवा संघटित केलेला नाही. डेटासेटमध्ये काय सुरू आहे हे समजून घेण्यासाठी, असा डेटा मनुष्य आणि वापरातील तंत्रज्ञानाने समजण्यासारख्या स्वरूपात संघटित करणे आवश्यक असते. डेटासेटची रचना कशी संघटित आहे हे वर्णन करते आणि ती संरचित, असंरचित आणि अर्ध-संरचित अशा प्रकारांमध्ये वर्गीकृत केली जाऊ शकते. या रचनांच्या प्रकारांमध्ये फरक स्त्रोतातील आधारे असतो, पण तीनही प्रकारांत येतो.
### परिमाणात्मक डेटा ### मोजमापात्मक डेटा
परिमाणात्मक डेटा म्हणजे डेटासेटमधील संख्यात्मक निरीक्षणे, जी सामान्यतः विश्लेषित, मोजली आणि गणितीय पद्धतीने वापरली जाऊ शकतात. परिमाणात्मक डेटाचे काही उदाहरणे म्हणजे: देशाची लोकसंख्या, व्यक्तीची उंची किंवा कंपनीचे तिमाही उत्पन्न. काही अतिरिक्त विश्लेषणासह, परिमाणात्मक डेटा हवेच्या गुणवत्तेचा निर्देशांक (AQI) यामधील हंगामी ट्रेंड शोधण्यासाठी किंवा कामाच्या सामान्य दिवशी ट्रॅफिक जाम होण्याची शक्यता अंदाज करण्यासाठी वापरला जाऊ शकतो. मोजमापात्मक डेटा म्हणजे डेटासेटमध्ये असलेली संख्यात्मक निरीक्षणे, जी सामान्यतः विश्लेषित, मोजले आणि गणितीयरीत्या वापरली जाऊ शकतात. मोजमापात्मक डेटाचे काही उदाहरणे: एखाद्या देशाचे लोकसंख्या, एखाद्या व्यक्तीची उंची किंवा एखाद्या कंपनीचे तिमाही उत्पन्न. काही अतिरिक्त विश्लेषणाने, मोजमापात्मक डेटा वापरून एअर क्वालिटी इंडेक्स (AQI) चे मौसमी ट्रेंड शोधले किंवा सामान्य कामाच्या दिवशी ट्रॅफिकच्या गर्दीची शक्यता अंदाजित केली जाऊ शकते.
### गुणात्मक डेटा ### गुणात्मक डेटा
गुणात्मक डेटा, ज्याला श्रेणीबद्ध डेटा असेही म्हणतात, तो परिमाणात्मक डेटासारखा वस्तुनिष्ठपणे मोजता येत नाही. हा सामान्यतः विविध स्वरूपातील व्यक्तिनिष्ठ डेटा असतो, जो एखाद्या उत्पादनाची किंवा प्रक्रियेची गुणवत्ता कॅप्चर करतो. कधी कधी, गुणात्मक डेटा संख्यात्मक असतो, परंतु तो सामान्यतः गणितीय पद्धतीने वापरला जात नाही, जसे की फोन नंबर किंवा टाइमस्टॅम्प. गुणात्मक डेटाचे काही उदाहरणे म्हणजे: व्हिडिओवरील टिप्पण्या, कारचा ब्रँड आणि मॉडेल किंवा तुमच्या जवळच्या मित्राचा आवडता रंग. गुणात्मक डेटा ग्राहकांना कोणते उत्पादने सर्वाधिक आवडतात हे समजण्यासाठी किंवा नोकरी अर्जातील लोकप्रिय कीवर्ड ओळखण्यासाठी वापरला जाऊ शकतो. गुणात्मक डेटा, ज्याला वर्गीकृत डेटा देखील म्हणतात, असे डेटा आहे जे मोजमापात्मक डेटाप्रमाणे वस्तुनिष्ठपणे मोजले जाऊ शकत नाही. तो सामान्यतः काही वस्तूची गुणवत्ता टिपणारे किंवा प्रक्रियेच्या स्वरूपातील विविध प्रकारचे व्यक्तिनिष्ठ डेटा असतो. कधी-कधी, गुणात्मक डेटा संख्यात्मक असू शकतो पण सामान्यतः गणितीयरीत्या वापरला जात नाही, जसे फोन नंबर किंवा टाइमस्टॅम्प. गुणात्मक डेटाचे काही उदाहरणे: व्हिडिओवरील टिप्पण्या, कारचा मेक आणि मॉडेल किंवा तुमच्या जवळच्या मित्राचा आवडता रंग. गुणात्मक डेटा वापरून ग्राहकांना कोणती उत्पादने सर्वात आवडतात हे समजून घेता येते किंवा नोकरी अर्जातील लोकप्रिय कीवर्ड ओळखता येतात.
### संरचित डेटा ### संरचित डेटा
संरचित डेटा म्हणजे पंक्ती आणि स्तंभांमध्ये आयोजित केलेला डेटा, जिथे प्रत्येक पंक्तीमध्ये समान सेटचे स्तंभ असतात. स्तंभ विशिष्ट प्रकाराच्या मूल्याचे प्रतिनिधित्व करतात आणि ते मूल्य काय दर्शवते याचे वर्णन करणारे नाव असते, तर पंक्तीमध्ये वास्तविक मूल्ये असतात. स्तंभांमध्ये मूल्यांवर विशिष्ट नियम किंवा निर्बंध असतात, जेणेकरून मूल्ये स्तंभाचे अचूक प्रतिनिधित्व करतात. उदाहरणार्थ, ग्राहकांच्या स्प्रेडशीटची कल्पना करा, जिथे प्रत्येक पंक्तीमध्ये फोन नंबर असणे आवश्यक आहे आणि फोन नंबरमध्ये कधीही अक्षरे नसावीत. फोन नंबर स्तंभावर असे नियम लागू केले जाऊ शकतात की तो कधीही रिकामा नसावा आणि फक्त संख्याच असाव्यात. संरचित डेटा असा डेटा आहे जो ओळी आणि स्तंभांमध्ये संघटित असतो, जिथे प्रत्येक ओळीमध्ये समान संचाचे स्तंभ असतात. स्तंभ विशिष्ट प्रकाराचे मूल्य दर्शवतात आणि त्याला एक नाव दिले जाते जे त्या मूल्याचे प्रतिनिधित्व काय करते हे स्पष्ट करते, तर ओळी वास्तविक मूल्ये ठेवतात. स्तंभावर अनेकदा विशिष्ट नियम किंवा निर्बंध असतात, जे सुनिश्चित करतात की मूल्य स्तंभाचे अचूक प्रतिनिधित्व करते. उदाहरणार्थ, ग्राहकांच्या स्प्रेडशीटमध्ये प्रत्येक ओळीत फोन नंबर असावा आणि फोन नंबरमध्ये अक्षरे नसावीत. फोन नंबर स्तंभावर अशी नियम लागू असू शकतात की तो कधीही रिक्त राहू नये आणि फक्त संख्या असाव्यात.
संरचित डेटाचा एक फायदा म्हणजे तो अशा प्रकारे आयोजित केला जाऊ शकतो की तो इतर संरचित डेटाशी संबंधित असू शकतो. परंतु, डेटा विशिष्ट पद्धतीने आयोजित करण्यासाठी डिझाइन केलेला असल्यामुळे, त्याच्या एकूण संरचनेत बदल करणे कठीण होऊ शकते. उदाहरणार्थ, ग्राहकांच्या स्प्रेडशीटमध्ये रिकामा नसलेला ईमेल स्तंभ जोडणे म्हणजे तुम्हाला विद्यमान ग्राहकांच्या पंक्तींमध्ये ही मूल्ये कशी जोडायची याचा विचार करावा लागेल. संरचित डेटाचा एक फायदा म्हणजे तो अशा प्रकारे संघटित केला जाऊ शकतो की तो इतर संरचित डेटाशी संबंधित होऊ शकतो. मात्र, डेटा विशिष्ट स्वरूपात रहाण्यासाठी डिझाइन केलेला असल्यामुळे त्याच्या एकूण रचनेत बदल करणे फारसे सोपे नसते. उदाहरणार्थ, ग्राहकांच्या स्प्रेडशीटमध्ये एक ईमेल स्तंभ भरावा जो कधीही रिक्त राहू नये, तर सध्याच्या ओळीत त्या मूल्यांना कसे भरायचे ते ठरवावे लागेल.
संरचित डेटाची उदाहरणे: स्प्रेडशीट्स, रिलेशनल डेटाबेस, फोन नंबर, बँक स्टेटमेंट्स संरचित डेटाची उदाहरणे: स्प्रेडशीट्स, रिलेशनल डेटाबेस, फोन नंबर, बँक स्टेटमेंट्स
### असंरचित डेटा ### असंरचित डेटा
असंरचित डेटा सामान्यतः पंक्ती किंवा स्तंभांमध्ये वर्गीकृत केला जाऊ शकत नाही आणि त्यामध्ये कोणतेही स्वरूप किंवा नियमांचा संच नसतो. असंरचित डेटावर संरचनेवर कमी निर्बंध असल्यामुळे, संरचित डेटासेटच्या तुलनेत नवीन माहिती जोडणे सोपे असते. उदाहरणार्थ, जर एखाद्या सेन्सरने दर 2 मिनिटांनी बारोमेट्रिक प्रेशर डेटा कॅप्चर केला आणि आता तापमान मोजण्याची आणि नोंदवण्याची क्षमता मिळाली, तर असंरचित असल्यास विद्यमान डेटामध्ये बदल करण्याची आवश्यकता नाही. परंतु, यामुळे अशा प्रकारच्या डेटाचे विश्लेषण किंवा तपास करणे अधिक वेळखाऊ होऊ शकते. उदाहरणार्थ, एखाद्या वैज्ञानिकाला सेन्सरच्या डेटामधून मागील महिन्याचे सरासरी तापमान शोधायचे आहे, परंतु त्याला असे आढळते की सेन्सरने काही डेटा "e" म्हणून नोंदवला आहे, ज्याचा अर्थ तो खराब झाला होता, त्यामुळे डेटा अपूर्ण आहे. असंरचित डेटा सामान्यतः ओळी किंवा स्तंभात वर्गीकृत केला जात नाही आणि त्यात एखादा निश्चित स्वरूप किंवा नियमांचा संच नसतो. असंरचित डेटावरच्या रचनेवर कमी निर्बंध असल्यामुळे नवीन माहिती जोडणे अधिक सोपे असते, तुलना करता संरचित डेटासेटशी. जर दोन मिनिटांनी बारोमेट्रिक प्रेशर मोजणारा सेन्सर आता तापमान मोजण्याची आणि रेकॉर्ड करण्याची क्षमता प्राप्त करतो, तर असंरचित असल्यास विद्यमान डेटामध्ये कोणीही बदल करावे लागत नाही. मात्र, अशा डेटाचे विश्लेषण किंवा तपासणी जास्त वेळ घेऊ शकते. उदाहरणार्थ, एखाद्या शास्त्रज्ञाला गेल्या महिन्याचा सरासरी तापमान शोधायचे आहे, पण तो पाहतो की काही सेन्सर डेटामध्ये "e" नोंदले आहे जे म्हणजे तो तोडला होता, ज्यामुळे डेटा अपूर्ण आहे.
असंरचित डेटाची उदाहरणे: टेक्स्ट फाइल्स, टेक्स्ट मेसेजेस, व्हिडिओ फाइल्स असंरचित डेटाची उदाहरणे: टेक्स्ट फाईल्स, मजकूर संदेश, व्हिडिओ फाईल्स
### अर्ध-संरचित डेटा ### अर्ध-संरचित
अर्ध-संरचित डेटामध्ये संरचित आणि असंरचित डेटाचे वैशिष्ट्ये असतात. तो सामान्यतः पंक्ती आणि स्तंभांच्या स्वरूपात नसतो, परंतु तो अशा प्रकारे आयोजित केला जातो, जो संरचित मानला जातो आणि निश्चित स्वरूप किंवा नियमांचा संच अनुसरण करू शकतो. संरचना स्रोतांमध्ये बदलते, जसे की चांगल्या प्रकारे परिभाषित केलेली श्रेणी ते अधिक लवचिक स्वरूप, जे नवीन माहिती सहजपणे समाकलित करण्यास अनुमती देते. मेटाडेटा हे संकेतक असतात, जे डेटा कसा आयोजित आणि संग्रहित केला जातो हे ठरवण्यास मदत करतात आणि डेटाच्या प्रकारावर आधारित विविध नावे असतात. मेटाडेटासाठी काही सामान्य नावे म्हणजे टॅग्स, घटक, घटक आणि गुणधर्म. उदाहरणार्थ, एक सामान्य ईमेल संदेशामध्ये विषय, मजकूर आणि प्राप्तकर्त्यांचा संच असतो आणि तो कोणाकडून किंवा कधी पाठवला गेला यावर आधारित आयोजित केला जाऊ शकतो. अर्ध-संरचित डेटा म्हणजे अशी वैशिष्ट्ये ज्यामुळे तो संरचित आणि असंरचित डेटा यांचा संगम आहे. तो सामान्यतः ओळी आणि स्तंभांच्या स्वरूपाला पूर्णपणे अनुसरित नाही पण एका रचनेत संघटित आहे आणि निश्चित स्वरूप किंवा नियमांचा संच असू शकतो. रचना स्त्रोतांनुसार वेगळी असू शकते, जसे विशिष्ट हायरेरकी ते अधिक लवचिक जे नवीन माहिती सोप्या प्रकारे एकत्रित करण्यास परवानगी देते. मेटाडेटा हे निर्देशांक असतात जे ठरवतात की डेटा कसा संघटित आणि संचयित आहे आणि त्याला विभिन्न प्रकारांनुसार नावे दिली जातात. मेटाडेटासाठी काही सामान्य नावे म्हणजे टॅग्स, घटक, एकक आणि गुणधर्म. उदाहरणार्थ, एक सर्वसाधारण ईमेल संदेशात विषय, मजकूर आणि प्राप्तकर्त्यांचा संच असतो आणि त्याला कोणी किंवा कधी पाठवले यावर आधारित संघटित केले जाऊ शकते.
अर्ध-संरचित डेटाची उदाहरणे: HTML, CSV फाइल्स, JavaScript Object Notation (JSON) अर्ध-संरचित डेटाची उदाहरणे: HTML, CSV फाईल्स, JavaScript ऑब्जेक्ट नोटेशन (JSON)
## डेटाचे स्रोत ## डेटाचे स्त्रोत
डेटा स्रोत म्हणजे डेटा जिथे तयार झाला किंवा "राहतो" आणि तो कसा आणि कधी गोळा केला गेला यावर आधारित बदलतो. वापरकर्त्यांनी तयार केलेला डेटा प्राथमिक डेटा म्हणून ओळखला जातो, तर माध्यमिक डेटा असा असतो, जो सामान्य वापरासाठी डेटा गोळा करणाऱ्या स्रोताकडून येतो. उदाहरणार्थ, वैज्ञानिकांचा एक गट जंगलात निरीक्षणे गोळा करत असेल तर तो प्राथमिक डेटा मानला जाईल आणि जर त्यांनी तो इतर वैज्ञानिकांसोबत शेअर करण्याचा निर्णय घेतला तर तो माध्यमिक डेटा मानला जाईल. डेटा स्रोत म्हणजे डेटा कुठे तयार झाला आहे किंवा "कुठे राहतो" याचा प्रारंभिक ठिकाण, जो गोळा कसा आणि केव्हा केला आहे त्यावर अवलंबून बदलतो. ज्याने डेटा तयार केला आहे तो प्राइमरी डेटा म्हणतात, तर सेकंडरी डेटा हा असा डेटा असतो जो सामान्य वापरासाठी संग्रहित केला जातो. उदाहरणार्थ, जर एखादा वैज्ञानिक समूह रेनफॉरेस्टमध्ये निरीक्षणे गोळा करत असेल तर तो प्राथमिक डेटा मानला जाईल आणि जर तो इतर वैज्ञानिकांसोबत शेअर करण्यात आला तर ज्यांना वापरण्यासाठी मिळालेला आहे त्यांच्या दृष्टीने तो द्वितीयक डेटा ठरेल.
डेटाबेस हे सामान्य स्रोत आहेत आणि डेटाबेस व्यवस्थापन प्रणालीवर अवलंबून असतात, जेथे वापरकर्ते डेटा एक्सप्लोर करण्यासाठी क्वेरी नावाच्या कमांड्स वापरतात. फाइल्स डेटा स्रोत म्हणून ऑडिओ, इमेज आणि व्हिडिओ फाइल्स तसेच Excel सारख्या स्प्रेडशीट्स असू शकतात. इंटरनेट स्रोत हे डेटा होस्ट करण्यासाठी सामान्य स्थान आहेत, जिथे डेटाबेस तसेच फाइल्स सापडू शकतात. अॅप्लिकेशन प्रोग्रामिंग इंटरफेस, ज्याला APIs म्हणतात, प्रोग्रामर्सना इंटरनेटद्वारे बाह्य वापरकर्त्यांसोबत डेटा शेअर करण्याचे मार्ग तयार करण्याची परवानगी देतात, तर वेब स्क्रॅपिंग प्रक्रियेद्वारे वेब पृष्ठावरून डेटा काढला जातो. [डेटासोबत काम करण्याचे धडे](../../../../../../../../../2-Working-With-Data) विविध डेटा स्रोत कसे वापरायचे यावर लक्ष केंद्रित करतात. डेटाबेस हा एक सामान्य स्रोत आहे आणि डेटा होस्ट व व्यवस्थापित करण्यासाठी डेटाबेस व्यवस्थापन प्रणालीवर अवलंबून असतो, जिथे वापरकर्ते क्वेरीज नावाच्या आदेशांचा वापर करून डेटाच्या शोध घेतात. डेटा स्रोत म्हणून फाईल्समध्ये ऑडिओ, प्रतिमा आणि व्हिडिओ फाईल्स तसेच Excel सारख्या स्प्रेडशीट्स असू शकतात. इंटरनेट हे देखील डेटा होस्ट करण्याचे सामान्य स्थान आहे, जिथे डेटाबेस तसेच फाईल्स आढळू शकतात. API (अ‍ॅप्लिकेशन प्रोग्रॅमिंग इंटरफेस) प्रोग्रॅमरना इंटरनेटवरून बाह्य वापरकर्त्यांसोबत डेटा शेअर करण्याचे मार्ग तयार करण्यास अनुमती देतात, तर वेब स्क्रॅपिंग प्रक्रियेमुळे वेब पृष्ठातून डेटा काढला जातो. [डेटासोबत काम करणे](../../../../../../../../../2-Working-With-Data) मधील धडे विविध डेटा स्रोतांचा वापर कसा करायचा यावर लक्ष केंद्रित करतात.
## निष्कर्ष ## निष्कर्ष
@ -51,26 +50,30 @@
- डेटा म्हणजे काय - डेटा म्हणजे काय
- डेटा कसा वर्णन केला जातो - डेटा कसा वर्णन केला जातो
- डेटा कसा वर्गीकृत आणि श्रेणीबद्ध केला जातो - डेटा कसा वर्गीकृत आणि श्रेणीबद्ध केला जातो
- डेटा कुठे सापडू शकतो - डेटा कुठे सापडतो
## 🚀 आव्हान ## 🚀 आव्हान
Kaggle हे ओपन डेटासेट्ससाठी उत्कृष्ट स्रोत आहे. [डेटासेट शोध साधन](https://www.kaggle.com/datasets) वापरून काही मनोरंजक डेटासेट्स शोधा आणि 3-5 डेटासेट्स खालील निकषांनुसार वर्गीकृत करा: Kaggle हा उघड्या डेटासेटचा उत्तम स्रोत आहे. [डेटासेट शोध उपकरणाचा](https://www.kaggle.com/datasets) वापर करून काही मनोरंजक डेटासेट शोधा आणि त्यापैकी 3-5 डेटासेट खालील निकषांनुसार वर्गीकृत करा:
- डेटा मोजमापात्मक आहे का गुणात्मक?
- डेटा संरचित, असंरचित, की अर्ध-संरचित आहे का?
## [व्याख्यानानंतरचा क्विझ](https://ff-quizzes.netlify.app/en/ds/quiz/5)
- डेटा परिमाणात्मक आहे की गुणात्मक?
- डेटा संरचित, असंरचित, की अर्ध-संरचित आहे?
## [व्याख्यानानंतरची प्रश्नमंजुषा](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## पुनरावलोकन आणि स्व-अभ्यास ## पुनरावलोकन आणि स्वअध्ययन
- Microsoft Learn युनिट, [तुमचा डेटा वर्गीकृत करा](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) मध्ये संरचित, अर्ध-संरचित आणि असंरचित डेटाचे तपशीलवार विश्लेषण आहे. - या Microsoft Learn युनिटमध्ये, ज्याचे शीर्षक [डेटा स्वरूपांची ओळख](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) आहे, संरचित, अर्ध-संरचित आणि असंरचित डेटा यांचे सविस्तर विश्लेषण आहे.
## असाइनमेंट ## असाइनमेंट
[डेटासेट्स वर्गीकृत करणे](assignment.md) [डेटासेट वर्गीकृत करणे](assignment.md)
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**: **अस्वीकरण**:
हा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) वापरून भाषांतरित करण्यात आला आहे. आम्ही अचूकतेसाठी प्रयत्नशील असलो तरी कृपया लक्षात ठेवा की स्वयंचलित भाषांतरे त्रुटी किंवा अचूकतेच्या अभावाने युक्त असू शकतात. मूळ भाषेतील दस्तऐवज हा अधिकृत स्रोत मानला जावा. महत्त्वाच्या माहितीसाठी व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराचा वापर करून उद्भवलेल्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थासाठी आम्ही जबाबदार राहणार नाही. हा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) चा वापर करून अनुवादित केला आहे. जरी आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेची कमतरता असू शकते. मूळ दस्तऐवज त्याच्या मूळ भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराच्या वापरामुळे उद्भवणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थलावणीसाठी आम्ही जबाबदार नाही.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {}, "metadata": {},
"source": [ "source": [
"# संभाव्यता आणि सांख्यिकीची ओळख\n", "# संभाव्यता आणि सांख्यिकीची ओळख\n",
"या नोटबुकमध्ये, आपण पूर्वी चर्चा केलेल्या काही संकल्पनांसह खेळणार आहोत. संभाव्यता आणि सांख्यिकीतील अनेक संकल्पना Python मधील `numpy` आणि `pandas` सारख्या प्रमुख डेटा प्रक्रियेसाठीच्या लायब्ररींमध्ये चांगल्या प्रकारे सादर केलेल्या असतात.\n" "या नोटबुकमध्ये, आपण पूर्वी चर्चिलेले काही संकल्पनांसह खेळणार आहोत. संभाव्यता आणि सांख्यिकीतील अनेक संकल्पना पायथनमधील डेटा प्रक्रिया करण्यासाठीच्या प्रमुख लायब्रऱ्यांमध्ये चांगल्या प्रकारे सादर केल्या आहेत, जसे की `numpy` आणि `pandas`.\n"
] ]
}, },
{ {
@ -24,8 +24,8 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## रँडम व्हेरिएबल्स आणि वितरण\n", "## यादृच्छिक चल व वितरण\n",
"चला 0 ते 9 या युनिफॉर्म वितरणातून 30 किंमतींचा नमुना काढण्यापासून सुरुवात करूया. आपण सरासरी आणि वैचित्र्य देखील गणना करू.\n" "चल 0 ते 9 पर्यंतच्या समान वितरणातून 30 मूल्यांचे एक नमुना काढूया. आपण सरासरी आणि विसरण देखील गणना करू.\n"
] ]
}, },
{ {
@ -44,7 +44,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"नमुन्यात किती वेगवेगळ्या मूल्ये आहेत हे दृष्टीकोनातून अंदाजवण्यासाठी, आपण **हिस्टोग्राम** चित्रित करू शकतो:\n" "नमुन्यात किती वेगवेगळ्या मूल्ये आहेत हे दृष्टीक्षेपाने अंदाज करण्यासाठी, आपण **हिस्टोग्राम** तयार करू शकतो:\n"
] ]
}, },
{ {
@ -61,9 +61,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## प्रत्यक्ष डेटाचे विश्लेषण\n", "## वास्तविक डेटा विश्लेषण करणे\n",
"\n", "\n",
"प्रत्यक्ष जगातील डेटाचे विश्लेषण करताना सरासरी आणि विचलन खूप महत्त्वाचे असतात. चला [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) येथून बेसबॉल खेळाडूंची माहिती लोड करूयात.\n" "वास्तविक जगातील डेटा विश्लेषित करताना सरासरी आणि विचलन अतिशय महत्त्वाचे असतात. चला [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) मधील बेसबॉल खेळाडूंच्या डेटाला लोड करूया\n"
] ]
}, },
{ {
@ -80,9 +80,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> आम्ही येथे डेटा विश्लेषणासाठी [**Pandas**](https://pandas.pydata.org/) नावाच्या पॅकेजचा वापर करीत आहोत. या कोर्समध्ये आम्ही नंतर Pandas आणि Python मधील डेटासह काम करण्याबद्दल अधिक बोलणार आहोत.\n", "> आम्ही येथे डेटा विश्लेषणासाठी [**Pandas**](https://pandas.pydata.org/) नावाचे पॅकेज वापरत आहोत. Pandas आणि Python मध्ये डेटाबरोबर काम करण्याबद्दल पुढील कोर्समध्ये अधिक चर्चा करू.\n",
"\n", "\n",
"चला वय, उंची आणि वजनासाठी सरासरी मूल्ये काढू या:\n" "आपण वय, उंची आणि वजन यांचे सरासरी मूल्ये काढूया:\n"
] ]
}, },
{ {
@ -98,7 +98,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आता आपण उंचीवर लक्ष केंद्रित करूया, आणि प्रमाणात्मक विचलन आणि विचलन मोजूया:\n" "आता आपण उंचीवर लक्ष केंद्रित करूया, आणि मानक विचलन आणि विचरणाची गणना करूया: \n"
] ]
}, },
{ {
@ -126,7 +126,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"सरासरी व्यतिरिक्त, माध्य आणि चौथ्या भागांचे मूल्य पाहणे समंजस ठरते. त्यांची दृष्यात्मक सादरीकरण **बॉक्स प्लॉट** द्वारे करता येते:\n" "सरासरीव्यतिरिक्त, माध्यमिका मूल्य आणि क्वार्टाईल्सकडे पाहणे अर्थपूर्ण आहे. त्यांचा **बॉक्स प्लॉट** वापरून दृश्यात्मकरित्या आढावा घेता येतो:\n"
] ]
}, },
{ {
@ -136,7 +136,7 @@
"outputs": [], "outputs": [],
"source": [ "source": [
"plt.figure(figsize=(10,2))\n", "plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n", "plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n", "plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n", "plt.tight_layout()\n",
"plt.show()" "plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आपण आमच्या डेटासेटच्या उपसमुहांचे बॉक्स प्लॉट्स देखील तयार करू शकतो, उदाहरणार्थ, खेळाडूच्या भूमिकेनुसार गटबद्ध केलेले.\n" "आपण आमच्या डेटासेटच्या उपसमुहांचे बॉक्स प्लॉट देखील तयार करू शकतो, उदाहरणार्थ, खेळाडूची भूमिका यानुसार गटबद्ध केलेले. \n"
] ]
}, },
{ {
@ -165,9 +165,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> **टीप**: हा आकृती सूचित करतो की, सरासरी दृष्टीने, पहिल्या बेसमनची उंची दुसऱ्या बेसमनच्या उंचीपेक्षा जास्त असते. नंतर आपण शिकलो की आपण या निष्कर्षाची अधिक औपचारिकदृष्ट्या तपासणी कशी करू शकतो आणि आपले डेटा सांख्यिकदृष्ट्या महत्त्वाचे असल्यास ते कसे दाखवता येते. \n", "> **टीप**: या आकृतीत असे सूचित केले आहे की, सरासरीत पहिल्या बेसमनची उंची दुसऱ्या बेसमनच्या उंचीपेक्षा जास्त असते. नंतर आपण कसे अधिक औपचारिकरित्या या संकल्पनेची चाचणी करू शकतो, आणि कसे आपले डेटा सांख्यिकीयदृष्ट्या महत्त्वपूर्ण आहे हे दाखवू शकतो हे शिकू. \n",
"\n", "\n",
"वय, उंची आणि वजन हे सर्व सलग (continuous) यादृच्छिक चल (random variables) आहेत. आपल्याला काय वाटते त्यांचे वितरण कसे असेल? माहितीसाठी एक चांगला मार्ग म्हणजे मूल्यांचा हिस्टोग्राम काढणे: \n" "वय, उंची आणि वजन ही सर्व सतत बदलणाऱ्या यादृच्छिक चल आहेत. तुम्हाला काय वाटते त्यांचे वितरण कसे आहे? मूल्यांचे हिस्टोग्राम काढणे हा त्याचा शोध घेण्याचा एक चांगला मार्ग आहे: \n"
] ]
}, },
{ {
@ -190,7 +190,7 @@
"source": [ "source": [
"## सामान्य वितरण\n", "## सामान्य वितरण\n",
"\n", "\n",
"चला आपला खरा डेटा सारखा समान सरासरी आणि विचलन असलेले सामान्य वितरण पाळणारे वजनाचे एक कृत्रिम नमुना तयार करूया:\n" "चला अशी वजनांची एक कृत्रिम उदाहरण तयार करूया जी सामान्य वितरणाचा अनुसरण करते ज्याचा मध्यम आणि विसरण वास्तविक डेटासारखा आहे:\n"
] ]
}, },
{ {
@ -231,7 +231,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"जास्तीत जास्त खरे जीवनातील मूल्ये सामान्य वितरणानुसार असतात, म्हणून नमुना डेटा तयार करण्यासाठी आम्ही एकसमान यादृच्छिक संख्या जनक वापरू नये. जर आम्ही एकसमान वितरणाने वजन तयार करण्याचा प्रयत्न केला (जे `np.random.rand` ने तयार केले जाते), तर काय होते ते येथे आहे:\n" "जीवनातील बहुतेक मूल्ये सहसा सामान्य वितरणात असतात, त्यामुळे आपल्याला सॅंपल डेटा निर्माण करण्यासाठी एकसमान यादृच्छिक संख्या जनक वापरू नये. जर आपण एकसमान वितरणाने वजन तयार करण्याचा प्रयत्न केला (जो `np.random.rand` द्वारा तयार केला जातो) तर काय होते ते येथे आहे:\n"
] ]
}, },
{ {
@ -253,7 +253,7 @@
"source": [ "source": [
"## आत्मविश्वास अंतराल\n", "## आत्मविश्वास अंतराल\n",
"\n", "\n",
"आता आपण बेसबॉल खेळाडूंच्या वजन आणि उंचीसाठी आत्मविश्वास अंतरालांची गणना करूया. आपण हा कोड [या stackoverflow चर्चेतून](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) वापरणार आहोत:\n" "चला आता बेसबॉल खेळाडूंच्या वजन आणि उंचीसाठी आत्मविश्वास अंतराल काढूया. आपण या कोडचा वापर करू [या stackoverflow चर्चेतून](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
] ]
}, },
{ {
@ -272,7 +272,7 @@
" return m, h\n", " return m, h\n",
"\n", "\n",
"for p in [0.85, 0.9, 0.95]:\n", "for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n", " m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")" " print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
] ]
}, },
@ -280,9 +280,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## परीक्षण अनुमान\n", "## संकल्पना चाचणी\n",
"\n", "\n",
"चला आपल्या बेसबॉल खेळाडू डेटासेटमधील विविध भूमिका तपासू या:\n" "चला आपल्या बेसबॉल खेळाडू डेटासेटमधील वेगवेगळ्या भूमिकांची पाहणी करूया:\n"
] ]
}, },
{ {
@ -298,7 +298,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"चला असा अनुमान तपासूया की फर्स्ट बेसमन दुसऱ्या बेसमनच्या तुलनेत उंच असतात. हे तपासण्याचा सर्वात सोपा मार्ग म्हणजे आत्मविश्वास अंतरांचे परीक्षण करणे:\n" "चला हायपोथेसिसची चाचणी करूया की फर्स्ट बेसमन सेकंड बेसमनपेक्षा उंच असतात. हे करण्याचा सर्वात सोपा मार्ग म्हणजे कॉन्फिडन्स इंटरव्हलांची चाचणी घेणे:\n"
] ]
}, },
{ {
@ -317,9 +317,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आपण पाहू शकतो की अवधी एकमेकांवर आच्छादित नाहीत.\n", "आपण पाहू शकतो की अंतराळ एकमेकांवर ओव्हरलॅप होत नाहीत.\n",
"\n", "\n",
"गृहितक सिद्ध करण्याचा सांख्यिकदृष्ट्या अधिक योग्य मार्ग म्हणजे **स्टुडंट t-टेस्ट** वापरणे:\n" "गृहितक सिद्ध करण्याचा आकड्यांवर आधारित अधिक योग्य मार्ग म्हणजे **स्टुडंट t-टेस्ट** वापरणे:\n"
] ]
}, },
{ {
@ -338,9 +338,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"`ttest_ind` फंक्शनने परत केलेल दोन मूल्ये आहेत:\n", "`ttest_ind` फंक्शनने परत केलेल दोन मूल्ये आहेत:\n",
"* p-मूल्य दोन वितरणांच्या समान सरासरी असण्याची शक्यता म्हणून विचारले जाऊ शकते. आपल्या प्रकरणात, हे खूप कमी आहे, ज्याचा अर्थ असा की प्रथम बेसमन उंच असल्याचे मजबूत पुरावे आहेत.\n", "* p-मूल्य हा दोन वितरणांच्या समान सरासरी होण्याची शक्यता समजली जाऊ शकते. आमच्या प्रकरणात, ते खूप कमी आहे, याचा अर्थ असा की पहिले बेसमन उंच असल्याचे मजबूत पुरावे आहेत.\n",
"* t-मूल्य म्हणजे सामान्यीकृत सरासरी फरकाचे मध्य मूल्य जे t-टेस्टमध्ये वापरले जाते, आणि ते दिलेल्या आत्मविश्वास मूल्यासाठी एक थ्रेशोल्ड मूल्याशी तुलना कली जाते.\n" "* t-मूल्य म्हणजे सामान्यीकृत सरासरी फरकाचे मध्यवर्ती मूल्य जे t-टेस्टमध्ये वापरले जाते, आणि ते दिलेल्या विश्वास मूल्यासाठी एक थ्रेशोल्ड मूल्याशी तुले जाते.\n"
] ]
}, },
{ {
@ -349,7 +349,7 @@
"source": [ "source": [
"## सेंट्रल लिमिट थिअरमसह सामान्य वितरणाचे अनुकरण करणे\n", "## सेंट्रल लिमिट थिअरमसह सामान्य वितरणाचे अनुकरण करणे\n",
"\n", "\n",
"Python मधील छद्म-यादी जनरेटर आपल्याला समान वितरण देण्यासाठी डिझाइन केलेले आहे. जर आपल्याला सामान्य वितरणासाठी एक जनरेटर तयार करायचा असेल, तर आपण सेंट्रल लिमिट थिअरम वापरू शकतो. सामान्य वितरण मूल्य मिळवण्यासाठी आपण फक्त समान-जनरेट केलेल्या नमुन्याचा सरासरी काढू.\n" "पायथनमधील छद्म-यादी जनक आम्हाला सारखे वितरण देण्यासाठी डिझाइन केला आहे. जर आपल्याला सामान्य वितरणासाठी जनक तयार करायचा असेल, तर आपण सेंट्रल लिमिट थिअरम वापरू शकतो. सामान्यपणे वितरित मूल्य मिळवण्यासाठी आपण फक्त सारखे-जनरेट केलेल्या नमुन्याचा सरासरी काढू. \n"
] ]
}, },
{ {
@ -373,9 +373,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## सहसंबंध आणि एविल बेसबॉल कॉर्पोरेशन\n", "## सहसंबंध आणि ईव्हिल बेसबॉल कॉर्प\n",
"\n", "\n",
"सहसंबंध आपल्याला डेटा अनुक्रमांमधील संबंध शोधण्यास अनुमती देतो. आपल्या खेळण्याच्या उदाहरणात, समजा एक एविल बेसबॉल कॉर्पोरेशन आहे जे आपल्या खेळाडूंना त्यांच्या उंचीप्रमाणे पैसे देते - खेळाडू जितका उंच आहे, त्याला तितका अधिक पैसा मिळतो. गृहित धरा की बेस वेतन $1000 आहे, आणि उंचीवर अवलंबून $0 ते $100 पर्यंत अतिरिक्त बोनस आहे. आपण MLB मधील वास्तविक खेळाडू घेणार आहोत, आणि त्यांची काल्पनिक पगार गणना करू:\n" "सहसंबंध आपल्याला डेटा अनुक्रमांमधील संबंध शोधण्याची परवानगी देतो. आपल्या टॉय उदाहरणात, समजा एक ईव्हिल बेसबॉल कॉर्पोरेशन आहे जी आपल्या खेळाडूंना त्यांच्या उंचीनुसार पैसे देते - खेळाडू जितका उंच आहे, त्याला तितके जास्त पैसे मिळतात. समजा बेस आकारधारक पगार $1000 आहे आणि उंचीनुसार $0 ते $100 पर्यंत अतिरिक्त बोनस आहे. आपण MLB मधील प्रत्यक्ष खेळाडूंना घेऊन त्यांचे काल्पनिक पगार मोजणार आहोत:\n"
] ]
}, },
{ {
@ -384,7 +384,7 @@
"metadata": {}, "metadata": {},
"outputs": [], "outputs": [],
"source": [ "source": [
"heights = df['Height'].fillna(method='pad')\n", "heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n", "salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])" "print(list(zip(heights, salaries))[:10])"
] ]
@ -393,7 +393,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आता आपण त्या अनुक्रमांच्या सहचर आणि सहसंबंधाची गणना करूया. `np.cov` आपल्याला असं म्हणतात ते **सहचर मॅट्रिक्स** देईल, जे सहचराचे एकाधिक चलांसाठीचे विस्तार आहे. सहचर मॅट्रिक्स $M$ चा घटक $M_{ij}$ हा इनपुट चल $X_i$ आणि $X_j$ मधील सहसंबंध आहे, आणि तिरक्या मूल्यांना $M_{ii}$ हा $X_{i}$ चा विचलन आहे. त्याचप्रमाणे, `np.corrcoef` आपल्याला **सहसंबंध मॅट्रिक्स** देईल.\n" "आता आपण त्या अनुक्रमांची सहव्युत्पन्नता आणि सहसंबंध काढूया. `np.cov` आपल्याला तथाकथित **सहव्युत्पन्नता मॅट्रिक्स** देईल, जी सहव्युत्पन्नता अनेक चलांवर विस्तारित केलेली आहे. सहव्युत्पन्नता मॅट्रिक्स $M$ चा घटक $M_{ij}$ हा इनपुट चल $X_i$ आणि $X_j$ यांचा सहसंबंध आहे, आणि त्यातील कर्णस्थ मूल्ये $M_{ii}$ ही $X_i$ चा वैरिएन्स आहे. अशाच प्रकारे, `np.corrcoef` आपल्याला **सहसंबंध मॅट्रिक्स** देतो.\n"
] ]
}, },
{ {
@ -411,7 +411,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"समाजशास्त्रीय सहसंबंध 1 इतका असल्यास, दोन चलांमधील एक मजबूत **रेखीय संबंध** आहे असे सांगते. आम्ही एक चल दुसऱ्या विरुद्ध plotting करून रेखीय संबंध दृष्यरित्या पाहू शकतो:\n" "सहसंबंध 1 इतका असल्यास दोन चलांमध्ये मजबूत **रेषीय संबंध** असतो. एक मूल्यास दुसऱ्याच्या विरोधात प्लॉट करून आपण रेषीय संबंध दृश्यमान करू शकतो:\n"
] ]
}, },
{ {
@ -430,7 +430,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"चलो पाहूया काय होते जर संबंध रेषीय नसेल. गृहित धरा की आमच्या कंपनीने उंची आणि पगारामधील स्पष्ट रेषीय अवलंबित्व लपवण्याचा निर्णय घेतला, आणि सूत्रात काही गैर-रेषीयता, जसे की `sin`, आणली:\n" "चला पाहूया काय होते जर नातं रेषीय नसल्यास. समजूया की आपल्या कंपनीने उंची आणि पगारामधील स्पष्ट रेषीय अवलंबित्व लपवण्याचा निर्णय घेतला आणि सूत्रात काही अरेखीयता, जसे की `sin`, समाविष्ट केली:\n"
] ]
}, },
{ {
@ -447,7 +447,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"या प्रकरणात, सहसंबंध थोडा कमी आहे, परंतु तो अजूनही खूप जास्त आहे. आता, संबंध आणखी कमी स्पष्ट करण्यासाठी, आपल्याला पगारात काही अतिरिक्त अकार्यक्षमता जोडायची असू शकते. चला पाहूया काय होते:\n" "या प्रकरणात, सहसंबंध थोडा कमी आहे, परंतु ते अजूनही खूप अधिक आहे. आता, संबंध आणखी कमी स्पष्ट करायचा असल्यास, आपण पगारात काही अयोग्य चल जोडून थोडी अधिक यादृच्छिकता घालू इच्छितो. चला पाहूया काय होते:\n"
] ]
}, },
{ {
@ -476,9 +476,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> तुम्हाला अंदाज देता येईल का का ही हट्ट्या अशा रेषांमध्ये सरळ उभ्या ओळींत लावल्या आहेत?\n", "> तुम्हाला का वाटते की बिंदू असे उभे ओळींमध्ये का बसतात?\n",
"\n", "\n",
"आपण वेतनासारख्या कृत्रिमरित्या बनवलेल्या संकल्पने आणि निरीक्षित चल *उंची* यामध्ये असलेला संबंध पाहिला आहे. चला आता दोन निरीक्षित चल, उंची आणि वजन यामध्येही असेच काही संबंध आहेत का ते पाहूयात:\n" "आम्ही वेतनासारख्या कृत्रिमपणे तयार केलेल्या संकल्पने आणि निरीक्षित चल *उंची* यामध्ये सहसंबंध दिसला आहे. चला हेही पाहूया की, उंची आणि वजन यांसारख्या दोन निरीक्षित चलांमध्ये देखील सहसंबंध आहे का:\n"
] ]
}, },
{ {
@ -494,11 +494,11 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"दुर्दैवाने, आम्हाला कोणतेही निकाल मिळाले नाहीत - फक्त काही विचित्र `nan` मूल्ये. हे या कारणास्तव आहे की आपल्या मालिका मधील काही मूल्ये अनिर्धारित आहेत, ज्यांना `nan` म्हणून प्रदर्शित केले गेले आहे, ज्यामुळे ऑपरेशनचे परिणाम देखील अनिर्धारित होतात. मॅट्रिक्सकडे पाहिल्यावर आपण पाहू शकतो की `Weight` हा समस्या निर्माण करणारा स्तंभ आहे, कारण `Height` मूल्यांमधील स्व-संबंध गणना केले गेले आहे.\n", "दुर्दैवाने, आपल्याला कोणतेही परिणाम मिळाले नाहीत - फक्त काही विचित्र `nan` मूल्ये. हे यासाठी आहे कारण आमच्या सिरीजमधील काही मूल्ये अपरिभाषित आहेत, ज्याला `nan` म्हणून दर्शविले जाते, ज्यामुळे ऑपरेशनचा परिणामही अपरिभाषित होतो. मॅट्रिक्सकडे पाहिल्याने आपण पाहू शकतो की `Weight` हा समस्या निर्माण करणारा कॉलम आहे, कारण `Height` मूल्यांमधील स्व-संबंध गणना केली गेली आहे.\n",
"\n", "\n",
"> हे उदाहरण **डेटा तयारी** आणि **स्वच्छतेचे** महत्त्व दाखवते. योग्य डेटा नसेल तर आपण काहीही गणना करू शकत नाही.\n", "> या उदाहरणातून **डेटा तयारी** आणि **सफाई** यांचे महत्त्व दिसते. योग्य डेटा नसल्यास आपण काहीही गणना करू शकत नाही.\n",
"\n", "\n",
"चला आपण गायब मूल्ये भरिण्यासाठी `fillna` पद्धत वापरू आणि संबंध गणना करू:\n" "चला गहाळ मूल्ये भरून काढण्यासाठी `fillna` पद्धत वापरूया, आणि संबंध (correlation) मोजूया:\n"
] ]
}, },
{ {
@ -507,14 +507,14 @@
"metadata": {}, "metadata": {},
"outputs": [], "outputs": [],
"source": [ "source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])" "np.corrcoef(df['Height'].ffill(), df['Weight'])"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"खरंच एक संबंध आहे, पण आमच्या कृत्रिम उदाहरणाप्रमाणे तका मजबूत नाही. खरंच, जर आपण एका मूल्याच्या विरुद्ध दुसऱ्या मूल्याचा स्कॅटर प्लॉट पाहिला तर संबंध फारशी स्पष्ट दिसणार नाही:\n" "खरंच एक संबंध आहे, पण आमच्या कृत्रिम उदाहरणाप्रमाणे तितका मजबूत नाही. खरंच, जर आपण एका मूल्याच्या विरुद्ध दुसऱ्या मूल्याचा स्कॅटर प्लॉट पाहिला, तर हा नातं खूप कमी स्पष्ट दिसेल:\n"
] ]
}, },
{ {
@ -537,14 +537,14 @@
"source": [ "source": [
"## निष्कर्ष\n", "## निष्कर्ष\n",
"\n", "\n",
"या नोटबुकमध्ये आपण डेटावर मूलभूत ऑपरेशन्स कसे करायचे ते शिकले आहे जेणेकरून सांख्यिकी फंक्शन्सची गणना करता येईल. आता आपल्याला गणित आणि सांख्यिकीचे एक ठोस साधन कसे वापरायचे हे माहिती आहे ज्यावरून काही अनुमान सिद्ध करता येतील, आणि दिलेल्या डेटा नमुन्यासाठी मनमानी चलांबाबत आत्मविश्वास अंतर कसे मोजायचे ते कळाले आहे.\n" "या नोटबुकमध्ये आपण डेटा वर मूलभूत क्रिया कशा करायच्या हे शिकलो जेणेकरून सांख्यिकी फंक्शन्सची गणना करता येईल. आता आपल्याला काही अनुमान सिद्ध करण्यासाठी गणित आणि सांख्यिकीचा एक मजबूत आधार कसा वापरायचा हे समजले आहे, आणि दिलेल्या डेटा नमुन्याच्या आधारे कोणत्याही चलांसाठी विश्वास.Interval कसे काढायचे हे देखील कळले आहे.\n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**तोडकं**:\nहा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) वापरून भाषांतरित केला आहे. आम्ही अचूकतेसाठी प्रयत्न करत असलो तरी, कृपया लक्षात ठेवा की स्वयंचलित भाषांतरात चुका किंवा अचूकतेच्या त्रुटी असू शकतात. मूळ दस्तऐवज त्याच्या मूळ भाषेतच अधिकारिक स्रोत मानावा. महत्त्वाच्या माहितीकरिता व्यावसायिक मानवी भाषांतर शिफारस केली जाते. या भाषांतराच्या वापरामुळे होणाऱ्या कोणत्याही गैरसमजुती किंवा चुकीच्या अर्थलाी आम्ही जबाबदार नाही.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n" "---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nहा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) चा वापर करून अनुवादित केला आहे. जरी आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेची कमतरता असू शकते. मूळ दस्तऐवज त्याच्या मूळ भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराच्या वापरामुळे उद्भवणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थलावणीसाठी आम्ही जबाबदार नाही.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
] ]
} }
], ],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python", "nbconvert_exporter": "python",
"pygments_lexer": "ipython3", "pygments_lexer": "ipython3",
"version": "3.9.6" "version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T11:52:55+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "mr"
} }
}, },
"nbformat": 4, "nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"# COVID-19 साथीच्या रोगाचा अंदाज\n", "# कोविड-19 महामारीचा अंदाज\n",
"\n", "\n",
"## डेटा लोड करणे\n", "## डेटा लोड करणे\n",
"\n", "\n",
"आपण COVID-19 बाधित व्यक्तींबद्दल डेटा वापरणार आहोत, जो [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ने [Johns Hopkins University](https://jhu.edu/) येथे प्रदान केला आहे. Dataset [या GitHub रिपॉझिटरी](https://github.com/CSSEGISandData/COVID-19) मध्ये उपलब्ध आहे.\n" "आपण [जॉन्स हॉपकिन्स युनिव्हर्सिटी](https://jhu.edu/)च्या [सिस्टम्स सायन्स आणि अभियांत्रिकी केंद्र](https://systems.jhu.edu/) (CSSE) कडून उपलब्ध केलेल्या कोविड-19 संसर्गित व्यक्तींबाबतचा डेटा वापरणार आहोत. Dataset [ह्या GitHub रेपॉझिटरी](https://github.com/CSSEGISandData/COVID-19) मध्ये उपलब्ध आहे.\n"
] ]
}, },
{ {
@ -27,7 +27,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आपण सर्वात अलीकडील डेटा थेट GitHub वरून `pd.read_csv` वापरून लोड करू शकतो. काही कारणाने डेटा उपलब्ध नसेल, तर तुम्ही नेहमी `data` फोल्डरमध्ये स्थानिकपणे उपलब्ध असलेली कॉपी वापरू शकता - फक्त खालील ओळ ज्यात `base_url` परिभाषित आहे, ती अनकमेंट करा:\n" "आपण `pd.read_csv` वापरून GitHub वरून थेट सर्वात अलीकडील डेटा लोड करू शकतो. काही कारणास्तव डेटा उपलब्ध नसेल तर, आपण नेहमी `data` फोल्डरमध्ये स्थानिक पातळीवर उपलब्ध असलेली कॉपी वापरू शकता - खालील ओळ अनकमेंट करा जी `base_url` परिभाषित करते:\n"
] ]
}, },
{ {
@ -48,7 +48,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"चला आता संक्रमित व्यक्तींचे डेटा लोड करूया आणि पाहूया की डेटा कसा दिसतो आहे:\n" "चला आता संसर्गग्रस्त व्यक्तींचे डेटा लोड करूया आणि पाहूया डेटा कसा दिसतो:\n"
] ]
}, },
{ {
@ -265,7 +265,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आपण पाहू शकतो की तक्त्याच्या प्रत्येक रांगेत प्रत्येक देश आणि/किंवा प्रांतातील संसर्गित व्यक्तींची संख्या निर्दिष्ट केली आहे, आणि स्तंभ तारीखांशी संबंधित आहेत. पुनर्प्राप्त झालेल्या आणि मृत्यूंच्या संख्येसारख्या इतर डेटासाठी देखील अशा तक्त्यांना लोड केले जाऊ शकते.\n" "आपण पाहू शकतो की टेबलमधील प्रत्येक रांग प्रत्येक देशासाठी आणि/किंवा प्रांतासाठी संसर्गित व्यक्तींची संख्या परिभाषित करते, आणि स्तंभ तारखा सूचित करतात. पुनर्प्राप्त व्यक्तींची संख्या आणि मृत्यूंची संख्या यांसारख्या इतर डेटासाठी देखील असेच तक्ते लोड केली जाऊ शकतात.\n"
] ]
}, },
{ {
@ -284,7 +284,7 @@
"source": [ "source": [
"## डेटाचा अर्थ लावणे\n", "## डेटाचा अर्थ लावणे\n",
"\n", "\n",
"वरील तक्त्यातील प्रांत कॉलमची भूमिका स्पष्ट नाही. चला पाहूया `Province/State` कॉलममध्ये कोणती वेगवेगळी मूल्ये आहेत:\n" "वर दिलेल्या तक्त्यात `Province/State` कॉलममधील विविध मूल्ये पाहू या कारण `Province/State` कॉलमची भूमिका अस्पष्ट आहे:\n"
] ]
}, },
{ {
@ -322,7 +322,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"नावांवरून आपण असा निष्कर्ष काढू शकतो की ऑस्ट्रेलिया आणि चीनसारख्या देशांमध्ये प्रांतांनिहाय अधिक तपशीलवार विभागणी आहे. उदाहरण पाहण्यासाठी आपण चीनबद्दलची माहिती पाहूया:\n" "नावे पाहून आपण कळू शकतो की ऑस्ट्रेलिया आणि चीनसारख्या देशांमध्ये प्रांतांनुसार अधिक तपशीलवार विभागणी आहे. उदाहरणासाठी चीनवरील माहिती पाहूया:\n"
] ]
}, },
{ {
@ -1321,9 +1321,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## डेटाचे पूर्व-प्रक्रियाकरण\n", "## डेटा पूर्वप्रक्रिया\n",
"\n", "\n",
"आम्हाला देशांना पुढील प्रदेशांमध्ये विभागण्यात स्वारस्य नाही, त्यामुळे आम्ही प्रथम या विभागणीपासून मुक्त होऊ आणि सर्व प्रदेशांवरील माहिती एकत्र करून एकूण देशासाठी माहिती मिळवू. हे `groupby` वापरून करता येऊ शकते:\n" "आम्हाला देशांना आणखी विभागांमध्ये विभागण्यात रस नाही, म्हणून प्रथम आपण हा विभाग काढून टाकू आणि सर्व विभागांची एकत्र माहिती मिळवू, ज्यामुळे संपूर्ण देशाबद्दल माहिती मिळेल. हे `groupby` वापरून करता येऊ शकते:\n"
] ]
}, },
{ {
@ -1578,7 +1578,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आपण पाहू शकता की `groupby` वापरल्यामुळे सर्व DataFrame आता Country/Region द्वारे अनुक्रमित आहेत. त्यामुळे आपण `.loc` वापरून विशिष्ट देशासाठी डेटा प्रवेश करू शकतो:|\n" "आपण पाहू शकता की `groupby` वापरल्यामुळे सर्व DataFrames आता Country/Region द्वारे अनुक्रमित आहेत. त्यामुळे आपण `.loc` वापरून विशिष्ट देशासाठी डेटा ऍक्सेस करू शकतो:|\n"
] ]
}, },
{ {
@ -1607,7 +1607,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> **लक्षात घ्या** की आपण `[3:]` कसे वापरतो जेणेकरून अनुक्रमिकेतील पहिले तीन घटक काढले जातात जे गैर-तारीख मेटाडेटा (प्रांत/राज्य आणि भौगोलिक स्थान स्तंभ) असतात. आपण ते तीन स्तंभ एकत्र काढू शकतो:\n" "> **नोंद** करा की आपण `[3:]` कसे वापरतो जेणेकरून एक अनुक्रम ज्यात पहिले तीन घटक जे नॉन-डेटा मेटाडेटा (प्रदेश/राज्य आणि स्थानिक भूगोल स्तंभ) असतात ते काढले जातात. आपण हे तीन स्तंभ पूर्णपणे काढू शकतो:\n"
] ]
}, },
{ {
@ -1625,9 +1625,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## डेटाचे तपासणी करणे\n", "## डेटा तपासणी करत आहे\n",
"\n", "\n",
"आता आपण एका विशिष्ट देशाचा तपासणी करूया. चला अशा फ्रेम तयार करूया ज्यात तारीखेनुसार अनुक्रमित संक्रमितांचे डेटा असतील:\n" "चला आता एखाद्या विशिष्ट देशाची तपासणी करूया. चला एक फ्रेम तयार करूया ज्यामध्ये आजच्या तारखेने अनुक्रमित केलेल्या संसर्गांचा डेटा असेल:\n"
] ]
}, },
{ {
@ -1793,7 +1793,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आता आपण प्रत्येक दिवस नवीन संक्रमित व्यक्तींची संख्या मोजूया. यामुळे आपल्याला साथी रोग किती वेगाने पसरतोय हे पाहता येईल. हे करण्यासाठी सर्वात सोपा मार्ग म्हणजे `diff` वापरणे:\n" "आता आपण दररोज संक्रमित झालेल्या नवीन लोकांची संख्या मोजूया. यामुळे आपल्याला महामारी किती वेगाने पसरत आहे हे दिसून येईल. हे करण्याचा सर्वात सोपा मार्ग म्हणजे `diff` वापरणे:\n"
] ]
}, },
{ {
@ -1823,7 +1823,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"आपल्याला डेटामध्ये उच्च चढ-उतार दिसू शकतात. चला एका महिन्यावर अधिक सविस्तर पाहूया:\n" "आपण डेटामध्ये मोठ्या आणि वारंवार बदलांची पाहणी करू शकतो. चला एका महिन्याजवळून पाहूया:\n"
] ]
}, },
{ {
@ -1852,7 +1852,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"डेटामध्ये आठवड्याचे चढउतार स्पष्टपणे दिसत आहेत. कारण आपल्याला ट्रेंड्स पाहण्यास सक्षम व्हायचे आहे, म्हणून कर्व्हला गुळगुळीत करण्यासाठी रनिंग सरासरी (running average) काढणे योग्य आहे (म्हणजे प्रत्येक दिवसासाठी आपण मागील काही दिवसांची सरासरी काढू):\n" "डेटा मध्ये साप्ताहिक चढउतार स्पष्टपणे दिसत आहेत. कारण आम्हाला ट्रेंड पाहायचे आहेत, त्यामुळे वक्र मऊ करण्यासाठी चालू सरासरी (म्हणजे प्रत्येक दिवसासाठी आपण मागील काही दिवसांची सरासरी काढू) काढणे योग्य आहे:\n"
] ]
}, },
{ {
@ -1882,7 +1882,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"अनेक देशांची तुलना करण्यासाठी, आपल्याला देशाच्या लोकसंख्येचा विचार करणे आवश्यक असू शकते, आणि देशाच्या लोकसंख्येच्या संदर्भात संसर्गित व्यक्तींचे प्रमाण तुलना करायचे आहे. देशाची लोकसंख्या मिळविण्यासाठी, चला देशांच्या डेटासेटला लोड करूया:\n" "अनेक देशांची तुलना करण्यासाठी, आपण देशाची लोकसंख्या लक्षात घेऊ इच्छितो, आणि देशाच्या लोकसंख्येच्या संदर्भात संसर्गित व्यक्तींच्या टक्केवारीची तुलना करू इच्छितो. देशाची लोकसंख्या मिळवण्यासाठी, चला देशांच्या डेटासेटला लोड करूया:\n"
] ]
}, },
{ {
@ -2153,7 +2153,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"कारण या डेटासेटमध्ये दोन्ही देश आणि प्रांतांची माहिती आहे, त्यामुळे संपूर्ण देशाची लोकसंख्या मिळविण्यासाठी आपल्याला थोडेच हुशार व्हावे लागेल:\n" "कारण हा डेटासेट देश आणि प्रांत या दोघांबद्दल माहिती ठेवतो, पूर्ण देशाची लोकसंख्या मिळवण्यासाठी आपल्याला थोडंसं हुशार होण्याची गरज आहे: \n"
] ]
}, },
{ {
@ -2261,14 +2261,15 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## गणना करणे $R_t$\n",
"\n", "\n",
"रोग किती संसर्गजनक आहे हे पाहण्यासाठी, आपण **मूल प्रजनन संख्या** $R_0$ कडे पाहतो, ज्याने सूचित केले की एका संक्रमित व्यक्तीने पुढे किती लोकांना संक्रमित केले असेल. जेव्हा $R_0$ 1 पेक्षा जास्त असतो, तेव्हा महामारी पसरण्याची शक्यता असते.\n", "## $R_t$ ची गणना करणे\n",
"\n", "\n",
"$R_0$ हा रोगाचा स्वतःचा गुणधर्म आहे, आणि काही संरक्षणात्मक उपायांचा विचार करत नाही जे लोक महामारी मंदावण्यासाठी घेऊ शकतात. महामारीच्या प्रगती दरम्यान, आपण कोणत्याही दिलेल्या वेळेला $t$ या प्रजनन संख्या $R_t$ अनुमानित करू शकतो. असे दिसून आले आहे की या संख्येचा अंदाज साधारणपणे 8 दिवसांच्या विंडो घेऊन, खालील प्रमाणे काढला जाऊ शकतो: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n", "रोग किती संसर्गजनक आहे हे पाहण्यासाठी, आपण **मूल पुनरुत्पादन संख्या** $R_0$ कडे पाहतो, जी संक्रमित व्यक्ती पुढे किती लोकांना संक्रमित करेल हे दर्शवते. जेव्हा $R_0$ 1 पेक्षा जास्त असते, तेव्हा साथीचा प्रसार होण्याची शक्यता असते.\n",
"जिथे $I_t$ हा दिवशी $t$ नव्याने संक्रमित झालेल्या व्यक्तींचा संख्या आहे.\n",
"\n", "\n",
"आता आपल्या महामारी डेटासाठी $R_t$ ची गणना करूया. यासाठी, आपण 8 `ninfected` मूल्यांचा रोलिंग विंडो घेऊ आणि वरील प्रमाण काढण्यासाठी फंक्शन लागू करू:\n" "$R_0$ हा रोगाचा स्वतःचा गुणधर्म आहे, आणि लोक कोरोनाचा प्रसार कमी करण्यासाठी घेऊ शकतात अशा काही प्रतिबंधक उपायांचा विचार घेत नाही. साथीच्या पुढे जाण्याच्या वेळी, आपण कोणत्याही दिलेल्या वेळेस $t$ वर पुनरुत्पादन संख्या $R_t$ चे अनुमान लावू शकतो. हे दर्शविले गेले आहे की हा संख्या अंदाजे 8 दिवसांच्या विंडो घेऊन अंदाज लावता येतो, आणि गणना केली जाते $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"जिथे $I_t$ हा दिवस $t$ वर नवीन संक्रमित व्यक्तींची संख्या आहे.\n",
"\n",
"चला आपला साथीचा डेटा वापरून $R_t$ ची गणना करूया. यासाठी, आपण 8 `ninfected` मूल्यांची रॉलिंग विंडो घेऊ, आणि वरील प्रमाण गणना करण्यासाठी फंक्शन लागू करू:\n"
] ]
}, },
{ {
@ -2298,9 +2299,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"तुम्हाला दिसेल की ग्राफमध्ये काही गॅप्स आहेत. ते `NaN` मुळे होऊ शकतात, किंवा डेटासेटमध्ये `inf` मूल्ये असल्यास होऊ शकतात. `inf` चे कारण 0 ने भागाकार होणे असू शकते, आणि `NaN` कमतर डेटा दर्शवू शकतो, किंवा निकाल काढण्यासाठी उपलब्ध डेटा नसणे दर्शवू शकतो (जसे की आपल्या फ्रेमच्या सुरुवातीस, जिथे रुंदी 8 चा रोलिंग विंडो अजून उपलब्ध नाही). ग्राफ अधिक छान दिसण्यासाठी, आपल्याला `replace` आणि `fillna` फंक्शन वापरून त्या मूल्यांना भरणे गरजेचे आहे.\n", "तुम्हाला दिसेल की ग्राफमध्ये काही रिकाम्या जागा आहेत. त्या `NaN` मुळे होऊ शकतात, किंवा डेटासेटमध्ये `inf` मूल्ये उपस्थित असल्यास होऊ शकतात. `inf` शून्याने भागाकार केल्यामुळे होऊ शकतो, आणि `NaN` गहाळ डेटा सूचित करू शकतो, किंवा निकाल काढण्यासाठी कोणताही डेटा उपलब्ध नसल्याचे दर्शवू शकतो (आपल्या फ्रेमच्या सुरुवातीस, जिथे 8 च्या रुंदीचा रोलिंग विंडो अद्याप उपलब्ध नाही). ग्राफ अधिक चांगला बनवण्यासाठी, आपल्याला `replace` आणि `fillna` फंक्शन वापरून त्या मूल्यांना भरून काढावे लागेल.\n",
"\n", "\n",
"आता आपण साथीच्या रोगाच्या सुरुवातीकडे अधिक लक्ष देऊया. आपण y-अक्षाची मूल्ये 6 पेक्षा खालील मूल्यांपुरतीच मर्यादित करू ज्यामुळे ते अधिक चांगले दिसतील, आणि 1 या स्थरावर आडवी रेषा काढू.\n" "आपण महामारीच्या सुरुवातीकडे आणखी पाहूया. आपण y-अक्षाची मूल्ये 6 पेक्षा खालील मूल्यांपुरती मर्यादित करू, ज्यामुळे चांगल्या रीतीने पाहता येईल, आणि 1 या ठिकाणी एक आडवी रेषा काढू.\n"
] ]
}, },
{ {
@ -2331,7 +2332,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"महामारीचा आणखी एक मनोरंजक निर्देशांक म्हणजे **डेरिव्हेटिव्ह**, किंवा नवीन प्रकरणांमधला **दैनिक फरक**. यामुळे आम्हाला स्पष्टपणे पाहता येते की महामारी कधी वाढत आहे किंवा कमी होत आहे.\n" "साथीच्या आजाराचा आणखी एक मनोरंजक निर्देशक म्हणजे **डेरिव्हेटिव्ह**, किंवा नवीन प्रकरणांमधील **दैनंदिन फरक**. हे आम्हाला स्पष्टपणे पाहण्यास अनुमती देते की साथीचा आजार कधी वाढत आहे किंवा कमी होत आहे.\n"
] ]
}, },
{ {
@ -2360,7 +2361,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"अहवालाद्वारे झालेल्या डेटा मध्ये भरपूर चढउतार असल्यामुळे, एकूण चित्र समजण्यासाठी रोलिंग सरासरी वापरून वक्र सुलभ करणे योग्य ठरते. चला पुन्हा महामारीच्या पहिल्या महिन्यांकडे लक्ष केंद्रित करूया:\n" "अहवालाद्वारे होणाऱ्या अनेक वक्रतांनी डेटा खूपच बदलतो, यामुळे एकूण चित्र मिळवण्यासाठी रोलिंग सरासरी चालवून वक्रसुमारे करणे योग्य आहे. परकीय घटनेच्या प्रारंभातील काही महिन्यांवर पुन्हा लक्ष केंद्रित करूया:\n"
] ]
}, },
{ {
@ -2390,26 +2391,27 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"\n",
"## आव्हान\n", "## आव्हान\n",
"\n", "\n",
"आता कोड आणि डेटासह अधिक खेळण्याची वेळ आली आहे! येथे काही सूचना आहेत ज्यावर तुम्ही प्रयोग करू शकता:\n", "आता कोड आणि डेटा यांच्यासह तुम्ही अधिक खेळायला वेळ आला आहे! येथे काही सूचना आहेत ज्यावर तुम्ही प्रयोग करू शकता:\n",
"* वेगवेगळ्या देशांमध्ये महामारीचा प्रसार पाहा.\n", "* विविध देशांमध्ये महामारी कशी पसरली आहे ते पहा.\n",
"* तुलना करण्यासाठी एका आकृतीवर अनेक देशांसाठी $R_t$ ग्राफ काढा, किंवा बाजूने काही आकृती तयार करा.\n", "* तुलना करण्यासाठी एका प्लॉटवर अनेक देशांसाठी $R_t$ ग्राफ काढा, किंवा बाजूला बाजूने अनेक प्लॉट तयार करा.\n",
"* मृत्यू आणि बरे होण्याच्या संख्येमुळे संक्रमित प्रकरणांची संख्या कशी संबंधित आहे ते पाहा.\n", "* मृत्यु आणि बरे होण्यांच्या संख्यांमध्ये संक्रमीत प्रकरणांच्या संख्येशी कशी सुसंगती आहे ते पहा.\n",
"* संक्रमण दर आणि मृत्यू दर यांचा दृकश्राव्य संबंध करून आणि काही विचित्र बाबी शोधून सामान्यतः रोग किती काळ टिकतो हे शोधण्याचा प्रयत्न करा. ते शोधण्यासाठी तुम्हाला वेगवेगळ्या देशांकडे पाहणे आवश्यक असू शकते.\n", "* संक्रमण दर आणि मृत्यू दर यांचे दृष्टीकोनातून सुसंगती करून आणि काही विचित्र गोष्टी शोधून सरासरी आजार किती काळ टिकतो हे शोधण्याचा प्रयत्न करा. ते जाणून घेण्यासाठी तुम्हाला वेगवेगळ्या देशांकडे पाहावे लागू शकते.\n",
"* मृत्यू दराची गणना करा आणि त्यात वेळेनुसार कसा बदल होतो ते पाहा. गणना करण्यापूर्वी रोगाचा कालावधी दिवसांत लक्षात घेतल्याने वेळ मालिका एका बाजूने सरकवावी लागू शकते.\n" "* मृत्यूदर मोजा आणि तो कालांतराने कसा बदलतो ते पहा. तुम्हाला रोगाचा दिवसांमध्ये कालावधी लक्षात घेऊन एका टाईम सिरीजला हलवावे लागू शकते त्यानंतर गणना करा.\n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## References\n", "## संदर्भ\n",
"\n", "\n",
"आपण पुढील प्रकाशनांमध्ये COVID महामारीच्या प्रसाराच्या पुढील अभ्यासाकडे पाहू शकता:\n", "आपण खालील प्रकाशनांमध्ये COVID साथीच्या रोगाचा प्रसार याबाबत अधिक अभ्यास पाहू शकता:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com) यांचा ब्लॉग पोस्ट\n", "* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ब्लॉग पोस्ट by [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n", "* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [वरील पेपरसाठी GitHub वर कोड](https://github.com/shwars/SlidingSIR)\n" "* [Code for the above paper on GitHub](https://github.com/shwars/SlidingSIR)\n"
] ]
}, },
{ {
@ -2423,7 +2425,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nहा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) वापरून भाषांतरित केला आहे. आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये चुका किंवा असत्यता असू शकतात. मूळ दस्तऐवज त्याच्या स्थानिक भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास व्यावसायिक मानवी भाषांतर शिफारसीय आहे. या भाषांतराच्या वापरामुळे उद्भवलेल्या कोणत्याही गैरसमजुती किंवा चुकीच्या अर्थ लावणीबद्दल आम्ही जबाबदार नाही.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n" "---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nहा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) चा वापर करून अनुवादित केला आहे. जरी आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेची कमतरता असू शकते. मूळ दस्तऐवज त्याच्या मूळ भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराच्या वापरामुळे उद्भवणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थलावणीसाठी आम्ही जबाबदार नाही.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
] ]
} }
], ],

@ -1,31 +1,33 @@
# डेंजरस लिझॉन्स डेटा व्हिज्युअलायझेशन प्रोजेक्ट # Dangerous Liaisons डेटा व्हिज्युअलायझेशन प्रकल्प
सुरुवात करण्यासाठी, तुमच्या मशीनवर NPM आणि Node चालू असल्याची खात्री करा. dependencies (npm install) इंस्टॉल करा आणि प्रोजेक्ट स्थानिक पातळीवर चालवा (npm run serve): सुरू करण्यासाठी, आपल्याकडे NPM आणि Node **>=20.0.0** आपल्या मशीनवर चालू असल्याची खात्री करा. अवलंबित्वे स्थापित करा (npm install) आणि नंतर प्रकल्प स्थानिकपणे चालवा (npm run serve):
## प्रोजेक्ट सेटअप ## प्रकल्प सेटअप
``` ```
npm install npm install
``` ```
### विकासासाठी संकलन आणि हॉट-रिलोड्स ### विकासासाठी संकलित करा आणि हॉट-रीलोड करा
``` ```
npm run serve npm run serve
``` ```
### उत्पादनासाठी संकलन आणि मिनिफिकेशन ### उत्पादनासाठी संकलित करा आणि मिनिफाय करा
``` ```
npm run build npm run build
``` ```
### फायली लिंट आणि दुरुस्त करा ### फायली तपासा आणि दुरुस्त्या करा
``` ```
npm run lint npm run lint
``` ```
### कॉन्फिगरेशन सानुकूलित करा ### कॉन्फिगरेशन सानुकूलित करा
[Configuration Reference](https://cli.vuejs.org/config/) पहा. पहा [Configuration Reference](https://cli.vuejs.org/config/).
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**: **अस्वीकरण**:
हा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) वापरून भाषांतरित करण्यात आला आहे. आम्ही अचूकतेसाठी प्रयत्नशील असलो तरी कृपया लक्षात ठेवा की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेचा अभाव असू शकतो. मूळ भाषेतील दस्तऐवज हा अधिकृत स्रोत मानला जावा. महत्त्वाच्या माहितीसाठी व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराचा वापर करून उद्भवलेल्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थासाठी आम्ही जबाबदार राहणार नाही. हा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) चा वापर करून अनुवादित केला आहे. जरी आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेची कमतरता असू शकते. मूळ दस्तऐवज त्याच्या मूळ भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराच्या वापरामुळे उद्भवणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थलावणीसाठी आम्ही जबाबदार नाही.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# Dangerous Liaisons डेटा व्हिज्युअलायझेशन प्रकल्प # Dangerous Liaisons डेटा व्हिज्युअलायझेशन प्रकल्प
सुरुवात करण्यासाठी, तुमच्या मशीनवर NPM आणि Node चालू आहेत याची खात्री करा. अवलंबित्वे स्थापित करा (npm install) आणि नंतर प्रकल्प स्थानिक पातळीवर चालवा (npm run serve): सुरुवात करण्यासाठी, आपल्याकडे NPM आणि Node **>=20.0.0** आपल्या मशीनवर चालू आहे याची खात्री करा. अवलंबित्वे स्थापित करा (npm install) आणि नंतर प्रकल्प स्थानिकपणे चालवा (npm run serve):
## प्रकल्प सेटअप ## प्रकल्पाची स्थापना
``` ```
npm install npm install
``` ```
### विकासासाठी संकलित आणि हॉट-रिलोड्स ### विकासासाठी संकलित करा आणि हॉट-रिलोड करा
``` ```
npm run serve npm run serve
``` ```
### उत्पादनासाठी संकलित आणि मिनिफाय करते ### उत्पादनासाठी संकलित करा आणि संक्षिप्त करा
``` ```
npm run build npm run build
``` ```
### फायली तपासते आणि दुरुस्त करते ### फाइल्स तपासा आणि दुरुस्त करा
``` ```
npm run lint npm run lint
``` ```
### कॉन्फिगरेशन सानुकूलित करा ### संरचना सानुकूल करा
[Configuration Reference](https://cli.vuejs.org/config/) पहा. पहा [Configuration Reference](https://cli.vuejs.org/config/).
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**: **अस्वीकरण**:
हा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) वापरून भाषांतरित करण्यात आला आहे. आम्ही अचूकतेसाठी प्रयत्नशील असलो तरी कृपया लक्षात ठेवा की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेचा अभाव असू शकतो. मूळ भाषेतील दस्तऐवज हा अधिकृत स्रोत मानला जावा. महत्त्वाच्या माहितीसाठी व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराचा वापर करून निर्माण होणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थासाठी आम्ही जबाबदार राहणार नाही. हा दस्तऐवज AI भाषांतर सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) चा वापर करून अनुवादित केला आहे. जरी आम्ही अचूकतेसाठी प्रयत्न करतो, तरी कृपया लक्षात घ्या की स्वयंचलित भाषांतरांमध्ये त्रुटी किंवा अचूकतेची कमतरता असू शकते. मूळ दस्तऐवज त्याच्या मूळ भाषेत अधिकृत स्रोत मानला पाहिजे. महत्त्वाची माहिती असल्यास, व्यावसायिक मानवी भाषांतराची शिफारस केली जाते. या भाषांतराच्या वापरामुळे उद्भवणाऱ्या कोणत्याही गैरसमज किंवा चुकीच्या अर्थलावणीसाठी आम्ही जबाबदार नाही.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "ne" "language_code": "ne"
}, },
"1-Introduction/01-defining-data-science/notebook.ipynb": { "1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec", "original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-02-28T08:27:14+00:00", "translation_date": "2026-07-17T20:34:47+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb", "source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "ne" "language_code": "ne"
}, },
@ -42,8 +42,8 @@
"language_code": "ne" "language_code": "ne"
}, },
"1-Introduction/03-defining-data/README.md": { "1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339", "original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2025-09-06T07:54:12+00:00", "translation_date": "2026-07-17T20:37:30+00:00",
"source_file": "1-Introduction/03-defining-data/README.md", "source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "ne" "language_code": "ne"
}, },
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md", "source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "ne" "language_code": "ne"
}, },
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T20:35:54+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ne"
},
"1-Introduction/README.md": { "1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949", "original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-27T17:02:15+00:00", "translation_date": "2025-08-27T17:02:15+00:00",
@ -108,8 +114,8 @@
"language_code": "ne" "language_code": "ne"
}, },
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": { "2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38", "original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-02-28T08:28:39+00:00", "translation_date": "2026-07-17T20:34:13+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb", "source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "ne" "language_code": "ne"
}, },
@ -192,14 +198,14 @@
"language_code": "ne" "language_code": "ne"
}, },
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": { "3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e", "original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2025-08-27T18:16:09+00:00", "translation_date": "2026-07-17T20:37:39+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md", "source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "ne" "language_code": "ne"
}, },
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": { "3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e", "original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2025-08-27T18:15:41+00:00", "translation_date": "2026-07-17T20:37:34+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md", "source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "ne" "language_code": "ne"
}, },

File diff suppressed because one or more lines are too long

@ -1,76 +1,79 @@
# डेटा परिभाषित गर्दै # डाटाको परिभाषा
|![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)| |![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:| |:---:|
|डेटा परिभाषित गर्दै - _Sketchnote by [@nitya](https://twitter.com/nitya)_ | |डाटा परिभाषा - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
ेटा भनेको तथ्य, जानकारी, अवलोकन र मापन हो, जसलाई खोज गर्न र सूचित निर्णयहरू समर्थन गर्न प्रयोग गरिन्छ। डेटा पोइन्ट भनेको डेटासेटभित्रको एकल इकाई हो, जुन डेटा पोइन्टहरूको संग्रह हो। डेटासेटहरू विभिन्न ढाँचाहरू र संरचनाहरूमा आउन सक्छन्, र सामान्यतया यसको स्रोत वा डेटा कहाँबाट आएको हो भन्ने आधारमा आधारित हुन्छ। उदाहरणका लागि, कुनै कम्पनीको मासिक आम्दानी स्प्रेडशीटमा हुन सक्छ तर स्मार्टवाचबाट प्राप्त घण्टाको हृदय दर डेटा [JSON](https://stackoverflow.com/a/383699) ढाँचामा हुन सक्छ। डेटा वैज्ञानिकहरूले डेटासेटभित्र विभिन्न प्रकारका डेटा संग काम गर्नु सामान्य कुरा हो ाटा भनेको तथ्य, जानकारी, अवलोकन र मापनहरू हुन् जुन पहिचान गर्न र सूचित निर्णयहरू गर्न प्रयोग गरिन्छ। डाटा पोइन्ट भनेको एउटा डेटा सेट भित्रको एकल डाटा इकाई हो, जुन डाटा पोइन्टहरूको संग्रह हो। डाटा सेटहरू विभिन्न ढाँचा र संरचनामा आउन सक्छन्, र प्रायः यसको स्रोतमा आधारित हुन्छन्, वा डाटा कहाँबाट आएको हो भन्नेमा निर्भर हुन्छ। उदाहरणका लागि, कुनै कम्पनीको मासिक आम्दानी स्प्रेडशीटमा हुन सक्छ तर स्मार्टवाचबाट प्राप्त घडी दरसम्बन्धी डाटा [JSON](https://stackoverflow.com/a/383699) ढाँचामा हुन सक्छ। डाटा वैज्ञानिकहरू प्रायः डाटासेट भित्र विभिन्न प्रकारका डाटासँग काम गर्छन्
यो पाठले डेटा यसको विशेषताहरू र स्रोतहरूद्वारा पहिचान र वर्गीकरणमा केन्द्रित छ। यो पाठ डाटाको विशेषता र यसको स्रोतहरू अनुसार डाटालाई चिन्ने र वर्गीकरण गर्नेमा केन्द्रित छ।
## [Pre-Lecture Quiz](https://ff-quizzes.netlify.app/en/ds/quiz/4) ## [पाठ पहिलाको क्विज](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## डाटा कसरी वर्णन गरिन्छ
## डेटा कसरी वर्णन गरिन्छ ### कच्चा डाटा
कच्चा डाटा भनेको सो को स्रोतबाट आएको प्रारम्भिक अवस्थामा रहेको डाटा हो र जसलाई अझै विश्लेषण वा व्यवस्थित गरिएको छैन। डाटा सेटमा के भइरहेको छ भनेर बुझ्नको लागि यसलाई मानिसहरूले बुझ्न सक्छन् र प्राविधिक विश्लेषण गर्न प्रयोग गर्न सक्छन् भन्ने ढाँचामा व्यवस्थित गर्न आवश्यक छ। डाटा सेटको संरचनाले यसको संगठन कसरी गरिएको छ भनेर वर्णन गर्छ र यसलाई संरचित, असंरचित र अर्ध-संरचित रूपमा वर्गीकरण गर्न सकिन्छ। यी प्रकारका संरचना स्रोत अनुसार फरक फरक हुनेछन् तर अन्ततः यी तीन श्रेणीमा पर्छन्।
### कच्चा डेटा ### मात्रात्मक डाटा
कच्चा डेटा भनेको यसको स्रोतबाट आएको प्रारम्भिक अवस्थाको डेटा हो, जुन विश्लेषण वा व्यवस्थित गरिएको छैन। डेटासेटमा के भइरहेको छ भन्ने बुझ्नको लागि, यसलाई मानिसहरूले बुझ्न सक्ने ढाँचामा व्यवस्थित गर्न आवश्यक छ, साथै उनीहरूले यसलाई थप विश्लेषण गर्न प्रयोग गर्ने प्रविधि। डेटासेटको संरचनाले यसलाई कसरी व्यवस्थित गरिएको छ भन्ने वर्णन गर्दछ र यसलाई संरचित, असंरचित र अर्ध-संरचित रूपमा वर्गीकृत गर्न सकिन्छ। यी संरचनाका प्रकारहरू स्रोतको आधारमा फरक हुन्छन् तर अन्ततः यी तीन श्रेणीहरूमा फिट हुन्छन् मात्रात्मक डाटा भनेको डाटासेट भित्रको संख्यात्मक अवलोकन हुन् र सामान्यतया विश्लेषण, मापन र गणितीय रूपमा प्रयोग गर्न सकिन्छ। मात्रात्मक डाटाका केही उदाहरणहरू हुन्: कुनै देशको जनसंख्या, कुनै व्यक्तिको उचाइ वा कुनै कम्पनीको त्रैमासिक आम्दानी। थप विश्लेषणसँगै मात्रात्मक डाटा वायु गुणस्तर सूचकांक (AQI) का मौसमी प्रवृत्तिहरू पत्ता लगाउन वा सामान्य कार्य दिनको भीडभाडको सम्भावना अनुमान गर्न प्रयोग गर्न सकिन्छ
### मात्रात्मक डेटा ### गुणात्मक डाटा
मात्रात्मक डेटा भनेको डेटासेटभित्रको संख्यात्मक अवलोकन हो, जसलाई सामान्यतया विश्लेषण, मापन र गणितीय रूपमा प्रयोग गर्न सकिन्छ। मात्रात्मक डेटा केही उदाहरणहरू हुन्: कुनै देशको जनसंख्या, व्यक्तिको उचाइ वा कम्पनीको त्रैमासिक आम्दानी। केही थप विश्लेषणको साथ, मात्रात्मक डेटा वायु गुणस्तर सूचकांक (AQI) को मौसमी प्रवृत्ति पत्ता लगाउन वा सामान्य कार्य दिनमा ट्राफिकको सम्भावना अनुमान गर्न प्रयोग गर्न सकिन्छ। गुणात्मक डाटा, जसलाई वर्गीकृत डाटा पनि भनिन्छ, त्यो डाटा हो जुन मात्रात्मक डाटाको अवलोकन जस्तो वस्तुगत रूपमा मापन गर्न सकिँदैन। यो सामान्यतया सब्जेक्टिभ डाटा हो जुन कुनै वस्तु वा प्रक्रियाको गुणस्तर समेट्छ। कहिलेकाहीं गुणात्मक डाटा संख्यात्मक पनि हुनसक्छ र सामान्यतया गणितीय रूपमा प्रयोग गरिंदैन, जस्तै फोन नम्बर वा समय-stamp। गुणात्मक डाटाका केही उदाहरणहरू हुन्: भिडियो टिप्पणीहरू, कारको ब्राण्ड र मोडेल, वा तपाईंका नजिकका साथीहरूको मनपर्ने रंग। गुणात्मक डाटा उपभोक्ताले कुन उत्पादनलाई सबैभन्दा बढी मन पराउँछन् बुझ्न वा जागिर आवेदन पत्रका लोकप्रिय कुञ्जीशब्दहरू पहिचान गर्न प्रयोग गर्न सकिन्छ।
### गुणात्मक डेटा ### संरचित डाटा
गुणात्मक डेटा, जसलाई श्रेणीगत डेटा पनि भनिन्छ, यस्तो डेटा हो जसलाई मात्रात्मक डेटा जस्तै वस्तुनिष्ठ रूपमा मापन गर्न सकिँदैन। यो सामान्यतया विभिन्न ढाँचाको व्यक्तिपरक डेटा हो, जसले कुनै वस्तु वा प्रक्रियाको गुणस्तरलाई समेट्छ। कहिलेकाहीं, गुणात्मक डेटा संख्यात्मक हुन्छ तर सामान्यतया गणितीय रूपमा प्रयोग गरिँदैन, जस्तै फोन नम्बर वा टाइमस्ट्याम्प। गुणात्मक डेटा केही उदाहरणहरू हुन्: भिडियो टिप्पणीहरू, कारको ब्रान्ड र मोडेल, वा तपाईंको नजिकको साथीहरूको मनपर्ने रंग। गुणात्मक डेटा उपभोक्ताहरूले सबैभन्दा मन पराउने उत्पादनहरू बुझ्न वा रोजगारी आवेदन रिजुमहरूमा लोकप्रिय कुञ्जी शब्दहरू पहिचान गर्न प्रयोग गर्न सकिन्छ संरचित डाटा भनेको पङ्क्तिहरू र स्तम्भहरूमा व्यवस्थित गरिएको डाटा हो, जहाँ प्रत्येक पङ्क्तिमा एउटै स्तम्भहरूको सेट हुन्छ। स्तम्भहरूले कुनै विशिष्ट प्रकारको मान प्रतिनिधित्व गर्दछन् र नामले यसको के प्रतिनिधित्व गर्छ स्पष्ट गर्दछ, जबकि पङ्क्तिहरूमा वास्तविक मान समावेश हुन्छन्। स्तम्भहरूले प्रायः मानहरूमा नियम वा प्रतिबन्धहरू हुन्छन् ताकि मानले स्तम्भलाई सही तरिकाले प्रतिनिधित्व गरोस्। उदाहरणका लागि, ग्राहकहरूको स्प्रेडशीटमा प्रत्येक पङ्क्तिमा फोन नम्बर हुनुपर्छ र फोन नम्बरमा कुनै अक्षर हुन सक्दैन। यस फोन नम्बर स्तम्भमा यस्तो नियम लागु गर्न सकिन्छ कि फोन नम्बर कहिल्यै रिक्त नहोस् र केवल संख्या मात्र समावेश गर्नुहोस्
### संरचित डेटा संरचित डाटाको फाइदा भनेको यसलाई यस्तो तरिकाले व्यवस्थित गर्न सकिन्छ जुन अन्य संरचित डाटासँग सम्बन्धित हुन सकोस्। तर, यो डाटा विशेष तरिकाले व्यवस्थित गरिएको हुँदा यसको समग्र संरचनामा परिवर्तन गर्न धेरै प्रयास गर्नुपर्छ। उदाहरणका लागि, ग्राहकको स्प्रेडशीटमा खाली नहुने इमेल स्तम्भ थप्न चाहनुहुन्छ भने यी मानहरू डाटासेटको पुराना पङ्क्तिहरूमा कसरी थप्ने भन्ने कुरा तय गर्न आवश्यक पर्छ।
संरचित डेटा भनेको पङ्क्ति र स्तम्भहरूमा व्यवस्थित डेटा हो, जहाँ प्रत्येक पङ्क्तिमा समान सेटका स्तम्भहरू हुन्छन्। स्तम्भहरूले विशेष प्रकारको मानलाई प्रतिनिधित्व गर्छन् र मानले के प्रतिनिधित्व गर्छ भन्ने वर्णन गर्ने नामले पहिचान गरिन्छ, जबकि पङ्क्तिहरूले वास्तविक मानहरू समावेश गर्छन्। स्तम्भहरूमा अक्सर मानहरूलाई सही रूपमा प्रतिनिधित्व गर्न निश्चित नियमहरू वा प्रतिबन्धहरू हुन्छन्। उदाहरणका लागि, ग्राहकहरूको स्प्रेडशीट कल्पना गर्नुहोस् जहाँ प्रत्येक पङ्क्तिमा फोन नम्बर हुनुपर्छ र फोन नम्बरहरूमा कहिल्यै वर्णमालाका अक्षरहरू समावेश हुँदैन। फोन नम्बर स्तम्भमा नियमहरू लागू गर्न सकिन्छ ताकि यो कहिल्यै खाली नहोस् र केवल नम्बरहरू समावेश होस्।
संरचित डेटा लाभ यो हो कि यसलाई यसरी व्यवस्थित गर्न सकिन्छ कि यसलाई अन्य संरचित डेटा संग सम्बन्धित गर्न सकिन्छ। तर, किनकि डेटा विशेष तरिकाले व्यवस्थित गर्न डिजाइन गरिएको छ, यसको समग्र संरचनामा परिवर्तन गर्न धेरै प्रयास लाग्न सक्छ। उदाहरणका लागि, ग्राहक स्प्रेडशीटमा एउटा इमेल स्तम्भ थप्न जसले खाली हुन सक्दैन भने यसको मतलब तपाईंले डेटासेटमा ग्राहकहरूको विद्यमान पङ्क्तिहरूमा यी मानहरू कसरी थप्ने भन्ने पत्ता लगाउनुपर्नेछ। संरचित डाटाका उदाहरणहरू: स्प्रेडशीट, सम्बन्धित डाटाबेस, फोन नम्बर, बैंक स्टेटमेन्ट
संरचित डेटा उदाहरणहरू: स्प्रेडशीटहरू, सम्बन्धात्मक डाटाबेसहरू, फोन नम्बरहरू, बैंक स्टेटमेन्टहरू ### असंरचित डाटा
असंरचित डाटा सामान्यतया पङ्क्तिहरू र स्तम्भहरूमा वर्गीकृत गर्न सकिँदैन र यसले अनुसरण गर्न कुनै निश्चित ढाँचा वा नियमहरू समावेश गर्दैन। असंरचित डाटाको संरचनामा कम प्रतिबन्धहरू हुने हुँदा नयाँ जानकारी थप्न सजिलो हुन्छ। उदाहरणका लागि, हावा दाब मापन गर्ने सेन्सरले प्रत्येक २ मिनेटमा डाटा संकलन गर्छ र अब यसले तापक्रम पनि मापन गर्ने सुविधा थपेको छ भने यदि यो असंरचित छ भने पुरानो डाटामा कुनै परिवर्तन नगरिकन नयाँ डाटाहरू थप्न सकिन्छ। तर, यसले डाटा विश्लेषण वा खोज अनुसन्धानमा समय लाग्न सक्छ। उदाहरणका लागि, अनुसन्धानकर्ताले सेन्सरको डाटाबाट अघिल्लो महिनाको औसत तापक्रम पत्ता लगाउन खोज्दा केहि डाटामा "e" लेखिएको भेट्टाए, जसले जनाउँछ सेन्सर बिग्रिएको थियो र डाटा अपूरो छ।
### असंरचित डेटा असंरचित डाटाका उदाहरणहरू: टेक्स्ट फाइलहरू, टेक्स्ट सन्देशहरू, भिडियो फाइलहरू
असंरचित डेटा सामान्यतया पङ्क्ति वा स्तम्भहरूमा वर्गीकृत गर्न सकिँदैन र यसमा कुनै ढाँचा वा नियमहरूको सेट हुँदैन। असंरचित डेटामा यसको संरचनामा कम प्रतिबन्धहरू भएका कारण नयाँ जानकारी थप्न सजिलो हुन्छ। उदाहरणका लागि, यदि बारोमेट्रिक दबाब प्रत्येक २ मिनेटमा मापन गर्ने सेन्सरले तापक्रम मापन र रेकर्ड गर्न अनुमति दिने अपडेट प्राप्त गरेको छ भने, यदि यो असंरचित छ भने विद्यमान डेटा परिवर्तन गर्न आवश्यक पर्दैन। तर, यसले यस्तो डेटा विश्लेषण गर्न वा अनुसन्धान गर्न समय लाग्न सक्छ। उदाहरणका लागि, वैज्ञानिकले सेन्सरको डेटाबाट अघिल्लो महिनाको औसत तापक्रम पत्ता लगाउन चाहन्छ तर पत्ता लगाउँछ कि सेन्सरले "e" रेकर्ड गरेको छ, जसले संकेत गर्दछ कि यो बिग्रिएको थियो, जसले गर्दा डेटा अपूर्ण छ।
असंरचित डेटा उदाहरणहरू: पाठ फाइलहरू, पाठ सन्देशहरू, भिडियो फाइलहरू ### अर्ध-संरचित
अर्ध-संरचित डाटाले संरचित र असंरचित दुवै प्रकारका विशेषताहरू समेट्छ। यो सामान्यतया पङ्क्ति र स्तम्भको ढाँचामा फिट नहोस् तर यस्तो तरिकाले व्यवस्थित हुन्छ जुन संरचित जस्तै हुन्छ र कुनै निश्चित ढाँचा वा नियमहरू पालन गर्न सक्छ। यसको संरचना स्रोत अनुसार फरक फरक हुन्छ, जस्तै राम्ररी परिभाषित श्रेणी वा नयाँ जानकारी सजिलै समायोजन गर्न सकिने लचिलो संरचना। मेटाडाटा डाटालाई कसरी सङ्गठित र स्टोर गरिन्छ भनेर निर्णय गर्न मद्दत गर्ने सूचकहरू हुन् र यसको नाम स्रोत अनुसार फरक फरक हुन्छ। मेटाडाटाका सामान्य नामहरूमा ट्याग, तत्त्वहरू, ईकाइहरू र गुणहरू पर्दछन्। उदाहरणका लागि, एउटा सामान्य इमेल सन्देशमा विषय, शरीर र प्राप्तकर्ताको सेट हुन्छ र यो को वा कहिले पठायो भनेर व्यवस्थित गर्न सकिन्छ।
### अर्ध-संरचित डेटा अर्ध-संरचित डाटाका उदाहरणहरू: HTML, CSV फाइलहरू, JavaScript Object Notation (JSON)
अर्ध-संरचित डेटामा संरचित र असंरचित डेटाको संयोजन बनाउने विशेषताहरू हुन्छन्। यो सामान्यतया पङ्क्ति र स्तम्भहरूको ढाँचामा अनुरूप हुँदैन तर यसलाई संरचित मानिने तरिकामा व्यवस्थित गरिएको हुन्छ र निश्चित ढाँचा वा नियमहरूको सेट अनुसरण गर्न सक्छ। संरचना स्रोतहरू बीच फरक हुन्छ, जस्तै राम्रोसँग परिभाषित पदानुक्रमदेखि अधिक लचिलो संरचना जसले नयाँ जानकारीको सजिलो एकीकरणलाई अनुमति दिन्छ। मेटाडेटा सूचकहरू हुन् जसले डेटा कसरी व्यवस्थित र भण्डारण गरिन्छ भन्ने निर्णय गर्न मद्दत गर्छन् र डेटा प्रकारको आधारमा विभिन्न नामहरू हुन्छन्। मेटाडेटाका केही सामान्य नामहरू ट्यागहरू, तत्वहरू, इकाइहरू र विशेषताहरू हुन्। उदाहरणका लागि, एउटा सामान्य इमेल सन्देशमा विषय, शरीर र प्राप्तकर्ताहरूको सेट हुन्छ र यसलाई कसले वा कहिले पठाएको थियो भन्ने आधारमा व्यवस्थित गर्न सकिन्छ।
अर्ध-संरचित डेटा उदाहरणहरू: HTML, CSV फाइलहरू, JavaScript Object Notation (JSON) ## डाटाका स्रोतहरू
## डेटा स्रोतहरू डाटा स्रोत भनेको डाटा कहाबाट उत्पन्न भयो वा कहाँ "बस्छ" भनेर जनाउने प्रारम्भिक स्थान हो र यो कसरी र कहिले संकलन गरियो भनेर निर्भर गर्दछ। प्रयोगकर्ताले उत्पन्न गरेको डाटालाई प्राथमिक डाटा भनिन्छ भने दोस्रो पक्षबाट संकलित डाटालाई दोस्रो डाटा भनिन्छ। उदाहरणका लागि, वर्षावनमा अवलोकन संकलन गरिरहेका वैज्ञानिकहरूको समूह प्राथमिक मानिन्छ र यदि तिनीहरूले यो डाटा अन्य वैज्ञानिकहरूसँग साझा गरे भने त्यो तिनीहरूको लागि दोस्रो डाटाको रूपमा लिइन्छ।
डेटा स्रोत भनेको डेटा उत्पन्न भएको प्रारम्भिक स्थान हो, वा यो "बस्छ" र यो कसरी र कहिले सङ्कलन गरियो भन्ने आधारमा फरक हुन्छ। प्रयोगकर्ताहरूले उत्पन्न गरेको डेटा प्राथमिक डेटा भनेर चिनिन्छ भने माध्यमिक डेटा यस्तो स्रोतबाट आउँछ जसले सामान्य प्रयोगको लागि डेटा सङ्कलन गरेको छ। उदाहरणका लागि, वैज्ञानिकहरूको समूहले वर्षावनमा अवलोकनहरू सङ्कलन गरेको प्राथमिक मानिन्छ र यदि उनीहरूले यसलाई अन्य वैज्ञानिकहरूसँग साझा गर्ने निर्णय गरे भने यो माध्यमिक मानिन्छ। डाटाबेस एक सामान्य स्रोत हो र यसका लागि डाटाबेस व्यवस्थापन प्रणाली आवश्यक हुन्छ जसले डाटा होस्ट र मर्मत गर्दछ जहाँ प्रयोगकर्ताहरू क्वेरी भनिने आदेशहरूसँग डाटा अन्वेषण गर्छन्। फाइलहरू जस्तै अडियो, चित्र, भिडियो फाइलहरू साथै एक्सेलजस्ता स्प्रेडशीटहरू पनि डाटा स्रोत हुन्। इन्टरनेट स्रोत पनि सामान्य हुन्छ जहाँ डाटाबेस र फाइलहरू भेटिन्छन्। एप्लिकेसन प्रोग्रामिङ इन्टरफेसहरू (API) ले प्रोग्रामरहरूलाई इन्टरनेट मार्फत बाह्य प्रयोगकर्तासँग डाटा साझा गर्ने तरिका सिर्जना गर्न अनुमति दिन्छ जबकि वेब स्क्र्यापिङले वेब पृष्ठबाट डाटा निकाल्छ। [डाटासँग काम गर्ने पाठहरू](../../../../../../../../../2-Working-With-Data) विभिन्न डाटा स्रोतहरू कसरी प्रयोग गर्ने भन्ने कुरामा केन्द्रित छन्।
डाटाबेसहरू सामान्य स्रोत हुन् र डाटाबेस व्यवस्थापन प्रणालीमा निर्भर गर्दछ जसले डेटा होस्ट र मर्मत गर्छ जहाँ प्रयोगकर्ताहरूले क्वेरी भनिने आदेशहरू प्रयोग गरेर डेटा अन्वेषण गर्छन्। फाइलहरू डेटा स्रोतको रूपमा अडियो, छवि, र भिडियो फाइलहरू साथै Excel जस्ता स्प्रेडशीटहरू हुन सक्छ। इन्टरनेट स्रोतहरू डेटा होस्ट गर्नको लागि सामान्य स्थान हुन्, जहाँ डाटाबेसहरू साथै फाइलहरू फेला पार्न सकिन्छ। एप्लिकेसन प्रोग्रामिङ इन्टरफेसहरू, जसलाई API पनि भनिन्छ, प्रोग्रामरहरूले इन्टरनेट मार्फत बाह्य प्रयोगकर्ताहरूसँग डेटा साझा गर्ने तरिकाहरू सिर्जना गर्न अनुमति दिन्छ, जबकि वेब स्क्र्यापिङले वेब पृष्ठबाट डेटा निकाल्छ। [डेटासँग काम गर्ने पाठहरू](../../../../../../../../../2-Working-With-Data) विभिन्न डेटा स्रोतहरू कसरी प्रयोग गर्नेमा केन्द्रित छन्।
## निष्कर्ष ## निष्कर्ष
यस पाठमा हामीले सिक्यौं: यस पाठमा हामीले सिक्यौं:
- डटा के हो - डटा के हो
- डटा कसरी वर्णन गरिन्छ - डटा कसरी वर्णन गरिन्छ
- डेटा कसरी वर्गीकृत र श्रेणीबद्ध गरिन्छ - डाटालाई कसरी वर्गीकरण र श्रेणीकरण गरिन्छ
- डेटा कहाँ फेला पार्न सकिन्छ - डाटा कहाँ पाइन्छ
## 🚀 चुनौती ## 🚀 चुनौती
Kaggle खुला डेटासेटहरूको उत्कृष्ट स्रोत हो। [डेटासेट खोज उपकरण](https://www.kaggle.com/datasets) प्रयोग गरेर केही रोचक डेटासेटहरू खोज्नुहोस् र ३-५ डेटासेटहरूलाई निम्न मापदण्डमा वर्गीकृत गर्नुहोस्: कागल एक उत्कृष्ट खुला डाटासेट स्रोत हो। [डाटासेट खोज उपकरण](https://www.kaggle.com/datasets) प्रयोग गरेर केही रोचक डाटासेटहरू खोज्नुहोस् र 3-5 डाटासेटहरूलाई तलका मापदण्ड अनुसार वर्गीकृत गर्नुहोस्:
- डाटा मात्रात्मक हो वा गुणात्मक?
- डाटा संरचित, असंरचित वा अर्ध-संरचित हो?
## [पाठ पछिको क्विज](https://ff-quizzes.netlify.app/en/ds/quiz/5)
- डेटा मात्रात्मक हो कि गुणात्मक?
- डेटा संरचित, असंरचित, वा अर्ध-संरचित हो?
## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## समीक्षा र आत्म-अध्ययन ## समीक्षा र स्वअध्ययन
- यो Microsoft Learn इकाई, [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) शीर्षकमा संरचित, अर्ध-संरचित, र असंरचित डेटाको विस्तृत विवरण छ। - यो माइक्रोसफ्ट लर्न इकाई, शीर्षक [डेटा ढाँचाहरूको पहिचान](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) ले संरचित, अर्ध-संरचित र असंरचित डाटाको विस्तृत विवरण दिइरहेको छ।
## असाइनमेन्ट ## कार्य
[ेटासेट वर्गीकरण गर्दै](assignment.md) [ाटासेट वर्गीकरण](assignment.md)
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**: **अस्वीकरण**:
यो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको छ। हामी शुद्धताको लागि प्रयास गर्छौं, तर कृपया ध्यान दिनुहोस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छ। यसको मूल भाषा मा रहेको मूल दस्तावेज़लाई आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीको लागि, व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न हुने कुनै पनि गलतफहमी वा गलत व्याख्याको लागि हामी जिम्मेवार हुने छैनौं। यो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको हो। हामी सही हुन प्रयास गर्छौं, तर कृपया जानकार हुनुस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। मूल दस्तावेज़ यसको मूल भाषामा आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीका लागि व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न कुनै पनि गलत बुझाइ वा त्रुटिको लागि हामी जिम्मेवार छैनौं।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"# संभावना र तथ्यांकमा परिचय\n", "# सम्भावना र तथ्याङ्कमा परिचय\n",
"यस नोटबुकमा, हामी पहिले छलफल गरेका केही अवधारणाहरूलाई खेल्नेछौं। सम्भाव्यता र तथ्यांकका धेरै अवधारणाहरू पायथनमा डाटा प्रशोधनका लागि प्रमुख पुस्तकालयहरू जस्तै `numpy` र `pandas` मा राम्रोसँग प्रतिनिधित्व गरिन्।\n" "यस नोटबुकमा, हामीले पहिले छलफल गरेका केही अवधारणाहरू सँग खेल्नेछौं। सम्भावना र तथ्याङ्कका धेरै अवधारणाहरू Python का डेटा प्रशोधनका प्रमुख पुस्तकालयहरू जस्तै `numpy` र `pandas` मा राम्रोसँग प्रतिनिधित्व गरिएका छन्।\n"
] ]
}, },
{ {
@ -24,8 +24,8 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## र्याण्डम भेरीएबलहरू र वितरणहरू\n", "## र्यान्डम भेरिएबलहरू र वितरणहरू\n",
"हामी 0 देखि 9 सम्मको युनिफर्म वितरणबाट 30 मानहरूको नमूना खिच्नेछौं। हामी माध्य र विचलन पनि गणना गर्नेछौं।\n" "आउनुहोस् देखि ९ सम्मको एउटा समान वितरणबाट ३० मानहरूको नमुना तान्नेबाट सुरु गरौं। हामी औसत र भिन्नता पनि गणना गर्नेछौं।\n"
] ]
}, },
{ {
@ -44,7 +44,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"नमूनामा कति फरक मानहरू छन् भनी दृश्य रूपमा अनुमान लगाउनका लागि, हामी **हिस्टोग्राम** प्लट गर्न सक्छौं:\n" "नमुना मा कति फरक मानहरू छन् भनेर दृश्यात्मक रूपमा अनुमान लगाउन, हामी **हिस्टोग्राम** प्लट गर्न सक्छौं:\n"
] ]
}, },
{ {
@ -61,9 +61,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## वास्तविक डाटा विश्लेषण\n", "## वास्तविक डेटा विश्लेषण गर्दै\n",
"\n", "\n",
"औसत र परिवर्तनशीलता वास्तविक-विश्व डाटा विश्लेषण गर्दा धेरै महत्वपूर्ण हुन्छन्। आउनुहोस् [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) बाट बेसबल खेलाडीहरूको डाटा लोड गरौं।\n" "वास्तविक-विश्व डेटा विश्लेषण गर्दा औसत र विचलन अत्यन्त महत्वपूर्ण छन्। आउनुहोस् [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) बाट बेसबल खेलाडीहरूको डेटा लोड गरौं\n"
] ]
}, },
{ {
@ -80,9 +80,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> हामी यहाँ डाटा विश्लेषणको लागि [**Pandas**](https://pandas.pydata.org/) नामक प्याकेज प्रयोग गर्दैछौं। हामी यो कोर्समा पछि Pandas र Python मा डाटासँग कसरी काम गर्ने बारे थप कुरा गर्नेछौं।\n", "> हामी यहाँ मात्र डेटा विश्लेषणको लागि [**Pandas**](https://pandas.pydata.org/) नामक प्याकेज प्रयोग गर्दैछौं। हामी यो कोर्समा पछि Pandas र Python मा डेटा बाट काम गर्ने बारे थप कुरा गर्नेछौं।\n",
"\n", "\n",
"आयु, उचाइ र तौलको औसत मानहरू गणना गरौं:\n" "उमेर, उचाई र तौलको औसत मानहरू गणना गरौं:\n"
] ]
}, },
{ {
@ -98,7 +98,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"अब हाम्रा ध्यान उचाइमा केन्द्रित गरौं, र मानक विचलन र विचरण गणना गरौं:\n" "अब उचाइमा ध्यान दिऔं, र मानक विचलन र भिन्नता गणना गरौं: \n"
] ]
}, },
{ {
@ -126,7 +126,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"औसतसँगै, मध्य मान र क्वारटाइलहरूमा पनि ध्यान दिन उचित हुन्छ। तिनीहरूलाई **बक्स प्लट** प्रयोग गरी दृश्यात्मक रूप दिन सकिन्छ:\n" "औसत बाहेक, मध्य मान र क्वारटाइलहरू हेर्नु पनि तर्कसंगत हुन्छ। तिनीहरूलाई **बक्स प्लट** प्रयोग गरी दृश्यात्मक रूपमा देखाउन सकिन्छ:\n"
] ]
}, },
{ {
@ -136,7 +136,7 @@
"outputs": [], "outputs": [],
"source": [ "source": [
"plt.figure(figsize=(10,2))\n", "plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n", "plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n", "plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n", "plt.tight_layout()\n",
"plt.show()" "plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"हामी हाम्रो डेटासेटका उपसमूहहरूको बक्स प्लटहरू पनि बनाउन सक्छौं, उदाहरणका लागि, खेलाडीको भूमिकाले समूहबद्ध गरेर।\n" "हामी हाम्रो डेटासेटका उपसेटहरूको बक्स प्लट पनि बनाउन सक्छौं, उदाहरणका लागि, खेलाडीको भूमिकाका आधारमा समूहित गरेर।\n"
] ]
}, },
{ {
@ -165,9 +165,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> **नोट**: यो चित्रले सुझाव दिन्छ कि औसतमा, प्रथम बेसम्यानको उचाइ दोस्रो बेसम्यानको ऊचाइभन्दा बढी हुन्छ। पछि हामी सिक्नेछौं कि कसरी हामी यो परिकल्पनालाई औपचारिक रूपमा परीक्षण गर्न सकिन्छ, र कसरी देखाउन सकिन्छ कि हाम्रो डेटा सांख्यिकीय रूपमा महत्वपूर्ण छ। \n", "> **नोट**: यो आलेखले सुझाउँछ कि सामान्यतया, पहिलो बेसम्यानका उचाइहरू दोस्रो बेसम्यानको उचाइभन्दा बढि हुन्छन्। पछि हामी कसरी यो धारणा औपचारिक रूपमा परीक्षण गर्न सक्छौं र हाम्रो डेटा सांख्यिकीय मान्य छ भनेर कसरी प्रमाणित गर्न सकिन्छ भन्ने सिक्नेछौं। \n",
"\n", "\n",
"उमेर, उचाइ र वजन सबै निरन्तर यादृच्छिक चरहरू हुन्। तपाईंले के सोच्नुहुन्छ तिनीहरूको वितरण के हो? यसको पत्ता लगाउनको लागि राम्रो तरिका भनेको मानहरूको हिस्टोग्राम प्लट गर्नु हो: \n" "उमेर, उचाई र तौल सबै निरन्तर र्यान्डम भेरिएबलहरू हुन्। तपाईंलाई के लाग्छ तिनीहरूको वितरण कस्तो छ? थाहा पाउने राम्रो तरिका भनेको मानहरूको हिस्टोग्राम प्लट गर्नु हो: \n"
] ]
}, },
{ {
@ -188,9 +188,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## Normal Distribution\n", "## सामान्य वितरण\n",
"\n", "\n",
"हामीसँगको वास्तविक डेटा जस्तै उस्तै औसत र विचलन हुने सामान्य वितरणको पालना गर्ने तौलहरूको कृत्रिम नमूना बनाउँछौं:\n" "वास्तविक डाटा जस्तै समान औसत र विचलन भएको सामान्य वितरण पछ्याउने तौलहरूको कृत्रिम नमुना बनाऔँ:\n"
] ]
}, },
{ {
@ -231,7 +231,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"किनभने वास्तविक जीवनका अधिकांश मानहरू सामान्य रूपमा वितरण हुन्छन्, हामीले नमूना डाटा सिर्जना गर्न एकरूप यादृच्छिक संख्या उत्पन्नकर्ता प्रयोग गर्नु हुँदैन। यदि हामी एकरूप वितरण (जसलाई `np.random.rand` द्वारा सिर्जना गरिएको छ) सँग तौलहरू सिर्जना गर्न प्रयास गर्छौं भने के हुन्छ यहाँ छ:\n" "किनभने वास्तविक जीवनका धेरै मानहरू सामान्यतया वितरण हुने गर्छन्, हामीले नमुना डाटा सिर्जना गर्न समान्य र्‍याण्डम नम्बर जेनेरेटर प्रयोग गर्नु हुँदैन। यहाँ समान वितरण ( `np.random.rand` द्वारा उत्पन्न) बाट तौलहरू उत्पादन गर्ने प्रयास गर्दा के हुन्छ देखाइएको छ:\n"
] ]
}, },
{ {
@ -251,9 +251,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## विश्वास अन्तरालहरू\n", "## आत्मविश्वास अन्तराल\n",
"\n", "\n",
"अब हामी बेसबल खेलाडीहरूको तौल र उचाइको लागि विश्वास अन्तराल गणना गर्ने छौं। हामी यो कोड प्रयोग गर्नेछौं [यस stackoverflow छलफलबाट](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n" "अब हामी बेसबल खेलाडीहरूको तौल र उचाइका लागि आत्मविश्वास अन्तराल गणना गर्नेछौं। हामी यो कोड प्रयोग गर्नेछौं [यस stackoverflow छलफलबाट](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
] ]
}, },
{ {
@ -272,7 +272,7 @@
" return m, h\n", " return m, h\n",
"\n", "\n",
"for p in [0.85, 0.9, 0.95]:\n", "for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n", " m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")" " print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
] ]
}, },
@ -282,7 +282,7 @@
"source": [ "source": [
"## परिकल्पना परीक्षण\n", "## परिकल्पना परीक्षण\n",
"\n", "\n",
"आउनुहोस् हाम्रा बेसबल खेलाडीहरूको डेटासेटमा विभिन्न भूमिकाहरू अन्वेषण गरौं:\n" "हाम्रा बेसबल खेलाडी डाटासेटमा फरक भुमिकाहरू अन्वेषण गरौं:\n"
] ]
}, },
{ {
@ -298,7 +298,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"चलिए यो परिकल्पनाको परीक्षण गरौं कि पहिलो बेसम्यानहरू दोस्रो बेसम्यानहरू भन्दा अग्ला हुन्छन्। यो गर्नको सबैभन्दा सरल तरिका हो विश्वस्तता अन्तरालहरूको परीक्षण गर्नु:\n" "पहिलो बेसम्यान दोस्रो बेसम्यानहरू भन्दा अग्लो हुन्छन् भन्ने अनुमानको परीक्षण गरौं। यसको लागि सबैभन्दा सरल तरिका भनेको आत्मविश्वास अन्तरालहरूको परीक्षण गर्नु हो:\n"
] ]
}, },
{ {
@ -317,9 +317,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"हामीले देख्न सक्छौं कि इन्टरवलहरूले ओभरल्याप गर्दैनन्।\n", "हामी देख्न सक्छौं कि अन्तरालहरू ओभरल्याप हुँदैनन्।\n",
"\n", "\n",
"एक तथ्याङ्कीय रूपमा अझ सही तरिका हाइपोथेसिस प्रमाणित गर्नको लागि **स्टुडेन्ट t-परीक्षण** प्रयोग गर्नु हो:\n" "परिकल्पनालाई प्रमाणित गर्ने एउटा सांख्यिकीय रूपमा सही तरिका भनेको **स्टुडेन्ट टी-टेस्ट** प्रयोग गर्नु हो:\n"
] ]
}, },
{ {
@ -338,18 +338,18 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"`ttest_ind` फंक्शनले फर्काउने दुई मानहरू हुन्:\n", "`ttest_ind` कार्यले फर्काइने दुई मानहरू हुन्:\n",
"* p-value लाई दुई वितरणहरूको एउटै मध्यमान हुने सम्भावना रूपमा मान्न सकिन्छ। हाम्रो अवस्थामा, यो धेरै कम छ, जसको अर्थ पहिलो बेसम्यानहरू उच्च हुने बलियो प्रमाण छ।\n", "* p-मूल्य दुई वितरणहरूको एउटै औसत हुने सम्भावना मान्न सकिन्छ। हाम्रो अवस्थामा, यो धेरै कम छ, जसको अर्थ छ कि प्रथम बेसम्यानहरू उच्च हुनुको लागि मजबूत प्रमाण छ।\n",
"* t-value भनेको सामान्यीकृत मध्यमान भिन्नताको मध्यवर्ती मान हो जुन t-test मा प्रयोग हुन्छ, र यो दिइएको आत्मविश्वास मानको लागि एउटा थ्रेसहोल्ड मानसँग तुलना गरिन्छ।\n" "* t-मूल्य सामान्यीकृत औसत भिन्नताको मध्यवर्ती मान हो जुन t-परीक्षणमा प्रयोग गरिन्छ, र यसलाई दिइएको विश्वस्तताका लागि थ्रेसहोल्ड मानसँग तुलना गरिन्छ।\n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## केन्द्रीय सीमा प्रमेयको साथ सामान्य वितरणको अनुकरण\n", "## केन्द्रीय सीमा प्रमेयको साथ साधारण वितरणको अनुकरण\n",
"\n", "\n",
"Python मा छोली-र्यान्डम जेनरेटरलाई सिधा समान वितरण दिनको लागि डिजाइन गरिएको छ। यदि हामी सामान्य वितरणको लागि जेनरेटर बनाउन चाहन्ौं भने हामी केन्द्रीय सीमा प्रमेय प्रयोग गर्न सक्छौं। सामान्य वितरण गरिएको मान प्राप्त गर्न हामी केवल समान-जनरेट गरिएको नमुना को औसत गणना गर्नेछौं।\n" "पाइथनमा स्यूडो-र्याण्डम जेनरेटरले हामीलाई एकसमान वितरण दिन डिजाइन गरिएको छ। यदि हामीलाई साधारण वितरणको लागि जेनरेटर बनाउन छ भने, हामी केन्द्रीय सीमा प्रमेय प्रयोग गर्न सक्छौं। सामान्य रूपमा वितरण गरिएको मान प्राप्त गर्न हामीले एकसमान-उत्पन्न नमुनाको माध्य गणना गर्नेछौं।\n"
] ]
}, },
{ {
@ -375,7 +375,7 @@
"source": [ "source": [
"## सहसम्बन्ध र दुष्ट बेसबल कर्पोरेशन\n", "## सहसम्बन्ध र दुष्ट बेसबल कर्पोरेशन\n",
"\n", "\n",
"सहसम्बन्धले हामीलाई डेटा अनुक्रमहरू बीच सम्बन्ध पत्ता लगाउन अनुमति दिन्छ। हाम्रो खेलौना उदाहरणमा, मानौं त्यहाँ एक दुष्ट बेसबल कर्पोरेशन छ जसले आफ्ना खेलाडीहरूलाई उचाइ अनुसार तलब दिन्छ - खेलाडी जतिसुकै लामा हुन्छ, उसलाई त्यति नै धेरै पैसा मिल्छ। मानौं आधारभूत तलब $1000 छ, र उचाइको आधारमा $0 देखि $100 सम्म अतिरिक्त बोनस दिइन्छ। हामी MLB का वास्तविक खेलाडीहरू लिनेछौं, र उनीहरूको काल्पनिक तलबहरू गणना गर्नेछौं:\n" "सहसम्बन्धले हामीलाई डाटा अनुक्रमहरूबीच सम्बन्ध पत्ता लगाउन मद्दत गर्दछ। हाम्रो सानो उदाहरणमा, मानौं त्यहाँ एक दुष्ट बेसबल कर्पोरेशन छ जसले आफ्ना खेलाडीलाई तिनीहरूको उचाइ अनुसार तलब दिन्छ - जस खेलाडी उचो हुन्छ, उसलाई बढी पैसा प्राप्त हुन्छ। मानौं आधारभूत तलब $१००० छ, र उचाइअनुसार $ देखि $१०० सम्म अतिरिक्त बोनस पाइन्छ। हामी MLB का वास्तविक खेलाडीहरू लिनेछौं र तिनीहरूको काल्पनिक तलब गणना गर्नेछौं:\n"
] ]
}, },
{ {
@ -384,7 +384,7 @@
"metadata": {}, "metadata": {},
"outputs": [], "outputs": [],
"source": [ "source": [
"heights = df['Height'].fillna(method='pad')\n", "heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n", "salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])" "print(list(zip(heights, salaries))[:10])"
] ]
@ -393,7 +393,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"अब ती श्रृंखलाहरूको सहसंबंध र सहसंबंध गणना गरौं। `np.cov` ले हामीलाई तथाकथित **सहसंबंध म्याट्रिक्स** दिनेछ, जुन बहु चरहरूमा सहसंबंधको विस्तार हो। सहसंबंध म्याट्रिक्स $M$ को तत्त्व $M_{ij}$ इनपुट चरहरू $X_i$ र $X_j$ बीचको सहसंबंध हो, र विकर्ण मानहरू $M_{ii}$ $X_i$ को वैरिएन्स हो। त्यसैगरी, `np.corrcoef` ले हामीलाई **सहसंबंध म्याट्रिक्स** दिनेछ।\n" "अब ती अनुक्रमहरूको सहसम्बन्ध र सहसञ्चिका गणना गरौं। `np.cov` ले हामीलाई तथाकथित **सहसञ्चिका म्याट्रिक्स** दिनेछ, जुन धेरै चरहरूमा सहसञ्चिकाको विस्तार हो। सहसञ्चिका म्याट्रिक्स $M$ को तत्त्व $M_{ij}$ ले इनपुट चरहरू $X_i$ र $X_j$ बीचको सहसम्बन्ध जनाउँछ, र विकर्ण मानहरू $M_{ii}$ $X_{i}$ को विचरण हो। त्यसै गरी, `np.corrcoef` ले हामीलाई **सहसम्बन्ध म्याट्रिक्स** दिनेछ।\n"
] ]
}, },
{ {
@ -411,7 +411,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"एक सहसंबन्ध १ बराबर हुनुको अर्थ दुई चलहरूमाबीच **रेखीय सम्बन्ध** बलियो छ। हामी एक मानलाई अर्कोको विरुद्ध चित्रण गरेर रेखीय सम्बन्ध देख्न सक्छौं:\n" "१ को सहसम्बन्धले जनाउँछ कि दुई चलहरूबीच एउटा बलियो **रेखीय सम्बन्ध** छ। हामी एउटा मानलाई अर्कोको विरुद्ध प्लट गरेर रेखीय सम्बन्धलाई दृश्य रूपमा देख्न सक्छौं:\n"
] ]
}, },
{ {
@ -430,7 +430,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"हेरौं के हुन्छ यदि सम्बन्ध रैखिक नहोस्। मानौं हाम्रो कम्पनीले उचाइ र तलबबीचको स्पष्ट रैखिक निर्भरतालाई लुकाउने निर्णय गर्यो, र सूत्रमा केहि गैर-रैखिकता परिचय गरायो, जस्तै `sin`:\n" "यो सम्बन्ध रेखीय नभए के होला भनेर हेरौं। मानौं हाम्रो कम्पनीले उचाइ र तलब बीचको स्पष्ट रेखीय निर्भरता लुकाउने निर्णय गर्यो, र सूत्रमा केहि गैर-रेखीयता, जस्तै `sin`, प्रस्तुत गर्यो:\n"
] ]
}, },
{ {
@ -447,7 +447,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"यस अवस्थामा, सहसंबन्ध केही कम छ, तर यो अझै पनि धेरै उच्च छ। अब, सम्बन्धलाई अझ कम स्पष्ट बनाउनका लागि, हामीले तलबमा केही अनियमित चर थपेर थप अनिश्चितता जोड्न सक्छौं। हेर्नुहोस् के हुन्छ:\n" "यस अवस्थामा, सहसम्बन्ध अलि सानो छ, तर यो अझै पनि निकै उच्च छ। अब, सम्बन्धलाई अझ कम स्पष्ट बनाउनका लागि, हामी तलबमा केही अतिरिक्त यादृच्छिकता थप्न कुनै यादृच्छिक भेरिएबल थप्न चाहन सक्छौं। हेर्नुहोस् के हुन्छ:\n"
] ]
}, },
{ {
@ -476,9 +476,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> के तपाईं अनुमान लगाउन सक्नुहुन्छ किन डटहरू यसरी ठाडो रेखामा सँगै मिल्छन्?\n", "> तपाईं अनुमान लगाउन सक्नुहुन्छ किन डटहरू यसरी ठाडो लाइनहरूमा सिधा हुन्छन्?\n",
"\n", "\n",
"हामीले तलब जस्ता कृत्रिम रूपमा बनाइएका अवधारणा र अवलोकन गरिएको चर *उचाइ* बीचको सम्बन्ध देख्यौं। अब हेरौं यदि दुई अवलोकन गरिएका चरहरू, जस्तै उचाइ र वजन, पनि सम्बन्धित छन् कि छैनन्:\n" "हामीले तलबजस्ता कृत्रिम रूपमा तयार गरिएको अवधारणा र अवलोकित चर *उचाइ* बीचको सम्बन्धलाई अवलोकन गरेका छौं। अब हामीले हेर्न सक्छौं कि दुई अवलोकित चरहरू, जस्तै उचाइ र तौल, पनि सम्बन्धित छन् कि छैनन्:\n"
] ]
}, },
{ {
@ -494,11 +494,11 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"दुर्भाग्यवश, हामीले कुनै परिणाम पाउन सकेनौं - केवल केही अनौठो `nan` मानहरू मात्र पाइयो। यसको कारण हाम्रो सिरिजमा भएका केही मानहरू अनिर्धारित छन्, जसलाई `nan` को रूपमा प्रतिनिधित्व गरिएको छ, जसले गर्दा अपरेसनको परिणाम पनि अनिर्धारित हुन्छ। म्याट्रिक्स हेर्दा हामी देख्न सक्छौं कि `Weight` समस्या भएको स्तम्भ हो, किनभने `Height` मानहरू बीचको आत्म-सहसंबन्ध गणना गरिएको छ।\n", "दुर्भाग्यवश, हामीले कुनै नतिजा पाएका छैनौं - केवल केही अनौठा `nan` मानहरू मात्र। यसको कारण यो हो कि हाम्रो श्रृंखलाका केही मानहरू अपरिभाषित छन्, जुन `nan` द्वारा प्रतिनिधित्व गरिएको छ, जसले गर्दा अपरेशनको नतिजा पनि अपरिभाषित हुन्छ। म्याट्रिक्सलाई हेर्दा हामी देख्न सक्छौं कि `Weight` समस्या भएको स्तम्भ हो, किनकि `Height` मानहरू बीच स्व-सहसम्बन्ध गणना गरिएको छ।\n",
"\n", "\n",
"> यस उदाहरणले **डाटा तयार पार्ने** र **सफा गर्ने** महत्त्व देखाउँछ। उचित डाटा बिना हामी केही पनि गणना गर्न सक्दैनौं।\n", "> यो उदाहरणले **डेटा तयारी** र **सफा सफाइ** को महत्व देखाउँछ। उचित डेटा बिना हामी केही पनि गणना गर्न सक्दैनौं।\n",
"\n", "\n",
"आउनुहोस् `fillna` विधि प्रयोग गरी अभाव भएका मानहरू भर्न र सहसंबन्ध गणना गरौं: \n" "आउनुहोस् `fillna` विधि प्रयोग गरी हराएको मानहरू भर्नुहोस्, र सहसम्बन्ध गणना गरौं: \n"
] ]
}, },
{ {
@ -507,14 +507,14 @@
"metadata": {}, "metadata": {},
"outputs": [], "outputs": [],
"source": [ "source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])" "np.corrcoef(df['Height'].ffill(), df['Weight'])"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"त्यसमा साँच्चिकै एक सम्बन्ध छ, तर हाम्रो कृत्रिम उदाहरणमा जस्तो बलियो छैन। साँच्चै, यदि हामी एउटालाई अर्कोसँग तुलना गर्ने स्क्याटर प्लटमा हेर्छौं भने, सम्बन्ध धेरै कम स्पष्ट हुनछ:\n" "वास्तवमा एक सम्बन्ध छ, तर हाम्रो कृत्रिम उदाहरणजस्तै कडा छैन। वास्तवमै, यदि हामी एउटा मानलाई अर्को मानसँग तुलना गर्ने स्क्याटर प्लट हेर्छौं भने सम्बन्ध धेरै कम स्पष्ट हुनछ:\n"
] ]
}, },
{ {
@ -535,16 +535,16 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## Conclusion\n", "## निष्कर्ष\n",
"\n", "\n",
"यस नोटबुकमा हामीले तथ्याङ्कीय कार्यहरू गणना गर्न डेटा माथि आधारभूत अपरेसनहरू कसरी गर्न सकिन्छ भन्ने सिक्यौं। अब हामीले केही परिकल्पनाहरू प्रमाणित गर्नका लागि गणित र तथ्यांकको एक बलियो उपकरण कसरी प्रयोग गर्ने, र डेटा नमूना दिईएका मनमाना चरहरूको लागि विश्वास अन्तर्वाल कसरी गणना गर्ने थाहा पाइसकेका छौं।\n" "यस नोटबुकमा हामीले डेटा माथि आधारभूत अपरेसनहरू कसरी गर्ने र सांख्यिकीय कार्यहरू कसरी गणना गर्ने सिक्यौं। हामी अब थाहा छ कसरी गणित र तथ्याङ्कहरूको सशक्त उपकरण प्रयोग गरेर केही अनुमानहरू प्रमाणित गर्ने, र डेटा नमुना दिइएमा मनमानी चरहरूको लागि विश्वास अन्तराल कसरी गणना गर्ने। \n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**: \nयो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको हो। हामी शुद्धताका लागि प्रयासरत छौं भने पनि, कृपया ज्ञात गर्नुहोस् कि स्वचालित अनुवादमा त्रुटि वा अशुद्धता हुनसक्छ। मूल दस्तावेज जस भाषामा छ, त्यो आधिकारिक स्रोत मान्नुपर्दछ। महत्वपूर्ण जानकारीका लागि, पेशेवर मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न हुने कुनै पनि गलतफहमी वा गलत व्याख्याका लागि हामी जिम्मेवार छैनौं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n" "---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nयो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको हो। हामी सही हुन प्रयास गर्छौं, तर कृपया जानकार हुनुस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। मूल दस्तावेज़ यसको मूल भाषामा आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीका लागि व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न कुनै पनि गलत बुझाइ वा त्रुटिको लागि हामी जिम्मेवार छैनौं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
] ]
} }
], ],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python", "nbconvert_exporter": "python",
"pygments_lexer": "ipython3", "pygments_lexer": "ipython3",
"version": "3.9.6" "version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T11:54:01+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ne"
} }
}, },
"nbformat": 4, "nbformat": 4,

@ -8,7 +8,7 @@
"\n", "\n",
"## डेटा लोड गर्दै\n", "## डेटा लोड गर्दै\n",
"\n", "\n",
"हामी COVID-19 संक्रमित व्यक्तिहरूको डेटा प्रयोग गर्नेछौं, जुन [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) द्वारा [Johns Hopkins University](https://jhu.edu/) मा प्रदान गरिएको छ। डेटासेट [यस GitHub Repository](https://github.com/CSSEGISandData/COVID-19) मा उपलब्ध छ।\n" "हामी COVID-19 संक्रमित व्यक्तिहरूको डेटा प्रयोग गर्नेछौं, जुन [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ले [Johns Hopkins University](https://jhu.edu/) मा उपलब्ध गराएको हो। डेटा सेट [यस GitHub Repository](https://github.com/CSSEGISandData/COVID-19) मा उपलब्ध छ।\n"
] ]
}, },
{ {
@ -27,7 +27,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"हामी सबैभन्दा नयाँ डेटा सिधै GitHub बाट `pd.read_csv` प्रयोग गरेर लोड गर्न सक्छौं। कुनै कारणले डेटा उपलब्ध नभएमा, तपाईं सधैं `data` फोल्डरमा स्थानीय रूपमा उपलब्ध कपी प्रयोग गर्न सक्नुहुन्छ - तलको `base_url` परिभाषित गर्ने लाइन अनकमेन्ट गर्नुहोस्:\n" "हामी सबैभन्दा हालको डेटा सिधै GitHub बाट `pd.read_csv` प्रयोग गरेर लोड गर्न सक्छौं। यदि कुनै कारणले डेटा उपलब्ध छैन भने, तपाईं सधैं `data` फोल्डरमा स्थानीय रूपमा उपलब्ध प्रतिलिपि प्रयोग गर्न सक्नुहुन्छ - तलको त्यो लाइन जुन `base_url` परिभाषित गर्छ, त्यसलाई कमेन्टबाट बाहिर निकाल्नुहोस्:\n"
] ]
}, },
{ {
@ -48,7 +48,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"अब संक्रमित व्यक्तिहरूको डेटा लोड गरौं र डेटा कस्तो देखिन्छ हेर्नुहोस्:\n" "अब हामी संक्रमित व्यक्तिहरूको डेटा लोड गरौं र हेर्नुहोस् डेटा कस्तो देखिन्छ:\n"
] ]
}, },
{ {
@ -265,7 +265,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"हामी देख्न सक्छौं कि तालिकाको हरेक पंक्तिले प्रत्येक देश र/वा प्रदेशको संक्रमित व्यक्तिको संख्या परिभाषित गर्दछ, र स्तम्भहरूले मितिहरूलाई जनाउँछन्। समान तालिकाहरू अन्य डाटाका लागि पनि लोड गर्न सकिन्छ, जस्तै निको भएका र मृत्यु भएका व्यक्तिहरूको संख्या।\n" "हामी देख्न सक्छौं कि तालिकाको प्रत्येक पंक्तिले प्रत्येक देश र/वा प्रदेशमा संक्रमित व्यक्तिहरूको संख्या परिभाषित गर्दछ, र स्तम्भहरू मितिहरूसँग मेल खान्छन्। अन्य डाटाका लागि पनि यस्तै तालिकाहरू लोड गर्न सकिन्छ, जस्तै निको भएका र मृत व्यक्तिहरूको संख्या।\n"
] ]
}, },
{ {
@ -282,9 +282,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## डाटाको अर्थ लगाउँदै\n", "## डाटालाई बुझ्ने\n",
"\n", "\n",
"माथिको तालिकाबाट प्रान्त स्तम्भको भूमिका स्पष्ट छैन। आउनुहोस् `Province/State` स्तम्भमा रहेका विभिन्न मानहरू हेर्छौं:\n" "माथिको तालिकाबाट प्रान्त स्तम्भको भूमिका स्पष्ट छैन। आउनुहोस् `प्रान्त/राज्य` स्तम्भमा रहेका विभिन्न मानहरू हेर्नुहोस्:\n"
] ]
}, },
{ {
@ -322,7 +322,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"नामहरूबाट हामीले पत्ता लगाउन सक्छौं कि अस्ट्रेलिया र चीन जस्ता देशहरूको प्रान्तहरू द्वारा अधिक विस्तृत विवरण छ। उदाहरण हेर्ने हो भने चीनको जानकारी खोजौं:\n" "नामहरूबाट हामी निस्कर्ष निकाल्न सक्छौं कि अष्ट्रेलिया र चीनजस्ता देशहरूसँग प्रान्तहरूद्वारा अझ विस्तृत विवरणहरू छन्। उदाहरण हेर्न चीनको बारेमा जानकारी खोजौं:\n"
] ]
}, },
{ {
@ -1321,9 +1321,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## डाटा पूर्व-संसोधन\n", "## डाटालाई पूर्व-संसाधन गर्नुहोस् \n",
"\n", "\n",
"हामी देशहरूलाई थप क्षेत्रहरूमा विभाजन गर्न इच्छुक छैनौं, त्यसैले हामीले पहिला यस विभाजनलाई हटाएर सबै क्षेत्रहरूको जानकारी सँगै थप्नेछौं, ताकि सम्पूर्ण देशको जानकारी प्राप्त गर्न सकियोस्। यो `groupby` प्रयोग गरेर गर्न सकिन्छ:\n" "हामीलाई देशहरूलाई थप क्षेत्रमा विभाजन गर्नुमा चासो छैन, त्यसैले हामीले पहिले यो विभाजन हटाएर सबै क्षेत्रहरूको जानकारी सँगै थप्नेछौं, जसले पूरा देशको जानकारी प्राप्त गर्न सकिन्छ। यो `groupby` प्रयोग गरेर गर्न सकिन्छ:\n"
] ]
}, },
{ {
@ -1578,7 +1578,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"तपाईंले देख्न सक्नुहुन्छ कि `groupby` प्रयोग गर्दा सबै DataFrames अब Country/Region द्वारा सूचकांकित छन्। यसरी हामी `.loc` प्रयोग गरेर कुनै विशेष देशको डेटा पहुँच गर्न सक्छौं:|\n" "तपाईं देख्न सक्नुहुन्छ कि `groupby` प्रयोग गरेर सबै DataFrames अब देश/क्षेत्र द्वारा अनुक्रमांकित भएका छन्। त्यसैले हामी `.loc` प्रयोग गरेर कुनै विशेष देशको डाटा पहुँच गर्न सक्दछौं:|\n"
] ]
}, },
{ {
@ -1607,7 +1607,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"> **नोट** हामीले `[3:]` कसरी प्रयोग गर्छौं भनेर हेर्नुहोस् जुन पहिलो तीन तत्वहरू हटाउन प्रयोग हुन्छ जुन गैर-मिति मेटाडेटा (प्रदेश/राज्य र भौगोलिक स्थानका स्तम्भहरू) समावेश गर्छ। हामी ती तीन स्तम्भहरू पूरै हटाउन पनि सक्छौं:\n" "> **नोट** कसरी हामी `[3:]` प्रयोग गर्छौं पहिलो तीन तत्वहरू हटाउनको लागि जुन गैर-डेटा मेटाडेटा (प्रोभिन्स/राज्य र भौगोलिक अवस्थिति स्तम्भहरू) राख्छन्। हामी ती तीन स्तम्भहरू पूर्ण रूपमा पनि हटाउन सक्छौं:\n"
] ]
}, },
{ {
@ -1625,9 +1625,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## डाटा अनुसन्धान गर्दै\n", "## डाटाको अनुसन्धान गर्दै\n",
"\n", "\n",
"अब हामी ए विशेष देशको अनुसन्धानमा सर्नेछौं। मिति अनुसार सूचीकृत संक्रमणहरुको डाटा भएको फ्रेम बनाऔं:\n" "अब हामी एउटा विशेष देशको अनुसन्धानमा सर्छौं। मिति अनुसार सूचीकृत संक्रमणसम्बन्धी डाटा भएको एउटा फ्रेम बनाऔं:\n"
] ]
}, },
{ {
@ -1793,7 +1793,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"अब हामी हरेक दिन नयाँ संक्रमित व्यक्तिहरुको संख्या गणना गरौं। यसले हामीलाई महामारी कतिको छिटो फैलिन्छ देखाउन मद्दत गर्नेछ। यसका लागि सबैभन्दा सजिलो तरिका `diff` प्रयोग गर्नु हो:\n" "अब हेरौं प्रत्येक दिन नयाँ संक्रमित व्यक्तिहरूको संख्या कति हुन्छ सो गणना गरौं। यसले हामीलाई महामारी कतिको छिटो अघि बढ्दैछ देखाउन मद्दत गर्नेछ। यो गर्न सबैभन्दा सजिलो तरिका भनेको `diff` प्रयोग गर्नु हो:\n"
] ]
}, },
{ {
@ -1823,7 +1823,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"हामी डाटामा उच्च उतारचढाव देख्न सक्छौं। आउनुहोस्, महिनाहरू मध्ये एउटामा नजिकबाट हेरौं:\n" "हामीले डाटामा उच्च उतार-चढावहरू देख्न सक्छौं। आउनुस्, महिनामध्ये एकमा नजिकबाट हेर्नुहोस्:\n"
] ]
}, },
{ {
@ -1852,7 +1852,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"स्पष्ट रूपमा देखिन्छ कि डाटामा साप्ताहिक उतार-चढावहरू छन्। किनभने हामी प्रवृत्तिहरू देख्न सक्षम हुन चाहन्छौं, त्यसैले रुनिङ औसत गणना गरेर वक्रलाई समतल बनाउनु उचित हुन्छ (अर्थात प्रत्येक दिनका लागि हामीले पहिलेका केहि दिनहरूको औसत मान गणना गर्नेछौं):\n" "डेटा मा साप्ताहिक उतार-चढाव स्पष्ट छ। किनभने हामी ट्रेन्डहरू देख्न चाहन्छौं, त्यसैले रुनिङ्ग औसत गणना गरेर वक्रलाई समतल बनाउनु उचित हुन्छ (अर्थात् हरेक दिनका लागि हामी अघिल्ला केहि दिनहरूको औसत मूल्य गणना गर्नेछौं):\n"
] ]
}, },
{ {
@ -1882,7 +1882,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"धेरै देशहरूलाई तुलना गर्न सक्षम हुनको लागि, हामी देशको जनसंख्यालाई ध्यानमा राख्न चाहन सक्छौं, र संक्रमित व्यक्तिहरूको प्रतिशतलाई देशको जनसंख्याको सन्दर्भमा तुलना गर्न सक्छौं। देशको जनसंख्या पाउनको लागि, देशहरूको डेटासेट लोड गरौं:\n" "केहि देशहरूलाई तुलना गर्न सक्षम हुनका लागि, हामीले देशको जनसंख्या विचार गर्न चाहान सक्छौं, र देशको जनसंख्याको सन्दर्भमा सङ्क्रमित व्यक्तिहरूको प्रतिशत तुलना गर्न चाहान सक्छौं। देशको जनसंख्या प्राप्त गर्नका लागि, देशहरूको डेटासेट लोड गरौं:\n"
] ]
}, },
{ {
@ -2153,7 +2153,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"किनभने यस डाटासेटमा देशहरू र प्रान्तहरू दुवैको तथ्याङ्क समावेश छ, सम्पूर्ण देशको जनसंख्या पाउन हामीलाई अलिकति चतुर हुन आवश्यक छ:\n" "किनभने यो डेटासेटले देशहरू र प्रान्तहरू दुबैको जानकारी समावेश गर्दछ, त्यसैले सम्पूर्ण देशको जनसंख्या पाउन हामीलाई अलिकति चतुर हुन आवश्यक छ: \n"
] ]
}, },
{ {
@ -2261,14 +2261,15 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## कम्प्युटिङ $R_t$\n",
"\n", "\n",
"रोग कति सङ्क्रमक छ हेर्नको लागि, हामी **मूल पुनरुत्पादन संख्या** $R_0$ हेर्छौं, जसले सङ्क्रमित व्यक्तिले थप कति व्यक्तिलाई सङ्क्रमण गर्ने संकेत गर्दछ। जब $R_0$ १ भन्दा बढी हुन्छ, महामारी फैलिने सम्भावना हुन्छ।\n", "## $R_t$ को गणना\n",
"\n", "\n",
"$R_0$ रोगको आफ्नै विशेषता हो, र मानिसहरूले महामारीलाई ढिलाइ गर्नका लागि लिएका केहि सुरक्षा उपायहरूलाई ध्यानमा राख्दैन। महामारीको प्रगतिक्रममा, हामी समय $t$ मा पुनरुत्पादन संख्या $R_t$ को अनुमान गर्न सक्छौं। देखाइएको छ कि यो संख्या करिब ८ दिनको विन्डो लिएर तलको सूत्रबाट अनुमान लगाउन सकिन्छ: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n", "रोग कति सङ्क्रमण गर्छ भनेर हेर्न, हामी **मूल प्रजनन संख्या** $R_0$ मा हेरौं, जसले सङ्क्रमित व्यक्तिले थप कति व्यक्तिलाई संक्रमण गराउने देखाउँछ। जब $R_0$ १ भन्दा बढिको हुन्छ, महामारी फैलनसक्ने सम्भावना हुन्छ।\n",
"\n",
"$R_0$ रोगको आफ्नै विशेषता हो, र यसले महामारीलाई ढिलो बनाउने मानिसहरूले गर्न सक्ने केही सुरक्षात्मक उपायहरूलाई ध्यानमा राख्दैन। महामारीको प्रगतिको समयमा, हामी कुनै पनि दिइएको समय $t$ मा प्रजनन संख्या $R_t$ को अनुमान गर्न सक्छौं। देखाइएको छ कि यो संख्या ८ दिनको एउटा विन्डो लिएर लगभग अनुमान गर्न सकिन्छ, र गणना गर्न $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"जहाँ $I_t$ दिन $t$ मा नयाँ सङ्क्रमित व्यक्तिहरुको संख्या हो।\n", "जहाँ $I_t$ दिन $t$ मा नयाँ सङ्क्रमित व्यक्तिहरुको संख्या हो।\n",
"\n", "\n",
"हाम्रो महामारी डेटाको लागि $R_t$ गणना गरौं। यसका लागि, हामी ८ `ninfected` मानहरूको एउटा रोलिङ विन्डो लिने छौं, र माथिको अनुपात गणना गर्नको लागि सो फंक्शन लागू गर्ने छौं:\n" "हाम्रो महामारी डेटा को लागि $R_t$ गणना गरौँ। यो गर्नका लागि, हामी ८ `ninfected` मानहरूको रोलिङ विन्डो लिनेछौं, र माथिको अनुपात गणना गर्न फलन लागू गर्नेछौं:\n"
] ]
}, },
{ {
@ -2298,9 +2299,9 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"तपाईंले देख्न सक्नुहुन्छ कि ग्राफमा केही खाली ठाउँहरू छन्। ती `NaN` बाट हुन सक्छन्, यदि `inf` मानहरू डेटासेटमा उपस्थित छन् भने। `inf` शून्यले भाग गरेपछि हुन सक्छ, र `NaN` ले हराएका डाटा हुन सक्छ वा परिणाम गणना गर्न उपलव्ध डाटा नभएको संकेत दिन्छ (हाम्रो फ्रेमको सुरुमा जस्तै, जहाँ चौडाइ ८ को रोलिङ विन्डो अझै उपलब्ध छैन)। ग्राफलाई राम्रो बनाउन, हामीले ती मानहरूलाई `replace` र `fillna` फंक्शन प्रयोग गरेर भर्नुपर्ने हुन्छ।\n", "तपाईंले देख्न सक्नुहुन्छ कि ग्राफमा केही खाली ठाउँहरू छन्। ती `NaN` वा `inf` मानहरू डेटासेटमा उपस्थित हुँदा हुन सक्छन्। `inf` सिफारिस शून्यद्वारा भाग गर्दा हुन सक्छ, र `NaN` ले अभाव डेटा वा नतिजा गणना गर्न उपलब्ध डेटा नहुन सक्छ (जस्तै हाम्रो फ्रेमको सुरुमा, जहाँ चौडाइ ८ को र rolling विन्डो अहिलेसम्म उपलब्ध छैन)। ग्राफलाई राम्रो बनाउन, हामीले ती मानहरू `replace` र `fillna` फंक्शनको प्रयोग गरेर भर्नु पर्छ।\n",
"\n", "\n",
"हामी महामारीको शुरुवातलाई अझै हेर्न जाऔं। हामी y-अक्षको मानहरूलाई ६ भन्दा कम मात्र देखाउन सीमित गर्नेछौं, ताकि राम्रोसँग देख्न सकियोस्, र १ मा एक तेर्सो रेखा तान्नेछौं।\n" "आउनुहोस् महामारीको सुरुवातलाई अझ अगाडि हेरौं। हामी y-अक्षका मानहरू ६ भन्दा तल मात्र देखाउन सीमित गर्नेछौं, राम्रोसँग देख्नको लागि, र १ मा एक तेर्सो रेखा तान्नेछौं।\n"
] ]
}, },
{ {
@ -2331,7 +2332,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"महामारीको अर्को रोचक सूचक हो **डेरिभेटिभ**, वा नयाँ घटनाहरूमा **दैनिक भिन्नता**। यसले हामीलाई स्पष्ट रूपमा देखाउन मद्दत गर्दछ कहिले महामारी बढिरहेको छ वा घटिरहेको छ।\n" "महामारीको अर्को रोचक संकेतक भनेको **व्युत्पन्न**, वा नयाँ केसहरूमा **दैनिक भिन्नता** हो। यसले हामीलाई महामारी बढिरहेको छ वा घटिरहेको छ भनेर स्पष्ट रूपमा हेर्न अनुमति दिन्छ \n"
] ]
}, },
{ {
@ -2360,7 +2361,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"रिपोर्टिङबाट उत्पन्न धेरै उतार-चढावहरू भएको तथ्यलाई हेर्दा, समग्र तस्वीर पाउनका लागि रोलिङ औसत चलाएर वक्रलाई सहज बनाउनु उपयुक्त हुन्छ। फेरि महामारीको पहिलो महिनाहरूमा ध्यान केन्द्रित गरौं:\n" "रिपोर्टिङका कारण डाटामा धेरै उतारचढावहरू हुने तथ्यलाई ध्यानमा राख्दै, समग्र चित्र पाउन रोलिंग औसत चलाएर घुमाउरो रेखालाई स्मूथ बनाउन अर्थपूर्ण हुन्छ। फेरि महामारीको पहिलो महिनाहरूमा केन्द्रित गरौं:\n"
] ]
}, },
{ {
@ -2390,26 +2391,27 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"\n",
"## चुनौती\n", "## चुनौती\n",
"\n", "\n",
"अब तपाईंले कोड र डाटासँग अझ धेरै खेल्ने समय हो! यहाँ केही सुझावहरू छन् जुन तपाईंले प्रयोग गरेर हेर्न सक्नुहुन्छ:\n", "अब तपाईंको लागि कोड र डाटासँग थप खेल्ने समय आएको छ! यहाँ केही सुझावहरू छन् जुन तपाईंले प्रयास गर्न सक्नुहुन्छ:\n",
"* विभिन्न देशहरूमा महामारीको फैलावट हेर्नुहोस्।\n", "* महामारी विभिन्न देशहरूमा कस्तो फैलिएको छ हेर्नुहोस्।\n",
"* तुलनाका लागि एउटै ग्राफमा धेरै देशहरूको $R_t$ ग्राफहरू प्लट गर्नुहोस्, वा सँगै धेरै प्लटहरू बनाउनुहोस्।\n", "* तुलना गर्नका लागि विभिन्न देशहरूको $R_t$ ग्राफहरू एउटै ग्राफमा प्लट गर्नुहोस्, वा साइड-बाइ-साइड केही ग्राफहरू बनाउनुस्।\n",
"* मृत्युदर र निको हुने दर कति संक्रमित घटनासँग सम्बन्धित छ हेर्नुस्।\n", "* संक्रमित घटनाहरूको संख्या र मृत्यु तथा निको हुनेहरूको संख्या कसरी सम्बन्धित छन् हेर्नुहोस्।\n",
"* संक्रमण दर र मृत्यु दरलाई दृश्य रूपमा सम्बन्धित गरेर एक सामान्य रोग कति समय सम्म रहन्छ पत्ता लगाउने प्रयास गर्नुहोस् र केही विसंगतिहरू खोज्नुहोस्। तपाईंले त्यो पत्ता लगाउनका लागि विभिन्न देशहरू हेर्नुपर्ने हुन सक्छ।\n", "* संक्रमण दर र मृत्यु दर दृश्यात्मक रूपमा तुलना गरेर र केही अनियमितताहरू खोजेर सामान्य रोगको अवधि कति लामो हुन्छ पत्ता लगाउने प्रयास गर्नुहोस्। त्यो पत्ता लगाउन तपाईंले विभिन्न देशहरू हेरिनुपर्ने हुन सक्छ।\n",
"* मृत्यु दर गणना गर्नुहोस् र यो समयक्रममा कसरी परिवर्तन हुन्छ हेर्नुहोस्। गणनाहरू अघि एउटा समय श्रृंखलालाई सार्न रोगको अवधि दिनहरूमा विचार गर्न सक्नुहुन्छ।\n" "* मृत्युदर गणना गर्नुहोस् र यो समयसँग कसरी परिवर्तन हुन्छ हेर्नुहोस्। गणनाहरू अघि तपाईंले रोगको अवधि दिनहरूमा लिन सोच्न सक्नुहुन्छ र एक टाइम सिरिजलाई सार्न सक्नुहुन्छ।\n"
] ]
}, },
{ {
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"## References\n", "## सन्दर्भहरू\n",
"\n", "\n",
"तपाईं निम्न प्रकाशनहरूमा COVID महामारीको फैलावटको थप अध्ययन हेर्न सक्नुहुन्छ:\n", "तपाईं निम्न प्रकाशनहरूमा COVID महामारीको फैलावटका थप अध्ययनहरू हेर्न सक्नुहुन्छ:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ब्लग पोस्ट द्वारा [Dmitry Soshnikov](http://soshnikov.com)\n", "* [COVID महामारीको दौरान Rt अनुमानको लागि स्लाइडिङ SIR मोडेल](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ब्लग पोस्ट [Dmitry Soshnikov](http://soshnikov.com) द्वारा\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n", "* T.Petrova, D.Soshnikov, A.Grunin. [वैश्विक COVID-19 प्रकोपको लागि समय-निर्भर पुनरुत्पादन संख्या अनुमान](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Code for the above paper on GitHub](https://github.com/shwars/SlidingSIR)\n" "* [माथिको पेपरको लागि GitHub मा कोड](https://github.com/shwars/SlidingSIR)\n"
] ]
}, },
{ {
@ -2423,7 +2425,7 @@
"cell_type": "markdown", "cell_type": "markdown",
"metadata": {}, "metadata": {},
"source": [ "source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**: \nयस दस्तावेज़लाई AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरी अनुवाद गरिएको छ। हामी शुद्धतामा प्रयासरत भए पनि, कृपया जानकार रहनुहोस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। मूल दस्तावेज़लाई यसको मूल भाषामा अधिकारिक स्रोत मान्नु पर्छ। महत्वपूर्ण जानकारीका लागि व्यावसायिक मानव अनुवाद अनुशंसित छ। यस अनुवादको प्रयोगबाट उत्पन्न भएका कुनै पनि गलतफहमी वा गलत व्याख्याहरूका लागि हामी जिम्मेवार हुँदैनौँ।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n" "---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**अस्वीकरण**:\nयो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको हो। हामी सही हुन प्रयास गर्छौं, तर कृपया जानकार हुनुस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। मूल दस्तावेज़ यसको मूल भाषामा आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीका लागि व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न कुनै पनि गलत बुझाइ वा त्रुटिको लागि हामी जिम्मेवार छैनौं।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
] ]
} }
], ],

@ -1,31 +1,33 @@
# डेंजरस लिआइजन्स डेटा भिजुअलाइजेसन प्रोजेक्ट # डेंजरस लियाजन्स डेटा भिजुअलाइजेशन परियोजना
सुरु गर्नका लागि, तपाईंको मेसिनमा NPM र Node चलिरहेको सुनिश्चित गर्नुहोस्। निर्भरता (npm install) स्थापना गर्नुहोस् र त्यसपछि प्रोजेक्टलाई स्थानीय रूपमा चलाउनुहोस् (npm run serve): सुरु गर्नका लागि, तपाईंले आफ्नो मेसिनमा NPM र Node **>=20.0.0** चलेको छ भनेर सुनिश्चित गर्नुपर्नेछ। निर्भरता स्थापना गर्न (npm install) र त्यसपछि परियोजना लोकल रन गर्न (npm run serve) गर्नुहोस्:
## प्रोजेक्ट सेटअप ## परियोजना सेटअप
``` ```
npm install npm install
``` ```
### विकासका लागि कम्पाइल र हट-रिलोड ### विकासका लागि कम्पाइल र हट-रिलोड गर्दछ
``` ```
npm run serve npm run serve
``` ```
### उत्पादनका लागि कम्पाइल र मिनिफाइ ### उत्पादनका लागि कम्पाइल र मिनिफाइ हुन्छ
``` ```
npm run build npm run build
``` ```
### फाइलहरू लिन्ट र फिक्स गर्छ ### फाइलहरू लिन्ट र सुधार गर्
``` ```
npm run lint npm run lint
``` ```
### कन्फिगरेसन अनुकूलन गर्नुहोस् ### कन्फिगरेसन अनुकूलन गर्नुहोस्
[Configuration Reference](https://cli.vuejs.org/config/) हेर्नुहोस् हेर्नुहोस् [Configuration Reference](https://cli.vuejs.org/config/)।
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**: **अस्वीकरण**:
यो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको छ। हामी शुद्धताको लागि प्रयास गर्छौं, तर कृपया ध्यान दिनुहोस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छ। यसको मूल भाषा मा रहेको मूल दस्तावेज़लाई आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीको लागि, व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न हुने कुनै पनि गलतफहमी वा गलत व्याख्याको लागि हामी जिम्मेवार हुने छैनौं। यो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको हो। हामी सही हुन प्रयास गर्छौं, तर कृपया जानकार हुनुस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। मूल दस्तावेज़ यसको मूल भाषामा आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीका लागि व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न कुनै पनि गलत बुझाइ वा त्रुटिको लागि हामी जिम्मेवार छैनौं।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# डेंजरस लिआइजन्स डेटा भिजुअलाइजेसन प्रोजेक्ट # डेंजरस लियाजोंस डेटा भिजुअलाइजेशन प्रोजेक्ट
सुरु गर्नका लागि, तपाईंको मेसिनमा NPM र Node चलिरहेको सुनिश्चित गर्नुहोस्। निर्भरता (npm install) स्थापना गर्नुहोस् र त्यसपछि प्रोजेक्टलाई स्थानीय रूपमा चलाउनुहोस् (npm run serve): सुरु गर्नको लागि, तपाईंले तपाईंको मेसिनमा NPM र Node **>=20.0.0** चलिरहेको छ भनी सुनिश्चित गर्नु पर्छ। निर्भरता स्थापना गर्नुहोस् (npm install) र त्यसपछि प्रोजेक्टलाई स्थानीय रूपमा चलाउनुहोस् (npm run serve):
## प्रोजेक्ट सेटअप ## प्रोजेक्ट सेटअप
``` ```
npm install npm install
``` ```
### विकासक लागि कम्पाइल र हट-रिलोड ### विकासक लागि कम्पाइल र हट-रिलोड गर्दछ
``` ```
npm run serve npm run serve
``` ```
### उत्पादनक लागि कम्पाइल र मिनिफाइ ### उत्पादनक लागि कम्पाइल र मिनिफाइ गर्दछ
``` ```
npm run build npm run build
``` ```
### फाइलहरू लिन्ट र फिक्स गर्छ ### फाइलहरूलाई लिन्ट र फिक्स गर्
``` ```
npm run lint npm run lint
``` ```
### कन्फिगरेसन अनुकूलन गर्नुहोस् ### कन्फिगरेसन अनुकूलन गर्नुहोस्
[Configuration Reference](https://cli.vuejs.org/config/) हेर्नुहोस् हेर्नुहोस् [Configuration Reference](https://cli.vuejs.org/config/)।
--- ---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**अस्वीकरण**: **अस्वीकरण**:
यो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरी अनुवाद गरिएको हो। हामी यथासम्भव शुद्धता सुनिश्चित गर्न प्रयास गर्छौं, तर कृपया ध्यान दिनुहोस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। यसको मूल भाषामा रहेको मूल दस्तावेज़लाई आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीका लागि, व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न हुने कुनै पनि गलतफहमी वा गलत व्याख्याका लागि हामी जिम्मेवार हुने छैनौं। यो दस्तावेज़ AI अनुवाद सेवा [Co-op Translator](https://github.com/Azure/co-op-translator) प्रयोग गरेर अनुवाद गरिएको हो। हामी सही हुन प्रयास गर्छौं, तर कृपया जानकार हुनुस् कि स्वचालित अनुवादमा त्रुटिहरू वा अशुद्धताहरू हुन सक्छन्। मूल दस्तावेज़ यसको मूल भाषामा आधिकारिक स्रोत मानिनुपर्छ। महत्वपूर्ण जानकारीका लागि व्यावसायिक मानव अनुवाद सिफारिस गरिन्छ। यस अनुवादको प्रयोगबाट उत्पन्न कुनै पनि गलत बुझाइ वा त्रुटिको लागि हामी जिम्मेवार छैनौं।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save