[pa,pt-PT,pt-BR] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Punjabi (Gurmukhi) [pa], Portuguese (Portugal) [pt-PT], Portuguese (Brazil) [pt-BR]
update-translations
localizeflow[bot] 6 days ago
parent e14f7a5142
commit 75f07a4e35

@ -12,8 +12,8 @@
"language_code": "pa"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T09:19:18+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:55:44+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "pa"
},
@ -42,8 +42,8 @@
"language_code": "pa"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-06T08:20:10+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T22:02:32+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "pa"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "pa"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:56:58+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pa"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-27T17:02:23+00:00",
@ -108,8 +114,8 @@
"language_code": "pa"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T09:21:32+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:55:03+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "pa"
},
@ -192,14 +198,14 @@
"language_code": "pa"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-27T18:16:17+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:02:42+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "pa"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-27T18:15:49+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:02:37+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "pa"
},

File diff suppressed because one or more lines are too long

@ -1,76 +1,79 @@
# ਡਾਟਾ ਦੀ ਪਰਿਭਾਸ਼
# ਡੇਟਾ ਦੀ ਪਰਿਭਾਸ਼ਾ ਕਰਨ
|![ [(@sketchthedocs)](https://sketchthedocs.dev) ਦੁਆਰਾ ਬਣਾਈ ਗਈ ਸਕੈਚਨੋਟ ](../../sketchnotes/03-DefiningData.png)|
|![ ਸਕੈਚਨੋਟ ਦੁਆਰਾ [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|ਡਾਟਾ ਦੀ ਪਰਿਭਾਸ਼ਾ - _[@nitya](https://twitter.com/nitya) ਦੁਆਰਾ ਸਕੈਚਨੋਟ_ |
|ਡੇਟਾ ਦੀ ਪਰਿਭਾਸ਼ਾ - _ਸਕੈਚਨੋਟ ਦੁਆਰਾ [@nitya](https://twitter.com/nitya)_ |
ਾਟਾ ਤਥਿਆਂ, ਜਾਣਕਾਰੀ, ਅਵਲੋਕਨ ਅਤੇ ਮਾਪਾਂ ਦਾ ਸੰਗ੍ਰਹਿ ਹੈ ਜੋ ਖੋਜਾਂ ਕਰਨ ਅਤੇ ਜਾਣਕਾਰੀ ਦੇ ਆਧਾਰ 'ਤੇ ਫੈਸਲੇ ਲੈਣ ਲਈ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ। ਡਾਟਾ ਪੌਇੰਟ ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ ਇੱਕ ਇਕਾਈ ਹੁੰਦੀ ਹੈ, ਜੋ ਡਾਟਾ ਪੌਇੰਟਸ ਦਾ ਸੰਗ੍ਰਹਿ ਹੁੰਦਾ ਹੈ। ਡਾਟਾ ਸੈੱਟ ਵੱਖ-ਵੱਖ ਫਾਰਮੈਟ ਅਤੇ ਬਣਤਰਾਂ ਵਿੱਚ ਆ ਸਕਦੇ ਹਨ ਅਤੇ ਆਮ ਤੌਰ 'ਤੇ ਇਸਦੇ ਸਰੋਤ ਜਾਂ ਡਾਟਾ ਕਿੱਥੋਂ ਆਇਆ ਹੈ, ਇਸ 'ਤੇ ਆਧਾਰਿਤ ਹੁੰਦੇ ਹਨ। ਉਦਾਹਰਣ ਲਈ, ਇੱਕ ਕੰਪਨੀ ਦੀ ਮਹੀਨਾਵਾਰ ਕਮਾਈ ਇੱਕ ਸਪ੍ਰੈਡਸ਼ੀਟ ਵਿੱਚ ਹੋ ਸਕਦੀ ਹੈ ਪਰ ਇੱਕ ਸਮਾਰਟਵਾਚ ਤੋਂ ਘੰਟਾਵਾਰ ਦਿਲ ਦੀ ਧੜਕਨ ਦਾ ਡਾਟਾ [JSON](https://stackoverflow.com/a/383699) ਫਾਰਮੈਟ ਵਿੱਚ ਹੋ ਸਕਦਾ ਹੈ। ਡਾਟਾ ਵਿਗਿਆਨੀਆਂ ਲਈ ਇੱਕ ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਕਿਸਮਾਂ ਦੇ ਡਾਟਾ ਨਾਲ ਕੰਮ ਕਰਨਾ ਆਮ ਗੱਲ ਹੈ।
ੇਟਾ ਸੱਚਾਈਆਂ, ਜਾਣਕਾਰੀਆਂ, ਦੇਖਣੀਆਂ ਅਤੇ ਮਾਪਣ ਹਨ ਜੋ ਖੋਜ ਕਰਨ ਅਤੇ ਸੁਝਾਈ ਗਈ ਫੈਸਲਿਆਂ ਦਾ ਸਮਰਥਨ ਕਰਨ ਲਈ ਵਰਤੇ ਜਾਂਦੇ ਹਨ। ਇੱਕ ਡੇਟਾ ਪੌਇੰਟ ਡੇਟਾਸੈੱਟ ਵਿੱਚ ਇੱਕ ਇਕਾਈ ਹੁੰਦਾ ਹੈ, ਜੋ ਕਿ ਡੇਟਾ ਪੌਇੰਟਾਂ ਦਾ ਇਕ ਸੰਗ੍ਰਹਿ ਹੁੰਦਾ ਹੈ। ਡੇਟਾਸੈੱਟ ਵੱਖ-ਵੱਖ ਫਾਰਮੈਟਾਂ ਅਤੇ ਸੰਰਚਨਾਵਾਂ ਵਿੱਚ ਆ ਸਕਦੇ ਹਨ, ਅਤੇ ਆਮ ਤੌਰ 'ਤੇ ਇਹ ਉਸਦੇ ਸਰੋਤ ਜਾਂ ਜਿਸ ਥਾਂ ਤੋਂ ਡੇਟਾ ਆਇਆ ਹੈ ਉਸ 'ਤੇ ਆਧਾਰਿਤ ਹੁੰਦੇ ਹਨ। ਉਦਾਹਰਣ ਲਈ, ਇੱਕ ਕੰਪਨੀ ਦੀ ਮਹੀਨਾਵਾਰ ਕਮਾਈ ਸਪ੍ਰੈਡਸ਼ੀਟ ਵਿੱਚ ਹੋ ਸਕਦੀ ਹੈ ਪਰ ਸਮਾਰਟਵੌਚ ਤੋਂ ਘੰਟਾਵਾਰ ਦਿਲ ਦੀ ਧੜਕਨ ਦਾ ਡੇਟਾ [JSON](https://stackoverflow.com/a/383699) ਫਾਰਮੈਟ ਵਿੱਚ ਹੋ ਸਕਦਾ ਹੈ। ਡੇਟਾ ਵਿਗਿਆਨੀਆਂ ਲਈ ਇੱਕ ਡੇਟਾਸੈੱਟ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਕਿਸਮਾਂ ਦੇ ਡੇਟਾ ਨਾਲ ਕੰਮ ਕਰਨਾ ਆਮ ਗੱਲ ਹੈ।
ਇਹ ਪਾਠ ਡਾਟਾ ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਅਤੇ ਇਸਦੇ ਸਰੋਤਾਂ ਦੁਆਰਾ ਡਾਟਾ ਦੀ ਪਛਾਣ ਅਤੇ ਵਰਗੀਕਰਨ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦਾ ਹੈ।
ਇਹ ਪਾਠ ਇਸ ਗੱਲ 'ਤੇ ਕੇਂਦਰਿਤ ਹੈ ਕਿ ਡੇਟਾ ਨੂੰ ਉਸਦੀ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਅਤੇ ਸਰੋਤਾਂ ਦੁਆਰਾ ਕਿਵੇਂ ਪਛਾਣਿਆ ਅਤੇ ਵਰਗੀਕ੍ਰਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।
## [ਪ੍ਰੀ-ਲੈਕਚਰ ਕਵਿਜ਼](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## [ਪ੍ਰੀ-ਲੈਕਚਰ ਕੁਇਜ਼](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## ਡੇਟਾ ਕਿਵੇਂ ਵਰਣਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ
## ਡਾਟਾ ਕਿਵੇਂ ਵਰਣਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ
### ਕੱਚਾ ਡੇਟਾ
ਕੱਚਾ ਡੇਟਾ ਉਹ ਡੇਟਾ ਹੈ ਜੋ ਆਪਣੇ ਸਰੋਤ ਤੋਂ ਆਪਣੀ ਸ਼ੁਰੂਆਤੀ ਹਾਲਤ ਵਿੱਚ ਆਇਆ ਹੈ ਅਤੇ ਜਿਸ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਜਾਂ ਵਿਵਸਥਾ ਨਹੀਂ ਕੀਤੀ ਗਈ। ਇੱਕ ਡੇਟਾਸੈੱਟ ਵਿੱਚ ਕੀ ਹੋ ਰਿਹਾ ਹੈ ਨੂੰ ਸਮਝਣ ਲਈ, ਇਸਨੂੰ ਇੱਕ ਐਸੇ ਫਾਰਮੈਟ ਵਿੱਚ ਵਿਵਸਥਿਤ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਜੋ ਮਨੁੱਖਾਂ ਅਤੇ ਉਹ ਤਕਨਾਲੋਜੀ ਦੂਆਰਾ ਸਮਝਿਆ ਜਾ ਸਕੇ ਜੋ ਇਸ ਦਾ ਹੋਰ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਦੇ ਹਨ। ਡੇਟਾਸੈੱਟ ਦੀ ਸੰਰਚਨਾ ਇਸ ਦੀ ਵਿਵਸਥਾ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ ਅਤੇ ਇਸਨੂੰ ਸੰਗਠਿਤ, ਅਸੰਰਚਿਤ ਅਤੇ ਅਰਧ-ਸੰਰਚਿਤ ਵਜੋਂ ਵਰਗੀਕ੍ਰਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਸੰਰਚਨਾਵਾਂ ਸਰੋਤ ਦੇ ਅਨੁਸਾਰ ਵੱਖ-ਵੱਖ ਹੋ ਸਕਦੀਆਂ ਹਨ ਪਰ ਅੰਤ ਵਿੱਚ ਇਹਨ੍ਹਾਂ ਤਿੰਨ ਸ਼੍ਰੇਣੀਆਂ ਵਿੱਚ ਆਉਂਦੀਆਂ ਹਨ।
### ਕੱਚਾ ਡਾਟਾ
ਕੱਚਾ ਡਾਟਾ ਉਹ ਡਾਟਾ ਹੁੰਦਾ ਹੈ ਜੋ ਆਪਣੇ ਸਰੋਤ ਤੋਂ ਆਪਣੇ ਸ਼ੁਰੂਆਤੀ ਰੂਪ ਵਿੱਚ ਆਇਆ ਹੈ ਅਤੇ ਇਸਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਜਾਂ ਸੰਗਠਨ ਨਹੀਂ ਕੀਤਾ ਗਿਆ। ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ ਕੀ ਹੋ ਰਿਹਾ ਹੈ ਇਸਦਾ ਅਰਥ ਸਮਝਣ ਲਈ, ਇਸਨੂੰ ਇੱਕ ਐਸੇ ਫਾਰਮੈਟ ਵਿੱਚ ਸੰਗਠਿਤ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਜੋ ਮਨੁੱਖਾਂ ਅਤੇ ਉਹਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੀ ਤਕਨਾਲੋਜੀ ਦੁਆਰਾ ਸਮਝਿਆ ਜਾ ਸਕੇ। ਡਾਟਾ ਸੈੱਟ ਦੀ ਬਣਤਰ ਇਸਦੀ ਸੰਗਠਨ ਨੂੰ ਵਰਣਨ ਕਰਦੀ ਹੈ ਅਤੇ ਇਸਨੂੰ ਸੰਗਠਿਤ, ਅਸੰਗਠਿਤ ਅਤੇ ਅਰਧ-ਸੰਗਠਿਤ ਵਜੋਂ ਵਰਗੀਕਰਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਇਹ ਬਣਤਰਾਂ ਸਰੋਤ ਦੇ ਆਧਾਰ 'ਤੇ ਵੱਖ-ਵੱਖ ਹੋ ਸਕਦੀਆਂ ਹਨ ਪਰ ਆਖਿਰਕਾਰ ਇਹ ਤਿੰਨ ਸ਼੍ਰੇਣੀਆਂ ਵਿੱਚ ਫਿੱਟ ਹੁੰਦੀਆਂ ਹਨ
### ਮਾਤਰਾਤਮਕ ਡੇਟਾ
ਮਾਤਰਾਤਮਕ ਡੇਟਾ ਡੇਟਾਸੈੱਟ ਵਿੱਚ ਗਿਣਤੀਬੱਧ ਨਿਰੀਖਣ ਹੁੰਦੇ ਹਨ ਅਤੇ ਆਮ ਤੌਰ 'ਤੇ ਵਿਸ਼ਲੇਸ਼ਣ, ਮਾਪ ਅਤੇ ਗਣਿਤੀਕ ਤੌਰ 'ਤੇ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਮਾਤਰਾਤਮਕ ਡੇਟਾ ਦੇ ਕੁਝ ਉਦਾਹਰਨ ਹਨ: ਇੱਕ ਦੇਸ਼ ਦੀ ਆਬਾਦੀ, ਕਿਸੇ ਵਿਅਕਤੀ ਦੀ ਲੰਬਾਈ ਜਾਂ ਇੱਕ ਕੰਪਨੀ ਦੀ ਤਿਮਾਹੀ ਕਮਾਈ। ਕੁਝ ਹੋਰ ਵਿਸ਼ਲੇਸ਼ਣ ਨਾਲ, ਮਾਤਰਾਤਮਕ ਡੇਟਾ ਨੂੰ ਹਵਾ ਮਿਆਰੀ ਅੰਕ (AQI) ਦੇ ਮੌਸਮੀ ਰੁਝਾਨਾਂ ਨੂੰ ਖੋਜਣ ਲਈ ਜਾਂ ਆਮ ਕੰਮ ਦੇ ਦਿਨ ਦੌਰਾਨ ਰਸ਼ ਆਵਰ ਟ੍ਰੈਫਿਕ ਦੀ ਸੰਭਾਵਨਾ ਦਾ ਅੰਦਾਜ਼ ਲਗਾਉਣ ਲਈ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ
### ਮਾਤਰਾਤਮਕ ਡਾਟਾ
ਮਾਤਰਾਤਮਕ ਡਾਟਾ ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ ਗਿਣਤੀ ਵਾਲੇ ਅਵਲੋਕਨ ਹੁੰਦੇ ਹਨ ਅਤੇ ਆਮ ਤੌਰ 'ਤੇ ਵਿਸ਼ਲੇਸ਼ਣ, ਮਾਪ ਅਤੇ ਗਣਿਤੀਕ ਤੌਰ 'ਤੇ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਮਾਤਰਾਤਮਕ ਡਾਟਾ ਦੇ ਕੁਝ ਉਦਾਹਰਣ ਹਨ: ਇੱਕ ਦੇਸ਼ ਦੀ ਆਬਾਦੀ, ਇੱਕ ਵਿਅਕਤੀ ਦੀ ਉਚਾਈ ਜਾਂ ਇੱਕ ਕੰਪਨੀ ਦੀ ਤਿਮਾਹੀ ਕਮਾਈ। ਕੁਝ ਵਾਧੂ ਵਿਸ਼ਲੇਸ਼ਣ ਨਾਲ, ਮਾਤਰਾਤਮਕ ਡਾਟਾ ਦਾ ਵਰਤੋਂ ਕਰਕੇ ਹਵਾ ਗੁਣਵੱਤਾ ਸੂਚਕ (AQI) ਦੇ ਮੌਸਮੀ ਰੁਝਾਨਾਂ ਦੀ ਖੋਜ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਜਾਂ ਇੱਕ ਆਮ ਕੰਮ ਦੇ ਦਿਨ 'ਤੇ ਰਸ਼ ਅਵਰ ਟ੍ਰੈਫਿਕ ਦੀ ਸੰਭਾਵਨਾ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਇਆ ਜਾ ਸਕਦਾ ਹੈ
### ਗੁਣਾਤਮਕ ਡੇਟਾ
ਗੁਣਾਤਮਕ ਡੇਟਾ, ਜਿਸ ਨੂੰ ਵਰਗੀਕृत ਡੇਟਾ ਵੀ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਉਹ ਡੇਟਾ ਹੁੰਦਾ ਹੈ ਜੋ ਮਾਤਰਾਤਮਕ ਡੇਟਾ ਵਾਂਗ ਗਿਣਤੀਬੱਧ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਵਿਅਕਤੀਗਤ ਡੇਟਾ ਦੇ ਵੱਖ-ਵੱਖ ਫਾਰਮੈਟ ਹੁੰਦੇ ਹਨ ਜੋ ਕਿਸੇ ਚੀਜ਼ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ, ਜਿਵੇਂ ਕਿ ਇੱਕ ਉਤਪਾਦ ਜਾਂ ਪ੍ਰਕਿਰਿਆ। ਕਈ ਵਾਰ, ਗੁਣਾਤਮਕ ਡੇਟਾ ਗਿਣਤੀਬੱਧ ਵੀ ਹੋ ਸਕਦਾ ਹੈ ਪਰ ਆਮ ਤੌਰ 'ਤੇ ਪਰਗਣਿਤਮਕ ਤੌਰ 'ਤੇ ਵਰਤਿਆ ਨਹੀਂ ਜਾਂਦਾ, ਜਿਵੇਂ ਕਿ ਫ਼ੋਨ ਨੰਬਰ ਜਾਂ ਟਾਈਮਸਟੈਂਪ। ਗੁਣਾਤਮਕ ਡੇਟਾ ਦੇ ਕੁਝ ਉਦਾਹਰਣ ਹਨ: ਵੀਡੀਓ ਟਿੱਪਣੀਆਂ, ਕਾਰ ਦਾ ਮਾਡਲ ਅਤੇ ਮੈਕ, ਜਾਂ ਤੁਹਾਡੇ ਸਭ ਤੋਂ ਨੇੜਲੇ ਦੋਸਤਾਂ ਦਾ ਮਨਪਸੰਦ ਰੰਗ। ਗੁਣਾਤਮਕ ਡੇਟਾ ਨੂੰ ਸਮਝਣ ਲਈ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਕਿਹੜੇ ਉਤਪਾਦ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਸਭ ਤੋਂ ਵਧੀਆ ਲਗਦੇ ਹਨ ਜਾਂ ਨੌਕਰੀ ਦੀਆਂ ਅਰਜ਼ੀਆਂ ਵਿੱਚ ਲੋਕਪ੍ਰਿਯ ਕੀਵਰਡ ਪਤਾ ਕਰਨ ਲਈ
### ਗੁਣਾਤਮਕ ਡਾਟਾ
ਗੁਣਾਤਮਕ ਡਾਟਾ, ਜਿਸਨੂੰ ਸ਼੍ਰੇਣੀਬੱਧ ਡਾਟਾ ਵੀ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਉਹ ਡਾਟਾ ਹੁੰਦਾ ਹੈ ਜੋ ਮਾਤਰਾਤਮਕ ਡਾਟਾ ਦੇ ਅਵਲੋਕਨ ਵਾਂਗ ਵਸਤੂਵਾਦੀ ਤੌਰ 'ਤੇ ਮਾਪਿਆ ਨਹੀਂ ਜਾ ਸਕਦਾ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਵੱਖ-ਵੱਖ ਫਾਰਮੈਟਾਂ ਵਿੱਚ ਸਬਜੈਕਟਿਵ ਡਾਟਾ ਹੁੰਦਾ ਹੈ ਜੋ ਕਿਸੇ ਚੀਜ਼ ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਕੈਪਚਰ ਕਰਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਇੱਕ ਉਤਪਾਦ ਜਾਂ ਪ੍ਰਕਿਰਿਆ। ਕਈ ਵਾਰ, ਗੁਣਾਤਮਕ ਡਾਟਾ ਗਿਣਤੀ ਵਾਲਾ ਹੁੰਦਾ ਹੈ ਪਰ ਆਮ ਤੌਰ 'ਤੇ ਗਣਿਤੀਕ ਤੌਰ 'ਤੇ ਵਰਤਿਆ ਨਹੀਂ ਜਾਂਦਾ, ਜਿਵੇਂ ਕਿ ਫੋਨ ਨੰਬਰ ਜਾਂ ਟਾਈਮਸਟੈਂਪ। ਗੁਣਾਤਮਕ ਡਾਟਾ ਦੇ ਕੁਝ ਉਦਾਹਰਣ ਹਨ: ਵੀਡੀਓ ਟਿੱਪਣੀਆਂ, ਕਾਰ ਦਾ ਮਾਡਲ ਅਤੇ ਬਣਾਉਟ ਜਾਂ ਤੁਹਾਡੇ ਸਭ ਤੋਂ ਨੇੜਲੇ ਦੋਸਤਾਂ ਦਾ ਮਨਪਸੰਦ ਰੰਗ। ਗੁਣਾਤਮਕ ਡਾਟਾ ਦਾ ਵਰਤੋਂ ਕਰਕੇ ਇਹ ਸਮਝਿਆ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਉਪਭੋਗਤਾ ਕਿਹੜੇ ਉਤਪਾਦਾਂ ਨੂੰ ਸਭ ਤੋਂ ਵਧੀਆ ਪਸੰਦ ਕਰਦੇ ਹਨ ਜਾਂ ਨੌਕਰੀ ਦੇ ਅਰਜ਼ੀ ਰੂਪਾਂ ਵਿੱਚ ਲੋਕਪ੍ਰਿਯ ਕੀਵਰਡਸ ਦੀ ਪਛਾਣ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ।
### ਸੰਰਚਿਤ ਡੇਟਾ
ਸੰਰਚਿਤ ਡੇਟਾ ਉਹ ਡੇਟਾ ਹੁੰਦਾ ਹੈ ਜੋ ਕਤਾਰਾਂ ਅਤੇ ਕਾਲਮਾਂ ਵਿੱਚ ਵਿਵਸਥਿਤ ਹੁੰਦਾ ਹੈ, ਜਿੱਥੇ ਹਰ ਕਤਾਰ ਵਿੱਚ ਇੱਕੋ ਜਿਹੇ ਕਾਲਮ ਹੁੰਦੇ ਹਨ। ਕਾਲਮ ਕਿਸੇ ਵਿਸ਼ੇਸ਼ ਕਿਸਮ ਦੇ ਮੁੱਲ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ ਅਤੇ ਨਾਮ ਨਾਲ ਪਹਿਚਾਨ ਕੀਤੇ ਜਾਂਦੇ ਹਨ ਜੋ ਮੁੱਲ ਦਾ ਵਰਣਨ ਕਰਦਾ ਹੈ, ਜਦਕਿ ਕਤਾਰਾਂ ਵਿੱਚ اصل ਮੁੱਲ ਹੁੰਦੇ ਹਨ। ਕਾਲਮਾਂ ਉੱਤੇ ਅਕਸਰ ਕੁਝ ਨਿਯਮ ਜਾਂ ਪਾਬੰਦੀਆਂ ਲਗਾਈਆਂ ਜਾਂਦੀਆਂ ਹਨ, ਤਾਂ ਜੋ ਮੁੱਲ ਸਹੀ ਤੌਰ 'ਤੇ ਕਾਲਮ ਨੂੰ ਦਰਸਾ ਸਕਣ। ਉਦਾਹਰਣ ਵਜੋਂ, ਇੱਕ ਗ੍ਰਾਹਕਾਂ ਦੀ ਸਪ੍ਰੈੱਡਸ਼ੀਟ ਦੀ ਕਲਪਨਾ ਕਰੋ ਜਿੱਥੇ ਹਰ ਕਤਾਰ ਵਿੱਚ ਫੋਨ ਨੰਬਰ ਹੋਣਾ ਲਾਜ਼ਮੀ ਹੈ ਅਤੇ ਫੋਨ ਨੰਬਰਾਂ ਵਿੱਚ ਅੱਖਰ ਸ਼ਾਮਲ ਨਹੀਂ ਹੁੰਦੇ। ਫੋਨ ਨੰਬਰ ਕਾਲਮ ਉੱਤੇ ਇਸ ਗੱਲ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਨਿਯਮ ਲਾਗੂ ਹੋ ਸਕਦੇ ਹਨ ਕਿ ਇਹ ਕਾਲਮ ਕਦੇ ਖਾਲੀ ਨਾ ਹੋਵੇ ਅਤੇ ਸਿਰਫ਼ ਨੰਬਰ ਹੀ ਰੱਖੇ।
### ਸੰਗਠਿਤ ਡਾਟਾ
ਸੰਗਠਿਤ ਡਾਟਾ ਉਹ ਡਾਟਾ ਹੁੰਦਾ ਹੈ ਜੋ ਕਤਾਰਾਂ ਅਤੇ ਕਾਲਮਾਂ ਵਿੱਚ ਸੰਗਠਿਤ ਹੁੰਦਾ ਹੈ, ਜਿੱਥੇ ਹਰ ਕਤਾਰ ਵਿੱਚ ਇੱਕੋ ਜਿਹੇ ਕਾਲਮ ਹੁੰਦੇ ਹਨ। ਕਾਲਮ ਕਿਸੇ ਵਿਸ਼ੇਸ਼ ਕਿਸਮ ਦੇ ਮੁੱਲ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ ਅਤੇ ਇਸਦਾ ਨਾਮ ਇਸ ਗੱਲ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਮੁੱਲ ਕਿਸ ਚੀਜ਼ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ, ਜਦਕਿ ਕਤਾਰਾਂ ਵਿੱਚ ਅਸਲ ਮੁੱਲ ਹੁੰਦੇ ਹਨ। ਕਾਲਮਾਂ ਵਿੱਚ ਅਕਸਰ ਮੁੱਲਾਂ 'ਤੇ ਵਿਸ਼ੇਸ਼ ਨਿਯਮ ਜਾਂ ਪਾਬੰਦੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਤਾਂ ਜੋ ਇਹ ਯਕੀਨੀ ਬਣਾਇਆ ਜਾ ਸਕੇ ਕਿ ਮੁੱਲ ਸਹੀ ਤੌਰ 'ਤੇ ਕਾਲਮ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ। ਉਦਾਹਰਣ ਲਈ, ਗਾਹਕਾਂ ਦੀ ਇੱਕ ਸਪ੍ਰੈਡਸ਼ੀਟ ਦੀ ਕਲਪਨਾ ਕਰੋ ਜਿੱਥੇ ਹਰ ਕਤਾਰ ਵਿੱਚ ਇੱਕ ਫੋਨ ਨੰਬਰ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਫੋਨ ਨੰਬਰਾਂ ਵਿੱਚ ਕਦੇ ਵੀ ਅੱਖਰਮਾਲਾ ਦੇ ਅੱਖਰ ਨਹੀਂ ਹੁੰਦੇ। ਫੋਨ ਨੰਬਰ ਕਾਲਮ 'ਤੇ ਨਿਯਮ ਲਾਗੂ ਕੀਤੇ ਜਾ ਸਕਦੇ ਹਨ ਤਾਂ ਜੋ ਇਹ ਕਦੇ ਵੀ ਖਾਲੀ ਨਾ ਹੋਵੇ ਅਤੇ ਸਿਰਫ ਗਿਣਤੀ ਵਾਲੇ ਅੰਕਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰੇ।
ਸੰਰਚਿਤ ਡੇਟਾ ਦਾ ਲਾਭ ਇਹ ਹੈ ਕਿ ਇਸਨੂੰ ਇਸ ਤਰ੍ਹਾਂ ਵਿਵਸਥਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਇਹ ਹੋਰ ਸੰਰਚਿਤ ਡੇਟਾ ਨਾਲ ਜੁੜ ਸਕੇ। ਪਰ ਇਹ ਡੇਟਾ ਇੱਕ ਨਿਰਧਾਰਿਤ ਤਰੀਕੇ ਨਾਲ ਵਿਵਸਥਿਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਇਸ ਲਈ ਇਸਦੀ ਸੰਰਚਨਾ ਵਿੱਚ ਬਦਲਾਅ ਕਰਨ ਵਿੱਚ ਬਹੁਤ ਮਿਹਨਤ ਲੱਗ ਸਕਦੀ ਹੈ। ਉਦਾਹਰਣ ਵਜੋਂ, ਗ੍ਰਾਹਕਾਂ ਦੀ ਸਪ੍ਰੈੱਡਸ਼ੀਟ ਵਿੱਚ ਇੱਕ ਈਮੇਲ ਕਾਲਮ ਸ਼ਾਮਲ ਕਰਨਾ ਜੋ ਖਾਲੀ ਨਾ ਹੋਵੇ, ਇਸਦਾ ਅਰਥ ਹੈ ਕਿ ਤੁਹਾਨੂੰ ਸੋਚਣਾ ਪਵੇਗਾ ਕਿ ਇਹ ਮੁੱਲ ਮੌਜੂਦਾ ਗ੍ਰਾਹਕਾਂ ਦੀਆਂ ਕਤਾਰਾਂ ਵਿੱਚ ਕਿਵੇਂ ਜੋੜੇ ਜਾਣ।
ਸੰਗਠਿਤ ਡਾਟਾ ਦਾ ਇੱਕ ਫਾਇਦਾ ਇਹ ਹੈ ਕਿ ਇਸਨੂੰ ਇਸ ਤਰੀਕੇ ਨਾਲ ਸੰਗਠਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਇਸਨੂੰ ਹੋਰ ਸੰਗਠਿਤ ਡਾਟਾ ਨਾਲ ਜੋੜਿਆ ਜਾ ਸਕੇ। ਹਾਲਾਂਕਿ, ਕਿਉਂਕਿ ਡਾਟਾ ਨੂੰ ਇੱਕ ਵਿਸ਼ੇਸ਼ ਤਰੀਕੇ ਨਾਲ ਸੰਗਠਿਤ ਕਰਨ ਲਈ ਡਿਜ਼ਾਈਨ ਕੀਤਾ ਗਿਆ ਹੈ, ਇਸਦੀ ਕੁੱਲ ਬਣਤਰ ਵਿੱਚ ਬਦਲਾਅ ਕਰਨ ਵਿੱਚ ਬਹੁਤ ਜ਼ਿਆਦਾ ਮਿਹਨਤ ਲੱਗ ਸਕਦੀ ਹੈ। ਉਦਾਹਰਣ ਲਈ, ਗਾਹਕ ਸਪ੍ਰੈਡਸ਼ੀਟ ਵਿੱਚ ਇੱਕ ਈਮੇਲ ਕਾਲਮ ਸ਼ਾਮਲ ਕਰਨਾ ਜੋ ਖਾਲੀ ਨਹੀਂ ਹੋ ਸਕਦਾ, ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਤੁਹਾਨੂੰ ਇਹ ਪਤਾ ਲਗਾਉਣਾ ਪਵੇਗਾ ਕਿ ਤੁਸੀਂ ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ ਮੌਜੂਦਾ ਗਾਹਕਾਂ ਦੀਆਂ ਕਤਾਰਾਂ ਵਿੱਚ ਇਹ ਮੁੱਲ ਕਿਵੇਂ ਸ਼ਾਮਲ ਕਰੋਗੇ।
ਸੰਰਚਿਤ ਡੇਟਾ ਦੇ ਉਦਾਹਰਨ: ਸਪ੍ਰੈੱਡਸ਼ੀਟ, ਸੰਬੰਧਤ ਡੇਟਾਬੇਸ, ਫੋਨ ਨੰਬਰ, ਬੈਂਕ ਬਿਆਨ
ਸੰਗਠਿਤ ਡਾਟਾ ਦੇ ਉਦਾਹਰਣ: ਸਪ੍ਰੈਡਸ਼ੀਟ, ਰਿਲੇਸ਼ਨਲ ਡਾਟਾਬੇਸ, ਫੋਨ ਨੰਬਰ, ਬੈਂਕ ਸਟੇਟਮੈਂਟ
### ਅਸੰਰਚਿਤ ਡੇਟਾ
ਅਸੰਰਚਿਤ ਡੇਟਾ ਆਮ ਤੌਰ 'ਤੇ ਕਤਾਰਾਂ ਜਾਂ ਕਾਲਮਾਂ ਵਿੱਚ ਵਰਗੀਕ੍ਰਿਤ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ ਅਤੇ ਇਸ ਵਿੱਚ ਕੋਈ ਫਾਰਮੈਟ ਜਾਂ ਨਿਯਮ ਨਹੀਂ ਹੁੰਦੇ। ਕਿਉਂਕਿ ਅਸੰਰਚਿਤ ਡੇਟਾ ਦੀ ਸੰਰਚਨਾ ਉੱਤੇ ਘੱਟ ਪਾਬੰਦੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਇਸ ਵਿੱਚ ਨਵੀਂ ਜਾਣਕਾਰੀ ਸ਼ਾਮਲ ਕਰਨਾ ਸੰਰਚਿਤ ਡੇਟਾਸੈੱਟ ਦੇ ਮੁਕਾਬਲੇ ਅਸਾਨ ਹੁੰਦਾ ਹੈ। ਜੇਕਰ ਕੋਈ ਸੈਂਸਰ ਹਰੇਕ 2 ਮਿੰਟਾਂ ਵਿੱਚ ਬੈਰੋਮੈਟ੍ਰਿਕ ਦਬਾਅ ਦਾ ਡੇਟਾ ਕੈਪਚਰ ਕਰਦਾ ਹੈ ਅਤੇ ਹੁਣ ਉਸਨੂੰ ਤਾਪਮਾਨ ਮਾਪਣ ਦਾ ਵੀ ਅੱਪਡੇਟ ਮਿਲਿਆ ਹੈ, ਤਾਂ ਅਸੰਰਚਿਤ ਡੇਟਾ ਹੋਣ ਕਰਕੇ ਮੌਜੂਦਾ ਡੇਟਾ ਵਿੱਚ ਕੋਈ ਬਦਲਾਵ ਕਰਨ ਦੀ ਲੋੜ ਨਹੀਂ ਹੋਵੇਗੀ। ਪਰ ਇਸ ਤਰ੍ਹਾਂ ਦੇ ਡੇਟੇ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਜਾਂ ਜਾਂਚ ਕਰਨਾ ਜ਼ਿਆਦਾ ਸਮਾਂ ਲੈ ਸਕਦਾ ਹੈ। ਉਦਾਹਰਣ ਲਈ, ਇੱਕ ਵਿਗਿਆਨੀ ਜੋ ਪਿਛਲੇ ਮਹੀਨੇ ਦਾ ਔਸਤ ਤਾਪਮਾਨ ਸੈਂਸਰ ਦੇ ਡੇਟਾ ਤੋਂ ਲੱਭਣਾ ਚਾਹੁੰਦਾ ਹੈ, ਪਰ ਪਤਾ ਲਗਦਾ ਹੈ ਕਿ ਸੈਂਸਰ ਨੇ ਕੁਝ ਡੇਟਾ ਵਿੱਚ "e" ਦਰਜ ਕੀਤਾ ਹੈ ਜੋ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਸੈਂਸਰ ਟੁੱਟਿਆ ਹੋਇਆ ਸੀ, ਜੋ ਅਰਥ ਹੈ ਕਿ ਡੇਟਾ ਅਧੂਰਾ ਹੈ।
### ਅਸੰਗਠਿਤ ਡਾਟਾ
ਅਸੰਗਠਿਤ ਡਾਟਾ ਆਮ ਤੌਰ 'ਤੇ ਕਤਾਰਾਂ ਜਾਂ ਕਾਲਮਾਂ ਵਿੱਚ ਵਰਗੀਕਰਿਤ ਨਹੀਂ ਕੀਤਾ ਜਾ ਸਕਦਾ ਅਤੇ ਇਸ ਵਿੱਚ ਕੋਈ ਫਾਰਮੈਟ ਜਾਂ ਨਿਯਮਾਂ ਦਾ ਸੈੱਟ ਨਹੀਂ ਹੁੰਦਾ। ਕਿਉਂਕਿ ਅਸੰਗਠਿਤ ਡਾਟਾ ਦੀ ਬਣਤਰ 'ਤੇ ਘੱਟ ਪਾਬੰਦੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਇਸ ਵਿੱਚ ਨਵੀਂ ਜਾਣਕਾਰੀ ਸ਼ਾਮਲ ਕਰਨਾ ਸੰਗਠਿਤ ਡਾਟਾ ਸੈੱਟ ਦੇ ਮੁਕਾਬਲੇ ਆਸਾਨ ਹੁੰਦਾ ਹੈ। ਜੇਕਰ ਇੱਕ ਸੈਂਸਰ ਜੋ ਹਰ 2 ਮਿੰਟ ਵਿੱਚ ਬੈਰੋਮੈਟ੍ਰਿਕ ਦਬਾਅ ਦਾ ਡਾਟਾ ਕੈਪਚਰ ਕਰਦਾ ਹੈ, ਇਸਨੂੰ ਅਪਡੇਟ ਮਿਲਦਾ ਹੈ ਜੋ ਹੁਣ ਇਸਨੂੰ ਤਾਪਮਾਨ ਮਾਪਣ ਅਤੇ ਰਿਕਾਰਡ ਕਰਨ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਇਸਨੂੰ ਅਸੰਗਠਿਤ ਹੋਣ 'ਤੇ ਮੌਜੂਦਾ ਡਾਟਾ ਨੂੰ ਬਦਲਣ ਦੀ ਲੋੜ ਨਹੀਂ ਹੁੰਦੀ। ਹਾਲਾਂਕਿ, ਇਸ ਕਿਸਮ ਦੇ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਜਾਂ ਜਾਂਚ ਕਰਨ ਵਿੱਚ ਜ਼ਿਆਦਾ ਸਮਾਂ ਲੱਗ ਸਕਦਾ ਹੈ। ਉਦਾਹਰਣ ਲਈ, ਇੱਕ ਵਿਗਿਆਨੀ ਜੋ ਪਿਛਲੇ ਮਹੀਨੇ ਦੇ ਸੈਂਸਰ ਡਾਟਾ ਤੋਂ ਔਸਤ ਤਾਪਮਾਨ ਪਤਾ ਲਗਾਉਣਾ ਚਾਹੁੰਦਾ ਹੈ, ਪਰ ਪਤਾ ਲਗਾਉਂਦਾ ਹੈ ਕਿ ਸੈਂਸਰ ਨੇ ਆਪਣੇ ਕੁਝ ਰਿਕਾਰਡ ਕੀਤੇ ਡਾਟਾ ਵਿੱਚ "e" ਦਰਸਾਇਆ ਹੈ ਕਿ ਇਹ ਟੁੱਟਿਆ ਹੋਇਆ ਸੀ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਡਾਟਾ ਅਧੂਰਾ ਹੈ।
ਅਸੰਰਚਿਤ ਡੇਟਾ ਦੇ ਉਦਾਹਰਣ: ਟੈਕਸਟ ਫਾਇਲਾਂ, ਟੈਕਸਟ ਸੁਨੇਹੇ, ਵੀਡੀਓ ਫਾਇਲਾਂ
ਅਸੰਗਠਿਤ ਡਾਟਾ ਦੇ ਉਦਾਹਰਣ: ਟੈਕਸਟ ਫਾਈਲਾਂ, ਟੈਕਸਟ ਮੈਸੇਜ, ਵੀਡੀਓ ਫਾਈਲਾਂ
### ਅਰਧ-ਸੰਰਚਿਤ ਡੇਟਾ
ਅਰਧ-ਸੰਰਚਿਤ ਡੇਟਾ ਵਿੱਚ ਐਸੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਹੁੰਦੀਆਂ ਹਨ ਜੋ ਇਸਨੂੰ ਸੰਰਚਿਤ ਅਤੇ ਅਸੰਰਚਿਤ ਡੇਟਾ ਦਾ ਮਿਲਾਪ ਬਣਾਉਂਦੀਆਂ ਹਨ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਕਤਾਰਾਂ ਅਤੇ ਕਾਲਮਾਂ ਦੇ ਫਾਰਮੈਟ ਤੇ ਖਰੇ ਨਹੀਂ ਉਤਰਦਾ ਪਰ ਇਸ ਤਰ੍ਹਾਂ ਵਿਵਸਥਿਤ ਹੁੰਦਾ ਹੈ ਜੋ ਸੰਰਚਿਤ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਸਥਿਰ ਫਾਰਮੈਟ ਜਾਂ ਨਿਯਮਾਂ ਦਾ ਪਾਲਣ ਕਰ ਸਕਦਾ ਹੈ। ਸੰਰਚਨਾ ਸਰੋਤਾਂ ਦੇ ਮੁਤਾਬਕ ਵੱਖ-ਵੱਖ ਹੁੰਦੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਇੱਕ ਚੰਗੀ ਤਰੀਕੇ ਨਾਲ ਨਿਰਧਾਰਿਤ ਹਾਇਰਾਰਕੀ ਤੋਂ ਲੈ ਕੇ ਕੁਝ ਜ਼ਿਆਦਾ ਲਚਕੀਲੇ ਤਰੀਕੇ ਤੱਕ ਜੋ ਨਵੀਂ ਜਾਣਕਾਰੀ ਨੂੰ ਆਸਾਨੀ ਨਾਲ ਜੋੜਨ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ। ਮੈਟਾਡੇਟਾ ਉਹ ਸੰਕੇਤ ਹਨ ਜੋ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੇ ਹਨ ਕਿ ਡੇਟਾ ਕਿਵੇਂ ਵਿਵਸਥਿਤ ਅਤੇ ਸਟੋਰ ਕੀਤਾ ਗਿਆ ਹੈ ਅਤੇ ਇਹ ਡੇਟਾ ਦੀ ਕਿਸਮ ਦੇ ਅਨੁਸਾਰ ਵੱਖ-ਵੱਖ ਨਾਮਾਂ ਨਾਲ ਜਾਣੇ ਜਾਂਦੇ ਹਨ। ਮੈਟਾਡੇਟਾ ਦੇ ਕੁਝ ਆਮ ਨਾਮ ਟੈਗ, ਤੱਤ, ਇਕਾਈਆਂ ਅਤੇ ਗੁਣ ਹਨ। ਉਦਾਹਰਣ ਵਜੋਂ, ਇੱਕ ਆਮ ਈਮੇਲ ਸੁਨੇਹਾ ਵਿੱਚ ਇੱਕ ਵਿਸ਼ਾ, ਬਾਡੀ ਅਤੇ ਪ੍ਰਾਪਤਕਰਤਿਆਂ ਦਾ ਸੈੱਟ ਹੁੰਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਇਸ ਅਨੁਸਾਰ ਵਿਵਸਥਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਇਹ ਕਿਸ ਨੇ ਜਾਂ ਕਦੋਂ ਭੇਜਿਆ ਸੀ।
### ਅਰਧ-ਸੰਗਠਿਤ
ਅਰਧ-ਸੰਗਠਿਤ ਡਾਟਾ ਵਿੱਚ ਉਹ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਹੁੰਦੀਆਂ ਹਨ ਜੋ ਇਸਨੂੰ ਸੰਗਠਿਤ ਅਤੇ ਅਸੰਗਠਿਤ ਡਾਟਾ ਦੇ ਮਿਲੇ-ਜੁਲੇ ਰੂਪ ਵਜੋਂ ਬਣਾਉਂਦੀਆਂ ਹਨ। ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਕਤਾਰਾਂ ਅਤੇ ਕਾਲਮਾਂ ਦੇ ਫਾਰਮੈਟ ਨੂੰ ਪਾਲਣ ਨਹੀਂ ਕਰਦਾ ਪਰ ਇਸ ਤਰੀਕੇ ਨਾਲ ਸੰਗਠਿਤ ਹੁੰਦਾ ਹੈ ਜੋ ਸੰਗਠਿਤ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਅਤੇ ਇੱਕ ਨਿਰਧਾਰਤ ਫਾਰਮੈਟ ਜਾਂ ਨਿਯਮਾਂ ਦੇ ਸੈੱਟ ਨੂੰ ਪਾਲਣ ਕਰ ਸਕਦਾ ਹੈ। ਬਣਤਰ ਸਰੋਤਾਂ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਹੋਵੇਗੀ, ਜਿਵੇਂ ਕਿ ਇੱਕ ਚੰਗੀ ਤਰ੍ਹਾਂ ਪਰਿਭਾਸ਼ਿਤ ਹਾਇਰਾਰਕੀ ਤੋਂ ਕੁਝ ਹੋਰ ਲਚਕਦਾਰ ਚੀਜ਼ ਜੋ ਨਵੀਂ ਜਾਣਕਾਰੀ ਦੇ ਆਸਾਨ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਦੀ ਆਗਿਆ ਦਿੰਦੀ ਹੈ। ਮੈਟਾਡਾਟਾ ਸੰਕੇਤਕ ਹੁੰਦੇ ਹਨ ਜੋ ਇਹ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੇ ਹਨ ਕਿ ਡਾਟਾ ਕਿਵੇਂ ਸੰਗਠਿਤ ਅਤੇ ਸਟੋਰ ਕੀਤਾ ਗਿਆ ਹੈ ਅਤੇ ਡਾਟਾ ਦੀ ਕਿਸਮ ਦੇ ਆਧਾਰ 'ਤੇ ਵੱਖ-ਵੱਖ ਨਾਮ ਹੋਣਗੇ। ਮੈਟਾਡਾਟਾ ਦੇ ਕੁਝ ਆਮ ਨਾਮ ਹਨ: ਟੈਗ, ਐਲਿਮੈਂਟ, ਐਨਟੀਟੀ ਅਤੇ ਐਟ੍ਰਿਬਿਊਟ। ਉਦਾਹਰਣ ਲਈ, ਇੱਕ ਆਮ ਈਮੇਲ ਸੁਨੇਹਾ ਵਿੱਚ ਇੱਕ ਵਿਸ਼ਾ, ਬਾਡੀ ਅਤੇ ਪ੍ਰਾਪਤਕਰਤਾਵਾਂ ਦਾ ਸੈੱਟ ਹੁੰਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਇਸ ਗੱਲ ਦੇ ਆਧਾਰ 'ਤੇ ਸੰਗਠਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਇਹ ਕੌਣ ਭੇਜਦਾ ਹੈ ਜਾਂ ਕਦੋਂ ਭੇਜਿਆ ਜਾਂਦਾ ਹੈ।
ਅਰਧ-ਸੰਰਚਿਤ ਡੇਟਾ ਦੇ ਉਦਾਹਰਣ: HTML, CSV ਫਾਇਲਾਂ, ਜਾਵਾਸਕ੍ਰਿਪਟ ਓਬਜੈਕਟ ਨੋਟੇਸ਼ਨ (JSON)
ਅਰਧ-ਸੰਗਠਿਤ ਡਾਟਾ ਦੇ ਉਦਾਹਰਣ: HTML, CSV ਫਾਈਲਾਂ, ਜਾਵਾਸਕ੍ਰਿਪਟ ਓਬਜੈਕਟ ਨੋਟੇਸ਼ਨ (JSON)
## ਡੇਟਾ ਦੇ ਸਰੋਤ
## ਡਾਟਾ ਦੇ ਸਰੋਤ
ਡੇਟਾ ਸਰੋਤ ਉਸ ਮੁੱਖ ਥਾਂ ਨੂੰ ਕਹਿੰਦੇ ਹਨ ਜਿੱਥੇ ਡੇਟਾ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਸੀ ਜਾਂ ਜਿੱਥੇ ਇਹ "ਰਿਹਾਇਸ਼" ਕਰਦਾ ਹੈ ਅਤੇ ਇਹ ਇਸ ਗੱਲ 'ਤੇ منحصر ਕਰਦਾ ਹੈ ਕਿ ਇਹ ਕਿਵੇਂ ਅਤੇ ਕਦੋਂ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ ਸੀ। ਉਸ ਡੇਟਾ ਨੂੰ ਪ੍ਰਾਇਮਰੀ ਡੇਟਾ ਕਿਹਾ ਜਾਂਦਾ ਹੈ ਜੋ ਇਸਦੇ ਉਪਭੋਗਤਾਵਾਂ ਦੁਆਰਾ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੋਵੇ, ਜਦਕਿ ਸਕੈਂਡਰੀ ਡੇਟਾ ਉਸ ਸਰੋਤ ਤੋਂ ਆਉਂਦਾ ਹੈ ਜਿਸਨੇ ਸਰਵਜਨਿਕ ਉਪਯੋਗ ਲਈ ਡੇਟਾ ਇਕੱਠਾ ਕੀਤਾ ਹੋਵੇ। ਉਦਾਹਰਨ ਵਜੋਂ, ਇੱਕ ਸਾਇੰਟਿਸਟਾਂ ਦੀ ਟੀਮ ਜਿਹੜੀ ਜੰਗਲ ਵਿੱਚ ਨਿਰੀਖਣ ਕਰ ਰਹੀ ਹੋਵੇ, ਉਸਨੂੰ ਪ੍ਰਾਇਮਰੀ ਮੰਨਿਆ ਜਾਵੇਗਾ ਅਤੇ ਜੇ ਉਹ ਇਸਨੂੰ ਹੋਰ ਸਾਇੰਟਿਸਟਾਂ ਨਾਲ ਸਾਂਝਾ ਕਰਦੇ ਹਨ ਤਾਂ ਉਹ ਉਨ੍ਹਾਂ ਲਈ ਸਕੈਂਡਰੀ ਬਣ ਜਾਵੇਗਾ।
ਡਾਟਾ ਸਰੋਤ ਉਹ ਸ਼ੁਰੂਆਤੀ ਸਥਾਨ ਹੁੰਦਾ ਹੈ ਜਿੱਥੇ ਡਾਟਾ ਬਣਾਇਆ ਗਿਆ ਸੀ ਜਾਂ ਜਿੱਥੇ ਇਹ "ਰਹਿੰਦਾ" ਹੈ ਅਤੇ ਇਹ ਇਸ ਗੱਲ ਦੇ ਆਧਾਰ 'ਤੇ ਵੱਖ-ਵੱਖ ਹੋਵੇਗਾ ਕਿ ਇਹ ਕਿਵੇਂ ਅਤੇ ਕਦੋਂ ਇਕੱਠਾ ਕੀਤਾ ਗਿਆ। ਵਰਤੋਂਕਾਰਾਂ ਦੁਆਰਾ ਬਣਾਇਆ ਗਿਆ ਡਾਟਾ ਪ੍ਰਾਇਮਰੀ ਡਾਟਾ ਵਜੋਂ ਜਾਣਿਆ ਜਾਂਦਾ ਹੈ ਜਦਕਿ ਸੈਕੰਡਰੀ ਡਾਟਾ ਇੱਕ ਸਰੋਤ ਤੋਂ ਆਉਂਦਾ ਹੈ ਜਿਸਨੇ ਆਮ ਵਰਤੋਂ ਲਈ ਡਾਟਾ ਇਕੱਠਾ ਕੀਤਾ ਹੈ। ਉਦਾਹਰਣ ਲਈ, ਇੱਕ ਗਰਮ ਜੰਗਲ ਵਿੱਚ ਅਵਲੋਕਨ ਇਕੱਠੇ ਕਰਨ ਵਾਲੇ ਵਿਗਿਆਨੀਆਂ ਦੇ ਇੱਕ ਸਮੂਹ ਨੂੰ ਪ੍ਰਾਇਮਰੀ ਮੰਨਿਆ ਜਾਵੇਗਾ ਅਤੇ ਜੇਕਰ ਉਹ ਇਸਨੂੰ ਹੋਰ ਵਿਗਿਆਨੀਆਂ ਨਾਲ ਸਾਂਝਾ ਕਰਨ ਦਾ ਫੈਸਲਾ ਕਰਦੇ ਹਨ ਤਾਂ ਇਹ ਉਹਨਾਂ ਲਈ ਸੈਕੰਡਰੀ ਮੰਨਿਆ ਜਾਵੇਗਾ ਜੋ ਇਸਨੂੰ ਵਰਤਦੇ ਹਨ।
ਡਾਟਾਬੇਸ ਇੱਕ ਆਮ ਸਰੋਤ ਹੁੰਦੇ ਹਨ ਅਤੇ ਡਾਟਾ ਨੂੰ ਹੋਸਟ ਅਤੇ ਰੱਖਣ ਲਈ ਡਾਟਾਬੇਸ ਮੈਨੇਜਮੈਂਟ ਸਿਸਟਮ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ ਜਿੱਥੇ ਵਰਤੋਂਕਾਰ ਕਮਾਂਡਾਂ ਨੂੰ ਕਵੈਰੀਜ਼ ਕਹਿੰਦੇ ਹਨ ਜੋ ਡਾਟਾ ਦੀ ਜਾਂਚ ਕਰਨ ਲਈ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਹਨ। ਫਾਈਲਾਂ ਡਾਟਾ ਸਰੋਤ ਵਜੋਂ ਆਡੀਓ, ਚਿੱਤਰ ਅਤੇ ਵੀਡੀਓ ਫਾਈਲਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ ਜਿਵੇਂ ਕਿ Excel ਵਰਗੀਆਂ ਸਪ੍ਰੈਡਸ਼ੀਟ। ਇੰਟਰਨੈਟ ਸਰੋਤ ਡਾਟਾ ਨੂੰ ਹੋਸਟ ਕਰਨ ਲਈ ਇੱਕ ਆਮ ਸਥਾਨ ਹਨ, ਜਿੱਥੇ ਡਾਟਾਬੇਸਾਂ ਅਤੇ ਫਾਈਲਾਂ ਦੋਵੇਂ ਮਿਲ ਸਕਦੇ ਹਨ। ਐਪਲੀਕੇਸ਼ਨ ਪ੍ਰੋਗਰਾਮਿੰਗ ਇੰਟਰਫੇਸ, ਜਿਸਨੂੰ APIs ਵੀ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਪ੍ਰੋਗਰਾਮਰਾਂ ਨੂੰ ਇੰਟਰਨੈਟ ਦੁਆਰਾ ਬਾਹਰੀ ਵਰਤੋਂਕਾਰਾਂ ਨਾਲ ਡਾਟਾ ਸਾਂਝਾ ਕਰਨ ਦੇ ਤਰੀਕੇ ਬਣਾਉਣ ਦੀ ਆਗਿਆ ਦਿੰਦੇ ਹਨ, ਜਦਕਿ ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ ਇੱਕ ਵੈੱਬ ਪੇਜ ਤੋਂ ਡਾਟਾ ਕੱਢਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਹੈ। [ਡਾਟਾ ਨਾਲ ਕੰਮ ਕਰਨ ਵਾਲੇ ਪਾਠ](../../../../../../../../../2-Working-With-Data) ਇਸ ਗੱਲ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੇ ਹਨ ਕਿ ਵੱਖ-ਵੱਖ ਡਾਟਾ ਸਰੋਤਾਂ ਨੂੰ ਕਿਵੇਂ ਵਰਤਿਆ ਜਾਵੇ।
ਡੇਟਾਬੇਸ ਇੱਕ ਆਮ ਸਰੋਤ ਹਨ ਅਤੇ ਡੇਟਾ ਨੂੰ ਹੋਸਟ ਅਤੇ ਸੰਭਾਲਣ ਲਈ ਡੇਟਾਬੇਸ ਮੈਨੇਜਮੈਂਟ ਸਿਸਟਮ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ ਜਿੱਥੇ ਉਪਭੋਗਤਾ ਕਮਾਂਡਾਂ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਕੁਇਰੀਜ਼ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਡੇਟਾ ਦਾ ਅਧਿਐਨ ਕਰਦੇ ਹਨ। ਫਾਇਲਾਂ ਸਰੋਤ ਵਜੋਂ ਆਡੀਓ, ਚਿੱਤਰ, ਅਤੇ ਵੀਡੀਓ ਫਾਇਲਾਂ ਅਤੇ ਸਪ੍ਰੈਡਸ਼ੀਟਾਂ ਜਿਵੇਂ Excel ਹੋ ਸਕਦੀਆਂ ਹਨ। ਇੰਟਰਨੇਟ ਸਰੋਤਾਂ ਇੱਕ ਆਮ ਥਾਂ ਹਨ ਜਿੱਥੇ ਡੇਟਾਬੇਸ ਅਤੇ ਫਾਇਲਾਂ ਮਿਲਦੀਆਂ ਹਨ। ਐਪਲੀਕੇਸ਼ਨ ਪ੍ਰੋਗ੍ਰਾਮਿੰਗ ਇੰਟਰਫੇਸ, ਜਿਨ੍ਹਾਂ ਨੂੰ APIs ਵੀ ਕਿਹਾ ਜਾਂਦਾ ਹੈ, ਪ੍ਰੋਗ੍ਰਾਮਰਾਂ ਨੂੰ ਬਾਹਰੀ ਉਪਭੋਗਤਾਵਾਂ ਨਾਲ ਡੇਟਾ ਸਾਂਝਾ ਕਰਨ ਦੇ ਤਰੀਕੇ ਬਣਾਉਣ ਦਿੰਦੇ ਹਨ, ਜਦਕਿ ਵੈੱਬ ਸਕ੍ਰੈਪਿੰਗ ਇੱਕ ਵੈੱਬ ਪੇਜ਼ ਤੋਂ ਡੇਟਾ ਕੱਢਦਾ ਹੈ। [Working with Data](../../../../../../../../../2-Working-With-Data) ਵਿੱਚ ਪਾਠ ਵੱਖ-ਵੱਖ ਡੇਟਾ ਸਰੋਤਾਂ ਦੀ ਵਰਤੋਂ 'ਤੇ ਕੇਂਦਰਿਤ ਹਨ।
## ਨਿਸ਼ਕਰਸ਼
ਇਸ ਪਾਠ ਵਿੱਚ ਅਸੀਂ ਸਿੱਖਿਆ:
ਇਸ ਪਾਠ ਵਿੱਚ ਅਸੀਂ ਇਹ ਸਿੱਖਿਆ:
- ਡੇਟਾ ਕੀ ਹੈ
- ਡੇਟਾ ਕਿਵੇਂ ਵਰਣਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ
- ਡੇਟਾ ਕਿਵੇਂ ਵਰਗੀਕ੍ਰਿਤ ਅਤੇ ਸ਼੍ਰੇਣੀਬੱਧ ਕੀਤਾ ਜਾਂਦਾ ਹੈ
- ਡੇਟਾ ਕਿੱਥੇ ਮਿਲ ਸਕਦਾ ਹੈ
## 🚀 ਚੈਲੈਂਜ
- ਡਾਟਾ ਕੀ ਹੈ
- ਡਾਟਾ ਕਿਵੇਂ ਵਰਣਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ
- ਡਾਟਾ ਕਿਵੇਂ ਵਰਗੀਕਰਿਤ ਅਤੇ ਸ਼੍ਰੇਣੀਬੱਧ ਕੀਤਾ ਜਾਂਦਾ ਹੈ
- ਡਾਟਾ ਕਿੱਥੇ ਮਿਲ ਸਕਦਾ ਹੈ
Kaggle ਖੁੱਲ੍ਹੇ ਡੇਟਾਸੈੱਟਾਂ ਦਾ ਇਕ ਬਹੁਤ ਵਧੀਆ ਸਰੋਤ ਹੈ। [ਡੇਟਾਸੈੱਟ ਖੋਜ ਟੂਲ](https://www.kaggle.com/datasets) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੁਝ ਰੁਚਿਕਰ ਡੇਟਾਸੈੱਟ ਲੱਭੋ ਅਤੇ ਹੇਠ ਲਿਖੇ ਮਾਪਦੰਡਾਂ ਨਾਲ 3-5 ਡੇਟਾਸੈੱਟਾਂ ਨੂੰ ਵਰਗੀਕ੍ਰਿਤ ਕਰੋ:
## 🚀 ਚੁਣੌਤੀ
- ਕੀ ਡੇਟਾ ਮਾਤਰਾਤਮਕ ਹੈ ਜਾਂ ਗੁਣਾਤਮਕ?
- ਕੀ ਡੇਟਾ ਸੰਰਚਿਤ, ਅਸੰਰਚਿਤ ਜਾਂ ਅਰਧ-ਸੰਰਚਿਤ ਹੈ?
Kaggle ਖੁੱਲ੍ਹੇ ਡਾਟਾ ਸੈੱਟਾਂ ਦਾ ਇੱਕ ਸ਼ਾਨਦਾਰ ਸਰੋਤ ਹੈ। [ਡਾਟਾ ਸੈੱਟ ਖੋਜ ਟੂਲ](https://www.kaggle.com/datasets) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੁਝ ਦਿਲਚਸਪ ਡਾਟਾ ਸੈੱਟ ਲੱਭੋ ਅਤੇ 3-5 ਡਾਟਾ ਸੈੱਟਾਂ ਨੂੰ ਇਸ ਮਾਪਦੰਡ ਨਾਲ ਵਰਗੀਕਰਿਤ ਕਰੋ:
## [ਪੋਸਟ-ਲੈਕਚਰ ਕੁਇਜ਼](https://ff-quizzes.netlify.app/en/ds/quiz/5)
- ਕੀ ਡਾਟਾ ਮਾਤਰਾਤਮਕ ਹੈ ਜਾਂ ਗੁਣਾਤਮਕ?
- ਕੀ ਡਾਟਾ ਸੰਗਠਿਤ, ਅਸੰਗਠਿਤ ਜਾਂ ਅਰਧ-ਸੰਗਠਿਤ ਹੈ?
## [ਪੋਸਟ-ਲੈਕਚਰ ਕਵਿਜ਼](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## ਸਮੀਖਿਆ ਅਤੇ ਸਵੈ-ਅਧਿਐਨ
## ਸਮੀਖਿਆ ਅਤੇ ਆਪ ਪੜ੍ਹਾਈ
- Microsoft Learn ਦੀ ਇਹ ਯੂਨਿਟ, ਜਿਸਦਾ ਸਿਰਲੇਖ [ਆਪਣੇ ਡਾਟਾ ਨੂੰ ਵਰਗੀਕਰਿਤ ਕਰੋ](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) ਹੈ, ਸੰਗਠਿਤ, ਅਰਧ-ਸੰਗਠਿਤ ਅਤੇ ਅਸੰਗਠਿਤ ਡਾਟਾ ਦਾ ਵਿਸਤ੍ਰਿਤ ਵਿਵਰਣ ਦਿੰਦੀ ਹੈ।
- ਇਸ Microsoft Learn ਯੂਨਿਟ, ਜਿਸ ਦਾ ਸਿਰਲੇਖ [ਡੇਟਾ ਫਾਰਮੈਟਾਂ ਦੀ ਪਹਿਚਾਣ](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) ਹੈ, ਵਿੱਚ ਸੰਰਚਿਤ, ਅਰਧ-ਸੰਰਚਿਤ ਅਤੇ ਅਸੰਰਚਿਤ ਡੇਟਾ ਦੀ ਵਿਸ਼ਤ ਰੂਪ ਵਿੱਚ ਵਿਵਰਨਾ ਹੈ।
## ਅਸਾਈਨਮੈਂਟ
[ਾਟਾ ਸੈੱਟਾਂ ਦੀ ਵਰਗੀਕਰਨ](assignment.md)
[ੇਟਾਸੈੱਟਾਂ ਨੂੰ ਵਰਗੀਕ੍ਰਿਤ ਕਰਨਾ](assignment.md)
---
**ਅਸਵੀਕਤੀ**:
ਇਹ ਦਸਤਾਵੇਜ਼ AI ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀ ਹੋਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਦਿਓ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸੁਚਤਤਾਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਇਸਦੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਤ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਸ ਅਨੁਵਾਦ ਦੀ ਵਰਤੋਂ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆ ਲਈ ਅਸੀਂ ਜ਼ਿੰਮੇਵਾਰ ਨਹੀਂ ਹਾਂ।
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**ਅਸਵੀਕਾਰੋਪਣ**:
ਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Introduction to Probability and Statistics\n",
"ਇਸ ਨੋਟਬੁਕ ਵਿੱਚ, ਅਸੀਂ ਕੁਝ ਅਜਿਹੇ ਸਿਧਾਂਤਾਂ ਨਾਲ ਖੇਡਾਂਗੇ ਜਿਨ੍ਹਾਂ ਬਾਰੇ ਅਸੀਂ ਪਹਿਲਾਂ ਹੀ ਵਿਚਾਰ ਕਰ ਚੁੱਕੇ ਹਾਂ। ਸੰਭਾਵਨਾ ਅਤੇ ਅੰਕੜੇ ਵਿਗਿਆਨ ਦੇ ਬਹੁਤ ਸਾਰੇ ਸਿਧਾਂਤPython ਵਿੱਚ ਡਾਟਾ ਪ੍ਰੋਸੈਸਿੰਗ ਲਈ ਮੁੱਖ ਲਾਇਬ्रेਰੀਆਂ ਜਿਵੇਂ ਕਿ `numpy` ਅਤੇ `pandas` ਵਿੱਚ ਵਧੀਆ ਤਰੀਕੇ ਨਾਲ ਦਰਸਾਏ ਗਏ ਹਨ।\n"
"# ਸੰਭਾਵਨਾ ਅਤੇ ਅੰਕੜੇ ਦਾ ਪਰਿਚਯ\n",
"ਇਸ ਨੋਟਬੁਕ ਵਿੱਚ, ਅਸੀਂ ਕੁਝ ਅਜਿਹੇ ਵਿਚਾਰਾਂ ਨਾਲ ਖੇਡਾਂਗੇ ਜਿਨ੍ਹਾਂ ਬਾਰੇ ਅਸੀਂ ਪਹਿਲਾਂ ਗੱਲ ਕੀਤੀ ਹੈ। ਸੰਭਾਵਨਾ ਅਤੇ ਅੰਕੜਿਆਂ ਦੇ ਬਹੁਤ ਸਾਰੇ ਧਾਰਾਵਾਂ ਪਾਇਥਨ ਵਿੱਚ ਡਾਟਾ ਪ੍ਰੋਸੈਸਿੰਗ ਲਈ ਪ੍ਰਮੁੱਖ ਲਾਇਬ੍ਰੇਰੀਆਂ ਜਿਵੇਂ ਕਿ `numpy` ਅਤੇ `pandas` ਵਿੱਚ ਵਧੀਆ ਤਰ੍ਹਾਂ ਦਰਸਾਏ ਗਏ ਹਨ।\n"
]
},
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## ਰੈਂਡਮ ਵਰੀਏਬਲ ਅਤੇ ਵੰਡਾਂ\n",
"ਆਓ 0 ਤੋਂ 9 ਤੱਕ ਦੇ ਯੂਨੀਫਾਰਮ ਵੰਡ ਤੋਂ 30 ਮੁੱਲਾਂ ਦਾ ਨਮੂਨਾ ਖਿੱਚਣਾ ਸ਼ੁਰੂ ਕਰੀਏ। ਅਸੀਂ ਮੀਨ ਅਤੇ ਵੈਰੀਅੰਸ ਵੀ ਗਣਨਾ ਕਰਾਂਗੇ।\n"
"## ਰੈਂਡਮ ਵਰੀਏਬਲ ਅਤੇ ਵੰਡਾਂ\n",
"ਆਓ 0 ਤੋਂ 9 ਦੀ ਇਕਸਾਰ ਵੰਡ ਤੋਂ 30 ਮੂਲਾਂ ਦਾ ਨਮੂਨਾ ਖਿੱਚਣਾ ਸ਼ੁਰੂ ਕਰੀਏ। ਅਸੀਂ ਮੀਨ ਅਤੇ ਵੈਰੀਅੰਸ ਵੀ ਗਣਨਾ ਕਰਾਂਗੇ।\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਨਮੂਨੇ ਵਿੱਚ ਕਿੰਨੀ ਵੱਖ-ਵੱਖ ਮੁੱਲ ਹਨ, ਇਸ ਨੂੰ ਦ੍ਰਿਸ਼ਟੀਗੋਚਰ ਤੌਰ 'ਤੇ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਲਈ, ਅਸੀਂ **ਹਿਸਟੋਗ੍ਰਾਮ** ਬਣਾਉਣ ਕਰ ਸਕਦੇ ਹਾਂ:\n"
"ਨਮੂਨੇ ਵਿੱਚ ਕਿੰਨੇ ਵੱਖ-ਵੱਖ ਮੁੱਲ ਹਨ ਇਹ ਦਿੱਖਣ ਲਈ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਵਾਸਤੇ, ਅਸੀਂ **ਹਿਸਟੋਗ੍ਰਾਮ** ਬਣਾਉਣ ਦੇ ਸਕਦੇ ਹਾਂ:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## ਅਸਲੀ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ\n",
"\n",
"ਮੀਨ ਅਤੇ ਵੈਰੀਅੰਸ ਅਸਲੀ ਦੁਨੀਆ ਦੇ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਦੇ ਸਮੇਂ ਬਹੁਤ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦੇ ਹਨ। ਆਓ [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) ਤੋਂ ਬੇਸਬਾਲ ਖਿਡਾਰੀਆਂ ਬਾਰੇ ਡਾਟਾ ਲੋਡ ਕਰੀਏ\n"
"ਮੀਨ ਅਤੇ ਵੈਰੀਅੰਸ ਅਸਲੀ ਦੁਨੀਆ ਦੇ ਡਾਟਾ ਦਾ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰ ਸਮੇਂ ਬਹੁਤ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦੇ ਹਨ। ਆਓ [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) ਤੋਂ ਬੇਸਬਾਲ ਖਿਡਾਰੀਆਂ ਬਾਰੇ ਡਾਟਾ ਲੋਡ ਕਰੀਏ\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> ਅਸੀਂ ਇੱਥੇ ਡਾਟਾ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ [**Pandas**](https://pandas.pydata.org/) ਨਾਮਕ ਪੈਕੇਜ ਦੀ ਵਰਤੋਂ ਕਰ ਰਹੇ ਹਾਂ। ਅਸੀਂ ਇਸ ਕੋਰਸ ਵਿੱਚ ਬਾਅਦ ਵਿੱਚ Pandas ਅਤੇ ਪਿੱਠੋਨ ਵਿੱਚ ਡਾਟਾ ਨਾਲ ਕੰਮ ਕਰਨ ਬਾਰੇ ਹੋਰ ਗੱਲ ਕਰਨਗੇ।\n",
"> ਅਸੀਂ ਇੱਥੇ ਡਾਟਾ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ [**Pandas**](https://pandas.pydata.org/) ਨਾਮਕ ਪੈਕੇਜ ਦਾ ਉਪਯੋਗ ਕਰ ਰਹੇ ਹਾਂ। ਅਸੀਂ ਇਸ ਕੋਰਸ ਵਿੱਚ ਬਾਅਦ ਵਿੱਚ Pandas ਅਤੇ Python ਵਿੱਚ ਡਾਟਾ ਨਾਲ ਕੰਮ ਕਰਨ ਬਾਰੇ ਹੋਰ ਚਰਚਾ ਕਰਨਗੇ।\n",
"\n",
"ਚਲੋ ਉਮਰ, ਕੱਦ ਅਤੇ ਵਜ਼ਨ ਲਈ ਔਸਤ ਮੁੱਲ ਗਣਨਾ ਕਰੀਏ:\n"
"ਆਓ ਉਮਰ, ਕਦ ਅਤੇ ਵਜ਼ਨ ਲਈ ਔਸਤ ਮੁੱਲ ਗਣਨਾ ਕਰੀਏ:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਹੁਣ ਆਓ ਅਸੀਂ ਕੱਦ ਤੇ ਧਿਆਨ ਕੇਂਦ੍ਰਿਤ ਕਰੀਏ, ਅਤੇ ਮਿਆਰੀ ਭਿੰਨਤਾ ਅਤੇ ਵੈਰੀਅਂਸ ਦੀ ਗਣਨਾ ਕਰੀਏ:\n"
"ਹੁਣ ਆਓ ਉਚਾਈ ’ਤੇ ਧਿਆਨ ਦਈਏ, ਅਤੇ ਮਿਆਰੀ ਵਿਵਰਤਾ ਅਤੇ ਪ੍ਰਭੇਦ ਨਿਕਾਲੀਏ: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਮੇਨ ਦੇ ਨਾਲ ਨਾਲ, ਮਿਡੀਅਨ ਮੁੱਲ ਅਤੇ ਕਵਾਰਟੀਲਾਂ ਨੂੰ ਵੇਖਣਾ ਵੀ ਸਮਝਦਾਰੀ ਹੈ। ਇਹਨਾਂ ਨੂੰ **ਬਾਕਸ ਪਲੌਟ** ਦੀ ਵਰਤੋਂ ਨਾਲ ਦਰਸਾਇਆ ਜਾ ਸਕਦਾ ਹੈ:\n"
"ਔਸਤ ਦੇ ਨਾਲ-ਨਾਲ, ਮੱਧਮਾਨ ਮੁੱਲ ਅਤੇ ਚਤੁਰਭੁਜਾਂ ਤੇ ਧਿਆਨ ਦੇਣਾ ਸਮਝਦਾਰ ਹੈ। ਇਹਨਾਂ ਨੂੰ **ਬਾਕਸ ਪਲਾਟ** ਦੀ ਵਰਤੋਂ ਨਾਲ ਦਰਸਾਇਆ ਜਾ ਸਕਦਾ ਹੈ:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਅਸੀਂ ਆਪਣੇ ਡਾਟਾ ਸੈੱਟ ਦੇ ਉਪਸੰਗ੍ਰਹਿਤ ਬਾਕਸ ਪਲਾਟ ਵੀ ਬਣਾ ਸਕਦੇ ਹਾਂ, ਉਦਾਹਰਨ ਵਜੋਂ, ਖਿਡਾਰੀ ਦੀ ਭੂਮਿਕਾ ਅਨੁਸਾਰ ਗਰੁੱਪਬੱਧ।\n"
"ਅਸੀਂ ਆਪਣੇ ਡੇਟਾਸੈੱਟ ਦੇ ਉਪਸੈੱਟਾਂ ਦੇ ਬਾਕਸ ਪਲਾਟ ਵੀ ਬਣਾ ਸਕਦੇ ਹਾਂ, ਉਦਾਹਰਨ ਲਈ, ਖਿਡਾਰੀ ਦੀ ਭੂਮਿਕਾ ਦੇ ਆਧਾਰ 'ਤੇ ਸਮੂਹਬੱਧ ਕਰਕੇ।\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **ਨੋਟ**: ਇਹ ਚਿੱਤਰ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ, ਕਿ ਆਮ ਤੌਰ 'ਤੇ ਪਹਿਲੇ ਬੇਸਮੈਨ ਦੀ ਉਚਾਈ ਦੂਜੇ ਬੇਸਮੈਨ ਦੀ ਉਚਾਈ ਨਾਲੋਂ ਵੱਧ ਹੁੰਦੀ ਹੈ। ਬਾਅਦ ਵਿੱਚ ਅਸੀਂ ਸਿੱਖਾਂਗੇ ਕਿ ਅਸੀਂ ਇਸ ਪਰਿਕਲਪਨਾ ਦੀ ਵਧੇਰੇ ਸਰਕਾਰੀ ਤਰੀਕੇ ਨਾਲ ਕਿਵੇਂ ਜਾਂਚ ਕਰ ਸਕਦੇ ਹਾਂ, ਅਤੇ ਕਿਵੇਂ ਇਹ ਦਰਸਾ ਸਕਦੇ ਹਾਂ ਕਿ ਸਾਡਾ ਡਾਟਾ ਅੰਕੜਿਆਂ ਦੇ ਤੌਰ ਤੇ ਮਹੱਤਵਪੂਰਨ ਹੈ। \n",
"> **ਨੋਟ**: ਇਹ ਚਿੱਤਰ ਸੂਚਿਤ ਕਰਦਾ ਹੈ ਕਿ ਆਮ ਤੌਰ 'ਤੇ, ਪਹਿਲੇ ਬੇਸਮੈਨ ਦੀਆਂ ਲੰਬਾਈਆਂ ਦੂਜੇ ਬੇਸਮੈਨ ਦੀਆਂ ਲੰਬਾਈਆਂ ਨਾਲੋਂ ਵੱਧ ਹੁੰਦੀਆਂ ਹਨ। ਬਾਅਦ ਵਿੱਚ ਅਸੀਂ ਸਿੱਖਾਂਗੇ ਕਿ ਕਿਵੇਂ ਅਸੀਂ ਇਸ ਧਾਰਨਾ ਦੀ ਜਾਂਚ ਵਧੀਕ ਅਧਿਕਾਰਤ ਢੰਗ ਨਾਲ ਕਰ ਸਕਦੇ ਹਾਂ, ਅਤੇ ਕਿਵੇਂ ਸਾਬਤ ਕਰ ਸਕਦੇ ਹਾਂ ਕਿ ਸਾਡੇ ਡੇਟਾ ਨੂੰ ਸੰਖਿਆਤਮਕ ਤੌਰ 'ਤੇ ਮਹੱਤਵਪੂਰਨ ਹੈ। \n",
"\n",
"ਉਮਰ, ਉਚਾਈ ਅਤੇ ਭਾਰ ਸਾਰੇ ਲਗਾਤਾਰ ਯਾਦਰਚਛਤ ਚਰ ਹਨ। ਤੁਹਾਨੂੰ ਕੀ ਲੱਗਦਾ ਹੈ ਕਿ ਉਨ੍ਹਾਂ ਦਾ ਵੰਡ ਕਿਹੜਾ ਹੈ? ਜਾਣਨ ਦਾ ਚੰਗਾ ਤਰੀਕਾ ਇਹ ਹੈ ਕਿ ਮੁੱਲਾਂ ਦਾ ਹਿਸਟੋਗ੍ਰਾਮ ਬਣਾਇਆ ਜਾਵੇ: \n"
"ਉਮਰ, ਲੰਬਾਈ ਅਤੇ ਵਜ਼ਨ ਸਭ ਲਗਾਤਾਰ ਬੇਤਰਤੀਬੀ ਵਾਲੇ ਰੂਪ ਹਨ। ਤੁਹਾਡੇ ਖਿਆਲ ਵਿਚ ਇਹਨਾਂ ਦਾ ਵਰਤਾਅ ਕਿਹੜਾ ਹੈ? ਇਹ ਜਾਣਣ ਲਈ ਇੱਕ ਵਧੀਆ ਤਰੀਕਾ ਇਹ ਹੈ ਕਿ ਅਸੀਂ ਮੁੱਲਾਂ ਦਾ ਹਿਸਟੋਗ੍ਰਾਮ ਬਣਾਈਏ: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Normal Distribution\n",
"## ਸਧਾਰਣ ਵੰਡ\n",
"\n",
"ਆਓ ਇੱਕ ਕ੍ਰਿਤ੍ਰਿਮ ਭਾਰ ਦਾ ਨਮੂਨਾ ਬਣਾਈਏ ਜੋ ਸਾਡੇ ਅਸਲ ਡੇਟਾ ਵਾਂਗੋਂ ਇੱਕੋ ਜਿਹਾ ਮੀਨ ਅਤੇ ਵਿਵਿਧਤਾ ਨਾਲ ਨਾਰਮਲ ਵਿਤਰਨ ਦਾ ਪਾਲਣ ਕਰਦਾ ਹੋਵੇ:\n"
"ਆਓ ਵਜ਼ਨਾਂ ਦਾ ਇੱਕ ਨਕਲੀ ਨਮੂਨਾ ਬਣਾਈਏ ਜੋ ਸਾਡੇ ਅਸਲੀ ਡੇਟਾ ਦੇ ਸਮਾਨ ਮੀਨ ਅਤੇ ਵੈਰੀਅੰਸ ਦੇ ਨਾਲ ਸਧਾਰਣ ਵੰਡ ਦਾ ਪਾਲਣ ਕਰਦਾ ਹੋਵੇ:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਕਿਉਂਕਿ ਜ਼ਿਆਦਾਤਰ ਅਸਲ ਜੀਵਨ ਵਿੱਚ ਮੁੱਲ normalt ਵੰਡੇ ਹੁੰਦੇ ਹਨ, ਸਾਨੂੰ ਨਮੂਨਾ ਡੇਟਾ ਬਣਾਉਣ ਲਈ ਇੱਕ ਸਮਾਨ ਰੈਂਡਮ ਨੰਬਰ ਜੇਨੇਰੇਟਰ ਦੀ ਵਰਤੋਂ ਨਹੀਂ ਕਰਨੀ ਚਾਹੀਦੀ। ਅਸੀਂ ਦੇਖਦੇ ਹਾਂ ਕਿ ਜੇ ਅਸੀਂ ਇੱਕ ਸਮਾਨ ਵੰਡ (ਜੋ `np.random.rand` ਨਾਲ ਬਣਾਈ ਗਈ ਹੈ) ਨਾਲ ਵਜ਼ਨ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੀਏ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ:\n"
"ਚੂੰਕਿ ਅਸਲ ਜੀਵਨ ਵਿੱਚ ਜ਼ਿਆਦਾਤਰ ਮੁੱਲ ਆਮ ਤੌਰ 'ਤੇ ਸਧਾਰਣ ਵੰਡ ਵਾਲੇ ਹੁੰਦੇ ਹਨ, ਸਾਨੂੰ ਨਮੂਨਾ ਡਾਟਾ ਬਣਾਉਣ ਲਈ ਇਕਸਾਰ ਯਾਦਗਾਰ ਨੰਬਰ ਜਨਰੇਟਰ ਦੀ ਵਰਤੋਂ ਨਹੀਂ ਕਰਨੀ ਚਾਹੀਦੀ। ਇੱਥੇ ਉਹ ਹੁੰਦਾ ਹੈ ਜੇ ਅਸੀਂ ਇਕਸਾਰ ਵੰਡ ਨਾਲ ਭਾਰ ਬਣਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੀਏ (ਜੋ `np.random.rand` ਨਾਲ ਬਣਾਇਆ ਗਿਆ ਹੈ):\n"
]
},
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## ਭਰੋਸੇਯੋਗ ਇੰਟਰਵਲ\n",
"## ਭਰੋਸੇਯੋਗ ਦਾਇਰੇ\n",
"\n",
"ਹੁਣ ਅਸੀਂ ਬੇਸਬਾਲ ਖਿਡਾਰੀਆਂ ਦੇ ਵਜ਼ਨ ਅਤੇ ਕਦ ਦੀਆਂ ਭਰੋਸੇਯੋਗ ਇੰਟਰਵਲ ਦੀ ਗਣਨਾ ਕਰਾਂਗੇ। ਅਸੀਂ ਇਹ ਕੋਡ [ਇਸ stackoverflow ਚਰਚਾ ਤੋਂ](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) ਵਰਤਾਂਗੇ:\n"
"ਅਸੀਂ ਹੁਣ ਬੇਸਬਾਲ ਖਿਡਾਰੀਆਂ ਦੇ ਵਜ਼ਨ ਅਤੇ ਕੱਦ ਲਈ ਭਰੋਸੇਯੋਗ ਦਾਇਰੇ ਦੀ ਗਣਨਾ ਕਰਾਂਗੇ। ਅਸੀਂ ਕੋਡ ਦੀ ਵਰਤੋਂ ਕਰਾਂਗੇ [ਇਸ ਸਟੈਕਓਵਰਫਲੋ ਚਰਚਾ ਤੋਂ](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -280,9 +280,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## ਪਰਿਕਲਪਨਾ ਦੀ ਜਾਂਚ\n",
"## ਹਿਪੋਥੈਸਿਸ ਟੈਸਟਿੰਗ\n",
"\n",
"ਆਓ ਸਾਡੇ ਬੇਸਬਾਲ ਖਿਡਾਰੀਆਂ ਦੇ ਡੇਟਾਸੇਟ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਭੂਮਿਕਾਵਾਂ ਦੀ ਖੋਜ ਕਰੀਏ:\n"
"ਆਓ ਸਾਡੇ ਬੇਸਬॉल ਖਿਡਾਰੀਆਂ ਦੇ ਡੇਟਾਸੇਟ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਭੂਮਿਕਾਵਾਂ ਦੀ ਖੋਜ ਕਰੀਏ:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਆਓ ਇਹ ਪਰਿਕਲਪਨਾ ਜਾਂਚੀਏ ਕਿ ਪਹਿਲੇ ਬੇਸਮੈਨ ਦੂਜੇ ਬੇਸਮੈਨ ਨਾਲੋਂ ਲੰਬੇ ਹੁੰਦੇ ਹਨ। ਇਸ ਦੀ ਸਭ ਤੋਂ ਸੌਖੀ ਤਰੀਕਾ ਇਹ ਹੈ ਕਿ ਕਾਂਫੀਡੈਂਸ ਇੰਟਰਨਲ ਦੀ ਜਾਂਚ ਕੀਤੀ ਜਾਵੇ:\n"
"ਆਓ ਇਹ ਪਰੀਏ ਕਿ ਪਹਿਲੇ ਬੇਸਮੈਨ ਦੂਜੇ ਬੇਸਮੈਨ ਨਾਲੋਂ ਲੰਬੇ ਹੁੰਦੇ ਹਨ। ਇਸ ਦੀ ਸਾਬਤ ਕਰਨ ਦਾ ਸਭ ਤੋਂ ਸਾਦਾ ਤਰੀਕਾ ਇਹ ਹੈ ਕਿ ਅਸੀਂ ਕਾਨਫੀਡੈਂਸ ਇੰਟਰਵਲ ਨੂੰ ਟੈਸਟ ਕਰੀਏ:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਅਸੀਂ ਦੇਖ ਸਕਦੇ ਹਾਂ ਕਿ ਇੰਟਰਵਲਾਂ ਇਕ ਦੂਜੇ ਨਾਲ ਓਵਰਲੈਪ ਨਹੀਂ ਕਰਦੇ। \n",
"ਅਸੀਂ ਦੇਖ ਸਕਦੇ ਹਾਂ ਕਿ ਅੰਤਰਾਲ ਇੱਕ ਦੂਜੇ ਨਾਲ ਨਹੀਂ ਮੀਲਦੇ। \n",
"\n",
"ਐਕ ਅੰਕੜਾ ਵਿਗਿਆਨਕ ਤੌਰ 'ਤੇ ਹੋਰ ਸਹੀ ਤਰੀਕਾ ਹੈ ਕਿ ਪਰਿਕਲਪਨਾ ਨੂੰ ਸਾਬਤ ਕਰਨ ਲਈ **ਸ੍ਟੂਡੈਂਟ t-ਟੈਸਟ** ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਵੇ:\n"
"ਸਿਧਾਂਤ ਨੂੰ ਸਾਬਤ ਕਰਨ ਦਾ ਇੱਕ ਅੰਕੜਾ ਨੁਮਾ ਜ਼ਿਆਦਾ ਸਹੀ ਤਰੀਕਾ ਹੈ **ਸਟੂਡੈਂਟ t-ਟੈਸਟ** ਦੀ ਵਰਤੋਂ ਕਰਨੀ: \n"
]
},
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"`ttest_ind` ਫੰਕਸ਼ਨ ਵੱਲੋਂ ਵਾਪਸ ਕੀਤੀਆਂ ਦੋ ਮੁੱਲਾਂ ਹਨ:\n",
"* p-ਮੁੱਲ ਨੂੰ ਦੋ ਵੰਡਾਂ ਦੇ ਇਕੋ ਜਿਹੇ ਮਤਲਬ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਮੰਨੀ ਜਾ ਸਕਦੀ ਹੈ। ਸਾਡੇ ਕੇਸ ਵਿੱਚ, ਇਹ ਬਹੁਤ ਘੱਟ ਹੈ, ਜਿਸਦਾ ਅਰਥ ਹੈ ਕਿ ਇਹ ਮਜ਼ਬੂਤ ਸਬੂਤ ਹੈ ਕਿ ਪਹਿਲੇ ਬੇਸਮੈਨ ਊਚੇ ਹੁੰਦੇ ਹਨ।\n",
"* t-ਮੁੱਲ ਨਾਰਮਲਾਈਜ਼ਡ ਮਤਲਬ ਫਰਕ ਦੀ ਦਰਮਿਆਨੀ ਮੁੱਲ ਹੈ ਜੋ t-ਟੈਸਟ ਵਿੱਚ ਵਰਤੀ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਇਸ ਦੀ ਤੁਲਨਾ ਦਿੱਤੇ ਗਏ ਭਰੋਸੇਮੰਦ ਮੁੱਲ ਲਈ ਕਰਮ ਤੋਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।\n"
"`ttest_ind` ਫੰਕਸ਼ਨ ਵੱਲੋਂ ਵਾਪਸ ਕੀਤੀਆਂ ਦੋ ਮੁੱਲ ਹਨ:\n",
"* p-ਮੁੱਲ ਨੂੰ ਦੋ ਵੰਡਾਂ ਦੇ ਇੱਕੋ ਜਿਹੇ ਔਸਤ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਵਜੋਂ ਦੇਖਿਆ ਜਾ ਸਕਦਾ ਹੈ। ਸਾਡੇ ਮਾਮਲੇ ਵਿੱਚ, ਇਹ ਕਾਫੀ ਘੱਟ ਹੈ, ਜਿਸਦਾ ਅਰਥ ਹੈ ਕਿ ਪਹਿਲੇ ਬੇਸਮੈਨ ਲੰਬੇ ਹੋਣ ਦੇ ਮਜ਼ਬੂਤ ਸਬੂਤ ਹਨ।\n",
"* t-ਮੁੱਲ ਤੁਹਾਡੇ ਨਾਰਮਲਾਈਜ਼ਡ ਔਸਤ ਅੰਤਰ ਦਾ ਮੱਧਮ ਮੁੱਲ ਹੈ ਜੋ t-ਟੈਸਟ ਵਿੱਚ ਵਰਤਿਆ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਇਸਨੂੰ ਦਿੱਤੀ ਗਈ ਭਰੋਸਾ ਕਦਰ ਲਈ ਇੱਕ ਸੀਮਾ ਮੁੱਲ ਨਾਲ ਤੁਲਨਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## ਕੇਂਦਰੀ ਸੀਮਾ ਸਭੰਧੀ ਸਿਧਾਂਤ ਨਾਲ ਆਮ ਵੰਡ ਦਾ ਅਨੁਕਰਨ ਕਰਨਾ\n",
"## ਸੈਂਟ੍ਰਲ ਲਿਮਿਟ ਥਿਊਰਮ ਨਾਲ ਸਧਾਰਣ ਵੰਡ ਦੀ ਸਿਮੂਲੇਸ਼ਨ\n",
"\n",
"ਪਾਈਥਨ ਵਿਚ ਛਦਮ-ਯਾਦਰਚ ਛੇਤੀ ਨਾਲ ਇੱਕ ਸਮਰੂਪ ਵੰਡ ਦੇਣ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ। ਜੇ ਅਸੀਂ ਸਧਾਰਣ ਵੰਡ ਲਈ ਇੱਕ ਜੇਨੇਰੇਟਰ ਬਣਾਉਣਾ ਚਾਹੁੰਦੇ ਹਾਂ, ਤਾਂ ਅਸੀਂ ਕੇਂਦਰੀ ਸੀਮਾ ਸਿਧਾਂਤ ਦਾ ਉਪਯੋਗ ਕਰ ਸਕਦੇ ਹਾਂ। ਇੱਕ ਸਧਾਰਣ ਵੰਡ ਵਾਲੀ ਮੂਲ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਅਸੀਂ ਬੱਸ ਸਮਰੂਪ-ਜਨਰੇਟ ਕੀਤੇ ਸੈੰਪਲ ਦਾ ਮੀਨ ਕੱਢਾਂਗੇ।\n"
"ਪਾਇਥਨ ਵਿੱਚ ਛਦਮ-ਬੇਤਰਤੀਬ ਜੈਨਰੇਟਰ ਸਾਨੂੰ ਇੱਕ ਸਮਾਨ ਵੰਡ ਦੇਣ ਲਈ ਡਿਜ਼ਾਇਨ ਕੀਤਾ ਗਿਆ ਹੈ। ਜੇ ਅਸੀਂ ਸਧਾਰਣ ਵੰਡ ਲਈ ਜੈਨਰੇਟਰ ਬਣਾਉਣਾ ਚਾਹੁੰਦੇ ਹਾਂ, ਤਾਂ ਅਸੀਂ ਸੈਂਟ੍ਰਲ ਲਿਮਿਟ ਥਿਊਰਮ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹਾਂ। ਇੱਕ ਸਧਾਰਣ ਵੰਡ ਵਾਲੀ ਕੀਮਤ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਅਸੀਂ ਸਿਰਫ਼ ਇਕ ਸਮਾਨ-ਜਨਰੇਟ ਕੀਤਾ ਗਿਆ ਨਮੂਨਾ ਦਾ ਮੱਧ (ਮੀਨ) ਕਾਲਕੁਲੇਟ ਕਰਾਂਗੇ। \n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Correlation and Evil Baseball Corp\n",
"## ਕੋਰਲੇਸ਼ਨ ਅਤੇ ਇਵਿਲ ਬੇਸਬਾਲ ਕਾਰਪੋਰੇਸ਼ਨ\n",
"\n",
"Correlation ਸਾਡੇ ਲਈ ਡਾਟਾ ਸੀਕੁਐਂਸز ਵਿਚਕਾਰ ਸੰਬੰਧ ਲੱਭਣ ਦੀ ਆਗਿਆ ਦਿੰਦੀ ਹੈ। ਸਾਡੇ ਖੇਡ ਉਦਾਹਰਨ ਵਿੱਚ, ਆਓ ਮੰਨ ਲਈਏ ਕਿ ਇੱਕ ਬੁਰਾ ਬੇਸਬਾਲ ਕਾਰਪੋਰੇਸ਼ਨ ਹੈ ਜੋ ਆਪਣੇ ਖਿਡਾਰੀਆਂ ਨੂੰ ਉਹਨਾਂ ਦੀ ਉਚਾਈ ਦੇ ਅਨੁਸਾਰ ਪੈਸਾ ਦਿੰਦਾ ਹੈ - ਜਿੰਨਾ ਵੱਡਾ ਖਿਡਾਰੀ ਹੁੰਦਾ ਹੈ, ਉੰਨਾ ਜ਼ਿਆਦਾ ਪੈਸਾ ਉਸਨੂੰ ਮਿਲਦਾ ਹੈ। ਮੰਨ ਲਈਏ ਕਿ ਬੇਸ ਸੈਲਰੀ $1000 ਹੈ, ਅਤੇ ਉਚਾਈ ਦੇ ਅਧਾਰ 'ਤੇ $0 ਤੋਂ $100 ਤੱਕ ਦਾ ਵਾਧੂ ਬੋਨਸ ਹੈ। ਅਸੀਂ MLB ਦੇ ਅਸਲੀ ਖਿਡਾਰੀਆਂ ਨੂੰ ਲਵਾਂਗੇ, ਅਤੇ ਉਹਨਾਂ ਦੀਆਂ ਕਲਪਨਾਤਮਕ ਸੈਲਰੀਆਂ ਦੀ ਗਣਨਾ ਕਰਾਂਗੇ:\n"
"ਕੋਰਲੇਸ਼ਨ ਸਾਨੂੰ ਡੇਟਾ ਕ੍ਰਮਾਂ ਵਿੱਚ ਸਬੰਧ ਲੱਭਣ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ। ਸਾਡੇ ਖਿਡੌਣੇ ਉਦਾਹਰਨ ਵਿੱਚ, ਆਓ ਧਰਾਈਏ ਕਿ ਇੱਕ ਬੁਰਾ ਬੇਸਬਾਲ ਕਾਰਪੋਰੇਸ਼ਨ ਹੈ ਜੋ ਆਪਣੇ ਖਿਡਾਰੀਆਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੀ ਲੰਬਾਈ ਅਨੁਸਾਰ ਤਨਖ਼ਾਹ ਦਿੰਦਾ ਹੈ - ਜਿੰਨਾ ਲੰਬਾ ਖਿਡਾਰੀ ਹੋਵੇ, ਉਸਨੂੰ ਉੰਨਾ ਜ਼ਿਆਦਾ ਪੈਸਾ ਮਿਲਦਾ ਹੈ। ਧਰੋ ਕਿ ਅੱਧਾਰ ਤਨਖ਼ਾਹ $1000 ਹੈ, ਅਤੇ ਲੰਬਾਈ ਅਨੁਸਾਰ $0 ਤੋਂ $100 ਤੱਕ ਅਤਿਰਕਤ ਬੋਨਸ ਮਿਲਦਾ ਹੈ। ਅਸੀਂ MLB ਦੇ ਅਸਲ ਖਿਡਾਰੀਆਂ ਨੂੰ ਲਵਾਂਗੇ ਅਤੇ ਉਨ੍ਹਾਂ ਦੀ ਕਲਪਨਾਤਮਕ ਤਨਖ਼ਾਹ ਦੀ ਗਿਣਤੀ ਕਰਾਂਗੇ:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਅਸੀਂ ਹੁਣ ਉਹਨਾਂ ਲੜੀਵਾਰਿਆਂ ਦੀ ਕੋਵੈਰੀਅੰਸ ਅਤੇ ਕੋਰਿਲੇਸ਼ਨ ਦੀ ਗਣਨਾ ਕਰਦੇ ਹਾਂ। `np.cov` ਸਾਨੂੰ ਇੱਕ ਕਿਹਾ ਜਾਂਦਾ ਹੈ **ਕੋਵੈਰੀਅੰਸ ਮੈਟ੍ਰਿਕਸ** ਦੇਵੇਗਾ, ਜੋ ਇੱਕ ਤੋਂ ਵੱਧ ਵੈਰੀਏਬਲਾਂ ਲਈ ਕੋਵੈਰੀਅੰਸ ਦਾ ਵਿਸਤਾਰ ਹੈ। ਕੋਵੈਰੀਅੰਸ ਮੈਟ੍ਰਿਕਸ $M$ ਦਾ ਤੱਤ $M_{ij}$ ਇਨਪੁਟ ਵੈਰੀਏਬਲ $X_i$ ਅਤੇ $X_j$ ਵਿੱਚ ਕੋਰਿਲੇਸ਼ਨ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਡਾਇਗਨਲ ਮੁੱਲ $M_{ii}$ $X_{i}$ ਦੀ ਵੈਰੀਅੰਸ ਹੁੰਦੀ ਹੈ। ਇਸੇ ਤਰ੍ਹਾਂ, `np.corrcoef` ਸਾਨੂੰ **ਕੋਰਿਲੇਸ਼ਨ ਮੈਟਰਿਕਸ** ਦੇਵੇਗਾ।\n"
"ਆਓ ਹੁਣ ਉਹਨਾਂ ਕ੍ਰਮਾਂਕਾਂ ਦੀ ਕੋਵੈਰੀਅੰਸ ਅਤੇ ਕੋਰਿਲੇਸ਼ਨ ਦੀ ਗਣਨਾ ਕਰੀਏ। `np.cov` ਸਾਨੂੰ ਇਕ ਆਖਿਆ ਜਾ ਸਕਦਾ ਹੈ **ਕੋਵੈਰੀਅੰਸ ਮੈਟ੍ਰਿਕਸ**, ਜੋ ਕਿ ਕਈ ਚਰਾਂ ਲਈ ਕੋਵੈਰੀਅੰਸ ਦਾ ਵਿਸਥਾਰ ਹੈ। ਕੋਵੈਰੀਅੰਸ ਮੈਟ੍ਰਿਕਸ $M$ ਦਾ ਤੱਤ $M_{ij}$ ਇੰਪੁੱਟ ਚਰਾਂ $X_i$ ਅਤੇ $X_j$ ਵਿਚਕਾਰ ਕੋਰਿਲੇਸ਼ਨ ਹੈ, ਅਤੇ ਤੱਕਣੀ ਮੁੱਲ $M_{ii}$ $X_i$ ਦਾ ਵੇਰੀਐਂਸ ਹੈ। ਇਸੇ ਤਰ੍ਹਾਂ, `np.corrcoef` ਸਾਨੂੰ **ਕੋਰਿਲੇਸ਼ਨ ਮੈਟਰਿਕਸ** ਦੇਵੇਗਾ।\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਇੱਕ ਸੰਬੰਧ ਜੋ 1 ਦੇ ਬਰਾਬਰ ਹੁੰਦਾ ਹੈ, ਦਾ ਅਰਥ ਹੈ ਕਿ ਦੋ ਬਦਲਿਆਂ ਵਿੱਚ ਇੱਕ ਮਜ਼ਬੂਤ **ਰੇਖੀ ਸੰਬੰਧ** ਹੈ। ਅਸੀਂ ਇੱਕ ਮੁੱਲ ਨੂੰ ਦੂਜੇ ਦੇ ਮੁਕਾਬਲੇ ਪਲਾਟ ਕਰਕੇ ਰੇਖੀ ਸੰਬੰਧ ਨੂੰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕਰ ਸਕਦੇ ਹਾਂ:\n"
"1 ਦੇ ਬਰਾਬਰ ਸਹਿਸੰਬੰਧ ਦਾ ਅਰਥ ਹੈ ਕਿ ਦੋ ਚਲ-ਪేరਿਆਂ ਦਰਮਿਆਨ ਇਕ ਮਜ਼ਬੂਤ **ਰੇਖੀਅਤਮਕ ਸੰਬੰਧ** ਹੈ। ਅਸੀਂ ਇੱਕ ਮੁੱਲ ਨੂੰ ਦੂਜੇ ਦੇ ਖਿਲਾਬ ਪਲੌਟ ਕਰਕੇ ਰੇਖੀਅਤਮਕ ਸੰਬੰਧ ਨਜ਼ਰੀਅਤੀ ਤੌਰ 'ਤੇ ਦੇਖ ਸਕਦੇ ਹਾਂ:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਆਓ ਵੇਖੀਏ ਕਿ ਕੀ ਹੁੰਦਾ ਹੈ ਜੇ ਸੰਬੰਧ ਰੇਖੀ ਨਹੀਂ ਹੈ। ਮੰਨ ਲਓ ਕਿ ਸਾਡੀ ਕੰਪਨੀ ਨੇ ਕਦਾਂ ਅਤੇ ਤਨਖ਼ਾਹਾਂ ਦਰਮਿਆਨ ਸਪਸ਼ਟ ਰੇਖੀ ਨਿਰਭਰਤਾ ਨੂੰ ਛੁਪਾਉਣ ਦਾ ਫੈਸਲਾ ਕੀਤਾ, ਅਤੇ ਫਾਰਮੂਲੇ ਵਿੱਚ ਕੁਝ ਗੈਰ-ਰੇਖੀਤਾ ਜਿਵੇਂ ਕਿ `sin` ਸ਼ਾਮਿਲ ਕੀਤਾ:\n"
"ਆਓ ਵੇਖੀਏ ਕਿ ਕੀ ਹੁੰਦਾ ਹੈ ਜੇ ਸੰਬੰਧ ਰੇਖੀਅ ਨਹੀਂ ਹੈ। ਧਰੋ ਕਿ ਸਾਡੀ ਕੰਪਨੀ ਨੇ ਉਚਾਈਆਂ ਅਤੇ ਤਨਖਾਹਾਂ ਦੇ ਵਿਚਕਾਰ ਸਪੱਸ਼ਟ ਰੇਖੀਅ ਇੰਨਦਾ ਨੂੰ ਛੁਪਾ ਕੇ ਫਾਰਮੂਲਾ ਵਿੱਚ ਕੁਝ ਗੈਰ-ਰੇਖੀਅਤਾ ਜਿਵੇਂ ਕਿ `sin` ਸ਼ਾਮਲ ਕਰ ਦਿੱਤਾ: \n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਇਸ ਮਾਮਲੇ ਵਿੱਚ, ਸਬੰਧ ਥੋੜ੍ਹਾ ਛੋਟਾ ਹੈ, ਪਰ ਇਹ ਫਿਰ ਵੀ ਕਾਫੀ ਉੱਚਾ ਹੈ। ਹੁਣ, ਸੰਬੰਧ ਨੂੰ ਹੋਰ ਘੱਟ ਸਪਸ਼ਟ ਬਣਾਉਣ ਲਈ, ਅਸੀਂ ਤਨਖਾਹ ਵਿੱਚ ਕੁਝ ਵਧੂ ਬੇਤਰਤੀਬੀ ਜੋੜ ਕੇ ਕੁਝ ਵਿਅਕਤੀਗਤ ਬਦਲਾਅ ਸ਼ਾਮਲ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹਾਂ। ਆਓ ਦੇਖੀਏ ਕੀ ਹੁੰਦਾ ਹੈ:\n"
"ਇਸ ਮਾਮਲੇ ਵਿੱਚ, ਸਬੰਧ ਥੋੜ੍ਹਾ ਛੋਟਾ ਹੈ, ਪਰ ਇਹ ਫਿਰ ਵੀ ਕਾਫੀ ਉੱਚਾ ਹੈ। ਹੁਣ, ਸੰਬੰਧ ਨੂੰ ਹੋਰ ਘੱਟ ਸਪੱਸ਼ਟ ਬਣਾਉਣ ਲਈ, ਅਸੀਂ ਸੇਲਰੀ ਵਿੱਚ ਕੁਝ ਅਜਿਹਾ ਯਾਦਰਸ਼ (randomness) ਸ਼ਾਮਿਲ ਕਰ ਸਕਦੇ ਹਾਂ ਜੋ ਕੁਝ ਬੇਤਹਾਸੀ ਪਰਿਵਰਤਨ ਵਾਲਾ ਹੋਵੇ। ਆਓ ਦੇਖੀਏ ਕਿ ਕੀ ਹੁੰਦਾ ਹੈ:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> ਕੀ ਤੁਸੀਂ ਅਨੁਮਾਨ ਲਾ ਸਕਦੇ ਹੋ ਕਿ ਇਹ ਡੌਟਸ ਇਸ ਤਰ੍ਹਾਂ ਲੰਬਕਾਰੀ ਲਾਈਨਾਂ ਵਿੱਚ ਕਿਉਂ ਲੱਗਦੇ ਹਨ?\n",
"> ਕੀ ਤੁਸੀਂ ਅੰਦਾਜ਼ਾ ਲਗਾ ਸਕਦੇ ਹੋ ਕਿ ਇਹ ਬਿੰਦੂ ਇਸ ਤਰ੍ਹਾਂ ਲੰਬਕਾਊ ਲਾਈਨਾਂ ਵਿੱਚ ਕਿਉਂ ਲੱਗਦੇ ਹਨ?\n",
"\n",
"ਅਸੀਂ ਕ੍ਰਿਤ੍ਰਿਮ ਤਰੀਕੇ ਨਾਲ ਬਣਾਈ ਗਈ ਧਾਰਣਾ ਜਿਵੇਂ ਕਿ ਤਨਖਾਹ ਅਤੇ ਪਰਵੇਖਤ ਵੈਰੀਏਬਲ *ਉਚਾਈ* ਵਿੱਚ ਸਬੰਧ ਵੇਖਿਆ ਹੈ। ਆਓ ਦੇਖੀਏ ਕਿ ਦੋ ਪਰਵੇਖਤ ਵੈਰੀਏਬਲ, ਜਿਵੇਂ ਕਿ ਉਚਾਈ ਅਤੇ ਵਜ਼ਨ ਵੀ, ਇੱਕ ਦੂਜੇ ਨਾਲ ਸੰਬੰਧਿਤ ਹਨ ਜਾਂ ਨਹੀਂ:\n"
"ਅਸੀਂ ਇੱਕ ਕ੍ਰਿਤ੍ਰਿਮ ਤਰੀਕੇ ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਗਏ ਅਧਾਰ 'ਤਨਖਾਹ' ਅਤੇ ਪਰਖਿਆ ਗਿਆ ਵੈਰੀਏਬਲ *ਕੱਦ* ਦੇ ਵਿਚਕਾਰ ਸੰਬੰਧ ਦਾ ਅਧਿਐਨ ਕੀਤਾ ਹੈ। ਆਓ ਇਹ ਵੀ ਦੇਖੀਏ ਕਿ ਦੋ ਪੜ੍ਹੇ ਗਏ ਵੈਰੀਏਬਲ, ਜਿਵੇਂ ਕਿ ਕੱਦ ਅਤੇ ਵਜ਼ਨ, ਵੀ ਪਰਸਪਰ ਸੰਬੰਧਿਤ ਹਨ ਜਾਂ ਨਹੀਂ:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਬਦਕਿਸਮਤੀ ਨਾਲ, ਸਾਨੂੰ ਕੋਈ ਨਤੀਜਾ ਨਹੀਂ ਮਿਲਿਆ - ਸਿਰਫ ਕੁਝ ਅਜੀਬ `nan` ਮੁੱਲ। ਇਹ ਇਸ ਕਾਰਨ ਹੈ ਕਿ ਸਾਡੇ ਸੀਰੀਜ਼ ਵਿੱਚ ਕੁਝ ਮੁੱਲ ਅਣਨਿਰਧਾਰਿਤ ਹਨ, ਜੋ ਕਿ `nan` ਰੂਪ ਵਿੱਚ ਦਰਸਾਏ ਗਏ ਹਨ, ਜਿਸ ਕਾਰਨ ਓਪਰੇਸ਼ਨ ਦਾ ਨਤੀਜਾ ਵੀ ਅਣਨਿਰਧਾਰਿਤ ਹੋ ਜਾਂਦਾ ਹੈ। ਮੈਟਰਿਕਸ ਨੂੰ ਦੇਖ ਕੇ ਅਸੀਂ ਵੇਖ ਸਕਦੇ ਹਾਂ ਕਿ `Weight` ਸਮੱਸਿਆ ਵਾਲਾ ਕਾਲਮ ਹੈ, ਕਿਉਂਕਿ `Height` ਮੁੱਲਾਂ ਵਿੱਚ ਸਵੈ-ਸਬੰਧਤ ਕੈਲਕ्युਲੇਸ਼ਨ ਕੀਤਾ ਗਿਆ ਹੈ।\n",
"ਬਦਕਿਸਮਤੀ ਨਾਲ, ਸਾਨੂੰ ਕੋਈ ਨਤੀਜੇ ਨਹੀਂ ਮਿਲੇ - ਸਿਰਫ ਕੁਝ ਅਜੀਬ `nan` ਵੈਲਯੂਜ਼। ਇਹ ਇਸ ਕਰਕੇ ਹੋਇਆ ਹੈ ਕਿ ਸਾਡੇ ਸਿਰੀਜ਼ ਵਿੱਚ ਕੁਝ ਵੈਲਯੂਜ਼ ਅਪਰਿਭਾਸ਼ਿਤ ਹਨ, ਜੋ `nan` ਦੇ ਤੌਰ ਤੇ ਦਰਸਾਏ ਗਏ ਹਨ, ਜਿਸ ਕਾਰਨ ਆਪਰੇਸ਼ਨ ਦਾ ਨਤੀਜਾ ਵੀ ਅਪਰਿਭਾਸ਼ਿਤ ਹੋ ਜਾਂਦਾ ਹੈ। ਮੈਟ੍ਰਿਕਸ ਨੂੰ ਦੇਖ ਕੇ ਅਸੀਂ ਪਤਾ ਲਗਾ ਸਕਦੇ ਹਾਂ ਕਿ `Weight` ਸਮੱਸਿਆ ਵਾਲਾ ਕਾਲਮ ਹੈ, ਕਿਉਂਕਿ `Height` ਵੈਲਯੂਜ਼ ਵਿਚਕਾਰ ਸਵੈ-ਸੰਬੰਧ ਜੋੜਿਆ ਗਿਆ ਹੈ।\n",
"\n",
"> ਇਹ ਉਦਾਹਰਨ **ਡੇਟਾ ਤਿਆਰੀ** ਅਤੇ **ਸਾਫ਼-ਸੁਥਰਾ** ਹੋਣ ਦੀ ਮਹੱਤਤਾ ਦਿਖਾਉਂਦੀ ਹੈ। ਠੀਕ ਡੇਟਾ ਤੋਂ ਬਿਨਾਂ ਅਸੀਂ ਕੁਝ ਵੀ ਗਣਨਾ ਨਹੀਂ ਕਰ ਸਕਦੇ।\n",
"> ਇਹ ਉਦਾਹਰਨ **ਡਾਟਾ ਤਿਆਰੀ** ਅਤੇ **ਸਫਾਈ** ਦੀ ਮਹੱਤਤਾ ਦਿਖਾਉਂਦੀ ਹੈ। ਠੀਕ ਡਾਟਾ ਬਿਨਾਂ ਅਸੀਂ ਕੁਝ ਵੀ ਹਿਸਾਬ ਨਹੀਂ ਕਰ ਸਕਦੇ।\n",
"\n",
"ਚਲੋ `fillna` ਮੈਥਡ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਗੁਆਚੁਕੇ ਮੁੱਲ ਭਰਦੇ ਹਾਂ, ਅਤੇ ਸਬੰਧਤਾ ਦੀ ਗਣਨਾ ਕਰਦੇ ਹਾਂ:\n"
"ਆਓ `fillna` ਮੈਥਡ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਗੁੰਮ ਵੈਲਯੂਜ਼ ਭਰੀਏ, ਅਤੇ ਸੰਬੰਧਤਾ ਦੀ ਗਣਨਾ ਕਰੀਏ: \n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"ਇਕ ਸੰਬੰਧ ਹੈ, ਪਰ ਸਾਡੇ ਕਲਪਨਾਤਮਕ ਉਦਾਹਰਨ ਵਾਂਗੋਂ ਇਨਾ ਮਜ਼ਬੂਤ ਨਹੀਂ। ਵਿਅਕਤੀਗਤ ਮੀਮਾਂਸਾ ਦੇ ਲਈ ਜੇ ਅਸੀਂ ਇੱਕ ਮੁੱਲ ਨੂੰ ਦੂਜੇ ਮੁੱਲ ਦੇ ਖਿਲਾਫ ਸਕੈਟਰ ਪਲਾਟ 'ਚ ਵੇਖੀਏ, ਤਾਂ ਇਹ ਸੰਬੰਧ ਕਾਫੀ ਘੱਟ ਸਪਸ਼ਟ ਹੋਵੇਗਾ:\n"
"ਯਕੀਨਨ ਇਕ ਸੰਬੰਧ ਹੈ, ਪਰ ਸਾਡੇ ਕෘਤਰਿਮ ਉਦਾਹਰਨ ਵਾਂਗੁ ਇਨਾ ਮਜ਼ਬੂਤ ਨਹੀਂ। ਯਕੀਨਨ, ਜੇ ਅਸੀਂ ਇੱਕ ਮੁੱਲ ਨੂੰ ਦੂਜੇ ਦੇ ਖਿਲਾਫ ਸੈਂਟਰ ਪਲਾਟ 'ਤੇ ਦੇਖੀਏ, ਤਾਂ ਸੰਬੰਧ ਬਹੁਤ ਘੱਟ ਸਪਸ਼ਟ ਹੋਵੇਗਾ:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## ਨਤੀਜਾ\n",
"\n",
"ਇਸ ਨੋਟਬੁੱਕ ਵਿੱਚ ਅਸੀਂ ਸਿੱਖਿਆ ਕਿ ਡੇਟਾ ‘ਤੇ ਬੁਨਿਆਦੀ ਕਾਰਵਾਈਆਂ ਕਿਵੇਂ ਕਰਨੀ ਹਨ ਤਾਂ ਜੋ ਸਾਂਖਿਆਕੀ ਫੰਕਸ਼ਨਾਂ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾ ਸਕੇ। ਅਸੀਂ ਹੁਣ ਜਾਣਦੇ ਹਾਂ ਕਿ ਕੁਝ ਧਾਰਨਾਵਾਂ ਨੂੰ ਸਾਬਤ ਕਰਨ ਲਈ ਗਣਿਤ ਅਤੇ ਸਾਂਖਿਆਕੀ ਦੀ ਇੱਕ ਮਜ਼ਬੂਤ ਸੰਦਾਰੀ ਵਰਤੋਂ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਅਤੇ ਕਿਸੇ ਵੀ ਚਲ-ਚਲਾਵ ਲਈ ਡੇਟਾ ਨਮੂਨੇ ਦੇ ਆਧਾਰ ‘ਤੇ ਵਿਸ਼ਵਾਸ ਅੰਤਰਾਲ ਕਿਵੇਂ ਗਣਨਾ ਕਰਦੇ ਹਨ।\n"
"ਇਸ ਨੋਟਬੁੱਕ ਵਿੱਚ ਅਸੀਂ ਸਿੱਖਿਆ ਕਿ ਡੇਟਾ 'ਤੇ ਮੂਲਭੂਤ ਕਾਰਵਾਈਆਂ ਕਿਵੇਂ ਕਰਨੀ ਹੈ ਤਾਂ ਕਿ ਸਾਂਖਿਆਕੀ ਫੰਕਸ਼ਨਾਂ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾ ਸਕੇ। ਹੁਣ ਅਸੀਂ ਜਾਣਦੇ ਹਾਂ ਕਿ ਕੁਝ ਪਰਿਕਲਪਨਾਵਾਂ ਨੂੰ ਸਾਬਤ ਕਰਨ ਲਈ ਗਣਿਤ ਅਤੇ ਸਾਂਖਿਆਕੀ ਦੇ ਸਾਊਂਡ ਉਪਕਰਨਾਂ ਦੀ ਵਰਤੋਂ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਅਤੇ ਡੇਟਾ ਸੈਂਪਲ ਦੇ ਆਧਾਰ 'ਤੇ ਮਨਮਾਨੇ ਚਲਾਂ ਲਈ ਵਿਸ਼ਵਾਸ ਅੰਤਰਾਲ ਕਿਵੇਂ ਗਣਨਾ ਕਰਨੇ ਹਨ। \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ਇਨਕਾਰ**: \nਇਹ ਦਸਤਾਵੇਜ਼ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾ ਲਈ ਕੋਸ਼ਿਸ਼ ਕਰਦੇ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮਪੜਤਤਾ ਹੋ ਸਕਦੀ ਹੈ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੇ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਿਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੀ ਵਰਤੋਂ ਨਾਲ ਉਪਜਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਮੀ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਿੰਮੇਵਾਰ ਨਹੀਂ ਹਾਂ।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ਅਸਵੀਕਾਰੋਪਣ**:\nਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T12:47:41+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pa"
}
},
"nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# ਕੋਵਿਡ-19 ਮਹਾਮਾਰੀ ਦਾ ਅੰਦਾਜ਼ਾ\n",
"# COVID-19 ਮਹਾਂਮਾਰੀ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣਾ\n",
"\n",
"## ਡਟਾ ਲੋਡ ਕਰਨਾ\n",
"## ਡਟਾ ਲੋਡ ਕਰਨਾ\n",
"\n",
"ਅਸੀਂ ਕੋਵਿਡ-19 ਨਾਲ ਸੰਕ੍ਰਮਿਤ ਵਿਅਕਤੀਆਂ ਦੇ ਡਾਟਾ ਦੀ ਵਰਤੋਂ ਕਰਾਂਗੇ, ਜੋ ਕਿ [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ਵਲੋਂ [Johns Hopkins University](https://jhu.edu/) ਵਿੱਚ ਪ੍ਰਦਾਨ ਕੀਤਾ ਗਿਆ ਹੈ। ਡਾਟਾਸੈੱਟ [ਇਸ GitHub Repository](https://github.com/CSSEGISandData/COVID-19) ਵਿੱਚ ਉਪਲਬਧ ਹੈ।\n"
"ਅਸੀਂ COVID-19 ਨਾਲ ਸੰਕਰਮਿਤ ਵਿਅਕਤੀਆਂ ਬਾਰੇ ਡੇਟਾ ਵਰਤਾਂਗੇ, ਜੋ [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ਵਲੋਂ [Johns Hopkins University](https://jhu.edu/) ਵਿੱਚ ਮੁਹੱਈਆ ਕਰਵਾਇਆ ਗਿਆ ਹੈ। ਡੇਟਾਸੇਟ ਇਸ [GitHub Repository](https://github.com/CSSEGISandData/COVID-19) ਵਿੱਚ ਉਪਲਬਧ ਹੈ।\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਅਸੀਂ `pd.read_csv` ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਸਭ ਤੋਂ ਹਾਲੀਆ ਡੇਟਾ ਸਿੱਧਾ GitHub ਤੋਂ ਲੋਡ ਕਰ ਸਕਦੇ ਹਾਂ। ਜੇ ਕਿਸੇ ਕਾਰਨ ਡੇਟਾ ਉਪਲਬਧ ਨਾ ਹੋਵੇ, ਤਾਂ ਤੁਸੀਂ ਸਦਾ `data` ਫੋਲਡਰ ਵਿੱਚ ਮੌਜੂਦ ਕਾਪੀ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ - ਸਿਰਫ ਹੇਠਾਂ ਦਿੱਤੀ ਲਾਈਨ ਨੂੰ ਅਨਕਾਮੈਂਟ ਕਰੋ ਜੋ `base_url` ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦੀ ਹੈ:\n"
"ਅਸੀਂ GitHub ਤੋਂ ਸਿੱਧਾ ਸਭ ਤੋਂ ਤਾਜ਼ਾ ਡਾਟਾ `pd.read_csv` ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਲੋਡ ਕਰ ਸਕਦੇ ਹਾਂ। ਜੇ ਕਿਸੇ ਕਾਰਨ ਡਾਟਾ ਉਪਲਬਧ ਨਾ ਹੋਵੇ, ਤਾਂ ਤੁਸੀਂ ਸਥਾਨਕ ਤੌਰ 'ਤੇ `data` ਫੋਲਡਰ ਵਿੱਚ ਮੌਜੂਦ ਕਾਪੀ ਦੀ ਹਮੇਸ਼ਾ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ - ਸਿਰਫ ਹੇਠਾਂ ਦਿੱਤੀ ਲਾਈਨ ਜੋ `base_url` ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦੀ ਹੈ, ਉਸ 'ਤੇੋਂ ਕਮੈਂਟ ਹਟਾਓ:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਹੁਣ ਆਓ ਸੰਕ੍ਰਮਿਤ ਵਿਅਕਤੀਆਂ ਲਈ ਡੇਟਾ ਲੋਡ ਕਰੀਏ ਅਤੇ ਵੇਖੀਏ ਕਿ ਡੇਟਾ ਕਿਵੇਂ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ:\n"
"ਆਓ ਹੁਣ ਸੰਕ੍ਰਮਿਤ ਵਿਅਕਤੀਆਂ ਲਈ ਡੇਟਾ ਲੋਡ ਕਰੀਏ ਅਤੇ ਵੇਖੀਏ ਕਿ ਡੇਟਾ ਕਿਵੇਂ ਦਿੱਸਦਾ ਹੈ:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਅਸੀਂ ਦੇਖ ਸਕਦੇ ਹਾਂ ਕਿ ਟੇਬਲ ਦੀ ਹਰ ਪੁੰਕਤੀ ਹਰ ਦੇਸ਼ ਅਤੇ/ਜਾਂ ਪ੍ਰਾਂਤ ਲਈ ਸੰਕ੍ਰਮਿਤ ਵਿਅਕਤੀਆਂ ਦੀ ਗਿਣਤੀ ਦਰਸਾਉਂਦੀ ਹੈ, ਅਤੇ ਕਾਲਮਾਂ ਤਾਰੀਖਾਂ ਨੂੰ ਦਰਸਾਉਂਦੇ ਹਨ। ਹੋਰ ਡੇਟਾ ਲਈ ਵੀ ਈਸੇ ਕਿਸਮ ਦੀਆਂ ਟੇਬਲਾਂ ਲੋਡ ਕੀਤੀਆਂ ਜਾ ਸਕਦੀਆਂ ਹਨ, ਜਿਵੇਂ ਕਿ ਸਿਹਤਮੰਦ ਹੋਏ ਲੋਕਾਂ ਦੀ ਗਿਣਤੀ ਅਤੇ ਮੌਤਾਂ ਦੀ ਗਿਣਤੀ।\n"
"ਅਸੀਂ ਵੇਖ ਸਕਦੇ ਹਾਂ ਕਿ ਟੇਬਲ ਦੀ ਹਰ ਪੰਗਤੀ ਹਰ ਦੇਸ਼ ਅਤੇ/ਜਾਂ ਪ੍ਰਾਂਤ ਲਈ ਸੰਕ੍ਰਮਿਤ افراد ਦੀ ਗਿਣਤੀ ਨੂੰ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦੀ ਹੈ, ਅਤੇ ਕਾਲਮ ਤਾਰੀਖਾਂ ਨਾਲ ਮਿਲਦੇ ਹਨ। ਹੋਰ ਡਾਟਾ ਲਈ ਮਿਲਦੇ ਜੁਲਦੇ ਟੇਬਲ ਲੋਡ ਕੀਤੇ ਜਾ ਸਕਦੇ ਹਨ, ਜਿਵੇਂ ਕਿ ਠੀਕ ਹੋਏ ਲੋਕਾਂ ਦੀ ਗਿਣਤੀ ਅਤੇ ਮੌਤਾਂ ਦੀ ਸੰਖਿਆ। \n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## ਡੇਟਾ ਨੂੰ ਸਮਝਣਾ\n",
"\n",
"ਉੱਪਰ ਦਿੱਤੀ ਟੇਬਲ ਤੋਂ ਪ੍ਰਾਂਤ ਕਾਲਮ ਦੀ ਭੂਮਿਕਾ ਸਪਸ਼ਟ ਨਹੀਂ ਹੈ। ਆਓ ਵੇਖੀਏ ਕਿ `Province/State` ਕਾਲਮ ਵਿੱਚ ਕਿਹੜੀਆਂ ਵੱਖ-ਵੱਖਆਂ ਸਾਰੀਆਂ ਮੌਜੂਦ ਹਨ:\n"
"ਉਪਰੋਕਤ ਟੇਬਲ ਤੋਂ ਪ੍ਰਾਂਤ ਕਾਲਮ ਦੀ ਭੂਮਿਕਾ ਸਪਸ਼ਟ ਨਹੀਂ ਹੈ। ਆਓ ਦੇਖੀਏ `Province/State` ਕਾਲਮ ਵਿੱਚ ਮੌਜੂਦ ਵੱਖ-ਵੱਖ ਕੀਮਤਾਂ:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਨਾਂਵਾਂ ਤੋਂ ਅਸੀਂ ਨਤੀਜਾ ਕੱਢ ਸਕਦੇ ਹਾਂ ਕਿ ਆਸਟ੍ਰੇਲੀਆ ਅਤੇ ਚੀਨ ਵਰਗੇ ਦੇਸ਼ਾਂ ਵਿੱਚ ਸੂਬਿਆਂ ਅਨੁਸਾਰ ਜ਼ਿਆਦਾ ਵਿਸਤ੍ਰਿਤ ਵਰਗੀਕਰਨ ਹੁੰਦਾ ਹੈ। ਆਓ ਚੀਨ ਬਾਰੇ ਜਾਣਕਾਰੀ ਲੱਭੀਏ ਤਾਂ ਕਿ ਉਦਾਹਰਣ ਵੇਖੀ ਜਾ ਸਕੇ:\n"
"ਨਾਮਾਂ ਤੋਂ ਅਸੀਂ ਨਿਰੀਖਣ ਕਰ ਸਕਦੇ ਹਾਂ ਕਿ ਆਸਟ੍ਰੇਲੀਆ ਅਤੇ ਚੀਨ ਵਰਗੇ ਦੇਸ਼ਾਂ ਕੋਲ ਪ੍ਰਾਂਤਾਂ ਵੱਲੋਂ ਹੋਰ ਵਿਸਥਾਰਿਤ ਵਿਭਾਜਨ ਹੈ। ਆਓ ਚੀਨ ਬਾਰੇ ਜਾਣਕਾਰੀ ਲੱਭੀਏ ਤਾਂ ਜੋ ਉਦਾਹਰਨ ਵੇਖੀ ਜਾ ਸਕੇ:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## ਡਾਟਾ ਦੀ ਪਹਿਲਾਂ-ਪ੍ਰਕਿਰਿਆ\n",
"## ਡਾਟਾ ਨੂੰ ਪ੍ਰੀ-ਪ੍ਰੋਸੈਸ ਕਰਨਾ \n",
"\n",
"ਅਸੀਂ ਦੇਸ਼ਾਂ ਨੂੰ ਹੋਰ ਖੇਤਰਾਂ ਵਿੱਚ ਵੰਡਣ ਵਿੱਚ ਰੁਚੀ ਨਹੀਂ ਰੱਖਦੇ, ਇਸ ਲਈ ਅਸੀਂ ਪਹਿਲਾਂ ਇਸ ਵੰਡ ਨੂੰ ਖਤਮ ਕਰਾਂਗੇ ਅਤੇ ਸਾਰੇ ਖੇਤਰਾਂ ਦੀ ਜਾਣਕਾਰੀ ਇਕੱਠੀ ਕਰਾਂਗੇ, ਤਾਂ ਜੋ ਪੂਰੇ ਦੇਸ਼ ਲਈ ਜਾਣਕਾਰੀ ਮਿਲ ਸਕੇ। ਇਹ `groupby` ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ:\n"
"ਅਸੀਂ ਦੇਸ਼ਾਂ ਨੂੰ ਹੋਰ ਖੇਤਰਾਂ ਵਿੱਚ ਵੰਡਣ ਵਿੱਚ ਰੁਚੀ ਨਹੀਂ ਰੱਖਦੇ, ਇਸ ਲਈ ਅਸੀਂ ਪਹਿਲਾਂ ਇਸ ਵੰਡ ਨੂੰ ਹਟਾ ਦੇਵਾਂਗੇ ਅਤੇ ਸਾਰੀਆਂ ਖੇਤਰਾਂ ਦੀ ਜਾਣਕਾਰੀ ਇਕੱਠੀ ਕਰਾਂਗੇ, ਤਾਂ ਜੋ ਸਾਰੇ ਦੇਸ਼ ਲਈ ਜਾਣਕਾਰੀ ਮਿਲ ਸਕੇ। ਇਹ `groupby` ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਤੁਸੀਂ ਦੇਖ ਸਕਦੇ ਹੋ ਕਿ `groupby` ਵਰਤਣ ਕਰਕੇ ਸਾਰੇ ਡੇਟਾਫਰੇਮ ਹੁਣ ਦੇਸ਼/ਖੇਤਰ ਅਨੁਸਾਰ ਸੂਚੀਬੱਧ ਹੋ ਚੁੱਕੇ ਹਨ। ਇਸ ਤਰ੍ਹਾਂ ਅਸੀਂ ਕਿਸੇ ਵਿਸ਼ੇਸ਼ ਦੇਸ਼ ਦਾ ਡੇਟਾ `.loc` ਵਰਤ ਕੇ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹਾਂ:|\n"
"ਤੁਸੀਂ ਦੇਖ ਸਕਦੇ ਹੋ ਕਿ `groupby` ਦੀ ਵਰਤੋਂ ਕਾਰਨ ਸਾਰੇ DataFrames ਹੁਣ ਦੇਸ਼/ਖੇਤਰ ਦੇ ਨਾਲ ਸੂਚੀਬੱਧ ਹਨ। ਅਸੀਂ ਇਸ ਤਰ੍ਹਾਂ ਕਿਸੇ ਖਾਸ ਦੇਸ਼ ਦਾ ਡੇਟਾ `.loc` ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹਾਂ:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **ਨੋਟ** ਦੇਖੋ ਕਿ ਅਸੀਂ `[3:]` ਕਿਵੇਂ ਵਰਤਦੇ ਹਾਂ ਤਾਕਿ ਉਸ ਸਿੱਕੜਦੇ ਤੱਤਾਂ ਨੂੰ ਹਟਾਇਆ ਜਾ ਸਕੇ ਜਿਹੜੇ ਗੈਰ-ਤਾਰੀਖੀ ਮੈਟਾਡੇਟਾ (ਪ੍ਰੋਵਿੰਸ/ਸਟੀਟ ਅਤੇ ਭੂ-ਸਥਿਤੀ ਕਾਲਮ) ਰੱਖਦੇ ਹਨ। ਅਸੀਂ ਉਹ ਤਿੰਨੇ ਕਾਲਮ ਬਿਲਕੁਲ ਹੀ ਹਟਾ ਵੀ ਸਕਦੇ ਹਾਂ:\n"
"> **ਨੋਟ** ਕਰੋ ਕਿ ਅਸੀਂ ਕਿਵੇਂ `[3:]` ਵਰਤਦੇ ਹਾਂ ਤਾਂ ਜੋ ਇੱਕ ਲੜੀ ਦੇ ਪਹਿਲੇ ਤਿੰਨ ਤੱਤ ਹਟਾ ਦਿੱਤੇ ਜਾਣ ਜੋ ਗੈਰ-ਤਾਰੀਖੀ ਮੈਟਾਡੇਟਾ ਰੱਖਦੇ ਹਨ (ਪ੍ਰਾਂਤ/ਸੂਬਾ ਅਤੇ ਭੂ-ਸਥਿਤੀ ਕਾਲਮ). ਅਸੀਂ ਇਹ ਤਿੰਨ ਕਾਲਮ ਬਿਲਕੁਲ ਹੀ ਹਟਾ ਵੀ ਸਕਦੇ ਹਾਂ:\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## ਡਾਟਾ ਦੀ ਜਾਂਚ\n",
"\n",
"ਚਲੋ ਹੁਣ ਕਿਸੇ ਖਾਸ ਦੇਸ਼ ਦੀ ਜਾਂਚ ਕਰੀਏ। ਆਓ ਇੱਕ ਫਰੇਮ ਬਣਾਈਏ ਜਿਸ ਵਿੱਚ ਮਿਤੀ ਅਨੁਸਾਰ ਸੰਕਰਮਣਾਂ ਦੇ ਡਾਟਾ ਸ਼ਾਮِل ਹੋਵੇ:\n"
"ਚਲੋ ਹੁਣ ਕਿਸੇ ਵਿਸ਼ੇਸ਼ ਦੇਸ਼ ਦੀ ਜਾਂਚ ਕਰੀਏ। ਆਓ ਇੱਕ ਫਰੇਮ ਬਣਾਈਏ ਜੋ ਮਿਤੀ ਅਨੁਸਾਰ ਇੰਫੈਕਸ਼ਨਾਂ ਦਾ ਡਾਟਾ ਸ਼ਾਮਿਲ ਕਰਦਾ ਹੋਵੇ:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਹੁਣ ਆਓ ਹਰ ਦਿਨ ਨਵੇਂ ਸੰਕ੍ਰਮਿਤ ਲੋਕਾਂ ਦੀ ਗਿਣਤੀ ਕੀਤੀ جائے। ਇਸ ਨਾਲ ਸਾਨੂੰ ਮਹਾਂਮਾਰੀ ਦੀ ਪ੍ਰਗਤੀ ਦੀ ਤੇਜ਼ੀ ਦੇਖਣ ਵਿੱਚ ਸਹਾਇਤਾ ਮਿਲੇਗੀ। ਇਹ ਕਰਨ ਦਾ ਸਭ ਤੋਂ ਆਸਾਨ ਤਰੀਕਾ `diff` ਵਰਤਣਾ ਹੈ:\n"
"ਹੁਣ ਆਓ ਹਰ ਦਿਨ ਨਵੇਂ ਸੰਕ੍ਰਮਿਤ ਲੋਕਾਂ ਦੀ ਗਿਣਤੀ ਕਰੀਏ। ਇਸ ਨਾਲ ਸਾਨੂੰ ਮਹਾਮਾਰੀ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਫੈਲ ਰਹੀ ਹੈ, ਇਹ ਜਾਣਨ ਵਿੱਚ ਮਦਦ ਮਿਲੇਗੀ। ਇਸਦਾ ਸਭ ਤੋਂ ਆਸਾਨ ਤਰੀਕਾ `diff` ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਹੈ:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਅਸੀਂ ਡਾਟਾ ਵਿੱਚ ਉੱਚੇ ਉਤਾਰ-ਚੜ੍ਹਾਵ ਦੇਖ ਸਕਦੇ ਹਾਂ। ਆਓ ਇੱਕ ਮਹੀਨੇ ਨੂੰ ਨਜ਼ਦੀਕੋਂ ਵੇਖੀਏ:\n"
"ਅਸੀਂ ਡਾਟਾ ਵਿੱਚ ਵੱਡੇ ਉੱਪਰ-ਥੱਲੇ ਵੇਖ ਸਕਦੇ ਹਾਂ। ਚਲੋ ਇੱਕ ਮਹੀਨੇ ਨੂੰ ਵਧੇਰੇ ਨੇੜੇ ਤੋਂ ਵੇਖਦੇ ਹਾਂ:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਇਹ ਸਾਫ਼ ਦਿੱਸਦਾ ਹੈ ਕਿ ਡਾਟਾ ਵਿੱਚ ਸਪਤਾਹਿਕ ਉਤਾਰ-ਚੜ੍ਹਾਵ ਹਨ। ਕਿਉਂਕਿ ਅਸੀਂ ਰੁਝਾਨਾਂ ਨੂੰ ਵੇਖਣਾ ਚਾਹੁੰਦੇ ਹਾਂ, ਇਸ ਲਈ ਕਰਵ ਨੂੰ ਸਮੂਥ ਕਰਨ ਲਈ ਚਲ ਰਹੀ ਔਸਤ ਦੀ ਗਣਨਾ ਕਰਨਾ ਤਰੱਕੀਪੂਰਕ ਹੈ (ਅਰਥਾਤ ਹਰ ਦਿਨ ਲਈ ਅਸੀਂ ਪਿਛਲੇ ਕਈ ਦਿਨਾਂ ਦੀ ਔਸਤ ਮೌಲ ਦੀ ਗਣਨਾ ਕਰਾਂਗੇ):\n"
"ਇਹ ਸਾਫ਼ ਤੌਰ 'ਤੇ ਦਿਖਾਈ ਦਿੰਦਾ ਹੈ ਕਿ ਡਾਟਾ ਵਿੱਚ ਹਫਤਾਵਾਰੀ ਉਤਾਰ-ਚੜਾਵ਼ ਹਨ। ਕਿਉਂਕਿ ਅਸੀਂ ਰੁਝਾਨਾਂ ਨੂੰ ਦੇਖਣਾ ਚਾਹੁੰਦੇ ਹਾਂ, ਇਸ ਲਈ ਕ੍ਰਿਵ ਨੂੰ ਸਧਾਰਨ ਬਣਾਉਣਾ ਵਾਜਬ ਹੈ ਰਨਿੰਗ ਐਵਰੇਜ਼ ਕੈਲਕੁਲੇਟ ਕਰਕੇ (ਅਰਥਾਤ ਹਰ ਦਿਨ ਲਈ ਅਸੀਂ ਪਿਛਲੇ ਕਈ ਦਿਨਾਂ ਦਾ ਔਸਤ ਮੁੱਲ ਕੈਲਕੁਲੇਟ ਕਰਾਂਗੇ):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਕਈ ਦੇਸ਼ਾਂ ਦੀ ਤੁਲਨਾ ਕਰਨ ਲਈ, ਸਾਨੂੰ ਦੇਸ਼ ਦੀ ਅਬਾਦੀ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਲੈਣਾ ਚਾਹੀਦਾ ਹੈ, ਅਤੇ ਦੇਸ਼ ਦੀ ਅਬਾਦੀ ਦੇ ਸੰਦਰਭ ਵਿੱਚ ਸੰਕਰਮਿਤ ਵਿਅਕਤੀਆਂ ਦੇ ਪ੍ਰਤੀਸ਼ਤ ਨੂੰ ਤੁਲਨਾ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ। ਦੇਸ਼ ਦੀ ਅਬਾਦੀ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ, ਆਓ ਦੇਸ਼ਾਂ ਦਾ ਡਾਟਾ ਸੈੱਟ ਲੋਡ ਕਰੀਏ:\n"
"ਕੁਝ ਦੇਸ਼ਾਂ ਦੀ ਤੁਲਨਾ ਕਰਨ ਯੋਗ ਹੋਣ ਲਈ, ਅਸੀਂ ਦੇਸ਼ ਦੀ ਆਬਾਦੀ ਦਾ ਖਿਆਲ ਰੱਖਣਾ ਚਾਹੁੰਦੇ ਹਾਂ, ਅਤੇ ਦੇਸ਼ ਦੀ ਆਬਾਦੀ ਦੇ ਸੰਦਰਭ ਵਿੱਚ ਸੰਕਰਮਿਤ ਵਿਅਕਤੀਆਂ ਦੇ ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਤੁਲਨਾ ਕਰਨੀ ਚਾਹੁੰਦੇ ਹਾਂ। ਦੇਸ਼ ਦੀ ਆਬਾਦੀ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ, ਆਓ ਦੇਸ਼ਾਂ ਦੇ ਡੈਟਾਸੇਟ ਨੂੰ ਲੋਡ ਕਰੀਏ:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਕਿਉਂਕਿ ਇਸ ਡੇਟਾਸੈਟ ਵਿਚ ਦੋਨੋਂ ਦੇਸ਼ਾਂ ਅਤੇ ਪ੍ਰਾਂਤਾਂ ਦੀ ਜਾਣਕਾਰੀ ਸ਼ਾਮਲ ਹੈ, ਪੂਰੇ ਦੇਸ਼ ਦੀ ਆਬਾਦੀ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਸਾਨੂੰ ਥੋੜ੍ਹੀ ਚਤੁਰਾਈ ਵਰਤਣੀ ਪਏਗੀ:\n"
"ਕਿਉਂਕਿ ਇਹ ਡੇਟਾਸੈਟ ਦੇਸ਼ਾਂ ਅਤੇ ਪ੍ਰਾਂਤਾਂ ਦੇ ਜਾਣਕਾਰੀ ਦਿੰਦਾ ਹੈ, ਪੂਰੇ ਦੇਸ਼ ਦੀ ਆਬਾਦੀ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਸਾਨੂੰ ਕੁਝ ਚਾਲਾਕ ਹੋਣਾ ਪਵੇਗਾ: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## $R_t$ ਦੀ ਗਣਨਾ\n",
"\n",
"ਦੇਖਣ ਲਈ ਕਿ ਰੋਗ ਕਿੰਨਾ ਸੰਕਰਮਕ ਹੈ, ਅਸੀਂ **ਮੂਲ ਪ੍ਰਜਨਨ ਸੰਖਿਆ** $R_0$ ਤੇ ਧਿਆਨ ਦਿੰਦੇ ਹਾਂ, ਜੋ ਦੱਸਦੀ ਹੈ ਕਿ ਇੱਕ ਸੰਕਰਮਿਤ ਵਿਅਕਤੀ ਹੋਰ ਕਿੰਨੇ ਲੋਕਾਂ ਨੂੰ ਸੰਕਰਮਿਤ ਕਰੇਗਾ। ਜਦੋਂ $R_0$ 1 ਤੋਂ ਵੱਧ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਮਹਾਮਾਰੀ ਦੇ ਫੈਲਣ ਦੀ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ।\n",
"ਬਿਮਾਰੀ ਕਿੰਨੀ ਸੰਕ੍ਰਾਮਕ ਹੈ ਇਹ ਦੇਖਣ ਲਈ, ਅਸੀਂ **ਮੂਲ ਪ੍ਰਜਨਨ ਸੰਖਿਆ** $R_0$ ਨੂੰ ਵੇਖਦੇ ਹਾਂ, ਜੋ ਦੱਸਦੀ ਹੈ ਕਿ ਇਕ ਸੰਕ੍ਰਮੀਤ ਵਿਅਕਤੀ ਹੋਰ ਕਿੰਨੇ ਲੋਕਾਂ ਨੂੰ ਸੰਕਰਮਿਤ ਕਰੇਗਾ। ਜਦੋਂ $R_0$ 1 ਤੋਂ ਵੱਧ ਹੁੰਦਾ ਹੈ, ਤਦ ਮਹਾਮਾਰੀ ਫੈਲਣ ਦੀ ਸੰਭਾਵਨਾ ਹੁੰਦੀ ਹੈ।\n",
"\n",
"$R_0$ ਰੋਗ ਦੀ ਆਪਣੀ ਵਿਸ਼ੇਸ਼ਤਾ ਹੁੰਦੀ ਹੈ, ਅਤੇ ਇਸ ਵਿੱਚ ਕੁਝ ਸੁਰੱਖਿਆ ਉਪਾਇਆ ਜੋ ਲੋਕ ਮਹਾਮਾਰੀ ਨੂੰ ਧੀਮਾ ਕਰਨ ਲਈ ਲੈਂਦੇ ਹਨ, ਨੂੰ ਸ਼ਾਮਲ ਨਹੀਂ ਕੀਤਾ ਜਾਂਦਾ। ਮਹਾਮਾਰੀ ਦੀ ਤਰੱਕੀ ਦੌਰਾਨ, ਅਸੀਂ ਕਿਸੇ ਵੀ ਦਿੱਤੇ ਸਮੇਂ $t$ 'ਤੇ ਪ੍ਰਜਨਨ ਸੰਖਿਆ $R_t$ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾ ਸਕਦੇ ਹਾਂ। ਇਹ ਸਾਬਤ ਹੋਇਆ ਹੈ ਕਿ ਇਸ ਸੰਖਿਆ ਦਾ ਕੁੱਲ ਮਿਲਾ ਕੇ ਅੰਦਾਜ਼ਾ ਲਗਾਇਆ ਜਾ ਸਕਦਾ ਹੈ 8 ਦਿਨਾਂ ਦੀ ਇੱਕ ਖਿੜਕੀ ਲੈ ਕੇ, ਅਤੇ ਗਣਨਾ ਕਰਕੇ $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ਜਿੱਥੇ $I_t$ ਦਿਨ $t$ 'ਤੇ ਨਵੇਂ ਸੰਕਰਮਿਤ ਵਿਅਕਤੀਆਂ ਦੀ ਗਿਣਤੀ ਹੈ।\n",
"$R_0$ ਬਿਮਾਰੀ ਦੀ ਆਪਣੀ ਖੁਬੀ ਹੈ, ਅਤੇ ਇਹ ਕੁਝ ਸੁਰੱਖਿਆ ਉਪਾਅ ਨਹੀਂ ਲੈਂਦਾ ਜੋ ਲੋਕ ਮਹਾਮਾਰੀ ਨੂੰ ਧੀਮਾ ਕਰਨ ਲਈ ਲਗਾ ਸਕਦੇ ਹਨ। ਮਹਾਮਾਰੀ ਦੇ ਪ੍ਰਗਟਾਵੇ ਦੌਰਾਨ, ਅਸੀਂ ਕਿਸੇ ਵੀ ਸਮੇਂ $t$ 'ਤੇ ਪ੍ਰਜਨਨ ਸੰਖਿਆ $R_t$ ਦਾ ਅੰਦਾਜ਼ਾ ਲਾ ਸਕਦੇ ਹਾਂ। ਇਹ ਦਿਖਾਇਆ ਗਿਆ ਹੈ ਕਿ ਇਸ ਸੰਖਿਆ ਨੂੰ ਲਗਭਗ ਅੰਦਾਜ਼ਾ ਲਗਾਇਆ ਜਾ ਸਕਦਾ ਹੈ 8 ਦਿਨਾਂ ਦੀ ਇੱਕ ਵਿੰਡੋ ਲੈ ਕੇ, ਅਤੇ ਹੇਠਾਂ ਦਿੱਤੇ ਗਣਿਤ ਸੂਤਰ ਨਾਲ ਗਣਨਾ ਕਰ ਕੇ $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ਜਿੱਥੇ $I_t$ ਦਿਨ $t$ 'ਤੇ ਨਵੇਂ ਸੰਕ੍ਰਮੀਤ ਵਿਅਕਤੀਆਂ ਦੀ ਗਿਣਤੀ ਹੈ।\n",
"\n",
"ਆਓ ਆਪਣੇ ਮਹਾਮਾਰੀ ਡੇਟਾ ਲਈ $R_t$ ਦੀ ਗਣਨਾ ਕਰੀਏ। ਇਹ ਕਰਨ ਲਈ, ਅਸੀਂ 8 `ninfected` ਮੂਲ्यों ਦੀ ਇੱਕ ਘੁੰਮਦੀ ਹੋਈ ਖਿੜਕੀ ਲਵਾਂਗੇ, ਅਤੇ ਉਪਰ ਦਿੱਤੇ ਅਨੁপাত ਦਾ ਗਣਨਾ ਕਰਨ ਲਈ ਫੰਕਸ਼ਨ ਲਾਗੂ ਕਰਾਂਗੇ:\n"
"ਆਓ ਸਾਡੇ ਮਹਾਮਾਰੀ ਡਾਟਾ ਲਈ $R_t$ ਦੀ ਗਣਨਾ ਕਰੀਏ। ਇਸ ਲਈ, ਅਸੀਂ 8 `ninfected` ਮੁੱਲਾਂ ਦੀ ਇੱਕ ਰੋਲਿੰਗ ਵਿੰਡੋ ਲਵਾਂਗੇ, ਅਤੇ ਉਪਰੋਕਤ ਅਨੁਪਾਤ ਗਣਨਾ ਕਰਨ ਲਈ ਫੰਕਸ਼ਨ ਲਾਗੂ ਕਰਾਂਗੇ:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਤੁਸੀਂ ਦੇਖ ਸਕਦੇ ਹੋ ਕਿ ਗ੍ਰਾਫ ਵਿੱਚ ਕੁਝ ਖਾਲੀ ਥਾਵਾਂ ਹਨ। ਇਹ `NaN` ਕਾਰਨ ਹੋ ਸਕਦੇ ਹਨ, ਜੇਕਰ ਡੇਟਾਸੈੱਟ ਵਿੱਚ `inf` ਮੁੱਲ ਮੌਜੂਦ ਹਨ। `inf` 0 ਨਾਲ ਭਾਗ ਕਰਨ ਕਾਰਨ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ `NaN` ਗੁਮ ਹੋਇਆ ਡਾਟਾ ਦਰਸਾ ਸਕਦਾ ਹੈ, ਜਾਂ ਨਤੀਜੇ ਦੀ ਗਣਨਾ ਕਰਨ ਲਈ ਕੋਈ ਡਾਟਾ ਉਪਲਬਧ ਨਹੀ ਹੈ (ਜਿਵੇਂ ਸਾਡੇ ਫਰੇਮ ਦੇ ਬਹੁਤ ਸ਼ੁਰੂ ਵਿੱਚ, ਜਿੱਥੇ 8-ਚੌੜਾਈ ਵਾਲਾ ਰੋਲਿੰਗ ਵਿੰਡੋ ਅਜੇ ਤੱਕ ਉਪਲਬਧ ਨਹੀਂ ਹੈ)। ਗ੍ਰਾਫ ਨੂੰ ਸੁੰਦਰ ਬਣਾਉਣ ਲਈ, ਸਾਨੂੰ ਉਹ ਮੁੱਲ `replace` ਅਤੇ `fillna` ਫੰਕਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਭਰਣੇ ਪੈਂਦੇ ਹਨ।\n",
"ਤੁਸੀਂ ਵੇਖ ਸਕਦੇ ਹੋ ਕਿ ਗ੍ਰਾਫ ਵਿੱਚ ਕੁਝ ਖਾਲੀ ਥਾਂਵਾਂ ਹਨ। ਉਹ ਜਾਂ ਤਾਂ `NaN` ਕਾਰਨ ਹੋ ਸਕਦੇ ਹਨ, ਜੇ ਡੇਟਾਸੇਟ ਵਿੱਚ `inf` ਮੁੱਲ ਮੌਜੂਦ ਹਨ। `inf` ਦੇ 0 ਨਾਲ ਵੰਡ ਕਰਨ ਕਰਕੇ ਹੋ ਸਕਦਾ ਹੈ, ਅਤੇ `NaN` ਗੁੰਮ ਹੋਇਆ ਡੇਟਾ ਦਰਸਾ ਸਕਦਾ ਹੈ, ਜਾਂ ਨਤੀਜਾ ਨਕਲਣ ਲਈ ਕੋਈ ਡੇਟਾ ਉਪਲਬਧ ਨਹੀਂ ਹੈ (ਜਿਵੇਂ ਸਾਡੇ ਫਰੇਮ ਦੇ ਬਹੁਤ ਸ਼ੁਰੂਆਤੀ ਹਿੱਸੇ ਵਿੱਚ, ਜਿੱਥੇ 8 ਦੀ ਚੌੜਾਈ ਵਾਲਾ ਰੋਲਿੰਗ ਵਿੰਡੋ ਹਜੇ ਉਪਲਬਧ ਨਹੀਂ ਹੈ)। ਗ੍ਰਾਫ ਨੂੰ ਵਧੀਆ ਬਣਾਉਣ ਲਈ, ਸਾਨੂੰ ਉਹ ਮੁੱਲ `replace` ਅਤੇ `fillna` ਫੰਕਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਪੂਰੇ ਕਰਨੇ ਪੈਣਗੇ।\n",
"\n",
"ਆਓ ਮਹਾਂਮਾਰੀ ਦੇ ਸ਼ੁਰੂਆਤ ਦੇ ਹਿੱਸੇ ਨੂੰ ਹੋਰ ਦੇਖੀਏ। ਅਸੀਂ y-ਅਕਸ ਦੇ ਮੁੱਲਾਂ ਨੂੰ 6 ਤੋਂ ਘੱਟ ਵਾਲੇ ਮੁੱਲਾਂ ਤੱਕ ਸੀਮਿਤ ਕਰਾਂਗੇ, ਤਾਂ ਕਿ ਬਿਹਤਰ ਤਰੀਕੇ ਨਾਲ ਵੇਖ ਸਕੀਏ, ਅਤੇ 1 ਤੇ ਇੱਕ ਅੱਡੀ ਲਾਈਨ ਖਿੱਚਾਂਗੇ।\n"
"ਆਓ ਮਹਾਮਾਰੀ ਦੀ ਸ਼ੁਰੂਆਤ ਨੂੰ ਅੱਗੇ ਵੇਖੀਏ। ਅਸੀਂ y-ਅਕਸ ਦੇ ਮੁੱਲ 6 ਤੋਂ ਘੱਟ ਹੀ ਦਿਖਾਵਾਂਗੇ, ਤਾਂ ਜੋ ਵਧੀਆ ਦੇਖਿਆ ਜਾ ਸਕੇ, ਅਤੇ 1 ‘ਤੇ ਆੜ੍ਹੀ ਲਕੀਰ ਖਿੱਚਾਂਗੇ।\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਪੈਂਡੇਮਿਕ ਦਾ ਇਕ ਹੋਰ ਦਿਲਚਸਪ ਇੰਡੀਕੇਟਰ ਹੈ **ਡੈਰੀਵੇਟਿਵ**, ਜਾਂ ਨਵੇਂ ਕੇਸਾਂ ਵਿੱਚ **ਰੋਜ਼ਾਨਾ ਫਰਕ**। ਇਹ ਸਾਨੂੰ स्पष्ट ਤੌਰ 'ਤੇ ਦੇਖਣ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ ਕਿ ਪੈਂਡੇਮਿਕ ਕਦੋਂ ਵੱਧ ਰਿਹਾ ਹੈ ਜਾਂ ਘਟ ਰਿਹਾ ਹੈ।\n"
"ਮਹਾਂਮਾਰੀ ਦਾ ਇੱਕ ਹੋਰ ਦਿਲਚਸਪ ਸੰਕੇਤਕ ਹੈ **ਡੈਰੀਵੇਟਿਵ**, ਜਾਂ ਨਵੇਂ ਮਾਮਲਿਆਂ ਵਿੱਚ **ਰੋਜ਼ਾਨਾ ਫਰਕ**। ਇਹ ਸਾਨੂੰ ਸਪਸ਼ਟ ਰੂਪ ਵਿੱਚ ਵੇਖਣ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ ਕਿ ਮਹਾਂਮਾਰੀ ਕਦੋਂ ਵੱਧ ਰਹੀ ਹੈ ਜਾਂ ਘਟ ਰਹੀ ਹੈ। \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"ਦਿੱਤੇ ਗਏ ਤੱਥ ਨੂੰ ਧਿਆਨ ਵਿਚ ਰੱਖਦੇ ਹੋਏ ਕਿ ਰਿਪੋਰਟਿੰਗ ਕਾਰਨ ਡਾਟਾ ਵਿੱਚ ਕਾਫੀ ਉਤਾਰ-ਚੜਾਅ ਹੁੰਦੇ ਹਨ, ਇਸ ਲਈ ਸਮੂਹ ਤਸਵੀਰ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਰੋਲਿੰਗ ਔਸਤ ਚਲਾਉਣਾ ਕਰਵ ਨੂੰ ਸਮੂਥ ਕਰਨਾ ਸਮਝਦਾਰ ਹੈ। ਆਓ ਮੁੜ ਦੇਖੀਏ ਮਹਾਂਮਾਰੀ ਦੇ ਪਹਿਲੇ ਮਹੀਨੇ:\n"
"ਇਸ ਗੱਲ ਨੂੰ ਧਿਆਨ ਵਿੱਚ ਰੱਖਦਿਆਂ ਕਿ ਰਿਪੋਰਟਿੰਗ ਕਾਰਜਾਂ ਕਰਕੇ ਡੇਟਾ ਵਿੱਚ ਕਾਫੀ ਉਤਾਰ-ਚੜ੍ਹਾਉ ਹੁੰਦੇ ਹਨ, ਸਮੱਗਰੀ ਨੂੰ ਹੌਲੇ-ਹੌਲੇ ਕਰਨ ਲਈ ਰੋਲਿੰਗ ਐਵਰੇਜ ਚਲਾਉਣਾ ਸਮਝਦਾਰ ਹੁੰਦਾ ਹੈ ਤਾਂ ਜੋ ਕੁੱਲ ਤਸਵੀਰ ਮਿਲੇ। ਆਓ ਫਿਰ ਤੋਂ ਮਹਾਂਮਾਰੀ ਦੇ ਪਹਿਲੇ ਮਹੀਨਿਆਂ 'ਤ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰੀਏ:\n"
]
},
{
@ -2390,26 +2391,27 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## ਚੈਲੈਂਜ\n",
"\n",
"ਹੁਣ ਤੁਹਾਡੇ ਲਈ ਕੋਡ ਅਤੇ ਡਾਟਾ ਨਾਲ ਹੋਰ ਖੇਡਣ ਦਾ ਸਮਾਂ ਹੈ! ਇੱਥੇ ਕੁਝ ਸੁਝਾਅ ਦਿੱਤੇ ਗਏ ਹਨ ਜਿੰਨ੍ਹਾਂ ਨਾਲ ਤੁਸੀਂ ਅਜ਼ਮਾਇਸ਼ ਕਰ ਸਕਦੇ ਹੋ:\n",
"## ਚੁਣੌਤੀ\n",
"\n",
"ਹੁਣ ਤੁਹਾਡੀ ਵਾਰੀ ਹੈ ਕਿ ਤੁਸੀਂ ਕੋਡ ਅਤੇ ਡਾਟਾ ਨਾਲ ਹੋਰ ਖੇਡੋ! ਇੱਥੇ ਕੁਝ ਸੁਝਾਵ ਹਨ ਜਿਨ੍ਹਾਂ ਨਾਲ ਤੁਸੀਂ ਪ੍ਰਯੋਗ ਕਰ ਸਕਦੇ ਹੋ:\n",
"* ਵੱਖ-ਵੱਖ ਦੇਸ਼ਾਂ ਵਿੱਚ ਮਹਾਂਮਾਰੀ ਦੇ ਫੈਲਾਅ ਨੂੰ ਵੇਖੋ।\n",
"* ਇੱਕੋ ਪਲਾਟ 'ਤੇ ਕਈ ਦੇਸ਼ਾਂ ਲਈ $R_t$ ਗ੍ਰਾਫ ਬਣਾਓ ਤਾ ਕਿ ਤੁਲਨਾ ਕੀਤੀ ਜਾ ਸਕੇ, ਜਾਂ ਕਈ ਪਲਾਟ ਇੱਕੱਠੇ ਦਰਸਾਓ।\n",
"* ਦੇਖੋ ਕਿ ਮੌਤਾਂ ਅਤੇ ਠੀਕ ਹੋਣ ਵਾਲਿਆਂ ਦੀ ਸੰਖਿਆ ਸੰਕ੍ਰਮਿਤ ਮਾਮਲਿਆਂ ਦੀ ਸੰਖਿਆ ਨਾਲ ਕਿਵੇਂ ਸੰਬੰਧਿਤ ਹੈ।\n",
"* ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਸੰਕ੍ਰਮਣ ਦੀ ਦਰ ਅਤੇ ਮੌਤਾਂ ਦੀ ਦਰ ਨੂੰ ਜੋੜ ਕੇ ਇਹ ਪਤਾ ਲਗਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ ਕਿ ਇੱਕ ਆਮ ਬਿਮਾਰੀ ਕਿੰਨੀ ਦਿਨ ਤੱਕ ਰਹਿੰਦੀ ਹੈ ਅਤੇ ਕੋਈ ਅਸਮਾਨਯਤਾਵਾਂ ਖੋਜੋ। ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਵੱਖ-ਵੱਖ ਦੇਸ਼ਾਂ ਦੇ ਡੇਟਾ ਵੇਖਣਾ ਪੈ ਸਕਦਾ ਹੈ।\n",
"* ਫੈਟਾਲਿਟੀ ਦਰ ਦੀ ਗਣਨਾ ਕਰੋ ਅਤੇ ਇਹ ਸਮੇਂ ਦੇ ਨਾਲ ਕਿਵੇਂ ਬਦਲਦੀ ਹੈ। ਤੁਸੀਂ ਗਣਨਾ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਬਿਮਾਰੀ ਦੀ ਲੰਬਾਈ ਨੂੰ ਦਿਨਾਂ ਵਿੱਚ ਧਿਆਨ ਵਿੱਚ ਲੈ ਕੇ ਇੱਕ ਟਾਈਮ ਸੀਰੀਜ਼ ਨੂੰ ਸਿਸਟਮ ਦੇਮਾਂਤ ਦੇ ਵੱਲ ਹਿਲਾ ਸਕਦੇ ਹੋ।\n"
"* ਤੁਲਨਾ ਲਈ ਇੱਕ ਪਲਾਟ 'ਤੇ ਕਈ ਦੇਸ਼ਾਂ ਲਈ $R_t$ ਗ੍ਰਾਫ ਬਣਾਓ, ਜਾਂ ਕਈ ਪਲਾਟ ਇਕੱਠੇ ਪਾਸੇ-ਪਾਸੇ ਬਣਾਓ\n",
"* ਵੇਖੋ ਕਿ ਮੌਤਾਂ ਅਤੇ ਸਿਹਤਮੰਦ ਹੋਣ ਵਾਲਿਆਂ ਦੀ ਗਿਣਤੀ ਸੰਕ੍ਰਮਿਤ ਮਾਮਲਿਆਂ ਦੀ ਗਿਣਤੀ ਨਾਲ ਕਿਵੇਂ ਸੰਬੰਧਿਤ ਹੈ।\n",
"* ਦ੍ਰਿਸ਼ਟੀਗਤ ਤੌਰ 'ਤੇ ਸੰਕ੍ਰਮਣ ਦਰ ਅਤੇ ਮੌਤ ਦੀ ਦਰ ਨੂੰ ਮਿਲਾ ਕੇ ਦੇਖ ਕੇ ਅਤੇ ਕੁਝ ਵਿਸ਼ੇਸ਼ ਘਟਨਾਵਾਂ ਲਈ ਤਲਾਸ਼ ਕਰ ਕੇ ਪਤਾ ਲਗਾਓ ਕਿ ਇੱਕ ਆਮ ਬਿਮਾਰੀ ਕਿੰਨੇ ਸਮੇਂ ਤਕ ਰਹਿੰਦੀ ਹੈ। ਤੁਹਾਨੂੰ ਇਹ ਜਾਣਨ ਲਈ ਵੱਖ-ਵੱਖ ਦੇਸ਼ਾਂ ਦੇਖਣ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ।\n",
"* ਮੌਤ ਦਾ ਦਰ (ਫੈਟਾਲਿਟੀ ਰੇਟ) ਗਣਨਾ ਕਰੋ ਅਤੇ ਇਹ ਸਮੇਂ ਦੇ ਨਾਲ ਕਿਵੇਂ ਬਦਲਦਾ ਹੈ। ਤੁਸੀਂ ਗਣਨਾਵਾਂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਬਿਮਾਰੀ ਦੀ ਲੰਬਾਈ ਨੂੰ ਦਿਨਾਂ ਵਿੱਚ ਧਿਆਨ ਵਿੱਚ ਲੈ ਕੇ ਇੱਕ ਸਮੇਂ ਦੀ ਲੜੀ ਨੂੰ ਸ਼ਿਫਟ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ ਸਕਦੇ ਹੋ।\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## References\n",
"## ਸੰਦਰਭ\n",
"\n",
"ਤੁਸੀਂ COVID ਮਹਾਂਮਾਰੀ ਦੇ ਫੈਲਾਅ 'ਤੇ ਹੋਰ ਅਧਿਐਨਾਂ ਨੂੰ ਹੇਠ ਲਿੱਖੀਆਂ ਪ੍ਰਕਾਸ਼ਨਾਵਾਂ ਵਿੱਚ ਦੇਖ ਸਕਦੇ ਹੋ:\n",
"* [COVID ਮਹਾਂਮਾਰੀ ਦੌਰਾਨ Rt ਅੰਦਾਜ਼ਾ ਲਗਾਉਣ ਲਈ ਸਲਾਈਡਿੰਗ SIR ਮਾਡਲ](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ਬਲੌਗ ਪੋਸਟ ਦੁਆਰਾ [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [ਗਲੋਬਲ COVID-19 ਫੈਲਾਅ ਲਈ ਸਮਾਂ-ਨਿਰਭਰ ਪੀੜਤੀ ਸੰਖਿਆ ਦਾ ਅੰਦਾਜ਼ਾ](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [ਉਪਰੋਕਤ ਪੇਪਰ ਲਈ ਕੋਡ GitHub 'ਤੇ](https://github.com/shwars/SlidingSIR)\n"
"ਤੁਸੀਂ ਹੇਠ ਲਿਖੀਆਂ ਪ੍ਰਕਾਸ਼ਨਾਂ ਵਿੱਚ COVID ਮਹਾਂਮਾਰੀ ਦੇ ਫੈਲਾਅ ਤੋਂ ਸਬੰਧਿਤ ਹੋਰ ਅਧਿਐਨ ਵੇਖ ਸਕਦੇ ਹੋ:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), ਬਲੌਗ ਪੋਸਟ ਦੁਆਰਾ [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [ਉપરੋਕਤ ਪੇਪਰ ਲਈ ਕੋਡ GitHub 'ਤੇ](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ਅਸਵੀਕਾਰਤਾ**: \nਇਹ ਦਸਤਾਵੇਜ਼ AI ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕ੍ਰਿਪਾ ਕਰਕੇ ਧਿਆਨ ਵਿੱਚ ਰੱਖੋ ਕਿ ਸਵੈਚਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਣਸਹੀ ਹਨੇਰੀਆਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਇਸ ਮੂਲ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਇਸ ਦੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਪ੍ਰਮਾਣਿਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੀ ਵਰਤੋਂ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਸਮਝਾਂਵਿਆਂ ਲਈ ਜ਼ਿੰਮੇਵਾਰ ਨਹੀਂ ਹਾਂ।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ਅਸਵੀਕਾਰੋਪਣ**:\nਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# ਖਤਰਨਾਕ ਸੰਬੰਧਾਂ ਡਾਟਾ ਵਿਜੁਅਲਾਈਜ਼ੇਸ਼ਨ ਪ੍ਰੋਜੈਕਟ
# ਡੇੰਜਰਸ ਲਿਆਇਜ਼ਨਜ਼ ਡਾਟਾ ਵਿਜ਼ੁਅਲਾਈਜੇਸ਼ਨ ਪ੍ਰੋਜੈਕਟ
ਸ਼ੁਰੂ ਕਰਨ ਲਈ, ਤੁਹਾਨੂੰ ਯਕੀਨੀ ਬਣਾਉਣਾ ਹੋਵੇਗਾ ਕਿ ਤੁਹਾਡੇ ਕੰਪਿਊਟਰ 'ਤੇ NPM ਅਤੇ Node ਚੱਲ ਰਹੇ ਹਨ। Dependencies (npm install) ਨੂੰ ਇੰਸਟਾਲ ਕਰੋ ਅਤੇ ਫਿਰ ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਲੋਕਲ ਤੌਰ 'ਤੇ ਚਲਾਓ (npm run serve):
ਸ਼ੁਰੂ ਕਰਨ ਲਈ, ਤੁਹਾਨੂੰ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਕੰਪਿਊਟਰ 'ਤੇ NPM ਅਤੇ Node **>=20.0.0** ਚੱਲ ਰਹੇ ਹਨ। ਡੀਪੈਂਡੈਂਸੀਜ਼ ਇੰਸਟਾਲ ਕਰੋ (npm install) ਅਤੇ ਫਿਰ ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਲੋਕਲ ਹੋ ਕੇ ਰਨ ਕਰੋ (npm run serve):
## ਪ੍ਰੋਜੈਕਟ ਸੈਟਅੱਪ
```
npm install
```
### ਵਿਕਾਸ ਲਈ ਕੰਪਾਇਲ ਅਤੇ ਹੌਟ-ਰੀਲੋਡ
### ਵਿਕਾਸ ਲਈ ਕੰਪਾਈਲ ਅਤੇ ਹੌਟ-ਰੀਲੋਡ ਕਰਦਾ ਹੈ
```
npm run serve
```
### ਪ੍ਰੋਡਕਸ਼ਨ ਲਈ ਕੰਪਾਇਲ ਅਤੇ ਮਿਨੀਫਾਈ
### ਉਤਪਾਦਨ ਲਈ ਕੰਪਾਈਲ ਅਤੇ ਮਿੰਨੀਫਾਈ ਕਰਦਾ ਹੈ
```
npm run build
```
### ਫਾਈਲਾਂ ਦੀ ਲਿੰਟਿੰਗ ਅਤੇ ਫਿਕਸਿੰਗ
### ਲਿੰਟ ਅਤੇ ਫਾਇਲਾਂ ਨੂੰ ਠੀਕ ਕਰਦਾ ਹੈ
```
npm run lint
```
### ਕਨਫਿਗਰੇਸ਼ਨ ਨੂੰ ਕਸਟਮਾਈਜ਼ ਕਰੋ
[Configuration Reference](https://cli.vuejs.org/config/) ਵੇਖੋ
### ਸੰਰਚਨਾ ਨੂੰ ਕਸਟਮਾਈਜ਼ ਕਰੋ
ਦੇਖੋ [Configuration Reference](https://cli.vuejs.org/config/)।
---
**ਅਸਵੀਕਾਰਨਾ**:
ਇਹ ਦਸਤਾਵੇਜ਼ AI ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਦਿਓ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸੁਚੀਤਤਾਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਇਸਦੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਤ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਸ ਅਨੁਵਾਦ ਦੀ ਵਰਤੋਂ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਗਲਤ ਫਹਿਮੀ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆ ਲਈ ਅਸੀਂ ਜ਼ਿੰਮੇਵਾਰ ਨਹੀਂ ਹਾਂ।
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**ਅਸਵੀਕਾਰੋਪਣ**:
ਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# ਖਤਰਨਾਕ ਸੰਬੰਧਾਂ ਡਾਟਾ ਵਿਜੁਅਲਾਈਜ਼ੇਸ਼ਨ ਪ੍ਰੋਜੈਕਟ
# Dangerous Liaisons ਡੇਟਾ ਵਿਜ਼ੁਅਲਾਈਜੇਸ਼ਨ ਪ੍ਰੋਜੈਕਟ
ਸ਼ੁਰੂ ਕਰਨ ਲਈ, ਤੁਹਾਨੂੰ ਯਕੀਨੀ ਬਣਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਕੰਪਿਊਟਰ 'ਤੇ NPM ਅਤੇ Node ਚੱਲ ਰਹੇ ਹਨ। ਡਿਪੈਂਡੈਂਸੀਜ਼ ਇੰਸਟਾਲ ਕਰੋ (npm install) ਅਤੇ ਫਿਰ ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਲੋਕਲ ਤੌਰ 'ਤੇ ਚਲਾਓ (npm run serve):
ਸ਼ੁਰੂ ਕਰਨ ਲਈ, ਤੁਹਾਨੂੰ ਯਕੀਨੀ ਬਣਾਣਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਤੁਹਾਡੇ ਕੰਪਿਊਟਰ 'ਤੇ NPM ਅਤੇ Node **>=20.0.0** ਚਲ ਰਹੇ ਹਨ। ਡਿਪੈਂਡੇਨਸੀਜ਼ ਨੂੰ ਇੰਸਟਾਲ ਕਰੋ (npm install) ਅਤੇ ਫਿਰ ਪ੍ਰੋਜੈਕਟ ਨੂੰ ਲੋਕਲ ਤੌਰ 'ਤੇ ਚਲਾਓ (npm run serve):
## ਪ੍ਰੋਜੈਕਟ ਸੈਟਅੱਪ
## ਪ੍ਰੋਜੈਕਟ ਸੈਟਅੱਪ
```
npm install
```
### ਡਿਵੈਲਪਮੈਂਟ ਲਈ ਕੰਪਾਲ ਅਤੇ ਹੌਟ-ਰੀਲੋਡ ਕਰਦਾ ਹੈ
### ਡਿਵੈਲਪਮੈਂਟ ਲਈ ਕੰਪਾਲ ਅਤੇ ਹੌਟ-ਰੀਲੋਡ ਕਰਦਾ ਹੈ
```
npm run serve
```
### ਪ੍ਰੋਡਕਸ਼ਨ ਲਈ ਕੰਪਾਈਲ ਅਤੇ ਮਿਨੀਫਾਈ ਕਰਦਾ ਹੈ
### ਪ੍ਰੋਡਕਸ਼ਨ ਲਈ ਕੰਪਾਇਲ ਅਤੇ ਸੈਡ ਕਰਦਾ ਹੈ
```
npm run build
```
### ਫਾਈਲਾਂ ਨੂੰ ਲਿੰਟ ਅਤੇ ਫਿਕਸ ਕਰਦਾ ਹੈ
### ਲਿੰਟ ਕਰਦਾ ਹੈ ਅਤੇ ਫਾਈਲਾਂ ਠੀਕ ਕਰਦਾ ਹੈ
```
npm run lint
```
### ਕਨਫਿਗਰੇਸ਼ਨ ਨੂੰ ਕਸਟਮਾਈਜ਼ ਕਰੋ
[ਕਨਫਿਗਰੇਸ਼ਨ ਰੈਫਰੈਂਸ](https://cli.vuejs.org/config/) ਵੇਖੋ
ਦੇਖੋ [Configuration Reference](https://cli.vuejs.org/config/)
---
**ਅਸਵੀਕਰਤੀ**:
ਇਹ ਦਸਤਾਵੇਜ਼ AI ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਦਿਓ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸੁਚਨਾਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਨੂੰ ਇਸਦੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਤ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਮਹੱਤਵਪੂਰਨ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਸ ਅਨੁਵਾਦ ਦੀ ਵਰਤੋਂ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੇ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆ ਲਈ ਅਸੀਂ ਜ਼ਿੰਮੇਵਾਰ ਨਹੀਂ ਹਾਂ।
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**ਅਸਵੀਕਾਰੋਪਣ**:
ਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ [Co-op Translator](https://github.com/Azure/co-op-translator) ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "pt-BR"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T09:23:54+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T22:00:44+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "pt-BR"
},
@ -42,8 +42,8 @@
"language_code": "pt-BR"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-06T08:37:11+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T22:03:29+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "pt-BR"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "pt-BR"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T22:01:40+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pt-BR"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-27T17:02:33+00:00",
@ -108,8 +114,8 @@
"language_code": "pt-BR"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T09:25:15+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T22:00:15+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "pt-BR"
},
@ -192,14 +198,14 @@
"language_code": "pt-BR"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-27T18:16:24+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:03:37+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "pt-BR"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-27T18:15:57+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:03:32+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "pt-BR"
},

File diff suppressed because one or more lines are too long

@ -4,49 +4,48 @@
|:---:|
|Definindo Dados - _Sketchnote por [@nitya](https://twitter.com/nitya)_ |
Dados são fatos, informações, observações e medições que são usados para fazer descobertas e apoiar decisões informadas. Um ponto de dado é uma unidade única de dados dentro de um conjunto de dados, que é uma coleção de pontos de dados. Conjuntos de dados podem vir em diferentes formatos e estruturas, geralmente baseados em sua origem ou de onde os dados vieram. Por exemplo, os ganhos mensais de uma empresa podem estar em uma planilha, enquanto os dados de frequência cardíaca por hora de um smartwatch podem estar no formato [JSON](https://stackoverflow.com/a/383699). É comum que cientistas de dados trabalhem com diferentes tipos de dados dentro de um conjunto de dados.
Dados são fatos, informações, observações e medições que são usados para fazer descobertas e apoiar decisões informadas. Um ponto de dado é uma unidade única de dados dentro de um conjunto de dados, que é uma coleção de pontos de dados. Conjuntos de dados podem vir em diferentes formatos e estruturas, e geralmente vão se basear na sua fonte, ou de onde os dados vieram. Por exemplo, os ganhos mensais de uma empresa podem estar em uma planilha, mas os dados de frequência cardíaca por hora de um smartwatch podem estar em formato [JSON](https://stackoverflow.com/a/383699). É comum que cientistas de dados trabalhem com diferentes tipos de dados dentro de um conjunto de dados.
Esta lição foca em identificar e classificar dados por suas características e suas fontes.
## [Quiz Pré-aula](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## [Pré-quiz da aula](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Como os Dados são Descritos
### Dados Brutos
Dados brutos são dados que vêm de sua fonte em seu estado inicial e não foram analisados ou organizados. Para entender o que está acontecendo com um conjunto de dados, ele precisa ser organizado em um formato que possa ser compreendido por humanos, bem como pela tecnologia que pode ser usada para analisá-lo mais profundamente. A estrutura de um conjunto de dados descreve como ele está organizado e pode ser classificada como estruturada, não estruturada e semiestruturada. Esses tipos de estrutura variam dependendo da origem, mas geralmente se encaixam nessas três categorias.
Dados brutos são dados que vieram da sua fonte em seu estado inicial e não foram analisados ou organizados. Para entender o que está acontecendo com um conjunto de dados, ele precisa ser organizado em um formato que possa ser compreendido por humanos assim como pela tecnologia que pode ser usada para analisá-lo mais a fundo. A estrutura de um conjunto de dados descreve como ele está organizado e pode ser classificada como estruturada, não estruturada e semi-estruturada. Esses tipos de estrutura variam dependendo da fonte mas, em última análise, se encaixam nessas três categorias.
### Dados Quantitativos
Dados quantitativos são observações numéricas dentro de um conjunto de dados e podem ser analisados, medidos e usados matematicamente. Alguns exemplos de dados quantitativos são: a população de um país, a altura de uma pessoa ou os ganhos trimestrais de uma empresa. Com alguma análise adicional, dados quantitativos podem ser usados para descobrir tendências sazonais do Índice de Qualidade do Ar (AQI) ou estimar a probabilidade de tráfego no horário de pico em um dia típico de trabalho.
Dados quantitativos são observações numéricas dentro de um conjunto de dados e normalmente podem ser analisados, medidos e usados matematicamente. Alguns exemplos de dados quantitativos são: a população de um país, a altura de uma pessoa ou os ganhos trimestrais de uma empresa. Com alguma análise adicional, dados quantitativos podem ser usados para descobrir tendências sazonais do Índice de Qualidade do Ar (AQI) ou estimar a probabilidade de tráfego intenso no horário de pico de um dia típico de trabalho.
### Dados Qualitativos
Dados qualitativos, também conhecidos como dados categóricos, são dados que não podem ser medidos objetivamente como observações de dados quantitativos. Geralmente são formatos variados de dados subjetivos que capturam a qualidade de algo, como um produto ou processo. Às vezes, dados qualitativos são numéricos, mas não seriam usados matematicamente, como números de telefone ou marcas de tempo. Alguns exemplos de dados qualitativos são: comentários em vídeos, a marca e modelo de um carro ou a cor favorita dos seus amigos mais próximos. Dados qualitativos podem ser usados para entender quais produtos os consumidores preferem ou identificar palavras-chave populares em currículos de candidatos a emprego.
Dados qualitativos, também conhecidos como dados categóricos, são dados que não podem ser medidos objetivamente como observações de dados quantitativos. Geralmente são diversos formatos de dados subjetivos que capturam a qualidade de algo, como um produto ou processo. Às vezes, dados qualitativos são numéricos e normalmente não seriam usados matematicamente, como números de telefone ou carimbos de data/hora. Alguns exemplos de dados qualitativos são: comentários em vídeos, a marca e modelo de um carro ou a cor favorita dos seus amigos mais próximos. Dados qualitativos podem ser usados para entender quais produtos os consumidores preferem ou identificar palavras-chave populares em currículos de candidatura a empregos.
### Dados Estruturados
Dados estruturados são dados organizados em linhas e colunas, onde cada linha terá o mesmo conjunto de colunas. As colunas representam um valor de um tipo específico e serão identificadas com um nome que descreve o que o valor representa, enquanto as linhas contêm os valores reais. As colunas frequentemente têm um conjunto específico de regras ou restrições sobre os valores, para garantir que os valores representem com precisão a coluna. Por exemplo, imagine uma planilha de clientes onde cada linha deve ter um número de telefone e os números de telefone nunca contêm caracteres alfabéticos. Podem ser aplicadas regras na coluna de número de telefone para garantir que ela nunca esteja vazia e contenha apenas números.
Dados estruturados são dados organizados em linhas e colunas, onde cada linha terá o mesmo conjunto de colunas. Colunas representam um valor de um tipo particular e serão identificadas com um nome que descreve o que o valor representa, enquanto linhas contêm os valores reais. Colunas frequentemente têm um conjunto específico de regras ou restrições nos valores, para garantir que os valores representem com precisão a coluna. Por exemplo, imagine uma planilha de clientes onde cada linha deve ter um número de telefone e esses números nunca contêm caracteres alfabéticos. Podem haver regras aplicadas à coluna de número de telefone para garantir que nunca esteja vazia e contenha apenas números.
Um benefício dos dados estruturados é que eles podem ser organizados de forma que possam ser relacionados a outros dados estruturados. No entanto, como os dados são projetados para serem organizados de uma maneira específica, fazer alterações em sua estrutura geral pode exigir muito esforço. Por exemplo, adicionar uma coluna de e-mail à planilha de clientes que não pode estar vazia significa que você precisará descobrir como adicionar esses valores às linhas existentes de clientes no conjunto de dados.
Um benefício dos dados estruturados é que eles podem ser organizados de modo a se relacionarem com outros dados estruturados. No entanto, porque os dados são projetados para serem organizados de uma forma específica, fazer alterações em sua estrutura geral pode exigir muito esforço. Por exemplo, adicionar uma coluna de e-mail à planilha de clientes que não pode ficar vazia significa que será preciso descobrir como adicionar esses valores às linhas existentes dos clientes no conjunto de dados.
Exemplos de dados estruturados: planilhas, bancos de dados relacionais, números de telefone, extratos bancários.
Exemplos de dados estruturados: planilhas, bancos de dados relacionais, números de telefone, extratos bancários
### Dados Não Estruturados
Dados não estruturados geralmente não podem ser categorizados em linhas ou colunas e não contêm um formato ou conjunto de regras a seguir. Como os dados não estruturados têm menos restrições em sua estrutura, é mais fácil adicionar novas informações em comparação a um conjunto de dados estruturado. Se um sensor que captura dados de pressão barométrica a cada 2 minutos recebeu uma atualização que agora permite medir e registrar temperatura, isso não exige alterar os dados existentes se forem não estruturados. No entanto, isso pode tornar a análise ou investigação desse tipo de dado mais demorada. Por exemplo, um cientista que deseja encontrar a temperatura média do mês anterior nos dados do sensor, mas descobre que o sensor registrou um "e" em alguns de seus dados para indicar que estava quebrado, em vez de um número típico, o que significa que os dados estão incompletos.
Dados não estruturados normalmente não podem ser categorizados em linhas ou colunas e não possuem um formato ou conjunto de regras a seguir. Como dados não estruturados têm menos restrições em sua estrutura, é mais fácil adicionar novas informações em comparação com um conjunto de dados estruturado. Se um sensor que captura dados da pressão barométrica a cada 2 minutos recebeu uma atualização que agora permite medir e registrar a temperatura, não é necessário alterar os dados existentes se eles forem não estruturados. No entanto, isso pode fazer com que a análise ou investigação desse tipo de dado demore mais. Por exemplo, um cientista que deseja encontrar a temperatura média do mês anterior a partir dos dados do sensor, mas descobre que o sensor registrou um "e" em alguns dados anotando que estava quebrado em vez de um número típico, o que significa que os dados estão incompletos.
Exemplos de dados não estruturados: arquivos de texto, mensagens de texto, arquivos de vídeo.
Exemplos de dados não estruturados: arquivos de texto, mensagens de texto, arquivos de vídeo
### Dados Semiestruturados
Dados semiestruturados têm características que os tornam uma combinação de dados estruturados e não estruturados. Eles geralmente não seguem um formato de linhas e colunas, mas são organizados de uma maneira considerada estruturada e podem seguir um formato fixo ou conjunto de regras. A estrutura varia entre as fontes, como uma hierarquia bem definida ou algo mais flexível que permite fácil integração de novas informações. Metadados são indicadores que ajudam a decidir como os dados são organizados e armazenados e terão vários nomes, dependendo do tipo de dado. Alguns nomes comuns para metadados são tags, elementos, entidades e atributos. Por exemplo, uma mensagem de e-mail típica terá um assunto, corpo e um conjunto de destinatários e pode ser organizada por quem ou quando foi enviada.
### Semi-estruturado
Dados semi-estruturados têm características que combinam dados estruturados e não estruturados. Normalmente não seguem um formato de linhas e colunas, mas são organizados de uma forma considerada estruturada e podem seguir um formato fixo ou conjunto de regras. A estrutura varia entre fontes, podendo ser uma hierarquia bem definida até algo mais flexível que permite fácil integração de novas informações. Metadados são indicadores que ajudam a decidir como os dados são organizados e armazenados e terão vários nomes, dependendo do tipo de dado. Alguns nomes comuns para metadados são tags, elementos, entidades e atributos. Por exemplo, uma mensagem típica de e-mail terá um assunto, corpo e conjunto de destinatários e pode ser organizada por quem ou quando foi enviada.
Exemplos de dados semiestruturados: HTML, arquivos CSV, JavaScript Object Notation (JSON).
Exemplos de dados semi-estruturados: HTML, arquivos CSV, JavaScript Object Notation (JSON)
## Fontes de Dados
Uma fonte de dados é o local inicial de onde os dados foram gerados ou onde "vivem" e varia com base em como e quando foram coletados. Dados gerados por seus usuários são conhecidos como dados primários, enquanto dados secundários vêm de uma fonte que coletou dados para uso geral. Por exemplo, um grupo de cientistas coletando observações em uma floresta tropical seria considerado primário, e se decidirem compartilhar com outros cientistas, seria considerado secundário para aqueles que o utilizam.
Uma fonte de dados é o local inicial onde os dados foram gerados, ou onde "moram", e varia com base em como e quando foram coletados. Dados gerados por seus usuários são conhecidos como dados primários enquanto dados secundários vêm de uma fonte que coletou dados para uso geral. Por exemplo, um grupo de cientistas coletando observações em uma floresta tropical seria considerado primário e se decidirem compartilhar com outros cientistas, para esses outros seria considerado secundário.
Bancos de dados são uma fonte comum e dependem de um sistema de gerenciamento de banco de dados para hospedar e manter os dados, onde os usuários utilizam comandos chamados consultas para explorar os dados. Arquivos como fontes de dados podem ser arquivos de áudio, imagem e vídeo, bem como planilhas como Excel. Fontes da internet são um local comum para hospedar dados, onde bancos de dados e arquivos podem ser encontrados. Interfaces de programação de aplicativos, também conhecidas como APIs, permitem que programadores criem maneiras de compartilhar dados com usuários externos pela internet, enquanto o processo de web scraping extrai dados de uma página da web. As [lições em Trabalhando com Dados](../../../../../../../../../2-Working-With-Data) focam em como usar várias fontes de dados.
Bancos de dados são uma fonte comum e dependem de um sistema de gerenciamento de banco de dados para hospedar e manter os dados onde usuários usam comandos chamados de consultas para explorar os dados. Arquivos como fontes de dados podem ser arquivos de áudio, imagem e vídeo, assim como planilhas como Excel. Fontes da internet são um local comum para hospedar dados, onde bancos de dados e arquivos podem ser encontrados. Interfaces de programação de aplicativos, também conhecidas como APIs, permitem que programadores criem formas de compartilhar dados com usuários externos pela internet, enquanto o processo de web scraping extrai dados de páginas web. As [lições em Trabalhando com Dados](../../../../../../../../../2-Working-With-Data) focam em como usar várias fontes de dados.
## Conclusão
Nesta lição, aprendemos:
Nesta lição aprendemos:
- O que são dados
- Como os dados são descritos
@ -55,16 +54,18 @@ Nesta lição, aprendemos:
## 🚀 Desafio
Kaggle é uma excelente fonte de conjuntos de dados abertos. Use a [ferramenta de busca de conjuntos de dados](https://www.kaggle.com/datasets) para encontrar alguns conjuntos de dados interessantes e classifique de 3 a 5 conjuntos de dados com os seguintes critérios:
Kaggle é uma excelente fonte de conjuntos de dados abertos. Use a [ferramenta de busca de datasets](https://www.kaggle.com/datasets) para encontrar alguns conjuntos de dados interessantes e classifique de 3 a 5 datasets com esse critério:
- Os dados são quantitativos ou qualitativos?
- Os dados são estruturados, não estruturados ou semiestruturados?
- Os dados são estruturados, não estruturados ou semi-estruturados?
## [Quiz pós-aula](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## [Quiz Pós-aula](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Revisão e Autoestudo
## Revisão & Estudo Autônomo
- Esta unidade do Microsoft Learn, intitulada [Classifique seus Dados](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data), tem uma análise detalhada de dados estruturados, semiestruturados e não estruturados.
- Esta unidade do Microsoft Learn, intitulada [Identificar formatos de dados](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) tem uma análise detalhada de dados estruturados, semi-estruturados e não estruturados.
## Tarefa
@ -72,5 +73,7 @@ Kaggle é uma excelente fonte de conjuntos de dados abertos. Use a [ferramenta d
---
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autoritativa. Para informações críticas, recomenda-se a tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações equivocadas decorrentes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Aviso Legal**:
Este documento foi traduzido usando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, por favor, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {},
"source": [
"# Introdução à Probabilidade e Estatística\n",
"Neste notebook, vamos explorar alguns dos conceitos que discutimos anteriormente. Muitos conceitos de probabilidade e estatística estão bem representados nas principais bibliotecas para processamento de dados em Python, como `numpy` e `pandas`.\n"
"Neste notebook, vamos explorar alguns dos conceitos que discutimos anteriormente. Muitos conceitos de probabilidade e estatística estão bem representados em grandes bibliotecas para processamento de dados em Python, como `numpy` e `pandas`.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Para estimar visualmente quantos valores diferentes estão na amostra, podemos plotar o **histograma**:\n"
"Para estimar visualmente quantos valores diferentes existem na amostra, podemos plotar o **histograma**:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## Analisando Dados Reais\n",
"\n",
"Média e variância são muito importantes ao analisar dados do mundo real. Vamos carregar os dados sobre jogadores de beisebol de [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Média e variância são muito importantes ao analisar dados do mundo real. Vamos carregar os dados sobre jogadores de baseball do [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -80,7 +80,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Estamos usando um pacote chamado [**Pandas**](https://pandas.pydata.org/) aqui para análise de dados. Falaremos mais sobre Pandas e trabalhar com dados em Python mais adiante neste curso.\n",
"> Estamos usando um pacote chamado [**Pandas**](https://pandas.pydata.org/) aqui para análise de dados. Falaremos mais sobre Pandas e o trabalho com dados em Python mais adiante neste curso.\n",
"\n",
"Vamos calcular os valores médios para idade, altura e peso:\n"
]
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Agora vamos focar na altura e calcular o desvio padrão e a variância:\n"
"Agora vamos focar na altura e calcular o desvio padrão e a variância: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Além da média, faz sentido olhar o valor mediano e os quartis. Eles podem ser visualizados usando um **box plot**:\n"
"Além da média, faz sentido observar o valor mediano e os quartis. Eles podem ser visualizados usando um **box plot**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Nota**: Este diagrama sugere que, em média, as alturas dos primeiros base são maiores do que as alturas dos segundos base. Mais adiante, aprenderemos como podemos testar essa hipótese de forma mais formal e como demonstrar que nossos dados são estatisticamente significativos para mostrar isso.\n",
"> **Nota**: Este diagrama sugere que, em média, as alturas dos primeira base são maiores do que as alturas dos segunda base. Mais adiante aprenderemos como podemos testar essa hipótese de forma mais formal e como demonstrar que nossos dados são estatisticamente significativos para isso. \n",
"\n",
"Idade, altura e peso são todas variáveis aleatórias contínuas. O que você acha que é a distribuição delas? Uma boa maneira de descobrir é traçar o histograma dos valores:\n"
"Idade, altura e peso são todas variáveis aleatórias contínuas. O que você acha que é a distribuição delas? Uma boa maneira de descobrir é plotar o histograma dos valores: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## Distribuição Normal\n",
"\n",
"Vamos criar uma amostra artificial de pesos que segue uma distribuição normal com a mesma média e variância dos nossos dados reais:\n"
"Vamos criar uma amostra artificial de pesos que segue uma distribuição normal com a mesma média e variância que nossos dados reais:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Como a maioria dos valores na vida real segue uma distribuição normal, não devemos usar um gerador de números aleatórios uniforme para gerar dados amostrais. Aqui está o que acontece se tentarmos gerar pesos com uma distribuição uniforme (gerada por `np.random.rand`):\n"
"Como a maioria dos valores na vida real é normalmente distribuída, não devemos usar um gerador de números aleatórios uniforme para gerar dados de amostra. Aqui está o que acontece se tentarmos gerar pesos com uma distribuição uniforme (gerada por `np.random.rand`):\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Intervalos de Confiança\n",
"\n",
"Vamos agora calcular intervalos de confiança para os pesos e alturas dos jogadores de beisebol. Usaremos o código [desta discussão no stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Vamos agora calcular intervalos de confiança para os pesos e alturas dos jogadores de beisebol. Usaremos o código [desta discussão do stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos testar a hipótese de que os Primeiros Bases são mais altos do que os Segundos Bases. A maneira mais simples de fazer isso é testar os intervalos de confiança:\n"
"Vamos testar a hipótese de que os jogadores de primeira base são mais altos do que os jogadores de segunda base. A maneira mais simples de fazer isso é testar os intervalos de confiança:\n"
]
},
{
@ -339,8 +339,8 @@
"metadata": {},
"source": [
"Os dois valores retornados pela função `ttest_ind` são:\n",
"* p-valor pode ser considerado como a probabilidade de duas distribuições terem a mesma média. No nosso caso, é muito baixo, o que significa que há fortes evidências de que os primeiras bases são mais altos.\n",
"* t-valor é o valor intermediário da diferença média normalizada que é usado no teste t, e é comparado contra um valor limite para um dado valor de confiança.\n"
"* valor-p pode ser considerado como a probabilidade de duas distribuições terem a mesma média. No nosso caso, é muito baixo, o que significa que há forte evidência apoiando que os primeiros base são mais altos.\n",
"* valor t é o valor intermediário da diferença de média normalizada que é usado no teste t, e ele é comparado contra um valor limite para um dado nível de confiança.\n"
]
},
{
@ -349,7 +349,7 @@
"source": [
"## Simulando uma Distribuição Normal com o Teorema do Limite Central\n",
"\n",
"O gerador pseudoaleatório em Python é projetado para nos fornecer uma distribuição uniforme. Se quisermos criar um gerador para distribuição normal, podemos usar o teorema do limite central. Para obter um valor distribuído normalmente, basta calcular a média de uma amostra gerada uniformemente.\n"
"O gerador pseudoaleatório no Python é projetado para nos fornecer uma distribuição uniforme. Se quisermos criar um gerador para distribuição normal, podemos usar o teorema do limite central. Para obter um valor distribuído normalmente, basta calcular a média de uma amostra gerada uniformemente.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Correlação e Evil Baseball Corp\n",
"\n",
"A correlação nos permite encontrar relações entre sequências de dados. No nosso exemplo lúdico, vamos fingir que existe uma corporação de beisebol malvada que paga seus jogadores de acordo com a altura - quanto mais alto o jogador, mais dinheiro ele/ela recebe. Suponha que haja um salário base de $1000, e um bônus adicional de $0 a $100, dependendo da altura. Vamos pegar os jogadores reais da MLB e calcular seus salários imaginários:\n"
"A correlação nos permite encontrar relações entre sequências de dados. Em nosso exemplo didático, vamos fingir que existe uma corporação malvada de beisebol que paga seus jogadores de acordo com a altura - quanto mais alto o jogador, mais dinheiro ele/ela recebe. Suponha que haja um salário base de $1000, e um bônus adicional de $0 a $100, dependendo da altura. Usaremos os jogadores reais da MLB e calcularemos seus salários imaginários:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos agora calcular a covariância e a correlação dessas sequências. `np.cov` nos dará a chamada **matriz de covariância**, que é uma extensão da covariância para múltiplas variáveis. O elemento $M_{ij}$ da matriz de covariância $M$ é uma correlação entre as variáveis de entrada $X_i$ e $X_j$, e os valores diagonais $M_{ii}$ são a variância de $X_{i}$. Da mesma forma, `np.corrcoef` nos dará a **matriz de correlação**.\n"
"Vamos agora calcular a covariância e correlação dessas sequências. `np.cov` nos dará uma chamada **matriz de covariância**, que é uma extensão da covariância para múltiplas variáveis. O elemento $M_{ij}$ da matriz de covariância $M$ é uma correlação entre as variáveis de entrada $X_i$ e $X_j$, e os valores diagonais $M_{ii}$ são a variância de $X_{i}$. De forma semelhante, `np.corrcoef` nos dará a **matriz de correlação**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Uma correlação igual a 1 significa que existe uma **relação linear** forte entre duas variáveis. Podemos visualizar a relação linear ao plotar um valor contra o outro:\n"
"Uma correlação igual a 1 significa que há uma forte **relação linear** entre duas variáveis. Podemos visualizar a relação linear ao plotar um valor contra o outro:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos ver o que acontece se a relação não for linear. Suponha que nossa empresa decidiu esconder a óbvia dependência linear entre alturas e salários, e introduziu alguma não linearidade na fórmula, como `sin`:\n"
"Vamos ver o que acontece se a relação não for linear. Suponha que nossa corporação decidiu esconder a óbvia dependência linear entre alturas e salários, e introduziu algum tipo de não-linearidade na fórmula, como `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Neste caso, a correlação é um pouco menor, mas ainda é bastante alta. Agora, para tornar a relação ainda menos óbvia, podemos querer adicionar um pouco de aleatoriedade extra adicionando uma variável aleatória ao salário. Vamos ver o que acontece:\n"
"Neste caso, a correlação é ligeiramente menor, mas ainda assim é bastante alta. Agora, para tornar a relação ainda menos óbvia, podemos querer adicionar um pouco de aleatoriedade extra adicionando alguma variável aleatória ao salário. Vamos ver o que acontece:\n"
]
},
{
@ -494,7 +494,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Infelizmente, não obtivemos nenhum resultado - apenas alguns valores estranhos `nan`. Isso ocorre porque alguns dos valores em nossa série estão indefinidos, representados como `nan`, o que faz com que o resultado da operação também seja indefinido. Ao olhar para a matriz, podemos ver que `Weight` é a coluna problemática, porque a autocorrelação entre os valores de `Height` foi calculada.\n",
"Infelizmente, não obtivemos nenhum resultado - apenas alguns valores estranhos `nan`. Isso ocorre porque alguns dos valores em nossa série estão indefinidos, representados como `nan`, o que faz com que o resultado da operação também seja indefinido. Ao observar a matriz, podemos ver que `Weight` é a coluna problemática, porque a autocorrelação entre os valores de `Height` foi calculada.\n",
"\n",
"> Este exemplo mostra a importância da **preparação** e **limpeza** dos dados. Sem dados adequados, não podemos calcular nada.\n",
"\n",
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"De fato, existe uma correlação, mas não tão forte quanto em nosso exemplo artificial. Na verdade, se analisarmos o gráfico de dispersão de um valor em relação ao outro, a relação seria muito menos óbvia:\n"
"De fato, existe uma correlação, mas não tão forte quanto em nosso exemplo artificial. De fato, se olharmos para o gráfico de dispersão de um valor em relação ao outro, a relação seria muito menos óbvia:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Conclusão\n",
"\n",
"Neste notebook aprendemos como realizar operações básicas em dados para calcular funções estatísticas. Agora sabemos como usar um aparato sólido de matemática e estatística para provar algumas hipóteses, e como calcular intervalos de confiança para variáveis arbitrárias dadas uma amostra de dados.\n"
"Neste notebook aprendemos como realizar operações básicas em dados para calcular funções estatísticas. Agora sabemos como usar um aparato consistente de matemática e estatística para provar algumas hipóteses e como calcular intervalos de confiança para variáveis arbitrárias dado um conjunto de dados.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**: \nEste documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autoritária. Para informações críticas, recomenda-se a tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**:\nEste documento foi traduzido usando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, por favor, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T12:49:37+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "br"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## Carregando Dados\n",
"\n",
"Utilizaremos dados sobre indivíduos infectados pela COVID-19, fornecidos pelo [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) da [Johns Hopkins University](https://jhu.edu/). O conjunto de dados está disponível em [este Repositório do GitHub](https://github.com/CSSEGISandData/COVID-19).\n"
"Usaremos dados sobre indivíduos infectados por COVID-19, fornecidos pelo [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) da [Johns Hopkins University](https://jhu.edu/). O conjunto de dados está disponível em [este Repositório GitHub](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos agora carregar os dados de indivíduos infectados e ver como os dados parecem:\n"
"Vamos agora carregar os dados dos indivíduos infectados e ver como os dados parecem:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Podemos ver que cada linha da tabela define o número de indivíduos infectados para cada país e/ou província, e as colunas correspondem às datas. Tabelas similares podem ser carregadas para outros dados, como número de recuperados e número de mortes.\n"
"Podemos ver que cada linha da tabela define o número de indivíduos infectados para cada país e/ou província, e as colunas correspondem às datas. Tabelas semelhantes podem ser carregadas para outros dados, como número de recuperados e número de mortes.\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## Entendendo os Dados\n",
"\n",
"Na tabela acima, o papel da coluna de província não está claro. Vamos ver os diferentes valores que estão presentes na coluna `Province/State`:\n"
"Na tabela acima o papel da coluna da província não está claro. Vamos ver os diferentes valores que estão presentes na coluna `Province/State`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Pelos nomes, podemos deduzir que países como Austrália e China m uma divisão mais detalhada por províncias. Vamos procurar informações sobre a China para ver o exemplo:\n"
"Pelos nomes, podemos deduzir que países como Austrália e China possuem uma divisão mais detalhada por províncias. Vamos procurar informações sobre a China para ver o exemplo:\n"
]
},
{
@ -1323,7 +1323,7 @@
"source": [
"## Pré-processamento dos Dados \n",
"\n",
"Não estamos interessados em dividir países em territórios adicionais, portanto, primeiro vamos eliminar essa divisão e adicionar informações de todos os territórios juntos, para obter informações para o país inteiro. Isso pode ser feito usando `groupby`:\n"
"Não temos interesse em dividir os países em territórios adicionais, portanto, primeiro nos livraríamos dessa divisão e adicionaríamos as informações de todos os territórios juntos, para obter informações para o país inteiro. Isso pode ser feito usando `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Você pode ver que devido ao uso de `groupby` todos os DataFrames agora estão indexados por País/Região. Podemos assim acessar os dados de um país específico usando `.loc`:|\n"
"Você pode ver que, devido ao uso de `groupby`, todos os DataFrames agora estão indexados por País/Região. Podemos assim acessar os dados de um país específico usando `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Observação** como usamos `[3:]` para remover os três primeiros elementos de uma sequência que contém metadados que não são datas (a Província/Estado e as colunas de geolocalização). Também podemos remover essas três colunas completamente:\n"
"> **Observe** como usamos `[3:]` para remover os primeiros três elementos de uma sequência que contém metadados que não são datas (as colunas de Província/Estado e geolocalização). Também podemos eliminar essas três colunas completamente:\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## Investigando os Dados\n",
"\n",
"Vamos agora mudar para investigar um país específico. Vamos criar um frame que contenha os dados sobre infecções indexados por data:\n"
"Vamos agora passar para a investigação de um país específico. Vamos criar um frame que contenha os dados sobre infecções indexados por data:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Agora vamos calcular o número de pessoas infectadas novas a cada dia. Isso nos permitirá ver a velocidade com que a pandemia progride. O dia mais fácil para fazer isso é usar `diff`:\n"
"Agora vamos calcular o número de novas pessoas infectadas a cada dia. Isso nos permitirá ver a velocidade com que a pandemia progride. A maneira mais fácil de fazer isso é usar `diff`:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Parece claramente que há flutuações semanais nos dados. Como queremos ser capazes de ver as tendências, faz sentido suavizar a curva calculando a média móvel (ou seja, para cada dia calcularemos o valor médio dos dias anteriores):\n"
"Claramente parece haver flutuações semanais nos dados. Como queremos ser capazes de ver as tendências, faz sentido suavizar a curva calculando a média móvel (ou seja, para cada dia vamos calcular o valor médio dos vários dias anteriores):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Para poder comparar vários países, podemos querer levar em conta a população do país e comparar a porcentagem de indivíduos infectados com relação à população do país. Para obter a população do país, vamos carregar o conjunto de dados dos países:\n"
"Para poder comparar vários países, podemos querer levar em conta a população do país e comparar a porcentagem de indivíduos infectados em relação à população do país. Para obter a população do país, vamos carregar o conjunto de dados dos países:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Como este conjunto de dados contém informações sobre países e províncias, para obter a população do país inteiro, precisamos ser um pouco mais espertos:\n"
"Como este conjunto de dados contém informações sobre países e províncias, para obter a população de todo o país precisamos ser um pouco mais espertos: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Calculando $R_t$\n",
"\n",
"Para entender quão contagiosa é a doença, observamos o **número básico de reprodução** $R_0$, que indica o número de pessoas que um indivíduo infectado pode infectar. Quando $R_0$ é maior que 1, a epidemia provavelmente irá se espalhar.\n",
"Para entender quão infecciosa é a doença, olhamos para o **número básico de reprodução** $R_0$, que indica o número de pessoas que uma pessoa infectada pode contagiar. Quando $R_0$ é maior que 1, é provável que a epidemia se espalhe.\n",
"\n",
"$R_0$ é uma característica da própria doença e não considera algumas medidas de proteção que as pessoas podem tomar para desacelerar a pandemia. Durante a progressão da pandemia, podemos estimar o número de reprodução $R_t$ em qualquer momento $t$. Foi demonstrado que esse número pode ser estimado aproximadamente considerando uma janela de 8 dias, e calculando $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"$R_0$ é uma propriedade da própria doença, e não considera algumas medidas de proteção que as pessoas podem adotar para desacelerar a pandemia. Durante a progressão da pandemia, podemos estimar o número de reprodução $R_t$ em um dado momento $t$. Foi demonstrado que esse número pode ser estimado aproximadamente tomando uma janela de 8 dias, e calculando $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"onde $I_t$ é o número de indivíduos recém-infectados no dia $t$.\n",
"\n",
"Vamos calcular $R_t$ para nossos dados da pandemia. Para isso, usaremos uma janela móvel de 8 valores de `ninfected` e aplicaremos a função para calcular a razão acima:\n"
"Vamos calcular $R_t$ para nossos dados da pandemia. Para isso, vamos tomar uma janela deslizante de 8 valores de `ninfected` e aplicar a função para calcular a razão acima:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Você pode ver que há algumas lacunas no gráfico. Elas podem ser causadas por `NaN`, ou se valores `inf` estiverem presentes no conjunto de dados. `inf` pode ser causado por divisão por 0, e `NaN` pode indicar dados ausentes, ou ausência de dados disponíveis para calcular o resultado (como no início do nosso frame, onde a janela móvel de largura 8 ainda não está disponível). Para deixar o gráfico mais bonito, precisamos preencher esses valores usando as funções `replace` e `fillna`.\n",
"Você pode ver que há algumas lacunas no gráfico. Elas podem ser causadas por `NaN`, ou por valores `inf` presentes no conjunto de dados. `inf` pode ser causado por divisão por 0, e `NaN` pode indicar dados faltantes ou ausência de dados disponíveis para calcular o resultado (como no início do nosso quadro, onde a janela móvel de largura 8 ainda não está disponível). Para deixar o gráfico mais agradável, precisamos preencher esses valores usando as funções `replace` e `fillna`.\n",
"\n",
"Vamos analisar melhor o início da pandemia. Também limitaremos os valores do eixo y para mostrar apenas valores abaixo de 6, para que possamos ver melhor, e desenharemos uma linha horizontal em 1.\n"
"Vamos analisar mais de perto o início da pandemia. Também limitaremos os valores do eixo y para mostrar apenas valores abaixo de 6, para facilitar a visualização, e desenharemos uma linha horizontal em 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Outro indicador interessante da pandemia é a **derivada**, ou **diferença diária** nos novos casos. Ela nos permite ver claramente quando a pandemia está aumentando ou diminuindo.\n"
"Outro indicador interessante da pandemia é a **derivada**, ou **diferença diária** nos novos casos. Ela nos permite ver claramente quando a pandemia está aumentando ou diminuindo. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dado o fato de que há muitas flutuações nos dados causadas pelo reporte, faz sentido suavizar a curva executando uma média móvel para obter o panorama geral. Vamos novamente focar nos primeiros meses da pandemia:\n"
"Dado o fato de que há muitas flutuações nos dados causadas pelos relatórios, faz sentido suavizar a curva executando uma média móvel para obter a visão geral. Vamos novamente focar nos primeiros meses da pandemia:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Desafio\n",
"\n",
"Agora é hora de você brincar mais com o código e os dados! Aqui estão algumas sugestões para você experimentar:\n",
"* Veja a propagação da pandemia em diferentes países.\n",
"* Trace gráficos de $R_t$ para vários países em um único gráfico para comparação, ou faça vários gráficos lado a lado.\n",
"Agora é hora de você brincar mais com o código e os dados! Aqui estão algumas sugestões que você pode experimentar:\n",
"* Veja a disseminação da pandemia em diferentes países.\n",
"* Trace gráficos de $R_t$ para vários países em um único gráfico para comparação, ou faça vários gráficos lado a lado\n",
"* Veja como o número de mortes e recuperações se correlaciona com o número de casos infectados.\n",
"* Tente descobrir quanto tempo uma doença típica dura, correlacionando visualmente a taxa de infecção e a taxa de mortes e procurando algumas anomalias. Pode ser necessário observar diferentes países para descobrir isso.\n",
"* Calcule a taxa de letalidade e como ela muda ao longo do tempo. Você pode querer levar em conta a duração da doença em dias para deslocar uma série temporal antes de fazer os cálculos.\n"
"* Tente descobrir quanto tempo uma doença típica dura correlacionando visualmente a taxa de infecção e a taxa de mortes e procurando algumas anomalias. Você pode precisar olhar diferentes países para descobrir isso.\n",
"* Calcule a taxa de letalidade e como ela muda ao longo do tempo. Você pode querer levar em conta a duração da doença em dias para deslocar uma série temporal antes de fazer os cálculos\n"
]
},
{
@ -2407,9 +2409,9 @@
"## Referências\n",
"\n",
"Você pode consultar estudos adicionais sobre a propagação da epidemia de COVID nas seguintes publicações:\n",
"* [Modelo SIR Deslizante para Estimativa de Rt durante a Pandemia de COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), post no blog de [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimação do Número de Reprodução Dependente do Tempo para o Surto Global de COVID-19](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Código para o artigo acima no GitHub](https://github.com/shwars/SlidingSIR)\n"
"* [Modelo SIR Deslizante para Estimativa de Rt durante a Pandemia de COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), postagem no blog de [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimativa do Número de Reprodução Dependente do Tempo para o Surto Global de COVID-19](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Código do artigo acima no GitHub](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**: \nEste documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**:\nEste documento foi traduzido usando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, por favor, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,6 +1,6 @@
# Projeto de visualização de dados Dangerous Liaisons
Para começar, certifique-se de que você tem o NPM e o Node instalados e funcionando na sua máquina. Instale as dependências (npm install) e, em seguida, execute o projeto localmente (npm run serve):
Para começar, você precisa garantir que tem o NPM e o Node **>=20.0.0** rodando em sua máquina. Instale as dependências (npm install) e então execute o projeto localmente (npm run serve):
## Configuração do projeto
```
@ -22,10 +22,12 @@ npm run build
npm run lint
```
### Personalizar configuração
Veja [Referência de Configuração](https://cli.vuejs.org/config/).
### Personalize a configuração
Veja [Configuration Reference](https://cli.vuejs.org/config/).
---
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autoritativa. Para informações críticas, recomenda-se a tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações equivocadas decorrentes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Aviso Legal**:
Este documento foi traduzido usando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, por favor, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,18 +1,18 @@
# Projeto de visualização de dados Dangerous Liaisons
Para começar, você precisa garantir que o NPM e o Node estejam funcionando na sua máquina. Instale as dependências (npm install) e, em seguida, execute o projeto localmente (npm run serve):
Para começar, você precisa garantir que o NPM e o Node **>=20.0.0** estejam rodando em sua máquina. Instale as dependências (npm install) e então execute o projeto localmente (npm run serve):
## Configuração do projeto
```
npm install
```
### Compila e recarrega automaticamente para desenvolvimento
### Compila e recarrega a quente para desenvolvimento
```
npm run serve
```
### Compila e minimiza para produção
### Compila e minifica para produção
```
npm run build
```
@ -22,10 +22,12 @@ npm run build
npm run lint
```
### Personalizar configuração
Veja [Referência de Configuração](https://cli.vuejs.org/config/).
### Personalize a configuração
Veja [Configuration Reference](https://cli.vuejs.org/config/).
---
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte oficial. Para informações críticas, recomenda-se a tradução profissional feita por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações equivocadas decorrentes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Aviso Legal**:
Este documento foi traduzido usando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, por favor, esteja ciente de que traduções automatizadas podem conter erros ou imprecisões. O documento original em seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "pt-PT"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T09:22:04+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:58:24+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "pt-PT"
},
@ -42,8 +42,8 @@
"language_code": "pt-PT"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T13:28:26+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T22:03:02+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "pt-PT"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "pt-PT"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:59:25+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pt-PT"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-24T21:14:50+00:00",
@ -108,8 +114,8 @@
"language_code": "pt-PT"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T09:23:27+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:57:55+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "pt-PT"
},
@ -192,14 +198,14 @@
"language_code": "pt-PT"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-24T22:34:24+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:03:09+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "pt-PT"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-24T22:33:52+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T22:03:05+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "pt-PT"
},

File diff suppressed because one or more lines are too long

@ -1,48 +1,47 @@
# Definindo Dados
# Definição de Dados
|![ Sketchnote por [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|Definindo Dados - _Sketchnote por [@nitya](https://twitter.com/nitya)_ |
|Definição de Dados - _Sketchnote por [@nitya](https://twitter.com/nitya)_ |
Dados são fatos, informações, observações e medições que são usados para fazer descobertas e apoiar decisões informadas. Um ponto de dado é uma unidade única de dados dentro de um conjunto de dados, que é uma coleção de pontos de dados. Conjuntos de dados podem vir em diferentes formatos e estruturas, geralmente baseados em sua origem ou de onde os dados vieram. Por exemplo, os lucros mensais de uma empresa podem estar em uma folha de cálculo, enquanto os dados de frequência cardíaca por hora de um smartwatch podem estar no formato [JSON](https://stackoverflow.com/a/383699). É comum que cientistas de dados trabalhem com diferentes tipos de dados dentro de um conjunto de dados.
Dados são fatos, informações, observações e medições usados para fazer descobertas e apoiar decisões informadas. Um ponto de dados é uma unidade única de dados dentro de um conjunto de dados, que é uma coleção de pontos de dados. Os conjuntos de dados podem existir em diferentes formatos e estruturas, geralmente baseados na sua origem, ou onde os dados foram recolhidos. Por exemplo, os ganhos mensais de uma empresa podem estar numa folha de cálculo, mas os dados da frequência cardíaca horária de um relógio inteligente podem estar em formato [JSON](https://stackoverflow.com/a/383699). É comum que os cientistas de dados trabalhem com diferentes tipos de dados dentro de um conjunto.
Esta lição foca em identificar e classificar dados com base em suas características e suas fontes.
Esta lição foca-se em identificar e classificar os dados pelas suas características e fontes.
## [Questionário Pré-Aula](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Como os Dados São Descritos
## Como os Dados são Descritos
### Dados Brutos
Dados brutos são dados que vêm de sua fonte em seu estado inicial e não foram analisados ou organizados. Para entender o que está acontecendo com um conjunto de dados, ele precisa ser organizado em um formato que possa ser compreendido por humanos, bem como pela tecnologia que pode ser usada para analisá-lo mais a fundo. A estrutura de um conjunto de dados descreve como ele está organizado e pode ser classificada como estruturada, não estruturada e semiestruturada. Esses tipos de estrutura variam dependendo da origem, mas, em última análise, se encaixam nessas três categorias.
Dados brutos são dados que vieram da sua fonte no seu estado inicial e não foram analisados nem organizados. Para compreender o que está a acontecer com um conjunto de dados, ele precisa de ser organizado num formato compreensível para humanos e para a tecnologia usada para o analisar mais a fundo. A estrutura de um conjunto de dados descreve como está organizado e pode ser classificada em estruturada, não estruturada e semi-estruturada. Estes tipos de estrutura variam dependendo da fonte, mas enquadram-se nestas três categorias.
### Dados Quantitativos
Dados quantitativos são observações numéricas dentro de um conjunto de dados e podem, tipicamente, ser analisados, medidos e usados matematicamente. Alguns exemplos de dados quantitativos são: a população de um país, a altura de uma pessoa ou os lucros trimestrais de uma empresa. Com alguma análise adicional, dados quantitativos podem ser usados para descobrir tendências sazonais do Índice de Qualidade do Ar (AQI) ou estimar a probabilidade de tráfego na hora do rush em um dia típico de trabalho.
Dados quantitativos são observações numéricas dentro de um conjunto de dados que tipicamente podem ser analisadas, medidas e usadas matematicamente. Alguns exemplos de dados quantitativos são: a população de um país, a altura de uma pessoa ou os lucros trimestrais de uma empresa. Com alguma análise adicional, dados quantitativos podem ser usados para descobrir tendências sazonais do Índice de Qualidade do Ar (AQI) ou estimar a probabilidade do trânsito nas horas de ponta num dia de trabalho típico.
### Dados Qualitativos
Dados qualitativos, também conhecidos como dados categóricos, são dados que não podem ser medidos objetivamente como as observações de dados quantitativos. Geralmente, são formatos variados de dados subjetivos que capturam a qualidade de algo, como um produto ou processo. Às vezes, dados qualitativos são numéricos, mas não seriam usados matematicamente, como números de telefone ou marcas de tempo. Alguns exemplos de dados qualitativos são: comentários em vídeos, a marca e o modelo de um carro ou a cor favorita dos seus amigos mais próximos. Dados qualitativos podem ser usados para entender quais produtos os consumidores mais gostam ou identificar palavras-chave populares em currículos de emprego.
Dados qualitativos, também conhecidos como dados categóricos, são dados que não podem ser medidos objetivamente como observações de dados quantitativos. Normalmente são vários formatos de dados subjetivos que captam a qualidade de algo, como um produto ou processo. Por vezes, dados qualitativos são numéricos mas não usados matematicamente, como números de telefone ou carimbos temporais. Alguns exemplos de dados qualitativos são: comentários em vídeos, a marca e modelo de um carro ou a cor favorita dos seus amigos mais próximos. Dados qualitativos podem ser usados para compreender quais os produtos que os consumidores preferem ou para identificar palavras-chave populares em currículos de candidatura.
### Dados Estruturados
Dados estruturados são organizados em linhas e colunas, onde cada linha terá o mesmo conjunto de colunas. As colunas representam um valor de um tipo específico e serão identificadas com um nome que descreve o que o valor representa, enquanto as linhas contêm os valores reais. As colunas frequentemente têm um conjunto específico de regras ou restrições sobre os valores, para garantir que os valores representem com precisão a coluna. Por exemplo, imagine uma folha de cálculo de clientes onde cada linha deve ter um número de telefone e os números de telefone nunca contêm caracteres alfabéticos. Podem ser aplicadas regras na coluna de números de telefone para garantir que ela nunca esteja vazia e contenha apenas números.
Dados estruturados são organizados em linhas e colunas, onde cada linha terá o mesmo conjunto de colunas. As colunas representam um valor de um tipo específico e são identificadas por um nome que descreve o que representa, enquanto as linhas contêm os valores reais. As colunas terão frequentemente um conjunto específico de regras ou restrições sobre os valores para garantir que representam adequadamente a coluna. Por exemplo, imagine uma folha de cálculo de clientes onde cada linha deve ter um número de telefone e os números de telefone nunca contêm caracteres alfabéticos. Pode haver regras aplicadas na coluna do número de telefone para garantir que nunca está vazia e contém só números.
Uma vantagem dos dados estruturados é que eles podem ser organizados de forma a se relacionar com outros dados estruturados. No entanto, como os dados são projetados para serem organizados de uma maneira específica, fazer alterações em sua estrutura geral pode exigir muito esforço. Por exemplo, adicionar uma coluna de e-mail à folha de cálculo de clientes que não pode estar vazia significa que será necessário descobrir como adicionar esses valores às linhas existentes de clientes no conjunto de dados.
Uma vantagem dos dados estruturados é que podem ser organizados de forma a relacionarem-se com outros dados estruturados. Contudo, como o dado é projetado para estar organizado de forma específica, alterar a sua estrutura global pode requerer muito esforço. Por exemplo, adicionar uma coluna de email à folha de clientes que não pode estar vazia significa que terá de perceber como adicionar esses valores às linhas existentes do conjunto de dados.
Exemplos de dados estruturados: folhas de cálculo, bancos de dados relacionais, números de telefone, extratos bancários.
Exemplos de dados estruturados: folhas de cálculo, bases de dados relacionais, números de telefone, extratos bancários
### Dados Não Estruturados
Dados não estruturados geralmente não podem ser categorizados em linhas ou colunas e não contêm um formato ou conjunto de regras a seguir. Como os dados não estruturados têm menos restrições em sua estrutura, é mais fácil adicionar novas informações em comparação com um conjunto de dados estruturado. Se um sensor que captura dados de pressão barométrica a cada 2 minutos recebeu uma atualização que agora permite medir e registrar a temperatura, não é necessário alterar os dados existentes se forem não estruturados. No entanto, isso pode tornar a análise ou investigação desse tipo de dado mais demorada. Por exemplo, um cientista que deseja encontrar a temperatura média do mês anterior a partir dos dados do sensor, mas descobre que o sensor registrou um "e" em alguns de seus dados para indicar que estava quebrado, em vez de um número típico, o que significa que os dados estão incompletos.
Dados não estruturados tipicamente não podem ser categorizados em linhas ou colunas e não têm um formato ou conjunto de regras a seguir. Porque têm menos restrições na estrutura, é mais fácil adicionar nova informação comparado a um conjunto estruturado. Se um sensor que captura dados de pressão barométrica a cada 2 minutos recebeu uma atualização para medir e registar temperatura, não é necessário alterar os dados existentes se forem não estruturados. Contudo, isto poderá tornar a análise ou investigação desses dados mais demorada. Por exemplo, um cientista que quer encontrar a temperatura média do mês anterior a partir dos dados do sensor, mas descobre que o sensor registou um "e" em alguns registos para indicar que estava avariado em vez de um número habitual, o que significa que os dados estão incompletos.
Exemplos de dados não estruturados: arquivos de texto, mensagens de texto, arquivos de vídeo.
Exemplos de dados não estruturados: ficheiros de texto, mensagens de texto, ficheiros de vídeo
### Dados Semiestruturados
Dados semiestruturados têm características que os tornam uma combinação de dados estruturados e não estruturados. Eles geralmente não seguem um formato de linhas e colunas, mas são organizados de uma maneira considerada estruturada e podem seguir um formato fixo ou conjunto de regras. A estrutura varia entre as fontes, como uma hierarquia bem definida ou algo mais flexível que permite a fácil integração de novas informações. Metadados são indicadores que ajudam a decidir como os dados são organizados e armazenados e terão vários nomes, dependendo do tipo de dado. Alguns nomes comuns para metadados são tags, elementos, entidades e atributos. Por exemplo, uma mensagem de e-mail típica terá um assunto, corpo e um conjunto de destinatários e pode ser organizada por quem ou quando foi enviada.
### Semi-estruturados
Dados semi-estruturados têm características que os colocam como uma combinação entre dados estruturados e não estruturados. Normalmente não seguem um formato de linhas e colunas, mas são organizados de uma forma considerada estruturada e podem seguir um formato fixo ou regras. A estrutura varia consoante a fonte, desde hierarquias bem definidas a algo mais flexível que permite fácil integração de nova informação. Metadados são indicadores que ajudam a decidir como os dados estão organizados e armazenados e podem ter vários nomes, dependendo do tipo de dados. Alguns nomes comuns são etiquetas, elementos, entidades e atributos. Por exemplo, uma mensagem de email típica tem um assunto, corpo e conjunto de destinatários, podendo ser organizada por quem a enviou ou quando.
Exemplos de dados semiestruturados: HTML, arquivos CSV, JavaScript Object Notation (JSON).
Exemplos de dados semi-estruturados: HTML, ficheiros CSV, JavaScript Object Notation (JSON)
## Fontes de Dados
## Fontes de Dados
Uma fonte de dados é o local inicial onde os dados foram gerados ou onde "vivem" e varia com base em como e quando foram coletados. Dados gerados por seus próprios usuários são conhecidos como dados primários, enquanto dados secundários vêm de uma fonte que coletou dados para uso geral. Por exemplo, um grupo de cientistas coletando observações em uma floresta tropical seria considerado primário, e se decidirem compartilhá-lo com outros cientistas, seria considerado secundário para aqueles que o utilizam.
Uma fonte de dados é o local inicial onde os dados foram gerados, ou onde "residem", e varia conforme como e quando foram recolhidos. Dados gerados pelos seus utilizadores são conhecidos como dados primários enquanto dados secundários provêm de uma fonte que recolheu dados para uso geral. Por exemplo, um grupo de cientistas que colhem observações numa floresta tropical são considerados primários e se decidirem partilhá-las com outros cientistas, serão secundários para esses que as usam.
Bancos de dados são uma fonte comum e dependem de um sistema de gerenciamento de banco de dados para hospedar e manter os dados, onde os usuários utilizam comandos chamados consultas para explorar os dados. Arquivos como fontes de dados podem ser arquivos de áudio, imagem e vídeo, bem como folhas de cálculo como Excel. Fontes da internet são um local comum para hospedar dados, onde bancos de dados e arquivos podem ser encontrados. Interfaces de programação de aplicativos, também conhecidas como APIs, permitem que programadores criem maneiras de compartilhar dados com usuários externos pela internet, enquanto o processo de web scraping extrai dados de uma página da web. As [lições em Trabalhando com Dados](../../../../../../../../../2-Working-With-Data) focam em como usar várias fontes de dados.
Bases de dados são uma fonte comum, dependendo de um sistema de gestão de base de dados para alojar e manter os dados, onde utilizadores usam comandos chamados queries para explorar os dados. Ficheiros como fontes podem ser áudio, imagens e vídeo, bem como folhas de cálculo como Excel. Fontes na internet são locais comuns para alojar dados, onde bases de dados e ficheiros podem ser encontrados. Interfaces de programação de aplicações, conhecidas por APIs, permitem que programadores criem formas de partilhar dados com utilizadores externos pela internet, enquanto o processo de web scraping extrai dados de páginas da web. As [lições em Trabalhar com Dados](../../../../../../../../../2-Working-With-Data) focam-se em como usar várias fontes de dados.
## Conclusão
@ -55,22 +54,26 @@ Nesta lição aprendemos:
## 🚀 Desafio
O Kaggle é uma excelente fonte de conjuntos de dados abertos. Use a [ferramenta de busca de conjuntos de dados](https://www.kaggle.com/datasets) para encontrar alguns conjuntos de dados interessantes e classifique de 3 a 5 conjuntos de dados com os seguintes critérios:
Kaggle é uma excelente fonte de conjuntos de dados abertos. Use a [ferramenta de pesquisa de conjuntos de dados](https://www.kaggle.com/datasets) para encontrar conjuntos de dados interessantes e classifique 3-5 conjuntos com estes critérios:
- Os dados são quantitativos ou qualitativos?
- Os dados são estruturados, não estruturados ou semiestruturados?
- Os dados são estruturados, não estruturados ou semi-estruturados?
## [Questionário Pós-Aula](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Revisão e Autoestudo
- Esta unidade do Microsoft Learn, intitulada [Classifique seus Dados](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data), tem uma explicação detalhada sobre dados estruturados, semiestruturados e não estruturados.
## Tarefa
## Revisão & Estudo Autónomo
- Esta unidade da Microsoft Learn, intitulada [Identificar formatos de dados](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) tem uma descrição detalhada de dados estruturados, semi-estruturados e não estruturados.
## Trabalho
[Classificando Conjuntos de Dados](assignment.md)
[Classificar Conjuntos de Dados](assignment.md)
---
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original no seu idioma nativo deve ser considerado a fonte oficial. Para informações críticas, recomenda-se uma tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas resultantes do uso desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas resultantes da utilização desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {},
"source": [
"# Introdução à Probabilidade e Estatística\n",
"Neste caderno, vamos experimentar alguns dos conceitos que discutimos anteriormente. Muitos conceitos de probabilidade e estatística estão bem representados em bibliotecas importantes para processamento de dados em Python, como `numpy` e `pandas`.\n"
"Neste caderno, iremos experimentar alguns dos conceitos que discutimos anteriormente. Muitos conceitos de probabilidade e estatística estão bem representados em bibliotecas principais para processamento de dados em Python, como `numpy` e `pandas`.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## Variáveis Aleatórias e Distribuições\n",
"Vamos começar por tirar uma amostra de 30 valores de uma distribuição uniforme entre 0 e 9. Também iremos calcular a média e a variância.\n"
"Vamos começar por tirar uma amostra de 30 valores de uma distribuição uniforme de 0 a 9. Também iremos calcular a média e a variância.\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Estamos a usar um pacote chamado [**Pandas**](https://pandas.pydata.org/) aqui para análise de dados. Falaremos mais sobre o Pandas e trabalhar com dados em Python mais à frente neste curso.\n",
"> Estamos a usar um pacote chamado [**Pandas**](https://pandas.pydata.org/) aqui para análise de dados. Vamos falar mais sobre o Pandas e o trabalho com dados em Python mais adiante neste curso.\n",
"\n",
"Vamos calcular os valores médios para idade, altura e peso:\n"
"Vamos calcular valores médios para idade, altura e peso:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Agora vamos focar na altura, e calcular o desvio padrão e a variância:\n"
"Agora vamos focar na altura e calcular o desvio padrão e a variância: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Além da média, faz sentido olhar para o valor mediano e os quartis. Eles podem ser visualizados usando um **diagrama de caixas**:\n"
"Para além da média, faz sentido olhar para o valor mediano e os quartis. Eles podem ser visualizados usando um **diagrama de caixas**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Também podemos fazer diagramas de caixa de subconjuntos do nosso conjunto de dados, por exemplo, agrupados por função do jogador.\n"
"Também podemos criar boxplots de subconjuntos do nosso conjunto de dados, por exemplo, agrupados por função do jogador.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Nota**: Este diagrama sugere que, em média, as alturas dos jogadores da primeira base são superiores às alturas dos jogadores da segunda base. Mais adiante, iremos aprender como testar esta hipótese de forma mais formal, e como demonstrar que os nossos dados são estatisticamente significativos para o mostrar. \n",
"> **Nota**: Este diagrama sugere que, em média, as alturas dos primeira bases são superiores às alturas dos segunda bases. Mais adiante, iremos aprender como podemos testar esta hipótese de forma mais formal, e como demonstrar que os nossos dados são estatisticamente significativos para o mostrar. \n",
"\n",
"A idade, a altura e o peso são todas variáveis aleatórias contínuas. O que acha que é a distribuição delas? Uma boa forma de descobrir é traçar o histograma dos valores: \n"
"A idade, a altura e o peso são todas variáveis aleatórias contínuas. O que acha que será a sua distribuição? Uma boa forma de descobrir é traçar o histograma dos valores: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## Distribuição Normal\n",
"\n",
"Vamos criar uma amostra artificial de pesos que segue uma distribuição normal com a mesma média e variância dos nossos dados reais:\n"
"Vamos criar uma amostra artificial de pesos que segue uma distribuição normal com a mesma média e variância que os nossos dados reais:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Como a maioria dos valores na vida real segue uma distribuição normal, não devemos usar um gerador de números aleatórios uniforme para gerar dados de amostra. Aqui está o que acontece se tentarmos gerar pesos com uma distribuição uniforme (gerada por `np.random.rand`):\n"
"Como a maioria dos valores na vida real está normalmente distribuída, não devemos usar um gerador de números aleatórios uniforme para gerar dados de amostra. Aqui está o que acontece se tentarmos gerar pesos com uma distribuição uniforme (gerada por `np.random.rand`):\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Intervalos de Confiança\n",
"\n",
"Vamos agora calcular intervalos de confiança para os pesos e alturas dos jogadores de basebol. Vamos usar o código [deste debate no stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Vamos agora calcular os intervalos de confiança para os pesos e alturas dos jogadores de basebol. Vamos usar o código [desta discussão no stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos testar a hipótese de que os Primeiros Basemen são mais altos do que os Segundos Basemen. A maneira mais simples de fazer isso é testar os intervalos de confiança:\n"
"Vamos testar a hipótese de que os Primeiros-Baseman são mais altos do que os Segundos-Baseman. A forma mais simples de fazer isto é testar os intervalos de confiança:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"Os dois valores devolvidos pela função `ttest_ind` são:\n",
"* o p-valor pode ser considerado como a probabilidade de duas distribuições terem a mesma média. No nosso caso, é muito baixo, o que significa que existe uma forte evidência a apoiar que os jogadores de primeira base são mais altos.\n",
"* o valor t é o valor intermédio da diferença média normalizada que é usado no teste t, e é comparado com um valor limite para um dado valor de confiança.\n"
"* o valor-p pode ser considerado como a probabilidade de duas distribuições terem a mesma média. No nosso caso, é muito baixo, o que significa que há uma forte evidência a apoiar que os primeira-base são mais altos.\n",
"* o valor-t é o valor intermédio da diferença média normalizada que é usado no teste t, e é comparado com um valor limite para um dado valor de confiança.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Simulação de uma Distribuição Normal com o Teorema do Limite Central\n",
"## Simulando uma Distribuição Normal com o Teorema do Limite Central\n",
"\n",
"O gerador pseudo-aleatório em Python é concebido para nos fornecer uma distribuição uniforme. Se quisermos criar um gerador para distribuição normal, podemos usar o teorema do limite central. Para obter um valor distribuído normalmente, vamos simplesmente calcular a média de uma amostra gerada de forma uniforme.\n"
"O gerador pseudo-aleatório em Python é desenhado para nos dar uma distribuição uniforme. Se quisermos criar um gerador para distribuição normal, podemos usar o teorema do limite central. Para obter um valor com distribuição normal, basta calcular a média de uma amostra gerada uniformemente.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Correlação e Evil Baseball Corp\n",
"\n",
"A correlação permite-nos encontrar relações entre sequências de dados. No nosso exemplo fictício, vamos fingir que existe uma corporação de basebol malvada que paga os seus jogadores de acordo com a sua altura quanto mais alto for o jogador, mais dinheiro ele/ela recebe. Suponha que há um salário base de $1000, e um bónus adicional de $0 a $100, dependendo da altura. Vamos pegar nos jogadores reais da MLB, e calcular os seus salários imaginários:\n"
"A correlação permite-nos encontrar relações entre sequências de dados. No nosso exemplo lúdico, vamos fingir que existe uma corporação malvada de baseball que paga os seus jogadores de acordo com a sua altura - quanto mais alto for o jogador, mais dinheiro ele/ela recebe. Suponha-se um salário base de $1000, e um bónus adicional de $0 a $100, dependendo da altura. Vamos pegar nos jogadores reais da MLB, e calcular os seus salários imaginários:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos agora calcular a covariância e a correlação dessas sequências. `np.cov` fornecerá uma chamada **matriz de covariância**, que é uma extensão da covariância para múltiplas variáveis. O elemento $M_{ij}$ da matriz de covariância $M$ é uma correlação entre as variáveis de entrada $X_i$ e $X_j$, e os valores diagonais $M_{ii}$ são a variância de $X_{i}$. De forma semelhante, `np.corrcoef` fornecerá a **matriz de correlação**.\n"
"Vamos agora calcular a covariância e a correlação dessas sequências. `np.cov` dará uma chamada **matriz de covariância**, que é uma extensão da covariância para múltiplas variáveis. O elemento $M_{ij}$ da matriz de covariância $M$ é uma correlação entre as variáveis de entrada $X_i$ e $X_j$, e os valores diagonais $M_{ii}$ são a variância de $X_{i}$. De forma semelhante, `np.corrcoef` dará a **matriz de correlação**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Uma correlação igual a 1 significa que existe uma **relação linear** forte entre duas variáveis. Podemos visualizar a relação linear ao traçar um valor em função do outro:\n"
"Uma correlação igual a 1 significa que existe uma forte **relação linear** entre duas variáveis. Podemos ver visualmente a relação linear ao traçar um valor em relação ao outro:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Neste caso, a correlação é ligeiramente menor, mas continua bastante elevada. Agora, para tornar a relação ainda menos óbvia, podemos querer adicionar alguma aleatoriedade extra adicionando uma variável aleatória ao salário. Vamos ver o que acontece:\n"
"Neste caso, a correlação é ligeiramente menor, mas continua bastante elevada. Agora, para tornar a relação ainda menos óbvia, poderíamos querer adicionar alguma aleatoriedade extra, acrescentando uma variável aleatória ao salário. Vamos ver o que acontece:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Consegue adivinhar por que é que os pontos se alinham em linhas verticais assim?\n",
"> Consegue adivinhar porque é que os pontos se alinham em linhas verticais assim?\n",
"\n",
"Observámos a correlação entre um conceito artificialmente construído como o salário e a variável observada *altura*. Vamos também ver se as duas variáveis observadas, como a altura e o peso, também correlacionam:\n"
"Observámos a correlação entre um conceito artificialmente criado como o salário e a variável observada *altura*. Vamos também ver se as duas variáveis observadas, como altura e peso, também se correlacionam:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Infelizmente, não obtivemos quaisquer resultados - apenas alguns valores estranhos `nan`. Isto deve-se ao facto de alguns dos valores da nossa série estarem indefinidos, representados como `nan`, o que causa que o resultado da operação também seja indefinido. Ao observar a matriz, podemos ver que `Weight` é a coluna problemática, porque a autocorrelação entre valores de `Height` foi calculada.\n",
"Infelizmente, não obtivemos quaisquer resultados - apenas alguns valores estranhos `nan`. Isto deve-se ao facto de algumas das valores na nossa série serem indefinidos, representados como `nan`, o que faz com que o resultado da operação seja também indefinido. Ao olhar para a matriz podemos ver que `Weight` é a coluna problemática, porque foi calculada a autocorrelação entre os valores de `Height`.\n",
"\n",
"> Este exemplo mostra a importância da **preparação** e **limpeza** dos dados. Sem dados adequados, não podemos calcular nada.\n",
"> Este exemplo mostra a importância da **preparação** e **limpeza** dos dados. Sem dados adequados não podemos calcular nada.\n",
"\n",
"Vamos usar o método `fillna` para preencher os valores em falta e calcular a correlação:\n"
"Vamos usar o método `fillna` para preencher os valores em falta, e calcular a correlação:\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"De facto, existe uma correlação, mas não tão forte como no nosso exemplo artificial. De facto, se olharmos para o gráfico de dispersão de um valor em função do outro, a relação seria muito menos óbvia:\n"
"Existe de facto uma correlação, mas não tão forte como no nosso exemplo artificial. De facto, se olharmos para o gráfico de dispersão de um valor em relação ao outro, a relação seria muito menos óbvia:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Conclusão\n",
"\n",
"Neste caderno aprendemos como realizar operações básicas em dados para calcular funções estatísticas. Agora sabemos como usar um conjunto sólido de matemática e estatística para provar algumas hipóteses, e como calcular intervalos de confiança para variáveis arbitrárias dado um conjunto de dados.\n"
"Neste caderno aprendemos como realizar operações básicas em dados para calcular funções estatísticas. Agora sabemos como usar um conjunto sólido de matemática e estatística para provar algumas hipóteses, e como calcular intervalos de confiança para variáveis arbitrárias dado um conjunto de dados. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**:\nEste documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos empenhemos em garantir a precisão, por favor esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autoritativa. Para informações críticas, recomenda-se a tradução profissional efetuada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas que decorram da utilização desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**:\nEste documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas resultantes da utilização desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T12:48:41+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "pt"
}
},
"nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Estimativa da Pandemia de COVID-19\n",
"# Estimativa da Pandemia COVID-19\n",
"\n",
"## Carregamento de Dados\n",
"\n",
"Vamos utilizar dados sobre indivíduos infetados com COVID-19, fornecidos pelo [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) na [Johns Hopkins University](https://jhu.edu/). O conjunto de dados está disponível em [este Repositório do GitHub](https://github.com/CSSEGISandData/COVID-19).\n"
"Iremos utilizar dados sobre indivíduos infectados pela COVID-19, fornecidos pelo [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) da [Johns Hopkins University](https://jhu.edu/). O conjunto de dados está disponível em [este Repositório do GitHub](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Podemos carregar os dados mais recentes diretamente do GitHub usando `pd.read_csv`. Se por alguma razão os dados não estiverem disponíveis, pode sempre usar a cópia disponível localmente na pasta `data` - basta descomentar a linha abaixo que define `base_url`:\n"
"Podemos carregar os dados mais recentes diretamente do GitHub usando `pd.read_csv`. Se por algum motivo os dados não estiverem disponíveis, pode sempre usar a cópia disponível localmente na pasta `data` - basta descomentar a linha abaixo que define `base_url`:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Vamos agora carregar os dados dos indivíduos infectados e ver como os dados se apresentam:\n"
"Vamos agora carregar os dados dos indivíduos infetados e ver como é que os dados se apresentam:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Podemos ver que cada linha da tabela define o número de indivíduos infetados para cada país e/ou província, e as colunas correspondem às datas. Tabelas semelhantes podem ser carregadas para outros dados, como número de recuperados e número de mortes.\n"
"Podemos ver que cada linha da tabela define o número de indivíduos infetados para cada país e/ou província, e as colunas correspondem às datas. Tabelas similares podem ser carregadas para outros dados, como o número de recuperados e o número de mortes.\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pré-processamento dos Dados\n",
"## Pré-processamento dos Dados \n",
"\n",
"Não estamos interessados em decompor os países em mais territórios, portanto, primeiro iremos eliminar essa decomposição e adicionar informações de todos os territórios juntos, para obter informações do país inteiro. Isto pode ser feito usando `groupby`:\n"
"Não estamos interessados em dividir os países em territórios adicionais, por isso começamos por eliminar essa divisão e adicionar informações de todos os territórios juntos, para obter dados para o país inteiro. Isto pode ser feito usando `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Pode ver que, devido ao uso de `groupby`, todos os DataFrames estão agora indexados por País/Região. Podemos assim aceder aos dados de um país específico usando `.loc`:|\n"
"Como pode ver, devido ao uso de `groupby`, todos os DataFrames estão agora indexados por País/Região. Podemos assim aceder aos dados de um país específico usando `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Nota** como usamos `[3:]` para remover os primeiros três elementos de uma sequência que contêm metadados que não são datas (as colunas de Província/Estado e geolocalização). Também podemos eliminar essas três colunas por completo:\n"
"> **Note** como usamos `[3:]` para remover os primeiros três elementos de uma sequência que contêm metadados que não são datas (as colunas de Província/Estado e geolocalização). Podemos também eliminar essas três colunas por completo:\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## Investigando os Dados\n",
"\n",
"Vamos agora passar a investigar um país específico. Vamos criar um frame que contenha os dados das infeções indexados por data:\n"
"Vamos agora mudar para investigar um país específico. Vamos criar um quadro que contenha os dados de infeções indexados por data:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Agora vamos calcular o número de novas pessoas infetadas a cada dia. Isto permitir-nos-á ver a velocidade com que a pandemia progride. O dia mais fácil para fazer isto é usar o `diff`:\n"
"Agora vamos calcular o número de novas pessoas infetadas a cada dia. Isto permitirá ver a velocidade a que a pandemia progride. A forma mais fácil de o fazer é usar `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Podemos ver grandes flutuações nos dados. Vamos analisar mais de perto um dos meses:\n"
"Podemos ver grandes flutuações nos dados. Vamos olhar mais de perto para um dos meses:\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Para poder comparar vários países, podemos querer levar em conta a população do país e comparar a percentagem de indivíduos infetados relativamente à população do país. Para obter a população do país, vamos carregar o conjunto de dados dos países:\n"
"Para poder comparar vários países, talvez queiramos ter em conta a população do país e comparar a percentagem de indivíduos infetados em relação à população do país. Para obter a população do país, vamos carregar o conjunto de dados dos países:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Porque este conjunto de dados contém informações sobre países e províncias, para obter a população de todo o país precisamos de ser um pouco mais engenhosos:\n"
"Como este conjunto de dados contém informações tanto sobre países como sobre províncias, para obter a população do país inteiro precisamos de ser um pouco engenhosos: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Cálculo de $R_t$\n",
"\n",
"Para perceber quão infecciosa é a doença, analisamos o **número básico de reprodução** $R_0$, que indica o número de pessoas que uma pessoa infetada irá infetar. Quando $R_0$ é superior a 1, a epidemia tem tendência a espalhar-se.\n",
"Para perceber quão contagiosa é a doença, analisamos o **número básico de reprodução** $R_0$, que indica o número de pessoas que uma pessoa infetada irá infectar. Quando $R_0$ é maior que 1, é provável que a epidemia se espalhe.\n",
"\n",
"$R_0$ é uma característica da própria doença, e não tem em conta algumas medidas de proteção que as pessoas podem tomar para abrandar a pandemia. Durante o progresso da pandemia, podemos estimar o número de reprodução $R_t$ em qualquer instante $t$. Foi demonstrado que este número pode ser aproximado tomando uma janela de 8 dias, e calculando $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"onde $I_t$ é o número de indivíduos recém-infetados no dia $t$.\n",
"$R_0$ é uma propriedade da própria doença, e não tem em conta algumas medidas de proteção que as pessoas possam tomar para abrandar a pandemia. Durante a progressão da pandemia, podemos estimar o número de reprodução $R_t$ a qualquer momento $t$. Foi demonstrado que este número pode ser estimado aproximadamente tomando uma janela de 8 dias, e calculando $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"onde $I_t$ é o número de indivíduos recém infetados no dia $t$.\n",
"\n",
"Vamos calcular $R_t$ para os nossos dados da pandemia. Para tal, iremos usar uma janela móvel de 8 valores `ninfected` e aplicar a função para calcular a razão acima:\n"
"Vamos calcular $R_t$ para os nossos dados da pandemia. Para tal, vamos usar uma janela móvel de 8 valores de `ninfected`, e aplicar a função para calcular a razão acima:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Pode ver que existem alguns espaços no gráfico. Estes podem ser causados tanto por `NaN`, como por valores `inf` presentes no conjunto de dados. `inf` pode ser causado por divisão por 0, e `NaN` pode indicar dados em falta, ou ausência de dados disponíveis para calcular o resultado (como no início do nosso frame, onde a janela móvel de largura 8 ainda não está disponível). Para tornar o gráfico mais agradável, precisamos preencher esses valores usando a função `replace` e `fillna`.\n",
"Pode ver que existem alguns espaços no gráfico. Esses podem ser causados por `NaN`, ou se houver valores `inf` presentes no conjunto de dados. `inf` pode ser causado por uma divisão por 0, e `NaN` pode indicar dados em falta, ou ausência de dados disponíveis para calcular o resultado (como no início do nosso frame, onde a janela móvel de largura 8 ainda não está disponível). Para tornar o gráfico mais agradável, precisamos preencher esses valores usando as funções `replace` e `fillna`.\n",
"\n",
"Vamos analisar mais detalhadamente o início da pandemia. Também iremos limitar os valores do eixo y para mostrar apenas valores abaixo de 6, para uma melhor visualização, e desenhar uma linha horizontal em 1.\n"
"Vamos analisar melhor o início da pandemia. Também iremos limitar os valores do eixo y para mostrar apenas valores abaixo de 6, a fim de ver melhor, e desenhar uma linha horizontal em 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Outro indicador interessante da pandemia é a **derivada**, ou **diferença diária** nos novos casos. Permite-nos ver claramente quando a pandemia está a aumentar ou a diminuir.\n"
"Outro indicador interessante da pandemia é a **derivada**, ou **diferença diária** nos novos casos. Permite-nos ver claramente quando a pandemia está a aumentar ou a diminuir. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dado o facto de existirem muitas flutuações nos dados causadas pela comunicação, faz sentido suavizar a curva aplicando uma média móvel para obter uma visão geral. Vamos focar novamente nos primeiros meses da pandemia:\n"
"Dado que existem muitas flutuações nos dados causadas pela comunicação, faz sentido suavizar a curva aplicando uma média móvel para obter uma visão geral. Vamos focar novamente nos primeiros meses da pandemia:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Challenge\n",
"\n",
"Agora é altura de brincar mais com o código e os dados! Aqui ficam algumas sugestões para experimentar:\n",
"* Ver a propagação da pandemia em diferentes países.\n",
"* Traçar gráficos de $R_t$ para vários países num único gráfico para comparação, ou fazer vários gráficos lado a lado.\n",
"* Ver como o número de mortes e recuperados se correlaciona com o número de casos infetados.\n",
"* Tentar descobrir quanto tempo dura uma doença típica correlacionando visualmente a taxa de infeção com a taxa de mortes e procurando algumas anomalias. Pode ser necessário olhar para diferentes países para descobrir isso.\n",
"* Calcular a taxa de fatalidade e como ela muda ao longo do tempo. Pode querer ter em conta a duração da doença em dias para deslocar uma série temporal antes de fazer os cálculos.\n"
"## Desafio\n",
"\n",
"Agora é altura de brincar mais com o código e os dados! Aqui estão algumas sugestões com as quais podes experimentar:\n",
"* Ver a dispersão da pandemia em diferentes países.\n",
"* traçar gráficos de $R_t$ para vários países num único gráfico para comparação, ou fazer vários gráficos lado a lado\n",
"* Ver como o número de mortes e recuperações se correlaciona com o número de casos infetados.\n",
"* Tenta perceber quanto tempo dura tipicamente uma doença visualmente correlacionando a taxa de infeção e a taxa de mortalidade e procurando algumas anomalias. Pode ser necessário olhar para diferentes países para descobrir isso.\n",
"* Calcular a taxa de letalidade e como esta muda ao longo do tempo. Podes querer ter em conta a duração da doença em dias para deslocar uma série temporal antes de fazer os cálculos\n"
]
},
{
@ -2406,8 +2408,8 @@
"source": [
"## Referências\n",
"\n",
"Pode consultar mais estudos sobre a propagação da epidemia de COVID nas seguintes publicações:\n",
"* [Modelo SIR Deslizante para Estimativa de Rt durante a Pandemia de COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), artigo de blog por [Dmitry Soshnikov](http://soshnikov.com)\n",
"Pode consultar estudos adicionais sobre a propagação da epidemia de COVID nas seguintes publicações:\n",
"* [Modelo SIR Deslizante para Estimativa de Rt durante a Pandemia de COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), publicação no blogue por [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimativa do Número de Reprodução Dependente do Tempo para o Surto Global de COVID-19](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Código para o artigo acima no GitHub](https://github.com/shwars/SlidingSIR)\n"
]
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**:\nEste documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, tenha em atenção que traduções automáticas podem conter erros ou imprecisões. O documento original no seu idioma nativo deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se a tradução profissional efetuada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes da utilização desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Aviso Legal**:\nEste documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas resultantes da utilização desta tradução.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,6 +1,6 @@
# Projeto de visualização de dados Dangerous Liaisons
Para começar, certifique-se de que tem o NPM e o Node instalados e a funcionar na sua máquina. Instale as dependências (npm install) e, em seguida, execute o projeto localmente (npm run serve):
Para começar, precisa de garantir que tem o NPM e Node **>=20.0.0** a funcionar na sua máquina. Instale as dependências (npm install) e depois execute o projeto localmente (npm run serve):
## Configuração do projeto
```
@ -12,7 +12,7 @@ npm install
npm run serve
```
### Compila e minimiza para produção
### Compila e minifica para produção
```
npm run build
```
@ -23,7 +23,11 @@ npm run lint
```
### Personalizar configuração
Consulte [Referência de Configuração](https://cli.vuejs.org/config/).
Veja [Configuration Reference](https://cli.vuejs.org/config/).
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autoritária. Para informações críticas, recomenda-se a tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes do uso desta tradução.
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas resultantes da utilização desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,6 +1,6 @@
# Projeto de visualização de dados Dangerous Liaisons
# Projeto de visualização de dados Ligações Perigosas
Para começar, certifique-se de que tem o NPM e o Node instalados e a funcionar na sua máquina. Instale as dependências (npm install) e depois execute o projeto localmente (npm run serve):
Para começar, precisa de garantir que tem o NPM e o Node **>=20.0.0** a correr na sua máquina. Instale as dependências (npm install) e depois execute o projeto localmente (npm run serve):
## Configuração do projeto
```
@ -12,7 +12,7 @@ npm install
npm run serve
```
### Compila e minimiza para produção
### Compila e minifica para produção
```
npm run build
```
@ -23,7 +23,11 @@ npm run lint
```
### Personalizar configuração
Consulte [Configuration Reference](https://cli.vuejs.org/config/).
Veja [Configuration Reference](https://cli.vuejs.org/config/).
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução por IA [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos para garantir a precisão, tenha em atenção que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autoritária. Para informações críticas, recomenda-se a tradução profissional realizada por humanos. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas decorrentes da utilização desta tradução.
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Aviso Legal**:
Este documento foi traduzido utilizando o serviço de tradução automática [Co-op Translator](https://github.com/Azure/co-op-translator). Embora nos esforcemos pela precisão, esteja ciente de que traduções automáticas podem conter erros ou imprecisões. O documento original na sua língua nativa deve ser considerado a fonte autorizada. Para informações críticas, recomenda-se tradução profissional humana. Não nos responsabilizamos por quaisquer mal-entendidos ou interpretações incorretas resultantes da utilização desta tradução.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save