From 5899c85ed3282e50f583c4d5f0f1217ba2608671 Mon Sep 17 00:00:00 2001 From: "localizeflow[bot]" Date: Fri, 17 Jul 2026 17:53:16 +0000 Subject: [PATCH] [te,ml,kn] chore(i18n): sync translations Sync translations with latest source changes. Languages: Telugu [te], Malayalam [ml], Kannada [kn] --- translations/kn/.co-op-translator.json | 4 +- .../2-Working-With-Data/07-python/README.md | 196 +++++++++--------- translations/ml/.co-op-translator.json | 4 +- .../2-Working-With-Data/07-python/README.md | 194 ++++++++--------- translations/te/.co-op-translator.json | 4 +- .../2-Working-With-Data/07-python/README.md | 192 ++++++++--------- 6 files changed, 299 insertions(+), 295 deletions(-) diff --git a/translations/kn/.co-op-translator.json b/translations/kn/.co-op-translator.json index 58869855..4e41b4e7 100644 --- a/translations/kn/.co-op-translator.json +++ b/translations/kn/.co-op-translator.json @@ -96,8 +96,8 @@ "language_code": "kn" }, "2-Working-With-Data/07-python/README.md": { - "original_hash": "7bfec050f4717dcc2dfd028aca9d21f3", - "translation_date": "2025-12-19T15:34:55+00:00", + "original_hash": "fb29e3e0be486fe8f15d50bdade79eb1", + "translation_date": "2026-07-17T17:53:06+00:00", "source_file": "2-Working-With-Data/07-python/README.md", "language_code": "kn" }, diff --git a/translations/kn/2-Working-With-Data/07-python/README.md b/translations/kn/2-Working-With-Data/07-python/README.md index 866c9cff..877bb861 100644 --- a/translations/kn/2-Working-With-Data/07-python/README.md +++ b/translations/kn/2-Working-With-Data/07-python/README.md @@ -1,62 +1,62 @@ -# ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುವುದು: ಪೈಥಾನ್ ಮತ್ತು ಪಾಂಡಾಸ್ ಲೈಬ್ರರಿ +# ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುವುದು: ಪೈಥಾನ್ ಮತ್ತು ಪಾಂಡಾಸ್ ಗ್ರಂಥಾಲಯ -| ![ [(@sketchthedocs)](https://sketchthedocs.dev) ಅವರ ಸ್ಕೆಚ್ ನೋಟ್ ](../../sketchnotes/07-WorkWithPython.png) | +| ![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/07-WorkWithPython.png) | | :-------------------------------------------------------------------------------------------------------: | -| ಪೈಥಾನ್ ಜೊತೆ ಕೆಲಸ ಮಾಡುವುದು - _[@nitya](https://twitter.com/nitya) ಅವರ ಸ್ಕೆಚ್ ನೋಟ್_ | +| ಪೈಥಾನ್ ಜೊತೆಗೆ ಕೆಲಸ - _ಸ್ಕೆಚ್ ನೋಟ್ [@nitya](https://twitter.com/nitya) ರಿಂದ_ | -[![ಪರಿಚಯ ವೀಡಿಯೋ](../../../../translated_images/kn/video-ds-python.245247dc811db8e4.webp)](https://youtu.be/dZjWOGbsN4Y) +[![Intro Video](../../../../translated_images/kn/video-ds-python.245247dc811db8e4.webp)](https://youtu.be/dZjWOGbsN4Y) -ಡೇಟಾಬೇಸ್‌ಗಳು ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಲು ಮತ್ತು ಕ್ವೇರಿ ಭಾಷೆಗಳನ್ನು ಬಳಸಿ ಅವುಗಳನ್ನು ಪ್ರಶ್ನಿಸಲು ಅತ್ಯಂತ ಪರಿಣಾಮಕಾರಿಯಾದ ಮಾರ್ಗಗಳನ್ನು ನೀಡುತ್ತವೆ, ಆದರೆ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವ ಅತ್ಯಂತ ಲವಚಿಕ ಮಾರ್ಗವೆಂದರೆ ನಿಮ್ಮದೇ ಪ್ರೋಗ್ರಾಂ ಬರೆಯುವುದು. ಬಹುಶಃ ಬಹಳ ಸಂದರ್ಭಗಳಲ್ಲಿ ಡೇಟಾಬೇಸ್ ಕ್ವೇರಿ ಮಾಡುವುದು ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿರುತ್ತದೆ. ಆದರೆ ಕೆಲವು ಸಂದರ್ಭಗಳಲ್ಲಿ ಹೆಚ್ಚು ಸಂಕೀರ್ಣ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವಿಕೆ ಅಗತ್ಯವಿದ್ದಾಗ, ಅದನ್ನು SQL ಬಳಸಿ ಸುಲಭವಾಗಿ ಮಾಡಲಾಗುವುದಿಲ್ಲ. -ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವಿಕೆ ಯಾವುದೇ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಭಾಷೆಯಲ್ಲಿ ಮಾಡಬಹುದು, ಆದರೆ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡಲು ಕೆಲವು ಭಾಷೆಗಳು ಹೆಚ್ಚಿನ ಮಟ್ಟದಲ್ಲಿವೆ. ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಕೆಳಗಿನ ಭಾಷೆಗಳಲ್ಲೊಂದು ಆಯ್ಕೆಮಾಡುತ್ತಾರೆ: +ಡೇಟಾಬೇಸ್‌ಗಳು ಡೇಟಾವನ್ನು very ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಸಂಗ್ರಹಿಸುವ ವಿಧಾನಗಳನ್ನು ಒದಗಿಸುತ್ತವೆ ಮತ್ತು ಕ್ವೇರಿ ಭಾಷೆಗಳನ್ನು ఉపయోగಿಸಿ ಅವುಗಳನ್ನು ಕೇಳಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ, ಆದರೆ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗಾಗಿ ಅತ್ಯಂತ ಸುಲಭ ವಿಧಾನವೆಂದರೆ ನಿಮ್ಮದೇ ದೃಷ್ಟಿಕೋನವನ್ನು ಬರೆಯುವುದು. ಬಹುಶಃ ಕೆಲವು ಸಂದರ್ಭಗಳಲ್ಲಿ, ಡೇಟಾಬೇಸ್ ಕ್ವೇರಿ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿರುತ್ತದೆ. ಆದರೆ ಕೆಲವು ಸಂದರ್ಭಗಳಲ್ಲಿ ಹೆಚ್ಚು ಸಂಕೀರ್ಣ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಯನ್ನು SQL ಉಪಯೋಗಿಸಿದರೆ ಸುಲಭವಲ್ಲ. +ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಯಾವುದೇ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಭಾಷೆಯಲ್ಲಿ ಬರೆಯಬಹುದು, ಆದರೆ ಕೆಲವು ಭಾಷೆಗಳು ಡೇಟಾ ಜೊತೆಗೆ ಕೆಲಸ ಮಾಡುವ ದೃಷ್ಟಿಯಿಂದ ಹೆಚ್ಚು ಮಟ್ಟದಲ್ಲಿವೆ. ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಕೆಳಗಿನ ಭಾಷೆಗಳಲ್ಲಿ ಒಂದನ್ನು ಬಯಸುತ್ತಾರೆ: -* **[Python](https://www.python.org/)**, ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಭಾಷೆ, ಸರಳತೆಯಿಂದಾಗಿ ಆರಂಭಿಕರಿಗೆ ಅತ್ಯುತ್ತಮ ಆಯ್ಕೆಯಾಗಿ ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ. ಪೈಥಾನ್‌ನಲ್ಲಿ ಅನೇಕ ಹೆಚ್ಚುವರಿ ಲೈಬ್ರರಿಗಳು ಇವೆ, ಉದಾಹರಣೆಗೆ ZIP ಆರ್ಕೈವ್‌ನಿಂದ ಡೇಟಾ ಹೊರತೆಗೆಯುವುದು ಅಥವಾ ಚಿತ್ರವನ್ನು ಗ್ರೇಸ್ಕೇಲ್‌ಗೆ ಪರಿವರ್ತಿಸುವುದು. ಡೇಟಾ ವಿಜ್ಞಾನಕ್ಕಿಂತ ಹೊರತು, ಪೈಥಾನ್ ವೆಬ್ ಅಭಿವೃದ್ಧಿಗೆ ಸಹ ಬಳಸಲಾಗುತ್ತದೆ. -* **[R](https://www.r-project.org/)** ಸಾಂಖ್ಯಿಕ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವಿಕೆಗೆ ವಿನ್ಯಾಸಗೊಳಿಸಿದ ಪರಂಪರাগত ಉಪಕರಣ. ಇದರಲ್ಲಿ ದೊಡ್ಡ ಲೈಬ್ರರಿ ಸಂಗ್ರಹ (CRAN) ಇದೆ, ಇದು ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವಿಕೆಗೆ ಉತ್ತಮ ಆಯ್ಕೆ. ಆದರೆ R ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಭಾಷೆ ಅಲ್ಲ ಮತ್ತು ಡೇಟಾ ವಿಜ್ಞಾನ ಕ್ಷೇತ್ರದ ಹೊರಗೆ ಕಡಿಮೆ ಬಳಕೆಯಾಗುತ್ತದೆ. -* **[Julia](https://julialang.org/)** ಡೇಟಾ ವಿಜ್ಞಾನಕ್ಕಾಗಿ ವಿಶೇಷವಾಗಿ ಅಭಿವೃದ್ಧಿಪಡಿಸಲಾದ ಮತ್ತೊಂದು ಭಾಷೆ. ಇದು ಪೈಥಾನ್‌ಗಿಂತ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀಡಲು ಉದ್ದೇಶಿಸಲಾಗಿದೆ, ವಿಜ್ಞಾನಾತ್ಮಕ ಪ್ರಯೋಗಗಳಿಗೆ ಅದ್ಭುತ ಸಾಧನ. +* **[Python](https://www.python.org/)**, ಒಂದು ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಭಾಷೆ, ಹಾಗಾಗಿ ಅದರ ಸರಳತೆಗೆ ಕಾರಣವಾಗಿ ಆರಂಭಿಕರಿಗೆ ಒಳ್ಳೆಯ ಆಯ್ಕೆ ಎಂದು ಪರಿಗಣಿಸಲಾಗಿದೆ. ಪೈಥಾನ್‌ನಲ್ಲಿಯ ಐತಿಹಾಸಿಕ ಗ್ರಂಥಾಲಯಗಳು ನಿಮ್ಮ ಅನೇಕ ಪ್ರಯೋಜನಕಾರಿ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತವೆ, ಉದಾಹರಣೆಗೆ ZIP ಆರ್ಕೈವ್‌ನಿಂದ ಡೇಟಾ ತೆಗೆದುಕೊಳ್ಳುವುದು ಅಥವಾ ಚಿತ್ರವನ್ನು ಗ್ರೇಸ್ಕೇಲ್ ಆಗಿ ಪರಿವರ್ತಿಸುವುದು. ಡೇಟಾ ವಿಜ್ಞಾನದ ಜೊತೆಗೆ, ಪೈಥಾನ್ ಅನ್ನು ವೆಬ್ ಅಭಿವೃದ್ಧಿಗಾಗಿ ಸಹ ಬಳಸಲಾಗುತ್ತದೆ. +* **[R](https://www.r-project.org/)** ಈ ಒಂದು ಸಾಂಖ್ಯಿಕ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೆ ಗಮನಹರಿಸಿ ಅಭಿವೃದ್ಧಿಗೊಂಡಿರುವ ಪರಂಪರೆಯ ಸಾಧನಸಂಕಲನವಾಗಿದೆ. ಇದರಲ್ಲಿ ದೊಡ್ಡ ಗ್ರಂಥಾಲಯ ಸಂಗ್ರಹ (CRAN) ಕೂಡ ಇದೆ, ಆದ್ದರಿಂದ ಇದು ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೆ ಒಳ್ಳೆಯ ಆಯ್ಕೆಯಾಗುತ್ತದೆ. ಆದರೆ, R ಒಂದು ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಭಾಷೆ ಅಲ್ಲ, ಮತ್ತು ಡೇಟಾ ವಿಜ್ಞಾನ ಕ್ಷೇತ್ರದ ಹೊರಗೆ ಬಹುಶಃ ಬಳಕೆಯಲ್ಲ. +* **[Julia](https://julialang.org/)** ಮತ್ತೊಂದು ಭಾಷೆ, ವಿಶೇಷವಾಗಿ ಡೇಟಾ ವಿಜ್ಞಾನಗಾಗಿ ಅಭಿವೃದ್ಧಿಪಡಿಸಲಾಗಿದೆ. ಇದು ಪೈಥಾನ್ ಗಿಂತ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆ ನೀಡಲು ಉದ್ದೇಶಿಸಲಾಗಿದೆ, ವಿಜ್ಞಾನಕಾರ್ಯದ ಪ್ರಯೋಗಗಳಿಗೆ ಅದ್ಭುತ ಸಾಧನವಾಗಿದೆ. -ಈ ಪಾಠದಲ್ಲಿ, ನಾವು ಸರಳ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವಿಕೆಗೆ ಪೈಥಾನ್ ಬಳಕೆಯ ಮೇಲೆ ಗಮನಹರಿಸುವೆವು. ಭಾಷೆಯ ಮೂಲಭೂತ ಪರಿಚಯವನ್ನು ನಾವು ಊಹಿಸುವೆವು. ಪೈಥಾನ್‌ನ ಗಾಢವಾದ ಪ್ರವಾಸಕ್ಕಾಗಿ, ನೀವು ಕೆಳಗಿನ ಸಂಪನ್ಮೂಲಗಳನ್ನು ನೋಡಿ: +ಈ ಪಾಠದಲ್ಲಿ, ನಾವು ಸರಳ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೆ ಪೈಥಾನ್ ಬಳಕೆಮೇಲೆ ಗಮನ ಕೊಡುತ್ತೇವೆ. ನಾವು ಭಾಷೆಯ ಮೂಲಭೂತ ಪರಿಚಯವಿದ್ದೇವೆ ಎಂದು ಊಹಿಸುವೆವು. ನೀವು ಪೈಥಾನ್ ಬಗ್ಗೆ ಹೆಚ್ಚು ವಿಸ್ತೃತ ಮಾರ್ಗದರ್ಶನ ಬಯಸಿದರೆ, ಕೆಳಗಿನ ಸಂಪನ್ಮೂಲಗಳನ್ನು ನೋಡಿ: -* [ಟರ್ಟಲ್ ಗ್ರಾಫಿಕ್ಸ್ ಮತ್ತು ಫ್ರ್ಯಾಕ್ಟಲ್ಸ್ ಜೊತೆಗೆ ಪೈಥಾನ್ ಕಲಿಯಿರಿ](https://github.com/shwars/pycourse) - GitHub ಆಧಾರಿತ ಪೈಥಾನ್ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ತ್ವರಿತ ಪರಿಚಯ ಕೋರ್ಸ್ -* [ಪೈಥಾನ್‌ನೊಂದಿಗೆ ನಿಮ್ಮ ಮೊದಲ ಹೆಜ್ಜೆಗಳು](https://docs.microsoft.com/en-us/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) - [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) ನಲ್ಲಿ ಕಲಿಕೆ ಮಾರ್ಗ +* [ಟರ್ಟಲ್ ಗ್ರಾಫಿಕ್ಸ್ ಮತ್ತು ಫ್ರಾಕ್ಟಲ್ಗಳೊಂದಿಗೆ ಪೈಥಾನ್ ಅನ್ನು ಮನರಂಜನೆಯ ಬದಲು ಕಲಿಯಿರಿ](https://github.com/shwars/pycourse) - ಗಿತ್‌ಹಬ್ ಆಧಾರಿತ ಪೈಥಾನ್ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಸಾಂಕ್ಷಿಪ್ತ ಕೋರ್ಸ್ +* [ಪೈಥಾನ್ ಮೊದಲನೆಯ ಹೆಜ್ಜೆಗಳು](https://docs.microsoft.com/en-us/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) - [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum)ನಲ್ಲಿ ಕಲಿಕಾ ಮಾರ್ಗ -ಡೇಟಾ ಅನೇಕ ರೂಪಗಳಲ್ಲಿ ಬರುತ್ತದೆ. ಈ ಪಾಠದಲ್ಲಿ, ನಾವು ಮೂರು ರೂಪಗಳ ಡೇಟಾವನ್ನು ಪರಿಗಣಿಸುವೆವು - **ಪಟ್ಟಿ ಡೇಟಾ**, **ಪಠ್ಯ** ಮತ್ತು **ಚಿತ್ರಗಳು**. +ಡೇಟಾ ಹಲವು ರೂಪಗಳಲ್ಲಿ ಬರುವುದಕ್ಕೆ ಸಾಧ್ಯ. ಈ ಪಾಠದಲ್ಲಿ, ನಾವು ಮೂರು ರೂಪಗಳ ಡೇಟಾವನ್ನು ತೆಗೆದುಕೊಳ್ಳಲಿದ್ದೇವೆ - **ಪಟ್ಟಿ ಡೇಟಾ**, **ಪಠ್ಯ** ಮತ್ತು **ಚಿತ್ರಗಳು**. -ನಾವು ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವ ಕೆಲವು ಉದಾಹರಣೆಗಳ ಮೇಲೆ ಗಮನಹರಿಸುವೆವು, ಎಲ್ಲಾ ಸಂಬಂಧಿತ ಲೈಬ್ರರಿಗಳ ಸಂಪೂರ್ಣ ಅವಲೋಕನ ನೀಡದೆ. ಇದರಿಂದ ನೀವು ಸಾಧ್ಯವಿರುವ ಮುಖ್ಯ ಕಲ್ಪನೆಯನ್ನು ಪಡೆಯಬಹುದು ಮತ್ತು ಸಮಸ್ಯೆಗಳಿಗೆ ಪರಿಹಾರಗಳನ್ನು ಹುಡುಕಲು ಎಲ್ಲಿ ನೋಡಬೇಕೆಂದು ತಿಳಿದುಕೊಳ್ಳಬಹುದು. +ನಾವು ಸಂಪೂರ್ಣ ಗ್ರಂಥಾಲಯ ವೀಕ್ಷಣೆಯ ಬದಲು ಕೆಲವು ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ ಉದಾಹರಣೆಗಳ ಮೇಲೆ ಗಮನಸೆಳೆಯುತ್ತೇವೆ. ಇದರಿಂದ ನಿಮಗೆ ಸಾಧ್ಯವಿರುವ ಪ್ರಮುಖ ಕಲ್ಪನೆ ದೊರೆಯುತ್ತದೆ ಮತ್ತು ನೀವು ಸಮಸ್ಯೆಗಳಿಗೆ ಪರಿಹಾರಗಳನ್ನು ಎಲ್ಲಿಂದ ಕಂಡುಹಿಡಿಯಬಹುದು ಎಂದು ಬಲ್ಲಿರಿ. -> **ಅತ್ಯಂತ ಉಪಯುಕ್ತ ಸಲಹೆ**. ನೀವು ಡೇಟಾ ಮೇಲೆ ನಿರ್ದಿಷ್ಟ ಕಾರ್ಯವನ್ನು ಮಾಡಲು ಬಯಸಿದಾಗ ಮತ್ತು ಅದನ್ನು ಹೇಗೆ ಮಾಡಬೇಕೆಂದು ತಿಳಿಯದಿದ್ದರೆ, ಅದನ್ನು ಇಂಟರ್ನೆಟ್‌ನಲ್ಲಿ ಹುಡುಕಿ. [Stackoverflow](https://stackoverflow.com/) ನಲ್ಲಿ ಬಹಳಷ್ಟು ಉಪಯುಕ್ತ ಪೈಥಾನ್ ಕೋಡ್ ಮಾದರಿಗಳು ಸಾಮಾನ್ಯ ಕಾರ್ಯಗಳಿಗೆ ಲಭ್ಯವಿವೆ. +> ** ಅತ್ಯಂತ ಉಪಯುಕ್ತ ಸಲಹೆ **. ನೀವು ಯಾವುದೇ ನಿರ್ದಿಷ್ಟ ಕಾರ್ಯವನ್ನು ಡೇಟಾ ಮೇಲೆ ಮಾಡಬೇಕಾದಾಗ, ಅದು ಹೇಗೆ ಮಾಡಬೇಕೆಂದು ತಿಳಿಯದಿದ್ದರೆ, ಅದನ್ನು ಇಂಟರ್ನೆಟ್‌ನಲ್ಲಿ ಹುಡುಕಿ. [Stackoverflow](https://stackoverflow.com/) ನಲ್ಲಿ ಬಹುಮಾನ್ಯವಾದ ಪೂರ್ವಕೋಡ್ ಉದಾಹರಣೆಗಳು ಪೈಥಾನ್‌ಗಾಗಿ ಸಾಕಷ್ಟು ಲಭ್ಯವಿರುತ್ತವೆ. -## [ಪೂರ್ವ-ಪಾಠ ಪ್ರಶ್ನೋತ್ತರ](https://ff-quizzes.netlify.app/en/ds/quiz/12) +## [ಪಾಠ ಹೇಗಿರುವುದನ್ನು ಭೇಟಿಮಾಡಲು ಗೆಲುವಿನ ಪ್ರಶ್ನೆಗಳು](https://ff-quizzes.netlify.app/en/ds/quiz/12) -## ಪಟ್ಟಿಯ ಡೇಟಾ ಮತ್ತು ಡೇಟಾಫ್ರೇಮ್‌ಗಳು +## ಪಟ್ಟಿಪರ ಡೇಟಾ ಮತ್ತು ಡೇಟಾಫ್ರೇಮ್‌ಗಳು -ನೀವು ಈಗಾಗಲೇ ಸಂಬಂಧಿತ ಡೇಟಾಬೇಸ್‌ಗಳ ಬಗ್ಗೆ ಮಾತನಾಡಿದಾಗ ಪಟ್ಟಿಯ ಡೇಟಾವನ್ನು ಭೇಟಿಯಾದಿದ್ದೀರಿ. ನೀವು ಬಹಳಷ್ಟು ಡೇಟಾ ಹೊಂದಿದ್ದಾಗ ಮತ್ತು ಅದು ಹಲವಾರು ವಿಭಿನ್ನ ಲಿಂಕ್ ಮಾಡಿದ ಪಟ್ಟಿಗಳಲ್ಲಿ ಇದ್ದಾಗ, ಅದನ್ನು ಕೆಲಸ ಮಾಡಲು SQL ಬಳಸುವುದು ಖಂಡಿತವಾಗಿಯೂ ಅರ್ಥಪೂರ್ಣ. ಆದರೆ, ನಾವು ಡೇಟಾ ಪಟ್ಟಿಯನ್ನು ಹೊಂದಿದ್ದಾಗ ಮತ್ತು ಆ ಡೇಟಾ ಬಗ್ಗೆ ಕೆಲವು **ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ** ಅಥವಾ **ಅಂತರ್ದೃಷ್ಟಿ**ಗಳನ್ನು ಪಡೆಯಬೇಕಾದಾಗ, ಉದಾಹರಣೆಗೆ ವಿತರಣೆ, ಮೌಲ್ಯಗಳ ನಡುವಿನ ಸಂಬಂಧ ಇತ್ಯಾದಿ, ಡೇಟಾ ವಿಜ್ಞಾನದಲ್ಲಿ ಮೂಲ ಡೇಟಾದ ಕೆಲವು ಪರಿವರ್ತನೆಗಳನ್ನು ಮಾಡಿ ನಂತರ ದೃಶ್ಯೀಕರಣ ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಈ ಎರಡೂ ಹಂತಗಳನ್ನು ಪೈಥಾನ್ ಬಳಸಿ ಸುಲಭವಾಗಿ ಮಾಡಬಹುದು. +ನೀವು ಈಗಾಗಲೇ ಸಂಬಂಧ ಡೇಟಾಬೇಸ್ ಕುರಿತು ಮಾತಾಡಿದಾಗ ಪಟ್ಟಿಪರ ಡೇಟಾ ಜೊತೆ ಪರಿಚಿತರಾಗಿದ್ದೀರಿ. ದೊಡ್ಡ ಪ್ರಮಾಣದ ಡೇಟಾ ಇದ್ದಾಗ ಮತ್ತು ಅದು ಹಲವು ಬೇರೆಯಾದ ಲಿಂಕ್‌ ಮಾಡಿದ ಪಟ್ಟಿಗಳಲ್ಲಿ ಇದ್ದಾಗ, ಅದನ್ನು ಕಾರ್ಯನಿರ್ವಹಿಸಲು SQL ಬಳಸುವುದು ಸ್ತಾಯೀ ಅನುಕೂಲ. ಆದರೆ ಹೆಚ್ಚಿನ ಸಂದರ್ಭಗಳಲ್ಲಿ, ನಾವು ಡೇಟಾ ಕುರಿತ **ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ** ಅಥವಾ **ಅನುಭವಗಳನ್ನು** ಪಡೆಯಲು ಬೇಕಾದಾಗ, ಉತ್ಪ್ರೇರಣೆ, ಮೌಲ್ಯಗಳ ಸಂಬಂಧತೆ ಮತ್ತು ಇತ್ಯಾದಿ ಬಗ್ಗೆ ವಿಚಾರಿಸುವಾಗ, Django ಡೇಟಾ ವಿಜ್ಞಾನದಲ್ಲಿ ಡೇಟಾ ಕೆಲವೊಂದು ಪರಿಕರಗಳನ್ನು ಪರಿವರ್ತಿಸುವುದು ಮತ್ತು ದೃಶ್ಯೀಕರಣವನ್ನು ಸಾಧಿಸುವುದು ಅವಶ್ಯಕ. ಆ ಇಬ್ಬರೂ ಹಂತಗಳನ್ನು ಪೈಥಾನ್ ಸಹಜವಾಗಿ ಮಾಡಬಹುದು. -ಪೈಥಾನ್‌ನಲ್ಲಿ ಪಟ್ಟಿಯ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡಲು ಎರಡು ಅತ್ಯಂತ ಉಪಯುಕ್ತ ಲೈಬ್ರರಿಗಳು ಇವೆ: -* **[Pandas](https://pandas.pydata.org/)** ನಿಮಗೆ **ಡೇಟಾಫ್ರೇಮ್‌ಗಳು** ಎಂದು ಕರೆಯಲ್ಪಡುವವುಗಳನ್ನು ನಿರ್ವಹಿಸಲು ಅನುಮತಿಸುತ್ತದೆ, ಅವು ಸಂಬಂಧಿತ ಪಟ್ಟಿಗಳ ಸಮಾನಾರ್ಥಕ. ನೀವು ಹೆಸರಿನ ಕಾಲಮ್‌ಗಳನ್ನು ಹೊಂದಬಹುದು ಮತ್ತು ಸಾಲು, ಕಾಲಮ್ ಮತ್ತು ಡೇಟಾಫ್ರೇಮ್‌ಗಳ ಮೇಲೆ ವಿವಿಧ ಕಾರ್ಯಗಳನ್ನು ಮಾಡಬಹುದು. -* **[Numpy](https://numpy.org/)** ಬಹು-ಮಾನದ **ಅರೆಗಳು** (ಟೆನ್ಸರ್‌ಗಳು) ಜೊತೆ ಕೆಲಸ ಮಾಡಲು ಲೈಬ್ರರಿ. ಅರೆಗಳು ಒಂದೇ ಮೂಲ ಪ್ರಕಾರದ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುತ್ತವೆ ಮತ್ತು ಡೇಟಾಫ್ರೇಮ್‌ಗಿಂತ ಸರಳವಾಗಿವೆ, ಆದರೆ ಹೆಚ್ಚು ಗಣಿತೀಯ ಕಾರ್ಯಗಳನ್ನು ನೀಡುತ್ತವೆ ಮತ್ತು ಕಡಿಮೆ ಓವರ್‌ಹೆಡ್ ಉಂಟುಮಾಡುತ್ತವೆ. +ಪೈಥಾನ್‌ನಲ್ಲಿರುವ ಎರಡು ಅತ್ಯಂತ ಉಪಯುಕ್ತ ಗ್ರಂಥಾಲಯಗಳು, ನೀವು ಪಟ್ಟಿಪರ ಡೇಟಾ ವಹಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತವೆ: +* **[Pandas](https://pandas.pydata.org/)** ನಿಮಗೆ **ಡೇಟಾಫ್ರೇಮ್ಸ್** ಎಂದು ಕರೆಯಲ್ಪಡುವ relational ಟೇಬಲ್ಗಳಿಗೆ ಇದ್ದಂತೆಯೇ ಇರುವ ಮಾಹಿತಿಯನ್ನು ನಡೆಸಲು ಅವಕಾಶ ನೀಡುತ್ತದೆ. ನೀವು ಕಾಲಮ್‌ಗಳಿಗೆ ಹೆಸರಿನನ್ನಿಡಬಹುದು ಮತ್ತು ಸಾಲುಗಳು, ಕಾಲಮ್‌ಗಳು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ಡೇಟಾಫ್ರೇಮ್‌ಗಳನ್ನು ಮೇಲ್ಮನವಿ ಮಾಡಬಹುದು. +* **[Numpy](https://numpy.org/)** ಬಹುಮಾರ್ಗೀಯ **array**ಗಳಾದ **ಟೆನ್ಸರ್‌ಗಳ** ಜೊತೆ ಕೆಲಸ ಮಾಡಲು ಗ್ರಂಥಾಲಯ. ಅರೆ ಸಮಾನ underlying ವಿಧದ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿದ್ದು, ಇದು ಡೇಟಾಫ್ರೇಮ್ಗಿಂತ ಸರಳ ಆದರೆ ಗಣಿತೀಯ ಕಾರ್ಯಗಳಿಗಿಂತ ಹೆಚ್ಚು ನೆರವಿನೊಂದಿಗೆ ಬರುವುದರಿಂದ ಕಡಿಮೆ ಬದ್ಧತೆಯನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ. -ಇನ್ನೂ ಕೆಲವು ಲೈಬ್ರರಿಗಳನ್ನು ನೀವು ತಿಳಿದುಕೊಳ್ಳಬೇಕು: -* **[Matplotlib](https://matplotlib.org/)** ಡೇಟಾ ದೃಶ್ಯೀಕರಣ ಮತ್ತು ಗ್ರಾಫ್ ರಚನೆಗೆ ಬಳಸುವ ಲೈಬ್ರರಿ -* **[SciPy](https://www.scipy.org/)** ಕೆಲವು ಹೆಚ್ಚುವರಿ ವೈಜ್ಞಾನಿಕ ಕಾರ್ಯಗಳ ಲೈಬ್ರರಿ. ನಾವು ಈಗಾಗಲೇ ಪ್ರಾಬಬಿಲಿಟಿ ಮತ್ತು ಸಾಂಖ್ಯಿಕತೆ ಬಗ್ಗೆ ಮಾತನಾಡಿದಾಗ ಈ ಲೈಬ್ರರಿಯನ್ನು ನೋಡಿದ್ದೇವೆ +ಇನ್ನೂ ಕೆಲವು ಗ್ರಂಥಾಲಯಗಳ ಪರಿಚಯ ಬೇಕಾಗಬಹುದು: +* **[Matplotlib](https://matplotlib.org/)** ಡೇಟಾ ದೃಶ್ಯೀಕರಣ ಮತ್ತು ಚಿತ್ರದ ಚಾರ್ಟ್ ಗಳಿಗಾಗಿ ಉಪಯೋಗಿಸುವ ಗ್ರಂಥಾಲಯ +* **[SciPy](https://www.scipy.org/)** ಹೆಚ್ಚುವರಿ ವೈಜ್ಞಾನಿಕ ಕಾರ್ಯಗಳನ್ನು ಹೊಂದಿರುವ ಗ್ರಂಥಾಲಯ. ನಾವು ಈಗಾಗಲೇ ಸಂಭಾವ್ಯತೆ ಮತ್ತು ಸಂಖ್ಯಾಶಾಸ್ತ್ರದ ಬಗ್ಗೆ ಮಾತನಾಡಲು ಈ ಗ್ರಂಥಾಲಯವನ್ನು ಸ್ಪರ್ಶಿಸಿದ್ದೇವೆ -ನೀವು ಸಾಮಾನ್ಯವಾಗಿ ನಿಮ್ಮ ಪೈಥಾನ್ ಪ್ರೋಗ್ರಾಂ ಆರಂಭದಲ್ಲಿ ಈ ಲೈಬ್ರರಿಗಳನ್ನು ಆಮದು ಮಾಡಲು ಬಳಸುವ ಕೋಡ್ ಇಲ್ಲಿದೆ: +ಕೆಳಗಿನ ಕೋಡ್ ಉದಾಹರಣೆಗಳನ್ನು ಆರಂಭದಲ್ಲಿ ನಿಮ್ಮ ಪೈಥಾನ್ ಪ್ರೋಗ್ರಾಂನಲ್ಲಿ ಈ ಗ್ರಂಥಾಲಯಗಳನ್ನು ಆಮದು ಮಾಡಿಕೊಳ್ಳಲು ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸುತ್ತಾರೆ: ```python import numpy as np import pandas as pd import matplotlib.pyplot as plt -from scipy import ... # ನೀವು ಬೇಕಾದ ನಿಖರ ಉಪ-ಪ್ಯಾಕೇಜ್‌ಗಳನ್ನು ಸೂಚಿಸಬೇಕಾಗುತ್ತದೆ +from scipy import ... # ನಿಮಗೆ ಬೇಕಾಗಿರುವ ನಿಖರ ಉಪ-ಪ್ಯಾಕೇಜ್‌ಗಳನ್ನು ನೀವು ಸೂಚಿಸಬೇಕು ``` -ಪಾಂಡಾಸ್ ಕೆಲವು ಮೂಲಭೂತ ಕಲ್ಪನೆಗಳ ಸುತ್ತಲೂ ಕೇಂದ್ರೀಕೃತವಾಗಿದೆ. +ಪಾಂಡಾಸ್ ಕೆಲವು ಮೂಲಭೂತ ಕಲ್ಪನೆಗಳ ಸುತ್ತ ಕೇಂದ್ರೀಕರಿಸಲಾಗಿದೆ. ### ಸರಣಿ (Series) -**ಸರಣಿ** ಮೌಲ್ಯಗಳ ಕ್ರಮವಾಗಿದೆ, ಪಟ್ಟಿ ಅಥವಾ ನಂಪೈ ಅರೆಗೆ ಸಮಾನ. ಮುಖ್ಯ ವ್ಯತ್ಯಾಸವೆಂದರೆ ಸರಣಿಗೆ **ಸೂಚ್ಯಂಕ** (index) ಇರುತ್ತದೆ, ಮತ್ತು ನಾವು ಸರಣಿಗಳ ಮೇಲೆ ಕಾರ್ಯಾಚರಣೆ ಮಾಡಿದಾಗ (ಉದಾ., ಸೇರಿಸುವಾಗ), ಸೂಚ್ಯಂಕವನ್ನು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ. ಸೂಚ್ಯಂಕ ಸರಳವಾಗಿ ಪೂರ್ಣಾಂಕ ಸಾಲು ಸಂಖ್ಯೆ ಆಗಿರಬಹುದು (ಪಟ್ಟಿ ಅಥವಾ ಅರೆದಿಂದ ಸರಣಿ ರಚಿಸುವಾಗ ಡೀಫಾಲ್ಟ್ ಸೂಚ್ಯಂಕ), ಅಥವಾ ಅದು ದಿನಾಂಕ ಅವಧಿಯಂತಹ ಸಂಕೀರ್ಣ ರಚನೆಯಾಗಿರಬಹುದು. +**ಸರಣಿ (Series)** ಮೌಲ್ಯಗಳ ಕ್ರಮವಾಗಿದೆ, ಇದು ಪಟ್ಟಿ ಅಥವಾ ನಂಪಿ ಅರೆಗಳಿಗೆ ಹೋಲಿಕೆಯಾಗಿದೆ. ಮುಖ್ಯ ಭೇದವೇನೆಂದರೆ, ಸರಣಿಗೆ **ಸೂಚ್ಯಂಕ (index)** ಕೂಡ ಇರುತ್ತದೆ, ಮತ್ತು ನಾವು ಸರಣಿಯಿಂದ ಕಾರ್ಯಗಳನ್ನು ( ಉದಾ. ಸೇರಿಸುವುದು) ಮಾಡಿದಾಗ, ಸೂಚ್ಯಂಕವನ್ನು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ. ಸೂಚ್ಯಂಕ ಸರಳ ಇಂಟೆજર‍ಂತಹ ಸಾಲು ಸಂಖ್ಯೆಯಾಗಿರಬಹುದು (ಪಟ್ಟಿ ಅಥವಾ ಅರೆಗಳಿಂದ ಸರಣಿ ಸೃಷ್ಟಿಸುವಾಗ ಪೂರ್ವನಿಯತವಾಗಿ ಬಳಸಲಾಗುವ ಸೂಚ್ಯಂಕ) ಅಥವಾ ದಿನಾಂಕ ಅಂತರಾವಧಿಯಂತಹ ಗಣಕೀಯ ರೀತಿಯಲ್ಲಿರಬಹುದು. -> **ಗಮನಿಸಿ**: ಜೊತೆಗೆ ನೀಡಲಾದ ನೋಟ್ಬುಕ್ [`notebook.ipynb`](notebook.ipynb) ನಲ್ಲಿ ಕೆಲವು ಪರಿಚಯಾತ್ಮಕ ಪಾಂಡಾಸ್ ಕೋಡ್ ಇದೆ. ನಾವು ಇಲ್ಲಿ ಕೆಲವು ಉದಾಹರಣೆಗಳನ್ನು ಮಾತ್ರ ವಿವರಿಸುತ್ತೇವೆ, ಮತ್ತು ನೀವು ಸಂಪೂರ್ಣ ನೋಟ್ಬುಕ್ ಅನ್ನು ಪರಿಶೀಲಿಸಲು ಸ್ವಾಗತ. +> **ಗಮನಿಸಿ**: ಜೊತೆಯಲ್ಲಿರುವ ನೋಟ್‌ಬುಕ್‌ನಲ್ಲಿ [`notebook.ipynb`](notebook.ipynb) ನಲ್ಲಿ ಕೆಲ ಆರಂಭಿಕ ಪಾಂಡಾಸ್ ಕೋಡ್ ಇದೆ. ನಾವು ಇಲ್ಲಿ ಕೆಲವು ಉದಾಹರಣೆಗಳನ್ನು ಮಾತ್ರ ನಿರೂಪಿಸುತ್ತೇವೆ, ನೀವು ಸಂಪೂರ್ಣ ನೋಟ್‌ಬುಕ್ ನೋಡಲು ಸ್ವಾಗತ. -ಉದಾಹರಣೆಯಾಗಿ ಪರಿಗಣಿಸಿ: ನಾವು ನಮ್ಮ ಐಸ್-ಕ್ರೀಮ್ ಅಂಗಡಿಯ ಮಾರಾಟವನ್ನು ವಿಶ್ಲೇಷಿಸಲು ಬಯಸುತ್ತೇವೆ. ಕೆಲವು ಕಾಲಾವಧಿಗೆ ದಿನನಿತ್ಯ ಮಾರಾಟ ಸಂಖ್ಯೆಗಳ ಸರಣಿಯನ್ನು ರಚಿಸೋಣ: +ಒಂದು ಉದಾಹರಣೆಗೆ ಪರಿಗಣಿಸಿ: ನಮ್ಮ ಐಸ್-ಕ್ರಿಮ್ ಮಾರಾಟವನ್ನು ವಿಶ್ಲೇಷಿಸಲು ಬಯಸುತ್ತೇವೆ. ಕೆಲವು ಅವಧಿಗೆ ಮಾರಾಟದ ಸಂಖ್ಯೆಗಳ ಸರಣಿ(ಪ್ರತಿ ದಿನ ಮಾರಾಟವಾದ ಐಟಂಗಳ ಸಂಖ್ಯೆ) ಸೃಷ್ಟಿಸೋಣ: ```python start_date = "Jan 1, 2020" @@ -66,9 +66,9 @@ print(f"Length of index is {len(idx)}") items_sold = pd.Series(np.random.randint(25,50,size=len(idx)),index=idx) items_sold.plot() ``` -![ಸಮಯ ಸರಣಿ ರೇಖಾಚಿತ್ರ](../../../../translated_images/kn/timeseries-1.80de678ab1cf727e.webp) +![Time Series Plot](../../../../translated_images/kn/timeseries-1.80de678ab1cf727e.webp) -ಈಗ ಪ್ರತೀ ವಾರ ನಾವು ಸ್ನೇಹಿತರಿಗಾಗಿ ಪಾರ್ಟಿ ಆಯೋಜಿಸುತ್ತೇವೆ ಮತ್ತು ಪಾರ್ಟಿಗಾಗಿ ಹೆಚ್ಚುವರಿ 10 ಪ್ಯಾಕೆಟ್ ಐಸ್-ಕ್ರೀಮ್ ತೆಗೆದುಕೊಳ್ಳುತ್ತೇವೆ ಎಂದು ಊಹಿಸೋಣ. ಅದನ್ನು ತೋರಿಸಲು ವಾರದ ಸೂಚ್ಯಂಕದೊಂದಿಗೆ ಮತ್ತೊಂದು ಸರಣಿಯನ್ನು ರಚಿಸಬಹುದು: +ಈಗ ಪ್ರತಿನಿತ್ಯ ನಾವು ಸ್ನೇಹಿತರಿಗಾಗಿ ಒಂದು ಪಾರ್ಟಿ ಆಯೋಜಿಸುತ್ತೇವೆ ಎಂದು ಊಹಿಸೋಣ, ಮತ್ತು ಪಾರ್ಟಿಗಾಗಿ ಹೆಚ್ಚುವರಿ 10 ಐಸ್-ಕ್ರಿಮ್ ಪ್ಯಾಕೆಟ್‌ಗಳನ್ನು ತೆಗೆದುಕೊಂಡಾಗ. ನಾವು ಇನ್ನೊಂದು ಸರಣಿ ಸೃಷ್ಟಿಸಬಹುದು, ವಾರಗಳ ಮೂಲಕ ಸೂಚ್ಯಂಕ ಮಾಡಲಾಗಿದ್ದು, ಅದನ್ನು ತೋರಿಸಲು: ```python additional_items = pd.Series(10,index=pd.date_range(start_date,end_date,freq="W")) ``` @@ -77,36 +77,36 @@ additional_items = pd.Series(10,index=pd.date_range(start_date,end_date,freq="W" total_items = items_sold.add(additional_items,fill_value=0) total_items.plot() ``` -![ಸಮಯ ಸರಣಿ ರೇಖಾಚಿತ್ರ](../../../../translated_images/kn/timeseries-2.aae51d575c55181c.webp) +![Time Series Plot](../../../../translated_images/kn/timeseries-2.aae51d575c55181c.webp) -> **ಗಮನಿಸಿ** ನಾವು ಸರಳ `total_items+additional_items` ಸಿಂಟ್ಯಾಕ್ಸ್ ಬಳಸುತ್ತಿಲ್ಲ. ಅದನ್ನು ಮಾಡಿದರೆ, ಫಲಿತಾಂಶ ಸರಣಿಯಲ್ಲಿ ಬಹಳಷ್ಟು `NaN` (*ಸಂಖ್ಯೆ ಅಲ್ಲ*) ಮೌಲ್ಯಗಳು ಬರುತ್ತಿದ್ದವು. ಇದಕ್ಕೆ ಕಾರಣವೆಂದರೆ `additional_items` ಸರಣಿಯಲ್ಲಿ ಕೆಲವು ಸೂಚ್ಯಂಕ ಬಿಂದುಗಳಿಗೆ ಮೌಲ್ಯಗಳು ಇಲ್ಲದಿರುವುದು, ಮತ್ತು `NaN` ಅನ್ನು ಯಾವುದಕ್ಕೂ ಸೇರಿಸಿದರೆ `NaN` ಆಗುತ್ತದೆ. ಆದ್ದರಿಂದ ಸೇರಿಸುವಾಗ `fill_value` ಪರಿಮಾಣವನ್ನು ಸೂಚಿಸಬೇಕಾಗುತ್ತದೆ. +> **ಗಮನಿಸಿ** ಸರಳ ವ್ಯಾಕರಣ `total_items+additional_items` ಬಳಸದಿದ್ದೇವೆ. ಅದನ್ನು ಬಳಸದಿದ್ದರೆ, ಫಲಿತಾಂಶದಲ್ಲಿ ತುಂಬಾ `NaN` (`Not a Number`) ಮೌಲ್ಯಗಳು ಬರುತ್ತಿದ್ದವು. ಇದಕ್ಕೆ ಕಾರಣ, ಕೆಲವು ಸೂಚ್ಯಂಕ್ಇಗಳು `additional_items` ಸರಣಿಯಲ್ಲಿ ಇಲ್ಲದಿರುವುದು, ಮತ್ತು `NaN` ಅನ್ನು ಸೇರಿಸುವಾಗ ಫಲಿತಾಂಶವೂ `NaN` ಆಗುತ್ತದೆ. ಆದ್ದರಿಂದ ಸೇರಿಸುವಾಗ `fill_value` ಪರಾಮಿತಿ ನಿಗದಿಪಡಿಸಬೇಕಾಗುತ್ತದೆ. -ಸಮಯ ಸರಣಿಗಳೊಂದಿಗೆ, ನಾವು ವಿಭಿನ್ನ ಕಾಲಾವಧಿಗಳೊಂದಿಗೆ ಸರಣಿಯನ್ನು **ಮರುನಮೂದನೆ** ಮಾಡಬಹುದು. ಉದಾಹರಣೆಗೆ, ಮಾಸಿಕ ಸರಾಸರಿ ಮಾರಾಟ ಪ್ರಮಾಣವನ್ನು ಲೆಕ್ಕಹಾಕಲು ಕೆಳಗಿನ ಕೋಡ್ ಬಳಸಬಹುದು: +ಕಾಲ ಸರಣಿಗಳೊಂದಿಗೆ, ನಾವು ವಿವಿಧ ಕಾಲಾವಧಿ ಮೂಲಕ ಸರಣಿಯನ್ನು **ಪುನರ್ವಿನ್ಯಾಸ (resample)** ಮಾಡಬಹುದು. ಉದಾಹರಣೆಗೆ, ಮಾಸಿಕ ಸರಾಸರಿ ಮಾರಾಟವನ್ನು ಲೆಕ್ಕಿಸುವುದಾಗಿ ಊಹಿಸೋಣ. ಕೆಳಗಿನ ಕೋಡ್ ಅನ್ನು ಬಳಸಬಹುದು: ```python monthly = total_items.resample("1M").mean() ax = monthly.plot(kind='bar') ``` -![ಮಾಸಿಕ ಸಮಯ ಸರಣಿ ಸರಾಸರಿ](../../../../translated_images/kn/timeseries-3.f3147cbc8c624881.webp) +![Monthly Time Series Averages](../../../../translated_images/kn/timeseries-3.f3147cbc8c624881.webp) ### ಡೇಟಾಫ್ರೇಮ್ -ಡೇಟಾಫ್ರೇಮ್ ಅಂದರೆ ಒಂದೇ ಸೂಚ್ಯಂಕ ಹೊಂದಿರುವ ಸರಣಿಗಳ ಸಂಗ್ರಹ. ನಾವು ಹಲವಾರು ಸರಣಿಗಳನ್ನು ಡೇಟಾಫ್ರೇಮ್ ಆಗಿ ಸಂಯೋಜಿಸಬಹುದು: +ಡೇಟಾಫ್ರೇಮ್ ಅಂದರೆ ಅದೇ ಸೂಚ್ಯಂಕ ಹೊಂದಿರುವ ಸರಣಿಗಳ ಸಮೂಹವಾಗಿದೆ. ನಾವು ಕೆಲವು ಸರಣಿಗಳನ್ನು ಸೇರಿಸಿ ಡೇಟಾಫ್ರೇಮ್ ಮಾಡಬಹುದು: ```python a = pd.Series(range(1,10)) b = pd.Series(["I","like","to","play","games","and","will","not","change"],index=range(0,9)) df = pd.DataFrame([a,b]) ``` -ಇದು ಹೀಗೆ ಒಂದು ಅಡ್ಡಪಟ್ಟಿ ರಚಿಸುತ್ತದೆ: +ಇದು ಹೋರಿಜಾಂಟಲ್ ಟೇಬಲ್ ಅನ್ನು ರಚಿಸುತ್ತದೆ: | | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | | --- | --- | ---- | --- | --- | ------ | --- | ------ | ---- | ---- | | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | | 1 | I | like | to | use | Python | and | Pandas | very | much | -ನಾವು ಸರಣಿಗಳನ್ನು ಕಾಲಮ್‌ಗಳಾಗಿ ಬಳಸಬಹುದು ಮತ್ತು ಡಿಕ್ಷನರಿ ಬಳಸಿ ಕಾಲಮ್ ಹೆಸರುಗಳನ್ನು ಸೂಚಿಸಬಹುದು: +ನಾವು ಸರಣಿಗಳನ್ನು ಕಾಲಮ್‌ಗಳಾಗಿ ಉಪಯೋಗಿಸಿ, ಡಿಕ್ಷನರಿ ಬಳಸಿ ಕಾಲಮ್ ಹೆಸರನ್ನು ಸೂಚಿಸಬಹುದು: ```python df = pd.DataFrame({ 'A' : a, 'B' : b }) ``` -ಇದು ಹೀಗೆ ಒಂದು ಪಟ್ಟಿಯನ್ನು ನೀಡುತ್ತದೆ: +ಈ ರೀತಿಯ ಟೇಬಲನ್ನು ನೀಡುತ್ತದೆ: | | A | B | | --- | --- | ------ | @@ -120,39 +120,39 @@ df = pd.DataFrame({ 'A' : a, 'B' : b }) | 7 | 8 | very | | 8 | 9 | much | -**ಗಮನಿಸಿ** ನಾವು ಹಿಂದಿನ ಪಟ್ಟಿಯನ್ನು ಟ್ರಾನ್ಸ್‌ಪೋಸ್ ಮಾಡಿ ಕೂಡ ಈ ಪಟ್ಟಿಯ ವಿನ್ಯಾಸವನ್ನು ಪಡೆಯಬಹುದು, ಉದಾ. ಬರೆಯುವ ಮೂಲಕ +**ಗಮನಿಸಿ** ನಾವು ಹಿಂದಿನ ಟೇಬಲನ್ನು ಟ್ರಾನ್ಸ್‌ಪೋಸ್ ಮಾಡಿ ಈ ಟೇಬಲ್ ವಿನ್ಯಾಸವನ್ನು ಪಡೆಯಬಹುದು, ಉದಾ: ```python -df = pd.DataFrame([a,b]).T..rename(columns={ 0 : 'A', 1 : 'B' }) +df = pd.DataFrame([a,b]).T.rename(columns={ 0 : 'A', 1 : 'B' }) ``` -ಇಲ್ಲಿ `.T` ಅಂದರೆ ಡೇಟಾಫ್ರೇಮ್ ಅನ್ನು ಟ್ರಾನ್ಸ್‌ಪೋಸ್ ಮಾಡುವ ಕಾರ್ಯ, ಅಂದರೆ ಸಾಲು ಮತ್ತು ಕಾಲಮ್‌ಗಳನ್ನು ಬದಲಿಸುವುದು, ಮತ್ತು `rename` ಕಾರ್ಯ ಕಾಲಮ್‌ಗಳನ್ನು ಹಿಂದಿನ ಉದಾಹರಣೆಗೆ ಹೊಂದಿಸಲು ಮರುನಾಮಕರಣ ಮಾಡಲು ಅನುಮತಿಸುತ್ತದೆ. +ಎಲ್ಲಿ `.T` ಅಂದರೆ ಡೇಟಾಫ್ರೇಮ್ ಅನ್ನು ಟ್ರಾನ್ಸ್‌ಪೋಸ್ ಮಾಡುವ ಕಾರ್ಯ (ಸಾಲು ಹಾಗೂ ಕಾಲಮ್ ಬದಲಾಯಿಸುವುದು), ಮತ್ತು `rename` ಕಾರ್ಯ ನಮಗೆ ಕಾಲಮ್‌ಗಳನ್ನು ಹಿಂದಿನ ಉದಾಹರಣೆಗೆ ಹೆಸರಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. -ಡೇಟಾಫ್ರೇಮ್‌ಗಳ ಮೇಲೆ ನಾವು ಮಾಡಬಹುದಾದ ಕೆಲವು ಪ್ರಮುಖ ಕಾರ್ಯಗಳು: +ಕೆಳಗಿನವು ಡೇಟಾಫ್ರೇಮ್‌ಗಳ ಮೇಲೆ ನಾವು ಮಾಡಬಹುದಾದ ಮುಖ್ಯ ಕಾರ್ಯಗಳು: -**ಕಾಲಮ್ ಆಯ್ಕೆ**. ನಾವು `df['A']` ಎಂದು ಬರೆಯುವ ಮೂಲಕ ವೈಯಕ್ತಿಕ ಕಾಲಮ್‌ಗಳನ್ನು ಆಯ್ಕೆಮಾಡಬಹುದು - ಈ ಕಾರ್ಯ ಸರಣಿಯನ್ನು ನೀಡುತ್ತದೆ. ನಾವು `df[['B','A']]` ಎಂದು ಬರೆಯುವ ಮೂಲಕ ಕಾಲಮ್‌ಗಳ ಉಪಸಮೂಹವನ್ನು ಮತ್ತೊಂದು ಡೇಟಾಫ್ರೇಮ್ ಆಗಿ ಆಯ್ಕೆಮಾಡಬಹುದು - ಇದು ಮತ್ತೊಂದು ಡೇಟಾಫ್ರೇಮ್ ನೀಡುತ್ತದೆ. +**ಕಾಲಮ್ ಆಯ್ಕೆ**. `df['A']` ಎಂದು ಬರೆಯುವ ಮೂಲಕ ನಾವು ವ್ಯಕ್ತಿಗತ ಕಾಲಮ್ ಆಯ್ಕೆ ಮಾಡಬಹುದು - ಈ ಕಾರ್ಯ ಸರಣಿಯನ್ನು ನೀಡುತ್ತದೆ. ನಾವು ಇನ್ನೊಂದು ಡೇಟಾಫ್ರೇಮ್‌ಗೆ ಕೆಲವು ಕಾಲಮ್ ಉಪಸಮೂಹ ಆಯ್ಕೆ ಮಾಡಲು `df[['B','A']]` ಎಂದು ಬರೆಯಬಹುದು - ಇದು ಮತ್ತೊಂದು ಡೇಟಾಫ್ರೇಮ್ ಅನ್ನು ನೀಡುತ್ತದೆ. -**ನಿರ್ದಿಷ್ಟ ಸಾಲುಗಳನ್ನು ಶೋಧನೆ**. ಉದಾಹರಣೆಗೆ, ಕಾಲಮ್ `A` 5 ಕ್ಕಿಂತ ಹೆಚ್ಚು ಇರುವ ಸಾಲುಗಳನ್ನು ಮಾತ್ರ ಉಳಿಸಲು, ನಾವು `df[df['A']>5]` ಎಂದು ಬರೆಯಬಹುದು. +**ನಿಯಮಗಳ ಮೂಲಕ ಕೆಲವು ಸಾಲುಗಳನ್ನು ಮಾತ್ರ ಫಿಲ್ಟರ್ ಮಾಡುವುದು**. ಉದಾಹರಣೆಗೆ, `A` ಕಾಲಮ್ 5ಕ್ಕಿಂತ ಹೆಚ್ಚು ಇರುವ ಸಾಲುಗಳನ್ನು ಮಾತ್ರ ಬೀಳಿಸುವುದಾಗಿ ಒಂದು ಆಯ್ಕೆ ಮಾಡಬೇಕಾದರೆ, `df[df['A']>5]` ಎಂದು ಬರೆಯಬಹುದು. -> **ಗಮನಿಸಿ**: ಶೋಧನೆ ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಎಂದರೆ, `df['A']<5` ಎಂಬ ಅಭಿವ್ಯಕ್ತಿ ಬೂಲಿಯನ್ ಸರಣಿಯನ್ನು ನೀಡುತ್ತದೆ, ಇದು ಮೂಲ ಸರಣಿ `df['A']` ಯ ಪ್ರತಿ ಅಂಶಕ್ಕೆ `True` ಅಥವಾ `False` ಸೂಚಿಸುತ್ತದೆ. ಬೂಲಿಯನ್ ಸರಣಿಯನ್ನು ಸೂಚ್ಯಂಕವಾಗಿ ಬಳಸಿದಾಗ, ಅದು ಡೇಟಾಫ್ರೇಮ್‌ನ ಸಾಲುಗಳ ಉಪಸಮೂಹವನ್ನು ನೀಡುತ್ತದೆ. ಆದ್ದರಿಂದ, ಸಾಮಾನ್ಯ ಪೈಥಾನ್ ಬೂಲಿಯನ್ ಅಭಿವ್ಯಕ್ತಿಯನ್ನು ಬಳಸಲು ಸಾಧ್ಯವಿಲ್ಲ, ಉದಾ. `df[df['A']>5 and df['A']<7]` ತಪ್ಪು. ಬದಲಿಗೆ, ನೀವು ಬೂಲಿಯನ್ ಸರಣಿಗಳ ಮೇಲೆ ವಿಶೇಷ `&` ಕಾರ್ಯವನ್ನು ಬಳಸಬೇಕು, ಉದಾ. `df[(df['A']>5) & (df['A']<7)]` (*ಬ್ರಾಕೆಟ್‌ಗಳು ಮುಖ್ಯ*). +> **ಗಮನಿಸಿ** ಫಿಲ್ಟರಿಂಗ್ ಕೆಲಸ ಹೇಗೆ ನಡೆಯುತ್ತದೆಯೆಂದರೆ, `df['A']<5` ಎಂಬ ಅಭಿವ್ಯಕ್ತಿ ಒಂದು ಬೂಲಿಯನ್ ಸರಣಿಯನ್ನು ನೀಡುತ್ತದೆ, ಇದು ಪ್ರತಿ ಮೂಲ ಸರಣಿ `df['A']` ಮೆಲುಕು ಪಡೆದ ಅಂಶಗಳಿಗೆ `True` ಅಥವಾ `False` ಅನ್ನು ಸೂಚಿಸುತ್ತದೆ. ಬೂಲಿಯನ್ ಸರಣಿ ಸೂಚ್ಯಂಕವಾಗಿ ಉಪಯೋಗಿಸಿದಾಗ, ಅದು ಡೇಟಾಫ್ರೇಮ್‌ನ ಸಾಲುಗಳ ಉಪಸಮೂಹವನ್ನು ವಾಪಸು ನೀಡುತ್ತದೆ. ಹೀಗಾಗಿ, Arbitrary Python ಬೂಲಿಯನ್ ಅಭಿವ್ಯಕ್ತಿ ಬಳಸಲು ಸಾಧ್ಯವಿಲ್ಲ, ಉದಾ., `df[df['A']>5 and df['A']<7]` ತಪ್ಪಾಗಿದೆ. ಬದಲಾಗಿ, ಬೂಲಿಯನ್ ಸರಣಿಗಳಲ್ಲಿ ವಿಶೇಷ `&` ಕಾರ್ಯವನ್ನು ಬಳಸಿರಿ, ಉದಾ., `df[(df['A']>5) & (df['A']<7)]` (*ಮುಚ್ಚುಹೊಡೆಗಳು ಮುಖ್ಯ*). -**ಹೊಸ ಗಣನೆ ಮಾಡಬಹುದಾದ ಕಾಲಮ್‌ಗಳನ್ನು ರಚಿಸುವುದು**. ನಾವು ಸುಲಭವಾಗಿ ಹೊಸ ಕಾಲಮ್‌ಗಳನ್ನು ರಚಿಸಬಹುದು, ಉದಾ.: +**ಹೊಸ ಗಣಿಸುತ್ತಬಹುದಾದ ಕಾಲಮ್‌ಗಳನ್ನು ರಚಿಸುವುದು**. ನಾವು ನಮ್ಮ ಡೇಟಾಫ್ರೇಮ್‌ಗೆ ಹೊಸ ಗಣನೆ ಮಾಡುವ ಕಾಲಮ್‌ಗಳನ್ನು ಸೌಕರ್ಯಪೂರ್ವಕ ಅಭಿವ್ಯಕ್ತಿಯನ್ನು ಬಳಸಿಕೊಂಡು ಸೃಷ್ಟಿಸಬಹುದು: ```python df['DivA'] = df['A']-df['A'].mean() ``` -ಈ ಉದಾಹರಣೆ `A` ಯ ಸರಾಸರಿ ಮೌಲ್ಯದಿಂದ ವ್ಯತ್ಯಾಸವನ್ನು ಲೆಕ್ಕಹಾಕುತ್ತದೆ. ಇಲ್ಲಿ ನಾವು ಸರಣಿಯನ್ನು ಲೆಕ್ಕಹಾಕಿ, ಅದನ್ನು ಎಡಭಾಗಕ್ಕೆ ನಿಯೋಜಿಸುತ್ತಿದ್ದೇವೆ, ಹೊಸ ಕಾಲಮ್ ರಚಿಸುತ್ತಿದ್ದೇವೆ. ಆದ್ದರಿಂದ ಸರಣಿಗೆ ಹೊಂದಿಕೆಯಾಗದ ಕಾರ್ಯಗಳನ್ನು ಬಳಸಲು ಸಾಧ್ಯವಿಲ್ಲ, ಉದಾ. ಕೆಳಗಿನ ಕೋಡ್ ತಪ್ಪು: +ಈ ಉದಾಹರಣೆ `A` ಕಾಲಮ್‌ನ ಸರಾಸರಿ ಮೌಲ್ಯದಿಂದ ವ್ಯತ್ಯಾಸವನ್ನು ಲೆಕ್ಕಿಸುತ್ತದೆ. ಇಲ್ಲಿ ನಡೆಯುತ್ತಿರುವುದು, ನಾವು ಸರಣಿ ಲೆಕ್ಕಿಸುವೆವು, ನಂತರ ಆ ಸರಣಿಯನ್ನು ಎಡ-ಹಸ್ತಕ್ಕೆ ನಿಗದಿಮಾಡುತ್ತೇವೆ ಮತ್ತು ಇನ್ನೊಂದು ಕಾಲಮ್‌ ರಚಿಸುತ್ತೇವೆ. ಹೀಗಾಗಿ ಸರಣಿಯೊಂದಿಗೆ ಹೊಂದಿಕೊಳ್ಳದ ಕಾರ್ಯಗಳನ್ನು ಬಳಸಲು ಆಗುವುದಿಲ್ಲ, ಉದಾಹರಣೆಗಾಗಿ ಕೆಳಗಿನ ಕೋಡ್ ತಪ್ಪಾಗಿದೆ: ```python # ತಪ್ಪು ಕೋಡ್ -> df['ADescr'] = "Low" if df['A'] < 5 else "Hi" df['LenB'] = len(df['B']) # <- ತಪ್ಪು ಫಲಿತಾಂಶ ``` -ಈ ಕೊನೆಯ ಉದಾಹರಣೆ, ವ್ಯಾಕರಣಾತ್ಮಕವಾಗಿ ಸರಿಯಿದ್ದರೂ, ತಪ್ಪು ಫಲಿತಾಂಶ ನೀಡುತ್ತದೆ, ಏಕೆಂದರೆ ಇದು ಸರಣಿ `B` ಯ ಉದ್ದವನ್ನು ಎಲ್ಲಾ ಮೌಲ್ಯಗಳಿಗೆ ನಿಯೋಜಿಸುತ್ತದೆ, ಮತ್ತು ನಾವು ಬಯಸಿದಂತೆ ಪ್ರತಿ ಅಂಶದ ಉದ್ದವಲ್ಲ. +ಈ ಕೊನೆಯ ಉದಾಹರಣೆ ಕೂಡ ವ್ಯಾಕರಣಾತ್ಮಕವಾಗಿ ಸರಿಹಾಗಿದ್ದರೂ, ತಪ್ಪಾದ ಫಲಿತಾಂಶ ನೀಡುತ್ತದೆ, ಏಕೆಂದರೆ ಇದು ಕಾಲಮ್‌ನ ಎಲ್ಲಾ ಮೌಲ್ಯಗಳಿಗೆ ಸರಣಿಯ `B` ನ দৈর্ঘ್ಯವನ್ನು ಅನ್ವಯಿಸುತ್ತದೆ, ನಾವು ಹೊಂದಿಕೊಳ್ಳಬೇಕಾದಂತೆ ವೈಯಕ್ತಿಕ ಅಂಶಗಳ দৈರ್ಘ್ಯವಲ್ಲ. -ಸಂಕೀರ್ಣ ಅಭಿವ್ಯಕ್ತಿಗಳನ್ನು ಲೆಕ್ಕಹಾಕಬೇಕಾದರೆ, ನಾವು `apply` ಫಂಕ್ಷನ್ ಬಳಸಬಹುದು. ಕೊನೆಯ ಉದಾಹರಣೆಯನ್ನು ಹೀಗೆ ಬರೆಯಬಹುದು: +ಈ ರೀತಿಯ ಸಂಕೀರ್ಣ ಅಭಿವ್ಯಕ್ತಿಗಳನ್ನು ಲೆಕ್ಕಿಸಲು, ನಾವು `apply` ಫಂಕ್ಷನ್ ಉಪಯೋಗಿಸಬಹುದು. ಕೊನೆಯ ಉದಾಹರಣೆ ಹೀಗೆಯಿರಬಹುದು: ```python df['LenB'] = df['B'].apply(lambda x : len(x)) # ಅಥವಾ df['LenB'] = df['B'].apply(len) ``` -ಮೇಲಿನ ಕಾರ್ಯಾಚರಣೆಗಳ ನಂತರ, ನಾವು ಕೆಳಗಿನ ಡೇಟಾಫ್ರೇಮ್ ಪಡೆಯುತ್ತೇವೆ: +ಮೇಲೆಗೊಂಡ ಕಾರ್ಯಗಳ ನಂತರ ನಾವು ಕೆಳಗಿನ ಡೇಟಾಫ್ರೇಮ್ ಪಡೆಯುತ್ತೇವೆ: | | A | B | DivA | LenB | | --- | --- | ------ | ---- | ---- | @@ -166,22 +166,22 @@ df['LenB'] = df['B'].apply(len) | 7 | 8 | very | 3.0 | 4 | | 8 | 9 | much | 4.0 | 4 | -**ಸಂಖ್ಯೆಗಳ ಆಧಾರದ ಮೇಲೆ ಸಾಲುಗಳನ್ನು ಆಯ್ಕೆಮಾಡುವುದು** `iloc` ರಚನೆಯನ್ನು ಬಳಸಿ ಮಾಡಬಹುದು. ಉದಾಹರಣೆಗೆ, ಡೇಟಾಫ್ರೇಮ್‌ನ ಮೊದಲ 5 ಸಾಲುಗಳನ್ನು ಆಯ್ಕೆಮಾಡಲು: +**ಸಂಖ್ಯೆಗಳ ಆಧಾರದ ಮೇಲೆ ಸಾಲುಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡುವುದು** `iloc` ರಚನೆ ಉಪಯೋಗಿಸಿ ಮಾಡಬಹುದು. ಉದಾಹರಣೆಗೆ, ಮೊದಲ 5 ಸಾಲುಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಲು: ```python df.iloc[:5] ``` -**ಗುಂಪುಮಾಡುವುದು** ಸಾಮಾನ್ಯವಾಗಿ ಎಕ್ಸೆಲ್‌ನ *ಪಿವಾಟ್ ಟೇಬಲ್* ಗಳಂತೆ ಫಲಿತಾಂಶ ಪಡೆಯಲು ಬಳಸಲಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ನಾವು `LenB` ಪ್ರತಿ ಮೌಲ್ಯಕ್ಕೆ ಕಾಲಮ್ `A` ಯ ಸರಾಸರಿ ಲೆಕ್ಕಹಾಕಬೇಕಾದರೆ, ನಾವು ಡೇಟಾಫ್ರೇಮ್ ಅನ್ನು `LenB` ಮೂಲಕ ಗುಂಪುಮಾಡಿ `mean` ಅನ್ನು ಕರೆಸಬಹುದು: +**ಗ್ರೂಪಿಂಗ್** ಬಹುಶಃ ಎಕ್ಸೆಲ್‌ನ ಪಿವಾಟ್ ಟೇಬಲ್‌ಗಳಂತೆಯೇ ಫಲಿತಾಂಶ ಪಡೆಯಲು ಬಳಸಲಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಪ್ರತಿಯೊಂದು `LenB` ಸಂಖ್ಯೆಯನ್ನು ಆಧರಿಸಿ `A` ಕಾಲಮ್‌ನ ಸರಾಸರಿ ಮೌಲ್ಯ ಲೆಕ್ಕಿಸೋಣ. ನಂತರ ನಾವು ಡೇಟಾಫ್ರೇಮ್ ಅನ್ನು `LenB` ಆಧರಿಸಿ ಗುಂಪು ಮಾಡಿ `mean` ಅನ್ನು ಕರೆಬಹುದು: ```python df.groupby(by='LenB')[['A','DivA']].mean() ``` -ಗುಂಪಿನ ಅಂಶಗಳ ಸಂಖ್ಯೆ ಮತ್ತು ಸರಾಸರಿಯನ್ನು ಲೆಕ್ಕಹಾಕಬೇಕಾದರೆ, ನಾವು ಹೆಚ್ಚು ಸಂಕೀರ್ಣ `aggregate` ಫಂಕ್ಷನ್ ಬಳಸಬಹುದು: +ಮತ್ತು ನಾವು ಗುಂಪಿನ ಸರಾಸರಿ ಮತ್ತು ಗಣನೆ ಲೆಕ್ಕಿಸಬೇಕಾದರೆ, ಆಗ ನಾವು ಹೆಚ್ಚು ಸಂಕೀರ್ಣ `aggregate` ಫಂಕ್ಷನ್ ಬಳಸಬಹುದು: ```python df.groupby(by='LenB') \ .aggregate({ 'DivA' : len, 'A' : lambda x: x.mean() }) \ .rename(columns={ 'DivA' : 'Count', 'A' : 'Mean'}) ``` -ಇದು ಕೆಳಗಿನ ಪಟ್ಟಿಯನ್ನು ನೀಡುತ್ತದೆ: +ಇದೊಂದು ಕೆಳಗಿನ ಟೇಬಲನ್ನು ನೀಡುತ್ತದೆ: | LenB | Count | Mean | | ---- | ----- | -------- | @@ -192,95 +192,97 @@ df.groupby(by='LenB') \ | 6 | 2 | 6.000000 | ### ಡೇಟಾ ಪಡೆಯುವುದು -ನಾವು Python ವಸ್ತುಗಳಿಂದ Series ಮತ್ತು DataFrames ರಚಿಸುವುದು ಎಷ್ಟು ಸುಲಭವಾಗಿದೆ ಎಂದು ನೋಡಿದ್ದೇವೆ. ಆದಾಗ್ಯೂ, ಡೇಟಾ ಸಾಮಾನ್ಯವಾಗಿ ಪಠ್ಯ ಕಡತ ಅಥವಾ Excel ಟೇಬಲ್ ರೂಪದಲ್ಲಿ ಬರುತ್ತದೆ. ಭಾಗ್ಯವಶಾತ್, Pandas ನಮಗೆ ಡಿಸ್ಕ್‌ನಿಂದ ಡೇಟಾವನ್ನು ಲೋಡ್ ಮಾಡಲು ಸರಳ ವಿಧಾನವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, CSV ಫೈಲ್ ಓದುವುದು ಈ ಕೆಳಗಿನಂತೆ ಸುಲಭವಾಗಿದೆ: + + +ನಾವು Python ವಸ್ತುಗಳಿಂದ Series ಮತ್ತು DataFrames ರಚಿಸುವುದು ಎಷ್ಟು ಸುಲಭ ಎಂಬುದನ್ನು ನೋಡಿದ್ದೇವೆ. ಆದಾಗ್ಯೂ, ಡೇಟಾ ಸಾಮಾನ್ಯವಾಗಿ ಪಠ್ಯ ಕಡತ ಅಥವಾ Excel ಟೇಬಲ್ ರೂಪದಲ್ಲಿ ಬರುತ್ತದೆ. ಅದೃಷ್ಟವಶಾತ್, Pandas ನಮಗೆ ಡಿಸ್ಕ್‌ನಿಂದ ಡೇಟಾವನ್ನು ಲೋಡ್ ಮಾಡುವ ಸರಳ ವಿಧಾನವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, CSV ಕಡತವನ್ನು ಓದುವಿಕೆ ಇದು ಸುಲಭವಾಗಿದೆ: ```python df = pd.read_csv('file.csv') ``` -ನಾವು "ಚಾಲೆಂಜ್" ವಿಭಾಗದಲ್ಲಿ ಹೊರಗಿನ ವೆಬ್‌ಸೈಟ್‌ಗಳಿಂದ ಡೇಟಾವನ್ನು ಪಡೆಯುವುದೂ ಸೇರಿದಂತೆ ಡೇಟಾ ಲೋಡ್ ಮಾಡುವ ಇನ್ನಷ್ಟು ಉದಾಹರಣೆಗಳನ್ನು ನೋಡುತ್ತೇವೆ + ನಾವು ಡೇಟಾ ಲೋಡ್ ಮಾಡುವ ಮತ್ತಷ್ಟು ಉದಾಹರಣೆಗಳನ್ನು, ಹೊರಗಿನ ವೆಬ್‌ಸೈಟ್ಗಳಿಂದ ಸ್ವೀಕರಿಸುವುದನ್ನು ಸೇರಿಸಲಾಗಿದೆ ಎಂದು "ಚಾಲೆಂಜ್" ವಿಭಾಗದಲ್ಲಿ ನೋಡಬಹುದು -### ಮುದ್ರಣ ಮತ್ತು ಚಿತ್ರಣ +### ಮುದ್ರಣ ಮತ್ತು ಪ್ಲಾಟಿಂಗ್ -ಡೇಟಾ ವಿಜ್ಞಾನಿ ಸಾಮಾನ್ಯವಾಗಿ ಡೇಟಾವನ್ನು ಅನ್ವೇಷಿಸಬೇಕಾಗುತ್ತದೆ, ಆದ್ದರಿಂದ ಅದನ್ನು ದೃಶ್ಯೀಕರಿಸಲು ಸಾಧ್ಯವಾಗುವುದು ಮುಖ್ಯ. DataFrame ದೊಡ್ಡದಾಗಿದ್ದಾಗ, ನಾವು ಬಹುಶಃ ಮೊದಲ ಕೆಲವು ಸಾಲುಗಳನ್ನು ಮುದ್ರಣ ಮಾಡುವ ಮೂಲಕ ನಾವು ಎಲ್ಲವನ್ನೂ ಸರಿಯಾಗಿ ಮಾಡುತ್ತಿದ್ದೇವೆ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಬಯಸುತ್ತೇವೆ. ಇದನ್ನು `df.head()` ಅನ್ನು ಕರೆಸುವುದರಿಂದ ಮಾಡಬಹುದು. ನೀವು Jupyter Notebook ನಿಂದ ಇದನ್ನು ಚಾಲನೆ ಮಾಡುತ್ತಿದ್ದರೆ, ಅದು DataFrame ಅನ್ನು ಸುಂದರವಾದ ಟೇಬುಲರ್ ರೂಪದಲ್ಲಿ ಮುದ್ರಣ ಮಾಡುತ್ತದೆ. +ಡೇಟಾ ಸಯನ್ಟಿಸ್ಟ್‌ಗೆ ಡೇಟಾವನ್ನು ಅನ್ವೇಷಣೆಯ ಮಾಡಬೇಕಾಗುತ್ತದೆ, ಆದ್ದರಿಂದ ಅದನ್ನು ದೃಶ್ಯೀಕರಿಸುವುದು ಬಹಳ ಮುಖ್ಯ. DataFrame ದೊಡ್ಡದಾಗಿರുമ്പോൾ, ನಾವು ಬಹುಶಃ ಮೊದಲ ಕೆಲವು ಸಾಲುಗಳನ್ನು ಮುದ್ರಣ ಎನ್ನುತ್ತೇವೆ ಇದು ನಾವು ಸರಿ ಮಾಡುತ್ತಿದ್ದೇವೆ ಎಂಬುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಉಪಯುಕ್ತ. ಇದನ್ನು `df.head()` ಅನ್ನು ಕರೆದು ಮಾಡಬಹುದು. ನೀವು ಇದನ್ನು Jupyter Notebook ರಿಂದ ಚಲಾಯಿಸಿದರೆ, ಇದು DataFrame ಅನ್ನು ಉತ್ತಮವಾದ ಟೇಬಲರ್ ರೂಪದಲ್ಲಿ ಮುದ್ರಣ ಮಾಡುತ್ತದೆ. -ನಾವು ಕೆಲವು ಕಾಲಮ್‌ಗಳನ್ನು ದೃಶ್ಯೀಕರಿಸಲು `plot` ಫಂಕ್ಷನ್ ಬಳಕೆಯನ್ನೂ ನೋಡಿದ್ದೇವೆ. `plot` ಬಹು ಕಾರ್ಯಗಳಿಗೆ ಬಹಳ ಉಪಯುಕ್ತವಾಗಿದ್ದು, `kind=` ಪರಿಮಾಣದ ಮೂಲಕ ವಿವಿಧ ಗ್ರಾಫ್ ಪ್ರಕಾರಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ, ನೀವು ಯಾವಾಗಲೂ ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾದುದನ್ನು ಚಿತ್ರಿಸಲು ಕಚ್ಚಾ `matplotlib` ಗ್ರಂಥಾಲಯವನ್ನು ಬಳಸಬಹುದು. ನಾವು ಡೇಟಾ ದೃಶ್ಯೀಕರಣವನ್ನು ವಿಭಿನ್ನ ಪಾಠಗಳಲ್ಲಿ ವಿವರವಾಗಿ ಚರ್ಚಿಸುವೆವು. +ಕೆಲವು ಕಾಲ, ಕೆಲವು ಅಂಶಗಳನ್ನು ದೃಶ್ಯೀಕರಿಸುವುದಕ್ಕೆ `plot` ಫಂಕ್ಷನ್ ಅನ್ನು ಬಳಕೆ ಮಾಡಿದ್ದೇವೆ. `plot` ಬಹು ಕಾರ್ಯಗಳಿಗೆ ತುಂಬ ಉಪಯುಕ್ತವಾಗಿದ್ದು, ವಿವಿಧ ಗ್ರಾಫ್ ಪ್ರಕಾರಗಳನ್ನು `kind=` ಪರಿಮಿತಿಯಿಂದ ಬೆಂಬಲಿಸುತ್ತದೆ, ಆದರೆ ನೀವು ಯಾವಾಗಲೂ ಗಂಭೀರವಾದದ್ದನ್ನು ಪ್ಲಾಟ್ ಮಾಡಲು ಮೂಲ `matplotlib` ಲೈಬ್ರರಿಯನ್ನು ಬಳಸಬಹುದು. ಡೇಟಾ ದೃಶ್ಯೀಕರಣವನ್ನು ವಿಭಿನ್ನ ಪಾಠಗಳಲ್ಲಿ ವಿವರವಾಗಿ ಚರ್ಚಿಸೋಣ. -ಈ ಅವಲೋಕನವು Pandas ನ ಪ್ರಮುಖ ತತ್ವಗಳನ್ನು ಒಳಗೊಂಡಿದೆ, ಆದರೂ ಗ್ರಂಥಾಲಯವು ಬಹಳ ಶ್ರೀಮಂತವಾಗಿದೆ ಮತ್ತು ನೀವು ಅದರಿಂದ ಏನು ಮಾಡಬಹುದು ಎಂಬುದಕ್ಕೆ ಯಾವುದೇ ಮಿತಿ ಇಲ್ಲ! ಈಗ ಈ ಜ್ಞಾನವನ್ನು ನಿರ್ದಿಷ್ಟ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸಲು ಅನ್ವಯಿಸೋಣ. +ಈ ಅವಲೋಕನವು Pandas ನ ಅತಿ ಪ್ರಮುಖ ತತ್ವಗಳು ಸೇರಿದೆ, ಆದರೂ ಈ ಲೈಬ್ರರಿ ಬಹಳ ಸಮೃದ್ಧವಾಗಿದೆ, ನೀವು ಇದರಿಂದ ಏನು ಮಾಡಬಹುದು ಎಂಬುದಕ್ಕೆ ಯಾವುದೇ ಮಿತಿ ಇಲ್ಲ! ಈಗ ನಾವು ಈ ಜ್ನಾನವನ್ನು ವಿಶೇಷ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುವದಕ್ಕೆ ಅನ್ವಯಿಸೋಣ. -## 🚀 ಚಾಲೆಂಜ್ 1: COVID ಹರಡುವಿಕೆಯನ್ನು ವಿಶ್ಲೇಷಣೆ +## 🚀 ಚಾಲೆಂಜ್ 1: COVID ಹರಡುವಿಕೆಯನ್ನು ವಿಶ್ಲೇಷಣೆ ಮಾಡುವುದು -ನಾವು ಗಮನಹರಿಸುವ ಮೊದಲ ಸಮಸ್ಯೆ COVID-19 ಮಹಾಮಾರಿಯ ಹರಡುವಿಕೆಯ ಮಾದರಿಯನ್ನು ಮಾಡುವುದು. ಅದಕ್ಕಾಗಿ, ನಾವು ವಿವಿಧ ದೇಶಗಳಲ್ಲಿ ಸೋಂಕಿತರ ಸಂಖ್ಯೆಯ ಡೇಟಾವನ್ನು ಬಳಸುತ್ತೇವೆ, ಇದು [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ನಲ್ಲಿ [Johns Hopkins University](https://jhu.edu/) ಒದಗಿಸಿದೆ. ಡೇಟಾಸೆಟ್ [ಈ GitHub ರೆಪೊಸಿಟರಿಯಲ್ಲಿ](https://github.com/CSSEGISandData/COVID-19) ಲಭ್ಯವಿದೆ. +ನಾವು ಮೊದಲಿಗೆ ಗಮನಹರಿಸುವ ಸಮಸ್ಯೆಯು COVID-19 ಸಾಂಕ್ರಾಮಿಕ ಹರಡುವಿಕೆಯನ್ನು ಮಾದರಿಮಾಡುವುದು. ಅದಕ್ಕಾಗಿ ಬೇರೆ ಬೇರೆ ದೇಶಗಳಲ್ಲಿ ಸೋಂಕಿತರ ಸಂಖ್ಯೆಯ ಮೇಲೆ ಡೇಟಾ ಬಳಸೋಣ, ಇದು [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) [Johns Hopkins University](https://jhu.edu/) ನಲ್ಲಿ ಲಭ್ಯವಿದೆ. ಈ ಡೇಟಾಸೆಟ್ [ಈ GitHub Repository](https://github.com/CSSEGISandData/COVID-19) ನಲ್ಲಿ ಲಭ್ಯವಿದೆ. -ನಾವು ಡೇಟಾ ಹೇಗೆ ನಿರ್ವಹಿಸಬೇಕೆಂದು ತೋರಿಸಲು ಬಯಸುವ ಕಾರಣದಿಂದ, ನೀವು [`notebook-covidspread.ipynb`](notebook-covidspread.ipynb) ಅನ್ನು ತೆರೆಯಿರಿ ಮತ್ತು ಮೇಲಿನಿಂದ ಕೆಳಗೆ ಓದಿ. ನೀವು ಸೆಲ್‌ಗಳನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸಬಹುದು ಮತ್ತು ನಾವು ಕೊನೆಯಲ್ಲಿ ನಿಮಗಾಗಿ ಬಿಟ್ಟಿರುವ ಕೆಲವು ಚಾಲೆಂಜ್‌ಗಳನ್ನು ಮಾಡಬಹುದು. +ನಾವು ಡೇಟಾವನ್ನು ಹೇಗೆ ನಿಭಾಯಿಸುವುದು ಎಂಬುದನ್ನು ತೋರಿಸಲು, ನೀವು [`notebook-covidspread.ipynb`](notebook-covidspread.ipynb) ಅನ್ನು ತೆರೆಯಿರಿ ಮತ್ತು ಕೆಳದಿಂದ ಮೇಲಕ್ಕೆ ಓದಿ. ನೀವು ಸೆಲ್‌ಗಳನ್ನು ಕೂಡ ನಿರ್ವಹಿಸಬಹುದು ಮತ್ತು ನಾವು ನಿಮ್ಮಿಗಾಗಿ ಕೊನೇಗೆ ಬಿಟ್ಟುಹೋದ ಕೆಲವು ಚಾಲೆಂಜ್‌ಗಳನ್ನೂ ಮಾಡಿ. ![COVID Spread](../../../../translated_images/kn/covidspread.f3d131c4f1d260ab.webp) -> ನೀವು Jupyter Notebook ನಲ್ಲಿ ಕೋಡ್ ಅನ್ನು ಹೇಗೆ ಚಾಲನೆ ಮಾಡುವುದು ಎಂದು ತಿಳಿಯದಿದ್ದರೆ, [ಈ ಲೇಖನವನ್ನು](https://soshnikov.com/education/how-to-execute-notebooks-from-github/) ನೋಡಿ. +> ನೀವು Jupyter Notebook ನಲ್ಲಿ ಕೋಡ್ ಹೇಗೆ ಚಲಾಯಿಸಬೇಕೆಂದು ತಿಳಿಯದಿದ್ದಲ್ಲಿ, [ಈ ಲೇಖನ](https://soshnikov.com/education/how-to-execute-notebooks-from-github/) ನೋಡಿ. -## ಅಸಂರಚಿತ ಡೇಟಾ ಜೊತೆಗೆ ಕೆಲಸ +## ಅಸಂರಚಿತ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುವುದು -ಡೇಟಾ ಬಹುಶಃ ಟೇಬುಲರ್ ರೂಪದಲ್ಲಿ ಬರುತ್ತದೆ, ಆದರೆ ಕೆಲವು ಸಂದರ್ಭಗಳಲ್ಲಿ ನಾವು ಕಡಿಮೆ ಸಂರಚಿತ ಡೇಟಾ, ಉದಾಹರಣೆಗೆ ಪಠ್ಯ ಅಥವಾ ಚಿತ್ರಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಈ ಸಂದರ್ಭದಲ್ಲಿ, ಮೇಲಿನ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ ತಂತ್ರಗಳನ್ನು ಅನ್ವಯಿಸಲು, ನಾವು somehow **ಸಂರಚಿತ** ಡೇಟಾವನ್ನು **ಎಕ್ಸ್ಟ್ರ್ಯಾಕ್ಟ್** ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಕೆಲವು ಉದಾಹರಣೆಗಳು: +ಡೇಟಾ ಬಹುತೆಕವು ಟೇಬಲರ್ ರೂಪದಲ್ಲಿ ಬರುತ್ತದೆ, ಆದರೆ ಕೆಲವೊಮ್ಮೆ ಕಡಿಮೆ ಸಾಂಕೇತಿಕವಾದ ಡೇಟಾವನ್ನು, ಉದಾಹರಣೆಗೆ ಪಠ್ಯ ಅಥವಾ ಚಿತ್ರಗಳನ್ನು ನಿಭಾಯಿಸಬೇಕಾಗಬಹುದು. ಈ ಸಂದರ್ಭದಲ್ಲಿ, ಮೇಲ್ನೋಟದಲ್ಲಿ ಕಂಡುಬಂದ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ ತಂತ್ರಗಳನ್ನು ಅನ್ವಯಿಸಲು ನಮಗೆ somehow **ಸಂರಚಿತ** ಡೇಟಾವನ್ನು **ತೆಗೆಯಬೇಕಾಗುತ್ತದೆ**. ಇಲ್ಲಿವೆ ಕೆಲವು ಉದಾಹರಣೆಗಳು: -* ಪಠ್ಯದಿಂದ ಕೀವರ್ಡ್‌ಗಳನ್ನು ಎಕ್ಸ್ಟ್ರ್ಯಾಕ್ಟ್ ಮಾಡಿ, ಆ ಕೀವರ್ಡ್‌ಗಳು ಎಷ್ಟು ಬಾರಿ ಕಾಣಿಸುತ್ತವೆ ಎಂದು ನೋಡುವುದು -* ಚಿತ್ರದಲ್ಲಿ ವಸ್ತುಗಳ ಬಗ್ಗೆ ಮಾಹಿತಿ ಪಡೆಯಲು ನ್ಯೂರಲ್ ನೆಟ್‌ವರ್ಕ್‌ಗಳನ್ನು ಬಳಸುವುದು -* ವೀಡಿಯೋ ಕ್ಯಾಮೆರಾ ಫೀಡ್‌ನಲ್ಲಿ ಜನರ ಭಾವನೆಗಳ ಬಗ್ಗೆ ಮಾಹಿತಿ ಪಡೆಯುವುದು +* ಪಠ್ಯದಿಂದ ಪ್ರಮುಖ ಪದಗಳನ್ನು ತೆಗೆದು, ಆ ಪದಗಳು ಎಷ್ಟು ಬಾರಿ ಬರುತ್ತವೆ ಎಂಬುದನ್ನು ಗಮನಿಸುವುದು +* ಚಿತ್ರದಲ್ಲಿ ವಸ್ತುಗಳ ಕುರಿತ ಮಾಹಿತಿ ಪಡೆಯಲು ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್‌ಗಳನ್ನು ಬಳಸುವುದು +* ವಿಡಿಯೋ ಕ್ಯಾಮೆರಾ ಫೀಡಿನಲ್ಲಿನ ಜನರ ಭಾವನೆಗಳ ಕುರಿತು ಮಾಹಿತಿ ಪಡೆಯುವುದು -## 🚀 ಚಾಲೆಂಜ್ 2: COVID ಪೇಪರ್‌ಗಳನ್ನು ವಿಶ್ಲೇಷಣೆ +## 🚀 ಚಾಲೆಂಜ್ 2: COVID ಲೇಖನಗಳನ್ನು ವಿಶ್ಲೇಷಣೆ ಮಾಡುವುದು -ಈ ಚಾಲೆಂಜ್‌ನಲ್ಲಿ, ನಾವು COVID ಮಹಾಮಾರಿಯ ವಿಷಯವನ್ನು ಮುಂದುವರೆಸುತ್ತೇವೆ ಮತ್ತು ವೈಜ್ಞಾನಿಕ ಪೇಪರ್‌ಗಳ ಪ್ರಕ್ರಿಯೆಗೆ ಗಮನಹರಿಸುತ್ತೇವೆ. COVID ಕುರಿತು 7000 ಕ್ಕೂ ಹೆಚ್ಚು (ಲೇಖನ ಸಮಯದಲ್ಲಿ) ಪೇಪರ್‌ಗಳೊಂದಿಗೆ [CORD-19 ಡೇಟಾಸೆಟ್](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) ಲಭ್ಯವಿದೆ, ಇದು ಮೆಟಾಡೇಟಾ ಮತ್ತು ಸಾರಾಂಶಗಳೊಂದಿಗೆ ಲಭ್ಯವಿದೆ (ಅರ್ಧಕ್ಕೂ ಹೆಚ್ಚು ಪೇಪರ್‌ಗಳಿಗೆ ಸಂಪೂರ್ಣ ಪಠ್ಯವೂ ಒದಗಿಸಲಾಗಿದೆ). +ಈ ಚಾಲೆಂಜ್‌ನಲ್ಲಿ, ನಾವು COVID ಮಹಾಮಾರಿ ವಿಷಯವನ್ನು ಮುಂದುವರೆಸುತ್ತೇವೆ, ಮತ್ತು ವೈಜ್ಞಾನಿಕ ಲೇಖನಗಳನ್ನು ಪ್ರಕ್ರಿಯೆ ಮಾಡಲಿದ್ದೇವೆ. [CORD-19 Dataset](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) ಇತ್ತೀಚೆಗೆ ಬರೆಯುತ್ತಿರುವ ಸಮಯದಲ್ಲಿ 7000ಕ್ಕೂ ಹೆಚ್ಚು COVID ಕುರಿತ ಲೇಖನಗಳನ್ನು, ಮೆಟಾಡೇಟಾ ಮತ್ತು ಸಾರಾಂಶಗಳೊಂದಿಗೆ (ಅರೆಯ ಬಹಳ ಭಾಗಕ್ಕೆ ಪೂರ್ಣ ಪಠ್ಯವೂ ಲಭ್ಯ) ಒದಗಿಸಿದೆ. -[Text Analytics for Health](https://docs.microsoft.com/azure/cognitive-services/text-analytics/how-tos/text-analytics-for-health/?WT.mc_id=academic-77958-bethanycheum) ಕಾಗ್ನಿಟಿವ್ ಸೇವೆಯನ್ನು ಬಳಸಿಕೊಂಡು ಈ ಡೇಟಾಸೆಟ್ ಅನ್ನು ವಿಶ್ಲೇಷಿಸುವ ಪೂರ್ಣ ಉದಾಹರಣೆ [ಈ ಬ್ಲಾಗ್ ಪೋಸ್ಟ್‌ನಲ್ಲಿ](https://soshnikov.com/science/analyzing-medical-papers-with-azure-and-text-analytics-for-health/) ವಿವರಿಸಲಾಗಿದೆ. ನಾವು ಈ ವಿಶ್ಲೇಷಣೆಯ ಸರಳೀಕೃತ ಆವೃತ್ತಿಯನ್ನು ಚರ್ಚಿಸುವೆವು. +[Text Analytics for Health](https://docs.microsoft.com/azure/cognitive-services/text-analytics/how-tos/text-analytics-for-health/?WT.mc_id=academic-77958-bethanycheum) ಕುಶಲ ಸೇವೆಯನ್ನು ಬಳಸಿಕೊಂಡು ಈ ಡೇಟಾಸೆಟ್‌ನ್ನು ವಿಶ್ಲೇಷಿಸುವ ಪೂರ್ಣ ಉದಾಹರಣೆ ಇದರಲ್ಲಿ [ಬ್ಲಾಗ್ ಪೋಸ್ಟ್‌ನಲ್ಲಿ](https://soshnikov.com/science/analyzing-medical-papers-with-azure-and-text-analytics-for-health/) ವಿವರಿಸಲಾಗಿದೆ. ನಾವು ಸುಧಾರಿತ ಆವೃತ್ತಿಯನ್ನು ಚರ್ಚಿಸುವೆವು. -> **NOTE**: ನಾವು ಈ ರೆಪೊಸಿಟರಿಯ ಭಾಗವಾಗಿ ಡೇಟಾಸೆಟ್ ನ ನಕಲನ್ನು ಒದಗಿಸುವುದಿಲ್ಲ. ನೀವು ಮೊದಲು [`metadata.csv`](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) ಫೈಲ್ ಅನ್ನು [ಈ Kaggle ಡೇಟಾಸೆಟ್‌ನಿಂದ](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) ಡೌನ್‌ಲೋಡ್ ಮಾಡಬೇಕಾಗಬಹುದು. Kaggle ನಲ್ಲಿ ನೋಂದಣಿ ಅಗತ್ಯವಿರಬಹುದು. ನೀವು ನೋಂದಣಿ ಇಲ್ಲದೆ [ಇಲ್ಲಿ](https://ai2-semanticscholar-cord-19.s3-us-west-2.amazonaws.com/historical_releases.html) ಡೇಟಾಸೆಟ್ ಅನ್ನು ಡೌನ್‌ಲೋಡ್ ಮಾಡಬಹುದು, ಆದರೆ ಅದು ಮೆಟಾಡೇಟಾ ಫೈಲ್ ಜೊತೆಗೆ ಎಲ್ಲಾ ಸಂಪೂರ್ಣ ಪಠ್ಯಗಳನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ. +> **ನ್ಯೋಟ್**: ಈ ರೆಪೊಸಿಟರಿಯ ಭಾಗವಾಗಿ ಡೇಟಾಸೆಟ್ ನ ಪ್ರತಿಯನ್ನು ನಾವು ಒದಗಿಸುವುದಿಲ್ಲ. ನೀವು ಮೊದಲು [Kaggle](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) ನಿಂದ [`metadata.csv`](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) ಕಡತವನ್ನು ಡೌನ್‌ಲೋಡ್ ಮಾಡಬೇಕು. Kaggle ನಲ್ಲಿ ನೋಂದಣಿ ಅಗತ್ಯವಿರಬಹುದು. ನೀವು ನೋಂದಣಿಯಿಲ್ಲದೆ [ಇತ್ತಿಂದ](https://ai2-semanticscholar-cord-19.s3-us-west-2.amazonaws.com/historical_releases.html) ಡೇಟಾಸೆಟ್ ಅನ್ನು ಡೌನ್‌ಲೋಡ್ ಮಾಡಬಹುದು, ಆದರೆ ಇದು ಮೆಟಾಡೇಟಾ ಕಡತಕ್ಕೆ ಜೊತೆಗೆ ಎಲ್ಲಾ ಪೂರ್ಣ ಪಠ್ಯಗಳನ್ನೂ ಒಳಗೊಂಡಿರುತ್ತದೆ. -[`notebook-papers.ipynb`](notebook-papers.ipynb) ಅನ್ನು ತೆರೆಯಿರಿ ಮತ್ತು ಮೇಲಿನಿಂದ ಕೆಳಗೆ ಓದಿ. ನೀವು ಸೆಲ್‌ಗಳನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸಬಹುದು ಮತ್ತು ಕೊನೆಯಲ್ಲಿ ನಾವು ಬಿಟ್ಟಿರುವ ಕೆಲವು ಚಾಲೆಂಜ್‌ಗಳನ್ನು ಮಾಡಬಹುದು. +[`notebook-papers.ipynb`](notebook-papers.ipynb) ತೆರೆಯಿರಿ ಮತ್ತು ಕೆಳದಿಂದ ಮೇಲಕ್ಕೆ ಓದಿ. ನೀವು ಸೆಲ್‌ಗಳನ್ನು ಸಹ ಚಲಾಯಿಸಬಹುದು ಮತ್ತು ನಾವು ನಿಮ್ಮಿಗಾಗಿ ಕೊನೆಯಲ್ಲಿಟ್ಟಿರುವ ಕೆಲವು ಚಾಲೆಂಜ್‌ಗಳನ್ನು ಮಾಡಿ. ![Covid Medical Treatment](../../../../translated_images/kn/covidtreat.b2ba59f57ca45fbc.webp) -## ಚಿತ್ರ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ +## ಚಿತ್ರ ಡೇಟಾವನ್ನು ಪ್ರಕ್ರಿಯೆ ಮಾಡುವುದು -ಇತ್ತೀಚೆಗೆ, ಚಿತ್ರಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಬಹಳ ಶಕ್ತಿಶಾಲಿ AI ಮಾದರಿಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸಲಾಗಿದೆ. ಪೂರ್ವ-ತರಬೇತಿ ಪಡೆದ ನ್ಯೂರಲ್ ನೆಟ್‌ವರ್ಕ್‌ಗಳು ಅಥವಾ ಕ್ಲೌಡ್ ಸೇವೆಗಳ ಮೂಲಕ ಅನೇಕ ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸಬಹುದು. ಕೆಲವು ಉದಾಹರಣೆಗಳು: +ಇತ್ತೀಚೆಗೆ, ಚಿತ್ರಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಬಹಳ ಶಕ್ತಿ ಹೊಂದಿದ AI ಮಾದರಿಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸಲಾಗಿದೆ. ಪೂರ್ವ-ಶಿಕ್ಷಿತ ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್‌ಗಳು ಅಥವಾ ಕ್ಲೌಡ್ ಸೇವೆಗಳ ಮೂಲಕ ಅನೇಕ ಕಾರ್ಯಗಳನ್ನು ಪರಿಹರಿಸಬಹುದು. ಕೆಲವು ಉದಾಹರಣೆಗಳು: -* **ಚಿತ್ರ ವರ್ಗೀಕರಣ**, ಇದು ಚಿತ್ರವನ್ನು ಪೂರ್ವನಿರ್ಧರಿತ ವರ್ಗಗಳಲ್ಲಿ ಒಂದಕ್ಕೆ ವರ್ಗೀಕರಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ನೀವು [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) ಮುಂತಾದ ಸೇವೆಗಳನ್ನು ಬಳಸಿ ನಿಮ್ಮದೇ ಚಿತ್ರ ವರ್ಗೀಕರಣಗಳನ್ನು ಸುಲಭವಾಗಿ ತರಬೇತಿಮಾಡಬಹುದು -* **ವಸ್ತು ಪತ್ತೆ**, ಚಿತ್ರದಲ್ಲಿ ವಿವಿಧ ವಸ್ತುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು. [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ಮುಂತಾದ ಸೇವೆಗಳು ಸಾಮಾನ್ಯ ವಸ್ತುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಬಹುದು, ಮತ್ತು ನೀವು ಕೆಲವು ವಿಶೇಷ ವಸ್ತುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) ಮಾದರಿಯನ್ನು ತರಬೇತಿಮಾಡಬಹುದು. -* **ಮುಖ ಪತ್ತೆ**, ವಯಸ್ಸು, ಲಿಂಗ ಮತ್ತು ಭಾವನೆ ಪತ್ತೆ ಸೇರಿದಂತೆ. ಇದನ್ನು [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ಮೂಲಕ ಮಾಡಬಹುದು. +* **ಚಿತ್ರ ವರ್ಗೀಕರಣ**, ಇದು ನಿಮಗೆ ಚಿತ್ರವನ್ನು ಪೂರ್ವನಿರ್ಧರಿತ ವರ್ಗಗಳಲ್ಲಿ ಒಂದಾಗಿ ವರ್ಗೀಕರಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ನೀವು ಸುಲಭವಾಗಿ [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) ಸೇವೆಗಳನ್ನು ಬಳಸಿಕೊಂಡು ನಿಮ್ಮದೇ ಚಿತ್ರ ವರ್ಗೀಕರಣ 모델ವನ್ನು ತರಬೇತಿ ಮಾಡಬಹುದು +* **ವಸ್ತು ಪತ್ತೆ** ಚಿತ್ರದಲ್ಲಿ ವಿಭಿನ್ನ ವಸ್ತುಗಳನ್ನು ಪತ್ತೆ ಹಚ್ಚಲು. [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum)ಂತಹ ಸೇವೆಗಳು ಸಾಮಾನ್ಯ ವಸ್ತುಗಳನ್ನು ಪತ್ತೆ ಹಚ್ಚುತ್ತವೆ, ಮತ್ತು ನೀವು [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) ಮಾದರಿಯನ್ನು ಕೆಲವೊಂದಿಷ್ಟು ಆಸಕ್ತ ವಸ್ತುಗಳನ್ನು ಪತ್ತೆ ಮಾಡುವಂತೆ ತರಬೇತಿ ಮಾಡಬಹುದು. +* **ಮುಖದ ಪತ್ತೆ**, ಇದರಲ್ಲಿ ವಯಸ್ಸು, ಲಿಂಗ ಮತ್ತು ಭಾವನೆ ಪತ್ತೆ ಸೇರಿದೆ. ಇದನ್ನು [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ಮೂಲಕ ಮಾಡಬಹುದು. -ಈ ಎಲ್ಲಾ ಕ್ಲೌಡ್ ಸೇವೆಗಳನ್ನು [Python SDKs](https://docs.microsoft.com/samples/azure-samples/cognitive-services-python-sdk-samples/cognitive-services-python-sdk-samples/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ಕರೆಸಬಹುದು, ಆದ್ದರಿಂದ ನಿಮ್ಮ ಡೇಟಾ ಅನ್ವೇಷಣಾ ಕಾರ್ಯಪ್ರವಾಹದಲ್ಲಿ ಸುಲಭವಾಗಿ ಸೇರಿಸಬಹುದು. +ಈ ಎಲ್ಲಾ ಕ್ಲೌಡ್ ಸೇವೆಗಳನ್ನು [Python SDKs](https://docs.microsoft.com/samples/azure-samples/cognitive-services-python-sdk-samples/cognitive-services-python-sdk-samples/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿಕೊಂಡು ಕರೆಯಬಹುದು, ಮತ್ತು ಆದ್ದರಿಂದ ನಿಮ್ಮ ಡೇಟಾ ಅನ್ವೇಷಣಾ ಕಾರ್ಯಪದ್ಧತಿಯಲ್ಲಿ ಸುಲಭವಾಗಿ ಸಂಯೋಜಿಸಬಹುದು. -ಚಿತ್ರ ಡೇಟಾ ಮೂಲಗಳಿಂದ ಡೇಟಾವನ್ನು ಅನ್ವೇಷಿಸುವ ಕೆಲವು ಉದಾಹರಣೆಗಳು: -* [How to Learn Data Science without Coding](https://soshnikov.com/azure/how-to-learn-data-science-without-coding/) ಬ್ಲಾಗ್ ಪೋಸ್ಟ್‌ನಲ್ಲಿ ನಾವು Instagram ಫೋಟೋಗಳನ್ನು ಅನ್ವೇಷಿಸುತ್ತೇವೆ, ಜನರು ಫೋಟೋಗೆ ಹೆಚ್ಚು ಲೈಕ್ ನೀಡಲು ಏನು ಕಾರಣವಾಗುತ್ತದೆ ಎಂದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಪ್ರಯತ್ನಿಸುತ್ತೇವೆ. ಮೊದಲು [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ಚಿತ್ರಗಳಿಂದ ಸಾಧ್ಯವಾದಷ್ಟು ಮಾಹಿತಿ ಎಕ್ಸ್ಟ್ರ್ಯಾಕ್ಟ್ ಮಾಡುತ್ತೇವೆ, ನಂತರ [Azure Machine Learning AutoML](https://docs.microsoft.com/azure/machine-learning/concept-automated-ml/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ವಿವರಣಾತ್ಮಕ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುತ್ತೇವೆ. -* [Facial Studies Workshop](https://github.com/CloudAdvocacy/FaceStudies) ನಲ್ಲಿ ನಾವು [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ಘಟನೆಗಳಿಂದ ಜನರ ಭಾವನೆಗಳನ್ನು ಫೋಟೋಗಳಿಂದ ಎಕ್ಸ್ಟ್ರ್ಯಾಕ್ಟ್ ಮಾಡುತ್ತೇವೆ, ಜನರನ್ನು ಸಂತೋಷಪಡಿಸುವುದೇನು ಎಂದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು. +ಚಿತ್ರ ಡೇಟಾ ಮೂಲಗಳಿಂದ ಡೇಟಾ ಅನ್ವೇಷಣೆಯ ಕೆಲವು ಉದಾಹರಣೆಗಳು ಇಲ್ಲಿವೆ: +* ಬ್ಲಾಗ್ ಪೋಸ್ಟ್ [How to Learn Data Science without Coding](https://soshnikov.com/azure/how-to-learn-data-science-without-coding/) ನಲ್ಲಿ ನಾವು ಇನ್‌ಸ್ಟಾಗ್ರಾಮ್ ಫೋಟೋಗಳನ್ನು ಅನ್ವೇಷಿಸಿ, ಜನರು ಫೋಟೋಗೆ ಹೆಚ್ಚಿನ ಲೈಕ್ಸ್ ನೀಡಲು ಕಾರಣವೇನು ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಪ್ರಯತ್ನಿಸುತ್ತೇವೆ. ಮೊದಲು ನಾವು [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ಚಿತ್ರದಷ್ಟು ಹೆಚ್ಚು ಮಾಹಿತಿಯನ್ನು ತೆಗೆಯುತ್ತೇವೆ, ನಂತರ [Azure Machine Learning AutoML](https://docs.microsoft.com/azure/machine-learning/concept-automated-ml/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ವ್ಯಾಖ್ಯಾನ ಮಾಡಬಹುದಾದ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುತ್ತೇವೆ. +* [Facial Studies Workshop](https://github.com/CloudAdvocacy/FaceStudies) ನಲ್ಲಿ ನಾವು [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ಬಳಸಿ ಘಟನೆಗಳಿಂದ ಜನರ ಭಾವನೆಗಳನ್ನು ಚಿತ್ರಗಳಲ್ಲಿ ತೆಗೆಯುತ್ತೇವೆ, ಜನರನ್ನು ಸಂತೋಷಪಡಿಸುವ ಕಾರಣಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಪ್ರಯತ್ನಿಸುತ್ತೇವೆ. -## ಸಮಾರೋಪ +## ಸಾರಾಂಶ -ನೀವು ಈಗಾಗಲೇ ಸಂರಚಿತ ಅಥವಾ ಅಸಂರಚಿತ ಡೇಟಾವನ್ನು ಹೊಂದಿದ್ದರೂ, Python ಬಳಸಿ ನೀವು ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ ಮತ್ತು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಎಲ್ಲಾ ಹಂತಗಳನ್ನು ನಿರ್ವಹಿಸಬಹುದು. ಇದು ಬಹುಶಃ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಯ ಅತ್ಯಂತ ಲವಚಿಕ ವಿಧಾನವಾಗಿದೆ, ಮತ್ತು ಅದಕ್ಕಾಗಿ ಬಹುತೇಕ ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು Python ಅನ್ನು ತಮ್ಮ ಪ್ರಾಥಮಿಕ ಸಾಧನವಾಗಿ ಬಳಸುತ್ತಾರೆ. ನಿಮ್ಮ ಡೇಟಾ ವಿಜ್ಞಾನ ಪ್ರಯಾಣದಲ್ಲಿ ಗಂಭೀರರಾಗಿದ್ದರೆ Python ಅನ್ನು ಆಳವಾಗಿ ಕಲಿಯುವುದು ಉತ್ತಮ ಆಯ್ಕೆಯಾಗಬಹುದು! +ನೀವು ಈಗಾಗಲೇ ಸಂರಚಿತ ಅಥವಾ ಅಸಂರಚಿತ ಡೇಟಾ ಹೊಂದಿದ್ದೀರಾ, Python ಬಳಸಿ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ ಮತ್ತು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಎಲ್ಲಾ ಹಂತಗಳನ್ನು ನಿರ್ವಹಿಸಬಹುದು. ಇದು ಬಹುಶಃ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆಯ ಅತ್ಯಂತ ಲವಚಿಕ ಮಾರ್ಗ, ಮತ್ತು ಅದಕ್ಕಾಗಿ ಹೆಚ್ಚಿನ ಡೇಟಾ ಸಯಂಟಿಸ್ಟ್‍ಗಳು Python ಅನ್ನು ಅವರ ಪ್ರಾಥಮಿಕ ಬಾಗುಲು ಉಪಕರಣವಾಗಿ ಬಳಸುತ್ತಾರೆ. ನಿಮ್ಮ ಡೇಟಾ ಸಯನ್ಸ್ ಪ್ರಯಾಣದಲ್ಲಿ ಗಂಭೀರರಾಗಿದ್ದರೆ Python ಅನ್ನು ಆಳವಾಗಿ ಕಲಿಯೋದು ಒಳ್ಳೆಯ ಐಡಿಯಾ! -## [ಪೋಸ್ಟ್-ಲೆಕ್ಚರ್ ಕ್ವಿಜ್](https://ff-quizzes.netlify.app/en/ds/quiz/13) +## [ಪಠ್ಯೋತ್ತರ ಕುಲಿಕಟ್ಟು](https://ff-quizzes.netlify.app/en/ds/quiz/13) -## ವಿಮರ್ಶೆ ಮತ್ತು ಸ್ವಯಂ ಅಧ್ಯಯನ +## ವಿಮರ್ಶೆ & ಸ್ವಯಂ ಅಧ್ಯಯನ **ಪುಸ್ತಕಗಳು** * [Wes McKinney. Python for Data Analysis: Data Wrangling with Pandas, NumPy, and IPython](https://www.amazon.com/gp/product/1491957662) -**ಆನ್ಲೈನ್ ಸಂಪನ್ಮೂಲಗಳು** +**ಆನ್‌ಲೈನ್ ಸಂಪನ್ಮೂಲಗಳು** * ಅಧಿಕೃತ [10 minutes to Pandas](https://pandas.pydata.org/pandas-docs/stable/user_guide/10min.html) ಟ್ಯುಟೋರಿಯಲ್ * [Pandas Visualization ಕುರಿತು ಡಾಕ್ಯುಮೆಂಟೇಶನ್](https://pandas.pydata.org/pandas-docs/stable/user_guide/visualization.html) **Python ಕಲಿಕೆ** -* [Turtle Graphics ಮತ್ತು Fractals ಬಳಸಿ Python ಅನ್ನು ಮನರಂಜನೆಯ ರೀತಿಯಲ್ಲಿ ಕಲಿಯಿರಿ](https://github.com/shwars/pycourse) -* [Python ನಲ್ಲಿ ನಿಮ್ಮ ಮೊದಲ ಹೆಜ್ಜೆಗಳು](https://docs.microsoft.com/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) Microsoft Learn ನಲ್ಲಿ ಲರ್ನಿಂಗ್ ಪಾತ್ (http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) +* [ತುತ್ತಲ್ರ ಗ್ರಾಫಿಕ್ಸ್ ಮತ್ತು ಫ್ರಾಕ್ಟಲ್ಸ್ ಜೊತೆಗೆ Python ಮನರಂಜನಾತ್ಮಕವಾಗಿ ಕಲಿಯಿರಿ](https://github.com/shwars/pycourse) +* [Python ಜೊತೆಗೆ ನಿಮ್ಮ ಮೊದಲ ಹೆಜ್ಜೆಗಳು](https://docs.microsoft.com/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) Microsoft Learn ನಲ್ಲಿ ಶ学习ಪಥ -## ಅಸೈನ್‌ಮೆಂಟ್ +## ನಿಯೋಜನೆ [ಮೇಲಿನ ಚಾಲೆಂಜ್‌ಗಳಿಗೆ ಹೆಚ್ಚಿನ ವಿವರವಾದ ಡೇಟಾ ಅಧ್ಯಯನವನ್ನು ಮಾಡಿ](assignment.md) -## ಕ್ರೆಡಿಟ್ಸ್ +## ಧನ್ಯವಾದಗಳು -ಈ ಪಾಠವನ್ನು ♥️ ಸಹಿತ [Dmitry Soshnikov](http://soshnikov.com) ರವರು ರಚಿಸಿದ್ದಾರೆ. +ಈ ಪಾಠವನ್ನು ಹೃದಯಪೂರ್ವಕವಾಗಿ [Dmitry Soshnikov](http://soshnikov.com) ರವರು ರಚಿಸಿದ್ದಾರೆ --- -**ಅಸ್ವೀಕರಣ**: -ಈ ದಸ್ತಾವೇಜು [Co-op Translator](https://github.com/Azure/co-op-translator) ಎಂಬ AI ಅನುವಾದ ಸೇವೆಯನ್ನು ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ಶುದ್ಧತೆಯತ್ತ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ತಪ್ಪುಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂಬುದನ್ನು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಮಹತ್ವದ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ ಅಥವಾ ತಪ್ಪು ವಿವರಣೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ. +**ಅಸ್ವೀಕಾರ**: +ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ. \ No newline at end of file diff --git a/translations/ml/.co-op-translator.json b/translations/ml/.co-op-translator.json index 1e08aebb..1d411653 100644 --- a/translations/ml/.co-op-translator.json +++ b/translations/ml/.co-op-translator.json @@ -96,8 +96,8 @@ "language_code": "ml" }, "2-Working-With-Data/07-python/README.md": { - "original_hash": "7bfec050f4717dcc2dfd028aca9d21f3", - "translation_date": "2025-12-19T15:32:07+00:00", + "original_hash": "fb29e3e0be486fe8f15d50bdade79eb1", + "translation_date": "2026-07-17T17:51:37+00:00", "source_file": "2-Working-With-Data/07-python/README.md", "language_code": "ml" }, diff --git a/translations/ml/2-Working-With-Data/07-python/README.md b/translations/ml/2-Working-With-Data/07-python/README.md index 30d5e48e..f6d257d2 100644 --- a/translations/ml/2-Working-With-Data/07-python/README.md +++ b/translations/ml/2-Working-With-Data/07-python/README.md @@ -1,62 +1,62 @@ -# ഡാറ്റയുമായി പ്രവർത്തിക്കൽ: പൈത്തൺയും പാൻഡാസ് ലൈബ്രറിയും +# ഡാറ്റയിൽ ജോലി ചെയ്യൽ: പൈഥൺ এবং പാൻഡാസ് ലൈബ്രറി | ![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/07-WorkWithPython.png) | | :-------------------------------------------------------------------------------------------------------: | -| Python ഉപയോഗിച്ച് പ്രവർത്തിക്കൽ - _Sketchnote by [@nitya](https://twitter.com/nitya)_ | +| Python-ൽ ജോലി ചെയ്യൽ - _Sketchnote by [@nitya](https://twitter.com/nitya)_ | [![Intro Video](../../../../translated_images/ml/video-ds-python.245247dc811db8e4.webp)](https://youtu.be/dZjWOGbsN4Y) -ഡാറ്റാബേസുകൾ ഡാറ്റ സംഭരിക്കാനും ക്വറി ഭാഷകൾ ഉപയോഗിച്ച് അവയെ ക്വറി ചെയ്യാനും വളരെ കാര്യക്ഷമമായ മാർഗങ്ങൾ നൽകുമ്പോഴും, ഡാറ്റ പ്രോസസ്സിംഗിന്റെ ഏറ്റവും ലവച്ഛമായ മാർഗം ഡാറ്റ കൈകാര്യം ചെയ്യാൻ നിങ്ങളുടെ സ്വന്തം പ്രോഗ്രാം എഴുതുകയാണ്. പലപ്പോഴും, ഡാറ്റാബേസ് ക്വറി ചെയ്യുന്നത് കൂടുതൽ ഫലപ്രദമായ മാർഗമായിരിക്കും. എന്നാൽ, കൂടുതൽ സങ്കീർണ്ണമായ ഡാറ്റ പ്രോസസ്സിംഗ് ആവശ്യമായപ്പോൾ, അത് എളുപ്പത്തിൽ SQL ഉപയോഗിച്ച് ചെയ്യാനാകില്ല. -ഡാറ്റ പ്രോസസ്സിംഗ് ഏതെങ്കിലും പ്രോഗ്രാമിംഗ് ഭാഷയിൽ പ്രോഗ്രാം ചെയ്യാം, പക്ഷേ ഡാറ്റ കൈകാര്യം ചെയ്യുന്നതിൽ ഉയർന്ന തലത്തിലുള്ള ചില ഭാഷകൾ ഉണ്ട്. ഡാറ്റ സയന്റിസ്റ്റുകൾ സാധാരണയായി താഴെപ്പറയുന്ന ഭാഷകളിൽ ഒന്നിനെ മുൻഗണന നൽകുന്നു: +ഡാറ്റാബേസുകൾ ഡാറ്റ സൂക്ഷിക്കാനും ക്വറി ഭാഷകൾ ഉപയോഗിച്ച് അവയെ ചോദിക്കാനുമുള്ള വളരെ കാര്യക്ഷമമായ മാർഗങ്ങൾ നൽകുമ്പോഴും, ഡാറ്റ പ്രോസസിംഗിന് ഏറ്റവും വിശാലമായ മാർഗമാണ് ഡാറ്റ മാനിപ്പുലേറ്റ് ചെയ്യാൻ നിങ്ങളുടെ സ്വന്തം പ്രോഗ്രാം എഴുതുന്നത്. പലപ്പോഴും, ഡാറ്റാബേസ് ക്വറി നടത്തുന്നത് കൂടുതൽ ഫലപ്രദമായ മാർഗമായിരിക്കും. എന്നാൽ, കൂടുതൽ സങ്കീർണമായ ഡാറ്റ പ്രോസസിംഗ് ആവശ്യമായപ്പോൾ അത് എളുപ്പത്തിൽ SQL ഉപയോഗിച്ച് ചെയ്‌തുപോവാൻ കഴിയില്ല. +ഡാറ്റ പ്രോസസിംഗ് ഏതെങ്കിലും പ്രോഗ്രാമിംഗ് ഭാഷയിൽ പ്രോഗ്രാം ചെയ്യാവുന്നതാണ്, പക്ഷേ ഡാറ്റയുമായി പ്രവർത്തിക്കുന്നതിൽ ഉയർന്നതരം ഉള്ള ചില ഭാ‍ഷകൾ ഉണ്ട്. ഡാറ്റ ശാസ്ത്രജ്ഞർ സാധാരണയായി താഴെപ്പറഞ്ഞ ഭാഷകളിൽ ഒന്നാണ് ഇഷ്ടപ്പെടുന്നത്: -* **[Python](https://www.python.org/)**, ഒരു പൊതുവായ പ്രോഗ്രാമിംഗ് ഭാഷ, അതിന്റെ ലളിതത്വം കാരണം തുടക്കക്കാർക്ക് ഏറ്റവും മികച്ച ഓപ്ഷനുകളിൽ ഒന്നായി പരിഗണിക്കപ്പെടുന്നു. Python-ന് നിരവധി അധിക ലൈബ്രറികൾ ഉണ്ട്, ഉദാഹരണത്തിന് ZIP ആർക്കൈവ് നിന്ന് ഡാറ്റ എടുക്കൽ, അല്ലെങ്കിൽ ചിത്രം ഗ്രേസ്കെയിലിലേക്ക് മാറ്റൽ പോലുള്ള പ്രായോഗിക പ്രശ്നങ്ങൾ പരിഹരിക്കാൻ സഹായിക്കുന്നവ. ഡാറ്റ സയൻസിനൊപ്പം, Python വെബ് ഡെവലപ്പ്മെന്റിനും വ്യാപകമായി ഉപയോഗിക്കുന്നു. -* **[R](https://www.r-project.org/)**, പാരമ്പര്യമായ ഒരു ടൂൾബോക്സ്, സ്റ്റാറ്റിസ്റ്റിക്കൽ ഡാറ്റ പ്രോസസ്സിംഗിനായി വികസിപ്പിച്ചിരിക്കുന്നു. ഇതിൽ വലിയ ലൈബ്രറി സംഭരണം (CRAN) ഉണ്ട്, ഇത് ഡാറ്റ പ്രോസസ്സിംഗിന് നല്ലൊരു തിരഞ്ഞെടുപ്പാണ്. എന്നാൽ, R ഒരു പൊതുവായ പ്രോഗ്രാമിംഗ് ഭാഷയല്ല, ഡാറ്റ സയൻസ് മേഖലയ്ക്ക് പുറത്തു അപൂർവമായി മാത്രമേ ഉപയോഗിക്കപ്പെടൂ. -* **[Julia](https://julialang.org/)**, ഡാറ്റ സയൻസിനായി പ്രത്യേകമായി വികസിപ്പിച്ച മറ്റൊരു ഭാഷ. Python-നേക്കാൾ മികച്ച പ്രകടനം നൽകാൻ ഉദ്ദേശിച്ചിരിക്കുന്നു, ശാസ്ത്രീയ പരീക്ഷണങ്ങൾക്ക് മികച്ച ഉപകരണം. +* **[Python](https://www.python.org/)**, ഒരു പൊതുവായ പ്രോഗ്രാമിംഗ് ഭാഷ, എളുപ്പത്തിൽ പഠിക്കാൻ മികച്ച ഓപ്ഷനുകളിൽ ഒന്നായി പരിഗണിക്കപ്പെടുന്നു. Python-ന് നിരവധി അധിക ലൈബ്രറികൾ ഉണ്ട്, ഉദാഹരണത്തിന് ZIP ആർക്കൈവ് നിന്നും ഡാറ്റ എടുക്കുക, അല്ലെങ്കിൽ ചിത്രത്തെ ഗ്രേസ്‌കെയിലിലേക്ക് മാറ്റുക തുടങ്ങിയ പല പ്രായോഗിക പ്രശ്നങ്ങളും പരിഹരിക്കാൻ സഹായിക്കുന്നു. ഡാറ്റ ശാസ്ത്രത്തിന് പുറമേ, Python വേബ് ഡെവലപ്പ്മെന്റിനും വ്യാപകമായി ഉപയോഗിക്കുന്നു. +* **[R](https://www.r-project.org/)** മാനസിക ഡാറ്റ പ്രോസസിംഗിന് വികസിപ്പിച്ച പാരമ്പര്യ ട്വൾ ബോക്സാണ്. ഇതിൽ ഗ്രന്ഥശാലകളുടെ വലിയ സദ്യ (CRAN) ഉണ്ട്, ഇത് ഡാറ്റ പ്രോസസിങ്ങ്‌ക്കു നല്ല ഓപ്ഷനാണ്. പക്ഷേ, R ഒരു പൊതുവായ പ്രോഗ്രാമിംഗ് ഭാഷയല്ല, കൂടാതെ അത് ഡാറ്റ ശാസ്ത്ര മേഖലയ്ക്ക് പുറത്തു അപൂർവ്വം മാത്രം ഉപയോഗിക്കുന്നു. +* **[Julia](https://julialang.org/)** മറ്റൊരു ഭാഷയാണ് പ്രത്യേകിച്ച് ഡാറ്റ ശാസ്ത്രത്തിനായി വികസിപ്പിച്ചത്. Python-നേക്കാൾ മികച്ച പ്രകടനം നൽകാൻ ഉദ്ദേശിച്ചാണ് ഇത് നിർമ്മിച്ചത്, ഇത് ശാസ്ത്രീയ പരീക്ഷണങ്ങൾക്കായി മികച്ച ഉപകരണമാകുന്നു. -ഈ പാഠത്തിൽ, നാം ലളിതമായ ഡാറ്റ പ്രോസസ്സിംഗിനായി Python ഉപയോഗിക്കുന്നതിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കും. ഭാഷയുടെ അടിസ്ഥാന പരിചയം ഉണ്ടെന്ന് നാം കരുതുന്നു. Python-ന്റെ കൂടുതൽ വിശദമായ പഠനത്തിന്, താഴെപ്പറയുന്ന സ്രോതസുകളിൽ ഒന്നിനെ കാണാം: +ഈ പാഠത്തിൽ, ലളിതമായ ഡാറ്റ പ്രോസസിംഗിനായി Python ഉപയോഗിക്കാൻ നമുക്ക് കേന്ദ്രീകരിക്കാം. ഭാഷയിൽ അടിസ്ഥാനമായ പരിചയം ധാര്യിച്ചിരിക്കുന്നു എന്ന് നമുക്ക് കരുതാം. Python-ന്റെ കൂടുതൽ വ്യാപകപരമായ പരിചയം ആവശ്യമായാൽ, താഴെപ്പറഞ്ഞ വരികളെ സ്രോതസ്സ് ഉപയോഗിക്കാം: -* [Learn Python in a Fun Way with Turtle Graphics and Fractals](https://github.com/shwars/pycourse) - GitHub-അധിഷ്ഠിത Python പ്രോഗ്രാമിംഗിന്റെ വേഗത്തിലുള്ള പരിചയക്കുറിപ്പ് -* [Take your First Steps with Python](https://docs.microsoft.com/en-us/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) ലെ പഠന പാത +* [ക്യാപുകൾ, ഫ്രാക്ടലുകളുമായി രസകരമായി Python പഠിക്കുക](https://github.com/shwars/pycourse) - GitHub അടിസ്ഥാനമായ പ്രവൃത്തി പരിചയ കോഴ്സ് +* [Python-ൽ ആദ്യ പടി ഗതി നേടുക](https://docs.microsoft.com/en-us/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) യിലെ ലേണിംഗ് പാത -ഡാറ്റ പല രൂപങ്ങളിൽ വരാം. ഈ പാഠത്തിൽ, നാം മൂന്ന് രൂപത്തിലുള്ള ഡാറ്റ പരിഗണിക്കും - **ടാബുലർ ഡാറ്റ**, **ടെക്സ്റ്റ്** , **ചിത്രങ്ങൾ**. +ഡാറ്റ പല രൂപങ്ങളിലും വരും. ഈ പാഠത്തിൽ, നാം മൂന്ന് രൂപങ്ങൾ പരിഗണിക്കാം - **ടാബുലർ ഡാറ്റ**, **വാചകം**, **ചിത്രങ്ങൾ**. -നാം എല്ലാ ബന്ധപ്പെട്ട ലൈബ്രറികളുടെ പൂർണ്ണ അവലോകനം നൽകുന്നതിന് പകരം, ഡാറ്റ പ്രോസസ്സിംഗിന്റെ ചില ഉദാഹരണങ്ങളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കും. ഇതിലൂടെ എന്ത് സാധ്യമാണ് എന്നതിന്റെ പ്രധാന ആശയം നിങ്ങൾക്ക് ലഭിക്കും, കൂടാതെ പ്രശ്നങ്ങൾ വന്നപ്പോൾ പരിഹാരങ്ങൾ എവിടെ കണ്ടെത്താമെന്ന് മനസ്സിലാക്കാൻ സഹായിക്കും. +നാം പൂർണ്ണമായ ലൈബ്രറികളെ കുറിച്ചുള്ള അവലോകനം നൽകുന്നതിന് പകരം, ഡാറ്റ പ്രോസസിംഗിന്റെ കുറച്ച് ഉദാഹരണങ്ങളിൽ കേന്ദ്രീകരിക്കും. ഇതിൽ നിങ്ങൾക്കു സാധ്യമാകാനുള്ള പ്രധാന ആശയം മനസ്സിലാക്കാനും, ആവശ്യാനുസരിച്ച് പ്രശ്നങ്ങൾക്ക് പരിഹാരങ്ങൾ കണ്ടെത്താൻ എവിടെ നോക്കേണ്ടതാണെന്ന് ഗ്രഹിക്കാനും സഹായിക്കും. -> **ഏറ്റവും പ്രയോജനകരമായ ഉപദേശം**. നിങ്ങൾക്ക് അറിയാത്ത ഒരു ഡാറ്റ ഓപ്പറേഷൻ ചെയ്യേണ്ടിവന്നാൽ, അത് ഇന്റർനെറ്റിൽ തിരയാൻ ശ്രമിക്കുക. [Stackoverflow](https://stackoverflow.com/) സാധാരണയായി Python-ൽ പല സാധാരണ ജോലികൾക്കുള്ള നിരവധി പ്രയോജനകരമായ കോഡ് സാമ്പിളുകൾ അടങ്ങിയിരിക്കുന്നു. +> **Entakki upadesham**. നിങ്ങൾ അറിയാത്ത ഒരു ഡാറ്റ ഓപ്പറേഷൻ നടത്തേണ്ടി വന്നാൽ, അത് ഇന്റർനെറ്റിൽ തിരയാൻ ശ്രമിക്കുക. [Stackoverflow](https://stackoverflow.com/) Python-ൽ വിവിധ സാധാരണ ജോലികൾക്കുള്ള ധാരാളം സഹായകമായ കോഡ് ഉദാഹരണം നൽകും. -## [പ്രീ-ലെക്ചർ ക്വിസ്](https://ff-quizzes.netlify.app/en/ds/quiz/12) +## [പഠനത്തിനുമുമ്പ് ക്വിസ്](https://ff-quizzes.netlify.app/en/ds/quiz/12) -## ടാബുലർ ഡാറ്റയും ഡാറ്റാഫ്രെയിമുകളും +## ടാബുലർ ഡാറ്റയും ഡാറ്റ്ഫ്രെയിംസും -റിലേഷണൽ ഡാറ്റാബേസുകൾക്കുറിച്ച് സംസാരിക്കുമ്പോൾ നിങ്ങൾ ടാബുലർ ഡാറ്റ നേരത്തെ കണ്ടിട്ടുണ്ട്. നിങ്ങൾക്ക് വലിയ ഡാറ്റ ഉണ്ടെങ്കിൽ, അത് പല വ്യത്യസ്ത ബന്ധമുള്ള പട്ടികകളിൽ ഉൾക്കൊള്ളുന്നുവെങ്കിൽ, അതുമായി പ്രവർത്തിക്കാൻ SQL ഉപയോഗിക്കുന്നത് തീർച്ചയായും ഉചിതമാണ്. എന്നാൽ, പലപ്പോഴും നമുക്ക് ഒരു ഡാറ്റ പട്ടിക ഉണ്ടാകുമ്പോൾ, ആ ഡാറ്റയെക്കുറിച്ച് ചില **അർത്ഥം** അല്ലെങ്കിൽ **അവബോധം** നേടേണ്ടതുണ്ടാകാം, ഉദാഹരണത്തിന് വിതരണവും മൂല്യങ്ങൾ തമ്മിലുള്ള സഹബന്ധവും. ഡാറ്റ സയൻസിൽ, നാം പലപ്പോഴും മൗലിക ഡാറ്റയിൽ ചില പരിവർത്തനങ്ങൾ നടത്തേണ്ടതുണ്ടാകുന്നു, തുടർന്ന് ദൃശ്യവൽക്കരണം നടത്തുന്നു. ഈ രണ്ട് ഘട്ടങ്ങളും Python ഉപയോഗിച്ച് എളുപ്പത്തിൽ ചെയ്യാം. +റിലേഷൻ ഡാറ്റാബേസുകളെ കുറിച്ചു പറഞ്ഞപ്പോൾ നേരത്തെ നിങ്ങളെ ടാബുലർ ഡാറ്റ കണ്ടിട്ടുണ്ട്. വളരെ ഡാറ്റ ഉണ്ടെങ്കിൽ, വിവിധ ബന്ധപ്പെട്ടു കിടക്കുന്ന ടേബിളുകളിലായി നിന്നാൽ, അതിൽ SQL ഉപയോഗിക്കുന്നത് ശരിയാണെന്ന് പറയാം. എന്നാൽ, ഡാറ്റയുടെ ചില പ്രത്യേക ബോധ്യം അല്ലെങ്കിൽ ആഴത്തിലുള്ള അവലോകനം (distribution, correlation തുടങ്ങിയവ) കിട്ടേണ്ടപ്പോൾ, ഡാറ്റ ശാസ്ത്രത്തിൽ പലപ്പോഴും ആദ്യ ഡാറ്റയിൽ നിന്ന് രൂപാന്തരം (transformations) ചെയ്യേണ്ടിവരും, പിന്നെ ভ്യ_ൽ പഠനം നടത്തേണ്ടിവരും. Python ഉപയോഗിച്ച് ഈ രണ്ട് ഘട്ടങ്ങളും എളുപ്പത്തിൽ ചെയ്യാം. -Python-ൽ ടാബുലർ ഡാറ്റ കൈകാര്യം ചെയ്യാൻ സഹായിക്കുന്ന ഏറ്റവും പ്രയോജനകരമായ രണ്ട് ലൈബ്രറികൾ ഉണ്ട്: -* **[Pandas](https://pandas.pydata.org/)**, **ഡാറ്റാഫ്രെയിമുകൾ** എന്നറിയപ്പെടുന്ന, റിലേഷണൽ പട്ടികകളോട് സമാനമായ ഘടനകളെ കൈകാര്യം ചെയ്യാൻ അനുവദിക്കുന്നു. നിങ്ങൾക്ക് നാമകരിച്ച കോളങ്ങൾ ഉണ്ടാകാം, കൂടാതെ വരി, കോളം, ഡാറ്റാഫ്രെയിമുകൾ എന്നിവയിൽ വ്യത്യസ്ത പ്രവർത്തനങ്ങൾ നടത്താം. -* **[Numpy](https://numpy.org/)**, **ടെൻസറുകൾ** എന്നറിയപ്പെടുന്ന, അഥവാ ബഹുമാനദണ്ഡ **അറേകൾ** കൈകാര്യം ചെയ്യാനുള്ള ലൈബ്രറി. അറേയിൽ ഒരേ തരം മൂല്യങ്ങൾ ഉണ്ടാകണം, ഇത് ഡാറ്റാഫ്രെയിമിനേക്കാൾ ലളിതമാണ്, പക്ഷേ കൂടുതൽ ഗണിത പ്രവർത്തനങ്ങൾ നൽകുന്നു, കൂടാതെ കുറവ് ഓവർഹെഡ് സൃഷ്ടിക്കുന്നു. +Python-ൽ ടാബുലർ ഡാറ്റ കൈകാര്യം ചെയ്യാൻ സഹായിക്കുന്ന ഏറ്റവും പ്രയോജനകരമായ രണ്ട് ലൈബ്രറികൾ ഇതാണ്: +* **[Pandas](https://pandas.pydata.org/)**, ഡാറ്റ്ഫ്രെയിം എന്ന പേരിൽ അറിയപ്പെടുന്ന റീലേഷൻ ഷിപ്പുള്ള പട്ടികകൾ കൈകാര്യം ചെയ്യാൻ സഹായിക്കുന്നു. നാമകരിച്ച കോളങ്ങളുമായി നിങ്ങൾക്ക് നിരവധി ഓപ്പറേഷനുകൾ നിരവതിരിക്കാൻ കഴിയും. +* **[Numpy](https://numpy.org/)**, ടെൻസറുകളായി പറയപ്പെടുന്ന ബഹുആയാമ **ആറേകൾ** കൈകാര്യം ചെയ്യാൻ ഉള്ള ലൈബ്രറിയാണ്. ആരേയ്ക്ക് എല്ലാസംഖ്യകളും ഒരേ തരം ഉള്ളവയാണ്, ഡാറ്റ്ഫ്രെയിമിനെക്കാൾ ലളിതമാണ്, എന്നാൽ ഏറെ ഗണിത ഫംഗ്ഷനുകൾക്കും കുറവ് ഓവർഹെഡിനും സഹായിക്കുന്നു. -കൂടാതെ നിങ്ങൾ അറിയേണ്ട ചില മറ്റ് ലൈബ്രറികളും ഉണ്ട്: -* **[Matplotlib](https://matplotlib.org/)**, ഡാറ്റ ദൃശ്യവൽക്കരണത്തിനും ഗ്രാഫുകൾ വരയ്ക്കുന്നതിനും ഉപയോഗിക്കുന്ന ലൈബ്രറി -* **[SciPy](https://www.scipy.org/)**, ചില അധിക ശാസ്ത്രീയ ഫംഗ്ഷനുകൾ ഉള്ള ലൈബ്രറി. നാം ഇതിനകം പ്രൊബബിലിറ്റി, സ്റ്റാറ്റിസ്റ്റിക്സ് സംബന്ധിച്ച് സംസാരിക്കുമ്പോൾ ഈ ലൈബ്രറി കണ്ടിട്ടുണ്ട് +ചില മറ്റ് ലൈബ്രറികളും നിങ്ങൾ അറിയേണ്ടതാണ്: +* **[Matplotlib](https://matplotlib.org/)**, ഡാറ്റാ ദൃശ്യവത്ക്കരണത്തിനും ഗ്രാഫുകൾ വരയ്ക്കുന്നതിനും ഉപയോഗിക്കുന്നു +* **[SciPy](https://www.scipy.org/)**, കൂടുതൽ ശാസ്ത്രീയ ഫംഗ്ഷനുകൾ ഉൾപ്പെടുത്തിയ ലൈബ്രറി. സാധ്യതയും സ്ഥിതിവിവരശാസ്ത്രവും സംബന്ധിച്ചിടത്തോളം ഇത് പരിചയപ്പെടുത്തപ്പെട്ടിട്ടുണ്ട്. -Python പ്രോഗ്രാമിന്റെ തുടക്കത്തിൽ ഈ ലൈബ്രറികൾ ഇമ്പോർട്ട് ചെയ്യാൻ സാധാരണയായി ഉപയോഗിക്കുന്ന കോഡ് ഇതാണ്: +Python പ്രോഗ്രാമിന്റെ ആരംഭത്തിൽ ഈ ലൈബ്രറികൾ ഇംപോർട്ട് ചെയ്യാൻ സാധാരണയായി ഉപയോഗിക്കുന്ന കോഡ് ഇവിടെ: ```python import numpy as np import pandas as pd import matplotlib.pyplot as plt -from scipy import ... # നിങ്ങൾക്ക് ആവശ്യമായ കൃത്യമായ സബ്-പാക്കേജുകൾ വ്യക്തമാക്കേണ്ടതാണ് +from scipy import ... # നിങ്ങൾക്ക് ആവശ്യമായ دقیق സബ്-പാക്കേജുകൾ വ്യക്തമാക്കേണ്ടതുണ്ട് ``` -Pandas ചില അടിസ്ഥാന ആശയങ്ങൾ ചുറ്റിപ്പറ്റിയാണ്. +Pandas ചില അടിസ്ഥാന ആശയങ്ങൾക്കു മദ്ധ്യമാണ്. ### സീരീസ് -**സീരീസ്** മൂല്യങ്ങളുടെ ഒരു ക്രമമാണ്, ലിസ്റ്റ് അല്ലെങ്കിൽ numpy അറേ പോലെയാണ്. പ്രധാന വ്യത്യാസം സീരീസിന് ഒരു **ഇൻഡക്സ്** ഉണ്ടാകുന്നതാണ്, സീരീസുകളിൽ പ്രവർത്തിക്കുമ്പോൾ (ഉദാ., കൂട്ടിച്ചേർക്കുമ്പോൾ) ഇൻഡക്സ് പരിഗണിക്കപ്പെടുന്നു. ഇൻഡക്സ് ലിസ്റ്റ് അല്ലെങ്കിൽ അറേയിൽ നിന്നുള്ള സീരീസ് സൃഷ്ടിക്കുമ്പോൾ ഡിഫോൾട്ട് ഉപയോഗിക്കുന്ന പൂർണ്ണസംഖ്യ വരി നമ്പർ പോലെയോ, അല്ലെങ്കിൽ തീയതി ഇടവേള പോലെയുള്ള സങ്കീർണ്ണ ഘടനയുള്ളതായിരിക്കാം. +**സീരീസ്** ഒരു മൂല്യങ്ങളുടെ നിരയാണ്, ലിസ്റ്റ് അല്ലെങ്കിൽ numpy array പോലെയാണ്. പ്രധാന വ്യത്യാസം അത് ഒരു **ഇൻഡക്സ്** കൂടുന്നു എന്നതാണ്, സീരീസ് മുകളിലുള്ള ഓപ്പറേഷനുകൾ (ഉദാ., ചേർക്കുക) ചെയ്താൽ ഇൻഡക്സ് പരിഗണിക്കുന്നു. ഇൻഡക്സ് സാധ്യതയുള്ളതതായി ജാതി നമ്പർ പോലും ആകാം (ലിസ്റ്റ് അല്ലെങ്കിൽ ആരേയിൽ നിന്നും സീരീസ് സൃഷ്ടിക്കുമ്പോൾ ഡിഫോൾട്ട് ഇൻഡക്സ് കാണുന്നത്), അല്ലെങ്കിൽ സങ്കീർണ ഘടന ഉണ്ടാകാം (പോലെയുള്ള തീയതി ഇടവേള). -> **കുറിപ്പ്**: സഹായി നോട്ട്‌ബുക്കിൽ [`notebook.ipynb`](notebook.ipynb) ചില പരിചയപരമായ Pandas കോഡ് ഉണ്ട്. ഇവിടെ നാം ചില ഉദാഹരണങ്ങൾ മാത്രം ചുരുക്കി കാണിക്കുന്നു, നിങ്ങൾക്ക് പൂർണ്ണ നോട്ട്‌ബുക്ക് പരിശോധിക്കാം. +> **കുറിപ്പ്**: സഹൈത ശീലനം നൽകുന്ന നോട്ട്‌ബുക്കിൽ [`notebook.ipynb`](notebook.ipynb) Pandas വിവരണകോഡ് ഉണ്ട്. ഇവിടെ നാം ചില ഉദാഹരണങ്ങൾ മാത്രമേ നൽകുന്നുള്ളൂ, മുഴുവൻ നോട്ട്‌ബുക്ക് പരിശോധിക്കാനായി സ്വാഗതം. -ഒരു ഉദാഹരണം പരിഗണിക്കാം: നമ്മുടെ ഐസ്‌ക്രീം കടയുടെ വിൽപ്പന വിശകലനം ചെയ്യണം. ഒരു സമയപരിധിക്കായി വിൽപ്പന സംഖ്യകളുടെ സീരീസ് (പ്രതിദിനം വിറ്റ വസ്തുക്കളുടെ എണ്ണം) സൃഷ്ടിക്കാം: +ഒരു ഉദാഹരണം പരിഗണിക്കാം: ഞങ്ങൾ നമ്മുടേത് ഐസ്ക്രീം വിൽപ്പനയെ വിശകലനം ചെയ്യാൻ ആഗ്രഹിക്കുന്നു. ഏതാനും ദിവസത്തേക്ക് വിൽപ്പന സംഖ്യകൾ ഉള്ള സീരീസ് സൃഷ്ടിക്കാം: ```python start_date = "Jan 1, 2020" @@ -68,45 +68,45 @@ items_sold.plot() ``` ![Time Series Plot](../../../../translated_images/ml/timeseries-1.80de678ab1cf727e.webp) -ഇപ്പോൾ ഓരോ ആഴ്ചയും നാം സുഹൃത്തുക്കൾക്കായി പാർട്ടി സംഘടിപ്പിക്കുന്നു, പാർട്ടിക്കായി അധികം 10 പാക്ക് ഐസ്‌ക്രീം കൊണ്ടുവരുന്നു എന്ന് കരുതുക. ആ ആഴ്ചയുടെ ഇൻഡക്സ് ഉപയോഗിച്ച് മറ്റൊരു സീരീസ് സൃഷ്ടിക്കാം: +ഓരോ ആഴ്ചയും നാം സുഹൃത്തുക്കൾക്കായി പാർട്ടി നടത്തുമ്പോൾ അധികം 10 പാക്ക് ഐസ്ക്രീം പാർട്ടി ഉപയോഗത്തിന് എടുത്തു വെക്കുന്നു. ഇതെടുത്തു കാണിക്കാൻ ആഴ്ച ഓർഡർ ചെയ്ത മറ്റൊരു സീരീസ് ഉണ്ടാക്കാം: ```python additional_items = pd.Series(10,index=pd.date_range(start_date,end_date,freq="W")) ``` -രണ്ട് സീരീസുകളും ചേർത്താൽ, മൊത്തം എണ്ണം കിട്ടും: + രണ്ടു സീരീസുകളും ചേരുമ്പോൾ, ആകെ സംഖ്യ ലഭിക്കുന്നു: ```python total_items = items_sold.add(additional_items,fill_value=0) total_items.plot() ``` ![Time Series Plot](../../../../translated_images/ml/timeseries-2.aae51d575c55181c.webp) -> **കുറിപ്പ്**: നാം ലളിതമായ `total_items+additional_items` സിന്താക്സ് ഉപയോഗിക്കുന്നില്ല. അതുപയോഗിച്ചാൽ, ഫലസീരീസിൽ പല `NaN` (*Not a Number*) മൂല്യങ്ങളും ഉണ്ടാകുമായിരിക്കും. കാരണം `additional_items` സീരീസിൽ ചില ഇൻഡക്സ് പോയിന്റുകൾക്ക് മൂല്യങ്ങൾ ഇല്ല, `NaN` യെ ഏതെങ്കിലും മൂല്യത്തിലേക്ക് കൂട്ടിച്ചേർക്കുമ്പോൾ ഫലം `NaN` ആകുന്നു. അതിനാൽ കൂട്ടിച്ചേർക്കുമ്പോൾ `fill_value` പാരാമീറ്റർ നിർദ്ദേശിക്കേണ്ടതാണ്. +> **കുറിപ്പ്:** ലളിതമായ സിന്റാക്സ് `total_items+additional_items` താൽപ്പര്യമില്ല, കാരണം `additional_items` സീരീസിൽ ചില ഇൻഡക്സ് പോയിന്റുകൾക്കുള്ള മൂല്യങ്ങൾ കാണാത്തതായതിനാൽ NaN (*Not a Number*) മൂല്യങ്ങൾ ഫലമായി വരും. ഏത് മൂല്യത്തിലും `NaN` ചേർത്താൽ `NaN`തന്നെയാണ് ഫലം. അതുകൊണ്ട് ചേർക്കുമ്പോൾ `fill_value` ഘടകം നൽകണം. -ടൈം സീരീസുകളുമായി, നാം സീരീസ് വ്യത്യസ്ത സമയ ഇടവേളകളിൽ **റിസാമ്പിൾ** ചെയ്യാം. ഉദാഹരണത്തിന്, മാസത്തിൽ ശരാശരി വിൽപ്പന കണക്കാക്കണം എങ്കിൽ താഴെ കൊടുത്ത കോഡ് ഉപയോഗിക്കാം: +ടൈം സീരീസിൽ നാം പല സമയ ഇടവേളകളിൽ **റിസാംപ്ലിംഗ്** നടത്താനാകും. ഉദാഹരണത്തിന്, മാസവാരമായി ശരാശരി വിൽപ്പന കണക്കാക്കണം എന്ന് പറയാം. താഴെ കൊടുത്തിരിക്കുന്ന കോഡ് ഉപയോഗിക്കാം: ```python monthly = total_items.resample("1M").mean() ax = monthly.plot(kind='bar') ``` ![Monthly Time Series Averages](../../../../translated_images/ml/timeseries-3.f3147cbc8c624881.webp) -### ഡാറ്റാഫ്രെയിം +### ഡാറ്റഫ്രെയിം -ഡാറ്റാഫ്രെയിം അടിസ്ഥാനപരമായി ഒരേ ഇൻഡക്സ് ഉള്ള സീരീസുകളുടെ സമാഹാരമാണ്. നാം പല സീരീസുകളും ചേർത്ത് ഒരു ഡാറ്റാഫ്രെയിം സൃഷ്ടിക്കാം: +ഡാറ്റഫ്രെയിം എന്നാൽ ഒരേ ഇൻഡക്സ് ഉള്ള സീരിസുകളുടെ ശേഖരം ആണ്. പല സീരീസുകളും ചേർത്ത് ഡാറ്റഫ്രെയിം ഉണ്ടാക്കാം: ```python a = pd.Series(range(1,10)) b = pd.Series(["I","like","to","play","games","and","will","not","change"],index=range(0,9)) df = pd.DataFrame([a,b]) ``` -ഇത് താഴെപ്പറയുന്ന പോലെ ഒരു ഹോരിസോണ്ടൽ പട്ടിക സൃഷ്ടിക്കും: +ഇത് താഴെപ്പറഞ്ഞതുപോലെ ഒരു ഹൊറിസോണ്ടൽ പട്ടിക സൃഷ്ടിക്കും: | | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | | --- | --- | ---- | --- | --- | ------ | --- | ------ | ---- | ---- | | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | | 1 | I | like | to | use | Python | and | Pandas | very | much | -നാം സീരീസുകൾ കോളങ്ങളായി ഉപയോഗിച്ച്, നാമകരിച്ച കോളം പേരുകൾ ഡിക്ഷണറി ഉപയോഗിച്ച് നിർദ്ദേശിക്കാം: +സീരീസ് കോളങ്ങളായി ഉപയോഗിച്ചും, കോളം നാമങ്ങൾ ഡിക്ഷണറി ഉപയോഗിച്ചും നിർദ്ദേശിക്കാവുന്നതാണ്: ```python df = pd.DataFrame({ 'A' : a, 'B' : b }) ``` -ഇത് താഴെപ്പറയുന്ന പട്ടിക നൽകും: +ഇതു താഴെപറഞ്ഞ പട്ടിക നൽകും: | | A | B | | --- | --- | ------ | @@ -120,39 +120,39 @@ df = pd.DataFrame({ 'A' : a, 'B' : b }) | 7 | 8 | very | | 8 | 9 | much | -**കുറിപ്പ്**: നാം മുമ്പത്തെ പട്ടിക ട്രാൻസ്പോസ് ചെയ്ത് (അഥവാ `.T` ഉപയോഗിച്ച്) ഈ പട്ടിക രൂപം ലഭിക്കാമെന്ന് ശ്രദ്ധിക്കുക, ഉദാ. +**കുറിപ്പ്** നമുക്ക് മുമ്പത്തെ പട്ടിക ട്രാൻസ്പോസ് ചെയ്ത് ഈ പട്ടിക രൂപം ലഭിക്കാനാകും. ഉദാഹരണത്തിന്, ```python -df = pd.DataFrame([a,b]).T..rename(columns={ 0 : 'A', 1 : 'B' }) +df = pd.DataFrame([a,b]).T.rename(columns={ 0 : 'A', 1 : 'B' }) ``` -ഇവിടെ `.T` ഡാറ്റാഫ്രെയിമിന്റെ ട്രാൻസ്പോസിംഗ് (വരി, കോളങ്ങൾ മാറ്റൽ) പ്രവർത്തനമാണ്, `rename` പ്രവർത്തനം കോളം പേരുകൾ മുൻപത്തെ ഉദാഹരണത്തിന് അനുയോജ്യമായി മാറ്റാൻ സഹായിക്കുന്നു. + ഇവിടെ `.T` ഡാറ്റഫ്രെയിം ട്രാൻസ്പോസ് (റոյസുകൾ, കോളങ്ങൾ മാറൽ) ഓപ്പറേഷനാണ്, `rename` ഉപയോഗിച്ച് മുമ്പത്തെ ഉദാഹരണത്തിലുപോലുള്ള കോളം നാമങ്ങൾ നൽകുന്നു. -ഡാറ്റാഫ്രെയിമുകളിൽ നാം ചെയ്യാവുന്ന ചില പ്രധാന പ്രവർത്തനങ്ങൾ: +ഡാറ്റഫ്രെയിമുകളിലെ ചില പ്രധാന ഓപ്പറേഷനുകൾ: -**കോളം തിരഞ്ഞെടുപ്പ്**. `df['A']` എഴുതിയാൽ വ്യക്തിഗത കോളം തിരഞ്ഞെടുക്കാം - ഇത് ഒരു സീരീസ് നൽകും. `df[['B','A']]` എഴുതിയാൽ കോളങ്ങളുടെ ഒരു ഉപസമൂഹം മറ്റൊരു ഡാറ്റാഫ്രെയിമിൽ തിരഞ്ഞെടുക്കാം. +**കോലം തിരഞ്ഞെടുപ്പ്**. ഓരോ കോളവും `df['A']` എന്ന് എഴുതിയാൽ തിരഞ്ഞെടുക്കാവുന്നതാണ് – ഇത് ഒരു സീരീസ് ആണ്. `"df[['B','A']]"` എഴുതിയാല്‍ മറ്റ് ഡാറ്റഫ്രെയിം രൂപത്തില്‍ ചില കോളങ്ങൾ കിട്ടും. -**നിബന്ധനകൾ പ്രകാരം** ചില വരികൾ മാത്രം ഫിൽട്ടർ ചെയ്യൽ. ഉദാഹരണത്തിന്, `A` കോളത്തിലെ മൂല്യം 5-ൽ കൂടുതലുള്ള വരികൾ മാത്രം വേണമെങ്കിൽ, `df[df['A']>5]` എഴുതാം. +**ശ്രേണി ഫിൽറ്ററിംഗ്**. ഉദാഹരണത്തിന്, `A` കോളത്തിലെ മൂല്യം 5-ല്‍ മേലുള്ളവ മാത്രം എടുക്കാൻ `df[df['A']>5]` എഴുതാം. -> **കുറിപ്പ്**: ഫിൽട്ടറിംഗ് പ്രവർത്തിക്കുന്നത് ഇങ്ങനെ ആണ്. `df['A']<5` എന്ന പ്രകടനം ഒരു ബൂളിയൻ സീരീസ് നൽകുന്നു, ഇത് `df['A']` യിലെ ഓരോ മൂല്യത്തിനും `True` അല്ലെങ്കിൽ `False` ആണ്. ബൂളിയൻ സീരീസ് ഇൻഡക്സ് ആയി ഉപയോഗിക്കുമ്പോൾ, ഡാറ്റാഫ്രെയിമിലെ വരികളുടെ ഉപസമൂഹം തിരികെ നൽകുന്നു. അതിനാൽ, സാധാരണ Python ബൂളിയൻ പ്രകടനം ഉപയോഗിക്കാനാകില്ല, ഉദാ., `df[df['A']>5 and df['A']<7]` തെറ്റാണ്. പകരം, ബൂളിയൻ സീരീസുകളിൽ പ്രത്യേക `&` ഓപ്പറേഷൻ ഉപയോഗിച്ച്, `df[(df['A']>5) & (df['A']<7)]` എഴുതണം (*ബ്രാക്കറ്റുകൾ നിർണായകമാണ്*). +> **കുറിപ്പ്**: ഫിൽറ്ററിംഗ് ഈ രീതി പ്രവർത്തിക്കുന്നു. `df['A']<5` കൊണ്ട് ഒരു ബൂളിയൻ സീരീസ് കിട്ടും, ഓരോ മൂല്യവും സത്യമാണോഅയോ എന്ന സൂചന. ആ ബൂളിയൻ സീരിസിനെ ഇൻഡക്സ് ആയി ഉപയോഗിച്ചാൽ, അവയുടെ ശരിയായ അടുക്കളയായ ഭാഗങ്ങൾ തിരഞ്ഞെടുത്ത് നൽകും. അതിനാല്‍ സാധാരണ Python ബൂളിയൻ ഓപ്പറേറ്ററുകൾ ഉപയോഗിക്കല്ലേ (ഉദാ., `df[df['A']>5 and df['A']<7]` തെറ്റാണ്). പകരം, ബൂളിയൻ സീരീസുകൾക്കായി പ്രത്യേക `&` ഉപയോഗിക്കണം: `df[(df['A']>5) & (df['A']<7)]` (**ബ്രാക്കറ്റുകൾ അനിവാര്യമാണ്**). -**പുതിയ കണക്കാക്കാവുന്ന കോളങ്ങൾ സൃഷ്ടിക്കൽ**. നാം ഇങ്ങനെ ലളിതമായ പ്രകടനം ഉപയോഗിച്ച് ഡാറ്റാഫ്രെയിമിന് പുതിയ കണക്കാക്കാവുന്ന കോളങ്ങൾ സൃഷ്ടിക്കാം: +**പുതിയ ഹിസാബ് ചെയ്യാവുന്ന കോളങ്ങൾ സൃഷ്ടിക്കൽ**. സെറീസുകൾക്കും ഡാറ്റഫ്രെയിമിനും സേത്വമായി പുത്തൻ കണ്ടുപിടിത്തങ്ങളുണ്ടാക്കാൻ സാധിച്ചു: ```python df['DivA'] = df['A']-df['A'].mean() ``` -ഈ ഉദാഹരണം `A`-യുടെ ശരാശരിയിൽ നിന്നുള്ള വ്യത്യാസം കണക്കാക്കുന്നു. ഇവിടെ സംഭവിക്കുന്നത് സീരീസ് കണക്കാക്കി, അത് ഇടത് വശത്ത് നിയോഗിച്ച് മറ്റൊരു കോളം സൃഷ്ടിക്കുന്നതാണ്. അതിനാൽ സീരീസിനോട് പൊരുത്തപ്പെടാത്ത പ്രവർത്തനങ്ങൾ ഉപയോഗിക്കാനാകില്ല, ഉദാഹരണത്തിന് താഴെ കൊടുത്ത കോഡ് തെറ്റാണ്: + ഈ ഉദാഹരണത്തിൽ `A` എന്ന കോളത്തിന്റെ ശരാശരിയുമായി വ്യത്യാസം കണക്കാക്കാം. ആ സീരീസിനെ ഇടതുപടി അസൈന്മെന്റിലൂടെ പുതിയ കോളമായി ചേർക്കുന്നു. അതിനാൽ, സീരീസിനോടൊരു കംപാറ്റിബിളല്ലാത്ത ഓപ്പറേഷൻ ഉപയോഗിക്കുന്നത് തെറ്റാണ്, ഉദാഹരണത്തിന് താഴെ കൊടുക്കുന്ന കോഡ് തെറ്റാണ്: ```python -# തെറ്റായ കോഡ് -> df['ADescr'] = "Low" if df['A'] < 5 else "Hi" +# തെറ്റ് പറ്റിയ കോഡ് -> df['ADescr'] = "Low" if df['A'] < 5 else "Hi" df['LenB'] = len(df['B']) # <- തെറ്റായ ഫലം ``` -ഇതിൽ, സിന്താക്റ്റിക് ആയി ശരിയാണെങ്കിലും, തെറ്റായ ഫലം നൽകുന്നു, കാരണം `B` സീരീസിന്റെ നീളം എല്ലാ മൂല്യങ്ങൾക്കും നിയോഗിക്കുന്നു, ഓരോ മൂല്യത്തിന്റെ നീളം അല്ല. + ഈ ഉദാഹരണം, എളുപ്പമുള്ള സിന്റാക്സും ആകുമ്പോൾ പിഴവുള്ള ഫലം നൽകുന്നു — എല്ലാ മൂല്യങ്ങൾക്കും `B` സീരീസിന്റെ വികൃതിയുടെ നീളം നൽകുന്നു, ഒരു മൂല്യത്തിന്റെ നീളം അല്ല. -സങ്കീർണ്ണ പ്രകടനങ്ങൾ കണക്കാക്കേണ്ടതുണ്ടെങ്കിൽ, `apply` ഫംഗ്ഷൻ ഉപയോഗിക്കാം. അവസാന ഉദാഹരണം ഇങ്ങനെ എഴുതാം: +സങ്കീർണ്ണ കംപ്യൂട്ടേഷൻ വേണ്ടിയാൽ `apply` ഫംഗ്ഷൻ ഉപയോഗിക്കാം. താഴെയുള്ള ഉദാഹരണം ഇതുപോലെ എഴുതാം: ```python df['LenB'] = df['B'].apply(lambda x : len(x)) # അല്ലെങ്കിൽ df['LenB'] = df['B'].apply(len) ``` -മുകളിൽ പറഞ്ഞ പ്രവർത്തനങ്ങൾ കഴിഞ്ഞ്, നമുക്ക് താഴെപ്പറയുന്ന ഡാറ്റാഫ്രെയിം ലഭിക്കും: +ഇതിന് ശേഷം ഡാറ്റഫ്രെയിം ഇങ്ങനെ ആയിരിക്കും: | | A | B | DivA | LenB | | --- | --- | ------ | ---- | ---- | @@ -166,22 +166,22 @@ df['LenB'] = df['B'].apply(len) | 7 | 8 | very | 3.0 | 4 | | 8 | 9 | much | 4.0 | 4 | -**സംഖ്യകൾ അടിസ്ഥാനമാക്കി വരികൾ തിരഞ്ഞെടുക്കൽ** `iloc` ഘടന ഉപയോഗിച്ച് ചെയ്യാം. ഉദാഹരണത്തിന്, ഡാറ്റാഫ്രെയിമിൽ നിന്ന് ആദ്യ 5 വരികൾ തിരഞ്ഞെടുക്കാൻ: +**നമ്പറുകൾ അടിസ്ഥാനമാക്കി ശ്രേണികൾ തിരഞ്ഞെടുക്കൽ** `iloc` ഉപയോഗിച്ച് നടത്താം. ഉദാഹരണത്തിന്, ആദ്യ 5 നിരകൾ തിരഞ്ഞെടുക്കാൻ: ```python df.iloc[:5] ``` -**ഗ്രൂപ്പിംഗ്** Excel-ലെ *പിവോട്ട് ടേബിളുകൾ* പോലുള്ള ഫലം ലഭിക്കാൻ സാധാരണ ഉപയോഗിക്കുന്നു. ഉദാഹരണത്തിന്, ഓരോ `LenB` മൂല്യത്തിനും `A`-യുടെ ശരാശരി കണക്കാക്കണം എങ്കിൽ, `LenB` പ്രകാരം ഗ്രൂപ്പ് ചെയ്ത് `mean` വിളിക്കാം: +**ഗ്രൂപ്പിംഗ്** സാധാരണയായി ഇക്സ്‌സൽ Pivot table പോലുള്ള ഫലം ഉളവാക്കാൻ ഉപയോഗിക്കുന്നു. ഉദാഹരണത്തിന്, `LenB` അടിസ്ഥാനത്തിൽ `A`-യുടെ ശരാശരി കണക്കിക്കുക. ആിനുവേണ്ടി `LenB` ബൈ ഗ്രൂപ്പ് ചെയ്ത് `mean` വിളിക്കാം: ```python df.groupby(by='LenB')[['A','DivA']].mean() ``` -`mean`-ഉം ഗ്രൂപ്പിലെ മൂല്യങ്ങളുടെ എണ്ണം കണക്കാക്കേണ്ടതുണ്ടെങ്കിൽ, കൂടുതൽ സങ്കീർണ്ണമായ `aggregate` ഫംഗ്ഷൻ ഉപയോഗിക്കാം: + ശരാശരി കൂടാതെ ഗൂപ്പിൽ ഉള്ള എളേക്ക് എണ്ണം കണക്കാക്കേണ്ടെങ്കിൽ കൂടുതൽ സങ്കീർണ്ണമായ `aggregate` ഉപയോഗിക്കാം: ```python df.groupby(by='LenB') \ .aggregate({ 'DivA' : len, 'A' : lambda x: x.mean() }) \ .rename(columns={ 'DivA' : 'Count', 'A' : 'Mean'}) ``` -ഇത് താഴെപ്പറയുന്ന പട്ടിക നൽകും: +ഇനി താഴെകൊടുത്ത പട്ടിക ലഭിക്കും: | LenB | Count | Mean | | ---- | ----- | -------- | @@ -191,98 +191,98 @@ df.groupby(by='LenB') \ | 4 | 3 | 6.333333 | | 6 | 2 | 6.000000 | -### ഡാറ്റ നേടൽ -നാം Python ഒബ്ജക്റ്റുകളിൽ നിന്ന് Series, DataFrames എളുപ്പത്തിൽ നിർമ്മിക്കാമെന്ന് കണ്ടു. എന്നാൽ, ഡാറ്റ സാധാരണയായി ഒരു ടെക്സ്റ്റ് ഫയലോ, Excel പട്ടികയോ ആയിരിക്കും. ഭാഗ്യവശാൽ, Pandas നമുക്ക് ഡിസ്‌കിൽ നിന്ന് ഡാറ്റ ലോഡ് ചെയ്യാനുള്ള ഒരു ലളിതമായ മാർഗം നൽകുന്നു. ഉദാഹരണത്തിന്, CSV ഫയൽ വായിക്കുന്നത് ഇത്ര എളുപ്പമാണ്: +### ഡാറ്റ ലഭ്യമാക്കൽ + + +Python objects ൽ നിന്ന് Series നും DataFrames നും എളുപ്പത്തിൽ എങ്ങനെ നിർമ്മിക്കാമെന്ന് നാം കണ്ടു. എന്നിരുന്നാലും, ഡാറ്റ സാധാരണയായി ഒരു ടെക്സ്റ്റ് ഫയലിന്റെ രൂപത്തിലോ ഒരു Excel പട്ടികയുടെ രൂപത്തിലോ വരും. ഭാഗ്യം കൊണ്ടാണ്, Pandas നമുക്ക് ഡിസ്കിൽ നിന്ന് ഡാറ്റ ലോഡ് ചെയ്യാനുള്ള ഒരു ലളിതമായ രീതി നൽകുന്നത്. ഉദാഹരണത്തിന്, CSV ഫയൽ റീഡ് ചെയ്യുന്നത് ഇതുപോലെയാണ്: ```python df = pd.read_csv('file.csv') ``` +ഡാറ്റ ലോഡിംഗ് സംബന്ധിച്ച കൂടുതൽ ഉദാഹരണങ്ങൾ, അടക്കം പുറത്തുള്ള വെബ് സൈറ്റുകളിൽ നിന്ന് ഡാറ്റ എങ്ങനെ പകർത്താം എന്നതാണ് "ചാലഞ്ച്" സെക്ഷനിൽ കാണുക -ഡാറ്റ ലോഡിംഗിന്റെ കൂടുതൽ ഉദാഹരണങ്ങൾ, പുറം വെബ് സൈറ്റുകളിൽ നിന്ന് ഡാറ്റ എടുക്കുന്നതും ഉൾപ്പെടെ, "ചലഞ്ച്" വിഭാഗത്തിൽ കാണാം. - - -### പ്രിന്റിംഗ് ആൻഡ് പ്ലോട്ടിംഗ് +### പ്രിന്റിംഗ് және പ്ലോട്ടിംഗ് -ഒരു ഡാറ്റ സയന്റിസ്റ്റ് പലപ്പോഴും ഡാറ്റ എക്സ്പ്ലോർ ചെയ്യേണ്ടതുണ്ടാകുന്നു, അതിനാൽ അത് ദൃശ്യവൽക്കരിക്കാൻ കഴിയുന്നത് പ്രധാനമാണ്. DataFrame വലുതായിരിക്കുമ്പോൾ, പലപ്പോഴും നാം ശരിയായി പ്രവർത്തിക്കുന്നുണ്ടോ എന്ന് ഉറപ്പാക്കാൻ ആദ്യ കുറച്ച് വരികൾ മാത്രം പ്രിന്റ് ചെയ്യാൻ ആഗ്രഹിക്കുന്നു. ഇത് `df.head()` വിളിച്ച് ചെയ്യാം. നിങ്ങൾ Jupyter Notebook ൽ ഇത് റൺ ചെയ്താൽ, DataFrame ഒരു മനോഹരമായ പട്ടിക രൂപത്തിൽ പ്രിന്റ് ചെയ്യും. +ഒരു ഡാറ്റ സയന്റിസ്റ്റിന് ഡാറ്റഎക്സ്‌പ്ലോർ ചെയ്യേണ്ടതുണ്ടാകുമ്പോൾ, അത് വിസ്വലൈസ് ചെയ്യുക വളരെ പ്രധാനമാണ്. DataFrame വലിയതായിരിക്കുമ്പോൾ, നാം സാധാരണയായി ചെയ്യുന്നത് ശരിയാണെന്ന് ഉറപ്പാക്കാൻ ആദ്യത്തെ കുറച്ച് വരികൾ മാത്രം പ്രിന്റ് ചെയ്യുക എന്നതാണ്. ഇത് `df.head()` വിളിച്ച് ചെയ്യാം. Jupyter Notebook ൽ ഇത് ഓടിക്കുന്നുവെങ്കിൽ, DataFrame ഒരു മനോഹരമായ പട്ടിക രൂപത്തിൽ പ്രിന്റ് ചെയ്യും. -നാം ചില കോളങ്ങൾ ദൃശ്യവൽക്കരിക്കാൻ `plot` ഫംഗ്ഷൻ ഉപയോഗിക്കുന്നതും കണ്ടു. `plot` പല ജോലികൾക്കും വളരെ ഉപകാരപ്രദമാണ്, കൂടാതെ `kind=` പാരാമീറ്റർ വഴി പല തരത്തിലുള്ള ഗ്രാഫുകൾ പിന്തുണയ്ക്കുന്നു, എന്നാൽ നിങ്ങൾക്ക് എപ്പോഴും കൂടുതൽ സങ്കീർണ്ണമായ ഒന്നും പ്ലോട്ട് ചെയ്യാൻ കച്ചവട `matplotlib` ലൈബ്രറി ഉപയോഗിക്കാം. ഡാറ്റ ദൃശ്യവൽക്കരണം വിശദമായി വേർതിരിച്ച കോഴ്‌സ് പാഠങ്ങളിൽ നാം പഠിക്കും. +നാം `plot` ഫങ്ഷന്റെ ഉപയോഗവും കണ്ടു, ചില കോളങ്ങളിലെ ഡാറ്റിസ് വിസ്വലൈസ് ചെയ്യാൻ. `plot` പല ജോലികൾക്കും വളരെ പ്രയോജനകാരിയാണ്, kind= പാരാമീറ്ററിലൂടെ പല തരത്തിലുള്ള ഗ്രാഫുകൾ പിന്തുണയ്ക്കുന്നു. എങ്കിലും ദോഷം കൂടുതൽ സങ്കീർണ്ണമായ എന്തെങ്കിലും പ്ലോട്ട് ചെയ്യാൻ കഴിയും raw `matplotlib` ലൈബ്രറി ഉപയോഗിക്കാം. ഡാറ്റ വിസ്വലൈസേഷൻ വിശദമായി വ്യത്യസ്ത കോഴ്സ് പാഠങ്ങളിൽ പ്രത്യേകം പരിഗണിക്കും. -ഈ അവലോകനം Pandas ന്റെ ഏറ്റവും പ്രധാനപ്പെട്ട ആശയങ്ങൾ ഉൾക്കൊള്ളുന്നു, എങ്കിലും ലൈബ്രറി വളരെ സമ്പന്നമാണ്, അതിൽ നിങ്ങൾ ചെയ്യാൻ കഴിയുന്ന കാര്യങ്ങൾക്ക് പരിധിയില്ല! ഇപ്പോൾ നാം ഈ അറിവ് പ്രത്യേക പ്രശ്നങ്ങൾ പരിഹരിക്കാൻ പ്രയോഗിക്കാം. +Pandas ന്റെ ഏറ്റവും പ്രധാനപ്പെട്ട നിലപാടുകൾ ഇതിൽ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്, എങ്കിലും ലൈബ്രറി വളരെ സമ്പന്നമാണ്, അതിൽ നിങ്ങൾക്ക് ചെയ്യാനാകുന്ന കാര്യങ്ങൾക്ക് അതിരില്ല! ഇപ്പോൾ ഈ അറിവ് ഉപയോഗിച്ച് ഒരു പ്രത്യേക പ്രശ്നം പരിഹരിക്കാം. -## 🚀 ചലഞ്ച് 1: COVID വ്യാപനം വിശകലനം +## 🚀 ചാലഞ്ച് 1: COVID പ്രചരണം വിശകലനം -നാം ശ്രദ്ധിക്കാനിരിക്കുന്ന ആദ്യ പ്രശ്നം COVID-19 മഹാമാരിയുടെ വ്യാപനം മോഡലിംഗ് ആണ്. അതിനായി, വിവിധ രാജ്യങ്ങളിലെ ബാധിതരുടെ എണ്ണം സംബന്ധിച്ച ഡാറ്റ ഉപയോഗിക്കും, ഇത് [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) [Johns Hopkins University](https://jhu.edu/) നൽകുന്നു. ഡാറ്റാസെറ്റ് [ഈ GitHub റിപോസിറ്ററിയിൽ](https://github.com/CSSEGISandData/COVID-19) ലഭ്യമാണ്. +ഏറ്റവും ആദ്യത്തെ പ്രശ്നം നാം ശ്രദ്ധിക്കുന്നതു COVID-19 പകർച്ച രോഗത്തിന്റെ മോഡലിംഗ് ആണ്. ഇത് ചെയ്യാൻ, വ്യത്യസ്ത രാജ്യങ്ങളിലുള്ള ബാധితരുടെയും എണ്ണം സംബന്ധിച്ച ഡാറ്റ ഉപയോഗിക്കും, ഇത് [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) അവരുടെ വെബ്സൈറ്റിൽ നിന്നും [Johns Hopkins University](https://jhu.edu/) നൽകുന്നു. ഡാറ്റാ സെറ്റ് [ഈ GitHub റീപ്പോസിറ്ററിയിൽ](https://github.com/CSSEGISandData/COVID-19) ലഭ്യമാണ്. -ഡാറ്റ കൈകാര്യം ചെയ്യുന്നത് എങ്ങനെ എന്ന് കാണിക്കാൻ, നിങ്ങൾക്ക് [`notebook-covidspread.ipynb`](notebook-covidspread.ipynb) തുറന്ന് മുകളിൽ നിന്ന് താഴേക്ക് വായിക്കാൻ ഞങ്ങൾ ക്ഷണിക്കുന്നു. സെല്ലുകൾ പ്രവർത്തിപ്പിക്കാനും, അവസാനം നാം നിങ്ങൾക്കായി വെച്ച ചില ചലഞ്ചുകൾ ചെയ്യാനും കഴിയും. +ഡാറ്റ കൈകാര്യം ചെയ്യുന്നത് എങ്ങനെയാണ് എന്നതറിയിക്കുന്നതിന്, നിങ്ങൾക്ക് [`notebook-covidspread.ipynb`](notebook-covidspread.ipynb) തുറന്ന് മേലിൽ നിന്ന് താഴേക്ക് വായിക്കണമെന്നും നിർദ്ദേശിക്കുന്നു. നിങ്ങൾ സെല്ലുകൾ പ്രവർത്തിപ്പിക്കാനും, അവസാനം നാം കൊടുത്തിരിക്കുന്ന ചില ചാലഞ്ചുകൾ ചെയ്യാനും കഴിയും. ![COVID Spread](../../../../translated_images/ml/covidspread.f3d131c4f1d260ab.webp) -> Jupyter Notebook ൽ കോഡ് എങ്ങനെ റൺ ചെയ്യാമെന്ന് അറിയില്ലെങ്കിൽ, [ഈ ലേഖനം](https://soshnikov.com/education/how-to-execute-notebooks-from-github/) കാണുക. +> Jupyter Notebook ൽ കോഡ് എങ്ങനെ പ്രവർത്തിപ്പിക്കാമെന്ന് അറിയില്ലെങ്കിൽ, [ഈ ലേഖനം](https://soshnikov.com/education/how-to-execute-notebooks-from-github/) കാണുക. ## അസംഘടിത ഡാറ്റയുമായി പ്രവർത്തിക്കൽ -ഡാറ്റ സാധാരണയായി പട്ടിക രൂപത്തിലാണ് ലഭിക്കുന്നത്, എന്നാൽ ചില സാഹചര്യങ്ങളിൽ കുറച്ച് കുറവുള്ള ഘടനയുള്ള ഡാറ്റ, ഉദാഹരണത്തിന്, ടെക്സ്റ്റ് അല്ലെങ്കിൽ ചിത്രങ്ങൾ, കൈകാര്യം ചെയ്യേണ്ടിവരും. ഈ സാഹചര്യത്തിൽ, മുകളിൽ കണ്ട ഡാറ്റ പ്രോസസ്സിംഗ് സാങ്കേതികവിദ്യകൾ പ്രയോഗിക്കാൻ, നാം somehow **ഘടനയുള്ള** ഡാറ്റ **എക്സ്ട്രാക്റ്റ്** ചെയ്യേണ്ടതുണ്ട്. ചില ഉദാഹരണങ്ങൾ: +ഡാറ്റ സാധാരണയായി പട്ടിക രൂപത്തിലാണ് ഉണ്ടാകാറുള്ളത്, പക്ഷേ ചില സാഹചര്യങ്ങളിൽ കുറവുള്ള ഘടനയുള്ള ഡാറ്റയെ കൈകാര്യം ചെയ്യേണ്ടി വരും, ഉദാഹരണത്തിന് ടെക്സ്റ്റ് അല്ലെങ്കിൽ ചിത്രങ്ങൾ. ഇതിൽ മുകളിൽ കാണുന്നതുപോലെ ഡാറ്റ പ്രോസസിംഗ് സാങ്കേതിക വിദ്യകൾ പ്രയോഗിക്കാൻ, ഞങ്ങൾ **ഘടനയുള്ള** ഡാറ്റ എക്സ്ട്രാക്റ്റ് ചെയ്യേണ്ടതുണ്ട്. ചില ഉദാഹരണങ്ങൾ: -* ടെക്സ്റ്റിൽ നിന്നുള്ള കീവേഡുകൾ എടുക്കുകയും ആ കീവേഡുകൾ എത്രത്തോളം പ്രത്യക്ഷപ്പെടുന്നു എന്ന് കാണുകയും ചെയ്യുക -* ചിത്രത്തിലെ വസ്തുക്കൾ സംബന്ധിച്ച വിവരങ്ങൾ എടുക്കാൻ ന്യൂറൽ നെറ്റ്വർക്കുകൾ ഉപയോഗിക്കുക -* വീഡിയോ ക്യാമറ ഫീഡിൽ ആളുകളുടെ വികാരങ്ങളെക്കുറിച്ചുള്ള വിവരങ്ങൾ നേടുക +* ടെക്സ്റ്റിൽ നിന്നുള്ള കീ-വാക്കുകൾ എടുക്കൽ, അവ എത്രത്തോളം പ്രത്യക്ഷപ്പെടുന്നു എന്ന് കാണൽ +* ചിത്രത്തിലെ വസ്തുക്കളുടെ വിവരങ്ങൾ എടുക്കാൻ ന്യൂറൽ നെറ്റ്വർക്ക് ഉപയോഗിക്കൽ +* വീഡിയോ ക്യാമറ ഫീഡിൽ ആളുകളുടെ വികാരം സംബന്ധിച്ച വിവരങ്ങൾ നേടൽ -## 🚀 ചലഞ്ച് 2: COVID പേപ്പറുകൾ വിശകലനം +## 🚀 ചാലഞ്ച് 2: COVID പേപ്പറുകൾ വിശകലനം -ഈ ചലഞ്ചിൽ, COVID മഹാമാരിയുടെ വിഷയത്തിൽ ശാസ്ത്രീയ പേപ്പറുകൾ പ്രോസസ്സ് ചെയ്യുന്നതിൽ നാം തുടരും. COVID സംബന്ധിച്ച 7000-ലധികം പേപ്പറുകൾ (എഴുതിയ സമയത്ത്) ഉള്ള [CORD-19 Dataset](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) ഉണ്ട്, മെടാഡേറ്റയും ആബ്സ്ട്രാക്റ്റുകളും ഉൾപ്പെടെ (അവയിൽ പകുതിയിലധികത്തിനും പൂർണ്ണ ടെക്സ്റ്റും ലഭ്യമാണ്). +ഈ ചാലഞ്ചിൽ, COVID മഹാമാരിയുടെ വിഷയത്തെ തുടർന്നും ശ്രദ്ധിക്കാം, വിഷയം സംബന്ധിച്ച ശാസ്ത്രീയ പേപ്പറുകൾ പ്രോസസ് ചെയ്യുന്നതിൽ കേന്ദ്രീകരിക്കാം. [CORD-19 Dataset](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) എന്നത് COVID സംബന്ധിച്ച 7000-ത്തിലധികം പേപ്പറുകൾ (ഈ എഴുത്തിന്റെ സമയത്ത്) ഉൾപ്പെടുന്ന ഒരു ഡാറ്റാസെറ്റ് ആണ്, മെടാഡാറ്റയും മുഖ്യഭാഗവും ലഭ്യമാണ് (അരയടിയിൽ പൂർണ്ണ എഴുത്തും ഉള്ളവയ്ക്കായി). -[Text Analytics for Health](https://docs.microsoft.com/azure/cognitive-services/text-analytics/how-tos/text-analytics-for-health/?WT.mc_id=academic-77958-bethanycheum) കോഗ്നിറ്റീവ് സർവീസ് ഉപയോഗിച്ച് ഈ ഡാറ്റാസെറ്റ് വിശകലനം ചെയ്യുന്ന ഒരു പൂർണ്ണ ഉദാഹരണം [ഈ ബ്ലോഗ് പോസ്റ്റിൽ](https://soshnikov.com/science/analyzing-medical-papers-with-azure-and-text-analytics-for-health/) വിശദീകരിച്ചിരിക്കുന്നു. നാം ഈ വിശകലനത്തിന്റെ ലളിതമായ പതിപ്പ് ചർച്ച ചെയ്യും. +[Text Analytics for Health](https://docs.microsoft.com/azure/cognitive-services/text-analytics/how-tos/text-analytics-for-health/?WT.mc_id=academic-77958-bethanycheum) കോഗ്നിറ്റീവ് സർവീസ് ഉപയോഗിച്ച് ഈ ഡാറ്റാസെറ്റ് വിശകലനം ചെയ്യുന്നതിന്റെ ഒരു പൂര്‍ണ ഉദാഹരണം [ഈ ബ്ലോഗ് പോസ്റ്റിൽ](https://soshnikov.com/science/analyzing-medical-papers-with-azure-and-text-analytics-for-health/) വിവരണം ലഭ്യമാണ്.прост simplified പതിപ്പ് നാം ചർച്ച ചെയ്യും. -> **കുറിപ്പ്**: ഈ റിപോസിറ്ററിയുടെ ഭാഗമായിട്ടുള്ള ഡാറ്റാസെറ്റ് നമുക്ക് നൽകുന്നില്ല. ആദ്യം [Kaggle](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) ൽ നിന്നുള്ള [`metadata.csv`](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) ഫയൽ ഡൗൺലോഡ് ചെയ്യേണ്ടതുണ്ടാകും. Kaggle ൽ രജിസ്ട്രേഷൻ ആവശ്യമായിരിക്കാം. രജിസ്ട്രേഷൻ ഇല്ലാതെ [ഇവിടെ](https://ai2-semanticscholar-cord-19.s3-us-west-2.amazonaws.com/historical_releases.html) നിന്നും ഡാറ്റാസെറ്റ് ഡൗൺലോഡ് ചെയ്യാം, എന്നാൽ അത് മെടാഡേറ്റ ഫയലിനൊപ്പം എല്ലാ പൂർണ്ണ ടെക്സ്റ്റുകളും ഉൾക്കൊള്ളും. +> **NOTE**: ഈ റീപ്പോസിറ്ററിയിൽ ഡാറ്റാസെറ്റ് ഒരു കോപ്പി നൽകുന്നില്ല. ദയവായി ആദ്യം [Kaggle ൽ നിന്നും](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) `metadata.csv` ഫയൽ ഡൗൺലോഡ് ചെയ്യേണ്ടതുണ്ട്. Kaggle ഇൽ രജിസ്റ്റർ ചെയ്യേണ്ടിവരുമെന്ന് ശ്രദ്ധിക്കുക. രജിസ്ട്രേഷൻ ഇല്ലാതെ ഡാറ്റാസെറ്റ് [ഇവിടെ](https://ai2-semanticscholar-cord-19.s3-us-west-2.amazonaws.com/historical_releases.html) നിന്ന് ഡൗൺലോഡ് ചെയ്യാം, എങ്കിലും അത് മെടാഡാറ്റ ഫയലിനൊപ്പം മുഴുവൻ പൂർണ്ണ എഴുത്തുകൾ ഉൾക്കൊള്ളും. -[`notebook-papers.ipynb`](notebook-papers.ipynb) തുറന്ന് മുകളിൽ നിന്ന് താഴേക്ക് വായിക്കുക. സെല്ലുകൾ പ്രവർത്തിപ്പിക്കാനും, അവസാനം നാം നിങ്ങൾക്കായി വെച്ച ചില ചലഞ്ചുകൾ ചെയ്യാനും കഴിയും. + [`notebook-papers.ipynb`](notebook-papers.ipynb) തുറന്ന് മുകളിൽ നിന്ന് താഴേക്ക് വായിക്കുക. സെല്ലുകൾ പ്രവർത്തിപ്പിക്കുകയും അവസാനം നാം കൊടുത്തിരുന്ന ചില ചാലഞ്ചുകൾ ചെയ്യുകയും ചെയ്യാം. ![Covid Medical Treatment](../../../../translated_images/ml/covidtreat.b2ba59f57ca45fbc.webp) -## ചിത്ര ഡാറ്റ പ്രോസസ്സിംഗ് +## ഇമേജ് ഡാറ്റ പ്രോസസിംഗ് -സമീപകാലത്ത്, ചിത്രങ്ങൾ മനസ്സിലാക്കാൻ സഹായിക്കുന്ന ശക്തമായ AI മോഡലുകൾ വികസിപ്പിച്ചിരിക്കുന്നു. മുൻകൂട്ടി പരിശീലിപ്പിച്ച ന്യൂറൽ നെറ്റ്വർക്കുകൾ അല്ലെങ്കിൽ ക്ലൗഡ് സർവീസുകൾ ഉപയോഗിച്ച് പല ജോലികളും പരിഹരിക്കാം. ചില ഉദാഹരണങ്ങൾ: +അടുത്തകാലിൽ, വളരെ ശക്തമായ AI മോഡലുകൾ വികസിപ്പിച്ചിട്ടുണ്ട്, ഇവ നമ്മുക്ക് ചിത്രങ്ങൾ മനസ്സിലാക്കാൻ സഹായിക്കുന്നു. മുൻ പരിശീലിത ന്യൂറൽ നെറ്റ്വർക്കുകൾ അല്ലെങ്കിൽ ക്ലൗഡ് സർവീസുകൾ ഉപയോഗിച്ച് പല ജോലികളും പരിഹരിക്കാം. ചില ഉദാഹരണങ്ങൾ: -* **ചിത്ര വർഗ്ഗീകരണം**, ഇത് ചിത്രത്തെ മുൻകൂട്ടി നിർവചിച്ച ക്ലാസ്സുകളിൽ ഒന്നിലേക്കു വർഗ്ഗീകരിക്കാൻ സഹായിക്കും. [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) പോലുള്ള സർവീസുകൾ ഉപയോഗിച്ച് നിങ്ങൾക്ക് നിങ്ങളുടെ സ്വന്തം ചിത്ര വർഗ്ഗീകരണ മോഡലുകൾ എളുപ്പത്തിൽ പരിശീലിപ്പിക്കാം -* **വസ്തു കണ്ടെത്തൽ**, ചിത്രത്തിലെ വ്യത്യസ്ത വസ്തുക്കൾ കണ്ടെത്താൻ. [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) പോലുള്ള സർവീസുകൾ സാധാരണ വസ്തുക്കൾ കണ്ടെത്തും, കൂടാതെ നിങ്ങൾക്ക് [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) മോഡൽ പരിശീലിപ്പിച്ച് പ്രത്യേക വസ്തുക്കൾ കണ്ടെത്താം. -* **മുഖം കണ്ടെത്തൽ**, പ്രായം, ലിംഗം, വികാരങ്ങൾ ഉൾപ്പെടെ. ഇത് [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) വഴി ചെയ്യാം. +* **ഇമേജ് ക്ലാസിഫിക്കേഷൻ:** ചിത്രത്തെ മുൻ నిర్ణയിച്ച ക്ലാസ്സുകളിലൊന്നായി ವರ್ಗീകരിക്കാൻ സഹായിക്കുന്നു. [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) പോലുള്ള സർവീസുകൾ ഉപയോഗിച്ച് നിങ്ങളുടെ സ്വന്തം ഇമേജ് ക്ലാസിഫയർമാരെ പരിശീലിപ്പിക്കാവുന്നതാണ് +* **ആബ്ജക്ട് ഡിറ്റക്ഷൻ:** ചിത്രത്തിലുള്ള വ്യത്യസ്ത വസ്തുക്കൾ കണ്ടെത്തൽ. [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) പോലുള്ള സർവീസുകൾ പല സാധാരണ വസ്തുക്കൾ കണ്ടെത്തും, [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) മോഡൽ ഉപയോഗിച്ച് നിങ്ങൾക്കു ചില പ്രത്യേക വസ്തുക്കൾ കണ്ടെത്താനും കഴിയും. +* **ഫേസ് ഡിറ്റക്ഷൻ:** പ്രായം, ലൈംഗികത, വികാരങ്ങൾ അടക്കം തിരിച്ചറിയൽ. ഇത് [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് ചെയ്യാം. -ഈ ക്ലൗഡ് സർവീസുകൾ [Python SDKs](https://docs.microsoft.com/samples/azure-samples/cognitive-services-python-sdk-samples/cognitive-services-python-sdk-samples/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് വിളിക്കാം, അതിനാൽ നിങ്ങളുടെ ഡാറ്റ എക്സ്പ്ലോറേഷൻ പ്രവൃത്തി പ്രവാഹത്തിൽ എളുപ്പത്തിൽ ഉൾപ്പെടുത്താം. +ഈ ക്ളൗഡ് സർവീസുകൾ [Python SDKs](https://docs.microsoft.com/samples/azure-samples/cognitive-services-python-sdk-samples/cognitive-services-python-sdk-samples/?WT.mc_id=academic-77958-bethanycheum) വഴി വിളിപ്പിച്ച് നിങ്ങളുടെ ഡാറ്റ എക്സ്‌പ്ലോറേഷൻ പ്രവൃത്തി പ്രവാഹത്തിൽ എളുപ്പത്തിൽ ഉൾപ്പെടുത്താവുന്നതാണ്. -ചിത്ര ഡാറ്റ സ്രോതസ്സുകളിൽ നിന്നുള്ള ഡാറ്റ എങ്ങനെ എക്സ്പ്ലോർ ചെയ്യാമെന്ന് ചില ഉദാഹരണങ്ങൾ: -* [How to Learn Data Science without Coding](https://soshnikov.com/azure/how-to-learn-data-science-without-coding/) എന്ന ബ്ലോഗ് പോസ്റ്റിൽ, നാം Instagram ഫോട്ടോകൾ പരിശോധിച്ച്, ആളുകൾ ഒരു ഫോട്ടോയ്ക്ക് കൂടുതൽ ലൈക്കുകൾ നൽകാൻ കാരണമായത് എന്താണെന്ന് മനസ്സിലാക്കാൻ ശ്രമിക്കുന്നു. ആദ്യം [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് ചിത്രങ്ങളിൽ നിന്ന് കൂടുതൽ വിവരങ്ങൾ എടുക്കുന്നു, പിന്നീട് [Azure Machine Learning AutoML](https://docs.microsoft.com/azure/machine-learning/concept-automated-ml/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് വ്യാഖ്യാനയോഗ്യമായ മോഡൽ നിർമ്മിക്കുന്നു. -* [Facial Studies Workshop](https://github.com/CloudAdvocacy/FaceStudies) ൽ, നാം [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് ഇവന്റുകളിൽ നിന്നുള്ള ഫോട്ടോകളിലെ ആളുകളുടെ വികാരങ്ങൾ എടുക്കുന്നു, ആളുകൾ സന്തോഷവാന്മാരാകാൻ കാരണമായത് എന്താണെന്ന് മനസ്സിലാക്കാൻ. +ഇമേജ് ഡാറ്റാ സ്രോതസ്സുകളിൽ നിന്നുള്ള ഡാറ്റ എക്സ്പ്ലോറേഷനെക്കുറിച്ചുള്ള ചില ഉദാഹരണങ്ങൾ: +* [How to Learn Data Science without Coding](https://soshnikov.com/azure/how-to-learn-data-science-without-coding/) എന്ന ബ്ലോഗ് പോസ്റ്റിൽ, നമ്മൾ Instagram ചിത്രങ്ങൾ പരിശോധിക്കുന്നു, ഒരു ചിത്രം കൂടുതൽ ലൈക്കുകൾ നേടുന്നത് എന്തുകൊണ്ടാണെന്ന് മനസ്സിലാക്കാൻ. ആദ്യം [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ഉപയോജിച്ച് ചിത്രങ്ങളിൽ നിന്നുള്ള όσο കൂടുതൽ വിവരവും എടുക്കുകയും, പിന്നീട് [Azure Machine Learning AutoML](https://docs.microsoft.com/azure/machine-learning/concept-automated-ml/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് വ്യാഖ്യാനം ചെയ്യാവുന്ന മോഡൽ നിർമ്മിക്കുകയും ചെയ്യുന്നു. +* [Facial Studies Workshop](https://github.com/CloudAdvocacy/FaceStudies) ൽ നാം [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ഉപയോഗിച്ച് സംഭവങ്ങളുടെ ഫോട്ടോകളിലെ ആൾക്കാർക്ക് ഉള്ള വികാരങ്ങൾ എടുക്കുകയും, ഏത് കാരണത്താൽ ആളുകൾ സന്തോഷവാനാകുന്നുവെന്ന് മനസ്സിലാക്കാൻ ശ്രമിക്കുകയും ചെയ്യുന്നു. -## സമാപനം +## നിഗമനം -നിങ്ങൾക്ക് ഘടനയുള്ളതോ അസംഘടിതമായതോ ആയ ഡാറ്റയുണ്ടാകട്ടെ, Python ഉപയോഗിച്ച് ഡാറ്റ പ്രോസസ്സിംഗ്, മനസ്സിലാക്കൽ എന്നിവയുമായി ബന്ധപ്പെട്ട എല്ലാ ഘട്ടങ്ങളും നിർവഹിക്കാം. ഇത് ഡാറ്റ പ്രോസസ്സിംഗിന് ഏറ്റവും ലവച്ഛമായ മാർഗമാണ്, അതുകൊണ്ടുതന്നെ ഭൂരിഭാഗം ഡാറ്റ സയന്റിസ്റ്റുകൾ Python പ്രധാന ഉപകരണമായി ഉപയോഗിക്കുന്നു. നിങ്ങളുടെ ഡാറ്റ സയൻസ് യാത്രയിൽ ഗൗരവമുണ്ടെങ്കിൽ Python ആഴത്തിൽ പഠിക്കുന്നത് നല്ല ആശയമാണ്! +നിങ്ങൾക്ക് ഘടനയുള്ളതോ അസംഘടിതമോ ആയ ഡാറ്റയുണ്ടെങ്കിലും Python ഉപയോഗിച്ച് ഡാറ്റ പ്രോസസിംഗിന്റെയും മനസിലാക്കലിന്റെയും എല്ലാ പടികളും ചെയ്യാം. ഇത് ഏറ്റവും വിമർശനാത്മകമായ ഡാറ്റ പ്രോസസിംഗ് മാർഗമാണ്, അതുകൊണ്ടുതന്നെ അധികം ഡാറ്റ സയന്റിസ്റ്റുകൾ Python നെ അവരുടെ പ്രധാന ഉപകരണമായി ഉപയോഗിക്കുന്നു. നിങ്ങളുടെ ഡേറ്റാ സയൻസ് യാത്രയിൽ സുതാര്യതയുണ്ട് എന്ന് നിങ്ങൾ കരുതുന്നുവെങ്കിൽ Python നന്നായി പഠിക്കൽ ഒരു നല്ല ആശയമാണെന്ന് തോന്നുന്നു! -## [പോസ്റ്റ്-ലെക്ചർ ക്വിസ്](https://ff-quizzes.netlify.app/en/ds/quiz/13) +## [പഠനാനന്തരം ക്വിസ്](https://ff-quizzes.netlify.app/en/ds/quiz/13) ## അവലോകനം & സ്വയം പഠനം **പുസ്തകങ്ങൾ** * [Wes McKinney. Python for Data Analysis: Data Wrangling with Pandas, NumPy, and IPython](https://www.amazon.com/gp/product/1491957662) -**ഓൺലൈൻ വിഭവങ്ങൾ** +**ഓൺലൈൻ റിസോഴ്സുകൾ** * ഔദ്യോഗിക [10 minutes to Pandas](https://pandas.pydata.org/pandas-docs/stable/user_guide/10min.html) ട്യൂട്ടോറിയൽ -* [Pandas Visualization](https://pandas.pydata.org/pandas-docs/stable/user_guide/visualization.html) ഡോക്യുമെന്റേഷൻ +* [Pandas Visualization ന്റെ ഡോക്യുമെന്റേഷൻ](https://pandas.pydata.org/pandas-docs/stable/user_guide/visualization.html) **Python പഠനം** -* [Learn Python in a Fun Way with Turtle Graphics and Fractals](https://github.com/shwars/pycourse) -* [Take your First Steps with Python](https://docs.microsoft.com/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) ലേണിംഗ് പാത്ത് +* [Turtle Graphics ഉം Fractals ഉം ഉപയോഗിച്ച് രസകരമായി Python പഠിക്കുക](https://github.com/shwars/pycourse) +* [Python ൽ നിങ്ങളുടെ ആദ്യ ചവിട്ടുകൾ എടുക്കുക](https://docs.microsoft.com/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) ലെ പഠന പാത ## അസൈൻമെന്റ് -[മുകളിൽ പറഞ്ഞ ചലഞ്ചുകൾക്കായി കൂടുതൽ വിശദമായ ഡാറ്റ പഠനം നടത്തുക](assignment.md) +[മുൻപ് പറഞ്ഞ ചാലഞ്ചുകൾക്ക് വേണ്ടി കൂടുതൽ വിശദമായ ഡാറ്റ പഠനങ്ങൾ നടത്തുക](assignment.md) -## ക്രെഡിറ്റുകൾ +## ക്രഡിറ്റുകൾ -ഈ പാഠം ♥️ കൊണ്ട് രചിച്ചത് [Dmitry Soshnikov](http://soshnikov.com) ആണ്. +ഈ പാഠം ♥️ കൊണ്ട് [Dmitry Soshnikov](http://soshnikov.com) എഴുതിയാണ് --- -**അസൂയാപത്രം**: -ഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖയാണ് പ്രാമാണികമായ ഉറവിടം എന്ന് പരിഗണിക്കേണ്ടതാണ്. നിർണായക വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല. +**അറിയിപ്പ്**: +ഈ രേഖ AI പരിഭാഷാ സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല. \ No newline at end of file diff --git a/translations/te/.co-op-translator.json b/translations/te/.co-op-translator.json index f79e5047..efb1891f 100644 --- a/translations/te/.co-op-translator.json +++ b/translations/te/.co-op-translator.json @@ -96,8 +96,8 @@ "language_code": "te" }, "2-Working-With-Data/07-python/README.md": { - "original_hash": "7bfec050f4717dcc2dfd028aca9d21f3", - "translation_date": "2025-12-19T15:29:16+00:00", + "original_hash": "fb29e3e0be486fe8f15d50bdade79eb1", + "translation_date": "2026-07-17T17:49:12+00:00", "source_file": "2-Working-With-Data/07-python/README.md", "language_code": "te" }, diff --git a/translations/te/2-Working-With-Data/07-python/README.md b/translations/te/2-Working-With-Data/07-python/README.md index 8feb3f02..e3e22891 100644 --- a/translations/te/2-Working-With-Data/07-python/README.md +++ b/translations/te/2-Working-With-Data/07-python/README.md @@ -1,62 +1,62 @@ -# డేటాతో పని చేయడం: పైథాన్ మరియు పాండాస్ లైబ్రరీ +# డేటాతో పని చేయడం: పైన్తన్ మరియు పాండాస్ లైబ్రరీ | ![ Sketchnote by [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/07-WorkWithPython.png) | | :-------------------------------------------------------------------------------------------------------: | -| Python తో పని చేయడం - _Sketchnote by [@nitya](https://twitter.com/nitya)_ | +| పైన్తన్‌తో పని చేయడం - _Sketchnote by [@nitya](https://twitter.com/nitya)_ | [![Intro Video](../../../../translated_images/te/video-ds-python.245247dc811db8e4.webp)](https://youtu.be/dZjWOGbsN4Y) -డేటాబేసులు డేటాను నిల్వ చేయడానికి మరియు క్వెరీ భాషలను ఉపయోగించి వాటిని క్వెరీ చేయడానికి చాలా సమర్థవంతమైన మార్గాలను అందించినప్పటికీ, డేటాను ప్రాసెస్ చేయడానికి అత్యంత అనుకూలమైన మార్గం మీ స్వంత ప్రోగ్రామ్ రాయడం. చాలా సందర్భాల్లో, డేటాబేస్ క్వెరీ చేయడం మరింత సమర్థవంతమైన మార్గం అవుతుంది. అయితే, కొన్ని సందర్భాల్లో, మరింత సంక్లిష్టమైన డేటా ప్రాసెసింగ్ అవసరం అయితే, అది SQL ఉపయోగించి సులభంగా చేయలేము. -డేటా ప్రాసెసింగ్ ఏ ప్రోగ్రామింగ్ భాషలోనైనా ప్రోగ్రామ్ చేయవచ్చు, కానీ డేటాతో పని చేయడంలో కొంతమంది భాషలు ఉన్నత స్థాయిలో ఉంటాయి. డేటా సైంటిస్టులు సాధారణంగా క్రింది భాషలలో ఒకదాన్ని ఇష్టపడతారు: +డేటాబేసులు డేటాను నిల్వ చేసేందుకు మరియు వాటిని క్వెరీ భాషలను ఉపయోగించి ప్రశ్నించేందుకు చాలా సమర్థవంతమైన మార్గాలను అందించినప్పటికీ, డేటాను ప్రాసెస్ చేసే అత్యంత అనువర్తన మార్గం మీ స్వంత ప్రోగ్రామ్ రాయడం ద్వారా డేటాను మేనేజు చేయడమే. చాలా సందర్భాల్లో, డేటాబేస్ క్వెరీ చేయడం మరింత సమర్థవంతమైన మార్గం అవుతుంది. కానీ కొంత క్లిష్టమైన డేటా ప్రాసెసింగ్ అవసరమైతే, SQL ఉపయోగించి దీన్ని సులువుగా చేయలేము. +డేటా ప్రాసెసింగ్‌ను ఏదైనా ప్రోగ్రామింగ్ భాషలో ప్రోగ్రామ్ చేయవచ్చు, కానీ డేటాతో పని చేసే అంశంలో కొంత మంది భాషలు ఉన్నత స్థాయికి చెందినవిగా పరిగణించబడతాయి. డేటా శాస్త్రవేత్తలు సాధారణంగా క్రింది భాషలలో ఒకదానిని ప్రాధాన్యం ఇస్తారు: -* **[Python](https://www.python.org/)**, ఒక సాధారణ ప్రయోజన ప్రోగ్రామింగ్ భాష, ఇది సులభత కారణంగా ప్రారంభకులకు ఉత్తమ ఎంపికలలో ఒకటిగా పరిగణించబడుతుంది. పైథాన్‌లో అనేక అదనపు లైబ్రరీలు ఉన్నాయి, ఇవి మీకు అనేక ప్రాక్టికల్ సమస్యలను పరిష్కరించడంలో సహాయపడతాయి, ఉదాహరణకు ZIP ఆర్కైవ్ నుండి డేటాను తీసుకోవడం లేదా చిత్రాన్ని గ్రేస్కేల్‌గా మార్చడం. డేటా సైన్స్‌కు అదనంగా, పైథాన్ వెబ్ డెవలప్‌మెంట్ కోసం కూడా తరచుగా ఉపయోగిస్తారు. -* **[R](https://www.r-project.org/)** ఒక సాంప్రదాయ టూల్‌బాక్స్, ఇది గణాంక డేటా ప్రాసెసింగ్ దృష్టితో అభివృద్ధి చేయబడింది. ఇది పెద్ద లైబ్రరీ రిపాజిటరీ (CRAN) కలిగి ఉంది, ఇది డేటా ప్రాసెసింగ్‌కు మంచి ఎంపిక. అయితే, R సాధారణ ప్రయోజన ప్రోగ్రామింగ్ భాష కాదు, మరియు డేటా సైన్స్ డొమైన్ వెలుపల అరుదుగా ఉపయోగిస్తారు. -* **[Julia](https://julialang.org/)** మరొక భాష, ఇది ప్రత్యేకంగా డేటా సైన్స్ కోసం అభివృద్ధి చేయబడింది. ఇది పైథాన్ కంటే మెరుగైన పనితీరు ఇవ్వడానికి ఉద్దేశించబడింది, ఇది శాస్త్రీయ ప్రయోగాలకు గొప్ప సాధనం. +* **[Python](https://www.python.org/)**, సాధారణ ఉద్దేశ్య ప్రోగ్రామింగ్ భాష, ఇది సులభత్వం కారణంగా మొదటి ప్రారంభం కోసం గొప్ప ఎంపికగా భావించబడుతుంది. పైన్తన్‌కు అనేక అదనపు లైబ్రరీలు ఉన్నాయి, అవి మీకు అనేక వ్యవహార కష్టాలను పరిష్కరించడంలో సహాయపడతాయి, ఉదాహరణకు ZIP ఆర్కైవ్ నుండి డేటాను తీయడం, లేదా చిత్రాన్ని గ్రేస్కేల్‌కు మార్చడం. డేటా సైన్స్ తలచికంటే, పైన్తన్ వెబ్ డెవలప్‌మెంట్‌లో కూడా తరచుగా ఉపయోగిస్తారు. +* **[R](https://www.r-project.org/)** గణాంక డేటా ప్రాసెసింగ్ దృష్టితో అభివృద్ధి చేయబడిన సంప్రదాయ టూల్ బాక్స్. ఇది పెద్ద లైబ్రరీ భాండాగారం (CRAN) కలిగి ఉంది, ఇది డేటా ప్రాసెసింగ్ కోసం మంచి ఎంపిక. అయితే R సాధారణ ఉద్దేశ్య ప్రోగ్రామింగ్ భాష కాదు, మరియు డేటా సైన్స్ డొమైన్లో తప్ప మరెక్కడా తరచుగా ఉపయోగించబడదు. +* **[Julia](https://julialang.org/)** డేటా సైన్స్ కోసమే ప్రత్యేకంగా అభివృద్ధి చేయబడిన మరో భాష. ఇది పైన్తన్ కంటే మెరుగైన పనితనాన్ని ఇవ్వాలని ఉద్దేశించబడింది, విద్యుత్ ప్రయోగాలకు గొప్ప సాధనం. -ఈ పాఠంలో, మేము సులభమైన డేటా ప్రాసెసింగ్ కోసం పైథాన్ ఉపయోగంపై దృష్టి సారిస్తాము. భాషపై ప్రాథమిక పరిచయం ఉన్నట్లు భావిస్తాము. మీరు పైథాన్ లో మరింత లోతైన పర్యటన కోరుకుంటే, క్రింది వనరులలో ఒకదాన్ని చూడవచ్చు: +ఈ పాఠంలో, మనం సింపుల్ డేటా ప్రాసెసింగ్ కోసం పైన్తన్ ఉపయోగంపై దృష్టి పెట్టబోతున్నాం. భాష గురించి ప్రాథమిక పరిచయం ఉందని అనుకుంటున్నాం. మీరు పైన్తన్‌ను విస్తృతంగా తెలుసుకోవాలని కోరుకుంటే, క్రింది వనరులను చూడవచ్చు: -* [Learn Python in a Fun Way with Turtle Graphics and Fractals](https://github.com/shwars/pycourse) - GitHub ఆధారిత పైథాన్ ప్రోగ్రామింగ్ త్వరిత పరిచయ కోర్సు -* [Take your First Steps with Python](https://docs.microsoft.com/en-us/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) లో లెర్నింగ్ పాత్ +* [తురలరేఖల గ్రాఫిక్స్ మరియు ఫ్రాక్టల్స్ తో పైన్తన్ హాయిగా నేర్చుకోండి](https://github.com/shwars/pycourse) - GitHub ఆధారిత త్వరిత పరిచయ కోర్స్ +* [పైన్తన్‌తో మీ మొదటి అడుగులు వేయండి](https://docs.microsoft.com/en-us/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum)లో లెర్నింగ్ పాథ్ -డేటా అనేక రూపాల్లో ఉండవచ్చు. ఈ పాఠంలో, మేము మూడు రూపాల డేటాను పరిగణిస్తాము - **టేబులర్ డేటా**, **పాఠ్యం** మరియు **చిత్రాలు**. +డేటా అనేక రూపాల్లో వస్తుంది. ఈ పాఠంలో, మేము మూడు రూపాల డేటాను పరిశీలిస్తాము - **పట్టికా డేటా**, **పాఠ్యం** మరియు **చిత్రాలు**. -మేము డేటా ప్రాసెసింగ్ కొన్ని ఉదాహరణలపై దృష్టి సారిస్తాము, అన్ని సంబంధిత లైబ్రరీల పూర్తి అవలోకనం ఇవ్వకుండా. ఇది మీరు సాధ్యమైన ప్రధాన ఆలోచనను పొందడానికి మరియు మీకు అవసరమైనప్పుడు సమస్యలకు పరిష్కారాలు ఎక్కడ కనుగొనాలో అర్థం చేసుకోవడానికి సహాయపడుతుంది. +మేము అన్ని సంబంధిత లైబ్రరీల పూర్తి సమీక్ష కాకుండా కొన్ని డేటా ప్రాసెసింగ్ ఉదాహరణలపై దృష్టి పెట్టబోతున్నాం. దీన్ని మీరు అనుసరించడం ద్వారా ఏం సాధ్యం అవుతుందంటే ప్రాథమిక ఆలోచన తెలుసుకుంటారు, మరియు అవసరమైతే సమస్యలకు పరిష్కారాలు ఎక్కడెక్కడ కనుగొనాలో మీకు అవగాహన ఏర్పడుతుంది. -> **అత్యంత ఉపయోగకరమైన సలహా**. మీరు డేటాపై నిర్దిష్ట ఆపరేషన్ చేయాల్సిన అవసరం ఉన్నప్పుడు, మీరు ఎలా చేయాలో తెలియకపోతే, దాన్ని ఇంటర్నెట్‌లో శోధించండి. [Stackoverflow](https://stackoverflow.com/) సాధారణ పనుల కోసం పైథాన్‌లో చాలా ఉపయోగకరమైన కోడ్ నమూనాలను కలిగి ఉంటుంది. +> **అత్యంత ఉపయోగకరమైన సలహా**. మీరు డేటాపై ఒక నిర్దిష్ట ఆపరేషన్ చేయాల్సివుంటే మరియు దానికి పద్ధతి తెలియకపోతే, ఇంటర్నెట్‌లో దాన్ని వెతకండి. [Stackoverflow](https://stackoverflow.com/)లో చాలా ఉపయోగకరమైన పైన్తన్ కోడ్ నమూనాలు ఉంటాయి చాలా సాధారణ పనుల కోసం. -## [పూర్వ-లెక్చర్ క్విజ్](https://ff-quizzes.netlify.app/en/ds/quiz/12) +## [పాఠం ముందస్తు క్విజ్](https://ff-quizzes.netlify.app/en/ds/quiz/12) -## టేబులర్ డేటా మరియు డేటాఫ్రేమ్స్ +## పట్టికా డేటా మరియు డేటాఫ్రేమ్స్ -మేము రిలేషనల్ డేటాబేసుల గురించి మాట్లాడినప్పుడు మీరు ఇప్పటికే టేబులర్ డేటాను కలుసుకున్నారు. మీరు చాలా డేటా కలిగి ఉన్నప్పుడు, మరియు అది అనేక వేర్వేరు లింక్ చేసిన పట్టికల్లో ఉంటే, దానితో పని చేయడానికి SQL ఉపయోగించడం ఖచ్చితంగా అర్థం. అయితే, చాలా సందర్భాల్లో మాకు డేటా పట్టిక ఉంటే, మరియు ఆ డేటా గురించి కొన్ని **అర్థం** లేదా **అవగాహన** పొందాలి, ఉదాహరణకు పంపిణీ, విలువల మధ్య సంబంధం మొదలైనవి. డేటా సైన్స్‌లో, మాకు అసలు డేటాను కొన్ని మార్పులు చేయాల్సిన అవసరం ఉంటుంది, ఆ తర్వాత దాన్ని విజువలైజ్ చేయాలి. ఈ రెండు దశలను సులభంగా పైథాన్ ఉపయోగించి చేయవచ్చు. +మీరు రిలేషనల్ డేటాబేసుల గురించి మాట్లాడినప్పుడు ఇప్పటికే పట్టికా డేటా కలవుంది. మీరు చాలాసార్లు డేటా కలిగి ఉన్నప్పుడు, మరియు అది అనేక లింక్ చేసిన పట్టికల్లో ఉంటే, దాన్ని పని చేయడానికి SQL ఉపయోగించడం నిశ్చయంగా సమర్థవంతమే. అయితే, చాలాసార్లు మనకు ఒక డేటా పట్టిక ఉంటుంది, మరియు ఆ డేటా గురించి కొన్ని **అర్ధం** లేదా **అన్వేషణలు** పొందడం అవసరం పడుతుంది, ఉదాహరణకి పంపిణీ, విలువల మధ్య సంబంధం మొదలైనవి. డేటా సైన్స్ లో చాలా సందర్భాల్లో అసలు డేటానుండి కొంత మార్పులు చేసి, ఫిర్యాదు చేయడం అవసరం. ఈ రెండు దశలను పైన్తన్ ఉపయోగించి సులువుగా చేయవచ్చు. -పైథాన్‌లో టేబులర్ డేటాతో పని చేయడానికి రెండు అత్యంత ఉపయోగకరమైన లైబ్రరీలు ఉన్నాయి: -* **[Pandas](https://pandas.pydata.org/)** మీరు **డేటాఫ్రేమ్స్** అని పిలవబడే వాటిని నిర్వహించడానికి అనుమతిస్తుంది, ఇవి రిలేషనల్ పట్టికలకు సమానమైనవి. మీరు పేరుతో ఉన్న కాలమ్స్ కలిగి ఉండవచ్చు, మరియు వరుసలు, కాలమ్స్ మరియు డేటాఫ్రేమ్స్ పై వివిధ ఆపరేషన్లు చేయవచ్చు. -* **[Numpy](https://numpy.org/)** అనేది **టెన్సార్ల**తో పని చేయడానికి లైబ్రరీ, అంటే బహుముఖ్యమైన **అర్రేస్**. అర్రేలో ఒకే రకమైన విలువలు ఉంటాయి, ఇది డేటాఫ్రేమ్ కంటే సులభం, కానీ ఇది మరింత గణిత ఆపరేషన్లు అందిస్తుంది మరియు తక్కువ ఓవర్‌హెడ్ సృష్టిస్తుంది. +పైన్తన్ లో మీకు పట్టికా డేటాతో పని చేయడంలో సహాయపడే రెండు అత్యంత ఉపయోగకరమైన లైబ్రరీలు ఉన్నాయి: +* **[Pandas](https://pandas.pydata.org/)** అనేది మీరు మేనిపులేట్ చేయగలిగే **డేటాఫ్రేమ్స్**కి అనుగుణమైనది, ఇవి రిలేషనల్ పట్టికలకు సమానం. మీరు పేరుతో కూడిన కాలమ్స్ కలిగి ఉండవచ్చు, మరియు మీరు వరుసలు, కాలమ్స్ మరియు డేటాఫ్రేమ్స్‌పై వేర్వేరు ఆపరేషన్లను చేయవచ్చు. +* **[Numpy](https://numpy.org/)** అనేది **టెన్సార్లతో**, అంటే బహుముఖ డైమెన్షనల్ **అర్రేలు**తో పని చేయడానికి ఉపయోగించే లైబ్రరీ. అర్రే అన్ని విలువలు ఒకే ప్రాథమిక రకమైనవి కలిగి ఉంటాయి, ఇది డేటాఫ్రేమ్ కంటే సరళమైనది, కానీ ఇది మరింత గణిత ఆపరేషన్లు అందిస్తుంది మరియు లోడ్ తక్కువగా ఉంటుంది. -మరియు మీరు తెలుసుకోవలసిన కొన్ని ఇతర లైబ్రరీలు కూడా ఉన్నాయి: -* **[Matplotlib](https://matplotlib.org/)** డేటా విజువలైజేషన్ మరియు గ్రాఫ్‌లను ప్లాట్ చేయడానికి ఉపయోగించే లైబ్రరీ -* **[SciPy](https://www.scipy.org/)** కొన్ని అదనపు శాస్త్రీయ ఫంక్షన్లతో కూడిన లైబ్రరీ. probability మరియు statistics గురించి మాట్లాడినప్పుడు మేము ఇప్పటికే ఈ లైబ్రరీని చూశాము +మరిది మరిన్ని కొన్ని లైబ్రరీలను కూడా మీరు తెలుసుకోవాలి: +* **[Matplotlib](https://matplotlib.org/)** అనేది డేటా విజువలైజేషన్ మరియు గ్రాఫ్ చిత్రణ కోసం ఉపయోగించే లైబ్రరీ +* **[SciPy](https://www.scipy.org/)** అనేది అదనపు శాస్త్రీయ ఫంక్షన్లు కలిగిన లైబ్రరీ. మనం ఇప్పటికే ఈ లైబ్రరీని అవకాశాలు మరియు గణాంకాల గురించి మాట్లాడినప్పుడు చూశాము -ఇది మీరు సాధారణంగా మీ పైథాన్ ప్రోగ్రామ్ ప్రారంభంలో ఆ లైబ్రరీలను దిగుమతి చేసుకోవడానికి ఉపయోగించే కోడ్ భాగం: +ఈ క్రింది కోడ్ మీరు సాధారణంగా మీ పైన్తన్ ప్రోగ్రామ్ల ప్రారంభంలో ఆ లైబ్రరీలను ఇంటిగ్రేట్ చేయడానికి ఉపయోగిస్తారు: ```python import numpy as np import pandas as pd import matplotlib.pyplot as plt -from scipy import ... # మీరు అవసరమైన ఖచ్చితమైన ఉప-ప్యాకేజీలను పేర్కొనాలి +from scipy import ... # మీరు అవసరమైన సబ్ప్యాకేజీలను ఖచ్చితంగా సూచించాలి ``` -పాండాస్ కొన్ని ప్రాథమిక భావనల చుట్టూ కేంద్రీకృతమైంది. +పాండాస్ కింది కొన్ని మౌలిక ఆలోచనల చుట్టూ నిర్మించబడింది. -### సిరీస్ +### సిరీస్ -**సిరీస్** అనేది విలువల శ్రేణి, ఇది జాబితా లేదా నంపై అర్రేకు సమానంగా ఉంటుంది. ప్రధాన తేడా ఏమిటంటే సిరీస్‌కు కూడా ఒక **ఇండెక్స్** ఉంటుంది, మరియు మేము సిరీస్‌పై ఆపరేషన్ చేస్తే (ఉదా., వాటిని జోడించడం), ఇండెక్స్‌ను పరిగణలోకి తీసుకుంటుంది. ఇండెక్స్ సాధారణంగా పూర్తి సంఖ్య వరుస సంఖ్య (జాబితా లేదా అర్రే నుండి సిరీస్ సృష్టించినప్పుడు డిఫాల్ట్‌గా ఉపయోగించే ఇండెక్స్) కావచ్చు, లేదా అది సంక్లిష్ట నిర్మాణం కలిగి ఉండవచ్చు, ఉదా., తేదీ వ్యవధి. +**సిరీస్** అనేది విలువల సుసంపన్న శ్రేణి, జాబితా లేదా నంపై అర్రేలా పోలి ఉంటుంది. ప్రధాన తేడా ఏమిటంటే సిరీస్‌కు ఒక **ఇండెక్స్** కూడా ఉంటుంది, మరియు మనం సిరీస్‌పై ఆపరేషన్లు (ఉదాహరణకు, జోడించటం) చేసినప్పుడు, ఇండెక్స్‌ను పరిగణలోకి తీసుకుంటారు. ఇండెక్స్ సాదారణంగా అంతర్జాతీయ వరుస సంఖ్యగా ఉండవచ్చు (సాధారణంగా జాబితా లేదా అర్రే నుండి సిరీస్ సృష్టించినప్పుడు డిఫాల్ట్‌గా ఉపయోగించే ఇండెక్స్), లేదా అది జటిలమైన నిర్మాణం, ఉదాహరణగా తేదీ వ్యవధి కూడా ఉండవచ్చు. -> **గమనిక**: సహాయక నోట్బుక్ [`notebook.ipynb`](notebook.ipynb) లో కొంత పరిచయ పాండాస్ కోడ్ ఉంది. మేము ఇక్కడ కొన్ని ఉదాహరణలను మాత్రమే వివరించాము, మీరు పూర్తి నోట్బుక్‌ను తప్పకుండా చూడవచ్చు. +> **గమనిక**: కలిసి ఇచ్చిన నోట్బుక్ [`notebook.ipynb`](notebook.ipynb)లో కొంత ప్రవేశిక పాండాస్ కోడ్ ఉంది. మేము ఇక్కడ కొన్ని ఉదాహరణలనే వివరించాము, మరియు మీరు మొత్తం నోట్బుక్‌ను తప్పకుండా చూస్తే మంచిది. -ఒక ఉదాహరణను పరిగణించండి: మేము మా ఐస్-క్రీమ్ స్థలంలో అమ్మకాలను విశ్లేషించాలనుకుంటున్నాము. కొంత కాలం పాటు రోజుకు అమ్మిన ఐటెమ్‌ల సంఖ్య సిరీస్‌ను సృష్టిద్దాం: +ఒక ఉదాహరణను పరిగణించండి: మనం మా ఐస్‌క్రీమ్ దుకాణం అమ్మకాలను విశ్లేషించాలనుకొంటున్నాం. కొన్ని కాలం పాటు అమ్మిన ఐటమ్‌ల సంఖ్యను సూచించే సిరీస్ ను తయారు చేద్దాం: ```python start_date = "Jan 1, 2020" @@ -66,47 +66,47 @@ print(f"Length of index is {len(idx)}") items_sold = pd.Series(np.random.randint(25,50,size=len(idx)),index=idx) items_sold.plot() ``` -![Time Series Plot](../../../../translated_images/te/timeseries-1.80de678ab1cf727e.webp) +![సమయ శ్రేణి ప్లాట్](../../../../translated_images/te/timeseries-1.80de678ab1cf727e.webp) -ఇప్పుడు ప్రతీ వారం మేము స్నేహితుల కోసం పార్టీ నిర్వహిస్తున్నాము, మరియు పార్టీ కోసం అదనంగా 10 ఐస్-క్రీమ్ ప్యాకెట్లు తీసుకుంటాము అనుకోండి. మేము వారానికి ఇండెక్స్ చేయబడిన మరో సిరీస్ సృష్టించవచ్చు, దీన్ని చూపించడానికి: +ఇప్పుడు ప్రస్తావిద్దాం, ప్రతి వారం మేము స్నేహితులకు పార్టీ నిర్వహిస్తున్నాము, మరియు పార్టీ కొరకు అదనంగా 10 ఐస్‌క్రీమ్ ప్యాక్స్ తీసుకుంటాము. దీనిని చూపించడానికి వారంతో ఇండెక్స్ ఉన్న మరో సిరీస్ తయారు చేద్దాం: ```python additional_items = pd.Series(10,index=pd.date_range(start_date,end_date,freq="W")) ``` -రెండు సిరీస్‌లను కలిపితే, మొత్తం సంఖ్య వస్తుంది: +రెండు సిరీస్‌లను కలిపితే, మొత్తం సంఖ్య లభిస్తుంది: ```python total_items = items_sold.add(additional_items,fill_value=0) total_items.plot() ``` -![Time Series Plot](../../../../translated_images/te/timeseries-2.aae51d575c55181c.webp) +![సమయ శ్రేణి ప్లాట్](../../../../translated_images/te/timeseries-2.aae51d575c55181c.webp) -> **గమనిక** మేము సాదారణ సింటాక్స్ `total_items+additional_items` ఉపయోగించట్లేదు. అలా చేస్తే, ఫలిత సిరీస్‌లో చాలా `NaN` (*Not a Number*) విలువలు వస్తాయి. ఇది ఎందుకంటే `additional_items` సిరీస్‌లో కొన్ని ఇండెక్స్ పాయింట్లకు విలువలు లేవు, మరియు `NaN` ను ఏదైనా విలువకు జోడిస్తే ఫలితం `NaN` అవుతుంది. అందువల్ల జోడింపు సమయంలో `fill_value` పారామీటర్‌ను నిర్దేశించాలి. +> **గమనిక**: మేము సాదారణ వాక్యరచన `total_items+additional_items` ఉపయోగించకపోతాము. అది చేస్తే, ఫలిత సిరీస్‌లో చాలా `NaN` (*Not a Number*) విలువలు వస్తాయి. ఇదే కారణం ఏమిటంటే, `additional_items` సిరీస్‌లో కొన్ని ఇండెక్స్ స్థానాలకు విలువలు లేవు, మరియు `NaN`ని ఏదైనా విలువతో కలిపితే, ఫలితంగా `NaN` వస్తుంది. అందుకే జోడించేటప్పుడు `fill_value` అనే పారామీటర్ ను వినియోగించాలి. -టైమ్ సిరీస్‌తో, మేము సిరీస్‌ను వేరే సమయ వ్యవధులతో **రీసాంపుల్** చేయవచ్చు. ఉదాహరణకు, మేము నెలవారీ సగటు అమ్మకాలను లెక్కించాలనుకుంటే, క్రింది కోడ్ ఉపయోగించవచ్చు: +సమయ శ్రేణులతో, మేము వివిధ సమయ వ్యవధులతో సిరీస్‌ను **రీసాంపుల్** చేయొచ్చు. ఉదాహరణకు, నెలవారీ సగటు అమ్మకాల పరిమాణం గణించాలనుకుంటే, క్రింది కోడ్ ఉపయోగించవచ్చు: ```python monthly = total_items.resample("1M").mean() ax = monthly.plot(kind='bar') ``` -![Monthly Time Series Averages](../../../../translated_images/te/timeseries-3.f3147cbc8c624881.webp) +![నెలవారీ సమయం సిరీస్ సగటులు](../../../../translated_images/te/timeseries-3.f3147cbc8c624881.webp) ### డేటాఫ్రేమ్ -డేటాఫ్రేమ్ అనేది ఒకే ఇండెక్స్ కలిగిన సిరీస్‌ల సేకరణ. మేము అనేక సిరీస్‌లను కలిపి ఒక డేటాఫ్రేమ్ సృష్టించవచ్చు: +డేటాఫ్రేమ్ అనేది ప్రాముఖ్యంగా ఒకే ఇండెక్స్ కలిగిన సిరీస్‌ల సమాహారంగా ఉంటుంది. మనం కొన్ని సిరీస్‌లను కలిపి ఒక డేటాఫ్రేమ్ సృష్టించవచ్చు: ```python a = pd.Series(range(1,10)) b = pd.Series(["I","like","to","play","games","and","will","not","change"],index=range(0,9)) df = pd.DataFrame([a,b]) ``` -ఇది ఈ విధంగా ఒక ఆడంబరమైన పట్టికను సృష్టిస్తుంది: +ఇది ఇలా ఒక أفقی పట్టికను సృష్టిస్తుంది: | | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | | --- | --- | ---- | --- | --- | ------ | --- | ------ | ---- | ---- | | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | | 1 | I | like | to | use | Python | and | Pandas | very | much | -మేము సిరీస్‌లను కాలమ్స్‌గా కూడా ఉపయోగించవచ్చు, మరియు డిక్షనరీ ఉపయోగించి కాలమ్ పేర్లను నిర్దేశించవచ్చు: +మేము సిరీస్‌లను కాలమ్స్‌గా ఉపయోగించి, డిక్షనరీ ద్వారా కాలమ్ పేర్లను కూడా సూచించవచ్చు: ```python df = pd.DataFrame({ 'A' : a, 'B' : b }) ``` -ఇది ఈ విధంగా ఒక పట్టిక ఇస్తుంది: +ఇది మనకు క్రింది పట్టికను ఇస్తుంది: | | A | B | | --- | --- | ------ | @@ -120,39 +120,39 @@ df = pd.DataFrame({ 'A' : a, 'B' : b }) | 7 | 8 | very | | 8 | 9 | much | -**గమనిక** మేము ఈ పట్టిక లేఅవుట్‌ను కూడా గత పట్టికను ట్రాన్స్‌పోజ్ చేయడం ద్వారా పొందవచ్చు, ఉదా., ఇలా రాయడం ద్వారా +**గమనిక**: మేము ఈ పట్టిక లేఅవుట్‌ను ముందస్తు పట్టికను ట్రాన్స్‌పోజ్ చేయడం ద్వారా కూడా పొందవచ్చు, ఉదాహరణకు ```python -df = pd.DataFrame([a,b]).T..rename(columns={ 0 : 'A', 1 : 'B' }) +df = pd.DataFrame([a,b]).T.rename(columns={ 0 : 'A', 1 : 'B' }) ``` -ఇక్కడ `.T` అనేది డేటాఫ్రేమ్‌ను ట్రాన్స్‌పోజ్ చేయడం అంటే వరుసలు మరియు కాలమ్స్ మార్చడం ఆపరేషన్, మరియు `rename` ఆపరేషన్ మాకు కాలమ్‌లను గత ఉదాహరణకు సరిపడేలా పేరు మార్చడానికి అనుమతిస్తుంది. +ఇక్కడ `.T` డేటాఫ్రేమ్‌ను ట్రాన్స్‌పోజ్ చేసే ఆపరేషన్ అంటే వరుసలు మరియు కాలమ్స్ మార్చడం, మరియు `rename` ఆపరేషన్ మునుపటి ఉదాహరణకు అనుగుణంగా కాలమ్స్‌ను పేరు మార్చేందుకు ఉపయోగిస్తాయి. -ఇక్కడ డేటాఫ్రేమ్స్‌పై మేము చేయగల కొన్ని ముఖ్యమైన ఆపరేషన్లు ఉన్నాయి: +ఇక్కడ కొన్ని అత్యంత ముఖ్యమైన ఆపరేషన్లు ఉన్నాయి, ఇవి డేటాఫ్రేమ్స్‌పై చేయొచ్చు: -**కాలమ్ ఎంపిక**. మేము వ్యక్తిగత కాలమ్‌లను `df['A']` అని రాయడం ద్వారా ఎంచుకోవచ్చు - ఈ ఆపరేషన్ ఒక సిరీస్‌ను ఇస్తుంది. మేము `df[['B','A']]` అని రాయడం ద్వారా కాలమ్‌ల ఉపసమితిని మరో డేటాఫ్రేమ్‌గా ఎంచుకోవచ్చు - ఇది మరో డేటాఫ్రేమ్ ఇస్తుంది. +**కాలమ్ ఎంపిక**. మనం `df['A']` రాయడం ద్వారా వ్యక్తిగత కాలమ్స్ ఎంచుకోవచ్చు - ఇది సిరీస్‌ని తిరిగి ఇస్తుంది. మనం `df[['B','A']]` రాయడం ద్వారా కొన్ని కాలమ్స్‌ను మరొక డేటాఫ్రేమ్‌కు ఎంచుకోవచ్చు - ఇది మరో డేటాఫ్రేమ్‌ను ఇస్తుంది. -**నిర్దిష్ట వరుసలను ఫిల్టర్ చేయడం**. ఉదాహరణకు, కాలమ్ `A` విలువ 5 కంటే ఎక్కువ ఉన్న వరుసలను మాత్రమే ఉంచాలంటే, మేము `df[df['A']>5]` అని రాయవచ్చు. +**నిర్దిష్ట వరుసలు ఫిల్టరింగ్**. ఉదాహరణకి, కాలమ్ `A` విలువ 5 కంటే ఎక్కువ ఉన్న వాటినే మాత్రమే ఉంచాలంటే, మేము `df[df['A']>5]` అని రాయవచ్చు. -> **గమనిక**: ఫిల్టరింగ్ ఎలా పనిచేస్తుందంటే, `df['A']<5` అనే వ్యక్తీకరణ ఒక బూలియన్ సిరీస్‌ను ఇస్తుంది, ఇది అసలు సిరీస్ `df['A']` లో ప్రతి అంశం కోసం వ్యక్తీకరణ `True` లేదా `False` అని సూచిస్తుంది. బూలియన్ సిరీస్‌ను ఇండెక్స్‌గా ఉపయోగిస్తే, అది డేటాఫ్రేమ్‌లోని వరుసల ఉపసమితిని ఇస్తుంది. అందువల్ల, సాధారణ పైథాన్ బూలియన్ వ్యక్తీకరణను ఉపయోగించడం సాధ్యం కాదు, ఉదా., `df[df['A']>5 and df['A']<7]` తప్పు. బదులుగా, మీరు బూలియన్ సిరీస్‌లపై ప్రత్యేక `&` ఆపరేషన్ ఉపయోగించాలి, ఇలా రాయాలి `df[(df['A']>5) & (df['A']<7)]` (*బ్రాకెట్లు ఇక్కడ ముఖ్యమైనవి*). +> **గమనిక**: ఫిల్టరింగ్ ఈ విధంగా పని చేస్తుంది. `df['A']<5` అనే వ్యక్తవ్యం ఒక బూలియన్ సిరీస్‌ను ఇస్తుంది, దీనిలో ప్రతి మూల్యం `True` లేదా `False` అని సూచిస్తుంది అసలు సిరీస్ `df['A']` యొక్క ప్రతి మూల్యానికి. ఈ బూలియన్ సిరీస్‌ను ఇండెక్స్‌గా ఉపయోగించినప్పుడు, అది డేటాఫ్రేమ్‌లోని వరుసల ఉపసమితి ఇస్తుంది. అందువల్ల ఏదైనా పైన్తన్ బూలియన్ వ్యక్తవ్యం ఉపయోగించడం సాధ్యం కాదు, ఉదాహరణకి `df[df['A']>5 and df['A']<7]` తప్పు. బదులు, బూలియన్ సిరీస్‌లపై ప్రత్యేక `&` ఆపరేషన్ ఉపయోగించి `df[(df['A']>5) & (df['A']<7)]` అని రాయాలి (*ధ्यानించండి బ్రాకెట్లున్నాయని*). -**కొత్త గణనీయమైన కాలమ్‌లను సృష్టించడం**. మేము సులభంగా కొత్త గణనీయమైన కాలమ్‌లను క్రింది వంటి సూటిగా అర్థమయ్యే వ్యక్తీకరణ ఉపయోగించి సృష్టించవచ్చు: +**కొత్త గణనీయమైన కాలమ్స్ సృష్టించడం**. మనం సులభంగా మన డేటాఫ్రేమ్ కోసం కొత్త గణించే కాలమ్స్ సృష్టించవచ్చు ఇలా సవ్య రీతిలో: ```python df['DivA'] = df['A']-df['A'].mean() ``` -ఈ ఉదాహరణ A యొక్క సగటు విలువ నుండి వ్యత్యాసాన్ని లెక్కిస్తుంది. ఇక్కడ నిజంగా జరుగుతున్నది ఏమిటంటే మేము ఒక సిరీస్‌ను లెక్కిస్తున్నాము, ఆ తర్వాత ఆ సిరీస్‌ను ఎడమవైపు కేటాయించడం ద్వారా మరో కాలమ్ సృష్టిస్తున్నాము. అందువల్ల, సిరీస్‌కు అనుకూలం కాని ఆపరేషన్లు ఉపయోగించలేము, ఉదా., క్రింది కోడ్ తప్పు: +ఈ ఉదాహరణలో A యొక్క సగటు విలువ నుండి వైవృత్తిని లెక్కించడం జరుగుతుంది. ఇక్కడ నిజానికి ఏమవుతుంది అంటే, ఒక సిరీస్‌ను గణించి, ఆ సిరీస్‌ను ఎడమ వైపు అర్థం చేసుకుని మరో కాలమ్ సృష్టిస్తారు. అందువల్ల సిరీస్‌కు సంబంధించిన ఆపరేషన్లకంటే విరుద్ధంగా ఉండే ఏ ఆపరేషన్లు వాడకూడదు, ఉదాహరణకి క్రింది కోడ్ తప్పు: ```python -# తప్పు కోడ్ -> df['ADescr'] = "తక్కువ" if df['A'] < 5 else "ఎక్కువ" +# తప్పు కోడ్ -> df['ADescr'] = "Low" if df['A'] < 5 else "Hi" df['LenB'] = len(df['B']) # <- తప్పు ఫలితం ``` -ఈ చివరి ఉదాహరణ, సింటాక్సు పరంగా సరైనదైనా, తప్పు ఫలితాన్ని ఇస్తుంది, ఎందుకంటే ఇది కాలమ్‌లోని అన్ని విలువలకు సిరీస్ `B` యొక్క పొడవును కేటాయిస్తుంది, మరియు మేము ఉద్దేశించినట్లుగా వ్యక్తిగత అంశాల పొడవును కాదు. +ఈ చివరి ఉదాహరణ, వాక్యరచన సరిగ్గా ఉన్నప్పటికీ, తప్పు ఫలితాన్ని ఇస్తుంది, ఎందుకంటే ఇది సిరీస్ `B` యొక్క పొడవును అన్ని కాలమ్ విలువలకు కేటాయిస్తుంది, మన ఉద్దేశ్యంగా ప్రతి మూల్యానికి పొడవును కేటాయించడం కాదు. -ఇలాంటి సంక్లిష్ట వ్యక్తీకరణలను లెక్కించాల్సిన అవసరం ఉంటే, మేము `apply` ఫంక్షన్ ఉపయోగించవచ్చు. చివరి ఉదాహరణను ఇలా రాయవచ్చు: +ఇలాంటి క్లిష్ట వ్యక్తవ్యతల కోసం, మనం `apply` ఫంక్షన్ ఉపయోగించవచ్చు. చివరి ఉదాహరణను ఇలా రాయవచ్చు: ```python df['LenB'] = df['B'].apply(lambda x : len(x)) # లేదా df['LenB'] = df['B'].apply(len) ``` -పై ఆపరేషన్ల తర్వాత, మేము క్రింది డేటాఫ్రేమ్‌ను పొందుతాము: +పై ఆపరేషన్ల తరువాత, మనకు వచ్చే డేటాఫ్రేమ్ ఇలా ఉంటుంది: | | A | B | DivA | LenB | | --- | --- | ------ | ---- | ---- | @@ -166,22 +166,22 @@ df['LenB'] = df['B'].apply(len) | 7 | 8 | very | 3.0 | 4 | | 8 | 9 | much | 4.0 | 4 | -**సంఖ్యల ఆధారంగా వరుసలను ఎంచుకోవడం** `iloc` నిర్మాణం ఉపయోగించి చేయవచ్చు. ఉదాహరణకు, డేటాఫ్రేమ్ నుండి మొదటి 5 వరుసలను ఎంచుకోవడానికి: +**సంఖ్య ఆధారంగా వరుసలను ఎంచుకోవడం** `iloc` నిర్మాణం ద్వారా చేయవచ్చు. ఉదాహరణకి, డేటాఫ్రేమ్ నుండి మొదటి 5 వరుసలను ఎంచుకోవాలంటే: ```python df.iloc[:5] ``` -**గ్రూపింగ్** తరచుగా Excel లోని *pivot tables* లాంటి ఫలితాన్ని పొందడానికి ఉపయోగిస్తారు. ఉదాహరణకు, మేము ప్రతి `LenB` సంఖ్య కోసం కాలమ్ `A` యొక్క సగటు విలువను లెక్కించాలనుకుంటే, మేము మా డేటాఫ్రేమ్‌ను `LenB` ద్వారా గ్రూప్ చేసి, `mean` పిలవవచ్చు: +**గ్రూపింగ్** Excelలో *పివెట్ టేబుల్స్* పెద్దలు పొందటానికి తరచుగా ఉపయోగిస్తారు. ఉదాహరణకి మనం `LenB` ఇనుము సంఖ్యకు ప్రతీ విలువ కోసం కాలమ్ `A` సగటును గణించాలనుకుంటే, మన డేటాఫ్రేమ్‌ను `LenB` ద్వారా గ్రూప్ చేసి `mean` పిలవచ్చు: ```python df.groupby(by='LenB')[['A','DivA']].mean() ``` -మేము సగటు మరియు గ్రూప్‌లో అంశాల సంఖ్యను లెక్కించాలనుకుంటే, మరింత సంక్లిష్టమైన `aggregate` ఫంక్షన్ ఉపయోగించవచ్చు: +మనం గ్రూప్‌లో సగటు మరియు మూల్యాల సంఖ్య తెలుసుకోవాలని అయితే, మరింత క్లిష్టమైన `aggregate` ఫంక్షన్ వాడవచ్చు: ```python df.groupby(by='LenB') \ .aggregate({ 'DivA' : len, 'A' : lambda x: x.mean() }) \ .rename(columns={ 'DivA' : 'Count', 'A' : 'Mean'}) ``` -ఇది క్రింది పట్టిక ఇస్తుంది: +మనం క్రింది పట్టికను పొందుతాము: | LenB | Count | Mean | | ---- | ----- | -------- | @@ -192,95 +192,97 @@ df.groupby(by='LenB') \ | 6 | 2 | 6.000000 | ### డేటా పొందడం -మనం Python ఆబ్జెక్టుల నుండి Series మరియు DataFrames ను సులభంగా నిర్మించగలమని చూశాము. అయితే, డేటా సాధారణంగా టెక్స్ట్ ఫైల్ లేదా Excel పట్టిక రూపంలో వస్తుంది. అదృష్టవశాత్తు, Pandas మాకు డిస్క్ నుండి డేటాను లోడ్ చేయడానికి ఒక సులభమైన మార్గాన్ని అందిస్తుంది. ఉదాహరణకు, CSV ఫైల్ చదవడం ఇలా సులభం: + + +మనం Python వస్తువుల నుండి Series మరియు DataFrames‌ను నిర్మించడం ఎంత సులభమో చూశాం. అయితే, డేటా సాధారణంగా టెక్స్ట్ ఫైల్ లేదా Excel పట్టిక రూపంలో వస్తుంది. అదృష్టవశాత్, Pandas మాకు డిస్క్ నుండి డేటాను లోడ్ చేసే సరళమైన మార్గాన్ని అందిస్తుంది. ఉదాహరణకు, CSV ఫైల్ చదవడం ఈ విధంగా సులభం: ```python df = pd.read_csv('file.csv') ``` -మనం "Challenge" విభాగంలో బాహ్య వెబ్ సైట్ల నుండి డేటాను పొందడం సహా మరిన్ని లోడింగ్ ఉదాహరణలను చూడబోతున్నాము +మనం "పోటీ" విభాగంలో బాహ్య వెబ్ సైట్ల నుండి డేటాను పొందడం సహా డేటా లోడ్ చేసే మరిన్ని ఉదాహరణలను చూస్తాము -### ముద్రణ మరియు చిత్రీకరణ +### ముద్రణ మరియు చిత్రణ -డేటా సైంటిస్ట్ తరచుగా డేటాను అన్వేషించాల్సి ఉంటుంది, కాబట్టి దాన్ని దృశ్యరూపంలో చూడగలగడం ముఖ్యమైనది. DataFrame పెద్దదైతే, మనం చాలా సార్లు మొదటి కొన్ని వరుసలను ముద్రించి మనం సరిగ్గా పని చేస్తున్నామా అని నిర్ధారించుకోవాలనుకుంటాము. ఇది `df.head()` ను పిలవడం ద్వారా చేయవచ్చు. మీరు Jupyter Notebook నుండి దీన్ని నడుపుతున్నట్లయితే, అది DataFrame ను మంచి పట్టిక రూపంలో ముద్రిస్తుంది. +డేటా సైంటిస్ట్ తరచుగా డేటాను అన్వేషించాలి, కాబట్టి దాన్ని దృశ్యమానంగా చూడగలగడం ముఖ్యం. DataFrame పెద్దదైతే, మనం యథార్ధంగా ఉన్నదేనా అని నిర్ధారించుకోవడం కోసం మొదటి కొన్ని వరుసలను మాత్రమే ముద్రించాలి అనుకునే అవకాశాలు ఎక్కువ. దీన్ని `df.head()` ని పిలవడం ద్వారా చేయవచ్చు. మీరు Jupyter Notebook నుండి దీనిని నడుపుతున్నట్లయితే, అది DataFrameని చక్కని పట్టిక రూపంలో ముద్రిస్తుంది. -మనం కొన్ని కాలమ్స్ ను దృశ్యరూపంలో చూపించడానికి `plot` ఫంక్షన్ ఉపయోగించడం కూడా చూశాము. `plot` అనేది అనేక పనులకు చాలా ఉపయోగకరమైనది, మరియు `kind=` పారామీటర్ ద్వారా అనేక రకాల గ్రాఫ్‌లను మద్దతు ఇస్తుంది, మీరు ఎప్పుడైనా మరింత క్లిష్టమైనది చిత్రీకరించడానికి ముడి `matplotlib` లైబ్రరీని ఉపయోగించవచ్చు. డేటా విజువలైజేషన్‌ను ప్రత్యేక కోర్సు పాఠాలలో వివరంగా చర్చిస్తాము. +కొను కాలమ్స్‌ను గుర్తించడానికి `plot` ఫంక్షన్ ఉపయోగించడం కూడా చూశాం. `plot` అనేది అనేక పనులకు చాలా ఉపయోగకరమైనది, మరియు `kind=` పారామీటర్ ద్వారా అనేక వేరే గ్రాఫ్ రకాలని మద్దతు అందిస్తుంది, మీరు ఎప్పుడైనా మరింత క్లిష్టమైన దృశ్యకరణకు కাঁচా `matplotlib` లైబ్రరీని ఉపయోగించవచ్చు. డేటా దృశ్యకరణను వేర్వేరు పాఠ్యాంశల్లో వివరిస్తాము. -ఈ అవలోకనం Pandas యొక్క అత్యంత ముఖ్యమైన భావనలను కవర్ చేస్తుంది, అయితే, లైబ్రరీ చాలా సమృద్ధిగా ఉంది, మరియు మీరు దానితో చేయగలిగే పనులకు ఎలాంటి పరిమితి లేదు! ఇప్పుడు ఈ జ్ఞానాన్ని నిర్దిష్ట సమస్యను పరిష్కరించడానికి ఉపయోగిద్దాం. +ఈ సమీక్ష Pandas యొక్క అత్యంత ముఖ్యమైన భావనలను కవర్ చేస్తుంది, అయినప్పటికీ, లైబ్రరీ బాగా సంపన్నమైనది, మరియు మీరు దానితో చేయగలిగే పనులకు ఎటువంటి పరిమితి లేదు! ఇప్పుడు ఈ జ్ఞానాన్ని ఒక నిర్దిష్ట సమస్య పరిష్కరించడానికి ఉపయోగిద్దాం. -## 🚀 ఛాలెంజ్ 1: COVID వ్యాప్తి విశ్లేషణ +## 🚀 పోటీ 1: COVID వ్యాప్తిని విశ్లేషించడం -మనం మొదట దృష్టి సారించబోయే సమస్య COVID-19 మహమ్మారి వ్యాప్తి మోడలింగ్. దీని కోసం, మనం వివిధ దేశాలలో సంక్రమితుల సంఖ్యపై డేటాను ఉపయోగిస్తాము, ఇది [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) ద్వారా [Johns Hopkins University](https://jhu.edu/) అందజేస్తుంది. డేటాసెట్ [ఈ GitHub రిపాజిటరీ](https://github.com/CSSEGISandData/COVID-19)లో అందుబాటులో ఉంది. +మొదటి సమస్య మనం దృష్టి సారించేది COVID-19 వ్యాప్తి యొక్క అంటుకుంటున్న వ్యాధి నమూనా నిర్మాణం గురించి. దానికోసం, వివిధ దేశాలలో సోకిన వ్యక్తుల సంఖ్యపై డేటాను ఉపయోగిస్తాము, ఇది [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) వద్ద [Johns Hopkins University](https://jhu.edu/) అందించినది. డేటా సెట్ [ఈ GitHub రిపోజిటరీ](https://github.com/CSSEGISandData/COVID-19) లో అందుబాటులో ఉంది. -మనం డేటాతో ఎలా వ్యవహరించాలో చూపించాలనుకుంటున్నందున, మీరు [`notebook-covidspread.ipynb`](notebook-covidspread.ipynb) ను తెరిచి పై నుండి క్రింద వరకు చదవమని ఆహ్వానిస్తున్నాము. మీరు సెల్స్‌ను కూడా నడిపించవచ్చు, మరియు చివరలో మేము మీ కోసం వదిలిన కొన్ని ఛాలెంజ్‌లను చేయవచ్చు. +మనం డేటాతో ఎలా పని చేయాలో చూపించాలనుకునే కారణంగా, మీరు [`notebook-covidspread.ipynb`](notebook-covidspread.ipynb) ను తెరిచి పైనుండి క్రిందవరకు చదవాలని ఆహ్వానిస్తున్నాము. మీరు సెల్స్ ని కూడా నడిపించి, మనం చివరికి వదిలిన కొంత ఛాలెంజ్‌లను కూడా చేయవచ్చు. ![COVID Spread](../../../../translated_images/te/covidspread.f3d131c4f1d260ab.webp) -> మీరు Jupyter Notebook లో కోడ్ ఎలా నడుపాలో తెలియకపోతే, [ఈ వ్యాసం](https://soshnikov.com/education/how-to-execute-notebooks-from-github/)ను చూడండి. +> మీరు Jupyter Notebookలో కోడ్ ఎలా నడుపాలో తెలియకపోతే, [ఈ వ్యాసం](https://soshnikov.com/education/how-to-execute-notebooks-from-github/)ను చూడండి. -## అసంఘటిత డేటాతో పని చేయడం +## అసంరచిత డేటాతో పని చేయడం -డేటా చాలా సార్లు పట్టిక రూపంలో వస్తుంది, కానీ కొన్ని సందర్భాల్లో మనం తక్కువ నిర్మాణాత్మక డేటాతో వ్యవహరించాల్సి ఉంటుంది, ఉదాహరణకు, టెక్స్ట్ లేదా చిత్రాలు. ఈ సందర్భంలో, పైగా చూచిన డేటా ప్రాసెసింగ్ సాంకేతికతలను వర్తింపజేయడానికి మనం ఏదో విధంగా నిర్మాణాత్మక డేటాను **ఎగుమతి** చేయాలి. కొన్ని ఉదాహరణలు: +డేటా చాలా సార్లు పట్టిక ఆకారంలో వస్తే కూడా, కొన్ని సందర్భాల్లో మనం తక్కువగా సరిగ్గా రూపొందించబడిన డేటాతో వ్యవహరించాల్సి ఉంటుంది, ఉదాహరణకు, టెక్స్ట్ లేదా చిత్రాలు. ఈ సందర్భంలో, పైన చూపించిన డేటా ప్రాసెసింగ్ సాంకేతికాలను వర్తింపజేయడానికి మనం ఏదో విధంగా **సంరచిత** డేటాను **ఎత్తుకురావాలి**. కొన్ని ఉదాహరణలు: -* టెక్స్ట్ నుండి కీలకపదాలను ఎగుమతి చేసి, ఆ కీలకపదాలు ఎంతసార్లు కనిపిస్తాయో చూడటం +* టెక్స్ట్ నుండి ముఖ్య పదాలను (keywords) ఎత్తుకురావడం, అవి ఎన్ని సార్లు కనిపిస్తాయో చూడడం * చిత్రంలోని వస్తువుల గురించి సమాచారం పొందడానికి న్యూరల్ నెట్‌వర్క్‌లను ఉపయోగించడం -* వీడియో కెమెరా ఫీడ్‌లోని వ్యక్తుల భావోద్వేగాలపై సమాచారం పొందడం +* వీడియోకెమెరా ఫీడ్‌లోని ప్రజల భావోద్వేగాలపై సమాచారం పొందడం -## 🚀 ఛాలెంజ్ 2: COVID పేపర్ల విశ్లేషణ +## 🚀 పోటీ 2: COVID పత్రాలను విశ్లేషించడం -ఈ ఛాలెంజ్‌లో, మనం COVID మహమ్మారి విషయంపై కొనసాగుతాము, మరియు ఈ విషయం పై శాస్త్రీయ పత్రాలను ప్రాసెస్ చేయడంపై దృష్టి సారిస్తాము. [CORD-19 Dataset](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) COVID పై 7000 కంటే ఎక్కువ (రాయడుతున్న సమయంలో) పత్రాలతో అందుబాటులో ఉంది, మెటాడేటా మరియు సారాంశాలతో (మరియు వాటిలో సగానికి పూర్తి టెక్స్ట్ కూడా అందుబాటులో ఉంది). +ఈ పోటీలో మనం COVID మహమ్మారి విషయం కొనసాగిస్తూ, సంబంధిత శాస్త్రీయ పత్రాలను ప్రాసెస్ చేయడంపై దృష్టి సారిస్తాము. [CORD-19 Dataset](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) COVID పై 7000 కన్నా ఎక్కువ (వ్రాస్తున్న సమయంలో) పత్రాలు మెటాడేటా మరియు సారాంశాలతో (అర్థ సటవంతుల్లో మిగిలిన వాటికి పూర్తి పాఠ్యాన్ని కూడా కలిగి) అందుబాటులో ఉన్నాయి. -[Text Analytics for Health](https://docs.microsoft.com/azure/cognitive-services/text-analytics/how-tos/text-analytics-for-health/?WT.mc_id=academic-77958-bethanycheum) కాగ్నిటివ్ సర్వీస్ ఉపయోగించి ఈ డేటాసెట్‌ను విశ్లేషించే పూర్తి ఉదాహరణ [ఈ బ్లాగ్ పోస్ట్](https://soshnikov.com/science/analyzing-medical-papers-with-azure-and-text-analytics-for-health/)లో వివరించబడింది. మనం ఈ విశ్లేషణ యొక్క సరళీకృత సంస్కరణను చర్చిస్తాము. +[Text Analytics for Health](https://docs.microsoft.com/azure/cognitive-services/text-analytics/how-tos/text-analytics-for-health/?WT.mc_id=academic-77958-bethanycheum) సేవను ఉపయోగించి ఈ డేటా సెట్ విశ్లేషణ యొక్క పూర్తి ఉదాహరణ [ఈ బ్లాగ్ పోస్ట్](https://soshnikov.com/science/analyzing-medical-papers-with-azure-and-text-analytics-for-health/)లో వివరించబడింది. మేము ఈ విశ్లేషణ సాదా వెర్షన్‌ గురించి చర్చించబోతున్నాము. -> **NOTE**: ఈ రిపాజిటరీలో డేటాసెట్ కాపీని అందించము. మీరు ముందుగా [`metadata.csv`](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) ఫైల్‌ను [Kaggleలోని ఈ డేటాసెట్](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge) నుండి డౌన్లోడ్ చేసుకోవాలి. Kaggleలో రిజిస్ట్రేషన్ అవసరం కావచ్చు. మీరు రిజిస్ట్రేషన్ లేకుండా [ఇక్కడ](https://ai2-semanticscholar-cord-19.s3-us-west-2.amazonaws.com/historical_releases.html) నుండి కూడా డేటాసెట్‌ను డౌన్లోడ్ చేసుకోవచ్చు, కానీ అది మెటాడేటా ఫైల్‌తో పాటు అన్ని పూర్తి టెక్స్ట్‌లను కూడా కలిగి ఉంటుంది. +> **గమనిక**: ఈ రిపోజిటరీ భాగంగా డేటాసెట్ కాపీని మేము అందించము. మీరు ముందుగా [Kaggle లో](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) నుండి [`metadata.csv`](https://www.kaggle.com/allen-institute-for-ai/CORD-19-research-challenge?select=metadata.csv) ఫైలు డౌన్లోడ్ చేసుకోవాలి. Kaggleలో రిజిస్టర్అపై అవసరం ఉండొచ్చు. మీరు రిజిస్టర్అ లేకుండానే [ఇక్కడ](https://ai2-semanticscholar-cord-19.s3-us-west-2.amazonaws.com/historical_releases.html) నుండి డేటాసెట్ డౌన్లోడ్ చేసుకోవచ్చు, కానీ అది మెటాడేటాతో పాటు అన్ని పూర్తి పాఠ్యాలను కూడా కలిగి ఉంటుంది. -[`notebook-papers.ipynb`](notebook-papers.ipynb) ను తెరిచి పై నుండి క్రింద వరకు చదవండి. మీరు సెల్స్‌ను కూడా నడిపించవచ్చు, మరియు చివరలో మేము మీ కోసం వదిలిన కొన్ని ఛాలెంజ్‌లను చేయవచ్చు. +[`notebook-papers.ipynb`](notebook-papers.ipynb) తెరిచి పై నుండి క్రింద వరకు చదవండి. మీరు సెల్స్‌ని నడిపించి, చివరలో మిగిల్చిన కొన్ని ఛాలెంజిలను కూడా చేయవచ్చు. ![Covid Medical Treatment](../../../../translated_images/te/covidtreat.b2ba59f57ca45fbc.webp) -## చిత్ర డేటా ప్రాసెసింగ్ +## చిత్ర డేటాను ప్రాసెసింగ్ చేయడం -ఇటీవల, చిత్రాలను అర్థం చేసుకునే శక్తివంతమైన AI మోడల్స్ అభివృద్ధి చేయబడ్డాయి. ప్రీ-ట్రెయిన్డ్ న్యూరల్ నెట్‌వర్క్‌లు లేదా క్లౌడ్ సర్వీసులు ఉపయోగించి అనేక పనులను పరిష్కరించవచ్చు. కొన్ని ఉదాహరణలు: +ఇటీవల, చిత్రాలను అర్థం చేసుకునే శక్తివంతమైన AI మోడల్స్ అభివృద్ధి అయ్యాయి. పూర్వపు శిక్షణ పొందిన న్యూరల్ నెట్‌వర్క్స్ లేదా క్లౌడ్ సేవలను ఉపయోగించి అనేక పనులను పరిష్కరించవచ్చు. కొన్ని ఉదాహరణలు: -* **చిత్ర వర్గీకరణ**, ఇది చిత్రాన్ని ముందుగా నిర్వచించిన వర్గాలలో ఒకటిగా వర్గీకరించడంలో సహాయపడుతుంది. మీరు [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) వంటి సర్వీసులను ఉపయోగించి మీ స్వంత చిత్ర వర్గీకరణలను సులభంగా శిక్షణ ఇవ్వవచ్చు -* **వస్తు గుర్తింపు** చిత్రంలో వివిధ వస్తువులను గుర్తించడానికి. [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) వంటి సర్వీసులు సాధారణ వస్తువులను గుర్తించగలవు, మరియు మీరు కొన్ని ప్రత్యేక వస్తువులను గుర్తించడానికి [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) మోడల్‌ను శిక్షణ ఇవ్వవచ్చు. +* **చిత్ర వర్గీకరణ**, ఇది చిత్రాన్ని ముందుగా నిర్వచించిన తరగతులలో ఒకటిగా వర్గీకరించటానికి సహాయపడుతుంది. మీరు [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) వంటి సేవలను ఉపయోగించి మీ స్వంత చిత్ర వర్గీకరణలనూ సులభంగా శిక్షణ ఇవ్వవచ్చు +* **వస్తువు గుర్తింపు**, చిత్రంలో వివిధ వస్తువులను గుర్తించడానికి. [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) వంటి సేవలు కొన్ని సాధారణ వస్తువులను గుర్తించగలవు, మరియు [Custom Vision](https://azure.microsoft.com/services/cognitive-services/custom-vision-service/?WT.mc_id=academic-77958-bethanycheum) మోడల్‌ని కొన్ని నిర్దిష్ట ఆసక్తికరమైన వస్తువులను గుర్తించడానికి శిక్షణ ఇవ్వవచ్చు. * **ముఖం గుర్తింపు**, వయస్సు, లింగం మరియు భావోద్వేగ గుర్తింపుతో సహా. ఇది [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ద్వారా చేయవచ్చు. -అన్ని ఆ క్లౌడ్ సర్వీసులను [Python SDKs](https://docs.microsoft.com/samples/azure-samples/cognitive-services-python-sdk-samples/cognitive-services-python-sdk-samples/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి పిలవవచ్చు, కాబట్టి అవి మీ డేటా అన్వేషణ వర్క్‌ఫ్లోలో సులభంగా చేర్చుకోవచ్చు. +ఈ క్లౌడ్ సేవలన్నీ [Python SDKs](https://docs.microsoft.com/samples/azure-samples/cognitive-services-python-sdk-samples/cognitive-services-python-sdk-samples/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి పిలవబడవచ్చు, అలా మీ డేటా అన్వేషణ వర్క్‌ఫ్లోలో సులభంగా చేర్చుకోవచ్చు. -ఇక్కడ చిత్ర డేటా మూలాల నుండి డేటాను అన్వేషించే కొన్ని ఉదాహరణలు ఉన్నాయి: -* [How to Learn Data Science without Coding](https://soshnikov.com/azure/how-to-learn-data-science-without-coding/) అనే బ్లాగ్ పోస్ట్‌లో మనం Instagram ఫోటోలని అన్వేషించి, ఫోటోకు ఎక్కువ లైక్స్ రావడానికి కారణమేమిటో అర్థం చేసుకోవడానికి ప్రయత్నిస్తాము. మొదట [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి చిత్రాల నుండి ఎక్కువ సమాచారం ఎగుమతి చేస్తాము, తరువాత [Azure Machine Learning AutoML](https://docs.microsoft.com/azure/machine-learning/concept-automated-ml/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి అర్థం చేసుకునే మోడల్‌ను నిర్మిస్తాము. -* [Facial Studies Workshop](https://github.com/CloudAdvocacy/FaceStudies)లో మనం [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి ఈవెంట్ల ఫోటోలలోని వ్యక్తుల భావోద్వేగాలను ఎగుమతి చేసి, ప్రజలను సంతోషంగా చేసే అంశాలను అర్థం చేసుకోవడానికి ప్రయత్నిస్తాము. +చిత్ర డేటా మూలాల నుండి డేటాను అన్వేషించడాని కొన్ని ఉదాహరణలు: +* బ్లాగ్ పోస్ట్ [కోడింగ్ లేకుండా డేటా సైన్స్ నేర్చుకోవడం](https://soshnikov.com/azure/how-to-learn-data-science-without-coding/) లో మనం Instagram ఫోటోలు అన్వేషిస్తున్నాము, ప్రజలు ఫోటోకు ఎక్కువ లైక్స్ ఇవ్వడానికి ఏమి కారణమో అర్థం చేసుకునేందుకు. ముందు [computer vision](https://azure.microsoft.com/services/cognitive-services/computer-vision/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి చిత్రాల నుండి ఎక్కువ సమాచారం తీసుకుంటాము, తరువాత [Azure Machine Learning AutoML](https://docs.microsoft.com/azure/machine-learning/concept-automated-ml/?WT.mc_id=academic-77958-bethanycheum) ఉపయోగించి వివరణాత్మక మోడల్ నిర్మిస్తాము. +* [Facial Studies Workshop](https://github.com/CloudAdvocacy/FaceStudies) లో మనం ఈవెంట్ల ఫోటోగ్రఫీలలో ప్రజల భావోద్వేగాలను తీసుకోవడానికి [Face API](https://azure.microsoft.com/services/cognitive-services/face/?WT.mc_id=academic-77958-bethanycheum) ను ఉపయోగిస్తాము, ప్రజలను సంతోషంగా చేసే అంశాలను అర్థం చేసుకునేందుకు. ## ముగింపు -మీకు ఇప్పటికే నిర్మాణాత్మక లేదా అసంఘటిత డేటా ఉన్నా, Python ఉపయోగించి మీరు డేటా ప్రాసెసింగ్ మరియు అర్థం చేసుకోవడంలో సంబంధించిన అన్ని దశలను నిర్వహించవచ్చు. ఇది డేటా ప్రాసెసింగ్ యొక్క అత్యంత అనుకూలమైన మార్గం కావచ్చు, అందుకే చాలా మంది డేటా సైంటిస్ట్‌లు Python ను వారి ప్రాథమిక సాధనంగా ఉపయోగిస్తారు. మీరు మీ డేటా సైన్స్ ప్రయాణంలో గంభీరంగా ఉంటే Python లో లోతుగా నేర్చుకోవడం మంచి ఆలోచన! +మీరు ఇప్పటికే సంరచిత లేదా అసంరచిత డేటా ఉన్నా, Python ఉపయోగించి మీరు డేటా ప్రాసెసింగ్ మరియు అర్థం చేసుకోవడంలో అన్ని దశలను నిర్వహించవచ్చు. అది ఎక్కువ సాంవిధానికంగా డేటా ప్రాసెసింగ్ చేసే మార్గం కాగా, ఎక్కువ మంది డేటా సైంటిస్టులు Pythonను వారి ప్రాథమిక సాధనంగా ఉపయోగిస్తారు. మీరు మీ డేటా సైన్స్ ప్రయాణం గంభీరంగా తీసుకుంటే Python లో లోతుగా నేర్రుకోవడం మంచి ఆలోచన. -## [పోస్ట్-లెక్చర్ క్విజ్](https://ff-quizzes.netlify.app/en/ds/quiz/13) +## [పఠన అనంతరం ప్రశ్నలు](https://ff-quizzes.netlify.app/en/ds/quiz/13) ## సమీక్ష & స్వీయ అధ్యయనం **పుస్తకాలు** * [Wes McKinney. Python for Data Analysis: Data Wrangling with Pandas, NumPy, and IPython](https://www.amazon.com/gp/product/1491957662) -**ఆన్‌లైన్ వనరులు** -* అధికారిక [10 minutes to Pandas](https://pandas.pydata.org/pandas-docs/stable/user_guide/10min.html) ట్యుటోరియల్ -* [Pandas Visualization పై డాక్యుమెంటేషన్](https://pandas.pydata.org/pandas-docs/stable/user_guide/visualization.html) +**ఆన్లైన్ వనరులు** +* అధికారిక [10 నిమిషాలు లో Pandas](https://pandas.pydata.org/pandas-docs/stable/user_guide/10min.html) ఉపాధి +* [Pandas Visualisation పై డాక్యుమెంటేషన్](https://pandas.pydata.org/pandas-docs/stable/user_guide/visualization.html) **Python నేర్చుకోవడం** -* [Turtle Graphics మరియు Fractals తో సరదాగా Python నేర్చుకోండి](https://github.com/shwars/pycourse) -* [Python తో మీ మొదటి అడుగులు వేయండి](https://docs.microsoft.com/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) [Microsoft Learn](http://learn.microsoft.com/?WT.mc_id=academic-77958-bethanycheum) లో లెర్నింగ్ పాత్ +* [Turtle Graphics మరియు Fractals తో Pythonను సరదాగా నేర్చుకోండి](https://github.com/shwars/pycourse) +* [Python తో మొదటి అడుగులు](https://docs.microsoft.com/learn/paths/python-first-steps/?WT.mc_id=academic-77958-bethanycheum) Microsoft Learn వద్దలెర్నింగ్ పాత్ ## అసైన్‌మెంట్ -[పై ఛాలెంజ్‌ల కోసం మరింత వివరమైన డేటా అధ్యయనం చేయండి](assignment.md) +[పై పోటీలకు మరింత సవివరమైన డేటా అధ్యయనం చేయండి](assignment.md) ## క్రెడిట్స్ -ఈ పాఠం ♥️ తో [Dmitry Soshnikov](http://soshnikov.com) రచించారు +ఈ పాఠం ♥️ తో [Dmitry Soshnikov](http://soshnikov.com) తయారు చేశారు --- -**అస్పష్టత**: -ఈ పత్రాన్ని AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పిదాలు ఉండవచ్చు. మూల పత్రం దాని స్వదేశీ భాషలో అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదం వాడకంలో ఏర్పడిన ఏవైనా అపార్థాలు లేదా తప్పుదారితీసే అర్థాలు కోసం మేము బాధ్యత వహించము. +**అస్వీకరణ**: +ఈ పత్రం AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము. \ No newline at end of file