ಡೇಟಾ ಎಂದರೆ ಅನ್ವೇಷಣೆ ಮಾಡಲು ಮತ್ತು ತಿಳಿವಳಿಕೆ ಹೊಂದಿದ ನಿರ್ಧಾರಗಳನ್ನು ಬೆಂಬಲಿಸಲು ಬಳಸುವ ವಾಸ್ತವಗಳು, ಮಾಹಿತಿ, ಅವಲೋಕನಗಳು ಮತ್ತು ಅಳತೆಗಳು. ಡೇಟಾ ಪಾಯಿಂಟ್ ಎಂದರೆ ಡೇಟಾ ಪಾಯಿಂಟ್ಗಳ ಸಂಗ್ರಹವಾದ ಡೇಟಾಸೆಟ್ನೊಳಗಿನ ಒಂದು ಏಕಕ ಡೇಟಾ. ಡೇಟಾಸೆಟ್ಗಳು ವಿಭಿನ್ನ ಸ್ವರೂಪಗಳು ಮತ್ತು ರಚನೆಗಳಲ್ಲಿ ಇರಬಹುದು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ಅದರ ಮೂಲ ಅಥವಾ ಡೇಟಾ ಎಲ್ಲಿ ಬಂದಿತು ಎಂಬುದರ ಆಧಾರದ ಮೇಲೆ ಇರುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, ಒಂದು ಕಂಪನಿಯ ಮಾಸಿಕ ಆದಾಯವು ಸ್ಪ್ರೆಡ್ಶೀಟ್ನಲ್ಲಿ ಇರಬಹುದು ಆದರೆ ಸ್ಮಾರ್ಟ್ ವಾಚ್ನಿಂದ ಗಂಟೆಗಟ್ಟಲೆ ಹೃದಯದ ದರದ ಡೇಟಾ [JSON](https://stackoverflow.com/a/383699) ಸ್ವರೂಪದಲ್ಲಿ ಇರಬಹುದು. ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಡೇಟಾಸೆಟ್ನೊಳಗಿನ ವಿಭಿನ್ನ ರೀತಿಯ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುತ್ತಾರೆ.
ಡೇಟಾ ಎಂದರೆ ವಾಸ್ತವಗಳು, ಮಾಹಿತಿ, ಪರಿಶೀಲನೆಗಳು ಮತ್ತು ಅಳತೆಗಳು, ఇవು ಕಂಡುಹಿಡಿಯಲು ಮತ್ತು ಜಾಗೃತ ನಿರ್ಣಯಗಳನ್ನು ಬೆಂಬಲಿಸಲು ಬಳಸಲಾಗುತ್ತದೆ. ಒಂದು ಡೇಟಾ ಪಾಯಿಂಟ್ ಎಂದರೆ ಡೇಟಾ ಸಂಗ್ರಹದೊಳಗಿನ ಒಂದು ಏಕಕ, ಅಂದರೆ ಡೇಟಾ ಪಾಯಿಂಟ್ಸ್ ಸಂಗ್ರಹವಾಗಿದೆ. ಡೇಟಾ ಸಂಗ್ರಹಗಳು ಬೇರೆಯಾದ ಫಾರ್ಮ್ಯಾಟ್ ಮತ್ತು ರಚನೆಗಳಲ್ಲಿ ಬರುತ್ತವೆ, ಹಾಗೂ ಸಾಮಾನ್ಯವಾಗಿ ಅದರ ಮೂಲ, ಅಂದರೆ ಡೇಟಾ ಇದ್ದ ಸ್ಥಳದ ಮೇರೆಗೆ ಇರುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, ಒಂದು ಕಂಪನಿಯ ಮಾಸಿಕ ಆದಾಯವು ಸ್ಪ್ರೆಡ್ಶೀಟ್ನಲ್ಲಿ ಇರಬಹುದು ಆದರೆ ಸ್ಮಾರ್ಟ್ವಾಚ್ನಿಂದ ಬಂದಿದೆ ಎಂದರೆ ಗಂಟೆಗಂಟೆ ಹೃದಯರೀತಿ ಡೇಟಾ [JSON](https://stackoverflow.com/a/383699) ಫಾರ್ಮ್ಯಾಟ್ನಲ್ಲಿರಬಹುದು. ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಒಂದು ಡೇಟಾ ಸಂಗ್ರಹದೊಳಗಿನ ಬೇರೆ ಬೇರೆ ಪ್ರಕಾರದ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುತ್ತಾರೆ.
ಈ ಪಾಠವು ಡೇಟಾವನ್ನು ಅದರ ಲಕ್ಷಣಗಳು ಮತ್ತು ಮೂಲಗಳ ಮೂಲಕ ಗುರುತಿಸುವುದು ಮತ್ತು ವರ್ಗೀಕರಿಸುವುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದೆ.
ಈ ಪಾಠವು ಡೇಟಾ ಲಕ್ಷಣಗಳು ಮತ್ತು ಅದರ ಮೂಲಗಳ ಮೂಲಕ ಡೇಟಾವನ್ನು ಗುರುತಿಸುವುದು ಮತ್ತು ವರ್ಗೀಕರಿಸುವುದರ ಮೇಲೆ ಗಮನಹರಿಸುತ್ತದೆ.
ಕಚ್ಚಾ ಡೇಟಾ ಎಂದರೆ ಮೂಲದಿಂದ ಅದರ ಪ್ರಾಥಮಿಕ ಸ್ಥಿತಿಯಲ್ಲಿ ಬಂದಿರುವ ಮತ್ತು ವಿಶ್ಲೇಷಣೆ ಅಥವಾ ಸಂಘಟನೆಯಾಗದಿರುವ ಡೇಟಾ. ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಏನಾಗುತ್ತಿದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಅದನ್ನು ಮಾನವರು ಮತ್ತು ತಂತ್ರಜ್ಞಾನವು ಮುಂದುವರೆಸಿ ವಿಶ್ಲೇಷಿಸಲು ಬಳಸಬಹುದಾದ ಸ್ವರೂಪದಲ್ಲಿ ಸಂಘಟಿಸಬೇಕಾಗುತ್ತದೆ. ಡೇಟಾಸೆಟ್ನ ರಚನೆ ಅದನ್ನು ಹೇಗೆ ಸಂಘಟಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ ಮತ್ತು ಇದನ್ನು ರಚಿತ, ಅಸಂರಚಿತ ಮತ್ತು ಅರ್ಧ-ರಚಿತ ಎಂದು ವರ್ಗೀಕರಿಸಬಹುದು. ಈ ರಚನೆಗಳ ಪ್ರಕಾರ ಮೂಲದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ ಆದರೆ ಕೊನೆಗೆ ಈ ಮೂರು ವರ್ಗಗಳಲ್ಲಿ ಸೇರಿಕೊಳ್ಳುತ್ತದೆ.
ಕಚ್ಚಾ ಡೇಟಾ ಎಂದರೆ ಮೂಲದಿಂದಲೇ ಲಭ್ಯವಿರುವ ಅದರ ಪ್ರಾರಂಭಿಕ ಸ್ಥಿತಿ ಮತ್ತು ವಿಶ್ಲೇಷಣೆ ಅಥವಾ ಆಯೋಜನೆಯಿಲ್ಲದೆ ಇರುವ ಡೇಟಾ. ಡೇಟಾ ಸಂಗ್ರಹದಲ್ಲಿ ನಡೆಯುತ್ತಿರುವುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಅದನ್ನು ಮಾನವರು ಮತ್ತು ಅದನ್ನು ಹೆಚ್ಚು ವಿಶ್ಲೇಷಿಸಲು ಉಪಯೋಗಿಸುವ ತಂತ್ರಜ್ಞಾನಗಳೂ ಸಮರ್ಥವಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬಲ್ಲ ರೀತಿಯಲ್ಲಿ ಆಯೋಜಿಸಬೇಕು. ಡೇಟಾ ಸಂಗ್ರಹದ ರಚನೆ ಅದನ್ನು ಹೇಗೆ ಆಯೋಜಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ ಮತ್ತು ಅದನ್ನು ರಚನೆಬದ್ಧ, ಅಸಂರಚಿತ ಮತ್ತು ಅರ್ಧ-ಸಂರಚಿತ ಎಂದು ವರ್ಗೀಕರಿಸಬಹುದು. ಈ ರಚನೆಯ ಪ್ರಕಾರಗಳು ಮೂಲದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುತ್ತವೆ ಆದರೆ ಅಂತಿಮವಾಗಿ ಈ ಮೂರು ವರ್ಗಗಳಲ್ಲಿ ಸೇರಿಕೊಳ್ಳುತ್ತವೆ.
### ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾ
### ಪ್ರಮಾಣಾತ್ಮಕ (Quantitative) ಡೇಟಾ
ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾ ಎಂದರೆ ಡೇಟಾಸೆಟ್ನೊಳಗಿನ ಸಂಖ್ಯಾತ್ಮಕ ಅವಲೋಕನಗಳು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ವಿಶ್ಲೇಷಣೆ, ಅಳತೆ ಮತ್ತು ಗಣಿತೀಯವಾಗಿ ಬಳಸಬಹುದು. ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾದ ಕೆಲವು ಉದಾಹರಣೆಗಳು: ಒಂದು ದೇಶದ ಜನಸಂಖ್ಯೆ, ವ್ಯಕ್ತಿಯ ಎತ್ತರ ಅಥವಾ ಕಂಪನಿಯ ತ್ರೈಮಾಸಿಕ ಆದಾಯ. ಕೆಲವು ಹೆಚ್ಚುವರಿ ವಿಶ್ಲೇಷಣೆಯೊಂದಿಗೆ, ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾವನ್ನು ವಾಯು ಗುಣಮಟ್ಟ ಸೂಚ್ಯಂಕ (AQI) ನ ಋತುವಿನ ಪ್ರವೃತ್ತಿಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು ಅಥವಾ ಸಾಮಾನ್ಯ ಕೆಲಸದ ದಿನದ ರಶ್ ಹವರ್ ಟ್ರಾಫಿಕ್ ಸಂಭವನೀಯತೆಯನ್ನು ಅಂದಾಜಿಸಲು ಬಳಸಬಹುದು.
ಪ್ರಮાણಾತ್ಮಕ ಡೇಟಾ ಒಂದು ಡೇಟಾ ಸಂಗ್ರಹದ ಅಂಕಿಅಂಶಗಳಾದ ವೀಕ್ಷಣೆಗಳು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ವಿಶ್ಲೇಷಣೆ, ಅಳತೆ ಮತ್ತು ಗಣಿತೀಯವಾಗಿ ಬಳಸಬಹುದು. ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಒಂದು ದೇಶದ ಜನಸಂಖ್ಯೆ, ಒಂದು ವ್ಯಕ್ತಿಯ ಎತ್ತರ, ಅಥವಾ ಕಂಪನಿಯ ತ್ರೈಮಾಸಿಕ ಆದಾಯ. ಕೆಲವು ಹೆಚ್ಚುವರಿ ವಿಶ್ಲೇಷಣೆಗಳೊಂದಿಗೆ, ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾವನ್ನು ಏರ್ ಕ್ವಾಲಿಟಿ ಸೂಚ್ಯಂಕದ ಋತುಚಕ್ರದ ಪ್ರವೃತ್ತಿಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು ಅಥವಾ ಸಾಮಾನ್ಯ ಕಾರ್ಯದಿನದಲ್ಲಿ ಜಾಮ್ ಸಮಯ ಸಂಚಾರದ ಸಂಭವನೀಯತೆಯನ್ನು ಅಂದಾಜಿಸಲು ಬಳಸಬಹುದು.
### ಗುಣಾತ್ಮಕ ಡೇಟಾ
### ಗುಣಾತ್ಮಕ (Qualitative) ಡೇಟಾ
ಗುಣಾತ್ಮಕ ಡೇಟಾ, ಅಥವಾ ವರ್ಗೀಕೃತ ಡೇಟಾ ಎಂದೂ ಕರೆಯಲ್ಪಡುವುದು, ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾದಂತಹ ವಸ್ತುನಿಷ್ಠವಾಗಿ ಅಳತೆಯಾಗದ ಡೇಟಾ. ಇದು ಸಾಮಾನ್ಯವಾಗಿ ಉತ್ಪನ್ನ ಅಥವಾ ಪ್ರಕ್ರಿಯೆಯ ಗುಣಮಟ್ಟವನ್ನು ಹಿಡಿದಿಡುವ ವಿಭಿನ್ನ ಸ್ವರೂಪದ ವಿಷಯಾತ್ಮಕ ಡೇಟಾಗಳಾಗಿರುತ್ತದೆ. ಕೆಲವೊಮ್ಮೆ, ಗುಣಾತ್ಮಕ ಡೇಟಾ ಸಂಖ್ಯಾತ್ಮಕವಾಗಿರಬಹುದು ಆದರೆ ಸಾಮಾನ್ಯವಾಗಿ ಗಣಿತೀಯವಾಗಿ ಬಳಸಲಾಗುವುದಿಲ್ಲ, ಉದಾಹರಣೆಗೆ ಫೋನ್ ಸಂಖ್ಯೆಗಳು ಅಥವಾ ಟೈಮ್ಸ್ಟ್ಯಾಂಪ್ಗಳು. ಗುಣಾತ್ಮಕ ಡೇಟಾದ ಕೆಲವು ಉದಾಹರಣೆಗಳು: ವೀಡಿಯೋ ಕಾಮೆಂಟ್ಗಳು, ಕಾರಿನ ತಯಾರಿಕೆ ಮತ್ತು ಮಾದರಿ ಅಥವಾ ನಿಮ್ಮ ಹತ್ತಿರದ ಸ್ನೇಹಿತರ ಪ್ರಿಯ ಬಣ್ಣ. ಗುಣಾತ್ಮಕ ಡೇಟಾವನ್ನು ಗ್ರಾಹಕರು ಯಾವ ಉತ್ಪನ್ನಗಳನ್ನು ಹೆಚ್ಚು ಇಷ್ಟಪಡುತ್ತಾರೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಅಥವಾ ಉದ್ಯೋಗ ಅರ್ಜಿ ರೆಸ್ಯೂಮೆಗಳಲ್ಲಿ ಜನಪ್ರಿಯ ಕೀವರ್ಡ್ಗಳನ್ನು ಗುರುತಿಸಲು ಬಳಸಬಹುದು.
ಗುಣಾತ್ಮಕ ಡೇಟಾ, ಎಂದುಲೇ ಕ್ಯಾಟೆಗೋರಿಕಲ್ ಡೇಟಾ ಎಂದೂ ಕರೆಯುವುದಾಗಿದೆ, ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾದ ವೀಕ್ಷಣೆಗಳಂತೆ ವಸ್ತುನಿಷ್ಠವಾಗಿ ಅಳತೆಯಡಿಸಲಾಗದ ಡೇಟಾ. ಇದು ಸಾಮಾನ್ಯವಾಗಿ ವಿವಿಧ ಸ್ವರೂಪದ ವ್ಯಕ್ತಿಗತ ಡೇಟಾಗಳಾಗಿದ್ದು, ಉತ್ಪನ್ನ ಅಥವಾ ಪ್ರಕ್ರಿಯೆಯ ಗುಣಮಟ್ಟವನ್ನು ಹಿಡಿಯುತ್ತದೆ. ಕೆಲವೆಡೆ, ಗುಣಾತ್ಮಕ ಡೇಟಾ ಅಂಕಿಅಂಶಗಳಾಗಿರಬಹುದು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ಗಣಿತೀಯವಾಗಿ ಬಳಸುವುದಿಲ್ಲ, ಉದಾಹರಣೆಗೆ ಫೋನ್ ಸಂಖ್ಯೆ ಅಥವಾ ಟೈಮ್ಸ್ಟ್ಯಾಂಪ್ಸ್. ಗುಣಾತ್ಮಕ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ವೀಡಿಯೋ ಕಾಮೆಂಟ್ಗಳು, ಕಾರಿನ ಮೇಕ್ ಮತ್ತು ಮಾದರಿ, ನಿಮ್ಮ ಹತ್ತಿರದ ಸ್ನೇಹಿತನ ಪ್ರಿಯ ಬಣ್ಣ. ಗುಣಾತ್ಮಕ ಡೇಟಾವನ್ನು ಗ್ರಾಹಕರು ಯಾವ ಉತ್ಪನ್ನಗಳನ್ನು ಹೆಚ್ಚು ಇಷ್ಟಪಡುತ್ತಾರೆ ಎಂದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಅಥವಾ ಉದ್ಯೋಗ ಅರ್ಜಿ ಜೀವನಚರಿತ್ರೆಗಳಲ್ಲಿ ಜನಪ್ರಿಯ ಕೀವರ್ಡ್ಗಳನ್ನು ಗುರುತಿಸಲು ಬಳಸಬಹುದು.
### ರಚಿತ ಡೇಟಾ
### ರಚನೆಬದ್ಧ ಡೇಟಾ
ರಚಿತ ಡೇಟಾ ಎಂದರೆ ಸಾಲುಗಳು ಮತ್ತು ಕಾಲಮ್ಗಳಾಗಿ ಸಂಘಟಿತವಾಗಿರುವ ಡೇಟಾ, ಇಲ್ಲಿ ಪ್ರತಿ ಸಾಲು ಒಂದೇ ರೀತಿಯ ಕಾಲಮ್ಗಳ ಸಮೂಹವನ್ನು ಹೊಂದಿರುತ್ತದೆ. ಕಾಲಮ್ಗಳು ನಿರ್ದಿಷ್ಟ ಪ್ರಕಾರದ ಮೌಲ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ ಮತ್ತು ಆ ಮೌಲ್ಯ ಏನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುವ ಹೆಸರಿನಿಂದ ಗುರುತಿಸಲಾಗುತ್ತದೆ, ಆದರೆ ಸಾಲುಗಳು ನಿಜವಾದ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುತ್ತವೆ. ಕಾಲಮ್ಗಳಿಗೆ ಸಾಮಾನ್ಯವಾಗಿ ಮೌಲ್ಯಗಳ ಮೇಲೆ ನಿಯಮಗಳು ಅಥವಾ ನಿರ್ಬಂಧಗಳು ಇರುತ್ತವೆ, ಮೌಲ್ಯಗಳು ಕಾಲಮ್ ಅನ್ನು ಸರಿಯಾಗಿ ಪ್ರತಿನಿಧಿಸುವುದನ್ನು ಖಚಿತಪಡಿಸಲು. ಉದಾಹರಣೆಗೆ, ಗ್ರಾಹಕರ ಸ್ಪ್ರೆಡ್ಶೀಟ್ ಅನ್ನು ಕಲ್ಪಿಸಿ, ಪ್ರತಿ ಸಾಲು ಫೋನ್ ಸಂಖ್ಯೆಯನ್ನು ಹೊಂದಿರಬೇಕು ಮತ್ತು ಫೋನ್ ಸಂಖ್ಯೆಗಳು ಎಂದಿಗೂ ಅಕ್ಷರಗಳನ್ನು ಹೊಂದಿರಬಾರದು. ಫೋನ್ ಸಂಖ್ಯೆ ಕಾಲಮ್ನಲ್ಲಿ ಖಾಲಿ ಇರಬಾರದು ಮತ್ತು ಸಂಖ್ಯೆಗಳನ್ನಷ್ಟೇ ಹೊಂದಿರಬೇಕು ಎಂಬ ನಿಯಮಗಳು ಇರಬಹುದು.
ರಚನೆಬದ್ಧ ಡೇಟಾ ಎಂದರೆ ಸಾಲುಗಳು ಮತ್ತು ಕಾಲಮ್ಗಳಾಗಿ ಆಯೋಜಿತ ಡೇಟಾ, ಇಲ್ಲಿ ಪ್ರತಿಯೊಂದು ಸಾಲು ಒಂದೇ ಕಾಲಮ್ಗಳ ಸಮೂಹವನ್ನು ಹೊಂದಿರುತ್ತದೆ. ಕಾಲಮ್ಗಳು ನಿರ್ದಿಷ್ಟ ಪ್ರಕಾರದ ಮೌಲ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ ಮತ್ತು ಅವು ಯಾವ ಮೌಲ್ಯವನ್ನು ಸೂಚಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುವ ಹೆಸರಿನಿಂದ ಗುರುತಿಸಲಾಗುತ್ತದೆ, ಮತ್ತು ಸಾಲುಗಳು ನಿಜವಾದ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದುತ್ತವೆ. ಕಾಲಮ್ಗಳಿಗೆ ಸಾಮಾನ್ಯವಾಗಿ ನಿರ್ದಿಷ್ಟ ನಿಯಮಗಳು ಅಥವಾ ನಿಯಂತ್ರಣಗಳು ಇರುತ್ತವೆ, ಮೌಲ್ಯಗಳು ಕಾಲಮ್ ಅನ್ನು ನಿಖರವಾಗಿ ಪ್ರತಿನಿಧಿಸುತ್ತಾ ಇರುವುದು ಖಚಿತಪಡಿಸಲು. ಉದಾಹರಣೆಗೆ, ಗ್ರಾಹಕರ ಸ್ಪ್ರೆಡ್ಶೀಟ್ನಲ್ಲಿ ಪ್ರತಿಯೊಂದು ಸಾಲಿಗೂ ಫೋನ್ ಸಂಖ್ಯೆ ಇರಬೇಕು ಮತ್ತು ಫೋನ್ ಸಂಖ್ಯೆಗಳಲ್ಲಿ ಯಾವ ಅಕ್ಷರೋಚ್ಚಾರಗಳೂ ಇರಲಾಗದು ಎಂದು ಕಲ್ಪಿಸೋಣ. ಫೋನ್ ಸಂಖ್ಯೆಯ ಕಾಲಮ್ನಲ್ಲಿ ಖಾಲಿ ಇರಬಾರದು ಮತ್ತು ಕೇವಲ ಸಂಖ್ಯೆಯನ್ನಷ್ಟೇ ಒಳಗೊಂಡಿರಬೇಕು ಎಂಬ ನಿಯಮಗಳು ಇರಬಹುದು.
ರಚಿತ ಡೇಟಾದ ಲಾಭವೆಂದರೆ ಅದನ್ನು ಇತರ ರಚಿತ ಡೇಟಾಗಳೊಂದಿಗೆ ಸಂಬಂಧಿಸಿದಂತೆ ಸಂಘಟಿಸಬಹುದು. ಆದರೆ, ಡೇಟಾ ನಿರ್ದಿಷ್ಟ ರೀತಿಯಲ್ಲಿ ಸಂಘಟಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿರುವುದರಿಂದ, ಅದರ ಒಟ್ಟು ರಚನೆಯಲ್ಲಿ ಬದಲಾವಣೆಗಳನ್ನು ಮಾಡುವುದು ಬಹಳ ಪ್ರಯತ್ನದ ಕೆಲಸವಾಗಬಹುದು. ಉದಾಹರಣೆಗೆ, ಗ್ರಾಹಕರ ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗೆ ಖಾಲಿ ಇರಬಾರದ ಇಮೇಲ್ ಕಾಲಮ್ ಸೇರಿಸುವುದು ಎಂದರೆ ಈ ಮೌಲ್ಯಗಳನ್ನು ಡೇಟಾಸೆಟ್ನಲ್ಲಿನ ಇತ್ತೀಚಿನ ಗ್ರಾಹಕರ ಸಾಲುಗಳಿಗೆ ಹೇಗೆ ಸೇರಿಸುವುದು ಎಂದು ನೀವು ಕಂಡುಹಿಡಿಯಬೇಕಾಗುತ್ತದೆ.
ರಚನೆಬದ್ಧ ಡೇಟಾದ ಲಾಭವೆಂದರೆ ಅದನ್ನು ಇತರ ರಚನೆಬದ್ಧ ಡೇಟಾದೊಂದಿಗೆ ಸಂಬಂಧಿಸಿದಂತೆ ಆಯೋಜಿಸಬಹುದಾಗಿದೆ. ಆದಾಗ್ಯೂ, ಡೇಟಾ ವಿಶೇಷ ರೀತಿಯಲ್ಲಿ ಆಯೋಜನೆ ಮಾಡಲು ರೂಪಿಸಲಾಗಿದೆ ಆದ್ದರಿಂದ ಅದರ ಆಂತರಿಕ ರಚನೆಯನ್ನು ಬದಲಾಯಿಸಲು ಹೆಚ್ಚಿನ ಪ್ರಯತ್ನ ಅಗತ್ಯವಿರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಗ್ರಾಹಕರ ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗೆ ಖಾಲಿಯಾಗದ ಇಮೇಲ್ ಕಾಲಮ್ ಸೇರಿಸುವುದಾದರೆ, ಡೇಟಾ ಸಂಗ್ರಹದಲ್ಲಿರುವ ಗ್ರಾಹಕರ ಇತರೆ ಸಾಲುಗಳಿಗೆ ಈ ಮೌಲ್ಯಗಳನ್ನು ಹೇಗೆ ಸೇರಿಸುವುದೆಂದು ತೀರಾ ವಿಚಾರ ಮಾಡಬೇಕಾಗುತ್ತದೆ.
ರಚಿತ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗಳು, ಸಂಬಂಧಿತ ಡೇಟಾಬೇಸ್ಗಳು, ಫೋನ್ ಸಂಖ್ಯೆಗಳು, ಬ್ಯಾಂಕ್ ಸ್ಟೇಟ್ಮೆಂಟ್ಗಳು
ರಚನೆಬದ್ಧ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗಳು, ಸಂಬಂಧಿತ ಡೇಟಾಬೇಸ್ಗಳು, ಫೋನ್ ಸಂಖ್ಯೆಗಳು, ಬ್ಯಾಂಕ್ ಸ್ಟೇಟ್ಮೆಂಟ್ಗಳು
### ಅಸಂರಚಿತ ಡೇಟಾ
### ಅಸಂರಚಿತ ಡೇಟಾ
ಅಸಂರಚಿತ ಡೇಟಾವನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಸಾಲುಗಳು ಅಥವಾ ಕಾಲಮ್ಗಳಾಗಿ ವರ್ಗೀಕರಿಸಲಾಗುವುದಿಲ್ಲ ಮತ್ತು ಅನುಸರಿಸಬೇಕಾದ ಸ್ವರೂಪ ಅಥವಾ ನಿಯಮಗಳ ಸಮೂಹವಿಲ್ಲ. ಅಸಂರಚಿತ ಡೇಟಾ ರಚನೆ ಮೇಲೆ ಕಡಿಮೆ ನಿರ್ಬಂಧಗಳಿರುವುದರಿಂದ, ರಚಿತ ಡೇಟಾಸೆಟ್ಗಿಂತ ಹೊಸ ಮಾಹಿತಿಯನ್ನು ಸೇರಿಸುವುದು ಸುಲಭ. ಉದಾಹರಣೆಗೆ, ಪ್ರತಿಯೊಂದು 2 ನಿಮಿಷಗಳಿಗೊಮ್ಮೆ ಬಾರೋಮೆಟ್ರಿಕ್ ಒತ್ತಡವನ್ನು ಸೆನ್ಸರ್ ಹಿಡಿಯುತ್ತಿದ್ದರೆ, ಈಗ ಅದು ತಾಪಮಾನವನ್ನು ಅಳತೆಮಾಡಲು ಮತ್ತು ದಾಖಲಿಸಲು ಸಾಧ್ಯವಾಗುವ ಅಪ್ಡೇಟ್ ಪಡೆದಿದ್ದರೆ, ಅಸಂರಚಿತ ಡೇಟಾದಲ್ಲಿ ಇದರಿಂದ ಇತ್ತೀಚಿನ ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸುವ ಅಗತ್ಯವಿಲ್ಲ. ಆದರೆ, ಈ ರೀತಿಯ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವುದು ಅಥವಾ ಪರಿಶೀಲಿಸುವುದು ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳಬಹುದು. ಉದಾಹರಣೆಗೆ, ಸೆನ್ಸರ್ ಡೇಟಾದಿಂದ ಹಿಂದಿನ ತಿಂಗಳ ಸರಾಸರಿ ತಾಪಮಾನವನ್ನು ಕಂಡುಹಿಡಿಯಲು ಬಯಸುವ ವಿಜ್ಞಾನಿ, ಕೆಲವು ದಾಖಲೆಗಳಲ್ಲಿ "e" ಎಂಬ ಅಕ್ಷರವನ್ನು ಕಂಡುಹಿಡಿದಿದ್ದಾನೆ, ಇದು ಸೆನ್ಸರ್ ಕೆಡವಿದೆಯೆಂದು ಸೂಚಿಸುವುದಕ್ಕಾಗಿ, ಸಾಮಾನ್ಯ ಸಂಖ್ಯೆಯ ಬದಲು, ಅಂದರೆ ಡೇಟಾ ಅಪೂರ್ಣವಾಗಿದೆ.
ಅಸಂರಚಿತ ಡೇಟಾನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಸಾಲು ಅಥವಾ ಕಾಲಮ್ಗಳಾಗಿ ವರ್ಗೀಕರಿಸಲಾಗದು ಮತ್ತು ಯಾವುದೇ ಫಾರ್ಮ್ಯಾಟ್ ಅಥವಾ ನಿಯಮಾವಳಿಗಳನ್ನು ಅನುಸರಿಸುವುದಿಲ್ಲ. ಅಸಂರಚಿತ ಡೇಟಾಕೆ ರಚನೆ ಮೇಲೆ ಕಡಿಮೆ ನಿಯಂತ್ರಣಗಳಿರುವುದರಿಂದ, ಹೊಸ ಮಾಹಿತಿಯನ್ನು ಸೇರಿಸುವುದು ಸರಳ. ಉದಾಹರಣೆಗೆ, ಪ್ರತಿಯೊಂದು 2 ನಿಮಿಷಕ್ಕೊಮ್ಮೆ ಬಾರೋಮೆಟ್ರಿಕ್ ಒತ್ತಡವನ್ನು ಸಂಗ್ರಹಿಸುವ ಸೆನ್ಸರ್ ಒಂದು ಅಪ್ಡೇಟ್ ಪಡೆದುಕೊಂಡು ಈಗ ತಾಪಮಾನವನ್ನು ಅಳೆಯುವ ಮತ್ತು ದಾಖಲಿಸುವಂತಾಯಿತು ಎಂದರೆ, ಅಸಂರಚಿತ ಡೇಟಾ ಆಗಿದ್ದರೆ ಈಗಿರುವ ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸಬೇಕಾಗಿಲ್ಲ. ಆದಾಗ್ಯೂ, ಈ ರೀತಿಯ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವುದು ಅಥವಾ ತನಿಖೆ ಮಾಡುವುದು ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳಬಹುದು. ಉದಾಹರಣೆಗೆ, ಹಿಂದಿನ ತಿಂಗಳ ಸರಾಸರಿ ತಾಪಮಾನ ಕಂಡುಹಿಡಿಯಲು ವಿಜ್ಞಾನಿ ಸೆನ್ಸರ್ ಡೇಟಾ ಬಳಸಬೇಕಾದಾಗ, ಕೆಲವು ದಾಖಲೆಗಳಲ್ಲೊಂದು "e" ಅಕ್ಷರವನ್ನು ತಮ್ಮ ಪ್ರಶಾಂತ ಸ್ಥಿತಿಯನ್ನು ಸೂಚಿಸಲು ದಾಖಲಿಸಿದ್ದನ್ನು ಕಂಡುಹಿಡಿದಿದ್ದರೆ, ಅಂದರೆ ಡೇಟಾ ಸಂಪೂರ್ಣವಾಗಿಲ್ಲ.
ಅಸಂರಚಿತ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಪಠ್ಯ ಕಡತಗಳು, ಪಠ್ಯ ಸಂದೇಶಗಳು, ವೀಡಿಯೋ ಕಡತಗಳು
ಅಸಂರಚಿತ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಪಠ್ಯ ಕಡತಗಳು, ಪಠ್ಯ ಸಂದೇಶಗಳು, ವೀಡಿಯೋ ಕಡತಗಳು
### ಅರ್ಧ-ರಚಿತ
### ಅರ್ಧ-ಸಂರಚಿತ
ಅರ್ಧ-ರಚಿತ ಡೇಟಾ ರಚಿತ ಮತ್ತು ಅಸಂರಚಿತ ಡೇಟಾದ ಸಂಯೋಜನೆಯಾಗಿರುವ ಲಕ್ಷಣಗಳನ್ನು ಹೊಂದಿದೆ. ಇದು ಸಾಮಾನ್ಯವಾಗಿ ಸಾಲುಗಳು ಮತ್ತು ಕಾಲಮ್ಗಳ ಸ್ವರೂಪಕ್ಕೆ ಅನುಗುಣವಾಗಿರದು, ಆದರೆ ರಚಿತ ಎಂದು ಪರಿಗಣಿಸಲ್ಪಡುವ ರೀತಿಯಲ್ಲಿ ಸಂಘಟಿತವಾಗಿರುತ್ತದೆ ಮತ್ತು ನಿಶ್ಚಿತ ಸ್ವರೂಪ ಅಥವಾ ನಿಯಮಗಳ ಸಮೂಹವನ್ನು ಅನುಸರಿಸಬಹುದು. ರಚನೆ ಮೂಲಗಳ ಪ್ರಕಾರ ಬದಲಾಗುತ್ತದೆ, ಉದಾಹರಣೆಗೆ ಚೆನ್ನಾಗಿ ವ್ಯಾಖ್ಯಾನಗೊಂಡ ಹೈರಾರ್ಕಿಯಿಂದ ಹಿಡಿದು ಹೊಸ ಮಾಹಿತಿಯನ್ನು ಸುಲಭವಾಗಿ ಸಂಯೋಜಿಸಲು ಅನುಕೂಲಕರವಾದ ಹೆಚ್ಚು ಲವಚಿಕ ಸ್ವರೂಪದವರೆಗೆ. ಮೆಟಾಡೇಟಾ ಎಂದರೆ ಡೇಟಾ ಹೇಗೆ ಸಂಘಟಿತವಾಗಿದೆ ಮತ್ತು ಸಂಗ್ರಹಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸಲು ಸಹಾಯ ಮಾಡುವ ಸೂಚಕಗಳು ಮತ್ತು ಡೇಟಾ ಪ್ರಕಾರದ ಆಧಾರದ ಮೇಲೆ ವಿವಿಧ ಹೆಸರಿನಿರುತ್ತವೆ. ಮೆಟಾಡೇಟಾದ ಕೆಲವು ಸಾಮಾನ್ಯ ಹೆಸರುಗಳು ಟ್ಯಾಗ್ಗಳು, ಅಂಶಗಳು, ಘಟಕಗಳು ಮತ್ತು ಗುಣಲಕ್ಷಣಗಳು. ಉದಾಹರಣೆಗೆ, ಸಾಮಾನ್ಯ ಇಮೇಲ್ ಸಂದೇಶವು ವಿಷಯ, ದೇಹ ಮತ್ತು ಸ್ವೀಕರಿಸುವವರ ಸಮೂಹವನ್ನು ಹೊಂದಿರುತ್ತದೆ ಮತ್ತು ಯಾರಿಂದ ಅಥವಾ ಯಾವಾಗ ಕಳುಹಿಸಲಾಯಿತು ಎಂಬುದರ ಮೂಲಕ ಸಂಘಟಿಸಲಾಗಬಹುದು.
ಅರ್ಧ-ಸಂರಚಿತ ಡೇಟಾ ಹೊಂದಿರುವ ಲಕ್ಷಣಗಳು ರಚನೆಬದ್ಧ ಮತ್ತು ಅಸಂರಚಿತ ಡೇಟಾದ ಸಂಯೋಜನೆಯನ್ನು ಮಾಡುತ್ತವೆ. ಸಾಮಾನ್ಯವಾಗಿ ಸಾಲು ಮತ್ತು ಕಾಲಮ್ ಫಾರ್ಮ್ಯಾಟ್ಗೆ ಅನುಗುಣವಾಗಿಲ್ಲ, ಆದರೆ ಯಾರೋ ಆದೇಶಿಸಿದಂತೆ ಆಯೋಜಿತವಾಗಿದೆ ಮತ್ತು ನಿಯಮಾವಳಿಗಳೊಂದಿಗಿರಬಹುದು. ಮೂಲಗಳ ಪ್ರಕಾರ ರಚನೆ ಬದಲಾಗಬಹುದು, ಉದಾಹರಣೆಗೆ ಸ್ಪಷ್ಟವಾದ ಹೈಯರಾರ್ಕಿ ಅಥವಾ ಸುಲಭವಾಗಿ ಹೊಸ ಮಾಹಿತಿಯನ್ನು ಒಗ್ಗೂಡಿಸುವ ಸ್ವಂತ ಮಾಹಿತಿ. ಮೆಟಾಡೇಟಾ ಎಂದರೆ ಡೇಟಾ ಹೇಗೆ ಆಯೋಜಿಸಲಾಗಿದೆ ಮತ್ತು ಸಂಗ್ರಹಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ತೀರ್ಮಾನಿಸಲು ಸಹಾಯ ಮಾಡುವ ಸೂಚಕರು, ಮತ್ತು ಡೇಟಾ ಪ್ರಕಾರ ಅನುಸಾರವಾಗಿ ವಿವಿಧ ಹೆಸರಿನೊಂದಿಗೆ ಇರುತ್ತವೆ. ಕೆಲವು ಸಾಮಾನ್ಯ ಹೆಸರುಗಳು: ಟ್ಯಾಗ್ಗಳು, ಘಟಕಗಳು, ಘಟಕತ್ವಗಳು ಮತ್ತು ಗುಣಲಕ್ಷಣಗಳು. ಉದಾಹರಣೆಗೆ, ಸಾಮಾನ್ಯ ಇಮೇಲ್ ಸಂದೇಶದಲ್ಲಿ ವಿಷಯ, ದೇಹ ಮತ್ತು ಸ್ವೀಕರಿಸುವವರ ಸಮೂಹ ಇರುತ್ತದೆ ಮತ್ತು ಅದನ್ನು ಯಾರು ಅಥವಾ ಯಾವಾಗ ಕಳುಹಿಸಲಾಗಿದೆ ಎಂಬುದರ ಮೂಲಕ ಆಯೋಜಿಸಬಹುದು.
ಡೇಟಾ ಮೂಲ ಎಂದರೆ ಡೇಟಾ ಉತ್ಪತ್ತಿಯಾದ ಪ್ರಾಥಮಿಕ ಸ್ಥಳ ಅಥವಾ ಅದು "ನಿವಾಸ" ಹೊಂದಿರುವ ಸ್ಥಳ ಮತ್ತು ಅದು ಹೇಗೆ ಮತ್ತು ಯಾವಾಗ ಸಂಗ್ರಹಿಸಲ್ಪಟ್ಟಿತು ಎಂಬುದರ ಆಧಾರದ ಮೇಲೆ ಬದಲಾಗುತ್ತದೆ. ಬಳಕೆದಾರರಿಂದ ಉತ್ಪತ್ತಿಯಾದ ಡೇಟಾವನ್ನು ಪ್ರಾಥಮಿಕ ಡೇಟಾ ಎಂದು ಕರೆಯುತ್ತಾರೆ, ಮತ್ತು ಸಾಮಾನ್ಯ ಬಳಕೆಗೆ ಸಂಗ್ರಹಿಸಿದ ಮೂಲದಿಂದ ಬಂದ ಡೇಟಾವನ್ನು ದ್ವಿತೀಯ ಡೇಟಾ ಎಂದು ಕರೆಯುತ್ತಾರೆ. ಉದಾಹರಣೆಗೆ, ಒಂದು ಗುಂಪು ವಿಜ್ಞಾನಿಗಳು ಮಳೆಕಾಡಿನಲ್ಲಿ ಅವಲೋಕನಗಳನ್ನು ಸಂಗ್ರಹಿಸುತ್ತಿದ್ದರೆ ಅವರು ಪ್ರಾಥಮಿಕ ಎಂದು ಪರಿಗಣಿಸಲ್ಪಡುತ್ತಾರೆ ಮತ್ತು ಅವರು ಅದನ್ನು ಇತರ ವಿಜ್ಞಾನಿಗಳೊಂದಿಗೆ ಹಂಚಿಕೊಳ್ಳಲು ನಿರ್ಧರಿಸಿದರೆ, ಅದನ್ನು ಬಳಸುವವರಿಗೆ ದ್ವಿತೀಯ ಎಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ.
ಡೇಟಾ ಮೂಲ ಎಂದರೆ ಡೇಟಾ ಉತ್ಪಾದನೆಯ ಮೊದಲ ಸ್ಥಳ, ಅಲ್ಲಿ ಅದು "ನಿವಾಸಿಸುತ್ತಿದೆ" ಎಂದು ಅರ್ಥವಾಗುತ್ತದೆ ಮತ್ತು ಡೇಟಾ ಸಂಗ್ರಹಣೆಯ ವಿಧಾನ ಮತ್ತು ಸಮಯ ಆಧಾರಿತವಾಗಿರುತ್ತದೆ. ಬಳಕೆದಾರರಿಂದ ಉದ್ಭವಿಸಿರುವ ಡೇಟಾವನ್ನು ಪ್ರಾಥಮಿಕ ಡೇಟಾ ಎಂದು ಕರೆಯುತ್ತಾರೆ; ಆದರೆ ಡೇಟಾ ಸಾಮಾನ್ಯ ಬಳಕೆಗೆ ಸಂಗ್ರಹಿಸಿರುವ ಮೂಲದಿಂದ ಬಂದಿರುವುದನ್ನು ದ್ವಿತೀಯ ಡೇಟಾ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಮಳೆಯ ಕಾಡಿನಲ್ಲಿ ವೀಕ್ಷಣೆಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ವಿಜ್ಞಾನಿಗಳ ಗುಂಪನ್ನು ಪ್ರಾಥಮಿಕವೆಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ, ಮತ್ತು ಅವರು ಅದನ್ನು ಇತರ ವಿಜ್ಞಾನಿಗಳಿಗೆ ಹಂಚಿದರೆ ಅದನ್ನು ದ್ವಿತೀಯ ಎಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ.
ಡೇಟಾಬೇಸ್ಗಳು ಸಾಮಾನ್ಯ ಮೂಲವಾಗಿದ್ದು, ಡೇಟಾಬೇಸ್ ನಿರ್ವಹಣಾ ವ್ಯವಸ್ಥೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿವೆ, ಬಳಕೆದಾರರು ಡೇಟಾವನ್ನು ಅನ್ವೇಷಿಸಲು ಕ್ವೆರಿಗಳು ಎಂದು ಕರೆಯುವ ಆಜ್ಞೆಗಳನ್ನು ಬಳಸುತ್ತಾರೆ. ಫೈಲ್ಗಳು ಡೇಟಾ ಮೂಲಗಳಾಗಿ ಧ್ವನಿ, ಚಿತ್ರ ಮತ್ತು ವೀಡಿಯೋ ಕಡತಗಳಾಗಿರಬಹುದು ಮತ್ತು ಎಕ್ಸೆಲ್ನಂತಹ ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗಳಾಗಿರಬಹುದು. ಇಂಟರ್ನೆಟ್ ಮೂಲಗಳು ಡೇಟಾ ಹೋಸ್ಟ್ ಮಾಡುವ ಸಾಮಾನ್ಯ ಸ್ಥಳವಾಗಿದ್ದು, ಅಲ್ಲಿ ಡೇಟಾಬೇಸ್ಗಳು ಮತ್ತು ಫೈಲ್ಗಳು ದೊರೆಯಬಹುದು. ಅಪ್ಲಿಕೇಶನ್ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಇಂಟರ್ಫೇಸ್ಗಳು, ಅಥವಾ APIಗಳು, ಪ್ರೋಗ್ರಾಮರ್ಗಳಿಗೆ ಇಂಟರ್ನೆಟ್ ಮೂಲಕ ಬಾಹ್ಯ ಬಳಕೆದಾರರೊಂದಿಗೆ ಡೇಟಾ ಹಂಚಿಕೊಳ್ಳಲು ಮಾರ್ಗಗಳನ್ನು ಸೃಷ್ಟಿಸಲು ಅನುಮತಿಸುತ್ತವೆ, ಮತ್ತು ವೆಬ್ ಸ್ಕ್ರೇಪಿಂಗ್ ಪ್ರಕ್ರಿಯೆ ವೆಬ್ ಪುಟದಿಂದ ಡೇಟಾವನ್ನು ಹೊರತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. [ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುವ ಪಾಠಗಳು](../../../../../../../../../2-Working-With-Data) ವಿವಿಧ ಡೇಟಾ ಮೂಲಗಳನ್ನು ಹೇಗೆ ಬಳಸುವುದು ಎಂಬುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುತ್ತವೆ.
ಡೇಟಾಬೇಸ್ಗಳು ಸಾಮಾನ್ಯ ಮೂಲಗಳಾಗಿದ್ದು, ಡೇಟಾಬೇಸ್ ನಿರ್ವಹಣಾ ವ್ಯವಸ್ಥೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುತ್ತವೆ, ಇಲ್ಲಿ ಬಳಕೆದಾರರು ಪ್ರಶ್ನೆಗಳನ್ನು ಹಾಕಿ ಡೇಟಾನ್ನನ್ನು ಅನ್ವೇಷಿಸುತ್ತಾರೆ. ಫೈಲ್ಗಳು ಡೇಟಾ ಮೂಲಗಳಾಗಿದ್ದು ಶಬ್ದ, ಚಿತ್ರ ಮತ್ತು ವೀಡಿಯೋ ಕಡತಗಳಾಗಿರಬಹುದು ಹಾಗು ಎಕ್ಸೆಲ್ನಂತಹ ಸ್ಪ್ರೆಡ್ಶೀಟ್ಗಳಾಗಿರಬಹುದು. ಇಂಟರ್ನೆಟ್ ಮೂಲಗಳು ಡೇಟಾ ಹೋಸ್ಟ್ ಮಾಡುವ ಸಾಮಾನ್ಯ ಸ್ಥಳಗಳಾಗಿದ್ದು, ಇಲ್ಲಿ ಡೇಟಾಬೇಸ್ಗಳು ಮತ್ತು ಫೈಲ್ಗಳೂ ಒದಗಿಸಬಹುದು. ಅಪ್ಲಿಕೇಶನ್ ಪ್ರೋಗ್ರಾಂ ಇಂಟರ್ಫೇಸಿಗಳು (APIs) ಪ್ರೋಗ್ರಾಮರ್ಗಳಿಗೆ ಅಂತರ್ಜಾಲದ ಮೂಲಕ ಬಾಹ್ಯ ಬಳಕೆದಾರರೊಂದಿಗೆ ಡೇಟಾ ಹಂಚುವ ಮಾರ್ಗಗಳನ್ನು ಸೃಷ್ಟಿಸಲು ಅವಕಾಶ ನೀಡುತ್ತವೆ, ಮತ್ತು ವೆಬ್ಸ್ಕ್ರೆಪಿಂಗ್ ಪ್ರಕ್ರಿಯೆಯು ವೆಬ್ ಪುಟದಿಂದ ಡೇಟಾವನ್ನು ತೆಗೆಯುತ್ತದೆ. [ಡೇಟಾ ಜೊತೆಗೆ ಕೆಲಸ ಮಾಡುವುದು](../../../../../../../../../2-Working-With-Data) ಪಾಠಗಳು ವಿವಿಧ ಡೇಟಾ ಮೂಲಗಳನ್ನು ಹೇಗೆ ಉಪಯೋಗಿಸುವುದೆಂಬುದನ್ನು ವಿವರಿಸುತ್ತವೆ.
## ಸಾರಾಂಶ
## ಸಮಾರೋಪ
ಈ ಪಾಠದಲ್ಲಿ ನಾವು ಕಲಿತದ್ದು:
ಈ ಪಾಠದಲ್ಲಿ ನಾವು ಕಲಿತವು:
- ಡೇಟಾ ಎಂದರೇನು
- ಡೇಟಾ ಎಂದರೇನು
- ಡೇಟಾವನ್ನು ಹೇಗೆ ವರ್ಣಿಸಲಾಗುತ್ತದೆ
- ಡೇಟಾವನ್ನು ಹೇಗೆ ವಿವರಿಸಲಾಗುತ್ತದೆ
- ಡೇಟಾವನ್ನು ಹೇಗೆ ವರ್ಗೀಕರಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ವರ್ಗೀಕರಿಸಲಾಗುತ್ತದೆ
- ಡೇಟಾವನ್ನು ಹೇಗೆ ವರ್ಗೀಕರಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ವಿಭಾಗಾಕೃತ ಮಾಡಲಾಗುತ್ತದೆ
- ಡೇಟಾವನ್ನು ಎಲ್ಲಿಂದ ಕಂಡುಹಿಡಿಯಬಹುದು
- ಡೇಟಾ ಸಂಗ್ರಹಣೆಯ ಸ್ಥಳಗಳು
## 🚀 ಸವಾಲು
## 🚀 ಸವಾಲು
ಕಾಗಲ್ ಒಂದು ಉತ್ತಮ ಮುಕ್ತ ಡೇಟಾಸೆಟ್ ಮೂಲವಾಗಿದೆ. [ಡೇಟಾಸೆಟ್ ಹುಡುಕಾಟ ಸಾಧನ](https://www.kaggle.com/datasets) ಬಳಸಿ ಕೆಲವು ಆಸಕ್ತಿದಾಯಕ ಡೇಟಾಸೆಟ್ಗಳನ್ನು ಹುಡುಕಿ ಮತ್ತು ಈ ಮಾನದಂಡಗಳೊಂದಿಗೆ 3-5 ಡೇಟಾಸೆಟ್ಗಳನ್ನು ವರ್ಗೀಕರಿಸಿ:
Kaggle ಇಲ್ಲಿ ಉತ್ತಮ ತೆರೆದ ಡೇಟಾ ಸಂಗ್ರಹಗಳು ಲಭ್ಯವಿದ್ದು, [ಡೇಟಾ ಸಂಗ್ರಹ ಹುಡುಕು ಸಾಧನ](https://www.kaggle.com/datasets) ಉಪಯೋಗಿಸಿ ಕೆಲವು ರೋಚಕ ಡೇಟಾ ಸಂಗ್ರಹಗಳನ್ನು ಹುಡುಕಿ ಮತ್ತು ಕೆಳಗಿನ ಮಾನದಂಡಗಳೊಂದಿಗೆ 3-5 ಡೇಟಾ ಸಂಗ್ರಹಗಳನ್ನು ವರ್ಗೀಕರಿಸಿ:
- ಈ ಮೈಕ್ರೋಸಾಫ್ಟ್ ಲರ್ನ್ ಘಟಕ, [ನಿಮ್ಮ ಡೇಟಾವನ್ನು ವರ್ಗೀಕರಿಸಿ](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) ಎಂಬ ಶೀರ್ಷಿಕೆಯೊಂದಿಗೆ, ರಚಿತ, ಅರ್ಧ-ರಚಿತ ಮತ್ತು ಅಸಂರಚಿತ ಡೇಟಾದ ವಿವರವಾದ ವಿವರಣೆಯನ್ನು ಹೊಂದಿದೆ.
- ಈ ಮೈಕ್ರೋಸಾಫ್ಟ್ ಲರ್ನ್ ಯೂನಿಟ್, ಶೀರ್ಷಿಕೆ [ಡೇಟಾ ಫಾರ್ಮ್ಯಾಟ್ ಗಳನ್ನು ಗುರುತಿಸುವುದು](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) ನಲ್ಲಿ ರಚನೆಬದ್ಧ, ಅರ್ಧ-ಸಂರಚಿತ ಮತ್ತು ಅಸಂರಚಿತ ಡೇಟಾದ ವಿಶದ ವಿವರಣೆ ಇದೆ.
## ಹುದ್ದೆ
## ನಿಯೋಜನೆ
[ಡೇಟಾಸೆಟ್ಗಳನ್ನು ವರ್ಗೀಕರಿಸುವುದು](assignment.md)
[ಡೇಟಾ ಸಂಗ್ರಹಗಳನ್ನು ವರ್ಗೀಕರಿಸುವುದು](assignment.md)
---
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**ಅಸ್ವೀಕರಣ**:
**ಅಸ್ವೀಕಾರ**:
ಈ ದಸ್ತಾವೇಜು [Co-op Translator](https://github.com/Azure/co-op-translator) ಎಂಬ AI ಅನುವಾದ ಸೇವೆಯನ್ನು ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ಶುದ್ಧತೆಯತ್ತ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ತಪ್ಪುಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂಬುದನ್ನು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಮಹತ್ವದ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ ಅಥವಾ ತಪ್ಪು ವಿವರಣೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ.
ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.
"ನಾವು ಈ ನೋಟ್ಬುಕೆಂದು, ನಾವು ಹಿಂದಿನದಲ್ಲೇ ಚರ್ಚಿಸಿದ ಕೆಲವು ಕಲ್ಪನೆಗಳೊಂದಿಗೆ ಆಟವಾಡೋಣ. ಸಾಧ್ಯತೆ ಮತ್ತು ಅಂಕಿಅಂಶದ ಅನೇಕ ಕಲ್ಪನೆಗಳು ಪೈಥಾನ್ನಲ್ಲಿ `numpy` ಮತ್ತು `pandas` ಮುಂತಾದ ಪ್ರಮುಖ ಡೇಟಾ ಪ್ರಕ್ರಿಯೆ ಗ್ರಂಥಾಲಯಗಳಲ್ಲಿ ಚೆನ್ನಾಗಿ ಪ್ರತಿನಿಧಿಸಲಾಗಿದೆ.\n"
"ಈ ನೋಟ್ಬುಕ್ನಲ್ಲಿ, ನಾವು ಹಿಂದಿನಂತಾಗಿ ಚರ್ಚಿಸಿರುವ ಕೆಲವು ಕಲ್ಪನೆಗಳೊಂದಿಗೆ ಆಟ ಆಡೋಣ. ಪ್ರಾಬಬಿಲಿಟಿ ಮತ್ತು ಸಂಖ್ಯಾಶಾಸ್ತ್ರದಿಂದ ನಗರಿಸಿದ ಹಲವು ಕಲ್ಪನೆಗಳು Python ನಲ್ಲಿ ಡೇಟಾ ಪ್ರೊಸೆಸಿಂಗ್ಗಾಗಿ ಪ್ರಮುಖ ಲೈಬ್ರರಿಗಳಾದ `numpy` ಮತ್ತು `pandas` ನಲ್ಲಿ ಉತ್ತಮವಾಗಿ ಪ್ರತಿನಿಧಿಸಲ್ಪಟ್ಟಿವೆ.\n"
]
]
},
},
{
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## Random Variables and Distributions\n",
"## ಯಾದೃಚ్ఛಿಕ ಚರಗಳು ಮತ್ತು ವಿತರಣೆಗಳು\n",
"0 ರಿಂದ 9ರವರೆಗೆ ಇರುವ ಸಮನ್ವಿತ ವಿತರಣೆಯಿಂದ 30 ಮೌಲ್ಯಗಳ ಒಂದು ಮಾದರಿಯನ್ನು ಬಿಡಿಸುವುದರಿಂದ ಶುರು ಮಾಡೋಣ. ನಾವು ಸರಾಸರಿ ಮತ್ತು ವ್ಯತ್ಯಾಸವನ್ನು ಕೂಡ ಗಣನೆ ಮಾಡುತ್ತೇವೆ.\n"
"0 ರಿಂದ 9 ರವರೆಗೆ ಸಮ್ಮಿಲನ ವಿತರಣೆಯಿಂದ 30 ಮೌಲ್ಯಗಳ ಒಂದು ಮಾದರಿಯನ್ನು ರೇಖಿಸುವುದರಿಂದ ನಾವು ಪ್ರಾರಂಭಿಸೋಣ. ನಾವು ಸರಾಸರಿ ಮತ್ತು ಪರವ್ಯಾಪ್ತಿಯನ್ನು ಕೂಡ 계산ಿಸುವೆವು.\n"
]
]
},
},
{
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಮೂನೆಯಲ್ಲಿ ಎಷ್ಟು ವಿಭಿನ್ನ ಮೌಲ್ಯಗಳಿವೆ ಎಂದು ದೃಶ್ಯವಾಗಿ ಅಂದಾಜು ಮಾಡಲು, ನಾವು **ಹಿಸ್ಟೋಗ್ರಾಮ್** ಅನ್ನು ಅಂಶಿಸುವಬಹುದು:\n"
"ನಮೂನೆಯಲ್ಲಿ ಎಷ್ಟು ವಿಭಿನ್ನ ಮೌಲ್ಯಗಳಿವೆ ಎಂದು ದೃಶ್ಯವಾಗಿ ಅವಲೋಕಿಸಲು, ನಾವು **ಹಿಸ್ಟೋಗ್ರಾಮ್** ಅನ್ನು ಆಕೃತಿಪಡಿಸಬಹುದು:\n"
]
]
},
},
{
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ನಿಜವಾದ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವುದು\n",
"## ನಿಜವಾದ ಡೇಟಾ ವಿಶ್ಲೇಷಣೆ\n",
"\n",
"\n",
"ಸರಾಸರಿ ಮತ್ತು ವೈವಿಧ್ಯವು ನಿಜವಾದ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವಾಗ ಬಹಳ ಮಹತ್ವವನ್ನು ಹೊಂದಿವೆ. ಬೇಸುಬಾಲ್ ಆಟಗಾರರ ಕುರಿತು ಇರುವ ಡೇಟಾವನ್ನು [SOCR MLB ಎತ್ತರ/ತೂಕ ಡೇಟಾ](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) ನಿಂದ ಲೋಡ್ ಮಾಡೋಣ.\n"
"ಸರಾಸರಿ ಮತ್ತು ವೈಚಿತ್ರ್ಯವು ನಿಜವಾದ ಜಗತ್ತಿನ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವಾಗ ತುಂಬಾ ಪ್ರಮುಖವಾದವು. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) ನಿಂದ ಬೇಸ್ಬಾಲ್ ಆಟಗಾರರ ಬಗ್ಗೆ ಡೇಟಾವನ್ನು ಲೋಡ್ ಮಾಡೋಣ\n"
]
]
},
},
{
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> ನಾವು ಡೇಟಾ ವಿಶ್ಲೇಷಣೆಗೆ [**Pandas**](https://pandas.pydata.org/) ಎಂಬ ಪ್ಯಾಕೇಜ್ ಅನ್ನು ಬಳಸುತ್ತಿದ್ದೇವೆ. ಈ ಪಾಠಕ್ರಮದಲ್ಲಿ ನಂತರ ನಾವು ಪಾಂಡಾಸ್ ಮತ್ತು ಪೈಥಾನ್ನಲ್ಲಿ ಡೇಟಾ ಕೆಲಸಮಾಡುವುದನ್ನು ಹೆಚ್ಚು ಚರ್ಚಿಸುವೆವು.\n",
"> ನಾವು ಇಲ್ಲಿ ಡೇಟಾ ವಿಶ್ಲೇಷಣೆಗೆ [**Pandas**](https://pandas.pydata.org/) ಎಂಬ ಪ್ಯಾಕೇಜ್ ಅನ್ನು ಬಳಸುತ್ತಿದ್ದೇವೆ. ಈ 코ರ್ಸಿನಲ್ಲಿ ನಂತರ Pandas ಮತ್ತು Python ನಲ್ಲಿ ಡೇಟಾ ಕೆಲಸದ ಬಗ್ಗೆ ಹೆಚ್ಚು ಮಾತನಾಡುವುದು.\n",
"\n",
"\n",
"ನಮ್ಮು ವಯಸ್ಸಿನ, ಎತ್ತರದ ಮತ್ತು ತೂಕದ ಸರಾಸರಿ ಮೌಲ್ಯಗಳನ್ನು ಲೆಕ್ಕಹಾಕೋಣ:\n"
"ವಯಸ್ಸು, ಎತ್ತರ ಮತ್ತು ತೂಕದ ಸರಾಸರಿ ಮೌಲ್ಯಗಳನ್ನು ಲೆಕ್ಕಿಸೋಣ:\n"
]
]
},
},
{
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಈಗ ಎತ್ತರದ ಮೇಲೆ ಗಮನಹರಿಸಿ, ಮತ್ತು ಸಾಮಾನ್ಯ ವಿಚಲನ ಮತ್ತು ವೈವಿಧ್ಯವನ್ನು ಗಣನೆ ಮಾಡೋಣ:\n"
"ಈಗ ನಾವು ಎತ್ತರದ ಮೇಲೆ ಗಮನ केंद्रितಮಾಡಿ, ಮಾನಕವಿಚಲನ ಮತ್ತು ವೈಸರ್ಯವನ್ನು ಲೆಕ್ಕಹಾಕೋಣ: \n"
]
]
},
},
{
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಸರಾಸರಿ ಮೌಲ್ಯದಿಂದ ಹೊರತುಪಡಿಸಿ, ಮಧ್ಯಮ ಮೌಲ್ಯ ಮತ್ತು ಕ್ವಾರ್ಟೈಲ್ಗಳನ್ನು ನೋಡುವುದು ಸುಮತ್ನದಾಗಿದೆ. ಅವುಗಳನ್ನು **ಬಾಕ್ಸ್ ಪ್ಲಾಟ್** ಬಳಸಿ ದೃಶ್ಯೀಕರಿಸಬಹುದು:\n"
"ಸರಾಸರಿಯ ಜೊತೆಗೆ, ಮದ್ಯಮಾನ ಮೌಲ್ಯ ಮತ್ತು ಚತುರ್ಭಾಗಗಳನ್ನು ನೋಡಲು ಅರ್ಥವಾಗುತ್ತದೆ. ಅವುಗಳನ್ನು **ಬಾಕ್ಸ್ ಪ್ಲಾಟ್** ಉಪಯೋಗಿಸಿ ದೃಶ್ಯೀಕರಿಸಬಹುದು:\n"
"ನಾವು ನಮ್ಮ ಡೇಟಾಸೆಟ್ನ ಉಪಸಮುಚ್ಚಯಗಳ ಬಾಕ್ಸ್ ಪ್ಲಾಟ್ಗಳನ್ನು ಮಾಡಬಹುದು, ಉದಾಹರಣೆಗೆ, ಆಟಗಾರರ ಪಾತ್ರದ ಮೂಲಕ ಗುಂಪುಗೂಡಿಸಲಾಗುತ್ತದೆ.\n"
"ನಾವು ನಮ್ಮ ಡೇಟಾಸೆಟ್ನ ಉಪಸೆಟ್ಗಳ ಬಾಕ್ಸ್ ಪ್ಲಾಟ್ಗಳನ್ನು ಮಾಡಬಹುದು, ಉದಾಹರಣೆಗೆ, ಆಟಗಾರರ ಪಾತ್ರದ ಪ್ರಕಾರ ಗುಂಪುಬದ್ಧಗೊಳಿಸಲಾಗುತ್ತದೆ.\n"
]
]
},
},
{
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> **ಗಮನಿಸಿ**: ಈ ಚಿತ್ರಣದಲ್ಲಿ, ಸರಾಸರಿ ಪ್ರಕಾರ, ಮೊದಲ ಬೇಸ್ಮ್ಯಾನ್ನ ಎತ್ತರವು ಎರಡನೇ ಬೇಸ್ಮ್ಯಾನ್ನ ಎತ್ತರಕ್ಕಿಂತ ಎತ್ತರವಾಗಿದೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ. ನಂತರ ನಾವು ಈ ಕಲ್ಪನೆಯನ್ನು ಅಧಿಕೃತವಾಗಿ ಹೇಗೆ ಪರೀಕ್ಷಿಸಬಹುದು ಮತ್ತು ನಮ್ಮ ಡೇಟಾ ಸಾಂಖ್ಯಿಕವಾಗಿ ಮಹತ್ತರವಾಗಿದೆ ಎಂದು ಹೇಗೆ ಪ್ರದರ್ಶಿಸಬಹುದು ಎಂದು ತಿಳಿಯೋಣ. \n",
"> **ಇತ್ಯಾದಿ**: ಈ ರೂಪರೇಖೆ ಸೂಚಿಸುತ್ತದೆ, ಸರಾಸರಿ olarak, ಮೊದಲ ಬ್ಯಾಗ್ಮ್ಯಾನ್ಗಳ ಎತ್ತರ ಎರಡನೇ ಬ್ಯಾಗ್ಮ್ಯಾನ್ಗಳ ಎತ್ತರಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿವೆ. ನಂತರ ನಾವು ಈ ಊಹೆಯನ್ನು ಯಥಾರ್ಥವಾಗಿ ಪರೀಕ್ಷಿಸುವುದನ್ನು ಕಲಿಯುವೆವು, ಮತ್ತು ನಮ್ಮ ಡೇಟಾ ವೈಜ್ಞಾನಿಕವಾಗಿ ಮಹತ್ವಪೂರ್ಣವಾಗಿದೆ ಎಂದು ತೋರಿಸುವ ಮಾರ್ಗವನ್ನು ತಿಳಿಯುವೆವು. \n",
"\n",
"\n",
"ವಯಸ್ಸು, ಎತ್ತರ ಮತ್ತು ತೂಕವೆಲ್ಲವೂ ಸತತ ಚೌಕಟ್ಟಿನ ಸಾಂಖ್ಯಿಕ ಚರಗಳಾಗಿವೆ. ನೀವು ಅವುಗಳ ವಿತರಣೆಯನ್ನು ಏನು ಎಂದು ಭಾವಿಸುತ್ತೀರಿ? ಅದನ್ನು ಕಂಡುಹಿಡಿಯಲು ಒಂದು ಒಳ್ಳೆಯ ವಿಧಾನವೆಂದರೆ ಮೌಲ್ಯಗಳ ಹಿಂದ್ಸ್ಟೋಗ್ರಾಂವನ್ನು ಚಿತ್ರಿಸುವುದು: \n"
"ವಯಸ್ಸು, ಎತ್ತರ ಮತ್ತು ತೂಕ ಎಲ್ಲವೂ ಸತತ ಯಾದೃಚ್ಛಿಕ ಚರಗಳು. ಅವುಗಳ ವಿತರಣೆಯಿಂದ ನಿಮಗೆ ಏನು ಅನಿಸುತ್ತದೆ? ಮೌಲ್ಯಗಳ ಹಿಸ್ಟೋಗ್ರಾಂ ಅನ್ನು ರಚಿಸುವುದು ತಿಳಿದುಕೊಳ್ಳಲು ಒಳ್ಳೆಯ ವಿಧಾನವಾಗಿದೆ: \n"
]
]
},
},
{
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಸಾಮಾನ್ಯ ವಿತರಣಾ\n",
"## ಸಾಮಾನ್ಯ ವಿತರಣೆ\n",
"\n",
"\n",
"ನಮ್ಮ ನಿಜವಾದ ಡೇಟಾದಂತೆಯೇ ಸರಾಸರಿ ಮತ್ತು ವ್ಯತ್ಯಾಸ ಹೊಂದಿರುವ ಸಾಮಾನ್ಯ ವಿತರಣೆಯನ್ನು ಅನುಸರಿಸುವ ತಲಮೇಳದ ತೂಕದ ಕೃತಕ ನಿದರ್ಶನವನ್ನು ರಚಿಸೋಣ:\n"
"ನಮ್ಮ ನಿಜವಾದ ಡೇಟಾದಂತಹ ಸರಾಸರಿ ಮತ್ತು ವೈವಿಧ್ಯತೆಯೊಂದಿಗೆ ಸಾಮಾನ್ಯ ವಿತರಣೆ ಅನುಸರಿಸುವ ತೂಕಗಳ ಕಲ್ಪಿತ ಮಾದರಿಯನ್ನು ರಚಿಸೋಣ:\n"
]
]
},
},
{
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಿಜ ಜೀವನದಲ್ಲಿನ ಬಹುತೇಕ ಮೌಲ್ಯಗಳು ಸಾಮಾನ್ಯವಾಗಿ ವಿತರಣೆಯಲ್ಲಿರುತ್ತವೆ, ಆದ್ದರಿಂದ ನಮೂನಾ ಡೇಟಾವನ್ನು ರಚಿಸಲು ಏಕಮಾನದ ಯಾದೃಚ್ಛಿಕ ಸಂಖ್ಯೆ ಜನಕವನ್ನು ಬಳಸಬಾರದು. ಇಲ್ಲಿದೆ ಏನು ಆಗುತ್ತದೆ ಎಂದು ನಾವು ಏಕಮಾನದ ವಿತರಣೆಯಿಂದ ( `np.random.rand` ನಿಂದ ರಚಿಸಲಾದ) ತೂಕಗಳನ್ನು ರಚಿಸಲು ಪ್ರಯತ್ನಿಸಿದಾಗ:\n"
"ನಿಜಜೀವನದಲ್ಲಿನ ಹೆಚ್ಚಿನ ಮೌಲ್ಯಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಹಂಚಿಕೆಯಾಗಿರುವುದರಿಂದ, ನಾವು ಮಾದರಿ ಡೇಟಾವನ್ನು ರಚಿಸಲು ಸಮನಾಗಿ ಬಿತ್ತರಣೆಯ ಯಾದೃಚ್ಛಿಕ ಸಂಖ್ಯಾ ಜನೆರೇಟರ್ ಅನ್ನು ಬಳಸಬಾರದು. ಸಮನಾಗಿ ಹಂಚಿಕೆಯುಳ್ಳ ತೂಕಗಳನ್ನು (`np.random.rand` ನಲ್ಲಿ ರಚಿಸಲಾಗಿದ್ದು) ರಚಿಸಲು ಪ್ರಯತ್ನಿಸಿದರೆ ಏನಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಇಲ್ಲಿ ಕಾಣಬಹುದು:\n"
]
]
},
},
{
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ನಂಬಿಕೆ ನಡುವಣಿಗಳು\n",
"## ವಿಶ್ವಾಸ интервалಗಳು\n",
"\n",
"\n",
"ಈಗ ನಾವು ಬೇಸ್ಬಾಲ್ ಆಟಗಾರರ ತೂಕ ಮತ್ತು ಎತ್ತರಗಳಿಗಾಗಿ ನಂಬಿಕೆ ನಡುವೆಗಳನ್ನು ಲೆಕ್ಕ ಹಾಕೋಣ. ನಾವು ಈ ಕೋಡ್ [ಈ ಸ್ಟ್ಯಾಕ್ಓವರ್ಫ್ಲೋ ಚರ್ಚೆಯಿಂದ](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) ಬಳಸಲಿದ್ದೇವೆ:\n"
"ಈಗ ನಾವು ಬೇಸ್ಬಾಲ್ ಆಟಗಾರರ ತೂಕ ಮತ್ತು ಎತ್ತರಗಳ ವಿಶ್ವಾಸ ಇಂಟರ್ವಾಲ್ಗಳನ್ನು ಲೆಕ್ಕಹಾಕೋಣ. ನಾವು [ಈ stackoverflow ಚರ್ಚೆಯಿಂದ] (https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) ಕೋಡ್ ಬಳಸುತ್ತೇವೆ:\n"
]
]
},
},
{
{
@ -272,7 +272,7 @@
" return m, h\n",
" return m, h\n",
"\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
]
},
},
@ -280,9 +280,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ನಿಯಮಾನುಸ್ಥಾನ ಪರೀಕ್ಷೆ\n",
"## ಪರಿಕಲ್ಪನೆ ಪರೀಕ್ಷೆ\n",
"\n",
"\n",
"ನಮ್ಮ ಬೇಸ್ಬಾಲ್ ಆಟಗಾರರ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ವಿಭಿನ್ನ ಪಾತ್ರಗಳನ್ನು ಪರಿಶೀಲಿಸೋಣ:\n"
"ನಾವೆಲ್ಲ naše ಬ್ಯಾಸ್ಬಾಲ್ ಆಟಗಾರರ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ವಿಭಿನ್ನ ಪಾತ್ರಗಳನ್ನು ಅನ್ವೇಷಿಸೋಣ:\n"
]
]
},
},
{
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಾವು ಮೊದಲ ಬೆಸ್ಮೆನ್ಗಳು ಎರಡನೇ ಬೆಸ್ಮೆನ್ಗಳಿಗಿಂತ ಎತ್ತರರಾಗಿದ್ದಾರೆ ಎಂಬ ಊಹೆಯನ್ನು ಪರೀಕ್ಷಿಸೋಣ. ಇದನ್ನು ಪರಿಶೀಲಿಸುವ ಅತ್ಯಂತ ಸರಳ ವಿಧಾನವು ನಂಬಿಕೆ ಅಂತರಗಳನ್ನು ಪರೀಕ್ಷಿಸುವುದಾಗಿದೆ:\n"
"ಪ್ರಥಮ ಬೇಸ್ಮನ್ಗಳು ಎರಡನೆಯ ಬೇಸ್ಮನ್ಗಳಿಗಿಂತ ಎತ್ತರವಾದವರು ಎಂಬ ಊಹೆಯನ್ನು ನಾವು ಪರೀಕ್ಷಿಸೋಣ. ಇದನ್ನು ಪರೀಕ್ಷಿಸುವ ಸರಳವಾದ ಮಾರ್ಗವು ನಂಬಿಕೆ ಅವಧಿಗಳನ್ನು ಪರೀಕ್ಷಿಸುವುದು: \n"
]
]
},
},
{
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಾವು интервалಗಳು ಮುರಿದಿಲ್ಲ ಎಂದು ನೋಡಬಹುದು.\n",
"ನಾವು ಅವಧಿಗಳು ಅತಿವ್ಯಾಪ್ತವಾಗುತ್ತಿಲ್ಲ ಎಂಬುದನ್ನು ಕಾಣಬಹುದು.\n",
"\n",
"\n",
"ಸಂದರ್ಭಾತ್ಮಕವಾಗಿ hypothesesನ ಸರಿ ಎನ್ನುವ ವಿಶ್ಲೇಷಣೆಯ ಕೆಲವೊಂದು ಸರಿಯಾದ ವಿಧಾನವು **ಸ್ಟುಡೆಂಟ್ ಟಿ-ಟೆಸ್ಟ್** ಅನ್ನು ಬಳಸುವುದಾಗಿದೆ:\n"
"ಗಣಿತಶಾಸ್ತ್ರೀಯವಾಗಿ ಸರಿ ಇದ್ದು ನಿರೂಪಣೆಯನ್ನು ಸಾಬೀತುಪಡಿಸುವ ಇನ್ನೊಂದು ಸರಿಯಾದ ವಿಧಾನವೆಂದರೆ **ಸ್ಟೂಡೆಂಟ್ t-ಪರೀಕ್ಷೆ** ಬಳಸುವುದು:\n"
]
]
},
},
{
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"`ttest_ind` ಫಂಕ್ಷನ್ ನೀಡುವ ಎರಡು ಮೌಲ್ಯಗಳು ಇಂತಿವೆ: \n",
"`ttest_ind` ಫಂಕ್ಷನ್ ನೀಡುವ ಎರಡು ಮೌಲ್ಯಗಳು ಇವುಗಳಾಗಿವೆ:\n",
"* p-ಮೌಲ್ಯವನ್ನು ಎರಡು توزيعات ಸಮಾನ ಸರಾಸರಿ ಹೊಂದಿರುವ ಸಾಧ್ಯತೆ ಎಂದು ಪರಿಗಣಿಸಬಹುದು. ನಮ್ಮ ಸಂದರ್ಭದಲ್ಲಿ, ಇದು ಬಹಳ ಕಡಿಮೆ, ಅಂದರೆ ಮೊದಲ baseman ಗಳು ಎತ್ತರವಾಗಿದ್ದಾರೆ ಎಂಬುದಕ್ಕೆ ಬಲವಾದ ಸಾಬೀತು ಇದೆ. \n",
"* p-ಮೌಲ್ಯವನ್ನು ಎರಡು ವಿತರಣೆಯು ಒಂದೇ ಸರಾಸರಿ ಹೊಂದಿರುವ ಸಂಭವನೀಯತೆ ಎಂದು ಪರಿಗಣಿಸಬಹುದು. ನಮ್ಮ ಪ್ರಕರಣದಲ್ಲಿ, ಅದು ಬಹಳ ಕಡಿಮೆ, ಅಂದರೆ ಮೊದಲ ಬ್ಯಾಡ್ಮನ್ ಗಳು ಉದ್ದವೇ ಹೆಚ್ಚು ಎಂಬ ಬಲವಾದ ಸಾಕ್ಷ್ಯಗಳಿವೆ.\n",
"* t-ಮೌಲ್ಯವು t-ಪರೀಕ್ಷೆಯಲ್ಲಿ ಬಳಸಲಾಗುವ ಸಾಮಾನ್ಯೀಕೃತ ಸರಾಸರಿ ವ್ಯತ್ಯಾಸದ ಮಧ್ಯಂತರ ಮೌಲ್ಯವಾಗಿದೆ ಮತ್ತು ನಿರ್ಧಿಷ್ಟ ನಂಬಿಕೆಯ ಮೌಲ್ಯಕ್ಕಾಗಿ ದಡ ಮೌಲ್ಯಕ್ಕೆ ಹೋಲಿಸಲಾಗುತ್ತದೆ.\n"
"* t-ಮೌಲ್ಯವು ಸಾಮಾನ್ಯೀಕೃತ ಸರಾಸರಿ ವ್ಯತ್ಯಾಸದ ಮಧ್ಯದ ಮೌಲ್ಯವಾಗಿದೆ, ಇದು t-ಪರೀಕ್ಷೆಯಲ್ಲಿ ಬಳಸದಾಗುತ್ತದೆ ಮತ್ತು ನಿರ್ದಿಷ್ಟ ವಿಶ್ವಾಸ ಮಟ್ಟಕ್ಕೆ ವಿರುದ್ಧ ತೀಚಿದ ಮೌಲ್ಯ ಹೋಲಿಸಿ ಪರಿಶೀಲನೆ ಮಾಡಲಾಗುತ್ತದೆ.\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಕೇಂದ್ರ ಸೀಮಿತ ಸಿದ್ಧಾಂತంతో ಸಾಮಾನ್ಯ ವಿತರಣೆಯನ್ನು ಅನೂಕಲಿಸು\n",
"## ಕೇಂದ್ರ ಸೀಮಾ ಸಿದ್ಧಾಂತದೊಂದಿಗೆ ಸಾಮಾನ್ಯ ವಿತರಣೆಯನ್ನು ನಕಲಿಸುವುದು\n",
"\n",
"\n",
"ಪೈಥಾನ್ನ ಪ್ಸ್ಯುಡೋ-ಯಾದೃಚ್ಛಿಕ ಜನಕ ನಮಗೆ ಒರಟು ವಿತರವನ್ನು ನೀಡುವಂತೆ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ. ನಾವು ಸಾಮಾನ್ಯ ವಿತರಣೆಗಾಗಿ ಜನಕವನ್ನು ರಚಿಸಲು ಇಚ್ಛಿಸಿದರೆ, ನಾವು ಕೇಂದ್ರ ಸೀಮಿತ ಸಿದ್ಧಾಂತವನ್ನು ಬಳಸಬಹುದು. ಸಾಮಾನ್ಯವಾಗಿ ವಿತರಿಸಲಾದ ಮೌಲ್ಯವನ್ನು ಪಡೆಯಲು ನಾವು ಒರಟು-ಉತ್ಪನ್ನಿತ ಮಾದರಿಯ ಸರಾಸರಿಯನ್ನು ಲೆಕ್ಕಿಸುವುದೇ ಆಗಿದೆ.\n"
"Python ನ ಪ್ಸ್ಯುಡೋ-ರ್ಯಾಂಡಮ್ ಜನರೇಟರ್ ನಮಗೆ ಸರ್ವત્ર ಸಮವ್ಯಾಪ್ತಿ ವಿತರಣೆಯನ್ನು ನೀಡುವುದಕ್ಕೆ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ. ನಾವು ಸಾಮಾನ್ಯ ವಿತರಣೆಗೆ ಜನರೇಟರ್ ರಚಿಸಲು ಬಯಸಿದರೆ, ನಾವು ಕೇಂದ್ರ ಸೀಮಾ ಸಿದ್ಧಾಂತವನ್ನು ಬಳಸಬಹುದು. ಸಾಮಾನ್ಯ ವಿತರಣೆಯ ಮೌಲ್ಯವನ್ನು ಪಡೆಯಲು ನಾವು ಸರ್ವತ್ರ ಸಮವ್ಯಾಪ್ತಿದಾಗಿದೆ ವಿವಿಧ ಮಾದರಿಯ ಸರಾಸರಿಯನ್ನು ಲೆಕ್ಕಹಾಕುತ್ತೇವೆ.\n"
]
]
},
},
{
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಪರಸ್ಪರ ಸಂಬಂಧ ಮತ್ತು ಇವರು ಬ್ಲೇಸ್ಬಾಲ್ ಕಾರ್ಪ್\n",
"## ಸಮಂಬಂಧ ಮತ್ತು ದುಷ್ಟ ಬೇಟ್ಸ್ಬಾಲ್ ಕಾರ್ಪೊರೇಶನ್\n",
"\n",
"\n",
"ಪರಸ್ಪರ ಸಂಬಂಧವು ನಮಗೆ ಡೇಟಾ ಕ್ರಮಗಳ ನಡುವಿನ ಸಂಬಂಧಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ನಮ್ಮ ಆಟದ ಉದಾಹರಣೆಯಲ್ಲಿ, ಕ್ರೀಡಾಪಟುಗಳ ಎತ್ತರದ ಪ್ರಕಾರ ಪಾವತಿ ನೀಡುವ ಒಂದು ಕೆಟ್ಟ ಬ್ಲೇಸ್ಬಾಲ್ ಸಂಸ್ಥೆ ಇದೆ ಎಂದು ಕಲ್ಪಿಸೋಣ - ಎತ್ತರದ ಆಟಗಾರನು ಆಗಿದ್ದರೆ, ಅವರು ಹೆಚ್ಚು ಹಣ ಪಡೆಯುತ್ತಾರೆ. ಆಧಾರ ವೇತನವು $1000 ಆಗಿದ್ದು, ಎತ್ತರದ ಪ್ರಕಾರ $0 ರಿಂದ $100 ರವರೆಗೂ ಹೆಚ್ಚುವರಿ ಬಹುಮಾನ ಇದೆ ಎಂದು ಕಲ್ಪಿಸೋಣ. ನಾವು MLB ನಿಂದ ನಿಜವಾದ ಆಟಗಾರರನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತೇವೆ ಮತ್ತು ಅವರ ಕಲ್ಪನಾತ್ಮಕ ವೇತನಗಳನ್ನು ಲೆಕ್ಕಿಸುತ್ತೇವೆ:\n"
"ಸಮಂಬಂಧ ನಮಗೆ ಡೇಟಾ ಸರಣಿಗಳ ನಡುವಿನ ಸಂಬಂಧಗಳನ್ನು ಕಂಡುಕೊಳ್ಳಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ನಮ್ಮ ಆಟದ ಉದಾಹರಣೆಯಲ್ಲಿ, ಇದೊಂದು ದುಷ್ಟ ಬೇಟ್ಸ್ಬಾಲ್ ಕಾರ್ಪೊರೇಶನ್ ಇದೆ ಎಂದು ಭಾವಿಸೋಣ, ಅದು ತನ್ನ ಆಟಗಾರರನ್ನು ಅವರ ಎತ್ತರದ ಪ್ರಕಾರ ವೇತನ ನೀಡುತ್ತದೆ - ಆಟಗಾರ ಎತ್ತರವಾಗಿದ್ದರೆ, ಅವನು/ಅವಳು ಹೆಚ್ಚು ಹಣ ಪಡೆಯುತ್ತಾರೆ. ಧಾರಣೆ ಮಾಡಿ ಮೂಲ ವೇತನ $1000, ಮತ್ತು ಎತ್ತರದ ಆಧಾರದ ಮೇಲೆ $0 ರಿಂದ $100 ರವರೆಗೆ ಹೆಚ್ಚುವರಿ ಬೋನಸ್ ಇದೆ. ನಾವು MLB ನ ವಾಸ್ತವಿಕ ಆಟಗಾರರನ್ನು ತೆಗೆದು ಅವರ ಕಾಲ್ಪನಿಕ ವೇತನಗಳನ್ನು ಲెక్కಿಸುತ್ತೇವೆ:\n"
"ಈಗ ಆ ಸರಣಿಗಳ ಸಹಪ್ರಯೋಗ ಮತ್ತು ಸಹಸಂಬಂಧವನ್ನು ಗಣನೆ ಮಾಡೋಣ. `np.cov` ನಮಗೆ ಸಹಪ್ರಯೋಗ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಅನ್ನು ಒದಗಿಸುತ್ತದೆ, ಇದು ಬಹುಮಾರ್ಗಗಳೊಂದಿಗೆ ಸಹಪ್ರಯೋಗದ ವಿಸ್ತರಣೆ ಆಗಿದೆ. ಸಹಪ್ರಯೋಗ ಮ್ಯಾಟ್ರಿಕ್ಸ್ $M$ ರ $M_{ij}$ ಅಂಶವು ಇನ್ಪುಟ್ ವ್ಯತ್ಯಾಸಗಳು $X_i$ ಮತ್ತು $X_j$ ನಡುವೆ ಇರುವ ಸಂಬಂಧವಾಗಿದೆ, ಮತ್ತು ಡಯಾಗನಲ್ ಮೌಲ್ಯಗಳು $M_{ii}$ $X_i$ ರ ವೈವಿಧ್ಯತೆಯಾಗಿದೆ. ಅದೇ ರೀತಿ, `np.corrcoef` ನಮಗೆ **ಸಹಸಂಬಂಧ ಮ್ಯಾಟ್ರಿಕ್ಸ್** ಅನ್ನು ಒದಗಿಸುತ್ತದೆ.\n"
"ಈಗ ನಾವು ಆ ಕ್ರಮಿಕಗಳ ಸಹವಿಭಾಗ ಮತ್ತು ಸಂಬಂಢವನ್ನು ಲೆಕ್ಕಹಾಕೋಣ. `np.cov` ನಮಗೆ ಅತಿ ಸಾಂಪ್ರದಾಯಿಕವಾಗಿ **ಸಹವಿಭಾಗ ಮ್ಯಾಟ್ರಿಕ್ಸ್** ಅನ್ನು ನೀಡುತ್ತದೆ, ಇದು ಬಹುಚರ ಮೌಲ್ಯಗಳಿಗೆ ಸಹವಿಭಾಗದ ವಿಸ್ತಾರವಾಗಿದೆ. ಸಹವಿಭಾಗ ಮ್ಯಾಟ್ರಿಕ್ಸ್ $M$ ನ ಅಂಶ $M_{ij}$ ಇನ್ಪುಟ್ ಚರ $X_i$ ಮತ್ತು $X_j$ಗಳ ನಡುವಿನ ಸಂಬಂಢವಾಗಿದೆ, ಮತ್ತು ಕರ್ನಲ ದಶಮಾಂಶ $M_{ii}$ $X_{i}$ ರ ವೈರೀಯನ್ಸ್ ಆಗಿದೆ. ಇದಕ್ಕೆ ಸಮಾನವಾಗಿ, `np.corrcoef` ನಮಗೆ **ಸಂಬಂಢ ಮ್ಯಾಟ್ರಿಕ್ಸ್** ಅನ್ನು ನೀಡುತ್ತದೆ.\n"
]
]
},
},
{
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಒಂದು ಸಹಸಂಬಂಧ 1ಕ್ಕೆ ಸಮನಾಗಿದ್ದರೆ, ಅದು ಎರಡು ಚರಗಳ ನಡುವೆ ಬಲವಾದ **ರೇಖೀಯ ಸಂಬಂಧ** ಇದೆ ಎಂದು ಅರ್ಥ. ನಾವು ಒಂದು ಮೌಲ್ಯವನ್ನು ಇನ್ನೊಂದರ ವಿರುದ್ಧ ರೇಖೀಯ ಸಂಬಂಧವನ್ನು ದೃಶ್ಯರೀತಿಯಲ್ಲಿ ನೋಡಬಹುದು:\n"
"ಸಹಸಂಬಂಧ 1ಕ್ಕೆ ಸಮಾನವಾಗಿರುವುದು ಎರಡು ಪರಿವರ್ತನಶೀಲಗಳ ನಡುವೆ ಬಲವಾದ **ರೇಖೀಯ ಸಂಬಂಧ** ಇರುವುದು ಅರ್ಥ. ನಾವು ಒಂದೊಂದು ಮೌಲ್ಯವನ್ನು ವಿರುದ್ಧವಾಗಿ ರೇಖಾಚಿತ್ರ ಎಸೆದು ರೇಖೀಯ ಸಂಬಂಧವನ್ನು ದೃಶ್ಯವಾಗಿ ನೋಡುವುದು ಸಾಧ್ಯ: \n"
]
]
},
},
{
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಸಂಬಂಧ ರೇಖೀಯವಾಗದಿದ್ದರೆ ಏನು ಕಾಣಬಹುದು ಎಂದು ನೋಡೋಣ. ಎಣಿಸೋಣ ನಮ್ಮ ಸಂಸ್ಥೆ ಎತ್ತರ ಮತ್ತು ವೇತನಗಳ ನಡುವಿನ ಸ್ಪಷ್ಟ ರೇಖೀಯ ಅವಲಂಬನೆಯನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ಮರೆಮಾಚಲು ನಿರ್ಧರಿಸಿದೆ ಮತ್ತು ಸೂತ್ರದಲ್ಲಿ ಕೆಲವು ಅರೆ-ರೇಖೀಯತೆಯನ್ನು, ಉದಾಹರಣೆಗೆ `sin` ಅನ್ನು ಪರಿಚಯಿಸಿದೆ:\n"
"ಸಂಬಂಧ ರೇಖೀಯವಾಗಿದ್ರೆ ಏನು ಆಗುತ್ತದೆಯೋ ನೋಡೋಣ. ನಮ್ಮ ಸಂಸ್ಥೆ ಎತ್ತರ ಮತ್ತು ವೇತನಗಳ ಮಧ್ಯೆ ಇಲ್ಲಿರುವ ಸ್ಪಷ್ಟ ರೇಖೀಯ ಅವಲಂಬನೆಯನ್ನು ಮುಚ್ಚಿಟ್ಟುಕೊಳ್ಳಲು ನಿರ್ಧರಿಸಿ, ಸೂತ್ರದಲ್ಲಿ `sin` ಎಂಬಂತೆ ಕೆಲವು ರೇಖೀಯತೆಯಿಲ್ಲದಿಕೆ (non-linearity) ಪರಿಚಯಿಸಿದೆ ಎಂದು ಊಹಿಸೋಣ:\n"
]
]
},
},
{
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಈ ಸಂದರ್ಭದಲ್ಲಿ, ಸಹಸಂಬಂಧ ಸ್ವಲ್ಪ ಕಡಿಮೆ ಆದರೆ ಅದು ಇನ್ನೂ ತುಂಬಾ ಎತ್ತರವಾಗಿದೆ. ಈಗ, ಸಂಬಂಧವನ್ನು ಇನ್ನಷ್ಟು ಅಸ್ಪಷ್ಟಗೊಳಿಸಲು, ವೇತನಕ್ಕೆ ಕೆಲವು ಹೆಚ್ಚಿನ ಯಾದೃಚ್ಛಿಕತೆಗಳನ್ನು ಸೇರಿಸುವ ಮೂಲಕ ನಾವು ಕೆಲವು ಯಾದೃಚ್ಛಿಕ ವೇರಿಯಬಲ್ ಸೇರಿಸಬಹುದು. ಏನು ಆಗುತ್ತದೆ ನೋಡೋಣ:\n"
"ಈ ಪ್ರಕರಣದಲ್ಲಿ, ಸಾಂದ್ರತೆ ಸ್ವಲ್ಪ ಕಡಿಮೆ ಇದೆ, ಆದರೆ ಅದು ಇನ್ನೂ ತುಂಬಾ ಎತ್ತರವಾಗಿದೆ. ಈಗ, ಸಂಬಂಧವನ್ನು ಇನ್ನಷ್ಟು ઓછಾಗಿ ತೋರಿಸುವುದಕ್ಕಾಗಿ, ನಾವು ಸಂಬಳಕ್ಕೆ ಕೆಲವು ಯಾದೃಚ್ಛಿತ ಚರವನ್ನು ಸೇರಿಸುವ ಮೂಲಕ ಕೆಲವು ಹೆಚ್ಚುವರಿ ಯಾದೃಚ್ಛಿತತೆಯನ್ನು ಸೇರಿಸಲು ಬಯಸಬಹುದು. ಏನಾಗುತ್ತದೆಯೋ ನೋಡೋಣ:\n"
]
]
},
},
{
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> ನೀವು ಯಾಕೆ ಈ ಬಿಂದುಗಳು ಇಂಡುಕಾರಿಯಾಗಿ ನಿಂತಿರುವ ಎಂದು ಊಹಿಸಬಹುದೆ?\n",
"> ನೀವು ಏಕೆ ಎಲೆಗಳು ಈ ರೀತಿ ಲಂಬ ಸಾಲುಗಳನ್ನು ಗಳಿಸಲು ಸರಿಹೊಂದುತ್ತವೆ ಎಂದು ಊಹಿಸಬಹುದೇ?\n",
"\n",
"\n",
"ನಾವು ಸಂಬಳ ಮುಂತಾದ ಕೃತಕವಾಗಿ ನಿರ್ದಿಷ್ಟಪಡಿಸಿದ ಪರಿಕಲ್ಪನೆ ಮತ್ತು ಗಮನಿಸಲ್ಪಟ್ಟ ಚರ *ದೈರ್ಧ್ಯ* ನಡುವಿನ ಅನುಪಾತವನ್ನು ಗಮನಿಸಿದ್ದೇವೆ. ಹೀಗೆ, ಬಗೆಯ ಮತ್ತು ತೂಕ ಮುಂತಾದ ಎರಡೂ ಗಮನಿಸಲ್ಪಟ್ಟ ಚರಗಳು ಸಹ ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿದೆಯೇ ಎಂದು ನೋಡೋಣ:\n"
"ವೇತನದಂತೆ ಕೃತಕವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಿದ ಕಲ್ಪನೆ ಮತ್ತು ಗಮನಿಸಿದ ಚರ *ಎತ್ತರ*ಗೊಳಗಿನ ಸಂಬಂಧವನ್ನು ನಾವು ಗಮನಿಸಿಕೊಂಡಿದ್ದೇವೆ. ಎತ್ತರ ಮತ್ತು ತೂಕದಂತೆ ಎರಡು ಗಮನಿಸಿದ ಚರಗಳು ಕೂಡ ಸಂಬಂಧ ಹೊಂದಿದೆಯೇ ಎಂದು ನೋಡೋಣ:\n"
]
]
},
},
{
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ದುರುದೃಷ್ಟವಶಾತ್, ನಮಗೆ ಯಾವುದೇ ಫಲಿತಾಂಶ ಸಿಗಲಿಲ್ಲ - শুধুমಾತ್ರ ಸ್ವಲ್ಪ ವಿಚಿತ್ರ `nan` ಮೌಲ್ಯಗಳಿವೆ. ನಮ್ಮ ಸರಣಿಯಲ್ಲಿ ಕೆಲವು ಮೌಲ್ಯಗಳು ನಿರ್ಧರಿಸದಿರುವುದರಿಂದ, ಅವು `nan` ಆಗಿ ಪ್ರತಿನಿಧಿಸಲಾಗಿದ್ದು, ಇದರಿಂದ ಕಾರ್ಯಾಚರಣೆಯ ಫಲಿತಾಂಶವೂ ನಿರ್ಧರಿಸದಿರುತ್ತದೆ. ಮ್ಯಾಟ್ರಿಕ್ಸ್ ನೋಡಿದಾಗ ನಾವು ಕಾಣಬಹುದು `Weight` ಸಮಸ್ಯೆಯಿರುವ ಕಾಲಮ್, ಏಕೆಂದರೆ `Height` ಮೌಲ್ಯಗಳ ನಡುವಿನ ಸ್ವ-ಸಂಬಂಢನ ಲೆಕ್ಕಹಾಕಲಾಗಿದೆ.\n",
"ದುರದೃಷ್ಟವಶಾತ್, ನಮಗೆ ಯಾವುದೇ ಫಲಿತಾಂಶಗಳಾಗಲಿಲ್ಲ - ಕೇವಲ ಕೆಲವು ಅಸಾಧಾರಣ `nan` ಮೌಲ್ಯಗಳೇ ಸಿಕ್ಕಿವೆ. ಇದಕ್ಕೆ ಕಾರಣ ನಮ್ಮ ಸರಣಿಯಲ್ಲಿ ಕೆಲವು ಮೌಲ್ಯಗಳು ವ್ಯಾಖ್ಯಾನಿಸದಿರುವುದು, ಅವು `nan` ಮೂಲಕ ಪ್ರತಿನಿಧಿಸಲಾಗಿದ್ದು, ಇದು ಕಾರ್ಯಾಚರಣೆಯ ಫಲಿತಾಂಶವೂ ವ್ಯಾಖ್ಯಾನಿಸದಂತೆ ಮಾಡುತ್ತದೆ. ಮೆಟ್ರಿಕ್ಸ್ ನೋಡಿ ನಾವು `Weight` ಎಂಬ ಕಾಲಮ್ ಸಮಸ್ಯೆಯಾಗಿರುವುದು ಕಾಣಬಹುದು, ಏಕೆಂದರೆ `Height` ಮೌಲ್ಯಗಳ ಮಧ್ಯೆ ಸ್ವಯಂ-ಸಂಬಂಧವನ್ನು ಲೆಕ್ಕಹಾಕಲಾಗಿದೆ. \n",
"\n",
"\n",
"> ಈ ಉದಾಹರಣೆ **ಡೇಟಾ ತಯಾರಿ** ಮತ್ತು **ಶುದ್ಧೀಕರಣ** ಮಹತ್ವವನ್ನು ತೋರಿಸುತ್ತದೆ. ಸರಿಯಾದ ಡೇಟಾ ಇಲ್ಲದೆ ನಾವು ಯಾವುದನ್ನೂ ಲೆಕ್ಕಹಾಕಲು ಸಾಧ್ಯವಿಲ್ಲ.\n",
"> ಈ ಉದಾಹರಣೆ **ಡೇಟಾ ಸಿದ್ಧತೆ** ಮತ್ತು **ಶುದ್ಧೀಕರಣ** ಮಹತ್ವವನ್ನು ತೋರಿಸುತ್ತದೆ. ಸರಿಯಾದ ಡೇಟಾ ಇಲ್ಲದೆ ನಾವು ಯಾವುದನ್ನೂ ಗಣನೆ ಮಾಡಲಾರವು.\n",
"\n",
"\n",
"ನಿಮ್ಮ ಕಳೆದುಹೋಗಿರುವ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಲು `fillna` ವಿಧಾನವನ್ನು ಬಳಸಿ, ಮತ್ತು ಸಂಬಂಧ ಲೆಕ್ಕಹಾಕೋಣ:\n"
"ಇಲ್ಲದೆ ಇರುವ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಲು `fillna` ವಿಧಾನವನ್ನು ಬಳಸಿ, ಸಂಬಂಧತೆ ಲೆಕ್ಕಿಸಿ: \n"
"ನಿಜಕ್ಕೂ ಒಂದು ಸಂಬಂಧವಿದೆ, ಆದರೆ ನಮ್ಮ ಕೃತಕ ಉದಾಹರಣೆಯಂತೆ ಬಲವಾದುದಾಗಿಲ್ಲ. ನಿಜಕ್ಕೂ, ಒಂದು ಮೌಲ್ಯವನ್ನು ಇನ್ನೊಂದರ ವಿರುದ್ಧದ ಚಿತ್ರ ಸಮೀಕ್ಷೆಯನ್ನು ನೋಡಿದರೆ, ಸಂಬಂಧವು ಸ್ಪಷ್ಟವಾಗಿರುವುದಿಲ್ಲ:\n"
"ನಿಜವಾಗಿಯೂ ಸಂಬಂಧವಿದೆ, ಆದರೆ ನಮ್ಮ ಕೃತಕ ಉದಾಹರಣೆಯಷ್ಟಿನಷ್ಟಾಗಿ ಬಲವಾದದ್ದು ಅಲ್ಲ. ನಿಜಕ್ಕೂ, ಒಂದು ಮೌಲ್ಯವನ್ನು ಮತ್ತೊಂದು ಮೌಲ್ಯಕ್ಕಾಲೋಚಿಸಿ ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್ ನೋಡಿದರೆ, ಸಂಬಂಧವು ಬಹಳ ಕಡಿಮೆ ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ:\n"
]
]
},
},
{
{
@ -535,16 +535,16 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ನಿಷ್ಕರ್ಷೆ\n",
"## ನಿರupeಕ್ಷೆ\n",
"\n",
"\n",
"ಈ ನೋಟ್ಬುಕ್ನಲ್ಲಿ ನಾವು ಅಂಕಿ ಅಥವ ಅಂಕಿ ಸಂಬಂಧಿತ ಕಾರ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸುವ ವಿಧಾನವನ್ನು ಕಲಿತಿರುವೆವು. ನಿರ್ದಿಷ್ಟ ಹಿಪೋಥಿಸಿಸ್ಗಳನ್ನು ಸಾಬೀತುಪಡಿಸಲು ಗಣಿತ ಮತ್ತು ಅಂಕಿ ವಿಭಾಗದ ಸಾಧನವನ್ನು ಬಳಸುವುದು ಹೇಗೆ ಮತ್ತು ದತ್ತಾಂಶ ಮಾದರಿಯನ್ನು ಅನುಸರಿಸಿ ಯಾದೃಚ್ಛಿಕ ಚರಗಳಿಗಾಗಿ ನಂಬಿಕೆ ಅಂತರಗಳನ್ನು ಹೇಗೆ ಲೆಕ್ಕಿಸಬೇಕು ಎಂಬುದನ್ನು ಈಗ ನಾವು ತಿಳಿದುಕೊಂಡಿದ್ದೇವೆ.\n"
"ಈ ನೋಟ್ಬುಕ್ನಲ್ಲಿ ನಾವು ಡೇಟಾದ ಮೇಲೆ ಮೂಲಭೂತ ಕಾರ್ಯಾಚರಣೆಗಳನ್ನು ಹೇಗೆ ಪ್ರಗಟಿಸುವುದು ಹಾಗೂ ಗಣಿತ ಮತ್ತು ಸಂಖ್ಯಾಶಾಸ್ತ್ರದ ಸಾಧನಗಳನ್ನು ಉಪಯೋಗಿಸಿ ಕೆಲವು ಊಹೆಗಳನ್ನು ತಿದ್ದುವುದು ಮತ್ತು ಡೇಟಾ ಉದಾಹರಣೆಯೊಂದನ್ನು ನೀಡಿದಾಗ ಯಾದೃಚ್ಛಿಕ ಚರಗಳ ವಿಶ್ವಾಸಂತರವನ್ನು ಹೇಗೆ ಲೆಕ್ಕಿಸಲು ಎಂಬುದನ್ನು ಕಲಿತಿದ್ದೇವೆ. \n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ಅಸ್ವೀಕರಣ**: \nಈ ದಾಖಲೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಎಂಬ AI ಅನುವಾದ ಸೇವೆಯನ್ನು ಬಳಸಿ ಅನುವದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯತ್ತ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ತಪ್ಪುಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂದು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯ ಮೂಲ ದಾಖಲೆ ಅನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಲಾಗಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದದಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು فهم ಅಥವಾ ವ್ಯಾಖ್ಯಾನಗಳಿಗೆ ನಾವು ಜವಾಬ್ದಾರಿಯಲ್ಲ.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ಅಸ್ವೀಕಾರ**:\nಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"ನಾವು COVID-19 ಸೋಂಕು ಹೊಂದಿದ ವ್ಯಕ್ತಿಗಳ ಬಗ್ಗೆ ಡೇಟಾವನ್ನು ಬಳಸುತ್ತೇವೆ, ಇದು [ಜಾನ್ಸ್ ಹಾಪ್ಕಿನ್ಸ್ ವಿಶ್ವವಿದ್ಯಾಲಯ](https://jhu.edu/)ನ [ಸಿಸ್ಟಮ್ ಸೈನ್ಸ್ ಅಂಡ್ ಎಂಜಿನಿಯರಿಂಗ್ ಸೆಂಟರ್](https://systems.jhu.edu/) (CSSE) ಒದಗಿಸಿರುವುದು. ಡೇಟಾಸೆಟ್ [ಈ GitHub ರೆಪೊಸಿಟರಿ](https://github.com/CSSEGISandData/COVID-19)ನಲ್ಲಿ ಲಭ್ಯವಿದೆ.\n"
"ನಾವು COVID-19 ಸೋಂಕಿತ ವ್ಯಕ್ತಿಗಳ ರೇಖಾಂಕನದ ಡೇಟಾವನ್ನು, [ಸಿಸ್ಟಮ್ಸ್ ಸೈನ್ಸ್ ಅಂಡ್ ಇಂಜಿನಿಯರಿಂಗ್](https://systems.jhu.edu/) (CSSE) ಕೇಂದ್ರದಿಂದ [ಜಾನ್ಸ್ ಹಾಪ್ಕಿನ್ಸ್ ವಿಶ್ವবিদ্যালಯ](https://jhu.edu/) ಒದಗಿಸಿದ ಮಾಹಿತಿಯನ್ನು ಉಪಯೋಗಿಸುವೆವು. ಡೇಟಾಸೆಟ್ [ಈ GitHub ರೆಪೊಸಿಟರಿ](https://github.com/CSSEGISandData/COVID-19)ಯಲ್ಲಿ ಲಭ್ಯವಿದೆ.\n"
]
]
},
},
{
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಾವು ಅತ್ಯಂತ ಇತ್ತೀಚಿನ ಡೇಟಾವನ್ನು ನೇರವಾಗಿ GitHub ನಿಂದ `pd.read_csv` ಬಳಸಿ ಲೋಡ್ ಮಾಡಬಹುದು. ಯಾವ ಕಾರಣಕ್ಕೂ ಡೇಟಾ ಲಭ್ಯವಿಲ್ಲದಿದ್ದರೆ, ಆ ಸಮಯದಲ್ಲಿ ನೀವು `data` ಫೋಲ್ಡರ್ನಲ್ಲಿ ಲಭ್ಯವಿರುವ ಸ್ಥಳೀಯ ಪ್ರತಿಯನ್ನು ಬಳಸಬಹುದು - ಕೆಳಗಿರುವ `base_url` ನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವ ಸಾಲನ್ನು ಅನ್ಕೋಮೆಂಟ್ ಮಾಡಬೇಕಾಗಿದೆ:\n"
"ನಾವು `pd.read_csv` ಬಳಸಿ GitHub ನಿಂದ ನವೀನ ಡೇಟಾವನ್ನು ನೇರವಾಗಿ ಲೋಡ್ ಮಾಡಬಹುದು. ಯುಗಾದಿ ಕಾರಣಕ್ಕಾಗಿ ಡೇಟಾ ಲಭ್ಯವಿಲ್ಲದಿದ್ದರೆ, ನೀವು ಯಾವಾಗಲೂ `data` ಫೋಲ್ಡರ್ನಲ್ಲಿ ಲಭ್ಯವಿರುವ ಪ್ರತಿಯನ್ನು ಬಳಸಬಹುದು - ಕೆಳಗಿನ `base_url` ಅನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವ ಲೈನ್ ಅನ್ನು ಅನಕಮೆಂಟ್ ಮಾಡಿರಿ:\n"
]
]
},
},
{
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಇನ್ನೀಗ ಸೋಂಕಿತರ individuals ಡೇಟಾವನ್ನು ಲೋಡ್ ಮಾಡಿ ನೋಂದಣಿ ಹೇಗಿದೆ ಎಂದು ನೋಡೋಣ:\n"
"ಇನ್ನು ನಾವು ಸೋಂಕಿತರ ಡೇಟಾವನ್ನು ಲೋಡ್ ಮಾಡಿ, ಡೇಟಾ ಹೇಗೆ ಕಾಣಿಸುತ್ತಿದೆ ಎಂದು ನೋಡೋಣ: \n"
]
]
},
},
{
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಾವು ನೋಡಬಹುದು ಪ್ರತಿ ಸಾಲನ್ನು ದೂರಾಡಿದಲ್ಲಿ ಪ್ರತಿ ದೇಶ ಮತ್ತು/ಅಥವಾ ಪ್ರಾಂತ್ಯದ ಸೋಂಕಿತ ವ್ಯಕ್ತಿಗಳ ಸಂಖ್ಯೆ ನೀಡಲಾಗಿದೆ, ಮತ್ತು ಕಾಲಂಗಳು ದಿನಾಂಕಗಳಿಗೆ ಹೊಂದಿಕೆಯಾಗಿವೆ. ಗುಣಾತ್ಮಕವಾಗಿ ಸರ್ಪಣೆಗಳು ಇತರ ಡೇಟಾಗಳಿಗಾಗಿ ಕೂಡ ಲೋಡ್ ಮಾಡಬಹುದು, ಉದಾಹರಣೆಗೆ ಗುಣಮುಖರಾದವರ ಸಂಖ್ಯೆ ಮತ್ತು ಸಾವಿನ ಸಂಖ್ಯೆ.\n"
"ನಾವು ನೋಡಬಹುದು ಪ್ರತಿಯೊಂದು ಪಂಕ್ತಿ ಟೇಬಲಿನ ಪ್ರತಿ ದೇಶ ಮತ್ತು/ಅಥವಾ ಪ್ರಾಂತ್ಯದ ನೋವಿರುವ ವ್ಯಕ್ತಿಗಳ ಸಂಖ್ಯೆಯನ್ನು ನಿರ்ணಯಿಸುತ್ತದೆ, ಮತ್ತು ಕಾಲಮ್ಗಳು ದಿನಾಂಕಗಳಿಗೆ ಹೊಂದಿಕೊಂಡಿವೆ. ಹೋಲುವ ಟೇಬಲ್ಗಳು ಇತರ ದತ್ತಾಂಶಗಳಿಗಾಗಿ, ಉದಾಹರಣಕ್ಕಾಗಿ ಗುಣಮುಖರಾದವರ ಸಂಖ್ಯೆ ಮತ್ತು ಮರಣದ ಸಂಖ್ಯೆಗಾಗಿ ಲೋಡ್ ಮಾಡಬಹುದು.\n"
]
]
},
},
{
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಡೇಟಾದ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ\n",
"## ದತ್ತಾಂಶವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು\n",
"\n",
"\n",
"ಮೇಲಿನ ಟೇಬಲಿನಿಂದ ಪ್ರಾಂತ್ಯ ಕಾಲಮ್ನ ಪಾತ್ರ ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ. ಅದರಲ್ಲಿರುವ `Province/State` ಕಾಲಮ್ನಲ್ಲಿ ಇರುವ ಬಗೆಬಗಿನ ಮೌಲ್ಯಗಳನ್ನು ನೋಡೋಣ:\n"
"ಮೇಲಿನ ಪಟ್ಟಿಯಿಂದ ಪ್ರಾಂತ್ಯ ಕಾಲಮ್ಮಿನ ಪಾತ್ರ ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ. `Province/State` ಕಾಲಮ್ಮಿನಲ್ಲಿ ಇರುವ müxtəlif ಮೌಲ್ಯಗಳನ್ನು ನೋಡೋಣ:\n"
]
]
},
},
{
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಾಮಗಳಿಂದ ನಾವು ಅಂದಾಜಿಸಬಹುದು ಆಸ್ಟ್ರೇಲಿಯಾ ಮತ್ತು ಚೀನಾ ಸೇರಿದಂತೆ ದೇಶಗಳಲ್ಲಿ ಪ್ರಾಂತ್ಯಗಳ ಪ್ರತ್ಯೇಕ ವಿವರಗಳು ಹೆಚ್ಚು ಇದ್ದವೆ ಎಂಬುದು. ಉದಾಹರಣೆಯಾಗಿ ಚೀನಾದ ಮಾಹಿತಿಯನ್ನು ನೋಡೋಣ:\n"
"ಹೆಸರುಗಳಿಂದ ನಾವು ಅರ್ಥ ಮಾಡಿಕೊಳ್ಳಬಹುದು ಆತ್ಮಾಲು ಮತ್ತು ಚೀನಾ ಹೀಗುವಂತೆ ರಾಷ್ಟреи ಹತ್ತು ಜನಾಂಗಗಳನ್ನು ಪ್ರಾಂತ್ಯಗಳ ಮೂಲಕ ಹೆಚ್ಚಿನ ವಿವರದ ವಿಭಜನೆ ಹೊಂದಿವೆ. ಉದಾಹರಣೆಯನ್ನು ನೋಡಲು ಚೀನಾದ ಮಾಹಿತಿ ಹುಡುಕೋಣ:\n"
]
]
},
},
{
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಡೇಟಾ ಮುನ್ನ್ಕೆಲಸ\n",
"## ಡೇಟಾವನ್ನು ಪೂರ್ವ-ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದು \n",
"\n",
"\n",
"ನಾವು ದೇಶಗಳನ್ನು ಇನ್ನಷ್ಟು ಪ್ರದೇಶಗಳಿಗೆ ವಿಭಜಿಸುವುದರಲ್ಲಿ ಆಸಕ್ತಿ ಹೊಂದಿಲ್ಲ, ಆದ್ದರಿಂದ ನಾವು ಮೊದಲಾಗಿ ಈ ವಿಭಜನೆನ್ನು ತೆಗೆದುಮುಕ್ತಮಾಡಿ ಎಲ್ಲಾ ಪ್ರದೇಶಗಳ ಬಗ್ಗೆ ಮಾಹಿತಿಯನ್ನು ಸೇರಿಸುತ್ತೇವೆ, ಇದರಿಂದ ಸಂಪೂರ್ಣ ದೇಶದ ಮಾಹಿತಿಯನ್ನು ಪಡೆಯಬಹುದು. ಇದನ್ನು `groupby` ಬಳಸಿ ಮಾಡಬಹುದಾಗಿದೆ:\n"
"ದೇಶಗಳನ್ನು ಮತ್ತಷ್ಟು ಪ್ರದೇಶಗಳಾಗಿ ವಿಭಜಿಸುವುದು ನಮಗೆ ಆಸಕ್ತಿ ಇಲ್ಲ, ಆದ್ದರಿಂದ ನಾವು ಮೊದಲು ಈ ವಿಭಜನೆವನ್ನು ತೆಗೆದುಹಾಕಿ ಎಲ್ಲಾ ಪ್ರದೇಶಗಳ ಮೇಲ್ಮೈ ಮಾಹಿತಿ ಸೇರಿಸುತ್ತೇವೆ, ώστε ქვეყნის ಸಂಪೂರ್ಣ ಮಾಹಿತಿಯನ್ನು ಪಡೆಯಲು. ಇದನ್ನು `groupby` ಬಳಸಿ ಮಾಡಬಹುದು:\n"
]
]
},
},
{
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನೀವು ನೋಡಬಹುದು `groupby` ಬಳಸಿದ ಕಾರಣ ಎಲ್ಲಾ DataFrames ಅನ್ನು ಈಗ Country/Region ಮೂಲಕ ಸೂಚ್ಯಂಕಿಸಲಾಗಿದೆ. ಆದ್ದರಿಂದ ನಾವು ನಿರ್ದಿಷ್ಟ ದೇಶದ ಡೇಟಾವನ್ನು `.loc` ಬಳಸಿಕಾಲು ಪ್ರವೇಶಿಸಬಹುದು:|\n"
"ನೀವು ಕಾಣಬಹುದು, `groupby` ಉಪಯೋಗಿಸುವ ಕಾರಣ ಎಲ್ಲ ಡೇಟಾಫ್ರೇಮ್ಗಳು ಈಗ ದೇಶ/ಪ್ರದೇಶದಿಂದ ಸೂಚ್ಯಂಕಗೊಳ್ಳುತ್ತವೆ. ನಾವು ಈ ರೀತಿ `.loc` ಬಳಸಿ ನಿರ್ದಿಷ್ಟ ದೇಶದ ಡೇಟಾವನ್ನು ಪ್ರವೇಶಿಸಬಹುದು:|\n"
]
]
},
},
{
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> **ಗಮನಿಸಿ** ನಾವು `[3:]` ಯನ್ನು ಹೇಗೆ ಬಳಸುತ್ತೇವೆ ಎಂದು, ಮೊದಲ ಮೂರು ಅಂಶಗಳನ್ನು ತೆಗೆದುಹಾಕಲು, ಅವುಗಳಲ್ಲಿ ದಿನಾಂಕವಲ್ಲದ ಮೆಟಾಡೇಟಾ (ಪ್ರಾಂತ್ಯ/ರಾಜ್ಯ ಮತ್ತು ಭೌಗೋಳಿಕ ಸ್ಥಳದ ಕಾಲಮ್ಗಳು) ಇರುತ್ತವೆ. ನಾವು ಆ ಮೂರು ಕಾಲಮ್ಗಳನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಕರಗಿ ಬಿಡಬಹುದು:\n"
"> **ಟಿಪ್ಪಣಿ** ನಾವು ಒಂದು ಸರಣಿಯ ಮೊದಲ ಮೂವರು ಅಂಶಗಳನ್ನು ಕಳಿಸಿ ಹಾಕಲು `[3:]` ಅನ್ನು 어떻게 ಬಳಸುತ್ತೇವೆ ಎಂದು ಗಮನಿಸಿ (ಆ ಸರಣಿಯಲ್ಲಿ ದಿನಾಂಕಕ್ಕೆ ಸೇರದ ಮೆಟಾಡೇಟಾ ಅಂಶಗಳು ಇವೆ, ಅದಾಗಿ ಪ್ರಾಂತ್ಯ/ರಾಜ್ಯ ಮತ್ತು ಭೌಗೋಳಿಕ ಸ್ಥಳಂಥ ಕಾಲಮ್ಗಳು). ನಾವು ಆ ಮೂವರು ಕಾಲಮ್ಗಳನ್ನು ಒಟ್ಟುಗೂ ನಿಲ್ಲಿಸಬಹುದು:\n"
]
]
},
},
{
{
@ -1627,7 +1627,7 @@
"source": [
"source": [
"## ಡೇಟಾವನ್ನು ಪರಿಶೀಲಿಸುವುದು\n",
"## ಡೇಟಾವನ್ನು ಪರಿಶೀಲಿಸುವುದು\n",
"\n",
"\n",
"ಸ್ಪಷ್ಟ ದೇಶವನ್ನು ಪರಿಶೀಲಿಸಲು ಈಗ ನಾವುaltres ಹೋಮ. ದಿನಾಂಕದ ಮೂಲಕ ಸೂಚಿಸಲಾಗಿರುವ ಸೋಂಕುಗಳ ಡೇಟಾವನ್ನು ಹೊಂದಿರುವ ಒಂದು ಫ್ರೇಮ್ ರಚಿಸೋಣ:\n"
"ನಾವು ಈಗ ಒಂದು ನಿರ್ದಿಷ್ಟ ದೇಶವನ್ನು ಪರಿಶೀಲಿಸಲು ತೆರಳೋಣ. ದಿನಾಂಕದ ಪ್ರಕಾರ ಸೂಚ್ಯಂಕ ಸಿದ್ದಪಡಿಸಿರುವ ಸೋಂಕುಗಳ ಡೇಟಾವನ್ನು ಹೊಂದಿರುವ ಫ್ರೇಮ್ ಅನ್ನು ರಚಿಸೋಣ:\n"
]
]
},
},
{
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಈಗ ನಾವು ಪ್ರತಿದಿನ ಹೊಸ ಸೋಂಕಿತ ಜನರ ಸಂಖ್ಯೆಯನ್ನು ಗಣನೆ ಮಾಡೋಣ. ಇದರಿಂದ ಪಾಲುಡೋಣ how ರೀತಿ ವೈರಸ್ ಪಸರಿಸುತ್ತಿರುತ್ತದೆ ಎನ್ನುವುದು ತಿಳಿಯಬಹುದು. ಇದನ್ನು ಮಾಡೋದಕ್ಕೆ ಸುಲಭ ಮಾರ್ಗವೆಂದರೆ `diff` ಬಳಕೆ ಮಾಡುವುದು:\n"
"ಈಗ ನಾವು ಪ್ರತಿದಿನ ಹೊಸವಾಗಿ ಸೋಂಕಿತರಾದವರ ಸಂಖ್ಯೆಯನ್ನು ಲೆಕ್ಕ ಹಾಕೋಣ. ಇದು ಪ್ಯಾಂಡೆಮಿಕ್ ಎಷ್ಟು ವೇಗವಾಗಿ ಅಭಿವೃದ್ಧಿಯಾಗುತ್ತಿದೆ ಎಂದು ನೋಡಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ. ಇದನ್ನು ಮಾಡಲು ಅತ್ಯಂತ ಸುಲಭವಾದ ವಿಧಾನ `diff` ಬಳಕೆ ಮಾಡುವುದು:\n"
]
]
},
},
{
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನಾವು ಡೇಟಾದಲ್ಲಿ ಹೆಚ್ಚಿನ ಏರಿಕೆಯನ್ನೂ ಇಳಿಗೆಯನ್ನೂ ನೋಡಬಹುದು. ಅದರಲ್ಲಿ ಒಂದಿದ ತಿಂಗಳನ್ನು ಸನಿಹದಿಂದ ನೋಡೋಣ:\n"
"ನಾವು ಡೇಟಾದಲ್ಲಿ ಹೆಚ್ಚಿನ ಏರಿಳಿತಗಳನ್ನು ನೋಡಬಹುದು. ಒಂದು ತಿಂಗಳವನ್ನೂ ತೋಚಿ ನೋಡೋಣ:\n"
]
]
},
},
{
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಡೇಟಾನಲ್ಲಿ ವಾರಂವಾರದ ಹರಾಜುಗಳಿವೆ ಎಂದು ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ. ನಾವು ಪ್ರವೃತ್ತಿಗಳನ್ನು ನೋಡಲು ಬಯಸುವುದರಿಂದ, ಕಾರ್ವನ್ನು ಸಮತೋಲನಗೊಳಿಸಲು (ಅಂದರೆ ಪ್ರತಿ ದಿನಕ್ಕೆ ನಾವು ಹಿಂದಿನ ಕೆಲವು ದಿನಗಳ ಸರಾಸರಿ ಮೌಲ್ಯವನ್ನು ಗಣನೆ ಮಾಡುತ್ತೇವೆ) ಪ್ರಯಾಣ ಸರಾಸರಿಯನ್ನು ಲೆಕ್ಕಹಾಕುವುದು ಅರ್ಥವಾಗುತ್ತದೆ:\n"
"ಡೇಟಾದಲ್ಲಿ ವಾರಪತ್ರಕ ಬದಲಾಗಾಟಗಳು ಸ್ಪಷ್ಟವಾಗಿ ಕಾಣಿಸುತ್ತವೆ. ನಮಗೆ ಪ್ರವಣತೆಗಳನ್ನು ನೋಡಲು ಸಾಧ್ಯವಾಗಬೇಕು ಎಂದು ಬಯಸುವುದರಿಂದ, ನೀವು ಚಾಲಿಸುತ್ತಿರುವ ಸರಾಸರಿಯನ್ನು ಲೆಕ್ಕಹಾಕುವುದು ಮೂಲಕ ವಕ್ರವನ್ನು ಸನ್ನಗ್ಗೊಳಿಸುವುದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುತ್ತದೆ (ಅಂದರೆ ಪ್ರತಿ ದಿನಕ್ಕೂ ನಾವು ಹಿಂದಿನ ಹಲವಾರು ದಿನಗಳ ಸರಾಸರಿ ಮೌಲ್ಯವನ್ನು ಲೆಕ್ಕಹಾಕುತ್ತೇವೆ):\n"
]
]
},
},
{
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಕೆಲವು ದೇಶಗಳನ್ನು ಹೋಲಿಸಲು, ನಾವು ಆ ದೇಶದ ಜನಸಂಖ್ಯೆಯನ್ನು ಗಮನದಲ್ಲಿ ತೆಗೆದುಕೊಂಡು, ದೇಶದ ಜನಸಂಖ್ಯೆಯ ಸಂಬಂಧಿತವಾಗಿ ಸೋಂಕಿತರ ಪ್ರಮಾಣವನ್ನು ಹೋಲಿಸಲು ಬಯಸಬಹುದು. ದೇಶದ ಜನಸಂಖ್ಯೆಯನ್ನು ಪಡೆಯಲು, ದೇಶಗಳ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಲೋಡ್ ಮಾಡೋಣ:\n"
"ಹಲವಾರು ದೇಶಗಳನ್ನು ಹೋಲಿಸಲು, ನಾವು ಆ ದೇಶದ ಜನಸಂಖ್ಯೆಯನ್ನು ಗಮನದಲ್ಲಿಟ್ಟುಕೊಳ್ಳಬಹುದು ಮತ್ತು ದೇಶದ ಜನಸಂಖ್ಯೆಪ್ರಕಾರ ಸೋಂಕಿತ ವ್ಯಕ್ತಿಗಳ ಶೇಕಡಾವಾರು ಹೋಲಿಸಬಹುದು. ದೇಶದ ಜನಸಂಖ್ಯೆಯನ್ನು ಪಡೆಯಲು, ದೇಶಗಳ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಲೋಡ್ ಮಾಡೋಣ:\n"
]
]
},
},
{
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಈ ಡೇಟಾಸೆಟ್ ದೇಶಗಳು ಮತ್ತು ಪ್ರಾಂತ್ಯಗಳ ಬಗ್ಗೆ ಮಾಹಿತಿ ಹೊಂದಿರುವುದರಿಂದ, ಸಂಪೂರ್ಣ ದೇಶದ ಜನಸಂಖ್ಯೆಯನ್ನು ಪಡೆಯಲು ನಾವು ಸ್ವಲ್ಪ ಚತುರರಾಗಿರಬೇಕಾಗುತ್ತದೆ:\n"
"ಈ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ದೇಶಗಳ ಮತ್ತು ಪ್ರಾಂತ್ಯಗಳ ಮಾಹಿತಿಯು ಎರಡೂ ಇದ್ದು, ಸಂಪೂರ್ಣ ದೇಶದ ಜನಸಂಖ್ಯೆಯನ್ನು ಪಡೆಯಲು ನಾವು ಸ್ವಲ್ಪ ಬುದ್ಧಿವಂತಿಕೆಯಿಂದ ಇರಬೇಕು: \n"
]
]
},
},
{
{
@ -2261,15 +2261,15 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಲೆಕ್ಕಾಚಾರ $R_t$\n",
"\n",
"\n",
"ರೋಗವು ಎಷ್ಟು ಸೋಂಕುಕಾರಿಯಾಗಿದೆ ಎಂದು ನೋಡಲು, ನಾವು **ಪ್ರಾಥಮಿಕ ಉತ್ಪಾದನಾ ಸಂಖ್ಯೆಯನ್ನು** $R_0$ ನೋಡುತ್ತೇವೆ, ಇದು ಸೋಂಕಿತ ವ್ಯಕ್ತಿ ಮುಂದುವರಿಸಿದವರ ಸಂಖ್ಯೆ ಎಷ್ಟಿದೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ. $R_0$ ೧ ಕ್ಕಿಂತ ಹೆಚ್ಚು ಇದ್ದರೆ, ಮಹಾಮಾರಿ ಹರಡಲಿರುವ ಸಾಧ್ಯತೆ ಇದೆ.\n",
"## $R_t$ ಅನ್ನು ಗಣನೆ ಮಾಡುವುದು\n",
"\n",
"\n",
"$R_0$ ಆ ರೋಗದ ಸ್ವಭಾವವಾಗಿದ್ದು, ಜನರು ಮಹಾಮಾರಿಗೆ ತಡೆ ಹಾಕಲು ತೆಗೆದುಕೊಳ್ಳುತ್ತಿರುವ ಕೆಲವು ರಕ್ಷಣೆ ಕ್ರಮಗಳನ್ನು ಪರಿಗಣಿಸುವುದಿಲ್ಲ. ಮಹಾಮಾರಿ ಪ್ರಗತಿಯ ಸಮಯದಲ್ಲಿ, ನಾವು ಯಾವುದೇ ನೀಡಲಾದ ಕಾಲ $t$ ಕ್ಕೆ ಉತ್ಪಾದನಾ ಸಂಖ್ಯೆ $R_t$ ಅನ್ನು ಅಂದಾಜಿಸಬಹುದು. ಈ ಸಂಖ್ಯೆಯನ್ನು ಸರಾಸರಿ ೮ ದಿನಗಳ ವಿಂಡೋವನ್ನು ತೆಗೆದು ಲೆಕ್ಕ ಹಾಕುವುದರಿಂದ ಅಂದಾಜಿಸಬಹುದು ಎಂದು ತೋರಿಸಲಾಗಿದೆ: \n",
"ರೋಗ 얼마나 संक्रमಕವಾಗಿದೆ ಎಂದು ನೋಡಲು, ನಾವು **ಮೂಲಪ್ರತಿಕೃತಿ ಸಂಖ್ಯೆ** $R_0$ ಅನ್ನು ನೋಡುತ್ತೇವೆ, ಇದು ಸೋಂಕಿತರಾದ ವ್ಯಕ್ತಿ ಮತ್ತಷ್ಟು ಎಷ್ಟು ಜನರನ್ನು ಸೋಂಕುಮಾಡುತ್ತಾನೆ ಎಂಬ ಸಂಖ್ಯೆಯನ್ನು ಸೂಚಿಸುತ್ತದೆ. $R_0$ 1 ಕ್ಕಿಂತ ಹೆಚ್ಚು ಇದ್ದರೆ, ಮಹಾಮಾರಿ ಹರಡುವ ಸಂಭವವಿದೆ.\n",
"ಇಲ್ಲಿ $I_t$ ದಿನ $t$ ಕ್ಕೆ ಹೊಸವಾಗಿ ಸೋಂಕಿತರಾದವರ ಸಂಖ್ಯೆ.\n",
"\n",
"\n",
"ನಮ್ಮ ಮಹಾಮಾರಿ ಡೇಟಾಗಾಗಿ $R_t$ ಲೆಕ್ಕ ಹಾಕೋಣ. ಇದಕ್ಕಾಗಿ, ನಾವು `ninfected` ಮೌಲ್ಯಗಳ 8 ಸಂಖ್ಯೆಗಳ ಸರಣಿಯನ್ನು ತೆಗೆದು, ಮೇಲಿನ ಅನುಪಾತ ಲೆಕ್ಕ ಹಾಕುವ ಕಾರ್ಯವನ್ನು ಅನ್ವಯಿಸೋಣ:\n"
"$R_0$ ರೋಗದ ಸ್ವಂತ ಗುಣಲಕ್ಷಣವಾಗಿದ್ದು, ಜನರು ಮಹಾಮಾರಿಯನ್ನು ನಿಧಾನಗೊಳಿಸಲು ತೆಗೆದುಕೊಳ್ಳಬಹುದಾದ ಕೆಲವು ರಕ್ಷಕ ಕ್ರಮಗಳನ್ನು ಗಮನದಲ್ಲಿರಿಸುವುದಿಲ್ಲ. ಮಹಾಮಾರಿಯ ಪ್ರಗತಿಯಲ್ಲಿ, ನಾವು ಯಾವುದೇ ಕೊಟ್ಟ ಸಮಯ $t$ ನಲ್ಲಿ ಪ್ರತಿಕೃತಿ ಸಂಖ್ಯೆ $R_t$ ಅನ್ನು ಅಂದಾಜಿಸಬಹುದು. 8 ದಿನಗಳ ವಿಂಡೋ ತೆಗೆದು ಈ ಸಂಖ್ಯೆಯನ್ನು ಸುಮಾರು ಅಂದಾಜಿಸಬಹುದಾಗಿದೆ ಎಂದು ತೋರಿಸಲಾಗಿದೆ $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ಇಲ್ಲಿ $I_t$ ದಿನ $t$ ರಂದು ಹೊಸವಾಗಿ ಸೋಂಕಿತರಾದ ವ್ಯಕ್ತಿಗಳ ಸಂಖ್ಯೆಯನ್ನು ಸೂಚಿಸುತ್ತದೆ.\n",
"\n",
"ನಮ್ಮ ಮಹಾಮಾರಿ ದತ್ತಾಂಶದ $R_t$ ಅನ್ನು ಗಣನೆ ಮಾಡೋಣ. ಇದಕ್ಕಾಗಿ, ನಾವು 8 `ninfected` ಮೌಲ್ಯಗಳ ರೋಲಿಂಗ್ ವಿಂಡೋ ತೆಗೆದು ಮೇಲಿನ ಅನುಪಾತವನ್ನು ಗಣನೆ ಮಾಡುವ ಕಾರ್ಯವನ್ನು ಅನುಷ್ಠಾನ ಮಾಡುತ್ತೇವೆ:\n"
]
]
},
},
{
{
@ -2299,9 +2299,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ನೀವು ಗ್ರಾಫ್ನಲ್ಲಿ ಕೆಲವು ಖಾಲಿ ಭಾಗಗಳಿವೆ ಎಂದು ನೋಡಿ, ಅವುಗಳ ಕಾರಣವಾಗಬಹುದು `NaN`, ಅಥವಾ `inf` ಮೌಲ್ಯಗಳು ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಇದ್ದರೆ. `inf` 0 ರಿಂದ ಭಾಗಿಸಿ ಉಂಟಾಗಬಹುದು, ಮತ್ತು `NaN` ಕಾಣಿಸಿಕೊಡುವುದು ದತ್ತಾಂಶ ಕಾಣೆಯಾದದ್ದು ಅಥವಾ ಫಲಿತಾಂಶ 계산 ಮಾಡಲು ಇರುವ ಡೇಟಾ ಇಲ್ಲದಿರುವುದು (ನಮ್ಮ ಫ್ರೇಮ್ನ ಆರಂಭದಲ್ಲಿ, ಅಗಲ 8 ಇರುವ ರೋಲಿಂಗ್ ವಿಂಡೋ ಇನ್ನೂ ಲಭ್ಯವಿಲ್ಲದಿರುವುದರಿಂದ). ಗ್ರಾಫ್ ಅನ್ನು ಉತ್ತಮಗೊಳಿಸಲು, ನಾವು `replace` ಮತ್ತು `fillna` ಕಾರ್ಯಗಳನ್ನು ಬಳಸಿ ಆ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಬೇಕು.\n",
"ನೀವು ಗ್ರಾಫ್ನಲ್ಲಿ ಕೆಲವು ಗ್ಯಾಪ್ಗಳಿವೆ ಎಂಬುದನ್ನು ನೋಡಬಹುದು. ಅವುಗಳ ಕಾರಣ datasets ನಲ್ಲಿ `NaN` ಅಥವಾ `inf` ಮೌಲ್ಯಗಳಿರುವುದು ಆಗಿರಬಹುದು. `inf` ಶೂನ್ಯದಿಂದ ವಿಭಾಗದ ಕಾರಣವಾಗಬಹುದು, ಮತ್ತು `NaN` ಅರ್ಥವು ಕಾಣದ ಡೇಟಾ ಅಥವಾ ಫಲಿತಾಂಶ ಗಣನೆಗೆ ಲಭ್ಯವಿಲ್ಲದ ಡೇಟಾಗಳನ್ನು ಸೂಚಿಸಬಹುದು (ನಮ್ಮ ಫ್ರೇಮ್ ಆರಂಭದಲ್ಲಿ, ಅಗಲ 8 ಇರುವ ರೋಲಿಂಗ್ ವಿಂಡೋ ಇನ್ನೂ ಲಭ್ಯವಿಲ್ಲದಂತೆ). ಗ್ರಾಫ್ ಅನ್ನು ಸುಂದರವಾಗಿಸಲು, ನಾವು `replace` ಮತ್ತು `fillna` ಫಂಕ್ಶನ್ ಬಳಸಿ ಆ ಮೌಲ್ಯಗಳನ್ನು ಪರಿಪೂರಣೆ ಮಾಡಬೇಕಾಗುತ್ತದೆ.\n",
"\n",
"\n",
"ನಾವು ನಂತರ ಪಾಂಡಮಿಕ್ನ ಆರಂಭವನ್ನು ಮತ್ತಷ್ಟು ನೋಡೋಣ. ನಾವು y-ಅಕ್ಷದ ಮೌಲ್ಯಗಳನ್ನು 6 ಕ್ಕೆ ಕಡಿತಮಾಡಿ ಮಾತ್ರ ತೋರಿಸುವಂತೆ ಸೀಮಿತಮಾಡುತ್ತೇವೆ, ಚೆನ್ನಾಗಿ ನೋಡಲು, ಮತ್ತು 1 ರಲ್ಲಿ ಆಧಾರ ರೇಖೆಯನ್ನು വരೆಯುತ್ತೇವೆ.\n"
"ಮಹಾಮಾರಿ ಆರಂಭವನ್ನು ನಾವು ಇನ್ನೂ ಗಮನಿಸಲಿದ್ದು. ಉತ್ತಮವಾಗಿ ಕಾಣಿಸಲು, y-ಆಕ್ಸಿಸ್ ಮೌಲ್ಯಗಳನ್ನು 6 ಕ್ಕಿಂತ ಕಡಿಮೆ ಇರುವ ಮೌಲ್ಯಗಳೆಲೆ ಮಾತ್ರ ಮಿತಿಗೊಳಿಸುವುದು ಮತ್ತು 1 ರಲ್ಲಿ ಸಮಾಂತರ ರೇಖೆ ತೆಗೆಯುವುದು ಸಹ ಮಾಡುತ್ತೇವೆ.\n"
]
]
},
},
{
{
@ -2332,7 +2332,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಮಹಾಮಾರಿಗೆ ಇನ್ನೊಂದು ಆಸಕ್ತಿದಾಯಕ ಸೂಚಕವೆಂದರೆ **ತೆರಗಿನ** ಅಥವಾ ಹೊಸ ಪ್ರಕರಣಗಳಲ್ಲಿ **ದೈನಂದಿನ ವ್ಯತ್ಯಾಸ**. ಇದು ಮಹಾಮಾರಿಗೆ ಎವು ಸಮಯದಲ್ಲಿ ಹೆಚ್ಚಾಗುತ್ತಿದೆ ಅಥವಾ ಕಡಿಮೆಯಾಗುತ್ತಿದೆ ಎಂಬುದನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ನೋಡಲು ಅನುಮತಿಸುತ್ತದೆ.\n"
"ಮಹಾಮಾರಿಯ ಇನ್ನೊಂದು ರೋಚಕ ಸೂಚಕವೆಂದರೆ **ಅವಕಲನೆ** ಅಥವಾ ಹೊಸ ಪ್ರಕರಣಗಳಲ್ಲಿ **ದೈನಂದಿನ ವ್ಯತ್ಯಾಸ**. ಇದು ನಮಗೆ ಮಹಾಮಾರಿಯು ಏಳುತ್ತಿರುವಾಗ ಅಥವಾ ಕಡಿಮೆಯಾಗುತ್ತಿರುವಾಗ ಸ್ಪಷ್ಟವಾಗಿ ನೋಡಲು ಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ. \n"
]
]
},
},
{
{
@ -2361,7 +2361,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ಅಹಿತಕರವಾಗಿ ವರದಿಗಳಿಂದಾಗುವ ಅನೇಕ ತಿರುವುಗಳನ್ನು ಗಮನಿಸಿದರೆ, ಒಟ್ಟಾರೆ ದೃಶ್ಯವನ್ನು ಪಡೆಯಲು ರೋಲಿಂಗ್ ಸರಾಸರಿ ನಿರ್ವಹಿಸುವ ಮೂಲಕ ವಕ್ರವನ್ನು ಸಮ್ಮಿಲಿತಗೊಳಿಸುವುದು ಸೂಕ್ತವಾಗಿದೆ. ಪುನಃ пандемಿಯ ಮೊದಲ ಕೆಲವು ತಿಂಗಳ ಮೇಲೆ ಗಮನಹರಿಸೋಣ:\n"
"ವರದಿಗೊಳಿಸುವಿಕೆಯ ಹಿನ್ನೆಲೆಯಲ್ಲಿ ಡೇಟಾದಲ್ಲಿ ಹಲವಾರು ಚಲನೆಗಳಿರುವುದು ಸ್ಪಷ್ಟವಾಗಿರುವಾಗ, ಒಟ್ಟಾರೆ ಚಿತ್ರವನ್ನು ಪಡೆಯಲು ರೋಲಿಂಗ್ ಸರಾಸರಿ ಹರಡಿಸುವ ಮೂಲಕ ವಕ್ರರೇಖೆಯನ್ನು ಸಮತೋಲನಗೊಳಿಸುವುದು ಅರ್ಥಪೂರ್ಣ. ಮತ್ತೆ ಮಹಾಮಾರಿಗೆ ಮೊದಲ ತಿಂಗಳುಗಳ ಕಡೆ ಗಮನ ಹರಿಸೋಣ:\n"
]
]
},
},
{
{
@ -2391,26 +2391,27 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಚಾಲೆಂಜ್\n",
"\n",
"\n",
"ಇಂಡೀಗ ನಿಮ್ಮ ಕೈಲಿಗೆ ಕೋಡ್ ಮತ್ತು ಡೇಟಾವನ್ನು ಇನ್ನಷ್ಟು ಆಡಲು ಸಮಯವಾಗಿದೆ! ನೀವು ಪ್ರಯೋಗಿಸಬಹುದಾದ ಕೆಲವು ಸಲಹೆಗಳು ಇಲ್ಲಿವೆ:\n",
"## ಸವಾಲು\n",
"* ವಿಭಿನ್ನ ದೇಶಗಳಲ್ಲಿ ಕೋವಿಡ್-19 ಹರಡುವಿಕೆಯನ್ನು ನೋಡಿ.\n",
"\n",
"* ಹೋಲಿಕೆಯಿಗಾಗಿ ಹಲವಾರು ದೇಶಗಳ $R_t$ ಗ್ರಾಫ್ಗಳನ್ನು ಒಂದೇ ಪ್ಲಾಟ್ನಲ್ಲಿ ಚಿತ್ರಿಸಿ, ಅಥವಾ ಬಹಳಷ್ಟು ಪ್ಲಾಟ್ಗಳನ್ನು ಪಕ್ಕಪಕ್ಕವಾಗಿ ಮಾಡಿ.\n",
"ಈಗ ನೀವು ಕೋಡ್ ಮತ್ತು ಡೇಟಾ ಜೊತೆಗೆ ಹೆಚ್ಚು ಚಟುವಟಿಕೆ ನಡೆಸುವ ಸಮಯವಾಗಿದೆ! ನಿಮಗೆ ಪ್ರಯೋಗಿಸಬಹುದಾದ ಕೆಲವು ಸಲಹೆಗಳು ಇವು:\n",
"* ಸಾವುಗಳ ಮತ್ತು ಪುನಃಪ್ರಾಪ್ತಿಗಳ ಸಂಖ್ಯೆ ಸೋಂಕಿತರ ಸಂಖ್ಯೆಯೊಂದಿಗೆ ಹೇಗೆ ಸಂಬಂಧಪಟ್ಟಿದೆ ಎಂದು ನೋಡಿ.\n",
"* ವಿವಿಧ ದೇಶಗಳಲ್ಲಿ ಮಹಾಮಾರಿಯ ಹರಡುವಿಕೆಯನ್ನು ನೋಡಿ.\n",
"* ಸರಾಸರಿ ರೋಗ ಎಷ್ಟು ಕಾಲ ಹಿಂತಿರುಗುತ್ತದೆಯೋ ಆ ಬಗ್ಗೆ ತಿಳಿಯಲು ಸೋಂಕು ದರ ಮತ್ತು ಸಾವುಗಳ ದರವನ್ನು ದೃಶ್ಯವಾಗಿ ಸಂಬಂಧಿಸಿ, ಹಾಗೂ ಕೆಲವು ಅನವಶ್ಯಕತೆಗಳನ್ನು ಹುಡುಕಿ. ಅದಕ್ಕಾಗಿ ನಿಮ್ಮಿಗೆ ವಿಭಿನ್ನ ದೇಶಗಳನ್ನು ನೋಡಬೇಕಾಗಬಹುದು.\n",
"* ಹೋಲಿಕೆಗಾಗಿ ಒಂದೇ ಪ್ಲಾಟ್ ಮೇಲೆ ಹಲವಾರು ದೇಶಗಳ $R_t$ ಗ್ರಾಫ್ಗಳನ್ನು ರೇಖಾಚಿತ್ರಗೊಳಿಸಿ, ಅಥವಾ ಬದಿಯಲ್ಲಿ ಬದಿಗೆ ಹಲವು ಪ್ಲಾಟ್ಗಳನ್ನು ರಚಿಸಿ\n",
"* ಸಾವು ದರವನ್ನು ಲೆಕ್ಕಿಸಿ ಮತ್ತು ಅದು ಸಮಯದೊಂದಿಗೆ ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ ಎಂದು ತಿಳಿದುಕೊಳ್ಳಿ. ಲೆಕ್ಕಾಚಾರ ಮಾಡಲು ನೀವು ರೋಗದ ಅವಧಿಯನ್ನು ದಿನಗಳಲ್ಲಿ ಗಮನದಲ್ಲಿಟ್ಟುಕೊಳ್ಳಲು ಬಯಸಬಹುದು ಮತ್ತು ಒಂದು ಸಮಯ ಸರಣಿಯನ್ನು ಸ್ಥಳಾಂತರಿಸಬಹುದು.\n"
"* ಇನ್ಫೆಕ್ಷನ್ ಪ್ರಕರಣಗಳ ಸಂಖ್ಯೆಯೊಂದಿಗೆ ಸಾವಿನ ಮತ್ತು ಚೇತರಿಕೆಯ ಸಂಖ್ಯೆಗಳು ಹೇಗೆ ಸಂಬಂಧ ಹೊಂದಿವೆ ಎಂದು ನೋಡಿ.\n",
"* ಸೋಂಕು ದರ ಮತ್ತು ಸಾವು ದರವನ್ನು ದೃಶ್ಯಾತ್ಮಕವಾಗಿ ಸಂಬಂಧಪಡಿಸಿ ಮತ್ತು ಕೆಲವು ಅನೋಮಲಿಗಳನ್ನು ಹುಡುಕಿ, ಒಂದು ಸಾಮಾನ್ಯ ರೋಗವು ಎಷ್ಟು ಕಾಲ टिकುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿಯಲು ಪ್ರಯತ್ನಿಸಿ. ಅದಕ್ಕಾಗಿ ನೀವು ವಿಭಿನ್ನ ದೇಶಗಳನ್ನು ನೋಡಿ ತಿಳಿದುಕೊಳ್ಳಬೇಕಾಗಬಹುದು.\n",
"* ಮಾರಣಾಂತಿಕ ದರವನ್ನು ಲೆಕ್ಕಿಸಿ ಮತ್ತು ಅದು ಸಮಯದೊಂದಿಗೆ ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ ಎಂದು ನೋಡಿ. ಲೆಕ್ಕಾಚಾರಗಳನ್ನು ಮಾಡುವ ಮೊದಲು ರೋಗದ ಅವಧಿಯನ್ನು ದಿನಗಳಲ್ಲಿ ಪರಿಗಣಿಸಿ ಒಂದು ಕಾಲ ಸರಣಿಯನ್ನು ಸರಿಸಲು ಬಯಸಬಹುದು\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ಉಲ್ಲೇಖಗಳು\n",
"## ರೆಫರೆನ್ಸುಗಳು\n",
"\n",
"\n",
"ನೀವು ಕೆಳಗಿನ ಪ್ರಕಟಣೆಗಳಲ್ಲಿ COVID ಮಹಾಮಾರಿ ಹರಡುವಿಕೆ ಸಂಬಂಧಿ ಹೆಚ್ಚಿನ ಅಧ್ಯಯನಗಳನ್ನು ನೋಡಿ ಪಡೆಯಬಹುದು:\n",
"ಕೆಳಗಿನ ಪ್ರಕಾಶನಗಳಲ್ಲಿ COVID ಮಹಾಮಾರಿಯ ಹರಡುವಿಕೆಯನ್ನು ಕುರಿತು ಇನ್ನಷ್ಟು ಅಧ್ಯಯನಗಳನ್ನು ನೀವು ನೋಡಬಹುದು:\n",
"* [COVID ಮಹಾಮಾರಿಯ ಸಮಯದಲ್ಲಿ Rt ಅಂದಾಜುಗಾಗಿ ಸ್ಲೈಡಿಂಗ್ SIR ಮಾದರಿ](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [ಡಿಮಿಟ್ರಿ ಸೋಶ್ನಿಕೋವ್](http://soshnikov.com) ಅವರ ಬ್ಲಾಗ್ ಪೋಸ್ಟ್\n",
"* [COVID ಮಹಾಮಾರಿಯ ಸಂದರ್ಭದಲ್ಲಿ Rt ಅಂದಾಜುಗಾಗಿ ಸ್ಲೈಡಿಂಗ್ SIR ಮಾದರಿ](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [ಡಿಮಿಟ್ರಿ ಸೋಶ್ನಿಕೊವ್](http://soshnikov.com) ರವರ ಬ್ಲಾಗ್ ಪೋಸ್ಟ್\n",
"* [ಮೇಲಿನ ಪ್ರಬಂಧದ ಕೋಡ್ GitHub ನಲ್ಲಿ](https://github.com/shwars/SlidingSIR)\n"
"* [ಮೇಲಿನ ಪೇಪರ್ಗೆ ಸಂಬಂಧಿಸಿದ ಕೋಡ್ GitHub ನಲ್ಲಿ](https://github.com/shwars/SlidingSIR)\n"
]
]
},
},
{
{
@ -2424,7 +2425,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ಅस्वೀಕರಣ**: \nಈ ದಾಖಲೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಎಂಬ AI ಭಾಷಾಂತರ ಸೇವೆಯನ್ನು ಬಳಸಿ ಭಾಷಾಂತರಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಭಾಷಾಂತರಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅನುಚಿತಾಂಶಗಳು ಇದ್ದಿರಬಹುದು ಎಂಬುದನ್ನು ಗಮನದಲ್ಲಿ ಇರಿಸಿಕೊಳ್ಳಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಅಂಕಿಗಳು ಮತ್ತು ಮಾಹಿತಿಯನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ ವೃತ್ತಿಪರ ಮಾನವ ಭಾಷಾಂತರವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಭಾಷಾಂತರ ಬಳಕೆಯಿಂದಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆಗಳು ಅಥವಾ ದುರ್ಬೋಧನೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ಅಸ್ವೀಕಾರ**:\nಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
ಪ್ರಾರಂಭಿಸಲು, ನಿಮ್ಮ ಯಂತ್ರದಲ್ಲಿ NPM ಮತ್ತು Node ಚಾಲನೆಯಲ್ಲಿರುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬೇಕು. ಅವಲಂಬನೆಗಳನ್ನು ಸ್ಥಾಪಿಸಿ (npm install) ಮತ್ತು ನಂತರ ಪ್ರಾಜೆಕ್ಟ್ ಅನ್ನು ಸ್ಥಳೀಯವಾಗಿ ಚಾಲನೆ ಮಾಡಿ (npm run serve):
ಪ್ರಾರಂಭಿಸಲು, ನಿಮ್ಮ ಯಂತ್ರದಲ್ಲಿ NPM ಮತ್ತು Node **>=20.0.0** চলেುತ್ತಿದೆ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬೇಕಾಗುತ್ತದೆ. ಅವಶ್ಯಕತೆಯನ್ನು ಸ್ಥಾಪಿಸಿ (npm install) ನಂತರ ಪ್ರಾಜೆಕ್ಟ್ ಅನ್ನು ಸ್ಥಳೀಯವಾಗಿ ರನ್ ಮಾಡಿ (npm run serve):
## ಪ್ರಾಜೆಕ್ಟ್ ಸೆಟಪ್
## ಪ್ರಾಜೆಕ್ಟ್ ಸೆಟಪ್
```
```
npm install
npm install
```
```
### ಅಭಿವೃದ್ಧಿಗಾಗಿ ಸಂಯೋಜಿಸಿ ಮತ್ತು ಹಾಟ್-ರಿಲೋಡ್ ಮಾಡಿ
### ಅಭಿವೃದ್ಧಿಗಾಗಿ ಸಂಯೋಜನೆ ಮತ್ತು ಹಾಟ್-ರಿಲೋಡ್
```
```
npm run serve
npm run serve
```
```
### ಉತ್ಪಾದನೆಗಾಗಿ ಸಂಯೋಜಿಸಿ ಮತ್ತು ಮಿನಿಫೈ ಮಾಡಿ
### ಉತ್ಪಾದನೆಗಾಗಿ ಸಂಯೋಜನೆ ಮತ್ತು ಕನಿಷ್ಠೀಕರಣ
```
```
npm run build
npm run build
```
```
### ಫೈಲ್ಗಳನ್ನು ಲಿಂಟ್ ಮಾಡಿ ಮತ್ತು ಸರಿಪಡಿಸಿ
### ಲಿಂಟ್ ಮಾಡಿ ಮತ್ತು ಫೈಲಾಗಳನ್ನು ಸರಿಪಡಿಸಿ
```
```
npm run lint
npm run lint
```
```
@ -28,6 +28,6 @@ npm run lint
---
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**ಅಸ್ವೀಕರಣ**:
**ಅಸ್ವೀಕಾರ**:
ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯಿಗಾಗಿ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂದು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಮಹತ್ವದ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ ಅಥವಾ ತಪ್ಪು ವಿವರಣೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ.
ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.
ಪ್ರಾರಂಭಿಸಲು, ನಿಮ್ಮ ಯಂತ್ರದಲ್ಲಿ NPM ಮತ್ತು Node ಚಾಲನೆಯಲ್ಲಿರುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬೇಕು. ಅವಲಂಬನೆಗಳನ್ನು ಸ್ಥಾಪಿಸಿ (npm install) ಮತ್ತು ನಂತರ ಪ್ರಾಜೆಕ್ಟ್ ಅನ್ನು ಸ್ಥಳೀಯವಾಗಿ ಚಾಲನೆ ಮಾಡಿ (npm run serve):
ಪ್ರಾರಂಭಿಸಲು, ನಿಮ್ಮ ಯಂತ್ರದಲ್ಲಿ NPM ಮತ್ತು Node **>=20.0.0** ರನ್ ಆಗುತ್ತಿದೆ ಎಂದು ಖಾತ್ರಿಪಡಿಸಿಕೊಳ್ಳಬೇಕು. ಡಿಪೆಂಡೆನ್ಸಿಗಳನ್ನು ಇನ್ಸ್ಟಾಲ್ ಮಾಡಿ (npm install) ನಂತರ ಪ್ರಾಜೆಕ್ಟ್ ಅನ್ನು ಸ್ಥಳೀಯವಾಗಿ ರನ್ ಮಾಡಿ (npm run serve):
## ಪ್ರಾಜೆಕ್ಟ್ ಸೆಟಪ್
## ಪ್ರಾಜೆಕ್ಟ್ ಸೆಟಪ್
```
```
npm install
npm install
```
```
### ಅಭಿವೃದ್ಧಿಗಾಗಿ ಸಂಯೋಜಿಸಿ ಮತ್ತು ಹಾಟ್-ರಿಲೋಡ್ ಮಾಡುತ್ತದೆ
### ಡೆವಲಪ್ಮೆಂಟ್ಗೆ ಸಂಕ್ಷಿಪ್ತವಾಗಿ ಸಂಯೋಜಿಸಿ ಮತ್ತು ಹಾಟ್ ರಿಲೋಡ್ ಮಾಡಿ
```
```
npm run serve
npm run serve
```
```
### ಉತ್ಪಾದನೆಗಾಗಿ ಸಂಯೋಜಿಸಿ ಮತ್ತು ಮಿನಿಫೈ ಮಾಡುತ್ತದೆ
### ಉತ್ಪಾದನೆಗಾಗಿ ಸಂಯೋಜಿಸಿ ಮತ್ತು ಮಿನಿಫೈ ಮಾಡಿ
```
```
npm run build
npm run build
```
```
### ಫೈಲ್ಗಳನ್ನು ಲಿಂಟ್ ಮಾಡಿ ಮತ್ತು ಸರಿಪಡಿಸುತ್ತದೆ
### ಫೈಲ್ಗಳನ್ನು ಲಿಂಟ್ ಮಾಡಿ ಮತ್ತು ಸರಿಪಡಿಸಿ
```
```
npm run lint
npm run lint
```
```
### ಕಸ್ಟಮೈಸ್ ಕಾನ್ಫಿಗರೇಶನ್
### ಕಸ್ಟಮೈಸ್ ಕಾನ್ಫಿಗರೇಶನ್
[Configuration Reference](https://cli.vuejs.org/config/) ಅನ್ನು ನೋಡಿ.
ನೋಡಿ [Configuration Reference](https://cli.vuejs.org/config/).
---
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**ಅಸ್ವೀಕರಣ**:
**ಅಸ್ವೀಕಾರ**:
ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯಿಗಾಗಿ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ತಪ್ಪುಗಳು ಇರಬಹುದು ಎಂದು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಮಹತ್ವದ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ ಅಥವಾ ತಪ್ಪು ವಿವರಣೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ.
ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.
| ](../../sketchnotes/03-DefiningData.png)|
| ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|:---:|
|ഡാറ്റ നിർവചിക്കൽ - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
|ഡാറ്റ വിശകലനം ചെയ്യൽ - _സ്കെച്ച്നോട്ട് [@nitya](https://twitter.com/nitya) നൽകിയതാണ്_ |
ഡാറ്റ എന്നത് കണ്ടെത്തലുകൾ നടത്താനും വിവരസമ്പന്നമായ തീരുമാനങ്ങൾ പിന്തുണയ്ക്കാനും ഉപയോഗിക്കുന്ന വാസ്തവങ്ങൾ, വിവരങ്ങൾ, നിരീക്ഷണങ്ങൾ, അളവുകൾ എന്നിവയാണ്. ഒരു ഡാറ്റ പോയിന്റ് എന്നത് ഒരു ഡാറ്റാസെറ്റിനുള്ളിൽ ഉള്ള ഒരു ഏകക ഡാറ്റയാണ്, ഡാറ്റ പോയിന്റുകളുടെ സമാഹാരമാണ് ഡാറ്റാസെറ്റ്. ഡാറ്റാസെറ്റുകൾ വ്യത്യസ്ത ഫോർമാറ്റുകളിലും ഘടനകളിലും വരാം, സാധാരണയായി അതിന്റെ ഉറവിടം അല്ലെങ്കിൽ ഡാറ്റ എവിടെ നിന്നാണ് വന്നത് എന്നതിന്റെ അടിസ്ഥാനത്തിലാണ്. ഉദാഹരണത്തിന്, ഒരു കമ്പനിയുടെ മാസവരുമാനം ഒരു സ്പ്രെഡ്ഷീറ്റിൽ ഉണ്ടാകാം, എന്നാൽ ഒരു സ്മാർട്ട്വാച്ചിൽ നിന്നുള്ള മണിക്കൂറിൽ ഹൃദയമിടിപ്പ് ഡാറ്റ [JSON](https://stackoverflow.com/a/383699) ഫോർമാറ്റിൽ ഉണ്ടാകാം. ഒരു ഡാറ്റാസെറ്റിനുള്ളിൽ ഡാറ്റ സയന്റിസ്റ്റുകൾ വ്യത്യസ്ത തരത്തിലുള്ള ഡാറ്റകളുമായി പ്രവർത്തിക്കുന്നത് സാധാരണമാണ്.
ഡാറ്റ എന്നത് കണ്ടെത്തലുകൾ നടത്താനും ബോധപൂർവ്വമായ തീരുമാനങ്ങൾ പിന്തുണയ്ക്കാനുമായി ഉപയോഗിക്കുന്ന വാസ്തവങ്ങൾ, വിവരങ്ങൾ, നിരീക്ഷണങ്ങൾ, അളവുകൾ എന്നിവയാണ്. ഡാറ്റ പോയിന്റ് എന്നത് ഡേറ്റാസെറ്റിനുള്ളിലെ ഒരൊറ്റ ഡാറ്റ യൂണിറ്റാണ്, ഡേറ്റാസെറ്റ് ഡാറ്റ പോയിന്റുകളുടെ സമാഹാരമാണ്. ഡേറ്റാസെറ്റ് വിവിധ ഫോർമാറ്റുകളിലും ഘടനകളിലുമായി വരാം, സാധാരണയായി അതിന്റെ ഉറവിടത്തിൻറെ അടിസ്ഥാനത്തിലാണ്, അല്ലെങ്കിൽ ഡാറ്റ എവിടെയാണ് ഉണ്ടായത് എന്നതിൽ. ഉദാഹരണത്തിന്, ഒരു കമ്പനിയുടെയും മാസാന്ത വരുമാനം സ്പ്രഡ്ഷീറ്റിൽ ഉണ്ടാകാം, എന്നാൽ സ്മാർട്ട്വാച്ചിൽ നിന്നുള്ള മണിക്കൂർഅളവിലെ ഹൃദയമിടിപ്പിന്റെ ഡാറ്റ [JSON](https://stackoverflow.com/a/383699) ഫോർമാറ്റിലായിരിക്കാം. ഡാറ്റ സയന്റിസ്റ്റുകൾ ഒരു ഡേറ്റാസെറ്റിനുള്ളിൽ വിവിധ തരത്തിലുള്ള ഡാറ്റയിൽ ജോലി ചെയ്യുന്നുണ്ടാകുന്നത് സാധാരണമാണ്.
ഈ പാഠം ഡാറ്റയുടെ സവിശേഷതകളും ഉറവിടങ്ങളും അടിസ്ഥാനമാക്കി ഡാറ്റ തിരിച്ചറിയാനും വർഗ്ഗീകരിക്കാനും ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു.
ഈ പാഠത്തിൽ, ഡാറ്റയുടെ സ്വഭാവവും ഉറവിടങ്ങളും പരിഗണിച്ചാണ് ഡാറ്റ തിരിച്ചറിയുകയും വർഗ്ഗീകരിക്കുകയും ചെയ്യുന്നതിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു.
റോ ഡാറ്റ എന്നത് അതിന്റെ ഉറവിടത്തിൽ നിന്നുള്ള പ്രാഥമിക അവസ്ഥയിലുള്ള ഡാറ്റയാണ്, ഇത് വിശകലനം ചെയ്യപ്പെടുകയോ ക്രമീകരിക്കപ്പെടുകയോ ചെയ്തിട്ടില്ല. ഒരു ഡാറ്റാസെറ്റിൽ എന്ത് സംഭവിക്കുന്നു എന്ന് മനസ്സിലാക്കാൻ, അത് മനുഷ്യരും അവയെ കൂടുതൽ വിശകലനം ചെയ്യാൻ ഉപയോഗിക്കുന്ന സാങ്കേതികവിദ്യയും മനസ്സിലാക്കാൻ കഴിയുന്ന ഫോർമാറ്റിലേക്ക് ക്രമീകരിക്കേണ്ടതുണ്ട്. ഒരു ഡാറ്റാസെറ്റിന്റെ ഘടന അതെങ്ങനെ ക്രമീകരിച്ചിരിക്കുന്നു എന്ന് വിവരിക്കുന്നു, ഇത് ഘടനയുള്ള, ഘടനയില്ലാത്ത, അർദ്ധഘടനയുള്ള എന്നിങ്ങനെ വർഗ്ഗീകരിക്കാം. ഈ ഘടനാ തരം ഉറവിടത്തിന്റെ അടിസ്ഥാനത്തിൽ വ്യത്യാസപ്പെടും, പക്ഷേ ഒടുവിൽ ഈ മൂന്ന് വിഭാഗങ്ങളിൽ പെടും.
അസംസ്കൃത ഡാറ്റ എന്നത് അതിന്റെ ഉറവിടത്തിൽ നിന്നുള്ള പ്രാഥമിക നിലയിലെ ഡാറ്റയാണ്, ഇത് വിശകലനം ചെയ്തോ ക്രമീകരിച്ചോ ആയിട്ടില്ല. ഒരു ഡേറ്റാസെറ്റിൽ എന്തിനാണ് സംഭവിക്കുന്നത് എന്നത് മനസ്സിലാക്കാൻ, മനുഷ്യർക്കും അവരെല്ലാം വിശകലനം ചെയ്യാൻ ഉപയോഗിക്കുന്ന സാങ്കേതിക വിദ്യകൾക്കും മനസ്സിലാകുന്ന രീതിയിൽ ഒരു രൂപത്തിൽ ക്രമീകരിക്കേണ്ടതുണ്ട്. ഒരു ഡേറ്റാസെറ്റിന്റെ ഘടന അതിന് എങ്ങനെ ക്രമീകരണമാണുള്ളതെന്ന് വിശദീകരിക്കുന്നു, ഈ ഘടനയെ ഘടിതം, അസംസ്കൃതം, അർദ്ദഘടിതം എന്നിങ്ങനെ വന്ധനകൾക്ക് കീഴിൽ വർക്കാമാണ്. ഈ ഘടിതങ്ങളെയും ഘടനയെയും ഉറവിടത്തെ അനുസരിച്ച് വ്യത്യാസമുണ്ടാകാം, പക്ഷേ അവസാനപരിണാമത്തിൽ ഇവ മൂന്ന് വർഗ്ഗങ്ങളിലായി എത്തും.
### അളവുകൂട്ടിയ ഡാറ്റ
### സംഖ്യാത്മക ഡാറ്റ (Quantitative Data)
അളവുകൂട്ടിയ ഡാറ്റ എന്നത് ഒരു ഡാറ്റാസെറ്റിനുള്ളിലെ സംഖ്യാത്മക നിരീക്ഷണങ്ങളാണ്, സാധാരണയായി ഇത് വിശകലനം ചെയ്യാനും അളക്കാനും ഗണിതപരമായി ഉപയോഗിക്കാനും കഴിയും. അളവുകൂട്ടിയ ഡാറ്റയുടെ ചില ഉദാഹരണങ്ങൾ: ഒരു രാജ്യത്തിന്റെ ജനസംഖ്യ, ഒരു വ്യക്തിയുടെ ഉയരം, ഒരു കമ്പനിയുടെ ത്രൈമാസ വരുമാനം. കൂടുതൽ വിശകലനത്തോടെ, അളവുകൂട്ടിയ ഡാറ്റ ഉപയോഗിച്ച് എയർ ക്വാളിറ്റി ഇൻഡക്സ് (AQI) ന്റെ സീസണൽ ട്രെൻഡുകൾ കണ്ടെത്താനോ സാധാരണ ജോലി ദിവസത്തിലെ തിരക്കുള്ള സമയത്തിന്റെ സാധ്യത കണക്കാക്കാനോ കഴിയും.
സംഖ്യാത്മക ഡാറ്റ ഡേറ്റാസെറ്റിനുള്ളിലെ സംഖ്യാത്മക നിരീക്ഷണങ്ങളാണ്, സാധാരണയായി വിശകലനം, അളവുകൾ എടുക്കൽ, ഗണിതപരമായ ഉപയോഗം എന്നിവയ്ക്ക് ബാധകമാണ്. സംഖ്യാത്മക ഡാറ്റയുടെ ചില ഉദാഹരണങ്ങൾ: ഒരു երկրի ജനസംഖ്യ, ഒരു വ്യക്തിയുടെ ഉയരം, ഒരു കമ്പനിയ്ക് പ്രതിമാസ വരുമാനം. കൂടുതൽ വിശകലനത്തോടെ, സംഖ്യാത്മക ഡാറ്റ ഉപയോഗിച്ച് എയർ ക്വാളിറ്റി ഇൻഡക്സ് (AQI) സീസണൽ ട്രെൻഡുകൾ കണ്ടെത്താനോ, സാധാരണ ജോലിദിനത്തിലെ തിരക്കുള്ള സമയങ്ങളിൽ ഗതാഗത സാധ്യത കണക്കാക്കാനോ സാധിക്കും.
### ഗുണപരമായ ഡാറ്റ
### ഗുണാത്മക ഡാറ്റ (Qualitative Data)
ഗുണപരമായ ഡാറ്റ, അല്ലെങ്കിൽ വർഗ്ഗീയ ഡാറ്റ എന്നറിയപ്പെടുന്നത്, അളവുകൂട്ടിയ ഡാറ്റ പോലെയുള്ള വസ്തുനിഷ്ഠമായി അളക്കാനാകാത്ത ഡാറ്റയാണ്. സാധാരണയായി ഇത് ഉൽപ്പന്നം അല്ലെങ്കിൽ പ്രക്രിയ പോലുള്ള ഒന്നിന്റെ ഗുണനിലവാരം പിടിച്ചെടുക്കുന്ന വിവിധ സ്വഭാവത്തിലുള്ള വിഷയപരമായ ഡാറ്റയാണ്. ചിലപ്പോൾ, ഗുണപരമായ ഡാറ്റ സംഖ്യാത്മകമായിരിക്കാം, എന്നാൽ സാധാരണ ഗണിതപരമായി ഉപയോഗിക്കാറില്ല, ഉദാഹരണത്തിന് ഫോൺ നമ്പറുകൾ അല്ലെങ്കിൽ ടൈംസ്റ്റാമ്പുകൾ. ഗുണപരമായ ഡാറ്റയുടെ ചില ഉദാഹരണങ്ങൾ: വീഡിയോ കമന്റുകൾ, ഒരു കാറിന്റെ നിർമ്മാതാവ് മോഡൽ, നിങ്ങളുടെ അടുത്ത സുഹൃത്തുക്കളുടെ പ്രിയപ്പെട്ട നിറം. ഗുണപരമായ ഡാറ്റ ഉപഭോക്താക്കൾക്ക് ഏറ്റവും ഇഷ്ടപ്പെട്ട ഉൽപ്പന്നങ്ങൾ മനസ്സിലാക്കാനോ ജോലി അപേക്ഷാ റിസ്യൂമുകളിൽ ജനപ്രിയമായ കീവേഡുകൾ തിരിച്ചറിയാനോ ഉപയോഗിക്കാം.
ഗുണാത്മക ഡാറ്റ, മറ്റൊരു പേരിൽ വർഗ്ഗീയ ഡാറ്റ, സംഖ്യാത്മക ഡാറ്റപോലെ ഓബ്ജക്റ്റീവായ അളവെടുപ്പുകൾക്കു പകരം സാധാരണയായി വിഷയപരമായ, വിവിധ ഫോർമാറ്റുകളിലുള്ള ഡാറ്റയാണ്. ഇത് സാധാരണയായി ഒരു ഉൽപ്പന്നത്തിന്റെ ഗുണമേന്മ അല്ലെങ്കിൽ പ്രക്രിയയുടെ ഗുണത്തിന്റെ വിശദവിവരം പകർത്തുന്ന വിധത്തിലാണ്. ചിലപ്പോൾ, ഗുണാത്മക ഡാറ്റ സംഖ്യാത്മക ആകാം, എന്നാൽ സാധാരണ ഗണിതപരമായി ഉപയോഗിക്കാറില്ല, ഉദാഹരണക്കായി ഫോൺ നമ്പറുകൾ അല്ലെങ്കിൽ ടൈംസ്റ്റാമ്പുകൾ. ചില ഉദാഹരണങ്ങൾ: വീഡിയോ കമന്റ്സ്, ഒരു കാറിന്റെ നിർമ്മാതാവ് മոդൽ, നിങ്ങളുടെ അടുത്ത സുഹൃത്തിന്റെ ഇഷ്ടപ്പെട്ട നിറം. ഗുണാത്മക ഡാറ്റ വഴി ഉപഭോക്താക്കൾക്ക് ഇഷ്ടപ്പെട്ട ഉൽപ്പന്നങ്ങൾ മനസ്സിലാക്കാനോ തൊഴിൽ അപേക്ഷയുടെ റിസ്യൂമ്മുകളിൽ പ്രചാരത്തിലുള്ള കീ-വാക്കുകൾ തിരിച്ചറിയാനോ സാധിക്കും.
### ഘടനയുള്ള ഡാറ്റ
### ഘടിത ഡാറ്റ (Structured Data)
ഘടനയുള്ള ഡാറ്റ എന്നത് വരികളും കോളങ്ങളുമായി ക്രമീകരിച്ചിരിക്കുന്ന ഡാറ്റയാണ്, ഓരോ വരിയിലും ഒരേ സെറ്റ് കോളങ്ങൾ ഉണ്ടാകും. കോളങ്ങൾ ഒരു പ്രത്യേക തരം മൂല്യത്തെ പ്രതിനിധീകരിക്കുന്നു, ആ മൂല്യം എന്താണെന്ന് വിവരിക്കുന്ന പേരോടെ തിരിച്ചറിയപ്പെടും, വരികൾ യഥാർത്ഥ മൂല്യങ്ങൾ അടങ്ങിയിരിക്കും. കോളങ്ങളിൽ സാധാരണയായി മൂല്യങ്ങൾക്ക് പ്രത്യേക നിയമങ്ങളോ നിയന്ത്രണങ്ങളോ ഉണ്ടാകും, മൂല്യങ്ങൾ കോളത്തെ ശരിയായി പ്രതിനിധീകരിക്കുന്നുവെന്ന് ഉറപ്പാക്കാൻ. ഉദാഹരണത്തിന്, ഓരോ വരിയിലും ഫോൺ നമ്പർ ഉണ്ടായിരിക്കേണ്ട ഒരു ഉപഭോക്തൃ സ്പ്രെഡ്ഷീറ്റിനെ കണക്കാക്കുക, ഫോൺ നമ്പറുകളിൽ അക്ഷരങ്ങൾ ഉണ്ടായിരിക്കരുത്. ഫോൺ നമ്പർ കോളത്തിൽ ശൂന്യമാകരുത്, നമ്പറുകൾ മാത്രമേ അടങ്ങിയിരിക്കൂ എന്നിങ്ങനെ നിയമങ്ങൾ പ്രയോഗിക്കാം.
ഘടിത ഡാറ്റ എങ്ങനെ ക്രമീകരിച്ചിട്ടുള്ളതെന്ന് പറയുന്നത് നിരകളും ത്താളുകളും ഉള്ള ഫോർമാറ്റിൽ ആണ്, ഓരോ നിരക്കും ഒരേ വിധത്തിലുള്ള ത്താളുകൾ ഉണ്ട്. ത്താളുകൾ പ്രത്യേക തരത്തിലുള്ള മൂല്യങ്ങളെ പ്രതിനിധാനം ചെയ്യുന്നു, അവയ്ക്കുള്ള പേരുകൾ അവ മൂല്യമുള്ളതു എന്താണെന്നു വിവരിക്കുന്നു, നിരകൾ യഥാർത്ഥ മൂല്യങ്ങൾ സഞ്ചരിക്കുന്നു. ത്താളുകൾക്ക് സാധാരണയായി മൂല്യങ്ങളുടെ പാരമിതികൾ അല്ലെങ്കിൽ നിയന്ത്രണങ്ങൾ ഉണ്ടാകാം, മൂല്യങ്ങൾ ഇതിനകം താളിന്റെ പ്രതിനിധാനം ശരിയായി നൽകുന്നതിന്. ഉദാഹരണം, ഒരു ഉപഭോക്തൃ സ്പ്രഡ്ഷീറ്റിൽ ഓരോ നിരക്കും ഫോൺ നമ്പർ വേണമെങ്കിൽ, ആ നമ്പറിൽ അക്ഷരങ്ങൾ ഉണ്ടാകരുത്. ഫോൺ നമ്പർ താളിൽ ശൂന്യം അല്ലാതെ നമ്പറുകൾ മാത്രമുണ്ടാകണം എന്നനിയമങ്ങൾ ഉണ്ടായിരിക്കും.
ഘടനയുള്ള ഡാറ്റയുടെ ഒരു ഗുണം, അത് മറ്റൊരു ഘടനയുള്ള ഡാറ്റയുമായി ബന്ധിപ്പിക്കാവുന്നതാണ്. എന്നാൽ, ഡാറ്റ ഒരു പ്രത്യേക രീതിയിൽ ക്രമീകരിക്കാൻ രൂപകൽപ്പന ചെയ്തതിനാൽ, അതിന്റെ മൊത്തം ഘടനയിൽ മാറ്റം വരുത്താൻ വലിയ ശ്രമം വേണം. ഉദാഹരണത്തിന്, ഉപഭോക്തൃ സ്പ്രെഡ്ഷീറ്റിൽ ശൂന്യമാകരുതാത്ത ഒരു ഇമെയിൽ കോളം ചേർക്കുന്നത്, നിലവിലുള്ള വരികളിൽ ഈ മൂല്യങ്ങൾ എങ്ങനെ ചേർക്കാമെന്ന് കണ്ടെത്തേണ്ടതായിരിക്കും.
ഘടിത ഡാറ്റയുടെ ഒരു നേട്ടം ആണ് മറ്റ് ഘടിത ഡാറ്റകളുമായി ബന്ധപ്പെട്ടിരിക്കാൻ കഴിയും എന്നത്. എന്നാൽ, അക്കാര്യത്തിൽ ഡാറ്റ വ്യവസ്ഥാപിതമായി ക്രമീകരിച്ചിട്ടുള്ളതിനാൽ, ആകെ ഘടനയിൽ മാറ്റങ്ങൾ വരുത്തുന്നത് ഏറെപ്രവർത്തനം ആവശ്യമാണ്. ഉദാഹരണത്തിന്, ഉപഭോക്തൃ സ്പ്രഡ്ഷീറ്റിൽ ഒരു ഇ-മെയിൽ ത്താൾ കൂട്ടിച്ചേർക്കേണ്ടത്, ആ ത്താൾ ശൂന്യമാകരുത് എന്നാണെങ്കിൽ, നിലവിലുള്ള നിരകളിൽ എങ്ങനെ ആ മൂല്യങ്ങൾ കൂട്ടിച്ചേർക്കുമെന്ന് നിങ്ങൾക്ക് കണ്ടെത്തേണ്ടതുണ്ട്.
ഘടനയുള്ള ഡാറ്റയുടെ ഉദാഹരണങ്ങൾ: സ്പ്രെഡ്ഷീറ്റുകൾ, റിലേഷണൽ ഡാറ്റാബേസുകൾ, ഫോൺ നമ്പറുകൾ, ബാങ്ക് സ്റ്റേറ്റ്മെന്റുകൾ
ഘടിത ഡാറ്റ ഉദാഹരണങ്ങൾ: സ്പ്രഡ്ഷീറ്റുകൾ, റിലേഷണൽ ഡാറ്റാബേസുകൾ, ഫോൺ നമ്പറുകൾ, ബാങ്ക് സ്റ്റേറ്റ്മെന്റുകൾ
### ഘടനയില്ലാത്ത ഡാറ്റ
### അസംസ്കൃത ഡാറ്റ (Unstructured Data)
ഘടനയില്ലാത്ത ഡാറ്റ സാധാരണയായി വരികളിലോ കോളങ്ങളിലോ വർഗ്ഗീകരിക്കാനാകാത്തതും ഒരു ഫോർമാറ്റോ നിയമങ്ങളോ ഇല്ലാത്തതുമാണ്. ഘടനയില്ലാത്ത ഡാറ്റയുടെ ഘടനയിൽ കുറവ് നിയന്ത്രണങ്ങൾ ഉള്ളതിനാൽ, പുതിയ വിവരങ്ങൾ ചേർക്കുന്നത് ഘടനയുള്ള ഡാറ്റാസെറ്റിനേക്കാൾ എളുപ്പമാണ്. ഒരു സെൻസർ 2 മിനിറ്റിൽ ഒരു തവണ ബാരോമെട്രിക് പ്രഷർ ഡാറ്റ ശേഖരിക്കുന്നുണ്ടെങ്കിൽ, ഇപ്പോൾ താപനില അളക്കാനും രേഖപ്പെടുത്താനും കഴിയുന്ന അപ്ഡേറ്റ് ലഭിച്ചാൽ, അത് ഘടനയില്ലാത്ത ഡാറ്റ ആണെങ്കിൽ നിലവിലുള്ള ഡാറ്റ മാറ്റേണ്ടതില്ല. എന്നാൽ, ഈ തരത്തിലുള്ള ഡാറ്റ വിശകലനം ചെയ്യുന്നതിന് കൂടുതൽ സമയം എടുക്കാം. ഉദാഹരണത്തിന്, ഒരു ശാസ്ത്രജ്ഞൻ സെൻസർ ഡാറ്റയിൽ നിന്നുള്ള കഴിഞ്ഞ മാസത്തെ ശരാശരി താപനില കണ്ടെത്താൻ ശ്രമിക്കുമ്പോൾ, ചില രേഖപ്പെടുത്തിയ ഡാറ്റയിൽ "e" എന്നത് സെൻസർ തകരാറിലായിരുന്നുവെന്ന് സൂചിപ്പിക്കാൻ ഉപയോഗിച്ചതായി കണ്ടെത്തുന്നു, അതായത് ഡാറ്റ അപൂർണ്ണമാണ്.
അസംസ്കൃത ഡാറ്റ സാധാരണയായി നിരകളിലോ ത്താളുകളിലോ വർഗ്ഗീകരിക്കാനാകാതെ മറ്റു ഫോർമാറ്റുകളോ നിയമങ്ങളോ പാലിക്കുന്നില്ലാതെ വരും. ഘടനയ്ക്ക് കുറവുള്ള നിയന്ത്രണം ഉള്ളതിനാൽ പുതിയ വിവരങ്ങൾ കൂട്ടിച്ചേർക്കാൻ ഇത്രയും എളുപ്പമാണ്, ഘടിത ഡേറ്റാസെറ്റുമായി താരതമ്യപ്പെടുത്തുമ്പോൾ. ഉദാഹരണത്തിന്, 2 മിനിറ്റ് ഇടവേളയിൽ ബാരോമെട്രിക് പ്രെഷർ ഡാറ്റ ശേഖരിക്കുന്ന സെൻസർ, ഇപ്പോൾ താപനില അളക്കുവാനും രേഖപ്പെടുത്തുവാനും അപ്ഡേറ്റ് കിട്ടിയാൽ, അസംസ്കൃത ആയതിനാൽ നിലവിലുള്ള ഡാറ്റ മാറ്റേണ്ടതില്ല. എന്നാൽ, ഇങ്ങനെ ചെയ്താൽ ഈ ഡാറ്റ വിശകലനം ചെയ്യുക വലുതാണ്. ഉദാഹരണമായി, കഴിഞ്ഞ മാസത്തെ ശരാശരി താപനില കണ്ടെത്താൻ ഒരു ശാസ്ത്രജ്ഞൻ ശ്രമിക്കുമ്പോൾ ചില ഡാറ്റയിൽ ഒരു "e" എന്ന് രേഖപ്പെടുത്തിയിട്ടുണ്ട്, ഇത് തകർന്നുവെന്ന് സൂചിപ്പിക്കുന്നത്, മൂല്യങ്ങൾ പൂർണ്ണമല്ല എന്നർത്ഥം.
ഘടനയില്ലാത്ത ഡാറ്റയുടെ ഉദാഹരണങ്ങൾ: ടെക്സ്റ്റ് ഫയലുകൾ, ടെക്സ്റ്റ് സന്ദേശങ്ങൾ, വീഡിയോ ഫയലുകൾ
അസംസ്കൃത ഡാറ്റ ഉദാഹരണങ്ങൾ: ടെക്സ്റ്റ് ഫയലുകൾ, ടെക്സ്റ്റ് സന്ദേശങ്ങൾ, വീഡിയോ ഫയലുകൾ
### അർദ്ധഘടനയുള്ള ഡാറ്റ
### അർദ്ദഘടിത ഡാറ്റ (Semi-structured Data)
അർദ്ധഘടനയുള്ള ഡാറ്റ ഘടനയുള്ളതും ഘടനയില്ലാത്തതുമായ ഡാറ്റയുടെ സംയോജനം പോലെയാണ്. സാധാരണയായി വരികളും കോളങ്ങളുമായുള്ള ഫോർമാറ്റിൽ ഒത്തുപോകുന്നില്ല, പക്ഷേ ഘടനയുള്ളതായും സ്ഥിരമായ ഫോർമാറ്റോ നിയമങ്ങളോ പാലിക്കുന്നതുമായ രീതിയിൽ ക്രമീകരിച്ചിരിക്കുന്നു. ഘടന ഉറവിടങ്ങൾക്കിടയിൽ വ്യത്യാസപ്പെടും, ഉദാഹരണത്തിന് നന്നായി നിർവചിച്ച ഹയർആർക്കി മുതൽ പുതിയ വിവരങ്ങൾ എളുപ്പത്തിൽ സംയോജിപ്പിക്കാൻ അനുവദിക്കുന്ന കൂടുതൽ സൗകര്യമുള്ള ഘടന വരെ. മെറ്റാഡേറ്റ എന്നത് ഡാറ്റ എങ്ങനെ ക്രമീകരിച്ചിരിക്കുന്നു എന്ന് തീരുമാനിക്കാൻ സഹായിക്കുന്ന സൂചകങ്ങളാണ്, ഡാറ്റയുടെ തരം അനുസരിച്ച് വിവിധ പേരുകൾ ഉണ്ടാകും. മെറ്റാഡേറ്റയ്ക്ക് സാധാരണ പേരുകൾ: ടാഗുകൾ, ഘടകങ്ങൾ, ഘടനകൾ, ഗുണങ്ങൾ. ഉദാഹരണത്തിന്, ഒരു സാധാരണ ഇമെയിൽ സന്ദേശത്തിന് വിഷയം, ശരീരം, സ്വീകരിക്കുന്നവരുടെ ഒരു സെറ്റ് ഉണ്ടാകും, അയച്ചത് ആരാണെന്നും എപ്പോൾ ആണെന്നും ക്രമീകരിക്കാവുന്നതാണ്.
അർദ്ദഘടിത ഡാറ്റ ഘടിതവും അസംസ്കൃതവുമായ ഡാറ്റയുടെ ചേരിഞ്ഞ രൂപമാണ്. ഇത് സാധാരണയായി നിരകൾ ടത്തിലെ ഫോർമാറ്റിൽ വന്നിട്ടില്ലെങ്കിലും, ഘടിതമായ രീതിയിൽ ക്രമീകരിച്ചിരിക്കുന്നു, ചിലപ്പോൾ നിശ്ചിത ഫോർമാറ്റ് അല്ലെങ്കിൽ നിയമങ്ങൾ പാലിക്കാം. ഘടിതത്വം ഉറവിടങ്ങളിൽ വ്യത്യാസപ്പെടും, ഉദാഹരണത്തിന്, നല്ല രീതിയിൽ നിർമ്മിച്ച പടിവാതിൽ മുതൽ കൂടുതൽ സൗകര്യപ്രദമായ പുതിയ വിവരങ്ങൾ എളുപ്പത്തിൽ ഉൾപ്പെടുത്താനുള്ളത് വരെ. മെറ്റാഡേറ്റ അപ സ്ഥിതീകരണ നിർണായകമാണ്, ഇത് ഡാറ്റ എങ്ങനെ ക്രമീകരിച്ചും സംഭരിച്ചു എന്ന് നിർണ്ണയിക്കുന്നത്, മെറ്റാഡേറ്റയുടെ പേരുകൾ ഡാറ്റയുടെ തരം അനുസരിച്ച് മാറ്റമാകും. സാധാരണ പേരുകൾ ടാഗുകൾ, ഘടകങ്ങൾ, എന്റിറ്റികൾ, ആട്രിബ്യൂട്ടുകൾ എന്നിവയാണ്. ഉദാഹരണത്തിന്, ഒരു സാധാരണ ഇ-മെയിൽ സന്ദേശത്തിന് വിഷയം, ഉള്ളടക്കം, സ്വീകരിക്കുന്നവരുടെ പട്ടിക, അയച്ചത് ആർ ആണെന്നും അയച്ച സമയവും അടങ്ങാം.
അർദ്ധഘടനയുള്ള ഡാറ്റയുടെ ഉദാഹരണങ്ങൾ: HTML, CSV ഫയലുകൾ, ജാവാസ്ക്രിപ്റ്റ് ഒബ്ജക്റ്റ് നോട്ടേഷൻ (JSON)
അർദ്ദഘടിത ഡാറ്റ ഉദാഹരണങ്ങൾ: HTML, CSV ഫയൽകൾ, ജാവാസ്ക്രിപ്റ്റ് ഒബ്ജക്റ്റ് നോട്ടേഷൻ (JSON)
## ഡാറ്റയുടെ ഉറവിടങ്ങൾ
## ഡാറ്റ ഉറവിടങ്ങൾ
ഡാറ്റ ഉറവിടം എന്നത് ഡാറ്റ എവിടെ സൃഷ്ടിക്കപ്പെട്ടുവോ "വസിക്കുന്നിടമോ" ആ പ്രാഥമിക സ്ഥലം ആണ്, ഇത് എങ്ങനെ എപ്പോൾ ശേഖരിച്ചതിന്റെ അടിസ്ഥാനത്തിൽ വ്യത്യാസപ്പെടും. ഉപയോക്താക്കൾ സൃഷ്ടിച്ച ഡാറ്റ പ്രാഥമിക ഡാറ്റയായി അറിയപ്പെടുന്നു, പൊതുവായ ഉപയോഗത്തിനായി ശേഖരിച്ച ഡാറ്റ രണ്ടാമത്തെ ഡാറ്റയാണ്. ഉദാഹരണത്തിന്, ഒരു ഗ്രൂപ്പ് ശാസ്ത്രജ്ഞർ ഒരു മഴക്കാടിൽ നിരീക്ഷണങ്ങൾ ശേഖരിക്കുന്നത് പ്രാഥമികമായി കണക്കാക്കപ്പെടും, അവർ അത് മറ്റ് ശാസ്ത്രജ്ഞരുമായി പങ്കുവെക്കാൻ തീരുമാനിച്ചാൽ അത് ഉപയോഗിക്കുന്നവർക്കു രണ്ടാമത്തെ ഡാറ്റയായി കണക്കാക്കപ്പെടും.
ഒരു ഡാറ്റ ഉറവിടം ഡാറ്റ സൃഷ്ടിച്ച പ്രാരംഭ സ്ഥലം അല്ലെങ്കിൽ അത് "സ്ഥിരം" ഉണ്ട് എന്നു പറയുന്ന സ്ഥലം ആണു, ശേഖരിച്ച സമയത്തും സാഹചര്യവും അനുസരിച്ച് വ്യത്യാസപ്പെടും. ഉപയോക്താക്കളാൽ സൃഷ്ടിച്ച ഡാറ്റ പ്രാഥമിക ഡാറ്റ ആയി അറിയപ്പെടും, എന്നാൽ പൊതുവായി ഉപയോഗത്തിനായി ശേഖരിച്ച ഇൻഫർമേഷൻ രണ്ടാമത്തെ ഡാറ്റ ആണു. ഉദാഹരണമായി, ഒരു വനംവീട് ശാസ്ത്രജ്ഞരുടെ കൂട്ടം നിരീക്ഷണങ്ങൾ ശേഖരിച്ചാൽ അവർ പ്രാഥമിക ഡാറ്റ സൃഷ്ടിക്കുന്നു, അത് മറ്റുള്ള ശാസ്ത്രജ്ഞരുമായി പങ്കുവെക്കുകയാണെങ്കിൽ, അവരെ രണ്ടാമത്തെ ഉപഭോക്താക്കൾ ആകും.
ഡാറ്റാബേസുകൾ സാധാരണ ഉറവിടമാണ്, ഡാറ്റാബേസ് മാനേജ്മെന്റ് സിസ്റ്റം ഡാറ്റ ഹോസ്റ്റ് ചെയ്യാനും പരിപാലിക്കാനും ഉപയോഗിക്കുന്നു, ഉപയോക്താക്കൾ ക്വെറിയുകൾ എന്ന കമാൻഡുകൾ ഉപയോഗിച്ച് ഡാറ്റ പരിശോധിക്കുന്നു. ഫയലുകൾ ഡാറ്റ ഉറവിടങ്ങളായി ഓഡിയോ, ഇമേജ്, വീഡിയോ ഫയലുകൾ കൂടാതെ എക്സൽ പോലുള്ള സ്പ്രെഡ്ഷീറ്റുകളും ആകാം. ഇന്റർനെറ്റ് ഉറവിടങ്ങൾ ഡാറ്റ ഹോസ്റ്റ് ചെയ്യാനുള്ള സാധാരണ സ്ഥലമാണ്, ഡാറ്റാബേസുകളും ഫയലുകളും അവിടെ കാണാം. ആപ്ലിക്കേഷൻ പ്രോഗ്രാമിംഗ് ഇന്റർഫേസുകൾ (APIs) പ്രോഗ്രാമർമാർക്ക് ഡാറ്റ ഇന്റർനെറ്റിലൂടെ ബാഹ്യ ഉപയോക്താക്കളുമായി പങ്കുവെക്കാനുള്ള മാർഗങ്ങൾ സൃഷ്ടിക്കാൻ അനുവദിക്കുന്നു, വെബ് സ്ക്രാപ്പിംഗ് എന്ന പ്രക്രിയ വെബ് പേജിൽ നിന്നുള്ള ഡാറ്റ എടുക്കുന്നു. [ഡാറ്റയുമായി പ്രവർത്തിക്കൽ](../../../../../../../../../2-Working-With-Data) പാഠങ്ങൾ വിവിധ ഡാറ്റ ഉറവിടങ്ങൾ എങ്ങനെ ഉപയോഗിക്കാമെന്ന് ശ്രദ്ധിക്കുന്നു.
ഡാറ്റാബേസുകൾ ഒരു സാധാരണ ഉറവിടമാണെങ്കിലും, ഡാറ്റാബേസ് മാനേജ്മെന്റ് സിസ്റ്റം ഉപയോക്താക്കൾക്ക് ഡാറ്റ അന്വേഷിക്കുവാൻ ക്വെറിയുകൾ ഉപയോഗിക്കുന്നു. ഫയലുകൾക്ക് ഓഡിയോ, ചിത്രം, വീഡിയോ ഫയലുകൾ ഉണ്ടാകാം, കൂടാതെ എക്സെൽ പോലുള്ള സ്പ്രഡ്ഷീറ്റുകളും. ഇന്റർനെറ്റ് ഉറവിടങ്ങൾ ഡാറ്റ കൈകാര്യം ചെയ്യുന്നതിന് പൊതുവെ കാണപ്പെടുന്നു, ഡാറ്റാബേസുകളും ഫയലുകളും ഇവിടെ ഉണ്ടാകാം. ആപ്ലിക്കേഷൻ പ്രോഗ്രാമിംഗ് ഇന്റർഫേസുകൾ (APIകൾ) പ്രോഗ്രാമർമാർക്ക് ഡാറ്റ മറ്റ് ഉപയോക്താക്കൾക്ക് പങ്കുവെക്കാനുള്ള മാർഗങ്ങൾ സൃഷ്ടിക്കാൻ സഹായിക്കുന്നു, വെബ് സ്ക്രാപിംഗ് എന്ന പ്രക്രിയ വെബ് പേജിൽ നിന്നുള്ള ഡാറ്റപിടിക്കുന്നത് ആണ്. [Working with Data](../../../../../../../../../2-Working-With-Data) പാഠഘടകങ്ങൾ വിവിധ ഡാറ്റ ഉറവിടങ്ങൾ ഉപയോഗിക്കുന്ന രീതിയിൽ കേന്ദ്രീകരിക്കുന്നു.
## സമാപനം
## പര്യവസംഹാരം
ഈ പാഠത്തിൽ നാം പഠിച്ചത്:
ഈ പാഠത്തിൽ നാം പഠിച്ചത്:
- ഡാറ്റ എന്താണെന്ന്
- ഡാറ്റ എന്താണെന്ന്
- ഡാറ്റ എങ്ങനെ വിവരണമാണ്
- ഡാറ്റ എങ്ങനെ വിവരണമെടുക്കുന്നു
- ഡാറ്റ എങ്ങനെ വർഗ്ഗീകരിക്കപ്പെടുന്നു
- ഡാറ്റ എങ്ങനെ വൻഗ്ഗീകരിക്കുകയും കാറ്റഗറൈസ് ചെയ്യുകയും ചെയ്യുന്നു
- ഡാറ്റ എവിടെ കണ്ടെത്താം
- ഡാറ്റ എവിടെയാണ് കണ്ടെത്താൻ കഴിയുക
## 🚀 ചലഞ്ച്
## 🚀 ചലഞ്ച്
കാഗിൾ തുറന്ന ഡാറ്റാസെറ്റുകളുടെ മികച്ച ഉറവിടമാണ്. [ഡാറ്റാസെറ്റ് തിരയൽ ഉപകരണം](https://www.kaggle.com/datasets) ഉപയോഗിച്ച് ചില രസകരമായ ഡാറ്റാസെറ്റുകൾ കണ്ടെത്തി ഈ മാനദണ്ഡങ്ങൾ ഉപയോഗിച്ച് 3-5 ഡാറ്റാസെറ്റുകൾ വർഗ്ഗീകരിക്കുക:
കാഗിൾ ഒരു മികച്ച തുറന്ന് ഡാറ്റാസെറ്റ് ഉറവിടമാണ്. [dataset search tool](https://www.kaggle.com/datasets) ഉപയോഗിച്ച് ചില രസകരമായ ഡാറ്റാസെറ്റുകൾ കണ്ടെത്തി അവ 3-5 ഡാറ്റാസെറ്റുകൾ താഴെ പറയുന്ന ക്രൈറ്റീരിയ അനുസരിച്ച് കാറ്റഗറൈസ് ചെയ്യുക:
- ഡാറ്റ അളവുകൂട്ടിയതാണോ ഗുണപരമായതാണോ?
- ഡാറ്റ സംഖ്യാത്മകമാണോ ഗുണാത്മകമാണോ?
- ഡാറ്റ ഘടനയുള്ളതാണോ, ഘടനയില്ലാത്തതാണോ, അർദ്ധഘടനയുള്ളതാണോ?
- [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) എന്ന മൈക്രോസോഫ്റ്റ് ലേൺ യൂണിറ്റ് ഘടനയുള്ള, അർദ്ധഘടനയുള്ള, ഘടനയില്ലാത്ത ഡാറ്റയുടെ വിശദമായ വിഭജനം നൽകുന്നു.
- ഈ മൈക്രോസോഫ്റ്റ് ലേൺ യൂണിറ്റ്, [ഡാറ്റ ഫോർമാറ്റുകൾ തിരിച്ചറിയൽ](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) പേരിൽ, ഘടിത, അർദ്ദഘടിത, അസംസ്കൃത ഡാറ്റയുടെ വിശദമായ വിശകലനമാണ് ലഭിക്കുന്നത്.
## അസൈൻമെന്റ്
## അസൈൻമെന്റ്
[Classifying Datasets](assignment.md)
[ഡാറ്റാസെറ്റുകൾ കാറ്റഗറൈസ് ചെയ്യൽ](assignment.md)
---
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**അസൂയാ**:
**അറിയിപ്പ്**:
ഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖയാണ് പ്രാമാണികമായ ഉറവിടം എന്ന് പരിഗണിക്കേണ്ടതാണ്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല.
ഈ രേഖ AI പരിഭാഷാ സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.
"ഈ നോട്ട്ബുക്കില്, നാം മുമ്പ് ചര്ച്ച ചെയ്ത ചില ആശയങ്ങളുമായി കളിക്കും. സാധ്യതയും സ്ഥിതിവിവരശാസ്ത്രവും സംബന്ധിച്ച പല ആശയങ്ങളും പൈത്തണിലെ ഡാറ്റ പ്രോസസ്സിംഗിന് ഉപയോഗിക്കുന്ന പ്രധാന ലൈബ്രററികളായ `numpy`നും `pandas`നും ഉൾപ്പെടെ നല്ല രീതിയിൽ പ്രതിനിധാനം ചെയ്യപ്പെടുന്നുണ്ട്.\n"
"ഈ നോട്ട്ബുക്കിൽ, നാം നേരത്തെ ചർച്ച ചെയ്ത ചില ആശയങ്ങളുമായി കളിച്ചുപോകും. സാധ്യതയും സ്ഥിതിവിവരശാസ്ത്രവും സംബന്ധിച്ച പല ആശയങ്ങളും പൈത്തണിലെ പ്രധാന ഡാറ്റ പ്രോസസ്സിംഗ് ലൈബ്രറിസായ `numpy` ഉം `pandas` ഉം എന്നിവയിൽ മികച്ച രീതിയിൽ പ്രതിനിധീകരിക്കപ്പെട്ടിരിക്കുന്നു.\n"
]
]
},
},
{
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## എങ്കിലും വ്യത്യാസങ്ങളും വിതരണങ്ങളും\n",
"## റാൻഡം വെരിയബിളുകളും വിതരണങ്ങളും\n",
"0 മുതൽ 9 വരെ യൂണിഫോം ഡിസ്ട്രിബ്യൂഷനിൽ നിന്ന് 30 മൂല്യങ്ങളുടെ ഒരു സാമ്പിൾ വരച്ച് തുടങ്ങാം. ശരാശരി കൂടാതെ വ്യതിയാനവും ഞങ്ങൾ കണക്കാക്കി കാണിക്കും.\n"
"0 മുതൽ 9 വരെയുള്ള യൂണിഫോം വിതരണത്തിൽ നിന്ന് 30 മൂല്യങ്ങളുടെ ഒരു സാമ്പിൾ എളുപ്പത്തിൽ എടുക്കാം. കൂടാതെ ശരാശരിയും വ്യത്യാസവും കണക്കാക്കാം.\n"
]
]
},
},
{
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"സാമ്പിളിൽ എത്ര വ്യത്യസ്ത മൂല്യങ്ങൾ ഉണ്ടെന്ന് ദൃശ്യമായി അളക്കാൻ, നാം **ഹിസ്റ്റോഗ്രാം** പ്ലോട്ട് ചെയ്യാം:\n"
"സാമ്പിളിൽ എത്ര വ്യത്യസ്ത മൂല്യങ്ങൾ ഉണ്ടെന്ന് ദൃശ്യമായി കണക്കാക്കാൻ, നാം **ഹിസ്റ്റോഗ്രാം** ചിത്രീകരിക്കാം:\n"
]
]
},
},
{
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## യഥാര്ഥ ഡാറ്റ വിശകലനം ചെയ്യൽ\n",
"## യഥാർഥ ഡാറ്റ വിശകലനം ചെയ്യൽ\n",
"\n",
"\n",
"സത്യസന്ധ ലോക ഡാറ്റ വിശകലനം ചെയ്യുമ്പോൾ ശരാശരി(Mean)യും വ്യത്യാസവും(variance) വളരെ പ്രധാനമാണ്. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) ൽ നിന്ന് ബേസ്ബോൾ കളിക്കാർക്കുറിച്ചുള്ള ഡാറ്റ ലോഡ് ചെയ്യാം.\n"
"യഥാർത്ഥ ലോക ഡാറ്റ വിശകലനം ചെയ്യുമ്പോൾ ശരാശരി (Mean) വീതം (variance) വളരെ പ്രധാനമാണ്. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) മുതൽ ബേസ്ബോൾ കളിക്കാരുടെ ഡാറ്റ ലോഡ് ചെയ്യാം\n"
]
]
},
},
{
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> ഡേറ്റാ അനാലിസിസിനായി ഇവിടെ [**Pandas**](https://pandas.pydata.org/) എന്ന പാക്കേജ് നമ്മൾ ഉപയോഗിക്കുന്നുണ്ട്. Pandas-ഉം Python-ലൂടെ ഡാറ്റ കൈകാര്യം ചെയ്യലും ഈ കോഴ്സിൽ പിന്നീട് കൂടുതൽ സംസാരിക്കും.\n",
"> ഡാറ്റ വിശകലനത്തിനായി നാം ഇവിടെ [**Pandas**](https://pandas.pydata.org/) എന്ന പാക്കേജ് 사용ചെയ്യുന്നു. Pandas സമ്പർക്കിച്ച് Python-ൽ ഡാറ്റ കൈകാര്യം ചെയ്യലിനെക്കുറിച്ച് ഈ കോഴ്സ് പിന്നീട് കൂടുതലായി സംസാരിക്കാം.\n",
"\n",
"\n",
"വയസിന്, എత్తി, ഭാരം എന്നിവയുടെ ശരാശരി മൂല്യങ്ങൾ കണക്കാക്കാം:\n"
"വയസു, ഉയരം, ഭാരത്തിന്റെ ശരാശരി മൂല്യങ്ങൾ കണക്കാക്കാം:\n"
]
]
},
},
{
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഇപ്പോൾ നമുക്ക്高度യ് (ഉയരം) ശ്രദ്ധ നിക്ഷേപിച്ച്, സ്റ്റാൻഡേർഡ് ഡിവിയേഷൻ (സാധാരണ വ്യതിയാനം)യും വ്യതിക്രമവും (വേറിയൻസ്) കണക്കാക്കാം:\n"
"ഇപ്പോൾ ഔരംമാനത്തെക്കുറിച്ച് ശ്രദ്ധ കേന്ദ്രീകരിച്ച് സ്റ്റാൻഡേർഡ് ഡിവിയേഷൻ, വേറിൻസുകൾ കണക്കാക്കാം: \n"
]
]
},
},
{
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"സാധారణ മൂല്യത്തിനൊപ്പം, നടുക്കമൂല്യം (median value) ആയും ക്വാർട്ടൈലുകളും (quartiles) ആയും നോക്കുന്നത് ന്യായമായിരിക്കും. അവയെ **ബോക്സ് പ്ലോട്ട്** ഉപയോഗിച്ച് ദൃശ്യവൽക്കരിക്കാം:\n"
"ശരാശരിയോടൊപ്പം, നടുക്കുമൂല്യവും ക്വാർടൈലുകളും നോക്കുന്നത് ഉചിതമാണ്. അവയെ **ബോക്സ് പ്ലോട്ട്** ഉപയോഗിച്ച് ദൃശ്യവൽക്കരിക്കാം:\n"
"നമുക്കു് നമ്മുടെ ഡേറ്റാസെറ്റിന്റെ ഉപസമൂഹങ്ങളുടെ ബോക്സ് പ്ലോട്ടുകളും ഉണ്ടാക്കാനാകും, ഉദാഹരണത്തിന്, കളിക്കാരന്റെ റോളു് അടിസ്ഥാനമാക്കി ഗ്രൂപ്പുചെയ്ത്.\n"
"നമുക്ക് നമ്മുടെ ഡാറ്റാസറ്റിന്റെ ഉപസമിതികളുടെ ബോക്സ് പ്ലോട്ടുകളും തയ്യാറാക്കാം, ഉദാഹരണത്തിന്, കളിക്കാരുടെ റോളുകൾ പ്രകാരം ഗ്രൂപ്പ് ചെയ്തിട്ടുള്ളവ. \n"
]
]
},
},
{
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> **കുറിപ്പ്**: ഈ രേഖാചിത്രം, സാധാരണയായി, ഫസ്റ്റ് ബേസ്മാനുകളുടെ ഉയരം സെക്കന്റ് ബേസ്മാനുകളുടെ ഉയരത്തേക്കാൾ കൂടുതലാണെന്ന് സൂചിപ്പിക്കുന്നു. പിന്നീട് നാം ഈ ഹിപothesisസിസ് കൂടുതൽ ഔപചാരികമായി പരീക്ഷിക്കുന്നതും, നമ്മുടെ ഡാറ്റ ഗണിതപരമായി പ്രാധാന്യമുള്ളതാണ് എന്ന് തെളിയിക്കുന്നതിനും പഠിക്കും. \n",
"> **കുറിപ്പു**: ഈ ഡയഗ്രാം സൂചിപ്പിക്കുന്നത്, ശരാശരിയിൽ, ഫസ്റ്റ് ബേസ്മനുകളുടെ ഉയരം സെക്കൻഡ് ബേസ്മനുകളുടെ ഉയരത്തിൽ നിന്ന് കൂടുതലാണെന്നാണ്. പിന്നീട് നാം ഈ അനുഭവസങ്കല്പം കൂടുതല് ഔപചാരികമായി പരീക്ഷിക്കാന് എന്താണ് ചെയ്യേണ്ടത്, കൂടാതെ ഞങ്ങളുടെ ഡാറ്റistatistical പോലെ പ്രസക്തമാണെന്ന് എങ്ങനെ തെളിയിക്കാമെന്നു പഠിക്കും. \n",
"\n",
"\n",
"പ്രായം, ഉയരം, ഭാരം എന്നിവ എല്ലാവും നിരന്തരമായ യാദൃച്ഛിക വ്യത്യാസങ്ങൾ ആണ്. ഇവയുടെ വിതരണമെന്ന് നിങ്ങൾ കരുതുന്നത് എന്താണ്? ഫലങ്ങൾ കണ്ടെത്താനുള്ള നല്ല മാർഗ്ഗം എളുപ്പത്തിൽ മൂല്യങ്ങളുടെ ഹിസ്റ്റോഗ്രാം വരക്കുക ആണ്:\n"
"പ്രായം, ഉയരം, ഭാരങ്ങൾ എല്ലാം നിരന്തരം അവയവമായ വ്യത്യാസങ്ങളാണ്. അവരുടെ വിതരണം എന്തായിരിക്കും എന്ന് നിങ്ങൾക്കു തോന്നുന്നുണ്ടോ? മൂല്യങ്ങളുടെ ഹിസ്റ്റോഗ്രാം വരയ്ക്കുക എന്നത് അറിയാനുള്ള നല്ല മാർഗമാണ്: \n"
]
]
},
},
{
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## സാധാരണ വിതരണം\n",
"## സാധാരണ വിതരണവും\n",
"\n",
"\n",
"നമ്മുടെ യഥാർത്ഥ ഡാറ്റയുമായി തുല്യമായ ശരാശരി და വ്യത്യാസം ഉള്ള സാധാരണ വിതരണം പിന്തുടരുന്ന കൊണ്ടുപോകുക وزن സമ്പിൾ ഉണ്ടാക്കാം:\n"
"നാം നമ്മുടെ യഥാർത്ഥ ഡേറ്റയുമായുള്ള സമാനമായ ശരാശരി മൂല്യവും വേരിയന്സും ഉള്ള ഒരു സാധാരണ വിതരണമുള്ള കൃത്രിമ പരീക്ഷണമുളള ഭാരം സൃഷ്ടിക്കാം:\n"
]
]
},
},
{
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"രീയിലൊകത്തിൽ ഭൂരിഭാഗം മൂല്യങ്ങളും സാധാരണ വിന്യസ്തത്തിലാണ് ഉള്ളത്, അതുകൊണ്ട് നമുക്ക് സാമ്പിൾ ഡേറ്റ ജനനത്തിന് യുണിഫോം റാന്ഡം നമ്പർ ജനറേറ്റർ ഉപയോഗിക്കരുത്. യുണിഫോം ഡിസ്ട്രിബ്യൂഷൻ ഉപയോഗിച്ച് ( `np.random.rand` ഉപയോഗിച്ച്) ഭാരം സൃഷ്ടിക്കാൻ ശ്രമിക്കുന്നത് എങ്ങനെ ഉണ്ടാകുന്നതാണെന്ന് കാണുക:\n"
"യാഥാർത്ഥ്യത്തിൽ അധികം മൂല്യങ്ങൾ സാധാരണ വിതരണത്തിലാണ് జరిగുന്നത്, അതിനാൽ സാമ്പിൾ ഡാറ്റ ഉണ്ടാക്കാൻ ഒന്നാംവിധത്തിൽ യുണിഫോം റാൻഡം നമ്പർ ജനറേറ്റർ ഉപയോഗിക്കരുത്. `np.random.rand` ഉപയോഗിച്ച് യുണിഫോം വിതരണത്തോടെ ഭാരം ഉണ്ടാക്കാൻ ശ്രമിക്കുമ്പഴുണ്ടാകുന്നന്ന് ഇതാ:\n"
]
]
},
},
{
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## വിശ്വാസമർജ്ജനാന്തരങ്ങൾ\n",
"## ആത്മവിശ്വാസ ഇടവേളകൾ\n",
"\n",
"\n",
"ഇപ്പോഴോപ്പBaseball കളിക്കാരുടെ ഭാരവും ഉയരവും സംബന്ധിച്ച വിശ്വാസമർജ്ജനാന്തരങ്ങൾ കണക്കാക്കാം. നാം ഈ കോഡ് [ഈ stackoverflow ചർച്ചയിൽ നിന്നും](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) ഉപയോഗിക്കും:\n"
"ഇനി നാം ബേസ്ബോൾ കളിക്കാർගේ ഭാരത്തിലും ഉയരത്തിലും ആത്മവിശ്വാസ ഇടവേളകൾ കണക്കാക്കാം. നാം ഈ കോഡ് ഉപയോഗിക്കും [from this stackoverflow discussion](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
]
},
},
{
{
@ -272,7 +272,7 @@
" return m, h\n",
" return m, h\n",
"\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
]
},
},
@ -280,9 +280,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ഹിപോത്ത്സിസ് ടെസ്റ്റിംഗ്\n",
"## ഹിപ്പ്ഥെസിസ് ടെസ്റ്റിംഗ്\n",
"\n",
"\n",
"നമ്മുടെ ബേസ്ബോൾ പ്ലേയേഴ്സ് ഡാറ്റാസെറ്റിലെ വ്യത്യസ്ത പങ്കുകളിൽ നമുക്ക് പരിശോധിക്കാം:\n"
"നമുക്ക് നമ്മുടെ ബേസ്ബോൾ താരങ്ങൾ ഡാറ്റാ സെറ്റിൽ വിവിധ പങ്ക് വഹിക്കുന്നവരെ പരിശോധിക്കാം:\n"
]
]
},
},
{
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"നമുക്കുittest ചെയ്യാം പരികൽപ്പനയെന്ന് ആദ്യ ബേസ്മാന്മാർ രണ്ടാം ബേസ്മാന്മാരേക്കാളും ഉയരം കൂടിയവരാണ്. ഇതു് ചെയ്യാനുള്ള ഏറ്റവും ലളിതമായ മാർഗം വിശ്വാസ അന്തരങ്ങൾ പരിശോധിക്കുക എന്നതാണ്:\n"
"ഫസ്റ്റ് ബേസ്മെൻ സെക്കൻഡ് ബേസ്മെനിൽ നിന്ന് ഉയരം കൂടുതലാണെന്ന് ഉള്ള ഉദ്ദേശ്യത്തെ നാം പരീക്ഷിക്കാം. ഇത് കാര്യക্ৰমം പരീക്ഷിക്കാനുള്ള ഏറ്റവും ലളിതമായ മാർഗമാണ് വിശ്വാസ അന്തരീക്ഷങ്ങൾ പരിശോധിക്കുക:\n"
]
]
},
},
{
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"നാം ഇടവേളകൾ ഒത്തുചേരുന്നില്ല എന്ന് കാണാമാകുന്നു.\n",
"ഇടവേളകൾ പരസ്പരം മുഴുങ്ങുന്നില്ലെന്ന് നാം കാണാൻ കഴിയും.\n",
"\n",
"\n",
"ഒരു സ്ഥിതിചಾಮകമായി കൂടുതല് ശരിയായ രീതിയിൽ ഗവേഷണ നിർദ്ദേശത്തെ തെളിയിക്കാൻ **സ്റ്റുഡന്റ് t-ടെസ്റ്റ്** ഉപയോഗിക്കാവുന്നതാണ്:\n"
"തിയറിയെ തെളിയിക്കാൻ കണക്കിലെടുക്കേണ്ടതിലുള്ള കൂടുതൽ ശരിയായ ഒരു രീതിയാണ് **സ്റ്റുഡന്റ് t-ടെസ്റ്റ്** ഉപയോഗിക്കുക:\n"
]
]
},
},
{
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"`ttest_ind` ഫംഗ്ഷൻ վերադարձിക്കുന്ന രണ്ട് മൂല്യങ്ങൾ ഇവയാണ്:\n",
"`ttest_ind` ഫംഗ്ഷനിലൂടെ മടങ്ങിവരുന്ന രണ്ട് മൂല്യങ്ങൾ:\n",
"* p-മൂല്യം എന്നാൽ രണ്ട് വിതരണങ്ങൾക്ക് സമാനമായ ശരാശരി ഉള്ളതിനുള്ള സാധ്യതയായി നമുക്ക് കാണാം. നമ്മുടെ കേസിൽ, ഇത് വളരെ കുറഞ്ഞതാണ്, അതായത് ആദ്യ ബേസ്മാന്മാർ ഉയരം കൂടുതൽ ഉള്ളതായി ശക്തമായ തെളിവുകളുണ്ട്.\n",
"* p-വാല്യു രണ്ട് വിതരണമങ്ങളുടെയും ശരാശരി ഒരുപോലെയെന്നാണ് കാണിക്കുന്ന സാദ്ധ്യതയായി പരിഗണിക്കാം. നമ്മുടെ കേസിൽ, ഇത് വളരെ താഴ്ന്നതാണ്, അതായത് ആദ്യ baseman-ുകൾക്ക് ഉയരമുള്ളവരാണ് എന്ന് ശക്തമായ തെളിവുകൾ ഉണ്ടായെന്നു സൂചിപ്പിക്കുന്നു.\n",
"* t-മൂല്യം t-ടെസ്റ്റിൽ ഉപയോഗിക്കുന്ന സാധാരണപ്പെടുത്തിയ ശരാശരി വ്യത്യാസത്തിന്റെ ഇടത്തിലുള്ള മൂല്യമാണ്, ഇത് നൽകിയ ആത്മവിശ്വാസ മൂല്യത്തിനായി ഒരു പരിധി മൂല്യത്തോടൊപ്പം താരതമ്യം ചെയ്യപ്പെടുന്നു.\n"
"* t-വാല്യു എന്നു പറഞ്ഞാൽ t-ടെസ്റ്റിൽ ഉപയോഗിക്കുന്ന സാധാരണപ്പെടുത്തിയ ശരാശരി വ്യത്യാസത്തിന്റെ ഇടത്തരം മൂല്യമാണ്, ഇത് നിശ്ചിത വിശ്വാസ മൂല്യത്തിനുള്ള ത്രെഷോൾഡ് മൂല്യവുമായി താരതമ്യം ചെയ്യപ്പെടുന്നു.\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## സെൻട്രൽ ലിമിറ്റ് തിയോറം ഉപയോഗിച്ച് ഒരു നോർമൽ വിതരണത്തെ അനുകരിക്കൽ\n",
"## സെൻട്രൽ ലിമിറ്റ് തെറിയം ഉപയോഗിച്ച് ഒരു നോർമൽ വിതരണം സിമുലേറ്റ് ചെയ്യുക\n",
"\n",
"\n",
"Python-ലെ സൂഡോ-രാൻഡം ജനറേറ്റർ നമ്മുക്ക് യൂണിഫോം വിതരണം നൽകാൻ രൂപകൽപ്പന ചെയ്തിരിക്കുന്നു. നോർമൽ വിതരണം സൃഷ്ടിക്കാൻ ഒരു ജനറേറ്റർ ആവശ്യമെങ്കിൽ, സെൻട്രൽ ലിമിറ്റ് തിയോറം ഉപയോഗിക്കാം. ഒരു നോർമലായി വിതരണമുള്ള മൂല്യം നേടാനായി, യൂണിഫോം-ജനിത സാമ്പിളിന്റെ ശരാശരി നിർണയിക്കുമ്പോൾ മതി.\n"
"Pythonല് ഉള്ള pseudo-random ജനറേറ്റർ ഞങ്ങൾക്ക് ഒരേസമയം समानമായ (uniform) വിതരണം നൽകാൻ മാത്രമേ രൂപകൽപ്പന ചെയ്തിട്ടുള്ളൂ. നാം ഒരു നോർമൽ വിതരണത്തിന് ജനറേറ്റർ സൃഷ്ടിക്കാൻ ആഗ്രഹിക്കുന്നുവെങ്കിൽ, സെൻട്രൽ ലിമിറ്റ് തെറിയം ഉപയോഗിക്കാം. ഒരു നോർമലായി വിതരണമുള്ള മൂല്യമാണ് നേടേണ്ടത് എങ്കിൽ നാം uniform-ജനിത പോമായ ഒരു സാമ്പിളിന്റെ ശരാശരി കണക്കുകൂട്ടും.\n"
]
]
},
},
{
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## സമ്പർക്കം (Correlation)യും ഈവിള് ബേസ്ബോൾ കോർപ്പറേഷനും\n",
"## സഹബന്ധവും ദുര്ധടക ബേസ്ബോൾ കോർപ്പറേഷനും\n",
"\n",
"\n",
"സമ്പർക്കം (Correlation) നമ്മുടെ സഹായത്തിന് ഡാറ്റാ സീക്വൻസുകളിലെ ബന്ധങ്ങൾ കണ്ടെത്താനാകും. നമ്മുടെ കളിപ്പാട്ട ഉദാഹരണത്തിൽ, കളിക്കാരുടെ ഉയരത്തിന്റെ അടിസ്ഥാനത്തിൽ പണം ലഭിക്കുന്ന ഒരു ഈവിള് ബേസ്ബോൾ കോർപ്പറേഷൻ ഉണ്ട് എന്ന് ഭാവിപ്പിക്കാം - കളിക്കാരൻ ഉയരമേൽവിട്ട പാർശ്വം കൂടുതൽ പണം ലഭിക്കും. അടിസ്ഥാന ശമ്പളം $1000 ആണെന്ന് കരുതുക, കൂടാതെ ഉയരത്തിന്റെ അടിസ്ഥാനത്തിൽ $0 മുതൽ $100 വരെ അധിക ബോണസ് ലഭിക്കുന്നു. നാം MLB യിലുള്ള യഥാർത്ഥ കളിക്കാരെ എടുത്ത് അവരുടെ പ്രതിഭാസ ശമ്പളങ്ങൾ കണക്കുകൂട്ടും:\n"
"സഹബന്ധം (Correlation) ഡാറ്റാ ക്രമങ്ങളുടെ തമ്മിലുള്ള ബന്ധങ്ങൾ കണ്ടെത്താൻ സഹായിക്കുന്നു. നമ്മുടെ കളിപ്പാട്ട ഉദാഹരണത്തിൽ, ഒരു ദുര്ധടക ബേസ്ബോൾ കോർപ്പറേഷൻ ഉണ്ട് എന്നു നമുക്ക് കരുതാം, അത് കളിക്കാർക്ക് അവരുടെ ഉയരത്തിന് അനുസൃതമായി പ്രതിഫലം നൽകുന്നു - കളിക്കാരി എത്ര ഉയരം കൂടിയവനാണെങ്കിൽ, അദ്ദേഹത്തിന് ലഭിക്കുന്ന പണം അത്രമേൽ കൂടും. അടിസ്ഥാന ശമ്പളം $1000 ആണ് എന്നു കരുതുക, കൂടാതെ ഉയരത്തിനെ ആശ്രയിച്ചുള്ള $0 മുതൽ $100 വരെ ബോണസും ഉണ്ട്. നമ്മൾ MLB-യിലെ യഥാർത്ഥ കളിക്കാരെ എടുത്ത് അവരുടെ kugira ആയ ശമ്പളങ്ങൾ കണക്കാക്കാം:\n"
"ഇപ്പോൾ ആ സീക്വൻസുകളുടെ കോവേറിയൻസ് և കോറിയലേഷൻ കണക്കാക്കാം. `np.cov` നമുക്ക്所谓的 **കോവേറിയൻസ് മാട്രിക്സ്** നൽകും, ഇത് കോവേറിയൻസിന്റെ ബഹുമുഖങ്ങളിലേക്ക് വിപുലീകരണമാണു. കോവേറിയൻസ് മാട്രിക്സിലുള്ള $M_{ij}$ ഘടകം ഇൻപുട്ട് വേരിയബിളുകളായ $X_i$ և $X_j$ തമ്മിലുള്ള കോറിയലേഷനാണ്, և ഹൈഫലം ആയും $M_{ii}$ ആണു $X_{i}$-ന്റെ വൈരിയൻസ്സ്. അതുപോലെ, `np.corrcoef` നമ്മുക്ക് **കോറിയലേഷൻ മാട്രിക്സ്** നൽകും.\n"
"നമുക്ക് ഇപ്പോൾ ആ ക്രമങ്ങളുടെ സഹവ്യത്യാസവും സഹസംബന്ധവും കണക്കാക്കാം. `np.cov` നമുക്ക്所谓的 **സഹവ്യത്യാസ മാട്രിക്സ്** നൽകും, ഇത് ഒന്നിലധികം ചാരങ്ങളിലേക്കുള്ള സഹവ്യത്യാസത്തിന്റെ വിപുലീകരണമാണ്. സഹവ്യത്യാസ മാട്രിക്സ് $M$ യുടെ ഘടകം $M_{ij}$ ഇൻപുട്ട് ചാരങ്ങൾ $X_i$ ഉം $X_j$ ഉം തമ്മിലുള്ള സഹസംബന്ധമാണ്, കൂടാതെ തൊണ്ണൂറിൽ പടിയുള്ള മൂല്യങ്ങൾ $M_{ii}$ $X_i$ ന്റെ വ്യത്യാസമാണ്. അതുപോലെ, `np.corrcoef` നമുക്ക് **സഹസംബന്ധ മാട്രിക്സ്** നൽകും.\n"
]
]
},
},
{
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഒരു ബന്ധത്തിന്റെ മൂല്യം 1 ആണെങ്കിൽ അത് രണ്ട് വേരിയബിളുകൾക്കിടയിൽ ശക്തമായ **രേഖീയ ബന്ധം** ഉണ്ടെന്ന് അർത്ഥമാക്കുന്നു. ഒരു മൂല്യം മറ്റൊന്നിന്റെ എതിരായി പ്ലോട്ട് ചെയ്ത് രേഖീയ ബന്ധം ദൃശ്യമായി കാണാവുന്നതാണ്:\n"
"ഒരു സഹബന്ധം 1-ന് തുല്യമാണ് എന്നത് രണ്ട് ചാരങ്ങളുടെ মাজയിൽ ശക്തമായ **രേഖീയ ബന്ധം** ഉള്ളതായിയാണ് അർത്ഥമാക്കുന്നത്. ഒരു മൂല്യം മറ്റൊന്നിനെ എതിരെ രേഖയായുള്ള ബന്ധം ഞങ്ങൾ രൂക്ഷമായി കാണാൻ കഴിയും:\n"
]
]
},
},
{
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ബന്ധം രേഖീയമല്ലെങ്കില് എന്ത് സംഭവിക്കും എന്ന് നോക്കാം. നമ്മുടെ കമ്പനിക്ക് ഉയരത്തിനും ശമ്പളത്തിനും ഉള്ള വ്യക്തമാകുന്ന രേഖീയ ആശ്രിതത്വം മറയ്ക്കാന് തീരുമാനിച്ച്, സൂത്രവാക്യത്തില് `sin` പോലുള്ള ചില രേഖീയമല്ലാത്ത ഘടകങ്ങള് ചേര്ത്തുണ്ടെന്ന് فرضിക്കുക:\n"
"ബന്ധം നേരിയല്ലെങ്കിൽ എന്താകും സംഭവിക്കുന്നത് നോക്കാം. നമ്മുടെകമ്പനിക്ക് ഉയരവും ശമ്പളവും തമ്മിലുള്ള വ്യക്തമായ നേരിയ ആശ്രിതത്വം മറച്ചുവെക്കണമായിട്ടുള്ളതും, സമവാക്യത്തിൽ `sin` പോലുള്ള കുറച്ച് നേരിയതല്ലാത്തത്വം പരിചയപ്പെടുത്തുകയായിരുന്നുവെന്നും കരുതുക:\n"
]
]
},
},
{
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഈ സാഹചര്യത്തിൽ, സഹബന്ധം ആൽകൂട്ടം കുറവാണ്, എന്നാൽ അത് ഇപ്പോഴും വളരെ ഉയർന്നതാണ്. ഇപ്പോൾ, ബന്ധം കൂടുതലായി വ്യക്തമാകാതിരിക്കാൻ, ശമ്പളത്തിലേക്ക് ചില തങ്ങളുള്ള സ്ഥിരാംശം കൂട്ടിയേകിയുള്ള ചില അനിയന്ത്രിത മാറ്റങ്ങൾ കൂട്ടിച്ചേർക്കാൻ നമ്മाला ആഗ്രഹിച്ചേക്കാം. എന്ത് സംഭവിക്കുന്നു എന്ന് നോക്കാം:\n"
"ഈ കേസിൽ, കോറിലേഷൻ കുറേക്കൂടി ചെറുതായിരിക്കും, എന്നാൽ അത് ഇന്നും വളരെ ഉയർന്നതാണ്. ഇപ്പോൾ, ബന്ധം കൂടുതൽ വ്യക്തമല്ലാതാക്കാൻ, ശമ്പളത്തിന് ഒരു ഏതേവർകൽ വ്യത്യാസം ചേർത്തുകൊണ്ട് കുറച്ച് അധിക അനിശ്ചിതത്വം ചേർക്കാൻ ആഗ്രഹിക്കാം. എന്ത് സംഭവിക്കുമോ എന്ന് നോക്കാം:\n"
]
]
},
},
{
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> നിങ്ങൾക്ക് ഏതുകാരണത്താൽ ഇങ്ങനെ ഡോട്ടുകൾ നേരിയ രേഖകളായി വരുന്നതെന്ന് മനസിലാകുമോ?\n",
"> കിണറുപോലെയുള്ള വൃത്തങ്ങൾ ഇതുപോലെ നിത്യരേഖകളായി ഒരു നിരകളായി മാറുന്നത് നിങ്ങൾക്കറിയാമോ?\n",
"\n",
"\n",
"സൽകാര്യമെന്ന മനുഷ്യനും നിർമിതമായി രൂപകൽപ്പന ചെയ്ത ഒരു ആശയത്തിനും കാണപ്പെട്ട മാറിയുള്ള *ഉയരം* എന്നതിനും ഇടയിൽ ഞങ്ങൾ ബന്ധം കണ്ടു. ഉയരം, ഭാരം പോലുള്ള രണ്ട് കാണപ്പെട്ട മാറ്റികൾ തമ്മിൽ ബന്ധമുണ്ടോ എന്നും നോക്കാം:\n"
"ശമ്പളം എന്ന കല്പിതമായ ആശയവും വീതി എന്ന നിരീക്ഷിച്ച വ്യത്യാസവും തമ്മിലുള്ള സഹബന്ധം നാം കണ്ടിട്ടുണ്ട്. വീതി, ഭാരം എന്നിവരിൽ രണ്ടും തമ്മിൽ സഹബന്ധമുണ്ടോ എന്ന് നമുക്ക് പരിശോധിക്കാം:\n"
]
]
},
},
{
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ദുരിതകരമായി, намക് യാതൊരു ഫലങ്ങളും ലഭിച്ചില്ല - ചില അസാധാരണമായ `nan` മൂല്യങ്ങൾ മാത്രമാണ്. ഇത് സംഭവിക്കുന്നത് നമ്മുടെ സീരിസിലെ ചില മൂല്യങ്ങൾ നിർവചനരഹിതമായതിനാൽ ആണ്, അവ `nan` ആയി പ്രതിനിധീകരിക്കപ്പെടുന്നു, ഇത് പ്രവർത്തിയുടെ ഫലവും നിർവചനരഹിതമാക്കുന്നു. മെട്രിക്സ് കാണുമ്പോൾ നമുക്ക് മനസിലാകും `Weight` ആണ് പ്രശ്നം ഉണ്ടായിരിക്കുന്ന കോളം, കാരണം `Height` മൂല്യങ്ങളിലെ സ്വയം സാന്നിധ്യം കണക്കാക്കിയിട്ടുണ്ട്.\n",
"ദുർഭാഗ്യവശാൽ, нам്ാൻ ഫലം ലഭിച്ചില്ല - ചില അസാധാരണമായ `nan` മൂല്യങ്ങൾ മാത്രമാണ് ഉണ്ടായത്. ഞങ്ങളുടെ സീരീസിലെ ചില മൂല്യങ്ങൾ നിർവചിക്കപ്പെടാത്തവയാണ്, `nan` ആയി പ്രതിനിധീകരിച്ചിരിക്കുന്നത്, ഇതാണ് പ്രവർത്തിയുടെ ഫലവും നിർവചിക്കപ്പെടാത്തതാകുന്നതിന്റെ കാരണം. מטרിക്സ് കണ്ടാൽ `Weight` ആണ് പ്രശ്നമുണ്ടാക്കുന്ന കോളം, കാരണം `Height` മൂല്യങ്ങൾക്കിടയിലെ സ്വയം-സംബന്ധം കണക്കാക്കിയിട്ടുണ്ട്.\n",
"\n",
"\n",
"> ഈ ഉദാഹരണം **ഡാറ്റ തയ്യാറിക്ഷണം**ക്കും **ശുചീകരണം**ക്കും പ്രാധാന്യം കാണിക്കുന്നു. ശരിയായ ഡാറ്റ ഇല്ലാതെ നമുക്ക് ഒന്നും കണക്കാക്കാനാകില്ല.\n",
"> ഈ ഉദാഹരണം **ഡാറ്റാ തയ്യാറെടുപ്പിന്റെ**യും **ശുചിത്വത്തിന്റെ**വഴി പ്രാധാന്യം കാണിക്കുന്നു. ശരിയായ ഡാറ്റ കൂടാതെ നാം ഒന്നും കണക്കാക്കാൻ കഴിയില്ല.\n",
"\n",
"\n",
"മിസ്സിംഗ് മൂല്യങ്ങൾ നിറയ്ക്കാൻ `fillna` മേധോഡ് ഉപയോഗിച്ച്, സാന്നിധ്യം കണക്കാക്കാം:\n"
"നഷ്ടമായ മൂല്യങ്ങൾ പൂരിപ്പിക്കാൻ `fillna` രീതി ഉപയോഗിക്കാം, പിന്നീട് സഹബന്ധം കണക്കാക്കാം:\n"
"നിശ്ചയമായും ഒരു സഹബന്ധം ഉണ്ടെങ്കിലും, നമ്മുടെ കല്പിത ഉദാഹരണത്തിലെപ്പോലെ അത്ര ശക്തമായ ഒരു സഹബന്ധമല്ല. സത്യത്തിൽ, ഒരു മൂല്യം മറ്റൊരുവതോടു വിരുതിയ ദൃശ്യത്തില് നോക്കിയാല്, ആ ബന്ധം വളരെ കുറവായിരിക്കും കാണപ്പെടുന്നത്:\n"
"ചേർത്ത് കണക്കാക്കുമ്പോൾ വിശ്വസിക്കാവുന്നൊരു ബന്ധമുണ്ട്, പക്ഷെ നമ്മുടെ കൃത്രിമ ഉദാഹരണത്തിലെത്ര ശക്തമല്ല. സത്യത്തിൽ, ഒരു മൂല്യത്തിന്റെ സ്കാറ്റർ പ്ലോട്ട് മറ്റൊന്നിനോട് താരതമ്യം ചെയ്താൽ, ബന്ധം കുറെയധികം വ്യക്തമായി കാണുന്നതായിരിക്കും:\n"
]
]
},
},
{
{
@ -535,16 +535,16 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## 결론\n",
"## നിഗമനം\n",
"\n",
"\n",
"ഈ നോട്ട്ബുക്കിൽ, സ്റ്റാറ്റിസ്റ്റിക്കൽ ഫംഗ്ഷനുകൾ കണക്കാക്കാൻ ഡേറ്റയിൽ അടിസ്ഥാന പ്രവർത്തനങ്ങൾ എങ്ങനെ നടത്താമെന്ന് ഞങ്ങൾ പഠിച്ചു. ഒരു ഡേറ്റാ സാമ്പിള് നൽകിയപ്പോൾ, ചില ഹൈപോത്തസിസുകൾ തെളിയിക്കാൻ ഗണിതശാസ്ത്രം, സംഖ്യാകീയ ശാസ്ത്രം എന്നിവ sound ഉപകരണമായി എങ്ങനെ ഉപയോഗിക്കാമെന്ന് ഇപ്പോൾ ഞങ്ങൾക്ക് അറിയാം, കൂടാതെ ഏത് ഘടകത്തിന്റെയും വിശ്വാസ വ്യത്യാസങ്ങൾ എങ്ങനെ കണക്കാക്കാമെന്ന് അറിയാം.\n"
"ഈ നോട്ട്ബുക്ക് ഉപയോഗിച്ച് നമുക്ക് ഡാറ്റയിൽ അടിസ്ഥാന പ്രവർത്തനങ്ങൾ നിർവ്വഹിച്ച് സ്റ്റാറ്റിസ്റ്റിക്കൽ ഫംഗ്ഷനുകൾ എങ്ങനെ കണക്കാക്കാമെന്നത് പഠിച്ചു. ചില ഹിപ്പോത്തസുകൾ തെളിയിക്കാൻ ഗണിതം, സ്ഥിതിവിവരശസ്ത്രത്തിന്റെ തർക്കസഹായക ഉപകരണങ്ങൾ എങ്ങനെ ഉപയോഗിക്കാമെന്നും, ഒരു ഡാറ്റാ സാമ്പിള് ലഭിച്ച വെറും വ്യത്യസ്ത ചാരിതാർത്ഥ്യങ്ങൾക്കായി വിശ്വാസ ഇടവേളകൾ എങ്ങനെ കണക്കാക്കാമെന്നും ഇപ്പോൾ നമുക്ക് അറിയാം.\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**അസൂയാംശം**: \nഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്ക് പരിശ്രമിച്ചാൽ പോലും, ഓട്ടോമാറ്റിക് വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റായ വിതരണങ്ങൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. മാതൃഭാഷയിൽ ഉള്ള അസൽ രേഖയാണ് ഏറ്റവും വിശ്വസനീയമായ ഉറവിടം എന്ന കാര്യം മാനിക്കണം. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിൽ നിന്നുണ്ടാകുന്ന ഏത് തെറ്റിദ്ധാരണകൾക്കും ഞങ്ങൾ ഉത്തരവാദികളല്ല.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**അറിയിപ്പ്**:\nഈ രേഖ AI പരിഭാഷാ സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"നാം COVID-19 ബാധിച്ച വ്യക്തികളുടെ ഡാറ്റ ഉപയോഗിക്കും, ഇത് [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) [Johns Hopkins University](https://jhu.edu/) നല്കുന്നു. ഡാറ്റാസെറ്റ് [ഈ GitHub റെപ്പോസിറ്റരി](https://github.com/CSSEGISandData/COVID-19)ലിൽ ലഭ്യമാണ്.\n"
"COVID-19 ബാധിച്ച വ്യക്തികളുമായി ബന്ധപ്പെട്ട ഡാറ്റ [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) [Johns Hopkins University](https://jhu.edu/) യിൽ നിന്നാണ് ഞങ്ങൾ ഉപയോഗിക്കുന്നത്. ഡാറ്റാസെറ്റ് [this GitHub Repository](https://github.com/CSSEGISandData/COVID-19) ല് ലഭ്യമാണ്.\n"
]
]
},
},
{
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"നാം ഏറ്റവും പുതിയ ഡാറ്റ `pd.read_csv` ഉപയോഗിച്ച് GitHub ല് നിന്നും നേരിട്ട് ലോഡ് ചെയ്യാം. എന്തെങ്കിലും കാരണം കൊണ്ട് ഡാറ്റ ലഭ്യമല്ലെങ്കിൽ, നിങ്ങൾക്ക 항상 `data` ഫോൾഡറിൽ ലഭ്യമായ ലൊക്കൽ കോപ്പി ഉപയോഗിക്കാം - `base_url` നിർവചിച്ചിരിക്കുന്ന താഴെയുള്ള വരി അണ്കോമന്റ് ചെയ്യുക:\n"
"`pd.read_csv` ഉപയോഗിച്ച് ഏറ്റവും പുതിയ ഡാറ്റ നേരിട്ട് ഗിറ്റ്ഹബിൽ നിന്ന് ലോഡ് ചെയ്യാം. ഏതു കാരണവശാൽ ഡാറ്റ ലഭ്യമല്ലെങ്കിൽ,സ്ഥാപിതമായിരിക്കുന്ന ഇവിടെ ഉള്ള കോപ്പി `data` ഫോൾഡറിൽസ് എപ്പോഴും ഉപയോഗിക്കabilirsiniz - താഴെ കൊടുത്തിരിക്കുന്ന `base_url` നിർവചിക്കുന്ന ലൈനിന്റെ കമന്റ് നീക്കം ചെയ്യുക:\n"
]
]
},
},
{
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഇപ്പോൾ ഞങ്ങൾ ബാധಿತರായ വ്യക്തികളുടെ ഡാറ്റ ലോഡ് ചെയ്ത്, ഡാറ്റ എങ്ങനെ കാണപ്പെടുന്നു എന്ന് നോക്കാം:\n"
"രോഗബാധിത വ്യക്തികളുടെ ഡാറ്റ നാം ഇപ്പോൾ ലോഡ് ചെയ്ത് ഡാറ്റ എങ്ങനെ കാണപ്പെടുന്നു എന്ന് നോക്കാം:\n"
]
]
},
},
{
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഞങ്ങൾ കാണുന്നുണ്ടാകുന്നത് ആണെങ്കിൽ പട്ടികയിലെ ഓരോ വരിയിലും ഓരോ രാജ്യത്തിന്റെ/പ്രവിശ്യയുടെ രോഗബാധിതരുടെ എണ്ണം നിർവ്വചിക്കുകയാണ്, കോളങ്ങൾ തീയതികളെ പ്രതിനിധീകരിക്കുന്നു. സൗകര്യമുള്ള മറ്റ് ഡാറ്റകൾക്കും സമാനമായ പട്ടികകൾ ലോഡ് ചെയ്യാവുന്നതാണ്, ഉദാഹരണത്തിന്, സുഖപ്രാപിച്ചവരുടെ എണ്ണം, മരണം സംഭവിച്ചവരുടെ എണ്ണം.\n"
"ഓരോ രാജ്യത്തിന്റെയും/പ്രവിശ്യയുടെയോ രോഗബാധിതരുടെ എണ്ണം ഓരോ പട്ടികാശ്രേണികളിലും നിസ്സാരമായി നിർവചിച്ചിട്ടുള്ളതായും, തീയതികൾക്ക് മുകളിൽ നിര കണികകൾക്ക് അനുയോജ്യമായതായും കാണാം. മാറിയവരുടെ എണ്ണം, മരണസംഖ്യ തുടങ്ങിയ മറ്റ് ഡേറ്റകൾക്കായി സമാന പട്ടികകൾ ലോഡ് ചെയ്യാവുന്നതാണ്.\n"
]
]
},
},
{
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ഡാറ്റയിൽ അർത്ഥമാക്കൽ\n",
"## ഡാറ്റയുടെ അർത്ഥം കണ്ടെത്തൽ\n",
"\n",
"\n",
"മുകളിൽ നൽകിയ പട്ടികയിൽ പ്രവിശ്യ കോളത്തിന്റെ ভূমിക വ്യക്തമല്ല. `Province/State` കോളത്തിൽ ഉള്ള വ്യത്യസ്ത മൂല്യങ്ങൾ നോക്കാം:\n"
"മുകളിൽ തന്നിരിക്കുന്ന പട്ടികയിൽ പ്രോവിൻസ് കോളത്തിന്റെ പങ്ക് വ്യക്തമല്ല. `Province/State` കോളത്തിൽ ഉള്ള വ്യത്യസ്ത മൂല്യങ്ങൾ നോക്കാം:\n"
]
]
},
},
{
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"നാമങ്ങളിൽ നിന്നു നാം തിരിച്ചറിയാൻ കഴിയും ഓസ്ട്രേലിയയും ചൈനയും പോലുള്ള രാജ്യങ്ങൾക്ക് പ്രവിശ്യകളിൽ കൂടുതൽ വിശദമായ വിഭാഗീകരണം ഉണ്ട്. ഒരു ഉദാഹരണമായി ചൈനയെക്കുറിച്ചുള്ള വിവരങ്ങൾ നോക്കാം:\n"
"പേരുകളിൽ നിന്നും ഓസ്ട്രേലിയ, ചൈന എന്നീ രാജ്യങ്ങൾക്ക് പ്രവിശ്യകൾ അനുസരിച്ച് കൂടുതൽ വ്യാപകമായി വിഭജനം ചെയ്യുന്നുണ്ട് എന്ന് നാം മനസിലാക്കാം. ഉദാഹരണം കാണുന്നതിനായി ചൈനയുടെ വിവരം നോക്കാം:\n"
]
]
},
},
{
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ഡാറ്റ പ്രീ-പ്രോസസിംഗ്\n",
"## ഡാറ്റ പ്രീ-പ്രോസസ്സിംഗ്\n",
"\n",
"\n",
"രാജ്യങ്ങളെ അധിക പ്രദേശങ്ങളായി വിഭജിക്കുന്നതിൽ ഞങ്ങൾ താൽപ്പര്യമില്ല, അതിനാൽ ഈ വിഭജനം നാം ആദ്യം ഒഴിവാക്കി എല്ലാ പ്രദേശങ്ങളുടെയും വിവരങ്ങൾ ചേർത്ത് ചേർക്കും, ആയതിനാൽ മുഴുവൻ രാജ്യത്തിനും വിവരങ്ങൾ ലഭിക്കും. ഇത് `groupby` ഉപയോഗിച്ച് ചെയ്യാം:\n"
"നാം രാജ്യങ്ങളെ കൂടുതൽ പ്രദേശങ്ങളായി വിഭജിക്കുന്നതിൽ താൽപര്യമില്ല, അതിനാൽ ആദ്യം ഈ വിഭജനം നീക്കം ചെയ്ത് എല്ലാ പ്രദേശങ്ങളുടെ വിവരങ്ങളും ഒരുമിച്ച് ചേർത്ത് രാജ്യത്തിനുള്ള മുഴുവൻ വിവരവും നേടും. ഇത് `groupby` ഉപയോഗിച്ച് ചെയ്യാം:\n"
]
]
},
},
{
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"`groupby` ഉപയോഗിച്ചതിനാൽ എല്ലാ DataFrame-ങ്ങളും ഇപ്പോൾ Country/Region വഴി സൂചികയാക്കപ്പെട്ടിട്ടുണ്ടെന്ന് നിങ്ങൾക്ക് കാണാം. അതിനാൽ, `.loc` ഉപയോഗിച്ച് ഏതെങ്കിലും പ്രത്യേക രാജ്യത്തിനുള്ള ഡാറ്റയിൽ എത്തിക്കാം:|\n"
"`groupby` ഉപയോഗിച്ചതാൽ എല്ലാ DataFrame-മുകളും ഇപ്പോൾ Country/Region അനുസരിച്ച് ഇൻഡക്സ് ചെയ്തിട്ടുണ്ടെന്ന് നിങ്ങൾ കാണാം. അതിനാൽ നമ്മൾ `.loc` ഉപയോഗിച്ച് ഒരു പ്രത്യേക രാജ്യത്തിന്റെ ഡാറ്റ ആക്സസ് ചെയ്യാൻ കഴിയും:|\n"
]
]
},
},
{
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> **കുറിപ്പ്** നാം എങ്ങനെ `[3:]` ഉപയോഗിച്ച് പ്രവിശ്യ/സംസ്ഥാനം, ഭൂസ്ഥിതി കോളങ്ങൾ ഉൾപ്പെടെ തീയതി അല്ലാത്ത മെറ്റാഡേറ്റയുള്ള ഒരു ക്രമത്തിലെ ആദ്യ മൂന്ന് ഘടകങ്ങൾ നീക്കം ചെയ്യുന്നു എന്ന് കാണിക്കുന്നു. ആ മൂന്ന് കോളങ്ങൾ നാം പൂർണമായും ഒഴിവാക്കാനും കഴിയും:\n"
"> **കുറിപ്പ്** നാം ഒരു ക്രമത്തിൽ ആദ്യത്തെ മൂന്ന് ഘടകങ്ങൾ നീക്കംചെയ്യാൻ `[3:]` എങ്ങനെ ഉപയോഗിക്കുന്നത് നോക്കുക, അവയിൽ തീയതി അല്ലാത്ത മെറ്റാഡേറ്റായ പ്രവിശൻ/സംസ്ഥാനം, ജിയോളൊക്കേഷൻ കോളങ്ങൾ അടങ്ങിയിരിക്കുന്നു. ആ മൂന്ന് കോളങ്ങൾ പൂർണ്ണമായി ഒതുക്കാം:\n"
]
]
},
},
{
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ഡേറ്റാ അന്വേഷിക്കൽ\n",
"## ഡാറ്റ പരിശോധിക്കൽ\n",
"\n",
"\n",
"നമ്മൾ ഇപ്പോൾ ഒരു പ്രത്യേക രാജ്യത്തെ അന്വേഷിക്കാൻ മാറാം. തിയതി അനുസരിച്ച് ഇൻഫെക്ഷൻ ഡേറ്റ അടങ്ങിയ ഒരു ഫ്രെയിം സൃഷ്ടിക്കാം:\n"
"ഇപ്പോൾ നാം ഒരു പ്രത്യേക രാജ്യത്തെ പരിശോധന നടത്താം. തീയതിയനുസരിച്ചുള്ള മാരകത സംബന്ധമായ ഡാറ്റ ഉൾಗೊಂಡ ഒരു ഫെയിം സൃഷ്ടിക്കാം: \n"
]
]
},
},
{
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"നമുക്ക് ഇപ്പോൾ ഓരോ ദിവസവും പുതുതായി ബാധിതരായി വരുന്നവരുടെ എണ്ണം കണക്കാക്കാം. ഇതുവഴി പാൻഡെമിക് എത്ര വേഗത്തിൽ വ്യാപിക്കുകയാണ് എന്ന് അറിയാം. ഇത് ചെയ്യാൻ ഏറ്റവും എളുപ്പം `diff` ഉപയോഗിക്കുകയാണ്:\n"
"ഇനി ഓരോ ദിവസവും പുതിയതായി ബാധിക്കപ്പെടുന്ന ആളുകളുടെ എണ്ണം കണക്കുകൂട്ടാം. ഇതിലൂടെ പാൻഡെമിക് മുന്നേറുന്ന വേഗത ഞങ്ങൾ കാണാൻ കഴിയും. അതിന് ഏറ്റവും എളുപ്പം ചെയ്യാനുള്ള മാർഗമാണ് `diff` ഉപയോഗിക്കുക:\n"
]
]
},
},
{
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഡാറ്റയിൽ ഉയർന്ന അസ്ഥിരതകൾ കാണപ്പെടുന്നു. ഒരു മാസത്തെ പറച്ചിൽ നാഴിക നോക്കാം:\n"
"ഡേറ്റയിൽ വലിയ തറവടികൾ കാണാം. ഒരു മാസത്തെ കൂടുതൽ നുറുങ്ങായി നോക്കാം:\n"
]
]
},
},
{
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഡാറ്റയിൽ സജീവമായ ആഴ്ചവారీ ഘട്ടങ്ങൾ വ്യക്തമാകുന്നു. നാം പ്രവണതകൾ കാണാൻ കഴിയണമെങ്കിൽ, പ്രവർത്തന ശരാശരി കണക്കാക്കി (അതായത് ഓരോ ദിവസത്തിനും മുമ്പ് പല ദിവസങ്ങളുടെ ശരാശരിയുടെ മൂല്യം കണക്കാക്കുക) വക്രം മൃദുവാക്കുന്നത് ബുദ്ധിമാനാണെന്ന് തോന്നുന്നു:\n"
"ഡാറ്റയിൽ സാപ്താഹികമായ അസ്ഥിരതകൾ ഉള്ളതായി വ്യക്തം. ട്രെൻഡുകൾ കാണാൻ കഴിയണമെങ്കിൽ, ലീക്കുപോലെ മുൻ കുറഞ്ഞ ദിവസങ്ങളിലെ ശരാശരി മൂല്യം കണക്കാക്കിയാണ് മൂലയുണ്ട് മൃദുവ 만드는ോണ് (അർത്ഥമാകുന്നു , ഓരോ ദിവസത്തിനും മുൻപുള്ള നിരവധി ദിവസങ്ങളുടെ ശരാശരി കണക്കാക്കും):\n"
]
]
},
},
{
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഒരു രാജ്യത്തെ കുറിച്ച് താരതമ്യം ചെയ്യാൻ കഴിയാനുള്ളത് ഏറെ രാജ്യങ്ങളെ താരതമ്യം ചെയ്യാൻ, രാജ്യത്തിന്റെ ജനസംഖ്യയെ പരിഗണിക്കാൻ ആഗ്രഹിക്കാം, ആ രാജ്യത്തിന്റെ ജനസംഖ്യയുടെ പ്രമാണത്തിൽ രോഗബാധിതരുടെ ശതമാനം താരതമ്യം ചെയ്യുക. രാജ്യത്തിന്റെ ജനസംഖ്യ നേടാൻ, രാജ്യങ്ങളുടെ ഡാറ്റാസെറ്റ് ലോഡ് ചെയ്യാം:\n"
"പല രാജ്യങ്ങളും താരതമ്യപ്പെടുത്താൻ കഴിയുന്നതായിരിക്കുവാൻ, രാജ്യത്തിന്റെ ജനസംഖ്യക്കുറിച്ച് പരിഗണിച്ച്, രാജ്യത്തിന്റെ ജനസംഖ്യയ്ക്കുള്ള രോഗബാധിതരുടെ ശതമാനം താരതമ്യപ്പെടുത്താൻ നമ്മൾ ആഗ്രഹിക്കാം. രാജ്യത്തിന്റെ ജനസംഖ്യ നേടുന്നതിനായി, രാജ്യങ്ങളുടെ ഡാറ്റാസെറ്റ് ലോഡ് ചെയ്യേണ്ടതാണ്:\n"
]
]
},
},
{
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഈ ഡാറ്റാസെറ്റിൽ രാജ്യങ്ങളും പ്രവിശ്യകളും സംബന്ധിച്ച വിവരങ്ങൾ ഉൾക്കൊള്ളുമ്പോൾ, മുഴുവൻ രാജ്യത്തിന്റെ ജനസംഖ്യ നേടാൻ നമുക്ക് കുറച്ചു ബുദ്ധിമുട്ടോടെ ഏറെക്കുറെ ശ്രദ്ധിക്കേണ്ടതാണ്:\n"
"ഈ ഡാറ്റാസെറ്റിൽ രാജ്യങ്ങളും പ്രവിശ്യകളും സംബന്ധിച്ച വിവരങ്ങൾ ഉള്ളതിനാൽ, മുഴുവൻ രാജ്യത്തിന്റെ ജനസംഖ്യ നേടുവാൻ നാം കുറച്ച് ബുദ്ധിമുട്ടായി പ്രവർത്തിക്കണം: \n"
]
]
},
},
{
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## കമ്പ്യൂട്ടിംഗ് $R_t$\n",
"\n",
"\n",
"രോഗം എത്രമാത്രം പ്രാവർത്തിതമാകുന്നു എന്ന് കാണാൻ, ഞങ്ങൾ **അടിസ്ഥാന പുനര്വ്യാപന സംഖ്യ** $R_0$ നോക്കുന്നു, ഇത് ഒരു ബാധിതൻ എത്ര ആളുകളെ കൂടി ബാധിക്കും എന്ന് സൂചിപ്പിക്കുന്നു. $R_0$ 1 നും മുകളിൽ ആയാൽ, മഹാമാരി വ്യാപിപ്പിക്കാൻ സാധ്യത കൂടുതലാണ്.\n",
"## $R_t$ കണക്കാക്കൽ\n",
"\n",
"\n",
"$R_0$ രോഗത്തിന്റെ സ്വഭാവമാണ്, ആളുകൾ മഹാമാരി മന്ദഗതിയിൽ വയ്ക്കാൻ സ്വീകരിക്കാവുന്ന ചില സുരക്ഷാ നടപടികൾ കഴിവിലെടുക്കുന്നില്ല. മഹാമാരിയുടെ പുരോഗതിയിൽ, നാം ഏതെങ്കിലും നിശ്ചിത സമയത്ത് $t$-ൽ പുനര്വ്യാപന സംഖ്യ $R_t$ കണക്കാക്കാം. ഇങ്ങനെ ഒരു സംഖ്യ ഏകദേശം കണക്കാക്കാൻ 8 ദിവസങ്ങളുടെ വിൻഡോ എടുത്ത് കണക്കാക്കുന്നത് കാണിച്ചിട്ടുണ്ട്: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"രോഗം 얼마나 വ്യാപകമാണെന്ന് കാണാൻ, നാം **ആധാരപരമായ പുനരുജ്ജീവന സംഖ്യ** $R_0$ എന്നതിനെ നോക്കുന്നു, ഇത് ഒരു संक्रमിതനായ വ്യക്തി തുടർന്നും എത്ര പേര് രോഗം ബാധിക്കാൻ സാധ്യതയുണ്ടെന്ന് സൂചിപ്പിക്കുന്നു. $R_0$ 1-ൽ കൂടുതൽ ആയാൽ, മഹാമാരി പടരാൻ സാധ്യതയുണ്ട്.\n",
"ഇവിടെ $I_t$ ദിനം $t$-ൽ പുതിയതായി ബാധിതരായ വ്യക്തികളുടെ എണ്ണം ആണ്.\n",
"\n",
"\n",
"നമുടെ മഹാമാരി ഡാറ്റയ്ക്ക് $R_t$ കണക്കാക്കാം. ഇതിന്, നാം 8 `ninfected` മൂല്യങ്ങളുള്ള ഒരു ചലിക്കുന്ന വിൻഡോ എടുത്ത്, മുകളിലുള്ള അനുപാതം കണക്കാക്കാൻ ഫังก്ഷൻ പ്രയോഗിക്കും:\n"
"$R_0$ രോഗത്തിന്റെ സ്വന്തം സ്വഭാവമാണ്, കൂടാതെ ജനങ്ങൾ പാൻഡെമിക്ക് മന്ദഗതിയാക്കാൻ സ്വീകരിച്ചേക്കാവുന്ന ചില സംരക്ഷണ നടപടികളെ പരിഗണിക്കുന്നില്ല. പാൻഡെമിക് പുരോഗമനത്തിനിടെ, നാം ഏതെങ്കിലും നാൾ $t$-ൽ പുനരുജ്ജീവന സംഖ്യ $R_t$ കണക്കാക്കി അറിയാം. 8 ദിവസത്തെ ഒരു വിൻഡോ എടുത്ത് ഇത് അനുമാനിക്കാവുന്നതായി തെളിഞ്ഞിട്ടുണ്ട്: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ഇവിടെ $I_t$ അർത്ഥം ആ ദിനം $t$-ൽ പുതിയത് ബാധിതരായ ആളുകളുടെ എണ്ണം ആണ്.\n",
"\n",
"നമ്മുടെ പാൻഡെമിക് ഡാറ്റയ്ക്കായി $R_t$ കണക്കാക്കാം. ഇതിന്, 8 `ninfected` മൂല്യങ്ങളുടെ ഒരു റോളിംഗ് വിൻഡോ എടുത്ത്, മുകളിൽ കൊടുത്ത അനുപാതം കണക്കാക്കുന്നതിനായി ഫംഗ്ഷൻ പ്രയോഗിക്കാം:\n"
]
]
},
},
{
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ഗ്രാഫിൽ ചില ഇടവേളകൾ ഉണ്ടെന്ന് നിങ്ങൾക്ക് കാണാമല്ലോ. അവയെ `NaN` അല്ലെങ്കിൽ `inf` മൂല്യങ്ങൾ ഡാറ്റാസെറ്റിൽ ഉണ്ടായാൽ ഉണ്ടാകാം. 0-ൽ വിഭജനത്തോടെ `inf` ഉണ്ടാകാം, കൂടാതെ `NaN` നഷ്ടപ്പെട്ട ഡാറ്റയാണ് സൂചിപ്പിക്കുക, അല്ലെങ്കിൽ ഫലം കണക്കാക്കാൻ ഡാറ്റ ലഭ്യമാകാതിരിക്കുക (വെരി തുടക്കത്തിൽ നമ്മുടെ ഫ്രെയിമിൽ, വീതിയുള്ള 8 വിൻഡോ ഇപ്പോഴും ലഭ്യമല്ലാത്തപ്പോൾ പോലെ). ഗ്രാഫ് കൂടുതൽ ഇഷ്ടമാക്കുന്നതിനായി, `replace` ഉം `fillna` ഫങ്ക്ഷനുകളും ഉപയോഗിച്ച് ആ മൂല്യങ്ങൾ പൂരിപ്പിക്കാൻ വേണ്ടിയാണ്.\n",
"ഗ്രാഫിൽ ചില വീഴ്ചകൾ കാണാം. ഡാറ്റാസെറ്റിൽ `inf` മൂല്യങ്ങളുള്ളപ്പോൾ അല്ലെങ്കിൽ `NaN` മൂല്യം ഉണ്ടെങ്കിൽ അവ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. `inf` അർത്ഥം സവിശേഷമായി 0 ഉപയോഗിച്ച് വിഭജനം ചെയ്തപ്പോൾ ഉണ്ടാകാം, `NaN` ഇന്റർപ്രട്ട് ചെയ്യാനാകാത്ത ഡാറ്റ പറയുന്നു, അല്ലെങ്കിൽ ഫലം കണക്കാക്കാൻ ഡാറ്റയില്ല (ഫ്രെയിമിന്റെ തുടക്കത്തിൽ 8 വിന്ഡോ വീതിയുള്ള റോളിംഗ് നിലവിൽ ഇല്ലാത്തത് പോലെ). ഗ്രാഫ് മിസ് ചെയ്യാതെ കാണാൻ ഈ മൂല്യങ്ങൾ `replace`യും `fillna` ഫംഗ്ഷനുകളും ഉപയോഗിച്ച് പൂരിപ്പിക്കണം.\n",
"\n",
"\n",
"പെൻഡെമിക് തുടക്കത്തെ കൂടി നാം പുറത്തു കാണാം. മികച്ചതായി കാണാൻ y-axis മൂല്യങ്ങൾ 6-ൽ താഴെയുള്ളവ മാത്രമായി പരിധി നിശ്ചയിക്കുകയും, 1-ൽ അതുല്യരേഖ വരയും വരക്കുകയും ചെയ്യും.\n"
"പാൻഡമിക് ആരംഭം കൂടി പരിശോധിക്കാം. മികച്ച ദൃശ്യത്തിന് y-അക്സിസ് മൂല്യങ്ങൾ 6 താഴെയുള്ളവ മാത്രമായി പരിമിതപ്പെടുത്താം, കൂടാതെ 1ലെ ഹോരിസോണ്ടൽ ലൈൻ വരയ്ക്കാം.\n"
]
]
},
},
{
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"അത്രയും-pandemic-ന്റെ മറ്റൊരു രസകരമായ സൂചകം എന്നതാണ് **ഡെരിവേറ്റ്** അല്ലെങ്കിൽ **ദൈനംദിന വ്യത്യാസം** പുതിയ കേസുകളിൽ. ഇത് നമ്മുടെpandemic വർധിച്ചുകളയുമ്പോഴും കുറയുമ്പോഴും വ്യക്തമാക്കാൻ സഹായിക്കുന്നു.\n"
"പാൻഡെമിക് സംബന്ധിച്ച മറ്റൊരു രസകരമായ സൂചകം **ഡെറിവേറ്റീവ്**, അല്ലെങ്കിൽ പുതിയ കേസുകളിൽ സംഭവിക്കുന്ന **ദൈനംദിന വ്യത്യാസം** ആണ്. ഇത് പാൻഡെമിക് വർധിക്കുന്നോ കുറയുന്നതിനോ വ്യക്തമാക്കാൻ സഹായിക്കുന്നു.\n"
]
]
},
},
{
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"റിപ്പോർട്ടിങ്ങിനു കാരണം ഡാറ്റയിൽ വളരെയധികം അസ്ഥിരതകൾ ഉണ്ടാകുന്നുള്ളതിനാൽ, ആകെ ചിത്രം മനസ്സിലാക്കാനായി റോളിംഗ് അവറേജ് നടക്കുത്ത് ഭ്രമരേഖ സാന്ത്വനപ്പെടുത്തുന്നത് ജസ്റ്റിസ് ആണ്. വീണ്ടും Pandemieയുടെ ആദ്യ മാസങ്ങളിലേക്ക് ശ്രദ്ധ കേന്ദ്രീകരിക്കും:\n"
"റിപ്പോർട്ടിങ്ങ് മൂലം ഡേറ്റയിൽ ഉണ്ടാകുന്ന പല തരത്തിലുള്ള മാറുപേരുകൾ ഉണ്ടെന്ന കാര്യത്തെ അടിസ്ഥാനമാക്കി, സമഗ്ര ദൃശ്യത്തിന് റോളിംഗ് ശരാശരി പ്രവർത്തിപ്പിച്ചുകൊണ്ട് വളവിനെ മൃദുവാക്കുന്നത് തർക്കരഹിതമാണ്. പാന്ഡമിക് ആരംഭിച്ച ആദ്യ മാസങ്ങളിലേക്ക് വീണ്ടും മടക്കിവേരാണ്:\n"
]
]
},
},
{
{
@ -2390,26 +2391,27 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## വെല്ലുവിളി\n",
"\n",
"\n",
"ഇപ്പോൾ നിങ്ങൾക്ക് കോഡ്നും ഡാറ്റയുമായി കൂടുതൽ കളിക്കാൻ സമയം ആയി! നിങ്ങൾ പരീക്ഷിച്ചറിയാൻ കഴിയും ചില നിർദ്ദേശങ്ങൾ ഇവയാണ്:\n",
"## ചേലഞ്ച്\n",
"* വ്യത്യസ്ത രാജ്യങ്ങളിൽ പാൻഡെമിക് എങ്ങനെ വ്യാപിച്ചതെന്ന് കാണുക.\n",
"\n",
"* താരതമ്യത്തിന് ഒറ്റ പ്ലോട്ടിൽ പല രാജ്യങ്ങളുടെ $R_t$ ഗ്രാഫുകൾ പോസ്റ്റ് ചെയ്യുക, അല്ലെങ്കിൽ പല പ്ലോട്ടുകളും അടുത്തടുത്ത് സജ്ജമാക്കുക.\n",
"ഇപ്പോൾ നിങ്ങൾക്കൊരു കോഡ്, ഡാറ്റ എന്നിവയുമായി കൂടുതൽ കളിക്കുന്ന സമയമാണ്! ഇവിടെ നിങ്ങൾ പരീക്ഷിക്കാൻ ചില നിർദ്ദേശങ്ങൾ നൽകിയിരിക്കുന്നു:\n",
"* മരണം, ആരോഗ്യപ്രാപ്തി എന്നിവ संक्रमിത കേസുകളുടെ എണ്ണവുമായി എങ്ങനെ ബന്ധപ്പെട്ടിരിക്കുന്നു എന്ന് കാണുക.\n",
"* വിവിധ രാജ്യങ്ങളില് പാൻഡെമിക്കും വ്യാപ്തി കാണുക.\n",
"* ഒരു സാധാരണ രോഗം എത്രകാലം നീണ്ടുനിൽക്കും എന്ന് പ്രത്യക്ഷമായി संक्रमിതത്വം നിരക്കും മരണ നിരക്കും തമ്മിൽ ബന്ധം പരിശോധിച്ച് കണ്ടെത്താൻ ശ്രമിക്കുക. അതിനായി വ്യത്യസ്ത രാജ്യങ്ങളെ കാണേണ്ടി വരാം.\n",
"* താരതമ്യത്തിനായി ഒന്നാന്തരം പ്ളോട്ടിൽ നിരവധി രാജ്യങ്ങൾക്കുള്ള $R_t$ ഗ്രാഫുകൾ വരയ്ക്കുക, അല്ലെങ്കിൽ പാരി പാളികളായി പ്ളോട്ടുകൾ ഉണ്ടാക്കുക\n",
"* മരണ നിരക്ക് എത്രമാണ് എന്ന് കണക്കാക്കി അത് സമയത്തിനുസരിച്ച് എങ്ങനെ മാറുന്നു എന്ന് കണ്ടു herausfinden ചെയ്യുക. കണക്കുകൾ ചെയ്യുന്നതിന് മുൻപ് രോഗത്തിന്റെ ദിവസങ്ങളുടെ ദൈർഘ്യം കൂടി പരിഗണിക്കാൻ നിങ്ങൾക്ക് ആവശ്യം ഉണ്ടാകും.\n"
"* മരണസംഖ്യയും മടങ്ങിവരവ് സംഖ്യയും संक्रमितരുടെ എണ്ണത്തോടുള്ള ബന്ധം കാണുക.\n",
"* ഒരു സാധാരണ രോഗം എത്രകാലം നീളുന്നത് എന്നത് കണ്ടെത്താൻ, അണുബാധ നിരക്കും മരണം നിരക്കും കാഴ്ചവൈകുന്ന ബാലമായ ബന്ധം കണ്ടെത്തി ചില അസാധാരണത്വങ്ങൾ പരിശോധിക്കുക. കണ്ടെത്താന് വിവിധ രാജ്യങ്ങളിൽ നോക്കേണ്ടതുണ്ടാകാം.\n",
"* മരണസംഖ്യ നിരക്കും അത് സമയവുമായി എങ്ങനെ മാറുന്നു എന്നതും കണക്കാക്കുക. ഒരു സമയഘട്ടം മാറ്റി നോക്കുന്നതിനായി രോഗത്തിന്റെ ദൈർഘ്യം ദിവസങ്ങളിൽ പരിഗണിക്കണം.\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## References\n",
"## റഫറൻസുകൾ\n",
"\n",
"\n",
"You may look at further studies of COVID epidemic spread in the following publications:\n",
"താഴെപ്പറയുന്ന പ്രസിദ്ധീകരണങ്ങളിൽ COVID മഹാമാരിയുടെ പടർച്ചയെക്കുറിച്ചുള്ള കൂടുതൽ പഠനങ്ങൾ കാണാൻ കഴിയും:\n",
"* [COVID മഹാമാരികാലത്ത് Rt അളക്കുന്നതിനുള്ള സ്ലൈഡിംഗ് SIR മോഡൽ](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com) എഴുതിയ ബ്ലോഗ് പോസ്റ്റ്\n",
"* [COVID മഹാമാരിക്കാലത്ത് Rt അളക്കുന്നതിനുള്ള സ്ലൈഡിംഗ് SIR മോഡൽ](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com) എഴുതിയ ബ്ലോഗ് പോസ്റ്റ്\n",
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**വ്യക്തീകരണം**: \nഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തിരിക്കുന്നു. ഞങ്ങൾ കൃത്യതയ്ക്ക് ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് വിവർത്തനങ്ങളിൽ പിഴവുകളും തെറ്റായ വിവരണങ്ങളും ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. യഥാർത്ഥ രേഖ അതിന്റെ സാദ്ധ്യതമാന ഭാഷയിൽ നിന്നുള്ളത് അതിന്റെ പ്രാമാണികമായ ഉറവിടമായി കണക്കാക്കപ്പെടണം. അത്യാവശ്യമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മാനുഷിക വിവർത്തനം നിർദേശിക്കുന്നു. ഈ വിവർത്തനം ഉപയോഗിക്കുന്നതിലൂടെ ഉണ്ടായ οποδήποτε തെറ്റുകാര്യങ്ങൾക്കും ഞങ്ങൾ ഉത്തരവാദികളല്ല.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**അറിയിപ്പ്**:\nഈ രേഖ AI പരിഭാഷാ സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
# ഡേഞ്ചറസ് ലിയാസൺസ് ഡാറ്റാ വിഷ്വലൈസേഷൻ പ്രോജക്റ്റ്
ആരംഭിക്കാൻ, നിങ്ങളുടെ മെഷീനിൽ NPMയും Nodeയും പ്രവർത്തനക്ഷമമാണെന്ന് ഉറപ്പാക്കണം. ഡിപ്പൻഡൻസികൾ ഇൻസ്റ്റാൾ ചെയ്യുക (npm install) പിന്നെ പ്രോജക്ട് ലോക്കലായി റൺ ചെയ്യുക (npm run serve):
ആരംഭിക്കാൻ, നിങ്ങളുടെ യന്ത്രത്തിൽ NPMയും Node **>=20.0.0** നും പ്രവർത്തിക്കുന്നതായി ഉറപ്പാക്കേണ്ടതാണ്. ആശ്രിതങ്ങൾ ഇൻസ്റ്റാൾ ചെയ്യുക (npm install) പിന്നെ പ്രോജക്റ്റ് ലോക്കലായി പ്രവർത്തിപ്പിക്കുക (npm run serve):
## പ്രോജക്ട് സെറ്റപ്പ്
## പ്രോജക്റ്റ് ക്രമീകരണം
```
```
npm install
npm install
```
```
### ഡെവലപ്പ്മെന്റിനായി കോമ്പൈൽ ചെയ്ത് ഹോട്ട്-റീലോഡ് ചെയ്യുന്നു
### വികസനത്തിനായി കോംപൈൽ ചെയ്യുകയും ഹോട്ട്-റീലോഡ് നടത്തുകയും ചെയ്യുന്നു
```
```
npm run serve
npm run serve
```
```
### പ്രൊഡക്ഷനായി കോമ്പൈൽ ചെയ്ത് മിനിഫൈ ചെയ്യുന്നു
### നിർമ്മാണത്തിനായി കോംപൈൽ ചെയ്ത് മിനിഫൈ ചെയ്യുന്നു
ഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖ പ്രാമാണികമായ ഉറവിടമായി കണക്കാക്കണം. നിർണായക വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനത്തിന്റെ ഉപയോഗത്തിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല.
ഈ രേഖ AI പരിഭാഷാ സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.
ആരംഭിക്കാൻ, നിങ്ങളുടെ മെഷീനിൽ NPMയും Nodeയും പ്രവർത്തനക്ഷമമാണെന്ന് ഉറപ്പാക്കണം. ഡിപ്പൻഡൻസികൾ ഇൻസ്റ്റാൾ ചെയ്യുക (npm install) പിന്നെ പ്രോജക്ട് ലോക്കലായി റൺ ചെയ്യുക (npm run serve):
തുടങ്ങാൻ, നിങ്ങളുടെ മെഷീനിൽ NPM ഒപ്പം Node **>=20.0.0** പ്രവർത്തിക്കുകയാണെന്നു ഉറപ്പാക്കണം. ഉപയോഗിച്ചും (npm install) അനിവാര്യമായ ഡിപ്പൻഡൻസികൾ ഇൻസ്റ്റാൾ ചെയ്ത് തുടർന്ന് പ്രോജക്റ്റ് ലോക്കലി പ്രവർത്തിപ്പിക്കുക (npm run serve):
## പ്രോജക്ട് സെറ്റപ്പ്
## പ്രോജക്ട് സെറ്റപ്പ്
```
```
npm install
npm install
```
```
### ഡെവലപ്പ്മെന്റിനായി കോമ്പൈൽ ചെയ്ത് ഹോട്ട്-റീലോഡ് ചെയ്യുന്നു
### ഡവലപ്പ്മെന്റിനായി കമ്പൈൽ ചെയ്ത് ഹോട്ട്-റീലോഡ് ചെയ്യുന്നു
ഈ രേഖ AI വിവർത്തന സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, സ്വയം പ്രവർത്തിക്കുന്ന വിവർത്തനങ്ങളിൽ പിശകുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. അതിന്റെ മാതൃഭാഷയിലുള്ള യഥാർത്ഥ രേഖ പ്രാമാണികമായ ഉറവിടമായി കണക്കാക്കണം. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനത്തിന്റെ ഉപയോഗത്തിൽ നിന്നുണ്ടാകുന്ന ഏതെങ്കിലും തെറ്റിദ്ധാരണകൾക്കോ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കോ ഞങ്ങൾ ഉത്തരവാദികളല്ല.
ഈ രേഖ AI പരിഭാഷാ സേവനം [Co-op Translator](https://github.com/Azure/co-op-translator) ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.
| ](../../sketchnotes/03-DefiningData.png)|
| ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|:---:|
|డేటా నిర్వచనం - _Sketchnote by [@nitya](https://twitter.com/nitya)_ |
|డేటాను నిర్వచించడం - _స్కెచ్ నోట్ by [@nitya](https://twitter.com/nitya)_ |
డేటా అనేది నిజాలు, సమాచారం, పరిశీలనలు మరియు కొలతలు, ఇవి ఆవిష్కరణలు చేయడానికి మరియు సమాచారంతో కూడిన నిర్ణయాలను మద్దతు ఇవ్వడానికి ఉపయోగిస్తారు. ఒక డేటా పాయింట్ అనేది ఒక డేటాసెట్లోని ఒకే ఒక డేటా యూనిట్, ఇది డేటా పాయింట్ల సేకరణ. డేటాసెట్లు వివిధ ఫార్మాట్లు మరియు నిర్మాణాలలో ఉండవచ్చు, మరియు సాధారణంగా దాని మూలం లేదా డేటా ఎక్కడినుంచి వచ్చింది అనే ఆధారంగా ఉంటాయి. ఉదాహరణకు, ఒక కంపెనీ యొక్క నెలవారీ ఆదాయం స్ప్రెడ్షీట్లో ఉండవచ్చు కానీ స్మార్ట్వాచ్ నుండి గంటలవారీ గుండె రేటు డేటా [JSON](https://stackoverflow.com/a/383699) ఫార్మాట్లో ఉండవచ్చు. డేటా శాస్త్రవేత్తలు సాధారణంగా ఒక డేటాసెట్లోని వివిధ రకాల డేటాతో పని చేస్తారు.
డేటా అనేది నిజాలు, సమాచారం, పరిశీలనలు మరియు కొలమానాలు, ఇవి ఆవిష్కరణలను చేయడానికి మరియు సమాచార ఆధారిత నిర్ణయాలను తీసుకోవడానికి ఉపయోగించబడతాయి. ఒక డేటా పాయింట్ అనేది ఒక డేటాసెట్లో ఉన్న ఒకే ఒక డేటా యూనిట్, ఇది డేటా పాయింట్ల సేకరణ. డేటాసెట్లు వివిధ ఫార్మాట్లు మరియు నిర్మాణాల్లో ఉండవచ్చు, మరియు సాధారణంగా వాటి మూలం లేదా డేటా ఎక్కడని ఆధారంగా ఉంటాయి. ఉదాహరణకి, ఒక కంపెనీ నెలవారీ ఆదాయం ఒక స్ప్రెడ్షీట్లో ఉండొచ్చు, కానీ స్మార్ట్వాచ్ నుండి గంటలవారీ గుండె రేటు డేటా [JSON](https://stackoverflow.com/a/383699) ఫార్మాట్లో ఉండొచ్చు. డేటా శాస్త్రవేత్తలు ఒక డేటాసెట్లో వేరే వేరే రకాల డేటాతో పని చేయడం సాధారణం.
ఈ పాఠం డేటాను దాని లక్షణాలు మరియు మూలాల ద్వారా గుర్తించడం మరియు వర్గీకరించడం పై కేంద్రీకృతమైంది.
ఈ పాఠం డేటాను దాని లక్షణాలు మరియు మూలాల ద్వారా గుర్తించడం మరియు వర్గీకరించడం పై కేంద్రీకృతమైంది.
## [పాఠం మునుపటి పరిక్ష](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## డేటా ఎలా వివరించబడుతుంది
## డేటాను ఎలా వివరిస్తారు
### రా డేటా
### రా డేటా
రా డేటా అనేది దాని మూలం నుండి ప్రారంభ స్థితిలో వచ్చిన డేటా, ఇది విశ్లేషించబడలేదు లేదా సక్రమంగా ఏర్పాటు చేయబడలేదు. ఒక డేటాసెట్లో ఏమి జరుగుతుందో అర్థం చేసుకోవడానికి, అది మానవులు మరియు వారు ఉపయోగించే సాంకేతికతకు అర్థమయ్యే ఫార్మాట్లో సక్రమంగా ఏర్పాటు చేయబడాలి. ఒక డేటాసెట్ నిర్మాణం దాని ఏర్పాటు ఎలా ఉందో వివరిస్తుంది మరియు ఇది నిర్మిత, నిర్మిత కాని మరియు అర్ధ-నిర్మితంగా వర్గీకరించబడవచ్చు. ఈ నిర్మాణ రకాలు మూలం ఆధారంగా మారవచ్చు కానీ చివరికి ఈ మూడు వర్గాలలో సరిపోతాయి.
రా డేటా అనేది దాని మూలం నుండి ప్రారంభ స్థితిలో వచ్చిన డేటా, ఇది విశ్లేషించబడలేదు లేదా ఏర్పాటు చేయబడలేదు. ఒక డేటాసెట్లో జరుగుతున్నది ఏమిటో అర్థం చేసుకోవడానికి, దీన్ని మనుషులు కూడా సులభంగా అర్థం చేసుకునే విధంగా మరియు తదుపరి విశ్లేషణకు ఉపయోగించే సాంకేతికతలు కూడా ఉపయోగించగలిగే విధంగా అమర్చాలి. ఒక డేటాసెట్ నిర్మాణం అది ఎలా ఏర్పాటు చేయబడిందో వివరించి, ఇది నిర్మాణమయ్యింది, నిర్మాణరహితమో లేదా సెమీ-నిర్మాణరహితమో అని వర్గీకరించబడుతుంది. ఈ రకాల నిర్మాణం మూలం ఆధారంగా భిన్నంగా ఉంటాయి, కానీ తుది దృష్ట్యా ఈ మూడు వర్గాల్లో ఉంటాయి.
### పరిమాణాత్మక డేటా
### పరిమాణాత్మక డేటా
పరిమాణాత్మక డేటా అనేది డేటాసెట్లోని సంఖ్యాత్మక పరిశీలనలు మరియు సాధారణంగా విశ్లేషించబడవచ్చు, కొలవబడవచ్చు మరియు గణితంగా ఉపయోగించబడవచ్చు. పరిమాణాత్మక డేటా కొన్ని ఉదాహరణలు: ఒక దేశ జనాభా, ఒక వ్యక్తి ఎత్తు లేదా ఒక కంపెనీ త్రైమాసిక ఆదాయం. కొంత అదనపు విశ్లేషణతో, పరిమాణాత్మక డేటా వాయు నాణ్యత సూచిక (AQI) యొక్క సీజనల్ ట్రెండ్లను కనుగొనడానికి లేదా సాధారణ పని దినంలో రష్ అవర్ ట్రాఫిక్ సంభావ్యతను అంచనా వేయడానికి ఉపయోగించవచ్చు.
పరిమాణాత్మక డేటా అనేది సంఖ్యాత్మక గమనికలు, సాధారణంగా విశ్లేషించబడవచ్చు, కొలవబడవచ్చు మరియు గణితంగా ఉపయోగించబడవచ్చు. కొన్ని ఉదాహరణలు: ఒక దేశ జనాభా, ఒక వ్యక్తి ఎత్తు లేదా ఒక కంపెనీ త్రైమాసిక ఆదాయం. మరింత విశ్లేషణతో, పరిమాణాత్మక డేటాను వాతావరణ గుణాత్మక సూచిక (AQI) సీజనల్ ట్రెండ్స్ కనుగొనడానికి లేదా సాధారణ పనిరోజు ట్రాఫిక్ సంక్షోభం సంభావ్యత అంచనానికీ ఉపయోగించవచ్చు.
### గుణాత్మక డేటా
### గుణాత్మక డేటా
గుణాత్మక డేటా, లేదా వర్గీకృత డేటా, అనేది పరిమాణాత్మక డేటా పరిశీలనల లాగా ఆబ్జెక్టివ్గా కొలవలేని డేటా. ఇది సాధారణంగా వివిధ రకాల సబ్జెక్టివ్ డేటా, ఇది ఏదైనా వస్తువు లేదా ప్రక్రియ యొక్క నాణ్యతను పట్టుకుంటుంది. కొన్నిసార్లు, గుణాత్మక డేటా సంఖ్యాత్మకంగా ఉండవచ్చు కానీ సాధారణంగా గణితంగా ఉపయోగించబడదు, ఉదాహరణకు ఫోన్ నంబర్లు లేదా టైమ్స్టాంప్లు. గుణాత్మక డేటా కొన్ని ఉదాహరణలు: వీడియో వ్యాఖ్యలు, కారు తయారీ మరియు మోడల్ లేదా మీ అత్యంత సన్నిహిత మిత్రుల ఇష్టమైన రంగు. గుణాత్మక డేటా వినియోగదారులు ఏ ఉత్పత్తులను ఎక్కువగా ఇష్టపడతారో అర్థం చేసుకోవడానికి లేదా ఉద్యోగ దరఖాస్తు రిజ్యూమ్లలో ప్రాచుర్యం పొందిన కీవర్డ్లను గుర్తించడానికి ఉపయోగించవచ్చు.
గుణాత్మక డేటా, లేదా వర్గీకరణ డేటా గా కూడా పిలవబడుతుంది, ఇది పరిమాణాత్మక డేటా లక్షణాల లాంటి విధంగా కొలవబడలేదు. ఇది సాధారణంగా పదార్థం లేదా ప్రక్రియ యొక్క లక్షణాలను బంధించే అనేక రకాలు ఉన్న సాపేక్ష డేటా. కొన్ని గుణాత్మక డేటా సంఖ్యాత్మకంగావుండవచ్చు కానీ సాధారణంగా గణితంగా ఉపయోగించరు, ఉదాహరణకు ఫోన్ నంబర్లు లేదా టైమ్స్టాంప్లు. కొన్ని ఉదాహరణలు: వీడియో కామెంట్లు, ఒక కారు తయారీ మరియు మోడల్, లేదా మీ దగ్గరి స్నేహితుల ఇష్టమైన రంగు. గుణాత్మక డేటా వినియోగదారులు ఎక్కువగా ఇష్టపడే ఉత్పత్తులను అర్థం చేసుకోవడానికి లేదా ఉద్యోగ దరఖాస్తుకు సంబంధించిన ప్రముఖ కీవర్డ్లను గుర్తించడానికి ఉపయోగపడుతుంది.
### నిర్మిత డేటా
### నిర్మాణమైన డేటా
నిర్మిత డేటా అనేది వరుసలు మరియు కాలమ్స్లో ఏర్పాటు చేయబడిన డేటా, ప్రతి వరుసకు అదే కాలమ్ల సెట్ ఉంటుంది. కాలమ్స్ ఒక నిర్దిష్ట రకం విలువను సూచిస్తాయి మరియు ఆ విలువ ఏమిటో వివరిస్తూ ఒక పేరుతో గుర్తించబడతాయి, వరుసలు వాస్తవ విలువలను కలిగి ఉంటాయి. కాలమ్లకు విలువలపై నిర్దిష్ట నియమాలు లేదా పరిమితులు ఉండవచ్చు, విలువలు కాలమ్ను సరిగ్గా ప్రతిబింబించడానికి. ఉదాహరణకు, ఒక కస్టమర్ల స్ప్రెడ్షీట్లో ప్రతి వరుసకు ఫోన్ నంబర్ ఉండాలి మరియు ఫోన్ నంబర్లు ఎప్పుడూ అక్షరాలు కలిగి ఉండకూడదు. ఫోన్ నంబర్ కాలమ్పై నియమాలు ఉండవచ్చు, అది ఎప్పుడూ ఖాళీగా ఉండకూడదని మరియు కేవలం సంఖ్యలు మాత్రమే ఉండాలని.
నిర్మాణమైన డేటా అనగా వరుసలు మరియు కాలమ్స్లో అమర్చబడిన డేటా, ప్రతి వరుసలో అదే కాలమ్స్ ఉంటాయి. కాలమ్స్ ఒక నిర్దিষ্ট రకం విలువను ప్రాతినిధ్యం చేస్తాయి మరియు ఆ విలువ యొక్క వివరణ ఇచ్చే పేరు తో గుర్తింపబడతాయి, వరుసలు నిజమైన విలువలను కలిగి ఉంటాయి. కాలమ్ మీద విలువలపై కొన్ని నిబంధనలు ఉండవచ్చు, దీని ద్వారా విలువలు సరైన దృశ్యాన్ని అందిస్తాయి. ఉదాహరణకి, ఒక కస్టమర్ల స్ప్రెడ్షీట్లో ప్రతి వరుస ఫోన్ నంబరం కలిగి ఉండాలి, ఫోన్ నంబర్లు ఎప్పుడూ అక్షరాలు ఉండవు. ఫోన్ నంబర్ కాలమ్ ఎప్పుడూ ఖాళీగా ఉండకూడదు మరియు సంఖ్యలను మాత్రమే కలిగి ఉండాలి అనే నియమాలు ఉండవచ్చు.
నిర్మిత డేటా లాభం ఏమిటంటే, ఇది ఇతర నిర్మిత డేటాతో సంబంధం కలిగి ఉండే విధంగా ఏర్పాటు చేయబడవచ్చు. అయితే, డేటా ఒక నిర్దిష్ట విధంగా ఏర్పాటు చేయబడినందున, దాని మొత్తం నిర్మాణంలో మార్పులు చేయడం చాలా కష్టంగా ఉంటుంది. ఉదాహరణకు, ఖాళీగా ఉండకూడని ఇమెయిల్ కాలమ్ను కస్టమర్ స్ప్రెడ్షీట్లో జోడించడం అంటే, ఈ విలువలను ఇప్పటికే ఉన్న కస్టమర్ వరుసలకు ఎలా జోడించాలో మీరు ఆలోచించాలి.
నిర్మాణమైన డేటాకు లాభం: ఇది ఇతర నిర్మాణమైన డేటాతో సంబంధం కలిగి ఉండే విధంగా అమర్చబడవచ్చు. అయితే, డేటా ఒక నిర్దిష్ట విధంగా అమర్చబడినందున, దాని మొత్తం నిర్మాణాన్ని మార్చడం కష్టం అయ్యే అవకాశం ఉంది. ఉదాహరణకి, కస్టమర్ స్ప్రెడ్షీట్లో ఖాళీగా ఉండకూడని ఇమెయిల్ కాలమ్ని చేర్చాలంటే, మీరు ఈ విలువలను ఇప్పటికే ఉన్న కస్టమర్ వరుసలకు ఎలా జోడించాలి అనేది నిర్ణయించుకోవాలి.
నిర్మిత డేటా ఉదాహరణలు: స్ప్రెడ్షీట్లు, రిలేషనల్ డేటాబేసులు, ఫోన్ నంబర్లు, బ్యాంక్ స్టేట్మెంట్లు
నిర్మాణమైన డేటా ఉదాహరణలు: స్ప్రెడ్షీట్స్, సంబంధిత డేటాబేస్లు, ఫోన్ నంబర్లు, బ్యాంక్ స్టేట్మెంట్లు
### నిర్మిత కాని డేటా
### నిర్మాణరకమైన డేటా
నిర్మిత కాని డేటా సాధారణంగా వరుసలు లేదా కాలమ్లుగా వర్గీకరించలేం మరియు దానికి అనుసరించాల్సిన ఫార్మాట్ లేదా నియమాలు ఉండవు. నిర్మిత కాని డేటాకు నిర్మిత డేటాతో పోలిస్తే తక్కువ పరిమితులు ఉండటంతో కొత్త సమాచారాన్ని జోడించడం సులభం. ఉదాహరణకు, ప్రతి 2 నిమిషాలకు బారోమెట్రిక్ ప్రెషర్ను కొలిచే సెన్సార్ ఇప్పుడు ఉష్ణోగ్రతను కొలవడానికి మరియు రికార్డ్ చేయడానికి అప్డేట్ పొందినట్లయితే, అది నిర్మిత కాని డేటా అయితే ఇప్పటికే ఉన్న డేటాను మార్చాల్సిన అవసరం లేదు. అయితే, ఈ రకమైన డేటాను విశ్లేషించడం లేదా పరిశీలించడం ఎక్కువ సమయం తీసుకోవచ్చు. ఉదాహరణకు, ఒక శాస్త్రవేత్త గత నెల సగటు ఉష్ణోగ్రతను కనుగొనాలనుకుంటే, సెన్సార్ కొన్ని రికార్డ్ చేసిన డేటాలో "e" అనే అక్షరాన్ని నమోదు చేసి అది సెన్సార్ బిగ్గరగా పనిచేయలేదని సూచిస్తే, డేటా అసంపూర్ణంగా ఉంటుంది.
నిర్మాణరకమైన డేటాతో కోషాలని లేదా కాలమ్స్ లో విడగొట్టలేము మరియు ఇది ఫార్మాట్ లేదా నియమాలు కలిగి ఉండదు. దీనికి నిర్మాణం పట్ల తక్కువ ఆంక్షలు ఉండటంతో, కొత్త సమాచారాన్ని జోడించడం సులభం. ఉదాహరణకు ఒక్కో రెండు నిమిషాలకు బారోమెట్రిక్ ప్రెషర్ని కొలిచే సెన్సార్ ఇప్పుడు ఉష్ణోగ్రత కొలవటం ప్రారంభిస్తే, ఇది నిర్మాణరకమైన డేటా అయితే ఉన్న డేటాలో మార్పులు చేయాల్సిన అవసరం ఉండదు. అయితే, ఈ రకమైన డేటాను విశ్లేషించడానికి స్వల్ప సమయం ఎక్కువ కావచ్చు. ఉదాహరణకి, శాస్త్రవేత్త ఒక నెల ఉష్ణోగ్రత సగటును కనుగొనాలని ప్రయత్నిస్తుండగా, కొంత డేటాలో సెన్సార్ బ్రోకెన్ ఉన్నట్టు చూపించడానికి "e" అనే అక్షరం వాడింది కనుగొనడం వల్ల డేటా అపూర్ణంగా ఉంటుంది.
నిర్మిత కాని డేటా ఉదాహరణలు: టెక్స్ట్ ఫైళ్లు, టెక్స్ట్ సందేశాలు, వీడియో ఫైళ్లు
నిర్మాణరకమైన డేటా ఉదాహరణలు: టెక్స్ట్ ఫైళ్ళు, టెక్స్ట్ మెసేజ్లు, వీడియో ఫైళ్ళు
### అర్ధ-నిర్మిత డేటా
### సెమీ-నిర్మాణమైన డేటా
అర్ధ-నిర్మిత డేటాకు నిర్మిత మరియు నిర్మిత కాని డేటా లక్షణాలు కలవు. ఇది సాధారణంగా వరుసలు మరియు కాలమ్ల ఫార్మాట్కు అనుగుణంగా ఉండదు కానీ నిర్మితంగా పరిగణించదగిన విధంగా ఏర్పాటు చేయబడుతుంది మరియు ఒక స్థిరమైన ఫార్మాట్ లేదా నియమాలను అనుసరించవచ్చు. నిర్మాణం మూలాల మధ్య మారవచ్చు, ఉదాహరణకు బాగా నిర్వచించబడిన హైరార్కీ నుండి కొత్త సమాచారాన్ని సులభంగా సమ్మిళితం చేయడానికి అనువైన మరింత సౌకర్యవంతమైనది వరకు. మెటాడేటా అనేది డేటా ఎలా ఏర్పాటు చేయబడిందో మరియు నిల్వ చేయబడిందో నిర్ణయించడంలో సహాయపడే సూచికలు మరియు డేటా రకంపై ఆధారపడి వివిధ పేర్లతో ఉంటాయి. సాధారణ మెటాడేటా పేర్లు: ట్యాగ్లు, ఎలిమెంట్లు, ఎంటిటీలను మరియు లక్షణాలు. ఉదాహరణకు, ఒక సాధారణ ఇమెయిల్ సందేశానికి ఒక విషయం, శరీరం మరియు రిసిపియెంట్ల సెట్ ఉంటుంది మరియు ఎవరు లేదా ఎప్పుడు పంపారో ఆధారంగా ఏర్పాటు చేయబడవచ్చు.
సెమీ-నిర్మాణమైన డేటా అనేది నిర్మాణమైన మరియు నిర్మాణరకమైన డేటా యొక్క మిశ్రమం. ఇది సాధారణంగా వరుసలు మరియు కాలమ్స్ ఫార్మాట్లో ఉండదు, కానీ ఒక నిర్దిష్ట నిర్మాణంలో అమర్చబడుతుంది మరియు ఒక నిర్దిష్ట ఫార్మాట్ లేదా నియమాలను అనుసరిస్తుంది. మూలాల మధ్య నిర్మాణం మారుతూ ఉంటుంది, అందులో మెటాడేటా అనే సూచనలు ఉంటాయి, ఇవి డేటా ఎలా అమర్చబడిందో నిర్ధారిస్తాయి. మెటాడేటాకు వివిధ పేర్లు ఉంటాయి, ఉదాహరణకు ట్యాగ్లు, ఎలిమెంట్లు, ఎంటిటీస్, అట్రిబ్యూట్లు. ఉదాహరణకి సాధారణ ఇమెయిల్ సందేశం సబ్జెక్ట్, బాడీ, రిసిపియంట్ లతో ఉంటుంది మరియు ఆ సందేశం ఎవరికి, ఎప్పుడు పంపామో ఆధారంగా అమర్చవచ్చు.
అర్ధ-నిర్మిత డేటా ఉదాహరణలు: HTML, CSV ఫైళ్లు, జావాస్క్రిప్ట్ ఆబ్జెక్ట్ నోటేషన్ (JSON)
సెమీ-నిర్మాణమైన డేటా ఉదాహరణలు: HTML, CSV ఫైళ్ళు, జావాస్క్రిప్ట్ ఆబ్జెక్ట్ నోటేషన్ (JSON)
## డేటా మూలాలు
## డేటా మూలాలు
డేటా మూలం అనేది డేటా ఉత్పత్తి అయిన ప్రాథమిక స్థలం లేదా అది "ఉండే" ప్రదేశం, మరియు అది ఎప్పుడు మరియు ఎలా సేకరించబడిందో ఆధారంగా మారుతుంది. దాని వినియోగదారులచే ఉత్పత్తి చేయబడిన డేటాను ప్రాథమిక డేటా అంటారు, మరియు సాధారణ ఉపయోగం కోసం సేకరించిన మూలం నుండి వచ్చిన డేటాను ద్వితీయ డేటా అంటారు. ఉదాహరణకు, ఒక వనవిల్లు లో పరిశీలనలు సేకరించే శాస్త్రవేత్తల సమూహం ప్రాథమికంగా పరిగణించబడుతుంది, మరియు వారు ఇతర శాస్త్రవేత్తలతో పంచుకుంటే, అది ఆ వినియోగదారులకు ద్వితీయంగా పరిగణించబడుతుంది.
డేటా మూలం అనగా డేటా ఉత్పత్తి అయిన ప్రాథమిక స్థానం, లేదా అది "లైవ్" గా ఉన్న ప్రదేశం. ఇది ఎక్కడ మరియు ఎప్పుడు సంగ్రహించబడిందనిపై ఆధారపడి ఉంటుంది. ఉపయోగదారులచే ఉత్పత్తి చేయబడిన డేటాను ప్రాథమిక డేటా అంటారు, అయితే సాధారణ ఉపయోగం కోసం సేకరించిన మూలం నుండి వచ్చిన డేటా ద్వితీయ డేటా. ఉదాహరణకి, ఒక సమూహం శాస్త్రవేత్తలు వానవనంలో గమనికలు సేకరిస్తే, అది ప్రాథమిక డేటా, అవి ఇతర శాస్త్రవేత్తలకు ఉపయోగం కోసం పంచితే, అది వాటి వైపు నుండి ద్వితీయ డేటా.
డేటాబేసులు సాధారణ మూలాలు మరియు డేటాను హోస్ట్ చేయడానికి మరియు నిర్వహించడానికి డేటాబేస్ మేనేజ్మెంట్ సిస్టమ్పై ఆధారపడి ఉంటాయి, వినియోగదారులు క్వెరీలు అనే ఆదేశాలను ఉపయోగించి డేటాను అన్వేషిస్తారు. ఫైళ్లు డేటా మూలాలుగా ఆడియో, చిత్రం, వీడియో ఫైళ్లు మరియు ఎక్సెల్ వంటి స్ప్రెడ్షీట్లు ఉండవచ్చు. ఇంటర్నెట్ మూలాలు డేటాను హోస్ట్ చేయడానికి సాధారణ ప్రదేశం, ఇక్కడ డేటాబేసులు మరియు ఫైళ్లు రెండూ ఉండవచ్చు. అప్లికేషన్ ప్రోగ్రామింగ్ ఇంటర్ఫేసులు (APIs) ప్రోగ్రామర్లకు ఇంటర్నెట్ ద్వారా బాహ్య వినియోగదారులతో డేటాను పంచుకునే మార్గాలను సృష్టించడానికి అనుమతిస్తాయి, మరియు వెబ్ స్క్రాపింగ్ ప్రక్రియ వెబ్ పేజీ నుండి డేటాను తీసుకుంటుంది. [డేటాతో పని చేయడం](../../../../../../../../../2-Working-With-Data) పాఠాలు వివిధ డేటా మూలాలను ఎలా ఉపయోగించాలో కేంద్రీకృతమై ఉన్నాయి.
డేటాబేస్లు సాధారణ మూలాలు మరియు డేటాను నిల్వ చేయడానికి డేటాబేస్ మేనేజ్మెంట్ సిస్టమ్పై ఆధారపడతాయి, ఇక్కడ వినియోగదారులు "క్వెరీలు" అనే కమాండ్లతో డేటాను అన్వేషిస్తారు. ఫైళ్ళు కూడా డేటా మూలాలు కాగా, అవి ఆడియో, చిత్రాలు, వీడియో ఫైళ్ళతో పాటు ఎక్సెల్ వంటి స్ప్రెడ్షీట్లుగా ఉండవచ్చు. ఇంటర్నెట్ మూలాలు సాధారణంగా డేటా నిల్వ చేసే ప్రదేశాలు, అంతలో డేటాబేసులు మరియు ఫైళ్ళు ఉంటాయి. అప్లికేషన్ ప్రోగ్రామింగ్ ఇంటర్ఫేసులు (APIs) ప్రోగ్రామర్లకు ఇంటర్నెట్ ద్వారా బాహ్య వినియోగదారులతో డేటా పంచుకోవడానికి మార్గాలను సృష్టించేందుకు అనుమతిస్తాయి, మరొకవైపు వెబ్ స్క్రాపింగ్ అనే ప్రక్రియ వెబ్ పేజీ నుండి డేటా తరగిస్తుంది. [డేటాతో పని చేయడం](../../../../../../../../../2-Working-With-Data) పాఠాలు వివిధ డేటా మూలాలను ఎలా ఉపయోగించాలో చెప్పేవి.
## ముగింపు
## ముగింపు
ఈ పాఠంలో మనం నేర్చుకున్నాం:
ఈ పాఠంలో మేము నేర్చుకున్నాం:
- డేటా అంటే ఏమిటి
- డేటా అంటే ఏమిటి
- డేటా ఎలా వివరించబడుతుంది
- డేటాను ఎలా వివరిస్తారు
- డేటా ఎలా వర్గీకరించబడుతుంది మరియు వర్గాలుగా విభజించబడుతుంది
- డేటాను ఎలా వర్గీకరించడం మరియు వర్గీకరించడం
- డేటా ఎక్కడ కనుగొనవచ్చు
- డేటాను ఎక్కడ పొందవచ్చు
## 🚀 సవాలు
## 🚀 సవాలు
Kaggle అనేది ఓపెన్ డేటాసెట్లకు అద్భుతమైన మూలం. [డేటాసెట్ శోధన సాధనం](https://www.kaggle.com/datasets) ఉపయోగించి కొన్ని ఆసక్తికరమైన డేటాసెట్లను కనుగొని ఈ ప్రమాణాలతో 3-5 డేటాసెట్లను వర్గీకరించండి:
క్యాగుల్ ఓపెన్ డేటాసెట్స్కి అద్భుతమైన మూలం. [డేటాసెట్ సెర్చ్ టూల్](https://www.kaggle.com/datasets) ను ఉపయోగించి కొన్ని ఆసక్తికరమైన డేటాసెట్లను కనుగోలు చేసి క్రింది ప్రమాణాలతో 3-5 డatasets వర్గీకరించండి:
- డేటా పరిమాణాత్మకమా లేదా గుణాత్మకమా?
- డేటా పరిమాణాత్మకమనా లేదా గుణాత్మకమా?
- డేటా నిర్మితమా, నిర్మిత కాని, లేదా అర్ధ-నిర్మితమా?
- డేటా నిర్మాణమైనది, నిర్మాణరకమైనది లేదా సెమీ-నిర్మాణమైనది?
- ఈ Microsoft Learn యూనిట్, [మీ డేటాను వర్గీకరించండి](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) అనే శీర్షికతో, నిర్మిత, అర్ధ-నిర్మిత మరియు నిర్మిత కాని డేటా యొక్క వివరమైన విభజనను కలిగి ఉంది.
- ఈ Microsoft Learn యూనిట్, [డేటా ఫార్మాట్లను గుర్తించడం](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) గా పిలవబడేది, నిర్మాణమైన, సెమీ-నిర్మాణమైన మరియు నిర్మాణరకమైన డేటా యొక్క సమగ్ర వివరణను కలిగి ఉంది.
## అసైన్మెంట్
## అసైన్మెంట్
[డేటాసెట్ల వర్గీకరణ](assignment.md)
[డేటాసెట్స్ వర్గీకరణ](assignment.md)
---
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**అస్పష్టత**:
**అస్వీకరణ**:
ఈ పత్రాన్ని AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పిదాలు ఉండవచ్చు. మూల పత్రం దాని స్వదేశీ భాషలో అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదం వాడకంలో ఏర్పడిన ఏవైనా అపార్థాలు లేదా తప్పుదారుల కోసం మేము బాధ్యత వహించము.
ఈ పత్రం AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.
"ఈ నోట్బుక్లో, మనం మునుపటి చర్చించిన కొన్ని భావాలను అన్వయించుకుంటాము. Probability మరియు Statistics నుండి అనేక భావనలు Python లోని ముఖ్యమైన డేటా ప్రాసెసింగ్ గ్రంధాలయాలలో, ఉదాహరణకు `numpy` మరియు `pandas` లో బాగా సూచించబడ్డాయి.\n"
"ఈ నోట్బుక్లో, మనం మునుపటి చర్చించిన కొన్ని సూత్రాలతో ఆడుకునే అవకాశం ఉంది. అవకాశం మరియు గణాంకాల నుండి వచ్చిన అనేక సూత్రాలు Python లో డేటా ప్రాసెసింగ్ కోసం ఉపయోగించే ప్రధాన లైబ్రరీలు అయిన `numpy` మరియు `pandas` లో బాగా ప్రతినిధ్యం వహిస్తున్నాయి.\n"
]
]
},
},
{
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## రాండమ్ వేరియబుల్స్ మరియు పంపిణీలు\n",
"## యాదృచ్ఛిక చారాలు మరియు పంపిణీలు\n",
"0 నుండి 9 వరకు ఉన్న యూనిఫారం పంపిణితం నుండి 30 విలువల నమూనాను చూపడం ప్రారంభిద్దాం. మేము సగటు మరియు వ్యత్యాసాన్ని కూడా లెక్కించబోతున్నాం.\n"
"0 నుండి 9 వరకు సమాన పంపిణి నుండి 30 విలువల నమూనాను చిత్రించడం ప్రారంభిద్దాం. మేము కూడా సగటు మరియు వ్యత్యాసాన్ని గ есепించబోతున్నాం.\n"
]
]
},
},
{
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"నమూనాలో ఎంతమేర విలువలు ఉన్నాయో దృష్టిగావ చూడటానికి, మనము **హిస్టోగ్రామ్**ని చిత్రించవచ్చు:\n"
"నమూనాలో ఎన్ని విభిన్న విలువలు ఉన్నాయో దృష్టిగతంగా అంచనా వేయడానికి, మనం **హిస్టోగ్రాం**ను చిత్రించవచ్చు:\n"
]
]
},
},
{
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## నిజమైన డేటాను విశ్లేషించడం\n",
"## వాస్తవ డేటాను విశ్లేషించడం\n",
"\n",
"\n",
"నిజమైన ప్రపంచ డేటాను విశ్లేషించేటప్పుడు సగటు మరియు వ్యత్యాసం చాలా ముఖ్యమైనవి. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) నుండి బేస్బాల్ ప్లేయర్ల సంబంధిత డేటాను లోడ్ చేద్దాం\n"
"గుణాత్మక మరియు మార్పిడి విలువలు వాస్తవ ప్రపంచ డేటాను విశ్లేషించేటప్పుడు చాలా ముఖ్యమైనవి. [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights) నుండి బేస్బాల్ క్రీడాకారుల గురించి డేటాను లోడ్ చేద్దాం\n"
]
]
},
},
{
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> మేము ఇక్కడ డేటా విశ్లేషణ కోసం [**Pandas**](https://pandas.pydata.org/) అనే ప్యాకేజ్ని ఉపయోగించుకుంటున్నాము. ఈ కోర్సులో తరువాత Pandas మరియు Pythonలో డేటాతో పని గురించి మరింత చర్చిస్తాము.\n",
"> మేము ఇక్కడ డేటా విశ్లేషణ కోసం [**Pandas**](https://pandas.pydata.org/) అనే ప్యాకేజ్ ఉపయోగిస్తున్నాము. ఈ కోర్సులో తర్వాత Pandas మరియు Pythonలో డేటాతో పని చేయడం గురించి మరింత extensively మాట్లాడబోతున్నాం.\n",
"\n",
"\n",
"వయస్సు, ఎత్తు మరియు బరువు కోసం సగటు విలువలను లెక్కించుదాం:\n"
"వయస్సు, ఎత్తు మరియు బరువు కోసం సగటు విలువలను లెక్కించుకుందాం:\n"
]
]
},
},
{
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ఇప్పుడు మనము ఎత్తుపై దృష్టి సారించి, ప్రామాణిక విచలనం మరియు వ్యత్యాసాన్ని లెక్కించుకుందాం:\n"
"ఇప్పుడు మనం ఎత్తుపై ఆసక్తి కనబరుస్తాము, మరియు ప్రామాణిక రొట్టడింపు మరియు వ్యత్యాసం లెక్కించండి: \n"
]
]
},
},
{
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"సగటు విలువ తప్ప ఇప్పటి మధ్య విలువ మరియు క్వార్టైళ్లను చూసుకోవడం కూడా అర్థవంతమైంది. వాటిని **బాక్స్ ప్లాట్** ఉపయోగించి దృశ్య రూపంలో చూపించవచ్చు:\n"
"సగటుకు అదనంగా, మధ్య విలువ మరియు క్వార్టైల్లను చూసుకోవడం తగినది. వాటిని **బాక్స్ ప్లాట్** ఉపయోగించి దర్శించవచ్చు:\n"
"మనం మా డేటాసెట్ యొక్క ఉపసమూహాల బాక్స్ ప్లాట్లు కూడా తయారు చేయవచ్చు, ఉదాహరణకు, ప్లేయర్ పాత్ర ఆధారంగా గ్రూప్ చేయబడినవి.\n"
"మన డేటాసెట్ యొక్క ఉపసెట్ల బాక్స్ ప్లాట్లు కూడా తయారు చేసుకోవచ్చు, ఉదాహరణకు, ప్లేయర్ పాత్ర ఆధారంగా సమూహీకరించి.\n"
]
]
},
},
{
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> **గమనిక**: ఈ диаг్రామ్ సూచిస్తోంది, సగటున, ఫస్ట్ బేస్ మ్యాన్ల పొడవు సెకండ్ బేస్ మ్యాన్ల పొడవు కంటే ఎక్కువ ఉంటుందని. తరువాత మనం ఈ సార్ధకతను మరింత అధికారికంగా ఎలా పరీక్షించాలో, మరియు మన డేటా గణాంకపరంగా సార్ధకమైనదని ఎలా నిరూపించాలో నేర్చుకుంటాము. \n",
"> **గమనిక**: ఈ రేఖాచిత్రం సూచించేది, సగటున, మొదటి బేస్మెన్ قدలు రెండవ బేస్మెన్స్ కంటే ఎక్కువ ఉంటాయని. తరువాత మేము ఈ సిద్ధాంతాన్ని మరింత అధికారికంగా ఎలా పరీక్షించవచ్చో, మరియు మా డేటా గణాంకపూర్వకంగా ముఖ్యమైనదని ఎలా చూపించవచ్చో నేర్చుకోబోతున్నాము. \n",
"\n",
"\n",
"వయసు, పొడవు మరియు బరువు అన్నీ నిరంతర రాండమ్ వేరియబుల్లు. అవి ఎలా పంపిణీ అవుతాయనుకుంటున్నారు? వాటి పంపిణీని గమ్యం చేసుకోవడానికి మంచి మార్గం విలువల హిస్టోగ్రామ్ను గీయడమటే: \n"
"వయస్సు, ఎత్తు మరియు బరువు అన్నీ కొనసాగుతున్న యాదృచ్ఛిక మార్పులు. వాటి పంపిణీ ఏమిటి అనుకుంటున్నారా? ఒక మంచి మార్గం, విలువల యొక్క హిస్టోగ్రామ్ను వ్రచడం: \n"
]
]
},
},
{
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## సాధారణ విభజన\n",
"## సస్సా పంపిణీ\n",
"\n",
"\n",
"మన నిజమైన డేటాతోనే సగటు మరియు వ్యత్యాసం కలిగిన సాధారణ విభజనను అనుసరించే బరువుల искусственном నమూనాను సృష్టించుకుందాం:\n"
"మన వాస్తవ డేటాతో ఇదే సగటు మరియు విచలనం కలిగిన సుస్సా పంపిణీని అనుసరించే బరువు యొక్క ఒక కృత్రిమ నమూనాను తయారు చేద్దాం:\n"
]
]
},
},
{
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"వాస్తవ జీవితంలో ఎక్కువ విలువలు సాధారణంగా పంపిణీ అవుతాయి కనుక, నమూనా డేటాను సృష్టించడానికి ఒక సమాన రాండమ్ సంఖ్య జనరేటర్ ను ఉపయోగించకూడదు. సమాన పంపిణీతో బరువులను సృష్టించాలని ప్రయత్నిస్తే, ( `np.random.rand` ద్వారా సృష్టించబడిన):\n"
"నిజ జీవితం లో ఎక్కువ భాగం విలువలు సాధారణంగా పంపిణీ చేయబడతాయి కాబట్టి, నమూనా డేటా ఉత్పత్తి చేయడానికి సమాన రాండమ్ సంఖ్య జనరేటర్ను ఉపయోగించకూడదు. సమాన పంపిణీతో బరువులను ఉత్పత్తి చేయాలని ప్రయత్నిస్తే ఏమి జరుగుతుందో ( `np.random.rand` ఉపయోగించి ఉత్పత్తి చేయబడింది) ఇక్కడ ఉంది:\n"
]
]
},
},
{
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## విశ్వాస మధ్యవర్తిత్వాలు\n",
"## విశ్వసనీయత అంతर्वిలయాలు\n",
"\n",
"\n",
"ఇప్పుడు బేస్బాల్ ఆటగాళ్ల బరువులు మరియు ఎత్తుల కోసం విశ్వాస మధ్యవర్తిత్వాలను లెక్కిద్దాం. మేము కింద తెలిపిన కోడ్ను [ఈ stackoverflow చర్చ నుండి](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) ఉపయోగిస్తాము:\n"
"ఇప్పుడు బేస్బాల్ ఆటగాళ్ళ బరువు మరియు ఎత్తుల కోసం విశ్వసనీయత అంతర్వილయాలను లెక్కించుకుందాం. మనం [ఈ stackoverflow చర్చలోని కోడ్](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data) ను ఉపయోగించుకుంటాము:\n"
]
]
},
},
{
{
@ -272,7 +272,7 @@
" return m, h\n",
" return m, h\n",
"\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
]
},
},
@ -280,9 +280,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ఊహ పరీక్ష\n",
"## హైపోథసిస్ పరీక్ష\n",
"\n",
"\n",
"మన బేస్బాల్ ప్లేయర్ల డేటాసెట్లో వివిధ పాత్రలను పరిశీలిద్దాం:\n"
"మన బేస్ బాల్ ఆడేవార డేటాసెట్లో వివిధ పాత్రలను పరిశీలిద్దాం:\n"
]
]
},
},
{
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మొదటి బేస్మెన్లు రెండవ బేస్మెన్ల కంటే ఎత్తైనవారంటే ఆ హైపోతీసిస్ను పరీక్షిద్దాం. దీనికి సరళమైన పద్ధతి కాంఫిడెన్స్ ఇంటర్వల్స్ను పరీక్షించడం:\n"
"మనం మొదటి బేస్మెన్లు రెండవ బేస్మెన్ల కంటే ఎత్తైనవారా అనే ఊహను పరీక్షిద్దాం. దీనిని చేయడానికి సరళమైన మార్గం విశ్వాస యంత్రాల్ని పరీక్షించడం:\n"
]
]
},
},
{
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మేము ఇంటర్వల్స్ ఒప్పుకోకపోవడం స్పష్టంగా చూడవచ్చు.\n",
"మేము ఇంటర్వాల్స్ అతుకులుపోనట్లు కనుగొంటాం.\n",
"\n",
"\n",
"సాంఖ్యికంగా మరింత సరైన హైపోథసిస్ నిరూపణ మార్గం **స్టూడెంట్ t-టెస్ట్** ఉపయోగించడమే:\n"
"ఒక గణాంకంగా మరింత సరి అయిన విధానం అనే హైపోతీసిస్ ను సాక్ష్యపరచడానికి **స్టూడెంట్ t-టెస్ట్** ను ఉపయోగించడం.\n"
]
]
},
},
{
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"`ttest_ind` ఫังก్షన్ ఇచ్చే రెండు విలువలు ఏమిటంటే:\n",
"`ttest_ind` ఫంక్షన్ తిరుగు ఇచ్చే రెండు విలువలు:\n",
"* p-విలువను రెండు పంపిణీలకు ఒకే సగటు ఉందని భావించే అంద probability గా చూడవచ్చు. మన సందర్భంలో, ఇది చాలా తక్కువగా ఉంది, అంటే మొదటి బేస్మెన్లు పొడవైనవారని బలమైన సాక్ష్యం ఉంది.\n",
"* p-విలువను రెండు వితరణల సగటు ఒకే విధంగా ఉండే అవకాశంగా పరిగణించవచ్చు. మన కేసులో, ఇది చాలా తక్కువగా ఉంది, అంటే ఫస్ట్ బేస్మేన్లు ఎక్కువ ఎత్తుగలవారని బలమైన సాక్ష్యం ఉంది.\n",
"* t-విలువ అనేది t-పరీక్షలో ఉపయోగించే సాంద్రీకృత సగటు తేడా యొక్క మధ్యస్థ విలువ, మరియు ఇది ఇచ్చిన నమ్మక విలువ కోసం ఒక పరిమితి విలువతో పోల్చబడుతుంది.\n"
"* t-విలువు అనేది సగటు తేడా సాధారణీకరించిన మధ్యంతర విలువు, ఇది t-టెస్ట్లో ఉపయోగిస్తారు, మరియు ఇచ్చిన విశ్వసనీయత విలువ కోసం ఒక సరిహద్దు విలువతో పోల్చబడుతుంది.\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## కేంద్రీయ పరిమితి సిద్ధాంతం సహితంగా సాధారణ పంపిణీ అనుకరణ\n",
"## సెంట్రల్ లిమిట్ థియరీతో సాధారణ పంపిణీని అనుకరించడం\n",
"\n",
"\n",
"Pythonలో ఉన్న దుష్టసంఖ్యాత్మక జన్యకము మనకు సమాన పంపిణీని అందించడానికి రూపొంది ఉంటుంది. మనం సాధారణ పంపిణీ కోసం ఒక జన్యకాన్ని సృష్టించాలనుకుంటే, కేంద్రీయ పరిమితి సిద్ధాంతం ఉపయోగించవచ్చు. సాధారణంగా పంపిణీచేసిన విలువను పొందడానికి, మనం సమానంగా ఉత్పత్తి చేసిన నమూనా యొక్క సగటును లెక్కించగలం.\n"
"పైథాన్ లోని ప్స్యూడో-యాదృచ్ఛిక జనరేటర్ మనకు ఒక సమమైన పంపిణీని అందించే విధంగా రూపొందించబడింది. సాధారణ పంపిణీ కోసం ఒక జనరేటర్ సృష్టించాలనుకుంటే, మనం సెంట్రల్ లిమిట్ థియరీను ఉపయోగించవచ్చు. సాధారణ పంపిణీ విలువను పొందడానికి, మనం సమమైనంగా ఉత్పన్నమైన నమూనా యొక్క సగటును లెక్కించాలి.\n"
]
]
},
},
{
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## అనుబంధం మరియు చెడ్డ బేస్బాల్ కార్పొరేషన్\n",
"## సంబంధం మరియు చెడ్డ బేస్బాల్ కార్పొరేషన్\n",
"\n",
"\n",
"అనుబంధం మాకు డేటా క్రమాల మధ్య సంబంధాలను కనుగొనడానికి సహాయపడుతుంది. మన ఆట వేళ ఉదాహరణలో, ఒక చెడ్డ బేస్బాల్ సంస్థ ఉంది అని భావిద్దాం, అది తన ఆటగాళ్లను వారి ఎత్తు ప్రకారం పారితోషకం ఇస్తుంది - ఆటగాడు ఎత్తైనట్లయితే, అతను/ఆమె ఎక్కువ డబ్బు పొందుతాడు/ఉంటుంది. మూల వేతనం $1000 మరియు ఎత్తును ఆధారంగా $0 నుండి $100 వరకు అదనపు బోనస్ ఉంటుందని అనుకోండి. మనము MLB నుండి నిజమైన ఆటగాళ్లను తీసుకొని, వారి కల్పిత జీతాలను లెక్కించబోతున్నాము:\n"
"సంబంధం మనకు డేటా వరుసల మధ్య సంబంధాలను కనుగొనడానికి సహాయపడుతుంది. మన యొక్క ఆట మాదిరిలో, ఒక చెడ్డ బేస్బాల్ కార్పొరేషన్ ఉందని భావిద్దాం, వారు తమ ఆటగాళ్లకు వారి ఎత్తు ఆధారంగా పే చేస్తుంది - ఆటగాడు ఎత్తైనట్టే, అతని/ఆమెకు ఎక్కువ డబ్బు అందుతుంది. ఒక ఆధార జీతం $1000 ఉంది అని, మరియు ఎత్తు ఆధారంగా $0 నుండి $100 అదనపు బోనస్ ఉంటుంది అని అనుకుందాం. మనం MLB లోని నిజమైన ఆటగాళ్లను తీసుకుని, వారి ఊహాత్మక జీతాలను లెక్కిస్తాము:\n"
"ఇప్పుడు ఆ సీక్వెన్సుల కోవేరియన్స్ మరియు కోరిలేషన్ లను లెక్కిద్దాం. `np.cov` మాకు కోవేరియన్స్ యొక్క విస్తరణ అయిన ఒక **కోవేరియన్స్ మ్యాట్రిక్స్** ను ఇస్తుంది, ఇది బహు చారాలను ఆక్రమిస్తుంది. కోవేరియన్స్ మ్యాట్రిక్స్ $M$ లోని మూలకం $M_{ij}$ ఇన్పుట్ చారాలు $X_i$ మరియు $X_j$ మధ్య కోవేరియన్స్, మరియు డయాగనల్ విలువలు $M_{ii}$ $X_{i}$ యొక్క వ్యత్యాసం. ఇది లాగే, `np.corrcoef` మాకు **కోరిలేషన్ మ్యాట్రిక్స్** ను ఇస్తుంది.\n"
"ఇప్పుడు ఆ సీక్వెన్సుల యొక్క సహవిభేదం మరియు సంబంధాన్ని గణించుకుందాం. `np.cov` మనకు ఒక所谓మైన **సహవిభేద మేట్రిక్స్** ఉత్పత్తి చేస్తుంది, ఇది బహు చరకాలను కలిపిన సహవిభేదానికి విస్తరణ. సహవిభేద మేట్రిక్స్ $M$ లోని అంశం $M_{ij}$ అనేది ఇన్పుట్ చరకాల $X_i$ మరియు $X_j$ మధ్య సహవిభేదం, మరియు ద్రవ్యరాశి విలువ $M_{ii}$ అనేది $X_{i}$ యొక్క విభిన్నత. అదేవిధంగా, `np.corrcoef` మనకు **సంబంధ మేట్రిక్స్** ఇస్తుంది.\n"
]
]
},
},
{
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"సంబంధం 1 కు సమానం అంటే రెండు మేరలు మధ్య బలమైన **సరణి సంబంధం** ఉందని అర్థం. మనం ఒక విలువను మరొకదాన్ని వ్యతిరేకంగా గీసే ద్వారా సరణి సంబంధాన్ని దృశ్యరూపంలో చూడవచ్చు:\n"
"1 సమానమైన సహసంబంధం అంటే ఇద్దరు చరాలు మధ్య బలమైన **రేఖీయ సంబంధం** ఉందని అర్థం. ఒక విలువను против ఎదుట మరోటి ప్లాట్ చేసి మేము ఈ రేఖీయ సంబంధాన్ని దృశ్యంగా చూడవచ్చు:\n"
]
]
},
},
{
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"సంబంధం రేఖీయ కాకపోతే ఏమవుతుందో చూద్దాం. మన సంస్థ ఎత్తులు మరియు వేతనాల మధ్య స్పష్టమైన రేఖీయ ఆధారితాన్ని దాచిపెట్టాలని నిర్ణయించుకొని, సూత్రంలో కొంత రేఖీయతలేని భాగాన్ని, ఉదాహరణకు `sin`ని చేర్చిందని అనుకుందాం:\n"
"సంబంధం రేఖీయమైనది కాకపోతే ఏం జరుగుతుందో చూద్దాం. మన సంస్థ ఎత్తుల మరియు జీతాల మధ్య స్పష్టమైన రేఖీయ ఆధారాన్ని దాచాలని నిర్ణయించుకుంది మరియు సూత్రంలో కొంత రేఖీయత లేని వ్యవధిని పరిచయం చేసింది, ఉదాహరణకు `sin` వంటి: \n"
]
]
},
},
{
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ఈ సందర్భంలో, సహసంబంధం కొంచెం తక్కువగా ఉంది, కానీ అది ఇంకా చాలా ఎక్కువగా ఉంది. ఇప్పుడు, సంబంధాన్ని మరింత స్పష్టంగా కానివ్వడానికి, జీతానికి కొంత అదనపు రాండమ్ వేరియబుల్ జోడించడం ద్వారా కొన్ని అదనపు యాదృచ్ఛికతను చేర్చవచ్చు. ఏం జరుగుతుందో చూద్దాం:\n"
"ఈ సందర్భంలో, సంబంధం కొంచెం తక్కువగా ఉన్నా, అది ఇంకా చాలా ఎక్కువగా ఉంటుంది. ఇప్పుడు, సంబంధాన్ని మరింత తక్కువగా చూపించడానికి, జీతానికి కొంత అదనపు యాదృచ్ఛికాన్ని చేర్చాలని మేము అనుకోవచ్చు. ఏమవుతుందని చూద్దాం:\n"
]
]
},
},
{
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> మీరు అంగీకరించగలరా ఎందుకు చిదులు ఈరూపంలో నిలబడతాయి?\n",
"> మీరు ఎందుకు ఈ మచ్చలు నిలువు గీతలుగా వరుసగా నిలుస్తాయనే అంచనా వేశారా?\n",
"\n",
"\n",
"మనం జీతం వంటి కృత్రిమంగా రూపొందించిన భావన మరియు గమనించిన మార్పిడి *ఎత్తు* మధ్య సంబంధాన్ని గమనించాము.ఇప్పుడు, ఎత్తు మరియు బరువు వంటి రెండు గమనించిన మార్చులు కూడా సంబంధితమయ్యాయో లేదో చూద్దాము:\n"
"జీతం వంటి కృత్రిమంగా రూపొంచబడిన సങ്കల్పం మరియు గమనించిన వేరియబులైన *ఎత్తు* మధ్య సంబంధాన్ని మేము గమనించాము. అలాగే, ఎత్తు మరియు బరువు వంటి గమనించిన రెండు వేరియబుల్స్ కూడా పరస్పరం సంబంధం ఉందా అని కూడా చూద్దాం:\n"
]
]
},
},
{
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"దుఃఖంగా, మనకి ఎలాంటి ఫలితాలు లభించలేదు - కేవలం కొన్ని అపరిచితమైన `nan` విలువలు మాత్రమే లభించాయి. ఇది మా సిరీస్లోని కొన్ని విలువలు నిర్వచించబడలేదు, వాటిని `nan`తో ప్రదర్శించబడుతుంది, తద్వారా ఆపరేషన్ ఫలితం కూడా నిర్వచించబడదు. మ్యాట్రిక్స్ను పరిశీలిస్తూ మనం చూస్తే `Weight` కాలమ్ సమస్యగా ఉంది, ఎందుకంటే `Height` విలువల మధ్య స్వీయ-సంబంధం లెక్కించబడింది.\n",
"దురదృష్టవశాత్తూ, మాకు ఎటువంటి ఫలితాలు రాలేదు - కేవలం కొంత వింత `nan` విలువలు మాత్రమే ఉన్నాయి. మా సిరీస్లో కొన్ని విలువలు నిర్వచించబడకపోవడం కారణంగా, అవి `nan` గా సూచించబడ్డాయి, ఇది ఆపరేషన్ ఫలితం కూడా నిర్వచించబడదని కారణమవుతుంది. మ్యాట్రిక్స్ను చూసినప్పుడు మనం గమనించగలము, `Weight` అనేది సమస్యాత్మక కాలమ్, ఎందుకంటే `Height` విలువల మధ్య స్వీయ-సంబంధం లెక్కించబడింది.\n",
"\n",
"\n",
"> ఈ ఉదాహరణ **డేటా తయారీ** మరియు **శుభ్రపరచడంల యొక్క ప్రాముఖ్యతను** చూపిస్తుంది. సరైన డేటా లేకుండా మనం ఎలాంటి లెక్కింపులు జరపలేము.\n",
"> ఈ ఉదాహరణ **డేటా సిద్ధత** మరియు **శుభ్రపరచడం** యొక్క ప్రాముఖ్యతను చూపిస్తుంది. సరైన డేటా లేకుండా మనం ఏదీ లెక్కించలేం.\n",
"\n",
"\n",
"మిస్ అయ్యిన విలువలను పూరించడానికి `fillna` మెథడ్ను ఉపయోగించి, సంబంధాన్ని లెక్కించుకుందాం:\n"
"మిస్సింగ్ విలువలను పూరించడానికి `fillna` పద్ధతిని ఉపయోగించి, సంబంధం లెక్కించుకుందాం: \n"
"వాస్తవానికి ఒక సంబంధం ఉంది, కానీ మా కృత్రిమ ఉదాహరణలో ఉన్నంత కఠినమైనటి కాదు. నిజంగా, ఒక విలువను మరొక విలువకు వ్యతిరేకంగా స్ఫురణ చార్ట్లో చూస్తే, సంబంధం చాలా తక్కువ స్పష్టంగా ఉంటుంది:\n"
"నిజానికి సంబంధం ఉంటుందిఅయితే, మన కళాకృతితో చేసిన ఉదాహరణ లో ఉండేలాగా బలమైనది కాదు. నిజానికి, ఒక విలువను మరొక విలువతో స్కాటర్ ప్లాట్ చూస్తే, సంబంధం చాలా తక్కువగా కనిపిస్తుంది:\n"
]
]
},
},
{
{
@ -535,16 +535,16 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## ముగింపు\n",
"## తుదిది\n",
"\n",
"\n",
"ఈ నోట్బుక్లో మేము గణాంక ఫంక్షన్లను లెక్కించడానికి డేటాపై ప్రాథమిక కార్యకలాపాలను ఎలా నిర్వహించాలో నేర్చుకున్నాము. కొన్ని ఊహాగానాలను నిరూపించడానికి సబ్బంది గణితం మరియు గణాంకాల పరికరాన్ని ఎలా ఉపయోగించాలో, మరియు డేటా నమూనా ఇచ్చిన అల్ప విస్తరణ విలువలకు విశ్వాస అంతరాలను ఎలా లెక్కించాలో మాకు ఇప్పుడు తెలుసు.\n"
"ఈ నోట్బుక్లో మేము గణాంకాత్మక ఫంక్షన్లను గణించే కోసం డేటాపై ప్రాథమిక కార్యాచరణలను ఎలా నిర్వహించాలో నేర్చుకున్నాము. కొన్ని హైపోతసిస్లను సిద్దం చేసే గణితం మరియు గణాంకాల శ్రేష్ట పరికరాన్ని ఎలా ఉపయోగించాలో మరియు డేటా నమూనా ఇవ్వబడినప్పుడు ఏదైనా వేరియబుల్లకు విశ్వాస అంతరాలను ఎలా లెక్కించాలో ఇప్పుడు మాకు తెలుసు.\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ముక్తాపత్రం**: \nఈ పత్రాన్ని AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ద్వారా అనువదించబడ్డది. మేము అత్యంత ఖచ్చితత్వానికి ప్రాముఖ్యత ఇస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలలో పிழళ్లు లేదా అసమర్థతలు ఉండవచ్చు. మౌలిక పత్రం స్వదేశి భాషలోనే అధికారిక మూలంగా తీసుకోవాలి. కీలక సమాచారం కోసం, వ్యావసాయిక మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదాన్ని ఉపయోగించడం వల్ల ఏర్పడే ఏవైనా అపార్థాలు లేదా തെറ്റుమాటలకు మేము బాధ్యత వహించటంలేదు.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**అస్వీకరణ**:\nఈ పత్రం AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"మేము కోవిడ్-19 బారిన పడిన వ్యక్తులపై డేటాను ఉపయోగిస్తాము, ఇది [జాన్సా హాప్కిన్స్ విశ్వవిద్యాలయం](https://jhu.edu/)లోని [సెంటర్ ఫర్ సిస్టమ్స్ సైన్స్ అండ్ ఇంజనీరింగ్](https://systems.jhu.edu/) (CSSE) అందించినది. డేటాసెట్ [ఈ గిత్హబ్ రిపాజిటరీ](https://github.com/CSSEGISandData/COVID-19)లో అందుబాటులో ఉంది.\n"
"మనం [Johns Hopkins University](https://jhu.edu/)లోని [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) అందించిన COVID-19 కార్యక్రమిత వ్యక్తులపై డేటాను ఉపయోగిస్తాము. డేటాసెట్ [ఈ GitHub Repository](https://github.com/CSSEGISandData/COVID-19) లో అందుబాటులో ఉంది.\n"
]
]
},
},
{
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మేము తాజా డేటాను నేరుగా GitHub నుండి `pd.read_csv` ఉపయోగించి లోడ్ చేయవచ్చు. ఏదైనా కారణం వలన డేటా అందుబాటులో లేకపోతే, మీరు ఎప్పుడైనా లోకలీ `data` ఫోల్డర్లో అందుబాటులో ఉన్న ప్రతిని ఉపయోగించవచ్చు - కేవలం క్రింద ఇచ్చిన `base_url` ను నిర్వచించే లైన్ను అనకమెంట్ చేయండి:\n"
"మనం `pd.read_csv` ను ఉపయోగించి GitHub నుండి తాజా డేటాను నేరుగా లోడ్ చేయవచ్చు. ఏదైనా కారణానికి డేటా అందుబాటులో లేకపోతే, మీరు ఎప్పుడైనా `data` ఫోల్డర్ లో స్థానికంగా ఉన్న కాపీని ఉపయోగించవచ్చు - కేవలం దిగువ ఉన్న `base_url` ను నిర్వచించే లైన్ ను అన్కామెంట్ చేయండి:\n"
]
]
},
},
{
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ఇప్పుడు సంక్రమిత వ్యక్తుల కోసం డేటాను లోడ్ చేసి, డేటా ఎలా ఉందో చూద్దాం:\n"
"ఇప్పుడు సంక్రమిత వ్యక్తుల డేటాను లోడ్ చేసి, డేటా ఎలా ఉందో చూద్దాం:\n"
]
]
},
},
{
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మేము చూస్తున్నాము ప్రతీ పంక్తి పట్టికలో ప్రతి దేశం మరియు/లేదా ప్రావిన్స్ కోసం సంక్రమిత వ్యక్తుల సంఖ్యను నిర్వచిస్తుంది, మరియు కాలమ్స్ తేదీలకు సంబంధించినవి. సమానమైన పట్టికలు ఇతర డేటా కోసం కూడా లోడ్ చేయవచ్చు, ఉదాహరణకు కోలుకున్నవారి సంఖ్య మరియు మరణాల సంఖ్య.\n"
"మేము చూడగలము ప్రతీ పట్టిక వరుసలో ప్రతి దేశం మరియు/లేదా ప్రాంశ్రియానికి సంక్రమిత వ్యక్తుల సంఖ్య పరిరూపించబడుతుంది, మరియు కాలమ్లు తేదీలకు అనుగుణంగా ఉంటాయి. ఇతర డేటా కోసం కూడా ఇలాంటి పట్టికలు లోడ్ చేయవచ్చు, ఉదాహరణకు, కోలుకున్నవారి సంఖ్య మరియు మరణాల సంఖ్య.\n"
]
]
},
},
{
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## డేటాకు అర్థం చేసుకోవడం\n",
"## డేటాను అర్థం చేసుకోవడం\n",
"\n",
"\n",
"పై పట్టిక నుండి ప్రావిన్స్ కాలమ్ యొక్క పాత్ర స్పష్టంగా లేదు. `Province/State` కాలమ్లో ఉన్న విభిన్న విలువలను చూద్దాం:\n"
"పై పట్టిక నుంచి province కాలమ్ యొక్క పాత్ర స్పష్టం కాదు. `Province/State` కాలమ్లో ఉన్న విభిన్న విలువలను చూద్దాం:\n"
]
]
},
},
{
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"పేర్ల నుండి మనం అర్థం చేసుకోగలము ఆస్ట్రేలియా మరియు చైనా వంటి దేశాలకు ప్రావిన్సుల ద్వారా మరింత వివరమైన విభజన ఉందని. ఉదాహరణగా చైనాకు సంబంధించిన సమాచారాన్ని చూసుకుందాం:\n"
"పేర్ల నుంచి మనకు అర్థం అవుతుంది ఆస్ట్రేలియా, చైనా వంటి దేశాలకు ప్రావిన్సుల ఆధారంగా మరింత విశదీకరణ ఉంది. ఉదాహరణ కోసం చైనా గురించి సమాచారం చూసేద్దాం:\n"
]
]
},
},
{
{
@ -1323,7 +1323,7 @@
"source": [
"source": [
"## డేటాను ప్రీ-ప్రాసెసింగ్ చేయడం \n",
"## డేటాను ప్రీ-ప్రాసెసింగ్ చేయడం \n",
"\n",
"\n",
"మేము దేశాలను మరిన్ని ప్రాంతాలుగా విభజించడంలో ఆసక్తి కలిగి లేము, కనుక మొదట దీన్ని తొలగించి అన్ని ప్రాంతాల సమాచారం కలిపి దేశం మొత్తం సమాచారం పొందటానికి ప్రయత్నిస్తాము. ఇది `groupby` ఉపయోగించి చేయవచ్చు:\n"
"మనం దేశాలను మరిన్ని ప్రాంతాలుగా విభజించడంలో ఆసక్తి చూపు లేదు, కాబట్టి ముందుగా ఈ విభజనను తొలగించి, అన్ని ప్రాంతాల సమాచారాన్ని కలిపి, మొత్తం దేశానికి సమాచారం పొందుతాము. ఇది `groupby` ఉపయోగించి చేయవచ్చు:\n"
]
]
},
},
{
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మీరు చూడగలరు, `groupby` ఉపయోగించడంవల్ల అన్ని DataFrames ఇప్పుడు Country/Region ద్వారా సూచిక వేయబడ్డాయి. కాబట్టి, .loc ఉపయోగించి నిర్దిష్ట దేశానికి సంబంధించిన డేటాను పొందగలము:|\n"
"మీరు గమనించవచ్చు `groupby` ఉపయోగించడంవల్ల అన్ని DataFrames ఇప్పుడు Country/Region ద్వారా సూచిక చేయబడ్డాయి. కాబట్టి మనం ఒక నిర్దిష్ట దేశం కోసం డేటాను `.loc` ఉపయోగించి యాక్సెస్ చేయవచ్చు:|\n"
]
]
},
},
{
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"> **గమనిక** మేము ఎలా `[3:]` ఉపయోగించి ప్రావిన్స్/స్టేట్ మరియు భౌగోళిక కోలమ్స్ వంటి తేదీకు సంభందించని మెటాడేటాను కలిగిన మొదటి మూడు అంశాలను తొలగిస్తున్నామో చూడండి. ఆ మూడు కాలమ్స్ను మొత్తం తీసివేయవచ్చు:\n"
"> **గమనిక** కానీ మేము `[3:]` ను ఉపయోగించి మొదటి మూడవ అంశాలను తొలగిస్తున్నాము, అవి తేదీ కాని మెటాడేటాని (ప్రావిన్స్/స్టేట్ మరియు భౌగోళిక సమన్వయాల కాలమ్స్) కలిగి ఉంటాయి. ఆ మూడవ కాలమ్స్ను కూడా పూర్తిగా తొలగించవచ్చు:\n"
]
]
},
},
{
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## డేటా పరిశీలన\n",
"## డేటాను పరిశీలించడం\n",
"\n",
"\n",
"ఇప్పుడు కొంత ప్రత్యేక దేశాన్ని పరిశీలించడం ప్రారంభిద్దాం. తేదీని సూచికగా ఉపయోగించి సంక్రమణలపై డేటా కలిగిన ఫ్రేమ్ను సృష్టిద్దాం:\n"
"ఇప్పుడు మనం ఒక ప్రత్యేక దేశాన్ని పరిశీలించుకుందాం. తేదీ ప్రకారం సూచించే సంక్రమణ వివరాలతో కూడిన ఫ్రేమ్ని సృష్టిద్దాం:\n"
]
]
},
},
{
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ఇప్పుడు ప్రతి రోజు కొత్తగా వైరస్ పడ్డ వ్యక్తుల సంఖ్యను లెక్కించుకుందాం. ఇది సంక్రమణ వేగాన్ని చూడటానికి మనకు సహాయపడుతుంది. దీని కోసం చేయటం సులభం అయిన పద్ధతి `diff` ఉపయోగించడం:\n"
"ఇప్పుడు ప్రతి రోజు కొత్తగా సంక్రమించిన వారి సంఖ్యను లెక్కిద్దాం. ఇది మహా వ్యాధి ఎంత వేగంగా వ్యాప్తి చెందుతుందో మనకు చూడటానికి సహాయపడుతుంది. దీన్ని చేయడానికి సులభమైన విధానం `diff` ను ఉపయోగించడం:\n"
]
]
},
},
{
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మేము డేటాలో అధిక మార్పులను చూడగలుగుతాము. నెలలలో ఒక దానిని దగ్గరగా చూస్తాం:\n"
"డేటాలో భారీ మార్పులు కనిపిస్తున్నాయి. ఒక నెలను దయచేసి సమీపంగా పరిశీలしましょう:\n"
]
]
},
},
{
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"డేటాలో వారంవారీ మార్పులు స్పష్టంగా కనిపిస్తున్నాయి. మనకు ధోరణులను చూడగలగాలి కాబట్టి, కరువు వంచనాన్ని సమానంగా చేయడం బుద్ధిమంతమైనది, అంటే ప్రతి రోజు కోసం గత కొన్ని రోజుల సగటు విలువని లెక్కించడం:\n"
"డేటాలో ప్రతి వారం మార్పులు స్పష్టంగా కనిపిస్తున్నాయి. మేము ట్రెండ్లను వీక్షించగలగాలి కనుక, వంతెనల సగటును (అంటే ప్రతి రోజు మునుపటి కొన్ని రోజుల సగటు విలువను లెక్కించుకుని) లెక్కించి వంక మార్చుట తగినది: \n"
]
]
},
},
{
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ఎన్నో దేశాలను తులనాచేయగలగడానికి, ఆ దేశం యొక్క జనసంఖ్యను పరిగణలోకి తీసుకోవాలని ఉండవచ్చు, మరియు దేశ జనసంఖ్యకు సంబంధించి సంక్రమిత వ్యక్తుల శాతాన్ని తులనాచేయవచ్చు. దేశ జనసంఖ్యను పొందడానికి, దేశాల డేటాసెట్ను లోడ్ చేద్దాం:\n"
"కొన్ని దేశాలను సరిపోల్చుకోవడానికి, మనం ఆ దేశం యొక్క జనాభాను పరిగణనలోకి తీసుకుని, దేశ జనాభా ప్రకారం సంక్రమిత వ్యక్తుల శాతం ను సరిపోల్చుకోవచ్చు. దేశ జనాభాను పొందడానికి, దేశాల డేటాసెట్ ను లోడ్ చేసుకుందాం:\n"
]
]
},
},
{
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"ఈ డేటాసెట్ దేశాలు మరియు ప్రావిన్స్ లో సమాచారం కలిగి ఉండటం వల్ల, మొత్తం దేశం జనాభాను పొందాలంటే మనం కొంచెం తెలివిగా ఉండాలి:\n"
"ఈ డేటాసెట్ దేశాలు మరియు ప్రావిన్సులపై సమాచారాన్ని కలిగి ఉండటంతో, మొత్తం దేశ జనాభాను పొందడానికి మేము కొంచెం తెలివిగా ఉండాలి:\n"
]
]
},
},
{
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## $R_t$ లెక్కింపు\n",
"\n",
"\n",
"రోగం ఎంత సంక్రమించదగినదో చూడటానికి, మేము **మూల ప్రజన సంఖ్య** $R_0$ ను చూస్తాము, ఇది ఒక సంక్రమిత వ్యక్తి తదుపరి ఎంత మంది వ్యక్తులను సంక్రమింపజేస్తుందో చూపిస్తుంది. $R_0$ 1 కన్నా ఎక్కువైతే, మహమ్మారి వ్యాప్తి కలలేఖనం.\n",
"## $R_t$ ని గణించటం\n",
"\n",
"\n",
"$R_0$ అనేది రోగంని స్వభావ లక్షణం, మరియు కొందరు వ్యక్తులు మహమ్మారిని నెమ్మదింపచేయడానికి తీసుకునే రక్షణ చర్యలను తీసిపోకుండా ఉంది. మహమ్మారి పురోగతిలో, మేము ఏ సమయంలో అయినా ప్రజన సంఖ్య $R_t$ ను అంచనా వేసుకోవచ్చు. ఈ సంఖ్య సుమారు అంచనా వేయడానికి 8 రోజుల విండో తీసుకుని, ఈ క్రింది రీతిలో లెక్కించవచ్చు: $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"వ్యాధి ఎంత బాగా సంక్రమించిందో చూడటానికి, మనం **బేసిక్ రీకంపొడక్షన్ నెంబర్** $R_0$ ను చూస్తాము, ఇది ఒక సంక్రమిత వ్యక్తి మరికొన్ని వ్యక్తులను సంక్రమించే సంఖ్యను సూచిస్తుంది. $R_0$ ఒక కన్నా ఎక్కువ ఉన్నప్పుడు, మహామారి వ్యాప్తి చెందే అవకాశం ఉంటుంది.\n",
"ఇక్కడ $I_t$ అనేది రోజు $t$ న కొత్తగా సంక్రమించిన వ్యక్తుల సంఖ్య.\n",
"\n",
"\n",
"మా మహమ్మారి డేటా కోసం $R_t$ ను లెక్కిద్దాం. దీని కోసం, మేము 8 `ninfected` విలువల రోలింగ్ విండో తీసుకుంటాము, మరియు పై నిష్పత్తిని లెక్కించడానికి ఫంక్షన్ను అన్వయిస్తాము:\n"
"$R_0$ అనేది వ్యాధి స్వంత లక్షణం, మరియు ప్రజలు మహామారిని నెమ్మదింపజేసేందుకు తీసుకునే రక్షణ చర్యలను పరిగణలోకి తీసుకోదు. మహామారి పెరుగుతున్న సమయంలో, మనం ఎప్పటికి అయినా $t$ సమయానికి రీకంపొడక్షన్ నెంబర్ $R_t$ ను అంచనా వేసవచ్చు. ఈ సంఖ్యను సుమారు అంచనా వేసేందుకు 8 రోజుల విండో తీసుకుని, ఈ క్రింది సమీకరణం ద్వారా లెక్కించవచ్చని చూపబడింది $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"ఇక్కడ $I_t$ అనేది $t$ తేధిన కొత్తగా సంక్రమిత వ్యక్తుల సంఖ్య.\n",
"\n",
"మన మహామారి డేటాకు $R_t$ ని లెక్కిద్దాం. దీన్నంకలిగించేందుకు, మనం 8 `ninfected` విలువల రోలింగ్ విండో తీసుకుని, పై నిష్పత్తిని లెక్కించే ఫంక్షన్ను వర్తింపజేస్తాము:\n"
]
]
},
},
{
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"గ్రాఫ్లో కొన్ని గ్యాప్స్ ఉన్నాయని మీరు చూడవచ్చు. అవి datasetలో `NaN` లేదా `inf` విలువలు ఉన్నప్పుడు సంభవించవచ్చు. `inf` విలువలు 0తో భాగించినప్పుడు కలుగుతాయి, మరియు `NaN` అనేది లెక్కించే ఫలితానికి అందుబాటులో లేని లేదా లెక్కించలేని (మా frame ప్రారంభంలో, వెడల్పు 8 ఉన్న rolling window ఇంకా అందుబాటులో లేని పరిస్థితి) డేటా లేకపోవడాన్ని సూచించవచ్చు. గ్రాఫ్ను మరింత అందంగా చేయడానికి, ఆ విలువలను `replace` మరియు `fillna` ఫంక్షన్లతో పూరించాలి.\n",
"మీరు గ్రాఫ్లో కొన్ని ఖాళీలు ఉన్నాయని చూడవచ్చు. అవి `NaN` వలన లేదా డేటాసెట్లో `inf` విలువలు ఉన్నప్పుడు ఏర్పడవచ్చు. `inf` విలువలు సాధ్యమైనవే 0తో భాగించడంవలన ఏర్పడవచ్చు, మరియు `NaN` లేదు లేదా లెక్కించడానికి అవసరమైన డేటా అందుబాటులో లేకపోవడం సూచించవచ్చు (ఉదాహరణకు, మన ఫ్రేమ్ మొదటి భాగంలో, వెడల్పు 8 ఉన్న రోలింగ్ విండో ఇంకా అందుబాటులో లేని సమయంలో). గ్రాఫ్ నైస్గా కనిపించడానికి, ఆ విలువలను `replace` మరియు `fillna` ఫంక్షన్ ఉపయోగించి పూరించాలి.\n",
"\n",
"\n",
"పాండమిక్ ప్రారంభాన్ని ఇంకా పరిశీలిద్దాం. మనం y-అక్ష విలువలను 6 కంటే తక్కువ విలువలకుగానే పరిమితం చేస్తాం, మెరుగైనదర్శన కోసం, మరియు 1 వద్ద అనుసరేఖను çizించాల్సి ఉంటుంది.\n"
"నిర్ధారించుకుందాం పాండమిక్ ప్రారంభాన్ని. మనం y-అక్షం విలువలను 6 కంటే తక్కువ విలువల వరకు సీమితం చేస్తాము, బాగా చూడటానికి, మరియు 1 వద్ద ఒక కూళ్ళ పొడవైన రేఖ వేయడం జరుగుతుంది.\n"
]
]
},
},
{
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"మరో ఆసక్తికరమైన సంకేతకురాలు పెన్డమిక్ యొక్క **డెరివేటివ్**, లేదా **దినసరి తేడా** కొత్త కేసుల్లో. ఇది మాకు పెన్డమిక్ ఎప్పుడు పెరుగుతున్నదో లేదా తగ్గుతున్నదో స్పష్టంగా చూడటానికి అనుమతిస్తుంది.\n"
"మరొక ఆసక్తికరమైన సంకేతం महामारी యొక్క **డెరివేటివ్**, లేదా **దైనందిన తేడా** కొత్త కేసుల సంఖ్యలో ఉంది. ఇది пандемిక్ పెరుగుతుండే లేదా తగ్గుతూ ఉండే సమయాన్ని స్పష్టంగా చూడటానికి సహాయం చేస్తుంది. \n"
]
]
},
},
{
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"రిపోర్టింగ్ కారణంగా డేటాలో చాలా మార్పులు ఉండటం వలన, మొత్తం చిత్రాన్ని అందుకోవడానికి రోలింగ్ అవరేజ్ నడిపించి వక్రమును స్మూత్ చేయడం అర్థవంతమే. తాజాగా మళ్లీ మహమ్మారి యొక్క మొదటి కొన్ని నెలలపై దృష్టి పెట్టుదాం:\n"
"రిపోర్టింగ్ కారణంగా డేటాలో చాలా తరగింపు ఉన్నందున, మొత్తం దృశ్యాన్ని పొందడానికి రోలింగ్ సగటు అమలు చేసి వక్రాన్ని సాఫీ చేయడం అర్థవంతమైంది. మళ్లీ మేం మహమ్మారి ప్రారంభ నెలలపై దృష్టి పెట్టుకుందాం:\n"
]
]
},
},
{
{
@ -2390,26 +2391,27 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## సవాల్\n",
"\n",
"\n",
"ఇప్పుడు మీరు కోడ్ మరియు డేటాతో మరింత ఆడుకునే సమయం అయింది! మీరు ప్రయోగించడానికి కొన్ని సూచనలు ఇక్కడ ఉన్నాయి:\n",
"## సవాలు\n",
"* వివిధ దేశాలలో మహమ్మారి వ్యాప్తిని చూడండి.\n",
"\n",
"* పోలిక కోసం ఒకే ప్లాట్లో అనేక దేశాల $R_t$ గ్రాఫ్లను చిత్రించండి, లేదా పక్కపక్కనే అనేక ప్లాట్లు చేయండి\n",
"ఇప్పుడు మీరు కోడ్ మరియు డేటాతో మరిన్ని ప్రయోగాలు చేయడానికి సమయం వచ్చింది! మీరు ప్రయత్నించవచ్చు కొన్ని సూచనలు ఇవి:\n",
"* మరణాలు మరియు బహాళీకి వచ్చిన సంఖ్యలు సంక్రమిత కేసుల సంఖ్యతో ఎలా సంబంధం ఉన్నాయో చూడండి.\n",
"* వివిధ దేశాల్లో మహమ్మారి వ్యాప్తిని చూడండి.\n",
"* సంక్రమణ రేటు మరియు మరణాల రేటును దృష్టిగానూ అనామాలీ కోసం పర్యవేక్షిస్తూ సాధారణంగా ఒక వ్యాధి ఎంతకాలం కొనసాగుతుందో కనుగొన్నారు. మీరు ఆ విషయం తెలుసుకోవడానికి వేర్వేరు దేశాలను చూడవలసి ఉంటుంది.\n",
"* అనేక దేశాల కోసం $R_t$ గ్రాఫ్లను ఒకే గ్రాఫ్లో సరిపోల్చడానికి గీస్తే, లేదా పలుపల గ్రాఫ్లను పక్కపక్కనే ఉంచండి\n",
"* మరణాల రేటును గణించండి మరియు అది సమయం కొనసాగుతున్నందున ఎలా మారుతుందో చూడండి. లెక్కలు చేయడానికి ముందు ఒక టైమ్ సిరీస్ను మరొకటి నుండి మార్చడానికి వ్యాధి వ్యవధిని దినాలలో పరిగణనలోకి తీసుకోవచ్చు.\n"
"* మరణాలు మరియు కోలుకున్న కేసుల సంఖ్య పట్ల సంక్రమిత కేసుల సంఖ్య ఎలా సంబంధమైందో చూడండి.\n",
"* సంక్రమణ రేటు మరియు మరణాల రేటు మీద దృష్టి సారించి ఈ వ్యాధి సగటు గడువెంత ఉంటుందో కనుగొనడానికి ప్రయత్నించండి. కొన్నిసార్లు వ్యత్యాసాలు చూసేందుకు వివిధ దేశాలను చూడవలసి ఉంటుంది.\n",
"* మరణ రేటును లెక్కించారు మరియు అది కాలం గడిచేకొద్దీ ఎలా మార్చుకుంటుంది చూడండి. లెక్కలు చేయడం మొదలు పెట్టేముందు వ్యాధి రోజుల వ్యవధిని కూడా పరిగణనలోకి తీసుకోవచ్చు\n"
]
]
},
},
{
{
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"## References\n",
"## సూచనలు\n",
"\n",
"\n",
"You may look at further studies of COVID epidemic spread in the following publications:\n",
"COVID వ్యాప్తి గురించి మరిన్ని అధ్యయనాలను క్రింది ప్రచురణలలో చూడవచ్చు:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), బ్లాగ్ పోస్ట్ by [Dmitry Soshnikov](http://soshnikov.com)\n",
"* [COVID మహమ్మారి సమయంలో Rt అంచనా కోసం స్లైడింగ్ SIR మోడల్](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), [Dmitry Soshnikov](http://soshnikov.com) బ్లాగ్ పోస్ట్\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [తెలిసుకునే సమయం ఆధారిత పునఃప్రసార సంఖ్య గ్లోబల్ COVID-19 ఉత్పాతకానికి అంచనా](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Code for the above paper on GitHub](https://github.com/shwars/SlidingSIR)\n"
"* [మంద్రపత్రంపై ఉన్న కోడ్ GitHubలో](https://github.com/shwars/SlidingSIR)\n"
]
]
},
},
{
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"cell_type": "markdown",
"metadata": {},
"metadata": {},
"source": [
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**వివరణాత్మక నోటీసు**: \nఈ డాక్యుమెంట్ను AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువాదం చేయబడింది. మనం ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాలలో పొరపాట్లు లేదా తప్పిదాలు ఉండవచ్చు. అసలు డాక్యుమెంట్ యొక్క మ్యాతృభాషా సంస్కరణను అధికారిక మూలంగా పరిగణించడం మంచిది. ముఖ్యమైన సమాచారానికి, నిపుణుల చేతి అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదాన్ని ఉపయోగించడం వల్ల కలిగే ఏమైనా తీవ్రతరాభిప్రాయాలు లేదా తప్పుదిద్దింపుల కోసం మనం బాధ్యులు కాదేము.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**అస్వీకరణ**:\nఈ పత్రం AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
# డేంజరస్ లియిలేషన్స్ డేటా విజువలైజేషన్ ప్రాజెక్ట్
ప్రారంభించడానికి, మీ మెషీన్లో NPM మరియు Node నడుస్తున్నాయని నిర్ధారించుకోవాలి. డిపెండెన్సీలను ఇన్స్టాల్ చేయండి (npm install) మరియు ఆపై ప్రాజెక్ట్ను లోకల్గా నడపండి (npm run serve):
ప్రారంభించడానికి, మీ మిషన్లో NPM మరియు Node **>=20.0.0** రన్ అయి ఉన్నదని నిర్ధారించుకోవాలి. డిపెండెన్సీలను ఇన్స్టాల్ చేయండి (npm install) మరియు ఆ తర్వాత ప్రాజెక్ట్ను లోకల్గా రన్ చేయండి (npm run serve):
## ప్రాజెక్ట్ సెటప్
## ప్రాజెక్ట్ సెట్ అప్
```
```
npm install
npm install
```
```
### అభివృద్ధికి కంపైల్ చేసి హాట్-రిలోడ్ చేస్తుంది
### అభివృద్ధి కోసం కంపైల్ చేసి హాట్-రీలోడ్ చేస్తుంది
```
```
npm run serve
npm run serve
```
```
### ఉత్పత్తికి కంపైల్ చేసి మినిఫై చేస్తుంది
### ఉత్పత్తి కోసం కంపైల్ చేసి మినిఫై చేస్తుంది
```
```
npm run build
npm run build
```
```
### ఫైళ్లను లింట్ చేసి సరిచేస్తుంది
### లింట్ చేసి ఫైళ్లు సరిచేస్తుంది
```
```
npm run lint
npm run lint
```
```
### కాన్ఫిగరేషన్ను అనుకూలీకరించండి
### కాన్ఫిగరేషన్ను అనుకూలీకరించండి
[Configuration Reference](https://cli.vuejs.org/config/) ను చూడండి.
ఈ పత్రాన్ని AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పిదాలు ఉండవచ్చు. అసలు పత్రం దాని స్వదేశీ భాషలోనే అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం చేయించుకోవడం మంచిది. ఈ అనువాదం వలన కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారుల బాధ్యత మేము తీసుకోము.
ఈ పత్రం AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.
ప్రారంభించడానికి, మీ మెషీన్లో NPM మరియు Node నడుస్తున్నాయని నిర్ధారించుకోవాలి. డిపెండెన్సీలను ఇన్స్టాల్ చేయండి (npm install) మరియు ఆపై ప్రాజెక్ట్ను లోకల్గా నడపండి (npm run serve):
ప్రారంభించడానికి, మీ యంత్రంపై NPM మరియు Node **>=20.0.0** ఉండాలని నిర్ధారించుకోవాలి. డిపెండెన్సీలను ఇన్స్టాల్ చేయండి (npm install) మరియు తర్వాత ప్రాజెక్ట్ను స్థానికంగా రన్ చేయండి (npm run serve):
## ప్రాజెక్ట్ సెటప్
## ప్రాజెక్ట్ సెటప్
```
```
npm install
npm install
```
```
### అభివృద్ధికి కంపైల్ చేసి హాట్-రిలోడ్ చేస్తుంది
### అభివృద్ధికై కంపైల్ చేసి హాట్-రీలోడ్ చేస్తుంది
```
```
npm run serve
npm run serve
```
```
### ఉత్పత్తికి కంపైల్ చేసి మినిఫై చేస్తుంది
### ఉత్పత్తికై కంపైల్ చేసి మినిఫై చేస్తుంది
```
```
npm run build
npm run build
```
```
### ఫైళ్లను లింట్ చేసి సరిచేస్తుంది
### లింట్ చేసి ఫైళ్లను సరిచేస్తుంది
```
```
npm run lint
npm run lint
```
```
### కాన్ఫిగరేషన్ను అనుకూలీకరించండి
### కాన్ఫిగరేషన్ను కస్టమైజ్ చేయండి
[Configuration Reference](https://cli.vuejs.org/config/) చూడండి.
ఈ పత్రాన్ని AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, ఆటోమేటెడ్ అనువాదాల్లో పొరపాట్లు లేదా తప్పిదాలు ఉండవచ్చు. అసలు పత్రం దాని స్వదేశీ భాషలో ఉన్నది అధికారిక మూలంగా పరిగణించాలి. ముఖ్యమైన సమాచారానికి, ప్రొఫెషనల్ మానవ అనువాదం సిఫార్సు చేయబడుతుంది. ఈ అనువాదం వాడకంలో ఏర్పడిన ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.
ఈ పత్రం AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.