You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/kn/1-Introduction/03-defining-data/README.md

21 KiB

ಡೇಟಾನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು

 ಸ್ಕೆಟ್‌ನೋಟ್ (@sketchthedocs) ಮೂಲಕ
ಡೇಟಾನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು - ಸ್ಕೆಟ್‌ನೋಟ್ @nitya ಮೂಲಕ

ಡೇಟಾ ಎಂದರೆ ವಾಸ್ತವಗಳು, ಮಾಹಿತಿ, ಪರಿಶೀಲನೆಗಳು ಮತ್ತು ಅಳತೆಗಳು, ఇవು ಕಂಡುಹಿಡಿಯಲು ಮತ್ತು ಜಾಗೃತ ನಿರ್ಣಯಗಳನ್ನು ಬೆಂಬಲಿಸಲು ಬಳಸಲಾಗುತ್ತದೆ. ಒಂದು ಡೇಟಾ ಪಾಯಿಂಟ್ ಎಂದರೆ ಡೇಟಾ ಸಂಗ್ರಹದೊಳಗಿನ ಒಂದು ಏಕಕ, ಅಂದರೆ ಡೇಟಾ ಪಾಯಿಂಟ್ಸ್ ಸಂಗ್ರಹವಾಗಿದೆ. ಡೇಟಾ ಸಂಗ್ರಹಗಳು ಬೇರೆಯಾದ ಫಾರ್ಮ್ಯಾಟ್ ಮತ್ತು ರಚನೆಗಳಲ್ಲಿ ಬರುತ್ತವೆ, ಹಾಗೂ ಸಾಮಾನ್ಯವಾಗಿ ಅದರ ಮೂಲ, ಅಂದರೆ ಡೇಟಾ ಇದ್ದ ಸ್ಥಳದ ಮೇರೆಗೆ ಇರುತ್ತವೆ. ಉದಾಹರಣೆಗೆ, ಒಂದು ಕಂಪನಿಯ ಮಾಸಿಕ ಆದಾಯವು ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ನಲ್ಲಿ ಇರಬಹುದು ಆದರೆ ಸ್ಮಾರ್ಟ್‌ವಾಚ್‌ನಿಂದ ಬಂದಿದೆ ಎಂದರೆ ಗಂಟೆಗಂಟೆ ಹೃದಯರೀತಿ ಡೇಟಾ JSON ಫಾರ್ಮ್ಯಾಟ್‌ನಲ್ಲಿರಬಹುದು. ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಒಂದು ಡೇಟಾ ಸಂಗ್ರಹದೊಳಗಿನ ಬೇರೆ ಬೇರೆ ಪ್ರಕಾರದ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುತ್ತಾರೆ.

ಈ ಪಾಠವು ಡೇಟಾ ಲಕ್ಷಣಗಳು ಮತ್ತು ಅದರ ಮೂಲಗಳ ಮೂಲಕ ಡೇಟಾವನ್ನು ಗುರುತಿಸುವುದು ಮತ್ತು ವರ್ಗೀಕರಿಸುವುದರ ಮೇಲೆ ಗಮನಹರಿಸುತ್ತದೆ.

ಪೂರ್ವ-ಲೇಕ್ಚರ್ ಕ್ವಿಜ್

ಡೇಟಾವನ್ನು ವಿವರಿಸುವ ವಿಧಾನ

ಕಚ್ಚಾ ಡೇಟಾ

ಕಚ್ಚಾ ಡೇಟಾ ಎಂದರೆ ಮೂಲದಿಂದಲೇ ಲಭ್ಯವಿರುವ ಅದರ ಪ್ರಾರಂಭಿಕ ಸ್ಥಿತಿ ಮತ್ತು ವಿಶ್ಲೇಷಣೆ ಅಥವಾ ಆಯೋಜನೆಯಿಲ್ಲದೆ ಇರುವ ಡೇಟಾ. ಡೇಟಾ ಸಂಗ್ರಹದಲ್ಲಿ ನಡೆಯುತ್ತಿರುವುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಅದನ್ನು ಮಾನವರು ಮತ್ತು ಅದನ್ನು ಹೆಚ್ಚು ವಿಶ್ಲೇಷಿಸಲು ಉಪಯೋಗಿಸುವ ತಂತ್ರಜ್ಞಾನಗಳೂ ಸಮರ್ಥವಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬಲ್ಲ ರೀತಿಯಲ್ಲಿ ಆಯೋಜಿಸಬೇಕು. ಡೇಟಾ ಸಂಗ್ರಹದ ರಚನೆ ಅದನ್ನು ಹೇಗೆ ಆಯೋಜಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುತ್ತದೆ ಮತ್ತು ಅದನ್ನು ರಚನೆಬದ್ಧ, ಅಸಂರಚಿತ ಮತ್ತು ಅರ್ಧ-ಸಂರಚಿತ ಎಂದು ವರ್ಗೀಕರಿಸಬಹುದು. ಈ ರಚನೆಯ ಪ್ರಕಾರಗಳು ಮೂಲದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುತ್ತವೆ ಆದರೆ ಅಂತಿಮವಾಗಿ ಈ ಮೂರು ವರ್ಗಗಳಲ್ಲಿ ಸೇರಿಕೊಳ್ಳುತ್ತವೆ.

ಪ್ರಮಾಣಾತ್ಮಕ (Quantitative) ಡೇಟಾ

ಪ್ರಮાણಾತ್ಮಕ ಡೇಟಾ ಒಂದು ಡೇಟಾ ಸಂಗ್ರಹದ ಅಂಕಿಅಂಶಗಳಾದ ವೀಕ್ಷಣೆಗಳು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ವಿಶ್ಲೇಷಣೆ, ಅಳತೆ ಮತ್ತು ಗಣಿತೀಯವಾಗಿ ಬಳಸಬಹುದು. ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಒಂದು ದೇಶದ ಜನಸಂಖ್ಯೆ, ಒಂದು ವ್ಯಕ್ತಿಯ ಎತ್ತರ, ಅಥವಾ ಕಂಪನಿಯ ತ್ರೈಮಾಸಿಕ ಆದಾಯ. ಕೆಲವು ಹೆಚ್ಚುವರಿ ವಿಶ್ಲೇಷಣೆಗಳೊಂದಿಗೆ, ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾವನ್ನು ಏರ್ ಕ್ವಾಲಿಟಿ ಸೂಚ್ಯಂಕದ ಋತುಚಕ್ರದ ಪ್ರವೃತ್ತಿಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು ಅಥವಾ ಸಾಮಾನ್ಯ ಕಾರ್ಯದಿನದಲ್ಲಿ ಜಾಮ್ ಸಮಯ ಸಂಚಾರದ ಸಂಭವನೀಯತೆಯನ್ನು ಅಂದಾಜಿಸಲು ಬಳಸಬಹುದು.

ಗುಣಾತ್ಮಕ (Qualitative) ಡೇಟಾ

ಗುಣಾತ್ಮಕ ಡೇಟಾ, ಎಂದುಲೇ ಕ್ಯಾಟೆಗೋರಿಕಲ್ ಡೇಟಾ ಎಂದೂ ಕರೆಯುವುದಾಗಿದೆ, ಪ್ರಮಾಣಾತ್ಮಕ ಡೇಟಾದ ವೀಕ್ಷಣೆಗಳಂತೆ ವಸ್ತುನಿಷ್ಠವಾಗಿ ಅಳತೆಯಡಿಸಲಾಗದ ಡೇಟಾ. ಇದು ಸಾಮಾನ್ಯವಾಗಿ ವಿವಿಧ ಸ್ವರೂಪದ ವ್ಯಕ್ತಿಗತ ಡೇಟಾಗಳಾಗಿದ್ದು, ಉತ್ಪನ್ನ ಅಥವಾ ಪ್ರಕ್ರಿಯೆಯ ಗುಣಮಟ್ಟವನ್ನು ಹಿಡಿಯುತ್ತದೆ. ಕೆಲವೆಡೆ, ಗುಣಾತ್ಮಕ ಡೇಟಾ ಅಂಕಿಅಂಶಗಳಾಗಿರಬಹುದು ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ಗಣಿತೀಯವಾಗಿ ಬಳಸುವುದಿಲ್ಲ, ಉದಾಹರಣೆಗೆ ಫೋನ್ ಸಂಖ್ಯೆ ಅಥವಾ ಟೈಮ್‌ಸ್ಟ್ಯಾಂಪ್ಸ್. ಗುಣಾತ್ಮಕ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ವೀಡಿಯೋ ಕಾಮೆಂಟ್ಗಳು, ಕಾರಿನ ಮೇಕ್ ಮತ್ತು ಮಾದರಿ, ನಿಮ್ಮ ಹತ್ತಿರದ ಸ್ನೇಹಿತನ ಪ್ರಿಯ ಬಣ್ಣ. ಗುಣಾತ್ಮಕ ಡೇಟಾವನ್ನು ಗ್ರಾಹಕರು ಯಾವ ಉತ್ಪನ್ನಗಳನ್ನು ಹೆಚ್ಚು ಇಷ್ಟಪಡುತ್ತಾರೆ ಎಂದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಅಥವಾ ಉದ್ಯೋಗ ಅರ್ಜಿ ಜೀವನಚರಿತ್ರೆಗಳಲ್ಲಿ ಜನಪ್ರಿಯ ಕೀವರ್ಡ್‌ಗಳನ್ನು ಗುರುತಿಸಲು ಬಳಸಬಹುದು.

ರಚನೆಬದ್ಧ ಡೇಟಾ

ರಚನೆಬದ್ಧ ಡೇಟಾ ಎಂದರೆ ಸಾಲುಗಳು ಮತ್ತು ಕಾಲಮ್‌ಗಳಾಗಿ ಆಯೋಜಿತ ಡೇಟಾ, ಇಲ್ಲಿ ಪ್ರತಿಯೊಂದು ಸಾಲು ಒಂದೇ ಕಾಲಮ್‌ಗಳ ಸಮೂಹವನ್ನು ಹೊಂದಿರುತ್ತದೆ. ಕಾಲಮ್‌ಗಳು ನಿರ್ದಿಷ್ಟ ಪ್ರಕಾರದ ಮೌಲ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ ಮತ್ತು ಅವು ಯಾವ ಮೌಲ್ಯವನ್ನು ಸೂಚಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುವ ಹೆಸರಿನಿಂದ ಗುರುತಿಸಲಾಗುತ್ತದೆ, ಮತ್ತು ಸಾಲುಗಳು ನಿಜವಾದ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದುತ್ತವೆ. ಕಾಲಮ್‌ಗಳಿಗೆ ಸಾಮಾನ್ಯವಾಗಿ ನಿರ್ದಿಷ್ಟ ನಿಯಮಗಳು ಅಥವಾ ನಿಯಂತ್ರಣಗಳು ಇರುತ್ತವೆ, ಮೌಲ್ಯಗಳು ಕಾಲಮ್‌ ಅನ್ನು ನಿಖರವಾಗಿ ಪ್ರತಿನಿಧಿಸುತ್ತಾ ಇರುವುದು ಖಚಿತಪಡಿಸಲು. ಉದಾಹರಣೆಗೆ, ಗ್ರಾಹಕರ ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ನಲ್ಲಿ ಪ್ರತಿಯೊಂದು ಸಾಲಿಗೂ ಫೋನ್ ಸಂಖ್ಯೆ ಇರಬೇಕು ಮತ್ತು ಫೋನ್ ಸಂಖ್ಯೆಗಳಲ್ಲಿ ಯಾವ ಅಕ್ಷರೋಚ್ಚಾರಗಳೂ ಇರಲಾಗದು ಎಂದು ಕಲ್ಪಿಸೋಣ. ಫೋನ್ ಸಂಖ್ಯೆಯ ಕಾಲಮ್ನಲ್ಲಿ ಖಾಲಿ ಇರಬಾರದು ಮತ್ತು ಕೇವಲ ಸಂಖ್ಯೆಯನ್ನಷ್ಟೇ ಒಳಗೊಂಡಿರಬೇಕು ಎಂಬ ನಿಯಮಗಳು ಇರಬಹುದು.

ರಚನೆಬದ್ಧ ಡೇಟಾದ ಲಾಭವೆಂದರೆ ಅದನ್ನು ಇತರ ರಚನೆಬದ್ಧ ಡೇಟಾದೊಂದಿಗೆ ಸಂಬಂಧಿಸಿದಂತೆ ಆಯೋಜಿಸಬಹುದಾಗಿದೆ. ಆದಾಗ್ಯೂ, ಡೇಟಾ ವಿಶೇಷ ರೀತಿಯಲ್ಲಿ ಆಯೋಜನೆ ಮಾಡಲು ರೂಪಿಸಲಾಗಿದೆ ಆದ್ದರಿಂದ ಅದರ ಆಂತರಿಕ ರಚನೆಯನ್ನು ಬದಲಾಯಿಸಲು ಹೆಚ್ಚಿನ ಪ್ರಯತ್ನ ಅಗತ್ಯವಿರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಗ್ರಾಹಕರ ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ಗೆ ಖಾಲಿಯಾಗದ ಇಮೇಲ್ ಕಾಲಮ್ ಸೇರಿಸುವುದಾದರೆ, ಡೇಟಾ ಸಂಗ್ರಹದಲ್ಲಿರುವ ಗ್ರಾಹಕರ ಇತರೆ ಸಾಲುಗಳಿಗೆ ಈ ಮೌಲ್ಯಗಳನ್ನು ಹೇಗೆ ಸೇರಿಸುವುದೆಂದು ತೀರಾ ವಿಚಾರ ಮಾಡಬೇಕಾಗುತ್ತದೆ.

ರಚನೆಬದ್ಧ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ಗಳು, ಸಂಬಂಧಿತ ಡೇಟಾಬೇಸ್‌ಗಳು, ಫೋನ್ ಸಂಖ್ಯೆಗಳು, ಬ್ಯಾಂಕ್ ಸ್ಟೇಟ್‌ಮೆಂಟ್‌ಗಳು

ಅಸಂರಚಿತ ಡೇಟಾ

ಅಸಂರಚಿತ ಡೇಟಾನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಸಾಲು ಅಥವಾ ಕಾಲಮ್‌ಗಳಾಗಿ ವರ್ಗೀಕರಿಸಲಾಗದು ಮತ್ತು ಯಾವುದೇ ಫಾರ್ಮ್ಯಾಟ್ ಅಥವಾ ನಿಯಮಾವಳಿಗಳನ್ನು ಅನುಸರಿಸುವುದಿಲ್ಲ. ಅಸಂರಚಿತ ಡೇಟಾಕೆ ರಚನೆ ಮೇಲೆ ಕಡಿಮೆ ನಿಯಂತ್ರಣಗಳಿರುವುದರಿಂದ, ಹೊಸ ಮಾಹಿತಿಯನ್ನು ಸೇರಿಸುವುದು ಸರಳ. ಉದಾಹರಣೆಗೆ, ಪ್ರತಿಯೊಂದು 2 ನಿಮಿಷಕ್ಕೊಮ್ಮೆ ಬಾರೋಮೆಟ್ರಿಕ್ ಒತ್ತಡವನ್ನು ಸಂಗ್ರಹಿಸುವ ಸೆನ್ಸರ್ ಒಂದು ಅಪ್ಡೇಟ್ ಪಡೆದುಕೊಂಡು ಈಗ ತಾಪಮಾನವನ್ನು ಅಳೆಯುವ ಮತ್ತು ದಾಖಲಿಸುವಂತಾಯಿತು ಎಂದರೆ, ಅಸಂರಚಿತ ಡೇಟಾ ಆಗಿದ್ದರೆ ಈಗಿರುವ ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸಬೇಕಾಗಿಲ್ಲ. ಆದಾಗ್ಯೂ, ಈ ರೀತಿಯ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸುವುದು ಅಥವಾ ತನಿಖೆ ಮಾಡುವುದು ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳಬಹುದು. ಉದಾಹರಣೆಗೆ, ಹಿಂದಿನ ತಿಂಗಳ ಸರಾಸರಿ ತಾಪಮಾನ ಕಂಡುಹಿಡಿಯಲು ವಿಜ್ಞಾನಿ ಸೆನ್ಸರ್ ಡೇಟಾ ಬಳಸಬೇಕಾದಾಗ, ಕೆಲವು ದಾಖಲೆಗಳಲ್ಲೊಂದು "e" ಅಕ್ಷರವನ್ನು ತಮ್ಮ ಪ್ರಶಾಂತ ಸ್ಥಿತಿಯನ್ನು ಸೂಚಿಸಲು ದಾಖಲಿಸಿದ್ದನ್ನು ಕಂಡುಹಿಡಿದಿದ್ದರೆ, ಅಂದರೆ ಡೇಟಾ ಸಂಪೂರ್ಣವಾಗಿಲ್ಲ.

ಅಸಂರಚಿತ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: ಪಠ್ಯ ಕಡತಗಳು, ಪಠ್ಯ ಸಂದೇಶಗಳು, ವೀಡಿಯೋ ಕಡತಗಳು

ಅರ್ಧ-ಸಂರಚಿತ

ಅರ್ಧ-ಸಂರಚಿತ ಡೇಟಾ ಹೊಂದಿರುವ ಲಕ್ಷಣಗಳು ರಚನೆಬದ್ಧ ಮತ್ತು ಅಸಂರಚಿತ ಡೇಟಾದ ಸಂಯೋಜನೆಯನ್ನು ಮಾಡುತ್ತವೆ. ಸಾಮಾನ್ಯವಾಗಿ ಸಾಲು ಮತ್ತು ಕಾಲಮ್ ಫಾರ್ಮ್ಯಾಟ್‌ಗೆ ಅನುಗುಣವಾಗಿಲ್ಲ, ಆದರೆ ಯಾರೋ ಆದೇಶಿಸಿದಂತೆ ಆಯೋಜಿತವಾಗಿದೆ ಮತ್ತು ನಿಯಮಾವಳಿಗಳೊಂದಿಗಿರಬಹುದು. ಮೂಲಗಳ ಪ್ರಕಾರ ರಚನೆ ಬದಲಾಗಬಹುದು, ಉದಾಹರಣೆಗೆ ಸ್ಪಷ್ಟವಾದ ಹೈಯರಾರ್ಕಿ ಅಥವಾ ಸುಲಭವಾಗಿ ಹೊಸ ಮಾಹಿತಿಯನ್ನು ಒಗ್ಗೂಡಿಸುವ ಸ್ವಂತ ಮಾಹಿತಿ. ಮೆಟಾಡೇಟಾ ಎಂದರೆ ಡೇಟಾ ಹೇಗೆ ಆಯೋಜಿಸಲಾಗಿದೆ ಮತ್ತು ಸಂಗ್ರಹಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ತೀರ್ಮಾನಿಸಲು ಸಹಾಯ ಮಾಡುವ ಸೂಚಕರು, ಮತ್ತು ಡೇಟಾ ಪ್ರಕಾರ ಅನುಸಾರವಾಗಿ ವಿವಿಧ ಹೆಸರಿನೊಂದಿಗೆ ಇರುತ್ತವೆ. ಕೆಲವು ಸಾಮಾನ್ಯ ಹೆಸರುಗಳು: ಟ್ಯಾಗ್‌ಗಳು, ಘಟಕಗಳು, ಘಟಕತ್ವಗಳು ಮತ್ತು ಗುಣಲಕ್ಷಣಗಳು. ಉದಾಹರಣೆಗೆ, ಸಾಮಾನ್ಯ ಇಮೇಲ್ ಸಂದೇಶದಲ್ಲಿ ವಿಷಯ, ದೇಹ ಮತ್ತು ಸ್ವೀಕರಿಸುವವರ ಸಮೂಹ ಇರುತ್ತದೆ ಮತ್ತು ಅದನ್ನು ಯಾರು ಅಥವಾ ಯಾವಾಗ ಕಳುಹಿಸಲಾಗಿದೆ ಎಂಬುದರ ಮೂಲಕ ಆಯೋಜಿಸಬಹುದು.

ಅರ್ಧ-ಸಂರಚಿತ ಡೇಟಾದ ಉದಾಹರಣೆಗಳು: HTML, CSV ಕಡತಗಳು, ಜಾವಾಸ್ಕ್ರಿಪ್ಟ್ ಆಬ್ಜೆಕ್ಟ್ ನೋಟೇಶನ್ (JSON)

ಡೇಟಾ ಮೂಲಗಳು

ಡೇಟಾ ಮೂಲ ಎಂದರೆ ಡೇಟಾ ಉತ್ಪಾದನೆಯ ಮೊದಲ ಸ್ಥಳ, ಅಲ್ಲಿ ಅದು "ನಿವಾಸಿಸುತ್ತಿದೆ" ಎಂದು ಅರ್ಥವಾಗುತ್ತದೆ ಮತ್ತು ಡೇಟಾ ಸಂಗ್ರಹಣೆಯ ವಿಧಾನ ಮತ್ತು ಸಮಯ ಆಧಾರಿತವಾಗಿರುತ್ತದೆ. ಬಳಕೆದಾರರಿಂದ ಉದ್ಭವಿಸಿರುವ ಡೇಟಾವನ್ನು ಪ್ರಾಥಮಿಕ ಡೇಟಾ ಎಂದು ಕರೆಯುತ್ತಾರೆ; ಆದರೆ ಡೇಟಾ ಸಾಮಾನ್ಯ ಬಳಕೆಗೆ ಸಂಗ್ರಹಿಸಿರುವ ಮೂಲದಿಂದ ಬಂದಿರುವುದನ್ನು ದ್ವಿತೀಯ ಡೇಟಾ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಮಳೆಯ ಕಾಡಿನಲ್ಲಿ ವೀಕ್ಷಣೆಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ವಿಜ್ಞಾನಿಗಳ ಗುಂಪನ್ನು ಪ್ರಾಥಮಿಕವೆಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ, ಮತ್ತು ಅವರು ಅದನ್ನು ಇತರ ವಿಜ್ಞಾನಿಗಳಿಗೆ ಹಂಚಿದರೆ ಅದನ್ನು ದ್ವಿತೀಯ ಎಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ.

ಡೇಟಾಬೇಸ್‌ಗಳು ಸಾಮಾನ್ಯ ಮೂಲಗಳಾಗಿದ್ದು, ಡೇಟಾಬೇಸ್ ನಿರ್ವಹಣಾ ವ್ಯವಸ್ಥೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗುತ್ತವೆ, ಇಲ್ಲಿ ಬಳಕೆದಾರರು ಪ್ರಶ್ನೆಗಳನ್ನು ಹಾಕಿ ಡೇಟಾನ್ನನ್ನು ಅನ್ವೇಷಿಸುತ್ತಾರೆ. ಫೈಲ್‌ಗಳು ಡೇಟಾ ಮೂಲಗಳಾಗಿದ್ದು ಶಬ್ದ, ಚಿತ್ರ ಮತ್ತು ವೀಡಿಯೋ ಕಡತಗಳಾಗಿರಬಹುದು ಹಾಗು ಎಕ್ಸೆಲ್‌ನಂತಹ ಸ್ಪ್ರೆಡ್‌ಶೀಟ್‌ಗಳಾಗಿರಬಹುದು. ಇಂಟರ್ನೆಟ್ ಮೂಲಗಳು ಡೇಟಾ ಹೋಸ್ಟ್ ಮಾಡುವ ಸಾಮಾನ್ಯ ಸ್ಥಳಗಳಾಗಿದ್ದು, ಇಲ್ಲಿ ಡೇಟಾಬೇಸ್‌ಗಳು ಮತ್ತು ಫೈಲ್‌ಗಳೂ ಒದಗಿಸಬಹುದು. ಅಪ್ಲಿಕೇಶನ್ ಪ್ರೋಗ್ರಾಂ ಇಂಟರ್‌ಫೇಸಿಗಳು (APIs) ಪ್ರೋಗ್ರಾಮರ್‌ಗಳಿಗೆ ಅಂತರ್ಜಾಲದ ಮೂಲಕ ಬಾಹ್ಯ ಬಳಕೆದಾರರೊಂದಿಗೆ ಡೇಟಾ ಹಂಚುವ ಮಾರ್ಗಗಳನ್ನು ಸೃಷ್ಟಿಸಲು ಅವಕಾಶ ನೀಡುತ್ತವೆ, ಮತ್ತು ವೆಬ್‌ಸ್ಕ್ರೆಪಿಂಗ್ ಪ್ರಕ್ರಿಯೆಯು ವೆಬ್ ಪುಟದಿಂದ ಡೇಟಾವನ್ನು ತೆಗೆಯುತ್ತದೆ. ಡೇಟಾ ಜೊತೆಗೆ ಕೆಲಸ ಮಾಡುವುದು ಪಾಠಗಳು ವಿವಿಧ ಡೇಟಾ ಮೂಲಗಳನ್ನು ಹೇಗೆ ಉಪಯೋಗಿಸುವುದೆಂಬುದನ್ನು ವಿವರಿಸುತ್ತವೆ.

ಸಮಾರೋಪ

ಈ ಪಾಠದಲ್ಲಿ ನಾವು ಕಲಿತವು:

  • ಡೇಟಾ ಎಂದರೇನು
  • ಡೇಟಾವನ್ನು ಹೇಗೆ ವಿವರಿಸಲಾಗುತ್ತದೆ
  • ಡೇಟಾವನ್ನು ಹೇಗೆ ವರ್ಗೀಕರಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ವಿಭಾಗಾಕೃತ ಮಾಡಲಾಗುತ್ತದೆ
  • ಡೇಟಾ ಸಂಗ್ರಹಣೆಯ ಸ್ಥಳಗಳು

🚀 ಸವಾಲು

Kaggle ಇಲ್ಲಿ ಉತ್ತಮ ತೆರೆದ ಡೇಟಾ ಸಂಗ್ರಹಗಳು ಲಭ್ಯವಿದ್ದು, ಡೇಟಾ ಸಂಗ್ರಹ ಹುಡುಕು ಸಾಧನ ಉಪಯೋಗಿಸಿ ಕೆಲವು ರೋಚಕ ಡೇಟಾ ಸಂಗ್ರಹಗಳನ್ನು ಹುಡುಕಿ ಮತ್ತು ಕೆಳಗಿನ ಮಾನದಂಡಗಳೊಂದಿಗೆ 3-5 ಡೇಟಾ ಸಂಗ್ರಹಗಳನ್ನು ವರ್ಗೀಕರಿಸಿ:

  • ಡೇಟಾ ಪ್ರಮಾಣಾತ್ಮಕ ಅಥವಾ ಗುಣಾತ್ಮಕವೆ?
  • ಡೇಟಾ ರಚನೆಬದ್ಧ, ಅಸಂರಚಿತ, ಅಥವಾ ಅರ್ಧ-ಸಂರಚಿತವೇ?

ಪೋಸ್ಟ್-ಲೇಕ್ಚರ್ ಕ್ವಿಜ್

ವಿಮರ್ಶೆ ಮತ್ತು ಸ್ವಯಂ ಅಧ್ಯಯನ

ನಿಯೋಜನೆ

ಡೇಟಾ ಸಂಗ್ರಹಗಳನ್ನು ವರ್ಗೀಕರಿಸುವುದು


ಅಸ್ವೀಕಾರ: ಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ Co-op Translator ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯನ್ನು ಸಾಧಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ದಯವಿಟ್ಟು ಗಮನಿಸಿ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸಡ್ಡೆಗಳು ಇರಬಹುದು. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜು ಪ್ರಾಮಾಣಿಕ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸುವ ಮೂಲಕ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗಳ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನಗಳ ಬಗ್ಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.