|
|
6 months ago | |
|---|---|---|
| .. | ||
| README.md | 6 months ago | |
| assignment.md | 6 months ago | |
| pi-audio.md | 6 months ago | |
| pi-microphone.md | 6 months ago | |
| pi-speech-to-text.md | 6 months ago | |
| virtual-device-audio.md | 6 months ago | |
| virtual-device-microphone.md | 6 months ago | |
| virtual-device-speech-to-text.md | 6 months ago | |
| wio-terminal-audio.md | 6 months ago | |
| wio-terminal-microphone.md | 6 months ago | |
| wio-terminal-speech-to-text.md | 6 months ago | |
README.md
ಐಒಟಿ ಸಾಧನದಿಂದ ಮಾತು ಗುರುತಿಸಿ
ಸ್ಕೆಚ್ನೋಟ್: ನಿತ್ಯ ನಾರಸಿಂಹನ್. ದೊಡ್ಡ ಗಾತ್ರದ ಆವೃತ್ತಿಗಾಗಿ ಚಿತ್ರವನ್ನು ಕ್ಲಿಕ್ ಮಾಡಿ.
ಈ ವೀಡಿಯೋವು ಆಝೂರ್ ಮಾತು ಸೇವೆಯ ಅವಲೋಕನವನ್ನು ನೀಡುತ್ತದೆ, ಇದು ಈ ಪಾಠದಲ್ಲಿ ಚರ್ಚಿಸುವ ವಿಷಯ:
🎥 ವೀಡಿಯೊ ವೀಕ್ಷಿಸಲು ಮೇಲಿನ ಚಿತ್ರವನ್ನು ಕ್ಲಿಕ್ ಮಾಡಿರಿ
ಪಾಠ ಮುನ್ನ ಪರೀಕ್ಷೆ
ಪರಿಚಯ
'ಅಲೆಕ್ಸಾ, 12 ನಿಮಿಷದ ಟೈಮರ್ ಸೆಟ್ ಮಾಡು'
'ಅಲೆಕ್ಸಾ, ಟೈಮರ್ ಸ್ಥಿತಿ'
'ಅಲೆಕ್ಸಾ, ಸ್ಟೀಮ್ ಬ್ರೋಕೋಲಿಗೆ 8 ನಿಮಿಷದ ಟೈಮರ್ ಸೆಟ್ ಮಾಡು'
ಸ್ಮಾರ್ಟ್ ಸಾಧನಗಳು ದಿನ ಹೊಂದಿದಂತೆ ವ್ಯಾಪಕವಾಗುತ್ತಿದ್ದವೆ. ಮನೆಪೋಡ್ಗಳು, ಎಕೋ ಮತ್ತು ಗೂಗಲ್ ಹೋಮ್ಸ್ ಗಳಂತಹ ಸ್ಮಾರ್ಟ್ ಸ್ಪೀಕರ್ಗಳಷ್ಟೇ ಅಲ್ಲ, ನಮ್ಮ ಫೋನ್ಗಳು, ಘಡಿಗಳಲ್ಲೂ ಮತ್ತು ಇಲ್ಲವಾದರೆ ದೀಪಗ hodಗಳು ಮತ್ತು ಥರ್ಮೋಸ್ಟ್ಯಾಟ್ಗಳಲ್ಲೂ ನೇರವಾಗಿ ಜೋಡಿಸಲಾಗಿದೆ.
💁 ನನ್ನ ಮನೆಯಲ್ಲ at least 19 ಸಾಧನಗಳನ್ನು ಧ್ವನಿ ಸಹಾಯಕರೊಂದಿಗೆ ಹೊಂದಿರುವಂತೆ ತಿಳಿದಿದೆ ಮತ್ತು ಅದೇ ನನ್ನ ತಿಳಿವಳಿಕೆಯಷ್ಟೇ!
ಧ್ವನಿ ನಿಯಂತ್ರಣವು accessibility ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಚಲಿಸುವುದರಲ್ಲಿ ಅಡಚಣೆಯುಳ್ಳವರಿಗೆ ಸಾಧನಗಳನ್ನು ಬಳಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಅದು ಶಾಶ್ವತ ಅಂಗವೈಕಲ್ಯವಾಗಿರಲಿ ಅಥವಾ ತಾತ್ಕಾಲಿಕ ಅಂಗವೈಕಲ್ಯವಾಗಿರಲಿ, ಉದಾಹರಣೆಗೆ ಮುದುರಿದ ಕೈಗಳು ಅಥವಾ ಖರೀದಿಸಿದ ವಸ್ತುಗಳ ಕಾರಣ ನನ್ನ ಕೈಗಳು ಬಜೆ ಇದ್ದವರು, ಧ್ವನಿಯಿಂದ ನನ್ನ ಮನೆಯನ್ನು ನಿಯಂತ್ರಿಸುವುದು ಹೊಸ ದಿಸೆಯಲ್ಲಿ ಪ್ರವೇಶವನ್ನು ತೆರೆದುಕೊಂಡಿದೆ. 'ಹೇ ಸಿರಿ, ನನ್ನ ಗ್ಯಾರೇಜ್ ದ್ವಾರವನ್ನು ಮುಚ್ಚು' ಎಂದು ಕೂಗುವುದು, ತಾಯಿಯ ಬದಲಾವಣೆ ಮಾಡುತ್ತಾ ಮತ್ತು ಕಾರ್ಯದರ್ಶಿ ಹಗಲುಕಾಲ ಪಾಪದೊಂದಿಗೆ, ಒಂದು ಚಿಕ್ಕ ಆದರೆ ಪರಿಣಾಮಕಾರಿಯಾದ ಸುಧಾರಣೆಯಾಗಿದೆ.
ಧ್ವನಿ ಸಹಾಯಕರ ಬಳಕೆಯೊಂದರಲ್ಲಿ ಹೆಚ್ಚು ಜನಪ್ರಿಯವಾದುದು ಟೈಮರ್ಗಳನ್ನು ಸೆಟ್ ಮಾಡುವುದು, ವಿಶೇಷವಾಗಿ ಅಡುಗೆ ಮನೆಯ ಟೈಮರ್ಗಳು. ನಿಮಗಿಷ್ಟದ ಆಹಾರ ತಯಾರಿಸುವಾಗ ಕೈಗಳನ್ನು ನಿಲ್ಲಿಸದೇ, ಸూప್ ಮಿಶ್ರಣ ಮಾಡುತ್ತಿರುವಾಗ ಅಥವಾ ಹಾಸು ಹಾಕುತ್ತಿರುವಾಗ ಬಹುಮುಖ ಟೈಮರ್ಗಳನ್ನು ನಿಮ್ಮ ಧ್ವನಿಯಿಂದಲೇ ಸೆಟ್ ಮಾಡುವುದು ತುಂಬಾ ಸಹಾಯಕ.
ಈ ಪಾಠದಲ್ಲಿ ನೀವು ಐಒಟಿ ಸಾಧನಗಳಲ್ಲಿ ಧ್ವನಿ ಗುರುತಿಸಲು ಕಲಿಯುತ್ತೀರಿ. ಮೈಕ್ರೋಫೋನ್ಗಳು ಸೆನ್ಸರ್ಗಳಾಗಿವೆ ಎಂಬುದನ್ನು, ಐಒಟಿ ಸಾಧನಕ್ಕೆ ಸಂಪರ್ಕಿಸಿದ ಮೈಕ್ರೋಫೋನಿನಿಂದ ಧ್ವನಿಯನ್ನು ಹೇಗೆ ಸೆರೆಹಿಡಿಯಬೇಕು ಎಂದು, ಮತ್ತು ಕೇಳಿದ ಮಾತುಗಳನ್ನು ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸಲು AI ಅನ್ನು ಹೇಗೆ ಬಳಸುವುದು ಎಂದು ಕಲಿಯುವಿರಿ. ಈ ಯೋಜನೆಯ ಉಳಿದ ಭಾಗಗಳಲ್ಲಿ, ಬಹುಭಾಷಾ ಬೆಂಬಲ ಹೊಂದಿರುವ ಸ್ಮಾರ್ಟ್ ಅಡುಗೆ ಟೈಮರ್ ಅನ್ನು ನಿರ್ಮಿಸುವಿರಿ.
ಈ ಪಾಠದಲ್ಲಿ ನಾವು ತಿಳಿಯಬೇಕಾಗಿರುವುದು:
- ಮೈಕ್ರೋಫೋನ್ಗಳು
- ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದಿಂದ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯುವುದು
- ಮಾತು-ಪಠ್ಯ
- ಮಾತನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು
ಮೈಕ್ರೋಫೋನ್ಗಳು
ಮೈಕ್ರೋಫೋನ್ಗಳು ಧ್ವನ ತರಂಗಗಳನ್ನು ವಿದ್ಯುತ್ ಸಂಕೇತಗಳಾಗಿ ಪರಿವರ್ತಿಸುವ ಅನಾಲಾಗ್ ಸೆನ್ಸರ್ಗಳು. ಗಾಳಿಯ ಕಂಪನಗಳು ಮೈಕ್ರೋಫೋನಿನೊಳಗಿನ ಘಟಕಗಳನ್ನು ಅಲ್ಪ ಪ್ರಮಾಣದಲ್ಲಿ ಸರಿಸುತ್ತವೆ, ಅವು ವಿದ್ಯುತ್ ಸಂಕೇತಗಳಲ್ಲಿ ಸೂಕ್ಷ್ಮ ಬದಲಾವಣೆಗಳನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ. ನಂತರ ಈ ಬದಲಾವಣೆಗಳನ್ನು ವೃದ್ಧಿಗೊಳಿಸಿ ವಿದ್ಯುತ್ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ರಚಿಸಲಾಗುತ್ತದೆ.
ಮೈಕ್ರೋಫೋನ್ ಪ್ರಕಾರಗಳು
ಮೈಕ್ರೋಫೋನ್ಗಳು ವಿವಿಧ ಪ್ರಕಾರಗಳಲ್ಲಿ ಬರುತ್ತವೆ:
-
ಡೈನಾಮಿಕ್ - ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಿಗೆ ಚಲಿಸುವ ಡಯಾಫ್ರಾಗ್ಮ್ಗೆ ಲಗತ್ತಿಸಲಾದ ಕನ್ನ ಡೋಣಿಯಾಗಿದೆ, ಅದು ತಂತುಗಳ ಸುಳಿಯಲ್ಲಿ ಚಲಿಸಿ ವಿದ್ಯುತ್ ಪ್ರಸರಣವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಇದು ಬಹುತೇಕ ಲೌಡ್ಸ್ಪೀಕರ್ಗಳ ವಿರುದ್ಧವಾಗಿದೆ, ಅವು ವಿದ್ಯುತ್ ಪ್ರವಾಹದಿಂದ ಕನ್ನ ಡೋಣಿಯನ್ನು ಚಲಿಸುವ ಮೂಲಕ ಧ್ವನಿಯನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ. ಇದರಿಂದ, ಸ್ಪೀಕರ್ಗಳನ್ನು ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಾಗಿ ಹಾಗೂ ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳನ್ನು ಸ್ಪೀಕರ್ಗಳಾಗಿ ಬಳಸಬಹುದು. ಉದಾಹರಣೆಗೆ, ಸಂವಹನ ಸಾಧನಗಳಲ್ಲಿ ಬಳಕೆದಾರನು ಕೇಳುವುದು ಅಥವಾ ಮಾತನಾಡುವುದು ಮಾತ್ರ ಸಾದ್ಯವಾಗಿದ್ದು, ಒಂದು ಸಾಧನವೇ ಸ್ಪೀಕರ್ ಮತ್ತು ಮೈಕ್ರೋಫೋನ್ ಎರಡನ್ನೂ ಆಗಬಹುದು.
ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಸ್ ಕಾರ್ಯಕ್ಕೆ ವಿದ್ಯುತ್ ಬೇಕಾಗಿಲ್ಲ, ವಿದ್ಯುತ್ ಸಂಕೇತವನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಮೈಕ್ರೋಫೋನಿನಿಂದ ಸೃಷ್ಟಿಸಲಾಗುತ್ತದೆ.
-
ರಿಬನ್ - ರಿಬನ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಿಗೆ ಹೋಲುವುವು, ಭಿನ್ನತೆ ಏನೆಂದರೆ ಡಯಾಫ್ರಾಗ್ಮಿನ ಬದಲು ತಾಮ್ರ ರಿಬನ್ ಲಗತ್ತಿಸಲಾಗಿದೆ. ಈ ರಿಬನ್ ಕ್ಷೇಮ ಕ್ಷೇತ್ರದಲ್ಲಿ ಚಲಿಸಿ ವಿದ್ಯುತ್ ಪ್ರಸರಣವನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ. ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಂತೆ, ರಿಬನ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಕಾರ್ಯಕ್ಕೆ ವಿದ್ಯುತ್ ಅಗತ್ಯವಿಲ್ಲ.
-
ಕಾಂಡೆನ್ಸರ್ - ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಸಣ್ಣ ತಾಮ್ರ ಡಯಾಫ್ರಾಗ್ಮ್ ಮತ್ತು ಸ್ಥಿರ ತಾಮ್ರ ಪ್ಲೇಟ್ ಹೊಂದಿರುತ್ತವೆ. ವಿದ್ಯುತ್ ಎರಡಕ್ಕೂ ಅನ್ವಯಿಸಲಾಗುತ್ತಿದ್ದು, ಡಯಾಫ್ರಾಗ್ಮ್ ಕಂಪನದಿಂದ ಪ್ಲೇಟ್ಗಳ ನಡುವಿನ ಸ್ಥಿರ ವಿದ್ಯುತ್ ಬದಲಾವಣೆಯಿಂದ ಸಂಕೇತ ಉದ್ಭವಿಸುತ್ತದೆ. ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಕಾರ್ಯಕ್ಕೆ ವಿದ್ಯುತ್ ಬೇಕಾಗುತ್ತದೆ - ಇದನ್ನು ಫ್ಯಾಂಟಮ್ ಪವರ್ ಎಂದು ಕರೆಯುತ್ತಾರೆ.
-
MEMS - ಮೈಕ್ರೋಎಲೆಕ್ಟ್ರೋ ಮೆಕ್ಯಾನಿಕಲ್ ಸಿಸ್ಟಮ್ (ಮೆಮ್ಸ್) ಮೈಕ್ರೋಫೋನ್ಗಳು ಚಿಪ್ ಮೇಲಿನ ಮೈಕ್ರೋಫೋನ್ಗಳು. ಸಿಲಿಕಾನ್ ಚಿಪ್ ಮೇಲೆ ಒತ್ತಡಕ್ಕೆ ಪ್ರಕೃತಸರಿಯಾಗಿ ಸ್ಪಂದಿಸುವ ಡಯಾಫ್ರಾಗ್ಮ್ ಅಂಚು ಮಾಡಲಾಗಿದೆ ಮತ್ತು ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನಿನಂತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. ಈ ಮೈಕ್ರೋಫೋನ್ಗಳು ಸೂಕ್ಷ್ಮವಾಗಿದ್ದು, ಪರಿಕರಗಳಲ್ಲಿ ಸಮಾಧಿಕೃತವಾಗಿರಬಹುದು.
ಮೇಲಿನ ಚಿತ್ರದಲ್ಲಿ, LEFT ಎಂದು ಗುರುತಿಸಿದ ಚಿಪ್ ಮಿಲ್ ಮೀಟರ್ ಗಿಂತ ಹೆಚ್ಚು ಚಿಕ್ಕ ಡಯಾಫ್ರಾಗ್ಮ್ ಹೊಂದಿರುವ ಮೆಮ್ಸ್ ಮೈಕ್ರೋಫೋನ್.
✅ ಸಂಶೋಧನೆ ಮಾಡಿ: ನಿಮ್ಮ ಸುತ್ತಲಿನ ಸಾಧನಗಳಲ್ಲಿ ಮೈಕ್ರೋಫೋನ್ಗಳಿರುವುದೇ? ನಿಮ್ಮ ಗಣಕಯಂತ್ರ, ಫೋನ್, ಹೆಡ್ಸೆಟ್ ಅಥವಾ ಇತರ ಸಾಧನಗಳಲ್ಲಿ ಮೈಕ್ರೋಫೋನಿನ ಪ್ರಕಾರವೇನು?
ಡಿಜಿಟಲ್ ಧ್ವನಿ
ಧ್ವನಿ ಒಂದು ಅನಾಲಾಗ್ ಸಂಕೇತವಾಗಿದ್ದು ತುಂಬಾ ಸೂಕ್ಷ್ಮ ಮಾಹಿತಿಯನ್ನು ಹೊರುತ್ತದೆ. ಈ ಸಂಕೇತವನ್ನು ಡಿಜಿಟಲ್ ಆಗಿ ಪರಿವರ್ತಿಸಲು ಪಲ್ಸ್ ವೇಡ್ ಮೋಜ್ಯುಲೇಶನ್ ಉಪಯೋಗಿಸಿ ಸಾವಿರಾರು ಬಾರಿ ಸೆಗ್ಮೆಂಟ್ ಮಾಡಬೇಕು.
🎓 ಸೆಂಪ್ಲಿಂಗ್ ಎಂದರೆ ಧ್ವನಿಯ ಸಂಕೇತವನ್ನು ಆ ಸಮಯದಲ್ಲಿ ಅದರ ಮೌಲ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುವ ಡಿಜಿಟಲ್ ಮೌಲ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು.
ಡಿಜಿಟಲ್ ಧ್ವನಿಯನ್ನು ಪಲ್ಸ್ ಕೋಡ್ ಮಾಡ್ಯುಲೇಶನ್ (PCM) ಬಳಸಿಕೊಂಡು ಸೆಂಪಲ್ ಮಾಡಲಾಗುತ್ತದೆ. PCM ನಲ್ಲಿ ಸಂಕೇತದ ವೋಲ್ಟೇಜ್ ಓದಿ ಆ ವೋಲ್ಟೇಜಿಗೆ ಸಮೀಪವಾದ ನಿರ್ದಿಷ್ಟ ಮೌಲ್ಯವನ್ನು ಆಯ್ಕೆ ಮಾಡಲಾಗುತ್ತದೆ.
💁 PCM ಅನ್ನು ಪಲ್ಸ್ ವಿದುತ ಮೋಡೆಲೇಷನ್ (PWM) ನ ಸೆನ್ಸರ್ ಆವೃತ್ತಿಯಾಗಿ ಭಾವಿಸಬಹುದು (PWM ಅನ್ನು ಪಠ್ಯ 3 ರಲ್ಲಿ ಕೇಳಿದ್ದೀರಿ). PCM ಅನಾಲಾಗ್ ಸಂಕೇತವನ್ನು ಡಿಜಿಟಲ್ಗೆ ಪರಿವರ್ತಿಸುತ್ತದೆ, PWM ಡಿಜಿಟಲ್ ಸಂಕೇತವನ್ನು ಅನಾಲಾಗ್ ಗೆ ಪರಿವರ್ತಿಸುತ್ತದೆ.
ಉದಾಹರಣೆಗೆ, ಹೆಚ್ಚಿನ ಸ್ಟ್ರೀಮಿಂಗ್ ಮ್ಯೂಸಿಕ್ ಸರ್ವೀಸ್ಗಳು 16-ಬಿಟ್ ಅಥವಾ 24-ಬಿಟ್ ಆಡಿಯೋವನ್ನು ಒದಗಿಸುತ್ತವೆ. ಎಂದರೆ ಅದಕ್ಕೆ 16-ಬಿಟ್ ಇಂಟೆಜರ್ ಅಥವಾ 24-ಬಿಟ್ ಇಂಟೆಜರ್ಗೆ ಹೊಂದುವಂತೆ ವೋಲ್ಟೇಜ್ ಅನ್ನು ಪರಿವರ್ತಿಸುತ್ತದೆ. 16-ಬಿಟ್ ಆಡಿಯೋ ಮೌಲ್ಯವನ್ನು -32,768 ರಿಂದ 32,767 ಅಂಕಗಳ ನಡುವಿನ ಸಂಖ್ಯೆಗೊಳಿಸುತ್ತದೆ, 24-ಬಿಟ್ ಮೌಲ್ಯವು −8,388,608 ರಿಂದ 8,388,607 ರವರೆಗೆ. ಹೆಚ್ಚು ಬಿಟ್ಗಳಿದ್ದರೆ, ನಾವು ಕೇಳುವ ಧ್ವನಿಗೆ ನಿಖರವಾಗಿರುತ್ತದೆ.
💁 ತಲೆತಲೆಗೆ 8-ಬಿಟ್ ಆಡಿಯೋ ಇರುವುದಿದೆ, ಇದನ್ನು ಲೋಫೈ ಎಂದೂ ಕರೆಯುತ್ತಾರೆ. ಇದು ಕೇವಲ 8-ಬಿಟ್ ಬಳಸಿ ಸಂಗ್ರಹಿಸಲ್ಪಟ್ಟ ಆಡಿಯೋ, ಅಂದರೆ -128 ರಿಂದ 127 ರವರೆಗೆ. ಮೊದಲ ಗಣಕಯಂತ್ರ ಧ್ವನಿ 8-ಬಿಟ್ ಮಿತಿ ಹೊಂದಿತ್ತು, ಇದರಿಂದ ಈ ರೀತಿಯ ಧ್ವನಿಯು ರೆಟ್ರೋ ಗೇಮಿಂಗ್ನಲ್ಲಿ ಹೆಚ್ಚಾಗಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ.
ಈ ಸೆಂಪಲ್ಗಳನ್ನು ಪ್ರತೀ ಸೆಕೆಂಡಿಗೆ ಸಾವಿರಾರು ಬಾರಿ ತೆಗೆದುಕೊಳ್ಳಲಾಗುತ್ತದೆ, KHz (ಸಾವಿರಗಳ ಸಂಕೇತ ಓದುವಿಕೆಗಳು ಪ್ರತೀ ಸೆಕೆಂಡ್) ನಲ್ಲಿ ಮಾಪನ ಮಾಡಿ. ಸ್ಟ್ರೀಮಿಂಗ್ ಸೇವೆಗಳು ಸಾಮಾನ್ಯವಾಗಿ 48KHz ಅನ್ನು ಬಳಸುತ್ತವೆ, ಕೆಲ 'ಲಾಸ್ಲೆಸ್' ಆಡಿಯೋ 96KHz ಅಥವಾ 192KHz ಉಪಯೋಗಿಸುತ್ತವೆ. ಹೆಚ್ಚು ಮಾದರಿ ದರದಿಂದ ಮೂಲ ಧ್ವನಿಗೆ ಹತ್ತಿರವಾಗಿರುತ್ತದೆ, ಕೆಲವರು 48KHz ಮೀರಿದ ಮೇಲೆ ಮಾನವನೇ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರ್ತಿಸಲಾರರು ಎಂಬುದು ಚರ್ಚೆಯಾಗುತ್ತಿದೆ.
✅ ಸಂಶೋಧನೆ ಮಾಡಿ: ನೀವು ಸ್ಟ್ರೀಮಿಂಗ್ ಮ್ಯೂಸಿಕ್ ಸೇವೆಯು ಬಳಸಿದರೆ, ಅದು ಯಾವ ಮಾದರಿ ದರ ಮತ್ತು ಗಾತ್ರವನ್ನು ಬಳಸುತ್ತದೆ? ನೀವು CDs ಬಳಸದಿರಾ? CD ಧ್ವನಿ ಮಾದರಿ ದರ ಮತ್ತು ಗಾತ್ರವೇನು?
ಧ್ವನಿ ದತ್ತಾಂಶದ ಹಲವಾರು ವಿನ್ಯಾಸಗಳಿವೆ. ನೀವು mp3 ಫೈಲ್ಗಳನ್ನು ಕೇಳಿದ್ದೀರಾ - ಗುಣಮಟ್ಟದಲ್ಲಿನ ನಷ್ಟವಿಲ್ಲದೆ ಸಣ್ಣಗೊಳಿಸಲು ಸಾಂಗತ್ಯಗೊಳಿಸಿದ ಧ್ವನಿ ದತ್ತಾಂಶ. ಅನ್ಕಂಪ್ರೆಸ್ಡ್ ಧ್ವನಿ ಸಾಮಾನ್ಯವಾಗಿ WAV ಫೈಲ್ ಆಗಿರುತ್ತದೆ - 44 ಬೈಟಿನ ಹೆಡರ್ ಮಾಹಿತಿಯನ್ನು ಹೊಂದಿದ್ದು, ನಂತರದ ದತ್ತಾಂಶವನ್ನು ಅನ್ನುತ್ತದೆ. ಹೆಡರ್ನಲ್ಲಿ ಮಾದರಿ ದರ (ಉದಾಹರಣೆಗಾಗಿ 16000 ಎಂದರೆ 16KHz) ಮತ್ತು ಮಾದರಿ ಗಾತ್ರ (16-ಬಿಟ್) ಮತ್ತು ಚಾನೆಲ್ಗಳ ಸಂಖ್ಯೆ ವಿವರಿಸಲಾಗಿದೆ. ಹೆಡರ್ಗೆ ನಂತರ RAW ಧ್ವನಿ ದತ್ತಾಂಶವಾಗಿರುತ್ತದೆ.
🎓 ಚಾನೆಲ್ಗಳು ಎಂದರೆ ಎಷ್ಟು ಪ್ರತ್ಯೇಕ ಧ್ವನಿ ಕಲವಣಿಗಳು ಒಟ್ಟಿನಲ್ಲಿ ಇದ್ದವೆ ಎಂಬುದರ ಸೂಚನೆ. ಬೇರೆ ಬೇರೆ ಧ್ವನಿ ಸ್ಟ್ರಿಮ್ಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಸ್ಟೀರಿಯೋದಲ್ಲಿ ಎಡ ಮತ್ತು ಬಲ ಚಾನೆಲ್ಗಳು 2 ಆಗಿರುತ್ತವೆ. 7.1 ಸುತ್ತುವಳಿ ಸ್ವರ ಹತ್ತಿರ ಹಂತದ ಚಾನೆಲ್ಗಳು 8 ಆಗಿರುತ್ತವೆ.
ಧ್ವನಿ ದತ್ತಾಂಶ ಗಾತ್ರ
ಧ್ವನಿ ದತ್ತಾಂಶವು ದೊಡ್ಡದಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, 16-ಬಿಟ್ ಅನುಪಚಿತ ಧ್ವನಿ 16KHz ನಲ್ಲಿ ಸೆರೆಹಿಡಿದರೆ (ಮಾತು-ಪಠ್ಯ ಮಾದರಿಗಾಗಿ ಸಾಕಷ್ಟು ಒಳ್ಳೆಯ ದರ) ಪ್ರತೀ ಸೆಕೆಂಡಿಗೆ 32KB ದತ್ತಾಂಶ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ:
- 16-ಬಿಟ್ ಎಂದರೆ 2 ಬೈಟ್ಗಳು ಪ್ರತಿ ಎಲಾಖೆಗೆ (1 ಬೈಟ್ = 8 ಬಿಟ್).
- 16KHz ಎಂದರೆ 16000 ಸೆಂಪಲ್ಗಳು ಪ್ರತಿ ಸೆಕೆಂಡ್.
- 16000 x 2 ಬೈಟ್ = 32000 ಬೈಟ್ ಪ್ರತಿ ಸೆಕೆಂಡ್.
ಇದು ಸಣ್ಣಮಾತ್ರದ ದತ್ತಾಂಶವೆಂದು ಕೇಳಿ ಬರುವುದಾದರೂ, ನಿಯತ ಸ್ಮರಣಾಶಕ್ತಿಯಿರುವ ಮೈಕ್ರೋ ಕಂಟ್ರೋಲರ್ ಬಳಕೆಮಾಡುತ್ತಿದ್ದರೆ ಇದು ದೊಡ್ಡ ಸಂಖ್ಯೆಯಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, Wio ಟರ್ಮಿನಲಿಗೆ 192KB ಸ್ಮೃತಿ ಇರುತ್ತದೆ, ಅದು ಪ್ರೋಗ್ರಾಂ ಕೋಡ್ ಮತ್ತು ವೇರಿಯಬಲ್ಗಳನ್ನು ಹೊಂದಿರಬೇಕು. ನಿಮ್ಮ ಪ್ರೋಗ್ರಾಂ ಕೋಡ್ ಅತ್ಯಂತ ಸಣ್ಣದಾಗಿದ್ದರೂ ಸಾಕ್ಷಾತ್ 5 ಸೆಕೆಂಡಿಗೆ ಹೆಚ್ಚು ಧ್ವನಿ ಸೆರೆಹಿಡಿಯಲು ಸಾಧ್ಯವಿಲ್ಲ.
ಮೈಕ್ರೋ ಕಂಟ್ರೋಲರ್ಗಳು ಹೆಚ್ಚುವರಿ ಸಂಗ್ರಹಣೆ ಸ್ವೀಕರಿಸಬಹುದು, ಹಾಗೆಯೇ SD ಕಾರ್ಡ್ಗಳು ಅಥವಾ ಫ್ಲ್ಯಾಶ್ ಮೆಮೊರಿಯಂತಹ. ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯುವ ಐಒಟಿ ಸಾಧನ ನಿರ್ಮಿಸುವಾಗ ನೀವು ಹೆಚ್ಚುವರಿ ಸಂಗ್ರಹಣೆ ಇರುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬೇಕು, ಮತ್ತು ಪ್ರೋಗ್ರಾಂ ಕೋಡ್ ಸೆರೆಹಿಡಿದ ಧ್ವನಿಯನ್ನು ನೇರವಾಗಿ ಆ ಸಂಗ್ರಹಣದಲ್ಲಿ ಬರೆಯಬೇಕು. ಮತ್ತು ಕ್ಲೌಡ್ಗೆ ಕಳುಹಿಸುವಾಗ ಆ ಸಂಗ್ರಹಣೆಗಳಿಂದ ಡೇಟಾವನ್ನು ಸ್ಟ್ರೀಮ್ ಮಾಡಬೇಕು. ಈ ರೀತಿ ಒಂದು ವೇಳೆ ಒಟ್ಟು ಧ್ವನಿ ದತ್ತಾಂಶವನ್ನು ಸ್ಮರಣೆಯಲ್ಲಿ ಹಿಡಿಯಲು ಸಾದ್ಯವಾಗದ ಪ್ರಕರಣದಲ್ಲಿ ಕಲವು ಬಂದೀತು.
ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದಿಂದ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯುವುದು
ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದೊಂದಿಗೆ ಮೈಕ್ರೋಫೋನನ್ನು ಸಂಪರ್ಕಿಸಿ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯಬಹುದು, ಅದು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದಕ್ಕೆ ಸಿದ್ಧನೆ. ಕೋವಿಡ್ ಧ್ವನಿ ಉತ್ಪಾದಿಸಲು ಸ್ಪೀಕರ್ಗಳಿಗೆ ಸಂಪರ್ಕಿಸಬಹುದು. ಮುಂದಿನ ಪಾಠಗಳಲ್ಲಿ ಧ್ವನಿ ಪ್ರತಿಕ್ರಿಯೆ ನೀಡಲು ಬಳಸಲಾಗಬಹುದು, ಈಗಿನಲ್ಲೇ ಮೈಕ್ರೋಫೋನನ್ನು ಪರೀಕ್ಷಿಸಲು ಸ್ಪೀಕರ್ಗಳನ್ನು ಸೆಟ್ ಮಾಡುವುದು ಉಪಯುಕ್ತ.
ಕಾರ್ಯ - ನಿಮ್ಮ ಮೈಕ್ರೋಫೋನ್ ಮತ್ತು ಸ್ಪೀಕರ್ಗಳನ್ನು ಕನ್ಫಿಗರ್ ಮಾಡಿ
ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದ ಮೈಕ್ರೋಫೋನ ಮತ್ತು ಸ್ಪೀಕರ್ಗಳನ್ನು ಕನ್ಫಿಗರ್ ಮಾಡಲು ಸಂಬಂಧಿಸಿದ ಮಾರ್ಗಸೂಚಿಯ ಮೂಲಕ ಸಾಗಿರಿ:
- Arduíno - Wio ಟರ್ಮಿನಲ್
- ಸಿಂಗಿ-ಬೋರ್ಡ್ ಕಂಪ್ಯೂಟರ್ - ರಾಸ್ಪ್ಬೆರ್ರಿ ಪೈ
- ಸಿಂಗಿ-ಬೋರ್ಡ್ ಕಂಪ್ಯೂಟರ್ - ವರ್ಚುವಲ್ ಸಾಧನ
ಕಾರ್ಯ - ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯಿರಿ
ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದಲ್ಲಿ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯಲು ಸಂಬಂಧಿಸಿದ ಮಾರ್ಗಸೂಚಿಯನ್ನು ಅನುಸರಿಸಿ:
- Arduíno - Wio ಟರ್ಮಿನಲ್
- ಸಿಂಗಿ-ಬೋರ್ಡ್ ಕಂಪ್ಯೂಟರ್ - ರಾಸ್ಪ್ಬೆರ್ರಿ ಪೈ
- ಸಿಂಗಿ-ಬೋರ್ಡ್ ಕಂಪ್ಯೂಟರ್ - ವರ್ಚುವಲ್ ಸಾಧನ
ಮಾತು-ಪಠ್ಯ
ಮಾತು-ಪಠ್ಯ ಅಥವಾ ಮಾತು ಗುರುತುಪಡಿಸುವಿಕೆಯಲ್ಲಿ ಆಡಿಯೋ ಸಂಕೇತದಲ್ಲಿ ಇದ್ದ ಶಬ್ದಗಳನ್ನು ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸಲು AI ಬಳಕೆ ಮಾಡಲಾಗುತ್ತದೆ.
ಮಾತು ಗುರುತಿಸುವಿಕೆಯ ಮಾದರಿಗಳು
ಮಾತು-ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಲು ಆಡಿಯೋ ಸಂಕೇತದ ಸೆಂಪಲ್ಗಳನ್ನು ಜೋಡಿಸಿ, ಆರಿಂದ ರಿಕರರೆಂಟ್ ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್ (RNN) ಆಧರಿತ ಯಂತ್ರ ಕಲಿಕೆ ಮಾದರಿಗೆ ಪೂರೈಸಲಾಗುತ್ತದೆ. ಇದು ಹಿಂದಿನ ಡೇಟಾವನ್ನು ಬಳಸಿ ಇನ್ಪುಟ್ ಡೇಟಾದ ಬಗ್ಗೆ ನಿರ್ಧಾರ ಮಾಡಲು ಬಳಸುವ ಮಾದರಿ. ಉದಾಹರಣೆಗೆ, RNN ಒಂದು ಆಡಿಯೋ ಸೆಂಪಲ್ 'Hel' ಎಂದು ಗುರುತಿಸಿ, ಬಳಿಕ ಇನ್ನೊಂದು 'lo' ಎಂದು ಗುರುತಿಸಿದರೆ, ಇವುಗಳನ್ನು ಜೋಡಿಸಿ 'Hello' ಎಂಬ ಪದವಿದೆ ಎಂದು ಕಂಡುಬಂದು ಅದನ್ನು ಫಲಿತಾಂಶವಾಗಿ ಆರಿಸಬಹುದು.
ಎಲ್ಲಾ ಯಂತ್ರ ಕಲಿಕೆ ಮಾದರಿಗಳು ಪ್ರತೀ ಬಾರಿ ಸಮಾನ ಗಾತ್ರದ ಡೇಟಾವನ್ನು ಸ್ವೀಕರಿಸುತ್ತವೆ. ನೀವು ಹಿಂದೆ ನಿರ್ಮಿಸಿದ್ದ ಚಿತ್ರ ವರ್ಗಶನಕಾರನು ಚಿತ್ರಗಳನ್ನು ನಿರ್ದಿಷ್ಟ ಗಾತ್ರಕ್ಕೆ ಮರುಅಳತೆ ಮಾಡಿ ಪ್ರಕ್ರಿಯೆ ಮಾಡುತ್ತಾನೆ. ಮಾತು ಮಾದರಿಗಳು ಅದೇ ರೀತಿ ನಿರ್ದಿಷ್ಟ ಗಾತ್ರದ ಧ್ವನಿ ತುಂಡುಗಳನ್ನು ಪ್ರಕ್ರಿಯೆ ಮಾಡಬೇಕು. ಮಾತು ಮಾದರಿಗಳು ಹಲವಾರು ಪೂರ್ವಾನುಮಾನಗಳನ್ನು ಸಂಯೋಜಿಸಿ ಉತ್ತರ ದೊರಕಿಸಬೇಕು, ಇದರಿಂದ 'Hi' ಮತ್ತು 'Highway', ಅಥವಾ 'flock' ಮತ್ತು 'floccinaucinihilipilification' ಎಂದು ವಿಭಿನ್ನವಾದ ಪದಗಳನ್ನು ಗುರುತಿಸಬಹುದು.
ಮಾತು ಮಾದರಿಗಳು ವಿಷಯವನ್ನು (Context) ಕೂಡ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಸಮರ್ಥವಾಗಿದ್ದು, ನುಡಿ ಪ್ರಕ್ರಿಯೆಗೆ ಅನ್ವಯಿಸಿ ತಪ್ಪು ಶಬ್ದಗಳನ್ನು ಸರಿಪಡಿಸಬಹುದು. ಉದಾಹರಣೆಗೆ, ನೀವು ಹೇಳಿದರೆ "ನಾನು ಅಂಗಡಿಗೆ ಹೋಗಿ ಎರಡು ಬಾಳೆಹಣ್ಣು ಮತ್ತು ಒಂದು ಸೇಬು ಕೂಡ ತಂದೆ", ಇದರಲ್ಲಿ ತಲಪಿಸುವಲ್ಲಿ ಒಂದೇ ಸರಿಯಾಗಿ ಆದರೆ ಬರಹದಲ್ಲಿ ಭಿನ್ನವಾದ “to”, “two” ಮತ್ತು “too” ಎಂದು ಮೂರು ಪದಗಳಿವೆ. ಮಾತು ಮಾದರಿಗಳು ವಿಷಯವನ್ನು ಅರ್ಥಮಾಡಿ ಸೂಕ್ತ ಬರಹವನ್ನು ಒಳಪಡಿಸುತ್ತವೆ.
💁 ಕೆಲವು ಧ್ವನಿ ಸೇವೆಗಳು ಧ್ವನಿಯನ್ನು ಕಚ್ಚಾ ಪರಿಸರಗಳಲ್ಲಿ (ಕಾರ್ಖಾನೆ ಮುಂತಾದ) ಅಥವಾ ಕೈಗಾರಿಕಾ ವಿಶಿಷ್ಟ ಪದಗಳ (ರಾಸಾಯನಿಕ ಹೆಸರುಗಳು) ಬಳಕೆಗೆ ಹೊಂದಿಸುವ ಮಾರ್ಪಡಿಸುವಿಕೆಯ ಅವಕಾಶವನ್ನು ಒದಗಿಸುತ್ತವೆ. ಈ ಕಸ್ಟಮೈಸೇಷನ್ಗಳನ್ನು ಮಾದರಿ ಉತ್ತಮಗೊಳಿಸಲು ಶಾಂಪಲ್ ಧ್ವನಿ ಮತ್ತು ಲಿಪಿಯೊಂದಿಗೆ ತರಬೇತುದಾರರು ಕಲಿಸುತ್ತಾರೆ, ಇದನ್ನು 'ಟ್ರಾನ್ಸ್ಫರ್ ಲರ್ನಿಂಗ್' ಎಂದು ಕರೆಯುತ್ತಾರೆ. ಇದು ನೀವು ಹಿಂದಿನ ಪಾಠದಲ್ಲಿ ಕೆಲವು ಚಿತ್ರಗಳ ಮೂಲಕ ಚಿತ್ರ ವರ್ಗೀಕರಣಕಾರ ರಚಿಸಿದ ರೀತಿಯೇ.
ಗೌಪ್ಯತೆ
ಗ್ರಾಹಕರ ಐಒಟಿ ಸಾಧನಗಳಲ್ಲಿ ಮಾತು-ಪಠ್ಯ ಸೇವೆ ಬಳಸುವಾಗ, ಗೌಪ್ಯತೆ ಅತ್ಯಂತ ಮುಖ್ಯ. ಈ ಸಾಧನಗಳು ನಿರಂತರವಾಗಿ ಧ್ವನಿಯನ್ನು ಕೇಳುತ್ತವೆ, ಆದ್ದರಿಂದ ನೀವು ಪ್ರತಿಯೊಂದು ಮಾತು ಕೂಡ ಕ್ಲೌಡ್ಗೆ ಕಳುಹಿಸಿ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿತವಾಗಬಾರದು. ಇದು ಇಂಟರ್ನೆಟ್ ಬೆಲವನ್ನು ಹೆಚ್ಚಿಸುವುದುತ್ತದೆ ಮಾತ್ರವಲ್ಲದೆ, ದೊಡ್ಡ ಗೌಪ್ಯತೆ ಸಮಸ್ಯೆಗಳೂ ಉಂಟಾಗುತ್ತವೆ, ವಿಶೇಷವಾಗಿ ಕೆಲ ಸ್ಮಾರ್ಟ್ ಸಾಧನ ತಯಾರಕರುಮಾದರಿ ಸುಧಾರಿಸಲು ಪರಿಷ್ಕರಿಸಿದ ಪಠ್ಯದೊಂದಿಗೆ ಮಾನವರ ಮೌಲ್ಯಮಾಪನಕ್ಕಾಗಿ ಕಂಡುಹಿಡಿದ ಧ್ವನಿಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಿಕೊಳ್ಳುತ್ತಾರೆ. ನೀವು ನಿಮ್ಮ ಸ್ಮಾರ್ಟ್ ಡಿವೈಸ್ ಅನ್ನು ಆಡಿಯೋವನ್ನು ಕ್ಲೌಡ್ಗೆ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲು ಕಳುಹಿಸುವುದು ನೀವು ಅದನ್ನು ಬಳಸುತ್ತಿದ್ದಾಗ ಮಾತ್ರ ಇಚ್ಛಿಸುತ್ತೀರಿ, ನಿಮ್ಮ ಮನೆಯಲ್ಲಿ ಆಡಿಯೋ ಕೇಳಿದಾಗ ಅಲ್ಲ, ದ್ವೀಪ ಮಟ್ಟದ ಸಭೆಗಳು ಅಥವಾ ಹತ್ತಿರದ ಸಂಭಾಷಣೆಗಳನ್ನು ಒಳಗೊಂಡಿರಬಹುದು. ಬಹುತೇಕ ಸ್ಮಾರ್ಟ್ ಸಾಧನಗಳು "ವೇಕ್ ವರ್ಡ್" ಜೊತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ, "ಆಲೆಕ್ಸಾ", "ಹೇ ಸಿರಿ", ಅಥವಾ "ಓಕೆ ಗೂಗಲ್" ಎಂಬ ಪ್ರಮುಖ ವಾಕ್ಯಗಳು ಸಾಧನವನ್ನು 'ಜಾಗೃತ'ಗೊಳಿಸುತ್ತವೆ ಮತ್ತು ನೀವು ಹೇಳುತ್ತಿರುವುದನ್ನು ಕೇಳಲು ಆರಂಭಿಸುತ್ತವೆ, ನೀವು ಡಿವೈಸ್ಗೆ ಮಾತನಾಡುವುದು ಮುಗಿದಿದೆ ಎಂದು ಸೂಚಿಸುವ ವಿಶ್ರಾಂತಿ ಕಂಡುಬಂದಾಗ.
🎓 ವೇಕ್ ವರ್ಡ್ ಪತ್ತೆ ಹಂಚಿಕೆ "ಕೀವರ್ಡ್ ಸ್ಪಾಟಿಂಗ್" ಅಥವಾ "ಕೀವರ್ಡ್ ರೆಕಗ್ನಿಷನ್" ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ.
ಈ ವೇಕ್ ವರ್ದ್ಗಳು ಸಾಧನದಲ್ಲಿ ಪತ್ತೆಯಾದವು, ಕ್ಲೌಡ್ನಲ್ಲಿ ಅಲ್ಲ. ಈ ಸ್ಮಾರ್ಟ್ ಸಾಧನಗಳಲ್ಲಿ ಸಣ್ಣ AI ಮಾದರಿಗಳು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಮತ್ತು ಅವು ವೇಕ್ ವರ್ಡ್ ಅನ್ನು ಕೇಳುತ್ತವೆ, ಪತ್ತೆಯಾಗಿದ್ರೆ ಆ ಕಾಯಿತ ಕೇವಲ ಆಡಿಯೋವನ್ನು ಕ್ಲೌಡ್ಗೆ Recognition ಗಾಗಿ ಸ್ಟ್ರೀಮ್ ಮಾಡಲು ಪ್ರಾರಂಭಿಸುತ್ತವೆ. ಈ ಮಾದರಿಗಳು ತುಂಬಾ ವಿಶೇಷವಾಗಿವೆ ಮತ್ತು ಕೇವಲ ವೇಕ್ ವರ್ಡ್ಗಾಗಿ ಕೇಳುತ್ತವೆ.
💁 ಕೆಲವು ತಂತ್ರಜ್ಞಾನ ಕಂಪನಿಗಳು ತಮ್ಮ ಸಾಧನಗಳಿಗೆ ಹೆಚ್ಚುವರಿ ಗೌಪ್ಯತೆಯನ್ನು ಸೇರಿಸುತ್ತಿದ್ದಾರೆ ಮತ್ತು ಕೆಲವು ಭಾಷಣದ ಪಠ್ಯ ಪರಿವರ್ತನೆಯನ್ನು ಸಾಧನದಲ್ಲಿ ಮಾಡುತ್ತಿದ್ದಾರೆ. ಆಪಲ್ ಅವರು 2021 ರ iOS ಮತ್ತು macOS ನ ನವೀಕರಣಗಳಲ್ಲಿ ಅವರಿಗೆ ಸಾಧನದಲ್ಲಿ ಭಾಷಣ-ಪಠ್ಯ ಪರಿವರ್ತನೆಗೆ ಬೆಂಬಲ ನೀಡುವುದಾಗಿ ಘೋಷಿಸಿದ್ದಾರೆ, ಮತ್ತು ಒಳ್ಳೇಷ್ಟು ವಿನಂತಿಗಳನ್ನು ಕ್ಲೌಡ್ ಬಳಸದೇ ನಿರ್ವಹಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ. ಇದು ಶಕ್ತಿಶಾಲಿ ಪ್ರೊಸೆಸರ್ಗಳಿದ್ದರಿಂದ ನಡೀತಾ Machine Learning ಮಾದರಿಗಳನ್ನು ಚಾಲನೆ ಮಾಡಲು ಸಾಧ್ಯವಾಗಿದೆ.
✅ ನೀವು ಏನು ಭಾವಿಸುತ್ತೀರಿ ಎಂಬುದನ್ನು ಕೇಳಬೇಕಾದರೆ, ಕ್ಲೌಡ್ಗೆ ಕಳುಹಿಸಿದ ಆಡಿಯೋವನ್ನು ಸಂಗ್ರಹಿಸುವುದರ ಗುಪ್ತತೆ ಮತ್ತು ನೈತಿಕ ಪರಿಣಾಮಗಳೇನು? ಈ ಆಡಿಯೋ ಸಂಗ್ರಹಿಸಬಹುದೇ? ಆಗ ಹಾಗೆ ಆದರೆ ಹೇಗೆ? ಕಾನೂನು ಕಾರ್ಯಾಚರಣೆಗೆ ದಾಖಲಾತಿಗಳನ್ನು ಉಪಯೋಗಿಸುವುದು ಗೌಪ್ಯತೆ ನಷ್ಟವನ್ನು ಬದಲಾಯಿಸುವ ಸಲುವಾಗಿದೆಯೇ?
ವೇಕ್ ವರ್ಡ್ ಪತ್ತೆ ಸಾಮಾನ್ಯವಾಗಿ ಒಂದು ತಂತ್ರ known as TinyML ಅನ್ನು ಬಳಸುತ್ತದೆ, ಇದು Microcontrollers ನಲ್ಲಿ ಚಾಲನೆಗಾಗಿ ML ಮಾದರಿಗಳನ್ನು ಪರಿವರ್ತಿಸುವುದಾಗಿದೆ. ಈ ಮಾದರಿಗಳು ಚಿಕ್ಕ ಗಾತ್ರದವು ಮತ್ತು very power consumption ಕಡಿಮೆ.
ವೇಕ್ ವರ್ಡ್ ಮಾದರಿಯನ್ನು ತರಬೇತಿ ಮಾಡುವುದು ಮತ್ತು ಬಳಸುವುದರ ಸಂಕೀರ್ಣತೆಯನ್ನು ತಪ್ಪಿಸಲು, ನೀವು ಈ ಪಾಠದಲ್ಲಿ ನಿರ್ಮಿಸುವ ಸ್ಮಾರ್ಟ್ ಟೈಮರ್ ಭಾಷಣ ಪಠ್ಯ ಪರಿವರ್ತನೆಗೆ ಬಟನ್ ಅನ್ನು ಬಳಕೆ ಮಾಡುತ್ತದೆ.
💁 ನೀವು Wio Terminal ಅಥವಾ Raspberry Pi ಮೇಲೆ ಚಾಲನೆ ಮಾಡುವ ವೇಕ್ ವರ್ಡ್ ಪತ್ತೆ ಮಾದರಿ ರಚಿಸಲು ಪ್ರಯತ್ನಿಸಲು ಇಚ್ಛಿಸಿದರೆ, ಇಲ್ಲಿ ನಿಮ್ಮ ಧ್ವನಿಗೆ ಪ್ರತಿಕ್ರಿಯಿಸುವ Edge Impulse ಟ್ಯುಟೋರಿಯಲ್ ನೋಡಿ. ನೀವು ನಿಮ್ಮ ಕಂಪ್ಯೂಟರ್ ಬಳಸಿ ಇದನ್ನು ಮಾಡಲು ಬಯಸಿದರೆ, Microsoft ಡಾಕ್ಯುಮೆಂಟ್ನಲ್ಲಿ ಕಸ್ಟಮ್ ಕೀವರ್ಡ್ ಕ್ವಿಕ್ಸ್ಟಾರ್ಟ್ ಬಳಸಿ ಪ್ರಯತ್ನಿಸಬಹುದು.
ಭಾಷಣವನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ
ಹಳೇ ಯೋಜನೆಯಲ್ಲಿ ಚಿತ್ರ ವರ್ಗೀಕರಣದಂತೆ, ಭಾಷಣವನ್ನು ಆಡಿಯೋ ಫೈಲ್ ಆಗಿ ಸ್ವೀಕರಿಸಿ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವ ಮೊದಲು ನಿಗದಿಪಡಿಸಲಾದ AI ಸೇವೆಗಳನ್ನು ಬಳಸಬಹುದು. ಇಂಥದ್ದೊಂದು ಸೇವೆ Speech Service ಆಗಿದೆ, Cognitive Services ನ ಭಾಗವಾಗಿದ್ದು, ನೀವು ನಿಮ್ಮ ಅಪ್ಲಿಕೇಶನ್ಗಳಲ್ಲಿ ಬಳಸಬಹುದಾದ ಪೂರ್ವ-ನಿರ್ಮಿತ AI ಸೇವೆಗಳು.
ಕಾರ್ಯ - ಭಾಷಣ AI ಸಂಪನ್ಮೂಲವನ್ನು ನಿಯೋಜಿಸಿ
-
ಈ ಯೋಜನೆಗಾಗಿ 'smart-timer' ಎಂಬ Resource Group ರಚಿಸಿ
-
ಕೆಳಗಿನ ಆಜ್ಞೆಯನ್ನು ಉಚಿತ ಭಾಷಣ ಸಂಪನ್ಮೂಲ ಸೃಷ್ಟಿಸಲು ಬಳಸಿ:
az cognitiveservices account create --name smart-timer \ --resource-group smart-timer \ --kind SpeechServices \ --sku F0 \ --yes \ --location <location>ನೀವು Resource Group ರಚಿಸುವಾಗ ಬಳಸಿದ
<location>ಇವುಗಳನ್ನು ಬದಲಾಯಿಸಿ. -
ನಿಮ್ಮ ಕೋಡ್ನಿಂದ ಭಾಷಣ ಸಂಪನ್ಮೂಲವನ್ನು ಪ್ರವೇಶಿಸಲು API ಕೀ ಬೇಕಾಗುತ್ತದೆ. ಕೀ ಪಡೆಯಲು ಕೆಳಗಿನ ಆಜ್ಞೆಯನ್ನು ಚಾಲನೆ ಮಾಡಿ:
az cognitiveservices account keys list --name smart-timer \ --resource-group smart-timer \ --output tableಕೀಲಿಯ ಒಂದನ್ನು ನಕಲಿಸಿ.
ಕಾರ್ಯ - ಭಾಷಣವನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ
ನಿಮ್ಮ IoT ಸಾಧನದಲ್ಲಿ ಭಾಷಣವನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಲು ಸಂಬಂಧಿತ ಗೈಡ್ ಮೂಲಕ ಕಾರ್ಯನಿರ್ವಹಿಸಿ:
🚀 ಚಾಲೆಂಜ್
ಭಾಷಣ ಗುರುತಿಸುವಿಕೆ ಬಹಳ ಸಮಯದಿಂದ ಇದ್ದು, ನಿರಂತರವಾಗಿ ಸುಧಾರಿಸುತ್ತಿದೆ. ಪ್ರಸ್ತುತ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಆರಂದಿಸಿ ಹೇಗೆ ಅವು ಕಾಲಕ್ರಮೇಣ ಬದಲಾಗಿದೆ ಎಂದು ಉಪಾಯಿಸುವುದನ್ನು ಸಹ ಸೇರಿಸಿ, ಮಷೀನ್ ಟ್ರಾನ್ಸ್ಕ್ರಿಪ್ಶನ್ನು ಮಾನವರಿಗಿಂತ ಎಷ್ಟು ಶುದ್ಧವಾಗಿದೆ.
ಭಾಷಣ ಗುರುತಿಸುವಿಕೆಯ ಭವಿಷ್ಯವನ್ನು ನೀವು ಹೇಗೆ ನೋಡುತ್ತೀರಿ?
ಪಠ್ಯನಂತರ ಕುಯಿಜ್
ವಿಮರ್ಶೆ & ಸ್ವಯಂ ಅಧ್ಯಯನ
- dymanic ಮತ್ತು condenser ಮೈಕ್ರೊಫೋನ್ಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸ ಕುರಿತು Musician's HQ ನಲ್ಲಿ ಓದಿ.
- Cognitive Services ಭಾಷಣ ಸೇವೆಯ ಬಗ್ಗೆ Microsoft Docs ನಲ್ಲಿ ವಿವರ ಓದಿ.
- ಕೀವರ್ಡ್ ಸ್ಪಾಟಿಂಗ್ ಕುರಿತು ಮಾಹಿತಿಯನ್ನು Microsoft Docs ನಲ್ಲಿ ನೋಡಿ.
ನಿಯೋಜನೆ
ಅರ್ಹತೆ ನಿರಾಕರಣೆ:
ಈ ದಾಖಲೆ AI ಅನುವಾದ ಸೇವೆ Co-op Translator ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ಸಮಗ್ರತೆಯನ್ನು ಸಾಧಿಸಲು ಯತ್ನಿಸಿದರೂ, ಸ್ವಯಂಶಾಸಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದೆಂದು ಗಮನಿಸಿ. ಮೂಲ ಭಾಶೆಯಲ್ಲಿ ಇರುವ ಮೂಲ ದಾಖಲೆ ಅಧಿಕೃತ ಹಾಗೂ ನಂಬಿಕೆ ಯೋಗ್ಯ ಮೂಲವಾಗಿರುತ್ತದೆ. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ಅರ್ಥಾಭ್ಯಾಸ ಅಥವಾ ತಪ್ಪು ವಿವರಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.







