You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/kn/6-consumer/lessons/1-speech-recognition
localizeflow[bot] 8671d5c4aa
chore(i18n): sync translations with latest source changes (#571)
6 months ago
..
README.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
assignment.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-audio.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-microphone.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-speech-to-text.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-audio.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-microphone.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-speech-to-text.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-audio.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-microphone.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-speech-to-text.md chore(i18n): sync translations with latest source changes (#571) 6 months ago

README.md

ಐಒಟಿ ಸಾಧನದಿಂದ ಮಾತು ಗುರುತಿಸಿ

ಈ ಪಾಠದ ಸ್ಕೆಚ್‌ನೋಟ್ ಅವಲೋಕನ

ಸ್ಕೆಚ್‌ನೋಟ್: ನಿತ್ಯ ನಾರಸಿಂಹನ್. ದೊಡ್ಡ ಗಾತ್ರದ ಆವೃತ್ತಿಗಾಗಿ ಚಿತ್ರವನ್ನು ಕ್ಲಿಕ್ ಮಾಡಿ.

ಈ ವೀಡಿಯೋವು ಆಝೂರ್ ಮಾತು ಸೇವೆಯ ಅವಲೋಕನವನ್ನು ನೀಡುತ್ತದೆ, ಇದು ಈ ಪಾಠದಲ್ಲಿ ಚರ್ಚಿಸುವ ವಿಷಯ:

ಮೈಕ್ರೋಸಾಫ್ಟ್ ಆಝೂರ್ ಯೂಟ್ಯೂಬ್ ಚಾನೆಲ್‌ನಿಂದ ನಿಮ್ಮ ಕಾಗ್ನಿಟಿವ್ ಸರ್ವಿಸಸ್ ಸ್ಪೀಚ್ ಸಂಪನ್ಮೂಲವನ್ನು ಹೇಗೆ ಪ್ರಾರಂಭಿಸುವುದು

🎥 ವೀಡಿಯೊ ವೀಕ್ಷಿಸಲು ಮೇಲಿನ ಚಿತ್ರವನ್ನು ಕ್ಲಿಕ್ ಮಾಡಿರಿ

ಪಾಠ ಮುನ್ನ ಪರೀಕ್ಷೆ

ಪಾಠ ಮುನ್ನ ಪರೀಕ್ಷೆ

ಪರಿಚಯ

'ಅಲೆಕ್ಸಾ, 12 ನಿಮಿಷದ ಟೈಮರ್ ಸೆಟ್ ಮಾಡು'

'ಅಲೆಕ್ಸಾ, ಟೈಮರ್ ಸ್ಥಿತಿ'

'ಅಲೆಕ್ಸಾ, ಸ್ಟೀಮ್ ಬ್ರೋಕೋಲಿಗೆ 8 ನಿಮಿಷದ ಟೈಮರ್ ಸೆಟ್ ಮಾಡು'

ಸ್ಮಾರ್ಟ್ ಸಾಧನಗಳು ದಿನ ಹೊಂದಿದಂತೆ ವ್ಯಾಪಕವಾಗುತ್ತಿದ್ದವೆ. ಮನೆಪೋಡ್ಗಳು, ಎಕೋ ಮತ್ತು ಗೂಗಲ್ ಹೋಮ್ಸ್ ಗಳಂತಹ ಸ್ಮಾರ್ಟ್ ಸ್ಪೀಕರ್‌ಗಳಷ್ಟೇ ಅಲ್ಲ, ನಮ್ಮ ಫೋನ್ಗಳು, ಘಡಿಗಳಲ್ಲೂ ಮತ್ತು ಇಲ್ಲವಾದರೆ ದೀಪಗ hodಗಳು ಮತ್ತು ಥರ್ಮೋಸ್ಟ್ಯಾಟ್‌ಗಳಲ್ಲೂ ನೇರವಾಗಿ ಜೋಡಿಸಲಾಗಿದೆ.

💁 ನನ್ನ ಮನೆಯಲ್ಲ at least 19 ಸಾಧನಗಳನ್ನು ಧ್ವನಿ ಸಹಾಯಕರೊಂದಿಗೆ ಹೊಂದಿರುವಂತೆ ತಿಳಿದಿದೆ ಮತ್ತು ಅದೇ ನನ್ನ ತಿಳಿವಳಿಕೆಯಷ್ಟೇ!

ಧ್ವನಿ ನಿಯಂತ್ರಣವು accessibility ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಚಲಿಸುವುದರಲ್ಲಿ ಅಡಚಣೆಯುಳ್ಳವರಿಗೆ ಸಾಧನಗಳನ್ನು ಬಳಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಅದು ಶಾಶ್ವತ ಅಂಗವೈಕಲ್ಯವಾಗಿರಲಿ ಅಥವಾ ತಾತ್ಕಾಲಿಕ ಅಂಗವೈಕಲ್ಯವಾಗಿರಲಿ, ಉದಾಹರಣೆಗೆ ಮುದುರಿದ ಕೈಗಳು ಅಥವಾ ಖರೀದಿಸಿದ ವಸ್ತುಗಳ ಕಾರಣ ನನ್ನ ಕೈಗಳು ಬಜೆ ಇದ್ದವರು, ಧ್ವನಿಯಿಂದ ನನ್ನ ಮನೆಯನ್ನು ನಿಯಂತ್ರಿಸುವುದು ಹೊಸ ದಿಸೆಯಲ್ಲಿ ಪ್ರವೇಶವನ್ನು ತೆರೆದುಕೊಂಡಿದೆ. 'ಹೇ ಸಿರಿ, ನನ್ನ ಗ್ಯಾರೇಜ್ ದ್ವಾರವನ್ನು ಮುಚ್ಚು' ಎಂದು ಕೂಗುವುದು, ತಾಯಿಯ ಬದಲಾವಣೆ ಮಾಡುತ್ತಾ ಮತ್ತು ಕಾರ್ಯದರ್ಶಿ ಹಗಲುಕಾಲ ಪಾಪದೊಂದಿಗೆ, ಒಂದು ಚಿಕ್ಕ ಆದರೆ ಪರಿಣಾಮಕಾರಿಯಾದ ಸುಧಾರಣೆಯಾಗಿದೆ.

ಧ್ವನಿ ಸಹಾಯಕರ ಬಳಕೆಯೊಂದರಲ್ಲಿ ಹೆಚ್ಚು ಜನಪ್ರಿಯವಾದುದು ಟೈಮರ್‌ಗಳನ್ನು ಸೆಟ್‌ ಮಾಡುವುದು, ವಿಶೇಷವಾಗಿ ಅಡುಗೆ ಮನೆಯ ಟೈಮರ್‌ಗಳು. ನಿಮಗಿಷ್ಟದ ಆಹಾರ ತಯಾರಿಸುವಾಗ ಕೈಗಳನ್ನು ನಿಲ್ಲಿಸದೇ, ಸూప್‌ ಮಿಶ್ರಣ ಮಾಡುತ್ತಿರುವಾಗ ಅಥವಾ ಹಾಸು ಹಾಕುತ್ತಿರುವಾಗ ಬಹುಮುಖ ಟೈಮರ್‌ಗಳನ್ನು ನಿಮ್ಮ ಧ್ವನಿಯಿಂದಲೇ ಸೆಟ್ ಮಾಡುವುದು ತುಂಬಾ ಸಹಾಯಕ.

ಈ ಪಾಠದಲ್ಲಿ ನೀವು ಐಒಟಿ ಸಾಧನಗಳಲ್ಲಿ ಧ್ವನಿ ಗುರುತಿಸಲು ಕಲಿಯುತ್ತೀರಿ. ಮೈಕ್ರೋಫೋನ್ಗಳು ಸೆನ್ಸರ್‌ಗಳಾಗಿವೆ ಎಂಬುದನ್ನು, ಐಒಟಿ ಸಾಧನಕ್ಕೆ ಸಂಪರ್ಕಿಸಿದ ಮೈಕ್ರೋಫೋನಿನಿಂದ ಧ್ವನಿಯನ್ನು ಹೇಗೆ ಸೆರೆಹಿಡಿಯಬೇಕು ಎಂದು, ಮತ್ತು ಕೇಳಿದ ಮಾತುಗಳನ್ನು ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸಲು AI ಅನ್ನು ಹೇಗೆ ಬಳಸುವುದು ಎಂದು ಕಲಿಯುವಿರಿ. ಈ ಯೋಜನೆಯ ಉಳಿದ ಭಾಗಗಳಲ್ಲಿ, ಬಹುಭಾಷಾ ಬೆಂಬಲ ಹೊಂದಿರುವ ಸ್ಮಾರ್ಟ್ ಅಡುಗೆ ಟೈಮರ್ ಅನ್ನು ನಿರ್ಮಿಸುವಿರಿ.

ಈ ಪಾಠದಲ್ಲಿ ನಾವು ತಿಳಿಯಬೇಕಾಗಿರುವುದು:

ಮೈಕ್ರೋಫೋನ್ಗಳು

ಮೈಕ್ರೋಫೋನ್ಗಳು ಧ್ವನ ತರಂಗಗಳನ್ನು ವಿದ್ಯುತ್ ಸಂಕೇತಗಳಾಗಿ ಪರಿವರ್ತಿಸುವ ಅನಾಲಾಗ್ ಸೆನ್ಸರ್‌ಗಳು. ಗಾಳಿಯ ಕಂಪನಗಳು ಮೈಕ್ರೋಫೋನಿನೊಳಗಿನ ಘಟಕಗಳನ್ನು ಅಲ್ಪ ಪ್ರಮಾಣದಲ್ಲಿ ಸರಿಸುತ್ತವೆ, ಅವು ವಿದ್ಯುತ್ ಸಂಕೇತಗಳಲ್ಲಿ ಸೂಕ್ಷ್ಮ ಬದಲಾವಣೆಗಳನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ. ನಂತರ ಈ ಬದಲಾವಣೆಗಳನ್ನು ವೃದ್ಧಿಗೊಳಿಸಿ ವಿದ್ಯುತ್ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ರಚಿಸಲಾಗುತ್ತದೆ.

ಮೈಕ್ರೋಫೋನ್ ಪ್ರಕಾರಗಳು

ಮೈಕ್ರೋಫೋನ್ಗಳು ವಿವಿಧ ಪ್ರಕಾರಗಳಲ್ಲಿ ಬರುತ್ತವೆ:

  • ಡೈನಾಮಿಕ್ - ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಿಗೆ ಚಲಿಸುವ ಡಯಾಫ್ರಾಗ್ಮ್‌ಗೆ ಲಗತ್ತಿಸಲಾದ ಕನ್ನ ಡೋಣಿಯಾಗಿದೆ, ಅದು ತಂತುಗಳ ಸುಳಿಯಲ್ಲಿ ಚಲಿಸಿ ವಿದ್ಯುತ್ ಪ್ರಸರಣವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಇದು ಬಹುತೇಕ ಲೌಡ್‌ಸ್ಪೀಕರ್‌ಗಳ ವಿರುದ್ಧವಾಗಿದೆ, ಅವು ವಿದ್ಯುತ್ ಪ್ರವಾಹದಿಂದ ಕನ್ನ ಡೋಣಿಯನ್ನು ಚಲಿಸುವ ಮೂಲಕ ಧ್ವನಿಯನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ. ಇದರಿಂದ, ಸ್ಪೀಕರ್‌ಗಳನ್ನು ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್‌ಗಳಾಗಿ ಹಾಗೂ ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್‌ಗಳನ್ನು ಸ್ಪೀಕರ್‌ಗಳಾಗಿ ಬಳಸಬಹುದು. ಉದಾಹರಣೆಗೆ, ಸಂವಹನ ಸಾಧನಗಳಲ್ಲಿ ಬಳಕೆದಾರನು ಕೇಳುವುದು ಅಥವಾ ಮಾತನಾಡುವುದು ಮಾತ್ರ ಸಾದ್ಯವಾಗಿದ್ದು, ಒಂದು ಸಾಧನವೇ ಸ್ಪೀಕರ್ ಮತ್ತು ಮೈಕ್ರೋಫೋನ್ ಎರಡನ್ನೂ ಆಗಬಹುದು.

    ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಸ್ ಕಾರ್ಯಕ್ಕೆ ವಿದ್ಯುತ್ ಬೇಕಾಗಿಲ್ಲ, ವಿದ್ಯುತ್ ಸಂಕೇತವನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಮೈಕ್ರೋಫೋನಿನಿಂದ ಸೃಷ್ಟಿಸಲಾಗುತ್ತದೆ.

    ಶ್ಯೂರ್ SM58 (ಡೈನಾಮಿಕ್ ಕಾರ್ಡಿಯೋದ್ ಪ್ರಕಾರ) ಮೈಕ್ರೋಫೋನಿಗೆ ಪಟ್ಟಿ ಸ್ಮಿತ್ ಹಾಡುತ್ತಿರುವುದು

  • ರಿಬನ್ - ರಿಬನ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಿಗೆ ಹೋಲುವುವು, ಭಿನ್ನತೆ ಏನೆಂದರೆ ಡಯಾಫ್ರಾಗ್ಮಿನ ಬದಲು ತಾಮ್ರ ರಿಬನ್ ಲಗತ್ತಿಸಲಾಗಿದೆ. ಈ ರಿಬನ್ ಕ್ಷೇಮ ಕ್ಷೇತ್ರದಲ್ಲಿ ಚಲಿಸಿ ವಿದ್ಯುತ್ ಪ್ರಸರಣವನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ. ಡೈನಾಮಿಕ್ ಮೈಕ್ರೋಫೋನ್ಗಳಂತೆ, ರಿಬನ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಕಾರ್ಯಕ್ಕೆ ವಿದ್ಯುತ್ ಅಗತ್ಯವಿಲ್ಲ.

    ಎಡ್ಮಂಡ್ ಲೋವೇ, ಅಮೆರಿಕನ್ ನಟ, ರೇಡಿಯೋ ಮೈಕ್ರೋಫೋನ್ ಬಳಿ ನಿಂತಿರುವುದು (NBC ಬ್ಲೂ ನೆಟ್‌ವರ್ಕ್‌ಗೆ ಲೇಬಲ್ ಮಾಡಲಾಗಿದೆ), ಸ್ಕ್ರಿಪ್ಟ್ ಹಿಡಿದಿರುವುದು, 1942

  • ಕಾಂಡೆನ್ಸರ್ - ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಸಣ್ಣ ತಾಮ್ರ ಡಯಾಫ್ರಾಗ್ಮ್ ಮತ್ತು ಸ್ಥಿರ ತಾಮ್ರ ಪ್ಲೇಟ್ ಹೊಂದಿರುತ್ತವೆ. ವಿದ್ಯುತ್ ಎರಡಕ್ಕೂ ಅನ್ವಯಿಸಲಾಗುತ್ತಿದ್ದು, ಡಯಾಫ್ರಾಗ್ಮ್ ಕಂಪನದಿಂದ ಪ್ಲೇಟ್‌ಗಳ ನಡುವಿನ ಸ್ಥಿರ ವಿದ್ಯುತ್ ಬದಲಾವಣೆಯಿಂದ ಸಂಕೇತ ಉದ್ಭವಿಸುತ್ತದೆ. ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನ್ಗಳು ಕಾರ್ಯಕ್ಕೆ ವಿದ್ಯುತ್ ಬೇಕಾಗುತ್ತದೆ - ಇದನ್ನು ಫ್ಯಾಂಟಮ್ ಪವರ್ ಎಂದು ಕರೆಯುತ್ತಾರೆ.

    AKG ಅಕೌಸ್ಟಿಕ್ಸ್‌ನ C451B ಸಣ್ಣ ಡಯಾಫ್ರಾಗ್ಮ್ ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನ್

  • MEMS - ಮೈಕ್ರೋಎಲೆಕ್ಟ್ರೋ ಮೆಕ್ಯಾನಿಕಲ್ ಸಿಸ್ಟಮ್ (ಮೆಮ್ಸ್) ಮೈಕ್ರೋಫೋನ್ಗಳು ಚಿಪ್ ಮೇಲಿನ ಮೈಕ್ರೋಫೋನ್ಗಳು. ಸಿಲಿಕಾನ್ ಚಿಪ್ ಮೇಲೆ ಒತ್ತಡಕ್ಕೆ ಪ್ರಕೃತಸರಿಯಾಗಿ ಸ್ಪಂದಿಸುವ ಡಯಾಫ್ರಾಗ್ಮ್ ಅಂಚು ಮಾಡಲಾಗಿದೆ ಮತ್ತು ಕಾಂಡೆನ್ಸರ್ ಮೈಕ್ರೋಫೋನಿನಂತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. ಈ ಮೈಕ್ರೋಫೋನ್ಗಳು ಸೂಕ್ಷ್ಮವಾಗಿದ್ದು, ಪರಿಕರಗಳಲ್ಲಿ ಸಮಾಧಿಕೃತವಾಗಿರಬಹುದು.

    ಸ್ಕೀಮಾ ಬೋರ್ಡ್ ಮೇಲೆ ಮೆಮ್ಸ್ ಮೈಕ್ರೋಫೋನ್

    ಮೇಲಿನ ಚಿತ್ರದಲ್ಲಿ, LEFT ಎಂದು ಗುರುತಿಸಿದ ಚಿಪ್ ಮಿಲ್ ಮೀಟರ್ ಗಿಂತ ಹೆಚ್ಚು ಚಿಕ್ಕ ಡಯಾಫ್ರಾಗ್ಮ್ ಹೊಂದಿರುವ ಮೆಮ್ಸ್ ಮೈಕ್ರೋಫೋನ್.

ಸಂಶೋಧನೆ ಮಾಡಿ: ನಿಮ್ಮ ಸುತ್ತಲಿನ ಸಾಧನಗಳಲ್ಲಿ ಮೈಕ್ರೋಫೋನ್ಗಳಿರುವುದೇ? ನಿಮ್ಮ ಗಣಕಯಂತ್ರ, ಫೋನ್, ಹೆಡ್ಸೆಟ್ ಅಥವಾ ಇತರ ಸಾಧನಗಳಲ್ಲಿ ಮೈಕ್ರೋಫೋನಿನ ಪ್ರಕಾರವೇನು?

ಡಿಜಿಟಲ್ ಧ್ವನಿ

ಧ್ವನಿ ಒಂದು ಅನಾಲಾಗ್ ಸಂಕೇತವಾಗಿದ್ದು ತುಂಬಾ ಸೂಕ್ಷ್ಮ ಮಾಹಿತಿಯನ್ನು ಹೊರುತ್ತದೆ. ಈ ಸಂಕೇತವನ್ನು ಡಿಜಿಟಲ್ ಆಗಿ ಪರಿವರ್ತಿಸಲು ಪಲ್ಸ್ ವೇಡ್ ಮೋಜ್ಯುಲೇಶನ್ ಉಪಯೋಗಿಸಿ ಸಾವಿರಾರು ಬಾರಿ ಸೆಗ್ಮೆಂಟ್ ಮಾಡಬೇಕು.

🎓 ಸೆಂಪ್ಲಿಂಗ್ ಎಂದರೆ ಧ್ವನಿಯ ಸಂಕೇತವನ್ನು ಆ ಸಮಯದಲ್ಲಿ ಅದರ ಮೌಲ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುವ ಡಿಜಿಟಲ್ ಮೌಲ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು.

ನಿಯತ ಸಮಯಾವಧಿಯಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಅಂಶಗಳನ್ನು ಹೊಂದಿರುವ ಸಂಕೇತವನ್ನು ನೋಟದೊಂದಿಗೆ ಲೈನ್ ಚಾರ್ಟ್

ಡಿಜಿಟಲ್ ಧ್ವನಿಯನ್ನು ಪಲ್ಸ್ ಕೋಡ್ ಮಾಡ್ಯುಲೇಶನ್ (PCM) ಬಳಸಿಕೊಂಡು ಸೆಂಪಲ್ ಮಾಡಲಾಗುತ್ತದೆ. PCM ನಲ್ಲಿ ಸಂಕೇತದ ವೋಲ್ಟೇಜ್ ಓದಿ ಆ ವೋಲ್ಟೇಜಿಗೆ ಸಮೀಪವಾದ ನಿರ್ದಿಷ್ಟ ಮೌಲ್ಯವನ್ನು ಆಯ್ಕೆ ಮಾಡಲಾಗುತ್ತದೆ.

💁 PCM ಅನ್ನು ಪಲ್ಸ್ ವಿದುತ ಮೋಡೆಲೇಷನ್ (PWM) ನ ಸೆನ್ಸರ್ ಆವೃತ್ತಿಯಾಗಿ ಭಾವಿಸಬಹುದು (PWM ಅನ್ನು ಪಠ್ಯ 3 ರಲ್ಲಿ ಕೇಳಿದ್ದೀರಿ). PCM ಅನಾಲಾಗ್ ಸಂಕೇತವನ್ನು ಡಿಜಿಟಲ್‌ಗೆ ಪರಿವರ್ತಿಸುತ್ತದೆ, PWM ಡಿಜಿಟಲ್ ಸಂಕೇತವನ್ನು ಅನಾಲಾಗ್ ಗೆ ಪರಿವರ್ತಿಸುತ್ತದೆ.

ಉದಾಹರಣೆಗೆ, ಹೆಚ್ಚಿನ ಸ್ಟ್ರೀಮಿಂಗ್ ಮ್ಯೂಸಿಕ್ ಸರ್ವೀಸ್ಗಳು 16-ಬಿಟ್ ಅಥವಾ 24-ಬಿಟ್ ಆಡಿಯೋವನ್ನು ಒದಗಿಸುತ್ತವೆ. ಎಂದರೆ ಅದಕ್ಕೆ 16-ಬಿಟ್ ಇಂಟೆಜರ್ ಅಥವಾ 24-ಬಿಟ್ ಇಂಟೆಜರ್‌ಗೆ ಹೊಂದುವಂತೆ ವೋಲ್ಟೇಜ್ ಅನ್ನು ಪರಿವರ್ತಿಸುತ್ತದೆ. 16-ಬಿಟ್ ಆಡಿಯೋ ಮೌಲ್ಯವನ್ನು -32,768 ರಿಂದ 32,767 ಅಂಕಗಳ ನಡುವಿನ ಸಂಖ್ಯೆಗೊಳಿಸುತ್ತದೆ, 24-ಬಿಟ್ ಮೌಲ್ಯವು 8,388,608 ರಿಂದ 8,388,607 ರವರೆಗೆ. ಹೆಚ್ಚು ಬಿಟ್‌ಗಳಿದ್ದರೆ, ನಾವು ಕೇಳುವ ಧ್ವನಿಗೆ ನಿಖರವಾಗಿರುತ್ತದೆ.

💁 ತಲೆತಲೆಗೆ 8-ಬಿಟ್ ಆಡಿಯೋ ಇರುವುದಿದೆ, ಇದನ್ನು ಲೋಫೈ ಎಂದೂ ಕರೆಯುತ್ತಾರೆ. ಇದು ಕೇವಲ 8-ಬಿಟ್ ಬಳಸಿ ಸಂಗ್ರಹಿಸಲ್ಪಟ್ಟ ಆಡಿಯೋ, ಅಂದರೆ -128 ರಿಂದ 127 ರವರೆಗೆ. ಮೊದಲ ಗಣಕಯಂತ್ರ ಧ್ವನಿ 8-ಬಿಟ್ ಮಿತಿ ಹೊಂದಿತ್ತು, ಇದರಿಂದ ಈ ರೀತಿಯ ಧ್ವನಿಯು ರೆಟ್ರೋ ಗೇಮಿಂಗ್‌ನಲ್ಲಿ ಹೆಚ್ಚಾಗಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ.

ಈ ಸೆಂಪಲ್ಗಳನ್ನು ಪ್ರತೀ ಸೆಕೆಂಡಿಗೆ ಸಾವಿರಾರು ಬಾರಿ ತೆಗೆದುಕೊಳ್ಳಲಾಗುತ್ತದೆ, KHz (ಸಾವಿರಗಳ ಸಂಕೇತ ಓದುವಿಕೆಗಳು ಪ್ರತೀ ಸೆಕೆಂಡ್) ನಲ್ಲಿ ಮಾಪನ ಮಾಡಿ. ಸ್ಟ್ರೀಮಿಂಗ್ ಸೇವೆಗಳು ಸಾಮಾನ್ಯವಾಗಿ 48KHz ಅನ್ನು ಬಳಸುತ್ತವೆ, ಕೆಲ 'ಲಾಸ್ಲೆಸ್' ಆಡಿಯೋ 96KHz ಅಥವಾ 192KHz ಉಪಯೋಗಿಸುತ್ತವೆ. ಹೆಚ್ಚು ಮಾದರಿ ದರದಿಂದ ಮೂಲ ಧ್ವನಿಗೆ ಹತ್ತಿರವಾಗಿರುತ್ತದೆ, ಕೆಲವರು 48KHz ಮೀರಿದ ಮೇಲೆ ಮಾನವನೇ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರ್ತಿಸಲಾರರು ಎಂಬುದು ಚರ್ಚೆಯಾಗುತ್ತಿದೆ.

ಸಂಶೋಧನೆ ಮಾಡಿ: ನೀವು ಸ್ಟ್ರೀಮಿಂಗ್ ಮ್ಯೂಸಿಕ್ ಸೇವೆಯು ಬಳಸಿದರೆ, ಅದು ಯಾವ ಮಾದರಿ ದರ ಮತ್ತು ಗಾತ್ರವನ್ನು ಬಳಸುತ್ತದೆ? ನೀವು CDs ಬಳಸದಿರಾ? CD ಧ್ವನಿ ಮಾದರಿ ದರ ಮತ್ತು ಗಾತ್ರವೇನು?

ಧ್ವನಿ ದತ್ತಾಂಶದ ಹಲವಾರು ವಿನ್ಯಾಸಗಳಿವೆ. ನೀವು mp3 ಫೈಲ್‌ಗಳನ್ನು ಕೇಳಿದ್ದೀರಾ - ಗುಣಮಟ್ಟದಲ್ಲಿನ ನಷ್ಟವಿಲ್ಲದೆ ಸಣ್ಣಗೊಳಿಸಲು ಸಾಂಗತ್ಯಗೊಳಿಸಿದ ಧ್ವನಿ ದತ್ತಾಂಶ. ಅನ್‌ಕಂಪ್ರೆಸ್‌ಡ್ ಧ್ವನಿ ಸಾಮಾನ್ಯವಾಗಿ WAV ಫೈಲ್ ಆಗಿರುತ್ತದೆ - 44 ಬೈಟಿನ ಹೆಡರ್ ಮಾಹಿತಿಯನ್ನು ಹೊಂದಿದ್ದು, ನಂತರದ ದತ್ತಾಂಶವನ್ನು ಅನ್ನುತ್ತದೆ. ಹೆಡರ್‌ನಲ್ಲಿ ಮಾದರಿ ದರ (ಉದಾಹರಣೆಗಾಗಿ 16000 ಎಂದರೆ 16KHz) ಮತ್ತು ಮಾದರಿ ಗಾತ್ರ (16-ಬಿಟ್) ಮತ್ತು ಚಾನೆಲ್‌ಗಳ ಸಂಖ್ಯೆ ವಿವರಿಸಲಾಗಿದೆ. ಹೆಡರ್‌ಗೆ ನಂತರ RAW ಧ್ವನಿ ದತ್ತಾಂಶವಾಗಿರುತ್ತದೆ.

🎓 ಚಾನೆಲ್‌ಗಳು ಎಂದರೆ ಎಷ್ಟು ಪ್ರತ್ಯೇಕ ಧ್ವನಿ ಕಲವಣಿಗಳು ಒಟ್ಟಿನಲ್ಲಿ ಇದ್ದವೆ ಎಂಬುದರ ಸೂಚನೆ. ಬೇರೆ ಬೇರೆ ಧ್ವನಿ ಸ್ಟ್ರಿಮ್‌ಗಳನ್ನು ಸೂಚಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಸ್ಟೀರಿಯೋದಲ್ಲಿ ಎಡ ಮತ್ತು ಬಲ ಚಾನೆಲ್‌ಗಳು 2 ಆಗಿರುತ್ತವೆ. 7.1 ಸುತ್ತುವಳಿ ಸ್ವರ ಹತ್ತಿರ ಹಂತದ ಚಾನೆಲ್‌ಗಳು 8 ಆಗಿರುತ್ತವೆ.

ಧ್ವನಿ ದತ್ತಾಂಶ ಗಾತ್ರ

ಧ್ವನಿ ದತ್ತಾಂಶವು ದೊಡ್ಡದಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, 16-ಬಿಟ್ ಅನುಪಚಿತ ಧ್ವನಿ 16KHz ನಲ್ಲಿ ಸೆರೆಹಿಡಿದರೆ (ಮಾತು-ಪಠ್ಯ ಮಾದರಿಗಾಗಿ ಸಾಕಷ್ಟು ಒಳ್ಳೆಯ ದರ) ಪ್ರತೀ ಸೆಕೆಂಡಿಗೆ 32KB ದತ್ತಾಂಶ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ:

  • 16-ಬಿಟ್ ಎಂದರೆ 2 ಬೈಟ್‌ಗಳು ಪ್ರತಿ ಎಲಾಖೆಗೆ (1 ಬೈಟ್ = 8 ಬಿಟ್).
  • 16KHz ಎಂದರೆ 16000 ಸೆಂಪಲ್‌ಗಳು ಪ್ರತಿ ಸೆಕೆಂಡ್.
  • 16000 x 2 ಬೈಟ್ = 32000 ಬೈಟ್ ಪ್ರತಿ ಸೆಕೆಂಡ್.

ಇದು ಸಣ್ಣಮಾತ್ರದ ದತ್ತಾಂಶವೆಂದು ಕೇಳಿ ಬರುವುದಾದರೂ, ನಿಯತ ಸ್ಮರಣಾಶಕ್ತಿಯಿರುವ ಮೈಕ್ರೋ ಕಂಟ್ರೋಲರ್ ಬಳಕೆಮಾಡುತ್ತಿದ್ದರೆ ಇದು ದೊಡ್ಡ ಸಂಖ್ಯೆಯಾಗುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, Wio ಟರ್ಮಿನಲಿಗೆ 192KB ಸ್ಮೃತಿ ಇರುತ್ತದೆ, ಅದು ಪ್ರೋಗ್ರಾಂ ಕೋಡ್ ಮತ್ತು ವೇರಿಯಬಲ್ಗಳನ್ನು ಹೊಂದಿರಬೇಕು. ನಿಮ್ಮ ಪ್ರೋಗ್ರಾಂ ಕೋಡ್ ಅತ್ಯಂತ ಸಣ್ಣದಾಗಿದ್ದರೂ ಸಾಕ್ಷಾತ್ 5 ಸೆಕೆಂಡಿಗೆ ಹೆಚ್ಚು ಧ್ವನಿ ಸೆರೆಹಿಡಿಯಲು ಸಾಧ್ಯವಿಲ್ಲ.

ಮೈಕ್ರೋ ಕಂಟ್ರೋಲರ್‌ಗಳು ಹೆಚ್ಚುವರಿ ಸಂಗ್ರಹಣೆ ಸ್ವೀಕರಿಸಬಹುದು, ಹಾಗೆಯೇ SD ಕಾರ್ಡ್‌ಗಳು ಅಥವಾ ಫ್ಲ್ಯಾಶ್ ಮೆಮೊರಿಯಂತಹ. ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯುವ ಐಒಟಿ ಸಾಧನ ನಿರ್ಮಿಸುವಾಗ ನೀವು ಹೆಚ್ಚುವರಿ ಸಂಗ್ರಹಣೆ ಇರುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಬೇಕು, ಮತ್ತು ಪ್ರೋಗ್ರಾಂ ಕೋಡ್ ಸೆರೆಹಿಡಿದ ಧ್ವನಿಯನ್ನು ನೇರವಾಗಿ ಆ ಸಂಗ್ರಹಣದಲ್ಲಿ ಬರೆಯಬೇಕು. ಮತ್ತು ಕ್ಲೌಡ್‌ಗೆ ಕಳುಹಿಸುವಾಗ ಆ ಸಂಗ್ರಹಣೆಗಳಿಂದ ಡೇಟಾವನ್ನು ಸ್ಟ್ರೀಮ್ ಮಾಡಬೇಕು. ಈ ರೀತಿ ಒಂದು ವೇಳೆ ಒಟ್ಟು ಧ್ವನಿ ದತ್ತಾಂಶವನ್ನು ಸ್ಮರಣೆಯಲ್ಲಿ ಹಿಡಿಯಲು ಸಾದ್ಯವಾಗದ ಪ್ರಕರಣದಲ್ಲಿ ಕಲವು ಬಂದೀತು.

ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದಿಂದ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯುವುದು

ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದೊಂದಿಗೆ ಮೈಕ್ರೋಫೋನನ್ನು ಸಂಪರ್ಕಿಸಿ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯಬಹುದು, ಅದು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದಕ್ಕೆ ಸಿದ್ಧನೆ. ಕೋವಿಡ್ ಧ್ವನಿ ಉತ್ಪಾದಿಸಲು ಸ್ಪೀಕರ್‌ಗಳಿಗೆ ಸಂಪರ್ಕಿಸಬಹುದು. ಮುಂದಿನ ಪಾಠಗಳಲ್ಲಿ ಧ್ವನಿ ಪ್ರತಿಕ್ರಿಯೆ ನೀಡಲು ಬಳಸಲಾಗಬಹುದು, ಈಗಿನಲ್ಲೇ ಮೈಕ್ರೋಫೋನನ್ನು ಪರೀಕ್ಷಿಸಲು ಸ್ಪೀಕರ್‌ಗಳನ್ನು ಸೆಟ್ ಮಾಡುವುದು ಉಪಯುಕ್ತ.

ಕಾರ್ಯ - ನಿಮ್ಮ ಮೈಕ್ರೋಫೋನ್ ಮತ್ತು ಸ್ಪೀಕರ್‌ಗಳನ್ನು ಕನ್ಫಿಗರ್ ಮಾಡಿ

ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದ ಮೈಕ್ರೋಫೋನ ಮತ್ತು ಸ್ಪೀಕರ್‌ಗಳನ್ನು ಕನ್ಫಿಗರ್ ಮಾಡಲು ಸಂಬಂಧಿಸಿದ ಮಾರ್ಗಸೂಚಿಯ ಮೂಲಕ ಸಾಗಿರಿ:

ಕಾರ್ಯ - ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯಿರಿ

ನಿಮ್ಮ ಐಒಟಿ ಸಾಧನದಲ್ಲಿ ಧ್ವನಿಯನ್ನು ಸೆರೆಹಿಡಿಯಲು ಸಂಬಂಧಿಸಿದ ಮಾರ್ಗಸೂಚಿಯನ್ನು ಅನುಸರಿಸಿ:

ಮಾತು-ಪಠ್ಯ

ಮಾತು-ಪಠ್ಯ ಅಥವಾ ಮಾತು ಗುರುತುಪಡಿಸುವಿಕೆಯಲ್ಲಿ ಆಡಿಯೋ ಸಂಕೇತದಲ್ಲಿ ಇದ್ದ ಶಬ್ದಗಳನ್ನು ಪಠ್ಯವಾಗಿ ಪರಿವರ್ತಿಸಲು AI ಬಳಕೆ ಮಾಡಲಾಗುತ್ತದೆ.

ಮಾತು ಗುರುತಿಸುವಿಕೆಯ ಮಾದರಿಗಳು

ಮಾತು-ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಲು ಆಡಿಯೋ ಸಂಕೇತದ ಸೆಂಪಲ್‌ಗಳನ್ನು ಜೋಡಿಸಿ, ಆರಿಂದ ರಿಕರರೆಂಟ್ ನ್ಯೂರಲ್ ನೆಟ್ವರ್ಕ್ (RNN) ಆಧರಿತ ಯಂತ್ರ ಕಲಿಕೆ ಮಾದರಿಗೆ ಪೂರೈಸಲಾಗುತ್ತದೆ. ಇದು ಹಿಂದಿನ ಡೇಟಾವನ್ನು ಬಳಸಿ ಇನ್ಪುಟ್ ಡೇಟಾದ ಬಗ್ಗೆ ನಿರ್ಧಾರ ಮಾಡಲು ಬಳಸುವ ಮಾದರಿ. ಉದಾಹರಣೆಗೆ, RNN ಒಂದು ಆಡಿಯೋ ಸೆಂಪಲ್ 'Hel' ಎಂದು ಗುರುತಿಸಿ, ಬಳಿಕ ಇನ್ನೊಂದು 'lo' ಎಂದು ಗುರುತಿಸಿದರೆ, ಇವುಗಳನ್ನು ಜೋಡಿಸಿ 'Hello' ಎಂಬ ಪದವಿದೆ ಎಂದು ಕಂಡುಬಂದು ಅದನ್ನು ಫಲಿತಾಂಶವಾಗಿ ಆರಿಸಬಹುದು.

ಎಲ್ಲಾ ಯಂತ್ರ ಕಲಿಕೆ ಮಾದರಿಗಳು ಪ್ರತೀ ಬಾರಿ ಸಮಾನ ಗಾತ್ರದ ಡೇಟಾವನ್ನು ಸ್ವೀಕರಿಸುತ್ತವೆ. ನೀವು ಹಿಂದೆ ನಿರ್ಮಿಸಿದ್ದ ಚಿತ್ರ ವರ್ಗಶನಕಾರನು ಚಿತ್ರಗಳನ್ನು ನಿರ್ದಿಷ್ಟ ಗಾತ್ರಕ್ಕೆ ಮರುಅಳತೆ ಮಾಡಿ ಪ್ರಕ್ರಿಯೆ ಮಾಡುತ್ತಾನೆ. ಮಾತು ಮಾದರಿಗಳು ಅದೇ ರೀತಿ ನಿರ್ದಿಷ್ಟ ಗಾತ್ರದ ಧ್ವನಿ ತುಂಡುಗಳನ್ನು ಪ್ರಕ್ರಿಯೆ ಮಾಡಬೇಕು. ಮಾತು ಮಾದರಿಗಳು ಹಲವಾರು ಪೂರ್ವಾನುಮಾನಗಳನ್ನು ಸಂಯೋಜಿಸಿ ಉತ್ತರ ದೊರಕಿಸಬೇಕು, ಇದರಿಂದ 'Hi' ಮತ್ತು 'Highway', ಅಥವಾ 'flock' ಮತ್ತು 'floccinaucinihilipilification' ಎಂದು ವಿಭಿನ್ನವಾದ ಪದಗಳನ್ನು ಗುರುತಿಸಬಹುದು.

ಮಾತು ಮಾದರಿಗಳು ವಿಷಯವನ್ನು (Context) ಕೂಡ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಸಮರ್ಥವಾಗಿದ್ದು, ನುಡಿ ಪ್ರಕ್ರಿಯೆಗೆ ಅನ್ವಯಿಸಿ ತಪ್ಪು ಶಬ್ದಗಳನ್ನು ಸರಿಪಡಿಸಬಹುದು. ಉದಾಹರಣೆಗೆ, ನೀವು ಹೇಳಿದರೆ "ನಾನು ಅಂಗಡಿಗೆ ಹೋಗಿ ಎರಡು ಬಾಳೆಹಣ್ಣು ಮತ್ತು ಒಂದು ಸೇಬು ಕೂಡ ತಂದೆ", ಇದರಲ್ಲಿ ತಲಪಿಸುವಲ್ಲಿ ಒಂದೇ ಸರಿಯಾಗಿ ಆದರೆ ಬರಹದಲ್ಲಿ ಭಿನ್ನವಾದ “to”, “two” ಮತ್ತು “too” ಎಂದು ಮೂರು ಪದಗಳಿವೆ. ಮಾತು ಮಾದರಿಗಳು ವಿಷಯವನ್ನು ಅರ್ಥಮಾಡಿ ಸೂಕ್ತ ಬರಹವನ್ನು ಒಳಪಡಿಸುತ್ತವೆ.

💁 ಕೆಲವು ಧ್ವನಿ ಸೇವೆಗಳು ಧ್ವನಿಯನ್ನು ಕಚ್ಚಾ ಪರಿಸರಗಳಲ್ಲಿ (ಕಾರ್ಖಾನೆ ಮುಂತಾದ) ಅಥವಾ ಕೈಗಾರಿಕಾ ವಿಶಿಷ್ಟ ಪದಗಳ (ರಾಸಾಯನಿಕ ಹೆಸರುಗಳು) ಬಳಕೆಗೆ ಹೊಂದಿಸುವ ಮಾರ್ಪಡಿಸುವಿಕೆಯ ಅವಕಾಶವನ್ನು ಒದಗಿಸುತ್ತವೆ. ಈ ಕಸ್ಟಮೈಸೇಷನ್‌ಗಳನ್ನು ಮಾದರಿ ಉತ್ತಮಗೊಳಿಸಲು ಶಾಂಪಲ್ ಧ್ವನಿ ಮತ್ತು ಲಿಪಿಯೊಂದಿಗೆ ತರಬೇತುದಾರರು ಕಲಿಸುತ್ತಾರೆ, ಇದನ್ನು 'ಟ್ರಾನ್ಸ್‌ಫರ್ ಲರ್ನಿಂಗ್' ಎಂದು ಕರೆಯುತ್ತಾರೆ. ಇದು ನೀವು ಹಿಂದಿನ ಪಾಠದಲ್ಲಿ ಕೆಲವು ಚಿತ್ರಗಳ ಮೂಲಕ ಚಿತ್ರ ವರ್ಗೀಕರಣಕಾರ ರಚಿಸಿದ ರೀತಿಯೇ.

ಗೌಪ್ಯತೆ

ಗ್ರಾಹಕರ ಐಒಟಿ ಸಾಧನಗಳಲ್ಲಿ ಮಾತು-ಪಠ್ಯ ಸೇವೆ ಬಳಸುವಾಗ, ಗೌಪ್ಯತೆ ಅತ್ಯಂತ ಮುಖ್ಯ. ಈ ಸಾಧನಗಳು ನಿರಂತರವಾಗಿ ಧ್ವನಿಯನ್ನು ಕೇಳುತ್ತವೆ, ಆದ್ದರಿಂದ ನೀವು ಪ್ರತಿಯೊಂದು ಮಾತು ಕೂಡ ಕ್ಲೌಡ್‌ಗೆ ಕಳುಹಿಸಿ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿತವಾಗಬಾರದು. ಇದು ಇಂಟರ್‌ನೆಟ್ ಬೆಲವನ್ನು ಹೆಚ್ಚಿಸುವುದುತ್ತದೆ ಮಾತ್ರವಲ್ಲದೆ, ದೊಡ್ಡ ಗೌಪ್ಯತೆ ಸಮಸ್ಯೆಗಳೂ ಉಂಟಾಗುತ್ತವೆ, ವಿಶೇಷವಾಗಿ ಕೆಲ ಸ್ಮಾರ್ಟ್ ಸಾಧನ ತಯಾರಕರುಮಾದರಿ ಸುಧಾರಿಸಲು ಪರಿಷ್ಕರಿಸಿದ ಪಠ್ಯದೊಂದಿಗೆ ಮಾನವರ ಮೌಲ್ಯಮಾಪನಕ್ಕಾಗಿ ಕಂಡುಹಿಡಿದ ಧ್ವನಿಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಿಕೊಳ್ಳುತ್ತಾರೆ. ನೀವು ನಿಮ್ಮ ಸ್ಮಾರ್ಟ್ ಡಿವೈಸ್ ಅನ್ನು ಆಡಿಯೋವನ್ನು ಕ್ಲೌಡ್‌ಗೆ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲು ಕಳುಹಿಸುವುದು ನೀವು ಅದನ್ನು ಬಳಸುತ್ತಿದ್ದಾಗ ಮಾತ್ರ ಇಚ್ಛಿಸುತ್ತೀರಿ, ನಿಮ್ಮ ಮನೆಯಲ್ಲಿ ಆಡಿಯೋ ಕೇಳಿದಾಗ ಅಲ್ಲ, ದ್ವೀಪ ಮಟ್ಟದ ಸಭೆಗಳು ಅಥವಾ ಹತ್ತಿರದ ಸಂಭಾಷಣೆಗಳನ್ನು ಒಳಗೊಂಡಿರಬಹುದು. ಬಹುತೇಕ ಸ್ಮಾರ್ಟ್ ಸಾಧನಗಳು "ವೇಕ್ ವರ್ಡ್" ಜೊತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ, "ಆಲೆಕ್ಸಾ", "ಹೇ ಸಿರಿ", ಅಥವಾ "ಓಕೆ ಗೂಗಲ್" ಎಂಬ ಪ್ರಮುಖ ವಾಕ್ಯಗಳು ಸಾಧನವನ್ನು 'ಜಾಗೃತ'ಗೊಳಿಸುತ್ತವೆ ಮತ್ತು ನೀವು ಹೇಳುತ್ತಿರುವುದನ್ನು ಕೇಳಲು ಆರಂಭಿಸುತ್ತವೆ, ನೀವು ಡಿವೈಸ್‌ಗೆ ಮಾತನಾಡುವುದು ಮುಗಿದಿದೆ ಎಂದು ಸೂಚಿಸುವ ವಿಶ್ರಾಂತಿ ಕಂಡುಬಂದಾಗ.

🎓 ವೇಕ್ ವರ್ಡ್ ಪತ್ತೆ ಹಂಚಿಕೆ "ಕೀವರ್ಡ್ ಸ್ಪಾಟಿಂಗ್" ಅಥವಾ "ಕೀವರ್ಡ್ ರೆಕಗ್ನಿಷನ್" ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ.

ಈ ವೇಕ್ ವರ್ದ್‌ಗಳು ಸಾಧನದಲ್ಲಿ ಪತ್ತೆಯಾದವು, ಕ್ಲೌಡ್‌ನಲ್ಲಿ ಅಲ್ಲ. ಈ ಸ್ಮಾರ್ಟ್ ಸಾಧನಗಳಲ್ಲಿ ಸಣ್ಣ AI ಮಾದರಿಗಳು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಮತ್ತು ಅವು ವೇಕ್ ವರ್ಡ್ ಅನ್ನು ಕೇಳುತ್ತವೆ, ಪತ್ತೆಯಾಗಿದ್ರೆ ಆ ಕಾಯಿತ ಕೇವಲ ಆಡಿಯೋವನ್ನು ಕ್ಲೌಡ್‌ಗೆ Recognition ಗಾಗಿ ಸ್ಟ್ರೀಮ್ ಮಾಡಲು ಪ್ರಾರಂಭಿಸುತ್ತವೆ. ಈ ಮಾದರಿಗಳು ತುಂಬಾ ವಿಶೇಷವಾಗಿವೆ ಮತ್ತು ಕೇವಲ ವೇಕ್ ವರ್ಡ್‌ಗಾಗಿ ಕೇಳುತ್ತವೆ.

💁 ಕೆಲವು ತಂತ್ರಜ್ಞಾನ ಕಂಪನಿಗಳು ತಮ್ಮ ಸಾಧನಗಳಿಗೆ ಹೆಚ್ಚುವರಿ ಗೌಪ್ಯತೆಯನ್ನು ಸೇರಿಸುತ್ತಿದ್ದಾರೆ ಮತ್ತು ಕೆಲವು ಭಾಷಣದ ಪಠ್ಯ ಪರಿವರ್ತನೆಯನ್ನು ಸಾಧನದಲ್ಲಿ ಮಾಡುತ್ತಿದ್ದಾರೆ. ಆಪಲ್ ಅವರು 2021 ರ iOS ಮತ್ತು macOS ನ ನವೀಕರಣಗಳಲ್ಲಿ ಅವರಿಗೆ ಸಾಧನದಲ್ಲಿ ಭಾಷಣ-ಪಠ್ಯ ಪರಿವರ್ತನೆಗೆ ಬೆಂಬಲ ನೀಡುವುದಾಗಿ ಘೋಷಿಸಿದ್ದಾರೆ, ಮತ್ತು ಒಳ್ಳೇಷ್ಟು ವಿನಂತಿಗಳನ್ನು ಕ್ಲೌಡ್ ಬಳಸದೇ ನಿರ್ವಹಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ. ಇದು ಶಕ್ತಿಶಾಲಿ ಪ್ರೊಸೆಸರ್‌ಗಳಿದ್ದರಿಂದ ನಡೀತಾ Machine Learning ಮಾದರಿಗಳನ್ನು ಚಾಲನೆ ಮಾಡಲು ಸಾಧ್ಯವಾಗಿದೆ.

ನೀವು ಏನು ಭಾವಿಸುತ್ತೀರಿ ಎಂಬುದನ್ನು ಕೇಳಬೇಕಾದರೆ, ಕ್ಲೌಡ್‌ಗೆ ಕಳುಹಿಸಿದ ಆಡಿಯೋವನ್ನು ಸಂಗ್ರಹಿಸುವುದರ ಗುಪ್ತತೆ ಮತ್ತು ನೈತಿಕ ಪರಿಣಾಮಗಳೇನು? ಈ ಆಡಿಯೋ ಸಂಗ್ರಹಿಸಬಹುದೇ? ಆಗ ಹಾಗೆ ಆದರೆ ಹೇಗೆ? ಕಾನೂನು ಕಾರ್ಯಾಚರಣೆಗೆ ದಾಖಲಾತಿಗಳನ್ನು ಉಪಯೋಗಿಸುವುದು ಗೌಪ್ಯತೆ ನಷ್ಟವನ್ನು ಬದಲಾಯಿಸುವ ಸಲುವಾಗಿದೆಯೇ?

ವೇಕ್ ವರ್ಡ್ ಪತ್ತೆ ಸಾಮಾನ್ಯವಾಗಿ ಒಂದು ತಂತ್ರ known as TinyML ಅನ್ನು ಬಳಸುತ್ತದೆ, ಇದು Microcontrollers ನಲ್ಲಿ ಚಾಲನೆಗಾಗಿ ML ಮಾದರಿಗಳನ್ನು ಪರಿವರ್ತಿಸುವುದಾಗಿದೆ. ಈ ಮಾದರಿಗಳು ಚಿಕ್ಕ ಗಾತ್ರದವು ಮತ್ತು very power consumption ಕಡಿಮೆ.

ವೇಕ್ ವರ್ಡ್ ಮಾದರಿಯನ್ನು ತರಬೇತಿ ಮಾಡುವುದು ಮತ್ತು ಬಳಸುವುದರ ಸಂಕೀರ್ಣತೆಯನ್ನು ತಪ್ಪಿಸಲು, ನೀವು ಈ ಪಾಠದಲ್ಲಿ ನಿರ್ಮಿಸುವ ಸ್ಮಾರ್ಟ್ ಟೈಮರ್ ಭಾಷಣ ಪಠ್ಯ ಪರಿವರ್ತನೆಗೆ ಬಟನ್ ಅನ್ನು ಬಳಕೆ ಮಾಡುತ್ತದೆ.

💁 ನೀವು Wio Terminal ಅಥವಾ Raspberry Pi ಮೇಲೆ ಚಾಲನೆ ಮಾಡುವ ವೇಕ್ ವರ್ಡ್ ಪತ್ತೆ ಮಾದರಿ ರಚಿಸಲು ಪ್ರಯತ್ನಿಸಲು ಇಚ್ಛಿಸಿದರೆ, ಇಲ್ಲಿ ನಿಮ್ಮ ಧ್ವನಿಗೆ ಪ್ರತಿಕ್ರಿಯಿಸುವ Edge Impulse ಟ್ಯುಟೋರಿಯಲ್ ನೋಡಿ. ನೀವು ನಿಮ್ಮ ಕಂಪ್ಯೂಟರ್ ಬಳಸಿ ಇದನ್ನು ಮಾಡಲು ಬಯಸಿದರೆ, Microsoft ಡಾಕ್ಯುಮೆಂಟ್‌ನಲ್ಲಿ ಕಸ್ಟಮ್ ಕೀವರ್ಡ್ ಕ್ವಿಕ್‌ಸ್ಟಾರ್ಟ್ ಬಳಸಿ ಪ್ರಯತ್ನಿಸಬಹುದು.

ಭಾಷಣವನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ

Speech services logo

ಹಳೇ ಯೋಜನೆಯಲ್ಲಿ ಚಿತ್ರ ವರ್ಗೀಕರಣದಂತೆ, ಭಾಷಣವನ್ನು ಆಡಿಯೋ ಫೈಲ್ ಆಗಿ ಸ್ವೀಕರಿಸಿ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವ ಮೊದಲು ನಿಗದಿಪಡಿಸಲಾದ AI ಸೇವೆಗಳನ್ನು ಬಳಸಬಹುದು. ಇಂಥದ್ದೊಂದು ಸೇವೆ Speech Service ಆಗಿದೆ, Cognitive Services ನ ಭಾಗವಾಗಿದ್ದು, ನೀವು ನಿಮ್ಮ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಲ್ಲಿ ಬಳಸಬಹುದಾದ ಪೂರ್ವ-ನಿರ್ಮಿತ AI ಸೇವೆಗಳು.

ಕಾರ್ಯ - ಭಾಷಣ AI ಸಂಪನ್ಮೂಲವನ್ನು ನಿಯೋಜಿಸಿ

  1. ಈ ಯೋಜನೆಗಾಗಿ 'smart-timer' ಎಂಬ Resource Group ರಚಿಸಿ

  2. ಕೆಳಗಿನ ಆಜ್ಞೆಯನ್ನು ಉಚಿತ ಭಾಷಣ ಸಂಪನ್ಮೂಲ ಸೃಷ್ಟಿಸಲು ಬಳಸಿ:

    az cognitiveservices account create --name smart-timer \
                                        --resource-group smart-timer \
                                        --kind SpeechServices \
                                        --sku F0 \
                                        --yes \
                                        --location <location>
    

    ನೀವು Resource Group ರಚಿಸುವಾಗ ಬಳಸಿದ <location> ಇವುಗಳನ್ನು ಬದಲಾಯಿಸಿ.

  3. ನಿಮ್ಮ ಕೋಡ್‌ನಿಂದ ಭಾಷಣ ಸಂಪನ್ಮೂಲವನ್ನು ಪ್ರವೇಶಿಸಲು API ಕೀ ಬೇಕಾಗುತ್ತದೆ. ಕೀ ಪಡೆಯಲು ಕೆಳಗಿನ ಆಜ್ಞೆಯನ್ನು ಚಾಲನೆ ಮಾಡಿ:

    az cognitiveservices account keys list --name smart-timer \
                                           --resource-group smart-timer \
                                           --output table
    

    ಕೀಲಿಯ ಒಂದನ್ನು ನಕಲಿಸಿ.

ಕಾರ್ಯ - ಭಾಷಣವನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ

ನಿಮ್ಮ IoT ಸಾಧನದಲ್ಲಿ ಭಾಷಣವನ್ನು ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಲು ಸಂಬಂಧಿತ ಗೈಡ್ ಮೂಲಕ ಕಾರ್ಯನಿರ್ವಹಿಸಿ:


🚀 ಚಾಲೆಂಜ್

ಭಾಷಣ ಗುರುತಿಸುವಿಕೆ ಬಹಳ ಸಮಯದಿಂದ ಇದ್ದು, ನಿರಂತರವಾಗಿ ಸುಧಾರಿಸುತ್ತಿದೆ. ಪ್ರಸ್ತುತ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ಆರಂದಿಸಿ ಹೇಗೆ ಅವು ಕಾಲಕ್ರಮೇಣ ಬದಲಾಗಿದೆ ಎಂದು ಉಪಾಯಿಸುವುದನ್ನು ಸಹ ಸೇರಿಸಿ, ಮಷೀನ್ ಟ್ರಾನ್ಸ್‌ಕ್ರಿಪ್ಶನ್ನು ಮಾನವರಿಗಿಂತ ಎಷ್ಟು ಶುದ್ಧವಾಗಿದೆ.

ಭಾಷಣ ಗುರುತಿಸುವಿಕೆಯ ಭವಿಷ್ಯವನ್ನು ನೀವು ಹೇಗೆ ನೋಡುತ್ತೀರಿ?

ಪಠ್ಯನಂತರ ಕುಯಿಜ್

ಪಠ್ಯನಂತರ ಕುಯಿಜ್

ವಿಮರ್ಶೆ & ಸ್ವಯಂ ಅಧ್ಯಯನ

ನಿಯೋಜನೆ


ಅರ್ಹತೆ ನಿರಾಕರಣೆ:
ಈ ದಾಖಲೆ AI ಅನುವಾದ ಸೇವೆ Co-op Translator ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ಸಮಗ್ರತೆಯನ್ನು ಸಾಧಿಸಲು ಯತ್ನಿಸಿದರೂ, ಸ್ವಯಂಶಾಸಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದೆಂದು ಗಮನಿಸಿ. ಮೂಲ ಭಾಶೆಯಲ್ಲಿ ಇರುವ ಮೂಲ ದಾಖಲೆ ಅಧಿಕೃತ ಹಾಗೂ ನಂಬಿಕೆ ಯೋಗ್ಯ ಮೂಲವಾಗಿರುತ್ತದೆ. ಪ್ರಮುಖ ಮಾಹಿತಿಗಾಗಿ ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ಅರ್ಥಾಭ್ಯಾಸ ಅಥವಾ ತಪ್ಪು ವಿವರಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಲ್ಲ.