13 KiB
ಪಠ್ಯವನ್ನು ಮಾತಾಗಿ ಪರಿವರ್ತನೆ ಮಾಡುವುದು - ರಾಸ್ಪ್ಬೆರಿ ಪೈ
ಈ ಪಾಠದ ಭಾಗದಲ್ಲಿ, ನೀವು ಪಠ್ಯವನ್ನು ಮಾತಾಗಿ ಪರಿವರ್ತಿಸಲು ಸ್ಮೃತಿ ಸೇವೆಯನ್ನು ಬಳಸಿ ಕೋಡ್ ಬರೆಯುತ್ತೀರಿ.
ಸ್ಮೃತಿ ಸೇವೆಯನ್ನು ಬಳಸಿ ಪಠ್ಯವನ್ನು ಮಾತಾಗಿ ಪರಿವರ್ತಿಸುವುದು
ಪಠ್ಯವನ್ನು REST API ಮೂಲಕ ಸ್ಮೃತಿ ಸೇವೆಗೆ ಕಳುಹಿಸಬಹುದು, ಆಗ ಅದು ಧ್ವನಿಯಾಗಿ ನಂತರ ನಿಮ್ಮ IoT ಸಾಧನದಲ್ಲಿ播放 ಮಾಡಲು ಆಡಿಯೋ ಕಡತವಾಗಿ ಸಿಗುತ್ತದೆ. ಮಾತು ವಿನಂತಿಸುವಾಗ, ವಿವಿಧ ಧ್ವನಿಗಳ ಬಳಕೆ ಮೂಲಕ ಮಾತು ನಿರ್ಮಿಸಲು ಬಳಸಬೇಕಾದ ಧ್ವನಿಯನ್ನು ಒದಗಿಸುವ ಅಗತ್ಯವಿದೆ.
ಪ್ರತಿ ಭಾಷೆ ವಿಭಿನ್ನ ಧ್ವನಿಗಳ ಶ್ರೇಣಿಯನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ, ಮತ್ತು ನೀವು ಪ್ರತಿ ಭಾಷೆಗೆ ಬೆಂಬಲಿತ ಧ್ವನಿಗಳ ಪಟ್ಟಿ ಪಡೆಯಲು ಸ್ಮೃತಿ ಸೇವೆಗೆ REST ವಿನಂತಿಯನ್ನು ಮಾಡಲು পারেন.
ಕಾರ್ಯ - ಧ್ವನಿಯನ್ನು ಪಡೆಯಿರಿ
-
VS ಕೋಡ್ನಲ್ಲಿ
smart-timerಪ್ರಾಜೆಕ್ಟ್ ತೆರೆಯಿರಿ. -
sayಕಾರ್ಯದ ಮೇಲ್ಪಡೆ ಭಾಷೆಗೆ ಧ್ವನಿಗಳ ಪಟ್ಟಿಯನ್ನು ವಿನಂತಿಸಲು ಕೆಳಗಿನ ಕೋಡ್ ಸೇರಿಸಿ:def get_voice(): url = f'https://{location}.tts.speech.microsoft.com/cognitiveservices/voices/list' headers = { 'Authorization': 'Bearer ' + get_access_token() } response = requests.get(url, headers=headers) voices_json = json.loads(response.text) first_voice = next(x for x in voices_json if x['Locale'].lower() == language.lower() and x['VoiceType'] == 'Neural') return first_voice['ShortName'] voice = get_voice() print(f'Using voice {voice}')ಈ ಕೋಡ್
get_voiceಎಂಬ ಒಂದು ಕಾರ್ಯವನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ, ಇದು ಸ್ಮೃತಿ ಸೇವೆಯನ್ನು ಬಳಸಿ ಧ್ವನಿಗಳ ಪಟ್ಟಿಯನ್ನು ಪಡೆಯುತ್ತದೆ. ನಂತರ, ಬಳಕೆಯ ಭಾಷೆಗೆ ಹೊಂದಿಕೊಳ್ಳುವ ಮೊದಲ ಧ್ವನಿಯನ್ನು ಕಂಡುಹಿಡಿಯುತ್ತದೆ.ಈ ಕಾರ್ಯವನ್ನು ನಂತರ ಕರೆಮಾಡಿ ಮೊದಲ ಧ್ವನಿಯನ್ನು ಸಂಗ್ರಹಿಸಿ, ಧ್ವನಿ ಹೆಸರು ಕಾನ್ಸೋಲ್ನಲ್ಲಿ ಮುದ್ರಿಸಲಾಗುತ್ತದೆ. ಈ ಧ್ವನಿಯನ್ನು ಒಮ್ಮೆ ವಿನಂತಿಸಿ, ಪಠ್ಯವನ್ನು ಮಾತಾಗಿ ಪರಿವರ್ತಿಸುವ ಪ್ರತಿಯೊಂದು ಕರೆಗೂ ಇದರ ಮೌಲ್ಯವನ್ನು ಬಳಸಬಹುದು.
💁 ನೀವು Microsoft Docs ನಲ್ಲಿರುವ ಭಾಷೆ ಮತ್ತು ಧ್ವನಿ ಬೆಂಬಲ ದಸ್ತಾವೇಜಿನಲ್ಲಿ كامل ಬೆಂಬಲಿತ ಧ್ವನಿಗಳ ಪಟ್ಟಿಯನ್ನು ಪಡೆಯಬಹುದು. ನೀವು ನಿರ್ದಿಷ್ಟ ಧ್ವನಿಯನ್ನು ಬಳಸಲು ಬಯಸಿದ್ದರೆ, ಈ ಕಾರ್ಯವನ್ನು ತೆಗೆದುಹಾಕಿ, ಆ ದಸ್ತಾವೇಜಿನಿಂದ ಧ್ವನಿ ಹೆಸರಿಗೆ ಹಾರ್ಡ್ ಕೋಡ್ ಮಾಡಬಹುದು. ಉದಾಹರಣೆಗೆ:
voice = 'hi-IN-SwaraNeural'
ಕಾರ್ಯ - ಪಠ್ಯವನ್ನು ಮಾತಾಗಿ ಪರಿವರ್ತಿಸುವುದು
-
ಇದರ ಕೆಳಗೆ, ಸ್ಮೃತಿ ಸೇವೆಗಳಲ್ಲಿಂದ ಪಡೆಯಬಹುದಾದ ಆಡಿಯೋ ರೂಪಿಗೆ ಒಂದು ಸ್ಥಿರಾಂಕವನ್ನು ಗೋಷ್ಠಿ ಮಾಡಿ. ನೀವು ಆಡಿಯೋವನ್ನು ವಿನಂತಿಸುವಾಗ ವಿವಿಧ ರೂಪಗಳಲ್ಲಿ ಅದನ್ನು ಪಡೆಯಬಹುದು.
playback_format = 'riff-48khz-16bit-mono-pcm'ನೀವು ಬಳಸಬಹುದಾದ ರೂಪ ನಿಮ್ಮ ಉಪಕರಣದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ. ಆಡಿಯೋವನ್ನು ಪ್ಲೇ ಮಾಡುವಾಗ
Invalid sample rateದೋಷಗಳು ಬಂದರೆ, ಇದನ್ನು ಬೇರೆ ಮೌಲ್ಯಕ್ಕೆ ಬದಲಿಸಿ. ಬೆಂಬಲಿತ ಮೌಲ್ಯಗಳ ಪಟ್ಟಿಯನ್ನು Microsoft Docs ನಲ್ಲಿ ಪಠ್ಯದಿಂದ ಮಾತು REST API ದಸ್ತಾವೇಜಿನಲ್ಲಿ ಕಾಣಬಹುದು. ನೀವುriffರೂಪದ ಆಡಿಯೋ ಬಳಕೆಯಾಗಬೇಕು, ಪ್ರಯತ್ನಿಸಲು ಮೌಲ್ಯಗಳುriff-16khz-16bit-mono-pcm,riff-24khz-16bit-mono-pcm, ಮತ್ತುriff-48khz-16bit-mono-pcm. -
ಇದರ ಕೆಳಗೆ,
get_speechಎಂಬ ಕಾರ್ಯವನ್ನು ಘೋಷಿಸಿ, ಇದು ಪಠ್ಯವನ್ನು ಸ್ಮೃತಿ ಸೇವೆ REST API ಬಳಸಿ ಮಾತಾಗಿ ಪರಿವರ್ತಿಸುತ್ತದೆ:def get_speech(text): -
get_speechಕಾರ್ಯದಲ್ಲಿ, ಕರೆಯಬೇಕಾದ URL ಮತ್ತು ಕಳುಹಿಸಬೇಕಾದ ಹೆಡರ್ಗಳನ್ನು ನಿಖರವಾಗಿ ನಿರ್ಧರಿಸಿ:url = f'https://{location}.tts.speech.microsoft.com/cognitiveservices/v1' headers = { 'Authorization': 'Bearer ' + get_access_token(), 'Content-Type': 'application/ssml+xml', 'X-Microsoft-OutputFormat': playback_format }ಈ ಹೆಡರ್ಗಳು ಜನರೇಟ್ ಆಗಿದ ಪ್ರವೇಶ ಟೋಕನ್ ಬಳಸಲಾಗುತ್ತಿದೆ, ವಿಷಯವನ್ನು SSML ಆಗಿ ಸಿದ್ಧಪಡಿಸಲಾಗಿದೆ ಮತ್ತು ಬೇಕಾದ ಆಡಿಯೋ ರೂಪ ನಿರ್ಧಾರವಾದಿದೆ.
-
ಇದರ ಕೆಳಗೆ, REST API ಗೆ ಕಳಿಸುವ SSML ಅನ್ನು ನಿರ್ಧರಿಸಿ:
ssml = f'<speak version=\'1.0\' xml:lang=\'{language}\'>' ssml += f'<voice xml:lang=\'{language}\' name=\'{voice}\'>' ssml += text ssml += '</voice>' ssml += '</speak>'ಈ SSML ಭಾಷೆಯನ್ನು, ಧ್ವನಿಯನ್ನು ಮತ್ತು ಪರಿವರ್ತಿಸುವ ಪಠ್ಯವನ್ನು ನಿಯೋಜಿಸುತ್ತದೆ.
-
ಕೊನೆಯಲ್ಲಿ, REST ವಿನಂತಿಯನ್ನು ಮಾಡಿಸಿ ಬೈನರಿ ಆಡಿಯೋ ಡೇಟಾವನ್ನು ಮರಳಿಸುವ ಕೋಡ್ ಸೇರಿಸಿ:
response = requests.post(url, headers=headers, data=ssml.encode('utf-8')) return io.BytesIO(response.content)
ಕಾರ್ಯ - ಆಡಿಯೋವನ್ನು ಪ್ಲೇ ಮಾಡುವುದು
-
get_speechಕಾರ್ಯದ ಕೆಳಗೆ, REST API ಕರೆನಿಂದ ಮರಳುವ ಆಡಿಯೋವನ್ನು ಪ್ಲೇ ಮಾಡುವ ಒಂದು ಹೊಸ ಕಾರ್ಯವನ್ನು ಘೋಷಿಸಿ:def play_speech(speech): -
ಈ ಕಾರ್ಯಕ್ಕೆ ಪಾಸ್ ಆಗುವ
speechಸಾಧಾರಣವಾಗಿ REST API ಕರೆಯು ಮರಳಿಸುವ ಬೈನರಿ ಆಡಿಯೋ ಡೇಟಾಗಾಗಿರುತ್ತದೆ. ಈ ಕೆಳಗಿನ ಕೋಡ್ ಅನ್ನು ಬಳಸಿ ಇದು ಒಂದು wave ಫೈಲ್ ಆಗಿ ತೆರೆಯಿರಿ ಮತ್ತು PyAudio ಗೆ ಪಾಸ್ ಮಾಡಿ ಆಡಿಯೋ ಪ್ಲೇಮಾಡಿ:def play_speech(speech): with wave.open(speech, 'rb') as wave_file: stream = audio.open(format=audio.get_format_from_width(wave_file.getsampwidth()), channels=wave_file.getnchannels(), rate=wave_file.getframerate(), output_device_index=speaker_card_number, output=True) data = wave_file.readframes(4096) while len(data) > 0: stream.write(data) data = wave_file.readframes(4096) stream.stop_stream() stream.close()ಈ ಕೋಡ್ PyAudio ಸ್ಟ್ರೀಮ್ ಅನ್ನು ಬಳಸುತ್ತದೆ, ಅದೇ ಅಥವಾ ಅudio ಹಿಡಿಯುವಾಗದಂತೆಯೇ. ವ್ಯತ್ಯಾಸವೆಂದರೆ ಇಲ್ಲಿ ಸ್ಟ್ರೀಮ್ ಔಟ್ಪುಟ್ ಆಗಿ ಸಿದ್ಧಪಡಿಸಲಾಗಿದೆ, ಮತ್ತು ಡೇಟಾ ಆಡಿಯೋ ಡೇಟಾದಿಂದ ಓದಿಕೊಳ್ಳಲ್ಪಡುವುದಾಗಿ ಮತ್ತು ಸ್ಟ್ರೀಮ್ ಗೆ ಒದಗಿಸಲಾಗುತ್ತಿದೆ.
ಸ್ಟ್ರೀಮ್ ವಿವರಗಳ (ಉದಾಹರಣೆಗೆ ಸ್ಯಾಂಪಲ್ ದರ) ಹಾರ್ಡ್ ಕೋಡ್ ಮಾಡುವ ಬದಲಾಗಿ, ಅವನ್ನು ಆಡಿಯೋ ಡೇಟಾದಿಂದ ಓದಿಕೊಳ್ಳಲಾಗುತ್ತದೆ.
-
sayಕಾರ್ಯದ ವಿಷಯವನ್ನು ಕೆಳಗಿನಂತೆ ಬದಲಾಯಿಸಿ:speech = get_speech(text) play_speech(speech)ಈ ಕೋಡ್ ಪಠ್ಯವನ್ನು ಬೈನರಿ ಆಡಿಯೋ ಡೇಟಾ ಆಗಿ ಪರಿವರ್ತಿಸಿ, ಆಡಿಯೋವನ್ನು پ್ಲೇ ಮಾಡುತ್ತದೆ.
-
ಅಪ್ಲಿಕೇಶನ್ ಅನ್ನು ಚಾಲನೆ ಮಾಡಿ, ಮತ್ತು ಕಾರ್ಯ ಫಂಕ್ಷನ್ ಅಪ್ಲಿಕೇಶನ್ ಕೂಡ ನಡೆಯುತ್ತಿದೆಯೇ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ. ಕೆಲವೊಂದು ಟೈಮರ್ಗಳನ್ನು ಸೆಟ್ ಮಾಡಿ, ನೀವು ಟೈಮರ್ ಸೆಟ್ ಆಗಿದ್ದನೆಂದು ಹೇಳುವ ಮಾತುನಿರೂಪಣೆಯನ್ನು ಕೇಳಬಹುದು, ನಂತರ ಟೈಮರ್ ಮುಗಿದಾಗ ಮತ್ತೊಂದು ಮಾತುನಿರೂಪಣೆಯನ್ನು ಕೇಳಬಹುದು.
Invalid sample rateದೋಷಗಳು ಬಂದರೆ, ಮೇಲ್ಕಂಡಂತೆplayback_formatಅನ್ನು ಬದಲಿಸಿ.
💁 ಈ ಕೋಡ್ ಅನ್ನು code-spoken-response/pi ಫೋಲ್ಡರ್ನಲ್ಲಿ ಕಾಣಬಹುದು.
😀 ನಿಮ್ಮ ಟೈಮರ್ ಕಾರ್ಯಕ್ರಮ ಯಶಸ್ವಿ ಆಯಿತು!
ತ್ಯಜ್ಯ ಹೇಳಿಕೆ:
ಈ документаಿ AI ಅನುವಾದ ಸೇವೆ Co-op Translator ಬಳಸಿ ಅನುವದಿಸಲಾಗಿದೆ. ನಾವು ಶುದ್ಧತೆಯ ಬಗ್ಗೆ ಪ್ರಯತ್ನಿಸುವುದರೊಂದಿಗೆ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂಬುದನ್ನು ದಯವಿಟ್ಟು ಗಮನಿಸಿರಿ. ಮೂಲ документаಿಯನ್ನು ಅದರ ಸ್ವದೇಶಿ ಭಾಷೆಯಲ್ಲಿ ಅಧಿಕೃತ ಮೂಲವೆನ್ನಿಸುತ್ತದೆ. ಮಹತ್ವದ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದವನ್ನು ಬಳಸದ ಪರಿಣಾಮ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಗ್ರಹಣ ಅಥವಾ ತಪ್ಪು ವ್ಯಾಖ್ಯಾನದ ಹೊಣೆಗಾರಿಕೆ ನಮ್ಮದಾಗಿರುವುದಿಲ್ಲ.