14 KiB
വാചകത്തിൽ നിന്ന് സംസാരത്തിലേക്ക് - റാസ്ബെറി പൈ
പാഠത്തിന്റെ ഈ ഭാഗത്തിൽ, സംസാര സേവനം ഉപയോഗിച്ച് വാചകത്തിനെ സംസാരത്തിൽ മാറുന്ന കോഡ് നിങ്ങൾ എഴുതും.
സംസാര സേവനം ഉപയോഗിച്ച് വാചകത്തിനെ സംസാരത്തിലേക്ക് മാറ്റുക
വാചകം REST API ഉപയോഗിച്ച് സംസാര സേവനത്തിലേക്ക് അയച്ചു, ഈ ഓഡിയോ ഫയലായി സബ്ക്ഷേപം ലഭിക്കും, ഇത് നിങ്ങളുടെ IoT ഉപകരണത്തിൽ പുനരവതരിപ്പിക്കാം. സംസാരത്തിനായി അഭ്യർത്ഥന ചെയ്യുമ്പോൾ, ഭാഷയുടെ വ്യത്യസ്ത ശബ്ദങ്ങളിൽ സംസാരമുണ്ടാക്കാനും ഉപയോഗിക്കുന്ന ശബ്ദം നൽകണമെന്ന് ആവശ്യമാണ്.
ഓരോ ഭാഷയും വിവിധ ശബ്ദങ്ങൾ പിന്തുണയ്ക്കുന്നു, ഈ ശബ്ദങ്ങളുടെ പട്ടിക ലഭിക്കാൻ സംസാര സേവനത്തിന് REST അഭ്യർത്ഥന നടത്താം.
ജോലികൾ - ശബ്ദം നേടുക
-
VS Code-ൽ
smart-timerപ്രോജക്ട് തുറക്കുക. -
പ്രവർത്തനം
sayമേലെ താഴെ നൽകിയ കോഡ് ചേർത്ത് ഒരു ഭാഷയുടെ ശബ്ദങ്ങളുടെ പട്ടികക്കും അഭ്യർത്ഥിക്കൂ:def get_voice(): url = f'https://{location}.tts.speech.microsoft.com/cognitiveservices/voices/list' headers = { 'Authorization': 'Bearer ' + get_access_token() } response = requests.get(url, headers=headers) voices_json = json.loads(response.text) first_voice = next(x for x in voices_json if x['Locale'].lower() == language.lower() and x['VoiceType'] == 'Neural') return first_voice['ShortName'] voice = get_voice() print(f'Using voice {voice}')ഈ കോഡ്
get_voiceഎന്ന പ്രവർത്തനം നിർവചിക്കുന്നു, ഇത് സംസാര സേവനം ഉപയോഗിച്ച് ശബ്ദങ്ങളുടെ പട്ടിക നേടുന്നു. തുടർന്ന് ഉപയോഗിക്കുന്ന ഭാഷയ്ക്ക് പൊരുത്തപ്പെടുന്ന ആദ്യ ശബ്ദം കണ്ടെത്തുന്നു.ഈ പ്രവർത്തനം പിന്നീട് വിളിച്ച് ആദ്യം കിട്ടിയ ശബ്ദം സംഭരിച്ചു ശബ്ദത്തിന്റെ പേര് കോൺസോളിൽ പ്രിന്റ് ചെയ്യും. വാചകത്തിൽ നിന്ന് സംസാരത്തിലേക്ക് മാറ്റുന്നതിനുള്ള എല്ലാ വിളികൾക്കും ഈ ശബ്ദം ഒരിക്കൽ അഭ്യർത്ഥിച്ച് ഉപയോഗിക്കാം.
💁 നിങ്ങൾക്ക് Microsoft ഡോക്സ്-ലെ ഭാഷയും ശബ്ദ പിന്തുണയും സംബന്ധിച്ച രേഖാമൂല്യങ്ങളിൽ നിന്ന് മുഴുവൻ പിന്തുണയുള്ള ശബ്ദങ്ങളുടെ പട്ടിക ലഭ്യമാണ്. നിർദ്ദിഷ്ട ശബ്ദം ഉപയോഗിക്കാനായാൽ, ഈ പ്രവർത്തനം ഒഴിവാക്കി രേഖാമൂല്യത്തിലുള്ള ശബ്ദനാമം കൊടുത്ത് ഹാർഡ് കോഡ് ചെയ്യാം. ഉദാഹരണത്തിന്:
voice = 'hi-IN-SwaraNeural'
ജോലികൾ - വാചകത്തെ സംസാരത്തിലേക്ക് മാറുക
-
ഇതിന് കീഴിൽ, സംസാര സേവനങ്ങളിൽ നിന്ന് ലഭ്യമാക്കേണ്ട ഓഡിയോ ഫോർമാറ്റിനുള്ള സ്ഥിരമായ ഘടകം നിർവചിക്കുക. ഓഡിയോ അഭ്യർത്ഥന ചെയ്യുമ്പോൾ വിവിധ ഫോർമാറ്റുകളിൽ ലഭ്യമാണ്.
playback_format = 'riff-48khz-16bit-mono-pcm'നിങ്ങൾക്ക് ഉപയോഗിക്കാൻ കഴിയുന്ന ഫോർമാറ്റ് നിങ്ങളുടെ ഹാർഡ്വെയറിനെ ആശ്രയിച്ചിരിക്കും. ഓഡിയോ പ്ലേ ചെയ്യുമ്പോൾ
Invalid sample rateപിശക് ലഭിച്ചാൽ മറ്റൊരു മൂല്യമാക്കി മാറ്റുക. പിന്തുണയുള്ള മൂല്യങ്ങളുടെ പട്ടിക Microsoft ഡോക്സ്-യിലെ Text to speech REST API രേഖാമൂല്യത്തിൽ കാണാം. നിങ്ങൾക്ക്riffഫോർമാറ്റ് ഓഡിയോ വേണ്ടിവരും, ഉപയോഗിക്കേണ്ട മൂല്യങ്ങൾriff-16khz-16bit-mono-pcm,riff-24khz-16bit-mono-pcm,riff-48khz-16bit-mono-pcmഎന്നിവയാണ്. -
ഇതിന് താഴെ,
get_speechഎന്ന പ്രവർത്തനം പ്രഖ്യാപിക്കുക, ഇത് സംസാര സേവന REST API ഉപയോഗിച്ച് വാചകത്തിനെ സംസാരത്തിലേക്ക് മാറ്റും:def get_speech(text): -
get_speechപ്രവർത്തനത്തിൽ, വിളിക്കേണ്ട URL-യും അയയ്ക്കേണ്ട ഹെഡറുകളും നിർവചിക്കുക:url = f'https://{location}.tts.speech.microsoft.com/cognitiveservices/v1' headers = { 'Authorization': 'Bearer ' + get_access_token(), 'Content-Type': 'application/ssml+xml', 'X-Microsoft-OutputFormat': playback_format }ഇത് തലക്കെട്ടുകൾ സജ്ജമാക്കുന്നു, ജനറേറ്റഡ് ആക്സസ് ടോക്കൺ ഉപയോഗിക്കുന്നു, ഉള്ളടക്കം SSML-ആണെന്ന് തീരുവുന്നു, ആവശ്യമായ ഓഡിയോ ഫോർമാറ്റും നിർവചിക്കുന്നു.
-
ഇതിന് താഴെ, REST API-യിലേക്ക് അയക്കാനുള്ള SSML നിർവചിക്കുക:
ssml = f'<speak version=\'1.0\' xml:lang=\'{language}\'>' ssml += f'<voice xml:lang=\'{language}\' name=\'{voice}\'>' ssml += text ssml += '</voice>' ssml += '</speak>'ഈ SSML ഭാഷയും ഉപയോഗിക്കുന്ന ശബ്ദവും നിർവചിക്കുകയും, മാറ്റേണ്ട വാചകം സജ്ജമാക്കുകയും ചെയ്യുന്നു.
-
അവസാനം, ഈ പ്രവർത്തനത്തിൽ REST അഭ്യർത്ഥന നടത്തുകയും ബൈനറി ഓഡിയോ ഡാറ്റ തിരിച്ച് നൽകുകയും ചെയ്യുന്ന കോഡ് ചേർക്കുക:
response = requests.post(url, headers=headers, data=ssml.encode('utf-8')) return io.BytesIO(response.content)
ജോലികൾ - ഓഡിയോ പ്ലേ ചെയ്യുക
-
get_speechപ്രവർത്തനത്തിനുശേഷം, REST API വിളിയിലൂടെ ലഭിച്ച ഓഡിയോ പ്ലേ ചെയ്യാനുള്ള പുതിയ പ്രവർത്തനം നിർവചിക്കുക:def play_speech(speech): -
ഈ പ്രവർത്തനത്തിലേക്ക് ലഭിക്കുന്ന
speechബൈനറി ഓഡിയോ ഡാറ്റയാണ്. ഇത് ഒരു വെയ്വ് ഫയലായി തുറന്ന് PyAudio ഉപയോഗിച്ച് ഓഡിയോ പ്ലേ ചെയ്യാനായി താഴെ കൊടുത്തിരിക്കുന്ന കോഡ് ഉപയോഗിക്കുക:def play_speech(speech): with wave.open(speech, 'rb') as wave_file: stream = audio.open(format=audio.get_format_from_width(wave_file.getsampwidth()), channels=wave_file.getnchannels(), rate=wave_file.getframerate(), output_device_index=speaker_card_number, output=True) data = wave_file.readframes(4096) while len(data) > 0: stream.write(data) data = wave_file.readframes(4096) stream.stop_stream() stream.close()ഈ കോഡ് PyAudio സ്ട്രീം ഉപയോഗിക്കുന്നു, ഓഡിയോ പിടിക്കുന്നതുപോലെ തന്നെ. വ്യത്യാസം സ്ട്രീം output ആയി സജ്ജമാക്കുകയും, ഓഡിയോ ഡാറ്റയിൽ നിന്ന് ഡാറ്റ വായിച്ച് സ്ട്രീമിലേക്ക് പുഷ് ചെയ്യുകയും ചെയ്യുകയാണ്.
സ്ട്രീം വിശദാംശങ്ങൾ ഹാർഡ് കോഡ് ചെയ്യാതെ അതു ഓഡിയോ ഡാറ്റയിൽനിന്ന് വായിക്കുന്നു.
-
sayപ്രവർത്തനത്തിന്റെ ഉള്ളടക്കം താഴെ നൽകിയതുപോലെ മാറ്റുക:speech = get_speech(text) play_speech(speech)ഈ കോഡ് വാചകത്തിനെ ബൈനറി ഓഡിയോ ഡാറ്റയാക്കി മാറ്റുകയും, ഓഡിയോ പ്ലേ ചെയ്യുകയും ചെയ്യുന്നു.
-
ആപ്പ് റൺ ചെയ്തു, ഫംഗ്ഷൻ ആപ്പ് കൂടി ഓടുന്നുണ്ടെന്ന് ഉറപ്പാക്കുക. ടൈമറുകൾ സജ്ജമാക്കൂ, നിങ്ങൾക്ക് ടൈമർ സജ്ജീകരിച്ചതായി വാചിക പ്രതികരണം കേൾക്കാനും ടൈമർ പൂർത്തിയായപ്പോൾ മറ്റൊരു വാചിക പ്രതികരണവും കേൾക്കാനും കഴിയും.
Invalid sample rateപിശക് ലഭിച്ചാൽ, മുകളിലുള്ള രീതിയിൽplayback_formatമാറ്റുക.
💁 ഈ കോഡ് code-spoken-response/pi ഫോളഡറിൽ ലഭ്യമാണ്.
😀 നിങ്ങളുടെ ടൈമർ പ്രോഗ്രാം വിജയകരമായി പൂർത്തിയായി!
വിവരം:
ഈ രേഖ AI പരിഭാഷ സേവനം Co-op Translator ഉപയോഗിച്ച് പരിഭാഷ ചെയ്തതായാണ് സൂചിപ്പിക്കുന്നത്. ഞങ്ങൾ കൃത്യതയ്ക്കായി പരിശ്രമിക്കുന്നുവെങ്കിലും, യന്ത്രം ചെയ്ത പരിഭാഷകളിൽ പിശകുകൾ കൾ അല്ലെങ്കിൽ അശുദ്ധതകൾ ഉണ്ടായേക്കാമെന്ന് ദയവായി ശ്രദ്ധിക്കുക. സൂക്ഷ്മമായ വിവരങ്ങൾ ആവശ്യമായാൽ, ഒടുവിലാണ് പ്രൊഫഷണൽ മാനവ പരിഭാഷ ശുപാർശ ചെയ്യുന്നത്. ഈ പരിഭാഷ ഉപയോഗിച്ചുണ്ടാകാവുന്ന തെറ്റ് മനസ്സിലാക്കലുകളോ തെറ്റിദ്ധാരണകളോ സംബന്ധിച്ച് ഞങ്ങൾ ഉത്തരവാദിത്വം ഏറ്റെടുക്കുന്നില്ല.