12 KiB
സംഭാഷണത്തിൽ നിന്ന് ലിപിവിവരണം - റാസ്ബെറി പൈ
പാഠത്തിന്റെ ഈ ഭാഗത്തിൽ, ക്യാഡ്ചർ ചെയ്തിരിക്കുന്ന ഓഡിയോയിലെ സംഭാഷണത്തെ ടെക്സ്റ്റിലാക്കി മാറ്റാൻ സ്പീച്ച് സർവീസ് ഉപയോഗിച്ച് കോഡ് എഴുതും.
ഓഡിയോ സ്പീച്ച് സർവീസിലേക്ക് അയയ്ക്കുക
ഓഡിയോ സ്പീച്ച് സർവീസിലേക്ക് REST API ഉപയോഗിച്ച് അയയ്ക്കാൻ കഴിയും. സ്പീച്ച് സർവീസ് ഉപയോഗിക്കാൻ, ആദ്യം ആക്സസ് ടോക്കൺ അഭ്യർത്ഥിക്കണം, തുടർന്ന് ആ ടോക്കൺ ഉപയോഗിച്ച് REST API ആക്സസ് ചെയ്യണം. ഈ ആക്സസ് ടോക്കണുകൾ 10 മിനിറ്റ് കഴിഞ്ഞ് കാലഹരണപ്പെടും, അതിനാൽ നിങ്ങളുടെ കോഡ് അവ സാധാരണയായി അഭ്യർത്ഥിച്ച് യഥാസമയം പുതുക്കാൻ ഉണ്ടാകണം.
###കാര്യ്യം - ആക്സസ് ടോക്കൺ നേടുക
-
നിങ്ങളുടെ പൈയിൽ
smart-timerപ്രോജക്റ്റ് തുറക്കുക. -
play_audioഫങ്ഷൻ നീക്കം ചെയ്യുക. ഇനി ഇത് വേണ്ടില്ല, കാരണം നിങ്ങൾ പറഞ്ഞത് വീണ്ടും മടക്കി പറയേണ്ട smart timer ആഗ്രഹിക്കുന്നില്ല. -
app.pyഫയലിന്റെ മേൽഭാഗത്ത് താഴെ കാണുന്ന ഇമ്പോർട്ട് ചേർക്കുക:import requests -
while Trueലൂപിന് മുമ്പ് താഴെ കൊടുത്തിരിക്കുന്ന കോഡ് ചേർക്കുക, സ്പീച്ച് സർവീസിന്റെ ചില സെറ്റിംഗുകൾ പ്രഖ്യാപിക്കാൻ:speech_api_key = '<key>' location = '<location>' language = '<language>'<key>എന്നത് നിങ്ങളുടെ സ്പീച്ച് സർവീസ് റിസോഴ്സ് എപി കീ ആയി മാറ്റുക.<location>എന്നത് നിങ്ങൾ സ്പീച്ച് സർവീസ് റിസോഴ്സ് സൃഷ്ടിച്ചതിന് ഉപയോഗിച്ച ലൊക്കേഷൻ ആയി മാറ്റുക.<language>എന്നത് നിങ്ങളുടെ സംസാര ഭാഷയുടെ ലോക്കേൽ നാമം ആയി മാറ്റുക, ഉദാഹരണത്തിന് ഇംഗ്ലീഷ് ആയെങ്കിൽen-GB, കാൻറൺസീസ് ആയെങ്കിൽzn-HK. മൈക്രോസോഫ്റ്റ് ഡോക്സിൽ ഭാഷകളും വോയ്സ് പിന്തുണയും ഉള്ള പട്ടികയിൽ നിങ്ങൾക്ക് സൗകര്യപ്രദമായി പ്രാപ്യമാക്കാം. -
ഇതിന് താഴെ, ആക്സസ് ടോക്കൺ നേടാനായി താഴെ കാണുന്ന ഫങ്ഷൻ ചേർക്കുക:
def get_access_token(): headers = { 'Ocp-Apim-Subscription-Key': speech_api_key } token_endpoint = f'https://{location}.api.cognitive.microsoft.com/sts/v1.0/issuetoken' response = requests.post(token_endpoint, headers=headers) return str(response.text)ഇതൊരു ടോക്കൺ ഇറക്കിവയ്ക്കുന്ന എന്റ്പോയിന്റിൽ API കീ ഹെഡറായി ചേർത്ത് വിളിക്കുന്നു. ഇത് സ്പീച്ച് സർവീസുകൾ വിളിക്കാൻ ഉപയോഗിക്കുന്ന ആക്സസ് ടോക്കൺ നൽകും.
-
ഇതിന് താഴെ, REST API ഉപയോഗിച്ച് ക്യാഡ്ചർ ചെയ്തിരിക്കുന്ന ഓഡിയോയിലെ സംഭാഷണം ടെക്സ്റ്റിലാക്കാൻ ഫങ്ഷൻ പ്രഖ്യാപിക്കുക:
def convert_speech_to_text(buffer): -
ഈ ഫങ്ഷനിൽ, REST API URL, ഹെഡറുകൾ സജ്ജമാക്കുക:
url = f'https://{location}.stt.speech.microsoft.com/speech/recognition/conversation/cognitiveservices/v1' headers = { 'Authorization': 'Bearer ' + get_access_token(), 'Content-Type': f'audio/wav; codecs=audio/pcm; samplerate={rate}', 'Accept': 'application/json;text/xml' } params = { 'language': language }സ്പീച്ച് സർവീസ് റിസോഴ്സിന്റെ ലൊക്കേഷൻ ഉപയോഗിച്ച് URL നിർമാണം ആണ് ഇത്.
get_access_tokenഫങ്ഷനിൽ നിന്നുള്ള ആക്സസ് ടോക്കൺ ഹെഡറുകളിൽ വിന്യസിക്കുന്നു, കൂടാതെ ഓഡിയോ ക്യാഡ്ചർ ചെയ്യാൻ ഉപയോഗിച്ച സാമ്പിൾ റേറ്റ് ചേർക്കുന്നു. അവസാനം URL-ൽ ഭാഷ സംബന്ധിച്ച പാരാമീറ്ററുകളും ആ വിസ്തൃതിയിലുള്ള നിർമ്മിതിയും നിർവചിക്കുന്നു. -
ഇതിന് താഴെ, REST API വിളിച്ച് ടെക്സ്റ്റ് ഏറ്റെടുക്കാൻ താഴെ കാണുന്ന കോഡ് ചേർക്കുക:
response = requests.post(url, headers=headers, params=params, data=buffer) response_json = response.json() if response_json['RecognitionStatus'] == 'Success': return response_json['DisplayText'] else: return ''അത് URL വിളിച്ച് മറുപടി JSON ഡികോഡ് ചെയ്യുന്നു. മറുപടി ഉള്ളിൽ
RecognitionStatusമൂല്യം വെളിപ്പെടുത്തുന്നു കേൾപ്പുള്ള സംഭാഷണം വിജയകരമായി ടെക്സ്റ്റായി മാറ്റിയിട്ടുണ്ടോ എന്ന്. അത്Successആണെങ്കിൽ ടെക്സ്റ്റ് ഫങ്ഷനിൽ നിന്നു മടങ്ങി കൊടുക്കുന്നു, അല്ലെങ്കിൽ ശൂന്യമാക്കുക. -
while True:ലൂപിനു മുകളിൽ, സ്പീച്ച് ടു ടെക്സ്റ്റ് സർവീസിൽ നിന്നുള്ള ടെക്സ്റ്റ് പ്രോസസ്സ് ചെയ്യാനുള്ള ഫങ്ഷൻ നിർവചിക്കുക. ഇപ്പോൾ ഇത് 텍스트 കണ്ട്രോൾ ചെയ്യാനായി മാത്രമേ ഉപയോഗിക്കൂ.def process_text(text): print(text) -
ചെറിയ
while Trueലൂപിൽplay_audioവിളിപ്പിക്കുന്നത്convert_speech_to_textഫങ്ഷൻ വിളിച്ച് പരിസ്ഥിതി ടെക്സ്റ്റ്process_textഫങ്ഷനിലേക്കു നൽകുന്നതിൽ മാറ്റുക:text = convert_speech_to_text(buffer) process_text(text) -
കോഡ് റൺ ചെയ്യുക. ബട്ടൺ അമർത്തി മൈക്രോഫോണിൽ സംസാരിക്കുക. അവസാനിപ്പിച്ചാൽ ബട്ടൺ വിട്ട് ഓഡിയോ ടെക്സ്റ്റിലേക്ക് മാറ്റി കണ്ട്രോൾക്ക് പ്രിന്റ് ചെയ്യും.
pi@raspberrypi:~/smart-timer $ python3 app.py Hello world. Welcome to IoT for beginners.വ്യത്യസ്ത തരത്തിലുള്ള വാക്യങ്ങൾ ഉപയോഗിച്ച് ശ്രമിക്കുക, ഒരേ പോലെയുള്ളരിയപ്പെട്ട വാക്കുകൾ വ്യത്യസ്ത അർത്ഥം ഉള്ള വാക്യങ്ങളിലും. ഉദാഹരണത്തിന്, ഇംഗ്ലീഷിൽ സംസാരിക്കുമ്പോൾ 'I want to buy two bananas and an apple too' എന്ന വാക്യം പറഞ്ഞു നോക്കുക, കൃത്യമായ 'to', 'two', 'too' ഉപയോഗത്തിലെ വ്യത്യാസം കേവലം ശബ്ദം പരിഗണിക്കാതെ വാക്കിന്റെ പശ്ചാത്തലത്തെ അടിസ്ഥാനമാക്കി എങ്ങനെ വേണെയുള്ളത് ഉപയോഗിക്കുന്നുവോ എന്ന് ശ്രദ്ധിക്കുക.
💁 ഈ കോഡ് code-speech-to-text/pi ഫോളഡറിൽ ലഭ്യമാണ്.
😀 നിങ്ങളുടെ സംഭാഷണത്തിൽ നിന്ന് ലിപിവിവരണ പ്രോഗ്രാം വിജയകരമായി ആക്രീ!
അറ്റംപറ്റുന്ന കാര്യങ്ങൾ:
ഈ പ്രമാണം AI വിവർത്തന സേവനമായ Co-op Translator ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി പരിശ്രമിച്ചെങ്കിലും, സ്വയംകൃതമായ വിവർത്തനങ്ങളിൽ പിഴവുകളും തെറ്റായ വിവരങ്ങളും ഉണ്ടാകാവുന്നതാണ്. പ്രാഥമിക ഭാഷയിൽ ഉള്ള മാതൃപ്രമാണം ഔദ്യോഗികമായ സ്രോതസായി പരിഗണിക്കണം. നിർണായകമായ വിവരങ്ങൾക്കായി വിദഗ്ധ മാനവ വിവർത്തനം നിർദ്ദേശിക്കുന്നു. ഈ വിവർത്തനത്തെ ആശ്രയിച്ചുവന്നുഉണ്ടാകാനുള്ള ഏതെന്ത് തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കും ഞങ്ങൾ ഉത്തരവാദിത്വമില്ല.