You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/ml/6-consumer/lessons/1-speech-recognition/pi-speech-to-text.md

12 KiB

സംഭാഷണത്തിൽ നിന്ന് ലിപിവിവരണം - റാസ്ബെറി പൈ

പാഠത്തിന്റെ ഈ ഭാഗത്തിൽ, ക്യാഡ്ചർ ചെയ്‌തിരിക്കുന്ന ഓഡിയോയിലെ സംഭാഷണത്തെ ടെക്സ്റ്റിലാക്കി മാറ്റാൻ സ്പീച്ച് സർവീസ് ഉപയോഗിച്ച് കോഡ് എഴുതും.

ഓഡിയോ സ്പീച്ച് സർവീസിലേക്ക് അയയ്ക്കുക

ഓഡിയോ സ്പീച്ച് സർവീസിലേക്ക് REST API ഉപയോഗിച്ച് അയയ്ക്കാൻ കഴിയും. സ്പീച്ച് സർവീസ് ഉപയോഗിക്കാൻ, ആദ്യം ആക്സസ് ടോക്കൺ അഭ്യർത്ഥിക്കണം, തുടർന്ന് ആ ടോക്കൺ ഉപയോഗിച്ച് REST API ആക്സസ് ചെയ്യണം. ഈ ആക്സസ് ടോക്കണുകൾ 10 മിനിറ്റ് കഴിഞ്ഞ് കാലഹരണപ്പെടും, അതിനാൽ നിങ്ങളുടെ കോഡ് അവ സാധാരണയായി അഭ്യർത്ഥിച്ച് യഥാസമയം പുതുക്കാൻ ഉണ്ടാകണം.

###കാര്യ്യം - ആക്സസ് ടോക്കൺ നേടുക

  1. നിങ്ങളുടെ പൈയിൽ smart-timer പ്രോജക്റ്റ് തുറക്കുക.

  2. play_audio ഫങ്ഷൻ നീക്കം ചെയ്യുക. ഇനി ഇത് വേണ്ടില്ല, കാരണം നിങ്ങൾ പറഞ്ഞത് വീണ്ടും മടക്കി പറയേണ്ട smart timer ആഗ്രഹിക്കുന്നില്ല.

  3. app.py ഫയലിന്റെ മേൽഭാഗത്ത് താഴെ കാണുന്ന ഇമ്പോർട്ട് ചേർക്കുക:

    import requests
    
  4. while True ലൂപിന് മുമ്പ് താഴെ കൊടുത്തിരിക്കുന്ന കോഡ് ചേർക്കുക, സ്പീച്ച് സർവീസിന്റെ ചില സെറ്റിംഗുകൾ പ്രഖ്യാപിക്കാൻ:

    speech_api_key = '<key>'
    location = '<location>'
    language = '<language>'
    

    <key> എന്നത് നിങ്ങളുടെ സ്പീച്ച് സർവീസ് റിസോഴ്‌സ് എപി കീ ആയി മാറ്റുക. <location> എന്നത് നിങ്ങൾ സ്പീച്ച് സർവീസ് റിസോഴ്‌സ് സൃഷ്ടിച്ചതിന് ഉപയോഗിച്ച ലൊക്കേഷൻ ആയി മാറ്റുക.

    <language> എന്നത് നിങ്ങളുടെ സംസാര ഭാഷയുടെ ലോക്കേൽ നാമം ആയി മാറ്റുക, ഉദാഹരണത്തിന് ഇംഗ്ലീഷ് ആയെങ്കിൽ en-GB, കാൻറൺസീസ് ആയെങ്കിൽ zn-HK. മൈക്രോസോഫ്റ്റ് ഡോക്‌സിൽ ഭാഷകളും വോയ്സ് പിന്തുണയും ഉള്ള പട്ടികയിൽ നിങ്ങൾക്ക് സൗകര്യപ്രദമായി പ്രാപ്യമാക്കാം.

  5. ഇതിന് താഴെ, ആക്സസ് ടോക്കൺ നേടാനായി താഴെ കാണുന്ന ഫങ്ഷൻ ചേർക്കുക:

    def get_access_token():
        headers = {
            'Ocp-Apim-Subscription-Key': speech_api_key
        }
    
        token_endpoint = f'https://{location}.api.cognitive.microsoft.com/sts/v1.0/issuetoken'
        response = requests.post(token_endpoint, headers=headers)
        return str(response.text)
    

    ഇതൊരു ടോക്കൺ ഇറക്കിവയ്ക്കുന്ന എന്റ്പോയിന്റിൽ API കീ ഹെഡറായി ചേർത്ത് വിളിക്കുന്നു. ഇത് സ്പീച്ച് സർവീസുകൾ വിളിക്കാൻ ഉപയോഗിക്കുന്ന ആക്സസ് ടോക്കൺ നൽകും.

  6. ഇതിന് താഴെ, REST API ഉപയോഗിച്ച് ക്യാഡ്ചർ ചെയ്‌തിരിക്കുന്ന ഓഡിയോയിലെ സംഭാഷണം ടെക്സ്റ്റിലാക്കാൻ ഫങ്ഷൻ പ്രഖ്യാപിക്കുക:

    def convert_speech_to_text(buffer):
    
  7. ഈ ഫങ്ഷനിൽ, REST API URL, ഹെഡറുകൾ സജ്ജമാക്കുക:

    url = f'https://{location}.stt.speech.microsoft.com/speech/recognition/conversation/cognitiveservices/v1'
    
    headers = {
        'Authorization': 'Bearer ' + get_access_token(),
        'Content-Type': f'audio/wav; codecs=audio/pcm; samplerate={rate}',
        'Accept': 'application/json;text/xml'
    }
    
    params = {
        'language': language
    }
    

    സ്പീച്ച് സർവീസ് റിസോഴ്‌സിന്റെ ലൊക്കേഷൻ ഉപയോഗിച്ച് URL നിർമാണം ആണ് ഇത്. get_access_token ഫങ്ഷനിൽ നിന്നുള്ള ആക്സസ് ടോക്കൺ ഹെഡറുകളിൽ വിന്യസിക്കുന്നു, കൂടാതെ ഓഡിയോ ക്യാഡ്ചർ ചെയ്യാൻ ഉപയോഗിച്ച സാമ്പിൾ റേറ്റ് ചേർക്കുന്നു. അവസാനം URL-ൽ ഭാഷ സംബന്ധിച്ച പാരാമീറ്ററുകളും ആ വിസ്തൃതിയിലുള്ള നിർമ്മിതിയും നിർവചിക്കുന്നു.

  8. ഇതിന് താഴെ, REST API വിളിച്ച് ടെക്സ്റ്റ് ഏറ്റെടുക്കാൻ താഴെ കാണുന്ന കോഡ് ചേർക്കുക:

    response = requests.post(url, headers=headers, params=params, data=buffer)
    response_json = response.json()
    
    if response_json['RecognitionStatus'] == 'Success':
        return response_json['DisplayText']
    else:
        return ''
    

    അത് URL വിളിച്ച് മറുപടി JSON ഡികോഡ് ചെയ്യുന്നു. മറുപടി ഉള്ളിൽ RecognitionStatus മൂല്യം വെളിപ്പെടുത്തുന്നു കേൾപ്പുള്ള സംഭാഷണം വിജയകരമായി ടെക്സ്റ്റായി മാറ്റിയിട്ടുണ്ടോ എന്ന്. അത് Success ആണെങ്കിൽ ടെക്സ്റ്റ് ഫങ്ഷനിൽ നിന്നു മടങ്ങി കൊടുക്കുന്നു, അല്ലെങ്കിൽ ശൂന്യമാക്കുക.

  9. while True: ലൂപിനു മുകളിൽ, സ്പീച്ച് ടു ടെക്സ്റ്റ് സർവീസിൽ നിന്നുള്ള ടെക്സ്റ്റ് പ്രോസസ്സ് ചെയ്യാനുള്ള ഫങ്ഷൻ നിർവചിക്കുക. ഇപ്പോൾ ഇത് 텍스트 കണ്ട്രോൾ ചെയ്യാനായി മാത്രമേ ഉപയോഗിക്കൂ.

    def process_text(text):
        print(text)
    
  10. ചെറിയ while True ലൂപിൽ play_audio വിളിപ്പിക്കുന്നത് convert_speech_to_text ഫങ്ഷൻ വിളിച്ച് പരിസ്ഥിതി ടെക്സ്റ്റ് process_text ഫങ്ഷനിലേക്കു നൽകുന്നതിൽ മാറ്റുക:

    text = convert_speech_to_text(buffer)
    process_text(text)
    
  11. കോഡ് റൺ ചെയ്യുക. ബട്ടൺ അമർത്തി മൈക്രോഫോണിൽ സംസാരിക്കുക. അവസാനിപ്പിച്ചാൽ ബട്ടൺ വിട്ട് ഓഡിയോ ടെക്സ്റ്റിലേക്ക് മാറ്റി കണ്ട്രോൾക്ക് പ്രിന്റ് ചെയ്യും.

    pi@raspberrypi:~/smart-timer $ python3 app.py 
    Hello world.
    Welcome to IoT for beginners.
    

    വ്യത്യസ്ത തരത്തിലുള്ള വാക്യങ്ങൾ ഉപയോഗിച്ച് ശ്രമിക്കുക, ഒരേ പോലെയുള്ളരിയപ്പെട്ട വാക്കുകൾ വ്യത്യസ്ത അർത്ഥം ഉള്ള വാക്യങ്ങളിലും. ഉദാഹരണത്തിന്, ഇംഗ്ലീഷിൽ സംസാരിക്കുമ്പോൾ 'I want to buy two bananas and an apple too' എന്ന വാക്യം പറഞ്ഞു നോക്കുക, കൃത്യമായ 'to', 'two', 'too' ഉപയോഗത്തിലെ വ്യത്യാസം കേവലം ശബ്ദം പരിഗണിക്കാതെ വാക്കിന്റെ പശ്ചാത്തലത്തെ അടിസ്ഥാനമാക്കി എങ്ങനെ വേണെയുള്ളത് ഉപയോഗിക്കുന്നുവോ എന്ന് ശ്രദ്ധിക്കുക.

💁 ഈ കോഡ് code-speech-to-text/pi ഫോളഡറിൽ ലഭ്യമാണ്.

😀 നിങ്ങളുടെ സംഭാഷണത്തിൽ നിന്ന് ലിപിവിവരണ പ്രോഗ്രാം വിജയകരമായി ആക്രീ!


അറ്റംപറ്റുന്ന കാര്യങ്ങൾ:
ഈ പ്രമാണം AI വിവർത്തന സേവനമായ Co-op Translator ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി പരിശ്രമിച്ചെങ്കിലും, സ്വയംകൃതമായ വിവർത്തനങ്ങളിൽ പിഴവുകളും തെറ്റായ വിവരങ്ങളും ഉണ്ടാകാവുന്നതാണ്. പ്രാഥമിക ഭാഷയിൽ ഉള്ള മാതൃപ്രമാണം ഔദ്യോഗികമായ സ്രോതസായി പരിഗണിക്കണം. നിർണായകമായ വിവരങ്ങൾക്കായി വിദഗ്ധ മാനവ വിവർത്തനം നിർദ്ദേശിക്കുന്നു. ഈ വിവർത്തനത്തെ ആശ്രയിച്ചുവന്നുഉണ്ടാകാനുള്ള ഏതെന്ത് തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കും ഞങ്ങൾ ഉത്തരവാദിത്വമില്ല.