You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/ml/6-consumer/lessons/1-speech-recognition/README.md

42 KiB

ഒരു ഐഒടി ഡിവൈസിലൂടെ ഭാഷ പരിചയപ്പെടുത്തുക

ഈ പാഠത്തിന് ഒരു സ്കെച്‌നോട്ട് അവലോകനം

സ്കെച്‌നോട്ട് Nitya Narasimhan യിൽ നിന്നുള്ളതാണ്. വലിയ പതിപ്പിനായി ചിത്രം ക്ലിക്ക് ചെയ്യുക.

ആഴുറി സ്പീച്ച് സർവീസിന്റെ അവലോകനം നൽകുന്ന ഈ വീഡിയൊ, ഈ പാഠത്തിൽ ഉൾപ്പെടുന്ന വിഷയം ആണ്:

Microsoft Azure YouTube ചാനലിൽ നിന്നുള്ള നിങ്ങളുടെ Cognitive Services Speech സ്രോതസ്സുപയോഗിച്ച് ആരംഭിക്കുന്ന വിധം

🎥 വീഡിയോ കാണാൻ മുകളിൽ ചിത്രം ക്ലിക്ക് ചെയ്യുക

പ്രീ-ലെക്ചർ ക്വിസ്

പ്രീ-ലെക്ചർ ക്വിസ്

അവതരണം

'ആലക്‌സ, 12 മിനിറ്റ് ടൈമർ സജ്ജീകരിക്കുക'

'ആലക്‌സ, ടൈമർ നില'

'ആലക്‌സ, steam broccoli എന്ന 8 മിനിറ്റ് ടൈമർ സജ്ജീകരിക്കുക'

സ്മാർട്ട് ഉപകരണം കൂടുതൽ വ്യാപകമായി ഉണ്ടാകുകയാണ്. ഹോംപോഡുകൾ, ഇക്കോസ്, ഗൂഗിൾ ഹോംസുകൾ പോലുള്ള സ്മാർട്ട് സ്പീക്കറുകളായി മാത്രമല്ല, മാബൈലുകൾ, വാച്ചുകൾ, ലൈറ്റ് ഫിറ്റിങ്സ്, താംപറ്ചർസ്റ്റാറ്റുകൾ എന്നിവയിലുമാണ് ഇവ പതിച്ചിരുന്നു.

💁 എനിക്ക് കുറഞ്ഞത് 19 ഉപകരണങ്ങളിൽ വോയ്സ് അസിസ്റ്റന്റുകൾ ഉണ്ട്, അതും എനിക്ക് അറിയാവുന്നവ മാത്രം!

വോയിസ് കൺട്രോൾ പരിമിതമായ ചലന ശേഷിയുള്ളവർക്കും ഉപകരണം ഉപയോഗിക്കാൻ സഹായം നൽകുന്നു. കൈകളില്ലാതെജനിച്ചവർക്കാവട്ടെ, തകർന്ന കൈകൾ ഉള്ളവർക്കാവട്ടെ, ഒപ്പം കൈകൾ തിരക്കുള്ള ഷോപ്പിംഗ് അല്ലെങ്കിൽ കുഞ്ഞുങ്ങൾ കൈകൊണ്ടുമുള്ളവർക്കുവേണം, നമ്മുടെ ശബ്ദത്തിലൂടെ വീട്ടിൽ കൺട്രോൾ ചെയ്യാനാകുന്നത് വലിയ സഹായമാണ്. ഒരു കുഞ്ഞു തിരുത്തലും അനിയന്ത്രിത ബാല്യക്കാരനുമായിരിക്കുമ്പോൾ 'ഹേ സിരി, എന്റെ ഗാരേജ് വാതിൽ അടയ്ക്കൂ' എന്ന് വിളിക്കുക ജീവിതത്തിലെ ചെറിയ പക്ഷേ ഫലപ്രദമായ പുരോഗതിയാണ്.

വോയ്സ് അസിസ്റ്റന്റുകൾ പ്രധാനമായി ഉപയോഗിക്കപ്പെടുന്നത് ടൈമറുകൾ സജ്ജീകരിക്കാൻ ആണ്. കിച്ചൺ ടൈമറുകൾയെ പിന്തുടർന്ന് നിങ്ങളുടെ വോയിസ് ഉപയോഗിച്ച് ബഹുഭവാഷകളിൽ ടൈമർ സജ്ജീകരിക്കാൻ കഴിയുന്ന ഒരു സ്മാർട്ട് കിച്ചൺ ടൈമർ നിങ്ങൾ ഈ പ്രോജക്റ്റിൽ നിർമ്മിക്കും.

ഈ പാഠത്തിൽ ഉൾപ്പെടുന്നത്:

മൈക്രോഫോണുകൾ

മൈക്രോഫോണുകൾ ശബ്ദ തരംഗങ്ങളെ വൈദ്യുതി സിഗ്നലുകളായി മാറ്റുന്ന അനലോഗ് സെൻസറുകളാണ്. വായുവിലെ വൈബ്രേഷൻ മൂലം മൈക്രോഫോൺ ഘടകങ്ങൾ ചെറിയ വീതി നീക്കം ചെയ്യും, ഇത് വൈദ്യുതി സിഗ്നലിൽ ചെറിയ മാറ്റങ്ങൾ സൃഷ്ടിക്കുന്നു. ഈ മാറ്റങ്ങൾ ഉയർത്തി വൈദ്യുതി ഔട്ട്‌പുട്ട് സൃഷ്ടിക്കുന്നു.

മൈക്രോഫോൺ തരം

വിവിധ തരത്തിലുള്ള മൈക്രോഫോണുകൾ ലബ്ധ്യമുണ്ട്:

  • ഡൈനാമിക് - ഡൈനാമിക് മൈക്രോഫോണുകളിൽ ഒരു ചലിക്കുന്ന ഡയഫ്രാഗം നിലനിൽക്കുന്ന വയറിനുള്ളിൽ മാഗ്നറ്റിനു ചേർന്നിരിക്കുന്നു. ഇത് വൈദ്യുതചര动力 സൃഷ്ടിക്കുന്നു. ഇത് സാധാരണ സ്മാർത്ഥസ്പീക്കറുകളുടെ പകർപ്പു വിപരീതം ആണ്. ഇതുവഴി സ്പീക്കറുകൾ ഡൈനാമിക് മൈക്രോഫോണുകളായി ഉപയോഗിക്കാനാകും. ഇന്റർകോം പോലുള്ള ഉപകരണങ്ങളിൽ ഉപയോക്താവ് കേൾക്കുകയോ സംസാരിക്കുകയോ മാത്രം ചെയ്യുമ്പോൾ, ഒരു ഉപകരണമുണ്ടാവുന്നത് സ്പീക്കറും മൈക്രോഫോണും ആയി പ്രവർത്തിക്കും.

    ഡൈനാമിക് മൈക്രോഫോണുകൾ പ്രവർത്തിക്കാൻ പവറിൽ ആശ്രയിക്കുന്നില്ല, വൈദ്യുതി സിഗ്നൽ മുഴുവൻ മൈക്രോഫോണിൽ നിന്നാണ് സൃഷ്ടിക്കുന്നത്.

    പത്തി സ്മിത്ത് ഒരു Shure SM58 (ഡൈനാമിക് കാർഡിയോഡ് തരം) മൈക്രോഫോൺ വഴി പാടുന്നു

  • റിബൺ - റിബൺ മൈക്രോഫോണുകൾ ഡൈനാമിക് മൈക്രോഫോണുകളും പോലെയാണ്, പക്ഷേ ഡയഫ്രാഗത്തിൻ പകരം ഒരു ലോഹ റിബൺ ഉണ്ട്. ഈ റിബൺ ഒരു മാഗ്നറ്റിക് ഫീൽഡിൽ ചലിക്കുന്നു, വൈദ്യുതി സിഗ്നൽ സൃഷ്ടിക്കുന്നു. ഡൈനാമിക് മൈക്രോഫോണുകളുപോലെ റിബൺ മൈക്രോഫോണുകളും പ്രവർത്തിക്കാൻ പവർ ആവശ്യമില്ല.

    എഡ്മണ്ട് ലോവ്, അമേരിക്കൻ നടൻ, 1942-ൽ റേഡിയോ മൈക്രോഫോണിന്റെ മുന്നിൽ നിൽക്കുന്നു

  • കണ്ടൻസർ - കണ്ടൻസർ മൈക്രോഫോണുകൾക്ക് ഒരു സാന്ദ്രമായ ലോഹ ഡയഫ്രാഗം ഉണ്ട്, ഫിക്‌സ് ചെയ്ത ലോഹ ബാക്ക് പ്ലേറ്റ് ഉം ഉണ്ട്. വൈദ്യുതി ഈ രണ്ട് ഭാഗങ്ങൾക്കും നൽകുന്നു, ഡയഫ്രാഗം വൈബ്രേറ്റ് ചെയ്യുമ്പോൾ താപ ഫീൽഡിലെ സ്റ്റാറ്റിക് ചാർജ് മാറ്റമുണ്ടാകുന്നു, അത് സിഗ്നൽ സൃഷ്ടിക്കുന്നു. കണ്ടൻസർ മൈക്രോഫോണുകൾ പ്രവർത്തിക്കാൻ പവർ ആവശ്യമാണ് - ഇത് ഫാൻട്ടം പവർ എന്നാണ് വിളിക്കുന്നത്.

    AKG Acoustics C451B ചെറിയ-ഡയഫ്രാഗം കണ്ടൻസർ മൈക്രോഫോൺ

  • MEMS - മൈക്രോഇലക്ട്രോമെക്കാനിക്കൽ സിസ്റ്റം മൈക്രോഫോണുകൾ, അല്ലെങ്കിൽ MEMS, കംപ്യൂട്ടർ ചിപ്പിൽ ചെറുകിട മൈക്രോഫോണുകളാണ്. സിലിക്കൺ ചിപ്പിൽ പ്രഷർ സെൻസിറ്റീവ് ഡയഫ്രാഗം ഉണ്ടാക്കിയിരിക്കുന്നു. ഈ മൈക്രോഫോണുകൾ ചെറിയവയാണ്, സർക്യൂട്ടറിയിലേക്കും ഉൾപ്പെടുത്തിയിരിക്കുന്നു.

    സർകിട്ട് ബോർഡിൽ ഒരു MEMS മൈക്രോഫോൺ

    മുകളിൽ ചിത്രത്തിൽ LEFT എന്ന് ലേബൽ ചെയ്യപ്പെട്ട ചിപ്പ് ഒരു MEMS മൈക്രോഫോൺ ആണ്, അതിന്റെ ഡയഫ്രാഗം ഒരു മില്ലിമീറിന് താഴെയാണ്.

ശോധന ചെയ്യുക: നിങ്ങളുടെ ഒരുവടിക്കടുത്തുള്ള മൈക്രോഫോണുകൾ ഏതാണ്? നിങ്ങളുടെ കമ്പ്യൂട്ടറിൽ, ഫോണിൽ, ഹെഡ്സറ്റിൽ അല്ലെങ്കിൽ മറ്റ് ഉപകരണങ്ങളിൽ. അവയെന്തിന് എന്ത് തരത്തിലുള്ള മൈക്രോഫോണുകളാണെന്ന് കണ്ടെത്തുക.

ഡിജിറ്റൽ ഓഡിയോ

ഓഡിയോ ഒരു അനലോഗ് സിഗ്നലാണ്, വളരെ നിശ്ചിത വിവരങ്ങൾ നൽകുന്നു. ഈ സിഗ്നലിനെ ഡിജിറ്റലിലേക്ക് മാറ്റാൻ, ഓഡിയോ ഒരു സെക്കൻഡിൽ ആയിരക്കണക്കിന് തവണ ശാംപിള്‍ ചെയ്യണം.

🎓 ശാംപ്ലിംഗ് എന്നത് ആ സമയത്ത് സിഗ്നലിന്റെ മൂല്യം ഡിജിറ്റൽ വേരിയബിളായി മാറ്റുകയാണ്.

ഏതാനും ഫിക്സാം ചെയ്ത ഇടവേളകളിൽ ഉള്ള ഒരു സിഗ്നലിന്റെ ലൈൻ ചാർട്ട്

ഡിജിറ്റൽ ഓഡിയോ പൾസ് കോഡ് മാഡൂൾ (PCM) ഉപയോഗിച്ച് നിറവേറ്റുന്നു. PCM സിഗ്നലിന്റെ വോൾട്ടേജ് വായിക്കുകയും അവയ്ക്ക് ഏറ്റവും അടുത്ത ഡിജിറ്റൽ മൂല്യം കണ്ടെത്തുകയുമാണ്.

💁 PCM, പൾസ് വിത്ത് മാഡൂൾ (PWM) പോലെയാണ്, പക്ഷേ PCM അനലോഗ് സിഗ്നലിനെ ഡിജിറ്റലാക്കി മാറ്റാൻ ഉപയോഗിക്കുന്നു, PWM ഡിജിറ്റൽ സിഗ്നൽ അനലോഗാക്കി മാറ്റാൻ ഉപയോഗിക്കുന്നു.

ഉദാഹരണം: മ്യൂസിക് സ്‌ട്രിമിംഗ് സേവനങ്ങൾ സാധാരണയായി 16-ബിറ്റ് അല്ലെങ്കിൽ 24-ബിറ്റ് ഓഡിയോ നൽകുന്നു. അതായത് വോൾട്ടേജിനെ 16-ബിറ്റ് അല്ലെങ്കിൽ 24-ബിറ്റ് പൂർണ്ണസംഖ്യയിലേക്ക് കൺവേർട്ട് ചെയ്യുന്നു. 16-ബിറ്റ് ഓഡിയോ -32,768 മുതൽ 32,767 വരെ നമ്പറുകളിൽ പെടുന്നു, 24-ബിറ്റ് 8,388,608 മുതൽ 8,388,607 വരെ. ബിറ്റുകളുടെ എണ്ണം കൂടുതലായാൽ ശബ്ദം കൂടുതലായി യഥാർത്ഥ ശബ്ദത്തോട് അടുത്താകും.

💁 8-ബിറ്റ് ഓഡിയോയെ ചിലപ്പോൾ LoFi എന്ന് വിളിക്കുന്നു. ഇത് 8-ബിറ്റ് മാത്രമാണ് ഉള്ളത്, -128 മുതൽ 127 വരെ. ആദ്യകാല കമ്പ്യൂട്ടർ ഓഡിയോ 8-ബിറ്റിൽ മാത്രം പരിമിതമായിരുന്നുവെന്നത് കാരണം റെട്രോ ഗെയിമിംഗ് എന്നിവയിൽ ഇതിനെ കാണാൻ സാധിക്കും.

ശാംപിളുകൾ ഓരോ സെക്കന്റിലും ആയിരക്കണക്കിനു തവണ എടുത്തിരിക്കുന്നു, മതി കൃത്യമായി നിർവ്വചിച്ച സാംപിലുള്ള നിരക്കുകൾക്കനുസരിച്ച് (kHz). മ്യൂസിക് സ്‌ട്രിമിംഗ് സേവനങ്ങൾ സാധാരണയായി 48KHz സാംപിള്‍ നിരക്ക് ഉപയോഗിക്കുന്നു, പക്ഷേ ചില ലോസ്‌ലെസ് ഓഡിയോ 96KHz അല്ലെങ്കിൽ 192KHz വരെ ഉപയോഗിക്കുന്നു. സാംപിള്‍ നിരക്ക് കൂടുമ്പോൾ ഓഡിയോ യഥാർത്ഥ ശബ്ദത്തോട് കൂടി അടുത്ത് വരും. 48KHz-ൽ മുകളിൽ മനുഷ്യർക്ക് വ്യത്യാസം കേൾക്കാനാകുന്നോ എന്നതിൽ ചർച്ചകളുണ്ട്.

അന്വേഷിക്കുക: നിങ്ങൾ ഉപയോഗിക്കുന്ന സ്ട്രീമിംഗ് മ്യൂസിക് സേവനം സാംപിള്‍ നിരക്കും സൈസും എത്രയാണ്? CD ഉപയോഗിക്കുന്നുവെങ്കിൽ, CD ഓഡിയോയുടെ സാംപിള്‍ നിരക്കും സൈസും എന്താണ്?

കൂടുതൽ ഓഡിയോ ഫോർമാറ്റുകള്‍ ഉണ്ട്. mp3 ഫയലുകളെ നിങ്ങൾ കേട്ടിട്ടുണ്ടാകും - ഇത് കംപ്രസു ചെയ്ത ഓഡിയോ, വലുപ്പം കുറക്കാൻ വേണ്ടി എന്നാൽ ഗുണനിലവാരത്തിൽ നഷ്ടം ഉണ്ടായിട്ടില്ല. കംപ്രസു ചെയ്തിട്ടില്ലാത്ത ഓഡിയോ സാധാരണയായി WAV ഫയൽ ആയി സൂക്ഷിക്കുന്നു ഇതിൽ 44 ബൈറ്റ് ഹെഡർ വിവരങ്ങളും ശേഷം കച്ചവടമായ ഓഡിയോ ഡാറ്റയും ഉണ്ട്. ഹെഡറിൽ സാംപിള്‍ നിരക്ക് (ഉദാ: 16000 എന്നാണ് 16KHz), സാമ്പിള്‍ സൈസ് (16 ബിറ്റ്), ചാനലുകളുടെ എണ്ണം എന്നിവ ഉൾപ്പെടുന്നു. ഹെഡറിനു ശേഷം RAW ഓഡിയോ ഡാറ്റ WAV ഫയലിൽ ഉണ്ടാകുന്നു.

🎓 ചാനൽ എന്നു പറയുന്നത് എത്ര വ്യത്യസ്ത ഓഡിയോ സ്ട്രീമുണ്ട് എന്നതാണ്. ഉദാഹരണത്തിന്, ലെഫ്റ്റ്, റൈറ്റ് ഉള്ള സ്റ്റെറിയോയ്ക്ക് 2 ചാനലുകൾ ഉണ്ടാകും. 7.1 സറൗണ്ട് സിസ്റ്റത്തിന് 8 ചാനലുകൾ ഉണ്ടാകും.

ഓഡിയോ ഡാറ്റാ വലുപ്പം

ഓഡിയോ ഡാറ്റ വളരെ വലുതാണ്. 16KHz-ൽ 16-ബിറ്റ് കംപ്രസു ചെയ്യാത്ത ഓഡിയോ ഒരു സെക്കന്റിന് 32KB ഡാറ്റ എടുക്കും (സ്പീച്ച് ടുഡ് ടെക്സ്റ്റ് മോഡലിനായി നല്ല നിരക്കാണിത്):

  • 16-ബിറ്റ് എന്നത് ഓരോ സാമ്പിളിനും 2 ബൈറ്റ് ആണ് (1 ബൈറ്റ് 8 ബിറ്റാണ്).
  • 16KHz എന്നത് 16,000 സാമ്പിളുകൾ ആണ് ഒരു സെക്കന്റിന്.
  • 16,000 x 2 ബൈറ്റ് = 32,000 ബൈറ്റുകൾ ഒരു സെക്കന്റിന്.

ഇതാണ് ചെറിയ തോതുള്ള ഡാറ്റ പോലെ തോന്നുന്നത്, പക്ഷേ സ്മാൾ മെമ്മറി ഉള്ള മൈക്രോ കണ്ട്രോളറിൽ ഇത് വലിയ തോതാണ്. ഉദാഹരണത്തിന് Wio Terminal-ന് 192KB മെമ്മറി ഉണ്ട്, പ്രോഗ്രാം കോഡ്, വേരിയബിളുകൾ എന്നിവ ഇതിൽ ഉൾപ്പെടണം. കോഡ് വളരെ ചെറുതായിരുന്നാലും 5 സെക്കന്റിൽ കൂടുതൽ ഓഡിയോ ക്യാപ്ചർ ചെയ്യാൻ കഴിയില്ല.

മൈക്രോ കണ്ട്രോളറുകൾക്ക് സ്ട്രോറേജ് പരിധി വർദ്ധിക്കുന്നതിന് SD കാർഡുകൾ അല്ലെങ്കിൽ ഫ്ലാഷ് മെമ്മറി പോലുള്ള അധിക സംഭരണവും ആണ് സാധ്യം. ഓഡിയോ ക്യാപ്ചർ ചെയ്യുന്ന IoT ഉപകരണം നിർമിക്കുമ്പോൾ നിങ്ങൾക്കുണ്ടാവേണ്ടത്യ്ക്ക് കൂടുതൽ സംഭരണം മാത്രം മാത്രമല്ല, നിങ്ങളുടെ കോഡ് നിങ്ങൾക്കൊപ്പം മൈക്രോഫോണിൽ നിന്നുള്ള ഓഡിയോ നേരിട്ട് സംഭരണത്തിലേയ്ക്ക് എഴുതണം. ക്ലൗഡിൽ വിവരം അയയ്ക്കുമ്പോഴായി സംഭരണം മുതൽ ബ്രൗസർ വരെ ഓഡിയോ സ്ട്രീം ചെയ്യണം. ഇതുവഴി ഒരു ഘട്ടത്തിൽ മുഴുവൻ ഓഡിയോ മെമ്മറിയിൽ സൂക്ഷിച്ച് മുക്തമാകാനുള്ള പ്രശ്നം ഒഴിവാക്കാം.

നിങ്ങളുടെ ഐഒടി ഉപകരണത്തിൽ നിന്നും ഓഡിയോ പിടിക്കുക

നിങ്ങളുടെ IoT ഉപകരണത്തിൽ മൈക്രോഫോൺ കണക്റ്റ് ചെയ്ത് ഓഡിയോ പിടിക്കാമെന്നും, സ്പീക്കറുകൾകൂടി കണക്റ്റ് ചെയ്ത് ഓഡിയോ പുറത്തു നൽകാനാകുമെന്നും, പിന്നീട് പാഠങ്ങളിൽ ഇത് ഓഡിയോ ഫീഡ്ബാക്കിനായി ഉപയോഗിക്കും. എന്നാൽ മൈക്രോഫോൺ പരീക്ഷിക്കാൻ ഇപ്പോൾ തന്നെ സ്പീക്കറുകൾ ക്രമീകരിക്കുക നല്ലതാണ്.

ജോലി - നിങ്ങളുടെ മൈക്രോഫോൺ, സ്പീക്കർ ക്രമീകരിക്കുക

നിങ്ങളുടെ IoT ഉപകരണത്തിനായുള്ള കണക്കിലെടുത്ത ഗൈഡ് വഴി മൈക്രോഫോൺ, സ്പീക്കറുകൾ ക്രമീകരിക്കുക:

ജോലി - ഓഡിയോ പിടിക്കുക

നിങ്ങളുടെ IoT ഉപകരണത്തിൽ ഓഡിയോ പിടിക്കാൻ അനുയോജ്യമായ ഗൈഡ് അനുസരിക്കുക:

സ്പീച്ച് മുതൽ ടെക്സ്റ്റ് വരെ

സ്പീച്ച് ടു ടെക്സ്റ്റ് അല്ലെങ്കിൽ സ്പീച്ച് തിരിച്ചറിയൽ എന്നത് ഒരു ഓഡിയോ സിഗ്നലിൽ ഉള്ള വാക്കുകൾ ടെക്സ്റ്റായി മാറ്റാൻ AI ഉപയോഗിക്കുന്നു.

സ്പീച്ച് തിരിച്ചറിയൽ മോഡലുകൾ

സ്പീച്ചിനെ ടെക്സ്റ്റായി മാറ്റാൻ, ഓഡിയോ സിഗ്നലിലെ സാമ്പിളുകൾ കൂട്ടിച്ച്, പുനരവർത്തിത ന്യൂറൽ നെറ്റ്വർക്ക് (RNN) അടിസ്ഥാനമാക്കിയുള്ള മെഷീൻ ലേണിംഗ് മോഡലിൽ നൽകുന്നു. RNN പഴയ ഡാറ്റ സഹായത്തോടെ പുതിയ ഡാറ്റയെ പറ്റിയുള്ള തീരുമാനങ്ങൾ എടുക്കുന്നത് സാധ്യമാക്കുന്നു. ഉദാ: RNN ഒരു ബ്ലോക്ക് 'Hel' എന്ന് തിരിച്ചറിയുകയും മറ്റു ഒരു ബ്ലോക്ക് 'lo' എന്ന് തിരിച്ചറിയുകയും ചെയ്താൽ അവ ചേർത്ത് 'Hello' എന്ന് ശരിയായ വാക്കായി തിരഞ്ഞെടുക്കാം.

ML മോഡലുകൾ എല്ലായ്പ്പോഴും ഓരോ തവണയും ഒരേ വലുപ്പത്തിലുള്ള ഡാറ്റ സ്വീകരിക്കും. ഇമേജ് ക്ലാസിഫയർ പാഠത്തിൽ നിങ്ങൾ നിർമ്മിച്ച ചിത്രങ്ങൾ ഒരേ വലുപ്പത്തിലേക്ക് പുനർവ്യവസ്ഥപ്പെടുത്തി പ്രോസസ്സ് ചെയ്തിരുന്നു. സ്പീച്ച് മോഡലുകളും ഒരേ വലുപ്പത്തിലുള്ള ഓഡിയോ മുള്ളുകൾ പ്രോസസ്സ് ചെയ്യുന്നു. മോഡൽ പുറത്തിറക്കലുകൾ സംയോജിപ്പിച്ച് 'Hi'യും 'Highway'യും വേർതിരിക്കുക, 'flock'നും 'floccinaucinihilipilification'നും വ്യത്യാസം കാണിക്കണം.

സ്പീച്ച് മോഡലുകൾക്കും കൂടുതൽ മുന്നേറ്റം ലഭിച്ചിട്ടുണ്ട്: അവ_CONTEXT_ മനസിലാക്കുകയും കൂടുതലായി ശബ്ദങ്ങൾ പ്രോസസ്സ് ചെയ്തപ്പോൾ വാക്കുകൾ ശരിയാക്കുകയും ചെയ്യുന്നു. ഉദാ: "I went to the shops to get two bananas and an apple too" ഇപ്രകാരമുള്ള മൂന്ന് വാക്കുകൾ ("to", "two" "too") ശബ്ദത്തിൽ ഒരേപോലെയാണ് കേൾകുക, മോഡൽ പ്രസംഗത്തിന്റെ സാന്റർഭം മനസ്സിലാക്കി ശരിയായ വാക്ക് തിരഞ്ഞെടുക്കും.

💁 ചില സ്പീച്ച് സർവീസുകൾ ശബ്ദപ്രദേശങ്ങളായ ഫാക്ടറികളിലും വ്യവസായം-കേന്ദ്രമായ പദങ്ങളുമായി മെച്ചപ്പെടാൻ ക്രമീകരിക്കാനാകും. ഈ ക്രമീകരണങ്ങൾ ട്രാൻസ്ഫർ ലേണിങ്ങ് ഉപയോഗിച്ച് ട്രെയിൻ ചെയ്യപ്പെടുന്നു, ഇമേജ് ക്ലാസിഫയർ ആദ്യ പാഠത്തിൽ കുറച്ച് ചിത്രങ്ങൾ ഉപയോഗിച്ച് നിർദ്ദേശിച്ചതുപോലെ.

സ്വകാര്യത

ഉപഭോക്തൃ IoT ഉപകരണങ്ങളിൽ സ്പീച്ച് ടു ടെക്സ്റ്റ് ഉപയോഗിക്കുന്നത് വളരെ സ്വകാര്യതാമായിരുന്നു. ഈ ഉപകരണം തുടർച്ചയായി ഓഡിയോ കേൾക്കുന്നു, അതിനാൽ ഉപയോക്താവ് പറയുന്നതെല്ലാം ക്ലൗഡിനുള്ളിലേക്ക് അയച്ച് ടൈപ്പായി മാറുന്നതിൽ ആഗ്രഹം ഇല്ല. ഇത് ഇന്റർനെറ്റ് ബാൻഡ്വിഡ്ത്തിന്റെ വലിയ ഉപയോഗം മാത്രമല്ല, സ്വകാര്യതയ്ക്കും വലിയ പ്രതിസന്ധിയാണ്, പ്രത്യേകിച്ച് ചില സ്മാർട്ട് ഉപകരണ നിർമ്മാതാക്കളെ വെളിപ്പെടുത്തുന്നത് മനുഷ്യർ generated ടെക്സ്റ്റിനെ എതിര് വെച്ച് ശബ്ദം നിർണയിക്കാൻ ചില ഓഡിയോ ശേഖരിക്കുന്നു എന്നതാണ്. നിങ്ങൾക്ക് നിങ്ങളുടെ സ്മാർട്ട് ഉപകരണം നിങ്ങൾ അത് ഉപയോഗിക്കുമ്പോഴേക്കാൾ മാത്രമേ പ്രോസസ്സിംഗിനായി ഓഡിയോ ക്ലൗഡിലേക്ക് അയക്കാൻ ഇച്ചെയ്യൂ, നിങ്ങളുടെ വീട്ടിൽ കേൾക്കുന്ന ഓഡിയോ അല്ല, അത് സ്വകാര്യ യോഗങ്ങളെ പോലും ഉൾക്കൊള്ളാം അല്ലെങ്കിൽ അടുത്ത ബന്ധങ്ങളുടെ സംഭാഷണങ്ങളായിരിക്കാം. ഏറ്റവും അധികം സ്മാർട്ട് ഉപകരണങ്ങൾ പ്രവർത്തിക്കുന്നത് ഒരു വേക്ക് വാക്ക് ഉപയോഗിച്ച് ആണ്, "അലക്സ", "ഹേ സിരി", അല്ലെങ്കിൽ "ഓകെ ഗൂഗിൾ" പോലൊരു കീഫ്രേസ് ഉപകരണം 'മുകളിൽ' വരാൻ കാരണമാകുന്നു, അതിനുശേഷം ഉപകരണം നിർത്തുന്നതു വരെ നിങ്ങൾ പറയുന്നതിനെ കേൾക്കുന്നു, ഇത് നിങ്ങൾ ഉപകരണത്തോടു സംസാരിക്കുന്നത് പൂർത്തിയായതായി സൂചിപ്പിക്കുന്നു.

🎓 വേക്ക് വാക്ക് കണ്ടെത്തലിനെ കീവേഡ് സ്‌പോട്ടിംഗ് അല്ലെങ്കിൽ കീവേഡ് തിരിച്ചറിവ് എന്നും വിളിക്കുന്നു.

ഈ വേക്ക് വാക്കുകൾ ക്ലൗഡിൽ അല്ല, ഉപകരണത്തിൽ കണ്ടെത്തുന്നു. ഈ സ്മാർട്ട് ഉപകരണങ്ങളിൽ വേക്ക് വാക്ക് കേൾക്കുന്നതിനായി ചെറിയ AI മോഡലുകൾ അനുഭവത്തിലുണ്ട്, വേക്ക് വാക്ക് കണ്ടെത്തുമ്പോൾ, ഓഡിയോ തിരിച്ചറിയലിനായി ക്ലൗഡിലേക്ക് പ്രക്ഷേപണം തുടങ്ങുന്നു. ഈ മോഡലുകൾ വളരെ പ്രത്യേകവയാണ്, വെറും വേക്ക് വാക്ക് കേൾക്കുന്നതിനാണ് ഇവ.

💁 ചില ടെക്ക് കമ്പനികൾ അവരുടെ ഉപകരണങ്ങൾക്ക് കൂടുതൽ സ്വകാര്യത നൽകുകയും അഭിവാക്ക്ത്രസംവേദനം ഉപകരണത്തിലും ചെയ്യുകയും ചെയ്യുന്നു. ആപ്പിൾ 2021 iOS, macOS അപ്‌ഡേറ്റിന്റെ ഭാഗമായായി സ്പീച്ച്-ടു-ടെക്സ് പരിവർത്തനം ഉപകരണത്തിൽ ചെയ്യുമെന്ന് പ്രഖ്യാപിച്ചിരിക്കുന്നു, കൂടാതെ കൂടുതൽ അഭ്യർത്ഥനകൾക്ക് ക്ലൗഡിനെ ആശ്രയിക്കാതെ കൈകാര്യം ചെയ്യാൻ കഴിയുന്നതാണ്. ഉപകരണങ്ങളിലെ ശക്തമായ പ്രോസസ്സറുകൾ കൊണ്ട് ഇവക്ക് ML മോഡലുകൾ ഓടിക്കാൻ കഴിയും എന്നതാണ് ഈ പ്രശസ്തിയുടെ കാരണം.

ക്ലൗഡിലേക്ക് അയക്കുന്ന ഓഡിയോ സൂക്ഷിക്കുന്നതിന്റെ സ്വകാര്യതയും നൈതിക സാദ്ധ്യതകളും നിങ്ങൾ എങ്ങനെ കാണുന്നു? അതുവേണ്ടി ഓഡിയോ സൂക്ഷിക്കണോ, എങ്കിൽ എങ്ങനെ? നിയമ പ്രാവർത്തനത്തിന് ഓഡിയോ രേഖപ്പെടുത്തലുകളുടെ ഉപയോഗം സ്വകാര്യത നഷ്ടത്തിന്റെ ഒട്ടേറെകൾക്കു മികച്ച പ്രതിഫലം ആണോ?

വേക്ക് വാക്ക് കണ്ടെത്തൽ സാധാരണയായി TinyML എന്ന സാങ്കേതിക വിദ്യ ഉപയോഗിക്കുന്നു, അത് ML മോഡലുകൾ മൈക്രോഡ്രൈവർസുകളിൽ ഓടാൻ രൂപപ്പെടുത്തുക എന്നതാണ്. ഈ മോഡലുകളുടെ വലിപ്പം ചെറിയതാണ്, ഓടുന്നതിനുള്ള വൈദ്യുതി ഉപയോഗം വളരെ കുറഞ്ഞതാണ്.

വേക്ക് വാക്ക് മോഡൽ പരിശീലിപ്പിക്കാനും ഉപയോഗിക്കാനുമായുള്ളസങ്കീർണ്ണത ഒഴിവാക്കാൻ, ഈ പാഠത്തിൽ നിങ്ങൾ നിർമ്മിക്കുന്ന സ്മാർട്ട് ടൈമർ സംസാര പരിചയപ്പെടലിന് ബട്ടൺ ഉപയോഗിക്കും.

💁 നിങ്ങൾ Wio Terminal അല്ലെങ്കിൽ Raspberry Pi ഓടുന്നതിന് വേക്ക് വാക്ക് കണ്ടെത്തൽ മോഡൽ സൃഷ്ടിക്കാൻ താൽപര്യമുണ്ടെങ്കിൽ, Edge Impulse ന്റെ നിങ്ങളുടെ ശബ്ദത്തിന് പ്രതികരിക്കുന്ന ട്യൂട്ടോറിയൽ നോക്കുക. നിങ്ങളുടെ കം퓨터 ഉപയോഗിച്ച് ഇത് പരീക്ഷിക്കാൻ Microsoft ഡോക്‌സിലുള്ള Custom Keyword ക്വിക്‌സ്റ്റാർട്ട് ഉപയോഗിച്ച് തുടങ്ങാം.

ആശയം - സ്പീച്ച് ടു ടെക്‌സ്‌റ്റ് പരിവർത്തനം

Speech services logo

മുമ്പത്തെ ഒരു പ്രോജക്ടിൽ ചിത്ര ക്‌ളാസിഫിക്കേഷനോടെയുള്ള പോലെ, സംസാരത്തെ ഓഡിയോ ഫൈൽ ആകാരം എടുത്ത് ടെക്‌സ്‌റ്റായി മാറ്റാൻ പ്രീ-ബിൽറ്റ് AI സേവനങ്ങൾ ഉണ്ട്. അവയിൽ ഒന്നാണ് സ്പീച്ച് സർവീസ്, കോഗ്മിറ്റീവ് സർവീസിന്റെ ഭാഗമായുള്ള, നിങ്ങളുടെ ആപ്ലിക്കേഷനുകളിൽ ഉപയോഗിക്കാവുന്ന പ്രീ-ബിൽറ്റ് AI സേവനങ്ങൾ.

ടാസ്‌ക്ക് - സ്പീച്ച് AI റിസോഴ്സ് കോൺഫിഗർ ചെയ്യുക

  1. ഈ പ്രോജക്ടിനായുള്ള ഒരു റിസോഴ്‌സ് ഗ്രൂപ്പായി smart-timer സൃഷ്ടിക്കുക

  2. ഈ കമാൻഡ് ഉപയോഗിച്ച് ഒരു ഫ്രീ സ്പീച്ച് റിസോഴ്സ് സൃഷ്ടിക്കുക:

    az cognitiveservices account create --name smart-timer \
                                        --resource-group smart-timer \
                                        --kind SpeechServices \
                                        --sku F0 \
                                        --yes \
                                        --location <location>
    

    റിസോഴ്‌സ് ഗ്രൂപ്പ് സൃഷ്ടിക്കുമ്പോൾ ഉപയോഗിച്ച <location> പകരുക.

  3. നിങ്ങളുടെ കോഡിൽ നിന്നുള്ള സ്പീച്ച് റിസോഴ്സിലേക്ക് ആക്സസ് നേടാൻ ഒരു API കീ ആവശ്യമുണ്ട്. കീ ലഭിക്കാൻ താഴെയുള്ള കമാൻഡ് ഓടിക്കുക:

    az cognitiveservices account keys list --name smart-timer \
                                           --resource-group smart-timer \
                                           --output table
    

    കീകളിൽ ഒരുത്തിന്റെ കോപ്പി എടുക്കുക.

ടാസ്‌ക് - സ്പീച്ച് ടെക്സ്റ്റായി പരിവർത്തനം ചെയ്യുക

നിങ്ങളുടെ IoT ഉപകരണത്തിൽ സ്പീച്ച് ടെക്സ്റ്റായി മാറ്റാൻ ഈ ബന്ധപ്പെട്ട മാർഗ്ഗനിർദ്ദേശം ശ്രദ്ധിക്കുക:


🚀 ചലഞ്ച്

സ്പീച്ച് പരിചയപ്പെടുത്തൽ നിരവധി വർഷങ്ങളായുള്ളതാണ്, തുടർച്ചയായി മെച്ചപ്പെടുകയാണ്. നിലവിലെ കഴിവുകൾ зертിച്ച് സമയാനുസൃതമായി ഇവ എങ്ങനെ മാറിയിട്ടുള്ളൂ എന്ന് വെളിപ്പെടുത്തുക, എന്നാൽ യന്ത്രം നിർവചിക്കുന്ന ട്രാൻസ്ക്രിപ്റ്റുകളുടെ കൃത്യത മനുഷ്യരുടെ താരതമ്യത്തിൽ എത്രമാത്രമാണ് എന്നുള്ളത് ഉൾപ്പെടെ.

നിങ്ങളുടെ നോക്കിൽ സ്പീച്ച് പരിചയപ്പെടുത്തലിന്റെ ഭാവി എന്തെന്ത് ഭാവിക്കാം?

പാഠത്തിന് ശേഷം പരീക്ഷ

Post-lecture quiz

അവലോകനം & സ്വയം പഠനം

അസൈൻമെന്റ്


അസ്വീകരണം:
ഈ ഡോക്യുമെന്റ് AI വിവർത്തന സേവനം Co-op Translator ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, автомат ചെയ്ത വിവർത്തനങ്ങളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. ജന്മഭൂമിയിലെ അതിന്റെ സ്വതന്ത്ര ഭാഷയിലുള്ള യഥാർത്ഥ ഡോക്യുമെന്റ് പ്രമാണം പരിഗണിക്കേണ്ടതാണ്. പ്രധാന വിവരങ്ങൾക്കായി പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം നിർബന്ധമാണ്. ഈ വിവർത്തന ഉപയോഗത്തിന് ഉണ്ടായുള്ള ബോധവാന്മതതകളോ തെറ്റിദ്ധാരണകളോ ഉള്ളതിന് നാം ഉത്തരവാദികളല്ല.