|
|
6 months ago | |
|---|---|---|
| .. | ||
| README.md | 6 months ago | |
| assignment.md | 6 months ago | |
| pi-audio.md | 6 months ago | |
| pi-microphone.md | 6 months ago | |
| pi-speech-to-text.md | 6 months ago | |
| virtual-device-audio.md | 6 months ago | |
| virtual-device-microphone.md | 6 months ago | |
| virtual-device-speech-to-text.md | 6 months ago | |
| wio-terminal-audio.md | 6 months ago | |
| wio-terminal-microphone.md | 6 months ago | |
| wio-terminal-speech-to-text.md | 6 months ago | |
README.md
ഒരു ഐഒടി ഡിവൈസിലൂടെ ഭാഷ പരിചയപ്പെടുത്തുക
സ്കെച്നോട്ട് Nitya Narasimhan യിൽ നിന്നുള്ളതാണ്. വലിയ പതിപ്പിനായി ചിത്രം ക്ലിക്ക് ചെയ്യുക.
ആഴുറി സ്പീച്ച് സർവീസിന്റെ അവലോകനം നൽകുന്ന ഈ വീഡിയൊ, ഈ പാഠത്തിൽ ഉൾപ്പെടുന്ന വിഷയം ആണ്:
🎥 വീഡിയോ കാണാൻ മുകളിൽ ചിത്രം ക്ലിക്ക് ചെയ്യുക
പ്രീ-ലെക്ചർ ക്വിസ്
അവതരണം
'ആലക്സ, 12 മിനിറ്റ് ടൈമർ സജ്ജീകരിക്കുക'
'ആലക്സ, ടൈമർ നില'
'ആലക്സ, steam broccoli എന്ന 8 മിനിറ്റ് ടൈമർ സജ്ജീകരിക്കുക'
സ്മാർട്ട് ഉപകരണം കൂടുതൽ വ്യാപകമായി ഉണ്ടാകുകയാണ്. ഹോംപോഡുകൾ, ഇക്കോസ്, ഗൂഗിൾ ഹോംസുകൾ പോലുള്ള സ്മാർട്ട് സ്പീക്കറുകളായി മാത്രമല്ല, മാബൈലുകൾ, വാച്ചുകൾ, ലൈറ്റ് ഫിറ്റിങ്സ്, താംപറ്ചർസ്റ്റാറ്റുകൾ എന്നിവയിലുമാണ് ഇവ പതിച്ചിരുന്നു.
💁 എനിക്ക് കുറഞ്ഞത് 19 ഉപകരണങ്ങളിൽ വോയ്സ് അസിസ്റ്റന്റുകൾ ഉണ്ട്, അതും എനിക്ക് അറിയാവുന്നവ മാത്രം!
വോയിസ് കൺട്രോൾ പരിമിതമായ ചലന ശേഷിയുള്ളവർക്കും ഉപകരണം ഉപയോഗിക്കാൻ സഹായം നൽകുന്നു. കൈകളില്ലാതെജനിച്ചവർക്കാവട്ടെ, തകർന്ന കൈകൾ ഉള്ളവർക്കാവട്ടെ, ഒപ്പം കൈകൾ തിരക്കുള്ള ഷോപ്പിംഗ് അല്ലെങ്കിൽ കുഞ്ഞുങ്ങൾ കൈകൊണ്ടുമുള്ളവർക്കുവേണം, നമ്മുടെ ശബ്ദത്തിലൂടെ വീട്ടിൽ കൺട്രോൾ ചെയ്യാനാകുന്നത് വലിയ സഹായമാണ്. ഒരു കുഞ്ഞു തിരുത്തലും അനിയന്ത്രിത ബാല്യക്കാരനുമായിരിക്കുമ്പോൾ 'ഹേ സിരി, എന്റെ ഗാരേജ് വാതിൽ അടയ്ക്കൂ' എന്ന് വിളിക്കുക ജീവിതത്തിലെ ചെറിയ പക്ഷേ ഫലപ്രദമായ പുരോഗതിയാണ്.
വോയ്സ് അസിസ്റ്റന്റുകൾ പ്രധാനമായി ഉപയോഗിക്കപ്പെടുന്നത് ടൈമറുകൾ സജ്ജീകരിക്കാൻ ആണ്. കിച്ചൺ ടൈമറുകൾയെ പിന്തുടർന്ന് നിങ്ങളുടെ വോയിസ് ഉപയോഗിച്ച് ബഹുഭവാഷകളിൽ ടൈമർ സജ്ജീകരിക്കാൻ കഴിയുന്ന ഒരു സ്മാർട്ട് കിച്ചൺ ടൈമർ നിങ്ങൾ ഈ പ്രോജക്റ്റിൽ നിർമ്മിക്കും.
ഈ പാഠത്തിൽ ഉൾപ്പെടുന്നത്:
- മൈക്രോഫോണുകൾ
- നിങ്ങളുടെ ഐഓടി ഉപകരണത്തിൽ നിന്നുള്ള ഓഡിയോ ക്യാപ്ചർ ചെയ്യൽ
- സ്പീച്ച് മുതൽ വാചകം വരെ
- ഭാഷയെ വാചകമായി മാറൽ
മൈക്രോഫോണുകൾ
മൈക്രോഫോണുകൾ ശബ്ദ തരംഗങ്ങളെ വൈദ്യുതി സിഗ്നലുകളായി മാറ്റുന്ന അനലോഗ് സെൻസറുകളാണ്. വായുവിലെ വൈബ്രേഷൻ മൂലം മൈക്രോഫോൺ ഘടകങ്ങൾ ചെറിയ വീതി നീക്കം ചെയ്യും, ഇത് വൈദ്യുതി സിഗ്നലിൽ ചെറിയ മാറ്റങ്ങൾ സൃഷ്ടിക്കുന്നു. ഈ മാറ്റങ്ങൾ ഉയർത്തി വൈദ്യുതി ഔട്ട്പുട്ട് സൃഷ്ടിക്കുന്നു.
മൈക്രോഫോൺ തരം
വിവിധ തരത്തിലുള്ള മൈക്രോഫോണുകൾ ലബ്ധ്യമുണ്ട്:
-
ഡൈനാമിക് - ഡൈനാമിക് മൈക്രോഫോണുകളിൽ ഒരു ചലിക്കുന്ന ഡയഫ്രാഗം നിലനിൽക്കുന്ന വയറിനുള്ളിൽ മാഗ്നറ്റിനു ചേർന്നിരിക്കുന്നു. ഇത് വൈദ്യുതചര动力 സൃഷ്ടിക്കുന്നു. ഇത് സാധാരണ സ്മാർത്ഥസ്പീക്കറുകളുടെ പകർപ്പു വിപരീതം ആണ്. ഇതുവഴി സ്പീക്കറുകൾ ഡൈനാമിക് മൈക്രോഫോണുകളായി ഉപയോഗിക്കാനാകും. ഇന്റർകോം പോലുള്ള ഉപകരണങ്ങളിൽ ഉപയോക്താവ് കേൾക്കുകയോ സംസാരിക്കുകയോ മാത്രം ചെയ്യുമ്പോൾ, ഒരു ഉപകരണമുണ്ടാവുന്നത് സ്പീക്കറും മൈക്രോഫോണും ആയി പ്രവർത്തിക്കും.
ഡൈനാമിക് മൈക്രോഫോണുകൾ പ്രവർത്തിക്കാൻ പവറിൽ ആശ്രയിക്കുന്നില്ല, വൈദ്യുതി സിഗ്നൽ മുഴുവൻ മൈക്രോഫോണിൽ നിന്നാണ് സൃഷ്ടിക്കുന്നത്.
-
റിബൺ - റിബൺ മൈക്രോഫോണുകൾ ഡൈനാമിക് മൈക്രോഫോണുകളും പോലെയാണ്, പക്ഷേ ഡയഫ്രാഗത്തിൻ പകരം ഒരു ലോഹ റിബൺ ഉണ്ട്. ഈ റിബൺ ഒരു മാഗ്നറ്റിക് ഫീൽഡിൽ ചലിക്കുന്നു, വൈദ്യുതി സിഗ്നൽ സൃഷ്ടിക്കുന്നു. ഡൈനാമിക് മൈക്രോഫോണുകളുപോലെ റിബൺ മൈക്രോഫോണുകളും പ്രവർത്തിക്കാൻ പവർ ആവശ്യമില്ല.
-
കണ്ടൻസർ - കണ്ടൻസർ മൈക്രോഫോണുകൾക്ക് ഒരു സാന്ദ്രമായ ലോഹ ഡയഫ്രാഗം ഉണ്ട്, ഫിക്സ് ചെയ്ത ലോഹ ബാക്ക് പ്ലേറ്റ് ഉം ഉണ്ട്. വൈദ്യുതി ഈ രണ്ട് ഭാഗങ്ങൾക്കും നൽകുന്നു, ഡയഫ്രാഗം വൈബ്രേറ്റ് ചെയ്യുമ്പോൾ താപ ഫീൽഡിലെ സ്റ്റാറ്റിക് ചാർജ് മാറ്റമുണ്ടാകുന്നു, അത് സിഗ്നൽ സൃഷ്ടിക്കുന്നു. കണ്ടൻസർ മൈക്രോഫോണുകൾ പ്രവർത്തിക്കാൻ പവർ ആവശ്യമാണ് - ഇത് ഫാൻട്ടം പവർ എന്നാണ് വിളിക്കുന്നത്.
-
MEMS - മൈക്രോഇലക്ട്രോമെക്കാനിക്കൽ സിസ്റ്റം മൈക്രോഫോണുകൾ, അല്ലെങ്കിൽ MEMS, കംപ്യൂട്ടർ ചിപ്പിൽ ചെറുകിട മൈക്രോഫോണുകളാണ്. സിലിക്കൺ ചിപ്പിൽ പ്രഷർ സെൻസിറ്റീവ് ഡയഫ്രാഗം ഉണ്ടാക്കിയിരിക്കുന്നു. ഈ മൈക്രോഫോണുകൾ ചെറിയവയാണ്, സർക്യൂട്ടറിയിലേക്കും ഉൾപ്പെടുത്തിയിരിക്കുന്നു.
മുകളിൽ ചിത്രത്തിൽ LEFT എന്ന് ലേബൽ ചെയ്യപ്പെട്ട ചിപ്പ് ഒരു MEMS മൈക്രോഫോൺ ആണ്, അതിന്റെ ഡയഫ്രാഗം ഒരു മില്ലിമീറിന് താഴെയാണ്.
✅ ശോധന ചെയ്യുക: നിങ്ങളുടെ ഒരുവടിക്കടുത്തുള്ള മൈക്രോഫോണുകൾ ഏതാണ്? നിങ്ങളുടെ കമ്പ്യൂട്ടറിൽ, ഫോണിൽ, ഹെഡ്സറ്റിൽ അല്ലെങ്കിൽ മറ്റ് ഉപകരണങ്ങളിൽ. അവയെന്തിന് എന്ത് തരത്തിലുള്ള മൈക്രോഫോണുകളാണെന്ന് കണ്ടെത്തുക.
ഡിജിറ്റൽ ഓഡിയോ
ഓഡിയോ ഒരു അനലോഗ് സിഗ്നലാണ്, വളരെ നിശ്ചിത വിവരങ്ങൾ നൽകുന്നു. ഈ സിഗ്നലിനെ ഡിജിറ്റലിലേക്ക് മാറ്റാൻ, ഓഡിയോ ഒരു സെക്കൻഡിൽ ആയിരക്കണക്കിന് തവണ ശാംപിള് ചെയ്യണം.
🎓 ശാംപ്ലിംഗ് എന്നത് ആ സമയത്ത് സിഗ്നലിന്റെ മൂല്യം ഡിജിറ്റൽ വേരിയബിളായി മാറ്റുകയാണ്.
ഡിജിറ്റൽ ഓഡിയോ പൾസ് കോഡ് മാഡൂൾ (PCM) ഉപയോഗിച്ച് നിറവേറ്റുന്നു. PCM സിഗ്നലിന്റെ വോൾട്ടേജ് വായിക്കുകയും അവയ്ക്ക് ഏറ്റവും അടുത്ത ഡിജിറ്റൽ മൂല്യം കണ്ടെത്തുകയുമാണ്.
💁 PCM, പൾസ് വിത്ത് മാഡൂൾ (PWM) പോലെയാണ്, പക്ഷേ PCM അനലോഗ് സിഗ്നലിനെ ഡിജിറ്റലാക്കി മാറ്റാൻ ഉപയോഗിക്കുന്നു, PWM ഡിജിറ്റൽ സിഗ്നൽ അനലോഗാക്കി മാറ്റാൻ ഉപയോഗിക്കുന്നു.
ഉദാഹരണം: മ്യൂസിക് സ്ട്രിമിംഗ് സേവനങ്ങൾ സാധാരണയായി 16-ബിറ്റ് അല്ലെങ്കിൽ 24-ബിറ്റ് ഓഡിയോ നൽകുന്നു. അതായത് വോൾട്ടേജിനെ 16-ബിറ്റ് അല്ലെങ്കിൽ 24-ബിറ്റ് പൂർണ്ണസംഖ്യയിലേക്ക് കൺവേർട്ട് ചെയ്യുന്നു. 16-ബിറ്റ് ഓഡിയോ -32,768 മുതൽ 32,767 വരെ നമ്പറുകളിൽ പെടുന്നു, 24-ബിറ്റ് −8,388,608 മുതൽ 8,388,607 വരെ. ബിറ്റുകളുടെ എണ്ണം കൂടുതലായാൽ ശബ്ദം കൂടുതലായി യഥാർത്ഥ ശബ്ദത്തോട് അടുത്താകും.
💁 8-ബിറ്റ് ഓഡിയോയെ ചിലപ്പോൾ LoFi എന്ന് വിളിക്കുന്നു. ഇത് 8-ബിറ്റ് മാത്രമാണ് ഉള്ളത്, -128 മുതൽ 127 വരെ. ആദ്യകാല കമ്പ്യൂട്ടർ ഓഡിയോ 8-ബിറ്റിൽ മാത്രം പരിമിതമായിരുന്നുവെന്നത് കാരണം റെട്രോ ഗെയിമിംഗ് എന്നിവയിൽ ഇതിനെ കാണാൻ സാധിക്കും.
ശാംപിളുകൾ ഓരോ സെക്കന്റിലും ആയിരക്കണക്കിനു തവണ എടുത്തിരിക്കുന്നു, മതി കൃത്യമായി നിർവ്വചിച്ച സാംപിലുള്ള നിരക്കുകൾക്കനുസരിച്ച് (kHz). മ്യൂസിക് സ്ട്രിമിംഗ് സേവനങ്ങൾ സാധാരണയായി 48KHz സാംപിള് നിരക്ക് ഉപയോഗിക്കുന്നു, പക്ഷേ ചില ലോസ്ലെസ് ഓഡിയോ 96KHz അല്ലെങ്കിൽ 192KHz വരെ ഉപയോഗിക്കുന്നു. സാംപിള് നിരക്ക് കൂടുമ്പോൾ ഓഡിയോ യഥാർത്ഥ ശബ്ദത്തോട് കൂടി അടുത്ത് വരും. 48KHz-ൽ മുകളിൽ മനുഷ്യർക്ക് വ്യത്യാസം കേൾക്കാനാകുന്നോ എന്നതിൽ ചർച്ചകളുണ്ട്.
✅ അന്വേഷിക്കുക: നിങ്ങൾ ഉപയോഗിക്കുന്ന സ്ട്രീമിംഗ് മ്യൂസിക് സേവനം സാംപിള് നിരക്കും സൈസും എത്രയാണ്? CD ഉപയോഗിക്കുന്നുവെങ്കിൽ, CD ഓഡിയോയുടെ സാംപിള് നിരക്കും സൈസും എന്താണ്?
കൂടുതൽ ഓഡിയോ ഫോർമാറ്റുകള് ഉണ്ട്. mp3 ഫയലുകളെ നിങ്ങൾ കേട്ടിട്ടുണ്ടാകും - ഇത് കംപ്രസു ചെയ്ത ഓഡിയോ, വലുപ്പം കുറക്കാൻ വേണ്ടി എന്നാൽ ഗുണനിലവാരത്തിൽ നഷ്ടം ഉണ്ടായിട്ടില്ല. കംപ്രസു ചെയ്തിട്ടില്ലാത്ത ഓഡിയോ സാധാരണയായി WAV ഫയൽ ആയി സൂക്ഷിക്കുന്നു – ഇതിൽ 44 ബൈറ്റ് ഹെഡർ വിവരങ്ങളും ശേഷം കച്ചവടമായ ഓഡിയോ ഡാറ്റയും ഉണ്ട്. ഹെഡറിൽ സാംപിള് നിരക്ക് (ഉദാ: 16000 എന്നാണ് 16KHz), സാമ്പിള് സൈസ് (16 ബിറ്റ്), ചാനലുകളുടെ എണ്ണം എന്നിവ ഉൾപ്പെടുന്നു. ഹെഡറിനു ശേഷം RAW ഓഡിയോ ഡാറ്റ WAV ഫയലിൽ ഉണ്ടാകുന്നു.
🎓 ചാനൽ എന്നു പറയുന്നത് എത്ര വ്യത്യസ്ത ഓഡിയോ സ്ട്രീമുണ്ട് എന്നതാണ്. ഉദാഹരണത്തിന്, ലെഫ്റ്റ്, റൈറ്റ് ഉള്ള സ്റ്റെറിയോയ്ക്ക് 2 ചാനലുകൾ ഉണ്ടാകും. 7.1 സറൗണ്ട് സിസ്റ്റത്തിന് 8 ചാനലുകൾ ഉണ്ടാകും.
ഓഡിയോ ഡാറ്റാ വലുപ്പം
ഓഡിയോ ഡാറ്റ വളരെ വലുതാണ്. 16KHz-ൽ 16-ബിറ്റ് കംപ്രസു ചെയ്യാത്ത ഓഡിയോ ഒരു സെക്കന്റിന് 32KB ഡാറ്റ എടുക്കും (സ്പീച്ച് ടുഡ് ടെക്സ്റ്റ് മോഡലിനായി നല്ല നിരക്കാണിത്):
- 16-ബിറ്റ് എന്നത് ഓരോ സാമ്പിളിനും 2 ബൈറ്റ് ആണ് (1 ബൈറ്റ് 8 ബിറ്റാണ്).
- 16KHz എന്നത് 16,000 സാമ്പിളുകൾ ആണ് ഒരു സെക്കന്റിന്.
- 16,000 x 2 ബൈറ്റ് = 32,000 ബൈറ്റുകൾ ഒരു സെക്കന്റിന്.
ഇതാണ് ചെറിയ തോതുള്ള ഡാറ്റ പോലെ തോന്നുന്നത്, പക്ഷേ സ്മാൾ മെമ്മറി ഉള്ള മൈക്രോ കണ്ട്രോളറിൽ ഇത് വലിയ തോതാണ്. ഉദാഹരണത്തിന് Wio Terminal-ന് 192KB മെമ്മറി ഉണ്ട്, പ്രോഗ്രാം കോഡ്, വേരിയബിളുകൾ എന്നിവ ഇതിൽ ഉൾപ്പെടണം. കോഡ് വളരെ ചെറുതായിരുന്നാലും 5 സെക്കന്റിൽ കൂടുതൽ ഓഡിയോ ക്യാപ്ചർ ചെയ്യാൻ കഴിയില്ല.
മൈക്രോ കണ്ട്രോളറുകൾക്ക് സ്ട്രോറേജ് പരിധി വർദ്ധിക്കുന്നതിന് SD കാർഡുകൾ അല്ലെങ്കിൽ ഫ്ലാഷ് മെമ്മറി പോലുള്ള അധിക സംഭരണവും ആണ് സാധ്യം. ഓഡിയോ ക്യാപ്ചർ ചെയ്യുന്ന IoT ഉപകരണം നിർമിക്കുമ്പോൾ നിങ്ങൾക്കുണ്ടാവേണ്ടത്യ്ക്ക് കൂടുതൽ സംഭരണം മാത്രം മാത്രമല്ല, നിങ്ങളുടെ കോഡ് നിങ്ങൾക്കൊപ്പം മൈക്രോഫോണിൽ നിന്നുള്ള ഓഡിയോ നേരിട്ട് സംഭരണത്തിലേയ്ക്ക് എഴുതണം. ക്ലൗഡിൽ വിവരം അയയ്ക്കുമ്പോഴായി സംഭരണം മുതൽ ബ്രൗസർ വരെ ഓഡിയോ സ്ട്രീം ചെയ്യണം. ഇതുവഴി ഒരു ഘട്ടത്തിൽ മുഴുവൻ ഓഡിയോ മെമ്മറിയിൽ സൂക്ഷിച്ച് മുക്തമാകാനുള്ള പ്രശ്നം ഒഴിവാക്കാം.
നിങ്ങളുടെ ഐഒടി ഉപകരണത്തിൽ നിന്നും ഓഡിയോ പിടിക്കുക
നിങ്ങളുടെ IoT ഉപകരണത്തിൽ മൈക്രോഫോൺ കണക്റ്റ് ചെയ്ത് ഓഡിയോ പിടിക്കാമെന്നും, സ്പീക്കറുകൾകൂടി കണക്റ്റ് ചെയ്ത് ഓഡിയോ പുറത്തു നൽകാനാകുമെന്നും, പിന്നീട് പാഠങ്ങളിൽ ഇത് ഓഡിയോ ഫീഡ്ബാക്കിനായി ഉപയോഗിക്കും. എന്നാൽ മൈക്രോഫോൺ പരീക്ഷിക്കാൻ ഇപ്പോൾ തന്നെ സ്പീക്കറുകൾ ക്രമീകരിക്കുക നല്ലതാണ്.
ജോലി - നിങ്ങളുടെ മൈക്രോഫോൺ, സ്പീക്കർ ക്രമീകരിക്കുക
നിങ്ങളുടെ IoT ഉപകരണത്തിനായുള്ള കണക്കിലെടുത്ത ഗൈഡ് വഴി മൈക്രോഫോൺ, സ്പീക്കറുകൾ ക്രമീകരിക്കുക:
- Arduino - Wio Terminal
- സിംഗിൾ-ബോർഡ് കമ്പ്യൂട്ടർ - റാസ്പ്ബെറി പൈ
- സിംഗിൾ-ബോർഡ് കമ്പ്യൂട്ടർ - വെർച്വൽ ഡിവൈസ്
ജോലി - ഓഡിയോ പിടിക്കുക
നിങ്ങളുടെ IoT ഉപകരണത്തിൽ ഓഡിയോ പിടിക്കാൻ അനുയോജ്യമായ ഗൈഡ് അനുസരിക്കുക:
- Arduino - Wio Terminal
- സിംഗിൾ-ബോർഡ് കമ്പ്യൂട്ടർ - റാസ്പ്ബെറി പൈ
- സിംഗിൾ-ബോർഡ് കമ്പ്യൂട്ടർ - വെർച്വൽ ഡിവൈസ്
സ്പീച്ച് മുതൽ ടെക്സ്റ്റ് വരെ
സ്പീച്ച് ടു ടെക്സ്റ്റ് അല്ലെങ്കിൽ സ്പീച്ച് തിരിച്ചറിയൽ എന്നത് ഒരു ഓഡിയോ സിഗ്നലിൽ ഉള്ള വാക്കുകൾ ടെക്സ്റ്റായി മാറ്റാൻ AI ഉപയോഗിക്കുന്നു.
സ്പീച്ച് തിരിച്ചറിയൽ മോഡലുകൾ
സ്പീച്ചിനെ ടെക്സ്റ്റായി മാറ്റാൻ, ഓഡിയോ സിഗ്നലിലെ സാമ്പിളുകൾ കൂട്ടിച്ച്, പുനരവർത്തിത ന്യൂറൽ നെറ്റ്വർക്ക് (RNN) അടിസ്ഥാനമാക്കിയുള്ള മെഷീൻ ലേണിംഗ് മോഡലിൽ നൽകുന്നു. RNN പഴയ ഡാറ്റ സഹായത്തോടെ പുതിയ ഡാറ്റയെ പറ്റിയുള്ള തീരുമാനങ്ങൾ എടുക്കുന്നത് സാധ്യമാക്കുന്നു. ഉദാ: RNN ഒരു ബ്ലോക്ക് 'Hel' എന്ന് തിരിച്ചറിയുകയും മറ്റു ഒരു ബ്ലോക്ക് 'lo' എന്ന് തിരിച്ചറിയുകയും ചെയ്താൽ അവ ചേർത്ത് 'Hello' എന്ന് ശരിയായ വാക്കായി തിരഞ്ഞെടുക്കാം.
ML മോഡലുകൾ എല്ലായ്പ്പോഴും ഓരോ തവണയും ഒരേ വലുപ്പത്തിലുള്ള ഡാറ്റ സ്വീകരിക്കും. ഇമേജ് ക്ലാസിഫയർ പാഠത്തിൽ നിങ്ങൾ നിർമ്മിച്ച ചിത്രങ്ങൾ ഒരേ വലുപ്പത്തിലേക്ക് പുനർവ്യവസ്ഥപ്പെടുത്തി പ്രോസസ്സ് ചെയ്തിരുന്നു. സ്പീച്ച് മോഡലുകളും ഒരേ വലുപ്പത്തിലുള്ള ഓഡിയോ മുള്ളുകൾ പ്രോസസ്സ് ചെയ്യുന്നു. മോഡൽ പുറത്തിറക്കലുകൾ സംയോജിപ്പിച്ച് 'Hi'യും 'Highway'യും വേർതിരിക്കുക, 'flock'നും 'floccinaucinihilipilification'നും വ്യത്യാസം കാണിക്കണം.
സ്പീച്ച് മോഡലുകൾക്കും കൂടുതൽ മുന്നേറ്റം ലഭിച്ചിട്ടുണ്ട്: അവ_CONTEXT_ മനസിലാക്കുകയും കൂടുതലായി ശബ്ദങ്ങൾ പ്രോസസ്സ് ചെയ്തപ്പോൾ വാക്കുകൾ ശരിയാക്കുകയും ചെയ്യുന്നു. ഉദാ: "I went to the shops to get two bananas and an apple too" ഇപ്രകാരമുള്ള മൂന്ന് വാക്കുകൾ ("to", "two" "too") ശബ്ദത്തിൽ ഒരേപോലെയാണ് കേൾകുക, മോഡൽ പ്രസംഗത്തിന്റെ സാന്റർഭം മനസ്സിലാക്കി ശരിയായ വാക്ക് തിരഞ്ഞെടുക്കും.
💁 ചില സ്പീച്ച് സർവീസുകൾ ശബ്ദപ്രദേശങ്ങളായ ഫാക്ടറികളിലും വ്യവസായം-കേന്ദ്രമായ പദങ്ങളുമായി മെച്ചപ്പെടാൻ ക്രമീകരിക്കാനാകും. ഈ ക്രമീകരണങ്ങൾ ട്രാൻസ്ഫർ ലേണിങ്ങ് ഉപയോഗിച്ച് ട്രെയിൻ ചെയ്യപ്പെടുന്നു, ഇമേജ് ക്ലാസിഫയർ ആദ്യ പാഠത്തിൽ കുറച്ച് ചിത്രങ്ങൾ ഉപയോഗിച്ച് നിർദ്ദേശിച്ചതുപോലെ.
സ്വകാര്യത
ഉപഭോക്തൃ IoT ഉപകരണങ്ങളിൽ സ്പീച്ച് ടു ടെക്സ്റ്റ് ഉപയോഗിക്കുന്നത് വളരെ സ്വകാര്യതാമായിരുന്നു. ഈ ഉപകരണം തുടർച്ചയായി ഓഡിയോ കേൾക്കുന്നു, അതിനാൽ ഉപയോക്താവ് പറയുന്നതെല്ലാം ക്ലൗഡിനുള്ളിലേക്ക് അയച്ച് ടൈപ്പായി മാറുന്നതിൽ ആഗ്രഹം ഇല്ല. ഇത് ഇന്റർനെറ്റ് ബാൻഡ്വിഡ്ത്തിന്റെ വലിയ ഉപയോഗം മാത്രമല്ല, സ്വകാര്യതയ്ക്കും വലിയ പ്രതിസന്ധിയാണ്, പ്രത്യേകിച്ച് ചില സ്മാർട്ട് ഉപകരണ നിർമ്മാതാക്കളെ വെളിപ്പെടുത്തുന്നത് മനുഷ്യർ generated ടെക്സ്റ്റിനെ എതിര് വെച്ച് ശബ്ദം നിർണയിക്കാൻ ചില ഓഡിയോ ശേഖരിക്കുന്നു എന്നതാണ്. നിങ്ങൾക്ക് നിങ്ങളുടെ സ്മാർട്ട് ഉപകരണം നിങ്ങൾ അത് ഉപയോഗിക്കുമ്പോഴേക്കാൾ മാത്രമേ പ്രോസസ്സിംഗിനായി ഓഡിയോ ക്ലൗഡിലേക്ക് അയക്കാൻ ഇച്ചെയ്യൂ, നിങ്ങളുടെ വീട്ടിൽ കേൾക്കുന്ന ഓഡിയോ അല്ല, അത് സ്വകാര്യ യോഗങ്ങളെ പോലും ഉൾക്കൊള്ളാം അല്ലെങ്കിൽ അടുത്ത ബന്ധങ്ങളുടെ സംഭാഷണങ്ങളായിരിക്കാം. ഏറ്റവും അധികം സ്മാർട്ട് ഉപകരണങ്ങൾ പ്രവർത്തിക്കുന്നത് ഒരു വേക്ക് വാക്ക് ഉപയോഗിച്ച് ആണ്, "അലക്സ", "ഹേ സിരി", അല്ലെങ്കിൽ "ഓകെ ഗൂഗിൾ" പോലൊരു കീഫ്രേസ് ഉപകരണം 'മുകളിൽ' വരാൻ കാരണമാകുന്നു, അതിനുശേഷം ഉപകരണം നിർത്തുന്നതു വരെ നിങ്ങൾ പറയുന്നതിനെ കേൾക്കുന്നു, ഇത് നിങ്ങൾ ഉപകരണത്തോടു സംസാരിക്കുന്നത് പൂർത്തിയായതായി സൂചിപ്പിക്കുന്നു.
🎓 വേക്ക് വാക്ക് കണ്ടെത്തലിനെ കീവേഡ് സ്പോട്ടിംഗ് അല്ലെങ്കിൽ കീവേഡ് തിരിച്ചറിവ് എന്നും വിളിക്കുന്നു.
ഈ വേക്ക് വാക്കുകൾ ക്ലൗഡിൽ അല്ല, ഉപകരണത്തിൽ കണ്ടെത്തുന്നു. ഈ സ്മാർട്ട് ഉപകരണങ്ങളിൽ വേക്ക് വാക്ക് കേൾക്കുന്നതിനായി ചെറിയ AI മോഡലുകൾ അനുഭവത്തിലുണ്ട്, വേക്ക് വാക്ക് കണ്ടെത്തുമ്പോൾ, ഓഡിയോ തിരിച്ചറിയലിനായി ക്ലൗഡിലേക്ക് പ്രക്ഷേപണം തുടങ്ങുന്നു. ഈ മോഡലുകൾ വളരെ പ്രത്യേകവയാണ്, വെറും വേക്ക് വാക്ക് കേൾക്കുന്നതിനാണ് ഇവ.
💁 ചില ടെക്ക് കമ്പനികൾ അവരുടെ ഉപകരണങ്ങൾക്ക് കൂടുതൽ സ്വകാര്യത നൽകുകയും അഭിവാക്ക്ത്രസംവേദനം ഉപകരണത്തിലും ചെയ്യുകയും ചെയ്യുന്നു. ആപ്പിൾ 2021 iOS, macOS അപ്ഡേറ്റിന്റെ ഭാഗമായായി സ്പീച്ച്-ടു-ടെക്സ് പരിവർത്തനം ഉപകരണത്തിൽ ചെയ്യുമെന്ന് പ്രഖ്യാപിച്ചിരിക്കുന്നു, കൂടാതെ കൂടുതൽ അഭ്യർത്ഥനകൾക്ക് ക്ലൗഡിനെ ആശ്രയിക്കാതെ കൈകാര്യം ചെയ്യാൻ കഴിയുന്നതാണ്. ഉപകരണങ്ങളിലെ ശക്തമായ പ്രോസസ്സറുകൾ കൊണ്ട് ഇവക്ക് ML മോഡലുകൾ ഓടിക്കാൻ കഴിയും എന്നതാണ് ഈ പ്രശസ്തിയുടെ കാരണം.
✅ ക്ലൗഡിലേക്ക് അയക്കുന്ന ഓഡിയോ സൂക്ഷിക്കുന്നതിന്റെ സ്വകാര്യതയും നൈതിക സാദ്ധ്യതകളും നിങ്ങൾ എങ്ങനെ കാണുന്നു? അതുവേണ്ടി ഓഡിയോ സൂക്ഷിക്കണോ, എങ്കിൽ എങ്ങനെ? നിയമ പ്രാവർത്തനത്തിന് ഓഡിയോ രേഖപ്പെടുത്തലുകളുടെ ഉപയോഗം സ്വകാര്യത നഷ്ടത്തിന്റെ ഒട്ടേറെകൾക്കു മികച്ച പ്രതിഫലം ആണോ?
വേക്ക് വാക്ക് കണ്ടെത്തൽ സാധാരണയായി TinyML എന്ന സാങ്കേതിക വിദ്യ ഉപയോഗിക്കുന്നു, അത് ML മോഡലുകൾ മൈക്രോഡ്രൈവർസുകളിൽ ഓടാൻ രൂപപ്പെടുത്തുക എന്നതാണ്. ഈ മോഡലുകളുടെ വലിപ്പം ചെറിയതാണ്, ഓടുന്നതിനുള്ള വൈദ്യുതി ഉപയോഗം വളരെ കുറഞ്ഞതാണ്.
വേക്ക് വാക്ക് മോഡൽ പരിശീലിപ്പിക്കാനും ഉപയോഗിക്കാനുമായുള്ളസങ്കീർണ്ണത ഒഴിവാക്കാൻ, ഈ പാഠത്തിൽ നിങ്ങൾ നിർമ്മിക്കുന്ന സ്മാർട്ട് ടൈമർ സംസാര പരിചയപ്പെടലിന് ബട്ടൺ ഉപയോഗിക്കും.
💁 നിങ്ങൾ Wio Terminal അല്ലെങ്കിൽ Raspberry Pi ഓടുന്നതിന് വേക്ക് വാക്ക് കണ്ടെത്തൽ മോഡൽ സൃഷ്ടിക്കാൻ താൽപര്യമുണ്ടെങ്കിൽ, Edge Impulse ന്റെ നിങ്ങളുടെ ശബ്ദത്തിന് പ്രതികരിക്കുന്ന ട്യൂട്ടോറിയൽ നോക്കുക. നിങ്ങളുടെ കം퓨터 ഉപയോഗിച്ച് ഇത് പരീക്ഷിക്കാൻ Microsoft ഡോക്സിലുള്ള Custom Keyword ക്വിക്സ്റ്റാർട്ട് ഉപയോഗിച്ച് തുടങ്ങാം.
ആശയം - സ്പീച്ച് ടു ടെക്സ്റ്റ് പരിവർത്തനം
മുമ്പത്തെ ഒരു പ്രോജക്ടിൽ ചിത്ര ക്ളാസിഫിക്കേഷനോടെയുള്ള പോലെ, സംസാരത്തെ ഓഡിയോ ഫൈൽ ആകാരം എടുത്ത് ടെക്സ്റ്റായി മാറ്റാൻ പ്രീ-ബിൽറ്റ് AI സേവനങ്ങൾ ഉണ്ട്. അവയിൽ ഒന്നാണ് സ്പീച്ച് സർവീസ്, കോഗ്മിറ്റീവ് സർവീസിന്റെ ഭാഗമായുള്ള, നിങ്ങളുടെ ആപ്ലിക്കേഷനുകളിൽ ഉപയോഗിക്കാവുന്ന പ്രീ-ബിൽറ്റ് AI സേവനങ്ങൾ.
ടാസ്ക്ക് - സ്പീച്ച് AI റിസോഴ്സ് കോൺഫിഗർ ചെയ്യുക
-
ഈ പ്രോജക്ടിനായുള്ള ഒരു റിസോഴ്സ് ഗ്രൂപ്പായി
smart-timerസൃഷ്ടിക്കുക -
ഈ കമാൻഡ് ഉപയോഗിച്ച് ഒരു ഫ്രീ സ്പീച്ച് റിസോഴ്സ് സൃഷ്ടിക്കുക:
az cognitiveservices account create --name smart-timer \ --resource-group smart-timer \ --kind SpeechServices \ --sku F0 \ --yes \ --location <location>റിസോഴ്സ് ഗ്രൂപ്പ് സൃഷ്ടിക്കുമ്പോൾ ഉപയോഗിച്ച
<location>പകരുക. -
നിങ്ങളുടെ കോഡിൽ നിന്നുള്ള സ്പീച്ച് റിസോഴ്സിലേക്ക് ആക്സസ് നേടാൻ ഒരു API കീ ആവശ്യമുണ്ട്. കീ ലഭിക്കാൻ താഴെയുള്ള കമാൻഡ് ഓടിക്കുക:
az cognitiveservices account keys list --name smart-timer \ --resource-group smart-timer \ --output tableകീകളിൽ ഒരുത്തിന്റെ കോപ്പി എടുക്കുക.
ടാസ്ക് - സ്പീച്ച് ടെക്സ്റ്റായി പരിവർത്തനം ചെയ്യുക
നിങ്ങളുടെ IoT ഉപകരണത്തിൽ സ്പീച്ച് ടെക്സ്റ്റായി മാറ്റാൻ ഈ ബന്ധപ്പെട്ട മാർഗ്ഗനിർദ്ദേശം ശ്രദ്ധിക്കുക:
🚀 ചലഞ്ച്
സ്പീച്ച് പരിചയപ്പെടുത്തൽ നിരവധി വർഷങ്ങളായുള്ളതാണ്, തുടർച്ചയായി മെച്ചപ്പെടുകയാണ്. നിലവിലെ കഴിവുകൾ зертിച്ച് സമയാനുസൃതമായി ഇവ എങ്ങനെ മാറിയിട്ടുള്ളൂ എന്ന് വെളിപ്പെടുത്തുക, എന്നാൽ യന്ത്രം നിർവചിക്കുന്ന ട്രാൻസ്ക്രിപ്റ്റുകളുടെ കൃത്യത മനുഷ്യരുടെ താരതമ്യത്തിൽ എത്രമാത്രമാണ് എന്നുള്ളത് ഉൾപ്പെടെ.
നിങ്ങളുടെ നോക്കിൽ സ്പീച്ച് പരിചയപ്പെടുത്തലിന്റെ ഭാവി എന്തെന്ത് ഭാവിക്കാം?
പാഠത്തിന് ശേഷം പരീക്ഷ
അവലോകനം & സ്വയം പഠനം
- സ്പീച്ചിന്റെ വ്യത്യസ്തമായ മൈക്രോഫോൺ തരംങ്ങൾ എന്തെല്ലാം ഉണ്ട്, അവ എങ്ങനെ പ്രവർത്തിക്കുന്നു എന്ന് Musician's HQ ൽ ഡൈനാമിക്, കൺഡൻസർ മൈക്രോഫോണുകൾ തമ്മിലുള്ള വ്യത്യാസം എന്ന ലേഖനത്തിൽ വായിക്കുക.
- കോഗ്നിറ്റീവ് സർവീസ് സ്പീച്ച് സർവീസ് കൂടുതൽ വായിക്കുക Microsoft ഡോക്സിൽ സ്പീച്ച് സർവീസ് ഡോക്യുമെന്റേഷൻ.
- കീവേഡ് സ്പോട്ടിംഗിനെക്കുറിച്ച് Microsoft ഡോക്സിൽ കീവേഡ് തിരിച്ചറിവ് ഡോക്യുമെന്റേഷൻ പഠിക്കുക.
അസൈൻമെന്റ്
അസ്വീകരണം:
ഈ ഡോക്യുമെന്റ് AI വിവർത്തന സേവനം Co-op Translator ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തതാണ്. നാം കൃത്യതയ്ക്ക് ശ്രമിച്ചിട്ടുണ്ടെങ്കിലും, автомат ചെയ്ത വിവർത്തനങ്ങളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റുകൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. ജന്മഭൂമിയിലെ അതിന്റെ സ്വതന്ത്ര ഭാഷയിലുള്ള യഥാർത്ഥ ഡോക്യുമെന്റ് പ്രമാണം പരിഗണിക്കേണ്ടതാണ്. പ്രധാന വിവരങ്ങൾക്കായി പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം നിർബന്ധമാണ്. ഈ വിവർത്തന ഉപയോഗത്തിന് ഉണ്ടായുള്ള ബോധവാന്മതതകളോ തെറ്റിദ്ധാരണകളോ ഉള്ളതിന് നാം ഉത്തരവാദികളല്ല.







