|
|
6 months ago | |
|---|---|---|
| .. | ||
| README.md | 6 months ago | |
| assignment.md | 6 months ago | |
| pi-text-to-speech.md | 6 months ago | |
| single-board-computer-set-timer.md | 6 months ago | |
| virtual-device-text-to-speech.md | 6 months ago | |
| wio-terminal-set-timer.md | 6 months ago | |
| wio-terminal-text-to-speech.md | 6 months ago | |
README.md
ടൈമർ സെറ്റ് ചെയ്യുക এবং പോഡ് ഫീഡ്బാക്ക് നൽകുക
സ്കെച്നോട്ട് Nitya Narasimhan തയ്യാറാക്കിയതാണ്. വലിയ പതിപ്പ് കാണാൻ ചിത്രത്തെ ക്ലിക്ക് ചെയ്യുക.
പ്രീ-ലെചർ ക്വിസ്
പരിചയം
സ്മാർട്ട് അസിസ്റ്റന്റുകൾ ഒരുവശം ബന്ധപ്പെടുന്ന ഉപകരണങ്ങളല്ല. നിങ്ങൾ അവയ്ക്ക് സംസാരിക്കും, അവ വരെ മറുപടി നൽകും:
"ആലക്സ, 3 മിനിട്ട് ടൈമർ സെറ്റ് ചെയ്യൂ"
"ശരി, നിങ്ങളുടെ ടൈമർ 3 മിനിട്ട് സെറ്റ് ചെയ്തു"
മുമ്പത്തെ 2 പാഠങ്ങളിൽ നിങ്ങൾ സംസാരത്തെ ടെക്സ്റ്റിലേക്ക് മാറ്റുന്നത് പഠിച്ചു, പിന്നെ അതിൽ നിന്നും ടൈമർ സെറ്റ് ചെയ്യാനുള്ള അഭ്യർത്ഥന പിടിച്ചെടുക്കുന്നത് അഭ്യസിച്ചു. ഈ പാഠത്തിൽ, നിങ്ങൾ IoT ഉപകരണത്തിൽ ടൈമർ എങ്ങനെ സെറ്റ് ചെയ്യാമെന്ന് പഠിക്കാം, ഉപയോക്താവിന് അവരുടെ ടൈമർ സ്ഥിരീകരിക്കുന്ന വാക്കുകളിലൂടെ പ്രതികരിക്കുകയും ടൈമർ തീർന്നപ്പോൾ അവരെ അറിയിക്കുകയും ചെയ്യുന്നതും.
ഈ പാഠത്തിൽ ചർച്ച ചെയ്യുന്നത്:
ടെക്സ്റ്റ് ടു സ്പീച്
നാമം സൂചിപ്പിക്കുന്നതുപോലെ ടെക്സ്റ്റ് ടു സ്പീച് എന്നത് ടെക്സ്റ്റിനെ സംസാരിക്കപ്പെടുന്ന വാക്കുകളായ ശബ്ദത്തിലേക്ക് മാറ്റാനുള്ള പ്രക്രിയയാണ്. അടിസ്ഥാന തത്വം ടെക്സ്റ്റിലെ വാക്കുകളെ അവയുടെ ഘടക ശബ്ദങ്ങളായ ഫോനീമുകളായി വിഭജിച്ച്, ആ ശബ്ദങ്ങൾക്ക് പ്രീ-റെക്കോർഡുചെയ്ത ശബ്ദമായാലോ AI മോഡലുകൾ ഉപയോഗിച്ച് സൃഷ്ടിച്ച ശബ്ദമായാലോ ചേര്ക്കുന്നതാണ്.
ടെക്സ്റ്റ് ടു സ്പീച് സിസ്റ്റങ്ങൾ സാധാരണയായി മൂന്ന് ഘട്ടങ്ങൾ ഉണ്ടാക്കുന്നു:
- ടെക്സ്റ്റ് വിശകലനം
- ഭാഷാ വിശകലനം
- വാർഫ്ോം ജനറേഷൻ
ടെക്സ്റ്റ് വിശകലനം
ടെക്സ്റ്റ് വിശകലനം അതായത് നൽകപ്പെട്ട ടെക്സ്റ്റിനെ സംസാരത്തിലേക്ക് പരിവർത്തനം ചെയ്യാൻ ഉപയോഗിക്കുന്ന വാക്കുകളായി മാറ്റുക. ഉദാഹരണത്തിന്, "Hello world" എന്ന് മാറ്റുമ്പോൾ പ്രത്യേക ടെക്സ്റ്റ് വിശകലനം ആവശ്യമില്ല, ആ രണ്ട് വാക്കുകൾ നേരിട്ട് സംസാരത്തിലേക്ക് മാറ്റാം. പക്ഷേ "1234" എന്ന varsa സ്ഥിതിയിൽ, കോൺടക്സ്റ്റിൽ ആശ്രയിച്ച് അത് "One thousand, two hundred thirty four" അല്ലെങ്കിൽ "One, two, three, four" എന്നിങ്ങനെയായി മാറ്റണം. "I have 1234 apples" എന്നപ്പോൾ അത് "One thousand, two hundred thirty four" ആകും, പക്ഷേ "The child counted 1234" ന്റെ അവസരത്തിൽ "One, two, three, four" ആകും.
വാക്കുകളുടെ സൃഷ്ടി മാത്രമല്ല ഭാഷയ്ക്കും പ്രദേശത്തിനും വ്യത്യാസമാകുന്നു. ഉദാഹരണത്തിന്, അമേരിക്കൻ ഇംഗ്ലീഷിൽ 120 എന്ന് "One hundred twenty", ബ്രിട്ടീഷ് ഇംഗ്ലീഷിൽ "One hundred and twenty" എന്നാണ്, "and" ന്റെ ഉപയോഗം ഹണ്ട്രെഡ് കഴിഞ്ഞ് വരുന്ന സന്ദർഭത്ത്.
✅ മറ്റൊരു ഉദാഹരണം: "in" എന്നത് inch എന്നതിന് ചുരുണ്ട രൂപമാണ്, "st" എന്ന് saint അല്ലെങ്കിൽ street എന്നതിന് ചുരുണ്ട രൂപമാണ്. നിങ്ങളുടെ ഭാഷയിൽ കോൺടക്സ്റ്റ് ഇല്ലാതെ അസ്പഷ്ടമായ മറ്റ് വാക്കുകൾ നിങ്ങൾക്ക് തോന്നുമോ?
വാക്കുകൾ നിർവ്വചിക്കപ്പെട്ടപ്പോൾ, അവ ഭാഷാ വിശകലനത്തിന് അയക്കപ്പെടുന്നു.
ഭാഷാ വിശകലനം
ഭാഷാ വിശകലനം വാക്കുകളെ ഫോനീമുകളായി വിഭജിക്കുന്നു. ഫോനീങ്ങൾ അക്ഷരങ്ങൾ മാത്രമല്ല, വാക്കിലെ മറ്റ് അക്ഷരങ്ങൾ കൂടി ആശ്രയിച്ച് ഉണ്ടാകുന്നു. ഉദാഹരണത്തിന്, ഇംഗ്ലീഷിൽ 'car' യിലാണ് 'a' ശബ്ദവും 'care' യിലുള്ള 'a' ശബ്ദവും വ്യത്യാസമുണ്ട്. ഇംഗ്ലീഷിനു മൂന്ന് തരം ആക്ഷരമാല അക്ഷരങ്ങളിൽ 44 ഫോനീങ്ങൾ ഉണ്ട്, ചിലപ്പോൾ വിവിധ അക്ഷരങ്ങൾ ഒരേ ഫോനീം പങ്കിടുന്നു, ഉദാഹരണമായി 'circle' ഉം 'serpent' ഉം ആരംഭിക്കുന്ന ഫോനീങ്ങൾ ഒരുപോലെയാണ്.
✅ ഒരു പഠനം: നിങ്ങളുടെ ഭാഷയിലെ ഫോനീങ്ങൾ എന്തൊക്കെയാണ്?
ഫോണീമുകളാക്കപ്പെട്ട് കഴിഞ്ഞാൽ, ടോണും കാലാവധിയും കോൺടക്സ്റ്റിൽ ആനുസരിച്ച് ക്രമീകരിക്കാൻ അധിക ഡാറ്റ ആവശ്യമുണ്ട്. ഉദാഹരണത്തിന്, ഇംഗ്ലീഷിൽ ചോദ്യം ചിഹ്നം ഉപയോഗിച്ചുള്ള വാക്കിന്റെ പിറവിയിൽ ഉയർന്ന ശബ്ദം ഒരു ചോദ്യം ആയി മാറ്റാൻ ഉപയോഗിക്കാം.
ഉദാഹരണം - "You have an apple" എന്നുപറഞ്ഞാൽ ആകെയുള്ള പ്രസ്താവനയാണ് നിങ്ങൾക്കൊരു ആപ്പിൾ ഉണ്ടെന്ന്. പിച്ചിന്റെ ഉയർച്ച വാക്കിന്റെ അവസാനം പ്രയോഗിച്ചാൽ, "You have an apple?" എന്ന ചോദ്യം ആകും. ഭാഷാ വിശകലനം ഇതു മനസ്സിലാക്കി പിച്ചിന്റെ ഉയർച്ച നിർമാണിക്കും.
ഫോണീമുകൾ ജനറേറ്റ് ചെയ്തപ്പോൾ, അവ വാർഡ്ഫോം ജനറേഷനിലേക്കു അയയ്ക്കാം, അവിടെ ശബ്ദം സൃഷ്ടിക്കും.
വാർഡ്ഫോം ജനറേഷൻ
ആദ്യ ഇലക്ട്രോണിക് ടെക്സ്റ്റ് ടു സ്പീച് സിസ്റ്റങ്ങളിൽ ഓരോ ഫോനീത്തിനും പ്രത്യേക ശബ്ദങ്ങൾ ഉപയോഗിക്കുകയായിരുന്നു, ഇതുകൊണ്ട് ശബ്ദം അസ്വാഭാവികമായിരുന്ന, റൊബോട്ടിക്കൽ ശബ്ദമുണ്ടായിരുന്നു. ഭാഷാ വിശകലനം നൽകിയ ഫോനീങ്ങൾ ശബ്ദങ്ങളുള്ള ഡാറ്റാബേസിൽ നിന്ന് ലോഡ് ചെയ്ത് ചേർത്ത് ശബ്ദമാക്കാറായിരുന്നു.
✅ ഒരു പഠനം: ആദ്യകാല സ്പീച് സിന്തസിസ്(audio) ശബ്ദങ്ങൾ കണ്ടെത്തി, അവ ഇപ്പോഴത്തെ സ്മാർട്ട് അസിസ്റ്റന്റുകളിലെ മോഡേൺ ശബ്ദങ്ങൾക്കൊപ്പം താരതമ്യം ചെയ്യുക.
മോഡേൺ വാർഡ്ഫോം ജനറേഷൻ അമിതമായ ഡീപ് ലേണിങ്ങിൽ (വലിയ ന്യൂറൽ നെറ്റ്വർക്ക് പോലെ പ്രവർത്തിക്കുന്ന) അധിഷ്ഠിത ML മോഡലുകൾ ഉപയോഗിച്ച് മനുഷ്യന്റെ ശബ്ദങ്ങൾക്കുളള സാധാരണ സ്വരങ്ങൾ സൃഷ്ടിക്കുന്നു.
💁 ഈ ML മോഡലുകളിൽ ചിലത് ട്രാൻസ്ഫർ ലേണിംഗ് വഴി റീ-ട്രെയിനിങ്ങിനായി ഉപയോഗിക്കാവുന്നതാണ്. ഇതിന്റെ ഫലമായി, നിങ്ങളുടെ ശബ്ദത്തിന്റെ കുറച്ച് മിനുട്ടുകൾ റെക്കോർഡ് ചെയ്താൽ, ആരും നിങ്ങൾറെ ശബ്ദം അനുകരിക്കാൻ കഴിയും എന്ന് ബാങ്കുകൾ സുരക്ഷാ സിസ്റ്റമായി ശബ്ദം ഉപയോഗിക്കുന്നത് ഇനി നല്ല ആശയം അല്ല.
ഈ വലിയ ML മോഡലുകൾ മൂന്ന് ഘട്ടങ്ങളും ചേർത്തു ഒരു മൂല്യമുള്ള സ്പീച് സിന്തസൈസറായി പരിശീലിപ്പിക്കപ്പെടുന്നു.
ടൈമർ സെറ്റ് ചെയ്യുക
ടൈമർ സെറ്റ് ചെയ്യാൻ, നിങ്ങളുടെ IoT ഉപകരണത്തിൽ സേർവർലെസ് കോഡ് ഉപയോഗിച്ച് നിങ്ങൾ സൃഷ്ടിച്ച REST എൻഡ്പോയിന്റ് വിളിച്ചു, ലഭിച്ച സെക്കന്റ്കളുടെ ആകെ നമ്പർ ഉപയോഗിച്ച് ടൈമർ സെറ്റ് ചെയ്യേണ്ടതാണ്.
ടാസ്ക് - ടൈമർ സമയമായി സർവർലെസ് ഫംഗ്ഷൻ വിളിക്കുക
നിങ്ങളുടെ IoT ഉപകരണത്തിൽ നിന്നുള്ള REST എൻഡ്പോയിന്റ് 호출് ചെയ്ത് ആവശ്യമായ സമയത്തേക്ക് ടൈമർ സെറ്റ് ചെയ്യാൻ അനുയോജ്യമായ ഗൈഡ് പിന്തുടരുക:
ടെക്സ്റ്റ് സ്പീചിലേക്ക് മാറ്റുക
നിങ്ങൾ സംസാരത്തെ ടെക്സ്റ്റിലേക്ക് മാറ്റാൻ ഉപയോഗിച്ച സ്പീച്ച് സേവനം, ടെക്സ്റ്റിനെ വീണ്ടും സംസാരത്തിലേക്ക് മാറ്റാൻ ഉപയോഗിക്കാം, അത് നിങ്ങളുടെ IoT ഉപകരണത്തിലെ സ്പീക്കറിൽ പ്ലേ ചെയ്യാവുന്നതാണ്. ടെക്സ്റ്റ് конвер്ട് ചെയ്യേണ്ടത്, ആവശ്യമായ ഓഡിയോ തരം (ഊദാഹരണത്തിന് സാമ്പിൾ റേറ്റ്) എന്നിവയും കൂടെ സ്പീച്ച് സേവനത്തിന് അയയ്ക്കുന്നു, ബൈനറി ഡാറ്റയായി ഓഡിയോ ലഭിക്കുന്നു.
ഈ അഭ്യർത്ഥനം 보내ുമ്പോൾ, നിങ്ങൾ Speech Synthesis Markup Language (SSML) ഉപയോഗിക്കുന്നു, സ്പീച്ച് സിന്തസിസ് ആപ്ലിക്കേഷനുകൾക്കായി XML അടിസ്ഥാനത്തിലുള്ള മാർക്കപ് ലാംഗ്വേജ്. ഇത് ടെക്സ്റ്റിനെ മാറ്റേണ്ടത് മാത്രമല്ല, ടെക്സ്റ്റിന്റെ ഭാഷ, ഉപയോഗിക്കുന്ന ശബ്ദം, വാക്കുകളുടെ വേഗത, വാള്യം, പിച്ച് എന്നിവ നിർവചിക്കാൻ ഉപയോഗിക്കാം.
ഉദാഹരണത്തിന്, ഈ SSML നിർവചിക്കുന്നത് ബ്രിട്ടീഷ് ഇംഗ്ലീഷ് ശബ്ദം en-GB-MiaNeural ഉപയോഗിച്ച് "Your 3 minute 5 second timer has been set" എന്ന ടെക്സ്റ്റ് സംസാരത്തിലേക്ക് മാറ്റാനുള്ള അഭ്യർത്ഥനയാണ്
<speak version='1.0' xml:lang='en-GB'>
<voice xml:lang='en-GB' name='en-GB-MiaNeural'>
Your 3 minute 5 second time has been set
</voice>
</speak>
💁 പല ടെക്സ്റ്റ് ടു സ്പീച്ച് സിസ്റ്റങ്ങൾ വിവിധ ഭാഷകൾക്കായി അനേകം ശബ്ദങ്ങൾ ലഭ്യമാക്കുന്നു, ഉദാഹരണത്തിന് ബ്രിട്ടീഷൻ ഇംഗ്ലീഷിനും ന്യൂസീലൻഡ് ഇംഗ്ലീഷിനും യഥാർത്ഥ ഉച്ചാരണം ഉള്ള ശബ്ദങ്ങൾ.
ടാസ്ക് - ടെക്സ്റ്റ് ടു സ്പീച് മാറ്റുക
നിങ്ങളുടെ IoT ഉപകരണത്തിൽ നിന്നുള്ള ടെക്സ്റ്റ് സ്പീച്ചിലേക്ക് മാറ്റുന്നതിനായി അനുയോജ്യ ഗൈഡ് പാലിക്കുക:
- Arduino - Wio Terminal
- Single-board കമ്പ്യൂട്ടർ - Raspberry Pi
- Single-board കമ്പ്യൂട്ടർ - Virtual device
🚀 ചാലെഞ്ച്
SSML വാക്കുകൾ spoken ആയ്പോകുന്ന വിധം മാറ്റാൻ വഴികളും നൽകുന്നു, ഉദാഹരണത്തിന് ചില വാക്കുകൾക്ക് എമ്പഫസിസ് നൽകുക, ഇടവേളകൾ ചേർക്കുക, പിച്ച് മാറ്റുക. നിങ്ങളുടെ IoT ഉപകരണത്തിൽ നിന്ന് വ്യത്യസ്ത SSML അയച്ച് ഓരോ ഫലവും താരതമ്യം ചെയ്ത് പരീക്ഷിച്ച് നോക്കുക. SSML ന്ന്റെ വിശദാംശങ്ങൾ ഉൾപ്പെടെ വായിക്കാൻ Speech Synthesis Markup Language (SSML) Version 1.1 specification from the World Wide Web consortium കാണാം.
പോസ്റ്റ്-ലെചർ ക്വിസ്
അവലോകനം & സ്വയം പഠനം
- സ്പീച്ച് സിന്തസിസ്സ് туралы കൂടുതൽ വായിക്കുക വിക്കിയിലെ സ്പീച്ച് സിന്തസിസ് പേജ്
- ക്രിമിനലുകൾ എങ്ങനെ സ്പീച്ച് സിന്തസിസ്സ് ഉപയോഗിച്ച് മോഷണം ചെയ്യുന്നു എന്നതിനെക്കുറിച്ച് കൂടുതൽ fake voices 'help cyber crooks steal cash' BBC വാർത്ത വായിക്കുക
- സ്പീച്ച് സിന്തസിസ്സുകൾ ഉപയോഗിച്ച് ശബ്ദ അഭിനേതാക്കളെ എങ്ങനെ ഭീഷണിപ്പെടുത്തുന്നു എന്നതിനെ കുറിച്ച് പഠിക്കാൻ Viceയിലെ ഈ TikTok കേസ് എങ്ങനെ AI ശബ്ദ അഭിനേതാക്കളെ തട്ടിക്കൊള്ളുന്നതിനെക്കുറിച്ചുള്ള ലേഖനം വായിക്കുക
അസൈൻമെന്റ്
വിശയവിവരണം:
ഈ റീപ്പോർട്ട് Co-op Translator എന്ന എ.ഐ. വിവർത്തന സേവനം ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തിട്ടുള്ളതാണ്. കൃത്യതയ്ക്ക് ഞങ്ങൾ ശ്രമിക്കുന്നുവെങ്കിലും, യാന്ത്രിക വിവർത്തനങ്ങളിൽ തെറ്റുകളോ അകൃത്യതകളോ ഉണ്ടാകാം എന്ന് ദയവായി ശ്രദ്ധിക്കുക. മാതൃഭാഷയിലെ അസൽ രേഖയാണ് സത്യമുള്ള ഉറവിടം. നിർണായക വിവരങ്ങൾക്കായി പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിച്ചതിനെ തുടർന്ന് ഉണ്ടാകുന്ന ഏതൊരു തെറ്റിദ്ധാരണക്കും ഞങ്ങൾ ഉത്തരവാദിത്വം ഏറ്റെടുക്കുന്നില്ല.

