You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/ml/6-consumer/lessons/3-spoken-feedback
localizeflow[bot] 8671d5c4aa
chore(i18n): sync translations with latest source changes (#571)
6 months ago
..
README.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
assignment.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-text-to-speech.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
single-board-computer-set-timer.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-text-to-speech.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-set-timer.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-text-to-speech.md chore(i18n): sync translations with latest source changes (#571) 6 months ago

README.md

ടൈമർ സെറ്റ് ചെയ്യുക এবং പോഡ് ഫീഡ്‌బാക്ക് നൽകുക

ഈ പാഠത്തിന്റെ സ്കെച്‌നോട്ട് അവലോകനം

സ്കെച്‌നോട്ട് Nitya Narasimhan തയ്യാറാക്കിയതാണ്. വലിയ പതിപ്പ് കാണാൻ ചിത്രത്തെ ക്ലിക്ക് ചെയ്യുക.

പ്രീ-ലെചർ ക്വിസ്

പ്രീ-ലെചർ ക്വിസ്

പരിചയം

സ്മാർട്ട് അസിസ്റ്റന്റുകൾ ഒരുവശം ബന്ധപ്പെടുന്ന ഉപകരണങ്ങളല്ല. നിങ്ങൾ അവയ്‌ക്ക് സംസാരിക്കും, അവ വരെ മറുപടി നൽകും:

"ആലക്സ, 3 മിനിട്ട് ടൈമർ സെറ്റ് ചെയ്യൂ"

"ശരി, നിങ്ങളുടെ ടൈമർ 3 മിനിട്ട് സെറ്റ് ചെയ്തു"

മുമ്പത്തെ 2 പാഠങ്ങളിൽ നിങ്ങൾ സംസാരത്തെ ടെക്സ്റ്റിലേക്ക് മാറ്റുന്നത് പഠിച്ചു, പിന്നെ അതിൽ നിന്നും ടൈമർ സെറ്റ് ചെയ്യാനുള്ള അഭ്യർത്ഥന പിടിച്ചെടുക്കുന്നത് അഭ്യസിച്ചു. ഈ പാഠത്തിൽ, നിങ്ങൾ IoT ഉപകരണത്തിൽ ടൈമർ എങ്ങനെ സെറ്റ് ചെയ്യാമെന്ന് പഠിക്കാം, ഉപയോക്താവിന് അവരുടെ ടൈമർ സ്ഥിരീകരിക്കുന്ന വാക്കുകളിലൂടെ പ്രതികരിക്കുകയും ടൈമർ തീർന്നപ്പോൾ അവരെ അറിയിക്കുകയും ചെയ്യുന്നതും.

ഈ പാഠത്തിൽ ചർച്ച ചെയ്യുന്നത്:

ടെക്സ്റ്റ് ടു സ്പീച്

നാമം സൂചിപ്പിക്കുന്നതുപോലെ ടെക്സ്റ്റ് ടു സ്പീച് എന്നത് ടെക്സ്റ്റിനെ സംസാരിക്കപ്പെടുന്ന വാക്കുകളായ ശബ്ദത്തിലേക്ക് മാറ്റാനുള്ള പ്രക്രിയയാണ്. അടിസ്ഥാന തത്വം ടെക്സ്റ്റിലെ വാക്കുകളെ അവയുടെ ഘടക ശബ്ദങ്ങളായ ഫോനീമുകളായി വിഭജിച്ച്, ആ ശബ്ദങ്ങൾക്ക് പ്രീ-റെക്കോർഡുചെയ്ത ശബ്ദമായാലോ AI മോഡലുകൾ ഉപയോഗിച്ച് സൃഷ്ടിച്ച ശബ്ദമായാലോ ചേര്‍ക്കുന്നതാണ്.

സാധാരണ ടെക്സ്റ്റ് ടു സ്പീച് സിസ്റ്റങ്ങളിലെ മൂന്ന് ഘട്ടങ്ങൾ

ടെക്സ്റ്റ് ടു സ്പീച് സിസ്റ്റങ്ങൾ സാധാരണയായി മൂന്ന് ഘട്ടങ്ങൾ ഉണ്ടാക്കുന്നു:

  • ടെക്സ്റ്റ് വിശകലനം
  • ഭാഷാ വിശകലനം
  • വാർഫ്‌ോം ജനറേഷൻ

ടെക്സ്റ്റ് വിശകലനം

ടെക്സ്റ്റ് വിശകലനം അതായത് നൽകപ്പെട്ട ടെക്സ്റ്റിനെ സംസാരത്തിലേക്ക് പരിവർത്തനം ചെയ്യാൻ ഉപയോഗിക്കുന്ന വാക്കുകളായി മാറ്റുക. ഉദാഹരണത്തിന്, "Hello world" എന്ന് മാറ്റുമ്പോൾ പ്രത്യേക ടെക്സ്റ്റ് വിശകലനം ആവശ്യമില്ല, ആ രണ്ട് വാക്കുകൾ നേരിട്ട് സംസാരത്തിലേക്ക് മാറ്റാം. പക്ഷേ "1234" എന്ന varsa സ്ഥിതിയിൽ, കോൺടക്‌സ്റ്റിൽ ആശ്രയിച്ച് അത് "One thousand, two hundred thirty four" അല്ലെങ്കിൽ "One, two, three, four" എന്നിങ്ങനെയായി മാറ്റണം. "I have 1234 apples" എന്നപ്പോൾ അത് "One thousand, two hundred thirty four" ആകും, പക്ഷേ "The child counted 1234" ന്റെ അവസരത്തിൽ "One, two, three, four" ആകും.

വാക്കുകളുടെ സൃഷ്ടി മാത്രമല്ല ഭാഷയ്ക്കും പ്രദേശത്തിനും വ്യത്യാസമാകുന്നു. ഉദാഹരണത്തിന്, അമേരിക്കൻ ഇംഗ്ലീഷിൽ 120 എന്ന് "One hundred twenty", ബ്രിട്ടീഷ് ഇംഗ്ലീഷിൽ "One hundred and twenty" എന്നാണ്, "and" ന്റെ ഉപയോഗം ഹണ്ട്രെഡ് കഴിഞ്ഞ് വരുന്ന സന്ദർഭത്ത്.

മറ്റൊരു ഉദാഹരണം: "in" എന്നത് inch എന്നതിന് ചുരുണ്ട രൂപമാണ്, "st" എന്ന് saint അല്ലെങ്കിൽ street എന്നതിന് ചുരുണ്ട രൂപമാണ്. നിങ്ങളുടെ ഭാഷയിൽ കോൺടക്‌സ്റ്റ് ഇല്ലാതെ അസ്പഷ്ടമായ മറ്റ് വാക്കുകൾ നിങ്ങൾക്ക് തോന്നുമോ?

വാക്കുകൾ നിർവ്വചിക്കപ്പെട്ടപ്പോൾ, അവ ഭാഷാ വിശകലനത്തിന് അയക്കപ്പെടുന്നു.

ഭാഷാ വിശകലനം

ഭാഷാ വിശകലനം വാക്കുകളെ ഫോനീമുകളായി വിഭജിക്കുന്നു. ഫോനീങ്ങൾ അക്ഷരങ്ങൾ മാത്രമല്ല, വാക്കിലെ മറ്റ് അക്ഷരങ്ങൾ കൂടി ആശ്രയിച്ച് ഉണ്ടാകുന്നു. ഉദാഹരണത്തിന്, ഇംഗ്ലീഷിൽ 'car' യിലാണ് 'a' ശബ്ദവും 'care' യിലുള്ള 'a' ശബ്ദവും വ്യത്യാസമുണ്ട്. ഇംഗ്ലീഷിനു മൂന്ന് തരം ആക്ഷരമാല അക്ഷരങ്ങളിൽ 44 ഫോനീങ്ങൾ ഉണ്ട്, ചിലപ്പോൾ വിവിധ അക്ഷരങ്ങൾ ഒരേ ഫോനീം പങ്കിടുന്നു, ഉദാഹരണമായി 'circle' ഉം 'serpent' ഉം ആരംഭിക്കുന്ന ഫോനീങ്ങൾ ഒരുപോലെയാണ്.

ഒരു പഠനം: നിങ്ങളുടെ ഭാഷയിലെ ഫോനീങ്ങൾ എന്തൊക്കെയാണ്?

ഫോണീമുകളാക്കപ്പെട്ട് കഴിഞ്ഞാൽ, ടോണും കാലാവധിയും കോൺടക്‌സ്റ്റിൽ ആനുസരിച്ച് ക്രമീകരിക്കാൻ അധിക ഡാറ്റ ആവശ്യമുണ്ട്. ഉദാഹരണത്തിന്, ഇംഗ്ലീഷിൽ ചോദ്യം ചിഹ്നം ഉപയോഗിച്ചുള്ള വാക്കിന്റെ പിറവിയിൽ ഉയർന്ന ശബ്ദം ഒരു ചോദ്യം ആയി മാറ്റാൻ ഉപയോഗിക്കാം.

ഉദാഹരണം - "You have an apple" എന്നുപറഞ്ഞാൽ ആകെയുള്ള പ്രസ്താവനയാണ് നിങ്ങൾക്കൊരു ആപ്പിൾ ഉണ്ടെന്ന്. പിച്ചിന്റെ ഉയർച്ച വാക്കിന്റെ അവസാനം പ്രയോഗിച്ചാൽ, "You have an apple?" എന്ന ചോദ്യം ആകും. ഭാഷാ വിശകലനം ഇതു മനസ്സിലാക്കി പിച്ചിന്റെ ഉയർച്ച നിർമാണിക്കും.

ഫോണീമുകൾ ജനറേറ്റ് ചെയ്തപ്പോൾ, അവ വാർഡ്‌ഫോം ജനറേഷനിലേക്കു അയയ്ക്കാം, അവിടെ ശബ്ദം സൃഷ്ടിക്കും.

വാർഡ്‌ഫോം ജനറേഷൻ

ആദ്യ ഇലക്ട്രോണിക് ടെക്സ്റ്റ് ടു സ്പീച് സിസ്റ്റങ്ങളിൽ ഓരോ ഫോനീത്തിനും പ്രത്യേക ശബ്ദങ്ങൾ ഉപയോഗിക്കുകയായിരുന്നു, ഇതുകൊണ്ട് ശബ്ദം അസ്വാഭാവികമായിരുന്ന, റൊബോട്ടിക്കൽ ശബ്ദമുണ്ടായിരുന്നു. ഭാഷാ വിശകലനം നൽകിയ ഫോനീങ്ങൾ ശബ്ദങ്ങളുള്ള ഡാറ്റാബേസിൽ നിന്ന് ലോഡ് ചെയ്ത് ചേർത്ത് ശബ്ദമാക്കാറായിരുന്നു.

ഒരു പഠനം: ആദ്യകാല സ്പീച് സിന്തസിസ്(audio) ശബ്ദങ്ങൾ കണ്ടെത്തി, അവ ഇപ്പോഴത്തെ സ്മാർട്ട് അസിസ്റ്റന്റുകളിലെ മോഡേൺ ശബ്ദങ്ങൾക്കൊപ്പം താരതമ്യം ചെയ്യുക.

മോഡേൺ വാർഡ്‌ഫോം ജനറേഷൻ അമിതമായ ഡീപ് ലേണിങ്ങിൽ (വലിയ ന്യൂറൽ നെറ്റ്‌വർക്ക് പോലെ പ്രവർത്തിക്കുന്ന) അധിഷ്ഠിത ML മോഡലുകൾ ഉപയോഗിച്ച് മനുഷ്യന്റെ ശബ്ദങ്ങൾക്കുളള സാധാരണ സ്വരങ്ങൾ സൃഷ്ടിക്കുന്നു.

💁 ഈ ML മോഡലുകളിൽ ചിലത് ട്രാൻസ്ഫർ ലേണിംഗ് വഴി റീ-ട്രെയിനിങ്ങിനായി ഉപയോഗിക്കാവുന്നതാണ്. ഇതിന്റെ ഫലമായി, നിങ്ങളുടെ ശബ്ദത്തിന്റെ കുറച്ച് മിനുട്ടുകൾ റെക്കോർഡ് ചെയ്താൽ, ആരും നിങ്ങൾറെ ശബ്ദം അനുകരിക്കാൻ കഴിയും എന്ന് ബാങ്കുകൾ സുരക്ഷാ സിസ്റ്റമായി ശബ്ദം ഉപയോഗിക്കുന്നത് ഇനി നല്ല ആശയം അല്ല.

ഈ വലിയ ML മോഡലുകൾ മൂന്ന് ഘട്ടങ്ങളും ചേർത്തു ഒരു മൂല്യമുള്ള സ്പീച് സിന്തസൈസറായി പരിശീലിപ്പിക്കപ്പെടുന്നു.

ടൈമർ സെറ്റ് ചെയ്യുക

ടൈമർ സെറ്റ് ചെയ്യാൻ, നിങ്ങളുടെ IoT ഉപകരണത്തിൽ സേർവർലെസ് കോഡ് ഉപയോഗിച്ച് നിങ്ങൾ സൃഷ്ടിച്ച REST എൻഡ്‌പോയിന്റ് വിളിച്ചു, ലഭിച്ച സെക്കന്റ്‌കളുടെ ആകെ നമ്പർ ഉപയോഗിച്ച് ടൈമർ സെറ്റ് ചെയ്യേണ്ടതാണ്.

ടാസ്ക് - ടൈമർ സമയമായി സർവർലെസ് ഫംഗ്ഷൻ വിളിക്കുക

നിങ്ങളുടെ IoT ഉപകരണത്തിൽ നിന്നുള്ള REST എൻഡ്‌പോയിന്റ് 호출് ചെയ്ത് ആവശ്യമായ സമയത്തേക്ക് ടൈമർ സെറ്റ് ചെയ്യാൻ അനുയോജ്യമായ ഗൈഡ് പിന്തുടരുക:

ടെക്സ്റ്റ് സ്പീചിലേക്ക് മാറ്റുക

നിങ്ങൾ സംസാരത്തെ ടെക്സ്റ്റിലേക്ക് മാറ്റാൻ ഉപയോഗിച്ച സ്പീച്ച് സേവനം, ടെക്സ്റ്റിനെ വീണ്ടും സംസാരത്തിലേക്ക് മാറ്റാൻ ഉപയോഗിക്കാം, അത് നിങ്ങളുടെ IoT ഉപകരണത്തിലെ സ്പീക്കറിൽ പ്ലേ ചെയ്യാവുന്നതാണ്. ടെക്സ്റ്റ് конвер്‌ട് ചെയ്യേണ്ടത്, ആവശ്യമായ ഓഡിയോ തരം (ഊദാഹരണത്തിന് സാമ്പിൾ റേറ്റ്) എന്നിവയും കൂടെ സ്പീച്ച് സേവനത്തിന് അയയ്ക്കുന്നു, ബൈനറി ഡാറ്റയായി ഓഡിയോ ലഭിക്കുന്നു.

ഈ അഭ്യർത്ഥനം 보내ുമ്പോൾ, നിങ്ങൾ Speech Synthesis Markup Language (SSML) ഉപയോഗിക്കുന്നു, സ്പീച്ച് സിന്തസിസ് ആപ്ലിക്കേഷനുകൾക്കായി XML അടിസ്ഥാനത്തിലുള്ള മാർക്കപ് ലാംഗ്വേജ്. ഇത് ടെക്സ്റ്റിനെ മാറ്റേണ്ടത് മാത്രമല്ല, ടെക്സ്റ്റിന്റെ ഭാഷ, ഉപയോഗിക്കുന്ന ശബ്ദം, വാക്കുകളുടെ വേഗത, വാള്യം, പിച്ച് എന്നിവ നിർവചിക്കാൻ ഉപയോഗിക്കാം.

ഉദാഹരണത്തിന്, ഈ SSML നിർവചിക്കുന്നത് ബ്രിട്ടീഷ് ഇംഗ്ലീഷ് ശബ്ദം en-GB-MiaNeural ഉപയോഗിച്ച് "Your 3 minute 5 second timer has been set" എന്ന ടെക്സ്റ്റ് സംസാരത്തിലേക്ക് മാറ്റാനുള്ള അഭ്യർത്ഥനയാണ്

<speak version='1.0' xml:lang='en-GB'>
    <voice xml:lang='en-GB' name='en-GB-MiaNeural'>
        Your 3 minute 5 second time has been set
    </voice>
</speak>

💁 പല ടെക്സ്റ്റ് ടു സ്പീച്ച് സിസ്റ്റങ്ങൾ വിവിധ ഭാഷകൾക്കായി അനേകം ശബ്ദങ്ങൾ ലഭ്യമാക്കുന്നു, ഉദാഹരണത്തിന് ബ്രിട്ടീഷൻ ഇംഗ്ലീഷിനും ന്യൂസീലൻഡ് ഇംഗ്ലീഷിനും യഥാർത്ഥ ഉച്ചാരണം ഉള്ള ശബ്ദങ്ങൾ.

ടാസ്ക് - ടെക്സ്റ്റ് ടു സ്പീച് മാറ്റുക

നിങ്ങളുടെ IoT ഉപകരണത്തിൽ നിന്നുള്ള ടെക്സ്റ്റ് സ്പീച്ചിലേക്ക് മാറ്റുന്നതിനായി അനുയോജ്യ ഗൈഡ് പാലിക്കുക:


🚀 ചാലെഞ്ച്

SSML വാക്കുകൾ spoken ആയ്പോകുന്ന വിധം മാറ്റാൻ വഴികളും നൽകുന്നു, ഉദാഹരണത്തിന് ചില വാക്കുകൾക്ക് എമ്പഫസിസ് നൽകുക, ഇടവേളകൾ ചേർക്കുക, പിച്ച് മാറ്റുക. നിങ്ങളുടെ IoT ഉപകരണത്തിൽ നിന്ന് വ്യത്യസ്ത SSML അയച്ച് ഓരോ ഫലവും താരതമ്യം ചെയ്ത് പരീക്ഷിച്ച് നോക്കുക. SSML ന്ന്റെ വിശദാംശങ്ങൾ ഉൾപ്പെടെ വായിക്കാൻ Speech Synthesis Markup Language (SSML) Version 1.1 specification from the World Wide Web consortium കാണാം.

പോസ്റ്റ്-ലെചർ ക്വിസ്

പോസ്റ്റ്-ലെചർ ക്വിസ്

അവലോകനം & സ്വയം പഠനം

അസൈൻമെന്റ്

ടൈമർ റദ്ദാക്കുക


വിശയവിവരണം:
ഈ റീപ്പോർട്ട് Co-op Translator എന്ന എ.ഐ. വിവർത്തന സേവനം ഉപയോഗിച്ച് വിവർത്തനം ചെയ്തിട്ടുള്ളതാണ്. കൃത്യതയ്ക്ക് ഞങ്ങൾ ശ്രമിക്കുന്നുവെങ്കിലും, യാന്ത്രിക വിവർത്തനങ്ങളിൽ തെറ്റുകളോ അകൃത്യതകളോ ഉണ്ടാകാം എന്ന് ദയവായി ശ്രദ്ധിക്കുക. മാതൃഭാഷയിലെ അസൽ രേഖയാണ് സത്യമുള്ള ഉറവിടം. നിർണായക വിവരങ്ങൾക്കായി പ്രൊഫഷണൽ മനുഷ്യ വിവർത്തനം ശുപാർശ ചെയ്യപ്പെടുന്നു. ഈ വിവർത്തനം ഉപയോഗിച്ചതിനെ തുടർന്ന് ഉണ്ടാകുന്ന ഏതൊരു തെറ്റിദ്ധാരണക്കും ഞങ്ങൾ ഉത്തരവാദിത്വം ഏറ്റെടുക്കുന്നില്ല.