|
|
6 months ago | |
|---|---|---|
| .. | ||
| README.md | 6 months ago | |
| assignment.md | 6 months ago | |
| pi-text-to-speech.md | 6 months ago | |
| single-board-computer-set-timer.md | 6 months ago | |
| virtual-device-text-to-speech.md | 6 months ago | |
| wio-terminal-set-timer.md | 6 months ago | |
| wio-terminal-text-to-speech.md | 6 months ago | |
README.md
టైమర్ను సెట్ చేయండి మరియు మాట్లాడే స్పందన ఇవ్వండి
స్కెచ్ నోటు రచయిత నిత్య నరసింహన్. పెద్ద వెర్షన్ కోసం చిత్రం పై క్లిక్ చేయండి.
పాఠానికి ముందు క్విజ్
పరిచయం
స్మార్ట్ సహాయకులు ఒక మార్గ సంభాషణ సాధనాలు కాదు. మీరు వారితో మాట్లాడతారు, వారు స్పందిస్తారు:
"అలెక్సా, 3 నిమిషాల టైమర్ సెట్ చేయండి"
"సరే, మీ టైమర్ 3 నిమిషాలకి సెట్ చేయబడింది"
అంతిమ 2 పాఠాలలో మీరు మాట్లాడని స్వరం తీసుకుని టెక్స్ట్ గా మార్చటం, ఆ టెక్స్ట్ నుండి ఒక సెట్ టైమర్ అభ్యర్థనను పొందటం ఎలా చేయాలో నేర్చుకున్నారు. ఈ పాఠంలో మీరు IoT ఉపకరణంలో టైమర్ సెట్ చేయడం, వినియోగదారుని వారి టైమర్ నిర్ధారించుకొనే మాటలతో ప్రతిస్పందించటం, మరియు టైమర్ ముగిసినప్పుడు వారిని హెచ్చరించడం నేర్పుకుంటారు.
ఈ పాఠంలో మేము కవర్ చేస్తాము:
టెక్స్ట్ నుండి మాటలకు
పేరే సూచిస్తున్నట్లుగా, టెక్స్ట్ నుండి మాటలకు అనేది టెక్స్ట్ను మాట్లాడే మాటలుగా మార్చే ప్రక్రియ. ప్రాథమిక సూత్రం టెక్స్ట్ లో ఉన్న పదాలను వాటి మూలధ్వనులుగా (ఫోనీమ్లు అని పిలవబడును) విడగొట్టి ఆ ధ్వనులను ప్రీ-రికార్డెడ్ ఆడియో లేదా AI మోడల్స్ ద్వారా తయారుచేసిన ఆడియోతో కలిపి చెబుతుంది.
టెక్స్ట్ నుండి మాటలకు వ్యవస్థలు సాధారణంగా 3 దశలలో ఉంటాయి:
- టెక్స్ట్ విశ్లేషణ
- భాషా విశ్లేషణ
- వేవ్-ఫారం తయారీ
టెక్స్ట్ విశ్లేషణ
టెక్స్ట్ విశ్లేషణ అంటే అందించిన టెక్స్ట్ను మాటలకు మార్చటానికి ఉపయోగపడే పదాలుగా మార్చడం. ఉదాహరణకి, "Hello world" ను మార్చేటప్పుడు టెక్స్ట్ విశ్లేషణ అవసరం లేదు, రెండు పదాలను మాటలకు మార్చడం సాధ్యం. కానీ "1234" వస్తే, సందర్భానుసారం దీనిని "One thousand, two hundred thirty four" లేదా "One, two, three, four" గా మార్చాలి. "I have 1234 apples" అయితే "One thousand, two hundred thirty four" గా, మరియు "The child counted 1234" అయితే "One, two, three, four" గా ఉంటుంది.
పదాలు భాషకు మాత్రమే కాకుండా ఆ భాష యొక్క ప్రాంతీయ ప్రాంతానికి కూడా ఆధారపడి మారుతాయి. ఉదాహరణకి, అమెరికన్ ఇంగ్లీష్లో 120 అంటే "One hundred twenty", బ్రిటిష్ ఇంగ్లీష్లో అదేమిటంటే "One hundred and twenty", ఈ "and" వర్డ్ హమాత్రం వాడబడుతుంది.
✅ ఇంకో కొన్ని ఉదాహరణలు: "in" అంటే అంగుళం యొక్క సంక్షిప్త రూపం, "st" అంటే సెంటు లేదా వీధి కోసం సంక్షిప్తం. మీ భాషలో సందర్భం లేకుండా అర్థం గందరగోళమైన పదాలు ఉన్నాయా? ఆలోచించండి.
పదాలు నిర్ణయించాక భాషా విశ్లేషణకి పంపుతారు.
భాషా విశ్లేషణ
భాషా విశ్లేషణ పదాలను ఫోనీమ్లుగా విభజిస్తుంది. ఫోనీమ్లు కేవలం అక్షరాల మీద కాదు, ఆ మాటలో ఉపయోగించిన ఇతర అక్షరాల ఆధారంగా ఉంటాయి. ఉదాహరణకి, ఇంగ్లీష్ లో 'car' లో "a" శబ్దం మరియు 'care' లో "a" శబ్దం వేరు. ఇంగ్లీష్ భాషలో 26 అక్షరాలకు 44 వివిధ ఫోనీమ్లు ఉంటాయి, వాటిలో కొద్ది కొన్ని వేర్వేరు అక్షరాలకు సామాన్యమైనవి, ఉదాహరణకి 'circle' మరియు 'serpent' మొదటిసారిలో ఉపయోగించే ఒకే ఫోనీమ్.
✅ పరిశోధన చేయండి: మీ భాషకు సంబంధించిన ఫోనీమ్లు ఏమిటి?
ఫోనీమ్లుగా మార్చిన తరువాత, ఇవి ఉచ్ఛారణ కోసం అదనపు సమాచారం అవసరం, అలాగే సందర్భాన్ని బట్టి టోన్ లేదా వ్యవధిని సర్దుబాటు చేస్తుంది. ఉదాహరణకి ఇంగ్లీష్ లో ప్రశ్న మాటగా టోన్ పెరుగుతుంటుంది, చివరి పదాన్ని ఎత్తెత్తి చెప్పటం ప్రశ్న సూచన.
ఉదాహరణకి - "You have an apple" అనే వాక్యం ఒక ప్రకటన, మీరు ఒక ఆపిల్ కలిగి ఉన్నారు అని చెప్పడం. టోన్ చివరికి పెరిగి "apple" పదం మీద పెరిగితే ప్రశ్నగా మారుతుంది "You have an apple?" అంటే మీకు ఆపిల్ ఉందా అని అడుగు. భాషా విశ్లేషణ పదంలో ఉన్న ప్రశ్నార్థక గుర్తు ఆధారంగా టోన్ పెంచటం నిర్ణయించాలి.
ఫోనీమ్లు రూపొందిన తరువాత, ఆడియో వైవ్-ఫారం తయారీకి పంపుతారు.
వేవ్-ఫారం తయారీ
ప్రాథమిక ఎలక్ట్రానిక్ టెక్స్ట్-మాటల వ్యవస్థలు ప్రతి ఫోనీమ్ కు వేర్వేరు ఆడియో రికార్డింగ్స్ ఉపయోగించేవి, దీని వలన కుండదల్లె, యాంత్రిక శబ్దాలతో కూడిన వాయిస్లు వస్తాయి. భాషా విశ్లేషణ ఫోనీమ్లు తయారుచేసి, వాటి సరిపోయే శబ్దాలను డేటాబేస్ నుండి తీసుకొని కలిపి ఆడియో తయారుచేస్తుంది.
✅ పరిశోధన చేయండి: మొదటి మాటల సింథసిస్ వ్యవస్థల ఆడియో రికార్డింగ్స్ కనుగొని వాటిని స్మార్ట్ సహాయకుల ఆధునిక మాటల సింథసిస్ తో తులనాచేద్దాము.
ఆధునిక వేవ్-ఫారం తయారీ దీప లెర్నింగ్ ఆధారిత ML మోడల్స్ ఉపయోగిస్తుంది (మేధస్సులో న్యూరాన్లా ప్రవర్తించే గాఢ న్యూరల్ నెట్వర్క్లు), ఇవి మానవులని పోలిన సహజ శబ్దాల వాయిస్లను తయారుచేస్తాయి.
💁 కొన్ని ఈ ML మోడల్స్ ట్రాన్స్ఫర్ లెర్నింగ్ ద్వారా నిజమైన వ్యక్తుల వంటివి రూపొందించుకొనటానికి మళ్లీ శిక్షణ పొందవచ్చు. దీని వలన వాయిస్ను భದ్రతా వ్యవస్థగా ఉపయోగించడం ఇప్పుడు మంచిది కాదు, ఎందుకంటే ఎవరు మీ వాయిస్ యొక్క కొద్దిగా రికార్డింగ్ తో మీ ప్రసారం చేయవచ్చు.
ఈ భారీ ML మోడల్స్ మూడు దశలను తీసుకొని ఎండ్-టు-ఎండ్ మాటల సింథసైజర్లు రూపొందిస్తున్నాయి.
టైమర్ సెట్ చేయండి
టైమర్ సెట్ చేయడానికి, మీ IoT డివైస్ మీరు సృష్టించిన సర్వర్లెస్ కోడ్ ఉపయోగించి REST ఎండ్పాయింట్ ని పిలవాలి, ఆ తర్వాత వచ్చిన సెకన్ల సంఖ్యను ఉపయోగించి టైమర్ సెట్ చేయాలి.
కార్యం - సర్వర్లెస్ ఫంక్షన్ కాల్ చేసి టైమర్ సమయం పొందండి
మీ IoT డివైస్ నుండి REST ఎండ్పాయింట్ ను కాల్ చేసి అవసరమైన సమయానికి టైమర్ ను సెట్ చేయడానికి సంబంధిత గైడ్ను అనుసరించండి:
టెక్స్ట్ నుండి మాటలకు మార్చడం
మీరు మాట్లాడిన స్వరాన్ని టెక్స్ట్ గా మార్చినట్లే, ఈ అదే మాటల సేవ టెక్స్ట్ను తిరిగి మాటలుగా మార్చడానికి ఉపయోగించవచ్చు, ఇది మీ IoT పరికరంలో ఉన్న స్పీకర్ ద్వారా ప్లే చేయవచ్చు. మార్చవలసిన టెక్స్ట్ ని ఆ మాటల సేవకు పంపి, కావాల్సిన ఆడియో రకం (ఉదాహరణకి సాంపిల్ రేటు) మరియు ఆడియో бинарి డేటా తిరిగి పొందవచ్చు.
ఈ అభ్యర్థనను మీరు Speech Synthesis Markup Language (SSML) ఉపయోగించి పంపుతారు, ఇది మాటల సింథసిస్ అప్లికేషన్ల కోసం XML ఆధారిత మార్కప్ భాష. ఇది మార్చవలసిన టెక్స్ట్ మాత్రమే కాకుండా, భాష, వాడవలసిన వాయిస్, మాటల వేగం, వాల్యూమ్, పిచ్ వంటి లక్షణాలను కూడా నిర్వచించవచ్చు.
ఉదాహరణకి, ఈ SSML అభ్యర్థన "Your 3 minute 5 second time has been set" అనే టెక్స్ట్ను బ్రిటిష్ ఇంగ్లీష్ వాయిస్ en-GB-MiaNeural తో మాటలుగా మార్చమని నిర్వచిస్తుంది
<speak version='1.0' xml:lang='en-GB'>
<voice xml:lang='en-GB' name='en-GB-MiaNeural'>
Your 3 minute 5 second time has been set
</voice>
</speak>
💁 చాలా టెక్స్ట్ నుండి మాటలకు వ్యవస్థలకు విభిన్న భాషల కోసం పలు వాయిస్లు ఉంటాయి, వాటిలో సంబంధిత ఉచ్చారణలతో, ఉదాహరణకి బ్రిటిష్ ఇంగ్లీష్ వాయిస్ కు ఇంగ్లీష్ ఉచ్చారణ మరియు న్యూజిలాండ్ ఇంగ్లీష్ వాయిస్ కు న్యూజిలాండ్ ఉచ్చారణ ఉంటుంది.
కార్యం - టెక్స్ట్ నుండి మాటలకు మార్చండి
మీ IoT డివైస్ ఉపయోగించి టెక్స్ట్ను మాటలకు మార్చడానికి సంబంధిత గైడ్ ద్వారా పని చేయండి:
- Arduino - Wio Terminal
- సింగిల్ బోర్డ్ కంప్యూటర్ - Raspberry Pi
- సింగిల్ బోర్డ్ కంప్యూటర్ - వర్చువల్ డివైస్
🚀 సవాలు
SSML మాటలను ఎలా పలకడం మారుస్తుందో మార్గాలు ఉన్నాయి, ఉదాహరణకి కొన్ని పదాలకు ప్రత్యేక భారం చేకూర్చడం, విరామాలు పెట్టడం, లేదా పిచ్ మార్చడం. ఈ విషయాలు ప్రయత్నించి, మీ IoT డివైస్ నుండి వేరే వేరే SSML పంపించి అవుట్పుట్ను పోల్చండి. SSML గురించి మరింత చదవడానికి, Speech Synthesis Markup Language (SSML) Version 1.1 specification from the World Wide Web consortium చూడండి.
పాఠం తర్వాత క్విజ్
సమీక్ష & స్వీయఅధ్యానం
- వికీపీడియా లో మాటల సింథసిస్ పై మరింత చదవండి
- బీబీసీ న్యూస్ లో ఉల్లేఖించిన, క్రిమినల్స్ మాటల సింథసిస్ ఉపయోగించి రుసుము దొంగిలించడం గురించి కథ
- వాయిస్ నటుల వాయిస్ల సింథసిస్ ద్వారా హానీ గురించి వివిధ వ్యాసాలు, ఉద్దాహరణకి టిక్టాక్ దావా గురించి వ్యాసం
అసైన్మెంట్
అసౌకర్యసహిత నివేదిక: ఈ పత్రం AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నించినప్పటికీ, స్వయంచాలక అనువాదాల్లో పొరపాట్లు లేదా తప్పులు ఉండొచ్చు. మూర్ఖ భాషలో ఉన్న అసలు పత్రం అధికారిక మూలంగా పరిగణించబడాలి. కీలకమైన సమాచారం కోసం, వృత్తిపరమైన మానవ అనువాదాన్ని షిఫారసు చేయబడుతుంది. ఈ అనువాదం వల్ల ఏర్పడే ఏవైనా అవగాహన లోపాలు లేదా తప్పులు కోసం మేము బాధ్యత వహించము.

