You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/te/6-consumer/lessons/1-speech-recognition/README.md

229 lines
40 KiB

This file contains ambiguous Unicode characters!

This file contains ambiguous Unicode characters that may be confused with others in your current locale. If your use case is intentional and legitimate, you can safely ignore this warning. Use the Escape button to highlight these characters.

# ఓ ఐఓటీ పరికరంతో మాట గుర్తించండి
![ఈ పాఠం యొక్క స్కెచ్‍నోట్ అవలోకనం](../../../../../translated_images/te/lesson-21.e34de51354d6606f.webp)
> స్కెచ్‍నోట్: [నిత్య నరసింహన్](https://github.com/nitya). పెద్దవర్షన్ కోసం చిత్రాన్ని క్లిక్ చేయండి.
ఈ వీడియో అజ్యూర్ స్పీచ్ సర్వీస్ యొక్క ఓవerviewని ఇస్తుంది, ఇది ఈ పాఠంలో కవర్ చేయబడుతుంది:
[![Microsoft Azure YouTube చానెల్ నుండి మీ Cognitive Services Speech వనరును ఉపయోగించడం ఎలా ప్రారంభించాలో](https://img.youtube.com/vi/iW0Fw0l3mrA/0.jpg)](https://www.youtube.com/watch?v=iW0Fw0l3mrA)
> 🎥 వీడియో చూడటానికి పై చిత్రాన్ని క్లిక్ చేయండి
## పాఠం ముందు పర్యాయపరీక్ష
[పాఠం ముందు పర్యాయపరీక్ష](https://black-meadow-040d15503.1.azurestaticapps.net/quiz/41)
## పరిచయం
'అలెక్సా, 12 నిమిషాల టైమర్‌ను సెట్ చేయు'
'అలెక్సా, టైమర్ స్థితి'
'అలెక్సా, steam broccoli అనే 8 నిమిషాల టైమర్‌ను సెట్ చేయు'
స్మార్ట్ పరికరాలు ఎక్కువగా ప్రాచుర్యం పొందుతున్నాయి. హోమ్‌పాడ్స్, ఎకోస్ మరియు గూగుల్ హోమ్స్ వంటి స్మార్ట్ స్పీకర్లుగా కాకుండా, మా ఫోన్లు, గడియారాలు, తక్కువ వెలుతురు, థర్మోస్టాట్లు వంటి పరికరాల్లోనూ ఉన్నాయి.
> 💁 నా ఇల్లలో కనీసం 19 పరికరాల్లో వాయిస్ అసిస్టెంట్ ఉంది, అవి నాకు తెలుసు!
వాయిస్ కన్ట్రోల్, కదలిక పరిమితులు ఉన్నవారికి పరికరాలతో సహజంగా పాటుకోవడానికి వీలుగా సౌలభ్యాన్ని పెంచుతుంది. ఇది జన్మతోనే చేయకపోవడం వంటి శాశ్వత వైకల్యం నుండి, విరిగిన చట్టాల వంటి తాత్కాలిక వైకల్యం వరకు లేకపోతే చేతులు బాగా బాపట్లు లేదా పిల్లలతో నిండిపోయినపుడు కూడా, నడుస్తున్న వాయిస్‌తో మన ఇళ్ళను నియంత్రించడం ప్రపంచాన్ని సులభతరంగా చేస్తుంది. "హే సిరీ, నా గ్యారేజ్ డోర్ మూసివేసు" అన్నదీ, ఒక పిల్లోడిని మార్చడం మరియు అహం చేసే అమ్మాయితో సహాయపడటానికి చిన్న కానీ సమర్థవంతమైన మార్పు.
వాయిస్ అసిస్టెంట్లలో ఒకటి ఎక్కువగా ఉపయోగించేది టైమర్లను సెట్ చేయటం, ముఖ్యంగా వంట గది టైమర్లు. మీ వాయిస్‌తో మాత్రమే బహుళ టైమర్లను సెట్ చేయగలగడం వంటగదిలో భారీ సహాయం - డౌ గమ్మరించటం, సూప్ కలపటం ఆపకుండా లేదా మీ చేతులు నెమ్మదిగా ఉండకుండా టైమర్ని ఉపయోగించడం అవసరం లేదు.
ఈ పాఠంలో మీరు ఓ ఐఓటీ పరికరాల్లో వాయిస్ గుర్తింపును ఎలా నిర్మించాలో నేర్చుకుంటారు. మీరు మైక్రోఫోన్లను సెన్సార్లుగా ఎలా ఉపయోగించాలో, ఐఓటీ పరికరంలో కలిపిన మైక్రోఫోన్లోనుండి ఆడియో ఎలా పట్టుకోవచ్చో, విన్నది టెక్స్‌గా ఎలా మార్చడానికి AIని ఉపయోగించాలో నేర్చుకుంటారు. ఈ ప్రాజెక్ట్ అంతా మీరు బహుళ భాషలతో వాయిస్‌ ఉపయోగించి టైమర్లను సెట్ చేయగల స్మార్ట్ కిచెన్ టైమర్‌ను నిర్మిస్తారు.
ఈ పాఠంలో కవర్ చేయబడుతుంది:
* [మైక్రోఫోన్లు](../../../../../6-consumer/lessons/1-speech-recognition)
* [మీ ఐఓటీ పరికరంగా ఆడియో సేకరణ](../../../../../6-consumer/lessons/1-speech-recognition)
* [స్పీచ్ నుండి టెక్స్ట్](../../../../../6-consumer/lessons/1-speech-recognition)
* [స్పీచ్‌ ను టెక్స్ట్‌గా మార్చడం](../../../../../6-consumer/lessons/1-speech-recognition)
## మైక్రోఫోన్లు
మైక్రోఫోన్లు అనేవి శబ్ద తరంగాలను ఎలక్ట్రికల్ సిగ్నల్స్‌గా మార్చే అనలాగ్ సెన్సార్లు. గాలి లో కంపనలు మైక్రోఫోన్లోని భాగాలను సన్నగా కదిలిస్తాయి, ఇవి ఎలక్ట్రికల్ సిగ్నల్స్‌లో చిన్న మార్పులను కలిగిస్తాయి. ఆ మార్పులను పెంచి ఎలక్ట్రికల్ అవుట్పుట్‌ రూపొందిస్తారు.
### మైక్రోఫోన్ రకాలు
మైక్రోఫోన్లు వివిధ రకాలలో వస్తాయి:
* డైనమిక్ - డైనమిక్ మైక్రోఫోన్లలో ఒక మాగ్నెట్ ఒక కదిలే డయాఫ్రేం కి అంటి ఉంటుంది, ఇది వైర్ కాయిల్‌లో కదులుతుంటే ఎలక్ట్రికల్ కరెంట్ ని సృష్టిస్తుంది. ఇది అత్యధిక స్పీకర్లకు విలొమం, అక్కడ ఎలక్ట్రికల్ కరెంట్ మాగ్నెట్ ను కదిలించి డయాఫ్రేం నుంచి శబ్దాన్ని కలిగిస్తారు. కాబట్టి స్పీకర్లు డైనమిక్ మైక్రోఫోన్లుగా మరియు డైనమిక్ మైక్రోఫోన్లు స్పీకర్లుగా ఉపయోగించవచ్చు. ఇంటర్‌కామ్ లాంటివి వినేటప్పుడు లేదా మాట్లాడేటప్పుడు ఒకే పరికరం రెండు పనులు చేయగలదు.
డైనమిక్ మైక్రోఫోన్లు పని చేయడానికి పవర్ అవసరం లేదు, ఎలక్ట్రికల్ సిగ్నల్ పూర్తిగా మైక్రోఫోనం నుండే ఉత్పత్తి అవుతుంది.
![ష్యూర్ SM58 (డైనమిక్ కార్డియోడ్ టైపు) మైక్రోఫోన్ లో పాట్టీ స్మిత్ పాడుతున్న దృశ్యం](../../../../../translated_images/te/dynamic-mic.8babac890a2d80df.webp)
* రిబ్బన్ - రిబ్బన్ మైక్రోఫోన్లు డైనమిక్ మైక్రోఫోన్లకు సమానంగా ఉంటాయి, కానీ డయాఫ్రేం బదులుగా మెటల్ రిబ్బన్ ఉంటాయి. ఈ రిబ్బన్ మాగ్నెటిక్ఫీల్డ్లో కదిలి ఎలక్ట్రికల్ కరెంట్ సృష్టిస్తుంది. డైనమిక్ మైక్రోఫోన్లలా, రిబ్బన్ మైక్రోఫోన్లకు కూడా పవర్ అవసరం లేదు.
![ఎడ్మండ్ లోవ్, అమెరికన్ నటుడు, 1942 లో రేడియో మైక్రోఫోన్ పక్కన ఉన్న తరచుగా స్క్రిప్ట్ పట్టుకుని](../../../../../translated_images/te/ribbon-mic.eacc8e092c7441ca.webp)
* కన్డెన్సర్ - కన్డెన్సర్ మైక్రోఫోన్లు సన్నని మెటల్ డయాఫ్రేం మరియు ఒక స్థిరమైన మెటల్ బ్యాక్‌ప్లేట్ కలిగి ఉంటాయి. వీటికి విద్యుత్ వర్తించబడుతుంది మరియు డయాఫ్రేం కంపించే సమయంలో ప్లేట్ల మధ్య స్థిరభారం మార్పు అవుతుంది, ఒక సిగ్నల్ ఉత్పత్తి అవుతుంది. కన్డెన్సర్ మైక్రోఫోన్లు పని చేయటానికి పవర్ అవసరం - దీనిని *Fantastic power* అంటారు.
![AKG అకౌస్టిక్స్ చేత C451B చిన్న-డయాఫ్రేం కన్డెన్సర్ మైక్రోఫోన్](../../../../../translated_images/te/condenser-mic.6f6ed5b76ca19e0e.webp)
* MEMS - మైక్రో ఎలక్ట్రోమెకానికల్ సిస్టమ్ మైక్రోఫోన్‌లు, MEMS, చిప్‌పై ఉన్న మైక్రోఫోన్‌లు. వీటిలో సిలికాన్ చిప్‌పై ప్రెజర్ సెన్సిటివ్ డయాఫ్రేం ఉంటుంది, కన్డెన్సర్ మైక్రోఫోన్‌లా పని చేస్తాయి. ఇవి చాలా చిన్నవి, సర్క్యూట్రీలో ఇంక్రిగ్రేట్ చేయబడ్డవు.
![ఒక సర్క్యూట్ బోర్డులో MEMS మైక్రోఫోన్](../../../../../translated_images/te/mems-microphone.80574019e1f5e4d9.webp)
పై చిత్రంలో, **LEFT** అనే చిప్ MEMS మైక్రోఫోన్, దీనిలో 1 మిల్లీమీటరుకు తక్కువ పరిమాణంలో చిన్న డయాఫ్రేం ఉంటుంది.
✅ కొంత పరిశోధన చేయండి: మీ దగ్గరున్న మైక్రోఫోన్లు ఏవేవి? మీ కంప్యూటర్, ఫోన్, హెడ్‌సెట్ లేదా ఇతర పరికరాల్లో ఏ రకమైన మైక్రోఫోన్లు ఉన్నాయి?
### డిజిటల్ ఆడియో
ఆడియో అనేది చాలా సూక్ష్మ వివరాలున్న అనలాగ్ సిగ్నల్. దీన్ని డిజిటల్ కు మార్చడానికి, ఆడియోను ప్రతి సెకను వేల ప్రేణాలుగా నమూనా తీయాలి.
> 🎓 నమూనా తీసుకోవటం అంటే ఆ ఆడియో సిగ్నల్ ఆ సమయంలో ఎలాంటి విలువ కలిగి ఉందో డిజిటల్ విలువగా మార్చటం.
![ఒక సిగ్నల్ లైన్ చార్ట్, స్థిర అంతరాలలో విడిపోయిన పాయింట్లు](../../../../../translated_images/te/sampling.6f4fadb3f2d9dfe7.webp)
డిజిటల్ ఆడియో పుల్స్ కోడ్ మాడ్యులేషన్ (PCM) ఉపయోగించి నమూనా తీసుకుంటారు. PCM అనేది సిగ్నల్ వోల్టేజ్ చదవటం మరియు నిర్ధారిత పరిమాణంలో సమీప డిస్క్రీట్ విలువను ఎంచుకోవడం.
> 💁 PCMను పుల్స్ విథ్ మాడ్యులేషన్ యొక్క సెన్సార్ వెర్షన్ లాగా అనుకోవచ్చు; PWM అనేది డిజిటల్ సిగ్నల్‌ను అనలాగ్‌గా మార్చటం, PCM అనేది అనలాగ్ సిగ్నల్‌ను డిజిటల్‌గా మార్చటం.
ఉదాహరణకు, అత్యధిక స్ట్రీమింగ్ మ్యూజిక్ సేవలు 16-బిట్ లేదా 24-బిట్ ఆడియోని అందిస్తాయి. అంటే వోల్టేజ్‌ను 16-బిట్ లేదా 24-బిట్ ఇంటీజర్‌లోకి మార్చడం. 16-బిట్ ఆడియో విలువను -32,768 నుంచి 32,767 వరకూ పరిమితం చేస్తుంది, 24-బిట్ 8,388,608 నుండి 8,388,607 వరకు. ఎక్కువ బిట్లు ఉంటే, నమూనా మా చెవిలు వాస్తవంగా వినే శబ్దానికి దగ్గరగా ఉంటుంది.
> 💁 మీరు 8-బిట్ ఆడియో గురించి విన్నారేమో, దీనిని LoFi అంటారు. ఇది కేవలం 8 బిట్లను ఉపయోగించి నమూనా తీసిన ఆడియో, అంటే -128 నుండి 127 వరకు. మొట్టమొదటి కంప్యూటర్ ఆడియో హార్డ్‌వేర్ పరిమితుల కారణంగా 8 బిట్ల పరిమితి ఉండేది, ఇది రెట్రో గేమింగ్‌లో కనిపిస్తుంది.
ఈ నమూనాలు ప్రతి సెకను వేలిమిది సార్లు తీసుకుంటారు, KHz (వేలు సార్లు చదవడం)s లో కొలతచేస్తారు. స్ట్రీమింగ్ మ్యూజిక్ 48KHz లో ఎక్కువగా ఉంటాయి, ఇంకా కొంత లాస్‌లెస్ ఆడియో 96KHz లేదా 192KHz వరకూ ఉంటుంది. ఎక్కువ శాంపిల్ రేట్ అంటే ఆడియో అసలు శబ్దానికి దగ్గరగా ఉంటుంది, ఒక حد వరకు. 48KHz పైగా మనుష్యులు తేడా చెప్పగలరా అన్నది చర్చ అవుతోంది.
✅ కొంత పరిశోధన చేయండి: మీరు ఉపయోగించే స్ట్రీమింగ్ మ్యూజిక్ సేవ ఏ శాంపిల్ రేట్ మరియు పరిమాణం ఉపయోగిస్తుంది? CDs కలిగి ఉంటే వాటి శాంపిల్ రేట్ మరియు పరిమాణం ఎంత?
ఆడియో డేటా కోసం అనేక ఫార్మాట్‌లు ఉన్నాయి. మీరు mp3 ఫైళ్లు గురించి వింటుంటారు — ఇది ఆడియో డేటాను నాణ్యత కోల్పోకుండా చిన్నదిగా కంప్రెస్ చేస్తుంది. అన్‌కంప్రెస్ చేయబడిన ఆడియో WAV ఫైలుగా నిల్వ చేయబడుతుంది — 44 బైట్ల హెడ్డర్ సమాచారం కలిగి, తదుపరి రా ఆడియో డేటా ఉంటుంది. హెడ్డర్‌లో శాంపిల్ రేట్ (ఉదా., 16000 అంటే 16KHz), శాంపిల్ పరిమాణం (16 అంటే 16-బిట్), ఛానెల్ల సంఖ్య వంటి సమాచారం ఉంటుంది. ఆ తర్వాత WAV ఫైల్‌ లో రా ఆడియో ఉండదు.
> 🎓 ఛానెల్లు అనగా ఎంతమంది ఆడియో స్ట్రీములు కలవుతాయో. ఉదాహరణకు, స్టీరియో ఆడియోకు ఎడమ మరియు కుడి రెండు ఛానెల్లు ఉంటాయి. 7.1 సౌండ్ కోసం 8 ఛానెల్లు ఉంటాయి.
### ఆడియో డేటా పరిమాణం
ఆడియో డేటా పెద్దదనే ఇయెస్ ఉంటుంది. ఉదాహరణకు, అన్‌కంప్రెస్ చేయబడిన 16-బిట్ 16KHz (స్పీచ్ నుంచి టెక్స్ట్ మోడల్ కోసం సరిపడ) ఆడియో ప్రతి సెకను 32KB డేటా తీసుకుంటుంది:
* 16-బిట్ అంటే ప్రతి నమూనాకు 2 బైట్లు (1 బైట్ = 8 బిట్లు).
* 16KHz అంటే 16,000 నమూనాలు ప్రతి సెకను.
* 16,000 x 2 బైట్లు = 32,000 బైట్లు ప్రతి సెకను.
చిన్న డేటా వలె అనిపించవచ్చు, కానీ మీకు పరిమిత మెమొరీ కల మైక్రోకంట్రోలర్ ఉంటే ఇది పెద్ద విషయం. ఉదా., Wio Terminal కి 192KB మెమొరీ ఉంది, ఇది ప్రోగ్రాం కోడ్ మరియు వేరియబుల్స్ భద్రపరచాలి. ప్రోగ్రాం చిన్నదైనా, మీరు 5 సెకన్లకంటే ఎక్కువ ఆడియో పట్టుకోలేరు.
మైక్రోకంట్రోలర్లు అదనపు నిల్వలకు యాక్సెస్ కలిగి ఉంటాయి, SD కార్డ్లు లేదా ఫ్లాష్ మెమొరీ వంటి. ఆడియో సేకరణ చేసే ఐఓటీ పరికరం నిర్మిస్తుంటే, అదనపు నిల్వ కలిగి ఉండాలని చూసుకోవాలి, మరియు మీ కోడ్ మైక్రోఫోన్ నుండి కలిగిన ఆడియోని నేరుగా ఆ నిల్వకు రాయాలి. ఆ తర్వాత క్లౌడ్ కి అప్రయత్నం చేసేటప్పుడు ఆ నిల్వ నుంచి స్ట్రీమింగ్ చేయాలి. ఇలా 하면 మెమొరీ లో ఆడియో డేటాను మొత్తం నెట్టే సమస్య తప్పుతుంది.
## మీ ఐఓటీ పరికరం నుండి ఆడియో సేకరణ
మీ ఐఓటీ పరికరం ఆడియో పట్టుకోవడం కోసం మైక్రోఫోన్ తో కనెక్ట్ చేయవచ్చు. అలాగే హోరాహోరీ కోసం స్పీకర్లకు కూడా కనెక్ట్ చేయవచ్చు. తర్వాత పాఠాల్లో ఇది ఆడియో ఫీడ్‌బ్యాక్ కోసం ఉపయోగపడుతుంది, కానీ మైక్రోఫోన్ పరీక్షించడానికి ఇప్పుడు స్పీకర్లు సెట్ చేయడం ఉపయోగకరం.
### టాస్క్ - మీ మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయండి
మీ ఐఓటీ పరికరం కోసం మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయడానికి సంబంధిత గైడ్ అనుసరించండి:
* [Arduino - Wio Terminal](wio-terminal-microphone.md)
* [సింగిల్-బోర్డ్ కంప్యూటర్ - Raspberry Pi](pi-microphone.md)
* [సింగిల్-బోర్డ్ కంప్యూటర్ - వర్చువల్ డివైస్](virtual-device-microphone.md)
### టాస్క్ - ఆడియో సేకరణ చేయండి
మీ ఐఓటీ పరికరంపై ఆడియోను సేకరించడానికి సంబంధించిన గైడ్ పని చేయండి:
* [Arduino - Wio Terminal](wio-terminal-audio.md)
* [సింగిల్-బోర్డ్ కంప్యూటర్ - Raspberry Pi](pi-audio.md)
* [సింగిల్-బోర్డ్ కంప్యూటర్ - వర్చువల్ డివైస్](virtual-device-audio.md)
## స్పీచ్ నుండి టెక్స్ట్
స్పీచ్ నుండి టెక్స్ట్, లేదా వాయిస్ గుర్తింపు, ఆడియోలోని మాటలను టెక్స్ట్ గా మార్చడానికి AIని ఉపయోగించడం.
### స్పీచ్ గుర్తింపు మోడల్స్
స్పీచ్ ను టెక్స్ట్ గా మార్చడానికి, ఆడియో సిగ్నల్ నుండి алынిన నమూనాలను సమూహం చేసి, రికారెంట్ న్యూరల్ నెట్‌వర్క్ (RNN) ఆధారిత మెషీన్ లెర్నింగ్ మోడల్ కి ఇస్తారు. RNN అనేది గత డేటాను ఉపయోగించి వచ్చే డేటాలపై నిర్ణయం తీసుకొనే మెషీన్ లెర్నింగ్ మోడల్. ఉదా., RNN ఒక ఆడియో బ్లాక్ 'Hel' అని గుర్తించి, తరువాత 'lo' శబ్దం వచ్చినప్పుడు, దానికి 'Hello' అనే సరైన పదం అని అర్ధం చేసుకుని ఫలితంగా ఎంచుకోవచ్చు.
ML మోడల్స్ ప్రతి సారి అదే పరిమాణంలో డేటా తీసుకుంటాయి. మీరు మొదటి మాటల పాఠంలో చేసిన ఇమేజ్ క్లాసిఫయర్ ఒక నిర్ధారిత పరిమాణంలో చిత్రాలను అంగీకరిస్తుంది. స్పీచ్ మోడల్స్ కూడా ఫిక్స్డ్ సైజ్ ఆడియో చంక్లను ప్రాసెస్ చేస్తాయి. స్పీచ్ మోడల్స్ బహుళ అంచనాల అవుట్పుట్స్‌ని కలిపి ఉత్తరం లేదా పదం నిర్ణయించాలి; ఉదా: 'Hi' మరియు 'Highway', లేదా 'flock' మరియు 'floccinaucinihilipilification' మధ్య తేడాను తెలియజేయించాలి.
స్పీచ్ మోడల్స్ సాహిత్యాన్ని అర్థం చేసుకునేంతగా అభివృద్ధి చెందాయి, మరియు మరిన్ని శబ్దాలు పొందే కొద్దీ వచనాలను సరిచేయగలవు. ఉదా., మీరు "I went to the shops to get two bananas and an apple too" అన్నప్పుడు, 'to', 'two', 'too' అన్న మూడు పదాలు విన్నట్లే ఉన్నాయి కానీ వ్రాయుకి వేరుగా ఉంటాయి. స్పీచ్ మోడల్స్ సందర్భాన్ని అర్థం చేసుకొని సరైన వ్రాతను ఉపయోగిస్తాయి.
> 💁 కొన్ని స్పీచ్ సేవలు శబ్దం ఎక్కువగా ఉన్న ప్రదేశాలలో లేదా పరిశ్రమ ప్రత్యేక పదాలకు కస్టమైజ్ చేయవచ్చు, ఎంతైనా శబ్దాల పరిమితి కావాలి. ఈ కస్టమైజేషన్లు మానవ వచనం అందించి శిక్షణ ఇస్తారు, ఇది ట్రాన్స్‌ఫర్ లెర్నింగ్ అనే పద్ధతి, మీరు మొదటి పాఠంలో యామేజి క్లాసిఫయర్ కి కొన్ని చిత్రాల నుంచి శిక్షణ ఇచ్చినట్టు ఉంటుంది.
### గోప్యత
వినియోగదారుల ఐఓటీ పరికరాల్లో స్పీచ్ నుండి టెక్స్ట్ ఉపయోగించి గోప్యత చాలా ముఖ్యమైనది. ఈ పరికరాలు నిరంతరం ఆడియో వినిపిస్తాయి, కాబట్టి వినియోగదారుగా మీరు అన్నిఅపుడు మాట్లాడే మాటలు మేఘం వెళ్ళిపోవడానికి అనుమతించకూడదు. ఇది భారీ ఇంటర్నెట్ బ్యాండ్‌విడ్ ఉపయోగిస్తుంది, మరియు గోప్యతకు పెద్ద సమస్యలు కలిగిస్తుంది, ముఖ్యంగా కొన్ని స్మార్ట్ పరికర తయారీదారులు ఎడమవాణి పదాలు పుట్టించడం కోసం యాదృచ్ఛికంగా కొన్ని ఆడియోను ఎంచుకుని వాటి టెక్స్ట్‌ను మానవులు ధృవీకరించేందుకు ఉపయోగిస్తారు ([సూచన](https://www.theverge.com/2019/4/10/18305378/amazon-alexa-ai-voice-assistant-annotation-listen-private-recordings)).
మీరు మీ స్మార్ట్ పరికరం ఆడియోను క్లౌడ్‌కు పంపించి ప్రాసెస్ చేయించుకోవాలనుకుంటే, మీరు అదనపు వినియోగం చేస్తున్నప్పుడు మాత్రమే కావాలి, మీ ఇంటి లోని ఆడియో వినడం మీరు కోరుకోరు, ఆ ఆడియోలో ప్రైవేట్ సమావేశాలు లేదా సన్నిహిత చర్చలు ఉండవచ్చు. ఎక్కువ స్మార్ట్ పరికరాలు పని చేసే విధానం *వేక్ వర్డ్* అనేది, ఒక కీలక పదబంధం, ఉదాహరణకు "అలెక్సా", "హే సిరి", లేదా "ఓకే గూగుల్" అవి పరికరాన్ని 'వేక్ అప్' చేసి మీరు ఏమి అంటున్నారో వినడానికి కారణమవుతుంది, మిమ్మల్ని మాట్లాడటం పూర్తయ్యిందని గుర్తించినప్పుడు ఆ వినిపింత ఆగుతుంది.
> 🎓 వేక్ వర్డ్ డిటెక్షన్‌ను *కీవర్డ్ స్పాటింగ్* లేదా *కీవర్డ్ రికగ్నిషన్* అని కూడా పిలుస్తారు.
ఈ వేక్ పదబంధాలు పరికరం మీద గుర్తించబడతాయి, క్లౌడ్ లో కాదు. ఈ స్మార్ట్ పరికరాలకు చిన్న AI మోడల్స్ ఉంటాయి, అవి పరికరం మీద నడుస్తాయి, వేక్ వర్డ్ కోసం వినుతాయి, గుర్తించినప్పుడు ఆడియోను క్లౌడ్‌కు గుర్తింపుగాను స్ట్రీమ్ చేయడం ప్రారంభిస్తాయి. ఈ మోడల్స్ చాలా ప్రత్యేకమైనవి, కేవలం వేక్ వర్డ్‌ కోసం వినడం ఇస్తాయి.
> 💁 కొన్ని సాంకేతిక కంపెనీలు వారి పరికరాలకు మరింత గోప్యతను జోడిస్తున్నాయి, మాట్లాడిన మాటలు పరికరం మీదనే టెక్ట్స్ గా మారుస్తున్నాయి. ఆపిల్ ప్రకటించింది, వారి 2021 iOS మరియు macOS అప్‌డేట్ల భాగంగా వారు స్పీచ్ టు టెక్ట్స్ మార్పిడిని పరికరంలోనే మద్దతు ఇస్తారని, మరియు క్లౌడ్ ఉపయోగం లేకుండా అనేక విజ్ఞప్తులను నిర్వహించగలుగుతారని. ఇది వారి పరికరాలలో శక్తివంతమైన ప్రాసెసర్ల కారణంగా సాధ్యమవుతుంది, అవి ML మోడల్స్ నడిపే సామర్థ్యం కలిగి ఉంటాయి.
✅ మీరు ఆడియోను క్లౌడ్‌లో నిల్వచేస్తే గోప్యత మరియు నైతిక సారాంశాలు ఏమిటో మీరు ఏమనుకుంటారు? ఆ ఆడియోను నిల్వ చేయాలా? ఉన్నట్లయితే ఎలాగ? పౌర భద్రత కోసం రికార్డింగ్లను ఉపయోగించడం గోప్యత కోల్పోవడం కంటే మంచి మార్పిడి అనుకుంటారా?
వేక్ వర్డ్ గుర్తింపు సాధారణంగా టైనీ ఎంఎల్ (TinyML) అనే సాంకేతికత ఉపయోగించి చేస్తారు, ఇది మైక్రోకంట్రోలర్లపై ML మోడల్స్ నడపడం కోసం మోడల్స్‌ని మార్చడం. ఈ మోడల్స్ చిన్నటి, తక్కువ శక్తితో నడుస్తాయి.
వేక్ వర్డ్ మోడల్ శిక్షణ మరియు వాడకపు క్లిష్టతను నివారించడానికి, మీరు ఈ పాఠంలో నిర్మిస్తున్న స్మార్ట్ టైమర్ స్పీచ్ గుర్తింపును ప్రారంభించడానికి బటన్ ఉపయోగిస్తుంది.
> 💁 మీరు Wio టెర్మినల్ లేదా రాస్ప్బెర్రీ పై పై వేక్ వర్డ్ డిటెక్షన్ మోడల్ సృష్టించడం ప్రయత్నించాలనుకుంటే, ఈ [Edge Impulse గాని మీ స్వరం కు స్పందించడం పాఠం](https://docs.edgeimpulse.com/docs/responding-to-your-voice)ను చూడండి. కంప్యూటర్ ఉపయోగించి చేయాలనుకుంటే Microsoft డాక్స్ లోని [కస్టమ్ కీవర్డ్ క్విక్ స్టార్ట్ గైడ్](https://docs.microsoft.com/azure/cognitive-services/speech-service/keyword-recognition-overview?WT.mc_id=academic-17441-jabenn) ను ప్రయత్నించవచ్చు.
## స్పీచ్ ను టెక్ట్స్‌గా మార్చడం
![Speech services logo](../../../../../translated_images/te/azure-speech-logo.a1f08c4befb0159f.webp)
మునుపటి ప్రాజెక్టులో ఇమేజ్ క్లాసిఫికేషన్ లాగా, మాటలను ఆడియో ఫైల్‌గా తీసుకొని టెక్ట్స్‌గా మార్చే ప్రీ-బిల్ట్ AI సేవలు ఉంటాయి. అలాంటి ఒక సేవ Speech Service, ఇది Cognitive Services లో భాగంగా మీరు మీ యాప్స్ లో ఉపయోగించుకునే ప్రీ-బిల్ట్ AI సేవ.
### పనితీరు - స్పీచ్ AI వనరును కాన్ఫిగర్ చేయండి
1. ఈ ప్రాజెక్ట్‌కు Resource Group ఒకటి సృష్టించండి దీనికి పేరు మీకు `smart-timer` అని పెట్టండి
1. ఈ కమాండ్ ఉపయోగించి ఉచిత స్పీచ్ వనరు సృష్టించండి:
```sh
az cognitiveservices account create --name smart-timer \
--resource-group smart-timer \
--kind SpeechServices \
--sku F0 \
--yes \
--location <location>
```
Resource Group సృష్టించేటప్పుడు మీరు ఉపయోగించిన `<location>` ను మార్చండి.
1. మీ కోడ్ నుండి స్పీచ్ వనరుకు యాక్సెస్ చేసుకోవడానికి API కీ అవసరం. ఈ కమాండ్ నడిపి కీ అందుకోండి:
```sh
az cognitiveservices account keys list --name smart-timer \
--resource-group smart-timer \
--output table
```
కీలు లో ఒకటి గుర్తుంచుకోండి.
### పనితీరు - స్పీచ్ ను టెక్ట్స్ గా మార్చండి
మీ IoT పరికరంలో స్పీచ్ ను టెక్ట్స్ గా మార్పు చేయడం కోసం సంబంధిత గైడ్ అనుసరించండి:
* [Arduino - Wio Terminal](wio-terminal-speech-to-text.md)
* [సింగిల్-బోర్డ్ కంప్యూటర్ - Raspberry Pi](pi-speech-to-text.md)
* [సింగిల్-బోర్డ్ కంప్యూటర్ - వర్చువల్ పరికరం](virtual-device-speech-to-text.md)
---
## 🚀 సవాల్
స్పీచ్ గుర్తింపు చాలా కాలంగా ఉంది, మరియు నిరంతరం మెరుగుపడుతూ ఉంది. ప్రస్తుత సామర్థ్యాలు ఏమిటి మరియు అవి గతంలో ఎలా మారాయో పరిశీలించి, మానవుల పైచేసిన యంత్ర లిప్యంతరాల వ్యత్యాసం ఎంత ఖచ్చితమైనదో పోల్చండి.
స్పీచ్ గుర్తింపు భవిష్యత్తు గురించి మీరు ఏమనుకుంటారు?
## లెక్చర్ తర్వాత క్విజ్
[లెక్చర్ తర్వాత క్విజ్](https://black-meadow-040d15503.1.azurestaticapps.net/quiz/42)
## సమీక్ష & స్వీయ అధ్యయనం
* విభిన్న మైక్రోఫోన్ రకాల గురించి మరియు అవి ఎలా పనిచేస్తాయి తెలుసుకోవటానికి [Musician's HQ లో డైనమిక్ మరియు కండెన్సర్ మైక్రోఫోన్ల వ్యత్యాసం](https://musicianshq.com/whats-the-difference-between-dynamic-and-condenser-microphones/) ఆర్టికల్ చదవండి.
* Cognitive Services స్పీచ్ సేవ గురించి మరింత తెలుసుకోవడానికి [Microsoft Docs లో స్పీచ్ సర్వీస్ డాక్యుమెంటేషన్](https://docs.microsoft.com/azure/cognitive-services/speech-service/?WT.mc_id=academic-17441-jabenn) చదవండి.
* కీవర్డ్ స్పాటింగ్ గురించి [Microsoft Docs లో కీవర్డ్ రికగ్నిషన్ డాక్యుమెంటేషన్](https://docs.microsoft.com/azure/cognitive-services/speech-service/keyword-recognition-overview?WT.mc_id=academic-17441-jabenn) చదవండి.
## అసైన్‌మెంట్
[](assignment.md)
---
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**హక్కు ప్రకటన**:
ఈ డాక్యుమెంట్‌ను AI అనువాద సేవ [Co-op Translator](https://github.com/Azure/co-op-translator) ఉపయోగించి అనువదించాం. మేము సరిగ్గా ఉండేందుకు ప్రయత్నిస్తేనూ, ఆటోమేటెడ్ అనువాదాలలో పొరపాట్లు లేదా అసత్యతలు ఉండవచ్చు. మూల డాక్యుమెంట్ దాని స్వదేశ భాషలో ఆధ్యాత్మక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, నిపుణుల మానవ అనువాదాన్ని సిఫార్సు చేస్తాము. ఈ అనువాదం వాడకంతో కలిగే అపవాదాల కోసం మేము బాధ్యత వహించము.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->