You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/te/6-consumer/lessons/1-speech-recognition
localizeflow[bot] 8671d5c4aa
chore(i18n): sync translations with latest source changes (#571)
6 months ago
..
README.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
assignment.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-audio.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-microphone.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
pi-speech-to-text.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-audio.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-microphone.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
virtual-device-speech-to-text.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-audio.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-microphone.md chore(i18n): sync translations with latest source changes (#571) 6 months ago
wio-terminal-speech-to-text.md chore(i18n): sync translations with latest source changes (#571) 6 months ago

README.md

ఓ ఐఓటీ పరికరంతో మాట గుర్తించండి

ఈ పాఠం యొక్క స్కెచ్‍నోట్ అవలోకనం

స్కెచ్‍నోట్: నిత్య నరసింహన్. పెద్దవర్షన్ కోసం చిత్రాన్ని క్లిక్ చేయండి.

ఈ వీడియో అజ్యూర్ స్పీచ్ సర్వీస్ యొక్క ఓవerviewని ఇస్తుంది, ఇది ఈ పాఠంలో కవర్ చేయబడుతుంది:

Microsoft Azure YouTube చానెల్ నుండి మీ Cognitive Services Speech వనరును ఉపయోగించడం ఎలా ప్రారంభించాలో

🎥 వీడియో చూడటానికి పై చిత్రాన్ని క్లిక్ చేయండి

పాఠం ముందు పర్యాయపరీక్ష

పాఠం ముందు పర్యాయపరీక్ష

పరిచయం

'అలెక్సా, 12 నిమిషాల టైమర్‌ను సెట్ చేయు'

'అలెక్సా, టైమర్ స్థితి'

'అలెక్సా, steam broccoli అనే 8 నిమిషాల టైమర్‌ను సెట్ చేయు'

స్మార్ట్ పరికరాలు ఎక్కువగా ప్రాచుర్యం పొందుతున్నాయి. హోమ్‌పాడ్స్, ఎకోస్ మరియు గూగుల్ హోమ్స్ వంటి స్మార్ట్ స్పీకర్లుగా కాకుండా, మా ఫోన్లు, గడియారాలు, తక్కువ వెలుతురు, థర్మోస్టాట్లు వంటి పరికరాల్లోనూ ఉన్నాయి.

💁 నా ఇల్లలో కనీసం 19 పరికరాల్లో వాయిస్ అసిస్టెంట్ ఉంది, అవి నాకు తెలుసు!

వాయిస్ కన్ట్రోల్, కదలిక పరిమితులు ఉన్నవారికి పరికరాలతో సహజంగా పాటుకోవడానికి వీలుగా సౌలభ్యాన్ని పెంచుతుంది. ఇది జన్మతోనే చేయకపోవడం వంటి శాశ్వత వైకల్యం నుండి, విరిగిన చట్టాల వంటి తాత్కాలిక వైకల్యం వరకు లేకపోతే చేతులు బాగా బాపట్లు లేదా పిల్లలతో నిండిపోయినపుడు కూడా, నడుస్తున్న వాయిస్‌తో మన ఇళ్ళను నియంత్రించడం ప్రపంచాన్ని సులభతరంగా చేస్తుంది. "హే సిరీ, నా గ్యారేజ్ డోర్ మూసివేసు" అన్నదీ, ఒక పిల్లోడిని మార్చడం మరియు అహం చేసే అమ్మాయితో సహాయపడటానికి చిన్న కానీ సమర్థవంతమైన మార్పు.

వాయిస్ అసిస్టెంట్లలో ఒకటి ఎక్కువగా ఉపయోగించేది టైమర్లను సెట్ చేయటం, ముఖ్యంగా వంట గది టైమర్లు. మీ వాయిస్‌తో మాత్రమే బహుళ టైమర్లను సెట్ చేయగలగడం వంటగదిలో భారీ సహాయం - డౌ గమ్మరించటం, సూప్ కలపటం ఆపకుండా లేదా మీ చేతులు నెమ్మదిగా ఉండకుండా టైమర్ని ఉపయోగించడం అవసరం లేదు.

ఈ పాఠంలో మీరు ఓ ఐఓటీ పరికరాల్లో వాయిస్ గుర్తింపును ఎలా నిర్మించాలో నేర్చుకుంటారు. మీరు మైక్రోఫోన్లను సెన్సార్లుగా ఎలా ఉపయోగించాలో, ఐఓటీ పరికరంలో కలిపిన మైక్రోఫోన్లోనుండి ఆడియో ఎలా పట్టుకోవచ్చో, విన్నది టెక్స్‌గా ఎలా మార్చడానికి AIని ఉపయోగించాలో నేర్చుకుంటారు. ఈ ప్రాజెక్ట్ అంతా మీరు బహుళ భాషలతో వాయిస్‌ ఉపయోగించి టైమర్లను సెట్ చేయగల స్మార్ట్ కిచెన్ టైమర్‌ను నిర్మిస్తారు.

ఈ పాఠంలో కవర్ చేయబడుతుంది:

మైక్రోఫోన్లు

మైక్రోఫోన్లు అనేవి శబ్ద తరంగాలను ఎలక్ట్రికల్ సిగ్నల్స్‌గా మార్చే అనలాగ్ సెన్సార్లు. గాలి లో కంపనలు మైక్రోఫోన్లోని భాగాలను సన్నగా కదిలిస్తాయి, ఇవి ఎలక్ట్రికల్ సిగ్నల్స్‌లో చిన్న మార్పులను కలిగిస్తాయి. ఆ మార్పులను పెంచి ఎలక్ట్రికల్ అవుట్పుట్‌ రూపొందిస్తారు.

మైక్రోఫోన్ రకాలు

మైక్రోఫోన్లు వివిధ రకాలలో వస్తాయి:

  • డైనమిక్ - డైనమిక్ మైక్రోఫోన్లలో ఒక మాగ్నెట్ ఒక కదిలే డయాఫ్రేం కి అంటి ఉంటుంది, ఇది వైర్ కాయిల్‌లో కదులుతుంటే ఎలక్ట్రికల్ కరెంట్ ని సృష్టిస్తుంది. ఇది అత్యధిక స్పీకర్లకు విలొమం, అక్కడ ఎలక్ట్రికల్ కరెంట్ మాగ్నెట్ ను కదిలించి డయాఫ్రేం నుంచి శబ్దాన్ని కలిగిస్తారు. కాబట్టి స్పీకర్లు డైనమిక్ మైక్రోఫోన్లుగా మరియు డైనమిక్ మైక్రోఫోన్లు స్పీకర్లుగా ఉపయోగించవచ్చు. ఇంటర్‌కామ్ లాంటివి వినేటప్పుడు లేదా మాట్లాడేటప్పుడు ఒకే పరికరం రెండు పనులు చేయగలదు.

    డైనమిక్ మైక్రోఫోన్లు పని చేయడానికి పవర్ అవసరం లేదు, ఎలక్ట్రికల్ సిగ్నల్ పూర్తిగా మైక్రోఫోనం నుండే ఉత్పత్తి అవుతుంది.

    ష్యూర్ SM58 (డైనమిక్ కార్డియోడ్ టైపు) మైక్రోఫోన్ లో పాట్టీ స్మిత్ పాడుతున్న దృశ్యం

  • రిబ్బన్ - రిబ్బన్ మైక్రోఫోన్లు డైనమిక్ మైక్రోఫోన్లకు సమానంగా ఉంటాయి, కానీ డయాఫ్రేం బదులుగా మెటల్ రిబ్బన్ ఉంటాయి. ఈ రిబ్బన్ మాగ్నెటిక్ఫీల్డ్లో కదిలి ఎలక్ట్రికల్ కరెంట్ సృష్టిస్తుంది. డైనమిక్ మైక్రోఫోన్లలా, రిబ్బన్ మైక్రోఫోన్లకు కూడా పవర్ అవసరం లేదు.

    ఎడ్మండ్ లోవ్, అమెరికన్ నటుడు, 1942 లో రేడియో మైక్రోఫోన్ పక్కన ఉన్న తరచుగా స్క్రిప్ట్ పట్టుకుని

  • కన్డెన్సర్ - కన్డెన్సర్ మైక్రోఫోన్లు సన్నని మెటల్ డయాఫ్రేం మరియు ఒక స్థిరమైన మెటల్ బ్యాక్‌ప్లేట్ కలిగి ఉంటాయి. వీటికి విద్యుత్ వర్తించబడుతుంది మరియు డయాఫ్రేం కంపించే సమయంలో ప్లేట్ల మధ్య స్థిరభారం మార్పు అవుతుంది, ఒక సిగ్నల్ ఉత్పత్తి అవుతుంది. కన్డెన్సర్ మైక్రోఫోన్లు పని చేయటానికి పవర్ అవసరం - దీనిని Fantastic power అంటారు.

    AKG అకౌస్టిక్స్ చేత C451B చిన్న-డయాఫ్రేం కన్డెన్సర్ మైక్రోఫోన్

  • MEMS - మైక్రో ఎలక్ట్రోమెకానికల్ సిస్టమ్ మైక్రోఫోన్‌లు, MEMS, చిప్‌పై ఉన్న మైక్రోఫోన్‌లు. వీటిలో సిలికాన్ చిప్‌పై ప్రెజర్ సెన్సిటివ్ డయాఫ్రేం ఉంటుంది, కన్డెన్సర్ మైక్రోఫోన్‌లా పని చేస్తాయి. ఇవి చాలా చిన్నవి, సర్క్యూట్రీలో ఇంక్రిగ్రేట్ చేయబడ్డవు.

    ఒక సర్క్యూట్ బోర్డులో MEMS మైక్రోఫోన్

    పై చిత్రంలో, LEFT అనే చిప్ MEMS మైక్రోఫోన్, దీనిలో 1 మిల్లీమీటరుకు తక్కువ పరిమాణంలో చిన్న డయాఫ్రేం ఉంటుంది.

కొంత పరిశోధన చేయండి: మీ దగ్గరున్న మైక్రోఫోన్లు ఏవేవి? మీ కంప్యూటర్, ఫోన్, హెడ్‌సెట్ లేదా ఇతర పరికరాల్లో ఏ రకమైన మైక్రోఫోన్లు ఉన్నాయి?

డిజిటల్ ఆడియో

ఆడియో అనేది చాలా సూక్ష్మ వివరాలున్న అనలాగ్ సిగ్నల్. దీన్ని డిజిటల్ కు మార్చడానికి, ఆడియోను ప్రతి సెకను వేల ప్రేణాలుగా నమూనా తీయాలి.

🎓 నమూనా తీసుకోవటం అంటే ఆ ఆడియో సిగ్నల్ ఆ సమయంలో ఎలాంటి విలువ కలిగి ఉందో డిజిటల్ విలువగా మార్చటం.

ఒక సిగ్నల్ లైన్ చార్ట్, స్థిర అంతరాలలో విడిపోయిన పాయింట్లు

డిజిటల్ ఆడియో పుల్స్ కోడ్ మాడ్యులేషన్ (PCM) ఉపయోగించి నమూనా తీసుకుంటారు. PCM అనేది సిగ్నల్ వోల్టేజ్ చదవటం మరియు నిర్ధారిత పరిమాణంలో సమీప డిస్క్రీట్ విలువను ఎంచుకోవడం.

💁 PCMను పుల్స్ విథ్ మాడ్యులేషన్ యొక్క సెన్సార్ వెర్షన్ లాగా అనుకోవచ్చు; PWM అనేది డిజిటల్ సిగ్నల్‌ను అనలాగ్‌గా మార్చటం, PCM అనేది అనలాగ్ సిగ్నల్‌ను డిజిటల్‌గా మార్చటం.

ఉదాహరణకు, అత్యధిక స్ట్రీమింగ్ మ్యూజిక్ సేవలు 16-బిట్ లేదా 24-బిట్ ఆడియోని అందిస్తాయి. అంటే వోల్టేజ్‌ను 16-బిట్ లేదా 24-బిట్ ఇంటీజర్‌లోకి మార్చడం. 16-బిట్ ఆడియో విలువను -32,768 నుంచి 32,767 వరకూ పరిమితం చేస్తుంది, 24-బిట్ 8,388,608 నుండి 8,388,607 వరకు. ఎక్కువ బిట్లు ఉంటే, నమూనా మా చెవిలు వాస్తవంగా వినే శబ్దానికి దగ్గరగా ఉంటుంది.

💁 మీరు 8-బిట్ ఆడియో గురించి విన్నారేమో, దీనిని LoFi అంటారు. ఇది కేవలం 8 బిట్లను ఉపయోగించి నమూనా తీసిన ఆడియో, అంటే -128 నుండి 127 వరకు. మొట్టమొదటి కంప్యూటర్ ఆడియో హార్డ్‌వేర్ పరిమితుల కారణంగా 8 బిట్ల పరిమితి ఉండేది, ఇది రెట్రో గేమింగ్‌లో కనిపిస్తుంది.

ఈ నమూనాలు ప్రతి సెకను వేలిమిది సార్లు తీసుకుంటారు, KHz (వేలు సార్లు చదవడం)s లో కొలతచేస్తారు. స్ట్రీమింగ్ మ్యూజిక్ 48KHz లో ఎక్కువగా ఉంటాయి, ఇంకా కొంత లాస్‌లెస్ ఆడియో 96KHz లేదా 192KHz వరకూ ఉంటుంది. ఎక్కువ శాంపిల్ రేట్ అంటే ఆడియో అసలు శబ్దానికి దగ్గరగా ఉంటుంది, ఒక حد వరకు. 48KHz పైగా మనుష్యులు తేడా చెప్పగలరా అన్నది చర్చ అవుతోంది.

కొంత పరిశోధన చేయండి: మీరు ఉపయోగించే స్ట్రీమింగ్ మ్యూజిక్ సేవ ఏ శాంపిల్ రేట్ మరియు పరిమాణం ఉపయోగిస్తుంది? CDs కలిగి ఉంటే వాటి శాంపిల్ రేట్ మరియు పరిమాణం ఎంత?

ఆడియో డేటా కోసం అనేక ఫార్మాట్‌లు ఉన్నాయి. మీరు mp3 ఫైళ్లు గురించి వింటుంటారు — ఇది ఆడియో డేటాను నాణ్యత కోల్పోకుండా చిన్నదిగా కంప్రెస్ చేస్తుంది. అన్‌కంప్రెస్ చేయబడిన ఆడియో WAV ఫైలుగా నిల్వ చేయబడుతుంది — 44 బైట్ల హెడ్డర్ సమాచారం కలిగి, తదుపరి రా ఆడియో డేటా ఉంటుంది. హెడ్డర్‌లో శాంపిల్ రేట్ (ఉదా., 16000 అంటే 16KHz), శాంపిల్ పరిమాణం (16 అంటే 16-బిట్), ఛానెల్ల సంఖ్య వంటి సమాచారం ఉంటుంది. ఆ తర్వాత WAV ఫైల్‌ లో రా ఆడియో ఉండదు.

🎓 ఛానెల్లు అనగా ఎంతమంది ఆడియో స్ట్రీములు కలవుతాయో. ఉదాహరణకు, స్టీరియో ఆడియోకు ఎడమ మరియు కుడి రెండు ఛానెల్లు ఉంటాయి. 7.1 సౌండ్ కోసం 8 ఛానెల్లు ఉంటాయి.

ఆడియో డేటా పరిమాణం

ఆడియో డేటా పెద్దదనే ఇయెస్ ఉంటుంది. ఉదాహరణకు, అన్‌కంప్రెస్ చేయబడిన 16-బిట్ 16KHz (స్పీచ్ నుంచి టెక్స్ట్ మోడల్ కోసం సరిపడ) ఆడియో ప్రతి సెకను 32KB డేటా తీసుకుంటుంది:

  • 16-బిట్ అంటే ప్రతి నమూనాకు 2 బైట్లు (1 బైట్ = 8 బిట్లు).
  • 16KHz అంటే 16,000 నమూనాలు ప్రతి సెకను.
  • 16,000 x 2 బైట్లు = 32,000 బైట్లు ప్రతి సెకను.

చిన్న డేటా వలె అనిపించవచ్చు, కానీ మీకు పరిమిత మెమొరీ కల మైక్రోకంట్రోలర్ ఉంటే ఇది పెద్ద విషయం. ఉదా., Wio Terminal కి 192KB మెమొరీ ఉంది, ఇది ప్రోగ్రాం కోడ్ మరియు వేరియబుల్స్ భద్రపరచాలి. ప్రోగ్రాం చిన్నదైనా, మీరు 5 సెకన్లకంటే ఎక్కువ ఆడియో పట్టుకోలేరు.

మైక్రోకంట్రోలర్లు అదనపు నిల్వలకు యాక్సెస్ కలిగి ఉంటాయి, SD కార్డ్లు లేదా ఫ్లాష్ మెమొరీ వంటి. ఆడియో సేకరణ చేసే ఐఓటీ పరికరం నిర్మిస్తుంటే, అదనపు నిల్వ కలిగి ఉండాలని చూసుకోవాలి, మరియు మీ కోడ్ మైక్రోఫోన్ నుండి కలిగిన ఆడియోని నేరుగా ఆ నిల్వకు రాయాలి. ఆ తర్వాత క్లౌడ్ కి అప్రయత్నం చేసేటప్పుడు ఆ నిల్వ నుంచి స్ట్రీమింగ్ చేయాలి. ఇలా 하면 మెమొరీ లో ఆడియో డేటాను మొత్తం నెట్టే సమస్య తప్పుతుంది.

మీ ఐఓటీ పరికరం నుండి ఆడియో సేకరణ

మీ ఐఓటీ పరికరం ఆడియో పట్టుకోవడం కోసం మైక్రోఫోన్ తో కనెక్ట్ చేయవచ్చు. అలాగే హోరాహోరీ కోసం స్పీకర్లకు కూడా కనెక్ట్ చేయవచ్చు. తర్వాత పాఠాల్లో ఇది ఆడియో ఫీడ్‌బ్యాక్ కోసం ఉపయోగపడుతుంది, కానీ మైక్రోఫోన్ పరీక్షించడానికి ఇప్పుడు స్పీకర్లు సెట్ చేయడం ఉపయోగకరం.

టాస్క్ - మీ మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయండి

మీ ఐఓటీ పరికరం కోసం మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయడానికి సంబంధిత గైడ్ అనుసరించండి:

టాస్క్ - ఆడియో సేకరణ చేయండి

మీ ఐఓటీ పరికరంపై ఆడియోను సేకరించడానికి సంబంధించిన గైడ్ పని చేయండి:

స్పీచ్ నుండి టెక్స్ట్

స్పీచ్ నుండి టెక్స్ట్, లేదా వాయిస్ గుర్తింపు, ఆడియోలోని మాటలను టెక్స్ట్ గా మార్చడానికి AIని ఉపయోగించడం.

స్పీచ్ గుర్తింపు మోడల్స్

స్పీచ్ ను టెక్స్ట్ గా మార్చడానికి, ఆడియో సిగ్నల్ నుండి алынిన నమూనాలను సమూహం చేసి, రికారెంట్ న్యూరల్ నెట్‌వర్క్ (RNN) ఆధారిత మెషీన్ లెర్నింగ్ మోడల్ కి ఇస్తారు. RNN అనేది గత డేటాను ఉపయోగించి వచ్చే డేటాలపై నిర్ణయం తీసుకొనే మెషీన్ లెర్నింగ్ మోడల్. ఉదా., RNN ఒక ఆడియో బ్లాక్ 'Hel' అని గుర్తించి, తరువాత 'lo' శబ్దం వచ్చినప్పుడు, దానికి 'Hello' అనే సరైన పదం అని అర్ధం చేసుకుని ఫలితంగా ఎంచుకోవచ్చు.

ML మోడల్స్ ప్రతి సారి అదే పరిమాణంలో డేటా తీసుకుంటాయి. మీరు మొదటి మాటల పాఠంలో చేసిన ఇమేజ్ క్లాసిఫయర్ ఒక నిర్ధారిత పరిమాణంలో చిత్రాలను అంగీకరిస్తుంది. స్పీచ్ మోడల్స్ కూడా ఫిక్స్డ్ సైజ్ ఆడియో చంక్లను ప్రాసెస్ చేస్తాయి. స్పీచ్ మోడల్స్ బహుళ అంచనాల అవుట్పుట్స్‌ని కలిపి ఉత్తరం లేదా పదం నిర్ణయించాలి; ఉదా: 'Hi' మరియు 'Highway', లేదా 'flock' మరియు 'floccinaucinihilipilification' మధ్య తేడాను తెలియజేయించాలి.

స్పీచ్ మోడల్స్ సాహిత్యాన్ని అర్థం చేసుకునేంతగా అభివృద్ధి చెందాయి, మరియు మరిన్ని శబ్దాలు పొందే కొద్దీ వచనాలను సరిచేయగలవు. ఉదా., మీరు "I went to the shops to get two bananas and an apple too" అన్నప్పుడు, 'to', 'two', 'too' అన్న మూడు పదాలు విన్నట్లే ఉన్నాయి కానీ వ్రాయుకి వేరుగా ఉంటాయి. స్పీచ్ మోడల్స్ సందర్భాన్ని అర్థం చేసుకొని సరైన వ్రాతను ఉపయోగిస్తాయి.

💁 కొన్ని స్పీచ్ సేవలు శబ్దం ఎక్కువగా ఉన్న ప్రదేశాలలో లేదా పరిశ్రమ ప్రత్యేక పదాలకు కస్టమైజ్ చేయవచ్చు, ఎంతైనా శబ్దాల పరిమితి కావాలి. ఈ కస్టమైజేషన్లు మానవ వచనం అందించి శిక్షణ ఇస్తారు, ఇది ట్రాన్స్‌ఫర్ లెర్నింగ్ అనే పద్ధతి, మీరు మొదటి పాఠంలో యామేజి క్లాసిఫయర్ కి కొన్ని చిత్రాల నుంచి శిక్షణ ఇచ్చినట్టు ఉంటుంది.

గోప్యత

వినియోగదారుల ఐఓటీ పరికరాల్లో స్పీచ్ నుండి టెక్స్ట్ ఉపయోగించి గోప్యత చాలా ముఖ్యమైనది. ఈ పరికరాలు నిరంతరం ఆడియో వినిపిస్తాయి, కాబట్టి వినియోగదారుగా మీరు అన్నిఅపుడు మాట్లాడే మాటలు మేఘం వెళ్ళిపోవడానికి అనుమతించకూడదు. ఇది భారీ ఇంటర్నెట్ బ్యాండ్‌విడ్ ఉపయోగిస్తుంది, మరియు గోప్యతకు పెద్ద సమస్యలు కలిగిస్తుంది, ముఖ్యంగా కొన్ని స్మార్ట్ పరికర తయారీదారులు ఎడమవాణి పదాలు పుట్టించడం కోసం యాదృచ్ఛికంగా కొన్ని ఆడియోను ఎంచుకుని వాటి టెక్స్ట్‌ను మానవులు ధృవీకరించేందుకు ఉపయోగిస్తారు (సూచన). మీరు మీ స్మార్ట్ పరికరం ఆడియోను క్లౌడ్‌కు పంపించి ప్రాసెస్ చేయించుకోవాలనుకుంటే, మీరు అదనపు వినియోగం చేస్తున్నప్పుడు మాత్రమే కావాలి, మీ ఇంటి లోని ఆడియో వినడం మీరు కోరుకోరు, ఆ ఆడియోలో ప్రైవేట్ సమావేశాలు లేదా సన్నిహిత చర్చలు ఉండవచ్చు. ఎక్కువ స్మార్ట్ పరికరాలు పని చేసే విధానం వేక్ వర్డ్ అనేది, ఒక కీలక పదబంధం, ఉదాహరణకు "అలెక్సా", "హే సిరి", లేదా "ఓకే గూగుల్" అవి పరికరాన్ని 'వేక్ అప్' చేసి మీరు ఏమి అంటున్నారో వినడానికి కారణమవుతుంది, మిమ్మల్ని మాట్లాడటం పూర్తయ్యిందని గుర్తించినప్పుడు ఆ వినిపింత ఆగుతుంది.

🎓 వేక్ వర్డ్ డిటెక్షన్‌ను కీవర్డ్ స్పాటింగ్ లేదా కీవర్డ్ రికగ్నిషన్ అని కూడా పిలుస్తారు.

ఈ వేక్ పదబంధాలు పరికరం మీద గుర్తించబడతాయి, క్లౌడ్ లో కాదు. ఈ స్మార్ట్ పరికరాలకు చిన్న AI మోడల్స్ ఉంటాయి, అవి పరికరం మీద నడుస్తాయి, వేక్ వర్డ్ కోసం వినుతాయి, గుర్తించినప్పుడు ఆడియోను క్లౌడ్‌కు గుర్తింపుగాను స్ట్రీమ్ చేయడం ప్రారంభిస్తాయి. ఈ మోడల్స్ చాలా ప్రత్యేకమైనవి, కేవలం వేక్ వర్డ్‌ కోసం వినడం ఇస్తాయి.

💁 కొన్ని సాంకేతిక కంపెనీలు వారి పరికరాలకు మరింత గోప్యతను జోడిస్తున్నాయి, మాట్లాడిన మాటలు పరికరం మీదనే టెక్ట్స్ గా మారుస్తున్నాయి. ఆపిల్ ప్రకటించింది, వారి 2021 iOS మరియు macOS అప్‌డేట్ల భాగంగా వారు స్పీచ్ టు టెక్ట్స్ మార్పిడిని పరికరంలోనే మద్దతు ఇస్తారని, మరియు క్లౌడ్ ఉపయోగం లేకుండా అనేక విజ్ఞప్తులను నిర్వహించగలుగుతారని. ఇది వారి పరికరాలలో శక్తివంతమైన ప్రాసెసర్ల కారణంగా సాధ్యమవుతుంది, అవి ML మోడల్స్ నడిపే సామర్థ్యం కలిగి ఉంటాయి.

మీరు ఆడియోను క్లౌడ్‌లో నిల్వచేస్తే గోప్యత మరియు నైతిక సారాంశాలు ఏమిటో మీరు ఏమనుకుంటారు? ఆ ఆడియోను నిల్వ చేయాలా? ఉన్నట్లయితే ఎలాగ? పౌర భద్రత కోసం రికార్డింగ్లను ఉపయోగించడం గోప్యత కోల్పోవడం కంటే మంచి మార్పిడి అనుకుంటారా?

వేక్ వర్డ్ గుర్తింపు సాధారణంగా టైనీ ఎంఎల్ (TinyML) అనే సాంకేతికత ఉపయోగించి చేస్తారు, ఇది మైక్రోకంట్రోలర్లపై ML మోడల్స్ నడపడం కోసం మోడల్స్‌ని మార్చడం. ఈ మోడల్స్ చిన్నటి, తక్కువ శక్తితో నడుస్తాయి.

వేక్ వర్డ్ మోడల్ శిక్షణ మరియు వాడకపు క్లిష్టతను నివారించడానికి, మీరు ఈ పాఠంలో నిర్మిస్తున్న స్మార్ట్ టైమర్ స్పీచ్ గుర్తింపును ప్రారంభించడానికి బటన్ ఉపయోగిస్తుంది.

💁 మీరు Wio టెర్మినల్ లేదా రాస్ప్బెర్రీ పై పై వేక్ వర్డ్ డిటెక్షన్ మోడల్ సృష్టించడం ప్రయత్నించాలనుకుంటే, ఈ Edge Impulse గాని మీ స్వరం కు స్పందించడం పాఠంను చూడండి. కంప్యూటర్ ఉపయోగించి చేయాలనుకుంటే Microsoft డాక్స్ లోని కస్టమ్ కీవర్డ్ క్విక్ స్టార్ట్ గైడ్ ను ప్రయత్నించవచ్చు.

స్పీచ్ ను టెక్ట్స్‌గా మార్చడం

Speech services logo

మునుపటి ప్రాజెక్టులో ఇమేజ్ క్లాసిఫికేషన్ లాగా, మాటలను ఆడియో ఫైల్‌గా తీసుకొని టెక్ట్స్‌గా మార్చే ప్రీ-బిల్ట్ AI సేవలు ఉంటాయి. అలాంటి ఒక సేవ Speech Service, ఇది Cognitive Services లో భాగంగా మీరు మీ యాప్స్ లో ఉపయోగించుకునే ప్రీ-బిల్ట్ AI సేవ.

పనితీరు - స్పీచ్ AI వనరును కాన్ఫిగర్ చేయండి

  1. ఈ ప్రాజెక్ట్‌కు Resource Group ఒకటి సృష్టించండి దీనికి పేరు మీకు smart-timer అని పెట్టండి

  2. ఈ కమాండ్ ఉపయోగించి ఉచిత స్పీచ్ వనరు సృష్టించండి:

    az cognitiveservices account create --name smart-timer \
                                        --resource-group smart-timer \
                                        --kind SpeechServices \
                                        --sku F0 \
                                        --yes \
                                        --location <location>
    

    Resource Group సృష్టించేటప్పుడు మీరు ఉపయోగించిన <location> ను మార్చండి.

  3. మీ కోడ్ నుండి స్పీచ్ వనరుకు యాక్సెస్ చేసుకోవడానికి API కీ అవసరం. ఈ కమాండ్ నడిపి కీ అందుకోండి:

    az cognitiveservices account keys list --name smart-timer \
                                           --resource-group smart-timer \
                                           --output table
    

    కీలు లో ఒకటి గుర్తుంచుకోండి.

పనితీరు - స్పీచ్ ను టెక్ట్స్ గా మార్చండి

మీ IoT పరికరంలో స్పీచ్ ను టెక్ట్స్ గా మార్పు చేయడం కోసం సంబంధిత గైడ్ అనుసరించండి:


🚀 సవాల్

స్పీచ్ గుర్తింపు చాలా కాలంగా ఉంది, మరియు నిరంతరం మెరుగుపడుతూ ఉంది. ప్రస్తుత సామర్థ్యాలు ఏమిటి మరియు అవి గతంలో ఎలా మారాయో పరిశీలించి, మానవుల పైచేసిన యంత్ర లిప్యంతరాల వ్యత్యాసం ఎంత ఖచ్చితమైనదో పోల్చండి.

స్పీచ్ గుర్తింపు భవిష్యత్తు గురించి మీరు ఏమనుకుంటారు?

లెక్చర్ తర్వాత క్విజ్

లెక్చర్ తర్వాత క్విజ్

సమీక్ష & స్వీయ అధ్యయనం

అసైన్‌మెంట్


హక్కు ప్రకటన:
ఈ డాక్యుమెంట్‌ను AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించాం. మేము సరిగ్గా ఉండేందుకు ప్రయత్నిస్తేనూ, ఆటోమేటెడ్ అనువాదాలలో పొరపాట్లు లేదా అసత్యతలు ఉండవచ్చు. మూల డాక్యుమెంట్ దాని స్వదేశ భాషలో ఆధ్యాత్మక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, నిపుణుల మానవ అనువాదాన్ని సిఫార్సు చేస్తాము. ఈ అనువాదం వాడకంతో కలిగే అపవాదాల కోసం మేము బాధ్యత వహించము.