You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
IoT-For-Beginners/translations/te/6-consumer/lessons/1-speech-recognition/README.md

40 KiB

ఓ ఐఓటీ పరికరంతో మాట గుర్తించండి

ఈ పాఠం యొక్క స్కెచ్‍నోట్ అవలోకనం

స్కెచ్‍నోట్: నిత్య నరసింహన్. పెద్దవర్షన్ కోసం చిత్రాన్ని క్లిక్ చేయండి.

ఈ వీడియో అజ్యూర్ స్పీచ్ సర్వీస్ యొక్క ఓవerviewని ఇస్తుంది, ఇది ఈ పాఠంలో కవర్ చేయబడుతుంది:

Microsoft Azure YouTube చానెల్ నుండి మీ Cognitive Services Speech వనరును ఉపయోగించడం ఎలా ప్రారంభించాలో

🎥 వీడియో చూడటానికి పై చిత్రాన్ని క్లిక్ చేయండి

పాఠం ముందు పర్యాయపరీక్ష

పాఠం ముందు పర్యాయపరీక్ష

పరిచయం

'అలెక్సా, 12 నిమిషాల టైమర్‌ను సెట్ చేయు'

'అలెక్సా, టైమర్ స్థితి'

'అలెక్సా, steam broccoli అనే 8 నిమిషాల టైమర్‌ను సెట్ చేయు'

స్మార్ట్ పరికరాలు ఎక్కువగా ప్రాచుర్యం పొందుతున్నాయి. హోమ్‌పాడ్స్, ఎకోస్ మరియు గూగుల్ హోమ్స్ వంటి స్మార్ట్ స్పీకర్లుగా కాకుండా, మా ఫోన్లు, గడియారాలు, తక్కువ వెలుతురు, థర్మోస్టాట్లు వంటి పరికరాల్లోనూ ఉన్నాయి.

💁 నా ఇల్లలో కనీసం 19 పరికరాల్లో వాయిస్ అసిస్టెంట్ ఉంది, అవి నాకు తెలుసు!

వాయిస్ కన్ట్రోల్, కదలిక పరిమితులు ఉన్నవారికి పరికరాలతో సహజంగా పాటుకోవడానికి వీలుగా సౌలభ్యాన్ని పెంచుతుంది. ఇది జన్మతోనే చేయకపోవడం వంటి శాశ్వత వైకల్యం నుండి, విరిగిన చట్టాల వంటి తాత్కాలిక వైకల్యం వరకు లేకపోతే చేతులు బాగా బాపట్లు లేదా పిల్లలతో నిండిపోయినపుడు కూడా, నడుస్తున్న వాయిస్‌తో మన ఇళ్ళను నియంత్రించడం ప్రపంచాన్ని సులభతరంగా చేస్తుంది. "హే సిరీ, నా గ్యారేజ్ డోర్ మూసివేసు" అన్నదీ, ఒక పిల్లోడిని మార్చడం మరియు అహం చేసే అమ్మాయితో సహాయపడటానికి చిన్న కానీ సమర్థవంతమైన మార్పు.

వాయిస్ అసిస్టెంట్లలో ఒకటి ఎక్కువగా ఉపయోగించేది టైమర్లను సెట్ చేయటం, ముఖ్యంగా వంట గది టైమర్లు. మీ వాయిస్‌తో మాత్రమే బహుళ టైమర్లను సెట్ చేయగలగడం వంటగదిలో భారీ సహాయం - డౌ గమ్మరించటం, సూప్ కలపటం ఆపకుండా లేదా మీ చేతులు నెమ్మదిగా ఉండకుండా టైమర్ని ఉపయోగించడం అవసరం లేదు.

ఈ పాఠంలో మీరు ఓ ఐఓటీ పరికరాల్లో వాయిస్ గుర్తింపును ఎలా నిర్మించాలో నేర్చుకుంటారు. మీరు మైక్రోఫోన్లను సెన్సార్లుగా ఎలా ఉపయోగించాలో, ఐఓటీ పరికరంలో కలిపిన మైక్రోఫోన్లోనుండి ఆడియో ఎలా పట్టుకోవచ్చో, విన్నది టెక్స్‌గా ఎలా మార్చడానికి AIని ఉపయోగించాలో నేర్చుకుంటారు. ఈ ప్రాజెక్ట్ అంతా మీరు బహుళ భాషలతో వాయిస్‌ ఉపయోగించి టైమర్లను సెట్ చేయగల స్మార్ట్ కిచెన్ టైమర్‌ను నిర్మిస్తారు.

ఈ పాఠంలో కవర్ చేయబడుతుంది:

మైక్రోఫోన్లు

మైక్రోఫోన్లు అనేవి శబ్ద తరంగాలను ఎలక్ట్రికల్ సిగ్నల్స్‌గా మార్చే అనలాగ్ సెన్సార్లు. గాలి లో కంపనలు మైక్రోఫోన్లోని భాగాలను సన్నగా కదిలిస్తాయి, ఇవి ఎలక్ట్రికల్ సిగ్నల్స్‌లో చిన్న మార్పులను కలిగిస్తాయి. ఆ మార్పులను పెంచి ఎలక్ట్రికల్ అవుట్పుట్‌ రూపొందిస్తారు.

మైక్రోఫోన్ రకాలు

మైక్రోఫోన్లు వివిధ రకాలలో వస్తాయి:

  • డైనమిక్ - డైనమిక్ మైక్రోఫోన్లలో ఒక మాగ్నెట్ ఒక కదిలే డయాఫ్రేం కి అంటి ఉంటుంది, ఇది వైర్ కాయిల్‌లో కదులుతుంటే ఎలక్ట్రికల్ కరెంట్ ని సృష్టిస్తుంది. ఇది అత్యధిక స్పీకర్లకు విలొమం, అక్కడ ఎలక్ట్రికల్ కరెంట్ మాగ్నెట్ ను కదిలించి డయాఫ్రేం నుంచి శబ్దాన్ని కలిగిస్తారు. కాబట్టి స్పీకర్లు డైనమిక్ మైక్రోఫోన్లుగా మరియు డైనమిక్ మైక్రోఫోన్లు స్పీకర్లుగా ఉపయోగించవచ్చు. ఇంటర్‌కామ్ లాంటివి వినేటప్పుడు లేదా మాట్లాడేటప్పుడు ఒకే పరికరం రెండు పనులు చేయగలదు.

    డైనమిక్ మైక్రోఫోన్లు పని చేయడానికి పవర్ అవసరం లేదు, ఎలక్ట్రికల్ సిగ్నల్ పూర్తిగా మైక్రోఫోనం నుండే ఉత్పత్తి అవుతుంది.

    ష్యూర్ SM58 (డైనమిక్ కార్డియోడ్ టైపు) మైక్రోఫోన్ లో పాట్టీ స్మిత్ పాడుతున్న దృశ్యం

  • రిబ్బన్ - రిబ్బన్ మైక్రోఫోన్లు డైనమిక్ మైక్రోఫోన్లకు సమానంగా ఉంటాయి, కానీ డయాఫ్రేం బదులుగా మెటల్ రిబ్బన్ ఉంటాయి. ఈ రిబ్బన్ మాగ్నెటిక్ఫీల్డ్లో కదిలి ఎలక్ట్రికల్ కరెంట్ సృష్టిస్తుంది. డైనమిక్ మైక్రోఫోన్లలా, రిబ్బన్ మైక్రోఫోన్లకు కూడా పవర్ అవసరం లేదు.

    ఎడ్మండ్ లోవ్, అమెరికన్ నటుడు, 1942 లో రేడియో మైక్రోఫోన్ పక్కన ఉన్న తరచుగా స్క్రిప్ట్ పట్టుకుని

  • కన్డెన్సర్ - కన్డెన్సర్ మైక్రోఫోన్లు సన్నని మెటల్ డయాఫ్రేం మరియు ఒక స్థిరమైన మెటల్ బ్యాక్‌ప్లేట్ కలిగి ఉంటాయి. వీటికి విద్యుత్ వర్తించబడుతుంది మరియు డయాఫ్రేం కంపించే సమయంలో ప్లేట్ల మధ్య స్థిరభారం మార్పు అవుతుంది, ఒక సిగ్నల్ ఉత్పత్తి అవుతుంది. కన్డెన్సర్ మైక్రోఫోన్లు పని చేయటానికి పవర్ అవసరం - దీనిని Fantastic power అంటారు.

    AKG అకౌస్టిక్స్ చేత C451B చిన్న-డయాఫ్రేం కన్డెన్సర్ మైక్రోఫోన్

  • MEMS - మైక్రో ఎలక్ట్రోమెకానికల్ సిస్టమ్ మైక్రోఫోన్‌లు, MEMS, చిప్‌పై ఉన్న మైక్రోఫోన్‌లు. వీటిలో సిలికాన్ చిప్‌పై ప్రెజర్ సెన్సిటివ్ డయాఫ్రేం ఉంటుంది, కన్డెన్సర్ మైక్రోఫోన్‌లా పని చేస్తాయి. ఇవి చాలా చిన్నవి, సర్క్యూట్రీలో ఇంక్రిగ్రేట్ చేయబడ్డవు.

    ఒక సర్క్యూట్ బోర్డులో MEMS మైక్రోఫోన్

    పై చిత్రంలో, LEFT అనే చిప్ MEMS మైక్రోఫోన్, దీనిలో 1 మిల్లీమీటరుకు తక్కువ పరిమాణంలో చిన్న డయాఫ్రేం ఉంటుంది.

కొంత పరిశోధన చేయండి: మీ దగ్గరున్న మైక్రోఫోన్లు ఏవేవి? మీ కంప్యూటర్, ఫోన్, హెడ్‌సెట్ లేదా ఇతర పరికరాల్లో ఏ రకమైన మైక్రోఫోన్లు ఉన్నాయి?

డిజిటల్ ఆడియో

ఆడియో అనేది చాలా సూక్ష్మ వివరాలున్న అనలాగ్ సిగ్నల్. దీన్ని డిజిటల్ కు మార్చడానికి, ఆడియోను ప్రతి సెకను వేల ప్రేణాలుగా నమూనా తీయాలి.

🎓 నమూనా తీసుకోవటం అంటే ఆ ఆడియో సిగ్నల్ ఆ సమయంలో ఎలాంటి విలువ కలిగి ఉందో డిజిటల్ విలువగా మార్చటం.

ఒక సిగ్నల్ లైన్ చార్ట్, స్థిర అంతరాలలో విడిపోయిన పాయింట్లు

డిజిటల్ ఆడియో పుల్స్ కోడ్ మాడ్యులేషన్ (PCM) ఉపయోగించి నమూనా తీసుకుంటారు. PCM అనేది సిగ్నల్ వోల్టేజ్ చదవటం మరియు నిర్ధారిత పరిమాణంలో సమీప డిస్క్రీట్ విలువను ఎంచుకోవడం.

💁 PCMను పుల్స్ విథ్ మాడ్యులేషన్ యొక్క సెన్సార్ వెర్షన్ లాగా అనుకోవచ్చు; PWM అనేది డిజిటల్ సిగ్నల్‌ను అనలాగ్‌గా మార్చటం, PCM అనేది అనలాగ్ సిగ్నల్‌ను డిజిటల్‌గా మార్చటం.

ఉదాహరణకు, అత్యధిక స్ట్రీమింగ్ మ్యూజిక్ సేవలు 16-బిట్ లేదా 24-బిట్ ఆడియోని అందిస్తాయి. అంటే వోల్టేజ్‌ను 16-బిట్ లేదా 24-బిట్ ఇంటీజర్‌లోకి మార్చడం. 16-బిట్ ఆడియో విలువను -32,768 నుంచి 32,767 వరకూ పరిమితం చేస్తుంది, 24-బిట్ 8,388,608 నుండి 8,388,607 వరకు. ఎక్కువ బిట్లు ఉంటే, నమూనా మా చెవిలు వాస్తవంగా వినే శబ్దానికి దగ్గరగా ఉంటుంది.

💁 మీరు 8-బిట్ ఆడియో గురించి విన్నారేమో, దీనిని LoFi అంటారు. ఇది కేవలం 8 బిట్లను ఉపయోగించి నమూనా తీసిన ఆడియో, అంటే -128 నుండి 127 వరకు. మొట్టమొదటి కంప్యూటర్ ఆడియో హార్డ్‌వేర్ పరిమితుల కారణంగా 8 బిట్ల పరిమితి ఉండేది, ఇది రెట్రో గేమింగ్‌లో కనిపిస్తుంది.

ఈ నమూనాలు ప్రతి సెకను వేలిమిది సార్లు తీసుకుంటారు, KHz (వేలు సార్లు చదవడం)s లో కొలతచేస్తారు. స్ట్రీమింగ్ మ్యూజిక్ 48KHz లో ఎక్కువగా ఉంటాయి, ఇంకా కొంత లాస్‌లెస్ ఆడియో 96KHz లేదా 192KHz వరకూ ఉంటుంది. ఎక్కువ శాంపిల్ రేట్ అంటే ఆడియో అసలు శబ్దానికి దగ్గరగా ఉంటుంది, ఒక حد వరకు. 48KHz పైగా మనుష్యులు తేడా చెప్పగలరా అన్నది చర్చ అవుతోంది.

కొంత పరిశోధన చేయండి: మీరు ఉపయోగించే స్ట్రీమింగ్ మ్యూజిక్ సేవ ఏ శాంపిల్ రేట్ మరియు పరిమాణం ఉపయోగిస్తుంది? CDs కలిగి ఉంటే వాటి శాంపిల్ రేట్ మరియు పరిమాణం ఎంత?

ఆడియో డేటా కోసం అనేక ఫార్మాట్‌లు ఉన్నాయి. మీరు mp3 ఫైళ్లు గురించి వింటుంటారు — ఇది ఆడియో డేటాను నాణ్యత కోల్పోకుండా చిన్నదిగా కంప్రెస్ చేస్తుంది. అన్‌కంప్రెస్ చేయబడిన ఆడియో WAV ఫైలుగా నిల్వ చేయబడుతుంది — 44 బైట్ల హెడ్డర్ సమాచారం కలిగి, తదుపరి రా ఆడియో డేటా ఉంటుంది. హెడ్డర్‌లో శాంపిల్ రేట్ (ఉదా., 16000 అంటే 16KHz), శాంపిల్ పరిమాణం (16 అంటే 16-బిట్), ఛానెల్ల సంఖ్య వంటి సమాచారం ఉంటుంది. ఆ తర్వాత WAV ఫైల్‌ లో రా ఆడియో ఉండదు.

🎓 ఛానెల్లు అనగా ఎంతమంది ఆడియో స్ట్రీములు కలవుతాయో. ఉదాహరణకు, స్టీరియో ఆడియోకు ఎడమ మరియు కుడి రెండు ఛానెల్లు ఉంటాయి. 7.1 సౌండ్ కోసం 8 ఛానెల్లు ఉంటాయి.

ఆడియో డేటా పరిమాణం

ఆడియో డేటా పెద్దదనే ఇయెస్ ఉంటుంది. ఉదాహరణకు, అన్‌కంప్రెస్ చేయబడిన 16-బిట్ 16KHz (స్పీచ్ నుంచి టెక్స్ట్ మోడల్ కోసం సరిపడ) ఆడియో ప్రతి సెకను 32KB డేటా తీసుకుంటుంది:

  • 16-బిట్ అంటే ప్రతి నమూనాకు 2 బైట్లు (1 బైట్ = 8 బిట్లు).
  • 16KHz అంటే 16,000 నమూనాలు ప్రతి సెకను.
  • 16,000 x 2 బైట్లు = 32,000 బైట్లు ప్రతి సెకను.

చిన్న డేటా వలె అనిపించవచ్చు, కానీ మీకు పరిమిత మెమొరీ కల మైక్రోకంట్రోలర్ ఉంటే ఇది పెద్ద విషయం. ఉదా., Wio Terminal కి 192KB మెమొరీ ఉంది, ఇది ప్రోగ్రాం కోడ్ మరియు వేరియబుల్స్ భద్రపరచాలి. ప్రోగ్రాం చిన్నదైనా, మీరు 5 సెకన్లకంటే ఎక్కువ ఆడియో పట్టుకోలేరు.

మైక్రోకంట్రోలర్లు అదనపు నిల్వలకు యాక్సెస్ కలిగి ఉంటాయి, SD కార్డ్లు లేదా ఫ్లాష్ మెమొరీ వంటి. ఆడియో సేకరణ చేసే ఐఓటీ పరికరం నిర్మిస్తుంటే, అదనపు నిల్వ కలిగి ఉండాలని చూసుకోవాలి, మరియు మీ కోడ్ మైక్రోఫోన్ నుండి కలిగిన ఆడియోని నేరుగా ఆ నిల్వకు రాయాలి. ఆ తర్వాత క్లౌడ్ కి అప్రయత్నం చేసేటప్పుడు ఆ నిల్వ నుంచి స్ట్రీమింగ్ చేయాలి. ఇలా 하면 మెమొరీ లో ఆడియో డేటాను మొత్తం నెట్టే సమస్య తప్పుతుంది.

మీ ఐఓటీ పరికరం నుండి ఆడియో సేకరణ

మీ ఐఓటీ పరికరం ఆడియో పట్టుకోవడం కోసం మైక్రోఫోన్ తో కనెక్ట్ చేయవచ్చు. అలాగే హోరాహోరీ కోసం స్పీకర్లకు కూడా కనెక్ట్ చేయవచ్చు. తర్వాత పాఠాల్లో ఇది ఆడియో ఫీడ్‌బ్యాక్ కోసం ఉపయోగపడుతుంది, కానీ మైక్రోఫోన్ పరీక్షించడానికి ఇప్పుడు స్పీకర్లు సెట్ చేయడం ఉపయోగకరం.

టాస్క్ - మీ మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయండి

మీ ఐఓటీ పరికరం కోసం మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయడానికి సంబంధిత గైడ్ అనుసరించండి:

టాస్క్ - ఆడియో సేకరణ చేయండి

మీ ఐఓటీ పరికరంపై ఆడియోను సేకరించడానికి సంబంధించిన గైడ్ పని చేయండి:

స్పీచ్ నుండి టెక్స్ట్

స్పీచ్ నుండి టెక్స్ట్, లేదా వాయిస్ గుర్తింపు, ఆడియోలోని మాటలను టెక్స్ట్ గా మార్చడానికి AIని ఉపయోగించడం.

స్పీచ్ గుర్తింపు మోడల్స్

స్పీచ్ ను టెక్స్ట్ గా మార్చడానికి, ఆడియో సిగ్నల్ నుండి алынిన నమూనాలను సమూహం చేసి, రికారెంట్ న్యూరల్ నెట్‌వర్క్ (RNN) ఆధారిత మెషీన్ లెర్నింగ్ మోడల్ కి ఇస్తారు. RNN అనేది గత డేటాను ఉపయోగించి వచ్చే డేటాలపై నిర్ణయం తీసుకొనే మెషీన్ లెర్నింగ్ మోడల్. ఉదా., RNN ఒక ఆడియో బ్లాక్ 'Hel' అని గుర్తించి, తరువాత 'lo' శబ్దం వచ్చినప్పుడు, దానికి 'Hello' అనే సరైన పదం అని అర్ధం చేసుకుని ఫలితంగా ఎంచుకోవచ్చు.

ML మోడల్స్ ప్రతి సారి అదే పరిమాణంలో డేటా తీసుకుంటాయి. మీరు మొదటి మాటల పాఠంలో చేసిన ఇమేజ్ క్లాసిఫయర్ ఒక నిర్ధారిత పరిమాణంలో చిత్రాలను అంగీకరిస్తుంది. స్పీచ్ మోడల్స్ కూడా ఫిక్స్డ్ సైజ్ ఆడియో చంక్లను ప్రాసెస్ చేస్తాయి. స్పీచ్ మోడల్స్ బహుళ అంచనాల అవుట్పుట్స్‌ని కలిపి ఉత్తరం లేదా పదం నిర్ణయించాలి; ఉదా: 'Hi' మరియు 'Highway', లేదా 'flock' మరియు 'floccinaucinihilipilification' మధ్య తేడాను తెలియజేయించాలి.

స్పీచ్ మోడల్స్ సాహిత్యాన్ని అర్థం చేసుకునేంతగా అభివృద్ధి చెందాయి, మరియు మరిన్ని శబ్దాలు పొందే కొద్దీ వచనాలను సరిచేయగలవు. ఉదా., మీరు "I went to the shops to get two bananas and an apple too" అన్నప్పుడు, 'to', 'two', 'too' అన్న మూడు పదాలు విన్నట్లే ఉన్నాయి కానీ వ్రాయుకి వేరుగా ఉంటాయి. స్పీచ్ మోడల్స్ సందర్భాన్ని అర్థం చేసుకొని సరైన వ్రాతను ఉపయోగిస్తాయి.

💁 కొన్ని స్పీచ్ సేవలు శబ్దం ఎక్కువగా ఉన్న ప్రదేశాలలో లేదా పరిశ్రమ ప్రత్యేక పదాలకు కస్టమైజ్ చేయవచ్చు, ఎంతైనా శబ్దాల పరిమితి కావాలి. ఈ కస్టమైజేషన్లు మానవ వచనం అందించి శిక్షణ ఇస్తారు, ఇది ట్రాన్స్‌ఫర్ లెర్నింగ్ అనే పద్ధతి, మీరు మొదటి పాఠంలో యామేజి క్లాసిఫయర్ కి కొన్ని చిత్రాల నుంచి శిక్షణ ఇచ్చినట్టు ఉంటుంది.

గోప్యత

వినియోగదారుల ఐఓటీ పరికరాల్లో స్పీచ్ నుండి టెక్స్ట్ ఉపయోగించి గోప్యత చాలా ముఖ్యమైనది. ఈ పరికరాలు నిరంతరం ఆడియో వినిపిస్తాయి, కాబట్టి వినియోగదారుగా మీరు అన్నిఅపుడు మాట్లాడే మాటలు మేఘం వెళ్ళిపోవడానికి అనుమతించకూడదు. ఇది భారీ ఇంటర్నెట్ బ్యాండ్‌విడ్ ఉపయోగిస్తుంది, మరియు గోప్యతకు పెద్ద సమస్యలు కలిగిస్తుంది, ముఖ్యంగా కొన్ని స్మార్ట్ పరికర తయారీదారులు ఎడమవాణి పదాలు పుట్టించడం కోసం యాదృచ్ఛికంగా కొన్ని ఆడియోను ఎంచుకుని వాటి టెక్స్ట్‌ను మానవులు ధృవీకరించేందుకు ఉపయోగిస్తారు (సూచన). మీరు మీ స్మార్ట్ పరికరం ఆడియోను క్లౌడ్‌కు పంపించి ప్రాసెస్ చేయించుకోవాలనుకుంటే, మీరు అదనపు వినియోగం చేస్తున్నప్పుడు మాత్రమే కావాలి, మీ ఇంటి లోని ఆడియో వినడం మీరు కోరుకోరు, ఆ ఆడియోలో ప్రైవేట్ సమావేశాలు లేదా సన్నిహిత చర్చలు ఉండవచ్చు. ఎక్కువ స్మార్ట్ పరికరాలు పని చేసే విధానం వేక్ వర్డ్ అనేది, ఒక కీలక పదబంధం, ఉదాహరణకు "అలెక్సా", "హే సిరి", లేదా "ఓకే గూగుల్" అవి పరికరాన్ని 'వేక్ అప్' చేసి మీరు ఏమి అంటున్నారో వినడానికి కారణమవుతుంది, మిమ్మల్ని మాట్లాడటం పూర్తయ్యిందని గుర్తించినప్పుడు ఆ వినిపింత ఆగుతుంది.

🎓 వేక్ వర్డ్ డిటెక్షన్‌ను కీవర్డ్ స్పాటింగ్ లేదా కీవర్డ్ రికగ్నిషన్ అని కూడా పిలుస్తారు.

ఈ వేక్ పదబంధాలు పరికరం మీద గుర్తించబడతాయి, క్లౌడ్ లో కాదు. ఈ స్మార్ట్ పరికరాలకు చిన్న AI మోడల్స్ ఉంటాయి, అవి పరికరం మీద నడుస్తాయి, వేక్ వర్డ్ కోసం వినుతాయి, గుర్తించినప్పుడు ఆడియోను క్లౌడ్‌కు గుర్తింపుగాను స్ట్రీమ్ చేయడం ప్రారంభిస్తాయి. ఈ మోడల్స్ చాలా ప్రత్యేకమైనవి, కేవలం వేక్ వర్డ్‌ కోసం వినడం ఇస్తాయి.

💁 కొన్ని సాంకేతిక కంపెనీలు వారి పరికరాలకు మరింత గోప్యతను జోడిస్తున్నాయి, మాట్లాడిన మాటలు పరికరం మీదనే టెక్ట్స్ గా మారుస్తున్నాయి. ఆపిల్ ప్రకటించింది, వారి 2021 iOS మరియు macOS అప్‌డేట్ల భాగంగా వారు స్పీచ్ టు టెక్ట్స్ మార్పిడిని పరికరంలోనే మద్దతు ఇస్తారని, మరియు క్లౌడ్ ఉపయోగం లేకుండా అనేక విజ్ఞప్తులను నిర్వహించగలుగుతారని. ఇది వారి పరికరాలలో శక్తివంతమైన ప్రాసెసర్ల కారణంగా సాధ్యమవుతుంది, అవి ML మోడల్స్ నడిపే సామర్థ్యం కలిగి ఉంటాయి.

మీరు ఆడియోను క్లౌడ్‌లో నిల్వచేస్తే గోప్యత మరియు నైతిక సారాంశాలు ఏమిటో మీరు ఏమనుకుంటారు? ఆ ఆడియోను నిల్వ చేయాలా? ఉన్నట్లయితే ఎలాగ? పౌర భద్రత కోసం రికార్డింగ్లను ఉపయోగించడం గోప్యత కోల్పోవడం కంటే మంచి మార్పిడి అనుకుంటారా?

వేక్ వర్డ్ గుర్తింపు సాధారణంగా టైనీ ఎంఎల్ (TinyML) అనే సాంకేతికత ఉపయోగించి చేస్తారు, ఇది మైక్రోకంట్రోలర్లపై ML మోడల్స్ నడపడం కోసం మోడల్స్‌ని మార్చడం. ఈ మోడల్స్ చిన్నటి, తక్కువ శక్తితో నడుస్తాయి.

వేక్ వర్డ్ మోడల్ శిక్షణ మరియు వాడకపు క్లిష్టతను నివారించడానికి, మీరు ఈ పాఠంలో నిర్మిస్తున్న స్మార్ట్ టైమర్ స్పీచ్ గుర్తింపును ప్రారంభించడానికి బటన్ ఉపయోగిస్తుంది.

💁 మీరు Wio టెర్మినల్ లేదా రాస్ప్బెర్రీ పై పై వేక్ వర్డ్ డిటెక్షన్ మోడల్ సృష్టించడం ప్రయత్నించాలనుకుంటే, ఈ Edge Impulse గాని మీ స్వరం కు స్పందించడం పాఠంను చూడండి. కంప్యూటర్ ఉపయోగించి చేయాలనుకుంటే Microsoft డాక్స్ లోని కస్టమ్ కీవర్డ్ క్విక్ స్టార్ట్ గైడ్ ను ప్రయత్నించవచ్చు.

స్పీచ్ ను టెక్ట్స్‌గా మార్చడం

Speech services logo

మునుపటి ప్రాజెక్టులో ఇమేజ్ క్లాసిఫికేషన్ లాగా, మాటలను ఆడియో ఫైల్‌గా తీసుకొని టెక్ట్స్‌గా మార్చే ప్రీ-బిల్ట్ AI సేవలు ఉంటాయి. అలాంటి ఒక సేవ Speech Service, ఇది Cognitive Services లో భాగంగా మీరు మీ యాప్స్ లో ఉపయోగించుకునే ప్రీ-బిల్ట్ AI సేవ.

పనితీరు - స్పీచ్ AI వనరును కాన్ఫిగర్ చేయండి

  1. ఈ ప్రాజెక్ట్‌కు Resource Group ఒకటి సృష్టించండి దీనికి పేరు మీకు smart-timer అని పెట్టండి

  2. ఈ కమాండ్ ఉపయోగించి ఉచిత స్పీచ్ వనరు సృష్టించండి:

    az cognitiveservices account create --name smart-timer \
                                        --resource-group smart-timer \
                                        --kind SpeechServices \
                                        --sku F0 \
                                        --yes \
                                        --location <location>
    

    Resource Group సృష్టించేటప్పుడు మీరు ఉపయోగించిన <location> ను మార్చండి.

  3. మీ కోడ్ నుండి స్పీచ్ వనరుకు యాక్సెస్ చేసుకోవడానికి API కీ అవసరం. ఈ కమాండ్ నడిపి కీ అందుకోండి:

    az cognitiveservices account keys list --name smart-timer \
                                           --resource-group smart-timer \
                                           --output table
    

    కీలు లో ఒకటి గుర్తుంచుకోండి.

పనితీరు - స్పీచ్ ను టెక్ట్స్ గా మార్చండి

మీ IoT పరికరంలో స్పీచ్ ను టెక్ట్స్ గా మార్పు చేయడం కోసం సంబంధిత గైడ్ అనుసరించండి:


🚀 సవాల్

స్పీచ్ గుర్తింపు చాలా కాలంగా ఉంది, మరియు నిరంతరం మెరుగుపడుతూ ఉంది. ప్రస్తుత సామర్థ్యాలు ఏమిటి మరియు అవి గతంలో ఎలా మారాయో పరిశీలించి, మానవుల పైచేసిన యంత్ర లిప్యంతరాల వ్యత్యాసం ఎంత ఖచ్చితమైనదో పోల్చండి.

స్పీచ్ గుర్తింపు భవిష్యత్తు గురించి మీరు ఏమనుకుంటారు?

లెక్చర్ తర్వాత క్విజ్

లెక్చర్ తర్వాత క్విజ్

సమీక్ష & స్వీయ అధ్యయనం

అసైన్‌మెంట్


హక్కు ప్రకటన:
ఈ డాక్యుమెంట్‌ను AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించాం. మేము సరిగ్గా ఉండేందుకు ప్రయత్నిస్తేనూ, ఆటోమేటెడ్ అనువాదాలలో పొరపాట్లు లేదా అసత్యతలు ఉండవచ్చు. మూల డాక్యుమెంట్ దాని స్వదేశ భాషలో ఆధ్యాత్మక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, నిపుణుల మానవ అనువాదాన్ని సిఫార్సు చేస్తాము. ఈ అనువాదం వాడకంతో కలిగే అపవాదాల కోసం మేము బాధ్యత వహించము.