|
|
6 months ago | |
|---|---|---|
| .. | ||
| README.md | 6 months ago | |
| assignment.md | 6 months ago | |
| pi-audio.md | 6 months ago | |
| pi-microphone.md | 6 months ago | |
| pi-speech-to-text.md | 6 months ago | |
| virtual-device-audio.md | 6 months ago | |
| virtual-device-microphone.md | 6 months ago | |
| virtual-device-speech-to-text.md | 6 months ago | |
| wio-terminal-audio.md | 6 months ago | |
| wio-terminal-microphone.md | 6 months ago | |
| wio-terminal-speech-to-text.md | 6 months ago | |
README.md
ఓ ఐఓటీ పరికరంతో మాట గుర్తించండి
స్కెచ్నోట్: నిత్య నరసింహన్. పెద్దవర్షన్ కోసం చిత్రాన్ని క్లిక్ చేయండి.
ఈ వీడియో అజ్యూర్ స్పీచ్ సర్వీస్ యొక్క ఓవerviewని ఇస్తుంది, ఇది ఈ పాఠంలో కవర్ చేయబడుతుంది:
🎥 వీడియో చూడటానికి పై చిత్రాన్ని క్లిక్ చేయండి
పాఠం ముందు పర్యాయపరీక్ష
పరిచయం
'అలెక్సా, 12 నిమిషాల టైమర్ను సెట్ చేయు'
'అలెక్సా, టైమర్ స్థితి'
'అలెక్సా, steam broccoli అనే 8 నిమిషాల టైమర్ను సెట్ చేయు'
స్మార్ట్ పరికరాలు ఎక్కువగా ప్రాచుర్యం పొందుతున్నాయి. హోమ్పాడ్స్, ఎకోస్ మరియు గూగుల్ హోమ్స్ వంటి స్మార్ట్ స్పీకర్లుగా కాకుండా, మా ఫోన్లు, గడియారాలు, తక్కువ వెలుతురు, థర్మోస్టాట్లు వంటి పరికరాల్లోనూ ఉన్నాయి.
💁 నా ఇల్లలో కనీసం 19 పరికరాల్లో వాయిస్ అసిస్టెంట్ ఉంది, అవి నాకు తెలుసు!
వాయిస్ కన్ట్రోల్, కదలిక పరిమితులు ఉన్నవారికి పరికరాలతో సహజంగా పాటుకోవడానికి వీలుగా సౌలభ్యాన్ని పెంచుతుంది. ఇది జన్మతోనే చేయకపోవడం వంటి శాశ్వత వైకల్యం నుండి, విరిగిన చట్టాల వంటి తాత్కాలిక వైకల్యం వరకు లేకపోతే చేతులు బాగా బాపట్లు లేదా పిల్లలతో నిండిపోయినపుడు కూడా, నడుస్తున్న వాయిస్తో మన ఇళ్ళను నియంత్రించడం ప్రపంచాన్ని సులభతరంగా చేస్తుంది. "హే సిరీ, నా గ్యారేజ్ డోర్ మూసివేసు" అన్నదీ, ఒక పిల్లోడిని మార్చడం మరియు అహం చేసే అమ్మాయితో సహాయపడటానికి చిన్న కానీ సమర్థవంతమైన మార్పు.
వాయిస్ అసిస్టెంట్లలో ఒకటి ఎక్కువగా ఉపయోగించేది టైమర్లను సెట్ చేయటం, ముఖ్యంగా వంట గది టైమర్లు. మీ వాయిస్తో మాత్రమే బహుళ టైమర్లను సెట్ చేయగలగడం వంటగదిలో భారీ సహాయం - డౌ గమ్మరించటం, సూప్ కలపటం ఆపకుండా లేదా మీ చేతులు నెమ్మదిగా ఉండకుండా టైమర్ని ఉపయోగించడం అవసరం లేదు.
ఈ పాఠంలో మీరు ఓ ఐఓటీ పరికరాల్లో వాయిస్ గుర్తింపును ఎలా నిర్మించాలో నేర్చుకుంటారు. మీరు మైక్రోఫోన్లను సెన్సార్లుగా ఎలా ఉపయోగించాలో, ఐఓటీ పరికరంలో కలిపిన మైక్రోఫోన్లోనుండి ఆడియో ఎలా పట్టుకోవచ్చో, విన్నది టెక్స్గా ఎలా మార్చడానికి AIని ఉపయోగించాలో నేర్చుకుంటారు. ఈ ప్రాజెక్ట్ అంతా మీరు బహుళ భాషలతో వాయిస్ ఉపయోగించి టైమర్లను సెట్ చేయగల స్మార్ట్ కిచెన్ టైమర్ను నిర్మిస్తారు.
ఈ పాఠంలో కవర్ చేయబడుతుంది:
మైక్రోఫోన్లు
మైక్రోఫోన్లు అనేవి శబ్ద తరంగాలను ఎలక్ట్రికల్ సిగ్నల్స్గా మార్చే అనలాగ్ సెన్సార్లు. గాలి లో కంపనలు మైక్రోఫోన్లోని భాగాలను సన్నగా కదిలిస్తాయి, ఇవి ఎలక్ట్రికల్ సిగ్నల్స్లో చిన్న మార్పులను కలిగిస్తాయి. ఆ మార్పులను పెంచి ఎలక్ట్రికల్ అవుట్పుట్ రూపొందిస్తారు.
మైక్రోఫోన్ రకాలు
మైక్రోఫోన్లు వివిధ రకాలలో వస్తాయి:
-
డైనమిక్ - డైనమిక్ మైక్రోఫోన్లలో ఒక మాగ్నెట్ ఒక కదిలే డయాఫ్రేం కి అంటి ఉంటుంది, ఇది వైర్ కాయిల్లో కదులుతుంటే ఎలక్ట్రికల్ కరెంట్ ని సృష్టిస్తుంది. ఇది అత్యధిక స్పీకర్లకు విలొమం, అక్కడ ఎలక్ట్రికల్ కరెంట్ మాగ్నెట్ ను కదిలించి డయాఫ్రేం నుంచి శబ్దాన్ని కలిగిస్తారు. కాబట్టి స్పీకర్లు డైనమిక్ మైక్రోఫోన్లుగా మరియు డైనమిక్ మైక్రోఫోన్లు స్పీకర్లుగా ఉపయోగించవచ్చు. ఇంటర్కామ్ లాంటివి వినేటప్పుడు లేదా మాట్లాడేటప్పుడు ఒకే పరికరం రెండు పనులు చేయగలదు.
డైనమిక్ మైక్రోఫోన్లు పని చేయడానికి పవర్ అవసరం లేదు, ఎలక్ట్రికల్ సిగ్నల్ పూర్తిగా మైక్రోఫోనం నుండే ఉత్పత్తి అవుతుంది.
-
రిబ్బన్ - రిబ్బన్ మైక్రోఫోన్లు డైనమిక్ మైక్రోఫోన్లకు సమానంగా ఉంటాయి, కానీ డయాఫ్రేం బదులుగా మెటల్ రిబ్బన్ ఉంటాయి. ఈ రిబ్బన్ మాగ్నెటిక్ఫీల్డ్లో కదిలి ఎలక్ట్రికల్ కరెంట్ సృష్టిస్తుంది. డైనమిక్ మైక్రోఫోన్లలా, రిబ్బన్ మైక్రోఫోన్లకు కూడా పవర్ అవసరం లేదు.
-
కన్డెన్సర్ - కన్డెన్సర్ మైక్రోఫోన్లు సన్నని మెటల్ డయాఫ్రేం మరియు ఒక స్థిరమైన మెటల్ బ్యాక్ప్లేట్ కలిగి ఉంటాయి. వీటికి విద్యుత్ వర్తించబడుతుంది మరియు డయాఫ్రేం కంపించే సమయంలో ప్లేట్ల మధ్య స్థిరభారం మార్పు అవుతుంది, ఒక సిగ్నల్ ఉత్పత్తి అవుతుంది. కన్డెన్సర్ మైక్రోఫోన్లు పని చేయటానికి పవర్ అవసరం - దీనిని Fantastic power అంటారు.
-
MEMS - మైక్రో ఎలక్ట్రోమెకానికల్ సిస్టమ్ మైక్రోఫోన్లు, MEMS, చిప్పై ఉన్న మైక్రోఫోన్లు. వీటిలో సిలికాన్ చిప్పై ప్రెజర్ సెన్సిటివ్ డయాఫ్రేం ఉంటుంది, కన్డెన్సర్ మైక్రోఫోన్లా పని చేస్తాయి. ఇవి చాలా చిన్నవి, సర్క్యూట్రీలో ఇంక్రిగ్రేట్ చేయబడ్డవు.
పై చిత్రంలో, LEFT అనే చిప్ MEMS మైక్రోఫోన్, దీనిలో 1 మిల్లీమీటరుకు తక్కువ పరిమాణంలో చిన్న డయాఫ్రేం ఉంటుంది.
✅ కొంత పరిశోధన చేయండి: మీ దగ్గరున్న మైక్రోఫోన్లు ఏవేవి? మీ కంప్యూటర్, ఫోన్, హెడ్సెట్ లేదా ఇతర పరికరాల్లో ఏ రకమైన మైక్రోఫోన్లు ఉన్నాయి?
డిజిటల్ ఆడియో
ఆడియో అనేది చాలా సూక్ష్మ వివరాలున్న అనలాగ్ సిగ్నల్. దీన్ని డిజిటల్ కు మార్చడానికి, ఆడియోను ప్రతి సెకను వేల ప్రేణాలుగా నమూనా తీయాలి.
🎓 నమూనా తీసుకోవటం అంటే ఆ ఆడియో సిగ్నల్ ఆ సమయంలో ఎలాంటి విలువ కలిగి ఉందో డిజిటల్ విలువగా మార్చటం.
డిజిటల్ ఆడియో పుల్స్ కోడ్ మాడ్యులేషన్ (PCM) ఉపయోగించి నమూనా తీసుకుంటారు. PCM అనేది సిగ్నల్ వోల్టేజ్ చదవటం మరియు నిర్ధారిత పరిమాణంలో సమీప డిస్క్రీట్ విలువను ఎంచుకోవడం.
💁 PCMను పుల్స్ విథ్ మాడ్యులేషన్ యొక్క సెన్సార్ వెర్షన్ లాగా అనుకోవచ్చు; PWM అనేది డిజిటల్ సిగ్నల్ను అనలాగ్గా మార్చటం, PCM అనేది అనలాగ్ సిగ్నల్ను డిజిటల్గా మార్చటం.
ఉదాహరణకు, అత్యధిక స్ట్రీమింగ్ మ్యూజిక్ సేవలు 16-బిట్ లేదా 24-బిట్ ఆడియోని అందిస్తాయి. అంటే వోల్టేజ్ను 16-బిట్ లేదా 24-బిట్ ఇంటీజర్లోకి మార్చడం. 16-బిట్ ఆడియో విలువను -32,768 నుంచి 32,767 వరకూ పరిమితం చేస్తుంది, 24-బిట్ −8,388,608 నుండి 8,388,607 వరకు. ఎక్కువ బిట్లు ఉంటే, నమూనా మా చెవిలు వాస్తవంగా వినే శబ్దానికి దగ్గరగా ఉంటుంది.
💁 మీరు 8-బిట్ ఆడియో గురించి విన్నారేమో, దీనిని LoFi అంటారు. ఇది కేవలం 8 బిట్లను ఉపయోగించి నమూనా తీసిన ఆడియో, అంటే -128 నుండి 127 వరకు. మొట్టమొదటి కంప్యూటర్ ఆడియో హార్డ్వేర్ పరిమితుల కారణంగా 8 బిట్ల పరిమితి ఉండేది, ఇది రెట్రో గేమింగ్లో కనిపిస్తుంది.
ఈ నమూనాలు ప్రతి సెకను వేలిమిది సార్లు తీసుకుంటారు, KHz (వేలు సార్లు చదవడం)s లో కొలతచేస్తారు. స్ట్రీమింగ్ మ్యూజిక్ 48KHz లో ఎక్కువగా ఉంటాయి, ఇంకా కొంత లాస్లెస్ ఆడియో 96KHz లేదా 192KHz వరకూ ఉంటుంది. ఎక్కువ శాంపిల్ రేట్ అంటే ఆడియో అసలు శబ్దానికి దగ్గరగా ఉంటుంది, ఒక حد వరకు. 48KHz పైగా మనుష్యులు తేడా చెప్పగలరా అన్నది చర్చ అవుతోంది.
✅ కొంత పరిశోధన చేయండి: మీరు ఉపయోగించే స్ట్రీమింగ్ మ్యూజిక్ సేవ ఏ శాంపిల్ రేట్ మరియు పరిమాణం ఉపయోగిస్తుంది? CDs కలిగి ఉంటే వాటి శాంపిల్ రేట్ మరియు పరిమాణం ఎంత?
ఆడియో డేటా కోసం అనేక ఫార్మాట్లు ఉన్నాయి. మీరు mp3 ఫైళ్లు గురించి వింటుంటారు — ఇది ఆడియో డేటాను నాణ్యత కోల్పోకుండా చిన్నదిగా కంప్రెస్ చేస్తుంది. అన్కంప్రెస్ చేయబడిన ఆడియో WAV ఫైలుగా నిల్వ చేయబడుతుంది — 44 బైట్ల హెడ్డర్ సమాచారం కలిగి, తదుపరి రా ఆడియో డేటా ఉంటుంది. హెడ్డర్లో శాంపిల్ రేట్ (ఉదా., 16000 అంటే 16KHz), శాంపిల్ పరిమాణం (16 అంటే 16-బిట్), ఛానెల్ల సంఖ్య వంటి సమాచారం ఉంటుంది. ఆ తర్వాత WAV ఫైల్ లో రా ఆడియో ఉండదు.
🎓 ఛానెల్లు అనగా ఎంతమంది ఆడియో స్ట్రీములు కలవుతాయో. ఉదాహరణకు, స్టీరియో ఆడియోకు ఎడమ మరియు కుడి రెండు ఛానెల్లు ఉంటాయి. 7.1 సౌండ్ కోసం 8 ఛానెల్లు ఉంటాయి.
ఆడియో డేటా పరిమాణం
ఆడియో డేటా పెద్దదనే ఇయెస్ ఉంటుంది. ఉదాహరణకు, అన్కంప్రెస్ చేయబడిన 16-బిట్ 16KHz (స్పీచ్ నుంచి టెక్స్ట్ మోడల్ కోసం సరిపడ) ఆడియో ప్రతి సెకను 32KB డేటా తీసుకుంటుంది:
- 16-బిట్ అంటే ప్రతి నమూనాకు 2 బైట్లు (1 బైట్ = 8 బిట్లు).
- 16KHz అంటే 16,000 నమూనాలు ప్రతి సెకను.
- 16,000 x 2 బైట్లు = 32,000 బైట్లు ప్రతి సెకను.
చిన్న డేటా వలె అనిపించవచ్చు, కానీ మీకు పరిమిత మెమొరీ కల మైక్రోకంట్రోలర్ ఉంటే ఇది పెద్ద విషయం. ఉదా., Wio Terminal కి 192KB మెమొరీ ఉంది, ఇది ప్రోగ్రాం కోడ్ మరియు వేరియబుల్స్ భద్రపరచాలి. ప్రోగ్రాం చిన్నదైనా, మీరు 5 సెకన్లకంటే ఎక్కువ ఆడియో పట్టుకోలేరు.
మైక్రోకంట్రోలర్లు అదనపు నిల్వలకు యాక్సెస్ కలిగి ఉంటాయి, SD కార్డ్లు లేదా ఫ్లాష్ మెమొరీ వంటి. ఆడియో సేకరణ చేసే ఐఓటీ పరికరం నిర్మిస్తుంటే, అదనపు నిల్వ కలిగి ఉండాలని చూసుకోవాలి, మరియు మీ కోడ్ మైక్రోఫోన్ నుండి కలిగిన ఆడియోని నేరుగా ఆ నిల్వకు రాయాలి. ఆ తర్వాత క్లౌడ్ కి అప్రయత్నం చేసేటప్పుడు ఆ నిల్వ నుంచి స్ట్రీమింగ్ చేయాలి. ఇలా 하면 మెమొరీ లో ఆడియో డేటాను మొత్తం నెట్టే సమస్య తప్పుతుంది.
మీ ఐఓటీ పరికరం నుండి ఆడియో సేకరణ
మీ ఐఓటీ పరికరం ఆడియో పట్టుకోవడం కోసం మైక్రోఫోన్ తో కనెక్ట్ చేయవచ్చు. అలాగే హోరాహోరీ కోసం స్పీకర్లకు కూడా కనెక్ట్ చేయవచ్చు. తర్వాత పాఠాల్లో ఇది ఆడియో ఫీడ్బ్యాక్ కోసం ఉపయోగపడుతుంది, కానీ మైక్రోఫోన్ పరీక్షించడానికి ఇప్పుడు స్పీకర్లు సెట్ చేయడం ఉపయోగకరం.
టాస్క్ - మీ మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయండి
మీ ఐఓటీ పరికరం కోసం మైక్రోఫోన్ మరియు స్పీకర్లను కాన్ఫిగర్ చేయడానికి సంబంధిత గైడ్ అనుసరించండి:
- Arduino - Wio Terminal
- సింగిల్-బోర్డ్ కంప్యూటర్ - Raspberry Pi
- సింగిల్-బోర్డ్ కంప్యూటర్ - వర్చువల్ డివైస్
టాస్క్ - ఆడియో సేకరణ చేయండి
మీ ఐఓటీ పరికరంపై ఆడియోను సేకరించడానికి సంబంధించిన గైడ్ పని చేయండి:
- Arduino - Wio Terminal
- సింగిల్-బోర్డ్ కంప్యూటర్ - Raspberry Pi
- సింగిల్-బోర్డ్ కంప్యూటర్ - వర్చువల్ డివైస్
స్పీచ్ నుండి టెక్స్ట్
స్పీచ్ నుండి టెక్స్ట్, లేదా వాయిస్ గుర్తింపు, ఆడియోలోని మాటలను టెక్స్ట్ గా మార్చడానికి AIని ఉపయోగించడం.
స్పీచ్ గుర్తింపు మోడల్స్
స్పీచ్ ను టెక్స్ట్ గా మార్చడానికి, ఆడియో సిగ్నల్ నుండి алынిన నమూనాలను సమూహం చేసి, రికారెంట్ న్యూరల్ నెట్వర్క్ (RNN) ఆధారిత మెషీన్ లెర్నింగ్ మోడల్ కి ఇస్తారు. RNN అనేది గత డేటాను ఉపయోగించి వచ్చే డేటాలపై నిర్ణయం తీసుకొనే మెషీన్ లెర్నింగ్ మోడల్. ఉదా., RNN ఒక ఆడియో బ్లాక్ 'Hel' అని గుర్తించి, తరువాత 'lo' శబ్దం వచ్చినప్పుడు, దానికి 'Hello' అనే సరైన పదం అని అర్ధం చేసుకుని ఫలితంగా ఎంచుకోవచ్చు.
ML మోడల్స్ ప్రతి సారి అదే పరిమాణంలో డేటా తీసుకుంటాయి. మీరు మొదటి మాటల పాఠంలో చేసిన ఇమేజ్ క్లాసిఫయర్ ఒక నిర్ధారిత పరిమాణంలో చిత్రాలను అంగీకరిస్తుంది. స్పీచ్ మోడల్స్ కూడా ఫిక్స్డ్ సైజ్ ఆడియో చంక్లను ప్రాసెస్ చేస్తాయి. స్పీచ్ మోడల్స్ బహుళ అంచనాల అవుట్పుట్స్ని కలిపి ఉత్తరం లేదా పదం నిర్ణయించాలి; ఉదా: 'Hi' మరియు 'Highway', లేదా 'flock' మరియు 'floccinaucinihilipilification' మధ్య తేడాను తెలియజేయించాలి.
స్పీచ్ మోడల్స్ సాహిత్యాన్ని అర్థం చేసుకునేంతగా అభివృద్ధి చెందాయి, మరియు మరిన్ని శబ్దాలు పొందే కొద్దీ వచనాలను సరిచేయగలవు. ఉదా., మీరు "I went to the shops to get two bananas and an apple too" అన్నప్పుడు, 'to', 'two', 'too' అన్న మూడు పదాలు విన్నట్లే ఉన్నాయి కానీ వ్రాయుకి వేరుగా ఉంటాయి. స్పీచ్ మోడల్స్ సందర్భాన్ని అర్థం చేసుకొని సరైన వ్రాతను ఉపయోగిస్తాయి.
💁 కొన్ని స్పీచ్ సేవలు శబ్దం ఎక్కువగా ఉన్న ప్రదేశాలలో లేదా పరిశ్రమ ప్రత్యేక పదాలకు కస్టమైజ్ చేయవచ్చు, ఎంతైనా శబ్దాల పరిమితి కావాలి. ఈ కస్టమైజేషన్లు మానవ వచనం అందించి శిక్షణ ఇస్తారు, ఇది ట్రాన్స్ఫర్ లెర్నింగ్ అనే పద్ధతి, మీరు మొదటి పాఠంలో యామేజి క్లాసిఫయర్ కి కొన్ని చిత్రాల నుంచి శిక్షణ ఇచ్చినట్టు ఉంటుంది.
గోప్యత
వినియోగదారుల ఐఓటీ పరికరాల్లో స్పీచ్ నుండి టెక్స్ట్ ఉపయోగించి గోప్యత చాలా ముఖ్యమైనది. ఈ పరికరాలు నిరంతరం ఆడియో వినిపిస్తాయి, కాబట్టి వినియోగదారుగా మీరు అన్నిఅపుడు మాట్లాడే మాటలు మేఘం వెళ్ళిపోవడానికి అనుమతించకూడదు. ఇది భారీ ఇంటర్నెట్ బ్యాండ్విడ్ ఉపయోగిస్తుంది, మరియు గోప్యతకు పెద్ద సమస్యలు కలిగిస్తుంది, ముఖ్యంగా కొన్ని స్మార్ట్ పరికర తయారీదారులు ఎడమవాణి పదాలు పుట్టించడం కోసం యాదృచ్ఛికంగా కొన్ని ఆడియోను ఎంచుకుని వాటి టెక్స్ట్ను మానవులు ధృవీకరించేందుకు ఉపయోగిస్తారు (సూచన). మీరు మీ స్మార్ట్ పరికరం ఆడియోను క్లౌడ్కు పంపించి ప్రాసెస్ చేయించుకోవాలనుకుంటే, మీరు అదనపు వినియోగం చేస్తున్నప్పుడు మాత్రమే కావాలి, మీ ఇంటి లోని ఆడియో వినడం మీరు కోరుకోరు, ఆ ఆడియోలో ప్రైవేట్ సమావేశాలు లేదా సన్నిహిత చర్చలు ఉండవచ్చు. ఎక్కువ స్మార్ట్ పరికరాలు పని చేసే విధానం వేక్ వర్డ్ అనేది, ఒక కీలక పదబంధం, ఉదాహరణకు "అలెక్సా", "హే సిరి", లేదా "ఓకే గూగుల్" అవి పరికరాన్ని 'వేక్ అప్' చేసి మీరు ఏమి అంటున్నారో వినడానికి కారణమవుతుంది, మిమ్మల్ని మాట్లాడటం పూర్తయ్యిందని గుర్తించినప్పుడు ఆ వినిపింత ఆగుతుంది.
🎓 వేక్ వర్డ్ డిటెక్షన్ను కీవర్డ్ స్పాటింగ్ లేదా కీవర్డ్ రికగ్నిషన్ అని కూడా పిలుస్తారు.
ఈ వేక్ పదబంధాలు పరికరం మీద గుర్తించబడతాయి, క్లౌడ్ లో కాదు. ఈ స్మార్ట్ పరికరాలకు చిన్న AI మోడల్స్ ఉంటాయి, అవి పరికరం మీద నడుస్తాయి, వేక్ వర్డ్ కోసం వినుతాయి, గుర్తించినప్పుడు ఆడియోను క్లౌడ్కు గుర్తింపుగాను స్ట్రీమ్ చేయడం ప్రారంభిస్తాయి. ఈ మోడల్స్ చాలా ప్రత్యేకమైనవి, కేవలం వేక్ వర్డ్ కోసం వినడం ఇస్తాయి.
💁 కొన్ని సాంకేతిక కంపెనీలు వారి పరికరాలకు మరింత గోప్యతను జోడిస్తున్నాయి, మాట్లాడిన మాటలు పరికరం మీదనే టెక్ట్స్ గా మారుస్తున్నాయి. ఆపిల్ ప్రకటించింది, వారి 2021 iOS మరియు macOS అప్డేట్ల భాగంగా వారు స్పీచ్ టు టెక్ట్స్ మార్పిడిని పరికరంలోనే మద్దతు ఇస్తారని, మరియు క్లౌడ్ ఉపయోగం లేకుండా అనేక విజ్ఞప్తులను నిర్వహించగలుగుతారని. ఇది వారి పరికరాలలో శక్తివంతమైన ప్రాసెసర్ల కారణంగా సాధ్యమవుతుంది, అవి ML మోడల్స్ నడిపే సామర్థ్యం కలిగి ఉంటాయి.
✅ మీరు ఆడియోను క్లౌడ్లో నిల్వచేస్తే గోప్యత మరియు నైతిక సారాంశాలు ఏమిటో మీరు ఏమనుకుంటారు? ఆ ఆడియోను నిల్వ చేయాలా? ఉన్నట్లయితే ఎలాగ? పౌర భద్రత కోసం రికార్డింగ్లను ఉపయోగించడం గోప్యత కోల్పోవడం కంటే మంచి మార్పిడి అనుకుంటారా?
వేక్ వర్డ్ గుర్తింపు సాధారణంగా టైనీ ఎంఎల్ (TinyML) అనే సాంకేతికత ఉపయోగించి చేస్తారు, ఇది మైక్రోకంట్రోలర్లపై ML మోడల్స్ నడపడం కోసం మోడల్స్ని మార్చడం. ఈ మోడల్స్ చిన్నటి, తక్కువ శక్తితో నడుస్తాయి.
వేక్ వర్డ్ మోడల్ శిక్షణ మరియు వాడకపు క్లిష్టతను నివారించడానికి, మీరు ఈ పాఠంలో నిర్మిస్తున్న స్మార్ట్ టైమర్ స్పీచ్ గుర్తింపును ప్రారంభించడానికి బటన్ ఉపయోగిస్తుంది.
💁 మీరు Wio టెర్మినల్ లేదా రాస్ప్బెర్రీ పై పై వేక్ వర్డ్ డిటెక్షన్ మోడల్ సృష్టించడం ప్రయత్నించాలనుకుంటే, ఈ Edge Impulse గాని మీ స్వరం కు స్పందించడం పాఠంను చూడండి. కంప్యూటర్ ఉపయోగించి చేయాలనుకుంటే Microsoft డాక్స్ లోని కస్టమ్ కీవర్డ్ క్విక్ స్టార్ట్ గైడ్ ను ప్రయత్నించవచ్చు.
స్పీచ్ ను టెక్ట్స్గా మార్చడం
మునుపటి ప్రాజెక్టులో ఇమేజ్ క్లాసిఫికేషన్ లాగా, మాటలను ఆడియో ఫైల్గా తీసుకొని టెక్ట్స్గా మార్చే ప్రీ-బిల్ట్ AI సేవలు ఉంటాయి. అలాంటి ఒక సేవ Speech Service, ఇది Cognitive Services లో భాగంగా మీరు మీ యాప్స్ లో ఉపయోగించుకునే ప్రీ-బిల్ట్ AI సేవ.
పనితీరు - స్పీచ్ AI వనరును కాన్ఫిగర్ చేయండి
-
ఈ ప్రాజెక్ట్కు Resource Group ఒకటి సృష్టించండి దీనికి పేరు మీకు
smart-timerఅని పెట్టండి -
ఈ కమాండ్ ఉపయోగించి ఉచిత స్పీచ్ వనరు సృష్టించండి:
az cognitiveservices account create --name smart-timer \ --resource-group smart-timer \ --kind SpeechServices \ --sku F0 \ --yes \ --location <location>Resource Group సృష్టించేటప్పుడు మీరు ఉపయోగించిన
<location>ను మార్చండి. -
మీ కోడ్ నుండి స్పీచ్ వనరుకు యాక్సెస్ చేసుకోవడానికి API కీ అవసరం. ఈ కమాండ్ నడిపి కీ అందుకోండి:
az cognitiveservices account keys list --name smart-timer \ --resource-group smart-timer \ --output tableకీలు లో ఒకటి గుర్తుంచుకోండి.
పనితీరు - స్పీచ్ ను టెక్ట్స్ గా మార్చండి
మీ IoT పరికరంలో స్పీచ్ ను టెక్ట్స్ గా మార్పు చేయడం కోసం సంబంధిత గైడ్ అనుసరించండి:
- Arduino - Wio Terminal
- సింగిల్-బోర్డ్ కంప్యూటర్ - Raspberry Pi
- సింగిల్-బోర్డ్ కంప్యూటర్ - వర్చువల్ పరికరం
🚀 సవాల్
స్పీచ్ గుర్తింపు చాలా కాలంగా ఉంది, మరియు నిరంతరం మెరుగుపడుతూ ఉంది. ప్రస్తుత సామర్థ్యాలు ఏమిటి మరియు అవి గతంలో ఎలా మారాయో పరిశీలించి, మానవుల పైచేసిన యంత్ర లిప్యంతరాల వ్యత్యాసం ఎంత ఖచ్చితమైనదో పోల్చండి.
స్పీచ్ గుర్తింపు భవిష్యత్తు గురించి మీరు ఏమనుకుంటారు?
లెక్చర్ తర్వాత క్విజ్
సమీక్ష & స్వీయ అధ్యయనం
- విభిన్న మైక్రోఫోన్ రకాల గురించి మరియు అవి ఎలా పనిచేస్తాయి తెలుసుకోవటానికి Musician's HQ లో డైనమిక్ మరియు కండెన్సర్ మైక్రోఫోన్ల వ్యత్యాసం ఆర్టికల్ చదవండి.
- Cognitive Services స్పీచ్ సేవ గురించి మరింత తెలుసుకోవడానికి Microsoft Docs లో స్పీచ్ సర్వీస్ డాక్యుమెంటేషన్ చదవండి.
- కీవర్డ్ స్పాటింగ్ గురించి Microsoft Docs లో కీవర్డ్ రికగ్నిషన్ డాక్యుమెంటేషన్ చదవండి.
అసైన్మెంట్
హక్కు ప్రకటన:
ఈ డాక్యుమెంట్ను AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించాం. మేము సరిగ్గా ఉండేందుకు ప్రయత్నిస్తేనూ, ఆటోమేటెడ్ అనువాదాలలో పొరపాట్లు లేదా అసత్యతలు ఉండవచ్చు. మూల డాక్యుమెంట్ దాని స్వదేశ భాషలో ఆధ్యాత్మక మూలం అని పరిగణించాలి. ముఖ్యమైన సమాచారానికి, నిపుణుల మానవ అనువాదాన్ని సిఫార్సు చేస్తాము. ఈ అనువాదం వాడకంతో కలిగే అపవాదాల కోసం మేము బాధ్యత వహించము.







