|
|
3 months ago | |
|---|---|---|
| .. | ||
| solution | 6 months ago | |
| README.md | 3 months ago | |
| assignment.md | 6 months ago | |
| notebook.ipynb | 8 months ago | |
README.md
క్లస్టరింగ్కు పరిచయం
క్లస్టరింగ్ అనేది ఒక రకమైన Unsupervised Learning దీనిలో ఒక డేటాసెట్ లేబుల్ చేయబడలేదు లేదా దాని ఇన్పుట్లు ముందుగా నిర్ణయించబడిన అవుట్పుట్స్కి సరిపోలడం లేదు అని فرضించబడుతుంది. ఇది వివిధ ఆల్గోరిథమ్స్ ఉపయోగించి లేబుల్ చేయబడని డేటాలోనూ జరిగే నమూనాలను గుర్తించి గుంపులను ఏర్పరుస్తుంది.
🎥 పై చిత్రాన్ని క్లిక్ చేసి వీడియోను చూడండి. మీరు క్లస్టరింగ్తో మెషిన్ లెర్నింగ్ చదువుతున్నప్పుడు, కొన్ని నైజీరియన్ డాన్స్ హాల్ పాటలను ఆనందించండి - ఇది 2014లో PSquare నుండి చాలా అభినందన పొందిన పాట.
పాఠం ముందు క్విజ్
పరిచయం
క్లస్టరింగ్ డేటా అన్వేషణకు చాలా ఉపయోగకరంగా ఉంటుంది. నైజీరియన్ ప్రేక్షకులు సంగీతాన్ని ఎలా వినిపిస్తారో దాని ధోరణులు మరియు నమూనాలను కనుగొనడంలో ఇది సహాయపడవచ్చా చూద్దాం.
✅ క్లస్టరింగ్ ఉపయోగాల గురించి ఒక నిమిషం ఆలోచించండి. నిజ జీవితంలో, మీరు ఒక పెద్ద లాండ్రీ ఉన్నప్పుడు మీ కుటుంబ సభ్యుల బట్టలను వేరు చేయాల్సినప్పుడు క్లస్టరింగ్ జరుగుతుంది 🧦👕👖🩲. డేటా సైన్స్లో, యూజర్ ఇష్టాలను విశ్లేషించేటప్పుడు లేదా ఏదైనా లేబుల్ చేయబడని డేటాసెట్ లక్షణాలను నిర్ధారించేటప్పుడు క్లస్టరింగ్ జరుగుతుంది. క్లస్టరింగ్ ఒక విధంగా, షాక్డ్రాయర్లాగా ఉన్న గందరగోళాన్ని అర్థం చేసుకోవడంలో సహాయపడుతుంది.
🎥 పై చిత్రాన్ని క్లిక్ చేసి వీడియో చూడండి: MITలో జాన్ గట్టాగ్ క్లస్టరింగ్ పరిచయం చేస్తున్నారు
ప్రొఫెషనల్ వాతావరణంలో, మార్కెట్ సెగ్మెంటేషన్, వయసు సమూహాలు ఏ వస్తువుల్ని కొంటారో నిర్ణయించడం వెలుపులో క్లస్టరింగ్ ఉపయోగపడుతుంది. మరో ఉపయోగం అనామలీ డిటెక్షన్ కోసం ఉండవచ్చు, ఉదాహరణకు క్రెడిట్ కార్డ్ లావాదేవీల డేటా నుంచి మోసం గుర్తించేందుకు. లేదా మీరింత ఎప్పుడు వైద్య స్కాన్లలో ట్యూమర్లు గుర్తించడానికి క్లస్టరింగ్ చేయవచ్చు.
✅ మీరు బ్యాంకింగ్, ఈ-కామర్స్ లేదా వ్యాపార పరిస్థితుల్లో క్లస్టరింగ్ను 'వైల్డ్లో' ఎలా ఎదుర్కొన్నట్టు అనిపించిందో ఒక నిమిషం ఆలోచించండి.
🎓 ఆసక్తికరంగా, 1930లలో మానవ శాస్త్రం మరియు మానసికశాస్త్రంలో క్లస్టర్ విశ్లేషణ ప్రారంభమైంది. ఇది ఎలా ఉపయోగించబడిందో ఊహించగలరా?
ఇంకొకవైపు, మీరు సెర్చ్ ఫలితాలను గుంపులను (ఉదా: షాపింగ్ లింకులు, చిత్రాలు, సమీక్షలు) వేరు చేసేలా ఉపయోగించవచ్చు. పెద్ద డేటాసెట్ ను తగ్గించడానికి మరియు మరింత స్పష్టమైన విశ్లేషణ చేయడానికి క్లస్టరింగ్ సాంకేతికత ఉపయోగా ఉంటుంది, దాంతో ఈ పద్ధతి ఇతర మోడళ్ళు నిర్మించబోయేముందు డేటాను అధ్యయనం చేయడంలో సహాయపడుతుంది.
✅ ఒకసారి మీ డేటా క్లస్టర్లలో ఏర్పడిన తర్వాత, మీరు దానికి క్లస్టర్ IDని ఇవ్వాలి, మరియు ఈ సాంకేతికత డేటాసెట్ గోప్యతను కాపాడటంలో ఉపయోగపడవచ్చు; మీరు డేటా పాయింట్ను మరింత వెల్లడించే గుణాలు కాకుండా దాని క్లస్టర్ IDతో సూచించవచ్చు. మీరు ఇతర కారణాలు కూడా ఆలోచించగలరా మీరే?
ఈ సწავర్థ మాడ్యూల్ లో క్లస్టరింగ్ సాంకేతికతలను లోతుగా తెలుసుకోండి
క్లస్టరింగ్ ప్రారంభించడం
Scikit-learn పెద్ద అనేక విధానాలను క్లస్టరింగ్ చేయడానికి అందిస్తుంది. మీరు ఎంచుకునే రకం మీ ఉపయోగ కచ్చితత్వంపై ఆధారపడి ఉంటుంది. డాక్యుమెంటేషన్ ప్రకారం, ప్రతి విధానం వివిధ లాభాలను కలిగి ఉంటుంది. Scikit-learn మద్దతు ఇచ్చే విధానాల సరళమైన పట్టిక ఇక్కడ ఉంది మరియు వాటి సరైన వినియోగ అంశాలు:
| పద్ధతి పేరు | ఉపయోగం |
|---|---|
| K-Means | సాధారణ ప్రయోజనం, పరిశీలనాత్మక |
| Affinity propagation | చాలా, అసమాన క్లస్టర్లు, పరిశీలనాత్మక |
| Mean-shift | చాలా, అసమాన క్లస్టర్లు, పరిశీలనాత్మక |
| Spectral clustering | కొద్దిపాటి, సారూప్య క్లస్టర్లు, ప్రసారం |
| Ward hierarchical clustering | చాలా, పరిమిత క్లస్టర్లు, ప్రసారం |
| Agglomerative clustering | చాలా, పరిమిత, అసంపూర్ణ యూక్లిడియన్ దూరాలు, ప్రసారం |
| DBSCAN | అసమాన శిఖర ఆకృతి, అసమాన క్లస్టర్లు, ప్రసారం |
| OPTICS | అసమాన శిఖర ఆకృతి, మార్పు గల సాంద్రతతో అసమాన క్లస్టర్లు, ప్రసారం |
| Gaussian mixtures | తేలికపాటి ఆకృతి, పరిశీలనాత్మక |
| BIRCH | పెద్ద డేటాసెట్ దుష్టాంశాలతో, పరిశీలనాత్మక |
🎓 మనం క్లస్టర్లను ఎలా సృష్టిస్తామో అది డేటా పాయింట్లను గుంపులుగా ఎలా సమీకరిస్తామో ఆధారపడి ఉంటుంది. కొన్ని పదాలు అర్థం చేసుకుందాం:
🎓 'Transductive' vs. 'inductive'
ప్రసారాత్మక (Transductive) సూచనాలు నిర్ధారించబడిన శిక్షణ కేసుల్లో తలపడి ఉంటాయి, అవి ప్రత్యేక పరీక్ష కేసులకు మ్యాప్ అవుతాయి. పరిశీలనాత్మక (Inductive) సూచనా శిక్షణ కేసుల నుంచి సాధారణ నియమాలుగా పొందబడి, ఆ తర్వాత మాత్రమే పరీక్ష కేసులకు వర్తింపజేయబడతాయి.
ఉదాహరణ: మీ దగ్గర భాగస్వామ్యంగా లేబుల్స్ ఉన్న డేటాసెట్ ఉందని ఊహించండి. కొన్ని ‘రికార్డులు’, కొన్ని ‘సీడీలుగా’ లేబుల్స్ ఉన్నాయి, మరికొన్ని ఖాళీగా ఉన్నాయి. మీరు ఖాళీ ఉన్న వాటికి లేబుల్స్ ఇవ్వాలి. మీరు పరిశీలనాత్మక విధానం తీసుకుంటే, మీరు 'రికార్డులు' మరియు 'సీడీలు' ఉన్న డేటాను శిక్షణ ఇస్తారు తరువాత అవి లేబుల్స్ లేని డేటాకు వర్తిస్తారు. కానీ ఇది ‘కాసెట్లు’ వంటి వస్తువులను తరగతీకరించడంలో ప్రమాదం ఉంటుంది. ప్రసారాత్మక పద్ధతి, మరోవైపు, ఈ అజ్ఞాత డేటాను మరింత సమర్థవంతంగా నిర్వహిస్తుంది, ఎందుకంటే ఇది సమానమైన అంశాలను ముందుగానే గుంపుగా కూర్చి ఆ గుంపుకు ఒక లేబుల్ సృష్టిస్తుంది. ఈ సందర్భంలో క్లస్టర్లు ‘వృత్తాకార సంగీత వస్తువులు’ మరియు ‘చతురస్ర సంగీత వస్తువులు’ను సూచించవచ్చు.
🎓 'Non-flat' vs. 'flat' geometry
గణిత శాస్త్ర పదజాలం నుండి పొడవుగా లేని (non-flat) మరియు పొడవుగా ఉన్న (flat) ఆకృతులు పాయింట్ల మధ్య దూరాలను కొలవడానికి సూచిస్తాయి, అవి వేరుసరైన (Euclidean) లేదా అసంపూర్ణ (non-Euclidean) గణితరీతులు అయి ఉంటాయి.
ఇక్కడ 'flat' అంటే యూక్లిడియన్ హెచ్చుతగ్గుల గణితం (అందులోని కొంత ‘విమాన’ గణితంగా నేర్పబడుతుంది), non-flat అంటే non-Euclidean గణితం. మెషిన్ లెర్నింగ్ తో గణిత శాస్త్రం సంబంధం ఏమిటి? డేటా మధ్య దూరాలు కొలవడానికి సరైన పద్ధతి అవసరం ఉంటుంది, అది డేటా స్వభావాన్ని బట్టి ‘flat’ లేదా ‘non-flat’ అయి ఉంటుంది. Euclidean distances రెండు పాయింట్ల మధ్య సোজు రేఖ పొడవును కొలుస్తుంది. Non-Euclidean distances వక్రీకృత మార్గం పొడవును కొలుస్తుంది. మీరు డేటాను చూసి అది ఒక ప్లేన్లో (పుటారంలో) లేనట్టుంటే, మీరు ప్రత్యేక అల్గోరిథమ్ ఉపయోగించాలి.
ఇంఫోగ్రాఫిక్: దాసాని మడిపల్లి
క్లస్టర్లు దూరాల మ్యాట్రిక్స్ (distance matrix) ద్వారా నిర్వచించబడతాయి, ఉదా: పాయింట్ల మధ్య దూరాలు. ఈ దూరం కొలవడానికి పలు విధానాలు ఉన్నాయి. యూక్లిడియన్ క్లస్టర్లు పాయింట్ల సగటు విలువల ద్వారా నిర్వచించబడతాయి, మరియు ‘సెంట్రాయిడ్’ (గుండ్రని కేంద్రీయ బిందువు) ఉంటుంది. దూరాలు ఆ సెంట్రాయిడ్ నుంచి కొలుస్తారు. నాన్-యూక్లిడియన్ దూరాలు ‘క్లస్ట్రాయిడ్స్’ ను సూచిస్తాయి, ఇవి సమీప పాయింట్లకు అత్యంత దగ్గరగా ఉన్న బిందువులు. క్లస్ట్రాయిడ్స్ వివిధ రీతులుగా నిర్వచించబడవచ్చు.
Constrained Clustering అనేది ఈ unsupervised పద్ధతిలో ‘semi-supervised’ నేర్పుదలని ప్రవేశపెడుతుంది. పాయింట్ల మధ్య సంబంధాలను ‘cannot link’ లేదా ‘must-link’ గా మార్క్ చేయబడతాయి, కాబట్టి కొన్ని నియమాలు డేటాసెట్కు అమలు చేయబడతాయి.
ఉదాహరణ: ఒక ఆల్గోరిథమ్ పూర్తి లేబుల్స్ లేకపోయిన లేదా చాల భాగస్వామ్య లేబుల్స్ ఉన్న డేటా పై అమలు చేసినప్పుడు, అది తక్కువ నాణ్యత గల క్లస్టర్లను ఉత్పత్తి చేస్తుంది. పై ఉదాహరణలో, క్లస్టర్లు ‘వృత్తాకార సంగీత వస్తువులు’, ‘చతురస్ర సంగీత వస్తువులు’, ‘త్రికోణాకారాలు’ మరియు ‘కుకీస్’ గా ఏర్పడవచ్చు. కొన్ని నియమాలు ఉంటే ("ఆ వస్తువు ప్లాస్టిక్ పర్యాయంగా ఉండాలి", "ఆ వస్తువు సంగీతాన్ని ఉత్పత్తి చేయగలగాలి") ఆ నియమాలు ఆల్గోరిథమ్ను మెరుగైన ఎంపికలు చేయడానికి సహాయపడతాయి.
🎓 'Density'
‘నోయిజీ’ (శబ్దతరంగంతో) ఉన్న డేటాను ‘dense’ అని పిలుస్తారు. క్లస్టర్లలో పాయింట్ల మధ్య దూరాలు సన్నిహితంగా లేదా రద్దీగా ఉంటే, ఆ డేటా సరైన క్లస్టరింగ్ పద్ధతితో విశ్లేషించడం అవసరం. ఈ వ్యాసం శబ్దతో కూడిన అసమాన క్లస్టర్ సాంద్రత ఉన్న డేటాను K-Means క్లస్టరింగ్ మరియు HDBSCAN ఆల్గోరిథమ్స్ తో ఎలా విశ్లేషించాలో వివరించును.
క్లస్టరింగ్ ఆల్గోరిథమ్స్
దశల వందలకు పైగా క్లస్టరింగ్ ఆల్గోరిథమ్స్ ఉన్నాయి, మరియు వాటి ఉపయోగం డేటా స్వభావంపై ఆధారపడి ఉంటుంది. ప్రధానమైన వాటిని చర్చిద్దాం:
-
హైరార్కికల్ క్లస్టరింగ్. ఒక వస్తువు సమీపంలోని మరొక వస్తువు దగ్గరగా ఉందా అని ఆధారంగా వర్గీకరించబడితే, వారి పాయింట్ల మధ్య దూరాల ఆధారంగా క్లస్టర్లు ఏర్పడతాయి. Scikit-learn యొక్క అగ్గ్లోమరేటివ్ క్లస్టరింగ్ హైరార్కికల్ తరహా.
ఇంఫోగ్రాఫిక్: దాసాని మడిపల్లి
-
సెంట్రాయిడ్ క్లస్టరింగ్. ఈ ప్రాచుర్యం పొందిన ఆల్గోరిథమ్ ‘k’ లేదా గుంపుల సంఖ్యను ఎంచుకోవాలి, ఆ తర్వాత అ الگోరిథమ్ ఒక గుంపుకు కేంద్రీయ బిందువు నిర్ణయించి ఆ చుట్టూ డేటాను సేకరిస్తుంది. K-means క్లస్టరింగ్ సెంట్రాయిడ్ క్లస్టరింగ్కు ప్రముఖ రూపం. కేంద్ర బిందువు సమీప సగటు ద్వారా నిర్ణయించబడుతుంది. క్లస్టర్ నుంచి చతురస్ర దూరం తగ్గించడం లక్ష్యం.
ఇంఫోగ్రాఫిక్: దాసాని మడిపల్లి
-
వితరణ ఆధారిత క్లస్టరింగ్. గణాంక మోడలింగ్ ఆధారంగా, వితరణ ఆధారిత క్లస్టరింగ్ డేటా పాయింట్ ఒక క్లస్టర్ కి చెందే అవకాశం నిర్ణయించి దానికి అనుగుణంగా కేటాయిస్తుంది. Gaussian మిశ్రమ పద్ధతులు దీనిలో ఉంటాయి.
-
సాంద్రత ఆధారిత క్లస్టరింగ్. డేటా పాయింట్లు తమ సాంద్రత, లేదా పరస్పరం చుట్టూ ఏర్పడే గుంపుపై ఆధారపడి కేటాయించబడతాయి. గుంపుకు దూరమైన పాయింట్లు అవుట్లయర్లు లేదా శబ్దం అనిపిస్తాయి. DBSCAN, Mean-shift మరియు OPTICS ఈ తరహా క్లస్టరింగ్ కు చెందుతాయి.
-
గ్రిడ్ ఆధారిత క్లస్టరింగ్. బహుముఖమైన డేటాసెట్ల కొరకు గ్రిడ్ సృష్టించి డేటాను గ్రిడ్ సెల్స్ మద్య విభజించి క్లస్టర్లు ఏర్పరుస్తుంది.
వ్యాయామం - మీ డేటాను క్లస్టర్ చేయండి
క్లస్టరింగ్ ఒక సాంకేతికతగా సరైన విజువలైజేషన్ తో చాలా మెరుగ్గ ఉంటుంది, కాబట్టి మన సంగీత డేటాను విజువలైజ్ చేయడం ప్రారంభిద్దాం. ఈ వ్యాయామం ఏ క్లస్టరింగ్ పద్ధతులను ఈ డేటాకు సమర్థవంతంగా ఉపయోగించాలో నిర్ణయించడానికి సహాయపడుతుంది.
-
ఈ ఫోల్డర్లోని notebook.ipynb ఫైల్ను ఓపెన్ చేయండి.
-
మంచి డేటా విజువలైజేషన్ కోసం
Seabornప్యాకేజీని దిగుమతి చేసుకోండి.!pip install seaborn -
nigerian-songs.csv నుండి పాటల డేటాను జతచేయండి. పాటల గురించి కొద్దిగా డేటా ఉన్న డేటాఫ్రేమ్ను లోడ్ చేయండి. లైబ్రరీస్ దిగుమతి చేసి డేటాను చూసేలా సిద్ధంగా ఉండండి:
import matplotlib.pyplot as plt import pandas as pd df = pd.read_csv("../data/nigerian-songs.csv") df.head()మొదటి కొన్ని పంక్తుల డేటా చూడండి:
name album artist artist_top_genre release_date length popularity danceability acousticness energy instrumentalness liveness loudness speechiness tempo time_signature 0 Sparky Mandy & The Jungle Cruel Santino alternative r&b 2019 144000 48 0.666 0.851 0.42 0.534 0.11 -6.699 0.0829 133.015 5 1 shuga rush EVERYTHING YOU HEARD IS TRUE Odunsi (The Engine) afropop 2020 89488 30 0.71 0.0822 0.683 0.000169 0.101 -5.64 0.36 129.993 3 2 LITT! LITT! AYLØ ఇండీ ఆర్&బి 2018 207758 40 0.836 0.272 0.564 0.000537 0.11 -7.127 0.0424 130.005 4 3 Confident / Feeling Cool Enjoy Your Life లేడీ డోన్లీ నైజీరియన్ పాప్ 2019 175135 14 0.894 0.798 0.611 0.000187 0.0964 -4.961 0.113 111.087 4 4 wanted you rare. ఒడున్సి (ది ఇంజిన్) ఆఫ్రోపాప్ 2018 152049 25 0.702 0.116 0.833 0.91 0.348 -6.044 0.0447 105.115 4 -
డేటాఫ్రేమ్ గురించి కొంత సమాచారం పొందడానికి,
info()ను کال్ చేయండి:df.info()అవుట్పుట్ ఇలా కనిపిస్తుంది:
<class 'pandas.core.frame.DataFrame'> RangeIndex: 530 entries, 0 to 529 Data columns (total 16 columns): # Column Non-Null Count Dtype --- ------ -------------- ----- 0 name 530 non-null object 1 album 530 non-null object 2 artist 530 non-null object 3 artist_top_genre 530 non-null object 4 release_date 530 non-null int64 5 length 530 non-null int64 6 popularity 530 non-null int64 7 danceability 530 non-null float64 8 acousticness 530 non-null float64 9 energy 530 non-null float64 10 instrumentalness 530 non-null float64 11 liveness 530 non-null float64 12 loudness 530 non-null float64 13 speechiness 530 non-null float64 14 tempo 530 non-null float64 15 time_signature 530 non-null int64 dtypes: float64(8), int64(4), object(4) memory usage: 66.4+ KB -
NULL విలువలు ఉన్నాయా లేదో డబుల్ చెక్ చేయడానికి
isnull()ను کال్ చేసి మొత్తం 0 అయ్యిందో లేదో చూసుకోండి:df.isnull().sum()మంచి దిశగా ఉంది:
name 0 album 0 artist 0 artist_top_genre 0 release_date 0 length 0 popularity 0 danceability 0 acousticness 0 energy 0 instrumentalness 0 liveness 0 loudness 0 speechiness 0 tempo 0 time_signature 0 dtype: int64 -
డేటాను వివరిస్తుంది:
df.describe()release_date length popularity danceability acousticness energy instrumentalness liveness loudness speechiness tempo time_signature count 530 530 530 530 530 530 530 530 530 530 530 530 mean 2015.390566 222298.1698 17.507547 0.741619 0.265412 0.760623 0.016305 0.147308 -4.953011 0.130748 116.487864 3.986792 std 3.131688 39696.82226 18.992212 0.117522 0.208342 0.148533 0.090321 0.123588 2.464186 0.092939 23.518601 0.333701 min 1998 89488 0 0.255 0.000665 0.111 0 0.0283 -19.362 0.0278 61.695 3 25% 2014 199305 0 0.681 0.089525 0.669 0 0.07565 -6.29875 0.0591 102.96125 4 50% 2016 218509 13 0.761 0.2205 0.7845 0.000004 0.1035 -4.5585 0.09795 112.7145 4 75% 2017 242098.5 31 0.8295 0.403 0.87575 0.000234 0.164 -3.331 0.177 125.03925 4 max 2020 511738 73 0.966 0.954 0.995 0.91 0.811 0.582 0.514 206.007 5
🤔 మనం క్లస్టరింగ్తో పనిచేస్తున్నప్పుడు, లేబుల్ చేయబడిన డేటాతో అవసరం లేని అన్సూపర్వైజ్డ్ పద్ధతిని ఉపయోగిస్తే, మేము ఈ డేటాను లేబుళ్లతో ఎందుకు చూపిస్తున్నాము? డేటా ఎక్స్ప్లోరేషన్ దశలో అవి ఉపయోగకరంగా ఉంటాయి, కానీ క్లస్టరింగ్ అల్గోరిథమ్స్ పని చేయడానికి అవి అవసరం కాదు. మీరు కాలమ్ హెడ్డర్లను తీసేసి డేటాను కాలమ్ నెంబర్ ద్వారా సూచించవచ్చు.
డేటా యొక్క సాధారణ విలువలను చూడండి. 'పాపులారిటీ' 0 కావచ్చు, అంటే ర్యాంకింగ్ లేని పాటలు ఉన్నాయి. వాటిని త్వరలో తీసేసేద్దాం.
-
ఎక్కువ ప్రాచుర్యం పొందిన జానర్లను కనుగొనడానికి బార్ప్లాట్ ఉపయోగించండి:
import seaborn as sns top = df['artist_top_genre'].value_counts() plt.figure(figsize=(10,7)) sns.barplot(x=top[:5].index,y=top[:5].values) plt.xticks(rotation=45) plt.title('Top genres',color = 'blue')
✅ మీరు ఇంకా ఎక్కువ టాప్ విలువలు చూడాలనుకుంటే, టాప్ [:5] ని పెద్ద విలువగా మార్చండి లేదా అన్ని విలువలు చూడడానికి తీసేయండి.
గమనించండి, టాప్ జానర్ 'Missing' అని ఉంటే, అంటే స్పాటిఫై దానిని వర్గీకరించలేదు, కాబట్టి మీరు దానిని తీసేయండి.
-
మిస్ అయిన డేటాను తొలగించండి
df = df[df['artist_top_genre'] != 'Missing'] top = df['artist_top_genre'].value_counts() plt.figure(figsize=(10,7)) sns.barplot(x=top.index,y=top.values) plt.xticks(rotation=45) plt.title('Top genres',color = 'blue')ఇప్పుడు జానర్లను మళ్ళీ చెక్ చేయండి:
-
ఈ డేటాసెట్లో టాప్ మూడు జానర్లు ఎంతో ప్రాబల్యం కలిగి ఉన్నాయి.
ఆఫ్రో డాన్స్హాల్,ఆఫ్రోపాప్, మరియునైజీరియన్ పాప్మీద దృష్టి పెట్టండి, అదనంగా పాపులారిటీ విలువ 0 ఉన్న డేటాను తొలగించి ఫిల్టర్ చేయండి (అంటే అది డేటాసెట్లో పాపులారిటీతో వర్తించబడలేదు మరియు మన ప్రయోజనాల కోసం శబ్దంగా పరిగణించవచ్చు):df = df[(df['artist_top_genre'] == 'afro dancehall') | (df['artist_top_genre'] == 'afropop') | (df['artist_top_genre'] == 'nigerian pop')] df = df[(df['popularity'] > 0)] top = df['artist_top_genre'].value_counts() plt.figure(figsize=(10,7)) sns.barplot(x=top.index,y=top.values) plt.xticks(rotation=45) plt.title('Top genres',color = 'blue') -
డేటా ఎలాంటి బలమైన సంబంధం కలిగి ఉన్నదో సత్వర పరీక్ష చేయండి:
corrmat = df.corr(numeric_only=True) f, ax = plt.subplots(figsize=(12, 9)) sns.heatmap(corrmat, vmax=.8, square=True)ఒకే బలమైన సంబంధం
ఎనర్జీమరియులౌడ్నెస్మధ్య ఉంది, ఇది ఆశ్చర్యానికి కారణం కాదు, ఎందుకంటే గట్టిగా మాట్లాడే సంగీతం సాధారణంగా చాలా ఉత్సాహభరితంగా ఉంటుంది. మిగిలిన సంబంధాలు తక్కువగా ఉన్నాయి. ఈ డేటాను ఒక క్లస్టరింగ్ అల్గోరిథమ్ ఎలా చూడగలదో చూడడం ఆసక్తికరం.🎓 సంబంధం కారణాన్ని సూచించదు! మనకు సంబంధం ఉందనే సాక్ష్యం ఉంది కానీ కారణం లేదని సాక్ష్యం లేదు. ఒక ఆహ్లాదకర వెబ్ సైట్ ఈ అంశాన్ని బలపరుస్తుంది.
ఈ డేటాసెట్లో పాట పాపులారిటీ మరియు డాన్సబిలిటీ మధ్య ఎలాంటి సారూప్యత ఉంది? ఒక FacetGrid సూచిస్తుంది అన్ని జానర్లకు సంబంధం లేకుండా ఒకే కేంద్రవృత్తాలు ఉన్నాయి. నైజీరియన్ రుచులు ఈ జానర్ కోసం ఒక నిర్దిష్ట డాన్సబిలిటీ స్థాయిలో కలుసుకుంటున్నాయా?
✅ వేరే డేటాపాయింట్లు (ఎనర్జీ, లౌడ్నెస్, స్పీచినెస్) మరియు మరిన్ని లేదా వేరే సంగీత జానర్లను ప్రయత్నించండి. మీరు ఏమి కనుగొంటారో చూడండి. సాధారణ డేటా పంపిణీ కోసం df.describe() పట్టికను చూడండి.
వ్యాయామం - డేటా పంపిణీ
ఈ మూడు జానర్లు వారి డాన్సబిలిటీ భావనలో తమ పాపులారిటీ ఆధారంగా గణనీయంగా వేరు కావచ్చునా?
-
మనం ఎంచుకున్న టాప్ మూడు జానర్ల పాపులారిటీ మరియు డాన్సబిలిటీ డేటా పంపిణీని x మరియు y అక్షాలుగా పరిశీలించండి.
sns.set_theme(style="ticks") g = sns.jointplot( data=df, x="popularity", y="danceability", hue="artist_top_genre", kind="kde", )మీరు సాధారణ సంగమంపై ఘన కేంద్రవృత్తాలను కనుగొనవచ్చు, అవి పాయింట్ల పంపిణీని చూపిస్తాయి.
🎓 ఈ ఉదాహరణ KDE (కెernel Density Estimate) గ్రాఫ్ ఉపయోగిస్తుంది, ఇది డేటాను నిరంతర సాంఖ్యిక సంభావ్యత వక్రం ద్వారా ప్రదర్శిస్తుంది. ఇది అనేక పంపిణీలతో పనిచేసేప్పుడు డేటాను అర్థం చేసుకోవడంలో సహాయపడుతుంది.
సాధారణంగా, ఈ మూడు జానర్లు వారి పాపులారిటీ మరియు డాన్సబిలిటీ విషయంలో సన్నిహితంగా సరిపోతాయి. ఈ సన్నిహిత పంపిణీ డేటాలో క్లస్టర్లను నిర్ధారించడం ఒక సవాలు:
-
ఒక స్కాటర్ ప్లాట్ సృష్టించండి:
sns.FacetGrid(df, hue="artist_top_genre", height=5) \ .map(plt.scatter, "popularity", "danceability") \ .add_legend()అదే అక్షాల స్కాటర్ప్లాట్ సన్నిహితత్వం వంటి నమూనాను చూపిస్తుంది
సాధారణంగా, క్లస్టరింగ్ కోసం, మీరు క్లస్టర్లను చూపించడానికి స్కాటర్ప్లాట్లను ఉపయోగించవచ్చు, కాబట్టి ఈ ప్రকার విజువలైజేషన్ నైపుణ్యం అవసరం. తదుపరి పాఠంలో, ఈ ఫిల్టర్ చేయబడిన డేటాను తీసుకుని, k-means క్లస్టరింగ్ ఉపయోగించి ఆసక్తికరమైన రీతుల్లో ఓవర్ల్యాప్ అవుతున్న డేటాలో గుంపులను కనుగొంటాం.
🚀సవాలు
తదుపరి పాఠం కోసం, మీరు కనుగొని ఉత్పాదక వాతావరణంలో ఉపయోగించే వివిధ క్లస్టరింగ్ అల్గోరిథమ్స్ గురించిన ఒక చార్ట్ తయారుచేయండి. ఏ రకాల సమస్యలను క్లస్టరింగ్ పరిష్కరించడానికి ప్రయత్నిస్తుంది?
పోస్ట్-లెక్చర్ క్విజ్
సమీక్ష & స్వీయ అధ్యయనం
మనం క్లస్టరింగ్ అల్గోరిథమ్స్ని వర్తించే ముందు, మన dataset యొక్క స్వభావాన్ని అర్థం చేసుకోవటం మంచిది. ఈ విషయం పైపైన చదవండి ఇక్కడ
ఈ సహాయక ఆర్టికల్ వివిధ డేటా ఆకారాలకు అనుగుణంగా వివిధ క్లస్టరింగ్ అల్గోరిథమ్స్ ఎలా పని చేస్తాయో మీకు వివరంగా చూపుతుంది.
అసైన్మెంట్
క్లస్టరింగ్ కోసం ఇతర విజువలైజేషన్లపై పరిశోధన చేయండి
అస్వీకరణ: ఈ పత్రం AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.









