{ "cells": [ { "cell_type": "markdown", "source": [ "## **Spotify-இல் இருந்து சேகரிக்கப்பட்ட நைஜீரிய இசை - ஒரு பகுப்பாய்வு**\n", "\n", "க்ளஸ்டரிங் என்பது [அன்சூப்பர்வைஸ்டு லெர்னிங்](https://wikipedia.org/wiki/Unsupervised_learning) வகையைச் சேர்ந்தது, இது ஒரு தரவுத்தொகுப்பு லேபிள் செய்யப்படாதது அல்லது அதன் உள்ளீடுகள் முன்பே வரையறுக்கப்பட்ட வெளியீடுகளுடன் பொருந்தவில்லை என்று கருதுகிறது. இது பல்வேறு الگாரிதங்களைப் பயன்படுத்தி லேபிள் செய்யப்படாத தரவுகளை சீரமைத்து, அதில் காணப்படும் முறைப்படி குழுக்களை வழங்குகிறது.\n", "\n", "[**முன்-வகுப்பு வினாடி வினா**](https://gray-sand-07a10f403.1.azurestaticapps.net/quiz/27/)\n", "\n", "### **அறிமுகம்**\n", "\n", "[க்ளஸ்டரிங்](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) தரவுகளை ஆராய்வதற்கு மிகவும் பயனுள்ளதாக உள்ளது. நைஜீரிய ரசிகர்கள் இசையை எப்படி அனுபவிக்கிறார்கள் என்பதைப் பற்றிய போக்குகள் மற்றும் முறைகளை இது கண்டுபிடிக்க உதவுமா என்று பார்ப்போம்.\n", "\n", "> ✅ க்ளஸ்டரிங் பயன்பாடுகளைப் பற்றி ஒரு நிமிடம் யோசிக்கவும். நிஜ வாழ்க்கையில், க்ளஸ்டரிங் உங்கள் குடும்ப உறுப்பினர்களின் ஆடைகளை சீரமைக்க நீங்கள் சலவை குவியலைப் பயன்படுத்தும் போது நிகழ்கிறது 🧦👕👖🩲. தரவியல் அறிவியலில், க்ளஸ்டரிங் பயனர் விருப்பங்களைப் பகுப்பாய்வு செய்ய அல்லது எந்த லேபிள் செய்யப்படாத தரவுத்தொகுப்பின் பண்புகளைத் தீர்மானிக்க முயற்சிக்கும் போது நிகழ்கிறது. க்ளஸ்டரிங், ஒரு வகையில், குளறுபடிகளை புரிந்து கொள்ள உதவுகிறது, ஒரு கால்சாக் டிராயர் போல.\n", "\n", "தொழில்முறை சூழலில், க்ளஸ்டரிங் சந்தை பிரிவினைத் தீர்மானிக்க, எந்த வயது குழுக்கள் எந்த பொருட்களை வாங்குகின்றன என்பதைப் போன்றவற்றைத் தீர்மானிக்க பயன்படுத்தப்படுகிறது. மற்றொரு பயன்பாடு மோசடிகளை கண்டறிதல், உதாரணமாக, கிரெடிட் கார்டு பரிவர்த்தனைகளின் தரவுத்தொகுப்பில் மோசடிகளை கண்டறிய. அல்லது நீங்கள் மருத்துவ ஸ்கேன் தொகுப்பில் கட்டிகள் உள்ளதா என்பதைத் தீர்மானிக்க க்ளஸ்டரிங்கைப் பயன்படுத்தலாம்.\n", "\n", "✅ நீங்கள் வங்கிகள், மின் வணிகம் அல்லது வணிக சூழலில் 'க்ளஸ்டரிங்' ஐ எப்படி சந்தித்திருக்கிறீர்கள் என்று ஒரு நிமிடம் யோசிக்கவும்.\n", "\n", "> 🎓 சுவாரஸ்யமாக, க்ளஸ்டர் பகுப்பாய்வு 1930களில் மனிதவியல் மற்றும் உளவியல் துறைகளில் தோன்றியது. அது எப்படி பயன்படுத்தப்பட்டிருக்கலாம் என்று நீங்கள் கற்பனை செய்ய முடியுமா?\n", "\n", "மாற்றாக, நீங்கள் தேடல் முடிவுகளை குழுக்களாகப் பிரிக்க பயன்படுத்தலாம் - வாங்கும் இணைப்புகள், படங்கள் அல்லது மதிப்பீடுகள், உதாரணமாக. க்ளஸ்டரிங் ஒரு பெரிய தரவுத்தொகுப்பை குறைக்கவும், அதில் மேலும் நுணுக்கமான பகுப்பாய்வு செய்யவும் உதவுகிறது, எனவே இந்த தொழில்நுட்பம் மற்ற மாதிரிகள் உருவாக்கப்படும் முன் தரவுகளைப் பற்றி அறிய பயன்படுத்தப்படுகிறது.\n", "\n", "✅ உங்கள் தரவுகள் குழுக்களில் ஒழுங்குபடுத்தப்பட்டவுடன், நீங்கள் அதற்கு ஒரு க்ளஸ்டர் ஐடி ஒதுக்குகிறீர்கள், மேலும் இந்த தொழில்நுட்பம் ஒரு தரவுத்தொகுப்பின் தனியுரிமையைப் பாதுகாக்க உதவுகிறது; நீங்கள் குழுவின் மற்ற வெளிப்படையான அடையாள தரவுகளால் அல்லாமல், ஒரு தரவுப் புள்ளியை அதன் க்ளஸ்டர் ஐடியால் குறிப்பிடலாம். க்ளஸ்டர் ஐடியை குறிப்பிடுவதற்கான மற்ற காரணங்களை நீங்கள் யோசிக்க முடியுமா?\n", "\n", "### க்ளஸ்டரிங் தொடங்குதல்\n", "\n", "> 🎓 க்ளஸ்டர்களை உருவாக்குவது எப்படி என்பது தரவுப் புள்ளிகளை குழுக்களாகச் சேர்க்கும் முறையைப் பொறுத்தது. சில சொற்களை விளக்கிப் பார்ப்போம்:\n", ">\n", "> 🎓 ['Transductive' vs. 'inductive'](https://wikipedia.org/wiki/Transduction_(machine_learning))\n", ">\n", "> Transductive inference என்பது குறிப்பிட்ட சோதனை வழக்குகளுக்கு பொருந்தும் பயிற்சி வழக்குகளிலிருந்து பெறப்படுகிறது. Inductive inference என்பது பொதுவான விதிகளை உருவாக்க பயிற்சி வழக்குகளிலிருந்து பெறப்படுகிறது, பின்னர் அவை சோதனை வழக்குகளுக்கு மட்டுமே பொருந்தும்.\n", ">\n", "> ஒரு உதாரணம்: நீங்கள் ஒரு பகுதி லேபிள் செய்யப்பட்ட தரவுத்தொகுப்பை வைத்திருக்கிறீர்கள் என்று கற்பனை செய்யுங்கள். சில பொருட்கள் 'records', சில 'cds', மற்றும் சில வெறுமையாக உள்ளன. வெறுமையானவற்றுக்கு லேபிள்களை வழங்குவது உங்கள் வேலை. நீங்கள் ஒரு inductive அணுகுமுறையைத் தேர்ந்தெடுத்தால், 'records' மற்றும் 'cds' ஐத் தேடும் ஒரு மாதிரியைப் பயிற்சி செய்து, உங்கள் லேபிள் செய்யப்படாத தரவுக்கு அந்த லேபிள்களைப் பயன்படுத்துவீர்கள். இந்த அணுகுமுறை உண்மையில் 'cassettes' ஆக இருக்கும் பொருட்களை வகைப்படுத்துவதில் சிக்கல்களை சந்திக்கும். மற்றொரு பக்கம், transductive அணுகுமுறை இந்த தெரியாத தரவுகளை மேலும் திறமையாக கையாளுகிறது, ஏனெனில் இது ஒரே மாதிரியான பொருட்களை ஒன்றாகக் குழுமமாக்க முயற்சித்து, பின்னர் ஒரு குழுவுக்கு ஒரு லேபிளை வழங்குகிறது. இந்த வழக்கில், க்ளஸ்டர்கள் 'round musical things' மற்றும் 'square musical things' ஆகியவற்றை பிரதிபலிக்கலாம்.\n", ">\n", "> 🎓 ['Non-flat' vs. 'flat' geometry](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering)\n", ">\n", "> கணிதவியல் சொற்களிலிருந்து பெறப்பட்ட 'non-flat' மற்றும் 'flat' geometry என்பது புள்ளிகளுக்கிடையிலான தூரத்தை 'flat' ([Euclidean](https://wikipedia.org/wiki/Euclidean_geometry)) அல்லது 'non-flat' (non-Euclidean) கணிதவியல் முறைகளால் அளவிடுவது.\n", ">\n", "> 'Flat' என்பது இங்கு Euclidean geometry (இதில் சில 'plane' geometry எனக் கற்பிக்கப்படுகிறது) மற்றும் 'non-flat' என்பது non-Euclidean geometry. கணிதவியல் மற்றும் இயந்திர கற்றல் என்ன தொடர்பு? கணிதவியல் அடிப்படையில் இரு துறைகளாக, க்ளஸ்டர்களில் புள்ளிகளுக்கிடையிலான தூரத்தை அளவிட ஒரு பொதுவான வழி இருக்க வேண்டும், மேலும் தரவின் தன்மையைப் பொறுத்து அதை 'flat' அல்லது 'non-flat' முறையில் செய்யலாம். [Euclidean distances](https://wikipedia.org/wiki/Euclidean_distance) என்பது இரண்டு புள்ளிகளுக்கிடையிலான கோடு பகுதியின் நீளமாக அளவிடப்படுகிறது. [Non-Euclidean distances](https://wikipedia.org/wiki/Non-Euclidean_geometry) ஒரு வளைவின் வழியாக அளவிடப்படுகிறது. உங்கள் தரவுகள், காட்சிப்படுத்தப்பட்டவுடன், ஒரு தளத்தில் இல்லை என்று தோன்றினால், அதை கையாள ஒரு சிறப்பு الگாரிதத்தைப் பயன்படுத்த வேண்டும்.\n", "\n", "
\n",
"
\n",
"
\n",
"
\n",
"
\n",
"
\n",
"