From 712688625c7e84a666f221b5f21b3b3ca3336418 Mon Sep 17 00:00:00 2001 From: "localizeflow[bot]" Date: Tue, 26 May 2026 22:57:13 +0000 Subject: [PATCH] chore(i18n): sync translations with latest source changes (chunk 1/1, 9 changes) --- translations/bg/.co-op-translator.json | 8 +- .../bg/1-Introduction/1-intro-to-ML/README.md | 101 ++++----- .../bg/5-Clustering/1-Visualize/README.md | 191 +++++++++--------- translations/ro/.co-op-translator.json | 8 +- .../ro/1-Introduction/1-intro-to-ML/README.md | 111 +++++----- .../ro/5-Clustering/1-Visualize/README.md | 185 ++++++++--------- translations/sk/.co-op-translator.json | 8 +- .../sk/1-Introduction/1-intro-to-ML/README.md | 107 +++++----- .../sk/5-Clustering/1-Visualize/README.md | 189 ++++++++--------- 9 files changed, 466 insertions(+), 442 deletions(-) diff --git a/translations/bg/.co-op-translator.json b/translations/bg/.co-op-translator.json index caf9b6a00..9fbaabc6f 100644 --- a/translations/bg/.co-op-translator.json +++ b/translations/bg/.co-op-translator.json @@ -1,7 +1,7 @@ { "1-Introduction/1-intro-to-ML/README.md": { - "original_hash": "69389392fa6346e0dfa30f664b7b6fec", - "translation_date": "2025-09-05T00:29:44+00:00", + "original_hash": "3a6394c6f5ce3f8aee8211e92eaf9ef0", + "translation_date": "2026-05-26T22:57:02+00:00", "source_file": "1-Introduction/1-intro-to-ML/README.md", "language_code": "bg" }, @@ -240,8 +240,8 @@ "language_code": "bg" }, "5-Clustering/1-Visualize/README.md": { - "original_hash": "730225ea274c9174fe688b21d421539d", - "translation_date": "2025-09-04T23:58:32+00:00", + "original_hash": "08b00d9fbffc667a7fe7fc19ac00dfbd", + "translation_date": "2026-05-26T22:56:35+00:00", "source_file": "5-Clustering/1-Visualize/README.md", "language_code": "bg" }, diff --git a/translations/bg/1-Introduction/1-intro-to-ML/README.md b/translations/bg/1-Introduction/1-intro-to-ML/README.md index 96b13b726..22de2f074 100644 --- a/translations/bg/1-Introduction/1-intro-to-ML/README.md +++ b/translations/bg/1-Introduction/1-intro-to-ML/README.md @@ -1,73 +1,73 @@ # Въведение в машинното обучение -## [Тест преди лекцията](https://ff-quizzes.netlify.app/en/ml/) +## [Въпросник преди лекцията](https://ff-quizzes.netlify.app/en/ml/) --- [![ML за начинаещи - Въведение в машинното обучение за начинаещи](https://img.youtube.com/vi/6mSx_KJxcHI/0.jpg)](https://youtu.be/6mSx_KJxcHI "ML за начинаещи - Въведение в машинното обучение за начинаещи") -> 🎥 Кликнете върху изображението по-горе за кратко видео, което разглежда този урок. +> 🎥 Кликнете върху снимката по-горе за кратко видео, разглеждащо този урок. -Добре дошли в този курс за класическо машинно обучение за начинаещи! Независимо дали сте напълно нови в тази тема или сте опитен специалист по машинно обучение, който иска да освежи знанията си в определена област, радваме се, че сте тук! Целта ни е да създадем приятелска отправна точка за вашето обучение по машинно обучение и ще се радваме да оценим, отговорим и включим вашата [обратна връзка](https://github.com/microsoft/ML-For-Beginners/discussions). +Добре дошли в този курс по класическо машинно обучение за начинаещи! Независимо дали сте напълно нови в тази тема, или сте опитен специалист по ML, който иска да подобри знанията си в определена област, радваме се, че сте с нас! Искаме да създадем приятелска стартова точка за вашето обучение по ML и с удоволствие ще оценяваме, отговаряме и включваме вашите [обратни връзки](https://github.com/microsoft/ML-For-Beginners/discussions). [![Въведение в ML](https://img.youtube.com/vi/h0e2HAPTGF4/0.jpg)](https://youtu.be/h0e2HAPTGF4 "Въведение в ML") -> 🎥 Кликнете върху изображението по-горе за видео: Джон Гуттаг от MIT представя машинното обучение +> 🎥 Кликнете върху снимката по-горе за видео: Джон Гъттаг от MIT представя машинното обучение --- -## Започване с машинното обучение +## Започване с машинно обучение -Преди да започнете с тази учебна програма, трябва да подготвите компютъра си, за да може да изпълнява notebooks локално. +Преди да започнете с тази учебна програма, трябва компютърът ви да е настроен и готов за локално изпълнение на тетрадки. -- **Конфигурирайте вашата машина с тези видеа**. Използвайте следните линкове, за да научите [как да инсталирате Python](https://youtu.be/CXZYvNRIAKM) на вашата система и [как да настроите текстов редактор](https://youtu.be/EU8eayHWoZg) за разработка. -- **Научете Python**. Препоръчително е да имате основно разбиране за [Python](https://docs.microsoft.com/learn/paths/python-language/?WT.mc_id=academic-77952-leestott), програмен език, полезен за специалисти по данни, който използваме в този курс. -- **Научете Node.js и JavaScript**. Също така използваме JavaScript няколко пъти в този курс при създаването на уеб приложения, така че ще трябва да имате [node](https://nodejs.org) и [npm](https://www.npmjs.com/) инсталирани, както и [Visual Studio Code](https://code.visualstudio.com/) за разработка както с Python, така и с JavaScript. -- **Създайте GitHub акаунт**. Тъй като ни намерихте тук на [GitHub](https://github.com), вероятно вече имате акаунт, но ако не, създайте такъв и след това направете fork на тази учебна програма, за да я използвате самостоятелно. (Може да ни дадете и звезда 😊) -- **Разгледайте Scikit-learn**. Запознайте се с [Scikit-learn](https://scikit-learn.org/stable/user_guide.html), набор от библиотеки за машинно обучение, които използваме в тези уроци. +- **Настройте машината си с тези видеа**. Използвайте следните връзки, за да научите [как да инсталирате Python](https://youtu.be/CXZYvNRIAKM) в системата си и [как да настроите текстови редактор](https://youtu.be/EU8eayHWoZg) за разработка. +- **Научете Python**. Също се препоръчва да имате основни познания по [Python](https://docs.microsoft.com/learn/paths/python-language/?WT.mc_id=academic-77952-leestott), програмен език, полезен за дата сайънтисти, който използваме в курса. +- **Научете Node.js и JavaScript**. В курса използваме JavaScript няколко пъти при разработване на уеб приложения, затова ще трябва да имате инсталирани [node](https://nodejs.org) и [npm](https://www.npmjs.com/), както и [Visual Studio Code](https://code.visualstudio.com/) за разработка както на Python, така и на JavaScript. +- **Създайте GitHub акаунт**. Тъй като ни намерихте тук в [GitHub](https://github.com), може би вече имате акаунт, но ако не, създайте такъв и след това създайте форк на тази учебна програма за лична употреба. (Без колебание ни дайте звезда, също 😊) +- **Запознайте се със Scikit-learn**. Запознайте се с [Scikit-learn](https://scikit-learn.org/stable/user_guide.html), набор от библиотеки за ML, които използваме в тези уроци. --- ## Какво е машинно обучение? -Терминът „машинно обучение“ е един от най-популярните и често използвани термини днес. Има голяма вероятност да сте го чували поне веднъж, ако имате някаква връзка с технологиите, независимо от областта, в която работите. Механиката на машинното обучение обаче остава загадка за повечето хора. За начинаещите в машинното обучение темата понякога може да изглежда сложна. Затова е важно да разберем какво всъщност представлява машинното обучение и да го изучаваме стъпка по стъпка чрез практически примери. +Терминът „машинно обучение“ е един от най-популярните и често използвани днес. Съществува немалка вероятност да сте чували този термин поне веднъж, ако имате някаква връзка с технологиите, независимо в коя сфера работите. Механизмите на машинното обучение обаче са загадка за повечето хора. За начинаещ в машинното обучение темата понякога може да изглежда претоварваща. Затова е важно да разберете какво всъщност е машинното обучение и да го изучавате стъпка по стъпка чрез практически примери. --- -## Крива на популярността +## Крива на шумотевицата -![ml hype curve](../../../../1-Introduction/1-intro-to-ML/images/hype.png) +![ml hype curve](../../../../translated_images/bg/hype.07183d711a17aafe.webp) -> Google Trends показва последната „крива на популярността“ на термина „машинно обучение“ +> Google Trends показва последната „крива на шумотевицата“ за термина „машинно обучение“ --- -## Загадъчна вселена +## Един мистериозен свят -Живеем във вселена, пълна с очарователни загадки. Велики учени като Стивън Хокинг, Алберт Айнщайн и много други са посветили живота си на търсенето на значима информация, която разкрива тайните на света около нас. Това е човешкото състояние на учене: човешкото дете научава нови неща и разкрива структурата на своя свят година след година, докато расте. +Живеем във вселена, пълна с увлекателни мистерии. Велики учени като Стивън Хокинг, Алберт Айнщайн и много други са посветили живота си на търсенето на смислена информация, която разкрива загадките на света около нас. Това е човешкото състояние на учене: дете постепенно опознава нови неща и разкрива структурата на своя свят година след година, докато расте до възрастен. --- ## Мозъкът на детето -Мозъкът и сетивата на детето възприемат фактите от заобикалящата го среда и постепенно научават скритите модели на живота, които помагат на детето да създаде логически правила за идентифициране на научените модели. Процесът на учене на човешкия мозък прави хората най-сложните живи същества на този свят. Непрекъснатото учене чрез откриване на скрити модели и след това иновации върху тези модели ни позволява да се подобряваме през целия си живот. Тази способност за учене и еволюция е свързана с концепцията, наречена [пластичност на мозъка](https://www.simplypsychology.org/brain-plasticity.html). Повърхностно можем да направим някои мотивационни сравнения между процеса на учене на човешкия мозък и концепциите на машинното обучение. +Мозъкът и сетивата на децата възприемат фактите около тях и постепенно разучават скритите модели на живота, които им помагат да създават логически правила за разпознаване на научените модели. Процесът на учене на човешкия мозък прави човека най-сложно устроеното живо същество на този свят. Непрекъснатото учене, като откриваме скритите модели и след това иновираме върху тях, ни позволява да ставаме по-добри през целия си живот. Тази способност за учене и развиващата се способност е свързана с концепция наречена [пластичност на мозъка](https://www.simplypsychology.org/brain-plasticity.html). На повърхността можем да открием някои мотивационни прилики между процеса на учене в човешкия мозък и концепциите на машинното обучение. --- ## Човешкият мозък -[Човешкият мозък](https://www.livescience.com/29365-human-brain.html) възприема нещата от реалния свят, обработва възприетата информация, взема рационални решения и извършва определени действия според обстоятелствата. Това наричаме интелигентно поведение. Когато програмираме подобие на интелигентния процес на поведение в машина, това се нарича изкуствен интелект (AI). +[Човешкият мозък](https://www.livescience.com/29365-human-brain.html) възприема неща от реалния свят, обработва възприетата информация, взема рационални решения и изпълнява действия според обстоятелствата. Това наричаме интелигентно поведение. Когато програмираме подобен интелигентен поведенчески процес на машина, това се нарича изкуствен интелект (AI). --- ## Някои термини -Въпреки че термините могат да бъдат объркващи, машинното обучение (ML) е важен подмножество на изкуствения интелект. **ML се занимава с използването на специализирани алгоритми за откриване на значима информация и намиране на скрити модели от възприетите данни, за да подкрепи процеса на рационално вземане на решения**. +Въпреки че термините могат да бъдат объркващи, машинното обучение (ML) е важна част от изкуствения интелект. **ML се занимава с използването на специализирани алгоритми за откриване на смислена информация и намиране на скрити модели от възприети данни, за да подкрепи процеса на рационално вземане на решения**. --- ## AI, ML, Дълбоко обучение -![AI, ML, deep learning, data science](../../../../1-Introduction/1-intro-to-ML/images/ai-ml-ds.png) +![AI, ML, deep learning, data science](../../../../translated_images/bg/ai-ml-ds.537ea441b124ebf6.webp) -> Диаграма, показваща връзките между AI, ML, дълбоко обучение и наука за данни. Инфографика от [Jen Looper](https://twitter.com/jenlooper), вдъхновена от [тази графика](https://softwareengineering.stackexchange.com/questions/366996/distinction-between-ai-ml-neural-networks-deep-learning-and-data-mining) +> Диаграма, показваща връзките между AI, ML, дълбоко обучение и наука за данните. Инфографика от [Jen Looper](https://twitter.com/jenlooper), вдъхновена от [този график](https://softwareengineering.stackexchange.com/questions/366996/distinction-between-ai-ml-neural-networks-deep-learning-and-data-mining) --- -## Концепции, които ще разгледаме +## Концепции за обхващане -В тази учебна програма ще разгледаме само основните концепции на машинното обучение, които един начинаещ трябва да знае. Ще се фокусираме върху това, което наричаме „класическо машинно обучение“, като основно използваме Scikit-learn, отлична библиотека, която много студенти използват за изучаване на основите. За да разберете по-широки концепции на изкуствения интелект или дълбокото обучение, е необходимо силно фундаментално знание за машинното обучение, което бихме искали да предложим тук. +В тази учебна програма ще покрием само основните концепции на машинното обучение, които един начинаещ трябва да знае. Основно покриваме това, което наричаме „класическо машинно обучение“, като използваме Scikit-learn, отлична библиотека, която много студенти използват за въведение. За да разберете по-широките концепции на изкуствения интелект или дълбокото обучение, е необходима здрава основа в машинното обучение и бихме искали да я предоставим тук. --- ## В този курс ще научите: @@ -80,71 +80,78 @@ - техники за клъстеризация в ML - техники за обработка на естествен език в ML - техники за прогнозиране на времеви серии в ML -- обучение чрез подсилване +- подсилено обучение - реални приложения на ML --- -## Какво няма да разгледаме +## Какво няма да покриваме - дълбоко обучение - невронни мрежи -- AI +- изкуствен интелект -За да осигурим по-добро учебно преживяване, ще избегнем сложностите на невронните мрежи, „дълбокото обучение“ – моделиране с много слоеве, използвайки невронни мрежи – и AI, които ще разгледаме в друга учебна програма. Също така ще предложим предстояща учебна програма за наука за данни, за да се фокусираме върху този аспект на по-голямото поле. +За да осигурим по-добро обучително преживяване, ще избегнем сложностите на невронните мрежи, „дълбокото обучение“ – многослойно моделиране с невронни мрежи – и AI, който ще обсъдим в друга учебна програма. Също така предстои учебна програма по наука за данните, която ще се фокусира върху тази по-широка област. --- ## Защо да изучаваме машинно обучение? -Машинното обучение, от гледна точка на системите, се определя като създаване на автоматизирани системи, които могат да научат скрити модели от данни, за да подпомогнат вземането на интелигентни решения. +Машинното обучение, от системна перспектива, се дефинира като създаване на автоматизирани системи, които могат да научават скрити модели от данни, за да подпомагат интелигентното вземане на решения. -Тази мотивация е свободно вдъхновена от начина, по който човешкият мозък научава определени неща въз основа на данните, които възприема от външния свят. +Тази мотивация е свободно вдъхновена от начина, по който човешкият мозък учи определени неща въз основа на данните, които възприема от външния свят. -✅ Помислете за минута защо един бизнес би искал да използва стратегии за машинно обучение вместо да създаде система с твърдо кодирани правила. +✅ Помислете за момент защо един бизнес би искал да използва стратегии за машинно обучение вместо създаване на система с твърдо кодирани правила. + +--- +## Защо качеството на данните е важно + +Качествените данни подобряват представянето на модела. Лоши или шумни данни могат да доведат до неточни прогнози, дори когато се използват усъвършенствани алгоритми за машинно обучение. --- ## Приложения на машинното обучение -Приложенията на машинното обучение вече са почти навсякъде и са толкова разпространени, колкото и данните, които се генерират в нашите общества от нашите смартфони, свързани устройства и други системи. Като се има предвид огромният потенциал на съвременните алгоритми за машинно обучение, изследователите проучват тяхната способност да решават многомерни и многодисциплинарни реални проблеми с отлични положителни резултати. +Приложенията на машинното обучение са почти навсякъде и са толкова чести, колкото и данните, които текат в нашето общество, генерирани от нашите смартфони, свързани устройства и други системи. Предвид огромния потенциал на модерните алгоритми за машинно обучение, изследователите проучват тяхната способност да решават многомерни и многоотраслови проблеми от реалния живот с отлични резултати. --- ## Примери за приложено ML **Можете да използвате машинно обучение по много начини**: -- За прогнозиране на вероятността за заболяване въз основа на медицинската история или доклади на пациента. -- За използване на данни за времето за прогнозиране на метеорологични събития. -- За разбиране на настроението на текст. -- За откриване на фалшиви новини, за да се спре разпространението на пропаганда. +- За прогнозиране на вероятността от заболяване според медицинската история или доклади на пациент. +- За използване на метеорологични данни за прогнозиране на метеорологични събития. +- За разбиране на настроението в текст. +- За откриване на фалшиви новини и спиране на разпространението на пропаганда. -Финанси, икономика, земни науки, космически изследвания, биомедицинско инженерство, когнитивни науки и дори хуманитарни науки са адаптирали машинното обучение, за да решат трудните, тежки за обработка на данни проблеми в своите области. +Финанси, икономика, науки за Земята, космически изследвания, биомедицинско инженерство, когнитивни науки и дори хуманитарни области са адаптирали машинното обучение за решаване на тежки, базирани на данни проблеми в своята сфера. --- ## Заключение -Машинното обучение автоматизира процеса на откриване на модели, като намира значими прозрения от реални или генерирани данни. То се е доказало като изключително ценно в бизнес, здравеопазване и финансови приложения, наред с други. +Машинното обучение автоматизира процеса на откриване на модели, като намира смислени прозрения от реални или генерирани данни. То се оказа изключително ценно в бизнеса, здравеопазването, финансите и др. -В близко бъдеще разбирането на основите на машинното обучение ще бъде задължително за хора от всяка област поради широкото му приложение. +В близко бъдеще разбирането на основите на машинното обучение ще бъде задължително за хора от всяка сфера заради широкоразпространеното му прилагане. --- # 🚀 Предизвикателство -Нарисувайте, на хартия или с онлайн приложение като [Excalidraw](https://excalidraw.com/), вашето разбиране за разликите между AI, ML, дълбоко обучение и наука за данни. Добавете идеи за проблеми, които всяка от тези техники е добра за решаване. +Скицирайте, на хартия или чрез онлайн приложение като [Excalidraw](https://excalidraw.com/), разбирането си за разликите между AI, ML, дълбоко обучение и наука за данните. Добавете идеи за проблеми, които всяка от тези техники е добра да решава. -# [Тест след лекцията](https://ff-quizzes.netlify.app/en/ml/) +# [Въпросник след лекцията](https://ff-quizzes.netlify.app/en/ml/) --- -# Преглед и самостоятелно обучение +# Преглед и самообучение -За да научите повече за това как можете да работите с ML алгоритми в облака, следвайте този [учебен път](https://docs.microsoft.com/learn/paths/create-no-code-predictive-models-azure-machine-learning/?WT.mc_id=academic-77952-leestott). +За да научите повече за това как да работите с ML алгоритми в облака, следвайте този [Обучителен път](https://docs.microsoft.com/learn/paths/create-no-code-predictive-models-azure-machine-learning/?WT.mc_id=academic-77952-leestott). -Вземете [учебен път](https://docs.microsoft.com/learn/modules/introduction-to-machine-learning/?WT.mc_id=academic-77952-leestott) за основите на ML. +Вземете [Обучителен път](https://docs.microsoft.com/learn/modules/introduction-to-machine-learning/?WT.mc_id=academic-77952-leestott) за основите на ML. --- -# Задание +# Задача [Започнете работа](assignment.md) --- -**Отказ от отговорност**: -Този документ е преведен с помощта на AI услуга за превод [Co-op Translator](https://github.com/Azure/co-op-translator). Въпреки че се стремим към точност, моля, имайте предвид, че автоматизираните преводи може да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за каквито и да е недоразумения или погрешни интерпретации, произтичащи от използването на този превод. \ No newline at end of file + +**Отказ от отговорност**: +Този документ е преведен с помощта на AI преводачески услуга [Co-op Translator](https://github.com/Azure/co-op-translator). Въпреки че се стремим към точност, моля имайте предвид, че автоматизираните преводи могат да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за каквито и да е недоразумения или неправилни тълкувания, произтичащи от използването на този превод. + \ No newline at end of file diff --git a/translations/bg/5-Clustering/1-Visualize/README.md b/translations/bg/5-Clustering/1-Visualize/README.md index 2077ac225..0fa060fdc 100644 --- a/translations/bg/5-Clustering/1-Visualize/README.md +++ b/translations/bg/5-Clustering/1-Visualize/README.md @@ -1,106 +1,105 @@ -# Въведение в клъстеризацията +# Въведение в клъстерирането -Клъстеризацията е вид [Обучение без надзор](https://wikipedia.org/wiki/Unsupervised_learning), което предполага, че даден набор от данни е без етикети или че входните данни не са свързани с предварително дефинирани изходи. Тя използва различни алгоритми, за да сортира данни без етикети и да предостави групировки според моделите, които открива в данните. +Клъстерирането е вид [ненаблюдавано обучение](https://wikipedia.org/wiki/Unsupervised_learning), което предполага, че набор от данни е без етикети или че входните му данни не са съпоставени с предварително зададени изходи. То използва различни алгоритми, за да сортира неетикираните данни и да предостави групи според моделите, които разпознава в данните. [![No One Like You by PSquare](https://img.youtube.com/vi/ty2advRiWJM/0.jpg)](https://youtu.be/ty2advRiWJM "No One Like You by PSquare") -> 🎥 Кликнете върху изображението по-горе за видео. Докато изучавате машинното обучение с клъстеризация, насладете се на някои нигерийски танцови парчета - това е високо оценена песен от 2014 г. на PSquare. +> 🎥 Кликнете върху снимката горе за видео. Докато изучавате машинното обучение с клъстериране, се насладете на някои нигерийски дънс хол тракове - това е високо оценена песен от 2014 г. на PSquare. -## [Тест преди лекцията](https://ff-quizzes.netlify.app/en/ml/) +## [Предварителен тест преди лекцията](https://ff-quizzes.netlify.app/en/ml/) ### Въведение -[Клъстеризацията](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) е много полезна за изследване на данни. Нека видим дали може да помогне за откриване на тенденции и модели в начина, по който нигерийската аудитория консумира музика. +[Клъстерирането](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) е много полезно за изследване на данни. Нека видим дали може да помогне да се открият тенденции и модели в начина, по който нигерийската публика консумира музика. -✅ Отделете минута, за да помислите за приложенията на клъстеризацията. В реалния живот клъстеризацията се случва винаги, когато имате купчина пране и трябва да сортирате дрехите на членовете на семейството 🧦👕👖🩲. В науката за данни клъстеризацията се случва, когато се опитвате да анализирате предпочитанията на потребителите или да определите характеристиките на който и да е набор от данни без етикети. Клъстеризацията, по някакъв начин, помага да се внесе ред в хаоса, като например чекмедже за чорапи. +✅ Отделете минута, за да помислите за приложенията на клъстерирането. В реалния живот клъстерирането се случва всеки път, когато имате купчина пране и трябва да сортирате дрехите на членове на семейството си 🧦👕👖🩲. В науката за данни, клъстерирането се случва, когато се опитвате да анализирате предпочитанията на потребителя или да определите характеристиките на всеки неетиран набор от данни. Клъстерирането, по някакъв начин, помага да се внесе ред в хаоса, като в чекмедже за чорапи. [![Introduction to ML](https://img.youtube.com/vi/esmzYhuFnds/0.jpg)](https://youtu.be/esmzYhuFnds "Introduction to Clustering") -> 🎥 Кликнете върху изображението по-горе за видео: Джон Гуттаг от MIT представя клъстеризацията. +> 🎥 Кликнете върху снимката горе за видео: Джон Гъттаг от MIT представя клъстерирането -В професионална среда клъстеризацията може да се използва за определяне на неща като сегментация на пазара, например за определяне на възрастовите групи, които купуват определени продукти. Друго приложение би било откриването на аномалии, например за откриване на измами в набор от данни с транзакции с кредитни карти. Или може да използвате клъстеризация за определяне на тумори в група медицински сканирания. +В професионална среда клъстерирането може да се използва за определяне на неща като сегментация на пазара, например определяне кои възрастови групи купуват кои артикули. Друга употреба би била откриването на аномалии, например за засичане на измами от набор от данни с транзакции с кредитни карти. Или може да използвате клъстериране, за да определите тумори в партида медицински сканирания. -✅ Помислете за момент как може да сте срещали клъстеризация „в дивата природа“, в банковия сектор, електронната търговия или бизнес среда. +✅ Помислете за минута как може да сте срещали клъстериране "в природата", в банкови, електронна търговия или бизнес среди. -> 🎓 Интересно е, че анализът на клъстери произхожда от областите на антропологията и психологията през 1930-те години. Можете ли да си представите как е бил използван? +> 🎓 Интересно е, че анализът на клъстери е възникнал в областите на антропологията и психологията през 30-те години на XX век. Можете ли да си представите как е могъл да се използва? -Алтернативно, можете да го използвате за групиране на резултати от търсене - например по връзки за пазаруване, изображения или ревюта. Клъстеризацията е полезна, когато имате голям набор от данни, който искате да намалите и върху който искате да извършите по-детайлен анализ, така че техниката може да се използва за изучаване на данни преди да се изградят други модели. +Алтернативно, може да го използвате за групиране на резултати от търсене - например по връзки за пазаруване, изображения или ревюта. Клъстерирането е полезно, когато имате голям набор от данни, който искате да намалите и върху който искате да извършите по-гранулиран анализ, така че техниката може да се използва за изучаване на данните преди изграждането на други модели. -✅ След като данните ви са организирани в клъстери, можете да им присвоите идентификатор на клъстер, и тази техника може да бъде полезна за запазване на поверителността на набора от данни; вместо това можете да се позовавате на точка от данни чрез нейния идентификатор на клъстер, а не чрез по-разкриващи идентифицируеми данни. Можете ли да се сетите за други причини, поради които бихте се позовали на идентификатор на клъстер, вместо на други елементи от клъстера, за да го идентифицирате? +✅ След като данните ви са организирани в клъстери, вие им присвоявате идентификатор на клъстера, и тази техника може да бъде полезна за запазване на поверителността на набора от данни; вместо да се позовавате на дадена точка чрез по-разкриващи идентифициращи данни, можете да използвате идентификатора на клъстера. Можете ли да се сетите за други причини, поради които бихте се позовали на идентификатор на клъстер, а не на други елементи от клъстера? -Задълбочете разбирането си за техниките на клъстеризация в този [учебен модул](https://docs.microsoft.com/learn/modules/train-evaluate-cluster-models?WT.mc_id=academic-77952-leestott). +Задълбочете разбирането си за техники на клъстериране в този [учебен модул](https://docs.microsoft.com/learn/modules/train-evaluate-cluster-models?WT.mc_id=academic-77952-leestott) +## Започване с клъстериране -## Започване с клъстеризация +[Scikit-learn предлага голям набор](https://scikit-learn.org/stable/modules/clustering.html) от методи за извършване на клъстериране. Типът, който избирате, ще зависи от конкретния ви случай. Според документацията, всеки метод има различни предимства. Ето опростена таблица на методите, поддържани от Scikit-learn и подходящите им случаи: -[Scikit-learn предлага голям набор](https://scikit-learn.org/stable/modules/clustering.html) от методи за извършване на клъстеризация. Типът, който изберете, ще зависи от вашия случай на употреба. Според документацията, всеки метод има различни предимства. Ето опростена таблица на методите, поддържани от Scikit-learn, и техните подходящи случаи на употреба: +| Име на метода | Случай на използване | +| :-------------------------- | :------------------------------------------------------------------- | +| K-Means | общо предназначение, индуктивно | +| Affinity propagation | много, неравномерни клъстери, индуктивно | +| Mean-shift | много, неравномерни клъстери, индуктивно | +| Spectral clustering | малко, равномерни клъстери, транздуктивно | +| Ward hierarchical clustering| много, ограничени клъстери, транздуктивно | +| Agglomerative clustering | много, ограничени, неевклидови разстояния, транздуктивно | +| DBSCAN | нехоризонтална геометрия, неравномерни клъстери, транздуктивно | +| OPTICS | нехоризонтална геометрия, неравномерни клъстери с променлива плътност, транздуктивно | +| Gaussian mixtures | хоризонтална геометрия, индуктивно | +| BIRCH | голям набор от данни с изключения, индуктивно | -| Име на метода | Случай на употреба | -| :--------------------------- | :------------------------------------------------------------------- | -| K-Means | общо предназначение, индуктивен | -| Affinity propagation | много, неравномерни клъстери, индуктивен | -| Mean-shift | много, неравномерни клъстери, индуктивен | -| Spectral clustering | малко, равномерни клъстери, трансдуктивен | -| Ward hierarchical clustering | много, ограничени клъстери, трансдуктивен | -| Agglomerative clustering | много, ограничени, неевклидови разстояния, трансдуктивен | -| DBSCAN | неравна геометрия, неравномерни клъстери, трансдуктивен | -| OPTICS | неравна геометрия, неравномерни клъстери с променлива плътност, трансдуктивен | -| Gaussian mixtures | равна геометрия, индуктивен | -| BIRCH | голям набор от данни с изключения, индуктивен | - -> 🎓 Как създаваме клъстери има много общо с начина, по който събираме точките от данни в групи. Нека разгледаме някои термини: +> 🎓 Начинът, по който създаваме клъстери, има много общо с начина, по който събираме точките в групи. Нека разгледаме някои терминологии: > -> 🎓 ['Трансдуктивен' срещу 'индуктивен'](https://wikipedia.org/wiki/Transduction_(machine_learning)) +> 🎓 ['Транздуктивно' срещу 'индуктивно'](https://wikipedia.org/wiki/Transduction_(machine_learning)) > -> Трансдуктивното заключение се извежда от наблюдавани тренировъчни случаи, които се свързват със специфични тестови случаи. Индуктивното заключение се извежда от тренировъчни случаи, които се свързват с общи правила, които след това се прилагат към тестови случаи. +> Транздуктивното извеждане се извлича от наблюдавани тренировъчни случаи, които съответстват на конкретни тестови случаи. Индуктивното извеждане се извлича от тренировъчни случаи, които съответстват на общи правила, които после се прилагат към тестовите случаи. > -> Пример: Представете си, че имате набор от данни, който е само частично етикетиран. Някои неща са „плочи“, някои „CD-та“, а някои са празни. Вашата задача е да предоставите етикети за празните. Ако изберете индуктивен подход, бихте обучили модел, който търси „плочи“ и „CD-та“, и бихте приложили тези етикети към неетикетираните данни. Този подход ще има проблеми с класифицирането на неща, които всъщност са „касети“. Трансдуктивният подход, от друга страна, се справя по-ефективно с тези неизвестни данни, тъй като работи за групиране на подобни елементи заедно и след това прилага етикет към групата. В този случай клъстерите може да отразяват „кръгли музикални неща“ и „квадратни музикални неща“. +> Пример: Представете си, че имате набор от данни, който е само частично етикиран. Някои неща са "плочи", други "cd-та", а други са празни. Вашата задача е да поставите етикети на празните. Ако изберете индуктивен подход, бихте обучили модел, който търси "плочи" и "cd-та" и ги прилага като етикети към неетираните данни. Този подход ще има проблеми с класифицирането на неща, които всъщност са "касети". От друга страна, транздуктивният подход се справя по-ефективно с тези неизвестни данни, тъй като работи за групиране на подобни елементи заедно и след това прилага етикет на групата. В този случай клъстерите може да отразяват "кръгли музикални неща" и "квадратни музикални неща". > -> 🎓 ['Неравна' срещу 'равна' геометрия](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering) +> 🎓 ['Нехоризонтална' срещу 'хоризонтална' геометрия](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering) > -> Произхождаща от математическата терминология, неравна срещу равна геометрия се отнася до измерването на разстоянията между точки чрез „равни“ ([Евклидови](https://wikipedia.org/wiki/Euclidean_geometry)) или „неравни“ (неевклидови) геометрични методи. +> Взето от математическата терминология, нехоризонталната срещу хоризонталната геометрия се отнася до измерването на разстоянията между точки чрез "хоризонтални" ([евклидови](https://wikipedia.org/wiki/Euclidean_geometry)) или "нехоризонтални" (неевклидови) геометрични методи. > ->'Равна' в този контекст се отнася до Евклидова геометрия (части от която се преподават като „плоска“ геометрия), а неравна се отнася до неевклидова геометрия. Какво общо има геометрията с машинното обучение? Е, като две области, които са вкоренени в математиката, трябва да има общ начин за измерване на разстоянията между точки в клъстери, и това може да се направи по „равен“ или „неравен“ начин, в зависимост от естеството на данните. [Евклидовите разстояния](https://wikipedia.org/wiki/Euclidean_distance) се измерват като дължината на сегмент от права линия между две точки. [Неевклидовите разстояния](https://wikipedia.org/wiki/Non-Euclidean_geometry) се измерват по крива. Ако вашите данни, визуализирани, изглежда не съществуват на равнина, може да се наложи да използвате специализиран алгоритъм за обработка. +>'Хоризонталното' тук се отнася до евклидовата геометрия (части от която се преподават като "планна" геометрия), а нехоризонталното - до неевклидовата геометрия. Какво общо има геометрията с машинното обучение? Като две области, основани на математиката, трябва да има общ начин за измерване на разстоянията между точки в клъстерите, което може да стане по "хоризонтален" или "нехоризонтален" начин, в зависимост от естеството на данните. [Евклидовите разстояния](https://wikipedia.org/wiki/Euclidean_distance) се измерват като дължина на отсечка между две точки. [Неевклидовите разстояния](https://wikipedia.org/wiki/Non-Euclidean_geometry) се измерват по дъга. Ако вашите данни, визуализирани, изглежда не съществуват на равнина, може да се нуждаете от специализиран алгоритъм, за да ги обработите. > -![Flat vs Nonflat Geometry Infographic](../../../../5-Clustering/1-Visualize/images/flat-nonflat.png) +![Flat vs Nonflat Geometry Infographic](../../../../translated_images/bg/flat-nonflat.d1c8c6e2a96110c1.webp) > Инфографика от [Dasani Madipalli](https://twitter.com/dasani_decoded) > > 🎓 ['Разстояния'](https://web.stanford.edu/class/cs345a/slides/12-clustering.pdf) > -> Клъстерите се определят от тяхната матрица на разстояния, например разстоянията между точки. Това разстояние може да се измерва по няколко начина. Евклидовите клъстери се определят от средната стойност на точките и съдържат „центроид“ или централна точка. Разстоянията се измерват спрямо този центроид. Неевклидовите разстояния се отнасят до „клъстроиди“, точката, която е най-близо до другите точки. Клъстроидите от своя страна могат да бъдат дефинирани по различни начини. +> Клъстерите се дефинират чрез матрица на разстоянията, например разстоянията между точките. Това разстояние може да се измерва по няколко начина. Евклидовите клъстери се дефинират чрез средната стойност на точките и съдържат “центроид” или централна точка. Разстоянията се измерват като разстояния до този центроид. Неевклидовите разстояния се отнасят до "клъстроиди", точката, най-близка до другите точки. Клъстроидите пък могат да се дефинират по различни начини. > > 🎓 ['Ограничени'](https://wikipedia.org/wiki/Constrained_clustering) > -> [Ограничената клъстеризация](https://web.cs.ucdavis.edu/~davidson/Publications/ICDMTutorial.pdf) въвежда „полунадзорено“ обучение в този метод без надзор. Връзките между точките се маркират като „не може да се свърже“ или „трябва да се свърже“, така че някои правила се налагат върху набора от данни. +> [Ограниченото клъстериране](https://web.cs.ucdavis.edu/~davidson/Publications/ICDMTutorial.pdf) въвежда "полуненаблюдавано" обучение в този ненаблюдаван метод. Връзките между точките са маркирани като "не може да се свърже" или "трябва да се свърже", така че върху набора от данни се налагат някои правила. > ->Пример: Ако алгоритъмът е оставен свободен върху група от неетикетирани или полуетикетирани данни, клъстерите, които произвежда, може да са с лошо качество. В горния пример клъстерите може да групират „кръгли музикални неща“, „квадратни музикални неща“, „триъгълни неща“ и „бисквити“. Ако се дадат някои ограничения или правила за следване („елементът трябва да е направен от пластмаса“, „елементът трябва да може да произвежда музика“), това може да помогне за „ограничаване“ на алгоритъма да прави по-добри избори. +>Пример: Ако даден алгоритъм бъде оставен да работи свободно върху пакет неетиран или полуетикетиран набор от данни, клъстерите, които произвежда, могат да бъдат с ниско качество. В примера по-горе, клъстерите може да групират "кръгли музикални неща", "квадратни музикални неща", "триъгълни неща" и "бисквити". Ако му се зададат някои ограничения или правила за спазване ("артикулът трябва да е от пластмаса", "артикулът трябва да може да произвежда музика"), това може да помогне да се 'ограничи' алгоритъмът да прави по-добри избори. > > 🎓 'Плътност' > -> Данните, които са „шумни“, се считат за „плътни“. Разстоянията между точките във всеки от неговите клъстери може да се окажат, при разглеждане, повече или по-малко плътни, или „претъпкани“, и следователно тези данни трябва да бъдат анализирани с подходящия метод за клъстеризация. [Тази статия](https://www.kdnuggets.com/2020/02/understanding-density-based-clustering.html) демонстрира разликата между използването на K-Means клъстеризация и HDBSCAN алгоритми за изследване на шумен набор от данни с неравномерна плътност на клъстерите. +> Данни, които са "шумни", се считат за "плътни". Разстоянията между точките във всеки от клъстерите им може да се окажат, след преглед, по-плътни или по-рядко наситени, или "струпани", и затова тези данни трябва да се анализират с подходящия метод на клъстериране. [Тази статия](https://www.kdnuggets.com/2020/02/understanding-density-based-clustering.html) демонстрира разликата между използването на K-Means клъстериране и HDBSCAN алгоритми за изследване на шумен набор от данни с неравномерна плътност на клъстерите. -## Алгоритми за клъстеризация +## Алгоритми за клъстериране -Съществуват над 100 алгоритма за клъстеризация, и тяхното използване зависи от естеството на данните. Нека обсъдим някои от основните: +Има над 100 алгоритъма за клъстериране и тяхната употреба зависи от естеството на наличните данни. Нека обсъдим някои от основните: -- **Йерархична клъстеризация**. Ако обект се класифицира според близостта му до близък обект, а не до по-далечен, клъстерите се формират въз основа на разстоянието на членовете им до и от други обекти. Агломеративната клъстеризация на Scikit-learn е йерархична. +- **Йерархично клъстериране**. Ако обект се класифицира според близостта му до друг близък обект, а не до по-отдалечен, клъстерите се формират според разстоянията между членовете им и другите обекти. Агломеративното клъстериране на Scikit-learn е йерархично. - ![Hierarchical clustering Infographic](../../../../5-Clustering/1-Visualize/images/hierarchical.png) + ![Hierarchical clustering Infographic](../../../../translated_images/bg/hierarchical.bf59403aa43c8c47.webp) > Инфографика от [Dasani Madipalli](https://twitter.com/dasani_decoded) -- **Клъстеризация чрез центроид**. Този популярен алгоритъм изисква избор на 'k', или броя на клъстерите, които да се формират, след което алгоритъмът определя централната точка на клъстера и събира данни около тази точка. [K-means клъстеризацията](https://wikipedia.org/wiki/K-means_clustering) е популярен вариант на клъстеризация чрез центроид. Центърът се определя от най-близката средна стойност, откъдето идва и името. Квадратното разстояние от клъстера се минимизира. +- **Центроидно клъстериране**. Този популярен алгоритъм изисква избор на "k", или броят на клъстерите, които да се формират, след което алгоритъмът определя централната точка на клъстера и събира данни около тази точка. [K-means клъстериране](https://wikipedia.org/wiki/K-means_clustering) е популярна версия на центроидното клъстериране. Центърът се определя от най-близката средна стойност, откъдето идва и името му. Квадратното разстояние от клъстера се минимизира. - ![Centroid clustering Infographic](../../../../5-Clustering/1-Visualize/images/centroid.png) + ![Centroid clustering Infographic](../../../../translated_images/bg/centroid.097fde836cf6c918.webp) > Инфографика от [Dasani Madipalli](https://twitter.com/dasani_decoded) -- **Клъстеризация, базирана на разпределение**. Базирана на статистическо моделиране, клъстеризацията, базирана на разпределение, се фокусира върху определяне на вероятността дадена точка от данни да принадлежи към клъстер и я присвоява съответно. Методите на Гаусови смеси принадлежат към този тип. +- **Клъстериране на базата на разпределение**. Базирано на статистическо моделиране, клъстерирането на базата на разпределение се фокусира върху определянето на вероятността дадена точка от данни да принадлежи на клъстер и съответното ѝ присвояване. Гаусовите смесени методи спадат към този тип. -- **Клъстеризация, базирана на плътност**. Точките от данни се присвояват към клъстери въз основа на тяхната плътност или групиране около други точки. Точки от данни, които са далеч от групата, се считат за изключения или шум. DBSCAN, Mean-shift и OPTICS принадлежат към този тип клъстеризация. +- **Клъстериране на базата на плътност**. Точките от данни се присвояват към клъстери според тяхната плътност или групиране около една и съща зона. Точки от данни далеч от групата се считат за изключения или шум. DBSCAN, Mean-shift и OPTICS са примери за този тип клъстериране. -- **Клъстеризация, базирана на решетка**. За многомерни набори от данни се създава решетка и данните се разделят между клетките на решетката, като по този начин се създават клъстери. +- **Клъстериране на базата на мрежа**. За многомерни набори от данни се създава мрежа и данните се разделят сред клетките на мрежата, като по този начин се формират клъстери. -## Упражнение - клъстеризирайте вашите данни +## Упражнение - клъстерирайте вашите данни -Клъстеризацията като техника е значително подпомогната от правилната визуализация, така че нека започнем с визуализиране на нашите музикални данни. Това упражнение ще ни помогне да решим кой от методите за клъстеризация трябва да използваме най-ефективно за естеството на тези данни. +Клъстерирането като техника се подпомага значително от правилната визуализация, затова нека започнем с визуализиране на нашите музикални данни. Това упражнение ще ни помогне да решим кой от методите за клъстериране трябва да използваме най-ефективно за естеството на тези данни. 1. Отворете файла [_notebook.ipynb_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/1-Visualize/notebook.ipynb) в тази папка. @@ -110,7 +109,7 @@ !pip install seaborn ``` -1. Добавете данните за песните от [_nigerian-songs.csv_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/data/nigerian-songs.csv). Заредете dataframe с някои данни за песните. Подгответе се да изследвате тези данни, като импортирате библиотеките и изведете данните: +1. Добавете данните за песните от [_nigerian-songs.csv_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/data/nigerian-songs.csv). Заредете dataframe с някои данни за песните. Подгответе се да изследвате тези данни чрез импортиране на библиотеките и извеждане на данните: ```python import matplotlib.pyplot as plt @@ -120,23 +119,23 @@ df.head() ``` - Проверете първите няколко реда от данните: + Проверете първите няколко реда на данните: - | | име | албум | изпълнител | топ жанр на изпълнителя | дата на издаване | дължина | популярност | танцувалност | акустичност | енергия | инструменталност | живост | сила на звука | речевост | темпо | времеви подпис | - | --- | ------------------------ | ---------------------------- | ------------------- | ----------------------- | ---------------- | ------- | ----------- | ------------ | ------------ | ------- | ---------------- | ------ | ------------ | --------- | ------- | -------------- | - | 0 | Sparky | Mandy & The Jungle | Cruel Santino | alternative r&b | 2019 | 144000 | 48 | 0.666 | 0.851 | 0.42 | 0.534 | 0.11 | -6.699 | 0.0829 | 133.015 | 5 | - | 1 | sh -| 2 | LITT! | LITT! | AYLØ | indie r&b | 2018 | 207758 | 40 | 0.836 | 0.272 | 0.564 | 0.000537 | 0.11 | -7.127 | 0.0424 | 130.005 | 4 | -| 3 | Confident / Feeling Cool | Enjoy Your Life | Lady Donli | nigerian pop | 2019 | 175135 | 14 | 0.894 | 0.798 | 0.611 | 0.000187 | 0.0964 | -4.961 | 0.113 | 111.087 | 4 | -| 4 | wanted you | rare. | Odunsi (The Engine) | afropop | 2018 | 152049 | 25 | 0.702 | 0.116 | 0.833 | 0.91 | 0.348 | -6.044 | 0.0447 | 105.115 | 4 | + | | name | album | artist | artist_top_genre | release_date | length | popularity | danceability | acousticness | energy | instrumentalness | liveness | loudness | speechiness | tempo | time_signature | + | --- | ------------------------ | ---------------------------- | ------------------- | ---------------- | ------------ | ------ | ---------- | ------------ | ------------ | ------ | ---------------- | -------- | -------- | ----------- | ------- | -------------- | + | 0 | Sparky | Mandy & The Jungle | Cruel Santino | alternative r&b | 2019 | 144000 | 48 | 0.666 | 0.851 | 0.42 | 0.534 | 0.11 | -6.699 | 0.0829 | 133.015 | 5 | + | 1 | shuga rush | EVERYTHING YOU HEARD IS TRUE | Odunsi (The Engine) | afropop | 2020 | 89488 | 30 | 0.71 | 0.0822 | 0.683 | 0.000169 | 0.101 | -5.64 | 0.36 | 129.993 | 3 | + | 2 | LITT! | LITT! | AYLØ | indie r&b | 2018 | 207758 | 40 | 0.836 | 0.272 | 0.564 | 0.000537 | 0.11 | -7.127 | 0.0424 | 130.005 | 4 | + | 3 | Confident / Feeling Cool | Enjoy Your Life | Lady Donli | Nigerian pop | 2019 | 175135 | 14 | 0.894 | 0.798 | 0.611 | 0.000187 | 0.0964 | -4.961 | 0.113 | 111.087 | 4 | + | 4 | wanted you | rare. | Odunsi (The Engine) | afropop | 2018 | 152049 | 25 | 0.702 | 0.116 | 0.833 | 0.91 | 0.348 | -6.044 | 0.0447 | 105.115 | 4 | -1. Получете информация за датафрейма, като извикате `info()`: +1. Вземете някаква информация за dataframe, като извикате `info()`: ```python df.info() ``` - Резултатът изглежда така: + Изходът изглежда така: ```output @@ -164,7 +163,7 @@ memory usage: 66.4+ KB ``` -1. Проверете за липсващи стойности, като извикате `isnull()` и се уверите, че сумата е 0: +1. Проверете отново за null стойности, като извикате `isnull()` и проверите сумата дали е 0: ```python df.isnull().sum() @@ -209,11 +208,11 @@ | 75% | 2017 | 242098.5 | 31 | 0.8295 | 0.403 | 0.87575 | 0.000234 | 0.164 | -3.331 | 0.177 | 125.03925 | 4 | | max | 2020 | 511738 | 73 | 0.966 | 0.954 | 0.995 | 0.91 | 0.811 | 0.582 | 0.514 | 206.007 | 5 | -> 🤔 Ако работим с клъстериране, метод без надзор, който не изисква етикетирани данни, защо показваме тези данни с етикети? Във фазата на изследване на данните те са полезни, но не са необходими за работата на алгоритмите за клъстериране. Можете просто да премахнете заглавията на колоните и да се позовавате на данните по номер на колона. +> 🤔 Ако работим с клъстеризация, ненаблюдавана техника, която не изисква етикетирани данни, защо показваме тези данни с етикети? Във фазата на изследване на данните те са полезни, но не са необходими за работата на алгоритмите за клъстеризация. Можете също така да премахнете заглавията на колоните и да се отнасяте към данните по номера на колоната. -Разгледайте общите стойности на данните. Забележете, че популярността може да бъде „0“, което показва песни без класиране. Нека скоро премахнем тези стойности. +Вижте общите стойности на данните. Обърнете внимание, че популярността може да бъде '0', което показва песни без класиране. Нека скоро ги премахнем. -1. Използвайте барплот, за да откриете най-популярните жанрове: +1. Използвайте диаграма с колони, за да разберете най-популярните жанрове: ```python import seaborn as sns @@ -225,13 +224,13 @@ plt.title('Top genres',color = 'blue') ``` - ![most popular](../../../../5-Clustering/1-Visualize/images/popular.png) + ![най-популярни](../../../../translated_images/bg/popular.9c48d84b3386705f.webp) -✅ Ако искате да видите повече топ стойности, променете top `[:5]` на по-голяма стойност или го премахнете, за да видите всички. +✅ Ако искате да видите повече водещи стойности, променете горната граница `[:5]` на по-голяма стойност или я премахнете, за да видите всички. -Забележете, когато топ жанрът е описан като „Missing“, това означава, че Spotify не го е класифицирал, така че нека го премахнем. +Обърнете внимание, че когато най-популярният жанр е описан като 'Missing', това означава, че Spotify не го е класифицирал, така че нека го премахнем. -1. Премахнете липсващите данни, като ги филтрирате: +1. Премахнете липсващи данни чрез филтриране ```python df = df[df['artist_top_genre'] != 'Missing'] @@ -244,9 +243,9 @@ Сега проверете отново жанровете: - ![most popular](../../../../5-Clustering/1-Visualize/images/all-genres.png) + ![най-популярни](../../../../translated_images/bg/all-genres.1d56ef06cefbfcd6.webp) -1. Трите водещи жанра доминират в този набор от данни. Нека се концентрираме върху `afro dancehall`, `afropop` и `nigerian pop`, като допълнително филтрираме набора от данни, за да премахнем всичко с 0 стойност на популярност (което означава, че не е класифицирано с популярност в набора от данни и може да се счита за шум за нашите цели): +1. Най-много доминират трите основни жанра в този набор от данни. Нека се съсредоточим върху `afro dancehall`, `afropop` и `nigerian pop`, като допълнително филтрираме набора, за да премахнем всичко с нулева популярност (което означава, че не е било класифицирано с популярност в набора и може да се счита за шум за нашите цели): ```python df = df[(df['artist_top_genre'] == 'afro dancehall') | (df['artist_top_genre'] == 'afropop') | (df['artist_top_genre'] == 'nigerian pop')] @@ -266,21 +265,21 @@ sns.heatmap(corrmat, vmax=.8, square=True) ``` - ![correlations](../../../../5-Clustering/1-Visualize/images/correlation.png) + ![корелации](../../../../translated_images/bg/correlation.a9356bb798f5eea5.webp) - Единствената силна корелация е между `energy` и `loudness`, което не е изненадващо, като се има предвид, че силната музика обикновено е доста енергична. В противен случай корелациите са сравнително слаби. Ще бъде интересно да видим какво може да направи алгоритъм за клъстериране с тези данни. + Единствената силна корелация е между `energy` и `loudness`, което не е изненадващо, тъй като силната музика обикновено е доста енергична. В противен случай корелациите са сравнително слаби. Интересно ще бъде да видим какво може да извлече алгоритъм за клъстеризация от тези данни. - > 🎓 Забележете, че корелацията не означава причинно-следствена връзка! Имаме доказателство за корелация, но нямаме доказателство за причинно-следствена връзка. [Забавен уебсайт](https://tylervigen.com/spurious-correlations) има визуализации, които подчертават тази точка. + > 🎓 Имайте предвид, че корелацията не означава причинно-следствена връзка! Имаме доказателство за корелация, но няма доказателство за причинност. [Забавен уебсайт](https://tylervigen.com/spurious-correlations) показва визуализации, които подчертават този факт. -Има ли някакво сближаване в този набор от данни около възприеманата популярност и танцувалност на песента? FacetGrid показва, че има концентрични кръгове, които се подреждат, независимо от жанра. Може ли да е така, че нигерийските вкусове се сближават на определено ниво на танцувалност за този жанр? +Има ли съвпадение в този набор от данни относно възприеманата популярност на песен и нейната danceability? FacetGrid показва, че има концентрични кръгове, които се подреждат, независимо от жанра. Може би нигерийският вкус се събира на определено ниво на danceability за този жанр? -✅ Опитайте различни точки от данни (енергия, сила на звука, речевост) и повече или различни музикални жанрове. Какво можете да откриете? Разгледайте таблицата `df.describe()`, за да видите общото разпределение на точките от данни. +✅ Опитайте с различни данни (енергия, шум, речовитост) и повече или различни музикални жанрове. Какво можете да откриете? Вижте таблицата `df.describe()`, за да видите общото разпределение на данните. ### Упражнение - разпределение на данните -Различават ли се значително тези три жанра по отношение на възприемането на тяхната танцувалност, въз основа на тяхната популярност? +Дали тези три жанра значително се различават във възприятията за тяхната danceability, базирано на тяхната популярност? -1. Изследвайте разпределението на данните за популярност и танцувалност на нашите три водещи жанра по дадена x и y ос. +1. Изследвайте разпределението на данните на трите водещи жанра по отношение на популярност и danceability по дадени оси x и y. ```python sns.set_theme(style="ticks") @@ -292,15 +291,15 @@ ) ``` - Можете да откриете концентрични кръгове около обща точка на сближаване, показващи разпределението на точките. + Можете да откриете концентрични кръгове около обща точка на сближаване, показваща разпределението на точките. - > 🎓 Забележете, че този пример използва графика KDE (Kernel Density Estimate), която представя данните с помощта на непрекъсната крива на плътност на вероятността. Това ни позволява да интерпретираме данните, когато работим с множество разпределения. + > 🎓 Обърнете внимание, че този пример използва графика KDE (оценка на ядровата плътност), която представлява данните чрез непрекъсната крива на вероятностната плътност. Това ни позволява да интерпретираме данните, когато работим с множество разпределения. - Като цяло трите жанра се подреждат свободно по отношение на тяхната популярност и танцувалност. Определянето на клъстери в тези свободно подредени данни ще бъде предизвикателство: + По принцип трите жанра се подреждат непрецизно по отношение на тяхната популярност и danceability. Определянето на клъстери в тези свободно подредени данни ще бъде предизвикателство: - ![distribution](../../../../5-Clustering/1-Visualize/images/distribution.png) + ![разпределение](../../../../translated_images/bg/distribution.9be11df42356ca95.webp) -1. Създайте диаграма с точки: +1. Създайте scatter plot: ```python sns.FacetGrid(df, hue="artist_top_genre", height=5) \ @@ -308,31 +307,33 @@ .add_legend() ``` - Диаграма с точки на същите оси показва подобен модел на сближаване. + Разпръсната графика със същите оси показва подобен модел на сближаване - ![Facetgrid](../../../../5-Clustering/1-Visualize/images/facetgrid.png) + ![Facetgrid](../../../../translated_images/bg/facetgrid.9b2e65ce707eba1f.webp) -Като цяло, за клъстериране можете да използвате диаграми с точки, за да покажете клъстери от данни, така че овладяването на този тип визуализация е много полезно. В следващия урок ще вземем тези филтрирани данни и ще използваме клъстериране с k-средни стойности, за да открием групи в тези данни, които изглежда се припокриват по интересни начини. +По принцип за клъстеризация можете да използвате scatterplot-и, за да покажете клъстери от данни, така че овладяването на този тип визуализация е много полезно. В следващия урок ще вземем този филтриран набор от данни и ще използваме k-means клъстеризация, за да открием групи в тези данни, които изглеждат, че се припокриват по интересен начин. --- ## 🚀Предизвикателство -В подготовка за следващия урок, направете диаграма за различните алгоритми за клъстериране, които можете да откриете и използвате в производствена среда. Какви проблеми се опитва да реши клъстерирането? +В подготовка за следващия урок направете диаграма за различните алгоритми за клъстеризация, които може да откриете и използвате в производствена среда. Какви проблеми се опитва да реши клъстеризацията? -## [Тест след лекцията](https://ff-quizzes.netlify.app/en/ml/) +## [Кратък тест след лекцията](https://ff-quizzes.netlify.app/en/ml/) -## Преглед и самостоятелно обучение +## Преглед и самообучение -Преди да приложите алгоритми за клъстериране, както научихме, е добра идея да разберете естеството на вашия набор от данни. Прочетете повече по тази тема [тук](https://www.kdnuggets.com/2019/10/right-clustering-algorithm.html) +Преди да приложите алгоритми за клъстеризация, както научихме, е добра идея да разберете естеството на вашия набор от данни. Прочетете повече по темата [тук](https://www.kdnuggets.com/2019/10/right-clustering-algorithm.html) -[Тази полезна статия](https://www.freecodecamp.org/news/8-clustering-algorithms-in-machine-learning-that-all-data-scientists-should-know/) ви води през различните начини, по които различните алгоритми за клъстериране се държат, предвид различни форми на данни. +[Тази полезна статия](https://www.freecodecamp.org/news/8-clustering-algorithms-in-machine-learning-that-all-data-scientists-should-know/) ви води през различните начини, по които различните алгоритми за клъстеризация работят при различни форми на данните. ## Задача -[Проучете други визуализации за клъстериране](assignment.md) +[Изследвайте други визуализации за клъстеризация](assignment.md) --- -**Отказ от отговорност**: -Този документ е преведен с помощта на AI услуга за превод [Co-op Translator](https://github.com/Azure/co-op-translator). Въпреки че се стремим към точност, моля, имайте предвид, че автоматизираните преводи може да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за недоразумения или погрешни интерпретации, произтичащи от използването на този превод. \ No newline at end of file + +**Отказ от отговорност**: +Този документ е преведен с помощта на AI преводачески услуга [Co-op Translator](https://github.com/Azure/co-op-translator). Въпреки че се стремим към точност, моля имайте предвид, че автоматизираните преводи могат да съдържат грешки или неточности. Оригиналният документ на неговия роден език трябва да се счита за авторитетен източник. За критична информация се препоръчва професионален човешки превод. Ние не носим отговорност за каквито и да е недоразумения или неправилни тълкувания, произтичащи от използването на този превод. + \ No newline at end of file diff --git a/translations/ro/.co-op-translator.json b/translations/ro/.co-op-translator.json index e1e1df0bd..ba20bfdcd 100644 --- a/translations/ro/.co-op-translator.json +++ b/translations/ro/.co-op-translator.json @@ -1,7 +1,7 @@ { "1-Introduction/1-intro-to-ML/README.md": { - "original_hash": "69389392fa6346e0dfa30f664b7b6fec", - "translation_date": "2025-09-05T16:07:43+00:00", + "original_hash": "3a6394c6f5ce3f8aee8211e92eaf9ef0", + "translation_date": "2026-05-26T22:55:25+00:00", "source_file": "1-Introduction/1-intro-to-ML/README.md", "language_code": "ro" }, @@ -240,8 +240,8 @@ "language_code": "ro" }, "5-Clustering/1-Visualize/README.md": { - "original_hash": "730225ea274c9174fe688b21d421539d", - "translation_date": "2025-09-05T15:43:36+00:00", + "original_hash": "08b00d9fbffc667a7fe7fc19ac00dfbd", + "translation_date": "2026-05-26T22:54:57+00:00", "source_file": "5-Clustering/1-Visualize/README.md", "language_code": "ro" }, diff --git a/translations/ro/1-Introduction/1-intro-to-ML/README.md b/translations/ro/1-Introduction/1-intro-to-ML/README.md index 117203d48..6c422a717 100644 --- a/translations/ro/1-Introduction/1-intro-to-ML/README.md +++ b/translations/ro/1-Introduction/1-intro-to-ML/README.md @@ -1,150 +1,157 @@ # Introducere în învățarea automată -## [Chestionar înainte de lecție](https://ff-quizzes.netlify.app/en/ml/) +## [Chestionar pre-lectură](https://ff-quizzes.netlify.app/en/ml/) --- [![ML pentru începători - Introducere în Învățarea Automată pentru Începători](https://img.youtube.com/vi/6mSx_KJxcHI/0.jpg)](https://youtu.be/6mSx_KJxcHI "ML pentru începători - Introducere în Învățarea Automată pentru Începători") -> 🎥 Click pe imaginea de mai sus pentru un scurt videoclip despre această lecție. +> 🎥 Faceți clic pe imaginea de mai sus pentru un scurt videoclip care parcurge această lecție. -Bine ai venit la acest curs despre învățarea automată clasică pentru începători! Indiferent dacă ești complet nou în acest subiect sau un practician experimentat în ML care dorește să își reîmprospăteze cunoștințele, suntem bucuroși să te avem alături! Ne dorim să creăm un punct de plecare prietenos pentru studiul tău în ML și am fi încântați să evaluăm, să răspundem și să integrăm [feedback-ul tău](https://github.com/microsoft/ML-For-Beginners/discussions). +Bine ați venit la acest curs despre învățarea automată clasică pentru începători! Fie că sunteți complet nou în acest domeniu, fie că sunteți un practician experimentat în ML care dorește să aprofundeze o arie, suntem bucuroși să vă avem alături! Dorim să creăm un punct de pornire prietenos pentru studiul vostru în ML și am fi bucuroși să evaluăm, să răspundem și să integrăm [feedback-ul](https://github.com/microsoft/ML-For-Beginners/discussions) vostru. [![Introducere în ML](https://img.youtube.com/vi/h0e2HAPTGF4/0.jpg)](https://youtu.be/h0e2HAPTGF4 "Introducere în ML") -> 🎥 Click pe imaginea de mai sus pentru un videoclip: John Guttag de la MIT introduce învățarea automată +> 🎥 Faceți clic pe imaginea de mai sus pentru un videoclip: John Guttag de la MIT introduce învățarea automată --- -## Începerea cu învățarea automată +## Începuturi în învățarea automată -Înainte de a începe acest curriculum, trebuie să îți configurezi computerul pentru a putea rula notebook-uri local. +Înainte de a începe cu acest curriculum, trebuie să aveți calculatorul configurat și pregătit să ruleze notebook-uri local. -- **Configurează-ți dispozitivul cu aceste videoclipuri**. Folosește următoarele linkuri pentru a învăța [cum să instalezi Python](https://youtu.be/CXZYvNRIAKM) pe sistemul tău și [cum să configurezi un editor de text](https://youtu.be/EU8eayHWoZg) pentru dezvoltare. -- **Învață Python**. Este recomandat să ai o înțelegere de bază a [Python](https://docs.microsoft.com/learn/paths/python-language/?WT.mc_id=academic-77952-leestott), un limbaj de programare util pentru oamenii de știință în domeniul datelor pe care îl folosim în acest curs. -- **Învață Node.js și JavaScript**. Vom folosi JavaScript de câteva ori în acest curs pentru a construi aplicații web, așa că va trebui să ai [node](https://nodejs.org) și [npm](https://www.npmjs.com/) instalate, precum și [Visual Studio Code](https://code.visualstudio.com/) disponibil pentru dezvoltarea atât în Python, cât și în JavaScript. -- **Creează un cont GitHub**. Deoarece ne-ai găsit aici pe [GitHub](https://github.com), este posibil să ai deja un cont, dar dacă nu, creează unul și apoi clonează acest curriculum pentru a-l folosi pe cont propriu. (Nu ezita să ne dai și o stea 😊) -- **Explorează Scikit-learn**. Familiarizează-te cu [Scikit-learn](https://scikit-learn.org/stable/user_guide.html), un set de biblioteci ML pe care le referim în aceste lecții. +- **Configurați-vă mașina cu aceste videoclipuri**. Folosiți linkurile următoare pentru a învăța [cum să instalați Python](https://youtu.be/CXZYvNRIAKM) pe sistemul vostru și să [configurați un editor de text](https://youtu.be/EU8eayHWoZg) pentru dezvoltare. +- **Învățați Python**. De asemenea, este recomandat să aveți o înțelegere de bază a [Python](https://docs.microsoft.com/learn/paths/python-language/?WT.mc_id=academic-77952-leestott), un limbaj de programare util pentru oamenii de știință în domeniul datelor pe care îl folosim în acest curs. +- **Învățați Node.js și JavaScript**. Folosim și JavaScript de câteva ori în acest curs când construim aplicații web, așa că va trebui să aveți instalate [node](https://nodejs.org) și [npm](https://www.npmjs.com/), precum și [Visual Studio Code](https://code.visualstudio.com/) disponibil atât pentru dezvoltarea Python, cât și JavaScript. +- **Creați un cont GitHub**. Deoarece ne-ați găsit aici pe [GitHub](https://github.com), s-ar putea să aveți deja un cont, dar dacă nu, creați unul și apoi faceți fork la acest curriculum pentru a-l folosi pe cont propriu. (Simțiți-vă liber să ne acordați și o stea 😊) +- **Explorați Scikit-learn**. Familiarizați-vă cu [Scikit-learn](https://scikit-learn.org/stable/user_guide.html), un set de biblioteci ML pe care le referim în aceste lecții. --- ## Ce este învățarea automată? -Termenul 'învățare automată' este unul dintre cele mai populare și frecvent utilizate termene din zilele noastre. Există o posibilitate considerabilă ca să fi auzit acest termen cel puțin o dată dacă ai o oarecare familiaritate cu tehnologia, indiferent de domeniul în care lucrezi. Mecanismele învățării automate, însă, sunt un mister pentru majoritatea oamenilor. Pentru un începător în învățarea automată, subiectul poate părea uneori copleșitor. Prin urmare, este important să înțelegem ce este de fapt învățarea automată și să o studiem pas cu pas, prin exemple practice. +Termenul „învățare automată” este unul dintre cei mai populari și des folosiți termeni din prezent. Există o probabilitate nontrivială să fi auzit acest termen cel puțin o dată dacă aveți oarecare familiaritate cu tehnologia, indiferent în ce domeniu lucrați. Mecanismele învățării automate, însă, sunt un mister pentru majoritatea oamenilor. Pentru un începător în învățarea automată, subiectul poate părea uneori copleșitor. Prin urmare, este important să înțelegem ce este de fapt învățarea automată și să învățăm despre ea pas cu pas, prin exemple practice. --- ## Curba hype-ului -![ml hype curve](../../../../1-Introduction/1-intro-to-ML/images/hype.png) +![ml hype curve](../../../../translated_images/ro/hype.07183d711a17aafe.webp) -> Google Trends arată curba recentă de 'hype' a termenului 'învățare automată' +> Google Trends arată „curba hype-ului” recentă a termenului „învățare automată” --- ## Un univers misterios -Trăim într-un univers plin de mistere fascinante. Mari oameni de știință precum Stephen Hawking, Albert Einstein și mulți alții și-au dedicat viețile căutării de informații semnificative care să dezvăluie misterele lumii din jurul nostru. Aceasta este condiția umană a învățării: un copil învață lucruri noi și descoperă structura lumii sale an de an pe măsură ce crește. +Trăim într-un univers plin de mistere fascinante. Mari oameni de știință precum Stephen Hawking, Albert Einstein și mulți alții și-au dedicat viețile căutării de informații semnificative care descoperă misterele lumii înconjurătoare. Aceasta este condiția umană a învățării: un copil învață lucruri noi și descoperă structura lumii lor an după an pe măsură ce crește spre maturitate. --- ## Creierul copilului -Creierul și simțurile unui copil percep faptele din mediul înconjurător și învață treptat tiparele ascunse ale vieții, care ajută copilul să creeze reguli logice pentru a identifica tiparele învățate. Procesul de învățare al creierului uman face ca oamenii să fie cele mai sofisticate ființe vii ale acestei lumi. Învățarea continuă prin descoperirea tiparelor ascunse și apoi inovarea pe baza acestor tipare ne permite să ne îmbunătățim constant pe parcursul vieții. Această capacitate de învățare și evoluție este legată de un concept numit [plasticitatea creierului](https://www.simplypsychology.org/brain-plasticity.html). Superficial, putem trasa unele similitudini motivaționale între procesul de învățare al creierului uman și conceptele de învățare automată. +Creierul și simțurile unui copil percep faptele din jur și învață treptat modelele ascunse ale vieții care ajută copilul să elaboreze reguli logice pentru a identifica modelele învățate. Procesul de învățare al creierului uman face din oameni cele mai sofisticate ființe din această lume. Învățarea continuă prin descoperirea modelelor ascunse și apoi inovarea pe baza acelor modele ne permite să ne îmbunătățim pe noi înșine pe tot parcursul vieții. Această capacitate de învățare și abilitate în evoluție este legată de un concept numit [plasticitatea creierului](https://www.simplypsychology.org/brain-plasticity.html). Dintr-o perspectivă superficială, putem trage unele asemănări motivaționale între procesul de învățare al creierului uman și conceptele învățării automate. --- ## Creierul uman -[Creierul uman](https://www.livescience.com/29365-human-brain.html) percepe lucruri din lumea reală, procesează informațiile percepute, ia decizii raționale și efectuează anumite acțiuni în funcție de circumstanțe. Acesta este ceea ce numim comportament inteligent. Când programăm o replică a procesului comportamental inteligent într-o mașină, aceasta se numește inteligență artificială (AI). +[Creierul uman](https://www.livescience.com/29365-human-brain.html) percepe lucrurile din lumea reală, procesează informațiile percepute, ia decizii raționale și efectuează anumite acțiuni în funcție de circumstanțe. Acesta este ceea ce numim comportament inteligent. Când programăm o facsimilare a procesului de comportament inteligent pe o mașină, aceasta se numește inteligență artificială (IA). --- -## Un pic de terminologie +## Câteva terminologii -Deși termenii pot fi confundați, învățarea automată (ML) este un subset important al inteligenței artificiale. **ML se ocupă de utilizarea algoritmilor specializați pentru a descoperi informații semnificative și a găsi tipare ascunse din datele percepute pentru a susține procesul de luare a deciziilor raționale**. +Deși termenii pot fi confuzi, învățarea automată (ML) este un subset important al inteligenței artificiale. **ML se ocupă cu utilizarea algoritmilor specializați pentru a descoperi informații semnificative și a găsi modele ascunse din datele percepute pentru a susține procesul de luare a deciziilor raționale**. --- -## AI, ML, Învățare profundă +## AI, ML, Deep Learning -![AI, ML, deep learning, data science](../../../../1-Introduction/1-intro-to-ML/images/ai-ml-ds.png) +![AI, ML, deep learning, data science](../../../../translated_images/ro/ai-ml-ds.537ea441b124ebf6.webp) -> Un diagramă care arată relațiile dintre AI, ML, învățarea profundă și știința datelor. Infografic de [Jen Looper](https://twitter.com/jenlooper) inspirat de [acest grafic](https://softwareengineering.stackexchange.com/questions/366996/distinction-between-ai-ml-neural-networks-deep-learning-and-data-mining) +> O diagramă ce arată relațiile dintre AI, ML, deep learning și știința datelor. Infografic de [Jen Looper](https://twitter.com/jenlooper) inspirat de [această grafică](https://softwareengineering.stackexchange.com/questions/366996/distinction-between-ai-ml-neural-networks-deep-learning-and-data-mining) --- ## Concepte de acoperit -În acest curriculum, vom acoperi doar conceptele de bază ale învățării automate pe care un începător trebuie să le cunoască. Vom aborda ceea ce numim 'învățare automată clasică', utilizând în principal Scikit-learn, o bibliotecă excelentă pe care mulți studenți o folosesc pentru a învăța elementele de bază. Pentru a înțelege conceptele mai largi ale inteligenței artificiale sau ale învățării profunde, o cunoaștere fundamentală solidă a învățării automate este indispensabilă, și dorim să o oferim aici. +În acest curriculum, vom acoperi doar conceptele de bază ale învățării automate pe care un începător trebuie să le cunoască. Vom acoperi ceea ce numim „învățarea automată clasică” folosind în principal Scikit-learn, o bibliotecă excelentă pe care mulți studenți o folosesc pentru a învăța noțiunile de bază. Pentru a înțelege concepte mai largi de inteligență artificială sau deep learning, o cunoaștere fundamentală puternică a învățării automate este indispensabilă, așa că dorim să o oferim aici. --- -## În acest curs vei învăța: +## În acest curs veți învăța: - conceptele de bază ale învățării automate - istoria ML - ML și echitatea - tehnici de regresie ML - tehnici de clasificare ML -- tehnici de grupare ML -- procesarea limbajului natural ML -- tehnici de prognoză a seriilor temporale ML -- învățare prin întărire +- tehnici de clusterizare ML +- tehnici de procesare a limbajului natural ML +- tehnici de predicție a seriilor temporale ML +- învățarea prin întărire - aplicații reale pentru ML --- -## Ce nu vom acoperi +## Ce NU vom acoperi -- învățarea profundă +- deep learning - rețele neuronale - AI -Pentru a oferi o experiență de învățare mai bună, vom evita complexitățile rețelelor neuronale, 'învățarea profundă' - construirea de modele cu multe straturi folosind rețele neuronale - și AI, pe care le vom discuta într-un alt curriculum. De asemenea, vom oferi un curriculum viitor despre știința datelor pentru a ne concentra pe acest aspect al acestui domeniu mai larg. +Pentru o experiență mai bună de învățare, vom evita complexitățile rețelelor neuronale, „deep learning” - modelarea în mai multe straturi folosind rețele neuronale - și AI, pe care le vom discuta într-un alt curriculum. De asemenea, vom oferi un curriculum viitor de știința datelor pentru a ne concentra pe acest aspect al acestui domeniu mai larg. --- ## De ce să studiezi învățarea automată? -Învățarea automată, din perspectiva sistemelor, este definită ca crearea de sisteme automate care pot învăța tipare ascunse din date pentru a ajuta la luarea deciziilor inteligente. +Învățarea automată, din perspectiva sistemelor, este definită ca crearea de sisteme automate care pot învăța modele ascunse din date pentru a ajuta la luarea deciziilor inteligente. -Această motivație este vag inspirată de modul în care creierul uman învață anumite lucruri pe baza datelor pe care le percepe din lumea exterioară. +Această motivație este inspirată vag de modul în care creierul uman învață anumite lucruri pe baza datelor pe care le percepe din lumea exterioară. -✅ Gândește-te un minut de ce o afacere ar dori să folosească strategii de învățare automată în loc să creeze un motor bazat pe reguli codificate manual. +✅ Gândiți-vă pentru un moment de ce o afacere ar dori să încerce să utilizeze strategii de învățare automată în loc să creeze un motor bazat pe reguli hardcodate. + +--- +## De ce contează calitatea datelor + +Datele de înaltă calitate îmbunătățesc performanța modelului. Datele proaste sau zgomotoase pot duce la predicții inexacte, chiar și folosind algoritmi avansați de învățare automată. --- ## Aplicații ale învățării automate -Aplicațiile învățării automate sunt acum aproape peste tot și sunt la fel de omniprezente ca datele care circulă în societățile noastre, generate de telefoanele noastre inteligente, dispozitivele conectate și alte sisteme. Având în vedere potențialul imens al algoritmilor de învățare automată de ultimă generație, cercetătorii au explorat capacitatea lor de a rezolva probleme multidimensionale și multidisciplinare din viața reală cu rezultate pozitive remarcabile. +Aplicațiile învățării automate sunt acum aproape peste tot și sunt la fel de omniprezente ca datele care circulă prin societățile noastre, generate de telefoanele noastre inteligente, dispozitivele conectate și alte sisteme. Având în vedere potențialul imens al algoritmilor de învățare automată de ultimă generație, cercetătorii și-au explorat capacitatea de a rezolva probleme multidimensionale și multidisciplinare reale cu rezultate foarte pozitive. --- ## Exemple de ML aplicat -**Poți folosi învățarea automată în multe moduri**: +**Puteți folosi învățarea automată în multe moduri**: -- Pentru a prezice probabilitatea unei boli pe baza istoricului medical sau a rapoartelor unui pacient. -- Pentru a utiliza datele meteorologice pentru a prezice evenimente meteorologice. -- Pentru a înțelege sentimentul unui text. -- Pentru a detecta știrile false și a opri răspândirea propagandei. +- Pentru a prezice probabilitatea unei boli din istoricul medical sau rapoartele unui pacient. +- Pentru a folosi date meteorologice pentru a prezice evenimente meteo. +- Pentru a înțelege sentimentele unui text. +- Pentru a detecta știri false pentru a opri răspândirea propagandei. -Finanțe, economie, știința pământului, explorarea spațiului, ingineria biomedicală, știința cognitivă și chiar domenii din științele umaniste au adaptat învățarea automată pentru a rezolva problemele grele de procesare a datelor din domeniul lor. +Finanțe, economie, știința pământului, explorarea spațială, ingineria biomedicală, știința cognitivă și chiar domenii în umanioare au adaptat învățarea automată pentru a rezolva probleme dificile, intensive în procesarea datelor, din domeniile lor. --- ## Concluzie -Învățarea automată automatizează procesul de descoperire a tiparelor prin găsirea de informații semnificative din datele reale sau generate. S-a dovedit a fi extrem de valoroasă în aplicații de afaceri, sănătate și financiare, printre altele. +Învățarea automată automatizează procesul de descoperire a modelelor prin găsirea de informații semnificative din datele reale sau generate. S-a dovedit a fi extrem de valoroasă în afaceri, sănătate și aplicații financiare, printre altele. -În viitorul apropiat, înțelegerea elementelor de bază ale învățării automate va deveni o necesitate pentru oamenii din orice domeniu datorită adoptării sale pe scară largă. +În viitorul apropiat, înțelegerea elementelor de bază ale învățării automate va deveni o necesitate pentru oamenii din orice domeniu, datorită adoptării sale pe scară largă. --- # 🚀 Provocare -Desenează, pe hârtie sau folosind o aplicație online precum [Excalidraw](https://excalidraw.com/), înțelegerea ta despre diferențele dintre AI, ML, învățarea profundă și știința datelor. Adaugă câteva idei despre problemele pe care fiecare dintre aceste tehnici le rezolvă bine. +Desenați, pe hârtie sau folosind o aplicație online precum [Excalidraw](https://excalidraw.com/), înțelegerea dvs. despre diferențele dintre AI, ML, deep learning și știința datelor. Adăugați câteva idei despre problemele pe care fiecare dintre aceste tehnici le rezolvă bine. -# [Chestionar după lecție](https://ff-quizzes.netlify.app/en/ml/) +# [Chestionar post-lectură](https://ff-quizzes.netlify.app/en/ml/) --- -# Recapitulare & Studiu individual +# Recapitulare și Auto-studiu -Pentru a afla mai multe despre cum poți lucra cu algoritmi ML în cloud, urmează acest [Parcurs de învățare](https://docs.microsoft.com/learn/paths/create-no-code-predictive-models-azure-machine-learning/?WT.mc_id=academic-77952-leestott). +Pentru a afla mai multe despre cum puteți lucra cu algoritmi ML în cloud, urmați acest [Learning Path](https://docs.microsoft.com/learn/paths/create-no-code-predictive-models-azure-machine-learning/?WT.mc_id=academic-77952-leestott). -Urmează un [Parcurs de învățare](https://docs.microsoft.com/learn/modules/introduction-to-machine-learning/?WT.mc_id=academic-77952-leestott) despre elementele de bază ale ML. +Parcurgeți un [Learning Path](https://docs.microsoft.com/learn/modules/introduction-to-machine-learning/?WT.mc_id=academic-77952-leestott) despre elementele de bază ale ML. --- -# Temă +# Tema -[Începe să lucrezi](assignment.md) +[Porniți și rulați](assignment.md) --- -**Declinare de responsabilitate**: -Acest document a fost tradus folosind serviciul de traducere AI [Co-op Translator](https://github.com/Azure/co-op-translator). Deși ne străduim să asigurăm acuratețea, vă rugăm să fiți conștienți că traducerile automate pot conține erori sau inexactități. Documentul original în limba sa natală ar trebui considerat sursa autoritară. Pentru informații critice, se recomandă traducerea profesională realizată de un specialist uman. Nu ne asumăm responsabilitatea pentru eventualele neînțelegeri sau interpretări greșite care pot apărea din utilizarea acestei traduceri. \ No newline at end of file + +**Declinare a responsabilității**: +Acest document a fost tradus folosind serviciul de traducere AI [Co-op Translator](https://github.com/Azure/co-op-translator). În timp ce ne străduim pentru acuratețe, vă rugăm să rețineți că traducerile automate pot conține erori sau inexactități. Documentul original în limba sa nativă trebuie considerat sursa autorizată. Pentru informații critice, se recomandă traducerea profesională realizată de un om. Nu ne asumăm responsabilitatea pentru eventualele neînțelegeri sau interpretări greșite care decurg din utilizarea acestei traduceri. + \ No newline at end of file diff --git a/translations/ro/5-Clustering/1-Visualize/README.md b/translations/ro/5-Clustering/1-Visualize/README.md index 02d2947f6..2a9a530b3 100644 --- a/translations/ro/5-Clustering/1-Visualize/README.md +++ b/translations/ro/5-Clustering/1-Visualize/README.md @@ -1,116 +1,115 @@ # Introducere în clustering -Clustering-ul este un tip de [Învățare Nesupervizată](https://wikipedia.org/wiki/Unsupervised_learning) care presupune că un set de date nu este etichetat sau că intrările sale nu sunt asociate cu ieșiri predefinite. Folosește diverse algoritmi pentru a analiza datele neetichetate și a oferi grupări bazate pe tiparele identificate în date. +Clustering este un tip de [Învățare nesupravegheată](https://wikipedia.org/wiki/Unsupervised_learning) care presupune că un set de date este neetichetat sau că intrările sale nu sunt asociate cu ieșiri predefinite. Utilizează diverse algoritmi pentru a parcurge datele neetichetate și a oferi grupări în funcție de tiparele pe care le distinge în date. -[![No One Like You de PSquare](https://img.youtube.com/vi/ty2advRiWJM/0.jpg)](https://youtu.be/ty2advRiWJM "No One Like You de PSquare") +[![No One Like You by PSquare](https://img.youtube.com/vi/ty2advRiWJM/0.jpg)](https://youtu.be/ty2advRiWJM "No One Like You by PSquare") -> 🎥 Click pe imaginea de mai sus pentru un videoclip. În timp ce studiezi învățarea automată cu clustering, bucură-te de câteva piese de Dance Hall nigerian - aceasta este o melodie foarte apreciată din 2014 de PSquare. +> 🎥 Dați clic pe imaginea de mai sus pentru un videoclip. În timp ce studiați învățarea automată cu clustering, bucurați-vă de niște piese de Nigerian Dance Hall - acesta este un cântec foarte apreciat din 2014 de PSquare. -## [Quiz înainte de lecție](https://ff-quizzes.netlify.app/en/ml/) +## [Chestionar pre-lectură](https://ff-quizzes.netlify.app/en/ml/) ### Introducere -[Clustering-ul](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) este foarte util pentru explorarea datelor. Să vedem dacă poate ajuta la descoperirea tendințelor și tiparelor în modul în care publicul nigerian consumă muzică. +[Clustering](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) este foarte util pentru explorarea datelor. Să vedem dacă poate ajuta la descoperirea tendințelor și tiparelor în modul în care publicul nigerian consumă muzică. -✅ Ia un minut să te gândești la utilizările clustering-ului. În viața reală, clustering-ul se întâmplă ori de câte ori ai o grămadă de rufe și trebuie să sortezi hainele membrilor familiei 🧦👕👖🩲. În știința datelor, clustering-ul se întâmplă atunci când încerci să analizezi preferințele unui utilizator sau să determini caracteristicile unui set de date neetichetat. Clustering-ul, într-un fel, ajută la a face ordine în haos, ca un sertar de șosete. +✅ Luați un minut să vă gândiți la utilizările clusteringului. În viața reală, clusteringul se întâmplă ori de câte ori aveți un maldăr de rufe și trebuie să sortați hainele membrilor familiei 🧦👕👖🩲. În știința datelor, clusteringul apare când încercați să analizați preferințele unui utilizator sau să determinați caracteristicile unui set de date neetichetat. Clusteringul, într-un fel, ajută la înțelegerea haosului, ca un sertar cu șosete. -[![Introducere în ML](https://img.youtube.com/vi/esmzYhuFnds/0.jpg)](https://youtu.be/esmzYhuFnds "Introducere în Clustering") +[![Introducere în ML](https://img.youtube.com/vi/esmzYhuFnds/0.jpg)](https://youtu.be/esmzYhuFnds "Introducere în clustering") -> 🎥 Click pe imaginea de mai sus pentru un videoclip: John Guttag de la MIT introduce clustering-ul. +> 🎥 Dați clic pe imaginea de mai sus pentru un videoclip: John Guttag de la MIT introduce clusteringul -Într-un mediu profesional, clustering-ul poate fi utilizat pentru a determina lucruri precum segmentarea pieței, identificarea grupelor de vârstă care cumpără anumite produse, de exemplu. O altă utilizare ar fi detectarea anomaliilor, poate pentru a identifica fraude într-un set de date cu tranzacții de carduri de credit. Sau ai putea folosi clustering-ul pentru a identifica tumori într-un lot de scanări medicale. +Într-un mediu profesional, clusteringul poate fi folosit pentru a determina lucruri precum segmentarea pieței, identificând ce grupuri de vârstă cumpără ce articole, de exemplu. O altă utilizare ar fi detectarea anomaliilor, poate pentru detectarea fraudelor dintr-un set de date cu tranzacții cu carduri de credit. Sau ați putea folosi clusteringul pentru a identifica tumori într-un lot de scanări medicale. -✅ Gândește-te un minut la cum ai putea întâlni clustering-ul 'în sălbăticie', într-un mediu bancar, de e-commerce sau de afaceri. +✅ Gândiți-vă un minut cum ați putea să fi întâlnit clustering 'în libertate', într-un mediu bancar, de comerț electronic sau de afaceri. -> 🎓 Interesant, analiza clusterelor a apărut în domeniile Antropologiei și Psihologiei în anii 1930. Îți poți imagina cum ar fi fost utilizată? +> 🎓 Interesant, analiza clusterelor a apărut în domeniile Antropologiei și Psihologiei în anii 1930. Vă puteți imagina cum ar fi fost folosită? -Alternativ, ai putea să-l folosești pentru gruparea rezultatelor căutării - de exemplu, după linkuri de cumpărături, imagini sau recenzii. Clustering-ul este util atunci când ai un set de date mare pe care vrei să-l reduci și pe care vrei să efectuezi o analiză mai detaliată, astfel încât tehnica poate fi utilizată pentru a învăța despre date înainte de a construi alte modele. +Alternativ, ați putea să îl folosiți pentru gruparea rezultatelor căutării - după linkuri de cumpărături, imagini sau recenzii, de exemplu. Clusteringul este util când aveți un set de date mare pe care doriți să-l reduceți și pe care doriți să faceți o analiză mai granulară, astfel încât tehnica poate fi folosită pentru a învăța despre date înainte ca alte modele să fie construite. -✅ Odată ce datele tale sunt organizate în clustere, le atribui un Id de cluster, iar această tehnică poate fi utilă pentru a păstra confidențialitatea unui set de date; poți să te referi la un punct de date prin Id-ul său de cluster, mai degrabă decât prin date identificabile mai revelatoare. Poți să te gândești la alte motive pentru care ai prefera să te referi la un Id de cluster în loc de alte elemente ale clusterului pentru a-l identifica? +✅ Odată ce datele dvs. sunt organizate în clustere, le atribuiți un ID de cluster, iar această tehnică poate fi utilă pentru păstrarea confidențialității unui set de date; puteți să vă referiți la un punct de date prin ID-ul clusterului, în loc de date identificabile mai revelatoare. Puteți să vă gândiți la alte motive pentru care ați folosi ID-ul unui cluster în loc de alte elemente ale clusterului pentru a-l identifica? -Aprofundează-ți înțelegerea tehnicilor de clustering în acest [modul de învățare](https://docs.microsoft.com/learn/modules/train-evaluate-cluster-models?WT.mc_id=academic-77952-leestott). +Adânciți-vă înțelegerea tehnicilor de clustering în acest [modul Learn](https://docs.microsoft.com/learn/modules/train-evaluate-cluster-models?WT.mc_id=academic-77952-leestott) +## Primii pași în clustering -## Începerea cu clustering - -[Scikit-learn oferă o gamă largă](https://scikit-learn.org/stable/modules/clustering.html) de metode pentru a efectua clustering. Tipul pe care îl alegi va depinde de cazul tău de utilizare. Conform documentației, fiecare metodă are diverse beneficii. Iată un tabel simplificat al metodelor suportate de Scikit-learn și cazurile lor de utilizare adecvate: +[Scikit-learn oferă o gamă largă](https://scikit-learn.org/stable/modules/clustering.html) de metode pentru a efectua clustering. Tipul pe care îl alegeți va depinde de cazul dvs. de utilizare. Conform documentației, fiecare metodă are diferite avantaje. Iată un tabel simplificat al metodelor acceptate de Scikit-learn și cazurile lor de utilizare adecvate: | Numele metodei | Caz de utilizare | -| :--------------------------- | :------------------------------------------------------------------- | -| K-Means | scop general, inductiv | -| Propagarea afinității | multe, clustere inegale, inductiv | -| Mean-shift | multe, clustere inegale, inductiv | -| Clustering spectral | puține, clustere egale, transductiv | -| Clustering ierarhic Ward | multe, clustere constrânse, transductiv | -| Clustering aglomerativ | multe, constrânse, distanțe non-euclidiene, transductiv | +| :--------------------------- | :------------------------------------------------------------------ | +| K-Means | scop general, inductiv | +| Propagarea afinității | multe clustere inegale, inductiv | +| Mean-shift | multe clustere inegale, inductiv | +| Clustering spectral | puține clustere egale, transductiv | +| Clustering ierarhic Ward | multe clustere constrânse, transductiv | +| Clustering aglomerativ | multe, constrâns, distanțe non euclidiene, transductiv | | DBSCAN | geometrie non-plană, clustere inegale, transductiv | | OPTICS | geometrie non-plană, clustere inegale cu densitate variabilă, transductiv | -| Amestecuri Gaussiene | geometrie plană, inductiv | -| BIRCH | set de date mare cu outlieri, inductiv | +| Amestecuri gaussiane | geometrie plană, inductiv | +| BIRCH | set de date mare cu outlieri, inductiv | -> 🎓 Modul în care creăm clustere are mult de-a face cu modul în care grupăm punctele de date în grupuri. Să descompunem câteva vocabular: +> 🎓 Modul în care creăm clustere are mult de-a face cu modul în care grupăm punctele de date. Să dezvoltăm puțin vocabularul: > > 🎓 ['Transductiv' vs. 'inductiv'](https://wikipedia.org/wiki/Transduction_(machine_learning)) > -> Inferența transductivă este derivată din cazuri de antrenament observate care se mapează la cazuri de testare specifice. Inferența inductivă este derivată din cazuri de antrenament care se mapează la reguli generale care sunt aplicate ulterior cazurilor de testare. +> Inferența transductivă este derivată din cazuri de antrenament observate care se mapează pe cazuri de test specifice. Inferența inductivă este derivată din cazuri de antrenament care se mapează pe reguli generale care apoi sunt aplicate cazurilor de test. > -> Un exemplu: Imaginează-ți că ai un set de date care este doar parțial etichetat. Unele lucruri sunt 'discuri', altele 'cd-uri', iar unele sunt goale. Sarcina ta este să oferi etichete pentru cele goale. Dacă alegi o abordare inductivă, ai antrena un model căutând 'discuri' și 'cd-uri' și ai aplica acele etichete datelor neetichetate. Această abordare va avea dificultăți în clasificarea lucrurilor care sunt de fapt 'casete'. O abordare transductivă, pe de altă parte, gestionează aceste date necunoscute mai eficient, deoarece lucrează pentru a grupa elemente similare împreună și apoi aplică o etichetă unui grup. În acest caz, clusterele ar putea reflecta 'lucruri muzicale rotunde' și 'lucruri muzicale pătrate'. +> Un exemplu: Imaginați-vă că aveți un set de date parțial etichetat. Unele lucruri sunt 'discuri', altele 'cd-uri', iar unele sunt necompletate. Sarcina dvs. este să atribuiți etichete celor necompletate. Dacă alegeți o abordare inductivă, ați antrena un model să caute 'discuri' și 'cd-uri' și să aplice aceste etichete datelor neetichetate. Această abordare va avea probleme în clasificarea lucrurilor care sunt de fapt 'casete'. O abordare transductivă, pe de altă parte, gestionează mai eficient aceste date necunoscute, deoarece lucrează să grupeze elementele similare împreună și apoi aplică o etichetă grupului. În acest caz, clusterele ar putea reflecta 'lucruri muzicale rotunde' și 'lucruri muzicale pătrate'. > -> 🎓 ['Geometrie non-plană' vs. 'plană'](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering) +> 🎓 ['Geometrie non-plană vs. plană'](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering) > -> Derivat din terminologia matematică, geometria non-plană vs. plană se referă la măsurarea distanțelor între puncte fie prin metode geometrice 'plane' ([Euclidiene](https://wikipedia.org/wiki/Euclidean_geometry)), fie 'non-plane' (non-Euclidiene). +> Derivată din terminologia matematică, geometria non-plană vs. plană se referă la măsurarea distanțelor dintre puncte prin metode geometrice 'plane' ([Euclidiană](https://wikipedia.org/wiki/Euclidean_geometry)) sau 'non-plane' (non-Euclidiană). > ->'Plană' în acest context se referă la geometria Euclidiană (părți din care sunt predate ca geometrie 'plană'), iar non-plană se referă la geometria non-Euclidiană. Ce legătură are geometria cu învățarea automată? Ei bine, ca două domenii care sunt bazate pe matematică, trebuie să existe o modalitate comună de a măsura distanțele între puncte în clustere, iar aceasta poate fi făcută într-un mod 'plan' sau 'non-plan', în funcție de natura datelor. [Distanțele Euclidiene](https://wikipedia.org/wiki/Euclidean_distance) sunt măsurate ca lungimea unui segment de linie între două puncte. [Distanțele non-Euclidiene](https://wikipedia.org/wiki/Non-Euclidean_geometry) sunt măsurate de-a lungul unei curbe. Dacă datele tale, vizualizate, par să nu existe pe un plan, s-ar putea să fie nevoie să folosești un algoritm specializat pentru a le gestiona. +> 'Plană' în acest context se referă la geometria euclidiană (părți din care se predau ca geometrie 'plană'), iar non-plană se referă la geometria non-euclidiană. Ce legătură are geometria cu învățarea automată? Ei bine, ca două domenii care au rădăcini în matematică, trebuie să existe o metodă comună de a măsura distanțele dintre punctele din clustere, iar aceasta se poate face într-un mod 'plan' sau 'non-plan', în funcție de natura datelor. [Distanțele euclidiene](https://wikipedia.org/wiki/Euclidean_distance) sunt măsurate ca lungimea unui segment de linie între două puncte. [Distanțele non-euclidiene](https://wikipedia.org/wiki/Non-Euclidean_geometry) sunt măsurate de-a lungul unei curbe. Dacă datele dvs., vizualizate, par să nu existe pe un plan, este posibil să aveți nevoie să folosiți un algoritm specializat pentru a le gestiona. > -![Infografic Geometrie Plană vs Non-plană](../../../../5-Clustering/1-Visualize/images/flat-nonflat.png) +![Flat vs Nonflat Geometry Infographic](../../../../translated_images/ro/flat-nonflat.d1c8c6e2a96110c1.webp) > Infografic de [Dasani Madipalli](https://twitter.com/dasani_decoded) > > 🎓 ['Distanțe'](https://web.stanford.edu/class/cs345a/slides/12-clustering.pdf) > -> Clusterele sunt definite de matricea lor de distanțe, de exemplu, distanțele între puncte. Această distanță poate fi măsurată în câteva moduri. Clusterele Euclidiene sunt definite de media valorilor punctelor și conțin un 'centroid' sau punct central. Distanțele sunt astfel măsurate prin distanța față de acel centroid. Distanțele non-Euclidiene se referă la 'clustroizi', punctul cel mai apropiat de alte puncte. Clustroizii, la rândul lor, pot fi definiți în diverse moduri. +> Clusterele sunt definite prin matricea lor de distanțe, de exemplu distanțele dintre puncte. Această distanță poate fi măsurată în câteva moduri. Clusterele euclidiene sunt definite prin media valorilor punctelor și conțin un 'centroid' sau punct central. Distanțele sunt astfel măsurate față de acel centroid. Distanțele non-euclidiene se referă la 'clustroizi', punctele cele mai apropiate de alte puncte. Clustroizii, la rândul lor, pot fi definiți în diferite moduri. > > 🎓 ['Constrâns'](https://wikipedia.org/wiki/Constrained_clustering) > -> [Clustering-ul Constrâns](https://web.cs.ucdavis.edu/~davidson/Publications/ICDMTutorial.pdf) introduce 'învățarea semi-supervizată' în această metodă nesupervizată. Relațiile dintre puncte sunt marcate ca 'nu se pot lega' sau 'trebuie să se lege', astfel încât unele reguli sunt impuse setului de date. +> [Clusteringul constrâns](https://web.cs.ucdavis.edu/~davidson/Publications/ICDMTutorial.pdf) introduce învățarea 'semi-supervizată' în această metodă nesupravegheată. Relațiile dintre puncte sunt marcate ca 'nu se pot lega' sau 'trebuie legate', astfel că anumite reguli sunt impuse setului de date. > ->Un exemplu: Dacă un algoritm este lăsat liber pe un lot de date neetichetate sau semi-etichetate, clusterele pe care le produce pot fi de calitate slabă. În exemplul de mai sus, clusterele ar putea grupa 'lucruri muzicale rotunde', 'lucruri muzicale pătrate', 'lucruri triunghiulare' și 'fursecuri'. Dacă i se oferă câteva constrângeri sau reguli de urmat ("elementul trebuie să fie din plastic", "elementul trebuie să poată produce muzică"), acest lucru poate ajuta la 'constrângerea' algoritmului să facă alegeri mai bune. +> Un exemplu: Dacă un algoritm este lăsat liber pe un set de date neetichetat sau semi-etichetat, clusterele pe care le produce pot fi de calitate scăzută. În exemplul de mai sus, clusterele ar putea grupa 'lucruri muzicale rotunde' și 'lucruri muzicale pătrate' și 'lucruri triunghiulare' și 'biscuiți'. Dacă i se dau niște constrângeri sau reguli de urmat ("obiectul trebuie să fie făcut din plastic", "obiectul trebuie să poată produce muzică") acestea pot ajuta algoritmul să ia decizii mai bune. > > 🎓 'Densitate' > -> Datele care sunt 'zgomotoase' sunt considerate a fi 'dense'. Distanțele între punctele din fiecare cluster pot fi, la examinare, mai mult sau mai puțin dense sau 'aglomerate', și astfel aceste date trebuie analizate cu metoda de clustering adecvată. [Acest articol](https://www.kdnuggets.com/2020/02/understanding-density-based-clustering.html) demonstrează diferența dintre utilizarea clustering-ului K-Means vs. algoritmii HDBSCAN pentru a explora un set de date zgomotos cu densitate inegală a clusterelor. +> Datele considerate 'zgomotoase' sunt considerate 'dense'. Distanțele dintre punctele din fiecare cluster, după examinare, pot fi mai mult sau mai puțin dense sau 'aglomerate', iar aceste date trebuie analizate cu metoda de clustering potrivită. [Acest articol](https://www.kdnuggets.com/2020/02/understanding-density-based-clustering.html) demonstrează diferența dintre utilizarea clusteringului K-Means vs. HDBSCAN pentru explorarea unui set de date zgomotos cu densitate neuniformă a clusterului. ## Algoritmi de clustering -Există peste 100 de algoritmi de clustering, iar utilizarea lor depinde de natura datelor disponibile. Să discutăm despre câțiva dintre cei mai importanți: +Există peste 100 de algoritmi de clustering, iar utilizarea lor depinde de natura datelor la îndemână. Să discutăm unii dintre cei mai importanți: -- **Clustering ierarhic**. Dacă un obiect este clasificat prin proximitatea sa față de un obiect apropiat, mai degrabă decât față de unul mai îndepărtat, clusterele sunt formate pe baza distanței membrilor față de și de la alte obiecte. Clustering-ul aglomerativ din Scikit-learn este ierarhic. +- **Clustering ierarhic**. Dacă un obiect este clasificat după proximitatea sa față de un obiect apropiat, în loc de unul mai îndepărtat, clusterele sunt formate pe baza distanței membrilor lor către și de la alte obiecte. Clusteringul aglomerativ din Scikit-learn este ierarhic. - ![Infografic Clustering Ierarhic](../../../../5-Clustering/1-Visualize/images/hierarchical.png) + ![Hierarchical clustering Infographic](../../../../translated_images/ro/hierarchical.bf59403aa43c8c47.webp) > Infografic de [Dasani Madipalli](https://twitter.com/dasani_decoded) -- **Clustering pe bază de centroid**. Acest algoritm popular necesită alegerea 'k', sau numărul de clustere de format, după care algoritmul determină punctul central al unui cluster și adună date în jurul acelui punct. [Clustering-ul K-means](https://wikipedia.org/wiki/K-means_clustering) este o versiune populară a clustering-ului pe bază de centroid. Centrul este determinat de media cea mai apropiată, de aici și numele. Distanța pătrată față de cluster este minimizată. +- **Clustering centroid**. Acest algoritm popular necesită alegerea lui 'k', sau numărul de clustere de format, după care algoritmul determină punctul central al unui cluster și grupează datele în jurul acelui punct. [Clusteringul K-means](https://wikipedia.org/wiki/K-means_clustering) este o versiune populară a clusteringului centroid. Centrul este determinat de media cea mai apropiată, de unde și numele. Distanța pătratică față de cluster este minimizată. - ![Infografic Clustering pe bază de Centroid](../../../../5-Clustering/1-Visualize/images/centroid.png) + ![Centroid clustering Infographic](../../../../translated_images/ro/centroid.097fde836cf6c918.webp) > Infografic de [Dasani Madipalli](https://twitter.com/dasani_decoded) -- **Clustering bazat pe distribuție**. Bazat pe modelarea statistică, clustering-ul bazat pe distribuție se concentrează pe determinarea probabilității ca un punct de date să aparțină unui cluster și îl atribuie corespunzător. Metodele de amestecuri Gaussiene aparțin acestui tip. +- **Clustering bazat pe distribuție**. Bazat pe modelarea statistică, clusteringul bazat pe distribuție se concentrează pe determinarea probabilității ca un punct de date să aparțină unui cluster și pe atribuirea sa corespunzătoare. Metodele cu amestec gaussian fac parte din acest tip. -- **Clustering bazat pe densitate**. Punctele de date sunt atribuite clusterelor pe baza densității lor sau a grupării lor în jurul altor puncte. Punctele de date aflate departe de grup sunt considerate outlieri sau zgomot. DBSCAN, Mean-shift și OPTICS aparțin acestui tip de clustering. +- **Clustering bazat pe densitate**. Punctele de date sunt atribuite clusterelor în funcție de densitatea lor sau de gruparea în jurul unul altuia. Punctele de date departe de grup sunt considerate outlieri sau zgomot. DBSCAN, Mean-shift și OPTICS fac parte din acest tip de clustering. -- **Clustering bazat pe grilă**. Pentru seturi de date multidimensionale, se creează o grilă, iar datele sunt împărțite între celulele grilei, creând astfel clustere. +- **Clustering pe bază de grilă**. Pentru seturi de date multidimensionale, se creează o grilă iar datele sunt împărțite între celulele grilei, creând astfel clustere. -## Exercițiu - grupează datele tale +## Exercițiu - clustrează-ți datele -Clustering-ul ca tehnică este foarte ajutat de o vizualizare adecvată, așa că să începem prin a vizualiza datele noastre muzicale. Acest exercițiu ne va ajuta să decidem care dintre metodele de clustering ar trebui să folosim cel mai eficient pentru natura acestor date. +Clusteringul ca tehnică este foarte ajutat de o vizualizare corectă, așa că să începem prin a vizualiza datele noastre muzicale. Acest exercițiu ne va ajuta să decidem care dintre metodele de clustering ar trebui să folosim cel mai eficient pentru natura acestor date. -1. Deschide fișierul [_notebook.ipynb_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/1-Visualize/notebook.ipynb) din acest folder. +1. Deschideți fișierul [_notebook.ipynb_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/1-Visualize/notebook.ipynb) din acest folder. -1. Importă pachetul `Seaborn` pentru o vizualizare bună a datelor. +1. Importați pachetul `Seaborn` pentru o vizualizare bună a datelor. ```python !pip install seaborn ``` -1. Adaugă datele despre melodii din [_nigerian-songs.csv_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/data/nigerian-songs.csv). Încarcă un dataframe cu câteva date despre melodii. Pregătește-te să explorezi aceste date importând bibliotecile și afișând datele: +1. Adăugați datele melodiilor din [_nigerian-songs.csv_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/data/nigerian-songs.csv). Încărcați un dataframe cu câteva date despre melodii. Pregătiți-vă să explorați aceste date importând bibliotecile și afișând datele: ```python import matplotlib.pyplot as plt @@ -120,23 +119,23 @@ Clustering-ul ca tehnică este foarte ajutat de o vizualizare adecvată, așa c df.head() ``` - Verifică primele câteva linii de date: + Verificați primele câteva linii de date: | | name | album | artist | artist_top_genre | release_date | length | popularity | danceability | acousticness | energy | instrumentalness | liveness | loudness | speechiness | tempo | time_signature | | --- | ------------------------ | ---------------------------- | ------------------- | ---------------- | ------------ | ------ | ---------- | ------------ | ------------ | ------ | ---------------- | -------- | -------- | ----------- | ------- | -------------- | | 0 | Sparky | Mandy & The Jungle | Cruel Santino | alternative r&b | 2019 | 144000 | 48 | 0.666 | 0.851 | 0.42 | 0.534 | 0.11 | -6.699 | 0.0829 | 133.015 | 5 | | 1 | shuga rush | EVERYTHING YOU HEARD IS TRUE | Odunsi (The Engine) | afropop | 2020 | 89488 | 30 | 0.71 | 0.0822 | 0.683 | 0.000169 | 0.101 | -5.64 | 0.36 | 129.993 | 3 | -| 2 | LITT! | LITT! | AYLØ | indie r&b | 2018 | 207758 | 40 | 0.836 | 0.272 | 0.564 | 0.000537 | 0.11 | -7.127 | 0.0424 | 130.005 | 4 | -| 3 | Confident / Feeling Cool | Enjoy Your Life | Lady Donli | nigerian pop | 2019 | 175135 | 14 | 0.894 | 0.798 | 0.611 | 0.000187 | 0.0964 | -4.961 | 0.113 | 111.087 | 4 | -| 4 | wanted you | rare. | Odunsi (The Engine) | afropop | 2018 | 152049 | 25 | 0.702 | 0.116 | 0.833 | 0.91 | 0.348 | -6.044 | 0.0447 | 105.115 | 4 | + | 2 | LITT! | LITT! | AYLØ | indie r&b | 2018 | 207758 | 40 | 0.836 | 0.272 | 0.564 | 0.000537 | 0.11 | -7.127 | 0.0424 | 130.005 | 4 | + | 3 | Confident / Feeling Cool | Enjoy Your Life | Lady Donli | nigerian pop | 2019 | 175135 | 14 | 0.894 | 0.798 | 0.611 | 0.000187 | 0.0964 | -4.961 | 0.113 | 111.087 | 4 | + | 4 | wanted you | rare. | Odunsi (The Engine) | afropop | 2018 | 152049 | 25 | 0.702 | 0.116 | 0.833 | 0.91 | 0.348 | -6.044 | 0.0447 | 105.115 | 4 | -1. Obține informații despre dataframe, apelând `info()`: +1. Obțineți câteva informații despre dataframe, apelând `info()`: ```python df.info() ``` - Rezultatul arată astfel: + Ieșirea arată astfel: ```output @@ -164,13 +163,13 @@ Clustering-ul ca tehnică este foarte ajutat de o vizualizare adecvată, așa c memory usage: 66.4+ KB ``` -1. Verifică din nou valorile nule, apelând `isnull()` și verificând că suma este 0: +1. Verificați din nou pentru valori nule, apelând `isnull()` și verificând dacă suma este 0: ```python df.isnull().sum() ``` - Totul arată bine: + Arată bine: ```output name 0 @@ -192,7 +191,7 @@ Clustering-ul ca tehnică este foarte ajutat de o vizualizare adecvată, așa c dtype: int64 ``` -1. Descrie datele: +1. Descrieți datele: ```python df.describe() @@ -209,11 +208,11 @@ Clustering-ul ca tehnică este foarte ajutat de o vizualizare adecvată, așa c | 75% | 2017 | 242098.5 | 31 | 0.8295 | 0.403 | 0.87575 | 0.000234 | 0.164 | -3.331 | 0.177 | 125.03925 | 4 | | max | 2020 | 511738 | 73 | 0.966 | 0.954 | 0.995 | 0.91 | 0.811 | 0.582 | 0.514 | 206.007 | 5 | -> 🤔 Dacă lucrăm cu clustering, o metodă nesupravegheată care nu necesită date etichetate, de ce arătăm aceste date cu etichete? În faza de explorare a datelor, acestea sunt utile, dar nu sunt necesare pentru ca algoritmii de clustering să funcționeze. Ai putea la fel de bine să elimini anteturile coloanelor și să te referi la date prin numărul coloanei. +> 🤔 Dacă lucrăm cu clustering, o metodă nesupravegheată care nu necesită date etichetate, de ce afișăm aceste date cu etichete? În faza de explorare a datelor, acestea sunt utile, dar nu sunt necesare pentru funcționarea algoritmilor de clustering. Ați putea foarte bine să eliminați anteturile coloanelor și să vă referiți la date după numărul coloanei. -Privește valorile generale ale datelor. Observă că popularitatea poate fi '0', ceea ce indică melodii care nu au un clasament. Să eliminăm aceste valori în curând. +Uitați-vă la valorile generale ale datelor. Rețineți că popularitatea poate fi '0', ceea ce arată cântece care nu au nicio clasare. Să le eliminăm în curând. -1. Folosește un barplot pentru a afla cele mai populare genuri: +1. Folosiți un barplot pentru a afla care sunt cele mai populare genuri: ```python import seaborn as sns @@ -225,13 +224,13 @@ Privește valorile generale ale datelor. Observă că popularitatea poate fi '0' plt.title('Top genres',color = 'blue') ``` - ![most popular](../../../../5-Clustering/1-Visualize/images/popular.png) + ![most popular](../../../../translated_images/ro/popular.9c48d84b3386705f.webp) -✅ Dacă dorești să vezi mai multe valori de top, schimbă topul `[:5]` la o valoare mai mare sau elimină-l pentru a vedea totul. +✅ Dacă doriți să vedeți mai multe valori de top, schimbați `[:5]` la o valoare mai mare sau eliminați-l pentru a vedea tot. -Observă că atunci când genul de top este descris ca 'Missing', înseamnă că Spotify nu l-a clasificat, așa că să scăpăm de acesta. +Notă, când genul de top este descris ca „Missing”, asta înseamnă că Spotify nu l-a clasificat, deci să scăpăm de el. -1. Elimină datele lipsă prin filtrarea lor +1. Scăpați de datele lipsă filtrându-le ```python df = df[df['artist_top_genre'] != 'Missing'] @@ -242,11 +241,11 @@ Observă că atunci când genul de top este descris ca 'Missing', înseamnă că plt.title('Top genres',color = 'blue') ``` - Acum verifică din nou genurile: + Acum verificați din nou genurile: - ![most popular](../../../../5-Clustering/1-Visualize/images/all-genres.png) + ![most popular](../../../../translated_images/ro/all-genres.1d56ef06cefbfcd6.webp) -1. Cele trei genuri de top domină acest set de date. Să ne concentrăm pe `afro dancehall`, `afropop` și `nigerian pop`, și să filtrăm suplimentar setul de date pentru a elimina orice valoare de popularitate 0 (ceea ce înseamnă că nu a fost clasificată cu o popularitate în setul de date și poate fi considerată zgomot pentru scopurile noastre): +1. De departe, primele trei genuri domină acest set de date. Să ne concentrăm pe `afro dancehall`, `afropop` și `nigerian pop`, de asemenea filtrăm setul de date pentru a elimina orice are valoarea 0 la popularitate (însemnând că nu a fost clasificat cu o popularitate în setul de date și poate fi considerat zgomot pentru scopurile noastre): ```python df = df[(df['artist_top_genre'] == 'afro dancehall') | (df['artist_top_genre'] == 'afropop') | (df['artist_top_genre'] == 'nigerian pop')] @@ -258,7 +257,7 @@ Observă că atunci când genul de top este descris ca 'Missing', înseamnă că plt.title('Top genres',color = 'blue') ``` -1. Fă un test rapid pentru a vedea dacă datele corelează într-un mod deosebit de puternic: +1. Faceți un test rapid pentru a vedea dacă datele corelează în vreun mod deosebit de puternic: ```python corrmat = df.corr(numeric_only=True) @@ -266,21 +265,21 @@ Observă că atunci când genul de top este descris ca 'Missing', înseamnă că sns.heatmap(corrmat, vmax=.8, square=True) ``` - ![correlations](../../../../5-Clustering/1-Visualize/images/correlation.png) + ![correlations](../../../../translated_images/ro/correlation.a9356bb798f5eea5.webp) Singura corelație puternică este între `energy` și `loudness`, ceea ce nu este prea surprinzător, având în vedere că muzica tare este de obicei destul de energică. În rest, corelațiile sunt relativ slabe. Va fi interesant să vedem ce poate face un algoritm de clustering cu aceste date. - > 🎓 Reține că corelația nu implică cauzalitate! Avem dovada corelației, dar nu și dovada cauzalității. Un [site web amuzant](https://tylervigen.com/spurious-correlations) are câteva vizualizări care subliniază acest punct. + > 🎓 Rețineți că corelația nu implică cauzalitate! Avem dovezi ale corelației, dar nu avem dovezi ale cauzalității. Un [site amuzant](https://tylervigen.com/spurious-correlations) are niște vizualizări care subliniază acest punct. -Există vreo convergență în acest set de date în jurul popularității percepute a unei melodii și a dansabilității? Un FacetGrid arată că există cercuri concentrice care se aliniază, indiferent de gen. Ar putea fi că gusturile nigeriene converg la un anumit nivel de dansabilitate pentru acest gen? +Există vreo convergență în acest set de date în jurul popularității percepute a unui cântec și a dansabilității? Un FacetGrid arată că există cercuri concentrice care se aliniază, indiferent de gen. Ar putea fi ca gusturile nigeriene să convergă la un anumit nivel de dansabilitate pentru acest gen? -✅ Încearcă diferite puncte de date (energy, loudness, speechiness) și mai multe sau diferite genuri muzicale. Ce poți descoperi? Privește tabelul `df.describe()` pentru a vedea răspândirea generală a punctelor de date. +✅ Încercați diferite puncte de date (energie, volum, expresivitate vocală) și mai multe sau alte genuri muzicale. Ce puteți descoperi? Aruncați o privire la tabelul `df.describe()` pentru a vedea răspândirea generală a datelor. ### Exercițiu - distribuția datelor -Aceste trei genuri sunt semnificativ diferite în percepția dansabilității lor, bazată pe popularitate? +Sunt aceste trei genuri semnificativ diferite în percepția dansabilității lor, pe baza popularității? -1. Examinează distribuția datelor pentru genurile noastre de top în ceea ce privește popularitatea și dansabilitatea de-a lungul unei axe x și y date. +1. Examinați distribuția datelor pentru cele trei genuri de top în ceea ce privește popularitatea și dansabilitatea pe axe x și y date. ```python sns.set_theme(style="ticks") @@ -292,15 +291,15 @@ Aceste trei genuri sunt semnificativ diferite în percepția dansabilității lo ) ``` - Poți descoperi cercuri concentrice în jurul unui punct general de convergență, arătând distribuția punctelor. + Puteți descoperi cercuri concentrice în jurul unui punct general de convergență, arătând distribuția punctelor. - > 🎓 Reține că acest exemplu folosește un grafic KDE (Kernel Density Estimate) care reprezintă datele folosind o curbă continuă de densitate a probabilității. Acest lucru ne permite să interpretăm datele atunci când lucrăm cu distribuții multiple. + > 🎓 Rețineți că acest exemplu folosește un grafic KDE (Kernel Density Estimate) care reprezintă datele folosind o curbă de densitate de probabilitate continuă. Aceasta ne permite să interpretăm datele când lucrăm cu distribuții multiple. În general, cele trei genuri se aliniază vag în ceea ce privește popularitatea și dansabilitatea. Determinarea clusterelor în aceste date vag aliniate va fi o provocare: - ![distribution](../../../../5-Clustering/1-Visualize/images/distribution.png) + ![distribution](../../../../translated_images/ro/distribution.9be11df42356ca95.webp) -1. Creează un scatter plot: +1. Creați un grafic scatter: ```python sns.FacetGrid(df, hue="artist_top_genre", height=5) \ @@ -308,31 +307,33 @@ Aceste trei genuri sunt semnificativ diferite în percepția dansabilității lo .add_legend() ``` - Un scatterplot pe aceleași axe arată un model similar de convergență + Un grafic scatter pe aceleași axe arată un model similar de convergență - ![Facetgrid](../../../../5-Clustering/1-Visualize/images/facetgrid.png) + ![Facetgrid](../../../../translated_images/ro/facetgrid.9b2e65ce707eba1f.webp) -În general, pentru clustering, poți folosi scatterplots pentru a arăta clusterele de date, așa că stăpânirea acestui tip de vizualizare este foarte utilă. În lecția următoare, vom lua aceste date filtrate și vom folosi clustering-ul k-means pentru a descoperi grupuri în aceste date care par să se suprapună în moduri interesante. +În general, pentru clustering, puteți folosi grafice scatter pentru a arăta clustere de date, așa că stăpânirea acestui tip de vizualizare este foarte utilă. În lecția următoare, vom lua aceste date filtrate și vom folosi clustering k-means pentru a descoperi grupuri în aceste date care par să se suprapună în mod interesant. --- ## 🚀Provocare -În pregătirea pentru lecția următoare, creează un grafic despre diferitele algoritmi de clustering pe care i-ai putea descoperi și folosi într-un mediu de producție. Ce tipuri de probleme încearcă să abordeze clustering-ul? +Ca pregătire pentru următoarea lecție, faceți un grafic despre diferiții algoritmi de clustering pe care îi puteți descoperi și folosi într-un mediu de producție. Ce tipuri de probleme încearcă să rezolve clusteringul? -## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ml/) +## [Chestionar post-lectură](https://ff-quizzes.netlify.app/en/ml/) -## Recapitulare & Studiu Individual +## Recenzie & Studiu individual -Înainte de a aplica algoritmi de clustering, așa cum am învățat, este o idee bună să înțelegi natura setului tău de date. Citește mai multe despre acest subiect [aici](https://www.kdnuggets.com/2019/10/right-clustering-algorithm.html) +Înainte de a aplica algoritmi de clustering, așa cum am învățat, este o idee bună să înțelegeți natura setului dvs. de date. Citiți mai multe pe această temă [aici](https://www.kdnuggets.com/2019/10/right-clustering-algorithm.html) -[Acest articol util](https://www.freecodecamp.org/news/8-clustering-algorithms-in-machine-learning-that-all-data-scientists-should-know/) te ghidează prin diferitele moduri în care algoritmii de clustering se comportă, având în vedere diferite forme de date. +[Acest articol util](https://www.freecodecamp.org/news/8-clustering-algorithms-in-machine-learning-that-all-data-scientists-should-know/) vă ghidează prin diferitele comportamente ale algoritmilor de clustering, în funcție de formele diferite ale datelor. -## Temă +## Tema pentru acasă -[Cercetează alte vizualizări pentru clustering](assignment.md) +[Cercetați alte vizualizări pentru clustering](assignment.md) --- -**Declinare de responsabilitate**: -Acest document a fost tradus folosind serviciul de traducere AI [Co-op Translator](https://github.com/Azure/co-op-translator). Deși ne străduim să asigurăm acuratețea, vă rugăm să rețineți că traducerile automate pot conține erori sau inexactități. Documentul original în limba sa natală ar trebui considerat sursa autoritară. Pentru informații critice, se recomandă traducerea profesională realizată de un specialist uman. Nu ne asumăm responsabilitatea pentru eventualele neînțelegeri sau interpretări greșite care pot apărea din utilizarea acestei traduceri. \ No newline at end of file + +**Declinare a responsabilității**: +Acest document a fost tradus folosind serviciul de traducere AI [Co-op Translator](https://github.com/Azure/co-op-translator). În timp ce ne străduim pentru acuratețe, vă rugăm să rețineți că traducerile automate pot conține erori sau inexactități. Documentul original în limba sa nativă trebuie considerat sursa autorizată. Pentru informații critice, se recomandă traducerea profesională realizată de un om. Nu ne asumăm responsabilitatea pentru eventualele neînțelegeri sau interpretări greșite care decurg din utilizarea acestei traduceri. + \ No newline at end of file diff --git a/translations/sk/.co-op-translator.json b/translations/sk/.co-op-translator.json index 29ae54a5c..a03cf366b 100644 --- a/translations/sk/.co-op-translator.json +++ b/translations/sk/.co-op-translator.json @@ -1,7 +1,7 @@ { "1-Introduction/1-intro-to-ML/README.md": { - "original_hash": "69389392fa6346e0dfa30f664b7b6fec", - "translation_date": "2025-09-05T16:07:12+00:00", + "original_hash": "3a6394c6f5ce3f8aee8211e92eaf9ef0", + "translation_date": "2026-05-26T22:53:52+00:00", "source_file": "1-Introduction/1-intro-to-ML/README.md", "language_code": "sk" }, @@ -240,8 +240,8 @@ "language_code": "sk" }, "5-Clustering/1-Visualize/README.md": { - "original_hash": "730225ea274c9174fe688b21d421539d", - "translation_date": "2025-09-05T15:42:19+00:00", + "original_hash": "08b00d9fbffc667a7fe7fc19ac00dfbd", + "translation_date": "2026-05-26T22:53:29+00:00", "source_file": "5-Clustering/1-Visualize/README.md", "language_code": "sk" }, diff --git a/translations/sk/1-Introduction/1-intro-to-ML/README.md b/translations/sk/1-Introduction/1-intro-to-ML/README.md index f71c34431..0eb4b9239 100644 --- a/translations/sk/1-Introduction/1-intro-to-ML/README.md +++ b/translations/sk/1-Introduction/1-intro-to-ML/README.md @@ -1,14 +1,14 @@ # Úvod do strojového učenia -## [Kvíz pred prednáškou](https://ff-quizzes.netlify.app/en/ml/) +## [Prednáškový kvíz](https://ff-quizzes.netlify.app/en/ml/) --- [![ML pre začiatočníkov - Úvod do strojového učenia pre začiatočníkov](https://img.youtube.com/vi/6mSx_KJxcHI/0.jpg)](https://youtu.be/6mSx_KJxcHI "ML pre začiatočníkov - Úvod do strojového učenia pre začiatočníkov") -> 🎥 Kliknite na obrázok vyššie pre krátke video k tejto lekcii. +> 🎥 Kliknite na obrázok vyššie pre krátke video, ktoré prechádza touto lekciou. -Vitajte v tomto kurze klasického strojového učenia pre začiatočníkov! Či už ste v tejto téme úplne noví, alebo skúsený odborník na strojové učenie, ktorý si chce zopakovať určité oblasti, sme radi, že ste sa k nám pridali! Chceme vytvoriť priateľské miesto na začiatok vášho štúdia strojového učenia a radi by sme vyhodnotili, reagovali na vaše [spätné väzby](https://github.com/microsoft/ML-For-Beginners/discussions) a začlenili ich. +Vitajte v tomto kurze klasického strojového učenia pre začiatočníkov! Či už ste úplne noví v tejto oblasti, alebo skúsený odborník na ML, ktorý chce zdokonaliť svoje znalosti, radi vás tu máme! Chceme vytvoriť priateľské štartovacie miesto pre vaše štúdium ML a budeme radi, keď nám poskytnete, zareagujeme na a začleníme vaše [spätné väzby](https://github.com/microsoft/ML-For-Beginners/discussions). [![Úvod do ML](https://img.youtube.com/vi/h0e2HAPTGF4/0.jpg)](https://youtu.be/h0e2HAPTGF4 "Úvod do ML") @@ -17,57 +17,57 @@ Vitajte v tomto kurze klasického strojového učenia pre začiatočníkov! Či --- ## Začíname so strojovým učením -Predtým, než začnete s týmto učebným plánom, je potrebné pripraviť váš počítač na spúšťanie notebookov lokálne. +Pred začatím tohto učebného plánu je potrebné mať počítač nastavený a pripravený na spúšťanie notebookov lokálne. -- **Nakonfigurujte svoj počítač pomocou týchto videí**. Použite nasledujúce odkazy na [inštaláciu Pythonu](https://youtu.be/CXZYvNRIAKM) vo vašom systéme a [nastavenie textového editora](https://youtu.be/EU8eayHWoZg) pre vývoj. -- **Naučte sa Python**. Odporúča sa mať základné znalosti [Pythonu](https://docs.microsoft.com/learn/paths/python-language/?WT.mc_id=academic-77952-leestott), programovacieho jazyka užitočného pre dátových vedcov, ktorý používame v tomto kurze. -- **Naučte sa Node.js a JavaScript**. JavaScript používame niekoľkokrát v tomto kurze pri tvorbe webových aplikácií, takže budete potrebovať [node](https://nodejs.org) a [npm](https://www.npmjs.com/) nainštalované, ako aj [Visual Studio Code](https://code.visualstudio.com/) dostupné pre vývoj v Pythone a JavaScripte. -- **Vytvorte si GitHub účet**. Keďže ste nás našli na [GitHube](https://github.com), možno už máte účet, ale ak nie, vytvorte si ho a potom si tento učebný plán forknite na vlastné použitie. (Môžete nám dať aj hviezdičku 😊) -- **Preskúmajte Scikit-learn**. Zoznámte sa s [Scikit-learn](https://scikit-learn.org/stable/user_guide.html), súborom knižníc pre strojové učenie, na ktoré sa odkazujeme v týchto lekciách. +- **Nakonfigurujte svoj počítač pomocou týchto videí**. Použite nasledujúce odkazy na naučenie sa [ako nainštalovať Python](https://youtu.be/CXZYvNRIAKM) vo vašom systéme a [nastaviť textový editor](https://youtu.be/EU8eayHWoZg) pre vývoj. +- **Naučte sa Python**. Tiež sa odporúča mať základné znalosti [Pythonu](https://docs.microsoft.com/learn/paths/python-language/?WT.mc_id=academic-77952-leestott), programovacieho jazyka užitočného pre dátových vedcov, ktorý v tomto kurze používame. +- **Naučte sa Node.js a JavaScript**. JavaScript používame niekoľkokrát v tomto kurze pri tvorbe webových aplikácií, takže budete potrebovať mať nainštalované [node](https://nodejs.org) a [npm](https://www.npmjs.com/), ako aj [Visual Studio Code](https://code.visualstudio.com/) dostupné pre vývoj v Pythone aj JavaScripte. +- **Vytvorte si účet na GitHub-e**. Keďže nás našli tu na [GitHub-e](https://github.com), možno už účet máte, ak nie, vytvorte si ho a potom si tento učebný plán forknete, aby ste ho mohli použiť sami. (Neváhajte nám tiež dať hviezdičku 😊) +- **Preskúmajte Scikit-learn**. Oboznámte sa so [Scikit-learn](https://scikit-learn.org/stable/user_guide.html), súborom ML knižníc, na ktoré sa v týchto lekciách odkazujeme. --- -## Čo je strojové učenie? +## Čo je to strojové učenie? -Termín 'strojové učenie' je jedným z najpopulárnejších a najčastejšie používaných termínov dneška. Je dosť pravdepodobné, že ste tento termín aspoň raz počuli, ak máte nejakú znalosť technológií, bez ohľadu na oblasť, v ktorej pracujete. Mechanizmy strojového učenia sú však pre väčšinu ľudí záhadou. Pre začiatočníka v strojovom učení môže byť táto téma niekedy ohromujúca. Preto je dôležité pochopiť, čo strojové učenie vlastne je, a učiť sa o ňom krok za krokom, prostredníctvom praktických príkladov. +Termín „strojové učenie“ je dnes jedným z najpopulárnejších a najčastejšie používaných výrazov. Existuje značná pravdepodobnosť, že ste tento termín počuli aspoň raz, ak máte akúkoľvek znalosť o technológiách, nezávisle od toho, v akej oblasti pracujete. Mechanizmy strojového učenia však väčšine ľudí zostávajú záhadou. Pre začiatočníka v strojovom učení môže byť táto téma niekedy ohromujúca. Preto je dôležité pochopiť, čo vlastne strojové učenie je, a učiť sa o ňom krok za krokom, prostredníctvom praktických príkladov. --- -## Krivka nadšenia +## Krivka hypu -![krivka nadšenia pre ML](../../../../1-Introduction/1-intro-to-ML/images/hype.png) +![ml hype curve](../../../../translated_images/sk/hype.07183d711a17aafe.webp) -> Google Trends ukazuje nedávnu 'krivku nadšenia' pre termín 'strojové učenie' +> Google Trends ukazuje nedávnu „krivku hypu“ termínu „strojové učenie“ --- ## Záhadný vesmír -Žijeme vo vesmíre plnom fascinujúcich záhad. Veľkí vedci ako Stephen Hawking, Albert Einstein a mnohí ďalší zasvätili svoje životy hľadaniu zmysluplných informácií, ktoré odhaľujú tajomstvá sveta okolo nás. Toto je ľudská podstata učenia: ľudské dieťa sa učí nové veci a rok čo rok odhaľuje štruktúru svojho sveta, keď dospieva. +Žijeme vo vesmíre plnom fascinujúcich záhad. Veľkí vedci ako Stephen Hawking, Albert Einstein a mnohí ďalší zasvätili svoj život hľadaniu významných informácií, ktoré odhaľujú záhady sveta okolo nás. Toto je ľudský stav učenia: ľudské dieťa sa učí nové veci a postupne objavuje štruktúru svojho sveta rok za rokom, keď rastie do dospelosti. --- -## Mozog dieťaťa +## Detský mozog -Mozog a zmysly dieťaťa vnímajú fakty zo svojho okolia a postupne sa učia skryté vzory života, ktoré pomáhajú dieťaťu vytvárať logické pravidlá na identifikáciu naučených vzorov. Proces učenia ľudského mozgu robí z ľudí najsofistikovanejšie živé bytosti na tomto svete. Neustále učenie sa objavovaním skrytých vzorov a následné inovovanie na základe týchto vzorov nám umožňuje zlepšovať sa počas celého života. Táto schopnosť učenia a evolúcie súvisí s konceptom nazývaným [plasticita mozgu](https://www.simplypsychology.org/brain-plasticity.html). Povrchne môžeme nájsť niektoré motivačné podobnosti medzi procesom učenia ľudského mozgu a konceptmi strojového učenia. +Detský mozog a zmysly vnímajú fakty o svojom okolí a postupne sa učia skryté vzory života, ktoré dieťaťu pomáhajú vytvárať logické pravidlá na rozpoznávanie naučených vzorov. Proces učenia ľudského mozgu robí z ľudí najsofistikovanejší živý tvor na tejto planéte. Učenie sa neustále objavovaním skrytých vzorov a ich následným zdokonaľovaním nám umožňuje robiť sa lepšími počas celého života. Táto schopnosť učenia a neustále sa vyvíjajúca kapacita súvisí s konceptom nazývaným [plasticita mozgu](https://www.simplypsychology.org/brain-plasticity.html). Povrchovo môžeme nájsť niektoré motivačné podobnosti medzi procesom učenia sa ľudského mozgu a konceptmi strojového učenia. --- ## Ľudský mozog -[Ľudský mozog](https://www.livescience.com/29365-human-brain.html) vníma veci z reálneho sveta, spracováva vnímané informácie, robí racionálne rozhodnutia a vykonáva určité akcie na základe okolností. Toto nazývame inteligentným správaním. Keď naprogramujeme napodobeninu inteligentného procesu správania do stroja, nazýva sa to umelá inteligencia (AI). +[Ľudský mozog](https://www.livescience.com/29365-human-brain.html) vníma veci z reálneho sveta, spracováva vnímané informácie, robí racionálne rozhodnutia a vykonáva určité akcie na základe okolností. Toto nazývame inteligentným správaním. Keď programujeme podobu tohto inteligentného správania na stroj, nazývame to umelou inteligenciou (AI). --- -## Niektoré pojmy +## Niektorá terminológia -Aj keď sa pojmy môžu zamieňať, strojové učenie (ML) je dôležitou podmnožinou umelej inteligencie. **ML sa zaoberá používaním špecializovaných algoritmov na odhaľovanie zmysluplných informácií a hľadanie skrytých vzorov z vnímaných dát na podporu procesu racionálneho rozhodovania**. +Hoci sa termíny môžu zamieňať, strojové učenie (ML) je dôležitou podmnožinou umelej inteligencie. **ML sa zaoberá používaním špecializovaných algoritmov na odhaľovanie významných informácií a hľadanie skrytých vzorov z vnímaných dát, aby podporilo racionálny rozhodovací proces**. --- -## AI, ML, Hlboké učenie +## AI, ML, hlboké učenie -![AI, ML, hlboké učenie, dátová veda](../../../../1-Introduction/1-intro-to-ML/images/ai-ml-ds.png) +![AI, ML, deep learning, data science](../../../../translated_images/sk/ai-ml-ds.537ea441b124ebf6.webp) -> Diagram ukazujúci vzťahy medzi AI, ML, hlbokým učením a dátovou vedou. Infografika od [Jen Looper](https://twitter.com/jenlooper) inšpirovaná [týmto grafom](https://softwareengineering.stackexchange.com/questions/366996/distinction-between-ai-ml-neural-networks-deep-learning-and-data-mining) +> Diagram zobrazujúci vzťahy medzi AI, ML, hlbokým učením a dátovou vedou. Infografika od [Jen Looper](https://twitter.com/jenlooper) inšpirovaná [týmto grafom](https://softwareengineering.stackexchange.com/questions/366996/distinction-between-ai-ml-neural-networks-deep-learning-and-data-mining) --- ## Koncepty, ktoré pokryjeme -V tomto učebnom pláne sa budeme venovať iba základným konceptom strojového učenia, ktoré musí začiatočník poznať. Pokryjeme to, čo nazývame 'klasické strojové učenie', primárne pomocou Scikit-learn, vynikajúcej knižnice, ktorú mnohí študenti používajú na učenie základov. Na pochopenie širších konceptov umelej inteligencie alebo hlbokého učenia je nevyhnutné mať silné základné znalosti strojového učenia, a preto ich chceme ponúknuť tu. +V tomto učebnom pláne pokryjeme len základné koncepty strojového učenia, ktoré musí začiatočník poznať. Pokrývame to, čo nazývame 'klasické strojové učenie' primárne pomocou Scikit-learn, vynikajúcej knižnice, ktorú používa mnoho študentov na osvojenie si základov. Na pochopenie širších konceptov umelej inteligencie alebo hlbokého učenia je nevyhnutné mať silné základy v strojovom učení, a preto vám ich tu chceme poskytnúť. --- ## V tomto kurze sa naučíte: @@ -75,11 +75,11 @@ V tomto učebnom pláne sa budeme venovať iba základným konceptom strojového - základné koncepty strojového učenia - históriu ML - ML a spravodlivosť -- regresné techniky ML -- klasifikačné techniky ML -- techniky zhlukovania ML -- techniky spracovania prirodzeného jazyka ML -- techniky predpovedania časových radov ML +- techniky regresie v ML +- techniky klasifikácie v ML +- techniky zhlukovania v ML +- techniky spracovania prirodzeného jazyka v ML +- techniky predikcie časových radov v ML - posilňovacie učenie - reálne aplikácie ML @@ -90,61 +90,68 @@ V tomto učebnom pláne sa budeme venovať iba základným konceptom strojového - neurónové siete - AI -Aby sme zabezpečili lepší zážitok z učenia, vyhneme sa zložitostiam neurónových sietí, 'hlbokého učenia' - modelovania s mnohými vrstvami pomocou neurónových sietí - a AI, o ktorých budeme diskutovať v inom učebnom pláne. Taktiež pripravujeme učebný plán dátovej vedy, ktorý sa zameria na tento aspekt širšieho poľa. +Pre lepší zážitok z učenia sa vyhneme zložitostiam neurónových sietí, „hlbokého učenia“ – viacvrstvového budovania modelov pomocou neurónových sietí – a AI, o ktorej budeme diskutovať v inom kurze. Tiež pripravujeme nadchádzajúci kurz dátovej vedy, ktorý sa zameria na túto oblasť väčšieho odboru. --- ## Prečo študovať strojové učenie? -Strojové učenie je z pohľadu systémov definované ako tvorba automatizovaných systémov, ktoré dokážu učiť skryté vzory z dát na podporu inteligentného rozhodovania. +Strojové učenie je z pohľadu systémov definované ako tvorba automatizovaných systémov, ktoré sa dokážu učiť skryté vzory z dát, aby pomohli robiť inteligentné rozhodnutia. -Táto motivácia je voľne inšpirovaná tým, ako ľudský mozog učí určité veci na základe dát, ktoré vníma z vonkajšieho sveta. +Táto motivácia je voľne inšpirovaná tým, ako sa ľudský mozog učí určité veci na základe dát, ktoré vníma z vonkajšieho sveta. -✅ Zamyslite sa na chvíľu, prečo by firma chcela použiť stratégie strojového učenia namiesto vytvorenia pevne zakódovaného systému založeného na pravidlách. +✅ Premyslite si na chvíľu, prečo by podnik chcel použiť stratégie strojového učenia namiesto vytvárania systému založeného na pevne zakódovaných pravidlách. + +--- +## Prečo je kvalita dát dôležitá + +Vysokokvalitné dáta zlepšujú výkon modelu. Slabé alebo šumové dáta môžu viesť k nepresným predikciám, aj keď sa používajú pokročilé algoritmy strojového učenia. --- ## Aplikácie strojového učenia -Aplikácie strojového učenia sú dnes takmer všade a sú rovnako rozšírené ako dáta, ktoré prúdia našimi spoločnosťami, generované našimi smartfónmi, pripojenými zariadeniami a inými systémami. Vzhľadom na obrovský potenciál najmodernejších algoritmov strojového učenia skúmajú výskumníci ich schopnosť riešiť multidimenzionálne a multidisciplinárne problémy reálneho života s veľkými pozitívnymi výsledkami. +Aplikácie strojového učenia sú dnes takmer všade, rovnako bežné ako dáta plynúce v našich spoločnostiach, generované našimi smartfónmi, pripojenými zariadeniami a ďalšími systémami. S ohľadom na obrovský potenciál najmodernejších algoritmov strojového učenia výskumníci skúmajú ich schopnosť riešiť viacrozmerné a multidisciplinárne reálne problémy s veľmi pozitívnymi výsledkami. --- ## Príklady aplikovaného ML -**Strojové učenie môžete použiť mnohými spôsobmi**: +**Strojové učenie môžete využívať mnohými spôsobmi**: -- Na predpovedanie pravdepodobnosti ochorenia na základe zdravotnej histórie alebo správ pacienta. -- Na využitie údajov o počasí na predpovedanie meteorologických udalostí. -- Na pochopenie sentimentu textu. -- Na detekciu falošných správ a zastavenie šírenia propagandy. +- Predpovedať pravdepodobnosť ochorenia na základe lekárskej histórie alebo správ pacienta. +- Využiť meteorologické dáta na predikciu poveternostných udalostí. +- Pochopiť sentiment textu. +- Detegovať falošné správy, aby sa zastavilo šírenie propagandy. -Financie, ekonómia, vedy o Zemi, vesmírny výskum, biomedicínske inžinierstvo, kognitívne vedy a dokonca aj oblasti humanitných vied adaptovali strojové učenie na riešenie náročných problémov spracovania dát vo svojich oblastiach. +Financie, ekonómia, veda o Zemi, vesmírny výskum, biomedicínske inžinierstvo, kognitívna veda a dokonca aj humanitné odbory prijali strojové učenie na riešenie zložitých, dátovo náročných problémov svojho odboru. --- ## Záver -Strojové učenie automatizuje proces objavovania vzorov tým, že nachádza zmysluplné poznatky z reálnych alebo generovaných dát. Ukázalo sa, že je mimoriadne hodnotné v podnikaní, zdravotníctve a finančných aplikáciách, medzi inými. +Strojové učenie automatizuje proces objavovania vzorov nájdením významných poznatkov z reálnych alebo generovaných dát. Preukázalo svoju vysokú hodnotu v podnikaní, zdravotníctve a finančných aplikáciách, medzi inými. -V blízkej budúcnosti bude pochopenie základov strojového učenia nevyhnutné pre ľudí z akejkoľvek oblasti vzhľadom na jeho široké prijatie. +V blízkej budúcnosti bude znalosť základov strojového učenia nevyhnutná pre ľudí z akéhokoľvek odboru vzhľadom na jeho široké prijatie. --- # 🚀 Výzva -Nakreslite na papier alebo pomocou online aplikácie ako [Excalidraw](https://excalidraw.com/) vaše pochopenie rozdielov medzi AI, ML, hlbokým učením a dátovou vedou. Pridajte niekoľko nápadov na problémy, ktoré sú každá z týchto techník dobré pri riešení. +Nakreslite na papieri alebo pomocou online aplikácie ako [Excalidraw](https://excalidraw.com/) svoje pochopenie rozdielov medzi AI, ML, hlbokým učením a dátovou vedou. Pridajte niekoľko nápadov na problémy, ktoré je každá z týchto techník schopná dobre riešiť. -# [Kvíz po prednáške](https://ff-quizzes.netlify.app/en/ml/) +# [Poprednáškový kvíz](https://ff-quizzes.netlify.app/en/ml/) --- -# Prehľad a samostatné štúdium +# Prehľad & samostatné štúdium -Ak sa chcete dozvedieť viac o tom, ako môžete pracovať s ML algoritmami v cloude, sledujte tento [učebný plán](https://docs.microsoft.com/learn/paths/create-no-code-predictive-models-azure-machine-learning/?WT.mc_id=academic-77952-leestott). +Ak sa chcete dozvedieť viac o tom, ako môžete pracovať s ML algoritmami v cloude, sledujte tento [Learning Path](https://docs.microsoft.com/learn/paths/create-no-code-predictive-models-azure-machine-learning/?WT.mc_id=academic-77952-leestott). -Absolvujte [učebný plán](https://docs.microsoft.com/learn/modules/introduction-to-machine-learning/?WT.mc_id=academic-77952-leestott) o základoch ML. +Absolvujte [Learning Path](https://docs.microsoft.com/learn/modules/introduction-to-machine-learning/?WT.mc_id=academic-77952-leestott) o základoch ML. --- # Zadanie -[Začnite](assignment.md) +[Začnite a rozbiehajte sa](assignment.md) --- -**Upozornenie**: -Tento dokument bol preložený pomocou služby AI prekladu [Co-op Translator](https://github.com/Azure/co-op-translator). Hoci sa snažíme o presnosť, prosím, berte na vedomie, že automatizované preklady môžu obsahovať chyby alebo nepresnosti. Pôvodný dokument v jeho pôvodnom jazyku by mal byť považovaný za autoritatívny zdroj. Pre kritické informácie sa odporúča profesionálny ľudský preklad. Nie sme zodpovední za žiadne nedorozumenia alebo nesprávne interpretácie vyplývajúce z použitia tohto prekladu. \ No newline at end of file + +**Vyhlásenie o zodpovednosti**: +Tento dokument bol preložený pomocou AI prekladateľskej služby [Co-op Translator](https://github.com/Azure/co-op-translator). Hoci sa snažíme o presnosť, vezmite prosím na vedomie, že automatické preklady môžu obsahovať chyby alebo nepresnosti. Pôvodný dokument v jeho natívnom jazyku by mal byť považovaný za autoritatívny zdroj. Pre kritické informácie sa odporúča profesionálny ľudský preklad. Nie sme zodpovední za žiadne nedorozumenia alebo nesprávne interpretácie vyplývajúce z použitia tohto prekladu. + \ No newline at end of file diff --git a/translations/sk/5-Clustering/1-Visualize/README.md b/translations/sk/5-Clustering/1-Visualize/README.md index 43b9f8f44..31143fbe6 100644 --- a/translations/sk/5-Clustering/1-Visualize/README.md +++ b/translations/sk/5-Clustering/1-Visualize/README.md @@ -1,106 +1,105 @@ # Úvod do zhlukovania -Zhlukovanie je typ [neučenej metódy](https://wikipedia.org/wiki/Unsupervised_learning), ktorá predpokladá, že dataset nie je označený alebo že jeho vstupy nie sú spojené s preddefinovanými výstupmi. Používa rôzne algoritmy na triedenie neoznačených dát a poskytuje skupiny na základe vzorov, ktoré rozpozná v dátach. +Zhlukovanie je typ [neurčeného učenia](https://wikipedia.org/wiki/Unsupervised_learning), ktorý predpokladá, že dátová množina nie je označená alebo že jej vstupy nie sú spárované s preddefinovanými výstupmi. Používa rôzne algoritmy na pretriedenie neoznačených dát a poskytuje zoskupenia podľa vzorov, ktoré v dátach rozpozná. -[![No One Like You od PSquare](https://img.youtube.com/vi/ty2advRiWJM/0.jpg)](https://youtu.be/ty2advRiWJM "No One Like You od PSquare") +[![No One Like You by PSquare](https://img.youtube.com/vi/ty2advRiWJM/0.jpg)](https://youtu.be/ty2advRiWJM "No One Like You by PSquare") -> 🎥 Kliknite na obrázok vyššie pre video. Kým študujete strojové učenie so zhlukovaním, užite si niektoré nigerijské Dance Hall skladby - toto je vysoko hodnotená skladba z roku 2014 od PSquare. +> 🎥 Kliknite na obrázok vyššie pre video. Kým študujete strojové učenie so zhlukovaním, vychutnajte si nigerijské tanečné skladby - toto je veľmi hodnotená pieseň z roku 2014 od PSquare. -## [Kvíz pred prednáškou](https://ff-quizzes.netlify.app/en/ml/) +## [Prednáškový kvíz](https://ff-quizzes.netlify.app/en/ml/) ### Úvod -[Zhlukovanie](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) je veľmi užitočné pre prieskum dát. Pozrime sa, či nám môže pomôcť objaviť trendy a vzory v tom, ako nigerijské publikum konzumuje hudbu. +[Zhlukovanie](https://link.springer.com/referenceworkentry/10.1007%2F978-0-387-30164-8_124) je veľmi užitočné pri prieskume dát. Pozrime sa, či môže pomôcť objaviť trendy a vzory v spôsobe, akým nigerijské publikum konzumuje hudbu. -✅ Zamyslite sa na chvíľu nad využitím zhlukovania. V reálnom živote sa zhlukovanie deje vždy, keď máte hromadu bielizne a potrebujete roztriediť oblečenie členov rodiny 🧦👕👖🩲. V dátovej vede sa zhlukovanie deje pri analýze preferencií používateľov alebo pri určovaní charakteristík akéhokoľvek neoznačeného datasetu. Zhlukovanie, do istej miery, pomáha urobiť poriadok z chaosu, ako napríklad zásuvka na ponožky. +✅ Venujte minútu zamysleniu sa nad použitím zhlukovania. V reálnom živote k zhlukovaniu dochádza, keď máte hromadu bielizne a potrebujete roztriediť oblečenie členov rodiny 🧦👕👖🩲. V dátovej vede k zhlukovaniu dochádza pri analýze preferencií používateľa alebo pri určovaní charakteristík akejkoľvek neoznačenej množiny dát. Zhlukovanie akoby pomáha dávať zmysel chaosu, ako zásuvka na ponožky. [![Úvod do ML](https://img.youtube.com/vi/esmzYhuFnds/0.jpg)](https://youtu.be/esmzYhuFnds "Úvod do zhlukovania") -> 🎥 Kliknite na obrázok vyššie pre video: John Guttag z MIT predstavuje zhlukovanie. +> 🎥 Kliknite na obrázok vyššie pre video: John Guttag z MIT predstavuje zhlukovanie -V profesionálnom prostredí môže byť zhlukovanie použité na určenie vecí, ako je segmentácia trhu, napríklad na určenie, ktoré vekové skupiny kupujú aké položky. Ďalším využitím by mohlo byť odhaľovanie anomálií, napríklad na detekciu podvodov z datasetu transakcií kreditných kariet. Alebo by ste mohli použiť zhlukovanie na určenie nádorov v dávke medicínskych skenov. +V profesionálnom prostredí sa zhlukovanie môže použiť na určovanie vecí ako segmentácia trhu, napríklad určenie, ktoré vekové skupiny kupujú ktoré produkty. Ďalším použitím môže byť detekcia anomálií, napríklad na odhalenie podvodov v množine dát o kreditných kartách. Alebo môžete použiť zhlukovanie na určenie nádorov v sérii lekárskych snímok. -✅ Zamyslite sa na chvíľu nad tým, ako ste sa mohli stretnúť so zhlukovaním „v divočine“, v bankovníctve, e-commerce alebo obchodnom prostredí. +✅ Zamyslite sa minútu nad tým, ako ste sa mohli stretnúť so zhlukovaním „v divočine“, v bankovníctve, e-commerce alebo biznisovom prostredí. -> 🎓 Zaujímavosť: Analýza zhlukov vznikla v oblasti antropológie a psychológie v 30. rokoch 20. storočia. Dokážete si predstaviť, ako mohla byť použitá? +> 🎓 Zaujímavosťou je, že analýza zhlukov vznikla v oblastiach antropológie a psychológie v 30. rokoch 20. storočia. Viete si predstaviť, ako mohla byť používaná? -Alternatívne by ste ju mohli použiť na zoskupenie výsledkov vyhľadávania - napríklad podľa nákupných odkazov, obrázkov alebo recenzií. Zhlukovanie je užitočné, keď máte veľký dataset, ktorý chcete zredukovať a na ktorom chcete vykonať podrobnejšiu analýzu, takže táto technika môže byť použitá na získanie informácií o dátach pred vytvorením iných modelov. +Alternatívne by ste ju mohli použiť na zoskupovanie výsledkov vyhľadávania - napríklad podľa nákupných odkazov, obrázkov alebo recenzií. Zhlukovanie je užitočné, keď máte veľkú množinu dát, ktorú chcete zredukovať a na ktorej chcete vykonať podrobnejšiu analýzu, takže technika sa dá použiť na spoznanie dát predtým, než sa vybudujú iné modely. -✅ Keď sú vaše dáta organizované do zhlukov, priradíte im identifikátor zhluku, a táto technika môže byť užitočná pri zachovaní súkromia datasetu; namiesto odkazovania na konkrétne údaje môžete odkazovať na identifikátor zhluku. Dokážete si predstaviť ďalšie dôvody, prečo by ste odkazovali na identifikátor zhluku namiesto iných prvkov zhluku na jeho identifikáciu? - -Prehĺbte svoje pochopenie techník zhlukovania v tomto [učebnom module](https://docs.microsoft.com/learn/modules/train-evaluate-cluster-models?WT.mc_id=academic-77952-leestott). +✅ Akonáhle sú vaše dáta zorganizované do zhlukov, priradíte im ID zhluku a táto technika môže byť užitočná pri zachovaní súkromia množiny dát; môžete namiesto identifikácie dátového bodu podľa odhalujúcich identifikovateľných údajov použiť jeho ID zhluku. Viete si predstaviť iné dôvody, prečo by ste radšej odkazovali na ID zhluku ako na iné prvky zhluku na jeho identifikáciu? +Prehĺbte svoje znalosti o technikách zhlukovania v tomto [moduly Learn](https://docs.microsoft.com/learn/modules/train-evaluate-cluster-models?WT.mc_id=academic-77952-leestott) ## Začíname so zhlukovaním -[Scikit-learn ponúka širokú škálu](https://scikit-learn.org/stable/modules/clustering.html) metód na vykonávanie zhlukovania. Typ, ktorý si vyberiete, bude závisieť od vášho prípadu použitia. Podľa dokumentácie má každá metóda rôzne výhody. Tu je zjednodušená tabuľka metód podporovaných Scikit-learn a ich vhodné prípady použitia: +[Scikit-learn ponúka veľkú škálu](https://scikit-learn.org/stable/modules/clustering.html) metód na zhlukovanie. Typ, ktorý si zvolíte, bude závisieť od vášho použitia. Podľa dokumentácie má každá metóda rôzne výhody. Tu je zjednodušená tabuľka metód podporovaných Scikit-learn a ich vhodných prípadov použitia: -| Názov metódy | Prípad použitia | +| Názov metódy | Prípad použitia | | :--------------------------- | :------------------------------------------------------------------- | -| K-Means | všeobecné použitie, induktívne | -| Affinity propagation | mnoho, nerovnomerné zhluky, induktívne | -| Mean-shift | mnoho, nerovnomerné zhluky, induktívne | -| Spectral clustering | málo, rovnomerné zhluky, transduktívne | -| Ward hierarchical clustering | mnoho, obmedzené zhluky, transduktívne | -| Agglomerative clustering | mnoho, obmedzené, ne-Euklidovské vzdialenosti, transduktívne | -| DBSCAN | neplochá geometria, nerovnomerné zhluky, transduktívne | -| OPTICS | neplochá geometria, nerovnomerné zhluky s variabilnou hustotou, transduktívne | -| Gaussian mixtures | plochá geometria, induktívne | -| BIRCH | veľký dataset s odľahlými bodmi, induktívne | - -> 🎓 Ako vytvárame zhluky, má veľa spoločného s tým, ako zhromažďujeme dátové body do skupín. Poďme si rozobrať niektoré pojmy: +| K-Means | všeobecné použitie, induktívne | +| Affinity propagation | veľa, nerovnomerných zhlukov, induktívne | +| Mean-shift | veľa, nerovnomerných zhlukov, induktívne | +| Spektrálne zhlukovanie | málo, rovnomerných zhlukov, transduktívne | +| Ward hierarchické zhlukovanie | veľa, obmedzených zhlukov, transduktívne | +| Agglomeratívne zhlukovanie | veľa, obmedzených, ne-euklidovských vzdialeností, transduktívne | +| DBSCAN | neplochá geometria, nerovnomerné zhluky, transduktívne | +| OPTICS | neplochá geometria, nerovnomerné zhluky s premenlivou hustotou, transduktívne | +| Gaussovské zmesi | plochá geometria, induktívne | +| BIRCH | veľká množina dát s odľahlými hodnotami, induktívne | + +> 🎓 Ako vytvárame zhluky veľmi súvisí s tým, ako zhromažďujeme dátové body do skupín. Pozrime sa na niektorú slovnú zásobu: > -> 🎓 ['Transduktívne' vs. 'induktívne'](https://wikipedia.org/wiki/Transduction_(machine_learning)) +> 🎓 ['Transduktívne' verzus 'induktívne'](https://wikipedia.org/wiki/Transduction_(machine_learning)) > -> Transduktívna inferencia je odvodená z pozorovaných tréningových prípadov, ktoré sa mapujú na konkrétne testovacie prípady. Induktívna inferencia je odvodená z tréningových prípadov, ktoré sa mapujú na všeobecné pravidlá, ktoré sa potom aplikujú na testovacie prípady. +> Transduktívny záver sa vyvodzuje z pozorovaných trénovacích prípadov, ktoré mapujú konkrétne testovacie prípady. Induktívny záver sa odvodzuje z trénovacích prípadov, ktoré mapujú všeobecné pravidlá, ktoré sa až potom aplikujú na testovacie prípady. > -> Príklad: Predstavte si, že máte dataset, ktorý je len čiastočne označený. Niektoré veci sú „platne“, niektoré „CD“ a niektoré sú prázdne. Vašou úlohou je poskytnúť označenia pre prázdne miesta. Ak si vyberiete induktívny prístup, trénovali by ste model hľadajúci „platne“ a „CD“ a aplikovali tieto označenia na vaše neoznačené dáta. Tento prístup bude mať problémy s klasifikáciou vecí, ktoré sú vlastne „kazety“. Transduktívny prístup, na druhej strane, efektívnejšie spracováva tieto neznáme dáta, pretože pracuje na zoskupení podobných položiek a potom aplikuje označenie na skupinu. V tomto prípade by zhluky mohli odrážať „okrúhle hudobné veci“ a „štvorcové hudobné veci“. +> Príklad: Predstavte si, že máte dataset, ktorý je len čiastočne označený. Niektoré veci sú 'platne', niektoré 'cdčka' a niektoré sú prázdne. Vašou úlohou je priradiť štítky prázdnym záznamom. Ak zvolíte induktívny prístup, vytrénujete model na hľadanie 'platní' a 'cdčiek' a použijete tieto štítky na neoznačené dáta. Tento prístup bude mať problém s klasifikáciou vecí, ktoré sú v skutočnosti 'kazety'. Transduktívny prístup, na druhej strane, lepšie spracováva tieto neznáme dáta, pretože pracuje na zoskupení podobných položiek a potom priradí štítok skupine. V tomto prípade by zhluky mohli odrážať "guľaté hudobné veci" a "štvorcové hudobné veci." > -> 🎓 ['Neplochá' vs. 'plochá' geometria](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering) +> 🎓 ['Neplochá' verzus 'plochá' geometria](https://datascience.stackexchange.com/questions/52260/terminology-flat-geometry-in-the-context-of-clustering) > -> Odvodené z matematickej terminológie, neplochá vs. plochá geometria sa týka merania vzdialeností medzi bodmi buď „plochými“ ([Euklidovskými](https://wikipedia.org/wiki/Euclidean_geometry)) alebo „neplochými“ (ne-Euklidovskými) geometrickými metódami. +> Vychádzajúc z matematickej terminológie, neplochá verzus plochá geometria sa vzťahuje na meranie vzdialeností medzi bodmi pomocou buď 'plochej' ([euklidovskej](https://wikipedia.org/wiki/Euclidean_geometry)) alebo 'neplochej' (ne-euklidovskej) geometrickej metódy. > ->'Plochá' v tomto kontexte odkazuje na Euklidovskú geometriu (časti ktorej sa učia ako „rovinná“ geometria), a neplochá odkazuje na ne-Euklidovskú geometriu. Čo má geometria spoločné so strojovým učením? Ako dve oblasti, ktoré sú zakorenené v matematike, musí existovať spoločný spôsob merania vzdialeností medzi bodmi v zhlukoch, a to môže byť vykonané „plochým“ alebo „neplochým“ spôsobom, v závislosti od povahy dát. [Euklidovské vzdialenosti](https://wikipedia.org/wiki/Euclidean_distance) sa merajú ako dĺžka úsečky medzi dvoma bodmi. [Ne-Euklidovské vzdialenosti](https://wikipedia.org/wiki/Non-Euclidean_geometry) sa merajú pozdĺž krivky. Ak vaše dáta, vizualizované, neexistujú na rovine, možno budete potrebovať použiť špecializovaný algoritmus na ich spracovanie. +> 'Plochá' v tomto kontexte odkazuje na euklidovskú geometriu (jej časť sa učí ako 'rovinná' geometria), a neplochá na ne-euklidovskú geometriu. Čo má geometria spoločné so strojovým učením? No, ako dva odbory založené na matematike, musí existovať spoločný spôsob, ako merať vzdialenosti medzi bodmi v zhlukoch, a to sa môže robiť plochým alebo neplochým spôsobom v závislosti od povahy dát. [Euklidovské vzdialenosti](https://wikipedia.org/wiki/Euclidean_distance) sa merajú ako dĺžka úseku medzi dvoma bodmi. [Ne-euklidovské vzdialenosti](https://wikipedia.org/wiki/Non-Euclidean_geometry) sa merajú pozdĺž krivky. Ak vaše dáta, zobrazené vizuálne, vyzerajú, že neexistujú na rovine, možno budete potrebovať použiť špecializovaný algoritmus na ich spracovanie. > -![Infografika plochá vs. neplochá geometria](../../../../5-Clustering/1-Visualize/images/flat-nonflat.png) +![Infografika plochá verzus neplochá geometria](../../../../translated_images/sk/flat-nonflat.d1c8c6e2a96110c1.webp) > Infografika od [Dasani Madipalli](https://twitter.com/dasani_decoded) > > 🎓 ['Vzdialenosti'](https://web.stanford.edu/class/cs345a/slides/12-clustering.pdf) > -> Zhluky sú definované ich maticou vzdialeností, napr. vzdialenosti medzi bodmi. Táto vzdialenosť môže byť meraná niekoľkými spôsobmi. Euklidovské zhluky sú definované priemerom hodnôt bodov a obsahujú „centroid“ alebo stredový bod. Vzdialenosti sú teda merané vzdialenosťou k tomuto centroidu. Ne-Euklidovské vzdialenosti odkazujú na „clustroidy“, bod najbližší k ostatným bodom. Clustroidy môžu byť definované rôznymi spôsobmi. +> Zhluky sú definované ich maticou vzdialeností, napríklad vzdialenosťami medzi bodmi. Táto vzdialenosť sa môže merať niekoľkými spôsobmi. Euklidovské zhluky sú definované priemerom hodnôt bodov a obsahujú 'centroid' alebo stredový bod. Vzdialenosti sa teda merajú podľa vzdialenosti k tomuto centriodu. Ne-euklidovské vzdialenosti sa týkajú 'clustroidov', bodu najbližšieho k iným bodom. Clustroidy môžu byť definované rôznymi spôsobmi. > > 🎓 ['Obmedzené'](https://wikipedia.org/wiki/Constrained_clustering) > -> [Obmedzené zhlukovanie](https://web.cs.ucdavis.edu/~davidson/Publications/ICDMTutorial.pdf) zavádza „semi-učené“ učenie do tejto neučenej metódy. Vzťahy medzi bodmi sú označené ako „nemôže byť prepojené“ alebo „musí byť prepojené“, takže na dataset sú aplikované určité pravidlá. +> [Obmedzené zhlukovanie](https://web.cs.ucdavis.edu/~davidson/Publications/ICDMTutorial.pdf) zavádza do metódy nesupervidovaného učenia prvky semi-supervidovaného učenia. Vzťahy medzi bodmi sú označené ako 'nemôže byť spojené' alebo 'musí byť spojené', takže na množinu dát sú vynútené niektoré pravidlá. > ->Príklad: Ak je algoritmus voľne spustený na dávke neoznačených alebo semi-označených dát, zhluky, ktoré vytvorí, môžu byť nekvalitné. V príklade vyššie by zhluky mohli zoskupovať „okrúhle hudobné veci“ a „štvorcové hudobné veci“ a „trojuholníkové veci“ a „sušienky“. Ak sú dané nejaké obmedzenia alebo pravidlá, ktoré treba dodržiavať („položka musí byť vyrobená z plastu“, „položka musí byť schopná produkovať hudbu“), môže to pomôcť „obmedziť“ algoritmus, aby robil lepšie rozhodnutia. +>Príklad: Ak algoritmus necháme voľne pracovať na množine neoznačených alebo čiastočne označených dát, zhluky, ktoré vytvorí, môžu byť nekvalitné. V predchádzajúcom príklade by zhluky mohli zoskupiť „guľaté hudobné veci“, „štvorcové hudobné veci“, „trojuholníkové veci“ a „keksíky“. Ak mu zadáme niektoré obmedzenia alebo pravidlá ("položka musí byť z plastu", "položka musí vedieť produkovať hudbu"), môže to pomôcť algoritmu robiť lepšie rozhodnutia. > > 🎓 'Hustota' > -> Dáta, ktoré sú „hlučné“, sa považujú za „husté“. Vzdialenosti medzi bodmi v každom z jeho zhlukov môžu byť pri skúmaní viac alebo menej husté, alebo „preplnené“, a preto tieto dáta potrebujú byť analyzované vhodnou metódou zhlukovania. [Tento článok](https://www.kdnuggets.com/2020/02/understanding-density-based-clustering.html) demonštruje rozdiel medzi použitím K-Means zhlukovania vs. HDBSCAN algoritmov na preskúmanie hlučného datasetu s nerovnomernou hustotou zhlukov. +> Dáta, ktoré sú 'šumové', sa považujú za 'husté'. Vzdialenosti medzi bodmi v jednotlivých zhlukoch môžu byť po preskúmaní viac alebo menej husté, alebo 'preplnené', a preto tieto dáta treba analyzovať vhodnou metódou zhlukovania. [Tento článok](https://www.kdnuggets.com/2020/02/understanding-density-based-clustering.html) ukazuje rozdiel medzi použitím K-Means a HDBSCAN algoritmov na skúmanie šumovej množiny dát s nerovnomernou hustotou zhlukov. ## Algoritmy zhlukovania -Existuje viac ako 100 algoritmov zhlukovania a ich použitie závisí od povahy dostupných dát. Poďme diskutovať o niektorých hlavných: +Existuje viac ako 100 algoritmov na zhlukovanie a ich použitie závisí od povahy spracovávaných dát. Pozrime sa na niektoré hlavné: -- **Hierarchické zhlukovanie**. Ak je objekt klasifikovaný podľa jeho blízkosti k blízkemu objektu, namiesto vzdialeného, zhluky sú tvorené na základe vzdialenosti členov od ostatných objektov. Agglomeratívne zhlukovanie v Scikit-learn je hierarchické. +- **Hierarchické zhlukovanie**. Ak je objekt klasifikovaný podľa svojej blízkosti k susednému objektu, namiesto k vzdialenejšiemu, vytvárajú sa zhluky na základe vzdialenosti členov k iným objektom. Agglomeratívne zhlukovanie v Scikit-learn je hierarchické. - ![Infografika hierarchického zhlukovania](../../../../5-Clustering/1-Visualize/images/hierarchical.png) + ![Infografika hierarchického zhlukovania](../../../../translated_images/sk/hierarchical.bf59403aa43c8c47.webp) > Infografika od [Dasani Madipalli](https://twitter.com/dasani_decoded) -- **Zhlukovanie podľa centroidu**. Tento populárny algoritmus vyžaduje výber 'k', alebo počet zhlukov, ktoré sa majú vytvoriť, po ktorom algoritmus určí stredový bod zhluku a zhromaždí dáta okolo tohto bodu. [K-means zhlukovanie](https://wikipedia.org/wiki/K-means_clustering) je populárna verzia zhlukovania podľa centroidu. Stred je určený najbližším priemerom, odtiaľ názov. Štvorcová vzdialenosť od zhluku je minimalizovaná. +- **Centroidové zhlukovanie**. Tento obľúbený algoritmus vyžaduje zvoliť počet „k“ zhlukov, ktoré sa majú vytvoriť, potom algoritmus určí stredový bod zhluku a zhromaždí údaje okolo neho. [K-means zhlukovanie](https://wikipedia.org/wiki/K-means_clustering) je populárna verzia centroidového zhlukovania. Stred je určený najbližším priemerom, odtiaľ názov. Štvorcová vzdialenosť od zhluku je minimalizovaná. - ![Infografika zhlukovania podľa centroidu](../../../../5-Clustering/1-Visualize/images/centroid.png) + ![Infografika centroidového zhlukovania](../../../../translated_images/sk/centroid.097fde836cf6c918.webp) > Infografika od [Dasani Madipalli](https://twitter.com/dasani_decoded) -- **Distribučné zhlukovanie**. Založené na štatistickom modelovaní, distribučné zhlukovanie sa zameriava na určenie pravdepodobnosti, že dátový bod patrí do zhluku, a jeho priradenie. Metódy Gaussovských zmesí patria do tohto typu. +- **Distribučné zhlukovanie**. Založené na štatistickom modelovaní, distribučné zhlukovanie sa zameriava na určenie pravdepodobnosti, že dátový bod patrí do zhluku, a podľa toho ho priraďuje. Metódy gaussovských zmesí patria do tohto typu. -- **Zhlukovanie podľa hustoty**. Dátové body sú priradené do zhlukov na základe ich hustoty, alebo ich zoskupenia okolo seba. Dátové body vzdialené od skupiny sú považované za odľahlé body alebo šum. DBSCAN, Mean-shift a OPTICS patria do tohto typu zhlukovania. +- **Hustotné zhlukovanie**. Dátové body sa priraďujú ku zhlukom na základe ich hustoty alebo ich zoskupenia okolo seba. Dátové body vzdialené od skupiny sa považujú za odľahlé hodnoty alebo šum. DBSCAN, Mean-shift a OPTICS patria do tohto typu zhlukovania. -- **Zhlukovanie podľa mriežky**. Pre multidimenzionálne datasety sa vytvorí mriežka a dáta sa rozdelia medzi bunky mriežky, čím sa vytvoria zhluky. +- **Mriežkové zhlukovanie**. Pre viacrozmerné dáta sa vytvára mriežka a dáta sa rozdeľujú medzi bunky mriežky, čím vznikajú zhluky. ## Cvičenie - zhlukujte svoje dáta -Zhlukovanie ako technika je výrazne podporené správnou vizualizáciou, takže začnime vizualizáciou našich hudobných dát. Toto cvičenie nám pomôže rozhodnúť, ktorú z metód zhlukovania by sme mali najefektívnejšie použiť pre povahu týchto dát. +Zhlukovanie ako technika je výrazne podporované správnou vizualizáciou, takže začnime vizualizáciou našich hudobných dát. Toto cvičenie nám pomôže rozhodnúť, ktorú z metód zhlukovania by sme mali najefektívnejšie použiť pre povahu týchto dát. 1. Otvorte súbor [_notebook.ipynb_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/1-Visualize/notebook.ipynb) v tomto priečinku. @@ -110,7 +109,7 @@ Zhlukovanie ako technika je výrazne podporené správnou vizualizáciou, takže !pip install seaborn ``` -1. Pripojte hudobné dáta zo súboru [_nigerian-songs.csv_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/data/nigerian-songs.csv). Načítajte dataframe s niektorými dátami o skladbách. Pripravte sa na preskúmanie týchto dát importovaním knižníc a vypísaním dát: +1. Pridajte dáta piesní zo súboru [_nigerian-songs.csv_](https://github.com/microsoft/ML-For-Beginners/blob/main/5-Clustering/data/nigerian-songs.csv). Načítajte dataframe s niektorými informáciami o piesňach. Pripravte sa na prieskum týchto dát importom knižníc a vyvedením dát: ```python import matplotlib.pyplot as plt @@ -120,17 +119,17 @@ Zhlukovanie ako technika je výrazne podporené správnou vizualizáciou, takže df.head() ``` - Skontrolujte prvých pár riadkov dát: + Skontrolujte prvé riadky dát: - | | názov | album | umelec | hlavný žáner umelca | dátum vydania | dĺžka | popularita | tanečnosť | akustickosť | energia | inštrumentálnosť | živosť | hlasitosť | rečovosť | tempo | takt | - | --- | ----------------------- | ---------------------------- | ------------------- | ------------------- | ------------- | ------ | ---------- | ------------ | ------------ | ------ | ---------------- | -------- | -------- | ----------- | ------- | -------------- | - | 0 | Sparky | Mandy & The Jungle | Cruel Santino | alternatívne r&b | 2019 | 144000 | 48 | 0.666 | 0.851 | 0.42 | 0.534 | 0.11 | -6.699 | 0.0829 | 133.015 | 5 | - | 1 | shuga rush | EVERYTHING YOU HEARD IS TRUE | Odunsi (The Engine) | afropop | 2020 | 89488 | 30 | 0.71 | 0.0822 | 0.683 | 0.000169 | 0.101 | -5.64 | 0.36 | 129.993 | 3 | -| 2 | LITT! | LITT! | AYLØ | indie r&b | 2018 | 207758 | 40 | 0.836 | 0.272 | 0.564 | 0.000537 | 0.11 | -7.127 | 0.0424 | 130.005 | 4 | -| 3 | Confident / Feeling Cool | Enjoy Your Life | Lady Donli | nigerian pop | 2019 | 175135 | 14 | 0.894 | 0.798 | 0.611 | 0.000187 | 0.0964 | -4.961 | 0.113 | 111.087 | 4 | -| 4 | wanted you | rare. | Odunsi (The Engine) | afropop | 2018 | 152049 | 25 | 0.702 | 0.116 | 0.833 | 0.91 | 0.348 | -6.044 | 0.0447 | 105.115 | 4 | + | | name | album | artist | artist_top_genre | release_date | length | popularity | danceability | acousticness | energy | instrumentalness | liveness | loudness | speechiness | tempo | time_signature | + | --- | ------------------------ | ---------------------------- | ------------------- | ---------------- | ------------ | ------ | ---------- | ------------ | ------------ | ------ | ---------------- | -------- | -------- | ----------- | ------- | -------------- | + | 0 | Sparky | Mandy & The Jungle | Cruel Santino | alternative r&b | 2019 | 144000 | 48 | 0.666 | 0.851 | 0.42 | 0.534 | 0.11 | -6.699 | 0.0829 | 133.015 | 5 | + | 1 | shuga rush | EVERYTHING YOU HEARD IS TRUE | Odunsi (The Engine) | afropop | 2020 | 89488 | 30 | 0.71 | 0.0822 | 0.683 | 0.000169 | 0.101 | -5.64 | 0.36 | 129.993 | 3 | + | 2 | LITT! | LITT! | AYLØ | indie r&b | 2018 | 207758 | 40 | 0.836 | 0.272 | 0.564 | 0.000537 | 0.11 | -7.127 | 0.0424 | 130.005 | 4 | + | 3 | Confident / Feeling Cool | Enjoy Your Life | Lady Donli | nigerian pop | 2019 | 175135 | 14 | 0.894 | 0.798 | 0.611 | 0.000187 | 0.0964 | -4.961 | 0.113 | 111.087 | 4 | + | 4 | wanted you | rare. | Odunsi (The Engine) | afropop | 2018 | 152049 | 25 | 0.702 | 0.116 | 0.833 | 0.91 | 0.348 | -6.044 | 0.0447 | 105.115 | 4 | -1. Získajte niektoré informácie o dátovom rámci, zavolaním `info()`: +1. Získajte niektoré informácie o dátovom rámci zavolaním `info()`: ```python df.info() @@ -164,7 +163,7 @@ Zhlukovanie ako technika je výrazne podporené správnou vizualizáciou, takže memory usage: 66.4+ KB ``` -1. Skontrolujte, či neobsahuje nulové hodnoty, zavolaním `isnull()` a overením, že súčet je 0: +1. Dvakrát si overte null hodnoty zavolaním `isnull()` a overením, že súčet je 0: ```python df.isnull().sum() @@ -192,7 +191,7 @@ Zhlukovanie ako technika je výrazne podporené správnou vizualizáciou, takže dtype: int64 ``` -1. Popíšte údaje: +1. Popíšte dáta: ```python df.describe() @@ -209,11 +208,11 @@ Zhlukovanie ako technika je výrazne podporené správnou vizualizáciou, takže | 75% | 2017 | 242098.5 | 31 | 0.8295 | 0.403 | 0.87575 | 0.000234 | 0.164 | -3.331 | 0.177 | 125.03925 | 4 | | max | 2020 | 511738 | 73 | 0.966 | 0.954 | 0.995 | 0.91 | 0.811 | 0.582 | 0.514 | 206.007 | 5 | -> 🤔 Ak pracujeme s klastrovaním, nesupervidovanou metódou, ktorá nevyžaduje označené údaje, prečo zobrazujeme tieto údaje s označeniami? Počas fázy skúmania údajov sú užitočné, ale pre fungovanie algoritmov klastrovania nie sú potrebné. Mohli by ste rovnako odstrániť hlavičky stĺpcov a odkazovať na údaje podľa čísla stĺpca. +> 🤔 Ak pracujeme so zhlukovaním, nepozorovanou metódou, ktorá nevyžaduje označené dáta, prečo tento údaj zobrazujeme s označeniami? V fáze prieskumu dát sú užitočné, no pre zhlukovacie algoritmy nie sú nevyhnutné. Môžete rovno odstrániť názvy stĺpcov a odkazovať sa na dáta podľa čísel stĺpcov. -Pozrite sa na všeobecné hodnoty údajov. Všimnite si, že popularita môže byť '0', čo ukazuje piesne, ktoré nemajú žiadne hodnotenie. Tieto odstránime čoskoro. +Pozrite sa na všeobecné hodnoty dát. Všimnite si, že popularita môže byť '0', čo ukazuje skladby bez rebríčkovania. Tie čoskoro odstránime. -1. Použite stĺpcový graf na zistenie najpopulárnejších žánrov: +1. Použite barplot, aby ste zistili najpopulárnejšie žánre: ```python import seaborn as sns @@ -225,13 +224,13 @@ Pozrite sa na všeobecné hodnoty údajov. Všimnite si, že popularita môže b plt.title('Top genres',color = 'blue') ``` - ![najpopulárnejšie](../../../../5-Clustering/1-Visualize/images/popular.png) + ![most popular](../../../../translated_images/sk/popular.9c48d84b3386705f.webp) -✅ Ak chcete vidieť viac najlepších hodnôt, zmeňte top `[:5]` na väčšiu hodnotu alebo ho odstráňte, aby ste videli všetky. +✅ Ak si chcete pozrieť viac top hodnôt, zmeňte horný limit `[:5]` na vyššiu hodnotu alebo ho odstráňte a zobrazíte všetko. -Všimnite si, že keď je najlepší žáner opísaný ako 'Missing', znamená to, že Spotify ho neklasifikoval, takže ho odstránime. +Dávajte pozor, keď je top žáner popísaný ako 'Missing', znamená to, že ho Spotify neklasifikovalo, preto ho odstránime. -1. Odstráňte chýbajúce údaje ich filtrovaním +1. Odstráňte chýbajúce dáta ich filtrovaním ```python df = df[df['artist_top_genre'] != 'Missing'] @@ -242,11 +241,11 @@ Všimnite si, že keď je najlepší žáner opísaný ako 'Missing', znamená t plt.title('Top genres',color = 'blue') ``` - Teraz znova skontrolujte žánre: + Teraz opätovne skontrolujte žánre: - ![všetky žánre](../../../../5-Clustering/1-Visualize/images/all-genres.png) + ![most popular](../../../../translated_images/sk/all-genres.1d56ef06cefbfcd6.webp) -1. Tri najlepšie žánre jednoznačne dominujú tejto množine údajov. Zamerajme sa na `afro dancehall`, `afropop` a `nigerian pop`, a navyše filtrovaním odstráňme všetko s hodnotou popularity 0 (čo znamená, že nebolo klasifikované s popularitou v množine údajov a môže byť považované za šum pre naše účely): +1. Zďaleka najdominantnejšie v tomto datasete sú tri žánre. Zamerajme sa na `afro dancehall`, `afropop` a `nigerian pop` a zároveň filtrovať dataset, aby sa odstránilo všetko s hodnotou popularity 0 (čo znamená, že v datasete nebolo zaradené do rebríčka a môže to byť považované za šum): ```python df = df[(df['artist_top_genre'] == 'afro dancehall') | (df['artist_top_genre'] == 'afropop') | (df['artist_top_genre'] == 'nigerian pop')] @@ -258,7 +257,7 @@ Všimnite si, že keď je najlepší žáner opísaný ako 'Missing', znamená t plt.title('Top genres',color = 'blue') ``` -1. Rýchlo otestujte, či údaje korelujú nejakým výrazným spôsobom: +1. Vykonajte rýchly test, či je v dátach nejaká silná korelácia: ```python corrmat = df.corr(numeric_only=True) @@ -266,21 +265,21 @@ Všimnite si, že keď je najlepší žáner opísaný ako 'Missing', znamená t sns.heatmap(corrmat, vmax=.8, square=True) ``` - ![korelácie](../../../../5-Clustering/1-Visualize/images/correlation.png) + ![correlations](../../../../translated_images/sk/correlation.a9356bb798f5eea5.webp) - Jediná silná korelácia je medzi `energy` a `loudness`, čo nie je príliš prekvapujúce, keďže hlasná hudba je zvyčajne dosť energická. Inak sú korelácie relatívne slabé. Bude zaujímavé vidieť, čo s týmito údajmi dokáže algoritmus klastrovania. + Jediná silná korelácia je medzi `energy` a `loudness`, čo nie je prekvapujúce, pretože hlasitá hudba je zvyčajne dosť energická. Inak sú korelácie relatívne slabé. Bude zaujímavé vidieť, čo s týmito dátami dokáže urobiť zhlukovací algoritmus. - > 🎓 Všimnite si, že korelácia neimplikuje kauzalitu! Máme dôkaz o korelácii, ale žiadny dôkaz o kauzalite. [Zábavná webová stránka](https://tylervigen.com/spurious-correlations) obsahuje niekoľko vizuálov, ktoré zdôrazňujú tento bod. + > 🎓 Upozorňujeme, že korelácia neimplikuje príčinnosť! Máme dôkaz korelácie, ale nie dôkaz príčiny. [Zábavná webová stránka](https://tylervigen.com/spurious-correlations) obsahuje vizuály zdôrazňujúce túto tému. -Existuje nejaká konvergencia v tejto množine údajov okolo vnímania popularity a tanečnosti piesne? FacetGrid ukazuje, že existujú sústredné kruhy, ktoré sa zhodujú, bez ohľadu na žáner. Mohlo by to byť tak, že nigérijské chute sa zhodujú na určitej úrovni tanečnosti pre tento žáner? +Existuje nejaká konvergencia v tomto datasete okolo vnímania popularity a tanečnosti skladby? FacetGrid ukazuje, že existujú sústredné kružnice, ktoré sa zhodujú bez ohľadu na žáner. Mohlo by to znamenať, že nigerijské chute sa zbiehajú pri určitej úrovni tanečnosti pre tento žáner? -✅ Vyskúšajte rôzne dátové body (energy, loudness, speechiness) a viac alebo iné hudobné žánre. Čo môžete objaviť? Pozrite sa na tabuľku `df.describe()`, aby ste videli všeobecné rozloženie dátových bodov. +✅ Vyskúšajte rôzne údaje (energy, loudness, speechiness) a viac alebo iné hudobné žánre. Čo môžete objaviť? Pozrite si tabuľku `df.describe()` a všimnite si všeobecné rozloženie dát. -### Cvičenie - rozloženie údajov +### Cvičenie – distribúcia dát -Sú tieto tri žánre významne odlišné vo vnímaní ich tanečnosti na základe ich popularity? +Sú tieto tri žánre výrazne odlišné vnímaním ich tanečnosti na základe popularity? -1. Preskúmajte rozloženie údajov našich troch najlepších žánrov pre popularitu a tanečnosť pozdĺž danej osi x a y. +1. Preskúmajte rozdelenie dát top troch žánrov podľa popularity a tanečnosti na osi x a y. ```python sns.set_theme(style="ticks") @@ -292,15 +291,15 @@ Sú tieto tri žánre významne odlišné vo vnímaní ich tanečnosti na zákla ) ``` - Môžete objaviť sústredné kruhy okolo všeobecného bodu konvergencie, ktoré ukazujú rozloženie bodov. + Môžete objaviť sústredné kružnice okolo všeobecného bodu zbiehania, ktoré ukazujú rozloženie bodov. - > 🎓 Tento príklad používa graf KDE (Kernel Density Estimate), ktorý reprezentuje údaje pomocou spojitej krivky hustoty pravdepodobnosti. To nám umožňuje interpretovať údaje pri práci s viacerými rozloženiami. + > 🎓 Upozorňujeme, že tento príklad používa KDE (odhad hustoty jadra), ktorý reprezentuje dáta pomocou spojitej krivky pravdepodobnosti. To nám umožňuje interpretovať dáta pri práci s viacerými distribúciami. - Vo všeobecnosti sa tri žánre voľne zhodujú, pokiaľ ide o ich popularitu a tanečnosť. Určenie klastrov v týchto voľne zarovnaných údajoch bude výzvou: + Všeobecne sa tri žánre voľne zhodujú v popularite a tanečnosti. Určiť klastry v týchto voľne usporiadaných dátach bude výzvou: - ![rozloženie](../../../../5-Clustering/1-Visualize/images/distribution.png) + ![distribution](../../../../translated_images/sk/distribution.9be11df42356ca95.webp) -1. Vytvorte bodový graf: +1. Vytvorte scatter plot: ```python sns.FacetGrid(df, hue="artist_top_genre", height=5) \ @@ -308,31 +307,33 @@ Sú tieto tri žánre významne odlišné vo vnímaní ich tanečnosti na zákla .add_legend() ``` - Bodový graf rovnakých osí ukazuje podobný vzor konvergencie + Scatterplot pre rovnaké osi ukazuje podobný vzor zbiehania - ![Facetgrid](../../../../5-Clustering/1-Visualize/images/facetgrid.png) + ![Facetgrid](../../../../translated_images/sk/facetgrid.9b2e65ce707eba1f.webp) -Vo všeobecnosti môžete pre klastrovanie použiť bodové grafy na zobrazenie klastrov údajov, takže zvládnutie tohto typu vizualizácie je veľmi užitočné. V ďalšej lekcii použijeme tieto filtrované údaje a použijeme klastrovanie k-means na objavenie skupín v týchto údajoch, ktoré sa zaujímavo prekrývajú. +Všeobecne, pre zhlukovanie môžete použiť scatterploty na znázornenie klastrov dát, takže ovládanie tohto typu vizualizácie je veľmi užitočné. V ďalšej lekcii použijeme tieto filtrované dáta a k-means zhlukovanie na objavenie skupín, ktoré sa zdajú priťahovať zaujímavým spôsobom. --- ## 🚀Výzva -V rámci prípravy na ďalšiu lekciu vytvorte graf o rôznych algoritmoch klastrovania, ktoré by ste mohli objaviť a použiť v produkčnom prostredí. Aké problémy sa klastrovanie snaží riešiť? +Na prípravu na ďalšiu lekciu vytvorte graf o rôznych zhlukovacích algoritmoch, ktoré môžete objaviť a použiť v produkčnom prostredí. Aké problémy sa zhlukovanie snaží riešiť? ## [Kvíz po prednáške](https://ff-quizzes.netlify.app/en/ml/) -## Prehľad a samoštúdium +## Prehľad a samostatné štúdium -Pred aplikáciou algoritmov klastrovania, ako sme sa naučili, je dobré pochopiť povahu vašej množiny údajov. Prečítajte si viac na túto tému [tu](https://www.kdnuggets.com/2019/10/right-clustering-algorithm.html) +Pred použitím zhlukovacích algoritmov, ako sme sa naučili, je dobré porozumieť povahy vášho datasetu. Viac o tejto téme si prečítajte [tu](https://www.kdnuggets.com/2019/10/right-clustering-algorithm.html) -[Tento užitočný článok](https://www.freecodecamp.org/news/8-clustering-algorithms-in-machine-learning-that-all-data-scientists-should-know/) vás prevedie rôznymi spôsobmi, ako sa rôzne algoritmy klastrovania správajú pri rôznych tvaroch údajov. +[Tento užitočný článok](https://www.freecodecamp.org/news/8-clustering-algorithms-in-machine-learning-that-all-data-scientists-should-know/) vás prevedie rôznymi spôsobmi správania sa zhlukovacích algoritmov vzhľadom na rôzne tvary dát. ## Zadanie -[Preskúmajte ďalšie vizualizácie pre klastrovanie](assignment.md) +[Preskúmajte ďalšie vizualizácie pre zhlukovanie](assignment.md) --- -**Upozornenie**: -Tento dokument bol preložený pomocou služby AI prekladu [Co-op Translator](https://github.com/Azure/co-op-translator). Aj keď sa snažíme o presnosť, prosím, berte na vedomie, že automatizované preklady môžu obsahovať chyby alebo nepresnosti. Pôvodný dokument v jeho pôvodnom jazyku by mal byť považovaný za autoritatívny zdroj. Pre kritické informácie sa odporúča profesionálny ľudský preklad. Nie sme zodpovední za akékoľvek nedorozumenia alebo nesprávne interpretácie vyplývajúce z použitia tohto prekladu. \ No newline at end of file + +**Vyhlásenie o zodpovednosti**: +Tento dokument bol preložený pomocou AI prekladateľskej služby [Co-op Translator](https://github.com/Azure/co-op-translator). Hoci sa snažíme o presnosť, vezmite prosím na vedomie, že automatické preklady môžu obsahovať chyby alebo nepresnosti. Pôvodný dokument v jeho natívnom jazyku by mal byť považovaný za autoritatívny zdroj. Pre kritické informácie sa odporúča profesionálny ľudský preklad. Nie sme zodpovední za žiadne nedorozumenia alebo nesprávne interpretácie vyplývajúce z použitia tohto prekladu. + \ No newline at end of file