{ "cells": [ { "cell_type": "markdown", "source": [ "# Предизвикателство: Анализ на текст за Данни Наука\n", "\n", "> *В този бележник експериментираме с използването на различен URL - статия от Уикипедия за Машинно Обучение. Можете да видите, че за разлика от Данни Наука, тази статия съдържа много термини, което прави анализа по-проблематичен. Трябва да измислим друг начин за изчистване на данните след извличането на ключови думи, за да се отървем от някои чести, но незначими комбинации от думи.*\n", "\n", "В този пример нека направим просто упражнение, което обхваща всички стъпки на традиционния процес на наука за данни. Не е нужно да пишете код, можете просто да кликнете върху клетките по-долу, за да ги изпълните и да наблюдавате резултата. Като предизвикателство, насърчаваме ви да опитате този код с различни данни.\n", "\n", "## Цел\n", "\n", "В този урок обсъждахме различни концепции, свързани с Данни Наука. Нека опитаме да открием още свързани концепции чрез **текстов минен анализ**. Ще започнем с текст за Данни Наука, ще извлечем ключови думи от него и след това ще се опитаме да визуализираме резултата.\n", "\n", "Като текст ще използвам страницата за Данни Наука от Уикипедия:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Стъпка 1: Получаване на данните\n", "\n", "Първата стъпка във всеки процес на анализ на данни е получаването на данните. Ще използваме библиотеката `requests` за това:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "