{ "cells": [ { "cell_type": "markdown", "source": [ "# Предизвикателство: Анализ на текст за дата сайънс\r\n", "\r\n", "В този пример, нека направим просто упражнение, покриващо всички стъпки на традиционния процес на дата сайънс. Не е необходимо да пишете код, просто можете да кликнете върху клетките по-долу, за да ги изпълните и да наблюдавате резултата. Като предизвикателство, се насърчавате да опитате този код с различни данни.\r\n", "\r\n", "## Цел\r\n", "\r\n", "В този урок обсъждахме различни концепции, свързани с дата сайънс. Нека опитаме да открием още свързани концепции чрез **текстов минен анализ**. Ще започнем с текст за дата сайънс, ще извлечем ключови думи от него и после ще опитаме да визуализираме резултата.\r\n", "\r\n", "Като текст ще използвам страницата за Data Science от Уикипедия:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Стъпка 1: Получаване на данните\n", "\n", "Първата стъпка във всеки процес на наука за данните е получаването на данните. Ще използваме библиотеката `requests` за тази цел:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "