{ "cells": [ { "cell_type": "markdown", "source": [ "# Výzva: Analýza textu o dátovej vede\n", "\n", "> *V tomto zošite experimentujeme s použitím rôznych URL - wikipedická stránka o strojovom učení. Vidíte, že na rozdiel od Dátovej vedy tento článok obsahuje veľa termínov, čo analýzu sťažuje. Potrebujeme prísť na iný spôsob, ako vyčistiť údaje po extrahovaní kľúčových slov, aby sme sa zbavili niektorých častých, ale bezvýznamných slovných spojení.*\n", "\n", "V tomto príklade si urobíme jednoduché cvičenie, ktoré pokrýva všetky kroky tradičného procesu dátovej vedy. Nemusíte písať žiadny kód, môžete len kliknúť na bunky nižšie, spustiť ich a pozorovať výsledok. Ako výzvu vás povzbudzujeme vyskúšať tento kód s rôznymi dátami.\n", "\n", "## Cieľ\n", "\n", "V tejto lekcii sme diskutovali o rôznych konceptoch súvisiacich s Dátovou vedou. Skúsme objaviť viac súvisiacich konceptov pomocou **text mining**. Začneme s textom o Dátovej vede, extrahujeme z neho kľúčové slová a potom sa pokúsime výsledok vizualizovať.\n", "\n", "Ako text použijem stránku o Dátovej vede z Wikipédie:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Krok 1: Získanie dát\n", "\n", "Prvým krokom v každom procese dátovej vedy je získanie dát. Použijeme na to knižnicu `requests`:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "