{ "cells": [ { "cell_type": "markdown", "source": [ "# Wyzwanie: Analiza tekstu o Data Science\n", "\n", "> *W tym notatniku eksperymentujemy z użyciem różnych URL – artykułu z Wikipedii na temat Machine Learning. Możesz zauważyć, że w przeciwieństwie do Data Science, ten artykuł zawiera wiele terminów, co utrudnia analizę. Musimy więc wymyślić inny sposób oczyszczania danych po ekstrakcji słów kluczowych, aby pozbyć się niektórych często występujących, lecz nieważnych kombinacji słów.*\n", "\n", "W tym przykładzie wykonajmy proste ćwiczenie obejmujące wszystkie etapy tradycyjnego procesu data science. Nie musisz pisać żadnego kodu – możesz po prostu kliknąć na poniższe komórki, aby je wykonać i zaobserwować rezultat. Jako wyzwanie zachęcam do wypróbowania tego kodu na różnych danych.\n", "\n", "## Cel\n", "\n", "W tej lekcji omawialiśmy różne koncepcje związane z Data Science. Spróbujmy odkryć więcej powiązanych koncepcji, wykonując **eksplorację tekstu**. Zaczniemy od tekstu o Data Science, wyekstrahujemy z niego słowa kluczowe, a następnie spróbujemy zwizualizować wynik.\n", "\n", "Jako tekst wykorzystam stronę Wikipedii o Data Science:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Krok 1: Pobieranie danych\n", "\n", "Pierwszym krokiem w każdym procesie analizy danych jest pobranie danych. Do tego użyjemy biblioteki `requests`:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "