{ "cells": [ { "cell_type": "markdown", "source": [ "# Izazov: Analiza teksta o znanosti o podacima\n", "\n", "> *U ovom bilježniku eksperimentiramo s korištenjem različitih URL-ova - Wikipedijska stranica o strojnome učenju. Možete vidjeti da, za razliku od Znanosti o podacima, ovaj članak sadrži mnogo termina, što čini analizu problematičnijom. Moramo smisliti drugi način čišćenja podataka nakon vađenja ključnih riječi kako bismo se riješili nekih čestih, ali nevažnih kombinacija riječi.*\n", "\n", "U ovom primjeru, napravimo jednostavnu vježbu koja pokriva sve korake tradicionalnog procesa znanosti o podacima. Ne morate pisati nikakav kod, možete samo kliknuti na ćelije ispod da ih izvršite i promatrate rezultat. Kao izazov, potičemo vas da isprobate ovaj kod s različitim podacima.\n", "\n", "## Cilj\n", "\n", "U ovoj lekciji raspravljali smo o različitim konceptima vezanim uz znanost o podacima. Pokušajmo otkriti više povezanih pojmova radeći **rudarenje teksta**. Počet ćemo s tekstom o znanosti o podacima, iz njega izvući ključne riječi, a zatim pokušati vizualizirati rezultat.\n", "\n", "Kao tekst koristit ću stranicu o znanosti o podacima s Wikipedije:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Korak 1: Preuzimanje podataka\n", "\n", "Prvi korak u svakom procesu znanosti o podacima je preuzimanje podataka. Koristit ćemo biblioteku `requests` za to:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "