{ "cells": [ { "cell_type": "markdown", "source": [ "# Izazov: Analiza teksta o znanosti o podacima\r\n", "\r\n", "U ovom primjeru, napravimo jednostavnu vježbu koja pokriva sve korake tradicionalnog procesa znanosti o podacima. Ne morate pisati nikakav kod, možete jednostavno kliknuti na ćelije u nastavku da ih izvršite i promatrate rezultat. Kao izazov, potičemo vas da isprobate ovaj kod s različitim podacima. \r\n", "\r\n", "## Cilj\r\n", "\r\n", "U ovoj lekciji raspravljali smo o različitim pojmovima vezanim uz znanost o podacima. Pokušajmo otkriti još povezanih pojmova radeći **rudarenje teksta**. Počet ćemo s tekstom o znanosti o podacima, izvući ključne riječi iz njega, a zatim pokušati vizualizirati rezultat.\r\n", "\r\n", "Kao tekst, koristit ću stranicu o znanosti o podacima s Wikipedije:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Korak 1: Dobivanje Podataka\n", "\n", "Prvi korak u svakom procesu znanosti o podacima je dobivanje podataka. Koristit ćemo biblioteku `requests` za to:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "