{ "cells": [ { "cell_type": "markdown", "source": [ "# Izziv: Analiza besedila o podatkovni znanosti\n", "\n", "> *V tem zvezku preizkušamo uporabo različnih URL - Wikipedije članek o strojnem učenju. Vidite lahko, da ta članek, v nasprotju s podatkovno znanostjo, vsebuje veliko izrazov, zaradi česar je analiza bolj problematična. Potrebujemo drugačen način čiščenja podatkov po izvleku ključnih besed, da se znebimo nekaterih pogostih, a nepomembnih besednih zvez.*\n", "\n", "V tem primeru naredimo preprosto vajo, ki pokriva vse korake tradicionalnega procesa podatkovne znanosti. Ni vam treba pisati kode, lahko samo kliknete na celice spodaj, da jih izvedete in opazujete rezultat. Kot izziv ste povabljeni, da poskusite to kodo z različnimi podatki.\n", "\n", "## Cilj\n", "\n", "V tej lekciji smo razpravljali o različnih konceptih, povezanih s podatkovno znanostjo. Poskusimo odkriti več povezanih konceptov z izvajanjem **rudarjenja besedila**. Začeli bomo z besedilom o podatkovni znanosti, iz njega izvlekli ključne besede in nato poskusili vizualizirati rezultat.\n", "\n", "Kot besedilo bom uporabil stran o podatkovni znanosti z Wikipedije:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## 1. korak: Pridobitev podatkov\n", "\n", "Prvi korak v vsakem procesu podatkovne znanosti je pridobitev podatkov. Za to bomo uporabili knjižnico `requests`:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "