{ "cells": [ { "cell_type": "markdown", "source": [ "# Väljakutse: Teksti analüüs andmeteaduse kohta\n", "\n", "Selles näites teeme lihtsa harjutuse, mis hõlmab kõiki traditsioonilise andmeteaduse protsessi samme. Sul ei ole vaja kirjutada koodi, saad lihtsalt klõpsata allolevatel lahtritel, et need käivitada ja tulemust vaadata. Väljakutsena oled julgustatud proovima seda koodi erinevate andmetega.\n", "\n", "## Eesmärk\n", "\n", "Selles õppetükis oleme käsitlenud erinevaid andmeteadusega seotud kontseptsioone. Proovime avastada rohkem seotud mõisteid, tehes **tekstiandmete kaevandamist**. Alustame andmeteaduse teemalisest tekstist, ekstraheerime sellest märksõnad ja seejärel proovime tulemust visualiseerida.\n", "\n", "Tekstina kasutan Wikipedia lehte andmeteaduse kohta:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Samm 1: Andmete hankimine\n", "\n", "Iga andmeteaduse protsessi esimene samm on andmete hankimine. Selleks kasutame `requests` raamatukogu:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "