{ "cells": [ { "cell_type": "markdown", "source": [ "# Väljakutse: Teksti analüüs andmeteaduse kohta\n", "\n", "Selles näites teeme lihtsa harjutuse, mis hõlmab kõiki traditsioonilise andmeteaduse protsessi samme. Koodi kirjutamine pole vajalik, saate lihtsalt allolevaid lahtrid klõpsata, et neid käivitada ja tulemust jälgida. Väljakutsena julgustatakse teid proovima seda koodi erinevate andmetega.\n", "\n", "## Eesmärk\n", "\n", "Selles õppetunnis oleme arutanud erinevaid andmeteadusega seotud mõisteid. Proovime avastada rohkem seotud mõisteid, tehes **teksti kaevandamist**. Alustame andmeteaduse teemalisest tekstist, eraldame sellest märksõnad ja proovime seejärel tulemust visualiseerida.\n", "\n", "Tekstina kasutan Wikipedia lehte andmeteaduse kohta:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Samm 1: Andmete hankimine\n", "\n", "Iga andmeteaduse protsessi esimene samm on andmete hankimine. Selleks kasutame `requests` teeki:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "