{ "cells": [ { "cell_type": "markdown", "source": [ "# Väljakutse: Teksti analüüs andmeteaduse kohta\n", "\n", "> *Selles märkmikus katsetame erinevate URL-idega - Wikipedia artikkel masinõppe kohta. Nagu näha, sisaldab see artikkel, erinevalt andmeteadusest, palju termineid, mis muudab analüüsi keerulisemaks. Peame leidma teise viisi andmete puhastamiseks pärast märksõnade eraldamist, et vabaneda mõningatest sagedastest, kuid mitte tähenduslikest sõnakombinatsioonidest.*\n", "\n", "Selles näites teeme lihtsa harjutuse, mis hõlmab kõiki traditsioonilise andmeteaduse protsessi samme. Sa ei pea ise koodi kirjutama, võid lihtsalt klõpsata allolevatel lahtritel, et neid käivitada ja tulemust jälgida. Väljakutsena soovitame sul proovida seda koodi erinevate andmetega.\n", "\n", "## Eesmärk\n", "\n", "Selles tunnis oleme arutanud erinevaid andmeteadusega seotud mõisteid. Proovime avastada rohkem seotud mõisteid, tehes **teksti kaevandamist**. Alustame tekstiga andmeteaduse kohta, eraldame sellest märksõnad ja proovime seejärel tulemust visualiseerida.\n", "\n", "Tekstina kasutan Wikipedia lehte andmeteaduse kohta:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Samm 1: Andmete hankimine\n", "\n", "Esimene samm igas andmeteaduse protsessis on andmete hankimine. Selleks kasutame `requests` teeki:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "