{ "cells": [ { "cell_type": "markdown", "source": [ "# Väljakutse: Teksti analüüsimine andmeteaduse kohta\n", "\n", "> *Selles märkmikus katsetame erinevate URL-idega – Wikipedia artikkel Masinõppest. Nagu näete, erinevalt Andmeteadusest sisaldab see artikkel palju termineid, mis muudab analüüsi keerukamaks. Peame leiutama teise viisi andmete puhastamiseks pärast märksõnade väljavõtmist, et vabaneda mõnest sagedasest, kuid tähenduseta sõnakombinatsioonist.*\n", "\n", "Selles näites teeme lihtsa harjutuse, mis hõlmab kõiki traditsioonilise andmeteaduse protsessi samme. Sul ei ole vaja koodi kirjutada, võid lihtsalt klõpsata allolevatel lahtritel, et neid käivitada ja tulemust vaadata. Väljakutsena julgustatakse sind seda koodi proovima erinevate andmetega.\n", "\n", "## Eesmärk\n", "\n", "Selles õppetükis oleme arutanud mitmesuguseid andmeteadusega seotud mõisteid. Proovime avastada rohkem seotud mõisteid, tehes **tekstiandmete kaevandamist**. Alustame tekstiga andmeteadusest, võtame sellest märksõnad välja ja proovime seejärel tulemust visualiseerida.\n", "\n", "Tekstina kasutan Wikipedia lehte andmeteadusest:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Samm 1: Andmete hankimine\n", "\n", "Iga andmeteaduse protsessi esimene samm on andmete hankimine. Selle jaoks kasutame `requests` teeki:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "