{ "cells": [ { "cell_type": "markdown", "source": [ "# Haaste: Tekstin analysointi liittyen datatieteeseen\n", "\n", "> *Tässä muistikirjassa kokeilemme eri URL-osoitteiden käyttöä - Wikipedia-artikkelia koneoppimisesta. Voitte huomata, että toisin kuin datatieteessä, tässä artikkelissa on paljon termejä, mikä tekee analyysistä haastavampaa. Meidän täytyy keksiä toinen tapa puhdistaa dataa avainsanojen poimimisen jälkeen, jotta pääsemme eroon yleisistä, mutta ei merkityksellisistä sanayhdistelmistä.*\n", "\n", "Tässä esimerkissä tehdään yksinkertainen harjoitus, joka kattaa kaikki perinteisen datatieteen prosessin vaiheet. Sinun ei tarvitse kirjoittaa koodia, voit vain klikata alla olevia soluja suorittaaksesi ne ja tarkastella tulosta. Haasteena sinua kannustetaan kokeilemaan tätä koodia erilaisilla datoilla.\n", "\n", "## Tavoite\n", "\n", "Tässä oppitunnissa olemme keskustelleet eri käsitteistä, jotka liittyvät datatieteeseen. Yritetään löytää lisää aiheeseen liittyviä käsitteitä tekemällä **tekstin louhintaa**. Aloitamme datatieteestä kertovalla tekstillä, poimimme siitä avainsanoja ja pyrimme sitten visualisoimaan tuloksen.\n", "\n", "Tekstiksi käytän Wikipedia-sivua datatieteestä:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Vaihe 1: Datan hankinta\n", "\n", "Jokaisen data-analyysin ensimmäinen vaihe on datan hankinta. Käytämme siihen `requests`-kirjastoa:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "