{ "cells": [ { "cell_type": "markdown", "source": [ "# Haaste: Tekstin analysointi datatieteestä\n", "\n", "Tässä esimerkissä teemme yksinkertaisen harjoituksen, joka kattaa perinteisen datatieteen prosessin kaikki vaiheet. Sinun ei tarvitse kirjoittaa mitään koodia, voit vain klikata alla olevia soluja suorittaaksesi ne ja tarkkailla tulosta. Haasteena on kokeilla tätä koodia eri aineistolla.\n", "\n", "## Tavoite\n", "\n", "Tässä oppitunnissa olemme käsitelleet erilaisia datatieteeseen liittyviä käsitteitä. Yritetään löytää lisää aiheeseen liittyviä käsitteitä tekemällä **tekstin louhintaa**. Aloitamme datatieteestä kertovasta tekstistä, josta poimimme avainsanoja, ja yritämme sitten visualisoida tuloksen.\n", "\n", "Tekstinä käytän Wikipedia-sivua datatieteestä:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Vaihe 1: Tietojen hankinta\n", "\n", "Jokaisen data-analyysin ensimmäinen vaihe on tietojen hankinta. Käytämme siihen `requests`-kirjastoa:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Data science - Wikipedia\n", "