{ "cells": [ { "cell_type": "markdown", "source": [ "# Utmaning: Analysera text om datavetenskap\n", "\n", "I detta exempel ska vi göra en enkel övning som täcker alla steg i en traditionell datavetenskapsprocess. Du behöver inte skriva någon kod, du kan bara klicka på cellerna nedan för att köra dem och observera resultatet. Som en utmaning uppmuntras du att prova denna kod med olika data.\n", "\n", "## Mål\n", "\n", "I denna lektion har vi diskuterat olika begrepp relaterade till datavetenskap. Låt oss försöka upptäcka fler relaterade begrepp genom att göra lite **textgruvdrift**. Vi börjar med en text om datavetenskap, extraherar nyckelord från den och försöker sedan visualisera resultatet.\n", "\n", "Som text kommer jag använda sidan om datavetenskap från Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Steg 1: Hämta data\n", "\n", "Första steget i varje datavetenskapsprocess är att hämta data. Vi kommer att använda biblioteket `requests` för att göra det:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "