{ "cells": [ { "cell_type": "markdown", "source": [ "# Udfordring: Analyse af tekst om datalogi\n", "\n", "I dette eksempel laver vi en simpel øvelse, der dækker alle trin i en traditionel datalogiproces. Du behøver ikke at skrive nogen kode, du kan blot klikke på cellerne nedenfor for at køre dem og observere resultatet. Som en udfordring opfordres du til at prøve denne kode med forskellige data.\n", "\n", "## Mål\n", "\n", "I denne lektion har vi diskuteret forskellige begreber relateret til datalogi. Lad os prøve at opdage flere relaterede begreber ved at lave noget **tekstmining**. Vi starter med en tekst om datalogi, udtrækker nøgleord fra den og prøver derefter at visualisere resultatet.\n", "\n", "Som tekst vil jeg bruge siden om datalogi fra Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Trin 1: Hent dataene\n", "\n", "Første trin i enhver data science-proces er at hente dataene. Vi vil bruge `requests` biblioteket til det:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "