{ "cells": [ { "cell_type": "markdown", "source": [ "# Udfordring: Analyse af tekst om datalogi\n", "\n", "> *I denne notesbog eksperimenterer vi med at bruge forskellige URL'er - wikipedia-artikel om maskinlæring. Du kan se, at i modsætning til datalogi indeholder denne artikel mange termer, hvilket gør analysen mere problematisk. Vi er nødt til at finde en anden måde at rydde op i dataene på efter nøgleordsudtrækning for at slippe af med nogle hyppige, men ikke meningsfulde ordkombinationer.*\n", "\n", "I dette eksempel laver vi en simpel øvelse, der dækker alle trin i en traditionel datalogi-proces. Du behøver ikke skrive nogen kode, du kan bare klikke på cellerne nedenfor for at køre dem og observere resultatet. Som en udfordring opfordres du til at prøve denne kode med forskellige data.\n", "\n", "## Mål\n", "\n", "I denne lektion har vi diskuteret forskellige begreber relateret til datalogi. Lad os prøve at opdage flere relaterede begreber ved at lave noget **tekstmining**. Vi starter med en tekst om datalogi, udtrækker nøgleord fra den, og forsøger derefter at visualisere resultatet.\n", "\n", "Som tekst vil jeg bruge siden om datalogi fra Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Trin 1: Hente dataene\n", "\n", "Første trin i enhver data science-proces er at hente dataene. Vi vil bruge `requests` biblioteket til det:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "