{ "cells": [ { "cell_type": "markdown", "source": [ "# Uitdaging: Tekstanalyse over Data Science\n", "\n", "In dit voorbeeld doen we een eenvoudige oefening die alle stappen van een traditioneel data science-proces beslaat. Je hoeft geen code te schrijven, je kunt gewoon op de cellen hieronder klikken om ze uit te voeren en het resultaat te observeren. Als uitdaging wordt je aangemoedigd om deze code uit te proberen met verschillende gegevens.\n", "\n", "## Doel\n", "\n", "In deze les hebben we verschillende concepten met betrekking tot Data Science besproken. Laten we proberen meer gerelateerde concepten te ontdekken door wat **text mining** te doen. We beginnen met een tekst over Data Science, halen er sleutelwoorden uit, en proberen vervolgens het resultaat te visualiseren.\n", "\n", "Als tekst zal ik de pagina over Data Science van Wikipedia gebruiken:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Stap 1: De gegevens ophalen\n", "\n", "De eerste stap in elk data science proces is het ophalen van de gegevens. We zullen hiervoor de `requests`-bibliotheek gebruiken:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Data science - Wikipedia\n", "