{ "cells": [ { "cell_type": "markdown", "source": [ "# Uitdaging: Tekstanalyse over Data Science\n", "\n", "> *In dit notitieboekje experimenteren we met het gebruik van een andere URL - Wikipedia-artikel over Machine Learning. Je ziet dat, in tegenstelling tot Data Science, dit artikel veel termen bevat, wat de analyse problematischer maakt. We moeten een andere manier bedenken om de data op te schonen na het uitvoeren van keyword-extractie, om van sommige frequente, maar niet-zo-betekenisvolle woordcombinaties af te komen.*\n", "\n", "In dit voorbeeld doen we een eenvoudige oefening die alle stappen van een traditioneel data science-proces omvat. Je hoeft geen code te schrijven; je kunt gewoon op de cellen hieronder klikken om ze uit te voeren en het resultaat te bekijken. Als uitdaging wordt je aangemoedigd om deze code met andere data uit te proberen.\n", "\n", "## Doel\n", "\n", "In deze les hebben we verschillende concepten besproken die gerelateerd zijn aan Data Science. Laten we proberen meer gerelateerde concepten te ontdekken door wat **tekstmining** toe te passen. We beginnen met een tekst over Data Science, halen er keywords uit, en proberen daarna het resultaat te visualiseren.\n", "\n", "Als tekst gebruik ik de pagina over Data Science van Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Stap 1: De gegevens verkrijgen\n", "\n", "De eerste stap in elk datawetenschapsproces is het verkrijgen van de gegevens. We zullen de `requests`-bibliotheek gebruiken om dat te doen:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "