{ "cells": [ { "cell_type": "markdown", "source": [ "# Herausforderung: Analyse von Texten über Data Science\n", "\n", "> *In diesem Notizbuch experimentieren wir mit der Verwendung verschiedener URLs – Wikipedia-Artikel über Maschinelles Lernen. Sie können sehen, dass im Gegensatz zu Data Science dieser Artikel viele Begriffe enthält, was die Analyse problematischer macht. Wir müssen nach der Schlüsselwortextraktion einen anderen Weg finden, die Daten zu bereinigen, um einige häufige, aber nicht aussagekräftige Wortkombinationen zu entfernen.*\n", "\n", "In diesem Beispiel machen wir eine einfache Übung, die alle Schritte eines traditionellen Data-Science-Prozesses abdeckt. Sie müssen keinen Code schreiben, Sie können einfach die Zellen unten anklicken, um sie auszuführen und das Ergebnis zu beobachten. Als Herausforderung sind Sie eingeladen, diesen Code mit anderen Daten auszuprobieren.\n", "\n", "## Ziel\n", "\n", "In dieser Lektion haben wir verschiedene Konzepte rund um Data Science besprochen. Versuchen wir, weitere verwandte Konzepte durch **Text Mining** zu entdecken. Wir beginnen mit einem Text über Data Science, extrahieren Schlüsselwörter daraus und versuchen dann, das Ergebnis zu visualisieren.\n", "\n", "Als Text verwende ich die Seite über Data Science von Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Schritt 1: Datenbeschaffung\n", "\n", "Der erste Schritt in jedem Data-Science-Prozess ist die Beschaffung der Daten. Wir verwenden dafür die Bibliothek `requests`:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "