{ "cells": [ { "cell_type": "markdown", "source": [ "# Herausforderung: Analyse von Texten über Data Science\n", "\n", "In diesem Beispiel machen wir eine einfache Übung, die alle Schritte eines traditionellen Data-Science-Prozesses abdeckt. Sie müssen keinen Code schreiben, Sie können einfach auf die untenstehenden Zellen klicken, um sie auszuführen und das Ergebnis zu beobachten. Als Herausforderung wird empfohlen, diesen Code mit verschiedenen Daten auszuprobieren.\n", "\n", "## Ziel\n", "\n", "In dieser Lektion haben wir verschiedene Konzepte im Zusammenhang mit Data Science besprochen. Versuchen wir, durch **Text Mining** weitere verwandte Konzepte zu entdecken. Wir beginnen mit einem Text über Data Science, extrahieren Schlüsselwörter daraus und versuchen dann, das Ergebnis zu visualisieren.\n", "\n", "Als Text verwende ich die Seite über Data Science von Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Schritt 1: Die Daten holen\n", "\n", "Der erste Schritt in jedem Data-Science-Prozess ist das Sammeln der Daten. Wir werden dafür die Bibliothek `requests` verwenden:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "