{ "cells": [ { "cell_type": "markdown", "source": [ "# Challenge : Analyse de texte sur la science des données\n", "\n", "> *Dans ce notebook, nous expérimentons l'utilisation d'une URL différente - article Wikipédia sur l'apprentissage automatique. Vous pouvez voir que, contrairement à la science des données, cet article contient beaucoup de termes, ce qui rend l'analyse plus problématique. Nous devons trouver un autre moyen de nettoyer les données après l'extraction des mots-clés, pour éliminer certaines combinaisons de mots fréquentes, mais sans signification.*\n", "\n", "Dans cet exemple, faisons un exercice simple qui couvre toutes les étapes d'un processus traditionnel de science des données. Vous n'avez pas besoin d'écrire du code, vous pouvez simplement cliquer sur les cellules ci-dessous pour les exécuter et observer le résultat. En guise de défi, nous vous encourageons à essayer ce code avec des données différentes.\n", "\n", "## Objectif\n", "\n", "Dans cette leçon, nous avons discuté de différents concepts liés à la science des données. Essayons de découvrir plus de concepts connexes en faisant un **text mining**. Nous commencerons par un texte sur la science des données, en extrayant des mots-clés, puis nous tenterons de visualiser le résultat.\n", "\n", "Comme texte, j'utiliserai la page sur la science des données de Wikipédia :\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Étape 1 : Récupération des données\n", "\n", "La première étape dans tout processus de science des données est la récupération des données. Nous allons utiliser la bibliothèque `requests` pour cela :\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "