{ "cells": [ { "cell_type": "markdown", "source": [ "# Défi : Analyse de texte sur la science des données\n", "\n", "Dans cet exemple, faisons un exercice simple qui couvre toutes les étapes d'un processus traditionnel de science des données. Vous n'avez pas à écrire de code, vous pouvez simplement cliquer sur les cellules ci-dessous pour les exécuter et observer le résultat. Comme défi, vous êtes encouragé à essayer ce code avec des données différentes.\n", "\n", "## Objectif\n", "\n", "Dans cette leçon, nous avons discuté de différents concepts liés à la science des données. Essayons de découvrir plus de concepts liés en faisant un **extraction de texte**. Nous commencerons par un texte sur la science des données, en extrayant des mots-clés, puis nous tenterons de visualiser le résultat.\n", "\n", "Comme texte, j'utiliserai la page sur la science des données de Wikipedia :\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Étape 1 : Récupération des données\n", "\n", "La première étape dans chaque processus de data science est la récupération des données. Nous allons utiliser la bibliothèque `requests` pour cela :\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Data science - Wikipedia\n", "