{ "cells": [ { "cell_type": "markdown", "source": [ "# Desafio: Analisar Texto sobre Ciência de Dados\n", "\n", "Neste exemplo, vamos fazer um exercício simples que cobre todos os passos de um processo tradicional de ciência de dados. Não precisa escrever código, pode simplesmente clicar nas células abaixo para as executar e observar o resultado. Como desafio, é incentivado que experimente este código com dados diferentes.\n", "\n", "## Objetivo\n", "\n", "Nesta aula, temos discutido vários conceitos relacionados com Ciência de Dados. Vamos tentar descobrir mais conceitos relacionados fazendo alguma **mineração de texto**. Vamos começar com um texto sobre Ciência de Dados, extrair palavras-chave dele e depois tentar visualizar o resultado.\n", "\n", "Como texto, vou usar a página sobre Ciência de Dados da Wikipédia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: Obter os Dados\n", "\n", "O primeiro passo em todo o processo de ciência de dados é obter os dados. Vamos usar a biblioteca `requests` para isso:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "