{ "cells": [ { "cell_type": "markdown", "source": [ "# Задача: Анализ текста о науке о данных\n", "\n", "В этом примере давайте выполним простое упражнение, охватывающее все этапы традиционного процесса науки о данных. Вам не нужно писать никакой код, вы можете просто нажимать на ячейки ниже, чтобы выполнить их и наблюдать результат. В качестве задания вам предлагается попробовать этот код с разными данными.\n", "\n", "## Цель\n", "\n", "В этом уроке мы обсуждали различные концепции, связанные с наукой о данных. Давайте попробуем обнаружить больше связанных концепций, сделав немного **текстового анализа**. Мы начнем с текста о науке о данных, извлечем из него ключевые слова и затем попробуем визуализировать результат.\n", "\n", "В качестве текста я использую страницу о науке о данных из Википедии:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: Получение данных\n", "\n", "Первый шаг в каждом процессе обработки данных — получение данных. Мы будем использовать библиотеку `requests` для этого:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Data science - Wikipedia\n", "