{ "cells": [ { "cell_type": "markdown", "source": [ "# Challenge: Аналіз тексту про Data Science\n", "\n", "У цьому прикладі виконаємо просту вправу, яка охоплює всі етапи традиційного процесу Data Science. Вам не потрібно писати жоден код, ви можете просто натиснути на клітинки нижче, щоб виконати їх і спостерігати результат. Як виклик, вас заохочують спробувати цей код із різними даними.\n", "\n", "## Мета\n", "\n", "У цьому уроці ми обговорювали різні поняття, пов’язані з Data Science. Спробуємо виявити більше пов’язаних понять за допомогою **текстового майнінгу**. Ми почнемо з тексту про Data Science, витягнемо ключові слова з нього, а потім спробуємо візуалізувати результат.\n", "\n", "Як текст я використаю сторінку про Data Science з Вікіпедії:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Крок 1: Отримання даних\n", "\n", "Перший крок у будь-якому процесі аналізу даних — отримання даних. Для цього ми використаємо бібліотеку `requests`:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "