{ "cells": [ { "cell_type": "markdown", "source": [ "# Виклик: Аналіз тексту про науку про дані\n", "\n", "> *У цій записній книжці ми експериментуємо з використанням різних URL - стаття Вікіпедії про Машинне навчання. Ви можете помітити, що на відміну від Науки про дані, ця стаття містить багато термінів, що ускладнює аналіз. Нам потрібно придумати інший спосіб очищення даних після вилучення ключових слів, щоб позбутися деяких частих, але незначущих словосполучень.*\n", "\n", "У цьому прикладі зробимо просту вправу, що охоплює всі кроки традиційного процесу науки про дані. Вам не потрібно писати жодного коду, ви можете просто клацнути по комірках нижче, щоб виконати їх і спостерігати результат. Для виклику вам рекомендується спробувати цей код із різними даними.\n", "\n", "## Мета\n", "\n", "У цьому уроці ми обговорювали різні поняття, пов’язані з Наукою про дані. Спробуємо відкрити більше пов’язаних понять, використовуючи **текстовий майнінг**. Почнемо з тексту про Науку про дані, вилучимо з нього ключові слова, а потім спробуємо візуалізувати результат.\n", "\n", "Як текст я використаю сторінку про Науку про дані з Вікіпедії:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Крок 1: Отримання даних\n", "\n", "Перший крок у кожному процесі наукових досліджень даних — це отримання даних. Для цього ми використаємо бібліотеку `requests`:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "