{ "cells": [ { "cell_type": "markdown", "source": [ "# Изазов: Анализа текста о науци о подацима\n", "\n", "> *У овом бележнику експериментишемо са коришћењем различитих URL - Википедијски чланак о Машинском учењу. Можете видети да, за разлику од науке о подацима, овај чланак садржи много термина, што чини анализу проблематичнијом. Морамо смислити други начин да очистимо податке након извлачења кључних речи, како бисмо се избавили од неких често понављајућих, али незначајних комбинација речи.*\n", "\n", "У овом примеру, хајде да урадимо једноставан задатак који покрива све кораке традиционалног процеса науке о подацима. Не морате писати никакав код, можете једноставно кликнути на ћелије испод да их извршите и посматрате резултат. Као изазов, охрабрени сте да испробате овај код са другачијим подацима.\n", "\n", "## Циљ\n", "\n", "У овој лекцији смо разговарали о различитим концептима повезаним са науком о подацима. Покушајмо да откријемо још сродних концепата радећи неку врсту **текстуалне анализе**. Почећемо са текстом о науци о подацима, извући кључне речи из њега, а потом покушати да визуелизујемо резултат.\n", "\n", "Као текст, користићу страницу о науци о подацима са Википедије:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: Преузимање података\n", "\n", "Први корак у сваком процесу науке о подацима је преузимање података. Користићемо библиотеку `requests` за то:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "