{ "cells": [ { "cell_type": "markdown", "source": [ "# Iššūkis: Teksto apie duomenų mokslą analizė\n", "\n", "> *Šiame užrašų knygelyje eksperimentuojame naudodami skirtingus URL – „Wikipedia“ straipsnį apie mašininį mokymąsi. Galite pastebėti, kad, skirtingai nuo Duomenų mokslo, šiame straipsnyje yra daug terminų, todėl analizė tampa sudėtingesnė. Turime sugalvoti kitą būdą, kaip išvalyti duomenis po raktinių žodžių išgavimų, kad atsikratytume dažnų, tačiau nereikšmingų žodžių junginių.*\n", "\n", "Šiame pavyzdyje atliksime paprastą pratimą, apimantį visas tradicinio duomenų mokslo proceso etapas. Jums nereikia rašyti jokio kodo, galite tiesiog spustelėti žemiau esančias ląsteles, kad jas įvykdytumėte ir pamatytumėte rezultatą. Kaip iššūkį, skatiname išbandyti šį kodą su skirtingais duomenimis.\n", "\n", "## Tikslas\n", "\n", "Šioje pamokoje aptarėme skirtingas su Duomenų mokslu susijusias sąvokas. Pabandykime atrasti daugiau susijusių sąvokų atlikdami **teksto kasybą**. Pradėsime nuo teksto apie Duomenų mokslą, iš jo ištrauksime raktinius žodžius, o tada pabandysime vizualizuoti rezultatą.\n", "\n", "Kaip tekstą naudosiu puslapį apie Duomenų mokslą iš Vikipedijos:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## 1 žingsnis: Duomenų gavimas\n", "\n", "Pirmas žingsnis kiekviename duomenų mokslo procese yra duomenų gavimas. Tam naudosime `requests` biblioteką:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "