{ "cells": [ { "cell_type": "markdown", "source": [ "# Kihívás: Szövegelemzés az adattudományról\n", "\n", "> *Ebben a jegyzetfüzetben különböző URL-eket – a gépi tanulásról szóló Wikipédia cikket – próbálunk ki. Látható, hogy az Adattudományhoz képest ez a cikk sok kifejezést tartalmaz, ami problémásabbá teszi az elemzést. Ki kell találnunk egy másik módszert az adatok megtisztítására a kulcsszókinyerés után, hogy megszabaduljunk néhány gyakori, de nem jelentős szókapcsolattól.*\n", "\n", "Ebben a példában egy egyszerű gyakorlatot végzünk, amely lefedi a hagyományos adattudományi folyamat minden lépését. Nem kell kódot írnia, csak kattintson az alábbi cellákra a végrehajtásukhoz, és figyelje az eredményt. Kihívásként arra ösztönzünk, hogy próbálja ki ezt a kódot más adatokkal is.\n", "\n", "## Cél\n", "\n", "Ebben a leckében különböző, az adattudományhoz kapcsolódó fogalmakról beszéltünk. Próbáljunk meg több kapcsolódó fogalmat felfedezni szövegbányászattal. Kezdjük egy adattudományról szóló szöveggel, nyerjünk ki kulcsszavakat, majd próbáljuk meg megjeleníteni az eredményt.\n", "\n", "Szövegként az adattudományról szóló Wikipédia oldalt fogom használni:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## 1. lépés: Az adatok beszerzése\n", "\n", "Minden adat tudományi folyamat első lépése az adatok beszerzése. Ehhez a `requests` könyvtárat fogjuk használni:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "