{ "cells": [ { "cell_type": "markdown", "source": [ "# Hamon: Pagsusuri ng Teksto tungkol sa Agham ng Datos\n", "\n", "Sa halimbawa na ito, gawin natin ang isang simpleng ehersisyo na sumasaklaw sa lahat ng hakbang ng isang tradisyunal na proseso ng agham ng datos. Hindi mo kailangang magsulat ng anumang code, maaari mo lamang i-click ang mga cell sa ibaba upang patakbuhin ang mga ito at obserbahan ang resulta. Bilang isang hamon, hinihikayat kang subukan ang code na ito sa iba't ibang datos.\n", "\n", "## Layunin\n", "\n", "Sa leksyon na ito, tinalakay natin ang iba't ibang konsepto na may kaugnayan sa Agham ng Datos. Subukan nating tuklasin pa ang mga kaugnay na konsepto sa pamamagitan ng paggawa ng **text mining**. Magsisimula tayo sa isang teksto tungkol sa Agham ng Datos, kukuha ng mga keyword mula dito, at pagkatapos ay susubukan nating ipakita ang resulta.\n", "\n", "Bilang teksto, gagamitin ko ang pahina tungkol sa Agham ng Datos mula sa Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: Pagkuha ng Data\n", "\n", "Ang unang hakbang sa bawat proseso ng data science ay ang pagkuha ng data. Gagamitin natin ang library na `requests` para gawin ito:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "