{ "cells": [ { "cell_type": "markdown", "source": [ "# Hamon: Pagsusuri ng Teksto tungkol sa Data Science\n", "\n", "> *Sa notebook na ito, sinubukan naming gumamit ng iba't ibang URL - wikipedia na artikulo tungkol sa Machine Learning. Makikita mo na, hindi tulad ng Data Science, ang artikulong ito ay naglalaman ng maraming termino, kaya mas nagiging problema ang pagsusuri. Kailangan nating maghanap ng ibang paraan upang linisin ang data pagkatapos gawin ang keyword extraction, upang matanggal ang ilang madalas ngunit walang kahulugang kombinasyon ng mga salita.*\n", "\n", "Sa halimbawang ito, gawin natin ang isang simpleng ehersisyo na sumasaklaw sa lahat ng mga hakbang ng tradisyonal na proseso ng data science. Hindi mo kailangang magsulat ng anumang code, maaari mo lamang i-click ang mga cell sa ibaba upang patakbuhin ang mga ito at obserbahan ang resulta. Bilang isang hamon, hinihikayat kang subukan ang code na ito gamit ang iba't ibang data.\n", "\n", "## Layunin\n", "\n", "Sa araling ito, tinalakay natin ang iba't ibang konsepto na may kaugnayan sa Data Science. Subukan nating tuklasin ang mas marami pang kaugnay na konsepto sa pamamagitan ng paggawa ng **text mining**. Magsisimula tayo sa isang teksto tungkol sa Data Science, kukunin ang mga keyword mula dito, at pagkatapos ay susubukan nating i-visualize ang resulta.\n", "\n", "Bilang teksto, gagamitin ko ang pahina tungkol sa Data Science mula sa Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: Pagkuha ng Data\n", "\n", "Unang hakbang sa bawat proseso ng data science ay ang pagkuha ng data. Gagamit tayo ng `requests` na library para gawin iyon:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "