{ "cells": [ { "cell_type": "markdown", "source": [ "# Cabaran: Menganalisis Teks tentang Sains Data\n", "\n", "> *Dalam buku nota ini, kami bereksperimen dengan menggunakan URL berbeza - artikel wikipedia mengenai Pembelajaran Mesin. Anda boleh melihat bahawa, tidak seperti Sains Data, artikel ini mengandungi banyak istilah, yang menjadikan analisis lebih bermasalah. Kita perlu mencari cara lain untuk membersihkan data selepas melakukan pengekstrakan kata kunci, untuk menyingkirkan beberapa kombinasi perkataan yang kerap tetapi tidak bermakna.*\n", "\n", "Dalam contoh ini, mari kita lakukan latihan mudah yang merangkumi semua langkah proses sains data tradisional. Anda tidak perlu menulis sebarang kod, anda hanya boleh klik pada sel di bawah untuk menjalankannya dan melihat hasilnya. Sebagai cabaran, anda digalakkan mencuba kod ini dengan data yang berbeza.\n", "\n", "## Matlamat\n", "\n", "Dalam pelajaran ini, kita telah membincangkan pelbagai konsep berkaitan dengan Sains Data. Mari cuba untuk menemui lebih banyak konsep berkaitan dengan melakukan **perlombongan teks**. Kita akan bermula dengan teks tentang Sains Data, ekstrak kata kunci daripadanya, dan kemudian cuba memvisualisasikan hasilnya.\n", "\n", "Sebagai teks, saya akan menggunakan halaman mengenai Sains Data dari Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Langkah 1: Mendapatkan Data\n", "\n", "Langkah pertama dalam setiap proses sains data ialah mendapatkan data. Kita akan menggunakan perpustakaan `requests` untuk melakukan itu:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "