{ "cells": [ { "cell_type": "markdown", "source": [ "# Tantangan: Menganalisis Teks tentang Data Science\n", "\n", "> *Dalam notebook ini, kami bereksperimen menggunakan URL berbeda - artikel wikipedia tentang Machine Learning. Anda dapat melihat bahwa, tidak seperti Data Science, artikel ini mengandung banyak istilah, yang membuat analisis menjadi lebih bermasalah. Kita perlu mencari cara lain untuk membersihkan data setelah melakukan ekstraksi kata kunci, untuk menghilangkan beberapa kombinasi kata yang sering muncul, tetapi tidak bermakna.*\n", "\n", "Dalam contoh ini, mari lakukan latihan sederhana yang mencakup semua langkah dari proses data science tradisional. Anda tidak perlu menulis kode apapun, Anda cukup klik pada sel di bawah untuk menjalankannya dan mengamati hasilnya. Sebagai tantangan, Anda didorong untuk mencoba kode ini dengan data yang berbeda.\n", "\n", "## Tujuan\n", "\n", "Dalam pelajaran ini, kita telah membahas berbagai konsep terkait Data Science. Mari kita coba menemukan lebih banyak konsep terkait dengan melakukan **text mining**. Kita akan mulai dengan sebuah teks tentang Data Science, mengekstrak kata kunci dari teks tersebut, dan kemudian mencoba memvisualisasikan hasilnya.\n", "\n", "Sebagai teks, saya akan menggunakan halaman tentang Data Science dari Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: Mendapatkan Data\n", "\n", "Langkah pertama dalam setiap proses data science adalah mendapatkan data. Kita akan menggunakan pustaka `requests` untuk melakukan itu:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "