{ "cells": [ { "cell_type": "markdown", "source": [ "# Thử thách: Phân tích Văn bản về Khoa học Dữ liệu\n", "\n", "Trong ví dụ này, hãy làm một bài tập đơn giản bao gồm tất cả các bước của quy trình khoa học dữ liệu truyền thống. Bạn không cần phải viết bất kỳ đoạn mã nào, bạn chỉ cần nhấp vào các ô bên dưới để thực thi chúng và quan sát kết quả. Như một thử thách, bạn được khuyến khích thử đoạn mã này với dữ liệu khác nhau.\n", "\n", "## Mục tiêu\n", "\n", "Trong bài học này, chúng ta đã thảo luận về các khái niệm khác nhau liên quan đến Khoa học Dữ liệu. Hãy thử khám phá thêm các khái niệm liên quan bằng cách thực hiện một số **khai thác văn bản**. Chúng ta sẽ bắt đầu với một văn bản về Khoa học Dữ liệu, trích xuất các từ khóa từ nó, và sau đó cố gắng trực quan hóa kết quả.\n", "\n", "Là một văn bản, tôi sẽ sử dụng trang về Khoa học Dữ liệu từ Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Bước 1: Lấy Dữ liệu\n", "\n", "Bước đầu tiên trong mọi quy trình khoa học dữ liệu là lấy dữ liệu. Chúng ta sẽ sử dụng thư viện `requests` để làm việc đó:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "