{ "cells": [ { "cell_type": "markdown", "source": [ "# Changamoto: Kuchambua Maandishi Kuhusu Sayansi ya Data\n", "\n", "Katika mfano huu, tufanye zoezi rahisi linalohusisha hatua zote za mchakato wa jadi wa sayansi ya data. Huna haja ya kuandika msimbo wowote, unaweza tu kubofya kwenye seli zilizo hapa chini kuziendesha na kuangalia matokeo. Kama changamoto, unahamasishwa kujaribu msimbo huu na data tofauti.\n", "\n", "## Lengo\n", "\n", "Katika somo hili, tumekuwa tukijadili dhana mbalimbali zinazohusiana na Sayansi ya Data. Hebu tujaribu kugundua dhana zaidi zinazohusiana kwa kufanya **uchimbaji wa maandishi**. Tutaanza na maandishi kuhusu Sayansi ya Data, kutoa maneno muhimu kutoka kwake, na kisha kujaribu kuona matokeo hayo kwa njia ya muonekano.\n", "\n", "Kama maandishi, nitumie ukurasa kuhusu Sayansi ya Data kutoka Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Hatua ya 1: Kupata Data\n", "\n", "Hatua ya kwanza katika kila mchakato wa sayansi ya data ni kupata data. Tutatumia maktaba ya `requests` kufanya hivyo:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "