{ "cells": [ { "cell_type": "markdown", "source": [ "# אתגר: ניתוח טקסט אודות מדעי הנתונים\n", "\n", "בדוגמה הזו, נעשה תרגיל פשוט הכולל את כל שלבי התהליך המסורתי במדעי הנתונים. אין צורך לכתוב קוד, אפשר פשוט ללחוץ על התאים למטה כדי להריץ אותם ולהתבונן בתוצאה. באתגר, מומלץ לנסות את הקוד עם נתונים שונים.\n", "\n", "## מטרה\n", "\n", "בשיעור הזה, דיברנו על מושגים שונים הקשורים למדעי הנתונים. בואו ננסה לגלות מושגים נוספים קשורים על ידי ביצוע **כריית טקסט**. נתחיל בטקסט על מדעי הנתונים, נחלץ ממנו מילות מפתח, ואז ננסה להמחיש את התוצאה.\n", "\n", "כטקסט, אשתמש בדף על מדעי הנתונים מויקיפדיה:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## שלב 1: קבלת הנתונים\n", "\n", "השלב הראשון בכל תהליך מדעי הנתונים הוא קבלת הנתונים. נשתמש בספריית `requests` כדי לעשות זאת:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "