{ "cells": [ { "cell_type": "markdown", "source": [ "# אתגר: ניתוח טקסט על מדעי הנתונים\n", "\n", "> *במחברת זו, אנו מנסים להשתמש במאמר ויקיפדיה שונה בכתובת URL - על למידת מכונה. אפשר לראות שלמרות שמדעי הנתונים פשוטים יותר, מאמר זה מכיל הרבה מונחים, מה שהופך את הניתוח לבעייתי יותר. יש להגיע לדרך אחרת לנקות את הנתונים לאחר שליפת מילות המפתח, כדי להיפטר משילובים של מילים נפוצים אך חסרי משמעות.*\n", "\n", "בדוגמה זו, נעשה תרגיל פשוט שמכסה את כל שלבי תהליך מדעי הנתונים המסורתי. אין צורך לכתוב קוד, אפשר פשוט ללחוץ על התאים למטה כדי להריץ אותם ולבחון את התוצאה. כאתגר, מומלץ לנסות את הקוד הזה עם נתונים שונים.\n", "\n", "## מטרה\n", "\n", "בשיעור זה דנו במושגים שונים הקשורים למדעי הנתונים. בואו ננסה לגלות מושגים קשורים נוספים על ידי עשיית **כריית טקסט**. נתחיל בטקסט על מדעי הנתונים, נחלץ ממנו מילות מפתח, ואז ננסה להמחיש את התוצאה.\n", "\n", "כטקסט, אשתמש בעמוד על מדעי הנתונים בויקיפדיה:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: קבלת הנתונים\n", "\n", "השלב הראשון בכל תהליך מדעי הנתונים הוא לקבל את הנתונים. נשתמש בספריית `requests` כדי לעשות זאת:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "