{ "cells": [ { "cell_type": "markdown", "source": [ "# چالش: تحلیل متن درباره علم داده\n", "\n", "در این مثال، بیایید یک تمرین ساده انجام دهیم که تمام مراحل یک فرایند سنتی علم داده را پوشش میدهد. نیازی به نوشتن کد ندارید، فقط میتوانید روی سلولهای زیر کلیک کنید تا آنها را اجرا کرده و نتیجه را مشاهده کنید. به عنوان یک چالش، تشویق میشوید این کد را با دادههای مختلف امتحان کنید.\n", "\n", "## هدف\n", "\n", "در این درس، درباره مفاهیم مختلف مرتبط با علم داده صحبت کردهایم. بیایید با انجام مقداری **کاوش متن** سعی کنیم مفاهیم مرتبط بیشتری کشف کنیم. با متنی درباره علم داده شروع میکنیم، کلمات کلیدی را از آن استخراج میکنیم و سپس سعی میکنیم نتیجه را به صورت تصویری نشان دهیم.\n", "\n", "برای متن، من از صفحه درباره علم داده در ویکیپدیا استفاده میکنم:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## مرحله ۱: دریافت دادهها\n", "\n", "اولین قدم در هر فرآیند علم داده، دریافت دادهها است. ما برای این کار از کتابخانه `requests` استفاده خواهیم کرد:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "