{ "cells": [ { "cell_type": "markdown", "source": [ "# چالش: تحلیل متن درباره علم داده\n", "\n", "> *در این دفترچه، ما با استفاده از URLهای مختلف - مقاله ویکیپدیا درباره یادگیری ماشین آزمایش میکنیم. میتوانید ببینید که برخلاف علم داده، این مقاله شامل اصطلاحات زیادی است که تحلیل را پیچیدهتر میکند. ما باید راهی دیگر برای پاکسازی دادهها پس از استخراج کلمات کلیدی پیدا کنیم تا از ترکیبات پرتکرار اما بیمعنی کلمات خلاص شویم.*\n", "\n", "در این مثال، بیایید یک تمرین ساده انجام دهیم که تمام مراحل یک فرایند سنتی علم داده را پوشش میدهد. لازم نیست هیچ کدی بنویسید، میتوانید فقط روی سلولهای زیر کلیک کنید تا اجرا شوند و نتیجه را مشاهده کنید. به عنوان چالش، تشویق میشوید این کد را با دادههای مختلف امتحان کنید.\n", "\n", "## هدف\n", "\n", "در این درس، ما درباره مفاهیم مختلف مرتبط با علم داده بحث کردهایم. بیایید با انجام کمی **کاوش متن** سعی کنیم مفاهیم مرتبط بیشتری کشف کنیم. ما با متنی درباره علم داده شروع میکنیم، کلمات کلیدی را استخراج میکنیم و سپس سعی میکنیم نتیجه را تجسم کنیم.\n", "\n", "منبع متن صفحه ویکیپدیا درباره علم داده است:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## گام ۱: دریافت دادهها\n", "\n", "اولین گام در هر فرآیند علم داده، دریافت دادهها است. ما از کتابخانه `requests` برای این کار استفاده میکنیم:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "