{ "cells": [ { "cell_type": "markdown", "source": [ "# چالش: تحلیل متن درباره علم داده\n", "\n", "> *در این دفترچه، ما با استفاده از URLهای مختلف - مقاله ویکی‌پدیا درباره یادگیری ماشین آزمایش می‌کنیم. می‌توانید ببینید که برخلاف علم داده، این مقاله شامل اصطلاحات زیادی است که تحلیل را پیچیده‌تر می‌کند. ما باید راهی دیگر برای پاکسازی داده‌ها پس از استخراج کلمات کلیدی پیدا کنیم تا از ترکیبات پرتکرار اما بی‌معنی کلمات خلاص شویم.*\n", "\n", "در این مثال، بیایید یک تمرین ساده انجام دهیم که تمام مراحل یک فرایند سنتی علم داده را پوشش می‌دهد. لازم نیست هیچ کدی بنویسید، می‌توانید فقط روی سلول‌های زیر کلیک کنید تا اجرا شوند و نتیجه را مشاهده کنید. به عنوان چالش، تشویق می‌شوید این کد را با داده‌های مختلف امتحان کنید.\n", "\n", "## هدف\n", "\n", "در این درس، ما درباره مفاهیم مختلف مرتبط با علم داده بحث کرده‌ایم. بیایید با انجام کمی **کاوش متن** سعی کنیم مفاهیم مرتبط بیشتری کشف کنیم. ما با متنی درباره علم داده شروع می‌کنیم، کلمات کلیدی را استخراج می‌کنیم و سپس سعی می‌کنیم نتیجه را تجسم کنیم.\n", "\n", "منبع متن صفحه ویکی‌پدیا درباره علم داده است:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## گام ۱: دریافت داده‌ها\n", "\n", "اولین گام در هر فرآیند علم داده، دریافت داده‌ها است. ما از کتابخانه `requests` برای این کار استفاده می‌کنیم:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "