{ "cells": [ { "cell_type": "markdown", "source": [ "# التحدي: تحليل نص حول علم البيانات\n", "\n", "> *في هذه المفكرة، نجرب استخدام رابط مختلف - مقالة ويكيبيديا عن التعلم الآلي. يمكنك أن ترى، على عكس علم البيانات، أن هذه المقالة تحتوي على الكثير من المصطلحات، مما يجعل التحليل أكثر تعقيدًا. نحتاج إلى إيجاد طريقة أخرى لتنظيف البيانات بعد استخراج الكلمات المفتاحية، للتخلص من بعض التركيبات الشائعة ولكن غير المفيدة من الكلمات.*\n", "\n", "في هذا المثال، لنقم بتمرين بسيط يغطي جميع خطوات عملية علم البيانات التقليدية. ليس عليك كتابة أي كود، يمكنك فقط النقر على الخلايا أدناه لتنفيذها وملاحظة النتيجة. كتحدي، نشجعك على تجربة هذا الكود مع بيانات مختلفة.\n", "\n", "## الهدف\n", "\n", "في هذا الدرس، ناقشنا مفاهيم مختلفة تتعلق بعلم البيانات. دعنا نحاول اكتشاف مفاهيم مرتبطة أكثر من خلال القيام ببعض **التنقيب النصي**. سنبدأ بنص عن علم البيانات، نستخرج منه الكلمات المفتاحية، ثم نحاول تصور النتيجة.\n", "\n", "كنص، سأستخدم الصفحة الخاصة بعلم البيانات من ويكيبيديا:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## الخطوة 1: الحصول على البيانات\n", "\n", "الخطوة الأولى في كل عملية علم بيانات هي الحصول على البيانات. سنستخدم مكتبة `requests` للقيام بذلك:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "