{ "cells": [ { "cell_type": "markdown", "source": [ "# چیلنج: ڈیٹا سائنس کے بارے میں متن کا تجزیہ\n", "\n", "> *اس نوٹ بک میں، ہم مختلف URL - ویکیپیڈیا آرٹیکل آن مشین لرننگ استعمال کرنے کے تجربے کر رہے ہیں۔ آپ دیکھ سکتے ہیں کہ، ڈیٹا سائنس کے برعکس، اس آرٹیکل میں بہت سارے اصطلاحات شامل ہیں، جس سے تجزیہ مزید پیچیدہ ہو جاتا ہے۔ ہمیں کی ورڈ استخراج کے بعد ڈیٹا کو صاف کرنے کے لیے ایک اور طریقہ کار سوچنا ہوگا، تاکہ کچھ متواتر لیکن غیر معنی خیز لفظی امتزاجات سے نجات حاصل کی جا سکے۔*\n", "\n", "اس مثال میں، آئیے ایک آسان مشق کریں جو روایتی ڈیٹا سائنس کے عمل کے تمام مراحل کو شامل کرتی ہے۔ آپ کو کوئی کوڈ لکھنے کی ضرورت نہیں ہے، آپ نیچے دیے گئے سیلز پر کلک کر کے انہیں چلا سکتے ہیں اور نتیجہ دیکھ سکتے ہیں۔ ایک چیلنج کے طور پر، آپ کو ترغیب دی جاتی ہے کہ آپ اس کوڈ کو مختلف ڈیٹا کے ساتھ آزما کر دیکھیں۔\n", "\n", "## مقصد\n", "\n", "اس سبق میں، ہم نے ڈیٹا سائنس سے متعلق مختلف تصورات پر بات کی ہے۔ آئیے کچھ **متن کی کھدائی** کر کے مزید متعلقہ تصورات تلاش کرنے کی کوشش کریں۔ ہم ڈیٹا سائنس کے بارے میں ایک متن سے شروع کریں گے، اس سے کی ورڈ نکالیں گے، اور پھر نتیجہ کو بصری شکل میں ظاہر کرنے کی کوشش کریں گے۔\n", "\n", "متن کے طور پر، میں ویکیپیڈیا کے صفحہ ڈیٹا سائنس کا استعمال کروں گا:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: ڈیٹا حاصل کرنا\n", "\n", "ہر ڈیٹا سائنس کے عمل میں پہلا قدم ڈیٹا حاصل کرنا ہوتا ہے۔ ہم اس کے لیے `requests` لائبریری استعمال کریں گے:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "