{ "cells": [ { "cell_type": "markdown", "source": [ "# ਚੁਣੌਤੀ: ਡਾਟਾ ਸਾਇੰਸ ਬਾਰੇ ਲਿਖਤ ਦੀ ਵਿਸ਼ਲੇਸ਼ਣ\r\n", "\r\n", "> *ਇਸ ਨੋਟਬੁੱਕ ਵਿੱਚ, ਅਸੀਂ ਮਸ਼ੀਨ ਲਰਨਿੰਗ 'ਤੇ ਵਿਸ਼ਪੇਡੀਆ ਲੇਖ ਦੇ ਵੱਖ-ਵੱਖ URL ਦੀ ਵਰਤੋਂ ਕਰ ਕੇ ਪ੍ਰਯੋਗ ਕਰਦੇ ਹਾਂ। ਤੁਸੀਂ ਦੇਖ ਸਕਦੇ ਹੋ ਕਿ, ਡਾਟਾ ਸਾਇੰਸ ਦੇ ਮੁਕਾਬਲੇ, ਇਸ ਲੇਖ ਵਿੱਚ ਬਹੁਤ ਸਾਰੇ ਸ਼ਬਦ ਹਨ, ਜਿਸ ਕਾਰਨ ਵਿਸ਼ਲੇਸ਼ਣ ਹੋਰ ਜ਼ਿਆਦਾ ਮੁਸ਼ਕਿਲ ਬਣ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਕੁੰਜੀ ਸ਼ਬਦ ਨਿਕਾਸ਼ ਦੇ ਬਾਅਦ ਡਾਟਾ ਨੂੰ ਸਾਫ਼ ਕਰਨ ਲਈ ਕੋਈ ਹੋਰ ਤਰੀਕਾ ਲੱਭਣਾ ਚਾਹੀਦਾ ਹੈ, ਤਾਂ ਜੋ ਕੁਝ ਬਾਰ-ਬਾਰ ਦੇ ਪਰ ਅਰਥਪੂਰਨ ਨਾ ਹੋਣ ਵਾਲੇ ਸ਼ਬਦਾਂ ਦੇ ਸੰਯੋਜਨਾਂ ਤੋਂ ਬਚਿਆ ਜਾ ਸਕੇ।*\r\n", "\r\n", "ਇਸ ਉਦਾਹਰਣ ਵਿੱਚ, ਆਓ ਇੱਕ ਸਧਾਰਣ ਅਭਿਆਸ ਕਰੀਏ ਜੋ ਪਰੰਪਰਾਗਤ ਡਾਟਾ ਸਾਇੰਸ ਪ੍ਰਕਿਰਿਆ ਦੇ ਸਾਰੇ ਕਦਮਾਂ ਨੂੰ ਕਵਰ ਕਰਦਾ ਹੈ। ਤੁਹਾਨੂੰ ਕੋਈ ਕੋਡ ਲਿਖਣ ਦੀ ਜ਼ਰੂਰਤ ਨਹੀਂ, ਤੁਸੀਂ ਹੇਠਾਂ ਦਿੱਤੇ ਸੈੱਲਾਂ 'ਤੇ ਕਲਿੱਕ ਕਰਕੇ ਉਨ੍ਹਾਂ ਨੂੰ ਚਲਾ ਸਕਦੇ ਹੋ ਅਤੇ ਨਤੀਜਾ ਦੇਖ ਸਕਦੇ ਹੋ। ਇੱਕ ਚੁਣੌਤੀ ਵਜੋਂ, ਤੁਹਾਨੂੰ ਪ੍ਰੋਤਸਾਹਿਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਕਿ ਤੁਸੀਂ ਇਹ ਕੋਡ ਵੱਖ-ਵੱਖ ਡਾਟਾ ਨਾਲ آزਮਾਓ। \r\n", "\r\n", "## ਲਕੜੀ\r\n", "\r\n", "ਇਸ ਪਾਠ ਵਿੱਚ, ਅਸੀਂ ਡਾਟਾ ਸਾਇੰਸ ਨਾਲ ਸਬੰਧਤ ਵੱਖ-ਵੱਖ ਧਾਰਣਾਵਾਂ 'ਤੇ ਚਰਚਾ ਕੀਤੀ ਹੈ। ਆਓ ਕੁਝ ਹੋਰ ਸਬੰਧਤ ਧਾਰਣਾਵਾਂ ਖੋਜਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੀਏ **ਲਿਖਤ ਖਣਨ** ਕਰਕੇ। ਅਸੀਂ ਡਾਟਾ ਸਾਇੰਸ ਬਾਰੇ ਲਿਖਤ ਨਾਲ ਸ਼ੁਰੂ ਕਰਾਂਗੇ, ਇਸ ਵਿੱਚੋਂ ਕੁੰਜੀ ਸ਼ਬਦ ਨਿਕਾਸ਼ ਕਰਾਂਗੇ ਅਤੇ ਫਿਰ ਨਤੀਜੇ ਨੂੰ ਦ੍ਰਿਸ਼ਟੀਗਤ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਾਂਗੇ।\r\n", "\r\n", "ਲੇਖ ਵਜੋਂ, ਮੈਂ ਵਿਸ਼ਪੇਡੀਆ ਤੋਂ ਡਾਟਾ ਸਾਇੰਸ ਦਾ ਪੇਜ਼ ਵਰਤਾਂਗਾ:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: ਡਾਟਾ ਪ੍ਰਾਪਤ ਕਰਨਾ\n", "\n", "ਹਰ ਡਾਟਾ ਸਾਇੰਸ ਪ੍ਰਕਿਰਿਆ ਦਾ ਪਹਿਲਾ ਕਦਮ ਡਾਟਾ ਪ੍ਰਾਪਤ ਕਰਨਾ ਹੈ। ਅਸੀਂ ਇਸ ਲਈ `requests` ਲਾਇਬ੍ਰੇਰੀ ਨੂੰ ਵਰਤਾਂਗੇ:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "