{ "cells": [ { "cell_type": "markdown", "source": [ "# സവാൽ: ഡാറ്റാ സയന്സ് സംബന്ധിച്ച ടെക്സ്റ്റ് വിശകലനംചെയ്യല്\n", "\n", "> *ഈ നോട്ട്ബുക്കിൽ, വ്യത്യസ്ത URL - മെഷീൻ ലേണിംഗ് Wikipedia ലേഖനം ഉപയോഗിച്ച് പരീക്ഷണം നടത്തുന്നു. ഡാറ്റാ സയന്സിന് വിരുദ്ധമായി, ഈ ലേഖനം പല പദങ്ങൾ ഉൾക്കൊള്ളുന്നുണ്ട്, എങ്കിൽ വിശകലനം കൂടുതൽ പ്രശ്നമാകുന്നു. കീവർഡ് എക്സ്ട്രാക്ഷൻ കഴിഞ്ഞ്, പൊതുജനങ്ങളായ, എന്നാൽ അര്ഥവത്തല്ലാത്ത പദസംയോജങ്ങള് നീക്കംചെയ്യാന് മറ്റൊരു വഴിയൊന്നുകൂടി കണ്ടെത്തേണ്ടതാണ്.*\n", "\n", "ഈ ഉദാഹരണത്തില്, പരമ്പരാഗത ഡാറ്റാ സയന്സ് പ്രക്രിയയുടെ എല്ലാ ഘട്ടങ്ങളും ഉൾപെടുത്തുന്ന എളുപ്പമായ ഒരു പരിശീലനം നടത്താം. നിങ്ങൾക്ക് കോഡ് എഴുതാന് ആവശ്യമില്ല, താഴെ കൊടുത്തിരിക്കുന്ന സെലുകൾ ക്ലിക് ചെയ്ത് പ്രവർത്തിപ്പിക്കുകയും ഫലം കാണുകയും ചെയ്യാം. ഒരു സവാളായി, ഈ കോഡ് മാറ്റി വ്യത്യസ്ത ഡാറ്റ ഉപയോഗിച്ച് പരീക്ഷിക്കാൻ നിങ്ങളെ പ്രേരിപ്പിക്കുന്നു.\n", "\n", "## ലക്ഷ്യം\n", "\n", "ഈ പാഠത്തിൽ, ഡാറ്റാ സയന്സുമായി ബന്ധപ്പെട്ട വിവിധ ആശയങ്ങളെക്കുറിച്ച് ചർച്ച ചെയ്തിട്ടുണ്ട്. **ടെക്സ്റ്റ് മൈനിംഗ്** നടത്തിക്കൊണ്ട് കൂടുതൽ ബന്ധപ്പെട്ട ആശയങ്ങൾ കണ്ടെത്താൻ ശ്രമിക്കാം. ഡാറ്റാ സയന്സ് എന്നക്കുറിച്ചുള്ള ടെക്സ്റ്റ് എടുത്ത്, അതിൽ നിന്നും കീവർഡ്സ് എടുക്കുകയും ഫലം ദൃശ്യവൽക്കരിക്കാൻ ശ്രമിക്കും.\n", "\n", "ടെക്സ്റ്റായി, ഞാൻ Wikipedia ലെ ഡാറ്റാ സയന്സ് പേജ് ഉപയോഗിക്കും:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## ഘട്ടം 1: ഡാറ്റ നേടൽ\n", "\n", "എല്ലാ ഡാറ്റ ശാസ്ത്ര പ്രക്രിയയിലുമുള്ള ആദ്യഘട്ടം ഡാറ്റ നേടലാണ്. അതിനു `requests` ലൈബ്രറി ഉപയോഗിക്കാം:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "