{ "cells": [ { "cell_type": "markdown", "source": [ "# சவால்: தரவுத்துறை பற்றிய உரையை பகுப்பாய்வு செய்தல்\n", "\n", "இந்த எடுத்துக் காட்டில், பாரம்பரியத் தரவுத்துறை செயல்முறையின் அனைத்து படிகளையும் உள்ளடக்கிய ஒரு எளிய பயிற்சியை செய்வோம். நீங்கள் எந்தக் கோډையும் எழுத வேண்டியதில்லை, கீழுள்ள செல்களை கிளிக் செய்து அவற்றை இயக்கி முடிவை கவனிக்கலாம். ஒரு சவாலாக, நீங்கள் வேறுபட்ட தரவுகளுடன் இந்தக் கோட்டை முயற்சி செய்ய ஊக்கமிடப்படுகிறீர்கள்.\n", "\n", "## குறிக்கோள்\n", "\n", "இந்த பாடத்தில், நாம் தரவுத்துறைக்கு தொடர்புடைய பல கருத்துக்களைப் பற்றி பேசியுள்ளோம். **உரை கைப்பாற்றுதல்** (text mining) மூலம் மேலும் தொடர்புடைய கருத்துக்களை கண்டுபிடிப்போம். ஒரு உரையாக, தரவுத்துறை பற்றிய விக்கிப்பீடியா பக்கத்தை பயன்படுத்தி, அதிலிருந்து முக்கிய வார்த்தைகளை எடுக்க, பின்னர் முடிவை காட்சிப்படுத்த முயற்சிப்போம்.\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: தரவைப் பெறுதல்\n", "\n", "ஒவ்வொரு தரவு விஞ்ஞான செயல்முறையின் முதல் படி தரவைப் பெறுதல். அதற்காக நாம் `requests` நூலகத்தை பயன்படுத்தப் போகிறோம்:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Data science - Wikipedia\n", "