{ "cells": [ { "cell_type": "markdown", "source": [ "# சவால்: தரவுத்தமிழியல் பற்றிய உரையை பகுப்பாய்வு செய்வது\n", "\n", "> *இந்த நோட்புக்கில், விக்கிப்பீடியாவின் மெஷின் லர்னிங் கட்டுரையைக் கொண்டு பல URL களை பயன்படுத்திக் கற்றலுக்கான முயற்சியை செய்துள்ளோம். தரவுத்தமிழியியைக் காட்டிலும், இந்தக் கட்டுரையில் பல பொது சொற்கள் உள்ளன, இது பகுப்பாய்வை கடினமாக்குகிறது. முக்கியமான வார்த்தை சேர்க்கை முடிந்த பிறகு, சில அடிக்கடி வரும் ஆனால் அர்த்தமற்ற வார்த்தை தொகுப்புகளை அகற்ற புதிய முறையை உருவாக்க வேண்டும்.*\n", "\n", "இந்த உதாரணத்தில், பாரம்பரியமான ஒரு தரவுத்தமிழியல் செயல்முறை அடங்கிய அனைத்து படிகளையும் செய்ய ஒரு எளிய பயிற்சியை மேற்கொண்டோம். நீங்கள் எந்தக் குறிமுறையையும் எழுத தேவையில்லை, கீழே உள்ள செற்களை கிளிக் செய்து அவற்றை இயக்கு மற்றும் முடிவை கவனிக்கலாம். ஒரு சவால் போன்று, நீங்கள் வேறு தரவுடன் இந்தக் குறிமுறையைக் கடக்க ஊக்கப்படுகிறீர்கள்.\n", "\n", "## இலக்கு\n", "\n", "இந்த பாடத்தில், நாங்கள் தரவுத்தமிழியல் தொடர்புடைய பலக் கருத்துக்களைப் பற்றி பேசிக் கொண்டு இருக்கிறோம். **உரை உற்பத்தி** செய்வதன் மூலம் மேலும் பல தொடர்புடைய கருத்துக்களை கண்டுபிடிக்க முயற்சிப்போம். தரவுத்தமிழியல் பற்றிய உரையை எடுத்துக் கொண்டு அதிலிருந்து முக்கிய வார்த்தைகளை நவீனமாகக் கூடுத்து பின்னர் முடிவை காட்சி படுத்த முயற்சிப்போம்.\n", "\n", "உரையாக, விக்கிப்பீடியாவின் தரவுத்தமிழியல் பக்கம் பயன்படுத்தப்படும்:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## படி 1: தரவைப் பெறுதல்\n", "\n", "ஒவ்வொரு தரவு அறிவியல் செயல்முறையிலும் முதற்கட்டம் தரவைப் பெறுதலாகும். அதை செய்ய `requests` நூலகத்தை நாம் பயன்படுத்துவோம்:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "