{ "cells": [ { "cell_type": "markdown", "source": [ "# চ্যালেঞ্জ: ডাটা সায়েন্স সম্পর্কে টেক্সট বিশ্লেষণ\n", "\n", "> *এই নোটবুকে, আমরা বিভিন্ন URL - মেশিন লার্নিং সম্পর্কিত উইকিপিডিয়া নিবন্ধ ব্যবহার করার সঙ্গে পরীক্ষামূলক কাজ করছি। আপনি দেখতে পারবেন যে, ডাটা সায়েন্সের তুলনায়, এই নিবন্ধে অনেক শব্দ থাকে, যা বিশ্লেষণকে আরও সমস্যাজনক করে তোলে। কিওয়ার্ড নিষ্কাশনের পর, ডেটা পরিষ্কারের জন্য অন্য একটি উপায় বের করতে হবে, যাতে কিছু প্রায়শই ব্যবহৃত, কিন্তু অর্থবহ নয় এমন শব্দসমূহ থেকে মুক্তি পাওয়া যায়।*\n", "\n", "এই উদাহরণে, চলুন একটি সহজ অনুশীলন করি যা একটি প্রচলিত ডাটা সায়েন্স প্রক্রিয়ার সমস্ত ধাপ জুড়ে। আপনাকে কোনো কোড লিখতে হবে না, আপনি শুধু নিচের সেলগুলিতে ক্লিক করে সেগুলো চালাতে পারবেন এবং ফলাফল পর্যবেক্ষণ করতে পারবেন। একটি চ্যালেঞ্জ হিসেবে, আপনি এই কোডটি বিভিন্ন ডাটার সঙ্গে চেষ্টা করতে উৎসাহিত হবেন।\n", "\n", "## লক্ষ্য\n", "\n", "এই পাঠে, আমরা ডাটা সায়েন্স সম্পর্কিত বিভিন্ন ধারণা আলোচনা করেছি। চলুন কিছু **টেক্সট মাইনিং** করে আরও সম্পর্কিত ধারণা আবিষ্কার করার চেষ্টা করি। আমরা ডাটা সায়েন্স সম্পর্কিত একটি টেক্সট দিয়ে শুরু করব, তা থেকে কিওয়ার্ড বের করব, এবং তারপর ফলাফল ভিজ্যুয়ালাইজ করার চেষ্টা করব।\n", "\n", "একটি টেক্সট হিসেবে, আমি উইকিপিডিয়ার ডাটা সায়েন্স পৃষ্ঠাটি ব্যবহার করব:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: ডেটা আনা\n", "\n", "প্র প্রতিটি ডেটা সায়েন্স প্রক্রিয়ার প্রথম ধাপ হল ডেটা আনা। আমরা এটি করার জন্য `requests` লাইব্রেরি ব্যবহার করব:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "