{ "cells": [ { "cell_type": "markdown", "source": [ "# চ্যালেঞ্জ: ডাটা সায়েন্স সম্পর্কে টেক্সট বিশ্লেষণ\n", "\n", "> *এই নোটবুকে, আমরা বিভিন্ন URL - মেশিন লার্নিং সম্পর্কিত উইকিপিডিয়া নিবন্ধ ব্যবহার করার সঙ্গে পরীক্ষামূলক কাজ করছি। আপনি দেখতে পারবেন যে, ডাটা সায়েন্সের তুলনায়, এই নিবন্ধে অনেক শব্দ থাকে, যা বিশ্লেষণকে আরও সমস্যাজনক করে তোলে। কিওয়ার্ড নিষ্কাশনের পর, ডেটা পরিষ্কারের জন্য অন্য একটি উপায় বের করতে হবে, যাতে কিছু প্রায়শই ব্যবহৃত, কিন্তু অর্থবহ নয় এমন শব্দসমূহ থেকে মুক্তি পাওয়া যায়।*\n", "\n", "এই উদাহরণে, চলুন একটি সহজ অনুশীলন করি যা একটি প্রচলিত ডাটা সায়েন্স প্রক্রিয়ার সমস্ত ধাপ জুড়ে। আপনাকে কোনো কোড লিখতে হবে না, আপনি শুধু নিচের সেলগুলিতে ক্লিক করে সেগুলো চালাতে পারবেন এবং ফলাফল পর্যবেক্ষণ করতে পারবেন। একটি চ্যালেঞ্জ হিসেবে, আপনি এই কোডটি বিভিন্ন ডাটার সঙ্গে চেষ্টা করতে উৎসাহিত হবেন।\n", "\n", "## লক্ষ্য\n", "\n", "এই পাঠে, আমরা ডাটা সায়েন্স সম্পর্কিত বিভিন্ন ধারণা আলোচনা করেছি। চলুন কিছু **টেক্সট মাইনিং** করে আরও সম্পর্কিত ধারণা আবিষ্কার করার চেষ্টা করি। আমরা ডাটা সায়েন্স সম্পর্কিত একটি টেক্সট দিয়ে শুরু করব, তা থেকে কিওয়ার্ড বের করব, এবং তারপর ফলাফল ভিজ্যুয়ালাইজ করার চেষ্টা করব।\n", "\n", "একটি টেক্সট হিসেবে, আমি উইকিপিডিয়ার ডাটা সায়েন্স পৃষ্ঠাটি ব্যবহার করব:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: ডেটা আনা\n", "\n", "প্র প্রতিটি ডেটা সায়েন্স প্রক্রিয়ার প্রথম ধাপ হল ডেটা আনা। আমরা এটি করার জন্য `requests` লাইব্রেরি ব্যবহার করব:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "