{ "cells": [ { "cell_type": "markdown", "source": [ "# চ্যালেঞ্জ: ডেটা সায়েন্স সম্পর্কে টেক্সট বিশ্লেষণ\n", "\n", "এই উদাহরণে, আসুন একটি সহজ ব্যায়াম করি যা ঐতিহ্যগত ডেটা সায়েন্স প্রক্রিয়ার সমস্ত ধাপ কভার করে। আপনাকে কোন কোড লিখতে হবে না, আপনি কেবল নিচের সেলগুলোতে ক্লিক করে সেগুলো চালাতে পারেন এবং ফলাফল পর্যবেক্ষণ করতে পারেন। একটি চ্যালেঞ্জ হিসাবে, আপনাকে উত্সাহিত করা হচ্ছে এই কোডটি বিভিন্ন ডেটা দিয়ে চেষ্টা করতে।\n", "\n", "## লক্ষ্য\n", "\n", "এই পাঠে, আমরা ডেটা সায়েন্স সম্পর্কিত বিভিন্ন ধারণা আলোচনা করেছি। চলুন কিছু **টেক্সট মাইনিং** করে আরো সম্পর্কিত ধারণা আবিষ্কার করার চেষ্টা করি। আমরা ডেটা সায়েন্স সম্পর্কে একটি টেক্সট থেকে কীওয়ার্ড বের করব, এবং তারপর ফলাফলটি ভিজ্যুয়ালাইজ করার চেষ্টা করব।\n", "\n", "একটি টেক্সট হিসাবে, আমি উইকিপিডিয়া থেকে ডেটা সায়েন্স পৃষ্ঠা ব্যবহার করব:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 62, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Step 1: ডেটা সংগ্রহ করা\n", "\n", "প্রতিটি ডেটা সায়েন্স প্রক্রিয়ার প্রথম পদক্ষেপ হল ডেটা সংগ্রহ করা। আমরা এটি করার জন্য `requests` লাইব্রেরি ব্যবহার করব:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 63, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Data science - Wikipedia\n", "