{ "cells": [ { "cell_type": "markdown", "source": [ "# စိန်ခေါ်မှု: ဒေတာသိပ္ပံအကြောင်း စာသား ခွဲခြမ်းစိတ်ဖြာခြင်း\n", "\n", "> *ဒီ notebook မှာတော့ မတူညီတဲ့ URL - Machine Learning ပေါ် ရှိ ဝီကီပီးဒီးယား ဆောင်းပါးကို အသုံးပြုပြီး လေ့လာကြည့်ပါတယ်။ Data Science လိုမျိုး မဟုတ်ပေမယ့် ဒီဆောင်းပါးမှာ ပါဝင်တဲ့ အသုံးအနှုန်းများ များပြားတာကြောင့် ခွဲခြမ်းစိတ်ဖြာမှုမှာ ပိုပြီး အခက်အခဲ ဖြစ်နေပါတယ်။ Keyword စုဆောင်းပြီးနောက်နောက် ဒေတာကို သန့်ရှင်းအောင် လုပ်ဖို့ အခြား နည်းလမ်းတစ်ခု လိုအပ်ပါတယ်၊ ဘာလို့ဆိုတော့ ကြာကြာ တွေ့ရတဲ့ ဒါပေမယ့် အဓိပ္ပါယ်မပါသော စကားလုံးတွေကို ဖယ်ရှားဖို့ လိုတယ်။*\n", "\n", "ဒီဥပမာမှာတော့ နိုင်တဲ့ နည်းလမ်း အားလုံးကို လုပ်ဆောင်မယ့် ရိုးရှင်းတဲ့ လေ့ကျင့်ခန်းတစ်ခု ပြုလုပ်မှာဖြစ်ပါတယ်။ ကိုယ့်မှာ ကုဒ်ရေးစရာ မလိုပါဘူး၊ အောက်ပါ ဆဲလ်တွေကို နှိပ်ပြီး run လိုက်ပြီးရလဒ်ကို ကြည့်နိုင်ပါတယ်။ စိန်ခေါ်မှုအနေနဲ့ ဒီကုဒ်ကို မတူညီတဲ့ ဒေတာနဲ့ ကြိုးစားကြည့်ဖို့ အကြောင်းပြုပါတယ်။\n", "\n", "## ရည်မှန်းချက်\n", "\n", "ဒီသင်ခန်းစာမှာတော့ Data Science နှင့် ဆက်နွယ်တဲ့ ကောင်းကြောင်း အယူအဆတွေကို ဆွေးနွေးခဲ့ပါတယ်။ Text mining လုပ်ခြင်းအားဖြင့် ပိုပြီး ဆက်နွယ်တဲ့ အယူအဆတွေ ရှာဖွေနိုင်မလား ကြိုးစားကြည့်ရအောင်။ Data Science ပေါ် ရှိ စာသားကို တင်ပြီး Keyword တွေ ရှာယူပြီး ပြီးလျှင် ရလဒ်ကို မြင်ကွင်းရအောင် ကြိုးစားပါမယ်။\n", "\n", "စာသားအဖြစ်တော့ Wikipedia မှာရှိတဲ့ Data Science စာမျက်နှာကို သုံးမှာ ဖြစ်ပါတယ်။\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## အဆင့် ၁: ဒေတာရယူခြင်း\n", "\n", "ဒေတာသိပ္ပံလုပ်ငန်းစဉ်တိုင်း၏ ပထမဆုံးအဆင့်မှာ ဒေတာရယူခြင်းဖြစ်သည်။ ထိုအတွက် `requests` စာကြည့်တိုက်ကို အသုံးပြုမည်။\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "