You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/my/1-Introduction/03-defining-data
localizeflow[bot] fc062c0410
[my,uk,lt] chore(i18n): sync translations
4 weeks ago
..
README.md [my,uk,lt] chore(i18n): sync translations 4 weeks ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 213 changes) 7 months ago

README.md

ဒေတာ သတ်မှတ်ခြင်း

 Sketchnote by (@sketchthedocs)
ဒေတာ သတ်မှတ်ခြင်း - Sketchnote by @nitya

ဒေတာဆိုသည်မှာ ရှာဖွေတွေ့ရှိမှုများပြုရန်နှင့် အသိပညာရှိပြီးဆုံးဖြတ်ချက်များအတွက် ထောက်ခံရန် အသုံးပြုသော သက်ဆိုင်ရာအချက်အလက်များ၊ သတင်းအချက်အလက်များ၊ စောင့်ကြည့်မှတ်တမ်းများနှင့် တိုင်းတာမှုများဖြစ်သည်။ ဒေတာအချက်တစ်ခု သည် ဒေတာစုစည်းမှု (dataset) အတွင်းရှိ ဒေတာတစ်ခုချင်းစီ ဖြစ်ပြီး ဒေတာစုစည်းမှုသည် ဒေတာအချက်များစုစည်းမှု ဖြစ်သည်။ ဒေတာစုစည်းမှုများမှာ မတူညီသည့် ပုံစံများနှင့် ဖွဲ့စည်းမှုများဖြင့် ရနိုင်ပြီး ဝင်ရောက်လာသည့် အရင်းအမြစ်အပေါ်မူတည်၍ မည်သည်မှာ ပုံစံဖြစ်နိုင်သည်။ ဥပမာအားဖြင့် ကုမ္ပဏီတစ်ခု၏ လစဉ် ဝင်ငွေများသည် စာရင်းဇယားဖြင့် ရနိုင်သော်လည်း လက်နက်ချိန် တစ်နာရီစီနှင့် စာရိုက်ထားသော မျက်နှာပြင်ကွင်းအား တိုင်းတာမှုများမှာ JSON ပုံစံဖြင့် ဖြစ်နိုင်သည်။ ဒေတာသိပ္ပံပညာရှင်များသည် ဒေတာစုစည်းမှုအတွင်းရှိ မတူညီသောဒေတာအမျိုးအစားများကို အတူတကွ လုပ်ကိုင်ကြသည်မှာ ကြွယ်ဝသည်။

ဤသင်ခန်းစာသည် ဒေတာ၏ လက္ခဏာများနှင့် ၎င်း၏ အရင်းအမြစ်များအပေါ် အခြေခံ၍ ဒေတာကို သတ်မှတ်ခြင်း နှင့် အမျိုးအစားခွဲခြင်းအတွက် အာရုံစိုက်ထားသည်။

စာသင်ခန်းမတက်ခင် စစ်တမ်း

ဒေတာကို ဘယ်လိုဖော်ပြသည်

မူလဒေတာ (Raw Data)

မူလဒေတာသည် ၎င်း၏ အရင်းအမြစ်မှ ရလာရှိသော ဒေတာဖြစ်ပြီး အစမှတ်အစဉ်များမပြုလုပ်ထားသေးဘဲ စာရင်းပြုစုခြင်း မခံရသေးသော ဒေတာဖြစ်သည်။ ဒေတာစုစည်းမှုနှင့် သက်ဆိုင်ရာ အရာကို နားလည်နိုင်ရန်အတွက် လူသားများနှင့် အနက်ခေါင်းဆောင်သော နည္းပညာများမှ အနောက်တုန်းတွင် နားလည်နိုင်သည့် ပုံစံတစ်ခုသို့ စုစည်းရန် လိုအပ်သည်။ ဒေတာစုစည်းမှု၏ ဖွဲ့စည်းပုံသည် ၎င်း၏ စီမံထားသည့် လမ်းစဉ်အတိုင်း ဖြစ်ပြီး ဖွဲ့စည်းထားခြင်း (structured), မဖွဲ့စည်းထားခြင်း (unstructured) နှင့် အဝတ်အစုံဖွဲ့စည်းပုံ (semi-structured) ဟူသော အမျိုးအစားများဖြင့် ခွဲခြားနိုင်သည်။ ဒီဖွဲ့စည်းပုံအမျိုးအစားများသည် အရင်းအမြစ်အပေါ်မူတည်၍ မတူညီနိုင်သော်လည်း နောက်ဆုံးတွင် အဆိုပါ သုံးအမျိုးအစားအတွင်းပဲ ဖြစ်မည်။

အရေအတွက်ဒေတာ (Quantitative Data)

အရေအတွက်ဒေတာသည် ဒေတာစုစည်းမှု၏ ဂဏန်းဖော်ပြချက်များဖြစ်ပြီး သိပ္ပံနည်းဖြင့် ခန်းဆက်တန်ဖိုးရန်၊ တိုင်းတာရန် နှင့် သင်္ချာအသုံးပြု၍ စစ်ဆေးရန် ပြုလုပ်နိုင်သည်။ အရေအတွက်ဒေတာ၏ ဥပမာများမှာ နိုင်ငံတစ်နိုင်ငံ၏ လူဦးရေပမာဏ၊ လူ့တစ်ဦး၏ အမြင့်၊ သို့မဟုတ် ကုမ္ပဏီတစ်ခု၏ သုံးလပတ်ဝင်ငွေတို့ ဖြစ်သည်။ အချိန်ပိုင်းစစ်ဆေးမှုများနှင့် တွက်ချက်ခြင်းများပါအပါအဝင် အရေအတွက်ဒေတာကို အသုံးပြု၍ လေထုအရည်အသွေး အညွှန်း (AQI) ၏ရာသီပိုင်းပုံစံများ ရှာဖွေရန် သို့မဟုတ် သာမန်အလုပ်ရက်တစ်နေ့တွင် ကားများပြားချိန် သဘောထားနှုန်း တွက်ချက်နိုင်သည်။

အရည်အသွေးဒေတာ (Qualitative Data)

အရည်အသွေးဒေတာကို အုပ်စုခွဲဒေတာ (categorical data) ဟုလည်း ခေါ်ကြပြီး ဂဏန်းအရေအတွက်ဒေတာ၏ စောင့်ကြည့်ချက်များကဲ့သို့ ပမာဏဖြင့် တိုင်းတာ၍ မရနိုင်သည့် ဒေတာဖြစ်သည်။ အများအားဖြင့် အကြောင်းအရာကျသော ဒေတာအမျိုးအစားမျိုးများဖြစ်ပြီး ထုတ်ကုန် သို့မဟုတ် လုပ်ငန်းနယ်ပယ်၏ အရည်အသွေးကို ဖော်ပြသည်။ တချို့အခါ အရည်အသွေးဒေတာသည် ဂဏန်းဖော်ပြချက်ဖြစ်နိုင်သော်လည်း သင်္ချာဖြင့် မသုံးကြသည့် ဖုန်းနံပါတ်များ သို့မဟုတ် အချိန်မှတ်တမ်းများကဲ့သို့ ဖြစ်နိုင်သည်။ အရည်အသွေးဒေတာ၏ ဥပမာများမှာ ဗီဒီယိုမှတ်ချက်များ၊ ကား၏ ထုတ်လုပ်သူနှင့် မော်ဒယ်၊ သင်၏ အနီးဆုံး သူငယ်ချင်းများ၏ အကြိုက်ဆုံးအရောင်တို့ ဖြစ်သည်။ အရည်အသွေးဒေတာကို ကုန်စည်များအား ပြုံးနောက်နောက်သေချာလေ့လာရန် နှင့် အလုပ်လျှောက်ထားမှုရုပ်သဘောတူများတွင် လူကြိုက်များသော စကားလုံးများအား သတ်မှတ်ရန် အသုံးပြုနိုင်သည်။

ဖွဲ့စည်းထားသော ဒေတာ (Structured Data)

ဖွဲ့စည်းထားသော ဒေတာ ဆိုသည်မှာ စာကြောင်းများနှင့် သင်္ကေတတွေဖြင့် စီစဉ်ထားသော ဒေတာဖြစ်ပြီး သူတိုင်း စာကြောင်းတစ်ကြောင်းလျှင် တူညီသော သင်္ကေတများကို ပိုင်ဆိုင်သည်။ ကော်လံများသည် တိကျသော အမျိုးအစားတစ်ခု၏ တန်ဖိုးတစ်ခုကို ကိုယ်စားပြု၍ ဤတန်ဖိုးသည် အရာရဲ့အဓိပ္ပါယ်ကို ဖော်ပြသည့် နာမည်ဖြင့် အဓိပ္ပါယ်ဖော်ပြပါသည်။ စာကြောင်းများတွင် တကယ့် တန်ဖိုးများပါရှိသည်။ ကော်လံများသည် တန်ဖိုးအတွက် သတ်မှတ်ချက် သို့မဟုတ် ကန့်သတ်ချက်များ ရှိနိုင်ပြီး အဆိုပါ တန်ဖိုးများသည် အမှန်တကယ် ကော်လံကို ကိုယ်စားပြုကြောင်း အာမခံရန် သတ်မှတ်ချက်များ ပါရှိသည်။ ဥပမာအားဖြင့် ဖုန်းနံပါတ် စာရင်းဇယားတစ်ခုတွင် စာကြောင်းတစ်ကြောင်းစီတွင် ဖုန်းနံပါတ်ရှိရမည် ဖြစ်ပြီး အက္ခရာများ ပါဝင်၍ မရနိုင်သည်။ ဖုန်းနံပါတ်ကော်လံတွင် ဝင်ငွေမရှိဘဲ နံပါတ်သာပါရမည်ဟု စည်းကမ်းချက်များ ပါရှိသည်။

ဖွဲ့စည်းထားသော ဒေတာ၏ အကျိုးကျေးဇူးမှာ အခြား ဖွဲ့စည်းထားသော ဒေတာနှင့် ဆက်စပ်နိုင်သော ပုံစံမျိုးဖြင့် စီမံစည်းကြပ်နိုင်ခြင်းဖြစ်သည်။ သို့သော် ဒေတာကို တိကျသော ပုံစံတစ်ခုအတိုင်း ဒီဇိုင်းလုပ်ထားသောကြောင့် ၎င်း၏ ပြည့်စုံသော ဖွဲ့စည်းပုံကို ပြောင်းလဲခြင်းသည် အားအလွန်ကြီးသော ကြိုးစားမှုများလိုအပ်နိုင်သည်။ ဥပမာအားဖြင့် ဖုန်းနံပါတ် မရှိခြင်း မရှိသေးသော အီးမေးလ်ကော်လံကို အသစ်ဖော်ထုတ်တင်ရန် ဆိုပါက ရှိပြီးသား ဖောက်သည် စာရင်းဇယားတွင် ၎င်းတန်ဖိုးများကို ထည့်သွင်းရန် နည်းလမ်းများ ရှာဖွေရန် လိုအပ်လာသည်။

ဖွဲ့စည်းထားသော ဒေတာ၏ ဥပမာများမှာ စာရင်းဇယားများ၊ ဆက်နွယ်မှု ဒေတာဘေ့စ်များ၊ ဖုန်းနံပါတ်များ၊ ဘဏ်လွှာများ ဖြစ်သည်။

မဖွဲ့စည်းထားသော ဒေတာ (Unstructured Data)

မဖွဲ့စည်းထားသော ဒေတာသည် အများအားဖြင့် စာကြောင်းများ သို့မဟုတ် ကော်လံများအဖြစ် ခွဲခြား၍ မရနိုင်ပြီး နည်းလမ်း သို့မဟုတ် စည်းမျဉ်းများ ရှိခြင်း မရှိပါ။ မဖွဲ့စည်းထားသော ဒေတာတွင် ဖွဲ့စည်းမှုအပေါ် ကန့်သတ်ချက်နည်းသောကြောင့် သစ်တစ်ခု ထပ်မံ တိုးချဲ့ ထည့်သွင်းရန် လွယ်ကူသည်၊ ဖွဲ့စည်းထားသော ဒေတာစုစည်းမှုနှင့် နှိုင်းယှဉ်ပါက။ ဥပမာအားဖြင့် နှစ်ခြင်းစက္ကန့်အားဖြင့် တိုင်းတာသော စင်ဆာတစ်ခုသည် အပူချိန်ကို တိုင်းတာထားရန် အသစ် ထည့်သွင်းနိုင်ခြင်းအတွက် အခြေခံဒေတာမပြောင်းလဲဘဲ ပုံသေတွင် ထည့်သွင်းနိုင်သည်။ သို့သော် ၎င်းကို ဓာတ်ခွဲခြင်း သို့မဟုတ် စုံစမ်းစစ်ဆေးခြင်း ပြုလုပ်ရာတွင် အချိန်ပို လိုအပ်စေသည်။ ဥပမာအားဖြင့် စင်ဆာမှ အတိတ်လအတွင်း ပျမ်းမှတ်အပူချိန်ကို ရှာဖွေရန် ကြိုးစားနေသည့် သိပ္ပံပညာရှင်တစ်ဦးသည် စင်ဆာမှတ်တမ်းအချို့တွင် 'e' ဟုမှတ်သားထားသည့် အချက်များ ရှိသည်ကို တွေ့ရှိပြီး ဖွဲ့စည်းပုံမှန်ဂဏန်းတစ်ခုမဟုတ်ဘဲ သက်သေပြသည်မှာ ဒေတာ မပြည့်စုံစွာရှိသည်ဖြစ်သည်။

မဖွဲ့စည်းထားသော ဒေတာ၏ ဥပမာများမှာ စာသားဖိုင်များ၊ စာတိုပို့ဆောင်မှုများ၊ ဗီဒီယိုဖိုင်များ ဖြစ်သည်။

အဝတ်အစုံဖွဲ့စည်းပုံ (Semi-structured)

အဝတ်အစုံဖွဲ့စည်းခြင်းသည် ဖွဲ့စည်းထားသော ဒေတာနှင့် မဖွဲ့စည်းထားသော ဒေတာတို့ ပေါင်းစပ်ထားသော လက္ခဏာများ ရှိသည်။ ၎င်းသည် အများအားဖြင့် စာကြောင်းနဲ့ ကော်လံပုံစံကိုလိုက်နာသည် မဟုတ်သော်လည်း ဖွဲ့စည်းထားသည့် ပုံစံဖြစ်သောကြောင့် တိကျသော ပုံစံ သို့မဟုတ် စည်းကမ်းများကို လိုက်နာနိူင်သည်။ ဖွဲ့စည်းပုံသည် အရင်းအမြစ်အလိုက် ကွဲပြားနိုင်ပြီး သပ်ရပ်ပြီး တိကျသော အဆင့်မြင့်ဖွဲ့စည်းပုံမှ သကွပ်သကူးမှုပြုလုပ်ရန် လွယ်ကူသော ပုံစံအထိ ဖြစ်နိုင်သည်။ မီတာဒေတာ (metadata) ဆိုသည်မှာ ဒေတာကို မည်သို့စီမံ ပြုပြင် ထားသည်နှင့် ဘယ်နေရာတွင် သိမ်းဆည်းထားသည်ကို ဆုံးဖြတ်ရန် အထောက်အကူဖြစ်သော အချက်များ ဖြစ်ပြီး၊ ဒေတာအမျိုးအစားများအပေါ်မူတည်၍ နာမည်မျိုးစုံရှိသည်။ မီတာဒေတာများ၏ လူသုံးများသော နာမည်များမှာ တဏှာများ (tags), အစိတ်အပိုင်းများ (elements), အဖြစ်များ (entities), နှင့် သက်ဆိုင်ရာ အချက်အလက်များ (attributes) ဖြစ်သည်။ ဥပမာအားဖြင့် အီးမေးလ်ပုံစံတစ်ခုတွင် ခေါင်းစဉ်၊ အကြောင်းအရာ၊ လက်ခံသူများ စသည့် ပစ္စည်းများရှိပြီး ပုံစံအရ မည်သူမှ ပြောသည့် အချိန်နှင့် အခြေအနေကို စီမံနိုင်သည်။

အဝတ်အစုံဖွဲ့စည်းထားသော ဒေတာ၏ ဥပမာများမှာ HTML, CSV ဖိုင်များ၊ JavaScript Object Notation (JSON) ဖြစ်သည်။

ဒေတာ၏ အရင်းအမြစ်များ

ဒေတာအရင်းအမြစ်ဆိုသည်မှာ ဒေတာကို ဖြစ်ပေါ်လာသောပထမဦးဆုံးနေရာ သို့မဟုတ် ဒေတာ "နေထိုင်ရာ" ဖြစ်ပြီး စုဆောင်းထားပုံ နှင့် စုဆောင်းချိန်အပေါ် မူတည်၍ ကွဲပြားသည်။ အသုံးပြုသူ(များ) မှ ထုတ်လုပ်သည့် ဒေတာကို ပထမဦးဆုံး ဒေတာ (primary data) ဟုခေါ်ပြီး ဒေတာကို အများပြည်သူ အသုံးပြုရန် မူရင်း ရင်းမြစ်မှ စုဆောင်းထားသော ဒေတာကို ဒုတိယဒေတာ (secondary data) ဟုခေါ်သည်။ ဥပမာအားဖြင့် သစ်တောတောတွင် သိပ္ပံပညာရှင်များ စောင့်ကြည့်မှတ်တမ်းများကို စုဆောင်းပါက ၎င်းသည် ပထမဦးဆုံး ဒေတာ ဖြစ်ပြီး အခြား သိပ္ပံပညာရှင်များနှင့် မျှဝေပင်ဆောင်ကိုင်ခြင်းဖြင့် အသုံးပြုသူများအတွက် ဒုတိယဒေတာ ဖြစ်လာသည်။

ဒေတာဘေ့စ်များသည် ပုံမှန် ဒေတာအရင်းအမြစ်များဖြစ်ပြီး ဒေတာဘေ့စ်စီမံခန့်ခွဲမှု စနစ်တစ်ခုကို မူလတည် အဖြစ်ထားရှိကာ အသုံးပြုသူများသည် ဒေတာစူးစမ်းရန် ဆက်တင်များ (queries) ကို အသုံးပြုသည်။ ဖိုင်များသည် အသံ၊ ပုံရိပ်နှင့် ဗီဒီယိုဖိုင်များဖြင့် ဖြစ်နိုင်သလို Excel ကဲ့သို့ စာရင်းဇယားများလည်း ဖြစ်နိုင်သည်။ အင်တာနက်ရင်းမြစ်များမှာ ဒေတာတင်ဆောင်ရန်မြေပုံလမ်းကြောင်းများဖြစ်သောကြောင့် ဒေတာဘေ့စ်များနှင့် ဖိုင်များကို ရနိုင်သည်။ အထူးပြုဖန်တီးထားသည့် application programming interfaces (APIs) သည် ပရိုဂရမ်မာများအား အင်တာနက်မှတဆင့် ပြင်ပအသုံးပြုသူများနှင့် ဒေတာမျှဝေရန် နည်းလမ်းများ ဖန်တီးရန် ခွင့်ပြုသည်။ ဝက်ဘ်စာမျက်နှာမှဒေတာကို ဆွဲထုတ်ခြင်းသည် web scraping ဟု ခေါ်သည်။ Working with Data တွင် ဒီလို အမျိုးမျိုးသော ဒေတာရင်းမြစ်များကို ဘယ်လို သုံးရမယ်ဆိုတာ အာရုံစိုက်တင်ပြထားသည်။

နိဂုံးချုပ်

ဤသင်ခန်းစာတွင် ကျွန်ုပ်တို့ သင်ယူခဲ့သည်မှာ -

  • ဒေတာဆိုသည်မှာ အဘယ်နည်း
  • ဒေတာကို ဘယ်လိုဖော်ပြသည်
  • ဒေတာကို ယေဘူယျပြုပြင်ခြင်းနှင့် အမျိုးအစားခွဲခြင်း
  • ဒေတာကို ဘယ်နေရာတွင် ရနိုင်သည်

🚀 စိန်ခေါ်မှု

Kaggle သည် အသုံးပြုရန်ကောင်းမွန်သော ဖွင့်လှစ် ဒေတာစုစည်းမှုများ ရနေရာဖြစ်သည်။ dataset search tool ကို အသုံးပြုကာ စိတ်ဝင်စားဖွယ် ဒေတာစုစည်းမှု ၃ မှ ၅ ခု ရှာဖွေ၍ အောက်ပါ အချက်အလက်များဖြင့် အမျိုးအစား ခွဲခြားပါ -

  • ဒီဒေတာသည် အရေအတွက် ဒေတာလား၊ အရည်အသွေး ဒေတာလား?
  • ဒီဒေတာသည် ဖွဲ့စည်းထားသည်၊ မဖွဲ့စည်းထားသည့် ဒေတာလား၊ ဒါမှမဟုတ် အဝတ်အစုံ ဖွဲ့စည်းပုံ ရှိသည့် ဒေတာလား?

စာသင်ခန်းပြီးနောက် စစ်တမ်း

ပြန်လည်သုံးသပ်ခြင်းနှင့် ကိုယ်တိုင်လေ့လာခြင်း

  • Microsoft Learn ၏ Identify data formats အတန်း တစ်ခုတွင် ဖွဲ့စည်းထားသော၊ အဝတ်အစုံ ဖွဲ့စည်းထားသောနှင့် မဖွဲ့စည်းထားသော ဒေတာများ၏ ဖော်ပြချက်အသေးစိတ်ပါဝင်သည်။

တာဝန်

Classifying Datasets


ပြောကြားချက် ဤစာတမ်းကို AI ဘာသာပြန်ဝန်ဆောင်မှု Co-op Translator အသုံးပြု၍ ဘာသာပြန်ထားပါသည်။ ကျွန်ုပ်တို့သည် တိကျမှန်ကန်မှုအတွက် ကြိုးပမ်းနေသော်လည်း၊ စက်ကိရိယာဘာသာပြန်ခြင်းများတွင် အမှားများ သို့မဟုတ် မှားယွင်းချက်များ ပါဝင်နိုင်ကြောင်း သတိပြုပါရန် လိုအပ်ပါသည်။ မူလစာတမ်းကို မူရင်းဘာသာဖြင့်သာ ယုံကြည်စိတ်ချရသော အချက်အလက်အဖြစ် သတ်မှတ်သင့်သည်။ အရေးကြီးသည့် သတင်းအချက်အလက်များအတွက် ပရော်ဖက်ရှင်နယ် လူသားဘာသာပြန်သူဝန်ဆောင်မှုကို အကြံပြုပါသည်။ ဤဘာသာပြန်ချက်ကို အသုံးပြုခြင်းမှ ဖြစ်ပေါ်လာသော နားလည်မှုကွာခြားမှုများ သို့မဟုတ် မမှန်ကန်သော အသုံးပြုမှုများအတွက် ကျွန်ုပ်တို့ တာဝန်မခံပါ။