You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
Data-Science-For-Beginners/translations/ml/1-Introduction/03-defining-data
localizeflow[bot] c2bac57fa3
[te,ml,kn] chore(i18n): sync translations
4 weeks ago
..
README.md [te,ml,kn] chore(i18n): sync translations 4 weeks ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 213 changes) 7 months ago

README.md

ഡാറ്റ വിശകലനം ചെയ്യൽ

 Sketchnote by (@sketchthedocs)
ഡാറ്റ വിശകലനം ചെയ്യൽ - സ്കെച്ച്നോട്ട് @nitya നൽകിയതാണ്

ഡാറ്റ എന്നത് കണ്ടെത്തലുകൾ നടത്താനും ബോധപൂർവ്വമായ തീരുമാനങ്ങൾ പിന്തുണയ്ക്കാനുമായി ഉപയോഗിക്കുന്ന വാസ്തവങ്ങൾ, വിവരങ്ങൾ, നിരീക്ഷണങ്ങൾ, അളവുകൾ എന്നിവയാണ്. ഡാറ്റ പോയിന്റ് എന്നത് ഡേറ്റാസെറ്റിനുള്ളിലെ ഒരൊറ്റ ഡാറ്റ യൂണിറ്റാണ്, ഡേറ്റാസെറ്റ് ഡാറ്റ പോയിന്റുകളുടെ സമാഹാരമാണ്. ഡേറ്റാസെറ്റ് വിവിധ ഫോർമാറ്റുകളിലും ഘടനകളിലുമായി വരാം, സാധാരണയായി അതിന്റെ ഉറവിടത്തിൻറെ അടിസ്ഥാനത്തിലാണ്, അല്ലെങ്കിൽ ഡാറ്റ എവിടെയാണ് ഉണ്ടായത് എന്നതിൽ. ഉദാഹരണത്തിന്, ഒരു കമ്പനിയുടെയും മാസാന്ത വരുമാനം സ്പ്രഡ്‌ഷീറ്റിൽ ഉണ്ടാകാം, എന്നാൽ സ്മാർട്ട്‌വാച്ചിൽ നിന്നുള്ള മണിക്കൂർഅളവിലെ ഹൃദയമിടിപ്പിന്റെ ഡാറ്റ JSON ഫോർമാറ്റിലായിരിക്കാം. ഡാറ്റ സയന്റിസ്റ്റുകൾ ഒരു ഡേറ്റാസെറ്റിനുള്ളിൽ വിവിധ തരത്തിലുള്ള ഡാറ്റയിൽ ജോലി ചെയ്യുന്നുണ്ടാകുന്നത് സാധാരണമാണ്.

ഈ പാഠത്തിൽ, ഡാറ്റയുടെ സ്വഭാവവും ഉറവിടങ്ങളും പരിഗണിച്ചാണ് ഡാറ്റ തിരിച്ചറിയുകയും വർഗ്ഗീകരിക്കുകയും ചെയ്യുന്നതിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു.

പ്രീ-ലെക്ചർ ക്വിസ്

ഡാറ്റയെ എങ്ങനെ വിവരണമെടുക്കുന്നു

അസംസ്‌കൃത ഡാറ്റ (Raw Data)

അസംസ്‌കൃത ഡാറ്റ എന്നത് അതിന്റെ ഉറവിടത്തിൽ നിന്നുള്ള പ്രാഥമിക നിലയിലെ ഡാറ്റയാണ്, ഇത് വിശകലനം ചെയ്തോ ക്രമീകരിച്ചോ ആയിട്ടില്ല. ഒരു ഡേറ്റാസെറ്റിൽ എന്തിനാണ് സംഭവിക്കുന്നത് എന്നത് മനസ്സിലാക്കാൻ, മനുഷ്യർക്കും അവരെല്ലാം വിശകലനം ചെയ്യാൻ ഉപയോഗിക്കുന്ന സാങ്കേതിക വിദ്യകൾക്കും മനസ്സിലാകുന്ന രീതിയിൽ ഒരു രൂപത്തിൽ ക്രമീകരിക്കേണ്ടതുണ്ട്. ഒരു ഡേറ്റാസെറ്റിന്റെ ഘടന അതിന് എങ്ങനെ ക്രമീകരണമാണുള്ളതെന്ന് വിശദീകരിക്കുന്നു, ഈ ഘടനയെ ഘടിതം, അസംസ്‌കൃതം, അർദ്ദഘടിതം എന്നിങ്ങനെ വന്ധനകൾക്ക് കീഴിൽ വർക്കാമാണ്. ഈ ഘടിതങ്ങളെയും ഘടനയെയും ഉറവിടത്തെ അനുസരിച്ച് വ്യത്യാസമുണ്ടാകാം, പക്ഷേ അവസാനപരിണാമത്തിൽ ഇവ മൂന്ന് വർഗ്ഗങ്ങളിലായി എത്തും.

സംഖ്യാത്മക ഡാറ്റ (Quantitative Data)

സംഖ്യാത്മക ഡാറ്റ ഡേറ്റാസെറ്റിനുള്ളിലെ സംഖ്യാത്മക നിരീക്ഷണങ്ങളാണ്, സാധാരണയായി വിശകലനം, അളവുകൾ എടുക്കൽ, ഗണിതപരമായ ഉപയോഗം എന്നിവയ്ക്ക് ബാധകമാണ്. സംഖ്യാത്മക ഡാറ്റയുടെ ചില ഉദാഹരണങ്ങൾ: ഒരു երկրի ജനസംഖ്യ, ഒരു വ്യക്തിയുടെ ഉയരം, ഒരു കമ്പനിയ്ക് പ്രതിമാസ വരുമാനം. കൂടുതൽ വിശകലനത്തോടെ, സംഖ്യാത്മക ഡാറ്റ ഉപയോഗിച്ച് എയർ ക്വാളിറ്റി ഇൻഡക്സ് (AQI) സീസണൽ ട്രെൻഡുകൾ കണ്ടെത്താനോ, സാധാരണ ജോലിദിനത്തിലെ തിരക്കുള്ള സമയങ്ങളിൽ ഗതാഗത സാധ്യത കണക്കാക്കാനോ സാധിക്കും.

ഗുണാത്മക ഡാറ്റ (Qualitative Data)

ഗുണാത്മക ഡാറ്റ, മറ്റൊരു പേരിൽ വർഗ്ഗീയ ഡാറ്റ, സംഖ്യാത്മക ഡാറ്റപോലെ ഓബ്ജക്റ്റീവായ അളവെടുപ്പുകൾക്കു പകരം സാധാരണയായി വിഷയപരമായ, വിവിധ ഫോർമാറ്റുകളിലുള്ള ഡാറ്റയാണ്. ഇത് സാധാരണയായി ഒരു ഉൽപ്പന്നത്തിന്റെ ഗുണമേന്മ അല്ലെങ്കിൽ പ്രക്രിയയുടെ ഗുണത്തിന്റെ വിശദവിവരം പകർത്തുന്ന വിധത്തിലാണ്. ചിലപ്പോൾ, ഗുണാത്മക ഡാറ്റ സംഖ്യാത്മക ആകാം, എന്നാൽ സാധാരണ ഗണിതപരമായി ഉപയോഗിക്കാറില്ല, ഉദാഹരണക്കായി ഫോൺ നമ്പറുകൾ അല്ലെങ്കിൽ ടൈംസ്റ്റാമ്പുകൾ. ചില ഉദാഹരണങ്ങൾ: വീഡിയോ കമന്റ്‌സ്, ഒരു കാറിന്റെ നിർമ്മാതാവ് മոդൽ, നിങ്ങളുടെ അടുത്ത സുഹൃത്തിന്റെ ഇഷ്ടപ്പെട്ട നിറം. ഗുണാത്മക ഡാറ്റ വഴി ഉപഭോക്താക്കൾക്ക് ഇഷ്ടപ്പെട്ട ഉൽപ്പന്നങ്ങൾ മനസ്സിലാക്കാനോ തൊഴിൽ അപേക്ഷയുടെ റിസ്യൂമ്മുകളിൽ പ്രചാരത്തിലുള്ള കീ-വാക്കുകൾ തിരിച്ചറിയാനോ സാധിക്കും.

ഘടിത ഡാറ്റ (Structured Data)

ഘടിത ഡാറ്റ എങ്ങനെ ക്രമീകരിച്ചിട്ടുള്ളതെന്ന് പറയുന്നത് നിരകളും ത്താളുകളും ഉള്ള ഫോർമാറ്റിൽ ആണ്, ഓരോ നിരക്കും ഒരേ വിധത്തിലുള്ള ത്താളുകൾ ഉണ്ട്. ത്താളുകൾ പ്രത്യേക തരത്തിലുള്ള മൂല്യങ്ങളെ പ്രതിനിധാനം ചെയ്യുന്നു, അവയ്ക്കുള്ള പേരുകൾ അവ മൂല്യമുള്ളതു എന്താണെന്നു വിവരിക്കുന്നു, നിരകൾ യഥാർത്ഥ മൂല്യങ്ങൾ സഞ്ചരിക്കുന്നു. ത്താളുകൾക്ക് സാധാരണയായി മൂല്യങ്ങളുടെ പാരമിതികൾ അല്ലെങ്കിൽ നിയന്ത്രണങ്ങൾ ഉണ്ടാകാം, മൂല്യങ്ങൾ ഇതിനകം താളിന്റെ പ്രതിനിധാനം ശരിയായി നൽകുന്നതിന്. ഉദാഹരണം, ഒരു ഉപഭോക്തൃ സ്പ്രഡ്‌ഷീറ്റിൽ ഓരോ നിരക്കും ഫോൺ നമ്പർ വേണമെങ്കിൽ, ആ നമ്പറിൽ അക്ഷരങ്ങൾ ഉണ്ടാകരുത്. ഫോൺ നമ്പർ താളിൽ ശൂന്യം അല്ലാതെ നമ്പറുകൾ മാത്രമുണ്ടാകണം എന്നനിയമങ്ങൾ ഉണ്ടായിരിക്കും.

ഘടിത ഡാറ്റയുടെ ഒരു നേട്ടം ആണ് മറ്റ് ഘടിത ഡാറ്റകളുമായി ബന്ധപ്പെട്ടിരിക്കാൻ കഴിയും എന്നത്. എന്നാൽ, അക്കാര്യത്തിൽ ഡാറ്റ വ്യവസ്ഥാപിതമായി ക്രമീകരിച്ചിട്ടുള്ളതിനാൽ, ആകെ ഘടനയിൽ മാറ്റങ്ങൾ വരുത്തുന്നത് ഏറെപ്രവർത്തനം ആവശ്യമാണ്. ഉദാഹരണത്തിന്, ഉപഭോക്തൃ സ്പ്രഡ്‌ഷീറ്റിൽ ഒരു ഇ-മെയിൽ ത്താൾ കൂട്ടിച്ചേർക്കേണ്ടത്, ആ ത്താൾ ശൂന്യമാകരുത് എന്നാണെങ്കിൽ, നിലവിലുള്ള നിരകളിൽ എങ്ങനെ ആ മൂല്യങ്ങൾ കൂട്ടിച്ചേർക്കുമെന്ന് നിങ്ങൾക്ക് കണ്ടെത്തേണ്ടതുണ്ട്.

ഘടിത ഡാറ്റ ഉദാഹരണങ്ങൾ: സ്പ്രഡ്‌ഷീറ്റുകൾ, റിലേഷണൽ ഡാറ്റാബേസുകൾ, ഫോൺ നമ്പറുകൾ, ബാങ്ക് സ്റ്റേറ്റ്മെന്റുകൾ

അസംസ്‌കൃത ഡാറ്റ (Unstructured Data)

അസംസ്‌കൃത ഡാറ്റ സാധാരണയായി നിരകളിലോ ത്താളുകളിലോ വർഗ്ഗീകരിക്കാനാകാതെ മറ്റു ഫോർമാറ്റുകളോ നിയമങ്ങളോ പാലിക്കുന്നില്ലാതെ വരും. ഘടനയ്ക്ക് കുറവുള്ള നിയന്ത്രണം ഉള്ളതിനാൽ പുതിയ വിവരങ്ങൾ കൂട്ടിച്ചേർക്കാൻ ഇത്രയും എളുപ്പമാണ്, ഘടിത ഡേറ്റാസെറ്റുമായി താരതമ്യപ്പെടുത്തുമ്പോൾ. ഉദാഹരണത്തിന്, 2 മിനിറ്റ് ഇടവേളയിൽ ബാരോമെട്രിക് പ്രെഷർ ഡാറ്റ ശേഖരിക്കുന്ന സെൻസർ, ഇപ്പോൾ താപനില അളക്കുവാനും രേഖപ്പെടുത്തുവാനും അപ്ഡേറ്റ് കിട്ടിയാൽ, അസംസ്‌കൃത ആയതിനാൽ നിലവിലുള്ള ഡാറ്റ മാറ്റേണ്ടതില്ല. എന്നാൽ, ഇങ്ങനെ ചെയ്താൽ ഈ ഡാറ്റ വിശകലനം ചെയ്യുക വലുതാണ്. ഉദാഹരണമായി, കഴിഞ്ഞ മാസത്തെ ശരാശരി താപനില കണ്ടെത്താൻ ഒരു ശാസ്ത്രജ്ഞൻ ശ്രമിക്കുമ്പോൾ ചില ഡാറ്റയിൽ ഒരു "e" എന്ന് രേഖപ്പെടുത്തിയിട്ടുണ്ട്, ഇത് തകർന്നുവെന്ന് സൂചിപ്പിക്കുന്നത്, മൂല്യങ്ങൾ പൂർണ്ണമല്ല എന്നർത്ഥം.

അസംസ്‌കൃത ഡാറ്റ ഉദാഹരണങ്ങൾ: ടെക്സ്റ്റ് ഫയലുകൾ, ടെക്സ്റ്റ് സന്ദേശങ്ങൾ, വീഡിയോ ഫയലുകൾ

അർദ്ദഘടിത ഡാറ്റ (Semi-structured Data)

അർദ്ദഘടിത ഡാറ്റ ഘടിതവും അസംസ്‌കൃതവുമായ ഡാറ്റയുടെ ചേരിഞ്ഞ രൂപമാണ്. ഇത് സാധാരണയായി നിരകൾ ടത്തിലെ ഫോർമാറ്റിൽ വന്നിട്ടില്ലെങ്കിലും, ഘടിതമായ രീതിയിൽ ക്രമീകരിച്ചിരിക്കുന്നു, ചിലപ്പോൾ നിശ്ചിത ഫോർമാറ്റ് അല്ലെങ്കിൽ നിയമങ്ങൾ പാലിക്കാം. ഘടിതത്വം ഉറവിടങ്ങളിൽ വ്യത്യാസപ്പെടും, ഉദാഹരണത്തിന്, നല്ല രീതിയിൽ നിർമ്മിച്ച പടിവാതിൽ മുതൽ കൂടുതൽ സൗകര്യപ്രദമായ പുതിയ വിവരങ്ങൾ എളുപ്പത്തിൽ ഉൾപ്പെടുത്താനുള്ളത് വരെ. മെറ്റാഡേറ്റ അപ സ്ഥിതീകരണ നിർണായകമാണ്, ഇത് ഡാറ്റ എങ്ങനെ ക്രമീകരിച്ചും സംഭരിച്ചു എന്ന് നിർണ്ണയിക്കുന്നത്, മെറ്റാഡേറ്റയുടെ പേരുകൾ ഡാറ്റയുടെ തരം അനുസരിച്ച് മാറ്റമാകും. സാധാരണ പേരുകൾ ടാഗുകൾ, ഘടകങ്ങൾ, എന്റിറ്റികൾ, ആട്രിബ്യൂട്ടുകൾ എന്നിവയാണ്. ഉദാഹരണത്തിന്, ഒരു സാധാരണ ഇ-മെയിൽ സന്ദേശത്തിന് വിഷയം, ഉള്ളടക്കം, സ്വീകരിക്കുന്നവരുടെ പട്ടിക, അയച്ചത് ആർ ആണെന്നും അയച്ച സമയവും അടങ്ങാം.

അർദ്ദഘടിത ഡാറ്റ ഉദാഹരണങ്ങൾ: HTML, CSV ഫയൽകൾ, ജാവാസ്ക്രിപ്റ്റ് ഒബ്ജക്റ്റ് നോട്ടേഷൻ (JSON)

ഡാറ്റ ഉറവിടങ്ങൾ

ഒരു ഡാറ്റ ഉറവിടം ഡാറ്റ സൃഷ്ടിച്ച പ്രാരംഭ സ്ഥലം അല്ലെങ്കിൽ അത് "സ്ഥിരം" ഉണ്ട് എന്നു പറയുന്ന സ്ഥലം ആണു, ശേഖരിച്ച സമയത്തും സാഹചര്യവും അനുസരിച്ച് വ്യത്യാസപ്പെടും. ഉപയോക്താക്കളാൽ സൃഷ്ടിച്ച ഡാറ്റ പ്രാഥമിക ഡാറ്റ ആയി അറിയപ്പെടും, എന്നാൽ പൊതുവായി ഉപയോഗത്തിനായി ശേഖരിച്ച ഇൻഫർമേഷൻ രണ്ടാമത്തെ ഡാറ്റ ആണു. ഉദാഹരണമായി, ഒരു വനംവീട് ശാസ്ത്രജ്ഞരുടെ കൂട്ടം നിരീക്ഷണങ്ങൾ ശേഖരിച്ചാൽ അവർ പ്രാഥമിക ഡാറ്റ സൃഷ്ടിക്കുന്നു, അത് മറ്റുള്ള ശാസ്ത്രജ്ഞരുമായി പങ്കുവെക്കുകയാണെങ്കിൽ, അവരെ രണ്ടാമത്തെ ഉപഭോക്താക്കൾ ആകും.

ഡാറ്റാബേസുകൾ ഒരു സാധാരണ ഉറവിടമാണെങ്കിലും, ഡാറ്റാബേസ് മാനേജ്മെന്റ് സിസ്റ്റം ഉപയോക്താക്കൾക്ക് ഡാറ്റ അന്വേഷിക്കുവാൻ ക്വെറിയുകൾ ഉപയോഗിക്കുന്നു. ഫയലുകൾക്ക് ഓഡിയോ, ചിത്രം, വീഡിയോ ഫയലുകൾ ഉണ്ടാകാം, കൂടാതെ എക്സെൽ പോലുള്ള സ്പ്രഡ്‌ഷീറ്റുകളും. ഇന്റർനെറ്റ് ഉറവിടങ്ങൾ ഡാറ്റ കൈകാര്യം ചെയ്യുന്നതിന് പൊതുവെ കാണപ്പെടുന്നു, ഡാറ്റാബേസുകളും ഫയലുകളും ഇവിടെ ഉണ്ടാകാം. ആപ്ലിക്കേഷൻ പ്രോഗ്രാമിംഗ് ഇന്റർഫേസുകൾ (APIകൾ) പ്രോഗ്രാമർമാർക്ക് ഡാറ്റ മറ്റ് ഉപയോക്താക്കൾക്ക് പങ്കുവെക്കാനുള്ള മാർഗങ്ങൾ സൃഷ്ടിക്കാൻ സഹായിക്കുന്നു, വെബ് സ്ക്രാപിംഗ് എന്ന പ്രക്രിയ വെബ് പേജിൽ നിന്നുള്ള ഡാറ്റപിടിക്കുന്നത് ആണ്. Working with Data പാഠഘടകങ്ങൾ വിവിധ ഡാറ്റ ഉറവിടങ്ങൾ ഉപയോഗിക്കുന്ന രീതിയിൽ കേന്ദ്രീകരിക്കുന്നു.

പര്യവസംഹാരം

ഈ പാഠത്തിൽ നാം പഠിച്ചത്:

  • ഡാറ്റ എന്താണെന്ന്
  • ഡാറ്റ എങ്ങനെ വിവരണമെടുക്കുന്നു
  • ഡാറ്റ എങ്ങനെ വൻഗ്ഗീകരിക്കുകയും കാറ്റഗറൈസ് ചെയ്യുകയും ചെയ്യുന്നു
  • ഡാറ്റ എവിടെയാണ് കണ്ടെത്താൻ കഴിയുക

🚀 ചലഞ്ച്

കാഗിൾ ഒരു മികച്ച തുറന്ന് ഡാറ്റാസെറ്റ് ഉറവിടമാണ്. dataset search tool ഉപയോഗിച്ച് ചില രസകരമായ ഡാറ്റാസെറ്റുകൾ കണ്ടെത്തി അവ 3-5 ഡാറ്റാസെറ്റുകൾ താഴെ പറയുന്ന ക്രൈറ്റീരിയ അനുസരിച്ച് കാറ്റഗറൈസ് ചെയ്യുക:

  • ഡാറ്റ സംഖ്യാത്മകമാണോ ഗുണാത്മകമാണോ?
  • ഡാറ്റ ഘടിതമോ അസംസ്‌കൃതമോ അർദ്ദഘടിതമോ?

പോസ്റ്റ്-ലെക്ചർ ക്വിസ്

റിവ്യൂ & സ്വയംപഠനം

അസൈൻമെന്റ്

ഡാറ്റാസെറ്റുകൾ കാറ്റഗറൈസ് ചെയ്യൽ


അറിയിപ്പ്: ഈ രേഖ AI പരിഭാഷാ സേവനം Co-op Translator ഉപയോഗിച്ച് പരിഭാഷപ്പെടുത്തിയതാണ്. ഞങ്ങൾ കൃത്യതയ്ക്കായി ശ്രമിക്കുന്നുവെങ്കിലും, ഓട്ടോമേറ്റഡ് പരിഭാഷകളിൽ പിഴവുകൾ അല്ലെങ്കിൽ തെറ്റായ വിവരങ്ങൾ ഉണ്ടാകാൻ സാധ്യതയുണ്ട്. അതിന്റെ സ്വാഭാവിക ഭാഷയിലുള്ള അസൽ രേഖയാണ് പ്രാമാണികമായ ഉറവിടമായി പരിഗണിക്കേണ്ടത്. നിർണായകമായ വിവരങ്ങൾക്ക്, പ്രൊഫഷണൽ മനുഷ്യ പരിഭാഷ ശുപാർശ ചെയ്യുന്നു. ഈ പരിഭാഷ ഉപയോഗിച്ച് ഉണ്ടാകുന്ന തെറ്റിദ്ധാരണകൾ അല്ലെങ്കിൽ തെറ്റായ വ്യാഖ്യാനങ്ങൾക്കായി ഞങ്ങൾ ഉത്തരവാദികളല്ല.