[id,ms,tl] chore(i18n): sync translations

Sync translations with latest source changes.
Languages: Indonesian [id], Malay [ms], Tagalog (Filipino) [tl]
update-translations
localizeflow[bot] 6 days ago
parent 616a08883a
commit e14f7a5142

@ -12,8 +12,8 @@
"language_code": "id"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T09:58:28+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:45:16+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "id"
},
@ -42,8 +42,8 @@
"language_code": "id"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-05T23:59:07+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T21:51:24+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "id"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "id"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:46:22+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "id"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-28T18:49:46+00:00",
@ -108,8 +114,8 @@
"language_code": "id"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T09:59:42+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:44:45+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "id"
},
@ -192,14 +198,14 @@
"language_code": "id"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-28T18:45:16+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:51:31+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "id"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-28T18:45:34+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:51:27+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "id"
},

File diff suppressed because one or more lines are too long

@ -4,44 +4,44 @@
|:---:|
|Mendefinisikan Data - _Sketchnote oleh [@nitya](https://twitter.com/nitya)_ |
Data adalah fakta, informasi, observasi, dan pengukuran yang digunakan untuk membuat penemuan dan mendukung pengambilan keputusan yang terinformasi. Sebuah titik data adalah satu unit data dalam sebuah dataset, yang merupakan kumpulan dari titik-titik data. Dataset dapat hadir dalam berbagai format dan struktur, biasanya berdasarkan sumbernya atau dari mana data tersebut berasal. Sebagai contoh, pendapatan bulanan sebuah perusahaan mungkin disimpan dalam spreadsheet, sedangkan data detak jantung per jam dari smartwatch mungkin dalam format [JSON](https://stackoverflow.com/a/383699). Umumnya, ilmuwan data bekerja dengan berbagai jenis data dalam sebuah dataset.
Data adalah fakta, informasi, pengamatan dan pengukuran yang digunakan untuk membuat penemuan dan mendukung keputusan yang berinformasi. Sebuah titik data adalah satu unit data dalam sebuah dataset, yang merupakan kumpulan titik data. Dataset dapat datang dalam format dan struktur yang berbeda-beda, dan biasanya akan berdasarkan sumbernya, atau dari mana data berasal. Misalnya, pendapatan bulanan sebuah perusahaan mungkin ada dalam spreadsheet tetapi data detak jantung per jam dari smartwatch mungkin dalam format [JSON](https://stackoverflow.com/a/383699). Umum bagi ilmuwan data untuk bekerja dengan berbagai jenis data dalam sebuah dataset.
Pelajaran ini berfokus pada mengidentifikasi dan mengklasifikasikan data berdasarkan karakteristik dan sumbernya.
## [Kuis Pra-Pelajaran](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## [Kuis Pra-Kuliah](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Bagaimana Data Dijelaskan
### Data Mentah
Data mentah adalah data yang berasal dari sumbernya dalam keadaan awal dan belum dianalisis atau diorganisasi. Untuk memahami apa yang terjadi dalam sebuah dataset, data perlu diorganisasi ke dalam format yang dapat dipahami oleh manusia serta teknologi yang mungkin digunakan untuk menganalisisnya lebih lanjut. Struktur dataset menggambarkan bagaimana data diorganisasi dan dapat diklasifikasikan sebagai terstruktur, tidak terstruktur, dan semi-terstruktur. Jenis struktur ini akan bervariasi tergantung pada sumbernya, tetapi pada akhirnya akan masuk ke dalam tiga kategori ini.
Data mentah adalah data yang berasal dari sumbernya dalam keadaan awal dan belum dianalisis atau diorganisasi. Untuk memahami apa yang sedang terjadi dengan sebuah dataset, data perlu diatur dalam format yang dapat dipahami oleh manusia maupun teknologi yang mungkin digunakan untuk menganalisis lebih lanjut. Struktur sebuah dataset menggambarkan bagaimana data diorganisasi dan dapat diklasifikasikan sebagai terstruktur, tidak terstruktur, dan semi-terstruktur. Jenis-jenis struktur ini akan bervariasi tergantung pada sumber tetapi pada akhirnya masuk dalam tiga kategori ini.
### Data Kuantitatif
Data kuantitatif adalah observasi numerik dalam sebuah dataset yang biasanya dapat dianalisis, diukur, dan digunakan secara matematis. Beberapa contoh data kuantitatif adalah: populasi suatu negara, tinggi badan seseorang, atau pendapatan kuartalan sebuah perusahaan. Dengan analisis tambahan, data kuantitatif dapat digunakan untuk menemukan tren musiman pada Indeks Kualitas Udara (AQI) atau memperkirakan kemungkinan kemacetan lalu lintas pada hari kerja biasa.
Data kuantitatif adalah pengamatan numerik dalam sebuah dataset dan biasanya dapat dianalisis, diukur, dan digunakan secara matematis. Beberapa contoh data kuantitatif adalah: populasi sebuah negara, tinggi badan seseorang, atau pendapatan kuartalan sebuah perusahaan. Dengan analisis tambahan, data kuantitatif dapat digunakan untuk menemukan tren musiman Indeks Kualitas Udara (AQI) atau memperkirakan kemungkinan kemacetan pada jam sibuk di hari kerja biasa.
### Data Kualitatif
Data kualitatif, juga dikenal sebagai data kategorikal, adalah data yang tidak dapat diukur secara objektif seperti observasi data kuantitatif. Umumnya, data ini berupa berbagai format data subjektif yang menangkap kualitas sesuatu, seperti produk atau proses. Kadang-kadang, data kualitatif bersifat numerik tetapi tidak digunakan secara matematis, seperti nomor telepon atau stempel waktu. Beberapa contoh data kualitatif adalah: komentar video, merek dan model mobil, atau warna favorit teman terdekat Anda. Data kualitatif dapat digunakan untuk memahami produk mana yang paling disukai konsumen atau mengidentifikasi kata kunci populer dalam resume lamaran kerja.
Data kualitatif, juga dikenal sebagai data kategorikal, adalah data yang tidak dapat diukur secara objektif seperti pengamatan data kuantitatif. Ini umumnya berupa berbagai format data subjektif yang menangkap kualitas sesuatu, seperti produk atau proses. Kadang-kadang, data kualitatif berupa angka dan biasanya tidak digunakan secara matematis, seperti nomor telepon atau cap waktu. Beberapa contoh data kualitatif adalah: komentar video, merek dan model mobil, atau warna favorit teman dekat Anda. Data kualitatif dapat digunakan untuk memahami produk apa yang paling disukai konsumen atau mengidentifikasi kata kunci populer dalam resume lamaran kerja.
### Data Terstruktur
Data terstruktur adalah data yang diorganisasi ke dalam baris dan kolom, di mana setiap baris memiliki set kolom yang sama. Kolom mewakili nilai dari jenis tertentu dan akan diidentifikasi dengan nama yang menggambarkan apa yang diwakili oleh nilai tersebut, sementara baris berisi nilai-nilai aktual. Kolom sering kali memiliki serangkaian aturan atau batasan tertentu pada nilai-nilai, untuk memastikan bahwa nilai-nilai tersebut secara akurat mewakili kolom. Sebagai contoh, bayangkan sebuah spreadsheet pelanggan di mana setiap baris harus memiliki nomor telepon dan nomor telepon tersebut tidak pernah mengandung karakter alfabet. Mungkin ada aturan yang diterapkan pada kolom nomor telepon untuk memastikan kolom tersebut tidak pernah kosong dan hanya berisi angka.
Data terstruktur adalah data yang diorganisasi ke dalam baris dan kolom, di mana setiap baris memiliki set kolom yang sama. Kolom mewakili nilai dari tipe tertentu dan akan diidentifikasi dengan nama yang menggambarkan apa yang direpresentasikan nilai tersebut, sementara baris berisi nilai-nilai sebenarnya. Kolom sering memiliki seperangkat aturan atau batasan pada nilainya, untuk memastikan bahwa nilai tersebut akurat merepresentasikan kolom. Misalnya bayangkan sebuah spreadsheet pelanggan di mana setiap baris harus memiliki nomor telepon dan nomor telepon tidak pernah berisi karakter alfabet. Mungkin ada aturan yang diterapkan pada kolom nomor telepon untuk memastikan kolom tersebut tidak kosong dan hanya berisi angka.
Keuntungan dari data terstruktur adalah bahwa data dapat diorganisasi sedemikian rupa sehingga dapat dihubungkan dengan data terstruktur lainnya. Namun, karena data dirancang untuk diorganisasi dengan cara tertentu, membuat perubahan pada struktur keseluruhannya dapat memerlukan banyak usaha. Sebagai contoh, menambahkan kolom email ke spreadsheet pelanggan yang tidak boleh kosong berarti Anda perlu mencari cara untuk menambahkan nilai-nilai ini ke baris pelanggan yang sudah ada dalam dataset.
Keuntungan dari data terstruktur adalah dapat diatur sedemikian rupa sehingga dapat dihubungkan dengan data terstruktur lainnya. Namun, karena data dirancang untuk diatur dengan cara tertentu, membuat perubahan pada keseluruhan strukturnya bisa memerlukan banyak usaha. Contohnya, menambahkan kolom email pada spreadsheet pelanggan yang tidak boleh kosong berarti Anda harus mencari cara untuk menambahkan nilai-nilai ini ke baris pelanggan yang sudah ada di dataset.
Contoh data terstruktur: spreadsheet, basis data relasional, nomor telepon, laporan bank.
Contoh data terstruktur: spreadsheet, basis data relasional, nomor telepon, laporan bank
### Data Tidak Terstruktur
Data tidak terstruktur biasanya tidak dapat dikategorikan ke dalam baris atau kolom dan tidak memiliki format atau aturan tertentu untuk diikuti. Karena data tidak terstruktur memiliki lebih sedikit batasan pada strukturnya, lebih mudah untuk menambahkan informasi baru dibandingkan dengan dataset terstruktur. Jika sebuah sensor yang menangkap data tekanan barometrik setiap 2 menit menerima pembaruan yang sekarang memungkinkan sensor tersebut mengukur dan merekam suhu, tidak diperlukan perubahan pada data yang sudah ada jika data tersebut tidak terstruktur. Namun, ini mungkin membuat analisis atau investigasi data jenis ini memakan waktu lebih lama. Sebagai contoh, seorang ilmuwan yang ingin menemukan suhu rata-rata bulan sebelumnya dari data sensor, tetapi menemukan bahwa sensor mencatat "e" dalam beberapa datanya untuk menunjukkan bahwa sensor tersebut rusak, bukan angka biasa, yang berarti data tersebut tidak lengkap.
Data tidak terstruktur biasanya tidak dapat dikategorikan ke dalam baris atau kolom dan tidak memiliki format atau aturan yang harus diikuti. Karena data tidak terstruktur memiliki lebih sedikit batasan pada strukturnya, lebih mudah untuk menambah informasi baru dibandingkan dengan dataset terstruktur. Jika sensor yang menangkap data tekanan barometrik setiap 2 menit menerima pembaruan yang memungkinkan mengukur dan merekam suhu, maka tidak perlu mengubah data yang sudah ada jika data tidak terstruktur. Namun, hal ini dapat membuat analisis atau penyelidikan jenis data ini menjadi lebih lama. Misalnya, seorang ilmuwan yang ingin mencari suhu rata-rata bulan sebelumnya dari data sensor, tetapi menemukan bahwa sensor merekam "e" dalam beberapa data untuk menunjukkan bahwa sensor rusak, bukan angka biasa, berarti data tidak lengkap.
Contoh data tidak terstruktur: file teks, pesan teks, file video.
Contoh data tidak terstruktur: berkas teks, pesan teks, berkas video
### Data Semi-Terstruktur
Data semi-terstruktur memiliki fitur yang membuatnya menjadi kombinasi antara data terstruktur dan tidak terstruktur. Data ini biasanya tidak mengikuti format baris dan kolom tetapi diorganisasi dengan cara yang dianggap terstruktur dan mungkin mengikuti format tetap atau aturan tertentu. Struktur ini akan bervariasi antara sumber, seperti hierarki yang terdefinisi dengan baik hingga sesuatu yang lebih fleksibel yang memungkinkan integrasi informasi baru dengan mudah. Metadata adalah indikator yang membantu menentukan bagaimana data diorganisasi dan disimpan, serta memiliki berbagai nama berdasarkan jenis data. Beberapa nama umum untuk metadata adalah tag, elemen, entitas, dan atribut. Sebagai contoh, sebuah pesan email biasa akan memiliki subjek, isi, dan daftar penerima, serta dapat diorganisasi berdasarkan siapa atau kapan pesan tersebut dikirim.
### Semi-terstruktur
Data semi-terstruktur memiliki fitur yang menjadikannya kombinasi antara data terstruktur dan tidak terstruktur. Data ini biasanya tidak mengikuti format baris dan kolom tetapi diatur dengan cara yang dianggap terstruktur dan mungkin mengikuti format atau aturan tetap. Struktur akan bervariasi antara sumber, seperti hierarki yang terdefinisi dengan baik hingga sesuatu yang lebih fleksibel yang memungkinkan integrasi informasi baru dengan mudah. Metadata adalah indikator yang membantu menentukan bagaimana data diorganisasi dan disimpan dan akan memiliki berbagai nama, berdasarkan tipe data. Beberapa nama umum untuk metadata adalah tag, elemen, entitas, dan atribut. Contohnya, sebuah pesan email biasanya memiliki subjek, isi, dan daftar penerima dan dapat diorganisasi berdasarkan pengirim atau waktu pengiriman.
Contoh data semi-terstruktur: HTML, file CSV, JavaScript Object Notation (JSON).
Contoh data semi-terstruktur: HTML, berkas CSV, JavaScript Object Notation (JSON)
## Sumber Data
## Sumber Data
Sumber data adalah lokasi awal di mana data dihasilkan, atau di mana data "berada" dan akan bervariasi berdasarkan bagaimana dan kapan data dikumpulkan. Data yang dihasilkan oleh penggunanya dikenal sebagai data primer, sedangkan data sekunder berasal dari sumber yang telah mengumpulkan data untuk penggunaan umum. Sebagai contoh, sekelompok ilmuwan yang mengumpulkan observasi di hutan hujan akan dianggap sebagai data primer, dan jika mereka memutuskan untuk membagikannya dengan ilmuwan lain, data tersebut akan dianggap sebagai data sekunder bagi mereka yang menggunakannya.
Sumber data adalah lokasi awal di mana data dihasilkan, atau di mana data "tinggal" dan bervariasi berdasarkan bagaimana dan kapan data dikumpulkan. Data yang dihasilkan oleh penggunanya disebut data primer sementara data sekunder berasal dari sumber yang mengumpulkan data untuk penggunaan umum. Misalnya, sekelompok ilmuwan yang mengumpulkan pengamatan di hutan hujan dianggap sebagai data primer, dan jika mereka memutuskan membagikannya dengan ilmuwan lain, itu menjadi data sekunder bagi yang menggunakannya.
Basis data adalah sumber yang umum dan bergantung pada sistem manajemen basis data untuk meng-host dan memelihara data, di mana pengguna menggunakan perintah yang disebut kueri untuk mengeksplorasi data. File sebagai sumber data dapat berupa file audio, gambar, dan video serta spreadsheet seperti Excel. Sumber internet adalah lokasi umum untuk meng-host data, di mana basis data serta file dapat ditemukan. Antarmuka pemrograman aplikasi, juga dikenal sebagai API, memungkinkan programmer untuk membuat cara berbagi data dengan pengguna eksternal melalui internet, sementara proses web scraping mengekstrak data dari halaman web. [Pelajaran dalam Bekerja dengan Data](../../../../../../../../../2-Working-With-Data) berfokus pada cara menggunakan berbagai sumber data.
Basis data adalah sumber umum dan mengandalkan sistem manajemen basis data untuk meng-host dan memelihara data di mana pengguna menggunakan perintah yang disebut kueri untuk menjelajahi data. Berkas sebagai sumber data bisa berupa berkas audio, gambar, dan video serta spreadsheet seperti Excel. Sumber internet adalah lokasi umum untuk men-host data, di mana basis data maupun berkas dapat ditemukan. Antarmuka pemrograman aplikasi, yang dikenal sebagai API, memungkinkan programmer membuat cara untuk berbagi data dengan pengguna eksternal melalui internet, sementara proses web scraping mengekstrak data dari halaman web. [Pelajaran di Bekerja dengan Data](../../../../../../../../../2-Working-With-Data) berfokus pada bagaimana menggunakan berbagai sumber data.
## Kesimpulan
@ -54,16 +54,18 @@ Dalam pelajaran ini kita telah mempelajari:
## 🚀 Tantangan
Kaggle adalah sumber yang sangat baik untuk dataset terbuka. Gunakan [alat pencarian dataset](https://www.kaggle.com/datasets) untuk menemukan beberapa dataset menarik dan klasifikasikan 3-5 dataset dengan kriteria ini:
Kaggle adalah sumber dataset terbuka yang sangat baik. Gunakan [alat pencarian dataset](https://www.kaggle.com/datasets) untuk menemukan beberapa dataset menarik dan klasifikasikan 3-5 dataset dengan kriteria ini:
- Apakah data tersebut kuantitatif atau kualitatif?
- Apakah data tersebut terstruktur, tidak terstruktur, atau semi-terstruktur?
- Apakah data kuantitatif atau kualitatif?
- Apakah data terstruktur, tidak terstruktur, atau semi-terstruktur?
## [Kuis Pasca-Pelajaran](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## [Kuis Pasca-kuliah](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Tinjauan & Studi Mandiri
- Unit Microsoft Learn ini, berjudul [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) memiliki penjelasan rinci tentang data terstruktur, semi-terstruktur, dan tidak terstruktur.
## Tinjauan & Belajar Mandiri
- Unit Microsoft Learn ini, berjudul [Identify data formats](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) memiliki penjelasan rinci tentang data terstruktur, semi-terstruktur, dan tidak terstruktur.
## Tugas
@ -71,5 +73,7 @@ Kaggle adalah sumber yang sangat baik untuk dataset terbuka. Gunakan [alat penca
---
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan layanan penerjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk memberikan hasil yang akurat, harap diperhatikan bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang berwenang. Untuk informasi yang bersifat kritis, disarankan menggunakan jasa penerjemahan manusia profesional. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk mencapai akurasi, harap diketahui bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang sah. Untuk informasi penting, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Pengantar Probabilitas dan Statistik\n",
"Dalam notebook ini, kita akan mencoba beberapa konsep yang telah kita bahas sebelumnya. Banyak konsep dari probabilitas dan statistik yang diwakili dengan baik dalam pustaka utama untuk pemrosesan data di Python, seperti `numpy` dan `pandas`.\n"
"# Pendahuluan tentang Probabilitas dan Statistik\n",
"Dalam buku catatan ini, kita akan bereksperimen dengan beberapa konsep yang telah kita bahas sebelumnya. Banyak konsep dari probabilitas dan statistik yang sangat terwakili dalam perpustakaan utama untuk pemrosesan data di Python, seperti `numpy` dan `pandas`.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## Variabel Acak dan Distribusi\n",
"Mari kita mulai dengan mengambil sampel 30 nilai dari distribusi uniform dari 0 hingga 9. Kita juga akan menghitung mean dan varians.\n"
"Mari kita mulai dengan mengambil sampel sebanyak 30 nilai dari distribusi uniform dari 0 hingga 9. Kita juga akan menghitung rata-rata dan variansi.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Untuk memperkirakan secara visual berapa banyak nilai berbeda yang ada dalam sampel, kita bisa menggambar **histogram**:\n"
"Untuk memperkirakan secara visual berapa banyak nilai berbeda yang ada dalam sampel, kita dapat membuat **histogram**:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## Menganalisis Data Nyata\n",
"\n",
"Rata-rata dan varians sangat penting saat menganalisis data dunia nyata. Mari kita muat data tentang pemain bisbol dari [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Rata-rata dan varians sangat penting saat menganalisis data dunia nyata. Mari kita muat data tentang pemain baseball dari [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -82,7 +82,7 @@
"source": [
"> Kami menggunakan paket yang disebut [**Pandas**](https://pandas.pydata.org/) di sini untuk analisis data. Kami akan membahas lebih lanjut tentang Pandas dan bekerja dengan data di Python nanti dalam kursus ini.\n",
"\n",
"Mari kita hitung nilai rata-rata untuk usia, tinggi, dan berat:\n"
"Mari kita hitung nilai rata-rata untuk umur, tinggi, dan berat:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sekarang mari kita fokus pada tinggi badan, dan hitung deviasi standar serta varians:\n"
"Sekarang mari kita fokus pada tinggi, dan hitung standar deviasi serta variansnya: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Selain nilai rata-rata, masuk akal untuk melihat nilai median dan kuartil. Mereka dapat divisualisasikan menggunakan **diagram kotak**:\n"
"Selain mean, masuk akal untuk melihat nilai median dan kuartil. Mereka dapat divisualisasikan menggunakan **box plot**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -167,7 +167,7 @@
"source": [
"> **Catatan**: Diagram ini menunjukkan, bahwa rata-rata, tinggi pemain base pertama lebih tinggi daripada tinggi pemain base kedua. Nanti kita akan belajar bagaimana kita dapat menguji hipotesis ini secara lebih formal, dan bagaimana menunjukkan bahwa data kita signifikan secara statistik untuk membuktikannya. \n",
"\n",
"Usia, tinggi, dan berat badan semuanya adalah variabel acak kontinu. Menurut Anda, bagaimana distribusinya? Cara yang baik untuk mengetahuinya adalah dengan memplot histogram nilai-nilai tersebut: \n"
"Usia, tinggi, dan berat semuanya adalah variabel acak kontinu. Menurut Anda, bagaimana distribusinya? Cara yang baik untuk mengetahuinya adalah dengan memplot histogram nilainya: \n"
]
},
{
@ -190,7 +190,7 @@
"source": [
"## Distribusi Normal\n",
"\n",
"Mari buat sampel buatan dari berat yang mengikuti distribusi normal dengan mean dan variansi yang sama seperti data nyata kita:\n"
"Mari buat contoh buatan dari bobot yang mengikuti distribusi normal dengan rata-rata dan varians yang sama seperti data asli kita:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Karena sebagian besar nilai dalam kehidupan nyata terdistribusi secara normal, kita sebaiknya tidak menggunakan generator angka acak uniform untuk menghasilkan data sampel. Berikut ini yang terjadi jika kita mencoba menghasilkan berat dengan distribusi uniform (dihasilkan oleh `np.random.rand`):\n"
"Karena sebagian besar nilai dalam kehidupan nyata didistribusikan secara normal, kita tidak boleh menggunakan generator angka acak uniform untuk menghasilkan data sampel. Berikut adalah apa yang terjadi jika kita mencoba menghasilkan berat dengan distribusi uniform (dihasilkan oleh `np.random.rand`):\n"
]
},
{
@ -253,7 +253,7 @@
"source": [
"## Interval Kepercayaan\n",
"\n",
"Sekarang mari kita hitung interval kepercayaan untuk berat dan tinggi pemain bisbol. Kita akan menggunakan kode [dari diskusi stackoverflow ini](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Sekarang mari kita hitung interval kepercayaan untuk berat dan tinggi pemain baseball. Kita akan menggunakan kode [dari diskusi stackoverflow ini](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mari kita uji hipotesis bahwa pemain First Basemen lebih tinggi daripada Second Basemen. Cara paling sederhana untuk melakukan ini adalah dengan menguji interval kepercayaan:\n"
"Mari kita uji hipotesis bahwa First Basemen lebih tinggi daripada Second Basemen. Cara termudah untuk melakukan ini adalah dengan menguji interval kepercayaan:\n"
]
},
{
@ -319,7 +319,7 @@
"source": [
"Kita dapat melihat bahwa intervalnya tidak tumpang tindih.\n",
"\n",
"Cara yang secara statistik lebih benar untuk membuktikan hipotesis adalah dengan menggunakan **Student t-test**:\n"
"Cara yang secara statistik lebih benar untuk membuktikan hipotesis adalah menggunakan **uji t-Student**:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"Dua nilai yang dikembalikan oleh fungsi `ttest_ind` adalah:\n",
"* p-value dapat dianggap sebagai probabilitas dari dua distribusi memiliki mean yang sama. Dalam kasus kami, nilainya sangat rendah, yang berarti ada bukti kuat yang mendukung bahwa pemain base pertama lebih tinggi.\n",
"* t-value adalah nilai antara dari perbedaan mean yang dinormalisasi yang digunakan dalam uji t, dan nilai ini dibandingkan dengan nilai ambang untuk nilai kepercayaan tertentu.\n"
"* p-value dapat dianggap sebagai probabilitas dua distribusi memiliki rata-rata yang sama. Dalam kasus kami, nilainya sangat rendah, yang berarti ada bukti kuat yang mendukung bahwa pemain pertama lebih tinggi.\n",
"* t-value adalah nilai antara dari perbedaan rata-rata ter-normalisasi yang digunakan dalam uji t, dan dibandingkan terhadap nilai ambang untuk nilai kepercayaan tertentu.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Mensimulasikan Distribusi Normal dengan Teorema Limit Sentral\n",
"## Mensimulasikan Distribusi Normal dengan Teorema Limit Tengah\n",
"\n",
"Generator pseudo-acak di Python dirancang untuk memberikan distribusi uniform. Jika kita ingin membuat generator untuk distribusi normal, kita dapat menggunakan teorema limit sentral. Untuk mendapatkan nilai yang terdistribusi normal, kita cukup menghitung rata-rata dari sampel yang dihasilkan secara uniform.\n"
"Generator pseudo-acak di Python dirancang untuk memberikan distribusi uniform. Jika kita ingin membuat generator untuk distribusi normal, kita bisa menggunakan teorema limit tengah. Untuk mendapatkan nilai yang terdistribusi normal, kita hanya akan menghitung rata-rata dari sampel yang dihasilkan secara uniform.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Korelasi dan Evil Baseball Corp\n",
"\n",
"Korelasi memungkinkan kita menemukan hubungan antara urutan data. Dalam contoh mainan kita, mari kita berpura-pura ada sebuah perusahaan baseball jahat yang membayar pemainnya berdasarkan tinggi badan mereka - semakin tinggi pemain, semakin banyak uang yang dia dapatkan. Misalkan ada gaji pokok sebesar $1000, dan bonus tambahan dari $0 hingga $100, tergantung pada tinggi badan. Kita akan mengambil pemain nyata dari MLB, dan menghitung gaji imajinasi mereka:\n"
"Korelasi memungkinkan kita menemukan hubungan antara urutan data. Dalam contoh mainan kita, mari berpura-pura ada sebuah perusahaan bisbol jahat yang membayar pemainnya sesuai dengan tinggi badan mereka - semakin tinggi pemain, semakin banyak uang yang dia dapatkan. Misalkan ada gaji pokok sebesar $1000, dan bonus tambahan dari $0 hingga $100, tergantung pada tinggi badan. Kita akan mengambil pemain asli dari MLB, dan menghitung gaji imajiner mereka:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sekarang mari kita hitung kovarians dan korelasi dari urutan tersebut. `np.cov` akan memberi kita yang disebut **matriks kovarians**, yang merupakan perpanjangan dari kovarians ke banyak variabel. Elemen $M_{ij}$ dari matriks kovarians $M$ adalah korelasi antara variabel input $X_i$ dan $X_j$, dan nilai diagonal $M_{ii}$ adalah varians dari $X_{i}$. Demikian pula, `np.corrcoef` akan memberi kita **matriks korelasi**.\n"
"Sekarang mari kita hitung kovarians dan korelasi dari urutan-urutan tersebut. `np.cov` akan memberi kita apa yang disebut **matriks kovarians**, yang merupakan perluasan dari kovarians ke banyak variabel. Elemen $M_{ij}$ dari matriks kovarians $M$ adalah korelasi antara variabel input $X_i$ dan $X_j$, dan nilai diagonal $M_{ii}$ adalah varians dari $X_{i}$. Demikian pula, `np.corrcoef` akan memberi kita **matriks korelasi**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Korelasi yang sama dengan 1 berarti ada **hubungan linier** yang kuat antara dua variabel. Kita dapat melihat hubungan linier secara visual dengan memplot satu nilai terhadap nilai lainnya:\n"
"Korelasi sama dengan 1 berarti ada hubungan **linear** yang kuat antara dua variabel. Kita dapat melihat hubungan linear secara visual dengan memplot satu nilai terhadap nilai lainnya:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mari kita lihat apa yang terjadi jika relasinya tidak linier. Misalkan perusahaan kita memutuskan untuk menyembunyikan ketergantungan linier yang jelas antara tinggi badan dan gaji, dan memperkenalkan sedikit non-linieritas ke dalam rumus, seperti `sin`:\n"
"Mari kita lihat apa yang terjadi jika relasinya tidak linier. Misalkan perusahaan kita memutuskan untuk menyembunyikan ketergantungan linier yang jelas antara tinggi badan dan gaji, dan memperkenalkan beberapa non-linearitas ke dalam rumus, seperti `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dalam kasus ini, korelasinya sedikit lebih kecil, tetapi masih cukup tinggi. Sekarang, untuk membuat hubungan tersebut menjadi kurang jelas, kita mungkin ingin menambahkan sedikit keacakan ekstra dengan menambahkan beberapa variabel acak ke gaji. Mari kita lihat apa yang terjadi:\n"
"Dalam kasus ini, korelasinya sedikit lebih kecil, tetapi masih cukup tinggi. Sekarang, untuk membuat hubungan itu menjadi kurang jelas, kita mungkin ingin menambahkan beberapa keacakan ekstra dengan menambahkan beberapa variabel acak ke gaji. Mari kita lihat apa yang terjadi:\n"
]
},
{
@ -478,7 +478,7 @@
"source": [
"> Bisakah Anda menebak mengapa titik-titik itu berbaris menjadi garis vertikal seperti ini?\n",
"\n",
"Kita telah mengamati korelasi antara konsep rekayasa buatan seperti gaji dan variabel teramati *tinggi badan*. Mari kita juga lihat apakah kedua variabel teramati, seperti tinggi badan dan berat badan, juga berkorelasi:\n"
"Kita telah mengamati korelasi antara konsep yang dibuat secara artifisial seperti gaji dan variabel yang diamati *tinggi badan*. Mari kita juga lihat apakah dua variabel yang diamati, seperti tinggi badan dan berat badan, juga berkorelasi:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sayangnya, kami tidak mendapatkan hasil apa pun - hanya beberapa nilai `nan` yang aneh. Ini disebabkan oleh fakta bahwa beberapa nilai dalam deret kami tidak terdefinisi, yang diwakili sebagai `nan`, yang menyebabkan hasil operasi juga menjadi tidak terdefinisi. Dengan melihat matriks, kita dapat melihat bahwa `Weight` adalah kolom yang bermasalah, karena korelasi sendiri antara nilai `Height` telah dihitung.\n",
"Sayangnya, kami tidak mendapatkan hasil apa pun - hanya beberapa nilai `nan` yang aneh. Ini disebabkan oleh fakta bahwa beberapa nilai dalam seri kami tidak terdefinisi, yang diwakili sebagai `nan`, yang menyebabkan hasil operasi juga tidak terdefinisi. Dengan melihat matriks, kita dapat melihat bahwa `Weight` adalah kolom yang bermasalah, karena korelasi diri antara nilai `Height` telah dihitung.\n",
"\n",
"> Contoh ini menunjukkan pentingnya **persiapan data** dan **pembersihan**. Tanpa data yang tepat, kita tidak dapat menghitung apa pun.\n",
"> Contoh ini menunjukkan pentingnya **persiapan data** dan **pembersihan**. Tanpa data yang tepat, kita tidak bisa menghitung apa pun.\n",
"\n",
"Mari kita gunakan metode `fillna` untuk mengisi nilai yang hilang, dan menghitung korelasinya: \n"
"Mari kita gunakan metode `fillna` untuk mengisi nilai yang hilang, dan hitung korelasinya:\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Memang ada korelasi, tetapi tidak sekuat dalam contoh buatan kita. Memang, jika kita melihat plot sebar satu nilai terhadap yang lain, hubungan tersebut akan jauh kurang jelas:\n"
"Memang ada korelasi, tetapi tidak sekuat contoh buatan kami. Memang, jika kita melihat diagram sebar dari satu nilai terhadap nilai lain, hubungan tersebut akan jauh lebih tidak jelas:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Kesimpulan\n",
"\n",
"Dalam notebook ini kita telah belajar bagaimana melakukan operasi dasar pada data untuk menghitung fungsi statistik. Kini kita tahu bagaimana menggunakan perangkat matematika dan statistik yang tepat untuk membuktikan beberapa hipotesis, serta bagaimana menghitung interval kepercayaan untuk variabel sembarang berdasarkan sampel data.\n"
"Dalam buku catatan ini kita telah belajar bagaimana melakukan operasi dasar pada data untuk menghitung fungsi statistik. Sekarang kita tahu bagaimana menggunakan perangkat matematika dan statistik yang kuat untuk membuktikan beberapa hipotesis, dan bagaimana menghitung interval kepercayaan untuk variabel arbitrer dengan sampel data. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**: \nDokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berusaha untuk mencapai ketepatan, harap diketahui bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang sahih. Untuk informasi penting, disarankan menggunakan jasa terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau salah tafsir yang timbul dari penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**:\nDokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk mencapai akurasi, harap diketahui bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang sah. Untuk informasi penting, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T17:38:29+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "id"
}
},
"nbformat": 4,

@ -4,11 +4,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Estimasi Pandemi COVID-19\n",
"# Perkiraan Pandemi COVID-19\n",
"\n",
"## Memuat Data\n",
"\n",
"Kami akan menggunakan data tentang individu yang terinfeksi COVID-19, yang disediakan oleh [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) di [Johns Hopkins University](https://jhu.edu/). Dataset tersedia di [Repositori GitHub ini](https://github.com/CSSEGISandData/COVID-19).\n"
"Kami akan menggunakan data tentang individu yang terinfeksi COVID-19, yang disediakan oleh [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) di [Johns Hopkins University](https://jhu.edu/). Dataset tersedia di [Repository GitHub ini](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita dapat memuat data terbaru langsung dari GitHub menggunakan `pd.read_csv`. Jika karena suatu alasan data tidak tersedia, Anda selalu dapat menggunakan salinan yang tersedia secara lokal di folder `data` - cukup hilangkan komentar pada baris di bawah yang mendefinisikan `base_url`:\n"
"Kita dapat memuat data terbaru langsung dari GitHub menggunakan `pd.read_csv`. Jika karena suatu alasan data tidak tersedia, Anda selalu dapat menggunakan salinan yang tersedia secara lokal di folder `data` - cukup aktifkan kembali baris di bawah yang mendefinisikan `base_url`:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita dapat melihat bahwa setiap baris tabel mendefinisikan jumlah individu yang terinfeksi untuk setiap negara dan/atau provinsi, dan kolom-kolom sesuai dengan tanggal. Tabel serupa dapat dimuat untuk data lain, seperti jumlah yang sembuh dan jumlah kematian.\n"
"Kita dapat melihat bahwa setiap baris dalam tabel mendefinisikan jumlah individu yang terinfeksi untuk setiap negara dan/atau provinsi, dan kolom-kolomnya sesuai dengan tanggal. Tabel serupa dapat dimuat untuk data lain, seperti jumlah yang sembuh dan jumlah kematian.\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## Memahami Data\n",
"\n",
"Dari tabel di atas, peran kolom provinsi tidak jelas. Mari kita lihat berbagai nilai yang ada di kolom `Province/State`:\n"
"Dari tabel di atas, peran kolom provinsi tidak jelas. Mari kita lihat nilai-nilai berbeda yang ada di kolom `Province/State`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dari nama-nama tersebut kita dapat menyimpulkan bahwa negara seperti Australia dan China memiliki rincian yang lebih detail berdasarkan provinsi. Mari kita cari informasi tentang China untuk melihat contohnya:\n"
"Dari nama-nama tersebut kita dapat menyimpulkan bahwa negara-negara seperti Australia dan China memiliki rincian yang lebih detail berdasarkan provinsi. Mari kita cari informasi tentang China untuk melihat contohnya:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pra-pemrosesan Data\n",
"## Pra-pemrosesan Data \n",
"\n",
"Kami tidak tertarik untuk memecah negara menjadi wilayah lebih lanjut, oleh karena itu pertama-tama kami akan menghilangkan pemecahan ini dan menambahkan informasi pada semua wilayah bersama-sama, untuk mendapatkan informasi untuk seluruh negara. Hal ini dapat dilakukan menggunakan `groupby`:\n"
"Kita tidak tertarik untuk memecah negara menjadi wilayah lebih lanjut, jadi kita akan menghilangkan pemecahan ini dan menambahkan informasi pada semua wilayah bersama-sama, untuk mendapatkan informasi untuk seluruh negara. Ini dapat dilakukan menggunakan `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Anda dapat melihat bahwa karena menggunakan `groupby` semua DataFrame sekarang diindeks oleh Country/Region. Dengan demikian kita dapat mengakses data untuk negara tertentu dengan menggunakan `.loc`:|\n"
"Anda dapat melihat bahwa karena menggunakan `groupby` semua DataFrame sekarang diindeks berdasarkan Country/Region. Jadi kita dapat mengakses data untuk negara tertentu dengan menggunakan `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Catatan** bagaimana kita menggunakan `[3:]` untuk menghapus tiga elemen pertama dari sebuah urutan yang berisi metadata non-tanggal (kolom Provinsi/Negara Bagian dan geolokasi). Kita juga bisa menghapus ketiga kolom tersebut sekaligus:\n"
"> **Catatan** bagaimana kita menggunakan `[3:]` untuk menghapus tiga elemen pertama dari sebuah urutan yang berisi metadata non-tanggal (Provinsi/Negara Bagian dan kolom geolokasi). Kita juga dapat menghapus ketiga kolom tersebut secara keseluruhan:\n"
]
},
{
@ -1627,7 +1627,7 @@
"source": [
"## Menyelidiki Data\n",
"\n",
"Sekarang mari kita beralih untuk menyelidiki negara tertentu. Mari kita buat sebuah frame yang berisi data infeksi yang diindeks berdasarkan tanggal:\n"
"Sekarang mari kita beralih untuk menyelidiki sebuah negara spesifik. Mari buat sebuah frame yang berisi data infeksi yang diindeks berdasarkan tanggal:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sekarang mari kita hitung jumlah orang yang terinfeksi baru setiap hari. Ini akan memungkinkan kita melihat kecepatan penyebaran pandemi. Cara termudah untuk melakukannya adalah menggunakan `diff`:\n"
"Sekarang mari kita hitung jumlah orang yang terinfeksi baru setiap hari. Ini akan memungkinkan kita melihat kecepatan perkembangan pandemi. Cara termudah untuk melakukannya adalah dengan menggunakan `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita dapat melihat fluktuasi tinggi dalam data. Mari kita lihat lebih dekat salah satu bulan:\n"
"Kita dapat melihat fluktuasi tinggi dalam data. Mari kita lihat lebih dekat pada salah satu bulan:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nampaknya jelas ada fluktuasi mingguan dalam data. Karena kita ingin dapat melihat tren, masuk akal untuk meratakan kurva dengan menghitung rata-rata berjalan (yaitu untuk setiap hari kita akan menghitung nilai rata-rata dari beberapa hari sebelumnya):\n"
"Jelas terlihat ada fluktuasi mingguan dalam data. Karena kita ingin dapat melihat tren, masuk akal untuk memperhalus kurva dengan menghitung rata-rata berjalan (yaitu untuk setiap hari kita akan menghitung nilai rata-rata dari beberapa hari sebelumnya):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Untuk dapat membandingkan beberapa negara, kita mungkin ingin mempertimbangkan jumlah penduduk negara tersebut, dan membandingkan persentase individu yang terinfeksi terhadap jumlah penduduk negara tersebut. Untuk mendapatkan jumlah penduduk negara, mari kita muat dataset negara:\n"
"Untuk dapat membandingkan beberapa negara, kita mungkin ingin mempertimbangkan populasi negara tersebut, dan membandingkan persentase individu yang terinfeksi dengan populasi negara tersebut. Untuk mendapatkan populasi negara, mari kita muat dataset negara:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Karena dataset ini berisi informasi tentang negara dan provinsi, untuk mendapatkan populasi seluruh negara kita perlu sedikit lebih pintar:\n"
"Karena dataset ini berisi informasi tentang baik negara maupun provinsi, untuk mendapatkan populasi seluruh negara kita perlu sedikit lebih cerdik: \n"
]
},
{
@ -2261,12 +2261,13 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Menghitung $R_t$\n",
"\n",
"Untuk melihat seberapa menular penyakit tersebut, kita melihat **angka reproduksi dasar** $R_0$, yang menunjukkan jumlah orang yang akan terinfeksi lebih lanjut oleh satu orang yang terinfeksi. Ketika $R_0$ lebih dari 1, kemungkinan epidemi akan menyebar.\n",
"Untuk melihat seberapa menularnya penyakit, kita melihat **angka reproduksi dasar** $R_0$, yang menunjukkan jumlah orang yang akan diinfeksi lebih lanjut oleh satu orang yang terinfeksi. Ketika $R_0$ lebih dari 1, kemungkinan epidemi akan menyebar.\n",
"\n",
"$R_0$ adalah sifat dari penyakit itu sendiri, dan tidak memperhitungkan beberapa langkah perlindungan yang mungkin diambil orang untuk memperlambat pandemi. Selama perkembangan pandemi, kita dapat memperkirakan angka reproduksi $R_t$ pada waktu tertentu $t$. Telah ditunjukkan bahwa angka ini dapat diperkirakan secara kasar dengan mengambil jendela waktu 8 hari, dan menghitung $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"di mana $I_t$ adalah jumlah individu yang terinfeksi baru pada hari $t$.\n",
"di mana $I_t$ adalah jumlah individu yang baru terinfeksi pada hari $t$.\n",
"\n",
"Mari kita hitung $R_t$ untuk data pandemi kita. Untuk melakukan ini, kita akan mengambil jendela bergulir dari 8 nilai `ninfected`, dan menerapkan fungsi untuk menghitung rasio di atas:\n"
]
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Anda dapat melihat bahwa ada beberapa celah di grafik. Itu bisa disebabkan oleh `NaN`, jika nilai `inf` hadir dalam dataset. `inf` mungkin disebabkan oleh pembagian dengan 0, dan `NaN` dapat menunjukkan data hilang, atau tidak ada data yang tersedia untuk menghitung hasil (seperti di awal frame kita, di mana jendela bergulir dengan lebar 8 belum tersedia). Untuk membuat grafik lebih baik, kita perlu mengisi nilai-nilai tersebut menggunakan fungsi `replace` dan `fillna`.\n",
"Anda dapat melihat bahwa ada beberapa celah pada grafik. Celah tersebut bisa disebabkan oleh `NaN`, jika nilai `inf` hadir di dalam dataset. `inf` dapat disebabkan oleh pembagian dengan 0, dan `NaN` dapat menunjukkan data yang hilang, atau tidak ada data tersedia untuk menghitung hasil (seperti di awal frame kita, dimana jendela bergulir dengan lebar 8 belum tersedia). Untuk membuat grafik lebih baik, kita perlu mengisi nilai-nilai tersebut menggunakan fungsi `replace` dan `fillna`.\n",
"\n",
"Mari kita lihat lebih jauh pada awal pandemi. Kita juga akan membatasi nilai sumbu y untuk hanya menampilkan nilai di bawah 6, agar lebih terlihat jelas, dan menggambar garis horizontal di angka 1.\n"
"Mari kita lihat lebih lanjut pada awal pandemi. Kita juga akan membatasi nilai pada sumbu y untuk menampilkan hanya nilai di bawah 6, agar lebih mudah dilihat, dan menggambar garis horizontal pada nilai 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Indikator menarik lain dari pandemi adalah **turunan**, atau **perbedaan harian** dalam kasus baru. Ini memungkinkan kita melihat dengan jelas kapan pandemi meningkat atau menurun.\n"
"Indikator menarik lainnya dari pandemi adalah **turunan**, atau **perbedaan harian** dalam kasus baru. Ini memungkinkan kita melihat dengan jelas kapan pandemi sedang meningkat atau menurun. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mengingat fakta bahwa terdapat banyak fluktuasi dalam data yang disebabkan oleh pelaporan, masuk akal untuk menghaluskan kurva dengan menjalankan rata-rata bergulir untuk mendapatkan gambaran keseluruhan. Mari kita fokus kembali pada bulan-bulan pertama pandemi:\n"
"Dengan fakta bahwa ada banyak fluktuasi dalam data yang disebabkan oleh pelaporan, masuk akal untuk menghaluskan kurva dengan menjalankan rata-rata bergulir untuk mendapatkan gambaran keseluruhan. Mari kita fokus kembali pada bulan-bulan pertama pandemi:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Tantangan\n",
"\n",
"Sekarang saatnya untuk Anda lebih banyak bermain dengan kode dan data! Berikut beberapa saran yang dapat Anda coba:\n",
"Sekarang saatnya bagi Anda untuk bermain lebih banyak dengan kode dan data! Berikut beberapa saran yang bisa Anda coba:\n",
"* Lihat penyebaran pandemi di berbagai negara.\n",
"* Plot grafik $R_t$ untuk beberapa negara dalam satu grafik untuk perbandingan, atau buat beberapa grafik berdampingan.\n",
"* Lihat bagaimana jumlah kematian dan pemulihan berkorelasi dengan jumlah kasus terinfeksi.\n",
"* Cobalah mencari tahu berapa lama penyakit biasanya berlangsung dengan mengkorelasikan secara visual tingkat infeksi dan tingkat kematian serta mencari beberapa anomali. Anda mungkin perlu melihat berbagai negara untuk mengetahuinya.\n",
"* Hitung tingkat fatalitas dan bagaimana perubahannya dari waktu ke waktu. Anda mungkin ingin memperhitungkan lama penyakit dalam hari untuk menggeser satu deret waktu sebelum melakukan perhitungan.\n"
"* Plot grafik $R_t$ untuk beberapa negara dalam satu grafik untuk perbandingan, atau buat beberapa grafik berdampingan\n",
"* Lihat bagaimana jumlah kematian dan pemulihan berkorelasi dengan jumlah kasus yang terinfeksi.\n",
"* Coba cari tahu berapa lama penyakit khas berlangsung dengan mengkorelasikan secara visual tingkat infeksi dan tingkat kematian serta mencari beberapa anomali. Anda mungkin perlu melihat pada negara yang berbeda untuk mengetahuinya.\n",
"* Hitung tingkat kematian dan bagaimana perubahan dari waktu ke waktu. Anda mungkin ingin memperhitungkan lamanya penyakit dalam hari untuk menggeser satu deret waktu sebelum melakukan perhitungan\n"
]
},
{
@ -2408,7 +2410,7 @@
"\n",
"Anda dapat melihat studi lebih lanjut tentang penyebaran epidemi COVID dalam publikasi berikut:\n",
"* [Model SIR Geser untuk Estimasi Rt selama Pandemi COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), posting blog oleh [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimasi Nomor Reproduksi yang Bergantung Waktu untuk Wabah COVID-19 Global](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimasi Angka Reproduksi Waktu-Tergantung untuk Wabah COVID-19 Global](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Kode untuk makalah di atas di GitHub](https://github.com/shwars/SlidingSIR)\n"
]
},
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**: \nDokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk akurasi, harap diperhatikan bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang otoritatif. Untuk informasi penting, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau interpretasi yang salah yang timbul dari penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**:\nDokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk mencapai akurasi, harap diketahui bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang sah. Untuk informasi penting, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# Proyek visualisasi data Dangerous Liaisons
Untuk memulai, pastikan Anda sudah memiliki NPM dan Node yang berjalan di mesin Anda. Instal dependensi (npm install) dan kemudian jalankan proyek secara lokal (npm run serve):
Untuk memulai, Anda perlu memastikan bahwa Anda memiliki NPM dan Node **>=20.0.0** yang berjalan di mesin Anda. Instal dependensi (npm install) lalu jalankan proyek secara lokal (npm run serve):
## Pengaturan Proyek
## Pengaturan proyek
```
npm install
```
### Kompilasi dan pemuatan ulang otomatis untuk pengembangan
### Mengompilasi dan memuat ulang secara hot untuk pengembangan
```
npm run serve
```
### Kompilasi dan minifikasi untuk produksi
### Mengompilasi dan meminifikasi untuk produksi
```
npm run build
```
### Linting dan perbaikan file
### Melakukan lint dan memperbaiki file
```
npm run lint
```
### Kustomisasi konfigurasi
Lihat [Referensi Konfigurasi](https://cli.vuejs.org/config/).
### Menyesuaikan konfigurasi
Lihat [Configuration Reference](https://cli.vuejs.org/config/).
---
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan layanan penerjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berusaha untuk memberikan hasil yang akurat, harap diingat bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang otoritatif. Untuk informasi yang bersifat kritis, disarankan menggunakan jasa penerjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk mencapai akurasi, harap diketahui bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang sah. Untuk informasi penting, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# Proyek visualisasi data Dangerous Liaisons
Untuk memulai, pastikan Anda memiliki NPM dan Node yang berjalan di mesin Anda. Instal dependensi (npm install) dan kemudian jalankan proyek secara lokal (npm run serve):
Untuk memulai, Anda perlu memastikan bahwa Anda memiliki NPM dan Node **>=20.0.0** yang berjalan di mesin Anda. Instal dependensi (npm install) dan kemudian jalankan proyek secara lokal (npm run serve):
## Pengaturan proyek
```
npm install
```
### Kompilasi dan pemuatan ulang otomatis untuk pengembangan
### Mengkompilasi dan menyegarkan secara hot untuk pengembangan
```
npm run serve
```
### Kompilasi dan minifikasi untuk produksi
### Mengkompilasi dan meminifikasi untuk produksi
```
npm run build
```
### Linting dan perbaikan file
### Melakukan lint dan memperbaiki file
```
npm run lint
```
### Sesuaikan konfigurasi
Lihat [Referensi Konfigurasi](https://cli.vuejs.org/config/).
### Menyesuaikan konfigurasi
Lihat [Configuration Reference](https://cli.vuejs.org/config/).
---
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan layanan penerjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berusaha untuk memberikan hasil yang akurat, harap diingat bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang otoritatif. Untuk informasi yang bersifat kritis, disarankan menggunakan jasa penerjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan layanan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Meskipun kami berupaya untuk mencapai akurasi, harap diketahui bahwa terjemahan otomatis mungkin mengandung kesalahan atau ketidakakuratan. Dokumen asli dalam bahasa aslinya harus dianggap sebagai sumber yang sah. Untuk informasi penting, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggung jawab atas kesalahpahaman atau penafsiran yang keliru yang timbul dari penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "ms"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T10:00:11+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:47:43+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "ms"
},
@ -42,8 +42,8 @@
"language_code": "ms"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-06T00:14:22+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T21:51:52+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "ms"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "ms"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:48:40+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ms"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-28T18:49:53+00:00",
@ -108,8 +114,8 @@
"language_code": "ms"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T10:01:40+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:47:15+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "ms"
},
@ -192,14 +198,14 @@
"language_code": "ms"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-28T18:45:22+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:51:59+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "ms"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-28T18:45:40+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:51:56+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "ms"
},

File diff suppressed because one or more lines are too long

@ -4,72 +4,76 @@
|:---:|
|Mendefinisikan Data - _Sketchnote oleh [@nitya](https://twitter.com/nitya)_ |
Data adalah fakta, maklumat, pemerhatian, dan pengukuran yang digunakan untuk membuat penemuan dan menyokong keputusan yang berinformasi. Titik data adalah unit tunggal data dalam satu set data, yang merupakan koleksi titik data. Set data boleh datang dalam pelbagai format dan struktur, dan biasanya berdasarkan sumbernya, atau dari mana data itu berasal. Sebagai contoh, pendapatan bulanan sebuah syarikat mungkin dalam bentuk spreadsheet tetapi data kadar denyutan jantung setiap jam dari jam tangan pintar mungkin dalam format [JSON](https://stackoverflow.com/a/383699). Adalah biasa bagi saintis data untuk bekerja dengan pelbagai jenis data dalam satu set data.
Data adalah fakta, maklumat, pemerhatian dan ukuran yang digunakan untuk membuat penemuan dan menyokong keputusan yang maklum. Titik data adalah satu unit data dalam satu set data, yang merupakan koleksi titik data. Set data boleh datang dalam pelbagai format dan struktur, dan biasanya akan berdasarkan kepada sumbernya, atau dari mana data itu datang. Sebagai contoh, pendapatan bulanan sesebuah syarikat mungkin berada dalam hamparan tetapi data kadar denyutan jantung setiap jam dari jam pintar mungkin dalam format [JSON](https://stackoverflow.com/a/383699). Adalah biasa untuk saintis data bekerja dengan pelbagai jenis data dalam satu set data.
Pelajaran ini memberi tumpuan kepada mengenal pasti dan mengklasifikasikan data berdasarkan ciri-ciri dan sumbernya.
Pelajaran ini memfokuskan pada mengenal pasti dan mengklasifikasikan data mengikut ciri-ciri dan sumbernya.
## [Kuiz Pra-Kuliah](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Bagaimana Data Diterangkan
### Data Mentah
Data mentah adalah data yang datang dari sumbernya dalam keadaan awal dan belum dianalisis atau diatur. Untuk memahami apa yang berlaku dengan satu set data, ia perlu diatur dalam format yang boleh difahami oleh manusia serta teknologi yang mungkin mereka gunakan untuk menganalisisnya lebih lanjut. Struktur satu set data menerangkan bagaimana ia diatur dan boleh diklasifikasikan sebagai berstruktur, tidak berstruktur, dan separa berstruktur. Jenis struktur ini akan berbeza, bergantung pada sumbernya tetapi akhirnya akan sesuai dengan tiga kategori ini.
Data mentah adalah data yang datang dari sumbernya dalam keadaan asal dan belum dianalisis atau diatur. Untuk memahami apa yang sedang berlaku dengan satu set data, ia perlu disusun dalam format yang boleh difahami oleh manusia serta teknologi yang mungkin digunakan untuk menganalisisnya lebih lanjut. Struktur satu set data menerangkan bagaimana ia diatur dan boleh diklasifikasikan sebagai berstruktur, tidak berstruktur dan separa berstruktur. Jenis struktur ini akan berbeza-beza, bergantung pada sumber tetapi akhirnya akan sesuai dalam tiga kategori ini.
### Data Kuantitatif
Data kuantitatif adalah pemerhatian berangka dalam satu set data dan biasanya boleh dianalisis, diukur, dan digunakan secara matematik. Beberapa contoh data kuantitatif adalah: populasi sesebuah negara, ketinggian seseorang, atau pendapatan suku tahunan sebuah syarikat. Dengan analisis tambahan, data kuantitatif boleh digunakan untuk menemui tren musiman Indeks Kualiti Udara (AQI) atau menganggarkan kebarangkalian kesesakan lalu lintas pada hari kerja biasa.
Data kuantitatif adalah pemerhatian berangka dalam satu set data dan biasanya boleh dianalisis, diukur dan digunakan secara matematik. Beberapa contoh data kuantitatif adalah: populasi sesebuah negara, ketinggian seseorang atau pendapatan suku tahunan syarikat. Dengan beberapa analisis tambahan, data kuantitatif boleh digunakan untuk menemui tren bermusim Indeks Kualiti Udara (AQI) atau menganggarkan kebarangkalian trafik waktu puncak pada hari kerja biasa.
### Data Kualitatif
Data kualitatif, juga dikenali sebagai data kategori, adalah data yang tidak boleh diukur secara objektif seperti pemerhatian data kuantitatif. Ia biasanya dalam pelbagai format data subjektif yang menangkap kualiti sesuatu, seperti produk atau proses. Kadang-kadang, data kualitatif adalah berangka tetapi tidak biasanya digunakan secara matematik, seperti nombor telefon atau cap waktu. Beberapa contoh data kualitatif adalah: komen video, jenama dan model kereta, atau warna kegemaran rakan terdekat anda. Data kualitatif boleh digunakan untuk memahami produk mana yang paling disukai pengguna atau mengenal pasti kata kunci popular dalam resume permohonan kerja.
Data kualitatif, juga dikenali sebagai data kategori adalah data yang tidak boleh diukur secara objektif seperti pemerhatian data kuantitatif. Ia biasanya dalam pelbagai format data subjektif yang menangkap kualiti sesuatu, seperti produk atau proses. Kadang-kadang, data kualitatif adalah berangka dan biasanya tidak digunakan secara matematik, seperti nombor telefon atau cap masa. Beberapa contoh data kualitatif adalah: komen video, jenama dan model kereta atau warna kegemaran kawan rapat anda. Data kualitatif boleh digunakan untuk memahami produk mana yang paling disukai pengguna atau mengenal pasti kata kunci popular dalam resume permohonan kerja.
### Data Berstruktur
Data berstruktur adalah data yang diatur dalam baris dan lajur, di mana setiap baris mempunyai set lajur yang sama. Lajur mewakili nilai jenis tertentu dan akan dikenali dengan nama yang menerangkan apa yang diwakili oleh nilai tersebut, sementara baris mengandungi nilai sebenar. Lajur sering mempunyai set peraturan atau sekatan tertentu pada nilai, untuk memastikan nilai tersebut secara tepat mewakili lajur. Sebagai contoh, bayangkan spreadsheet pelanggan di mana setiap baris mesti mempunyai nombor telefon dan nombor telefon tersebut tidak pernah mengandungi aksara abjad. Mungkin ada peraturan yang diterapkan pada lajur nombor telefon untuk memastikan ia tidak pernah kosong dan hanya mengandungi nombor.
Data berstruktur adalah data yang diatur dalam baris dan lajur, di mana setiap baris akan mempunyai set lajur yang sama. Lajur mewakili nilai suatu jenis tertentu dan akan dikenal pasti dengan nama yang menerangkan apa yang nilai itu wakili, manakala baris mengandungi nilai sebenar. Lajur sering mempunyai set peraturan atau had tertentu untuk nilai, bagi memastikan bahawa nilai itu mewakili lajur dengan tepat. Sebagai contoh bayangkan hamparan pelanggan di mana setiap baris mesti mempunyai nombor telefon dan nombor telefon itu tidak mengandungi aksara alfabet. Mungkin ada peraturan yang dikenakan pada lajur nombor telefon untuk memastikan ia tidak pernah kosong dan hanya mengandungi nombor.
Kelebihan data berstruktur adalah ia boleh diatur sedemikian rupa sehingga boleh dikaitkan dengan data berstruktur lain. Walau bagaimanapun, kerana data direka untuk diatur dengan cara tertentu, membuat perubahan pada struktur keseluruhannya boleh memerlukan banyak usaha. Sebagai contoh, menambah lajur e-mel pada spreadsheet pelanggan yang tidak boleh kosong bermaksud anda perlu memikirkan bagaimana anda akan menambah nilai-nilai ini pada baris pelanggan yang sedia ada dalam set data.
Kelebihan data berstruktur adalah ia boleh disusun dengan cara yang boleh dikaitkan dengan data berstruktur lain. Namun, kerana data direka untuk diatur dalam cara tertentu, membuat perubahan pada struktur keseluruhannya boleh mengambil banyak usaha. Sebagai contoh, menambah lajur e-mel ke hamparan pelanggan yang tidak boleh kosong bermakna anda perlu mencari cara bagaimana menambah nilai ini ke baris pelanggan yang sedia ada dalam set data.
Contoh data berstruktur: spreadsheet, pangkalan data relasional, nombor telefon, penyata bank
Contoh data berstruktur: hamparan, pangkalan data berhubung, nombor telefon, penyata bank
### Data Tidak Berstruktur
Data tidak berstruktur biasanya tidak boleh dikategorikan ke dalam baris atau lajur dan tidak mengandungi format atau set peraturan untuk diikuti. Oleh kerana data tidak berstruktur mempunyai sekatan yang lebih sedikit pada strukturnya, lebih mudah untuk menambah maklumat baru berbanding dengan set data berstruktur. Jika sensor yang menangkap data tekanan barometrik setiap 2 minit telah menerima kemas kini yang kini membolehkannya mengukur dan merekodkan suhu, ia tidak memerlukan perubahan pada data sedia ada jika ia tidak berstruktur. Walau bagaimanapun, ini mungkin membuat analisis atau penyiasatan jenis data ini mengambil masa lebih lama. Sebagai contoh, seorang saintis yang ingin mencari suhu purata bulan sebelumnya dari data sensor, tetapi mendapati bahawa sensor merekodkan "e" dalam beberapa datanya untuk menunjukkan bahawa ia rosak dan bukannya nombor biasa, yang bermaksud data tersebut tidak lengkap.
Data tidak berstruktur biasanya tidak boleh dikategorikan dalam baris atau lajur dan tidak mengandungi format atau set peraturan untuk diikuti. Oleh kerana data tidak berstruktur mempunyai kurang sekatan pada strukturnya, ia lebih mudah untuk menambah maklumat baru berbanding dengan set data berstruktur. Jika sensor yang menangkap data tekanan barometrik setiap 2 minit menerima kemas kini yang kini membolehkan ia mengukur dan merekod suhu, ia tidak memerlukan pengubahan data sedia ada jika ia tidak berstruktur. Namun, ini mungkin menjadikan analisis atau penyiasatan jenis data ini mengambil masa lebih lama. Sebagai contoh, seorang saintis yang mahu mencari suhu purata bulan lalu dari data sensor, tetapi mendapati sensor merekod "e" dalam beberapa data yang direkod untuk menunjukkan bahawa ia rosak dan bukannya nombor biasa, yang bermaksud data itu tidak lengkap.
Contoh data tidak berstruktur: fail teks, mesej teks, fail video
### Data Separa Berstruktur
Data separa berstruktur mempunyai ciri-ciri yang menjadikannya gabungan data berstruktur dan tidak berstruktur. Ia biasanya tidak mematuhi format baris dan lajur tetapi diatur dengan cara yang dianggap berstruktur dan mungkin mengikuti format tetap atau set peraturan. Struktur akan berbeza antara sumber, seperti hierarki yang ditentukan dengan baik kepada sesuatu yang lebih fleksibel yang membolehkan integrasi maklumat baru dengan mudah. Metadata adalah penunjuk yang membantu menentukan bagaimana data diatur dan disimpan dan akan mempunyai pelbagai nama, berdasarkan jenis data. Beberapa nama umum untuk metadata adalah tag, elemen, entiti, dan atribut. Sebagai contoh, mesej e-mel biasa akan mempunyai subjek, badan, dan set penerima dan boleh diatur berdasarkan siapa atau bila ia dihantar.
### Separuh Berstruktur
Data separuh berstruktur mempunyai ciri yang menjadikannya gabungan antara data berstruktur dan tidak berstruktur. Ia biasanya tidak mematuhi format baris dan lajur tetapi disusun dengan cara yang dianggap berstruktur dan mungkin mengikuti format tetap atau set peraturan. Struktur akan berbeza antara sumber, seperti hierarki yang ditakrifkan dengan baik kepada sesuatu yang lebih fleksibel yang membenarkan integrasi maklumat baru dengan mudah. Metadata adalah penunjuk yang membantu menentukan bagaimana data disusun dan disimpan dan akan mempunyai pelbagai nama, berdasarkan jenis data. Beberapa nama biasa untuk metadata adalah tag, elemen, entiti dan atribut. Sebagai contoh, mesej e-mel biasa akan mempunyai subjek, badan dan satu set penerima dan boleh diatur mengikut siapa atau bila ia dihantar.
Contoh data separa berstruktur: HTML, fail CSV, JavaScript Object Notation (JSON)
## Sumber Data
## Sumber Data
Sumber data adalah lokasi awal di mana data dihasilkan, atau di mana ia "hidup" dan akan berbeza berdasarkan bagaimana dan bila ia dikumpulkan. Data yang dihasilkan oleh penggunanya dikenali sebagai data primer sementara data sekunder berasal dari sumber yang telah mengumpulkan data untuk kegunaan umum. Sebagai contoh, sekumpulan saintis yang mengumpulkan pemerhatian di hutan hujan akan dianggap sebagai data primer dan jika mereka memutuskan untuk berkongsi dengan saintis lain, ia akan dianggap sebagai data sekunder bagi mereka yang menggunakannya.
Sumber data adalah lokasi awal di mana data dijana, atau di mana ia "berkedudukan" dan akan berbeza berdasarkan bagaimana dan bila ia dikumpulkan. Data yang dijana oleh pengguna adalah dikenali sebagai data primer manakala data sekunder datang dari sumber yang telah mengumpulkan data untuk kegunaan umum. Sebagai contoh, sekumpulan saintis yang mengumpulkan pemerhatian di hutan hujan dianggap sebagai primer dan jika mereka memutuskan untuk berkongsi dengan saintis lain, ia dianggap sebagai sekunder bagi mereka yang menggunakannya.
Pangkalan data adalah sumber yang biasa dan bergantung pada sistem pengurusan pangkalan data untuk menjadi tuan rumah dan mengekalkan data di mana pengguna menggunakan arahan yang dipanggil kueri untuk meneroka data. Fail sebagai sumber data boleh berupa fail audio, imej, dan video serta spreadsheet seperti Excel. Sumber internet adalah lokasi biasa untuk menjadi tuan rumah data, di mana pangkalan data serta fail boleh ditemui. Antara muka pengaturcaraan aplikasi, juga dikenali sebagai API, membolehkan pengaturcara mencipta cara untuk berkongsi data dengan pengguna luaran melalui internet, sementara proses web scraping mengekstrak data dari halaman web. [Pelajaran dalam Bekerja dengan Data](../../../../../../../../../2-Working-With-Data) memberi tumpuan kepada cara menggunakan pelbagai sumber data.
Pangkalan data adalah sumber biasa dan bergantung pada sistem pengurusan pangkalan data untuk mengehos dan menyelenggara data di mana pengguna menggunakan arahan dipanggil pertanyaan untuk meneroka data. Fail sebagai sumber data boleh berupa fail audio, imej dan video serta hamparan seperti Excel. Sumber internet adalah lokasi biasa untuk mengehos data, di mana pangkalan data serta fail boleh dijumpai. Antara muka pengaturcaraan aplikasi, juga dikenali sebagai API membolehkan pengaturcara mencipta cara untuk berkongsi data dengan pengguna luaran melalui internet, manakala proses pengikisan web mengekstrak data dari halaman web. [Pelajaran dalam Bekerja dengan Data](../../../../../../../../../2-Working-With-Data) memfokuskan pada cara menggunakan pelbagai sumber data.
## Kesimpulan
Dalam pelajaran ini kita telah belajar:
Dalam pelajaran ini kami telah mempelajari:
- Apa itu data
- Bagaimana data diterangkan
- Bagaimana data diklasifikasikan dan dikategorikan
- Di mana data boleh ditemui
- Di mana data boleh didapati
## 🚀 Cabaran
Kaggle adalah sumber yang sangat baik untuk set data terbuka. Gunakan [alat carian set data](https://www.kaggle.com/datasets) untuk mencari beberapa set data yang menarik dan klasifikasikan 3-5 set data dengan kriteria ini:
Kaggle adalah sumber set data terbuka yang hebat. Gunakan [alat carian set data](https://www.kaggle.com/datasets) untuk mencari beberapa set data menarik dan klasifikasikan 3-5 set data dengan kriteria ini:
- Adakah data kuantitatif atau kualitatif?
- Adakah data berstruktur, tidak berstruktur, atau separa berstruktur?
## [Kuiz Pasca-Kuliah](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## [Kuiz pasca kuliah](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Kajian & Pembelajaran Kendiri
- Unit Microsoft Learn ini, bertajuk [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) mempunyai pecahan terperinci tentang data berstruktur, separa berstruktur, dan tidak berstruktur.
## Ulang Kaji & Belajar Sendiri
- Unit Microsoft Learn ini, bertajuk [Kenal pasti format data](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) mempunyai pecahan terperinci tentang data berstruktur, separa berstruktur, dan tidak berstruktur.
## Tugasan
[Classifying Datasets](assignment.md)
[Mengklasifikasikan Set Data](assignment.md)
---
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk memastikan ketepatan, sila ambil perhatian bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang berwibawa. Untuk maklumat yang kritikal, terjemahan manusia profesional adalah disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk ketepatan, sila ambil maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sahih. Untuk maklumat penting, terjemahan oleh manusia profesional adalah disyorkan. Kami tidak bertanggungjawab terhadap sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -5,7 +5,7 @@
"metadata": {},
"source": [
"# Pengenalan kepada Kebarangkalian dan Statistik\n",
"Dalam buku nota ini, kita akan bermain-main dengan beberapa konsep yang telah kita bincangkan sebelum ini. Banyak konsep daripada kebarangkalian dan statistik diwakili dengan baik dalam perpustakaan utama untuk pemprosesan data dalam Python, seperti `numpy` dan `pandas`.\n"
"Dalam buku nota ini, kita akan bermain-main dengan beberapa konsep yang telah kita bincangkan sebelum ini. Banyak konsep dari kebarangkalian dan statistik terdapat dengan baik dalam perpustakaan utama untuk pemprosesan data dalam Python, seperti `numpy` dan `pandas`.\n"
]
},
{
@ -25,7 +25,7 @@
"metadata": {},
"source": [
"## Pembolehubah Rawak dan Taburan\n",
"Mari kita mulakan dengan mengambil sampel 30 nilai dari taburan seragam dari 0 hingga 9. Kita juga akan mengira min dan varians.\n"
"Mari kita mulakan dengan melukis satu sampel 30 nilai daripada taburan seragam dari 0 hingga 9. Kita juga akan mengira min dan varians.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Untuk menganggar secara visual berapa banyak nilai berbeza yang terdapat dalam sampel, kita boleh plot **histogram**:\n"
"Untuk menganggarkan secara visual berapa banyak nilai berbeza yang terdapat dalam sampel, kita boleh melukis **histogram**:\n"
]
},
{
@ -63,7 +63,7 @@
"source": [
"## Menganalisis Data Sebenar\n",
"\n",
"Min dan varians adalah sangat penting apabila menganalisis data dunia sebenar. Mari muatkan data tentang pemain besbol dari [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Purata dan varians sangat penting apabila menganalisis data dunia sebenar. Mari kita muatkan data tentang pemain besbol dari [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -80,7 +80,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Kami menggunakan pakej yang dipanggil [**Pandas**](https://pandas.pydata.org/) di sini untuk analisis data. Kami akan bercakap lebih lanjut mengenai Pandas dan bekerja dengan data dalam Python kemudian dalam kursus ini.\n",
"> Kami menggunakan pakej yang dipanggil [**Pandas**](https://pandas.pydata.org/) di sini untuk analisis data. Kami akan membincangkan lebih lanjut tentang Pandas dan bekerja dengan data dalam Python kemudian dalam kursus ini.\n",
"\n",
"Mari kita kira nilai purata untuk umur, ketinggian dan berat:\n"
]
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sekarang mari kita fokus pada ketinggian, dan kira sisihan piawai serta varians:\n"
"Sekarang mari kita tumpukan pada ketinggian, dan kira sisihan piawai dan varians: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Selain daripada min, adalah munasabah untuk melihat nilai median dan kuartil. Ia boleh divisualisasikan menggunakan **graf kotak**:\n"
"Selain daripada min, adalah masuk akal untuk melihat nilai median dan kuartil. Ia boleh divisualisasikan menggunakan **plot kotak**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Nota**: Rajah ini mencadangkan, secara purata, ketinggian pemain pertama lebih tinggi daripada ketinggian pemain kedua. Nanti kita akan belajar bagaimana kita boleh menguji hipotesis ini dengan lebih formal, dan bagaimana untuk menunjukkan bahawa data kita adalah signifikan secara statistik untuk membuktikannya. \n",
"> **Nota**: Rajah ini mencadangkan, bahawa puratanya, ketinggian pemain first baseman adalah lebih tinggi daripada ketinggian pemain second baseman. Kemudian kita akan belajar bagaimana kita boleh menguji hipotesis ini dengan lebih formal, dan bagaimana untuk menunjukkan bahawa data kita adalah signifikan secara statistik untuk membuktikannya. \n",
"\n",
"Umur, ketinggian dan berat semua adalah pembolehubah rawak berterusan. Apakah agaknya taburan mereka? Cara yang baik untuk mengetahuinya ialah dengan melukis histogram nilai-nilai tersebut: \n"
"Umur, ketinggian dan berat adalah semua pemboleh ubah rawak berterusan. Apakah anda fikir taburan mereka? Cara yang baik untuk mengetahuinya adalah dengan memplot histogram nilai-nilai tersebut: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Taburan Normal\n",
"## Pengagihan Normal\n",
"\n",
"Mari kita cipta sampel buatan berat yang mengikuti taburan normal dengan min dan varians yang sama seperti data sebenar kita:\n"
"Mari kita buat contoh buatan berat yang mengikut pengagihan normal dengan min dan varians yang sama seperti data sebenar kita:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Oleh kerana kebanyakan nilai dalam kehidupan sebenar diedarkan secara normal, kita tidak seharusnya menggunakan penjana nombor rawak seragam untuk menjana data sampel. Berikut adalah apa yang berlaku jika kita cuba menjana berat dengan taburan seragam (dijana oleh `np.random.rand`):\n"
"Oleh kerana kebanyakan nilai dalam kehidupan sebenar diagihkan secara normal, kita tidak seharusnya menggunakan penjana nombor rawak seragam untuk menjana data sampel. Inilah yang berlaku jika kita cuba menjana berat dengan taburan seragam (dijana oleh `np.random.rand`):\n"
]
},
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Selang Keyakinan\n",
"## Julat Keyakinan\n",
"\n",
"Mari kita kira selang keyakinan untuk berat dan ketinggian pemain besbol. Kita akan menggunakan kod [dari perbincangan stackoverflow ini](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Mari kita kira julat keyakinan untuk berat dan tinggi pemain besbol. Kita akan menggunakan kod [dari perbincangan stackoverflow ini](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## Ujian Hipotesis\n",
"\n",
"Mari kita terokai peranan berbeza dalam set data pemain besbol kami:\n"
"Mari kita terokai peranan yang berbeza dalam set data pemain besbol kami:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mari uji hipotesis bahawa Pemain Pertama Bas lebih tinggi daripada Pemain Kedua Bas. Cara paling mudah untuk melakukan ini adalah dengan menguji selang keyakinan:\n"
"Mari uji hipotesis bahawa Pemain Pertama adalah lebih tinggi daripada Pemain Kedua. Cara paling mudah untuk melakukan ini adalah dengan menguji selang keyakinan:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita dapat melihat bahawa julat masa tidak bertindih.\n",
"Kita dapat lihat bahawa selang tidak bertindih.\n",
"\n",
"Cara yang lebih tepat dari segi statistik untuk membuktikan hipotesis adalah dengan menggunakan **ujian t-Student**:\n"
"Cara yang lebih betul secara statistik untuk membuktikan hipotesis ialah dengan menggunakan **ujian t-Student**:\n"
]
},
{
@ -339,17 +339,17 @@
"metadata": {},
"source": [
"Dua nilai yang dikembalikan oleh fungsi `ttest_ind` adalah:\n",
"* nilai p boleh dianggap sebagai kebarangkalian dua taburan mempunyai min yang sama. Dalam kes kami, ia sangat rendah, bermakna terdapat bukti kukuh yang menyokong bahawa pemain pertama adalah lebih tinggi.\n",
"* nilai t adalah nilai pertengahan perbezaan min yang dinormalisasi yang digunakan dalam ujian t, dan ia dibandingkan dengan nilai ambang untuk nilai keyakinan tertentu.\n"
"* nilai p boleh dianggap sebagai kebarangkalian dua taburan mempunyai min yang sama. Dalam kes kami, ia sangat rendah, yang bermaksud terdapat bukti kukuh yang menyokong bahawa pemain pertama basemen lebih tinggi.\n",
"* nilai t adalah nilai perantaraan perbezaan min yang dinormalisasi yang digunakan dalam ujian-t, dan ia dibandingkan dengan nilai ambang untuk nilai keyakinan yang diberikan.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Mensimulasikan Taburan Normal dengan Teorem Had Tengah\n",
"## Mensimulasikan Taburan Normal dengan Teorem Had Pusat\n",
"\n",
"Penjana pseudo-rawak dalam Python direka untuk memberikan taburan seragam. Jika kita ingin membuat penjana untuk taburan normal, kita boleh menggunakan teorem had tengah. Untuk mendapatkan nilai yang diedarkan secara normal, kita hanya akan mengira purata sampel yang dijana secara seragam.\n"
"Penjana pseudo-rawak dalam Python direka untuk memberikan kita taburan seragam. Jika kita mahu mencipta penjana untuk taburan normal, kita boleh menggunakan teorem had pusat. Untuk mendapatkan nilai yang diedarkan secara normal, kita hanya akan mengira purata sampel yang dijana secara seragam.\n"
]
},
{
@ -375,7 +375,7 @@
"source": [
"## Korelasi dan Evil Baseball Corp\n",
"\n",
"Korelasi membolehkan kita mencari hubungan antara urutan data. Dalam contoh mainan kita, mari kita andaikan terdapat sebuah syarikat besbol jahat yang membayar pemainnya mengikut ketinggian mereka - semakin tinggi pemain tersebut, semakin banyak wang yang dia terima. Katakan terdapat gaji asas sebanyak $1000, dan bonus tambahan dari $0 hingga $100, bergantung pada ketinggian. Kita akan mengambil pemain sebenar dari MLB, dan mengira gaji khayalan mereka:\n"
"Korelasi membolehkan kita mencari hubungan antara jujukan data. Dalam contoh mainan kita, mari kita anggap terdapat sebuah korporat bisbol jahat yang membayar pemainnya mengikut ketinggian mereka - semakin tinggi pemain itu, semakin banyak wang yang dia dapat. Anggap terdapat gaji asas sebanyak $1000, dan bonus tambahan dari $0 hingga $100, bergantung pada ketinggian. Kita akan ambil pemain sebenar dari MLB, dan kira gaji imaginasi mereka:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mari kita kira kovarians dan korelasi bagi urutan-urutan tersebut. `np.cov` akan memberikan kita yang dipanggil **matriks kovarians**, yang merupakan lanjutan kovarians kepada pelbagai pemboleh ubah. Elemen $M_{ij}$ dalam matriks kovarians $M$ adalah korelasi antara pemboleh ubah input $X_i$ dan $X_j$, dan nilai diagonal $M_{ii}$ adalah varians bagi $X_{i}$. Begitu juga, `np.corrcoef` akan memberikan kita **matriks korelasi**.\n"
"Mari kita sekarang mengira kovarians dan korelasi bagi urutan-urutan tersebut. `np.cov` akan memberikan kita apa yang dipanggil **matriks kovarians**, yang merupakan lanjutan kepada kovarians untuk pelbagai pembolehubah. Elemen $M_{ij}$ dalam matriks kovarians $M$ adalah korelasi antara pembolehubah input $X_i$ dan $X_j$, dan nilai diagonal $M_{ii}$ adalah varians bagi $X_{i}$. Begitu juga, `np.corrcoef` akan memberikan kita **matriks korelasi**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Korelasi sama dengan 1 bermaksud terdapat **hubungan linear** yang kuat antara dua pemboleh ubah. Kita boleh lihat hubungan linear secara visual dengan memplot satu nilai terhadap yang lain:\n"
"Korelasi sama dengan 1 bermakna terdapat **hubungan linear** yang kuat antara dua pembolehubah. Kita boleh melihat hubungan linear secara visual dengan memplotkan satu nilai terhadap nilai yang lain:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mari kita lihat apa yang berlaku jika hubungannya tidak linear. Katakan bahawa syarikat kita memutuskan untuk menyembunyikan pergantungan linear yang jelas antara ketinggian dan gaji, dan memperkenalkan sedikit bukan linear dalam formula, seperti `sin`:\n"
"Mari kita lihat apa yang berlaku jika hubungan itu tidak linear. Katakan bahawa syarikat kita memutuskan untuk menyembunyikan kebergantungan linear yang jelas antara ketinggian dan gaji, dan memperkenalkan beberapa ketidaksempurnaan dalam formula, seperti `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dalam kes ini, korelasi adalah sedikit lebih kecil, tetapi masih agak tinggi. Kini, untuk menjadikan hubungan itu kurang jelas, kita mungkin mahu menambah beberapa unsur rawak tambahan dengan menambah beberapa pembolehubah rawak kepada gaji. Mari lihat apa yang berlaku:\n"
"Dalam kes ini, korelasi adalah sedikit lebih kecil, tetapi masih agak tinggi. Kini, untuk menjadikan hubungan itu kurang jelas, kita mungkin ingin menambah sedikit kebetulan tambahan dengan menambah beberapa pembolehubah rawak kepada gaji. Mari kita lihat apa yang berlaku:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Bolehkah anda teka mengapa titik-titik itu tersusun menjadi garisan menegak seperti ini?\n",
"> Bolehkah anda teka mengapa titik-titik tersebut tersusun menjadi garisan menegak seperti ini?\n",
"\n",
"Kita telah memerhati korelasi antara konsep yang direka secara artifisial seperti gaji dan pemboleh ubah yang diperhatikan *tinggi*. Mari kita lihat juga jika dua pemboleh ubah yang diperhatikan, seperti tinggi dan berat, juga berkorelasi:\n"
"Kita telah memerhati korelasi antara konsep yang direka secara artifisial seperti gaji dan pemboleh ubah yang diperhatikan *ketinggian*. Mari lihat juga jika dua pemboleh ubah yang diperhatikan, seperti ketinggian dan berat, juga berkorelasi:\n"
]
},
{
@ -494,7 +494,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Malangnya, kami tidak mendapat sebarang keputusan - hanya beberapa nilai `nan` pelik. Ini kerana beberapa nilai dalam siri kami tidak ditakrifkan, yang diwakili sebagai `nan`, yang menyebabkan hasil operasi itu juga tidak ditakrifkan. Dengan melihat matriks, kita dapat lihat bahawa `Weight` adalah lajur bermasalah, kerana korelasi sendiri antara nilai `Height` telah dikira.\n",
"Malangnya, kami tidak mendapatkan sebarang keputusan - hanya beberapa nilai `nan` yang pelik. Ini adalah disebabkan oleh beberapa nilai dalam siri kami tidak terdefinisi, yang diwakili sebagai `nan`, yang menyebabkan keputusan operasi juga tidak terdefinisi. Dengan melihat pada matriks, kami dapat melihat bahawa `Weight` adalah lajur yang bermasalah, kerana korelasi sendiri antara nilai `Height` telah dikira.\n",
"\n",
"> Contoh ini menunjukkan kepentingan **penyediaan data** dan **pembersihan**. Tanpa data yang betul, kita tidak dapat mengira apa-apa.\n",
"\n",
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Memang terdapat korelasi, tetapi tidaklah sehebat dalam contoh buatan kami. Sebenarnya, jika kita melihat plot taburan satu nilai terhadap nilai yang lain, hubungannya akan menjadi kurang jelas:\n"
"Memang terdapat korelasi, tetapi bukan yang kuat seperti dalam contoh buatan kami. Memang, jika kita melihat pada plot sebar satu nilai berbanding nilai yang lain, hubungannya akan jauh kurang jelas:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Kesimpulan\n",
"\n",
"Dalam buku nota ini kita telah belajar bagaimana untuk melaksanakan operasi asas ke atas data untuk mengira fungsi statistik. Kita kini tahu bagaimana menggunakan peralatan matematik dan statistik yang mantap untuk membuktikan beberapa hipotesis, dan bagaimana untuk mengira selang keyakinan bagi pemboleh ubah arbitrari berdasarkan sampel data.\n"
"Dalam buku nota ini kami telah belajar bagaimana untuk melakukan operasi asas pada data untuk mengira fungsi statistik. Kami kini tahu bagaimana menggunakan peralatan matematik dan statistik yang kukuh untuk membuktikan beberapa hipotesis, dan bagaimana mengira selang keyakinan untuk pemboleh ubah sewenang-wenangnya berdasarkan sampel data. \n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**: \nDokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk ketepatan, sila maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya hendaklah dianggap sebagai sumber yang sahih. Untuk maklumat penting, terjemahan oleh profesional manusia adalah disyorkan. Kami tidak bertanggungjawab terhadap sebarang salah faham atau kesilapan tafsir yang timbul daripada penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**:\nDokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk ketepatan, sila ambil maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sahih. Untuk maklumat penting, terjemahan oleh manusia profesional adalah disyorkan. Kami tidak bertanggungjawab terhadap sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T17:39:31+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "ms"
}
},
"nbformat": 4,

@ -8,7 +8,7 @@
"\n",
"## Memuatkan Data\n",
"\n",
"Kami akan menggunakan data mengenai individu yang dijangkiti COVID-19, yang disediakan oleh [Pusat Sains Sistem dan Kejuruteraan](https://systems.jhu.edu/) (CSSE) di [Universiti Johns Hopkins](https://jhu.edu/). Set data tersedia di [Repositori GitHub ini](https://github.com/CSSEGISandData/COVID-19).\n"
"Kami akan menggunakan data mengenai individu yang dijangkiti COVID-19, disediakan oleh [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) di [Johns Hopkins University](https://jhu.edu/). Set data tersedia di [Repositori GitHub ini](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita boleh memuatkan data terkini terus dari GitHub menggunakan `pd.read_csv`. Jika atas sebab tertentu data tersebut tidak tersedia, anda sentiasa boleh menggunakan salinan yang tersedia secara tempatan dalam folder `data` - hanya nyahkomen baris di bawah yang mendefinisikan `base_url`:\n"
"Kita boleh memuatkan data terkini terus dari GitHub menggunakan `pd.read_csv`. Jika atas sebab tertentu data tidak tersedia, anda sentiasa boleh menggunakan salinan yang ada secara tempatan dalam folder `data` - cuma buat komen baris di bawah yang mendefinisikan `base_url`:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mari kita muatkan data untuk individu yang dijangkiti dan lihat bagaimana rupa data tersebut:\n"
"Mari kita muatkan data untuk individu yang dijangkiti dan lihat bagaimana data tersebut kelihatan:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita boleh lihat bahawa setiap baris jadual menentukan bilangan individu yang dijangkiti untuk setiap negara dan/atau wilayah, dan lajur-lajur bersesuaian dengan tarikh. Jadual yang serupa boleh dimuatkan untuk data lain, seperti bilangan yang sembuh dan bilangan kematian.\n"
"Kita boleh melihat bahawa setiap baris jadual mentakrifkan bilangan individu yang dijangkiti untuk setiap negara dan/atau wilayah, dan lajur bersamaan dengan tarikh. Jadual serupa boleh dimuatkan untuk data lain, seperti bilangan yang sembuh dan bilangan kematian.\n"
]
},
{
@ -284,7 +284,7 @@
"source": [
"## Memahami Data\n",
"\n",
"Daripada jadual di atas, peranan lajur negeri tidak jelas. Mari lihat nilai-nilai berbeza yang terdapat dalam lajur `Province/State`:\n"
"Daripada jadual di atas, peranan lajur negeri tidak jelas. Mari kita lihat nilai-nilai berbeza yang terdapat dalam lajur `Province/State`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Daripada nama-nama tersebut kita boleh membuat kesimpulan bahawa negara-negara seperti Australia dan China mempunyai pecahan yang lebih terperinci mengikut wilayah. Mari kita lihat maklumat mengenai China untuk melihat contohnya:\n"
"Daripada nama-nama tersebut kita boleh membuat kesimpulan bahawa negara seperti Australia dan China mempunyai pecahan yang lebih terperinci mengikut wilayah. Mari kita cari maklumat mengenai China untuk melihat contohnya:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Prapemprosesan Data\n",
"## Pra-pemprosesan Data \n",
"\n",
"Kami tidak berminat untuk memecahkan negara kepada wilayah yang lebih terperinci, oleh itu kami akan membuang pecahan ini terlebih dahulu dan menambah maklumat bagi semua wilayah bersama-sama, untuk mendapatkan maklumat bagi seluruh negara. Ini boleh dilakukan menggunakan `groupby`:\n"
"Kami tidak berminat untuk memecahkan negara kepada wilayah-wilayah yang lebih kecil, oleh itu kami akan mula dengan menghapus perincian ini dan menambahkan maklumat mengenai semua wilayah bersama, untuk mendapatkan maklumat bagi keseluruhan negara. Ini boleh dilakukan menggunakan `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Anda boleh melihat bahawa disebabkan penggunaan `groupby`, semua DataFrame kini diindeks mengikut Negara/Wilayah. Oleh itu, kita boleh mengakses data untuk negara tertentu dengan menggunakan `.loc`:|\n"
"Anda boleh lihat bahawa disebabkan menggunakan `groupby` semua DataFrame kini diindeks mengikut Negara/Wilayah. Oleh itu, kita boleh mengakses data untuk negara tertentu dengan menggunakan `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Nota** bagaimana kita menggunakan `[3:]` untuk mengeluarkan tiga elemen pertama dalam satu urutan yang mengandungi metadata bukan tarikh (lajur Wilayah/Negeri dan geolokasi). Kita juga boleh membuang ketiga-tiga lajur tersebut sepenuhnya:\n"
"> **Nota** bagaimana kami menggunakan `[3:]` untuk membuang tiga elemen pertama dalam satu urutan yang mengandungi metadata bukan tarikh (ruangan Wilayah/Negeri dan geolokasi). Kami juga boleh membuang ketiga-tiga ruangan tersebut secara keseluruhan:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Menyelidik Data\n",
"## Menyiasat Data\n",
"\n",
"Mari kita beralih kepada penyelidikan negara tertentu. Mari kita cipta satu bingkai yang mengandungi data jangkitan yang diindeks mengikut tarikh:\n"
"Mari kita beralih ke penyiasatan sebuah negara tertentu. Mari kita buat sebuah bingkai yang mengandungi data jangkitan diindeks mengikut tarikh:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sekarang mari kita kira bilangan orang yang dijangkiti baru setiap hari. Ini akan membolehkan kita melihat kelajuan di mana pandemik berkembang. Cara paling mudah melakukannya adalah dengan menggunakan `diff`:\n"
"Sekarang mari kita kira bilangan orang yang dijangkiti baru setiap hari. Ini akan membolehkan kita melihat kelajuan di mana pandemik bergerak maju. Cara paling mudah untuk melakukannya adalah menggunakan `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kita dapat melihat turun naik yang tinggi dalam data. Mari kita lihat dengan lebih dekat pada salah satu bulan:\n"
"Kita boleh melihat turun naik yang tinggi dalam data. Mari kita lihat dengan lebih dekat pada salah satu bulan:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Nampak jelas bahawa terdapat turun naik mingguan dalam data. Oleh kerana kita ingin dapat melihat tren, adalah wajar untuk melicinkan lengkung tersebut dengan mengira purata bergerak (iaitu untuk setiap hari kita akan mengira nilai purata beberapa hari sebelumnya):\n"
"Ia jelas kelihatan seperti terdapat turun naik mingguan dalam data. Oleh kerana kita mahu dapat melihat trend, adalah masuk akal untuk melicinkan lengkung dengan mengira purata bergerak (iaitu bagi setiap hari kita akan mengira nilai purata bagi beberapa hari sebelumnya):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Untuk dapat membandingkan beberapa negara, kita mungkin ingin mengambil kira populasi negara tersebut, dan membandingkan peratusan individu yang dijangkiti dengan populasi negara. Untuk mendapatkan populasi negara, mari muatkan set data negara-negara:\n"
"Untuk dapat membandingkan beberapa negara, kita mungkin mahu mengambil kira populasi negara tersebut, dan membandingkan peratusan individu yang dijangkiti berbanding dengan populasi negara. Untuk mendapatkan populasi negara, mari muatkan set data negara-negara:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Kerana set data ini mengandungi maklumat tentang kedua-dua negara dan wilayah, untuk mendapatkan populasi keseluruhan negara kita perlu menjadi sedikit bijak:\n"
"Oleh kerana set data ini mengandungi maklumat tentang kedua-dua negara dan wilayah, untuk mendapatkan populasi keseluruhan negara kita perlu menjadi sedikit bijak: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Mengira $R_t$\n",
"\n",
"Untuk melihat betapa berjangkitnya penyakit ini, kita melihat pada **nombor pembiakan asas** $R_0$, yang menunjukkan bilangan orang yang akan dijangkiti oleh seorang individu yang dijangkiti. Apabila $R_0$ lebih daripada 1, wabak itu cenderung untuk merebak.\n",
"Untuk melihat betapa berjangkitnya penyakit itu, kita melihat **nombor pembiakan asas** $R_0$, yang menunjukkan bilangan orang yang akan dijangkiti oleh seorang individu yang dijangkiti. Apabila $R_0$ lebih dari 1, wabak dijangka akan merebak.\n",
"\n",
"$R_0$ adalah sifat penyakit itu sendiri, dan tidak mengambil kira beberapa langkah perlindungan yang mungkin diambil oleh orang untuk melambatkan pandemik. Semasa perkembangan pandemik, kita boleh menganggarkan nombor pembiakan $R_t$ pada mana-mana masa $t$. Ia telah ditunjukkan bahawa nombor ini boleh dianggarkan secara kasar dengan mengambil tetingkap selama 8 hari, dan mengira $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"di mana $I_t$ adalah bilangan individu yang baru dijangkiti pada hari $t$.\n",
"$R_0$ adalah sifat penyakit itu sendiri, dan tidak mengambil kira beberapa langkah perlindungan yang mungkin diambil oleh orang untuk memperlahankan pandemik. Semasa perkembangan pandemik, kita boleh menganggarkan nombor pembiakan $R_t$ pada bila-bila masa $t$. Ia telah ditunjukkan bahawa nombor ini boleh dianggarkan secara kasar dengan mengambil tetingkap selama 8 hari, dan mengira $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"di mana $I_t$ ialah bilangan individu baru yang dijangkiti pada hari $t$.\n",
"\n",
"Mari kita kira $R_t$ untuk data pandemik kita. Untuk melakukan ini, kita akan mengambil tetingkap bergulung sebanyak 8 nilai `ninfected`, dan menggunakan fungsi untuk mengira nisbah di atas:\n"
"Mari kita kira $R_t$ untuk data pandemik kita. Untuk melakukan ini, kita akan mengambil tetingkap bergerak sebanyak 8 nilai `ninfected`, dan menggunakan fungsi untuk mengira nisbah di atas:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Anda boleh lihat bahawa terdapat beberapa jurang dalam graf. Jurang tersebut boleh disebabkan oleh sama ada `NaN`, jika nilai `inf` hadir dalam set data. `inf` mungkin disebabkan oleh pembahagian dengan 0, dan `NaN` boleh menunjukkan data yang hilang, atau tiada data tersedia untuk mengira keputusan (seperti pada permulaan bingkai kita, di mana tetingkap bergulung dengan lebar 8 belum tersedia). Untuk menjadikan graf lebih kemas, kita perlu mengisi nilai-nilai tersebut menggunakan fungsi `replace` dan `fillna`.\n",
"Anda boleh lihat terdapat beberapa jurang dalam graf. Jurang tersebut boleh disebabkan oleh `NaN`, jika nilai `inf` wujud dalam set data. `inf` mungkin disebabkan oleh pembahagian dengan 0, dan `NaN` boleh menunjukkan data hilang, atau tiada data yang tersedia untuk mengira keputusan (seperti pada permulaan bingkai kami, di mana tingkap berguling dengan lebar 8 belum tersedia). Untuk menjadikan graf lebih kemas, kita perlu mengisi nilai-nilai tersebut menggunakan fungsi `replace` dan `fillna`.\n",
"\n",
"Mari lihat lebih lanjut pada permulaan pandemik. Kita juga akan mengehadkan nilai pada paksi-y untuk menunjukkan hanya nilai di bawah 6, supaya dapat dilihat dengan lebih baik, dan melukis garis mendatar pada nilai 1.\n"
"Mari kita lihat lebih lanjut pada permulaan pandemik. Kita juga akan mengehadkan nilai paksi-y untuk hanya menunjukkan nilai di bawah 6, supaya dapat melihat dengan lebih jelas, dan melukis garis mendatar pada 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Penunjuk menarik lain bagi pandemik ialah **terbitan**, atau **perbezaan harian** dalam kes baharu. Ia membolehkan kita melihat dengan jelas bila pandemik sedang meningkat atau menurun.\n"
"Satu petunjuk menarik lain bagi pandemik adalah **terbitan**, atau **perbezaan harian** dalam kes baru. Ia membolehkan kita melihat dengan jelas bila pandemik meningkat atau menurun. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Memandangkan terdapat banyak turun naik dalam data yang disebabkan oleh pelaporan, adalah wajar untuk melicinkan lengkung dengan menjalankan purata bergulir untuk mendapatkan gambaran keseluruhan. Mari kita beri tumpuan semula pada bulan-bulan pertama pandemik:\n"
"Memandangkan terdapat banyak turun naik dalam data yang disebabkan oleh pelaporan, adalah logik untuk melicinkan lengkung dengan menjalankan purata bergulir bagi mendapatkan gambaran keseluruhan. Mari kita fokus sekali lagi pada bulan-bulan pertama pandemik:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Cabaran\n",
"\n",
"Kini tiba masanya untuk anda bermain lebih dengan kod dan data! Berikut adalah beberapa cadangan yang anda boleh cuba eksperimen:\n",
"* Lihat penyebaran pandemik di negara-negara yang berbeza.\n",
"* Lukis graf $R_t$ untuk beberapa negara dalam satu graf untuk perbandingan, atau buat beberapa graf berdampingan\n",
"Kini tiba masanya untuk anda bermain lebih dengan kod dan data! Berikut adalah beberapa cadangan yang boleh anda cuba:\n",
"* Lihat penyebaran pandemik di pelbagai negara.\n",
"* Lukis graf $R_t$ untuk beberapa negara pada satu graf untuk perbandingan, atau buat beberapa graf bersebelahan\n",
"* Lihat bagaimana bilangan kematian dan pemulihan berkorelasi dengan bilangan kes yang dijangkiti.\n",
"* Cuba cari berapa lama penyakit biasa berlangsung dengan mengaitkan secara visual kadar jangkitan dan kadar kematian serta mencari beberapa kejanggalan. Anda mungkin perlu melihat di negara-negara berbeza untuk mengetahuinya.\n",
"* Kira kadar kematian dan bagaimana ia berubah dari masa ke masa. Anda mungkin ingin mengambil kira tempoh penyakit dalam hari untuk mengalihkan satu siri masa sebelum melakukan pengiraan.\n"
"* Cuba cari berapa lama penyakit biasa berlangsung dengan menghubungkan secara visual kadar jangkitan dan kadar kematian serta mencari beberapa anomali. Anda mungkin perlu melihat negara yang berbeza untuk mengetahui itu.\n",
"* Kira kadar kematian dan bagaimana ia berubah dari masa ke masa. Anda mungkin mahu mengambil kira tempoh penyakit dalam hari untuk mengalih satu siri masa sebelum membuat pengiraan\n"
]
},
{
@ -2407,8 +2409,8 @@
"## Rujukan\n",
"\n",
"Anda boleh melihat kajian lanjut mengenai penyebaran wabak COVID dalam penerbitan berikut:\n",
"* [Model SIR Gelongsor untuk Anggaran Rt semasa Pandemik COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), pos blog oleh [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Anggaran Nombor Pembiakan Bergantung Masa untuk Wabak Global COVID-19](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Model SIR Gelongsor untuk Anggaran Rt semasa Pandemik COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), catatan blog oleh [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Anggaran Nombor Reproduksi Berasaskan Masa untuk Wabak COVID-19 Global](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Kod untuk kertas di atas di GitHub](https://github.com/shwars/SlidingSIR)\n"
]
},
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**: \nDokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk memastikan ketepatan, sila ambil maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sahih. Untuk maklumat yang kritikal, disarankan menggunakan terjemahan profesional oleh manusia. Kami tidak bertanggungjawab atas sebarang salah faham atau penafsiran yang salah yang timbul daripada penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Penafian**:\nDokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk ketepatan, sila ambil maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sahih. Untuk maklumat penting, terjemahan oleh manusia profesional adalah disyorkan. Kami tidak bertanggungjawab terhadap sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,31 +1,33 @@
# Projek visualisasi data Dangerous Liaisons
Untuk memulakan, pastikan anda mempunyai NPM dan Node yang berjalan di mesin anda. Pasang kebergantungan (npm install) dan kemudian jalankan projek secara tempatan (npm run serve):
Untuk memulakan, anda perlu memastikan bahawa anda mempunyai NPM dan Node **>=20.0.0** yang berjalan di mesin anda. Pasang kebergantungan (npm install) dan kemudian jalankan projek secara tempatan (npm run serve):
## Persediaan projek
```
npm install
```
### Kompilasi dan muat semula secara automatik untuk pembangunan
### Memampat dan muat semula secara panas untuk pembangunan
```
npm run serve
```
### Kompilasi dan minimakan untuk pengeluaran
### Memampat dan meminify untuk pengeluaran
```
npm run build
```
### Lakukan lint dan perbaiki fail
### Memeriksa dan membaiki fail
```
npm run lint
```
### Sesuaikan konfigurasi
Lihat [Rujukan Konfigurasi](https://cli.vuejs.org/config/).
### Tersuai konfigurasi
Lihat [Configuration Reference](https://cli.vuejs.org/config/).
---
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk memastikan ketepatan, sila ambil perhatian bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang berwibawa. Untuk maklumat yang kritikal, terjemahan manusia profesional adalah disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk ketepatan, sila ambil maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sahih. Untuk maklumat penting, terjemahan oleh manusia profesional adalah disyorkan. Kami tidak bertanggungjawab terhadap sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,31 +1,33 @@
# Projek visualisasi data Dangerous Liaisons
Untuk memulakan, pastikan anda mempunyai NPM dan Node yang berjalan pada mesin anda. Pasang kebergantungan (npm install) dan kemudian jalankan projek secara tempatan (npm run serve):
Untuk bermula, anda perlu memastikan bahawa anda mempunyai NPM dan Node **>=20.0.0** yang berjalan pada mesin anda. Pasang kebergantungan (npm install) dan kemudian jalankan projek secara tempatan (npm run serve):
## Persediaan projek
## Persediaan Projek
```
npm install
```
### Kompilasi dan muat semula secara automatik untuk pembangunan
### Menyusun dan memuat semula secara panas untuk pembangunan
```
npm run serve
```
### Kompilasi dan minimisasi untuk pengeluaran
### Menyusun dan meminimumkan untuk pengeluaran
```
npm run build
```
### Lint dan pembaikan fail
### Memeriksa dan membetulkan fail
```
npm run lint
```
### Sesuaikan konfigurasi
Lihat [Rujukan Konfigurasi](https://cli.vuejs.org/config/).
Lihat [Configuration Reference](https://cli.vuejs.org/config/).
---
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk memastikan ketepatan, sila ambil perhatian bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang berwibawa. Untuk maklumat yang kritikal, terjemahan manusia profesional adalah disyorkan. Kami tidak bertanggungjawab atas sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Penafian**:
Dokumen ini telah diterjemahkan menggunakan perkhidmatan terjemahan AI [Co-op Translator](https://github.com/Azure/co-op-translator). Walaupun kami berusaha untuk ketepatan, sila ambil maklum bahawa terjemahan automatik mungkin mengandungi kesilapan atau ketidaktepatan. Dokumen asal dalam bahasa asalnya harus dianggap sebagai sumber yang sahih. Untuk maklumat penting, terjemahan oleh manusia profesional adalah disyorkan. Kami tidak bertanggungjawab terhadap sebarang salah faham atau salah tafsir yang timbul daripada penggunaan terjemahan ini.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -12,8 +12,8 @@
"language_code": "tl"
},
"1-Introduction/01-defining-data-science/notebook.ipynb": {
"original_hash": "8f5eb7b3f7cc89e6d98fb32e1de65dec",
"translation_date": "2026-02-27T10:02:13+00:00",
"original_hash": "8eb07e3d899aaba7ea9c9ec9b5aa2850",
"translation_date": "2026-07-17T21:50:04+00:00",
"source_file": "1-Introduction/01-defining-data-science/notebook.ipynb",
"language_code": "tl"
},
@ -42,8 +42,8 @@
"language_code": "tl"
},
"1-Introduction/03-defining-data/README.md": {
"original_hash": "12339119c0165da569a93ddba05f9339",
"translation_date": "2025-09-06T00:30:36+00:00",
"original_hash": "7217c6f9eb464d4ff4bae6c036ab53cb",
"translation_date": "2026-07-17T21:52:22+00:00",
"source_file": "1-Introduction/03-defining-data/README.md",
"language_code": "tl"
},
@ -65,6 +65,12 @@
"source_file": "1-Introduction/04-stats-and-probability/assignment.md",
"language_code": "tl"
},
"1-Introduction/04-stats-and-probability/notebook.ipynb": {
"original_hash": "0c77e104b29c723287bf11b773fcc5d5",
"translation_date": "2026-07-17T21:51:03+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "tl"
},
"1-Introduction/README.md": {
"original_hash": "696a8474a01054281704cbfb09148949",
"translation_date": "2025-08-28T02:42:43+00:00",
@ -108,8 +114,8 @@
"language_code": "tl"
},
"2-Working-With-Data/07-python/notebook-covidspread.ipynb": {
"original_hash": "6335cccba01dc6ad7b15aba7a8c73f38",
"translation_date": "2026-02-27T10:03:45+00:00",
"original_hash": "da97f98781c7cd271063f605fe8d71d0",
"translation_date": "2026-07-17T21:49:34+00:00",
"source_file": "2-Working-With-Data/07-python/notebook-covidspread.ipynb",
"language_code": "tl"
},
@ -192,14 +198,14 @@
"language_code": "tl"
},
"3-Data-Visualization/13-meaningful-visualizations/solution/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-28T02:41:00+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:52:29+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/solution/README.md",
"language_code": "tl"
},
"3-Data-Visualization/13-meaningful-visualizations/starter/README.md": {
"original_hash": "5c51a54dd89075a7a362890117b7ed9e",
"translation_date": "2025-08-28T02:41:06+00:00",
"original_hash": "2b3b2632bb02af608ca60be828e8097d",
"translation_date": "2026-07-17T21:52:26+00:00",
"source_file": "3-Data-Visualization/13-meaningful-visualizations/starter/README.md",
"language_code": "tl"
},

File diff suppressed because one or more lines are too long

@ -1,48 +1,47 @@
# Pagpapakahulugan ng Datos
# Pagbibigay Kahulugan sa Datos
|![ Sketchnote ni [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|![ Sketchnote mula kay [(@sketchthedocs)](https://sketchthedocs.dev) ](../../sketchnotes/03-DefiningData.png)|
|:---:|
|Pagpapakahulugan ng Datos - _Sketchnote ni [@nitya](https://twitter.com/nitya)_ |
|Pagbibigay Kahulugan sa Datos - _Sketchnote mula kay [@nitya](https://twitter.com/nitya)_ |
Ang datos ay mga katotohanan, impormasyon, obserbasyon, at sukat na ginagamit upang makagawa ng mga tuklas at suportahan ang mga desisyong may kaalaman. Ang isang data point ay isang yunit ng datos sa loob ng isang dataset, na koleksyon ng mga data point. Ang mga dataset ay maaaring dumating sa iba't ibang format at istruktura, at karaniwang nakabatay sa pinagmulan nito, o kung saan nagmula ang datos. Halimbawa, ang buwanang kita ng isang kumpanya ay maaaring nasa spreadsheet ngunit ang datos ng oras-oras na tibok ng puso mula sa isang smartwatch ay maaaring nasa format na [JSON](https://stackoverflow.com/a/383699). Karaniwan para sa mga data scientist na magtrabaho sa iba't ibang uri ng datos sa loob ng isang dataset.
Ang datos ay mga katotohanan, impormasyon, mga obserbasyon at mga panukat na ginagamit upang makagawa ng mga tuklas at suportahan ang mga may kaalamang desisyon. Ang isang data point ay isang hiwalay na yunit ng datos sa loob ng isang dataset, na isang koleksyon ng mga data points. Ang mga dataset ay maaaring magkakaiba ang format at estruktura, at karaniwang nakabase sa pinagmulan nito, o kung saan nagmula ang datos. Halimbawa, ang buwanang kita ng isang kumpanya ay maaaring nasa spreadsheet ngunit ang datos ng heart rate bawat oras mula sa isang smartwatch ay maaaring nasa [JSON](https://stackoverflow.com/a/383699) na format. Karaniwan para sa mga data scientist na magtrabaho sa iba't ibang uri ng datos sa loob ng isang dataset.
Ang araling ito ay nakatuon sa pagkilala at pag-uuri ng datos batay sa mga katangian nito at mga pinagmulan.
Ang araling ito ay nakatuon sa pagtukoy at pagsuri ng datos ayon sa mga katangian nito at pinagmulan.
## [Pre-Lecture Quiz](https://ff-quizzes.netlify.app/en/ds/quiz/4)
## Paano Inilalarawan ang Datos
### Raw Data
Ang raw data ay datos na nagmula sa pinagmulan nito sa orihinal na estado at hindi pa nasusuri o naayos. Upang maunawaan kung ano ang nangyayari sa isang dataset, kailangang ayusin ito sa isang format na mauunawaan ng tao pati na rin ng teknolohiyang maaaring gamitin upang masuri ito nang higit pa. Ang istruktura ng isang dataset ay naglalarawan kung paano ito naayos at maaaring uriin bilang structured, unstructured, at semi-structured. Ang mga uri ng istruktura na ito ay mag-iiba depende sa pinagmulan ngunit sa huli ay magkasya sa tatlong kategoryang ito.
Ang raw data ay datos na nagmula sa pinagmulan nito sa unang estado nito at hindi pa nasuri o naayos. Upang maunawaan kung ano ang nangyayari sa isang dataset, kailangan itong ayusin sa isang format na mauunawaan ng mga tao pati na rin ng teknolohiya na maaaring gamitin upang suriin ito ng mas malalim. Ang estruktura ng isang dataset ay naglalarawan kung paano ito naayos at maaaring uriin bilang structured, unstructured, at semi-structured. Ang mga uri ng estrukturang ito ay nagbabago depende sa pinagmulan pero karaniwang mapapaloob sa tatlong kategoryang ito.
### Quantitative Data
Ang quantitative data ay mga numerikal na obserbasyon sa loob ng isang dataset at karaniwang maaaring suriin, sukatin, at gamitin sa matematika. Ilang halimbawa ng quantitative data ay: populasyon ng isang bansa, taas ng isang tao, o kita ng isang kumpanya kada quarter. Sa karagdagang pagsusuri, ang quantitative data ay maaaring gamitin upang matuklasan ang mga seasonal trend ng Air Quality Index (AQI) o tantiyahin ang posibilidad ng trapiko sa rush hour sa isang tipikal na araw ng trabaho.
Ang quantitative data ay mga numerikal na obserbasyon sa loob ng isang dataset at karaniwang maaaring pag-aralan, sukatin, at gamitin sa matematika. Ilan sa mga halimbawa ng quantitative data ay: populasyon ng isang bansa, taas ng isang tao, o kita ng isang kumpanya kada quarter. Sa karagdagang pagsusuri, ang quantitative data ay maaaring gamitin upang tuklasin ang mga seasonal na trend ng Air Quality Index (AQI) o tantiyahin ang posibilidad ng trapiko tuwing rush hour sa isang tipikal na araw ng trabaho.
### Qualitative Data
Ang qualitative data, na kilala rin bilang categorical data, ay datos na hindi maaaring sukatin nang objektibo tulad ng obserbasyon ng quantitative data. Karaniwan itong iba't ibang format ng subjektibong datos na naglalarawan sa kalidad ng isang bagay, tulad ng produkto o proseso. Minsan, ang qualitative data ay numerikal ngunit hindi karaniwang ginagamit sa matematika, tulad ng mga numero ng telepono o mga timestamp. Ilang halimbawa ng qualitative data ay: mga komento sa video, make at model ng kotse, o paboritong kulay ng pinakamalapit mong kaibigan. Ang qualitative data ay maaaring gamitin upang maunawaan kung aling mga produkto ang pinakagusto ng mga consumer o matukoy ang mga sikat na keyword sa mga resume ng aplikasyon sa trabaho.
Ang qualitative data, na kilala rin bilang categorical data, ay datos na hindi maaaring masukat nang obhetibo tulad ng mga obserbasyon ng quantitative data. Ito ay karaniwang iba't ibang mga porma ng subjective na datos na kumakatawan sa kalidad ng isang bagay, tulad ng produkto o proseso. Minsan, ang qualitative data ay numerikal ngunit karaniwang hindi ginagamit sa matematika, gaya ng mga numero ng telepono o timestamps. Ilan sa mga halimbawa ng qualitative data ay: mga komento sa video, brand at modelo ng sasakyan, o paboritong kulay ng iyong mga malalapit na kaibigan. Ang qualitative data ay maaaring gamitin upang maunawaan kung alin sa mga produkto ang pinakagusto ng mga konsyumer o upang matukoy ang mga popular na keyword sa mga resume ng aplikasyon sa trabaho.
### Structured Data
Ang structured data ay datos na naayos sa mga row at column, kung saan ang bawat row ay may parehong set ng column. Ang mga column ay kumakatawan sa isang halaga ng partikular na uri at makikilala sa isang pangalan na naglalarawan kung ano ang kinakatawan ng halaga, habang ang mga row ay naglalaman ng aktwal na mga halaga. Ang mga column ay madalas na may partikular na set ng mga panuntunan o limitasyon sa mga halaga, upang matiyak na ang mga halaga ay tumpak na kumakatawan sa column. Halimbawa, isipin ang isang spreadsheet ng mga customer kung saan ang bawat row ay dapat may numero ng telepono at ang mga numero ng telepono ay hindi kailanman naglalaman ng mga alpabetikong karakter. Maaaring may mga panuntunan na inilapat sa column ng numero ng telepono upang matiyak na hindi ito kailanman walang laman at naglalaman lamang ng mga numero.
Ang structured data ay datos na inayos sa mga hilera at kolum, kung saan bawat hilera ay may parehong set ng mga kolum. Ang mga kolum ay kumakatawan sa halaga ng isang partikular na uri at may pangalan na naglalarawan kung ano ang kinakatawan ng halaga, habang ang mga hilera ay naglalaman ng aktwal na mga halaga. Karaniwan, ang mga kolum ay may mga patakaran o limitasyon sa mga halaga upang matiyak na tama ang mga kinakatawang values sa kolum. Halimbawa, isipin ang isang spreadsheet ng mga customer kung saan bawat hilera ay dapat may numero ng telepono at ang mga numero ng telepono ay hindi naglalaman ng mga titik. Maaaring may mga patakaran para sa kolum ng numero ng telepono upang matiyak na hindi ito walang laman at naglalaman lamang ng mga numero.
Ang benepisyo ng structured data ay maaari itong ayusin sa paraang maaaring maiugnay sa iba pang structured data. Gayunpaman, dahil ang datos ay dinisenyo upang maayos sa isang partikular na paraan, ang paggawa ng mga pagbabago sa pangkalahatang istruktura nito ay maaaring mangailangan ng malaking pagsisikap. Halimbawa, ang pagdaragdag ng email column sa spreadsheet ng customer na hindi maaaring walang laman ay nangangahulugan na kailangan mong alamin kung paano mo idaragdag ang mga halagang ito sa mga umiiral na row ng mga customer sa dataset.
Isang benepisyo ng structured data ay maaari itong ayusin sa paraan na maiuugnay ito sa ibang structured data. Gayunpaman, dahil ang datos ay disenyo na maayos sa isang partikular na paraan, ang paggawa ng mga pagbabago sa kabuuang estruktura nito ay maaaring mangailangan ng maraming pagsisikap. Halimbawa, ang pagdagdag ng isang email column sa spreadsheet ng customer na hindi maaaring maging walang laman ay nangangahulugang kailangan mong planuhin kung paano mo idaragdag ang mga halagang ito sa mga kasalukuyang hilera ng mga customer sa dataset.
Mga halimbawa ng structured data: spreadsheets, relational databases, mga numero ng telepono, bank statements
Mga halimbawa ng structured data: spreadsheet, relational databases, numero ng telepono, bank statements
### Unstructured Data
Ang unstructured data ay karaniwang hindi maaaring ikategorya sa mga row o column at walang format o set ng mga panuntunan na susundin. Dahil ang unstructured data ay may mas kaunting mga limitasyon sa istruktura nito, mas madali itong magdagdag ng bagong impormasyon kumpara sa isang structured dataset. Halimbawa, kung ang isang sensor na kumukuha ng datos sa barometric pressure tuwing 2 minuto ay nakatanggap ng update na ngayon ay pinapayagan itong sukatin at i-record ang temperatura, hindi nito kailangang baguhin ang umiiral na datos kung ito ay unstructured. Gayunpaman, maaaring mas matagal ang pagsusuri o pagsisiyasat sa ganitong uri ng datos. Halimbawa, ang isang siyentipiko na gustong hanapin ang average na temperatura ng nakaraang buwan mula sa datos ng sensor, ngunit natuklasan na ang sensor ay nag-record ng "e" sa ilan sa mga datos nito upang ipahiwatig na ito ay nasira sa halip na isang tipikal na numero, na nangangahulugang hindi kumpleto ang datos.
Ang unstructured data ay karaniwang hindi maisasailalim sa mga hilera o kolum at walang tiyak na format o set ng mga patakaran na sinusunod. Dahil ang unstructured data ay may mas kaunting mga restriksiyon sa estruktura nito, mas madali itong dagdagan ng bagong impormasyon kumpara sa structured dataset. Kung ang isang sensor na kumukuha ng datos tungkol sa barometric pressure tuwing 2 minuto ay nakatanggap ng update na pinapayagan itong sukatin at irekord ang temperatura, hindi na kailangan baguhin ang umiiral na datos kung ito ay unstructured. Gayunpaman, maaaring tumagal ng mas matagal ang pagsusuri o imbestigasyon ng ganitong uri ng datos. Halimbawa, isang siyentipiko na nais alamin ang average na temperatura ng nakaraang buwan mula sa datos ng sensor, ngunit natuklasan na may "e" na naitala sa ilang bahagi ng datos bilang palatandaan na ito ay sira, hindi isang karaniwang numero, na nangangahulugang hindi kumpleto ang datos.
Mga halimbawa ng unstructured data: text files, text messages, video files
Mga halimbawa ng unstructured data: mga text file, mga text message, mga video file
### Semi-structured
Ang semi-structured data ay may mga katangian na ginagawa itong kombinasyon ng structured at unstructured data. Karaniwan itong hindi sumusunod sa format ng mga row at column ngunit naayos sa paraang itinuturing na structured at maaaring sumunod sa isang nakatakdang format o set ng mga panuntunan. Ang istruktura ay mag-iiba sa pagitan ng mga pinagmulan, tulad ng isang malinaw na hierarchy hanggang sa isang mas flexible na istruktura na nagpapadali sa pagsasama ng bagong impormasyon. Ang metadata ay mga tagapagpahiwatig na tumutulong sa pagpapasya kung paano naayos at iniimbak ang datos at magkakaroon ng iba't ibang pangalan, batay sa uri ng datos. Ilang karaniwang pangalan para sa metadata ay tags, elements, entities, at attributes. Halimbawa, ang isang tipikal na email message ay magkakaroon ng subject, body, at isang set ng mga recipient at maaaring ayusin batay sa kung sino o kailan ito ipinadala.
Ang semi-structured data ay may mga katangian na pinagsasama ang structured at unstructured data. Karaniwan, hindi ito sumusunod sa format ng mga hilera at kolum ngunit inaayos sa paraang itinuturing na structured at maaaring sumunod sa isang tiyak na format o set ng mga patakaran. Ang estruktura ay nag-iiba sa bawat pinagmulan, tulad ng isang malinaw na hierarchy hanggang sa isang mas flexible na format na nagpapadali ng integrasyon ng bagong impormasyon. Ang metadata ay mga tagapagpahiwatig na tumutulong tukuyin kung paano inaayos at iniimbak ang datos at may iba't ibang pangalan depende sa uri ng datos. Ilan sa mga karaniwang tawag sa metadata ay tags, elements, entities, at attributes. Halimbawa, ang isang tipikal na email message ay may subject, body, at set ng mga recipient at maaaring iayos ayon sa sino o kailan ito ipinadala.
Mga halimbawa ng semi-structured data: HTML, CSV files, JavaScript Object Notation (JSON)
Mga halimbawa ng semi-structured data: HTML, mga CSV file, JavaScript Object Notation (JSON)
## Mga Pinagmulan ng Datos
## Mga Pinagmulan ng Datos
Ang pinagmulan ng datos ay ang pangunahing lokasyon kung saan nabuo ang datos, o kung saan ito "nakatira" at mag-iiba batay sa kung paano at kailan ito nakolekta. Ang datos na nabuo ng mga gumagamit nito ay kilala bilang primary data habang ang secondary data ay nagmumula sa isang pinagmulan na nangolekta ng datos para sa pangkalahatang paggamit. Halimbawa, ang isang grupo ng mga siyentipiko na nangongolekta ng obserbasyon sa isang rainforest ay ituturing na primary at kung magpasya silang ibahagi ito sa ibang mga siyentipiko, ito ay ituturing na secondary para sa mga gumagamit nito.
Ang data source ay ang unang lokasyon kung saan nagmula ang datos, o kung saan ito "nakatira" at nag-iiba depende kung paano at kailan ito nakolekta. Ang datos na ginawa ng mga gumagamit nito ay tinatawag na primary data habang ang secondary data ay nagmumula sa pinagmulan na nangolekta ng datos para sa pangkalahatang gamit. Halimbawa, isang grupo ng mga siyentipiko na nangongolekta ng mga obserbasyon sa isang rainforest ay itinuturing na primary data at kung kanilang ibabahagi ito sa ibang mga siyentipiko, magiging secondary ito para sa mga gagamit nito.
Ang mga database ay isang karaniwang pinagmulan at umaasa sa isang database management system upang i-host at panatilihin ang datos kung saan gumagamit ang mga user ng mga command na tinatawag na queries upang galugarin ang datos. Ang mga file bilang pinagmulan ng datos ay maaaring audio, image, at video files pati na rin ang mga spreadsheet tulad ng Excel. Ang mga internet sources ay isang karaniwang lokasyon para sa pagho-host ng datos, kung saan ang mga database pati na rin ang mga file ay matatagpuan. Ang application programming interfaces, na kilala rin bilang APIs, ay nagpapahintulot sa mga programmer na lumikha ng mga paraan upang magbahagi ng datos sa mga panlabas na user sa pamamagitan ng internet, habang ang proseso ng web scraping ay kumukuha ng datos mula sa isang web page. Ang [mga aralin sa Working with Data](../../../../../../../../../2-Working-With-Data) ay nakatuon sa kung paano gamitin ang iba't ibang pinagmulan ng datos.
Ang mga database ay isang karaniwang pinagmulan at umaasa sa database management system upang i-host at panatilihin ang datos kung saan gumagamit ang mga user ng mga komang tinatawag na queries upang tuklasin ang datos. Ang mga file bilang pinagmulan ng datos ay maaaring audio, imahe, at video files pati na rin mga spreadsheet tulad ng Excel. Ang mga internet source ay isang karaniwang lokasyon para mag-host ng datos, kung saan makikita ang mga database pati na rin mga file. Ang application programming interfaces, kilala rin bilang APIs, ay nagpapahintulot sa mga programmer na gumawa ng mga paraan upang ibahagi ang datos sa panlabas na mga user sa pamamagitan ng internet, habang ang proseso ng web scraping ay kumukuha ng datos mula sa isang web page. Ang [mga aralin sa Paggamit ng Data](../../../../../../../../../2-Working-With-Data) ay nakatuon sa kung paano gamitin ang iba't ibang mga pinagmulan ng datos.
## Konklusyon
@ -50,27 +49,31 @@ Sa araling ito natutunan natin:
- Ano ang datos
- Paano inilalarawan ang datos
- Paano inuuri at ikinategorya ang datos
- Saan matatagpuan ang datos
- Paano ikinakategorya at iniuri ang datos
- Saan maaaring matagpuan ang datos
## 🚀 Hamon
Ang Kaggle ay isang mahusay na pinagmulan ng mga open datasets. Gamitin ang [dataset search tool](https://www.kaggle.com/datasets) upang makahanap ng ilang kawili-wiling datasets at uriin ang 3-5 datasets gamit ang mga pamantayang ito:
Ang Kaggle ay isang mahusay na pinagkukunan ng bukas na mga dataset. Gamitin ang [dataset search tool](https://www.kaggle.com/datasets) upang maghanap ng mga kawili-wiling dataset at uriin ang 3-5 mga dataset gamit ang mga sumusunod na kriteriya:
- Ang datos ba ay quantitative o qualitative?
- Ang datos ba ay structured, unstructured, o semi-structured?
## [Post-lecture quiz](https://ff-quizzes.netlify.app/en/ds/quiz/5)
## Review at Pag-aaral sa Sarili
- Ang Microsoft Learn unit na ito, na pinamagatang [Classify your Data](https://docs.microsoft.com/en-us/learn/modules/choose-storage-approach-in-azure/2-classify-data) ay may detalyadong breakdown ng structured, semi-structured, at unstructured data.
## Repaso at Sariling Pag-aaral
- Ang yunit ng Microsoft Learn na ito, na may pamagat na [Identify data formats](https://learn.microsoft.com/en-us/training/modules/explore-core-data-concepts/2-data-formats?pivots=text) ay may detalyadong pagtalakay sa structured, semi-structured, at unstructured data.
## Takdang Aralin
[Pag-uuri ng Datasets](assignment.md)
[Pag-uuri ng mga Dataset](assignment.md)
---
**Paunawa**:
Ang dokumentong ito ay isinalin gamit ang AI translation service na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't sinisikap naming maging tumpak, tandaan na ang mga awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa kanyang katutubong wika ang dapat ituring na opisyal na sanggunian. Para sa mahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang hindi pagkakaunawaan o maling interpretasyon na maaaring magmula sa paggamit ng pagsasaling ito.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Pagtatanggi**:
Ang dokumentong ito ay isinalin gamit ang serbisyo ng AI translation na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't nagsusumikap kami para sa katumpakan, pakatandaan na ang awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pangunahing sanggunian. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang maling pagkakaintindi o maling interpretasyon na nagmula sa paggamit ng pagsasaling ito.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -4,8 +4,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"# Introduction to Probability and Statistics\n",
"Sa notebook na ito, maglalaro tayo gamit ang ilan sa mga konseptong natalakay na natin. Maraming konsepto mula sa probabilidad at estadistika ang mahusay na naipapakita sa mga pangunahing library para sa pagpoproseso ng datos sa Python, tulad ng `numpy` at `pandas`.\n"
"# Panimula sa Probabilidad at Estadistika\n",
"Sa notebook na ito, mag-eeksperimento tayo sa ilan sa mga konseptong dati na nating napag-usapan. Maraming konsepto mula sa probabilidad at estadistika ang mahusay na naipapakita sa mga pangunahing library para sa pagproseso ng datos sa Python, tulad ng `numpy` at `pandas`.\n"
]
},
{
@ -24,8 +24,8 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Random Variables and Distributions\n",
"Magsimula tayo sa pagkuha ng 30 na halimbawang halaga mula sa pantay-pantay na distribusyon mula 0 hanggang 9. Kakalkulahin din natin ang mean at variance.\n"
"## Mga Random na Variable at Distribusyon\n",
"Magsimula tayo sa pagkuha ng sample ng 30 halaga mula sa isang uniform na distribusyon mula 0 hanggang 9. Kalkulahin din natin ang mean at variance.\n"
]
},
{
@ -44,7 +44,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Upang tantiyahin nang biswal kung ilan ang iba't ibang halaga sa sample, maaari nating iguhit ang **histogram**:\n"
"Upang biswal na tantiyahin kung ilan ang magkakaibang halaga sa sample, maaari nating ilahad ang **histogram**:\n"
]
},
{
@ -61,9 +61,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pagsusuri ng Totoong Data\n",
"## Pagsusuri ng Tuwirang Data\n",
"\n",
"Mahalaga ang mean at variance kapag sinusuri ang totoong datos mula sa mundo. I-load natin ang datos tungkol sa mga manlalaro ng baseball mula sa [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
"Mahalaga ang mean at variance kapag sinusuri ang totoong data. I-load natin ang data tungkol sa mga manlalaro ng baseball mula sa [SOCR MLB Height/Weight Data](http://wiki.stat.ucla.edu/socr/index.php/SOCR_Data_MLB_HeightsWeights)\n"
]
},
{
@ -80,9 +80,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Gumagamit tayo ng isang pakete na tinatawag na [**Pandas**](https://pandas.pydata.org/) dito para sa pagsusuri ng datos. Pag-uusapan pa natin nang mas detalyado ang tungkol sa Pandas at ang pagtrabaho sa datos gamit ang Python sa susunod na bahagi ng kursong ito.\n",
"> Gumagamit tayo ng isang package na tinatawag na [**Pandas**](https://pandas.pydata.org/) dito para sa pagsusuri ng datos. Pag-uusapan pa natin ang tungkol sa Pandas at pagtatrabaho sa datos gamit ang Python sa susunod na bahagi ng kursong ito.\n",
"\n",
"I-compute natin ang mga karaniwang halaga para sa edad, taas, at timbang:\n"
"Kalkulahin natin ang karaniwang halaga ng edad, taas, at timbang:\n"
]
},
{
@ -98,7 +98,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ngayon, magtuon tayo sa taas, at kwentahin ang standard deviation at variance:\n"
"Ngayon pagtuunan natin ng pansin ang taas, at kalkulahin ang standard deviation at variance: \n"
]
},
{
@ -126,7 +126,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Bilang karagdagan sa mean, makatuwiran rin na tingnan ang median na halaga at mga quartile. Maaari silang maipakita gamit ang isang **box plot**:\n"
"Bilang karagdagan sa mean, makatuwiran ring tingnan ang median na halaga at mga kwartil. Maaari itong ipakita gamit ang isang **box plot**:\n"
]
},
{
@ -136,7 +136,7 @@
"outputs": [],
"source": [
"plt.figure(figsize=(10,2))\n",
"plt.boxplot(df['Height'].ffill(), vert=False, showmeans=True)\n",
"plt.boxplot(df['Height'].ffill(), orientation='horizontal', showmeans=True)\n",
"plt.grid(color='gray', linestyle='dotted')\n",
"plt.tight_layout()\n",
"plt.show()"
@ -146,7 +146,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Maaari rin tayong gumawa ng mga box plot ng mga subset ng ating dataset, halimbawa, na pinag-grupo ayon sa papel ng manlalaro.\n"
"Maaari rin tayong gumawa ng mga box plot ng mga subset ng ating dataset, halimbawa, naka-grupo ayon sa papel ng manlalaro.\n"
]
},
{
@ -165,9 +165,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Nota**: Ipinapahiwatig ng diagram na ito, na sa karaniwan, mas mataas ang tangkad ng mga first basemen kaysa sa mga second basemen. Sa susunod ay malalaman natin kung paano natin masusubukan ang hypothesis na ito nang mas pormal, at kung paano ipapakita na ang ating datos ay estadistikang mahalaga upang patunayan iyon. \n",
"> **Tandaan**: Ipinapakita ng diagram na ito, na sa karaniwan, ang taas ng mga unang baseman ay mas mataas kaysa sa taas ng mga pangalawang baseman. Mamaya ay malalaman natin kung paano natin masusubukan ang hipotesis na ito ng mas pormal, at kung paano ipapakita na ang ating data ay estadistikal na mahalaga para ipakita iyon. \n",
"\n",
"Ang edad, tangkad, at timbang ay lahat ng mga tuloy-tuloy na random na variable. Ano sa tingin mo ang kanilang distribusyon? Isang magandang paraan upang malaman ay ang iguhit ang histogram ng mga halaga: \n"
"Ang edad, taas, at timbang ay lahat ng tuloy-tuloy na random na mga variable. Ano sa palagay mo ang kanilang distribusyon? Isang magandang paraan para malaman ito ay ang pag-plot ng histogram ng mga halaga: \n"
]
},
{
@ -188,9 +188,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Normal Distribution\n",
"## Normal na Distribusyon\n",
"\n",
"Gumawa tayo ng isang artipisyal na sample ng mga timbang na sumusunod sa normal na distribusyon na may parehong mean at variance tulad ng sa totoong data natin:\n"
"Gumawa tayo ng artipisyal na sample ng mga timbang na sumusunod sa normal na distribusyon na may parehong mean at variance tulad ng sa ating totoong datos:\n"
]
},
{
@ -231,7 +231,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dahil karamihan sa mga halaga sa totoong buhay ay karaniwang naipapamahagi, hindi natin dapat gamitin ang isang pantay-pantay na random number generator upang makabuo ng sample data. Ganito ang nangyayari kung susubukan nating gumawa ng mga timbang gamit ang isang pantay na pamamahagi (na ginawa gamit ang `np.random.rand`):\n"
"Dahil karamihan sa mga halaga sa totoong buhay ay karaniwang nakapamahagi, hindi natin dapat gamitin ang isang uniform random number generator upang bumuo ng sample data. Narito ang nangyayari kung susubukan nating bumuo ng mga timbang na may uniform na pamamahagi (ginawa gamit ang `np.random.rand`):\n"
]
},
{
@ -251,9 +251,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Confidence Intervals\n",
"## Mga Interval ng Kumpiyansa\n",
"\n",
"Ngayon ay kalkulahin natin ang mga confidence interval para sa mga timbang at taas ng mga manlalaro ng baseball. Gagamitin natin ang code [mula sa talakayan sa stackoverflow na ito](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
"Ngayon ay kalkulahin natin ang mga interval ng kumpiyansa para sa mga timbang at taas ng mga manlalaro ng baseball. Gagamitin natin ang code [mula sa diskusyong ito sa stackoverflow](https://stackoverflow.com/questions/15033511/compute-a-confidence-interval-from-sample-data):\n"
]
},
{
@ -272,7 +272,7 @@
" return m, h\n",
"\n",
"for p in [0.85, 0.9, 0.95]:\n",
" m, h = mean_confidence_interval(df['Weight'].fillna(method='pad'),p)\n",
" m, h = mean_confidence_interval(df['Weight'].ffill(),p)\n",
" print(f\"p={p:.2f}, mean = {m:.2f} ± {h:.2f}\")"
]
},
@ -282,7 +282,7 @@
"source": [
"## Pagsusuri ng Hipotesis\n",
"\n",
"Tuklasin natin ang iba't ibang mga papel sa aming dataset ng mga manlalaro ng baseball:\n"
"Tuklasin natin ang iba't ibang tungkulin sa ating dataset ng mga manlalaro ng baseball:\n"
]
},
{
@ -298,7 +298,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Subukan natin ang hipotesis na mas matangkad ang mga First Basemen kaysa mga Second Basemen. Ang pinakasimpleng paraan upang gawin ito ay subukan ang mga confidence intervals:\n"
"Subukan natin ang hipotesis na mas matangkad ang mga First Basemen kaysa sa mga Second Basemen. Ang pinakamadaling paraan para gawin ito ay subukan ang confidence intervals:\n"
]
},
{
@ -317,9 +317,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Makikita natin na ang mga interval ay hindi nag-o-overlap.\n",
"Makikita natin na ang mga interval ay hindi magkapatong.\n",
"\n",
"Isang mas estadistikang tamang paraan upang patunayan ang hipotesis ay ang paggamit ng **Student t-test**:\n"
"Isang mas estadistikal na tamang paraan upang patunayan ang hypothesis ay ang paggamit ng **Student t-test**:\n"
]
},
{
@ -338,18 +338,18 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ang dalawang halaga na ibinabalik ng function na `ttest_ind` ay:\n",
"* Ang p-value ay maaaring ituring bilang ang posibilidad na ang dalawang distribusyon ay may parehong mean. Sa aming kaso, ito ay napakababa, na nangangahulugang may malakas na ebidensya na sumusuporta na ang mga first basemen ay mas matangkad.\n",
"* Ang t-value ay ang panggitnang halaga ng na-normalize na pagkakaiba ng mean na ginagamit sa t-test, at ito ay ihinahambing sa isang threshold value para sa isang ibinigay na halaga ng kumpiyansa.\n"
"Ang dalawang halaga na ibinabalik ng `ttest_ind` na function ay:\n",
"* Ang p-value ay maaaring ituring bilang posibilidad na ang dalawang distribusyon ay may parehong mean. Sa ating kaso, ito ay napakababa, na nangangahulugang may malakas na ebidensya na sumusuporta na mas matangkad ang mga first basemen.\n",
"* Ang t-value ay ang panggitnang halaga ng normalisadong diperensya ng mean na ginamit sa t-test, at ito ay ihinahambing laban sa isang threshold value para sa isang ibinigay na halaga ng kumpiyansa.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pagsasalarawan ng Normal na Distribusyon gamit ang Central Limit Theorem\n",
"## Pagsasagawa ng Simulasyon ng Normal na Distribusyon gamit ang Central Limit Theorem\n",
"\n",
"Ang pseudo-random generator sa Python ay idinisenyo upang magbigay sa atin ng pantay-pantay na distribusyon. Kung nais nating gumawa ng generator para sa normal na distribusyon, maaari nating gamitin ang central limit theorem. Upang makakuha ng isang normal na distributed na halaga, kukunin lang natin ang mean ng isang sample na ginawa gamit ang uniform na distribusyon.\n"
"Ang pseudo-random generator sa Python ay dinisenyo upang magbigay sa atin ng uniform na distribusyon. Kung nais nating gumawa ng generator para sa normal na distribusyon, maaari nating gamitin ang central limit theorem. Upang makuha ang isang normal na distribusyon na halaga, kakalkulahin lang natin ang mean ng isang sample na ginawa gamit ang uniform distribution.\n"
]
},
{
@ -373,9 +373,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Correlation at Evil Baseball Corp\n",
"## Korelasyon at Masamang Baseball Corp\n",
"\n",
"Pinapahintulutan tayo ng correlation na makita ang mga relasyon sa pagitan ng mga sunud-sunod na datos. Sa aming halimbawa, magpalagay tayo na may isang masamang kumpanya ng baseball na nagbabayad sa mga manlalaro nito ayon sa kanilang taas - kung mas matangkad ang manlalaro, mas malaki ang perang matatanggap niya. Ipagpalagay na may base salary na $1000, at karagdagang bonus mula $0 hanggang $100, depende sa taas. Kukuhanin natin ang mga totoong manlalaro mula sa MLB, at kakalkulahin ang kanilang mga imahinaryong sweldo:\n"
"Pinapayagan tayo ng korelasyon na mahanap ang mga relasyon sa pagitan ng mga pagkakasunod-sunod ng datos. Sa aming halimbawa, magpanggap tayo na mayroong isang masamang korporasyon ng baseball na nagbabayad sa mga manlalaro nito batay sa kanilang taas - kung mas matangkad ang manlalaro, mas malaki ang kanyang kinikita. Ipagpalagay na may pangunahing sahod na $1000, at karagdagang bonus mula $0 hanggang $100, depende sa taas. Gagamitin natin ang totoong mga manlalaro mula sa MLB, at kakalkulahin ang kanilang imahinaryong mga sahod:\n"
]
},
{
@ -384,7 +384,7 @@
"metadata": {},
"outputs": [],
"source": [
"heights = df['Height'].fillna(method='pad')\n",
"heights = df['Height'].ffill()\n",
"salaries = 1000+(heights-heights.min())/(heights.max()-heights.mean())*100\n",
"print(list(zip(heights, salaries))[:10])"
]
@ -393,7 +393,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ngayon ay kwentahin natin ang covariance at correlation ng mga sequences na iyon. Ang `np.cov` ay magbibigay sa atin ng tinatawag na **covariance matrix**, na isang pagpapalawak ng covariance sa maraming variable. Ang elementong $M_{ij}$ ng covariance matrix na $M$ ay isang correlation sa pagitan ng mga input variable na $X_i$ at $X_j$, at ang mga diagonal na halaga na $M_{ii}$ ay ang variance ng $X_{i}$. Katulad nito, ang `np.corrcoef` ay magbibigay sa atin ng **correlation matrix**.\n"
"Ngayon ay kakalkulahin natin ang covariance at correlation ng mga sekwensyang iyon. Ang `np.cov` ay magbibigay sa atin ng tinatawag na **covariance matrix**, na isang extension ng covariance sa maraming variable. Ang elementong $M_{ij}$ ng covariance matrix na $M$ ay isang correlation sa pagitan ng mga input variable na $X_i$ at $X_j$, at ang mga diagonal na halaga na $M_{ii}$ ay ang variance ng $X_{i}$. Katulad nito, ang `np.corrcoef` ay magbibigay sa atin ng **correlation matrix**.\n"
]
},
{
@ -411,7 +411,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ang isang correlation na katumbas ng 1 ay nangangahulugan na mayroong malakas na **linear na ugnayan** sa pagitan ng dalawang variable. Makikita natin nang biswal ang linear na ugnayan sa pamamagitan ng pag-plot ng isang halaga laban sa isa pa:\n"
"Ang korrelasyon na pantay sa 1 ay nangangahulugan na may malakas na **linear na ugnayan** sa pagitan ng dalawang variable. Makikita natin nang biswal ang linear na ugnayan sa pamamagitan ng pag-plot ng isang halaga laban sa isa pa:\n"
]
},
{
@ -430,7 +430,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Tingnan natin kung ano ang mangyayari kung ang relasyon ay hindi linear. Ipagpalagay na ang aming korporasyon ay nagpasya na itago ang maliwanag na linear na ugnayan sa pagitan ng mga taas at suweldo, at nagpakilala ng ilang non-linearity sa pormula, tulad ng `sin`:\n"
"Tingnan natin kung ano ang mangyayari kung ang relasyon ay hindi linear. Ipagpalagay natin na ang ating korporasyon ay nagpasya na itago ang halatang linear na ugnayan sa pagitan ng mga taas at mga sahod, at nagpakilala ng ilang non-linearidad sa formula, tulad ng `sin`:\n"
]
},
{
@ -447,7 +447,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sa kasong ito, medyo mas maliit ang korelasyon, pero ito ay nananatiling medyo mataas. Ngayon, para gawing mas hindi halata ang relasyon, maaaring gusto nating magdagdag ng dagdag na randomness sa pamamagitan ng pagdagdag ng isang random na variable sa suweldo. Tingnan natin kung ano ang mangyayari:\n"
"Sa kasong ito, ang korelasyon ay bahagyang mas maliit, ngunit ito ay mataas pa rin. Ngayon, upang gawing mas hindi halata ang relasyon, maaaring nais nating magdagdag ng karagdagang random na variable sa sahod. Tingnan natin kung ano ang mangyayari:\n"
]
},
{
@ -476,9 +476,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> Mahuhulaan mo ba kung bakit ang mga tuldok ay nakahanay sa mga patayong linya tulad nito?\n",
"> Mahulaan mo ba kung bakit ang mga tuldok ay pumila sa patayo na mga linya tulad nito?\n",
"\n",
"Napansin natin ang ugnayan sa pagitan ng isang artipisyal na nilikhang konsepto tulad ng sahod at ang naobserbahang variable na *taas*. Tingnan din natin kung nagkakaugnay ang dalawang naobserbahang variable, tulad ng taas at bigat:\n"
"Napag-alaman natin ang ugnayan sa pagitan ng artipisyal na inhenyerong konsepto tulad ng sahod at ng naobserbahang baryabol *taas*. Tingnan din natin kung nagkakaugnay ang dalawang naobserbahang baryabol, tulad ng taas at bigat:\n"
]
},
{
@ -494,11 +494,11 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Sa kasamaang palad, wala kaming nakuha na mga resulta - puro kakaibang mga `nan` na halaga lamang. Ito ay dahil ang ilan sa mga halaga sa aming serye ay hindi natukoy, na kinakatawan bilang `nan`, na nagdudulot na ang resulta ng operasyon ay hindi rin natukoy. Sa pagtingin sa matrix makikita natin na ang `Weight` ang problemadong column, dahil ang self-correlation sa pagitan ng mga halaga ng `Height` ay na-kompyut.\n",
"Sa kasamaang palad, wala kaming nakuha na resulta - puro kakaibang `nan` na mga halaga lamang. Ito ay dahil ang ilan sa mga halaga sa aming serye ay hindi naitakda, na kinakatawan bilang `nan`, na nagdudulot ng resulta ng operasyon na maging hindi rin naitakda. Sa pamamagitan ng pagtingin sa matrix makikita natin na ang `Weight` ang problemadong kolum, dahil ang self-correlation sa pagitan ng mga halagang `Height` ang nakalkula.\n",
"\n",
"> Ipinapakita ng halimbawa na ito ang kahalagahan ng **paghahanda ng data** at **paglilinis**. Kung walang tamang data hindi tayo makakakompyut ng anuman.\n",
"> Ipinapakita ng halimbawang ito ang kahalagahan ng **paghahanda ng datos** at **paglilinis**. Kung walang tamang datos, hindi tayo makakakalkula ng kahit ano.\n",
"\n",
"Gamitin natin ang `fillna` na pamamaraan upang punan ang nawawalang mga halaga, at kompyutin ang correlation:\n"
"Gamitin natin ang `fillna` na metodo para punan ang mga nawawalang halaga, at kalkulahin ang correlation:\n"
]
},
{
@ -507,14 +507,14 @@
"metadata": {},
"outputs": [],
"source": [
"np.corrcoef(df['Height'].fillna(method='pad'), df['Weight'])"
"np.corrcoef(df['Height'].ffill(), df['Weight'])"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"Talaga namang may ugnayan, ngunit hindi kasing lakas tulad ng sa aming artipisyal na halimbawa. Sa katunayan, kung titingnan natin ang scatter plot ng isang halaga laban sa isa pa, ang relasyon ay magiging hindi gaanong halata:\n"
"Mayroon ngang ugnayan, ngunit hindi kasing lakas ng sa ating gawa-gawang halimbawa. Sa katunayan, kung titingnan natin ang scatter plot ng isang halaga laban sa isa pa, ang relasyon ay magiging hindi gaanong halata:\n"
]
},
{
@ -537,14 +537,14 @@
"source": [
"## Konklusyon\n",
"\n",
"Sa notebook na ito natutunan natin kung paano magsagawa ng mga pangunahing operasyon sa data upang makalkula ang mga estadistikal na punsyon. Ngayon ay alam na natin kung paano gamitin ang isang matibay na kagamitan ng matematika at estadistika upang patunayan ang ilang mga hipotesis, at kung paano kalkulahin ang mga confidence interval para sa mga arbitraryong variable batay sa isang sample ng data.\n"
"Sa notebook na ito ay natutunan natin kung paano magsagawa ng mga pangunahing operasyon sa data upang makalkula ang mga estadistikang function. Ngayon ay alam na natin kung paano gamitin ang matibay na kasangkapan ng matematika at estadistika upang patunayan ang ilang mga hipotesis, at kung paano kalkulahin ang confidence intervals para sa iba't ibang variable batay sa isang sample ng data.\n"
]
},
{
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Paunawa**:\nAng dokumentong ito ay isinalin gamit ang AI translation service na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagamat sinisikap naming maging tumpak, pakatandaan na ang mga awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o kamalian. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pinagmumulan ng katotohanan. Para sa mga mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang hindi pagkakaunawaan o maling interpretasyon na maaaring mangyari mula sa paggamit ng pagsasaling ito.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Pagtatanggi**:\nAng dokumentong ito ay isinalin gamit ang serbisyo ng AI translation na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't nagsusumikap kami para sa katumpakan, pakatandaan na ang awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pangunahing sanggunian. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang maling pagkakaintindi o maling interpretasyon na nagmula sa paggamit ng pagsasaling ito.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],
@ -568,12 +568,6 @@
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.9.6"
},
"coopTranslator": {
"original_hash": "0f899e3c5019f948e7c787b22f3b2304",
"translation_date": "2026-01-16T17:40:36+00:00",
"source_file": "1-Introduction/04-stats-and-probability/notebook.ipynb",
"language_code": "tl"
}
},
"nbformat": 4,

@ -6,9 +6,9 @@
"source": [
"# Pagtataya ng Pandemya ng COVID-19\n",
"\n",
"## Pag-load ng Datos\n",
"## Pag-load ng Data\n",
"\n",
"Gagamitin natin ang datos tungkol sa mga indibidwal na nahawaan ng COVID-19, na ibinigay ng [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) sa [Johns Hopkins University](https://jhu.edu/). Ang dataset ay makukuha sa [GitHub Repository na ito](https://github.com/CSSEGISandData/COVID-19).\n"
"Gagamitin natin ang datos ng mga taong nahawaan ng COVID-19, na ibinigay ng [Center for Systems Science and Engineering](https://systems.jhu.edu/) (CSSE) sa [Johns Hopkins University](https://jhu.edu/). Ang dataset ay makukuha sa [this GitHub Repository](https://github.com/CSSEGISandData/COVID-19).\n"
]
},
{
@ -27,7 +27,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Maaari nating i-load ang pinakabagong datos nang direkta mula sa GitHub gamit ang `pd.read_csv`. Kung sa anumang dahilan ay hindi available ang datos, maaari mong gamitin ang kopya na makikita lokal sa folder na `data` - i-uncomment lamang ang linya sa ibaba na nagtatakda ng `base_url`:\n"
"Maaari nating i-load ang pinaka-bagong datos nang direkta mula sa GitHub gamit ang `pd.read_csv`. Kung sa anumang dahilan ay hindi available ang datos, maaari mo palaging gamitin ang kopya na naka-lokal sa `data` na folder - i-uncomment lamang ang linya sa ibaba na nagdedefine ng `base_url`:\n"
]
},
{
@ -48,7 +48,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ngayon ay i-load natin ang datos para sa mga nahawaan at tingnan kung paano ang itsura ng datos:\n"
"I-load na natin ngayon ang datos para sa mga nahawaang indibidwal at tingnan kung ano ang itsura ng datos:\n"
]
},
{
@ -265,7 +265,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Makikita natin na bawat hilera ng talahanayan ay nagtatakda ng bilang ng mga nahawang indibidwal para sa bawat bansa at/o lalawigan, at ang mga kolum ay tumutugon sa mga petsa. Maaaring mag-load ng mga katulad na talahanayan para sa ibang datos, tulad ng bilang ng mga gumaling at bilang ng mga namatay.\n"
"Makikita natin na ang bawat hilera ng talaan ay nagtatakda ng bilang ng mga nahawang indibidwal para sa bawat bansa at/o lalawigan, at ang mga kolum ay tumutukoy sa mga petsa. Maaaring i-load ang magkaparehong mga talaan para sa iba pang data, tulad ng bilang ng mga gumaling at bilang ng mga namatay.\n"
]
},
{
@ -282,9 +282,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pag-unawa sa Data\n",
"## Pag-unawa sa mga Datos\n",
"\n",
"Mula sa talahanayan sa itaas, hindi malinaw ang papel ng kolum na lalawigan. Tingnan natin ang iba't ibang mga halaga na naroroon sa kolum na `Province/State`:\n"
"Mula sa talahanayan sa itaas, hindi malinaw ang papel ng kolum na probinsya. Tingnan natin ang iba't ibang mga halaga na nasa kolum na `Province/State`:\n"
]
},
{
@ -322,7 +322,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Mula sa mga pangalan, maaari nating matukoy na ang mga bansa tulad ng Australia at China ay may mas detalyadong paghahati-hati ayon sa mga lalawigan. Tingnan natin ang impormasyon tungkol sa China upang makita ang halimbawa:\n"
"Mula sa mga pangalan ay maaari nating mahinuha na ang mga bansa tulad ng Australia at China ay may mas detalyadong paghahati-hati ayon sa mga lalawigan. Tingnan natin ang impormasyon tungkol sa China upang makita ang halimbawa:\n"
]
},
{
@ -1321,9 +1321,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pre-processing the Data \n",
"## Pre-processing ang Data\n",
"\n",
"Hindi kami interesado sa paghahati ng mga bansa sa mga karagdagang teritoryo, kaya't unang aalisin muna namin ang paghahating ito at pagsasamahin ang impormasyon sa lahat ng teritoryo upang makuha ang impormasyon para sa buong bansa. Magagawa ito gamit ang `groupby`:\n"
"Hindi kami interesado na hatiin pa ang mga bansa sa mas maliliit pang teritoryo, kaya una naming aalisin ang paghahati na ito at pagsasamahin ang impormasyon ng lahat ng teritoryo, para makuha ang impormasyon para sa buong bansa. Maaari itong gawin gamit ang `groupby`:\n"
]
},
{
@ -1578,7 +1578,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Makikita mo na dahil sa paggamit ng `groupby` lahat ng DataFrames ay naka-index na ayon sa Country/Region. Kaya natin ma-access ang data para sa isang partikular na bansa gamit ang `.loc`:|\n"
"Makikita mo na dahil sa paggamit ng `groupby`, lahat ng DataFrames ay naka-index na ngayon ayon sa Bansa/Rehiyon. Maaari nating ma-access ang data para sa isang partikular na bansa gamit ang `.loc`:|\n"
]
},
{
@ -1607,7 +1607,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"> **Tandaan** kung paano natin ginagamit ang `[3:]` upang alisin ang unang tatlong elemento ng isang sunod-sunod na naglalaman ng metadata na hindi petsa (ang mga kolum na Lalawigan/Estado at heolohikal na lokasyon). Maaari rin nating alisin nang buo ang tatlong kolum na iyon:\n"
"> **Tandaan** kung paano namin ginagamit ang `[3:]` upang alisin ang unang tatlong elemento ng isang pagkakasunod-sunod na naglalaman ng non-date metadata (ang mga kolum ng Lalawigan/Estado at geolocation). Maaari rin naming alisin ang tatlong kolum na iyon nang buo:\n"
]
},
{
@ -1625,9 +1625,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"## Pagsisiyasat sa Data\n",
"## Pagsisiyasat sa Datos\n",
"\n",
"Lumipat tayo ngayon sa pagsisiyasat ng isang partikular na bansa. Gumawa tayo ng isang frame na naglalaman ng data ng mga impeksyon na naka-index ayon sa petsa:\n"
"Lumipat tayo ngayon sa pagsisiyasat ng isang partikular na bansa. Gumawa tayo ng isang frame na naglalaman ng datos tungkol sa mga impeksyon na naka-index ayon sa petsa:\n"
]
},
{
@ -1793,7 +1793,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Ngayon tukuyin natin ang bilang ng mga bagong nahawa bawat araw. Papayagan tayo nitong makita ang bilis ng pag-usad ng pandemya. Ang pinakamadaling paraan upang gawin ito ay gamitin ang `diff`:\n"
"Ngayon kalkulahin natin ang bilang ng mga bagong nahawaang tao bawat araw. Papayagan tayo nitong makita ang bilis kung saan umuunlad ang pandemya. Ang pinakamadaling paraan upang gawin ito ay ang paggamit ng `diff`:\n"
]
},
{
@ -1823,7 +1823,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Makikita natin ang malalaking pagbabago sa datos. Tingnan natin nang mas mabuti ang isa sa mga buwan:\n"
"Makikita natin ang mataas na pagbabago sa datos. Tingnan natin ng mas malapitan ang isa sa mga buwan:\n"
]
},
{
@ -1852,7 +1852,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Malinaw na mukhang may lingguhang pagbabago-bago sa datos. Dahil nais nating makita ang mga trend, makatuwiran na paliitin ang kurba sa pamamagitan ng pagkalkula ng tumatakbong average (ibig sabihin, para sa bawat araw kakalkulahin natin ang average na halaga ng mga nakaraang ilang araw):\n"
"Maliwanag na may mga lingguhang pagbabago-bago sa datos. Dahil gusto nating makita ang mga uso, makatuwiran na pakinisin ang kurba sa pamamagitan ng pagkukuwenta ng karaniwang halaga habang tumatakbo (ibig sabihin para sa bawat araw, kukuwentahin natin ang karaniwang halaga ng mga nakaraang ilang araw):\n"
]
},
{
@ -1882,7 +1882,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Upang makapagkumpara ng ilang mga bansa, maaaring gusto nating isaalang-alang ang populasyon ng bansa, at ihambing ang porsyento ng mga nahawaang indibidwal kaugnay sa populasyon ng bansa. Upang makuha ang populasyon ng bansa, i-load natin ang dataset ng mga bansa:\n"
"Upang makapagkumpara ng ilang bansa, maaaring gusto nating isaalang-alang ang populasyon ng bansa, at ikumpara ang porsyento ng mga nahawa base sa populasyon ng bansa. Upang makuha ang populasyon ng bansa, i-load natin ang dataset ng mga bansa:\n"
]
},
{
@ -2153,7 +2153,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dahil ang dataset na ito ay naglalaman ng impormasyon tungkol sa parehong mga bansa at mga lalawigan, upang makuha ang populasyon ng buong bansa kailangan nating maging medyo matalino:\n"
"Dahil ang dataset na ito ay naglalaman ng impormasyon tungkol sa parehong mga bansa at mga lalawigan, upang makuha ang populasyon ng buong bansa kailangan nating maging medyo maingat: \n"
]
},
{
@ -2261,14 +2261,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Pagkalkula ng $R_t$\n",
"\n",
"Upang makita kung gaano nakakahawa ang sakit, tinitingnan natin ang **basic reproduction number** $R_0$, na nagpapakita ng bilang ng mga tao na karagdagang mahahawa ng isang taong may impeksyon. Kapag ang $R_0$ ay higit sa 1, malamang na kumalat ang epidemya.\n",
"Upang makita kung gaano kaimpeksiyon ang sakit, tinitingnan natin ang **basic reproduction number** na $R_0$, na nagpapahiwatig ng bilang ng mga tao na mahahawa sa isang taong may impeksyon. Kapag ang $R_0$ ay higit sa 1, malamang na kumalat ang epidemya.\n",
"\n",
"Ang $R_0$ ay isang katangian ng sakit mismo, at hindi isinasaalang-alang ang ilang mga hakbang na proteksiyon na maaaring gawin ng mga tao upang pabagalin ang pandemya. Sa pag-usad ng pandemya, maaari nating tantyahin ang reproduction number $R_t$ sa anumang takdang oras $t$. Naipakita na ang numerong ito ay maaaring tantyahin nang medyo tama sa pamamagitan ng pagkuha ng window ng 8 araw, at pagkalkula ng $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"kung saan ang $I_t$ ay ang bilang ng mga bagong nahawang indibidwal sa araw ng $t$.\n",
"Ang $R_0$ ay isang katangian ng sakit mismo, at hindi isinasaalang-alang ang ilang mga hakbang sa proteksyon na maaaring gawin ng mga tao upang pabagalin ang pandemya. Sa pag-usad ng pandemya, maaari nating tantiyahin ang reproduction number $R_t$ sa anumang takdang oras $t$. Napag-alaman na ang bilang na ito ay maaaring tantiyahin sa pamamagitan ng pagkuha ng window ng 8 araw, at pagkalkula ng $$R_t=\\frac{I_{t-7}+I_{t-6}+I_{t-5}+I_{t-4}}{I_{t-3}+I_{t-2}+I_{t-1}+I_t}$$\n",
"kung saan ang $I_t$ ay ang bilang ng mga bagong nahawang indibidwal sa araw na $t$.\n",
"\n",
"Kalkulahin natin ang $R_t$ para sa ating datos ng pandemya. Upang gawin ito, kukuha tayo ng rolling window ng 8 `ninfected` na mga halaga, at ilalapat ang function upang kalkulahin ang ratio sa itaas:\n"
"Ating kalkulahin ang $R_t$ para sa ating datos ng pandemya. Upang gawin ito, gagamit tayo ng rolling window ng 8 na `ninfected` na halaga, at ilalapat ang punsiyon upang kalkulahin ang ratio sa itaas:\n"
]
},
{
@ -2298,9 +2299,9 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Makikita mo na may ilang puwang sa grap. Maaaring sanhi iyon ng `NaN`, o kung mayroong `inf` na mga halaga na nasa dataset. Ang `inf` ay maaaring sanhi ng paghahati sa 0, at ang `NaN` ay maaaring magpahiwatig ng nawawalang datos, o walang datos na magagamit upang makuha ang resulta (tulad noong umpisa ng aming frame, kung saan ang rolling window na may lapad na 8 ay hindi pa magagamit). Upang maging mas maganda ang grap, kailangan nating punan ang mga halagang iyon gamit ang `replace` at `fillna` na function.\n",
"Makikita mo na may ilang puwang sa grap. Maaaring sanhi iyon ng `NaN`, o kung may mga `inf` values na naroroon sa dataset. Ang `inf` ay maaaring sanhi ng paghahati sa 0, at ang `NaN` ay maaaring magsabi ng nawawalang datos, o walang datos na magagamit upang kalkulahin ang resulta (tulad sa simula ng ating frame, kung saan ang rolling window na may lapad na 8 ay hindi pa available). Upang maging mas maganda ang grap, kailangan nating punan ang mga halagang iyon gamit ang `replace` at `fillna` na function.\n",
"\n",
"Tingnan natin nang mas malalim ang simula ng pandemya. Ililimitahan din natin ang mga halaga sa y-axis upang ipakita lamang ang mga halagang mas mababa sa 6, upang makita nang mas malinaw, at magdadagdag ng pahalang na linya sa 1.\n"
"Tingnan natin nang mas malapit ang simula ng pandemya. Ililimita rin natin ang mga value ng y-axis upang ipakita lamang ang mga value na mas mababa sa 6, para mas makita ng mas maayos, at iguhit ang isang pahalang na linya sa 1.\n"
]
},
{
@ -2331,7 +2332,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Isa pang kawili-wiling palatandaan ng pandemya ay ang **derivative**, o **pang-araw-araw na pagkakaiba** sa mga bagong kaso. Pinapahintulutan tayo nitong malinaw na makita kung kailan tumataas o bumababa ang pandemya.\n"
"Isa pang kawili-wiling palatandaan ng pandemya ay ang **derivative**, o **araw-araw na pagkakaiba** sa mga bagong kaso. Pinapayagan tayo nitong makita nang malinaw kung kailan tumataas o bumababa ang pandemya. \n"
]
},
{
@ -2360,7 +2361,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"Dahil sa maraming pagbabago-bago sa datos na sanhi ng pag-uulat, makatuwiran na patagalin ang kurba sa pamamagitan ng pagpapatakbo ng rolling average upang makuha ang kabuuang larawan. Muli nating ituon ang pansin sa unang mga buwan ng pandemya:\n"
"Dahil sa maraming pagbabago-bago sa datos na dulot ng pagrereport, makatuwiran na i-smooth ang kurba sa pamamagitan ng paggamit ng rolling average upang makuha ang pangkalahatang larawan. Muli tayong magtuon sa unang mga buwan ng pandemya:\n"
]
},
{
@ -2390,14 +2391,15 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"\n",
"## Hamon\n",
"\n",
"Ngayon ay oras na para mas maglaro ka pa gamit ang code at datos! Narito ang ilang suhestiyon na maaari mong subukan:\n",
"Ngayon ay oras na para mas maglaro ka pa gamit ang code at data! Narito ang ilang mungkahi na maaari mong subukan:\n",
"* Tingnan ang pagkalat ng pandemya sa iba't ibang bansa.\n",
"* Gumuhit ng mga grap ng $R_t$ para sa ilang bansa sa isang graph para sa paghahambing, o gumawa ng ilang mga graph na magkakatabi\n",
"* Tingnan kung paano nagkakaugnay ang bilang ng mga namatay at gumaling sa bilang ng mga kaso ng impeksyon.\n",
"* Subukang alamin kung gaano katagal karaniwang tumatagal ang sakit sa pamamagitan ng biswal na pag-uugnay ng rate ng impeksyon at rate ng namatay at paghahanap ng ilang anomalyas. Maaaring kailangan mong tingnan ang iba't ibang bansa para malaman iyon.\n",
"* Kalkulahin ang fatality rate at kung paano ito nagbabago sa paglipas ng panahon. Maaring gusto mong isaalang-alang ang haba ng sakit sa mga araw upang i-shift ang isang time series bago gawin ang mga kalkulasyon\n"
"* I-plot ang mga graph ng $R_t$ para sa ilang mga bansa sa isang plot para sa paghahambing, o gumawa ng ilang mga plot na magkatabi\n",
"* Tingnan kung paano nagkakaugnay ang bilang ng mga namatay at gumaling sa bilang ng mga nahawaang kaso.\n",
"* Subukang alamin kung gaano katagal karaniwang tumatagal ang isang sakit sa pamamagitan ng biswal na pag-uugnay ng rate ng impeksyon at rate ng kamatayan at paghahanap ng ilang anomalya. Maaaring kailanganin mong tingnan ang iba't ibang bansa upang malaman ito.\n",
"* Kalkulahin ang fatality rate at kung paano ito nagbabago sa paglipas ng panahon. Maaari mong isaalang-alang ang haba ng sakit sa mga araw upang i-shift ang isang time series bago gumawa ng mga kalkulasyon\n"
]
},
{
@ -2406,10 +2408,10 @@
"source": [
"## Mga Sanggunian\n",
"\n",
"Maaari kang tumingin sa mga karagdagang pag-aaral ng pagkalat ng epidemya ng COVID sa mga sumusunod na publikasyon:\n",
"* [Sliding SIR Model for Rt Estimation during COVID Pandemic](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blog post ni [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Estimation of Time-Dependent Reproduction Number for Global COVID-19 Outbreak](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Code para sa nasabing papel sa GitHub](https://github.com/shwars/SlidingSIR)\n"
"Maaari kang tumingin sa karagdagang mga pag-aaral tungkol sa pagkalat ng epidemya ng COVID sa mga sumusunod na publikasyon:\n",
"* [Sliding SIR Model para sa Pagtataya ng Rt sa panahon ng Pandemya ng COVID](https://soshnikov.com/science/sliding-sir-model-for-rt-estimation/), blog post ni [Dmitry Soshnikov](http://soshnikov.com)\n",
"* T.Petrova, D.Soshnikov, A.Grunin. [Pagtataya ng Pampanahong Bilang ng Reproduksiyon para sa Pandaigdigang Pagsiklab ng COVID-19](https://www.preprints.org/manuscript/202006.0289/v1). *Preprints* **2020**, 2020060289 (doi: 10.20944/preprints202006.0289.v1)\n",
"* [Kodigo para sa nasabing papel sa GitHub](https://github.com/shwars/SlidingSIR)\n"
]
},
{
@ -2423,7 +2425,7 @@
"cell_type": "markdown",
"metadata": {},
"source": [
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Pagsubli ng Paalala**:\nAng dokumentong ito ay naisalin gamit ang serbisyong pagsasalin ng AI na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagamat aming pinagsisikapang maging tumpak, mangyaring tandaan na maaaring magkaroon ng mga pagkakamali o di-tumpak na pagsasalin ang awtomatikong pagsasalin. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pinagkukunan ng katotohanan. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasaling-guro ng tao. Hindi kami mananagot sa anumang mga hindi pagkakaintindihan o maling interpretasyon na maaaring magmula sa paggamit ng pagsasaling ito.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**Pagtatanggi**:\nAng dokumentong ito ay isinalin gamit ang serbisyo ng AI translation na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't nagsusumikap kami para sa katumpakan, pakatandaan na ang awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pangunahing sanggunian. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang maling pagkakaintindi o maling interpretasyon na nagmula sa paggamit ng pagsasaling ito.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
]
}
],

@ -1,23 +1,23 @@
# Proyekto ng Pagpapakita ng Datos ng Dangerous Liaisons
# Projekto ng visualisasyon ng datos ng Dangerous Liaisons
Para makapagsimula, tiyakin na mayroon kang NPM at Node na tumatakbo sa iyong makina. I-install ang mga kinakailangang dependencies (npm install) at pagkatapos ay patakbuhin ang proyekto nang lokal (npm run serve):
Upang makapagsimula, kailangan mong tiyakin na mayroon kang NPM at Node **>=20.0.0** na tumatakbo sa iyong makina. I-install ang mga dependency (npm install) at pagkatapos ay patakbuhin ang proyekto nang lokal (npm run serve):
## Setup ng Proyekto
## Setup ng proyekto
```
npm install
```
### Nagko-compile at nagre-reload nang mabilis para sa development
### Nagko-compile at nagho-hot-reload para sa pag-develop
```
npm run serve
```
### Nagko-compile at nagmi-minify para sa production
### Nagko-compile at nagmi-minify para sa produksyon
```
npm run build
```
### Nagli-lint at nag-aayos ng mga file
### Nagla-lint at nag-aayos ng mga file
```
npm run lint
```
@ -27,5 +27,7 @@ Tingnan ang [Configuration Reference](https://cli.vuejs.org/config/).
---
**Paunawa**:
Ang dokumentong ito ay isinalin gamit ang AI translation service na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't sinisikap naming maging tumpak, tandaan na ang mga awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa kanyang katutubong wika ang dapat ituring na opisyal na sanggunian. Para sa mahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang hindi pagkakaunawaan o maling interpretasyon na maaaring magmula sa paggamit ng pagsasaling ito.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Pagtatanggi**:
Ang dokumentong ito ay isinalin gamit ang serbisyo ng AI translation na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't nagsusumikap kami para sa katumpakan, pakatandaan na ang awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pangunahing sanggunian. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang maling pagkakaintindi o maling interpretasyon na nagmula sa paggamit ng pagsasaling ito.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->

@ -1,13 +1,13 @@
# Proyekto sa Pagpapakita ng Datos ng Dangerous Liaisons
# Proyektong visualisasyon ng data ng Dangerous Liaisons
Para makapagsimula, tiyakin na naka-install ang NPM at Node sa iyong makina. I-install ang mga kinakailangang dependencies (npm install) at pagkatapos ay patakbuhin ang proyekto nang lokal (npm run serve):
Upang makapagsimula, kailangan mong tiyakin na mayroon kang NPM at Node **>=20.0.0** na tumatakbo sa iyong makina. I-install ang mga dependencies (npm install) at pagkatapos ay patakbuhin ang proyekto nang lokal (npm run serve):
## Setup ng Proyekto
```
npm install
```
### Nagko-compile at nagre-reload nang mabilis para sa development
### Nagko-compile at nagre-reload nang mainit para sa development
```
npm run serve
```
@ -17,7 +17,7 @@ npm run serve
npm run build
```
### Nagli-lint at nag-aayos ng mga file
### Naglilinis at nag-aayos ng mga files
```
npm run lint
```
@ -27,5 +27,7 @@ Tingnan ang [Configuration Reference](https://cli.vuejs.org/config/).
---
**Paunawa**:
Ang dokumentong ito ay isinalin gamit ang AI translation service na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't sinisikap naming maging tumpak, tandaan na ang mga awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa kanyang katutubong wika ang dapat ituring na opisyal na sanggunian. Para sa mahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang hindi pagkakaunawaan o maling interpretasyon na maaaring magmula sa paggamit ng pagsasaling ito.
<!-- CO-OP TRANSLATOR DISCLAIMER START -->
**Pagtatanggi**:
Ang dokumentong ito ay isinalin gamit ang serbisyo ng AI translation na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagama't nagsusumikap kami para sa katumpakan, pakatandaan na ang awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o hindi pagkakatugma. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pangunahing sanggunian. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasalin ng tao. Hindi kami mananagot sa anumang maling pagkakaintindi o maling interpretasyon na nagmula sa paggamit ng pagsasaling ito.
<!-- CO-OP TRANSLATOR DISCLAIMER END -->
Loading…
Cancel
Save