You can not select more than 25 topics
Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
4244 lines
163 KiB
4244 lines
163 KiB
{
|
|
"cells": [
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "rQ8UhzFpgRra"
|
|
},
|
|
"source": [
|
|
"# ಡೇಟಾ ತಯಾರಿ\n",
|
|
"\n",
|
|
"[ಮೂಲ ನೋಟ್ಬುಕ್ ಮೂಲ *ಡೇಟಾ ಸೈನ್ಸ್: ಪೈಥಾನ್ ಮತ್ತು ಮೆಷಿನ್ ಲರ್ನಿಂಗ್ ಸ್ಟುಡಿಯೋಗೆ ಡೇಟಾ ಸೈನ್ಸ್ಗೆ ಮೆಷಿನ್ ಲರ್ನಿಂಗ್ ಪರಿಚಯ* ಲೀ ಸ್ಟಾಟ್ ಅವರಿಂದ](https://github.com/leestott/intro-Datascience/blob/master/Course%20Materials/4-Cleaning_and_Manipulating-Reference.ipynb)\n",
|
|
"\n",
|
|
"## `DataFrame` ಮಾಹಿತಿಯನ್ನು ಅನ್ವೇಷಿಸುವುದು\n",
|
|
"\n",
|
|
"> **ಕಲಿಕೆಯ ಗುರಿ:** ಈ ಉಪವಿಭಾಗದ ಕೊನೆಯಲ್ಲಿ, pandas DataFrames ನಲ್ಲಿ ಸಂಗ್ರಹಿಸಲಾದ ಡೇಟಾ ಬಗ್ಗೆ ಸಾಮಾನ್ಯ ಮಾಹಿತಿಯನ್ನು ಕಂಡುಹಿಡಿಯಲು ನೀವು ಆರಾಮದಾಯಕವಾಗಿರಬೇಕು.\n",
|
|
"\n",
|
|
"ನೀವು ನಿಮ್ಮ ಡೇಟಾವನ್ನು pandas ಗೆ ಲೋಡ್ ಮಾಡಿದ ನಂತರ, ಅದು ಬಹುಶಃ `DataFrame` ಆಗಿರುತ್ತದೆ. ಆದಾಗ್ಯೂ, ನಿಮ್ಮ `DataFrame` ನಲ್ಲಿ 60,000 ಸಾಲುಗಳು ಮತ್ತು 400 ಕಾಲಮ್ಗಳು ಇದ್ದರೆ, ನೀವು ಯಾವ ರೀತಿಯಲ್ಲಿ ನೀವು ಕೆಲಸ ಮಾಡುತ್ತಿರುವುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಪ್ರಾರಂಭಿಸುತ್ತೀರಿ? ಭಾಗ್ಯವಶಾತ್, pandas ಕೆಲವು ಅನುಕೂಲಕರ ಸಾಧನಗಳನ್ನು ಒದಗಿಸುತ್ತದೆ, ಇದು `DataFrame` ಬಗ್ಗೆ ಒಟ್ಟು ಮಾಹಿತಿಯನ್ನು ಮತ್ತು ಮೊದಲ ಕೆಲವು ಮತ್ತು ಕೊನೆಯ ಕೆಲವು ಸಾಲುಗಳನ್ನು ತ್ವರಿತವಾಗಿ ನೋಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಈ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅನ್ವೇಷಿಸಲು, ನಾವು Python scikit-learn ಗ್ರಂಥಾಲಯವನ್ನು ಆಮದುಮಾಡಿ ಮತ್ತು ಪ್ರತಿಯೊಬ್ಬ ಡೇಟಾ ವಿಜ್ಞಾನಿಯೂ ನೂರಾರು ಬಾರಿ ನೋಡಿರುವ ಐಕಾನಿಕ್ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಬಳಸುತ್ತೇವೆ: ಬ್ರಿಟಿಷ್ ಜೀವಶಾಸ್ತ್ರಜ್ಞ ರೋನಾಲ್ಡ್ ಫಿಶರ್ ಅವರ *Iris* ಡೇಟಾ ಸೆಟ್, 1936 ರಲ್ಲಿ ಅವರ \"The use of multiple measurements in taxonomic problems\" ಎಂಬ ಪತ್ರಿಕೆಯಲ್ಲಿ ಬಳಸಲಾದದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 1,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "hB1RofhdgRrp",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"import pandas as pd\n",
|
|
"from sklearn.datasets import load_iris\n",
|
|
"\n",
|
|
"iris = load_iris()\n",
|
|
"iris_df = pd.DataFrame(data=iris['data'], columns=iris['feature_names'])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "AGA0A_Y8hMdz"
|
|
},
|
|
"source": [
|
|
"### `DataFrame.shape`\n",
|
|
"ನಾವು Iris Dataset ಅನ್ನು `iris_df` ಎಂಬ ಚರದಲ್ಲಿ ಲೋಡ್ ಮಾಡಿದ್ದೇವೆ. ಡೇಟಾದೊಳಗೆ ಮುಳುಗುವ ಮೊದಲು, ನಮಗೆ ಎಷ್ಟು ಡೇಟಾಪಾಯಿಂಟ್ಗಳು ಇದ್ದಾರೆ ಮತ್ತು ಡೇಟಾಸೆಟ್ನ ಒಟ್ಟು ಗಾತ್ರ ಎಷ್ಟು ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು ಉಪಯುಕ್ತವಾಗಿರುತ್ತದೆ. ನಾವು ವ್ಯವಹರಿಸುತ್ತಿರುವ ಡೇಟಾದ ಪ್ರಮಾಣವನ್ನು ನೋಡುವುದು ಸಹಾಯಕವಾಗಿದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 2,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "LOe5jQohhulf",
|
|
"outputId": "fb0577ac-3b4a-4623-cb41-20e1b264b3e9"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"(150, 4)"
|
|
]
|
|
},
|
|
"execution_count": 2,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"iris_df.shape"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "smE7AGzOhxk2"
|
|
},
|
|
"source": [
|
|
"ಹೀಗಾಗಿ, ನಾವು 150 ಸಾಲುಗಳು ಮತ್ತು 4 ಕಾಲಮ್ಗಳ ಡೇಟಾ ಜೊತೆ ಕೆಲಸ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಪ್ರತಿ ಸಾಲು ಒಂದು ಡೇಟಾಪಾಯಿಂಟ್ ಅನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಕಾಲಮ್ ಡೇಟಾ ಫ್ರೇಮ್ಗೆ ಸಂಬಂಧಿಸಿದ ಒಂದು ವೈಶಿಷ್ಟ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ. ಆದ್ದರಿಂದ ಮೂಲತಃ, 4 ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಹೊಂದಿರುವ 150 ಡೇಟಾಪಾಯಿಂಟ್ಗಳಿವೆ.\n",
|
|
"\n",
|
|
"`shape` ಇಲ್ಲಿ ಡೇಟಾಫ್ರೇಮ್ನ ಒಂದು ಗುಣಲಕ್ಷಣವಾಗಿದ್ದು, ಫಂಕ್ಷನ್ ಅಲ್ಲ, ಆದ್ದರಿಂದ ಅದು ಕವಚದ ಜೋಡಿಯಲ್ಲಿ ಕೊನೆಗೊಳ್ಳುವುದಿಲ್ಲ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "d3AZKs0PinGP"
|
|
},
|
|
"source": [
|
|
"### `DataFrame.columns`\n",
|
|
"ನಾವು ಈಗ 4 ಕಾಲಮ್ಗಳ ಡೇಟಾಗೆ ಹೋಗೋಣ. ಅವುಗಳಲ್ಲಿ ಪ್ರತಿ ಒಂದು ನಿಖರವಾಗಿ ಏನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ? `columns` ಗುಣಲಕ್ಷಣವು ಡೇಟಾಫ್ರೇಮ್ನ ಕಾಲಮ್ಗಳ ಹೆಸರನ್ನು ನಮಗೆ ನೀಡುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 3,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "YPGh_ziji-CY",
|
|
"outputId": "74e7a43a-77cc-4c80-da56-7f50767c37a0"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"Index(['sepal length (cm)', 'sepal width (cm)', 'petal length (cm)',\n",
|
|
" 'petal width (cm)'],\n",
|
|
" dtype='object')"
|
|
]
|
|
},
|
|
"execution_count": 3,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"iris_df.columns"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "TsobcU_VjCC_"
|
|
},
|
|
"source": [
|
|
"ನಾವು ನೋಡಬಹುದು, ನಾಲ್ಕು(4) ಕಾಲಮ್ಗಳಿವೆ. `columns` ಗುಣಲಕ್ಷಣವು ಕಾಲಮ್ಗಳ ಹೆಸರನ್ನು ನಮಗೆ ತಿಳಿಸುತ್ತದೆ ಮತ್ತು ಮೂಲತಃ ಇನ್ನೇನೂ ಅಲ್ಲ. ಈ ಗುಣಲಕ್ಷಣವು ಮಹತ್ವವನ್ನು ಪಡೆಯುತ್ತದೆ ನಾವು ಡೇಟಾಸೆಟ್ ಹೊಂದಿರುವ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಗುರುತಿಸಲು ಬಯಸುವಾಗ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "2UTlvkjmgRrs"
|
|
},
|
|
"source": [
|
|
"### `DataFrame.info`\n",
|
|
"ಡೇಟಾದ ಪ್ರಮಾಣ (`shape` ಗುಣಲಕ್ಷಣದಿಂದ ನೀಡಲ್ಪಟ್ಟಿದೆ) ಮತ್ತು ವೈಶಿಷ್ಟ್ಯಗಳ ಅಥವಾ ಕಾಲಮ್ಗಳ ಹೆಸರುಗಳು (`columns` ಗುಣಲಕ್ಷಣದಿಂದ ನೀಡಲ್ಪಟ್ಟಿದೆ) ನಮಗೆ ಡೇಟಾಸೆಟ್ ಬಗ್ಗೆ ಏನೋ ತಿಳಿಸುತ್ತವೆ. ಈಗ, ನಾವು ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಇನ್ನಷ್ಟು ಆಳವಾಗಿ ಹೋಗಲು ಇಚ್ಛಿಸುತ್ತೇವೆ. `DataFrame.info()` ಫಂಕ್ಷನ್ ಇದಕ್ಕೆ ಬಹಳ ಉಪಯುಕ್ತವಾಗಿದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 4,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "dHHRyG0_gRrt",
|
|
"outputId": "d8fb0c40-4f18-4e19-da48-c8db77d1d3a5",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"name": "stdout",
|
|
"output_type": "stream",
|
|
"text": [
|
|
"<class 'pandas.core.frame.DataFrame'>\n",
|
|
"RangeIndex: 150 entries, 0 to 149\n",
|
|
"Data columns (total 4 columns):\n",
|
|
" # Column Non-Null Count Dtype \n",
|
|
"--- ------ -------------- ----- \n",
|
|
" 0 sepal length (cm) 150 non-null float64\n",
|
|
" 1 sepal width (cm) 150 non-null float64\n",
|
|
" 2 petal length (cm) 150 non-null float64\n",
|
|
" 3 petal width (cm) 150 non-null float64\n",
|
|
"dtypes: float64(4)\n",
|
|
"memory usage: 4.8 KB\n"
|
|
]
|
|
}
|
|
],
|
|
"source": [
|
|
"iris_df.info()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "1XgVMpvigRru"
|
|
},
|
|
"source": [
|
|
"ಇಂದಿನಿಂದ, ನಾವು ಕೆಲವು ಗಮನಾರ್ಹ ಅಂಶಗಳನ್ನು ಮಾಡಬಹುದು:\n",
|
|
"1. ಪ್ರತಿ ಕಾಲಮ್ನ ಡೇಟಾ ಪ್ರಕಾರ: ಈ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ, ಎಲ್ಲಾ ಡೇಟಾ 64-ಬಿಟ್ ಫ್ಲೋಟಿಂಗ್-ಪಾಯಿಂಟ್ ಸಂಖ್ಯೆಗಳಾಗಿ ಸಂಗ್ರಹಿಸಲಾಗಿದೆ.\n",
|
|
"2. ನಾನ್-ನಲ್ ಮೌಲ್ಯಗಳ ಸಂಖ್ಯೆ: ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸುವುದು ಡೇಟಾ ತಯಾರಿಕೆಯಲ್ಲಿ ಪ್ರಮುಖ ಹಂತವಾಗಿದೆ. ಇದನ್ನು ನಂತರ ನೋಟ್ಬುಕ್ನಲ್ಲಿ ನಿರ್ವಹಿಸಲಾಗುವುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "IYlyxbpWFEF4"
|
|
},
|
|
"source": [
|
|
"### DataFrame.describe()\n",
|
|
"ನಮ್ಮ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಬಹಳಷ್ಟು ಸಂಖ್ಯಾತ್ಮಕ ಡೇಟಾ ಇದೆ ಎಂದು ಹೇಳೋಣ. ಸರಾಸರಿ, ಮಧ್ಯಮ, ಚತುರ್ಥಾಂಶಗಳು ಇತ್ಯಾದಿ ಏಕವ್ಯತ್ಯಯ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಲೆಕ್ಕಾಚಾರಗಳನ್ನು ಪ್ರತಿ ಕಾಲಮ್ಗಳ ಮೇಲೆ ಪ್ರತ್ಯೇಕವಾಗಿ ಮಾಡಬಹುದು. `DataFrame.describe()` ಫಂಕ್ಷನ್ ನಮಗೆ ಡೇಟಾಸೆಟ್ನ ಸಂಖ್ಯಾತ್ಮಕ ಕಾಲಮ್ಗಳ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಸಾರಾಂಶವನ್ನು ಒದಗಿಸುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 5,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 297
|
|
},
|
|
"id": "tWV-CMstFIRA",
|
|
"outputId": "4fc49941-bc13-4b0c-a412-cb39e7d3f289"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>sepal length (cm)</th>\n",
|
|
" <th>sepal width (cm)</th>\n",
|
|
" <th>petal length (cm)</th>\n",
|
|
" <th>petal width (cm)</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>count</th>\n",
|
|
" <td>150.000000</td>\n",
|
|
" <td>150.000000</td>\n",
|
|
" <td>150.000000</td>\n",
|
|
" <td>150.000000</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>mean</th>\n",
|
|
" <td>5.843333</td>\n",
|
|
" <td>3.057333</td>\n",
|
|
" <td>3.758000</td>\n",
|
|
" <td>1.199333</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>std</th>\n",
|
|
" <td>0.828066</td>\n",
|
|
" <td>0.435866</td>\n",
|
|
" <td>1.765298</td>\n",
|
|
" <td>0.762238</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>min</th>\n",
|
|
" <td>4.300000</td>\n",
|
|
" <td>2.000000</td>\n",
|
|
" <td>1.000000</td>\n",
|
|
" <td>0.100000</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>25%</th>\n",
|
|
" <td>5.100000</td>\n",
|
|
" <td>2.800000</td>\n",
|
|
" <td>1.600000</td>\n",
|
|
" <td>0.300000</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>50%</th>\n",
|
|
" <td>5.800000</td>\n",
|
|
" <td>3.000000</td>\n",
|
|
" <td>4.350000</td>\n",
|
|
" <td>1.300000</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>75%</th>\n",
|
|
" <td>6.400000</td>\n",
|
|
" <td>3.300000</td>\n",
|
|
" <td>5.100000</td>\n",
|
|
" <td>1.800000</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>max</th>\n",
|
|
" <td>7.900000</td>\n",
|
|
" <td>4.400000</td>\n",
|
|
" <td>6.900000</td>\n",
|
|
" <td>2.500000</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" sepal length (cm) sepal width (cm) petal length (cm) petal width (cm)\n",
|
|
"count 150.000000 150.000000 150.000000 150.000000\n",
|
|
"mean 5.843333 3.057333 3.758000 1.199333\n",
|
|
"std 0.828066 0.435866 1.765298 0.762238\n",
|
|
"min 4.300000 2.000000 1.000000 0.100000\n",
|
|
"25% 5.100000 2.800000 1.600000 0.300000\n",
|
|
"50% 5.800000 3.000000 4.350000 1.300000\n",
|
|
"75% 6.400000 3.300000 5.100000 1.800000\n",
|
|
"max 7.900000 4.400000 6.900000 2.500000"
|
|
]
|
|
},
|
|
"execution_count": 5,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"iris_df.describe()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "zjjtW5hPGMuM"
|
|
},
|
|
"source": [
|
|
"ಮೇಲಿನ ಔಟ್ಪುಟ್ನಲ್ಲಿ ಪ್ರತಿ ಕಾಲಮ್ನ ಒಟ್ಟು ಡೇಟಾ ಪಾಯಿಂಟ್ಗಳ ಸಂಖ್ಯೆ, ಸರಾಸರಿ, ಮಾನಕ ವ್ಯತ್ಯಾಸ, ಕನಿಷ್ಠ, ಕೆಳಗಿನ ಚತುರ್ಥಾಂಶ(25%), ಮಧ್ಯಮ(50%), ಮೇಲಿನ ಚತುರ್ಥಾಂಶ(75%) ಮತ್ತು ಗರಿಷ್ಠ ಮೌಲ್ಯವನ್ನು ತೋರಿಸಲಾಗಿದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "-lviAu99gRrv"
|
|
},
|
|
"source": [
|
|
"### `DataFrame.head`\n",
|
|
"ಮೇಲಿನ ಎಲ್ಲಾ ಫಂಕ್ಷನ್ಗಳು ಮತ್ತು ಗುಣಲಕ್ಷಣಗಳೊಂದಿಗೆ, ನಮಗೆ ಡೇಟಾಸೆಟ್ನ ಮೇಲ್ಮಟ್ಟದ ದೃಷ್ಟಿ ಸಿಕ್ಕಿದೆ. ಎಷ್ಟು ಡೇಟಾ ಪಾಯಿಂಟ್ಗಳು ಇವೆ, ಎಷ್ಟು ವೈಶಿಷ್ಟ್ಯಗಳು ಇವೆ, ಪ್ರತಿ ವೈಶಿಷ್ಟ್ಯದ ಡೇಟಾ ಪ್ರಕಾರ ಮತ್ತು ಪ್ರತಿ ವೈಶಿಷ್ಟ್ಯದ ನಾನ್-ನಲ್ ಮೌಲ್ಯಗಳ ಸಂಖ್ಯೆ ನಮಗೆ ಗೊತ್ತಾಗಿದೆ.\n",
|
|
"\n",
|
|
"ಈಗ ಡೇಟಾವನ್ನು ಸ್ವತಃ ನೋಡುವ ಸಮಯವಾಗಿದೆ. ನಮ್ಮ `DataFrame`ನ ಮೊದಲ ಕೆಲವು ಸಾಲುಗಳು (ಮೊದಲ ಕೆಲವು ಡೇಟಾಪಾಯಿಂಟ್ಗಳು) ಹೇಗಿವೆ ಎಂದು ನೋಡೋಣ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 6,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "DZMJZh0OgRrw",
|
|
"outputId": "d9393ee5-c106-4797-f815-218f17160e00",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>sepal length (cm)</th>\n",
|
|
" <th>sepal width (cm)</th>\n",
|
|
" <th>petal length (cm)</th>\n",
|
|
" <th>petal width (cm)</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>5.1</td>\n",
|
|
" <td>3.5</td>\n",
|
|
" <td>1.4</td>\n",
|
|
" <td>0.2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>4.9</td>\n",
|
|
" <td>3.0</td>\n",
|
|
" <td>1.4</td>\n",
|
|
" <td>0.2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>4.7</td>\n",
|
|
" <td>3.2</td>\n",
|
|
" <td>1.3</td>\n",
|
|
" <td>0.2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>4.6</td>\n",
|
|
" <td>3.1</td>\n",
|
|
" <td>1.5</td>\n",
|
|
" <td>0.2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>3.6</td>\n",
|
|
" <td>1.4</td>\n",
|
|
" <td>0.2</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" sepal length (cm) sepal width (cm) petal length (cm) petal width (cm)\n",
|
|
"0 5.1 3.5 1.4 0.2\n",
|
|
"1 4.9 3.0 1.4 0.2\n",
|
|
"2 4.7 3.2 1.3 0.2\n",
|
|
"3 4.6 3.1 1.5 0.2\n",
|
|
"4 5.0 3.6 1.4 0.2"
|
|
]
|
|
},
|
|
"execution_count": 6,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"iris_df.head()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "EBHEimZuEFQK"
|
|
},
|
|
"source": [
|
|
"ಇಲ್ಲಿ ಔಟ್ಪುಟ್ ಆಗಿ, ನಾವು ಡೇಟಾಸೆಟ್ನ ಐದು(5) ಎಂಟ್ರಿಗಳನ್ನು ನೋಡಬಹುದು. ಎಡಭಾಗದ ಸೂಚ್ಯಂಕವನ್ನು ನೋಡಿದರೆ, ಇವು ಮೊದಲ ಐದು ಸಾಲುಗಳು ಎಂದು ನಾವು ಕಂಡುಹಿಡಿಯಬಹುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "oj7GkrTdgRry"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n",
|
|
"\n",
|
|
"ಮೇಲಿನ ಉದಾಹರಣೆಯಿಂದ ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ, ಡೀಫಾಲ್ಟ್ ಆಗಿ, `DataFrame.head` ಒಂದು `DataFrame` ನ ಮೊದಲ ಐದು ಸಾಲುಗಳನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ. ಕೆಳಗಿನ ಕೋಡ್ ಸೆಲ್ನಲ್ಲಿ, ನೀವು ಐದು ಸಾಲುಗಳಿಗಿಂತ ಹೆಚ್ಚು ಸಾಲುಗಳನ್ನು ಪ್ರದರ್ಶಿಸುವ ಮಾರ್ಗವನ್ನು ಕಂಡುಹಿಡಿಯಬಹುದೇ?\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 7,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "EKRmRFFegRrz",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Hint: Consult the documentation by using iris_df.head?"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "BJ_cpZqNgRr1"
|
|
},
|
|
"source": [
|
|
"### `DataFrame.tail`\n",
|
|
"ಡೇಟಾವನ್ನು ನೋಡಲು ಇನ್ನೊಂದು ವಿಧಾನವು ಆರಂಭದ ಬದಲು ಕೊನೆಯಲ್ಲಿ ನೋಡುವುದು. `DataFrame.head` ನ ವಿರುದ್ಧವಾದದ್ದು `DataFrame.tail`, ಇದು `DataFrame` ನ ಕೊನೆಯ ಐದು ಸಾಲುಗಳನ್ನು ನೀಡುತ್ತದೆ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 8,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 0
|
|
},
|
|
"id": "heanjfGWgRr2",
|
|
"outputId": "6ae09a21-fe09-4110-b0d7-1a1fbf34d7f3",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>sepal length (cm)</th>\n",
|
|
" <th>sepal width (cm)</th>\n",
|
|
" <th>petal length (cm)</th>\n",
|
|
" <th>petal width (cm)</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>145</th>\n",
|
|
" <td>6.7</td>\n",
|
|
" <td>3.0</td>\n",
|
|
" <td>5.2</td>\n",
|
|
" <td>2.3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>146</th>\n",
|
|
" <td>6.3</td>\n",
|
|
" <td>2.5</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>1.9</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>147</th>\n",
|
|
" <td>6.5</td>\n",
|
|
" <td>3.0</td>\n",
|
|
" <td>5.2</td>\n",
|
|
" <td>2.0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>148</th>\n",
|
|
" <td>6.2</td>\n",
|
|
" <td>3.4</td>\n",
|
|
" <td>5.4</td>\n",
|
|
" <td>2.3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>149</th>\n",
|
|
" <td>5.9</td>\n",
|
|
" <td>3.0</td>\n",
|
|
" <td>5.1</td>\n",
|
|
" <td>1.8</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" sepal length (cm) sepal width (cm) petal length (cm) petal width (cm)\n",
|
|
"145 6.7 3.0 5.2 2.3\n",
|
|
"146 6.3 2.5 5.0 1.9\n",
|
|
"147 6.5 3.0 5.2 2.0\n",
|
|
"148 6.2 3.4 5.4 2.3\n",
|
|
"149 5.9 3.0 5.1 1.8"
|
|
]
|
|
},
|
|
"execution_count": 8,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"iris_df.tail()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "31kBWfyLgRr3"
|
|
},
|
|
"source": [
|
|
"ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಕ್ರಮಬದ್ಧ ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ ಹೊರಗಿನ ಅಂಶಗಳನ್ನು ಹುಡುಕುತ್ತಿರುವಾಗ, `DataFrame` ನ ಮೊದಲ ಕೆಲವು ಸಾಲುಗಳು ಅಥವಾ ಕೊನೆಯ ಕೆಲವು ಸಾಲುಗಳನ್ನು ಸುಲಭವಾಗಿ ಪರಿಶೀಲಿಸಲು ಸಾಧ್ಯವಾಗುವುದು ಉಪಯುಕ್ತವಾಗಿದೆ.\n",
|
|
"\n",
|
|
"ಮೇಲಿನ ಎಲ್ಲಾ ಫಂಕ್ಷನ್ಗಳು ಮತ್ತು ಗುಣಲಕ್ಷಣಗಳು, ಕೋಡ್ ಉದಾಹರಣೆಗಳ ಸಹಾಯದಿಂದ, ನಮಗೆ ಡೇಟಾದ ಒಂದು ನೋಟ ಮತ್ತು ಅನುಭವವನ್ನು ಪಡೆಯಲು ಸಹಾಯ ಮಾಡುತ್ತವೆ.\n",
|
|
"\n",
|
|
"> **ಮುಖ್ಯಾಂಶ:** DataFrame ನಲ್ಲಿ ಮಾಹಿತಿಯ ಮೆಟಾಡೇಟಾ ಅಥವಾ ಅದರ ಮೊದಲ ಮತ್ತು ಕೊನೆಯ ಕೆಲವು ಮೌಲ್ಯಗಳನ್ನು ನೋಡಿದರೆ, ನೀವು ತಕ್ಷಣವೇ ನೀವು ವ್ಯವಹರಿಸುತ್ತಿರುವ ಡೇಟಾದ ಗಾತ್ರ, ಆಕಾರ ಮತ್ತು ವಿಷಯದ ಬಗ್ಗೆ ಒಂದು ತಕ್ಷಣದ ಕಲ್ಪನೆ ಪಡೆಯಬಹುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "TvurZyLSDxq_"
|
|
},
|
|
"source": [
|
|
"### ಕಳೆದುಹೋಗಿದ ಡೇಟಾ\n",
|
|
"ನಾವು ಕಳೆದುಹೋಗಿದ ಡೇಟಾದಲ್ಲಿ ಮುಳುಗೋಣ. ಕೆಲವು ಕಾಲಮ್ಗಳಲ್ಲಿ ಯಾವುದೇ ಮೌಲ್ಯ ಸಂಗ್ರಹಿಸಲಾಗದಾಗ ಕಳೆದುಹೋಗಿದ ಡೇಟಾ ಸಂಭವಿಸುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಒಂದು ಉದಾಹರಣೆಯನ್ನು ತೆಗೆದುಕೊಳ್ಳೋಣ: ಯಾರಾದರೂ ತಮ್ಮ ತೂಕದ ಬಗ್ಗೆ ಜಾಗರೂಕವಾಗಿದ್ದು ಸಮೀಕ್ಷೆಯಲ್ಲಿ ತೂಕದ ಕ್ಷೇತ್ರವನ್ನು ಭರ್ತಿಮಾಡದಿದ್ದರೆ. ಆಗ ಆ ವ್ಯಕ್ತಿಯ ತೂಕ ಮೌಲ್ಯ ಕಳೆದುಹೋಗುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಬಹುಮಾನವಾಗಿ, ನಿಜವಾದ ಜಗತ್ತಿನ ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ ಕಳೆದುಹೋಗಿದ ಮೌಲ್ಯಗಳು ಸಂಭವಿಸುತ್ತವೆ.\n",
|
|
"\n",
|
|
"**ಪಾಂಡಾಸ್ ಕಳೆದುಹೋಗಿದ ಡೇಟಾವನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತದೆ**\n",
|
|
"\n",
|
|
"\n",
|
|
"ಪಾಂಡಾಸ್ ಕಳೆದುಹೋಗಿದ ಮೌಲ್ಯಗಳನ್ನು ಎರಡು ರೀತಿಯಲ್ಲಿ ನಿರ್ವಹಿಸುತ್ತದೆ. ಮೊದಲನೆಯದು ನೀವು ಹಿಂದಿನ ವಿಭಾಗಗಳಲ್ಲಿ ನೋಡಿದ್ದೀರಿ: `NaN`, ಅಂದರೆ ನಂಬರ್ ಅಲ್ಲ. ಇದು ವಾಸ್ತವವಾಗಿ IEEE ಫ್ಲೋಟಿಂಗ್-ಪಾಯಿಂಟ್ ಸ್ಪೆಸಿಫಿಕೇಶನ್ನ ಭಾಗವಾಗಿರುವ ವಿಶೇಷ ಮೌಲ್ಯ ಮತ್ತು ಇದು ಕಳೆದುಹೋಗಿದ ಫ್ಲೋಟಿಂಗ್-ಪಾಯಿಂಟ್ ಮೌಲ್ಯಗಳನ್ನು ಸೂಚಿಸಲು ಮಾತ್ರ ಬಳಸಲಾಗುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಫ್ಲೋಟ್ಸ್ ಹೊರತುಪಡಿಸಿ ಕಳೆದುಹೋಗಿದ ಮೌಲ್ಯಗಳಿಗೆ, ಪಾಂಡಾಸ್ ಪೈಥಾನ್ `None` ವಸ್ತುವನ್ನು ಬಳಸುತ್ತದೆ. ನೀವು ಎರಡು ವಿಭಿನ್ನ ರೀತಿಯ ಮೌಲ್ಯಗಳನ್ನು ಎದುರಿಸುವುದು ಗೊಂದಲಕಾರಿಯಾಗಬಹುದು, ಆದರೆ ಈ ವಿನ್ಯಾಸ ಆಯ್ಕೆಗೆ ತರ್ಕಬದ್ಧವಾದ ಪ್ರೋಗ್ರಾಮ್ಯಾಟಿಕ್ ಕಾರಣಗಳಿವೆ ಮತ್ತು ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಈ ಮಾರ್ಗವನ್ನು ಅನುಸರಿಸುವುದರಿಂದ ಪಾಂಡಾಸ್ ಬಹುಮಟ್ಟಿನ ಪ್ರಕರಣಗಳಿಗೆ ಉತ್ತಮ ಸಮಾಧಾನವನ್ನು ನೀಡುತ್ತದೆ. ಇದನ್ನು ಬಿಟ್ಟು, `None` ಮತ್ತು `NaN` ಎರಡೂ ಬಳಸುವಾಗ ನೀವು ಜಾಗರೂಕವಾಗಿರಬೇಕಾದ ನಿರ್ಬಂಧಗಳನ್ನು ಹೊಂದಿವೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "lOHqUlZFgRr5"
|
|
},
|
|
"source": [
|
|
"### `None`: ಫ್ಲೋಟ್ ಅಲ್ಲದ ಕಾಣೆಯಾದ ಡೇಟಾ \n",
|
|
"`None` ಪೈಥಾನ್ನಿಂದ ಬರುತ್ತದೆ, ಆದ್ದರಿಂದ ಅದು `'object'` ಡೇಟಾ ಪ್ರಕಾರದಲ್ಲದ NumPy ಮತ್ತು pandas ಅರೆಗಳಲ್ಲಿ ಬಳಸಲಾಗುವುದಿಲ್ಲ. ನೆನಪಿಡಿ, NumPy ಅರೆಗಳು (ಮತ್ತು pandas ನಲ್ಲಿ ಡೇಟಾ ರಚನೆಗಳು) ಒಂದೇ ಪ್ರಕಾರದ ಡೇಟಾವನ್ನು ಮಾತ್ರ ಹೊಂದಿರಬಹುದು. ಇದು ದೊಡ್ಡ ಪ್ರಮಾಣದ ಡೇಟಾ ಮತ್ತು ಗಣನಾತ್ಮಕ ಕೆಲಸಗಳಿಗೆ ಅದ್ಭುತ ಶಕ್ತಿ ನೀಡುತ್ತದೆ, ಆದರೆ ಇದರ ಲವಚಿಕತೆಯನ್ನು ಕೂಡಾ ಮಿತಿಗೊಳಿಸುತ್ತದೆ. ಇಂತಹ ಅರೆಗಳು \"ಕನಿಷ್ಠ ಸಾಮಾನ್ಯ ಹಂಚಿಕೆದಾರ\" ಗೆ ಅಪ್ಕಾಸ್ಟ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ, ಅರೆದಲ್ಲಿರುವ ಎಲ್ಲವನ್ನೂ ಒಳಗೊಂಡಿರುವ ಡೇಟಾ ಪ್ರಕಾರ. ಅರೆಗಳಲ್ಲಿ `None` ಇದ್ದರೆ, ನೀವು ಪೈಥಾನ್ ವಸ್ತುಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತಿದ್ದೀರಿ ಎಂದು ಅರ್ಥ. \n",
|
|
"\n",
|
|
"ಇದನ್ನು ಕಾರ್ಯಾಚರಣೆಯಲ್ಲಿ ನೋಡಲು, ಕೆಳಗಿನ ಉದಾಹರಣೆಯ ಅರೆ (ಅದರ `dtype` ಗಮನಿಸಿ) ಪರಿಗಣಿಸಿ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 9,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "QIoNdY4ngRr7",
|
|
"outputId": "92779f18-62f4-4a03-eca2-e9a101604336",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"array([2, None, 6, 8], dtype=object)"
|
|
]
|
|
},
|
|
"execution_count": 9,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"import numpy as np\n",
|
|
"\n",
|
|
"example1 = np.array([2, None, 6, 8])\n",
|
|
"example1"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "pdlgPNbhgRr7"
|
|
},
|
|
"source": [
|
|
"ಅಪ್ಕಾಸ್ಟ್ ಡೇಟಾ ಪ್ರಕಾರಗಳ ವಾಸ್ತವಿಕತೆ ಎರಡು ಪಾರ್ಶ್ವ ಪರಿಣಾಮಗಳನ್ನು ಹೊಂದಿದೆ. ಮೊದಲನೆಯದಾಗಿ, ಕಾರ್ಯಾಚರಣೆಗಳು ಸಂಯೋಜಿತ NumPy ಕೋಡ್ ಬದಲು ವ್ಯಾಖ್ಯಾನಿತ Python ಕೋಡ್ ಮಟ್ಟದಲ್ಲಿ ನಡೆಸಲಾಗುತ್ತದೆ. ಮೂಲತಃ, ಇದರಿಂದ `None` ಹೊಂದಿರುವ `Series` ಅಥವಾ `DataFrames` ಅನ್ನು ಒಳಗೊಂಡ ಯಾವುದೇ ಕಾರ್ಯಾಚರಣೆಗಳು ನಿಧಾನವಾಗುತ್ತವೆ. ನೀವು ಬಹುಶಃ ಈ ಕಾರ್ಯಕ್ಷಮತೆ ಹಾನಿಯನ್ನು ಗಮನಿಸದಿರಬಹುದು, ಆದರೆ ದೊಡ್ಡ ಡೇಟಾಸೆಟ್ಗಳಿಗೆ ಇದು ಸಮಸ್ಯೆಯಾಗಬಹುದು.\n",
|
|
"\n",
|
|
"ಎರಡನೆಯ ಪಾರ್ಶ್ವ ಪರಿಣಾಮವು ಮೊದಲನೆಯದರಿಂದ ಉಂಟಾಗುತ್ತದೆ. ಏಕೆಂದರೆ `None` ಮೂಲತಃ `Series` ಅಥವಾ `DataFrame`ಗಳನ್ನು ವನಿಲ್ಲಾ Python ಜಗತ್ತಿಗೆ ಹಿಂದಿರುಗಿಸುತ್ತದೆ, `None` ಮೌಲ್ಯವನ್ನು ಹೊಂದಿರುವ ಅರೆಗಳ ಮೇಲೆ NumPy/pandas ಸಂಗ್ರಹಣಾ ಕಾರ್ಯಗಳು, ಉದಾಹರಣೆಗೆ `sum()` ಅಥವಾ `min()`, ಸಾಮಾನ್ಯವಾಗಿ ದೋಷವನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 10,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 292
|
|
},
|
|
"id": "gWbx-KB9gRr8",
|
|
"outputId": "ecba710a-22ec-41d5-a39c-11f67e645b50",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"ename": "TypeError",
|
|
"evalue": "ignored",
|
|
"output_type": "error",
|
|
"traceback": [
|
|
"\u001b[0;31m---------------------------------------------------------------------------\u001b[0m",
|
|
"\u001b[0;31mTypeError\u001b[0m Traceback (most recent call last)",
|
|
"\u001b[0;32m<ipython-input-10-ce9901ad18bd>\u001b[0m in \u001b[0;36m<module>\u001b[0;34m()\u001b[0m\n\u001b[0;32m----> 1\u001b[0;31m \u001b[0mexample1\u001b[0m\u001b[0;34m.\u001b[0m\u001b[0msum\u001b[0m\u001b[0;34m(\u001b[0m\u001b[0;34m)\u001b[0m\u001b[0;34m\u001b[0m\u001b[0;34m\u001b[0m\u001b[0m\n\u001b[0m",
|
|
"\u001b[0;32m/usr/local/lib/python3.7/dist-packages/numpy/core/_methods.py\u001b[0m in \u001b[0;36m_sum\u001b[0;34m(a, axis, dtype, out, keepdims, initial, where)\u001b[0m\n\u001b[1;32m 45\u001b[0m def _sum(a, axis=None, dtype=None, out=None, keepdims=False,\n\u001b[1;32m 46\u001b[0m initial=_NoValue, where=True):\n\u001b[0;32m---> 47\u001b[0;31m \u001b[0;32mreturn\u001b[0m \u001b[0mumr_sum\u001b[0m\u001b[0;34m(\u001b[0m\u001b[0ma\u001b[0m\u001b[0;34m,\u001b[0m \u001b[0maxis\u001b[0m\u001b[0;34m,\u001b[0m \u001b[0mdtype\u001b[0m\u001b[0;34m,\u001b[0m \u001b[0mout\u001b[0m\u001b[0;34m,\u001b[0m \u001b[0mkeepdims\u001b[0m\u001b[0;34m,\u001b[0m \u001b[0minitial\u001b[0m\u001b[0;34m,\u001b[0m \u001b[0mwhere\u001b[0m\u001b[0;34m)\u001b[0m\u001b[0;34m\u001b[0m\u001b[0;34m\u001b[0m\u001b[0m\n\u001b[0m\u001b[1;32m 48\u001b[0m \u001b[0;34m\u001b[0m\u001b[0m\n\u001b[1;32m 49\u001b[0m def _prod(a, axis=None, dtype=None, out=None, keepdims=False,\n",
|
|
"\u001b[0;31mTypeError\u001b[0m: unsupported operand type(s) for +: 'int' and 'NoneType'"
|
|
]
|
|
}
|
|
],
|
|
"source": [
|
|
"example1.sum()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "LcEwO8UogRr9"
|
|
},
|
|
"source": [
|
|
"**ಮುಖ್ಯ ಪಾಠ**: ಪೂರ್ಣಾಂಕಗಳು ಮತ್ತು `None` ಮೌಲ್ಯಗಳ ನಡುವೆ ಸೇರಿಸುವಿಕೆ (ಮತ್ತು ಇತರ ಕಾರ್ಯಾಚರಣೆಗಳು) ನಿರ್ಧರಿಸಲಾಗಿಲ್ಲ, ಇದು ಅವುಗಳನ್ನು ಹೊಂದಿರುವ ಡೇಟಾಸೆಟ್ಗಳೊಂದಿಗೆ ನೀವು ಏನು ಮಾಡಬಹುದು ಎಂಬುದನ್ನು ಸೀಮಿತಗೊಳಿಸಬಹುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "pWvVHvETgRr9"
|
|
},
|
|
"source": [
|
|
"### `NaN`: ಕಾಣೆಯಾದ ಫ್ಲೋಟ್ ಮೌಲ್ಯಗಳು\n",
|
|
"\n",
|
|
"`None` ಗೆ ವಿರುದ್ಧವಾಗಿ, NumPy (ಮತ್ತು ಆದ್ದರಿಂದ pandas) ತನ್ನ ವೇಗವಾದ, ವೆಕ್ಟರೈಜ್ಡ್ ಕಾರ್ಯಾಚರಣೆಗಳು ಮತ್ತು ufuncs ಗಾಗಿ `NaN` ಅನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ. ಕೆಟ್ಟ ಸುದ್ದಿ ಎಂದರೆ `NaN` ಮೇಲೆ ನಡೆಸಲಾದ ಯಾವುದೇ ಗಣಿತವು ಯಾವಾಗಲೂ `NaN` ಅನ್ನು ಫಲಿತಾಂಶವಾಗಿ ನೀಡುತ್ತದೆ. ಉದಾಹರಣೆಗೆ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 11,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "rcFYfMG9gRr9",
|
|
"outputId": "699e81b7-5c11-4b46-df1d-06071768690f",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"nan"
|
|
]
|
|
},
|
|
"execution_count": 11,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"np.nan + 1"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 12,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "BW3zQD2-gRr-",
|
|
"outputId": "4525b6c4-495d-4f7b-a979-efce1dae9bd0",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"nan"
|
|
]
|
|
},
|
|
"execution_count": 12,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"np.nan * 0"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "fU5IPRcCgRr-"
|
|
},
|
|
"source": [
|
|
"ಚೆನ್ನಾದ ಸುದ್ದಿ: `NaN` ಇರುವ ಅರೆಗಳ ಮೇಲೆ ಸಂಗ್ರಹಣೆಗಳು ದೋಷಗಳನ್ನು ತೋರಿಸುವುದಿಲ್ಲ. ಕೆಟ್ಟ ಸುದ್ದಿ: ಫಲಿತಾಂಶಗಳು ಸಮಾನವಾಗಿ ಉಪಯುಕ್ತವಾಗಿರುವುದಿಲ್ಲ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 13,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "LCInVgSSgRr_",
|
|
"outputId": "fa06495a-0930-4867-87c5-6023031ea8b5",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"(nan, nan, nan)"
|
|
]
|
|
},
|
|
"execution_count": 13,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example2 = np.array([2, np.nan, 6, 8]) \n",
|
|
"example2.sum(), example2.min(), example2.max()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "nhlnNJT7gRr_"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 11,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "yan3QRaOgRr_",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# What happens if you add np.nan and None together?\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "_iDvIRC8gRsA"
|
|
},
|
|
"source": [
|
|
"ಸ್ಮರಿಸಿ: `NaN` ಕೇವಲ ಕಾಣೆಯಾದ ಫ್ಲೋಟಿಂಗ್-ಪಾಯಿಂಟ್ ಮೌಲ್ಯಗಳಿಗಾಗಿ ಮಾತ್ರ; ಪೂರ್ಣಾಂಕಗಳು, ಸ್ಟ್ರಿಂಗ್ಗಳು ಅಥವಾ ಬೂಲಿಯನ್ಗಳಿಗೆ `NaN` ಸಮಾನಾರ್ಥಕವಿಲ್ಲ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "kj6EKdsAgRsA"
|
|
},
|
|
"source": [
|
|
"### `NaN` ಮತ್ತು `None`: pandas ನಲ್ಲಿ ಶೂನ್ಯ ಮೌಲ್ಯಗಳು\n",
|
|
"\n",
|
|
"`NaN` ಮತ್ತು `None` ಸ್ವಲ್ಪ ವಿಭಿನ್ನವಾಗಿ ವರ್ತಿಸಬಹುದು ಆದರೂ, pandas ಅವುಗಳನ್ನು ಪರಸ್ಪರ ಬದಲಾಯಿಸಬಹುದಾದಂತೆ ನಿರ್ವಹಿಸಲು ನಿರ್ಮಿಸಲಾಗಿದೆ. ನಾವು ಏನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುತ್ತೇವೆ ಎಂದು ನೋಡಲು, ಪೂರ್ಣಾಂಕಗಳ `Series` ಅನ್ನು ಪರಿಗಣಿಸಿ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 15,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "Nji-KGdNgRsA",
|
|
"outputId": "36aa14d2-8efa-4bfd-c0ed-682991288822",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"0 1\n",
|
|
"1 2\n",
|
|
"2 3\n",
|
|
"dtype: int64"
|
|
]
|
|
},
|
|
"execution_count": 15,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"int_series = pd.Series([1, 2, 3], dtype=int)\n",
|
|
"int_series"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "WklCzqb8gRsB"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 16,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "Cy-gqX5-gRsB",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Now set an element of int_series equal to None.\n",
|
|
"# How does that element show up in the Series?\n",
|
|
"# What is the dtype of the Series?\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "WjMQwltNgRsB"
|
|
},
|
|
"source": [
|
|
"`Series` ಮತ್ತು `DataFrame`ಗಳಲ್ಲಿ ಡೇಟಾ ಸಮಾನತೆಯನ್ನು ಸ್ಥಾಪಿಸಲು ಡೇಟಾ ಪ್ರಕಾರಗಳನ್ನು ಅಪ್ಕಾಸ್ಟ್ ಮಾಡುವ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ, pandas `None` ಮತ್ತು `NaN` ನಡುವಿನ ಕಾಣೆಯ ಮೌಲ್ಯಗಳನ್ನು ಸ್ವೀಕರಿಸಲು ಇಚ್ಛಿಸುತ್ತದೆ. ಈ ವಿನ್ಯಾಸ ವೈಶಿಷ್ಟ್ಯದ ಕಾರಣದಿಂದ, pandas ನಲ್ಲಿ `None` ಮತ್ತು `NaN` ಅನ್ನು \"null\" ಎಂಬ ಎರಡು ವಿಭಿನ್ನ ರುಚಿಗಳಾಗಿ ಪರಿಗಣಿಸುವುದು ಸಹಾಯಕವಾಗಬಹುದು. ನಿಜವಾಗಿಯೂ, pandas ನಲ್ಲಿ ಕಾಣೆಯ ಮೌಲ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸಲು ನೀವು ಬಳಸುವ ಕೆಲವು ಮೂಲ ವಿಧಾನಗಳು ಈ ಕಲ್ಪನೆಯನ್ನು ಅವರ ಹೆಸರಿನಲ್ಲಿ ಪ್ರತಿಬಿಂಬಿಸುತ್ತವೆ:\n",
|
|
"\n",
|
|
"- `isnull()`: ಕಾಣೆಯ ಮೌಲ್ಯಗಳನ್ನು ಸೂಚಿಸುವ ಬೂಲಿಯನ್ ಮಾಸ್ಕ್ ಅನ್ನು ರಚಿಸುತ್ತದೆ\n",
|
|
"- `notnull()`: `isnull()` ಗೆ ವಿರುದ್ಧ\n",
|
|
"- `dropna()`: ಡೇಟಾದ ಫಿಲ್ಟರ್ ಮಾಡಲಾದ ಆವೃತ್ತಿಯನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ\n",
|
|
"- `fillna()`: ಕಾಣೆಯ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಿದ ಅಥವಾ ಅಂದಾಜಿಸಿದ ಡೇಟಾದ ನಕಲನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ\n",
|
|
"\n",
|
|
"ಇವುಗಳನ್ನು ನಿಪುಣವಾಗಿ ಬಳಸುವುದು ಮತ್ತು ಆರಾಮವಾಗಿ ತಿಳಿದುಕೊಳ್ಳುವುದು ಮುಖ್ಯ, ಆದ್ದರಿಂದ ನಾವು ಪ್ರತಿಯೊಂದರನ್ನೂ ಕೆಲವು ಆಳದಲ್ಲಿ ಪರಿಶೀಲಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "Yh5ifd9FgRsB"
|
|
},
|
|
"source": [
|
|
"### ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು\n",
|
|
"\n",
|
|
"ನಾವು ಕಳೆದುಹೋಗಿರುವ ಮೌಲ್ಯಗಳ ಮಹತ್ವವನ್ನು ಅರ್ಥಮಾಡಿಕೊಂಡಿದ್ದೇವೆ, ಈಗ ಅವುಗಳನ್ನು ನಮ್ಮ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಪತ್ತೆಹಚ್ಚಬೇಕಾಗಿದೆ, ಅವುಗಳೊಂದಿಗೆ ವ್ಯವಹರಿಸುವ ಮೊದಲು. \n",
|
|
"`isnull()` ಮತ್ತು `notnull()` ಎರಡೂ ನಿಮ್ಮ ಪ್ರಾಥಮಿಕ ವಿಧಾನಗಳು ಶೂನ್ಯ ಡೇಟಾವನ್ನು ಪತ್ತೆಹಚ್ಚಲು. ಎರಡೂ ನಿಮ್ಮ ಡೇಟಾದ ಮೇಲೆ ಬೂಲಿಯನ್ ಮಾಸ್ಕ್ಗಳನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತವೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 17,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "e-vFp5lvgRsC",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"example3 = pd.Series([0, np.nan, '', None])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 18,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "1XdaJJ7PgRsC",
|
|
"outputId": "92fc363a-1874-471f-846d-f4f9ce1f51d0",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"0 False\n",
|
|
"1 True\n",
|
|
"2 False\n",
|
|
"3 True\n",
|
|
"dtype: bool"
|
|
]
|
|
},
|
|
"execution_count": 18,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example3.isnull()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "PaSZ0SQygRsC"
|
|
},
|
|
"source": [
|
|
"ಔಟ್ಪುಟ್ ಅನ್ನು ನಿಕಟವಾಗಿ ನೋಡಿ. ಇದರಲ್ಲಿ ಯಾವುದಾದರೂ ನಿಮಗೆ ಆಶ್ಚರ್ಯಕರವಾಗಿದೆಯೇ? `0` ಗಣಿತೀಯ ಶೂನ್ಯವಾಗಿದ್ದರೂ, ಅದು ಸಂಪೂರ್ಣವಾಗಿ ಒಳ್ಳೆಯ ಪೂರ್ಣಾಂಕವಾಗಿದೆ ಮತ್ತು pandas ಅದನ್ನು ಹಾಗೆಯೇ ಪರಿಗಣಿಸುತ್ತದೆ. `''` ಸ್ವಲ್ಪ ಹೆಚ್ಚು ಸೂಕ್ಷ್ಮವಾಗಿದೆ. ನಾವು ಅದನ್ನು ವಿಭಾಗ 1 ರಲ್ಲಿ ಖಾಲಿ ಸ್ಟ್ರಿಂಗ್ ಮೌಲ್ಯವನ್ನು ಪ್ರತಿನಿಧಿಸಲು ಬಳಸಿದ್ದರೂ, ಅದು pandas ಗೆ ಸಂಬಂಧಿಸಿದಂತೆ ಶೂನ್ಯದ ಪ್ರತಿನಿಧನೆ ಅಲ್ಲ, ಅದು ಸ್ಟ್ರಿಂಗ್ ವಸ್ತುವಾಗಿದೆ.\n",
|
|
"\n",
|
|
"ಈಗ, ಇದನ್ನು ತಿರುಗಿಸಿ, ನೀವು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಬಳಸುವ ರೀತಿಯಲ್ಲಿ ಈ ವಿಧಾನಗಳನ್ನು ಬಳಸೋಣ. ನೀವು Boolean ಮಾಸ್ಕ್ಗಳನ್ನು ನೇರವಾಗಿ ``Series`` ಅಥವಾ ``DataFrame`` ಸೂಚ್ಯಂಕವಾಗಿ ಬಳಸಬಹುದು, ಇದು ಪ್ರತ್ಯೇಕವಾಗಿ ಕಾಣೆಯಾದ (ಅಥವಾ ಇರುವ) ಮೌಲ್ಯಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡಲು ಉಪಯುಕ್ತವಾಗಬಹುದು.\n",
|
|
"\n",
|
|
"ನಾವು ಒಟ್ಟು ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳ ಸಂಖ್ಯೆಯನ್ನು ತಿಳಿದುಕೊಳ್ಳಬೇಕಾದರೆ, `isnull()` ವಿಧಾನದಿಂದ ಉತ್ಪನ್ನವಾದ ಮಾಸ್ಕ್ ಮೇಲೆ ಸರಳವಾಗಿ ಮೊತ್ತವನ್ನು ಮಾಡಬಹುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 19,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "JCcQVoPkHDUv",
|
|
"outputId": "001daa72-54f8-4bd5-842a-4df627a79d4d"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"2"
|
|
]
|
|
},
|
|
"execution_count": 19,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example3.isnull().sum()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "PlBqEo3mgRsC"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 20,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "ggDVf5uygRsD",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Try running example3[example3.notnull()].\n",
|
|
"# Before you do so, what do you expect to see?\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "D_jWN7mHgRsD"
|
|
},
|
|
"source": [
|
|
"**ಮುಖ್ಯ ಅಂಶ**: `isnull()` ಮತ್ತು `notnull()` ವಿಧಾನಗಳು DataFrames ನಲ್ಲಿ ಬಳಸಿದಾಗ ಸಮಾನ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡುತ್ತವೆ: ಅವು ಫಲಿತಾಂಶಗಳನ್ನು ಮತ್ತು ಆ ಫಲಿತಾಂಶಗಳ ಸೂಚ್ಯಂಕವನ್ನು ತೋರಿಸುತ್ತವೆ, ಇದು ನಿಮ್ಮ ಡೇಟಾ ಜೊತೆ ಹೋರಾಡುವಾಗ ನಿಮಗೆ ಬಹಳ ಸಹಾಯ ಮಾಡುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "BvnoojWsgRr4"
|
|
},
|
|
"source": [
|
|
"### ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ನಿಭಾಯಿಸುವುದು\n",
|
|
"\n",
|
|
"> **ಕಲಿಕೆಯ ಗುರಿ:** ಈ ಉಪವಿಭಾಗದ ಕೊನೆಯಲ್ಲಿ, ನೀವು DataFrames ನಿಂದ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಹೇಗೆ ಮತ್ತು ಯಾವಾಗ ಬದಲಾಯಿಸಬೇಕು ಅಥವಾ ತೆಗೆದುಹಾಕಬೇಕು ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳಬೇಕು.\n",
|
|
"\n",
|
|
"ಯಂತ್ರ ಅಧ್ಯಯನ ಮಾದರಿಗಳು ತಾವು ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ನಿಭಾಯಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಆದ್ದರಿಂದ, ಡೇಟಾವನ್ನು ಮಾದರಿಯಲ್ಲಿ ಹಂಚಿಕೆಯಾಗಿಸುವ ಮೊದಲು, ನಾವು ಈ ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ನಿಭಾಯಿಸಬೇಕಾಗುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ಹೇಗೆ ನಿಭಾಯಿಸಲಾಗುತ್ತದೆ ಎಂಬುದು ಸೂಕ್ಷ್ಮ ವ್ಯವಹಾರಗಳನ್ನು ಹೊಂದಿದೆ, ಇದು ನಿಮ್ಮ ಅಂತಿಮ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ನೈಜ ಜಗತ್ತಿನ ಫಲಿತಾಂಶಗಳನ್ನು ಪ್ರಭಾವಿಸುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ನಿಭಾಯಿಸುವ ಎರಡು ಪ್ರಮುಖ ವಿಧಾನಗಳಿವೆ:\n",
|
|
"\n",
|
|
"\n",
|
|
"1. ಕಾಣೆಯಾದ ಮೌಲ್ಯವನ್ನು ಹೊಂದಿರುವ ಸಾಲನ್ನು ತೆಗೆದುಹಾಕುವುದು\n",
|
|
"2. ಕಾಣೆಯಾದ ಮೌಲ್ಯವನ್ನು ಬೇರೆ ಮೌಲ್ಯದಿಂದ ಬದಲಾಯಿಸುವುದು\n",
|
|
"\n",
|
|
"ನಾವು ಈ ಎರಡೂ ವಿಧಾನಗಳನ್ನು ಮತ್ತು ಅವುಗಳ ಲಾಭ-ನಷ್ಟಗಳನ್ನು ವಿವರವಾಗಿ ಚರ್ಚಿಸುವೆವು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "3VaYC1TvgRsD"
|
|
},
|
|
"source": [
|
|
"### ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕುವುದು\n",
|
|
"\n",
|
|
"ನಾವು ನಮ್ಮ ಮಾದರಿಗೆ ನೀಡುವ ಡೇಟಾದ ಪ್ರಮಾಣವು ಅದರ ಕಾರ್ಯಕ್ಷಮತೆಯ ಮೇಲೆ ನೇರ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕುವುದು ಎಂದರೆ ನಾವು ಡೇಟಾಪಾಯಿಂಟ್ಗಳ ಸಂಖ್ಯೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತಿದ್ದೇವೆ, ಮತ್ತು ಆದ್ದರಿಂದ ಡೇಟಾಸೆಟ್ನ ಗಾತ್ರವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತಿದ್ದೇವೆ. ಆದ್ದರಿಂದ, ಡೇಟಾಸೆಟ್ ಬಹಳ ದೊಡ್ಡದಾಗಿದ್ದಾಗ ನಲ್ ಮೌಲ್ಯಗಳಿರುವ ಸಾಲುಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕುವುದು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಮತ್ತೊಂದು ಉದಾಹರಣೆ ಎಂದರೆ ಒಂದು ನಿರ್ದಿಷ್ಟ ಸಾಲು ಅಥವಾ ಕಾಲಮ್ನಲ್ಲಿ ಬಹಳಷ್ಟು ಮಿಸ್ ಆಗಿರುವ ಮೌಲ್ಯಗಳಿರಬಹುದು. ಆಗ ಅವುಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕಬಹುದು ಏಕೆಂದರೆ ಆ ಸಾಲು/ಕಾಲಮ್ಗೆ ಹೆಚ್ಚಿನ ಡೇಟಾ ಇಲ್ಲದಿರುವುದರಿಂದ ಅವು ನಮ್ಮ ವಿಶ್ಲೇಷಣೆಗೆ ಹೆಚ್ಚಿನ ಮೌಲ್ಯವನ್ನು ಸೇರಿಸುವುದಿಲ್ಲ.\n",
|
|
"\n",
|
|
"ಮಿಸ್ ಆಗಿರುವ ಮೌಲ್ಯಗಳನ್ನು ಗುರುತಿಸುವುದನ್ನು ಮೀರಿ, pandas `Series` ಮತ್ತು `DataFrame`ಗಳಿಂದ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ತೆಗೆದುಹಾಕಲು ಅನುಕೂಲಕರ ವಿಧಾನವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಇದನ್ನು ಕಾರ್ಯದಲ್ಲಿ ನೋಡಲು, ನಾವು `example3` ಗೆ ಮರಳೋಣ. `DataFrame.dropna()` ಫಂಕ್ಷನ್ ನಲ್ ಮೌಲ್ಯಗಳಿರುವ ಸಾಲುಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 21,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "7uIvS097gRsD",
|
|
"outputId": "c13fc117-4ca1-4145-a0aa-42ac89e6e218",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"0 0\n",
|
|
"2 \n",
|
|
"dtype: object"
|
|
]
|
|
},
|
|
"execution_count": 21,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example3 = example3.dropna()\n",
|
|
"example3"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "hil2cr64gRsD"
|
|
},
|
|
"source": [
|
|
"ನೋಟ್ ಮಾಡಿ ಇದು ನಿಮ್ಮ `example3[example3.notnull()]` ನಿಂದ ನಿಮ್ಮ ಔಟ್ಪುಟ್ನಂತೆ ಕಾಣಬೇಕು. ಇಲ್ಲಿ ವ್ಯತ್ಯಾಸವೆಂದರೆ, ಮಸ್ಕ್ ಮಾಡಲಾದ ಮೌಲ್ಯಗಳ ಮೇಲೆ ಮಾತ್ರ ಸೂಚ್ಯಂಕ ಹಾಕುವುದರ ಬದಲು, `dropna` ಆ ಕಳೆದುಹೋಗಿದ ಮೌಲ್ಯಗಳನ್ನು `Series` `example3` ನಿಂದ ತೆಗೆದುಹಾಕಿದೆ.\n",
|
|
"\n",
|
|
"ಕಾರಣ DataFrames ಗೆ ಎರಡು ಆಯಾಮಗಳಿವೆ, ಅವು ಡೇಟಾವನ್ನು ತೆಗೆದುಹಾಕಲು ಹೆಚ್ಚು ಆಯ್ಕೆಗಳನ್ನು ಒದಗಿಸುತ್ತವೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 22,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "an-l74sPgRsE",
|
|
"outputId": "340876a0-63ad-40f6-bd54-6240cdae50ab",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>7</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>9</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 1.0 NaN 7\n",
|
|
"1 2.0 5.0 8\n",
|
|
"2 NaN 6.0 9"
|
|
]
|
|
},
|
|
"execution_count": 22,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4 = pd.DataFrame([[1, np.nan, 7], \n",
|
|
" [2, 5, 8], \n",
|
|
" [np.nan, 6, 9]])\n",
|
|
"example4"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "66wwdHZrgRsE"
|
|
},
|
|
"source": [
|
|
"(ನೀವು ಗಮನಿಸಿದ್ದೀರಾ pandas ಎರಡು ಕಾಲಮ್ಗಳನ್ನು `NaN` ಗಳನ್ನು ಹೊಂದಿಸಲು ಫ್ಲೋಟ್ಗಳಿಗೆ ಅಪ್ಕಾಸ್ಟ್ ಮಾಡುತ್ತದೆ?)\n",
|
|
"\n",
|
|
"ನೀವು `DataFrame` ನಿಂದ ಒಂದೇ ಮೌಲ್ಯವನ್ನು ತೆಗೆದುಹಾಕಲು ಸಾಧ್ಯವಿಲ್ಲ, ಆದ್ದರಿಂದ ನೀವು ಸಂಪೂರ್ಣ ಸಾಲುಗಳು ಅಥವಾ ಕಾಲಮ್ಗಳನ್ನು ತೆಗೆದುಹಾಕಬೇಕು. ನೀವು ಏನು ಮಾಡುತ್ತಿದ್ದೀರೋ ಅದಕ್ಕೆ ಅನುಗುಣವಾಗಿ, ನೀವು ಒಂದನ್ನು ಅಥವಾ ಇನ್ನೊಂದನ್ನು ಮಾಡಬಹುದು, ಹಾಗಾಗಿ pandas ಎರಡಕ್ಕೂ ಆಯ್ಕೆಗಳು ನೀಡುತ್ತದೆ. ಡೇಟಾ ಸೈನ್ಸ್ನಲ್ಲಿ, ಕಾಲಮ್ಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಚರಗಳನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ ಮತ್ತು ಸಾಲುಗಳು ಅವಲೋಕನಗಳನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ, ಆದ್ದರಿಂದ ನೀವು ಡೇಟಾದ ಸಾಲುಗಳನ್ನು ತೆಗೆದುಹಾಕುವ ಸಾಧ್ಯತೆ ಹೆಚ್ಚು; `dropna()` ನ ಡೀಫಾಲ್ಟ್ ಸೆಟ್ಟಿಂಗ್ ಯಾವುದೇ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುವ ಎಲ್ಲಾ ಸಾಲುಗಳನ್ನು ತೆಗೆದುಹಾಕುವದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 23,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 80
|
|
},
|
|
"id": "jAVU24RXgRsE",
|
|
"outputId": "0b5e5aee-7187-4d3f-b583-a44136ae5f80",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"1 2.0 5.0 8"
|
|
]
|
|
},
|
|
"execution_count": 23,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4.dropna()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "TrQRBuTDgRsE"
|
|
},
|
|
"source": [
|
|
"ಅಗತ್ಯವಿದ್ದರೆ, ನೀವು ಕಾಲಮ್ಗಳಿಂದ NA ಮೌಲ್ಯಗಳನ್ನು ತೆಗೆದುಹಾಕಬಹುದು. ಅದಕ್ಕಾಗಿ `axis=1` ಅನ್ನು ಬಳಸಿ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 24,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "GrBhxu9GgRsE",
|
|
"outputId": "ff4001f3-2e61-4509-d60e-0093d1068437",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>7</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>8</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>9</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 2\n",
|
|
"0 7\n",
|
|
"1 8\n",
|
|
"2 9"
|
|
]
|
|
},
|
|
"execution_count": 24,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4.dropna(axis='columns')"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "KWXiKTfMgRsF"
|
|
},
|
|
"source": [
|
|
"ಗಮನಿಸಿ, ಇದು ನೀವು ಉಳಿಸಿಕೊಳ್ಳಲು ಬಯಸುವ ಬಹಳಷ್ಟು ಡೇಟಾವನ್ನು ಬಿಟ್ಟಿಹೋಗಬಹುದು, ವಿಶೇಷವಾಗಿ ಸಣ್ಣ ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ. ನೀವು ಕೆಲವೊಂದು ಅಥವಾ ಎಲ್ಲಾ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುವ ಸಾಲುಗಳು ಅಥವಾ ಕಾಲಮ್ಗಳನ್ನು ಮಾತ್ರ ಬಿಟ್ಟಿಹೋಗಲು ಬಯಸಿದರೆ ಏನು ಮಾಡಬೇಕು? ನೀವು `dropna` ನಲ್ಲಿ `how` ಮತ್ತು `thresh` ಪರಿಮಾಣಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಆ ಸೆಟ್ಟಿಂಗ್ಗಳನ್ನು ನಿರ್ದಿಷ್ಟಪಡಿಸಬಹುದು.\n",
|
|
"\n",
|
|
"ಡೀಫಾಲ್ಟ್ ಆಗಿ, `how='any'` (ನೀವು ಸ್ವತಃ ಪರಿಶೀಲಿಸಲು ಅಥವಾ ಈ ವಿಧಾನದಲ್ಲಿ ಇನ್ನೇನು ಪರಿಮಾಣಗಳಿವೆ ಎಂದು ನೋಡಲು ಬಯಸಿದರೆ, ಕೋಡ್ ಸೆಲ್ನಲ್ಲಿ `example4.dropna?` ಅನ್ನು ರನ್ ಮಾಡಿ). ಬದಲಾಗಿ, ನೀವು `how='all'` ಅನ್ನು ನಿರ್ದಿಷ್ಟಪಡಿಸಬಹುದು, ಇದರಿಂದ ಎಲ್ಲಾ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುವ ಸಾಲುಗಳು ಅಥವಾ ಕಾಲಮ್ಗಳನ್ನು ಮಾತ್ರ ಬಿಟ್ಟಿಹೋಗುತ್ತದೆ. ಮುಂದಿನ ವ್ಯಾಯಾಮದಲ್ಲಿ ಇದನ್ನು ಕಾರ್ಯಾಚರಣೆಯಲ್ಲಿ ನೋಡಲು ನಮ್ಮ ಉದಾಹರಣೆಯ `DataFrame` ಅನ್ನು ವಿಸ್ತರಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 25,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "Bcf_JWTsgRsF",
|
|
"outputId": "72e0b1b8-52fa-4923-98ce-b6fbed6e44b1",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" <th>3</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>7</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>9</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2 3\n",
|
|
"0 1.0 NaN 7 NaN\n",
|
|
"1 2.0 5.0 8 NaN\n",
|
|
"2 NaN 6.0 9 NaN"
|
|
]
|
|
},
|
|
"execution_count": 25,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4[3] = np.nan\n",
|
|
"example4"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "pNZer7q9JPNC"
|
|
},
|
|
"source": [
|
|
"> ಮುಖ್ಯ ಅಂಶಗಳು: \n",
|
|
"1. ಡೇಟಾಸೆಟ್ ಸಾಕಷ್ಟು ದೊಡ್ಡದಾಗಿದ್ದರೆ ಮಾತ್ರ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕುವುದು ಒಳ್ಳೆಯ ವಿಚಾರ. \n",
|
|
"2. ಹೆಚ್ಚಿನ ಡೇಟಾ ಇಲ್ಲದಿದ್ದರೆ ಸಂಪೂರ್ಣ ಸಾಲುಗಳು ಅಥವಾ ಕಾಲಮ್ಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕಬಹುದು. \n",
|
|
"3. `DataFrame.dropna(axis=)` ವಿಧಾನವು ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. `axis` ಆರ್ಗ್ಯುಮೆಂಟ್ ಸಾಲುಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕಬೇಕೇ ಅಥವಾ ಕಾಲಮ್ಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕಬೇಕೇ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ. \n",
|
|
"4. `how` ಆರ್ಗ್ಯುಮೆಂಟ್ ಕೂಡ ಬಳಸಬಹುದು. ಡೀಫಾಲ್ಟ್ ಆಗಿ ಇದು `any` ಗೆ ಸೆಟ್ ಆಗಿರುತ್ತದೆ. ಆದ್ದರಿಂದ, ಯಾವುದೇ ನಲ್ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುವ ಸಾಲುಗಳು/ಕಾಲಮ್ಗಳನ್ನು ಮಾತ್ರ ಬಿಟ್ಟಿಹಾಕುತ್ತದೆ. ಎಲ್ಲಾ ಮೌಲ್ಯಗಳು ನಲ್ ಆಗಿರುವ ಸಾಲುಗಳು/ಕಾಲಮ್ಗಳನ್ನು ಮಾತ್ರ ಬಿಟ್ಟಿಹಾಕಲು ಇದನ್ನು `all` ಗೆ ಸೆಟ್ ಮಾಡಬಹುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "oXXSfQFHgRsF"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 22,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "ExUwQRxpgRsF",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# How might you go about dropping just column 3?\n",
|
|
"# Hint: remember that you will need to supply both the axis parameter and the how parameter.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "38kwAihWgRsG"
|
|
},
|
|
"source": [
|
|
"`thresh` ಪರಿಮಾಣವು ನಿಮಗೆ ಸೂಕ್ಷ್ಮ ನಿಯಂತ್ರಣವನ್ನು ನೀಡುತ್ತದೆ: ನೀವು ಸಾಲು ಅಥವಾ ಕಾಲಮ್ ಉಳಿಸಿಕೊಳ್ಳಲು ಅಗತ್ಯವಿರುವ *ನಲ್ ಅಲ್ಲದ* ಮೌಲ್ಯಗಳ ಸಂಖ್ಯೆಯನ್ನು ಹೊಂದಿಸುತ್ತೀರಿ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 27,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 80
|
|
},
|
|
"id": "M9dCNMaagRsG",
|
|
"outputId": "8093713a-54d2-4e54-c73f-4eea315cb6f2",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" <th>3</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2 3\n",
|
|
"1 2.0 5.0 8 NaN"
|
|
]
|
|
},
|
|
"execution_count": 27,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4.dropna(axis='rows', thresh=3)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "fmSFnzZegRsG"
|
|
},
|
|
"source": [
|
|
"ಇಲ್ಲಿ, ಮೊದಲ ಮತ್ತು ಕೊನೆಯ ಸಾಲುಗಳನ್ನು ತೆಗೆದುಹಾಕಲಾಗಿದೆ, ಏಕೆಂದರೆ ಅವುಗಳಲ್ಲಿ ಕೇವಲ ಎರಡು ಅಶೂನ್ಯ ಮೌಲ್ಯಗಳಿವೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "mCcxLGyUgRsG"
|
|
},
|
|
"source": [
|
|
"### ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬುವುದು\n",
|
|
"\n",
|
|
"ಕಾಲಕಾಲಕ್ಕೆ, ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ಮಾನ್ಯವಾಗಬಹುದಾದ ಮೌಲ್ಯಗಳಿಂದ ತುಂಬುವುದು ಅರ್ಥಪೂರ್ಣವಾಗಬಹುದು. ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಲು ಕೆಲವು ತಂತ್ರಗಳು ಇವೆ. ಮೊದಲನೆಯದು ಡೊಮೇನ್ ಜ್ಞಾನವನ್ನು (ಡೇಟಾಸೆಟ್ ಆಧಾರಿತ ವಿಷಯದ ಜ್ಞಾನ) ಬಳಸಿಕೊಂಡು ಕೇವಲ ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ಅಂದಾಜಿಸುವುದು.\n",
|
|
"\n",
|
|
"ನೀವು ಇದನ್ನು ಸ್ಥಳದಲ್ಲಿಯೇ ಮಾಡಲು `isnull` ಅನ್ನು ಬಳಸಬಹುದು, ಆದರೆ ತುಂಬಾ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಬೇಕಾದರೆ ಅದು ಕಷ್ಟಕರವಾಗಬಹುದು. ಡೇಟಾ ಸೈನ್ಸ್ನಲ್ಲಿ ಇದು ಸಾಮಾನ್ಯ ಕಾರ್ಯವಾಗಿರುವುದರಿಂದ, pandas `fillna` ಅನ್ನು ಒದಗಿಸುತ್ತದೆ, ಇದು `Series` ಅಥವಾ `DataFrame` ನ ಪ್ರತಿಯನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ, ಅಲ್ಲಿ ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ನೀವು ಆಯ್ಕೆಮಾಡಿದ ಮೌಲ್ಯದಿಂದ ಬದಲಿಸಲಾಗಿದೆ. ಇದನ್ನು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಹೇಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ ಎಂದು ನೋಡಲು ಮತ್ತೊಂದು ಉದಾಹರಣೆಯ `Series` ಅನ್ನು ರಚಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "CE8S7louLezV"
|
|
},
|
|
"source": [
|
|
"### ವರ್ಗೀಕೃತ ಡೇಟಾ (ಸಂಖ್ಯಾತ್ಮಕವಲ್ಲದ)\n",
|
|
"ಮೊದಲು ನಾವು ಸಂಖ್ಯಾತ್ಮಕವಲ್ಲದ ಡೇಟಾವನ್ನು ಪರಿಗಣಿಸೋಣ. ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ, ನಮಗೆ ವರ್ಗೀಕೃತ ಡೇಟಾ ಇರುವ ಕಾಲಮ್ಗಳು ಇರುತ್ತವೆ. ಉದಾ. ಲಿಂಗ, ಸತ್ಯ ಅಥವಾ ಅಸತ್ಯ ಇತ್ಯಾದಿ.\n",
|
|
"\n",
|
|
"ಇವುಗಳಲ್ಲಿ ಬಹುತೇಕ ಸಂದರ್ಭಗಳಲ್ಲಿ, ನಾವು ಕಳವಳಾದ ಮೌಲ್ಯಗಳನ್ನು ಕಾಲಮ್ನ `mode` (ಅತ್ಯಧಿಕ ಸಂಭವನೀಯ ಮೌಲ್ಯ) ಮೂಲಕ ಬದಲಾಯಿಸುತ್ತೇವೆ. ಉದಾಹರಣೆಗೆ, ನಮಗೆ 100 ಡೇಟಾ ಪಾಯಿಂಟ್ಗಳಿದ್ದು, 90 ಸತ್ಯ ಎಂದು ಹೇಳಿದ್ದು, 8 ಅಸತ್ಯ ಎಂದು ಹೇಳಿದ್ದು ಮತ್ತು 2 ಭರ್ತಿ ಮಾಡಿಲ್ಲ. ಆಗ, ನಾವು ಆ 2 ಅನ್ನು ಸಂಪೂರ್ಣ ಕಾಲಮ್ ಪರಿಗಣಿಸಿ ಸತ್ಯದಿಂದ ಭರ್ತಿ ಮಾಡಬಹುದು.\n",
|
|
"\n",
|
|
"ಮತ್ತೆ, ಇಲ್ಲಿ ನಾವು ಕ್ಷೇತ್ರ ಜ್ಞಾನವನ್ನು ಬಳಸಬಹುದು. ಮೋಡ್ನೊಂದಿಗೆ ಭರ್ತಿ ಮಾಡುವ ಉದಾಹರಣೆಯನ್ನು ಪರಿಗಣಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 28,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "MY5faq4yLdpQ",
|
|
"outputId": "19ab472e-1eed-4de8-f8a7-db2a3af3cb1a"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1</td>\n",
|
|
" <td>2</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>3</td>\n",
|
|
" <td>4</td>\n",
|
|
" <td>None</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>5</td>\n",
|
|
" <td>6</td>\n",
|
|
" <td>False</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>7</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>9</td>\n",
|
|
" <td>10</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 1 2 True\n",
|
|
"1 3 4 None\n",
|
|
"2 5 6 False\n",
|
|
"3 7 8 True\n",
|
|
"4 9 10 True"
|
|
]
|
|
},
|
|
"execution_count": 28,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_mode = pd.DataFrame([[1,2,\"True\"],\n",
|
|
" [3,4,None],\n",
|
|
" [5,6,\"False\"],\n",
|
|
" [7,8,\"True\"],\n",
|
|
" [9,10,\"True\"]])\n",
|
|
"\n",
|
|
"fill_with_mode"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "MLAoMQOfNPlA"
|
|
},
|
|
"source": [
|
|
"ಈಗ, ಮೊದಲು `None` ಮೌಲ್ಯವನ್ನು ಮೋಡ್ನೊಂದಿಗೆ ತುಂಬಿಸುವ ಮೊದಲು ಮೋಡ್ ಅನ್ನು ಕಂಡುಹಿಡಿಯೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 29,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "WKy-9Y2tN5jv",
|
|
"outputId": "8da9fa16-e08c-447e-dea1-d4b1db2feebf"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"True 3\n",
|
|
"False 1\n",
|
|
"Name: 2, dtype: int64"
|
|
]
|
|
},
|
|
"execution_count": 29,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_mode[2].value_counts()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "6iNz_zG_OKrx"
|
|
},
|
|
"source": [
|
|
"ಹೀಗಾಗಿ, ನಾವು None ಅನ್ನು True ಮೂಲಕ ಬದಲಾಯಿಸುವೆವು\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 30,
|
|
"metadata": {
|
|
"id": "TxPKteRvNPOs"
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"fill_with_mode[2].fillna('True',inplace=True)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 31,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "tvas7c9_OPWE",
|
|
"outputId": "ec3c8e44-d644-475e-9e22-c65101965850"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1</td>\n",
|
|
" <td>2</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>3</td>\n",
|
|
" <td>4</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>5</td>\n",
|
|
" <td>6</td>\n",
|
|
" <td>False</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>7</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>9</td>\n",
|
|
" <td>10</td>\n",
|
|
" <td>True</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 1 2 True\n",
|
|
"1 3 4 True\n",
|
|
"2 5 6 False\n",
|
|
"3 7 8 True\n",
|
|
"4 9 10 True"
|
|
]
|
|
},
|
|
"execution_count": 31,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_mode"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "SktitLxxOR16"
|
|
},
|
|
"source": [
|
|
"ನಾವು ನೋಡಬಹುದು, ನಲ್ ಮೌಲ್ಯವನ್ನು ಬದಲಾಯಿಸಲಾಗಿದೆ. ಹೇಳಬೇಕಾಗಿಲ್ಲ, ನಾವು ಯಾವುದೇ ವಾಕ್ಯವನ್ನು `'True'` ಬದಲು ಬರೆಯಬಹುದು ಮತ್ತು ಅದು ಬದಲಾಯಿಸಲಾಗುತ್ತಿತ್ತು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "heYe1I0dOmQ_"
|
|
},
|
|
"source": [
|
|
"### ಸಂಖ್ಯಾತ್ಮಕ ಡೇಟಾ\n",
|
|
"ಈಗ, ಸಂಖ್ಯಾತ್ಮಕ ಡೇಟಾಕ್ಕೆ ಬನ್ನೋಣ. ಇಲ್ಲಿ, ನಾವು ಕಾಣುವ ಎರಡು ಸಾಮಾನ್ಯ ವಿಧಾನಗಳು ಇಲ್ಲಿವೆ:\n",
|
|
"\n",
|
|
"1. ಸಾಲಿನ ಮಧ್ಯಮ ಮೌಲ್ಯದಿಂದ ಬದಲಾಯಿಸುವುದು\n",
|
|
"2. ಸಾಲಿನ ಸರಾಸರಿ ಮೌಲ್ಯದಿಂದ ಬದಲಾಯಿಸುವುದು\n",
|
|
"\n",
|
|
"ನಾವು ಮಧ್ಯಮ ಮೌಲ್ಯದಿಂದ ಬದಲಾಯಿಸುವುದು, ಹೊರಗಿನ ಮೌಲ್ಯಗಳೊಂದಿಗೆ ತಿರುವುಳ್ಳ ಡೇಟಾದಲ್ಲಿ ಮಾಡುತ್ತೇವೆ. ಇದಕ್ಕೆ ಕಾರಣ ಮಧ್ಯಮವು ಹೊರಗಿನ ಮೌಲ್ಯಗಳಿಗೆ ಪ್ರತಿರೋಧಕವಾಗಿರುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಡೇಟಾ ಸಾಮಾನ್ಯೀಕೃತವಾಗಿದ್ದಾಗ, ನಾವು ಸರಾಸರಿಯನ್ನು ಬಳಸಬಹುದು, ಏಕೆಂದರೆ ಆ ಸಂದರ್ಭದಲ್ಲಿ ಸರಾಸರಿ ಮತ್ತು ಮಧ್ಯಮವು ಬಹಳ ಸಮೀಪವಾಗಿರುತ್ತವೆ.\n",
|
|
"\n",
|
|
"ಮೊದಲು, ನಾವು ಸಾಮಾನ್ಯವಾಗಿ ಹಂಚಿಕೆಯಾದ ಒಂದು ಕಾಲಮ್ ತೆಗೆದುಕೊಳ್ಳೋಣ ಮತ್ತು ಆ ಕಾಲಮ್ನ ಸರಾಸರಿ ಮೌಲ್ಯದಿಂದ ಕಾಣೆಯಾದ ಮೌಲ್ಯವನ್ನು ತುಂಬೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 32,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "09HM_2feOj5Y",
|
|
"outputId": "7e309013-9acb-411c-9b06-4de795bbeeff"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>-2.0</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>-1.0</td>\n",
|
|
" <td>2</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>4</td>\n",
|
|
" <td>5</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>6</td>\n",
|
|
" <td>7</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>9</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 -2.0 0 1\n",
|
|
"1 -1.0 2 3\n",
|
|
"2 NaN 4 5\n",
|
|
"3 1.0 6 7\n",
|
|
"4 2.0 8 9"
|
|
]
|
|
},
|
|
"execution_count": 32,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_mean = pd.DataFrame([[-2,0,1],\n",
|
|
" [-1,2,3],\n",
|
|
" [np.nan,4,5],\n",
|
|
" [1,6,7],\n",
|
|
" [2,8,9]])\n",
|
|
"\n",
|
|
"fill_with_mean"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "ka7-wNfzSxbx"
|
|
},
|
|
"source": [
|
|
"ಕಾಲಮ್ನ ಸರಾಸರಿ ಎಂದರೆ\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 33,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "XYtYEf5BSxFL",
|
|
"outputId": "68a78d18-f0e5-4a9a-a959-2c3676a57c70"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"0.0"
|
|
]
|
|
},
|
|
"execution_count": 33,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"np.mean(fill_with_mean[0])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "oBSRGxKRS39K"
|
|
},
|
|
"source": [
|
|
"ಸರಾಸರಿ ಬಳಸಿ ತುಂಬುವುದು\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 34,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "FzncQLmuS5jh",
|
|
"outputId": "00f74fff-01f4-4024-c261-796f50f01d2e"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>-2.0</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>-1.0</td>\n",
|
|
" <td>2</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>0.0</td>\n",
|
|
" <td>4</td>\n",
|
|
" <td>5</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>6</td>\n",
|
|
" <td>7</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>9</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 -2.0 0 1\n",
|
|
"1 -1.0 2 3\n",
|
|
"2 0.0 4 5\n",
|
|
"3 1.0 6 7\n",
|
|
"4 2.0 8 9"
|
|
]
|
|
},
|
|
"execution_count": 34,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_mean[0].fillna(np.mean(fill_with_mean[0]),inplace=True)\n",
|
|
"fill_with_mean"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "CwpVFCrPTC5z"
|
|
},
|
|
"source": [
|
|
"ನಾವು ನೋಡಬಹುದು, ಕಳೆದುಹೋಗಿರುವ ಮೌಲ್ಯವನ್ನು ಅದರ ಸರಾಸರಿಯಿಂದ ಬದಲಾಯಿಸಲಾಗಿದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "jIvF13a1i00Z"
|
|
},
|
|
"source": [
|
|
"ಈಗ ನಾವು ಮತ್ತೊಂದು ಡೇಟಾಫ್ರೇಮ್ ಅನ್ನು ಪ್ರಯತ್ನಿಸೋಣ, ಮತ್ತು ಈ ಬಾರಿ ನಾವು None ಮೌಲ್ಯಗಳನ್ನು ಕಾಲಮ್ನ ಮಧ್ಯಮ ಮೌಲ್ಯದಿಂದ ಬದಲಾಯಿಸುವೆವು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 35,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "DA59Bqo3jBYZ",
|
|
"outputId": "85dae6ec-7394-4c36-fda0-e04769ec4a32"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>-2</td>\n",
|
|
" <td>0.0</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>-1</td>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>0</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>5</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>1</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>7</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>2</td>\n",
|
|
" <td>8.0</td>\n",
|
|
" <td>9</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 -2 0.0 1\n",
|
|
"1 -1 2.0 3\n",
|
|
"2 0 NaN 5\n",
|
|
"3 1 6.0 7\n",
|
|
"4 2 8.0 9"
|
|
]
|
|
},
|
|
"execution_count": 35,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_median = pd.DataFrame([[-2,0,1],\n",
|
|
" [-1,2,3],\n",
|
|
" [0,np.nan,5],\n",
|
|
" [1,6,7],\n",
|
|
" [2,8,9]])\n",
|
|
"\n",
|
|
"fill_with_median"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "mM1GpXYmjHnc"
|
|
},
|
|
"source": [
|
|
"ಎರಡನೇ ಕಾಲಮ್ನ ಮಧ್ಯಮ ಮೌಲ್ಯವೇನು\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 36,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "uiDy5v3xjHHX",
|
|
"outputId": "564b6b74-2004-4486-90d4-b39330a64b88"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"4.0"
|
|
]
|
|
},
|
|
"execution_count": 36,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_median[1].median()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "z9PLF75Jj_1s"
|
|
},
|
|
"source": [
|
|
"ಮಧ್ಯಮ ಮೌಲ್ಯದಿಂದ ತುಂಬುವುದು\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 37,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "lFKbOxCMkBbg",
|
|
"outputId": "a8bd18fb-2765-47d4-e5fe-e965f57ed1f4"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>-2</td>\n",
|
|
" <td>0.0</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>-1</td>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>0</td>\n",
|
|
" <td>4.0</td>\n",
|
|
" <td>5</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>1</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>7</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>2</td>\n",
|
|
" <td>8.0</td>\n",
|
|
" <td>9</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2\n",
|
|
"0 -2 0.0 1\n",
|
|
"1 -1 2.0 3\n",
|
|
"2 0 4.0 5\n",
|
|
"3 1 6.0 7\n",
|
|
"4 2 8.0 9"
|
|
]
|
|
},
|
|
"execution_count": 37,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"fill_with_median[1].fillna(fill_with_median[1].median(),inplace=True)\n",
|
|
"fill_with_median"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "8JtQ53GSkKWC"
|
|
},
|
|
"source": [
|
|
"ನಾವು ನೋಡಬಹುದು, NaN ಮೌಲ್ಯವನ್ನು ಕಾಲಮ್ನ ಮಧ್ಯಮ ಮೌಲ್ಯದಿಂದ ಬದಲಾಯಿಸಲಾಗಿದೆ\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 38,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "0ybtWLDdgRsG",
|
|
"outputId": "b8c238ef-6024-4ee2-be2b-aa1f0fcac61d",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"a 1.0\n",
|
|
"b NaN\n",
|
|
"c 2.0\n",
|
|
"d NaN\n",
|
|
"e 3.0\n",
|
|
"dtype: float64"
|
|
]
|
|
},
|
|
"execution_count": 38,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example5 = pd.Series([1, np.nan, 2, None, 3], index=list('abcde'))\n",
|
|
"example5"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "yrsigxRggRsH"
|
|
},
|
|
"source": [
|
|
"ನೀವು ಎಲ್ಲಾ ಶೂನ್ಯ ಎಂಟ್ರಿಗಳನ್ನು ಒಂದೇ ಮೌಲ್ಯದಿಂದ ತುಂಬಬಹುದು, ಉದಾಹರಣೆಗೆ `0`:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 39,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "KXMIPsQdgRsH",
|
|
"outputId": "aeedfa0a-a421-4c2f-cb0d-183ce8f0c91d",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"a 1.0\n",
|
|
"b 0.0\n",
|
|
"c 2.0\n",
|
|
"d 0.0\n",
|
|
"e 3.0\n",
|
|
"dtype: float64"
|
|
]
|
|
},
|
|
"execution_count": 39,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example5.fillna(0)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "RRlI5f_hkfKe"
|
|
},
|
|
"source": [
|
|
"> ಮುಖ್ಯ ಅಂಶಗಳು:\n",
|
|
"1. ಕಡತದ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬುವುದು ಕಡತದ ಡೇಟಾ ಕಡಿಮೆ ಇದ್ದಾಗ ಅಥವಾ ಕಡತದ ಡೇಟಾವನ್ನು ತುಂಬಲು ಯಾವುದೇ ತಂತ್ರವಿದ್ದಾಗ ಮಾಡಬೇಕು.\n",
|
|
"2. ಡೊಮೇನ್ ಜ್ಞಾನವನ್ನು ಬಳಸಿ ಕಡತದ ಮೌಲ್ಯಗಳನ್ನು ಅಂದಾಜು ಮಾಡಿ ತುಂಬಬಹುದು.\n",
|
|
"3. ವರ್ಗೀಕೃತ ಡೇಟಾದಲ್ಲಿ, ಬಹುಮಟ್ಟಿಗೆ, ಕಡತದ ಮೌಲ್ಯಗಳನ್ನು ಆ ಕಾಲಮ್ನ ಮೋಡ್ನಿಂದ ಬದಲಿಸಲಾಗುತ್ತದೆ.\n",
|
|
"4. ಸಂಖ್ಯಾತ್ಮಕ ಡೇಟಾದಲ್ಲಿ, ಕಡತದ ಮೌಲ್ಯಗಳನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಸರಾಸರಿ (ಸಾಮಾನ್ಯೀಕೃತ ಡೇಟಾಸೆಟ್ಗಳಿಗೆ) ಅಥವಾ ಕಾಲಮ್ಗಳ ಮಧ್ಯಮ ಮೌಲ್ಯದಿಂದ ತುಂಬಲಾಗುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "FI9MmqFJgRsH"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 40,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "af-ezpXdgRsH",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# What happens if you try to fill null values with a string, like ''?\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "kq3hw1kLgRsI"
|
|
},
|
|
"source": [
|
|
"ನೀವು **ಮುಂದಿನ-ಪೂರಣೆ** ಶೂನ್ಯ ಮೌಲ್ಯಗಳನ್ನು ಮಾಡಬಹುದು, ಅಂದರೆ ಶೂನ್ಯವನ್ನು ತುಂಬಲು ಕೊನೆಯ ಮಾನ್ಯ ಮೌಲ್ಯವನ್ನು ಬಳಸುವುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 41,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "vO3BuNrggRsI",
|
|
"outputId": "e2bc591b-0b48-4e88-ee65-754f2737c196",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"a 1.0\n",
|
|
"b 1.0\n",
|
|
"c 2.0\n",
|
|
"d 2.0\n",
|
|
"e 3.0\n",
|
|
"dtype: float64"
|
|
]
|
|
},
|
|
"execution_count": 41,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example5.fillna(method='ffill')"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "nDXeYuHzgRsI"
|
|
},
|
|
"source": [
|
|
"ನೀವು ಮುಂದಿನ ಮಾನ್ಯ ಮೌಲ್ಯವನ್ನು ಹಿಂಬಾಲಿಸಿ ಶೂನ್ಯವನ್ನು ತುಂಬಲು **ಬ್ಯಾಕ್-ಫಿಲ್** ಕೂಡ ಮಾಡಬಹುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 42,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "4M5onHcEgRsI",
|
|
"outputId": "8f32b185-40dd-4a9f-bd85-54d6b6a414fe",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"a 1.0\n",
|
|
"b 2.0\n",
|
|
"c 2.0\n",
|
|
"d 3.0\n",
|
|
"e 3.0\n",
|
|
"dtype: float64"
|
|
]
|
|
},
|
|
"execution_count": 42,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example5.fillna(method='bfill')"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "MbBzTom5gRsI"
|
|
},
|
|
"source": [
|
|
"ನೀವು ಊಹಿಸಬಹುದು, ಇದು DataFrames ಜೊತೆಗೆ ಕೂಡ ಇದೇ ರೀತಿಯಲ್ಲಿ ಕೆಲಸ ಮಾಡುತ್ತದೆ, ಆದರೆ ನೀವು null ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಲು `axis` ಅನ್ನು ಕೂಡ ನಿರ್ದಿಷ್ಟಪಡಿಸಬಹುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 43,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "aRpIvo4ZgRsI",
|
|
"outputId": "905a980a-a808-4eca-d0ba-224bd7d85955",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" <th>3</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>7</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>9</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2 3\n",
|
|
"0 1.0 NaN 7 NaN\n",
|
|
"1 2.0 5.0 8 NaN\n",
|
|
"2 NaN 6.0 9 NaN"
|
|
]
|
|
},
|
|
"execution_count": 43,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 44,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "VM1qtACAgRsI",
|
|
"outputId": "71f2ad28-9b4e-4ff4-f5c3-e731eb489ade",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" <th>3</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>7.0</td>\n",
|
|
" <td>7.0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8.0</td>\n",
|
|
" <td>8.0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>NaN</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>9.0</td>\n",
|
|
" <td>9.0</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2 3\n",
|
|
"0 1.0 1.0 7.0 7.0\n",
|
|
"1 2.0 5.0 8.0 8.0\n",
|
|
"2 NaN 6.0 9.0 9.0"
|
|
]
|
|
},
|
|
"execution_count": 44,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4.fillna(method='ffill', axis=1)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "ZeMc-I1EgRsI"
|
|
},
|
|
"source": [
|
|
"ಹಿಂದಿನ ಮೌಲ್ಯವು ಮುಂದಿನ ಭರ್ತಿಗೆ ಲಭ್ಯವಿಲ್ಲದಿದ್ದಾಗ, ಶೂನ್ಯ ಮೌಲ್ಯ ಉಳಿಯುತ್ತದೆ ಎಂದು ಗಮನಿಸಿ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "eeAoOU0RgRsJ"
|
|
},
|
|
"source": [
|
|
"### ವ್ಯಾಯಾಮ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 45,
|
|
"metadata": {
|
|
"collapsed": true,
|
|
"id": "e8S-CjW8gRsJ",
|
|
"trusted": false
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"# What output does example4.fillna(method='bfill', axis=1) produce?\n",
|
|
"# What about example4.fillna(method='ffill') or example4.fillna(method='bfill')?\n",
|
|
"# Can you think of a longer code snippet to write that can fill all of the null values in example4?\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "YHgy0lIrgRsJ"
|
|
},
|
|
"source": [
|
|
"ನೀವು `fillna` ಅನ್ನು ಬಳಸುವ ಬಗ್ಗೆ ಸೃಜನಶೀಲವಾಗಿರಬಹುದು. ಉದಾಹರಣೆಗೆ, ಮತ್ತೆ `example4` ಅನ್ನು ನೋಡೋಣ, ಆದರೆ ಈ ಬಾರಿ `DataFrame` ನಲ್ಲಿ ಇರುವ ಎಲ್ಲಾ ಮೌಲ್ಯಗಳ ಸರಾಸರಿಯನ್ನು ಬಳಸಿಕೊಂಡು ಕಳೆದುಹೋಗಿರುವ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬೋಣ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 46,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "OtYVErEygRsJ",
|
|
"outputId": "708b1e67-45ca-44bf-a5ee-8b2de09ece73",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>0</th>\n",
|
|
" <th>1</th>\n",
|
|
" <th>2</th>\n",
|
|
" <th>3</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>1.0</td>\n",
|
|
" <td>5.5</td>\n",
|
|
" <td>7</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>2.0</td>\n",
|
|
" <td>5.0</td>\n",
|
|
" <td>8</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>1.5</td>\n",
|
|
" <td>6.0</td>\n",
|
|
" <td>9</td>\n",
|
|
" <td>NaN</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" 0 1 2 3\n",
|
|
"0 1.0 5.5 7 NaN\n",
|
|
"1 2.0 5.0 8 NaN\n",
|
|
"2 1.5 6.0 9 NaN"
|
|
]
|
|
},
|
|
"execution_count": 46,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example4.fillna(example4.mean())"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "zpMvCkLSgRsJ"
|
|
},
|
|
"source": [
|
|
"ಕಾಲಮ್ 3 ಇನ್ನೂ ಮೌಲ್ಯರಹಿತವಾಗಿದೆ ಎಂದು ಗಮನಿಸಿ: ಡೀಫಾಲ್ಟ್ ದಿಕ್ಕು ಮೌಲ್ಯಗಳನ್ನು ಸಾಲು-ವಾರಿಯಾಗಿ ತುಂಬುವುದು.\n",
|
|
"\n",
|
|
"> **ಮುಖ್ಯಾಂಶ:** ನಿಮ್ಮ ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ ಕಾಣಿಸದ ಮೌಲ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸಲು ಹಲವಾರು ವಿಧಾನಗಳಿವೆ. ನೀವು ಬಳಸುವ ನಿರ್ದಿಷ್ಟ ತಂತ್ರ (ಅವುಗಳನ್ನು ತೆಗೆದುಹಾಕುವುದು, ಬದಲಾಯಿಸುವುದು, ಅಥವಾ ಬದಲಾಯಿಸುವ ವಿಧಾನವೇನಾಗಿರಲಿ) ಆ ಡೇಟಾದ ವಿಶೇಷತೆಯಿಂದ ನಿರ್ಧರಿಸಬೇಕು. ನೀವು ಡೇಟಾಸೆಟ್ಗಳನ್ನು ಹೆಚ್ಚು ಹ್ಯಾಂಡಲ್ ಮಾಡಿ, ಸಂವಹನ ಮಾಡುತ್ತಾ ಹೋಗುವಂತೆ ಕಾಣಿಸದ ಮೌಲ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಉತ್ತಮ ಜ್ಞಾನವನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸುತ್ತೀರಿ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "bauDnESIl9FH"
|
|
},
|
|
"source": [
|
|
"### ವರ್ಗೀಕೃತ ಡೇಟಾವನ್ನು ಎನ್ಕೋಡ್ ಮಾಡುವುದು\n",
|
|
"\n",
|
|
"ಯಂತ್ರ ಅಧ್ಯಯನ ಮಾದರಿಗಳು ಸಂಖ್ಯೆಗಳನ್ನೇ ಮಾತ್ರ ಹ್ಯಾಂಡಲ್ ಮಾಡುತ್ತವೆ ಮತ್ತು ಯಾವುದೇ ರೀತಿಯ ಸಂಖ್ಯಾತ್ಮಕ ಡೇಟಾವನ್ನೇ ಮಾತ್ರ. ಅದು ಹೌದು ಮತ್ತು ಇಲ್ಲದ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಹೇಳಲು ಸಾಧ್ಯವಿಲ್ಲ, ಆದರೆ 0 ಮತ್ತು 1 ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರುತಿಸಲು ಸಾಧ್ಯ. ಆದ್ದರಿಂದ, ಕಳೆದುಹೋಗಿರುವ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬಿದ ನಂತರ, ಮಾದರಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ವರ್ಗೀಕೃತ ಡೇಟಾವನ್ನು ಕೆಲವು ಸಂಖ್ಯಾತ್ಮಕ ರೂಪಕ್ಕೆ ಎನ್ಕೋಡ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಎನ್ಕೋಡಿಂಗ್ ಎರಡು ರೀತಿಗಳಲ್ಲಿ ಮಾಡಬಹುದು. ನಾವು ಅವುಗಳನ್ನು ಮುಂದಿನ ಭಾಗದಲ್ಲಿ ಚರ್ಚಿಸುವೆವು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "uDq9SxB7mu5i"
|
|
},
|
|
"source": [
|
|
"**ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್**\n",
|
|
"\n",
|
|
"\n",
|
|
"ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್ ಅಂದರೆ ಪ್ರತಿ ವರ್ಗವನ್ನು ಸಂಖ್ಯೆಗಾಗಿಸುವುದು. ಉದಾಹರಣೆಗೆ, ನಮ್ಮ ಬಳಿ ವಿಮಾನಯಾನ ಪ್ರಯಾಣಿಕರ ಡೇಟಾಸೆಟ್ ಇದ್ದು, ಅದರಲ್ಲೊಂದು ಕಾಲಮ್ನಲ್ಲಿ ಅವರ ವರ್ಗ ['ಬಿಸಿನೆಸ್ ಕ್ಲಾಸ್', 'ಇಕಾನಮಿ ಕ್ಲಾಸ್', 'ಫಸ್ಟ್ ಕ್ಲಾಸ್'] ಇರುತ್ತದೆ ಎಂದು ಹೇಳೋಣ. ಈ ಮೇಲೆ ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್ ಮಾಡಿದರೆ, ಇದು [0,1,2] ಆಗಿ ಪರಿವರ್ತಿತವಾಗುತ್ತದೆ. ಕೋಡ್ ಮೂಲಕ ಉದಾಹರಣೆಯನ್ನು ನೋಡೋಣ. ಮುಂದಿನ ನೋಟ್ಬುಕ್ಗಳಲ್ಲಿ ನಾವು `scikit-learn` ಅನ್ನು ಕಲಿಯಲಿದ್ದೇವೆ, ಆದ್ದರಿಂದ ಇಲ್ಲಿ ಅದನ್ನು ಬಳಸುವುದಿಲ್ಲ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 47,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 235
|
|
},
|
|
"id": "1vGz7uZyoWHL",
|
|
"outputId": "9e252855-d193-4103-a54d-028ea7787b34"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>ID</th>\n",
|
|
" <th>class</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>10</td>\n",
|
|
" <td>business class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>20</td>\n",
|
|
" <td>first class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>30</td>\n",
|
|
" <td>economy class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>40</td>\n",
|
|
" <td>economy class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>50</td>\n",
|
|
" <td>economy class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>5</th>\n",
|
|
" <td>60</td>\n",
|
|
" <td>business class</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" ID class\n",
|
|
"0 10 business class\n",
|
|
"1 20 first class\n",
|
|
"2 30 economy class\n",
|
|
"3 40 economy class\n",
|
|
"4 50 economy class\n",
|
|
"5 60 business class"
|
|
]
|
|
},
|
|
"execution_count": 47,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"label = pd.DataFrame([\n",
|
|
" [10,'business class'],\n",
|
|
" [20,'first class'],\n",
|
|
" [30, 'economy class'],\n",
|
|
" [40, 'economy class'],\n",
|
|
" [50, 'economy class'],\n",
|
|
" [60, 'business class']\n",
|
|
"],columns=['ID','class'])\n",
|
|
"label"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "IDHnkwTYov-h"
|
|
},
|
|
"source": [
|
|
"ಮೊದಲ ಕಾಲಮ್ನಲ್ಲಿ ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್ ಮಾಡಲು, ಪ್ರತಿಯೊಂದು ವರ್ಗವನ್ನು ಒಂದು ಸಂಖ್ಯೆಗೆ ನಕ್ಷೆ ಮಾಡಬೇಕಾಗುತ್ತದೆ, ಅದನ್ನು ಬದಲಾಯಿಸುವ ಮೊದಲು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 48,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 235
|
|
},
|
|
"id": "ZC5URJG3o1ES",
|
|
"outputId": "aab0f1e7-e0f3-4c14-8459-9f9168c85437"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>ID</th>\n",
|
|
" <th>class</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>10</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>20</td>\n",
|
|
" <td>2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>30</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>40</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>50</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>5</th>\n",
|
|
" <td>60</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" ID class\n",
|
|
"0 10 0\n",
|
|
"1 20 2\n",
|
|
"2 30 1\n",
|
|
"3 40 1\n",
|
|
"4 50 1\n",
|
|
"5 60 0"
|
|
]
|
|
},
|
|
"execution_count": 48,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"class_labels = {'business class':0,'economy class':1,'first class':2}\n",
|
|
"label['class'] = label['class'].replace(class_labels)\n",
|
|
"label"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "ftnF-TyapOPt"
|
|
},
|
|
"source": [
|
|
"ನಾವು ನೋಡಬಹುದು, ಔಟ್ಪುಟ್ ನಾವು ಭಾವಿಸಿದ್ದದಕ್ಕೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ. ಆದ್ದರಿಂದ, ನಾವು ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್ ಅನ್ನು ಯಾವಾಗ ಬಳಸುತ್ತೇವೆ? ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್ ಕೆಳಗಿನ ಯಾವುದೇ ಒಂದು ಅಥವಾ ಎರಡೂ ಸಂದರ್ಭಗಳಲ್ಲಿ ಬಳಸಲಾಗುತ್ತದೆ:\n",
|
|
"1. ವರ್ಗಗಳ ಸಂಖ್ಯೆ ಹೆಚ್ಚು ಇದ್ದಾಗ\n",
|
|
"2. ವರ್ಗಗಳು ಕ್ರಮದಲ್ಲಿ ಇದ್ದಾಗ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "eQPAPVwsqWT7"
|
|
},
|
|
"source": [
|
|
"**ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್**\n",
|
|
"\n",
|
|
"ಮತ್ತೊಂದು ಎನ್ಕೋಡಿಂಗ್ ಪ್ರಕಾರವು ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್ ಆಗಿದೆ. ಈ ಎನ್ಕೋಡಿಂಗ್ ಪ್ರಕಾರದಲ್ಲಿ, ಕಾಲಮ್ನ ಪ್ರತಿ ವರ್ಗವನ್ನು ಪ್ರತ್ಯೇಕ ಕಾಲಮ್ ಆಗಿ ಸೇರಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಡೇಟಾಪಾಯಿಂಟ್ ಆ ವರ್ಗವನ್ನು ಹೊಂದಿದೆಯೇ ಎಂಬುದರ ಆಧಾರದ ಮೇಲೆ 0 ಅಥವಾ 1 ಅನ್ನು ಪಡೆಯುತ್ತದೆ. ಆದ್ದರಿಂದ, n ವಿಭಿನ್ನ ವರ್ಗಗಳಿದ್ದರೆ, n ಕಾಲಮ್ಗಳು ಡೇಟಾಫ್ರೇಮ್ಗೆ ಸೇರಿಸಲಾಗುತ್ತದೆ.\n",
|
|
"\n",
|
|
"ಉದಾಹರಣೆಗೆ, ನಾವು ಅದೇ ವಿಮಾನ ತರಗತಿ ಉದಾಹರಣೆಯನ್ನು ತೆಗೆದುಕೊಳ್ಳೋಣ. ವರ್ಗಗಳು ಇವು: ['ಬಿಸಿನೆಸ್ ಕ್ಲಾಸ್', 'ಇಕಾನಮಿ ಕ್ಲಾಸ್', 'ಫಸ್ಟ್ ಕ್ಲಾಸ್']. ಆದ್ದರಿಂದ, ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್ ಮಾಡಿದರೆ, ಕೆಳಗಿನ ಮೂರು ಕಾಲಮ್ಗಳು ಡೇಟಾಸೆಟ್ಗೆ ಸೇರಿಸಲಾಗುತ್ತದೆ: ['class_ಬಿಸಿನೆಸ್ ಕ್ಲಾಸ್', 'class_ಇಕಾನಮಿ ಕ್ಲಾಸ್', 'class_ಫಸ್ಟ್ ಕ್ಲಾಸ್'].\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 49,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 235
|
|
},
|
|
"id": "ZM0eVh0ArKUL",
|
|
"outputId": "83238a76-b3a5-418d-c0b6-605b02b6891b"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>ID</th>\n",
|
|
" <th>class</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>10</td>\n",
|
|
" <td>business class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>20</td>\n",
|
|
" <td>first class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>30</td>\n",
|
|
" <td>economy class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>40</td>\n",
|
|
" <td>economy class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>50</td>\n",
|
|
" <td>economy class</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>5</th>\n",
|
|
" <td>60</td>\n",
|
|
" <td>business class</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" ID class\n",
|
|
"0 10 business class\n",
|
|
"1 20 first class\n",
|
|
"2 30 economy class\n",
|
|
"3 40 economy class\n",
|
|
"4 50 economy class\n",
|
|
"5 60 business class"
|
|
]
|
|
},
|
|
"execution_count": 49,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"one_hot = pd.DataFrame([\n",
|
|
" [10,'business class'],\n",
|
|
" [20,'first class'],\n",
|
|
" [30, 'economy class'],\n",
|
|
" [40, 'economy class'],\n",
|
|
" [50, 'economy class'],\n",
|
|
" [60, 'business class']\n",
|
|
"],columns=['ID','class'])\n",
|
|
"one_hot"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "aVnZ7paDrWmb"
|
|
},
|
|
"source": [
|
|
"ನಾವು ಮೊದಲ ಕಾಲಮ್ ಮೇಲೆ ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್ ಮಾಡೋಣ\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 50,
|
|
"metadata": {
|
|
"id": "RUPxf7egrYKr"
|
|
},
|
|
"outputs": [],
|
|
"source": [
|
|
"one_hot_data = pd.get_dummies(one_hot,columns=['class'])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 51,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 235
|
|
},
|
|
"id": "TM37pHsFr4ge",
|
|
"outputId": "7be15f53-79b2-447a-979c-822658339a9e"
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>ID</th>\n",
|
|
" <th>class_business class</th>\n",
|
|
" <th>class_economy class</th>\n",
|
|
" <th>class_first class</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>10</td>\n",
|
|
" <td>1</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>20</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>30</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>1</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>40</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>1</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>50</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>1</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>5</th>\n",
|
|
" <td>60</td>\n",
|
|
" <td>1</td>\n",
|
|
" <td>0</td>\n",
|
|
" <td>0</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" ID class_business class class_economy class class_first class\n",
|
|
"0 10 1 0 0\n",
|
|
"1 20 0 0 1\n",
|
|
"2 30 0 1 0\n",
|
|
"3 40 0 1 0\n",
|
|
"4 50 0 1 0\n",
|
|
"5 60 1 0 0"
|
|
]
|
|
},
|
|
"execution_count": 51,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"one_hot_data"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "_zXRLOjXujdA"
|
|
},
|
|
"source": [
|
|
"ಪ್ರತಿ ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡ್ ಮಾಡಿದ ಕಾಲಮ್ 0 ಅಥವಾ 1 ಅನ್ನು ಹೊಂದಿರುತ್ತದೆ, ಇದು ಆ ಡೇಟಾಪಾಯಿಂಟ್ಗೆ ಆ ವರ್ಗವು ಅಸ್ತಿತ್ವದಲ್ಲಿದೆಯೇ ಎಂದು ಸೂಚಿಸುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "bDnC4NQOu0qr"
|
|
},
|
|
"source": [
|
|
"ನಾವು ಯಾವಾಗ ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್ ಅನ್ನು ಬಳಸುತ್ತೇವೆ? ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್ ಕೆಳಗಿನ ಯಾವುದೇ ಅಥವಾ ಎರಡೂ ಸಂದರ್ಭಗಳಲ್ಲಿ ಬಳಸಲಾಗುತ್ತದೆ:\n",
|
|
"\n",
|
|
"1. ವರ್ಗಗಳ ಸಂಖ್ಯೆ ಮತ್ತು ಡೇಟಾಸೆಟ್ನ ಗಾತ್ರವು ಚಿಕ್ಕದಾಗಿರುವಾಗ.\n",
|
|
"2. ವರ್ಗಗಳು ಯಾವುದೇ ನಿರ್ದಿಷ್ಟ ಕ್ರಮವನ್ನು ಅನುಸರಿಸದಾಗ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "XnUmci_4uvyu"
|
|
},
|
|
"source": [
|
|
"> ಮುಖ್ಯ ಅಂಶಗಳು:\n",
|
|
"1. ಎನ್ಕೋಡಿಂಗ್ ಅನ್ನು ಅಂಕಿ ರಹಿತ ಡೇಟಾವನ್ನು ಅಂಕಿ ಡೇಟಾಗೆ ಪರಿವರ್ತಿಸಲು ಮಾಡಲಾಗುತ್ತದೆ.\n",
|
|
"2. ಎನ್ಕೋಡಿಂಗ್ನ ಎರಡು ವಿಧಗಳಿವೆ: ಲೇಬಲ್ ಎನ್ಕೋಡಿಂಗ್ ಮತ್ತು ಒನ್ ಹಾಟ್ ಎನ್ಕೋಡಿಂಗ್, ಇವುಗಳನ್ನೆಲ್ಲಾ ಡೇಟಾಸೆಟ್ನ ಅಗತ್ಯಗಳ ಆಧಾರದ ಮೇಲೆ ಮಾಡಬಹುದು.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "K8UXOJYRgRsJ"
|
|
},
|
|
"source": [
|
|
"## ನಕಲಿ ಡೇಟಾವನ್ನು ತೆಗೆದುಹಾಕುವುದು\n",
|
|
"\n",
|
|
"> **ಕಲಿಕೆಯ ಗುರಿ:** ಈ ಉಪವಿಭಾಗದ ಕೊನೆಯಲ್ಲಿ, ನೀವು ಡೇಟಾಫ್ರೇಮ್ಗಳಿಂದ ನಕಲಿ ಮೌಲ್ಯಗಳನ್ನು ಗುರುತಿಸುವುದು ಮತ್ತು ತೆಗೆದುಹಾಕುವುದರಲ್ಲಿ ಆರಾಮವಾಗಿರಬೇಕು.\n",
|
|
"\n",
|
|
"ಕಳೆದುಹೋಗಿರುವ ಡೇಟಾದ ಜೊತೆಗೆ, ನೀವು ನಿಜಜೀವನದ ಡೇಟಾಸೆಟ್ಗಳಲ್ಲಿ ನಕಲಿ ಡೇಟಾವನ್ನು ಸಹ συχνά ಎದುರಿಸುತ್ತೀರಿ. ಭಾಗ್ಯವಶಾತ್, pandas ನಕಲಿ ಎಂಟ್ರಿಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಮತ್ತು ತೆಗೆದುಹಾಕಲು ಸುಲಭವಾದ ವಿಧಾನವನ್ನು ಒದಗಿಸುತ್ತದೆ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "qrEG-Wa0gRsJ"
|
|
},
|
|
"source": [
|
|
"### ನಕಲುಗಳನ್ನು ಗುರುತಿಸುವುದು: `duplicated`\n",
|
|
"\n",
|
|
"ನೀವು pandas ನಲ್ಲಿ `duplicated` ವಿಧಾನವನ್ನು ಬಳಸಿಕೊಂಡು ಸುಲಭವಾಗಿ ನಕಲು ಮೌಲ್ಯಗಳನ್ನು ಗುರುತಿಸಬಹುದು, ಇದು ಒಂದು ಬೂಲಿಯನ್ ಮಾಸ್ಕ್ ಅನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ, ಅದು `DataFrame` ನಲ್ಲಿ ಒಂದು ಎಂಟ್ರಿ ಹಿಂದಿನದೊಂದಿಗಿನ ನಕಲು ಆಗಿದೆಯೇ ಎಂದು ಸೂಚಿಸುತ್ತದೆ. ಇದನ್ನು ಕಾರ್ಯಾಚರಣೆಯಲ್ಲಿ ನೋಡಲು ಮತ್ತೊಂದು ಉದಾಹರಣೆಯ `DataFrame` ಅನ್ನು ರಚಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 52,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 204
|
|
},
|
|
"id": "ZLu6FEnZgRsJ",
|
|
"outputId": "376512d1-d842-4db1-aea3-71052aeeecaf",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>letters</th>\n",
|
|
" <th>numbers</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>A</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>B</td>\n",
|
|
" <td>2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>2</th>\n",
|
|
" <td>A</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>B</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>4</th>\n",
|
|
" <td>B</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" letters numbers\n",
|
|
"0 A 1\n",
|
|
"1 B 2\n",
|
|
"2 A 1\n",
|
|
"3 B 3\n",
|
|
"4 B 3"
|
|
]
|
|
},
|
|
"execution_count": 52,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example6 = pd.DataFrame({'letters': ['A','B'] * 2 + ['B'],\n",
|
|
" 'numbers': [1, 2, 1, 3, 3]})\n",
|
|
"example6"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 53,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/"
|
|
},
|
|
"id": "cIduB5oBgRsK",
|
|
"outputId": "3da27b3d-4d69-4e1d-bb52-0af21bae87f2",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/plain": [
|
|
"0 False\n",
|
|
"1 False\n",
|
|
"2 True\n",
|
|
"3 False\n",
|
|
"4 True\n",
|
|
"dtype: bool"
|
|
]
|
|
},
|
|
"execution_count": 53,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example6.duplicated()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "0eDRJD4SgRsK"
|
|
},
|
|
"source": [
|
|
"### ನಕಲುಗಳನ್ನು ಬಿಟ್ಟಿಹಾಕುವುದು: `drop_duplicates`\n",
|
|
"`drop_duplicates` ಸರಳವಾಗಿ ಎಲ್ಲಾ `duplicated` ಮೌಲ್ಯಗಳು `False` ಆಗಿರುವ ಡೇಟಾದ ನಕಲನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 54,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 142
|
|
},
|
|
"id": "w_YPpqIqgRsK",
|
|
"outputId": "ac66bd2f-8671-4744-87f5-8b8d96553dea",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>letters</th>\n",
|
|
" <th>numbers</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>A</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>B</td>\n",
|
|
" <td>2</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>3</th>\n",
|
|
" <td>B</td>\n",
|
|
" <td>3</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" letters numbers\n",
|
|
"0 A 1\n",
|
|
"1 B 2\n",
|
|
"3 B 3"
|
|
]
|
|
},
|
|
"execution_count": 54,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example6.drop_duplicates()"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "69AqoCZAgRsK"
|
|
},
|
|
"source": [
|
|
"`duplicated` ಮತ್ತು `drop_duplicates` ಎರಡೂ ಡೀಫಾಲ್ಟ್ ಆಗಿ ಎಲ್ಲಾ ಕಾಲಮ್ಗಳನ್ನು ಪರಿಗಣಿಸುತ್ತವೆ ಆದರೆ ನೀವು ನಿಮ್ಮ `DataFrame` ನಲ್ಲಿ ಕೆಲವು ಕಾಲಮ್ಗಳ ಉಪಸಮೂಹವನ್ನು ಮಾತ್ರ ಪರಿಶೀಲಿಸಲು ಸೂಚಿಸಬಹುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": 55,
|
|
"metadata": {
|
|
"colab": {
|
|
"base_uri": "https://localhost:8080/",
|
|
"height": 111
|
|
},
|
|
"id": "BILjDs67gRsK",
|
|
"outputId": "ef6dcc08-db8b-4352-c44e-5aa9e2bec0d3",
|
|
"trusted": false
|
|
},
|
|
"outputs": [
|
|
{
|
|
"data": {
|
|
"text/html": [
|
|
"<div>\n",
|
|
"<style scoped>\n",
|
|
" .dataframe tbody tr th:only-of-type {\n",
|
|
" vertical-align: middle;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe tbody tr th {\n",
|
|
" vertical-align: top;\n",
|
|
" }\n",
|
|
"\n",
|
|
" .dataframe thead th {\n",
|
|
" text-align: right;\n",
|
|
" }\n",
|
|
"</style>\n",
|
|
"<table border=\"1\" class=\"dataframe\">\n",
|
|
" <thead>\n",
|
|
" <tr style=\"text-align: right;\">\n",
|
|
" <th></th>\n",
|
|
" <th>letters</th>\n",
|
|
" <th>numbers</th>\n",
|
|
" </tr>\n",
|
|
" </thead>\n",
|
|
" <tbody>\n",
|
|
" <tr>\n",
|
|
" <th>0</th>\n",
|
|
" <td>A</td>\n",
|
|
" <td>1</td>\n",
|
|
" </tr>\n",
|
|
" <tr>\n",
|
|
" <th>1</th>\n",
|
|
" <td>B</td>\n",
|
|
" <td>2</td>\n",
|
|
" </tr>\n",
|
|
" </tbody>\n",
|
|
"</table>\n",
|
|
"</div>"
|
|
],
|
|
"text/plain": [
|
|
" letters numbers\n",
|
|
"0 A 1\n",
|
|
"1 B 2"
|
|
]
|
|
},
|
|
"execution_count": 55,
|
|
"metadata": {},
|
|
"output_type": "execute_result"
|
|
}
|
|
],
|
|
"source": [
|
|
"example6.drop_duplicates(['letters'])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {
|
|
"id": "GvX4og1EgRsL"
|
|
},
|
|
"source": [
|
|
"> **ಮುಖ್ಯಾಂಶ:** ನಕಲಿ ಡೇಟಾವನ್ನು ತೆಗೆದುಹಾಕುವುದು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಪ್ರತಿಯೊಂದು ಡೇಟಾ-ವಿಜ್ಞಾನ ಯೋಜನೆಯಲ್ಲಿಯೂ ಅಗತ್ಯವಾದ ಭಾಗವಾಗಿದೆ. ನಕಲಿ ಡೇಟಾ ನಿಮ್ಮ ವಿಶ್ಲೇಷಣೆಯ ಫಲಿತಾಂಶಗಳನ್ನು ಬದಲಾಯಿಸಬಹುದು ಮತ್ತು ನಿಮಗೆ ತಪ್ಪು ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡಬಹುದು!\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"## ನೈಜ-ಜಗತ್ತಿನ ಡೇಟಾ ಗುಣಮಟ್ಟ ಪರಿಶೀಲನೆಗಳು\n",
|
|
"\n",
|
|
"> **ಕಲಿಕೆಯ ಗುರಿ:** ಈ ವಿಭಾಗದ ಕೊನೆಯಲ್ಲಿ, ನೀವು ಸಾಮಾನ್ಯ ನೈಜ-ಜಗತ್ತಿನ ಡೇಟಾ ಗುಣಮಟ್ಟ ಸಮಸ್ಯೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಿ ಸರಿಪಡಿಸುವಲ್ಲಿ ಆರಾಮವಾಗಿರಬೇಕು, ಇದರಲ್ಲಿ ಅಸಮಾನ ವರ್ಗೀಕೃತ ಮೌಲ್ಯಗಳು, ಅಸಾಮಾನ್ಯ ಸಂಖ್ಯಾತ್ಮಕ ಮೌಲ್ಯಗಳು (ಔಟ್ಲೈಯರ್ಗಳು), ಮತ್ತು ಬದಲಾವಣೆಗಳೊಂದಿಗೆ ನಕಲಿ ಘಟಕಗಳು ಸೇರಿವೆ.\n",
|
|
"\n",
|
|
"ಕಳೆದುಹೋಗಿರುವ ಮೌಲ್ಯಗಳು ಮತ್ತು ನಿಖರ ನಕಲುಗಳು ಸಾಮಾನ್ಯ ಸಮಸ್ಯೆಗಳಾಗಿದ್ದರೂ, ನೈಜ-ಜಗತ್ತಿನ ಡೇಟಾಸೆಟ್ಗಳು ಹೆಚ್ಚಾಗಿ ಸೂಕ್ಷ್ಮ ಸಮಸ್ಯೆಗಳನ್ನು ಹೊಂದಿರುತ್ತವೆ:\n",
|
|
"\n",
|
|
"1. **ಅಸಮಾನ ವರ್ಗೀಕೃತ ಮೌಲ್ಯಗಳು**: ಒಂದೇ ವರ್ಗವನ್ನು ವಿಭಿನ್ನವಾಗಿ ಬರೆಯುವುದು (ಉದಾ: \"USA\", \"U.S.A\", \"United States\")\n",
|
|
"2. **ಅಸಾಮಾನ್ಯ ಸಂಖ್ಯಾತ್ಮಕ ಮೌಲ್ಯಗಳು**: ಡೇಟಾ ನಮೂದಿಸುವ ದೋಷಗಳನ್ನು ಸೂಚಿಸುವ ಅತಿದೊಡ್ಡ ಔಟ್ಲೈಯರ್ಗಳು (ಉದಾ: ವಯಸ್ಸು = 999)\n",
|
|
"3. **ಸಮೀಪ ನಕಲಿ ಸಾಲುಗಳು**: ಸ್ವಲ್ಪ ಬದಲಾವಣೆಗಳೊಂದಿಗೆ ಒಂದೇ ಘಟಕವನ್ನು ಪ್ರತಿನಿಧಿಸುವ ದಾಖಲೆಗಳು\n",
|
|
"\n",
|
|
"ಈ ಸಮಸ್ಯೆಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಿ ನಿರ್ವಹಿಸುವ ತಂತ್ರಗಳನ್ನು ಅನ್ವೇಷಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### ಮಾದರಿ \"ಕಳಪೆ\" ಡೇಟಾಸೆಟ್ ರಚನೆ\n",
|
|
"\n",
|
|
"ಮೊದಲು, ನಾವು ಸಾಮಾನ್ಯವಾಗಿ ನಿಜವಾದ ಡೇಟಾದಲ್ಲಿ ಎದುರಿಸುವ ಸಮಸ್ಯೆಗಳ ಪ್ರಕಾರಗಳನ್ನೊಳಗೊಂಡ ಮಾದರಿ ಡೇಟಾಸೆಟ್ ಅನ್ನು ರಚಿಸೋಣ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"import pandas as pd\n",
|
|
"import numpy as np\n",
|
|
"\n",
|
|
"# Create a sample dataset with quality issues\n",
|
|
"dirty_data = pd.DataFrame({\n",
|
|
" 'customer_id': [1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12],\n",
|
|
" 'name': ['John Smith', 'Jane Doe', 'John Smith', 'Bob Johnson', \n",
|
|
" 'Alice Williams', 'Charlie Brown', 'John Smith', 'Eva Martinez',\n",
|
|
" 'Bob Johnson', 'Diana Prince', 'Frank Castle', 'Alice Williams'],\n",
|
|
" 'age': [25, 32, 25, 45, 28, 199, 25, 31, 45, 27, -5, 28],\n",
|
|
" 'country': ['USA', 'UK', 'U.S.A', 'Canada', 'USA', 'United Kingdom',\n",
|
|
" 'United States', 'Mexico', 'canada', 'USA', 'UK', 'usa'],\n",
|
|
" 'purchase_amount': [100.50, 250.00, 105.00, 320.00, 180.00, 90.00,\n",
|
|
" 102.00, 275.00, 325.00, 195.00, 410.00, 185.00]\n",
|
|
"})\n",
|
|
"\n",
|
|
"print(\"Sample 'Dirty' Dataset:\")\n",
|
|
"print(dirty_data)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### 1. ಅಸಮಾನ ವರ್ಗೀಕೃತ ಮೌಲ್ಯಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು\n",
|
|
"\n",
|
|
"`country` ಕಾಲಮ್ನಲ್ಲಿ ಒಂದೇ ದೇಶಗಳಿಗೆ ಹಲವಾರು ಪ್ರತಿನಿಧಾನಗಳಿವೆ ಎಂದು ಗಮನಿಸಿ. ಈ ಅಸಮಾನತೆಗಳನ್ನು ಗುರುತಿಸೋಣ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Check unique values in the country column\n",
|
|
"print(\"Unique country values:\")\n",
|
|
"print(dirty_data['country'].unique())\n",
|
|
"print(f\"\\nTotal unique values: {dirty_data['country'].nunique()}\")\n",
|
|
"\n",
|
|
"# Count occurrences of each variation\n",
|
|
"print(\"\\nValue counts:\")\n",
|
|
"print(dirty_data['country'].value_counts())"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"#### ವರ್ಗೀಕೃತ ಮೌಲ್ಯಗಳನ್ನು ಮಾನಕೀಕರಿಸುವುದು\n",
|
|
"\n",
|
|
"ನಾವು ಈ ಮೌಲ್ಯಗಳನ್ನು ಮಾನಕೀಕರಿಸಲು ಒಂದು ನಕ್ಷೆ ರಚಿಸಬಹುದು. ಸರಳ ವಿಧಾನವೆಂದರೆ ಸಣ್ಣ ಅಕ್ಷರಗಳಿಗೆ ಪರಿವರ್ತಿಸಿ ಮತ್ತು ನಕ್ಷೆ ಡಿಕ್ಷನರಿ ರಚಿಸುವುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Create a standardization mapping\n",
|
|
"country_mapping = {\n",
|
|
" 'usa': 'USA',\n",
|
|
" 'u.s.a': 'USA',\n",
|
|
" 'united states': 'USA',\n",
|
|
" 'uk': 'UK',\n",
|
|
" 'united kingdom': 'UK',\n",
|
|
" 'canada': 'Canada',\n",
|
|
" 'mexico': 'Mexico'\n",
|
|
"}\n",
|
|
"\n",
|
|
"# Standardize the country column\n",
|
|
"dirty_data['country_clean'] = dirty_data['country'].str.lower().map(country_mapping)\n",
|
|
"\n",
|
|
"print(\"Before standardization:\")\n",
|
|
"print(dirty_data['country'].value_counts())\n",
|
|
"print(\"\\nAfter standardization:\")\n",
|
|
"print(dirty_data[['country_clean']].value_counts())"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"**ವೈಕಲ್ಪಿಕ: ಫಜ್ಜಿ ಹೊಂದಾಣಿಕೆ ಬಳಕೆ**\n",
|
|
"\n",
|
|
"ಹೆಚ್ಚು ಸಂಕೀರ್ಣ ಪ್ರಕರಣಗಳಿಗೆ, ನಾವು `rapidfuzz` ಗ್ರಂಥಾಲಯದೊಂದಿಗೆ ಫಜ್ಜಿ ಸ್ಟ್ರಿಂಗ್ ಹೊಂದಾಣಿಕೆಯನ್ನು ಬಳಸಿಕೊಂಡು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಸಮಾನ ಸ್ಟ್ರಿಂಗ್ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಬಹುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"try:\n",
|
|
" from rapidfuzz import process, fuzz\n",
|
|
"except ImportError:\n",
|
|
" print(\"rapidfuzz is not installed. Please install it with 'pip install rapidfuzz' to use fuzzy matching.\")\n",
|
|
" process = None\n",
|
|
" fuzz = None\n",
|
|
"\n",
|
|
"# Get unique countries\n",
|
|
"unique_countries = dirty_data['country'].unique()\n",
|
|
"\n",
|
|
"# For each country, find similar matches\n",
|
|
"if process is not None and fuzz is not None:\n",
|
|
" print(\"Finding similar country names (similarity > 70%):\")\n",
|
|
" for country in unique_countries:\n",
|
|
" matches = process.extract(country, unique_countries, scorer=fuzz.ratio, limit=3)\n",
|
|
" # Filter matches with similarity > 70 and not identical\n",
|
|
" similar = [m for m in matches if m[1] > 70 and m[0] != country]\n",
|
|
" if similar:\n",
|
|
" print(f\"\\n'{country}' is similar to:\")\n",
|
|
" for match, score, _ in similar:\n",
|
|
" print(f\" - '{match}' (similarity: {score}%)\")\n",
|
|
"else:\n",
|
|
" print(\"Skipping fuzzy matching because rapidfuzz is not available.\")"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### 2. ಅಸಾಮಾನ್ಯ ಸಂಖ್ಯಾತ್ಮಕ ಮೌಲ್ಯಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು (ಔಟ್ಲೈಯರ್ಗಳು)\n",
|
|
"\n",
|
|
"`age` ಕಾಲಮ್ ಅನ್ನು ನೋಡಿದಾಗ, 199 ಮತ್ತು -5 ಎಂಬ ಕೆಲವು ಸಂಶಯಾಸ್ಪದ ಮೌಲ್ಯಗಳಿವೆ. ಈ ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ನಾವು ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ವಿಧಾನಗಳನ್ನು ಬಳಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Display basic statistics\n",
|
|
"print(\"Age column statistics:\")\n",
|
|
"print(dirty_data['age'].describe())\n",
|
|
"\n",
|
|
"# Identify impossible values using domain knowledge\n",
|
|
"print(\"\\nRows with impossible age values (< 0 or > 120):\")\n",
|
|
"impossible_ages = dirty_data[(dirty_data['age'] < 0) | (dirty_data['age'] > 120)]\n",
|
|
"print(impossible_ages[['customer_id', 'name', 'age']])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"#### IQR (ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ರೇಂಜ್) ವಿಧಾನವನ್ನು ಬಳಸುವುದು\n",
|
|
"\n",
|
|
"IQR ವಿಧಾನವು ಅತಿದೊಡ್ಡ ಮೌಲ್ಯಗಳಿಗೆ ಕಡಿಮೆ ಸಂವೇದನಶೀಲವಾಗಿರುವ ಬಲವಾದ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ತಂತ್ರವಾಗಿದೆ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Calculate IQR for age (excluding impossible values)\n",
|
|
"valid_ages = dirty_data[(dirty_data['age'] >= 0) & (dirty_data['age'] <= 120)]['age']\n",
|
|
"\n",
|
|
"Q1 = valid_ages.quantile(0.25)\n",
|
|
"Q3 = valid_ages.quantile(0.75)\n",
|
|
"IQR = Q3 - Q1\n",
|
|
"\n",
|
|
"# Define outlier bounds\n",
|
|
"lower_bound = Q1 - 1.5 * IQR\n",
|
|
"upper_bound = Q3 + 1.5 * IQR\n",
|
|
"\n",
|
|
"print(f\"IQR-based outlier bounds for age: [{lower_bound:.2f}, {upper_bound:.2f}]\")\n",
|
|
"\n",
|
|
"# Identify outliers\n",
|
|
"age_outliers = dirty_data[(dirty_data['age'] < lower_bound) | (dirty_data['age'] > upper_bound)]\n",
|
|
"print(f\"\\nRows with age outliers:\")\n",
|
|
"print(age_outliers[['customer_id', 'name', 'age']])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"#### Z-ಸ್ಕೋರ್ ವಿಧಾನವನ್ನು ಬಳಸುವುದು\n",
|
|
"\n",
|
|
"Z-ಸ್ಕೋರ್ ವಿಧಾನವು ಸರಾಸರಿ ಇಂದ ಮಾನಕ ವ್ಯತ್ಯಾಸಗಳ ಆಧಾರದ ಮೇಲೆ ಹೊರಗಿನ ಅಂಕಿಗಳನ್ನು ಗುರುತಿಸುತ್ತದೆ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"try:\n",
|
|
" from scipy import stats\n",
|
|
"except ImportError:\n",
|
|
" print(\"scipy is required for Z-score calculation. Please install it with 'pip install scipy' and rerun this cell.\")\n",
|
|
"else:\n",
|
|
" # Calculate Z-scores for age, handling NaN values\n",
|
|
" age_nonan = dirty_data['age'].dropna()\n",
|
|
" zscores = np.abs(stats.zscore(age_nonan))\n",
|
|
" dirty_data['age_zscore'] = np.nan\n",
|
|
" dirty_data.loc[age_nonan.index, 'age_zscore'] = zscores\n",
|
|
"\n",
|
|
" # Typically, Z-score > 3 indicates an outlier\n",
|
|
" print(\"Rows with age Z-score > 3:\")\n",
|
|
" zscore_outliers = dirty_data[dirty_data['age_zscore'] > 3]\n",
|
|
" print(zscore_outliers[['customer_id', 'name', 'age', 'age_zscore']])\n",
|
|
"\n",
|
|
" # Clean up the temporary column\n",
|
|
" dirty_data = dirty_data.drop('age_zscore', axis=1)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"#### ಹೊರಗಿನ ಅಂಶಗಳನ್ನು ನಿರ್ವಹಿಸುವುದು\n",
|
|
"\n",
|
|
"ಒಮ್ಮೆ ಪತ್ತೆಯಾದ ನಂತರ, ಹೊರಗಿನ ಅಂಶಗಳನ್ನು ಹಲವಾರು ರೀತಿಯಲ್ಲಿ ನಿರ್ವಹಿಸಬಹುದು:\n",
|
|
"1. **ತೆಗೆದುಹಾಕಿ**: ಹೊರಗಿನ ಅಂಶಗಳಿರುವ ಸಾಲುಗಳನ್ನು ತೆಗೆದುಹಾಕಿ (ಅವು ದೋಷಗಳಾಗಿದ್ದರೆ)\n",
|
|
"2. **ಮಿತಿ ನಿಗದಿ ಮಾಡಿ**: ಗಡಿಬಿಡಿ ಮೌಲ್ಯಗಳಿಂದ ಬದಲಾಯಿಸಿ\n",
|
|
"3. **NaN ನೊಂದಿಗೆ ಬದಲಾಯಿಸಿ**: ಇಲ್ಲದಿರುವ ಡೇಟಾ ಎಂದು ಪರಿಗಣಿಸಿ ಮತ್ತು ಇಂಪುಟೇಶನ್ ತಂತ್ರಗಳನ್ನು ಬಳಸಿ\n",
|
|
"4. **ಉಳಿಸಿ**: ಅವು ಮಾನ್ಯವಾದ ಅತಿದೊಡ್ಡ ಮೌಲ್ಯಗಳಾಗಿದ್ದರೆ\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Create a cleaned version by replacing impossible ages with NaN\n",
|
|
"dirty_data['age_clean'] = dirty_data['age'].apply(\n",
|
|
" lambda x: np.nan if (x < 0 or x > 120) else x\n",
|
|
")\n",
|
|
"\n",
|
|
"print(\"Age column before and after cleaning:\")\n",
|
|
"print(dirty_data[['customer_id', 'name', 'age', 'age_clean']])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### 3. ಸಮೀಪದ ನಕಲಿ ಸಾಲುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು\n",
|
|
"\n",
|
|
"ನಮ್ಮ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ \"ಜಾನ್ ಸ್ಮಿತ್\" ಎಂಬ ಹೆಸರಿನ ವಿವಿಧ ಮೌಲ್ಯಗಳೊಂದಿಗೆ ಹಲವಾರು ದಾಖಲೆಗಳಿವೆ ಎಂದು ಗಮನಿಸಿ. ಹೆಸರಿನ ಸಾದೃಶ್ಯದ ಆಧಾರದ ಮೇಲೆ ಸಾಧ್ಯವಿರುವ ನಕಲುಗಳನ್ನು ಗುರುತಿಸೋಣ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# First, let's look at exact name matches (ignoring extra whitespace)\n",
|
|
"dirty_data['name_normalized'] = dirty_data['name'].str.strip().str.lower()\n",
|
|
"\n",
|
|
"print(\"Checking for duplicate names:\")\n",
|
|
"duplicate_names = dirty_data[dirty_data.duplicated(['name_normalized'], keep=False)]\n",
|
|
"print(duplicate_names.sort_values('name_normalized')[['customer_id', 'name', 'age', 'country']])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"#### ಫಜ್ಜಿ ಹೊಂದಾಣಿಕೆಯಿಂದ ಸಮೀಪದ ನಕಲುಗಳನ್ನು ಹುಡುಕುವುದು\n",
|
|
"\n",
|
|
"ಹೆಚ್ಚು ಸುಧಾರಿತ ನಕಲು ಪತ್ತೆಗಾಗಿ, ನಾವು ಸಮಾನ ಹೆಸರುಗಳನ್ನು ಹುಡುಕಲು ಫಜ್ಜಿ ಹೊಂದಾಣಿಕೆಯನ್ನು ಬಳಸಬಹುದು:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"try:\n",
|
|
" from rapidfuzz import process, fuzz\n",
|
|
"\n",
|
|
" # Function to find potential duplicates\n",
|
|
" def find_near_duplicates(df, column, threshold=90):\n",
|
|
" \"\"\"\n",
|
|
" Find near-duplicate entries in a column using fuzzy matching.\n",
|
|
" \n",
|
|
" Parameters:\n",
|
|
" - df: DataFrame\n",
|
|
" - column: Column name to check for duplicates\n",
|
|
" - threshold: Similarity threshold (0-100)\n",
|
|
" \n",
|
|
" Returns: List of potential duplicate groups\n",
|
|
" \"\"\"\n",
|
|
" values = df[column].unique()\n",
|
|
" duplicate_groups = []\n",
|
|
" checked = set()\n",
|
|
" \n",
|
|
" for value in values:\n",
|
|
" if value in checked:\n",
|
|
" continue\n",
|
|
" \n",
|
|
" # Find similar values\n",
|
|
" matches = process.extract(value, values, scorer=fuzz.ratio, limit=len(values))\n",
|
|
" similar = [m[0] for m in matches if m[1] >= threshold]\n",
|
|
" \n",
|
|
" if len(similar) > 1:\n",
|
|
" duplicate_groups.append(similar)\n",
|
|
" checked.update(similar)\n",
|
|
" \n",
|
|
" return duplicate_groups\n",
|
|
"\n",
|
|
" # Find near-duplicate names\n",
|
|
" duplicate_groups = find_near_duplicates(dirty_data, 'name', threshold=90)\n",
|
|
"\n",
|
|
" print(\"Potential duplicate groups:\")\n",
|
|
" for i, group in enumerate(duplicate_groups, 1):\n",
|
|
" print(f\"\\nGroup {i}:\")\n",
|
|
" for name in group:\n",
|
|
" matching_rows = dirty_data[dirty_data['name'] == name]\n",
|
|
" print(f\" '{name}': {len(matching_rows)} occurrence(s)\")\n",
|
|
" for _, row in matching_rows.iterrows():\n",
|
|
" print(f\" - Customer {row['customer_id']}: age={row['age']}, country={row['country']}\")\n",
|
|
"except ImportError:\n",
|
|
" print(\"rapidfuzz is not installed. Skipping fuzzy matching for near-duplicates.\")"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"#### ನಕಲುಗಳನ್ನು ನಿರ್ವಹಿಸುವುದು\n",
|
|
"\n",
|
|
"ಒಮ್ಮೆ ಗುರುತಿಸಿದ ನಂತರ, ನಕಲುಗಳನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸುವುದೆಂದು ನೀವು ನಿರ್ಧರಿಸಬೇಕು:\n",
|
|
"1. **ಮೊದಲ ಸಂಭವನೆಯನ್ನು ಉಳಿಸಿ**: `drop_duplicates(keep='first')` ಬಳಸಿ\n",
|
|
"2. **ಕೊನೆಯ ಸಂಭವನೆಯನ್ನು ಉಳಿಸಿ**: `drop_duplicates(keep='last')` ಬಳಸಿ\n",
|
|
"3. **ಮಾಹಿತಿಯನ್ನು ಸಂಗ್ರಹಿಸಿ**: ನಕಲು ಸಾಲುಗಳಿಂದ ಮಾಹಿತಿಯನ್ನು ಸಂಯೋಜಿಸಿ\n",
|
|
"4. **ಮ್ಯಾನುಯಲ್ ಪರಿಶೀಲನೆ**: ಮಾನವ ಪರಿಶೀಲನೆಗಾಗಿ ಫ್ಲ್ಯಾಗ್ ಮಾಡಿ\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# Example: Remove duplicates based on normalized name, keeping first occurrence\n",
|
|
"cleaned_data = dirty_data.drop_duplicates(subset=['name_normalized'], keep='first')\n",
|
|
"\n",
|
|
"print(f\"Original dataset: {len(dirty_data)} rows\")\n",
|
|
"print(f\"After removing name duplicates: {len(cleaned_data)} rows\")\n",
|
|
"print(f\"Removed: {len(dirty_data) - len(cleaned_data)} duplicate rows\")\n",
|
|
"\n",
|
|
"print(\"\\nCleaned dataset:\")\n",
|
|
"print(cleaned_data[['customer_id', 'name', 'age', 'country_clean']])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### ಸಾರಾಂಶ: ಸಂಪೂರ್ಣ ಡೇಟಾ ಶುದ್ಧೀಕರಣ ಪೈಪ್ಲೈನ್\n",
|
|
"\n",
|
|
"ನಾವು ಇದನ್ನು ಎಲ್ಲವನ್ನೂ ಸೇರಿಸಿ ಸಮಗ್ರ ಶುದ್ಧೀಕರಣ ಪೈಪ್ಲೈನ್ ಆಗಿ ಮಾಡೋಣ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"def clean_dataset(df):\n",
|
|
" \"\"\"\n",
|
|
" Comprehensive data cleaning function.\n",
|
|
" \"\"\"\n",
|
|
" # Create a copy to avoid modifying the original\n",
|
|
" cleaned = df.copy()\n",
|
|
" \n",
|
|
" # 1. Standardize categorical values (country)\n",
|
|
" country_mapping = {\n",
|
|
" 'usa': 'USA', 'u.s.a': 'USA', 'united states': 'USA',\n",
|
|
" 'uk': 'UK', 'united kingdom': 'UK',\n",
|
|
" 'canada': 'Canada', 'mexico': 'Mexico'\n",
|
|
" }\n",
|
|
" cleaned['country'] = cleaned['country'].str.lower().map(country_mapping)\n",
|
|
" \n",
|
|
" # 2. Clean abnormal age values\n",
|
|
" cleaned['age'] = cleaned['age'].apply(\n",
|
|
" lambda x: np.nan if (x < 0 or x > 120) else x\n",
|
|
" )\n",
|
|
" \n",
|
|
" # 3. Remove near-duplicate names (normalize whitespace)\n",
|
|
" cleaned['name'] = cleaned['name'].str.strip()\n",
|
|
" cleaned = cleaned.drop_duplicates(subset=['name'], keep='first')\n",
|
|
" \n",
|
|
" return cleaned\n",
|
|
"\n",
|
|
"# Apply the cleaning pipeline\n",
|
|
"final_cleaned_data = clean_dataset(dirty_data)\n",
|
|
"\n",
|
|
"print(\"Before cleaning:\")\n",
|
|
"print(f\" Rows: {len(dirty_data)}\")\n",
|
|
"print(f\" Unique countries: {dirty_data['country'].nunique()}\")\n",
|
|
"print(f\" Invalid ages: {((dirty_data['age'] < 0) | (dirty_data['age'] > 120)).sum()}\")\n",
|
|
"\n",
|
|
"print(\"\\nAfter cleaning:\")\n",
|
|
"print(f\" Rows: {len(final_cleaned_data)}\")\n",
|
|
"print(f\" Unique countries: {final_cleaned_data['country'].nunique()}\")\n",
|
|
"print(f\" Invalid ages: {((final_cleaned_data['age'] < 0) | (final_cleaned_data['age'] > 120)).sum()}\")\n",
|
|
"\n",
|
|
"print(\"\\nCleaned dataset:\")\n",
|
|
"print(final_cleaned_data[['customer_id', 'name', 'age', 'country', 'purchase_amount']])"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### 🎯 ಚಾಲೆಂಜ್ ವ್ಯಾಯಾಮ\n",
|
|
"\n",
|
|
"ಈಗ ನಿಮ್ಮ ತಿರುಗು! ಕೆಳಗಿನವು ಗುಣಮಟ್ಟದ ಹಲವು ಸಮಸ್ಯೆಗಳೊಂದಿಗೆ ಹೊಸ ಸಾಲು ಡೇಟಾ. ನೀವು ಮಾಡಬಹುದೇ:\n",
|
|
"\n",
|
|
"1. ಈ ಸಾಲಿನಲ್ಲಿ ಎಲ್ಲಾ ಸಮಸ್ಯೆಗಳನ್ನು ಗುರುತಿಸಿ\n",
|
|
"2. ಪ್ರತಿ ಸಮಸ್ಯೆಯನ್ನು ಶುದ್ಧಗೊಳಿಸಲು ಕೋಡ್ ಬರೆಯಿರಿ\n",
|
|
"3. ಶುದ್ಧಗೊಳಿಸಿದ ಸಾಲನ್ನು ಡೇಟಾಸೆಟ್ಗೆ ಸೇರಿಸಿ\n",
|
|
"\n",
|
|
"ಇದು ಸಮಸ್ಯೆಯ ಡೇಟಾ:\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "code",
|
|
"execution_count": null,
|
|
"metadata": {},
|
|
"outputs": [],
|
|
"source": [
|
|
"# New problematic row\n",
|
|
"new_row = pd.DataFrame({\n",
|
|
" 'customer_id': [13],\n",
|
|
" 'name': [' Diana Prince '], # Extra whitespace\n",
|
|
" 'age': [250], # Impossible age\n",
|
|
" 'country': ['U.S.A.'], # Inconsistent format\n",
|
|
" 'purchase_amount': [150.00]\n",
|
|
"})\n",
|
|
"\n",
|
|
"print(\"New row to clean:\")\n",
|
|
"print(new_row)\n",
|
|
"\n",
|
|
"# TODO: Your code here to clean this row\n",
|
|
"# Hints:\n",
|
|
"# 1. Strip whitespace from the name\n",
|
|
"# 2. Check if the name is a duplicate (Diana Prince already exists)\n",
|
|
"# 3. Handle the impossible age value\n",
|
|
"# 4. Standardize the country name\n",
|
|
"\n",
|
|
"# Example solution (uncomment and modify as needed):\n",
|
|
"# new_row_cleaned = new_row.copy()\n",
|
|
"# new_row_cleaned['name'] = new_row_cleaned['name'].str.strip()\n",
|
|
"# new_row_cleaned['age'] = np.nan # Invalid age\n",
|
|
"# new_row_cleaned['country'] = 'USA' # Standardized\n",
|
|
"# print(\"\\nCleaned row:\")\n",
|
|
"# print(new_row_cleaned)"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"### ಪ್ರಮುಖ ಅಂಶಗಳು\n",
|
|
"\n",
|
|
"1. **ಅಸಮಾನ ವರ್ಗಗಳು** ನೈಜ ಜಗತ್ತಿನ ಡೇಟಾದಲ್ಲಿ ಸಾಮಾನ್ಯವಾಗಿವೆ. ಸದಾ ವಿಶಿಷ್ಟ ಮೌಲ್ಯಗಳನ್ನು ಪರಿಶೀಲಿಸಿ ಮತ್ತು ನಕ್ಷೆಗಳನ್ನು ಅಥವಾ ಫಜ್ಜಿ ಹೊಂದಾಣಿಕೆಯನ್ನು ಬಳಸಿ ಅವುಗಳನ್ನು ಮಾನಕೀಕರಿಸಿ.\n",
|
|
"\n",
|
|
"2. **ಅತಿರೇಕಗಳು** ನಿಮ್ಮ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಬಹುಮಟ್ಟಿಗೆ ಪ್ರಭಾವಿತ ಮಾಡಬಹುದು. ಅವುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಕ್ಷೇತ್ರ ಜ್ಞಾನವನ್ನು ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ವಿಧಾನಗಳೊಂದಿಗೆ (IQR, Z-ಸ್ಕೋರ್) ಬಳಸಿ.\n",
|
|
"\n",
|
|
"3. **ಸಮೀಪದ ನಕಲುಗಳು** ನಿಖರ ನಕಲುಗಳಿಗಿಂತ ಪತ್ತೆಹಚ್ಚಲು ಕಷ್ಟಕರವಾಗಿವೆ. ಅವುಗಳನ್ನು ಗುರುತಿಸಲು ಫಜ್ಜಿ ಹೊಂದಾಣಿಕೆ ಮತ್ತು ಡೇಟಾವನ್ನು ಸಾಮಾನ್ಯೀಕರಿಸುವುದು (ಕೆಳಗಿನ ಅಕ್ಷರಗೊಳಿಸುವುದು, ಖಾಲಿ ಸ್ಥಳಗಳನ್ನು ತೆಗೆದುಹಾಕುವುದು) ಪರಿಗಣಿಸಿ.\n",
|
|
"\n",
|
|
"4. **ಡೇಟಾ ಶುದ್ಧೀಕರಣವು ಪುನರಾವರ್ತನಾತ್ಮಕವಾಗಿದೆ**. ನೀವು ಅನೇಕ ತಂತ್ರಗಳನ್ನು ಅನ್ವಯಿಸಬೇಕಾಗಬಹುದು ಮತ್ತು ನಿಮ್ಮ ಶುದ್ಧೀಕೃತ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಅಂತಿಮಗೊಳಿಸುವ ಮೊದಲು ಫಲಿತಾಂಶಗಳನ್ನು ಪರಿಶೀಲಿಸಬೇಕಾಗಬಹುದು.\n",
|
|
"\n",
|
|
"5. **ನಿಮ್ಮ ನಿರ್ಧಾರಗಳನ್ನು ದಾಖಲೆ ಮಾಡಿಕೊಳ್ಳಿ**. ನೀವು ಯಾವ ಶುದ್ಧೀಕರಣ ಹಂತಗಳನ್ನು ಅನ್ವಯಿಸಿದ್ದೀರಿ ಮತ್ತು ಏಕೆ ಎಂದು ಗಮನದಲ್ಲಿಡಿ, ಏಕೆಂದರೆ ಇದು ಪುನರಾವರ್ತನೆ ಮತ್ತು ಪಾರದರ್ಶಕತೆಯಿಗಾಗಿ ಮುಖ್ಯವಾಗಿದೆ.\n",
|
|
"\n",
|
|
"> **ಉತ್ತಮ ಅಭ್ಯಾಸ:** ನಿಮ್ಮ ಮೂಲ \"ಕಳಪೆ\" ಡೇಟಾದ ಪ್ರತಿಯನ್ನು ಸದಾ ಇಟ್ಟುಕೊಳ್ಳಿ. ನಿಮ್ಮ ಮೂಲ ಡೇಟಾ ಫೈಲ್ಗಳನ್ನು ಮರುಬರೆಯಬೇಡಿ - `data_cleaned.csv` ಹೋಲುವ ಸ್ಪಷ್ಟ ಹೆಸರಿನ ನಿಯಮಗಳೊಂದಿಗೆ ಶುದ್ಧೀಕೃತ ಆವೃತ್ತಿಗಳನ್ನು ರಚಿಸಿ.\n"
|
|
]
|
|
},
|
|
{
|
|
"cell_type": "markdown",
|
|
"metadata": {},
|
|
"source": [
|
|
"---\n\n<!-- CO-OP TRANSLATOR DISCLAIMER START -->\n**ಅಸ್ವೀಕರಣ**: \nಈ ದಸ್ತಾವೇಜು AI ಅನುವಾದ ಸೇವೆ [Co-op Translator](https://github.com/Azure/co-op-translator) ಬಳಸಿ ಅನುವಾದಿಸಲಾಗಿದೆ. ನಾವು ನಿಖರತೆಯಿಗಾಗಿ ಪ್ರಯತ್ನಿಸುತ್ತಿದ್ದರೂ, ಸ್ವಯಂಚಾಲಿತ ಅನುವಾದಗಳಲ್ಲಿ ದೋಷಗಳು ಅಥವಾ ಅಸತ್ಯತೆಗಳು ಇರಬಹುದು ಎಂದು ದಯವಿಟ್ಟು ಗಮನಿಸಿ. ಮೂಲ ಭಾಷೆಯಲ್ಲಿರುವ ಮೂಲ ದಸ್ತಾವೇಜನ್ನು ಅಧಿಕೃತ ಮೂಲವೆಂದು ಪರಿಗಣಿಸಬೇಕು. ಮಹತ್ವದ ಮಾಹಿತಿಗಾಗಿ, ವೃತ್ತಿಪರ ಮಾನವ ಅನುವಾದವನ್ನು ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ. ಈ ಅನುವಾದ ಬಳಕೆಯಿಂದ ಉಂಟಾಗುವ ಯಾವುದೇ ತಪ್ಪು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಿಕೆ ಅಥವಾ ತಪ್ಪು ವಿವರಣೆಗಳಿಗೆ ನಾವು ಹೊಣೆಗಾರರಾಗುವುದಿಲ್ಲ.\n<!-- CO-OP TRANSLATOR DISCLAIMER END -->\n"
|
|
]
|
|
}
|
|
],
|
|
"metadata": {
|
|
"anaconda-cloud": {},
|
|
"colab": {
|
|
"name": "notebook.ipynb",
|
|
"provenance": []
|
|
},
|
|
"kernelspec": {
|
|
"display_name": "Python 3",
|
|
"language": "python",
|
|
"name": "python3"
|
|
},
|
|
"language_info": {
|
|
"codemirror_mode": {
|
|
"name": "ipython",
|
|
"version": 3
|
|
},
|
|
"file_extension": ".py",
|
|
"mimetype": "text/x-python",
|
|
"name": "python",
|
|
"nbconvert_exporter": "python",
|
|
"pygments_lexer": "ipython3",
|
|
"version": "3.5.4"
|
|
},
|
|
"coopTranslator": {
|
|
"original_hash": "6301339d1c9a301b00639c635dc9b731",
|
|
"translation_date": "2025-12-19T17:32:39+00:00",
|
|
"source_file": "2-Working-With-Data/08-data-preparation/notebook.ipynb",
|
|
"language_code": "kn"
|
|
}
|
|
},
|
|
"nbformat": 4,
|
|
"nbformat_minor": 0
|
|
} |