|
|
7 months ago | |
|---|---|---|
| .. | ||
| solution | 7 months ago | |
| README.md | 7 months ago | |
| assignment.md | 10 months ago | |
| notebook.ipynb | 10 months ago | |
README.md
Scikit-learn பயன்படுத்தி ஒரு ரிக்ரஷன் மாடல் உருவாக்குதல்: நான்கு விதமான ரிக்ரஷன்
தகவல் வரைபடம்: Dasani Madipalli
முன்-வகுப்பு வினாடி வினா
இந்த பாடம் R-இல் கிடைக்கிறது!
அறிமுகம்
இ bisher நீங்கள் ரிக்ரஷன் என்ன என்பதை கற்றுக்கொண்டீர்கள், மற்றும் இந்த பாடத்தில் பயன்படுத்தப்படும் கம்பளி விலை தரவுத்தொகுப்பிலிருந்து எடுத்த மாதிரி தரவுடன் அதை ஆராய்ந்தீர்கள். மேலும், அதை Matplotlib பயன்படுத்தி காட்சிப்படுத்தியுள்ளீர்கள்.
இப்போது நீங்கள் எம்.எல். ரிக்ரஷனை மேலும் ஆழமாக ஆராய தயாராக உள்ளீர்கள். காட்சிப்படுத்தல் தரவின் அர்த்தத்தை புரிந்துகொள்ள உதவுகிறது, ஆனால் இயந்திர கற்றலின் உண்மையான சக்தி மாடல்களை பயிற்சி செய்வதில் உள்ளது. மாடல்கள் வரலாற்று தரவின் அடிப்படையில் பயிற்சி பெறுகின்றன, தரவின் சார்புகளை தானாகவே பிடிக்கின்றன, மேலும் மாடல் முன்பே பார்த்திராத புதிய தரவுக்கான முடிவுகளை கணிக்க அனுமதிக்கின்றன.
இந்த பாடத்தில், நீங்கள் இரண்டு வகையான ரிக்ரஷனைப் பற்றி மேலும் கற்றுக்கொள்வீர்கள்: அடிப்படை நேரியல் ரிக்ரஷன் மற்றும் பாலினோமியல் ரிக்ரஷன், மற்றும் இந்த நுட்பங்களின் அடிப்படையில் உள்ள சில கணிதங்களை. இந்த மாடல்கள் வெவ்வேறு உள்ளீட்டு தரவுகளின் அடிப்படையில் கம்பளி விலைகளை கணிக்க உதவும்.
🎥 மேலே உள்ள படத்தை கிளிக் செய்து நேரியல் ரிக்ரஷனின் சுருக்கமான வீடியோ கண்ணோட்டத்தைப் பாருங்கள்.
இந்த பாடத்திட்டத்தின் முழுவதும், கணிதத்தில் குறைந்த அறிவை நாம் கருதுகிறோம், மற்றும் பிற துறைகளிலிருந்து வரும் மாணவர்களுக்கு அதை அணுகக்கூடியதாக மாற்ற முயற்சிக்கிறோம். குறிப்புகள், 🧮 அழைப்புகள், வரைபடங்கள் மற்றும் புரிதலுக்கு உதவும் பிற கற்றல் கருவிகளை கவனிக்கவும்.
முன்-தயாரிப்பு
இப்போது நீங்கள் கம்பளி தரவின் அமைப்புடன் பரிச்சயமாக இருக்க வேண்டும். இந்த பாடத்தின் notebook.ipynb கோப்பில் இது முன்பே ஏற்றப்பட்டு சுத்தம் செய்யப்பட்டு கிடைக்கிறது. இந்த கோப்பில், கம்பளி விலை ஒரு புதிய தரவுப் பிரேமில் புஷெல் ஒன்றுக்கு காட்டப்படுகிறது. Visual Studio Code-இல் கர்னல்களில் இந்த நோட்புக்குகளை இயக்க முடியும் என்பதை உறுதிப்படுத்தவும்.
தயாரிப்பு
நினைவூட்டலுக்காக, நீங்கள் இந்த தரவுகளை ஏற்றுவதன் மூலம் அதில் கேள்விகளை கேட்க முடியும்.
- கம்பளிகளை வாங்க சிறந்த நேரம் எது?
- சிறிய கம்பளிகளின் ஒரு கேஸின் விலையை நான் எதிர்பார்க்க முடியுமா?
- நான் அவற்றை அரை புஷெல் கூளங்களில் வாங்க வேண்டுமா அல்லது 1 1/9 புஷெல் பெட்டியில் வாங்க வேண்டுமா? இந்த தரவுகளை மேலும் ஆராய்வோம்.
முந்தைய பாடத்தில், நீங்கள் ஒரு Pandas தரவுப் பிரேமை உருவாக்கி, அசல் தரவுத்தொகுப்பின் ஒரு பகுதியை அதில் நிரப்பி, புஷெல் மூலம் விலையை நிலைப்படுத்தினீர்கள். ஆனால், அதைச் செய்வதன் மூலம், நீங்கள் சுமார் 400 தரவுப் புள்ளிகளை மட்டுமே சேகரிக்க முடிந்தது, மேலும் அவை விழுந்து காலங்களில் மட்டுமே இருந்தன.
இந்த பாடத்துடன் இணைக்கப்பட்ட நோட்புக்கில் முன்பே ஏற்றப்பட்ட தரவைக் கவனிக்கவும். தரவுகள் முன்பே ஏற்றப்பட்டு, ஆரம்ப ஸ்காட்டர்ப்ளாட் மாத்திரம் வரைபடமாக்கப்பட்டுள்ளது. மாதத் தரவைக் காட்டுகிறது. தரவின் இயல்பைப் பற்றி மேலும் விவரங்களைப் பெற சுத்தம் செய்ய முயற்சிக்கலாம்.
ஒரு நேரியல் ரிக்ரஷன் கோடு
Lesson 1-இல் நீங்கள் கற்றுக்கொண்டது போல, ஒரு நேரியல் ரிக்ரஷன் பயிற்சியின் நோக்கம் ஒரு கோட்டை வரைபடமாக்குவதில் உள்ளது:
- மாறிலி உறவுகளை காட்டுதல். மாறிலிகளுக்கிடையேயான உறவுகளை காட்டுதல்
- கணிப்புகளைச் செய்யுதல். புதிய தரவுப் புள்ளி அந்த கோட்டுடன் தொடர்புடைய இடத்தில் எங்கு இருக்கும் என்பதை துல்லியமாக கணிக்குதல்.
இது குறைந்த-சதுர ரிக்ரஷன் மூலம் இந்த வகையான கோட்டை வரைபடமாக்குவது வழக்கமாகும். 'குறைந்த-சதுரங்கள்' என்ற சொல், ரிக்ரஷன் கோட்டின் சுற்றியுள்ள அனைத்து தரவுப் புள்ளிகளும் சதுரமாக்கப்பட்டு பின்னர் சேர்க்கப்படுகின்றன என்பதை குறிக்கிறது. இறுதியில், அந்த மொத்த தொகை மிகச் சிறியதாக இருக்க வேண்டும், ஏனெனில் நாம் குறைந்த பிழைகள், அல்லது குறைந்த-சதுரங்கள் வேண்டும்.
நாம் தரவுப் புள்ளிகளின் மொத்த தூரம் குறைவாக இருக்க வேண்டும் என்பதற்காக இதைச் செய்கிறோம். மேலும், அதன் திசையை விட அதன் அளவைக் கவனிக்கிறோம் என்பதற்காக நிபந்தனைகளை சதுரமாக்கி பின்னர் சேர்க்கிறோம்.
🧮 கணிதத்தை காட்டுங்கள்
இந்த கோடு, சிறந்த பொருத்தம் கொண்ட கோடு ஒரு சமன்பாட்டால் வெளிப்படுத்தப்படலாம்:
Y = a + bX
Xஎன்பது 'விளக்க மாறிலி'.Yஎன்பது 'சார்ந்த மாறிலி'. கோட்டின் சாய்வுbமற்றும்aஎன்பது y-இன்டர்செப்ட், இதுX = 0என்ற போதுYஇன் மதிப்பை குறிக்கிறது.முதலில், சாய்வு
bஐ கணக்கிடுங்கள். தகவல் வரைபடம்: Jen Looperவேறு வார்த்தைகளில், மற்றும் கம்பளி தரவின் அசல் கேள்வியைப் பார்க்கும்போது: "மாதத்தின் அடிப்படையில் புஷெல் ஒன்றுக்கு கம்பளி விலையை கணிக்க",
Xவிலையை குறிக்கிறது மற்றும்Yவிற்பனை மாதத்தை குறிக்கிறது.
Yஇன் மதிப்பை கணக்கிடுங்கள். நீங்கள் சுமார் $4 செலுத்துகிறீர்கள் என்றால், அது ஏப்ரல் மாதம்! தகவல் வரைபடம்: Jen Looperகோட்டின் சாய்வை கணக்கிடும் கணிதம், இது இன்டர்செப்ட்டின் அடிப்படையிலும் சார்ந்தது, அல்லது
X = 0என்ற போதுYஎங்கு அமைந்துள்ளது என்பதை காட்ட வேண்டும்.இந்த மதிப்புகளை கணக்கிடும் முறை Math is Fun வலைத்தளத்தில் காணலாம். மேலும், இந்த குறைந்த-சதுரங்கள் கணக்கிடும் கருவி க்கு சென்று எண்களின் மதிப்புகள் கோட்டில் எப்படி பாதிக்கின்றன என்பதைப் பாருங்கள்.
தொடர்பு
மற்றொரு முக்கியமான சொல் தொடர்பு குணகம் என்பது கொடுக்கப்பட்ட X மற்றும் Y மாறிலிகளுக்கிடையே. ஒரு ஸ்காட்டர்ப்ளாட்டைப் பயன்படுத்தி, நீங்கள் இந்த குணகத்தை விரைவாக காட்சிப்படுத்தலாம். தரவுப் புள்ளிகள் ஒழுங்காக ஒரு கோட்டில் சிதறியுள்ள ஒரு வரைபடம் அதிக தொடர்பு கொண்டதாக இருக்கும், ஆனால் X மற்றும் Y இடையே தரவுப் புள்ளிகள் எங்கும் சிதறியுள்ள ஒரு வரைபடம் குறைந்த தொடர்பு கொண்டதாக இருக்கும்.
ஒரு நல்ல நேரியல் ரிக்ரஷன் மாடல், குறைந்த-சதுர ரிக்ரஷன் முறையைப் பயன்படுத்தி ஒரு ரிக்ரஷன் கோட்டுடன் 1 க்கு அருகிலுள்ள (0 க்கு அருகிலல்ல) தொடர்பு குணகத்தை கொண்டிருக்கும்.
✅ இந்த பாடத்துடன் இணைக்கப்பட்ட நோட்புக்கை இயக்கி, மாதத்திற்கும் விலைக்கும் இடையேயான ஸ்காட்டர்ப்ளாட்டைப் பாருங்கள். கம்பளி விற்பனைக்கு மாதத்திற்கும் விலைக்கும் இடையேயான தரவுகள், உங்கள் கண்ணோட்டத்தின் அடிப்படையில் ஸ்காட்டர்ப்ளாட்டில் அதிக அல்லது குறைந்த தொடர்பு கொண்டதாக தோன்றுகிறதா? மாதம் என்பதற்குப் பதிலாக ஆண்டின் நாள் (அதாவது ஆண்டின் தொடக்கத்திலிருந்து நாட்களின் எண்ணிக்கை) போன்ற நுண்ணறிவு அளவீட்டை நீங்கள் பயன்படுத்தினால் அது மாறுமா?
கீழே உள்ள குறியீட்டில், தரவுகளை சுத்தம் செய்துவிட்டு, new_pumpkins என்ற ஒரு தரவுப் பிரேமைப் பெற்றுள்ளோம் என்று கருதுவோம், இது பின்வருமாறு இருக்கும்:
| ID | Month | DayOfYear | Variety | City | Package | Low Price | High Price | Price |
|---|---|---|---|---|---|---|---|---|
| 70 | 9 | 267 | PIE TYPE | BALTIMORE | 1 1/9 bushel cartons | 15.0 | 15.0 | 13.636364 |
| 71 | 9 | 267 | PIE TYPE | BALTIMORE | 1 1/9 bushel cartons | 18.0 | 18.0 | 16.363636 |
| 72 | 10 | 274 | PIE TYPE | BALTIMORE | 1 1/9 bushel cartons | 18.0 | 18.0 | 16.363636 |
| 73 | 10 | 274 | PIE TYPE | BALTIMORE | 1 1/9 bushel cartons | 17.0 | 17.0 | 15.454545 |
| 74 | 10 | 281 | PIE TYPE | BALTIMORE | 1 1/9 bushel cartons | 15.0 | 15.0 | 13.636364 |
தரவுகளை சுத்தம் செய்யும் குறியீடு
notebook.ipynbஇல் கிடைக்கிறது. முந்தைய பாடத்தில் செய்த அதே சுத்தம் செய்யும் படிகளை நாம் மேற்கொண்டுள்ளோம், மேலும்DayOfYearபத்தியை பின்வரும் வெளிப்பாட்டைப் பயன்படுத்தி கணக்கிட்டுள்ளோம்:
day_of_year = pd.to_datetime(pumpkins['Date']).apply(lambda dt: (dt-datetime(dt.year,1,1)).days)
இப்போது நீங்கள் நேரியல் ரிக்ரஷனின் கணிதத்தைப் புரிந்துகொண்டுள்ளீர்கள், கம்பளி விலைகளுக்கான சிறந்த தொகுப்பை கணிக்க முடியும் என்றால், ஒரு ரிக்ரஷன் மாடலை உருவாக்குவோம். ஒரு விடுமுறை கம்பளி தோட்டத்திற்காக கம்பளிகளை வாங்கும் ஒருவர், தோட்டத்திற்கான கம்பளி தொகுப்புகளைப் பெற தன் வாங்குதலை மேம்படுத்த இந்த தகவலை விரும்பலாம்.
தொடர்பு தேடுதல்
🎥 மேலே உள்ள படத்தை கிளிக் செய்து தொடர்பின் சுருக்கமான வீடியோ கண்ணோட்டத்தைப் பாருங்கள்.
முந்தைய பாடத்தில் நீங்கள் பார்த்திருப்பீர்கள், வெவ்வேறு மாதங்களுக்கான சராசரி விலை இவ்வாறு தோன்றுகிறது:
இது தொடர்பு இருக்க வேண்டும் என்று பரிந்துரைக்கிறது, மேலும் Month மற்றும் Price அல்லது DayOfYear மற்றும் Price இடையேயான உறவுகளை கணிக்க ஒரு நேரியல் ரிக்ரஷன் மாடலை பயிற்சி செய்ய முயற்சிக்கலாம். இதோ பின்வரும் உறவைக் காட்டும் ஸ்காட்டர்ப்ளாட்:
corr செயல்பாட்டைப் பயன்படுத்தி தொடர்பு இருக்கிறதா என்பதைப் பார்ப்போம்:
print(new_pumpkins['Month'].corr(new_pumpkins['Price']))
print(new_pumpkins['DayOfYear'].corr(new_pumpkins['Price']))
இது தொடர்பு மிகவும் குறைவாக உள்ளது என்று தோன்றுகிறது, Month மூலம் -0.15 மற்றும் DayOfMonth மூலம் -0.17, ஆனால் மற்றொரு முக்கியமான உறவு இருக்கலாம். இது வெவ்வேறு கம்பளி வகைகளுக்கு தொடர்புடைய விலைகளின் வெவ்வேறு குழுக்களைக் கொண்டுள்ளது போல தோன்றுகிறது. இந்த யூகத்தை உறுதிப்படுத்த, ஒவ்வொரு கம்பளி வகையையும் வெவ்வேறு நிறத்தில் வரைபடமாக்குவோம். scatter வரைபட செயல்பாட்டிற்கு ax அளவுருவை அனுப்புவதன் மூலம், அனைத்து புள்ளிகளையும் ஒரே வரைபடத்தில் வரைபடமாக்கலாம்:
ax=None
colors = ['red','blue','green','yellow']
for i,var in enumerate(new_pumpkins['Variety'].unique()):
df = new_pumpkins[new_pumpkins['Variety']==var]
ax = df.plot.scatter('DayOfYear','Price',ax=ax,c=colors[i],label=var)
எங்கள் விசாரணை, விற்பனை தேதியை விட வகை மொத்த விலைக்கு அதிக தாக்கத்தை ஏற்படுத்துகிறது என்பதை பரிந்துரைக்கிறது. இதை ஒரு பட்டை வரைபடத்தில் காணலாம்:
new_pumpkins.groupby('Variety')['Price'].mean().plot(kind='bar')
இப்போது 'pie type' என்ற ஒரு கம்பளி வகையை மட்டும் கவனித்து, தேதியின் விலைக்கு என்ன தாக்கம் உள்ளது என்பதைப் பார்ப்போம்:
pie_pumpkins = new_pumpkins[new_pumpkins['Variety']=='PIE TYPE']
pie_pumpkins.plot.scatter('DayOfYear','Price')
இப்போது corr செயல்பாட்டைப் பயன்படுத்தி Price மற்றும் DayOfYear இடையேயான தொடர்பை கணக்கிடினால், -0.27 போன்ற ஒன்றைப் பெறுவோம் - இது ஒரு கணிப்பீட்டு மாடலை பயிற்சி செய்வது பொருத்தமாக உள்ளது என்று பொருள்.
ஒரு நேரியல் ரிக்ரஷன் மாடலை பயிற்சி செய்வதற்கு முன், எங்கள் தரவுகள் சுத்தமாக உள்ளன என்பதை உறுதிப்படுத்துவது முக்கியம். நேரியல் ரிக்ரஷன் வெற்றிட மதிப்புகளுடன் நன்றாக வேலை செய்யாது, எனவே அனைத்து காலியான செல்களை அகற்றுவது பொருத்தமாக இருக்கும்:
pie_pumpkins.dropna(inplace=True)
pie_pumpkins.info()
மற்றொரு அணுகுமுறை, காலியான மதிப்புகளை தொடர்புடைய பத்தியில் இருந்து சராசரி மதிப்புகளால் நிரப்புவது.
எளிய நேரியல் ரிக்ரஷன்
🎥 மேலே உள்ள படத்தை கிளிக் செய்து Scikit-learn பயன்படுத்தி நேரியல் மற்றும் பாலினோமியல் ரிக்ரஷனின் சுருக்கமான வீடியோ கண்ணோட்டத்தைப் பாருங்கள்.
எங்கள் நேரியல் ரிக்ரஷன் மாடலை பயிற்சி செய்ய, Scikit-learn நூலகத்தைப் பயன்படுத்துவோம்.
from sklearn.linear_model import LinearRegression
from sklearn.metrics import mean_squared_error
from sklearn.model_selection import train_test_split
முதலில், உள்ளீட்டு மதிப்புகள் (அம்சங்கள்) மற்றும் எதிர்பார்க்கப்படும் வெளியீடு (லேபல்) ஆகியவற்றை தனித்தனியாக numpy வரிசைகளாக பிரிக்கிறோம்:
X = pie_pumpkins['DayOfYear'].to_numpy().reshape(-1,1)
y = pie_pumpkins['Price']
கவனிக்கவும், Linear Regression தொகுப்பு அதை சரியாக புரிந்துகொள்ள
reshapeசெய்ய வேண்டியிருந்தது. Linear Regression ஒரு 2D-வரிசையை உள்ளீடாக எதிர்பார்க்கிறது, அங்கு வரிசையின் ஒவ்வொரு வரிசையும் உள்ளீட்டு அம்சங்களின் ஒரு வெக்டருக்கு இணையாக இருக்கும். எங்கள் வழக்கில், ஏனெனில் எங்களுக்கு ஒரு உள்ளீடு மட்டுமே உள்ளது - N×1 வடிவத்துடன் ஒரு வரிசை தேவை, N தரவுத்தொகுப்பின் அளவு.
பின்னர், தரவுகளை பயிற்சி மற்றும் சோதனை தரவுத்தொகுப்புகளாகப் பிரிக்க வேண்டும், பயிற்சிக்குப் பிறகு எங்கள் மாடலை சரிபார்க்க முடியும்:
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=0)
இறுதியாக, உண்மையான நேரியல் ரிக்ரஷன் மாடலை பயிற்சி செய்வது இரண்டு வரிகளின் குறியீட்டில் மட்டுமே ஆகிறது. LinearRegression பொருளை வரையறுத்து, fit முறைமையைப் பயன்படுத்தி அதை எங்கள் தரவுகளுக்கு பொருத்துகிற
மாதிரி எவ்வளவு துல்லியமாக உள்ளது என்பதைப் பார்க்க, நாம் சோதனை தரவுத்தொகுப்பில் விலைகளை கணிக்கலாம், பின்னர் எங்கள் கணிப்புகள் எதிர்பார்க்கப்படும் மதிப்புகளுக்கு எவ்வளவு அருகில் உள்ளன என்பதை அளவிடலாம். இதைச் செய்ய மீன் ஸ்கொயர் எரர் (MSE) அளவுகோல்களைப் பயன்படுத்தலாம், இது எதிர்பார்க்கப்படும் மற்றும் கணிக்கப்பட்ட மதிப்புகளுக்கு இடையிலான அனைத்து சதுர வித்தியாசங்களின் சராசரி ஆகும்.
pred = lin_reg.predict(X_test)
mse = np.sqrt(mean_squared_error(y_test,pred))
print(f'Mean error: {mse:3.3} ({mse/np.mean(pred)*100:3.3}%)')
எங்கள் பிழை சுமார் 2 புள்ளிகள், இது ~17% ஆக உள்ளது. இது மிகச் சிறந்தது அல்ல. மாதிரியின் தரத்தை அளவிட மற்றொரு குறியீடு தீர்மானக் குணகம் ஆகும், இதை இவ்வாறு பெறலாம்:
score = lin_reg.score(X_train,y_train)
print('Model determination: ', score)
மதிப்பு 0 என்றால், மாதிரி உள்ளீட்டு தரவுகளை கணக்கில் எடுத்துக் கொள்ளவில்லை, மற்றும் மிக மோசமான நேரியல் கணிப்பாளர் ஆக செயல்படுகிறது, இது முடிவின் சராசரி மதிப்பு மட்டுமே. மதிப்பு 1 என்றால், நாம் எதிர்பார்க்கப்படும் அனைத்து வெளியீடுகளையும் சரியாகக் கணிக்க முடியும். எங்கள் நிலைமையில், தீர்மானக் குணகம் சுமார் 0.06 ஆக உள்ளது, இது மிகவும் குறைவாக உள்ளது.
நாம் சோதனை தரவுகளை மற்றும் ரெக்ரஷன் கோட்டை ஒன்றாக வரைந்து, எங்கள் நிலைமையில் ரெக்ரஷன் எப்படி செயல்படுகிறது என்பதை தெளிவாகப் பார்க்கலாம்:
plt.scatter(X_test,y_test)
plt.plot(X_test,pred)
பாலினோமியல் ரெக்ரஷன்
நேரியல் ரெக்ரஷனின் மற்றொரு வகை பாலினோமியல் ரெக்ரஷன் ஆகும். சில நேரங்களில் மாறிகள் இடையே நேரியல் உறவு இருக்கும் - கும்மியளவு அதிகமாக இருந்தால், விலை அதிகமாக இருக்கும் - ஆனால் சில நேரங்களில் இந்த உறவுகளை ஒரு தளம் அல்லது நேர்கோட்டாக வரைந்து காட்ட முடியாது.
✅ இங்கே பாலினோமியல் ரெக்ரஷன் பயன்படுத்தக்கூடிய தரவின் சில உதாரணங்கள் உள்ளன.
Date மற்றும் Price இடையேயான உறவை மீண்டும் பாருங்கள். இந்த சிதறல் வரைபடம் நேர்கோட்டால் பகுப்பாய்வு செய்யப்பட வேண்டும் என்று தோன்றுகிறதா? விலைகள் மாறக்கூடாது? இந்த நிலைமையில், நீங்கள் பாலினோமியல் ரெக்ரஷனை முயற்சிக்கலாம்.
✅ பாலினோமியல்கள் ஒரு அல்லது அதற்கு மேற்பட்ட மாறிகள் மற்றும் குணகங்கள் கொண்ட கணிதப் பிரகடனங்கள் ஆகும்.
பாலினோமியல் ரெக்ரஷன் நேரியல் தரவுக்கு பொருத்தமாக ஒரு வளைந்த கோட்டை உருவாக்குகிறது. எங்கள் நிலைமையில், DayOfYear மாறியை சதுரமாக உள்ளீட்டு தரவுகளில் சேர்த்தால், ஆண்டின் ஒரு குறிப்பிட்ட புள்ளியில் குறைந்தபட்சம் இருக்கும் ஒரு பரபாலிக் வளைவை எங்கள் தரவுடன் பொருத்த முடியும்.
Scikit-learn ஒரு பயனுள்ள pipeline API ஐ உள்ளடக்கியது, இது தரவுப் செயலாக்கத்தின் பல்வேறு படிகளை ஒன்றாக இணைக்க உதவுகிறது. Pipeline என்பது estimators களின் சங்கிலி ஆகும். எங்கள் நிலைமையில், முதலில் பாலினோமியல் அம்சங்களை மாதிரியில் சேர்த்து, பின்னர் ரெக்ரஷனை பயிற்சி செய்யும் ஒரு pipeline ஐ உருவாக்குவோம்:
from sklearn.preprocessing import PolynomialFeatures
from sklearn.pipeline import make_pipeline
pipeline = make_pipeline(PolynomialFeatures(2), LinearRegression())
pipeline.fit(X_train,y_train)
PolynomialFeatures(2) ஐப் பயன்படுத்துவது, உள்ளீட்டு தரவிலிருந்து அனைத்து இரண்டாம் நிலை பாலினோமியல்களையும் சேர்க்கும். எங்கள் நிலைமையில், இது DayOfYear2 ஆக இருக்கும், ஆனால் இரண்டு உள்ளீட்டு மாறிகள் X மற்றும் Y கொடுக்கப்பட்டால், இது X2, XY மற்றும் Y2 ஐச் சேர்க்கும். மேலும், நாம் விரும்பினால் அதிக நிலை பாலினோமியல்களையும் பயன்படுத்தலாம்.
Pipeline ஐ LinearRegression பொருளைப் போலவே பயன்படுத்தலாம், அதாவது, pipeline ஐ fit செய்து, பின்னர் predict ஐப் பயன்படுத்தி கணிப்பு முடிவுகளைப் பெறலாம். சோதனை தரவுகள் மற்றும் அணுகுமுறை வளைவை காட்டும் வரைபடம் இங்கே உள்ளது:
பாலினோமியல் ரெக்ரஷனைப் பயன்படுத்தி, நாம் சற்று குறைந்த MSE மற்றும் அதிக தீர்மானத்தைப் பெற முடியும், ஆனால் குறிப்பிடத்தக்க அளவில் அல்ல. மற்ற அம்சங்களைப் பின்பற்ற வேண்டும்!
நீங்கள் பார்க்கலாம், கும்மி விலைகள் குறைந்தபட்சமாக ஹாலோவீன் அருகே காணப்படுகின்றன. இதை நீங்கள் எப்படி விளக்குவீர்கள்?
🎃 வாழ்த்துகள், நீங்கள் பை கும்மிகளின் விலையை கணிக்க உதவும் ஒரு மாதிரியை உருவாக்கியுள்ளீர்கள். நீங்கள் இதே செயல்முறையை அனைத்து கும்மி வகைகளுக்கும் மீண்டும் செய்யலாம், ஆனால் அது சிரமமாக இருக்கும். இப்போது, எங்கள் மாதிரியில் கும்மி வகையை கணக்கில் எடுப்பது எப்படி என்பதைப் பார்ப்போம்!
வகை அம்சங்கள்
சிறந்த உலகில், ஒரே மாதிரியைப் பயன்படுத்தி வெவ்வேறு கும்மி வகைகளுக்கான விலைகளை கணிக்க முடியும். ஆனால், Variety பத்தி Month போன்ற பத்திகளிலிருந்து சற்று வேறுபட்டது, ஏனெனில் இது எண்ணியல் அல்லாத மதிப்புகளை கொண்டுள்ளது. இவ்வகை பத்திகள் categorical என்று அழைக்கப்படுகின்றன.
🎥 மேலே உள்ள படத்தை கிளிக் செய்து வகை அம்சங்களைப் பயன்படுத்துவதற்கான சுருக்கமான வீடியோவைப் பாருங்கள்.
இங்கே நீங்கள் வகை அடிப்படையில் சராசரி விலை எப்படி மாறுகிறது என்பதைப் பார்க்கலாம்:
வகையை கணக்கில் எடுக்க, முதலில் அதை எண்ணியல் வடிவத்திற்கு மாற்ற வேண்டும், அல்லது encode செய்ய வேண்டும். இதைச் செய்ய பல வழிகள் உள்ளன:
- எளிய numeric encoding ஒரு வகை பட்டியலை உருவாக்கி, பின்னர் வகை பெயரை அந்த பட்டியலில் உள்ள ஒரு குறியீட்டால் மாற்றும். இது நேரியல் ரெக்ரஷனுக்கு சிறந்த யோசனை அல்ல, ஏனெனில் நேரியல் ரெக்ரஷன் குறியீட்டின் உண்மையான எண்ணியல் மதிப்பை எடுத்துக் கொண்டு, அதை ஒரு குணகத்தால் பெருக்கி முடிவில் சேர்க்கும். எங்கள் நிலைமையில், குறியீட்டு எண் மற்றும் விலை இடையேயான உறவு தெளிவாகவே நேரியல் அல்ல, எங்கள் குறியீடுகள் ஒரு குறிப்பிட்ட முறையில் வரிசைப்படுத்தப்பட்டாலும் கூட.
- One-hot encoding
Varietyபத்தியை 4 வெவ்வேறு பத்திகளால் மாற்றும், ஒவ்வொரு வகைக்கும் ஒரு பத்தி. ஒவ்வொரு பத்தியும், அந்த வரிசை ஒரு குறிப்பிட்ட வகையைச் சேர்ந்தது என்றால்1ஐ கொண்டிருக்கும், இல்லையெனில்0ஐ கொண்டிருக்கும். இது, கும்மி வகைக்கு ஒவ்வொன்றுக்கும், அந்த குறிப்பிட்ட வகைக்கு "தொடக்க விலை" (அல்லது "கூடுதல் விலை")க்கு பொறுப்பான, நேரியல் ரெக்ரஷனில் நான்கு குணகங்களை உருவாக்கும்.
வகையை one-hot encode செய்யும் விதம் கீழே உள்ள கோடில் காட்டப்பட்டுள்ளது:
pd.get_dummies(new_pumpkins['Variety'])
| ID | FAIRYTALE | MINIATURE | MIXED HEIRLOOM VARIETIES | PIE TYPE |
|---|---|---|---|---|
| 70 | 0 | 0 | 0 | 1 |
| 71 | 0 | 0 | 0 | 1 |
| ... | ... | ... | ... | ... |
| 1738 | 0 | 1 | 0 | 0 |
| 1739 | 0 | 1 | 0 | 0 |
| 1740 | 0 | 1 | 0 | 0 |
| 1741 | 0 | 1 | 0 | 0 |
| 1742 | 0 | 1 | 0 | 0 |
One-hot encode செய்யப்பட்ட வகையை உள்ளீடாகக் கொண்டு நேரியல் ரெக்ரஷனைப் பயிற்சி செய்ய, X மற்றும் y தரவுகளை சரியாக initialize செய்ய வேண்டும்:
X = pd.get_dummies(new_pumpkins['Variety'])
y = new_pumpkins['Price']
மீதமுள்ள கோடு, Linear Regression ஐ பயிற்சி செய்ய மேலே பயன்படுத்தியதைப் போலவே இருக்கும். நீங்கள் முயற்சித்தால், மீன் ஸ்கொயர் பிழை சுமார் அதே அளவாக இருக்கும், ஆனால் தீர்மானக் குணகம் மிகவும் அதிகமாக (~77%) இருக்கும். மேலும் துல்லியமான கணிப்புகளைப் பெற, மேலும் பல வகை அம்சங்களை, மற்றும் Month அல்லது DayOfYear போன்ற எண்ணியல் அம்சங்களைப் பின்பற்றலாம். ஒரு பெரிய அம்சங்களின் வரிசையைப் பெற, join ஐப் பயன்படுத்தலாம்:
X = pd.get_dummies(new_pumpkins['Variety']) \
.join(new_pumpkins['Month']) \
.join(pd.get_dummies(new_pumpkins['City'])) \
.join(pd.get_dummies(new_pumpkins['Package']))
y = new_pumpkins['Price']
இங்கே, City மற்றும் Package வகையைப் பின்பற்றுகிறோம், இது MSE 2.84 (10%) மற்றும் தீர்மானம் 0.94 ஐ வழங்குகிறது!
அனைத்தையும் ஒன்றாக இணைத்தல்
சிறந்த மாதிரியை உருவாக்க, மேலே உள்ள உதாரணத்திலிருந்து (one-hot encode செய்யப்பட்ட வகை + எண்ணியல்) தரவுகளை Polynomial Regression உடன் இணைத்து பயன்படுத்தலாம். உங்கள் வசதிக்காக முழு கோடு இங்கே உள்ளது:
# set up training data
X = pd.get_dummies(new_pumpkins['Variety']) \
.join(new_pumpkins['Month']) \
.join(pd.get_dummies(new_pumpkins['City'])) \
.join(pd.get_dummies(new_pumpkins['Package']))
y = new_pumpkins['Price']
# make train-test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=0)
# setup and train the pipeline
pipeline = make_pipeline(PolynomialFeatures(2), LinearRegression())
pipeline.fit(X_train,y_train)
# predict results for test data
pred = pipeline.predict(X_test)
# calculate MSE and determination
mse = np.sqrt(mean_squared_error(y_test,pred))
print(f'Mean error: {mse:3.3} ({mse/np.mean(pred)*100:3.3}%)')
score = pipeline.score(X_train,y_train)
print('Model determination: ', score)
இது எங்களுக்கு MSE=2.23 (~8% prediction error) மற்றும் தீர்மானக் குணகம் 97% அளவுக்கு தர வேண்டும்.
| மாதிரி | MSE | தீர்மானம் |
|---|---|---|
DayOfYear Linear |
2.77 (17.2%) | 0.07 |
DayOfYear Polynomial |
2.73 (17.0%) | 0.08 |
Variety Linear |
5.24 (19.7%) | 0.77 |
| All features Linear | 2.84 (10.5%) | 0.94 |
| All features Polynomial | 2.23 (8.25%) | 0.97 |
🏆 வாழ்த்துகள்! நீங்கள் ஒரு பாடத்தில் நான்கு ரெக்ரஷன் மாதிரிகளை உருவாக்கி, மாதிரி தரத்தை 97% வரை மேம்படுத்தியுள்ளீர்கள். ரெக்ரஷன் பற்றிய இறுதி பகுதியில், வகைகளைத் தீர்மானிக்க Logistic Regression பற்றி நீங்கள் கற்றுக்கொள்வீர்கள்.
🚀சவால்
இந்த நோட்புக்கில் பல்வேறு மாறிகளைச் சோதித்து, தொடர்பு மாதிரி துல்லியத்துடன் எப்படி பொருந்துகிறது என்பதைப் பாருங்கள்.
பாடத்திற்குப் பிந்தைய வினாடி வினா
மதிப்பீடு & சுயபயிற்சி
இந்த பாடத்தில் நாம் Linear Regression பற்றி கற்றுக்கொண்டோம். Regression இன் மற்ற முக்கிய வகைகள் உள்ளன. Stepwise, Ridge, Lasso மற்றும் Elasticnet தொழில்நுட்பங்கள் பற்றி படிக்கவும். மேலும் அறிய Stanford Statistical Learning course ஒரு நல்ல பாடமாகும்.
பணிக்கட்டளை
அறிவிப்பு:
இந்த ஆவணம் Co-op Translator என்ற AI மொழிபெயர்ப்பு சேவையை பயன்படுத்தி மொழிபெயர்க்கப்பட்டுள்ளது. நாங்கள் துல்லியத்திற்காக முயற்சிக்கிறோம், ஆனால் தானியங்கி மொழிபெயர்ப்புகளில் பிழைகள் அல்லது தவறுகள் இருக்கக்கூடும் என்பதை கவனத்தில் கொள்ளவும். அதன் சொந்த மொழியில் உள்ள மூல ஆவணம் அதிகாரப்பூர்வ ஆதாரமாக கருதப்பட வேண்டும். முக்கியமான தகவல்களுக்கு, தொழில்முறை மனித மொழிபெயர்ப்பு பரிந்துரைக்கப்படுகிறது. இந்த மொழிபெயர்ப்பைப் பயன்படுத்துவதால் ஏற்படும் எந்த தவறான புரிதல்களுக்கும் அல்லது தவறான விளக்கங்களுக்கும் நாங்கள் பொறுப்பல்ல.






