You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
ML-For-Beginners/translations/te/2-Regression/2-Data
localizeflow[bot] 5ecbb045c5
[te,ml,kn] chore(i18n): sync translations
1 month ago
..
solution [te,ml,kn] chore(i18n): sync translations 1 month ago
README.md [te,ml,kn] chore(i18n): sync translations 1 month ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 300 changes) 7 months ago
notebook.ipynb chore(i18n): sync translations with latest source changes (chunk 9/10, 100 files) 8 months ago

README.md

Scikit-learn ఉపయోగించి రిగ్రెషన్ మోడల్‌ను నిర్మించండి: డేటా సిద్ధం చేయండి మరియు విజువలైజ్ చేయండి

డేటా విజువలైజేషన్ ఇన్ఫోగ్రాఫిక్

ఇన్ఫోగ్రాఫిక్ Dasani Madipalli చేత

ప్రీ-లెక్చర్ క్విజ్

ఈ పాఠం R లో అందుబాటులో ఉంది!

పరిచయం

మీరు Scikit-learn తో యాంత్రిక అభ్యాస నమూనా నిర్మాణాన్ని ప్రారంభించడానికి అవసరమైన సాధనాలతో సన్నద్ధంగా ఉన్నప్పుడు, మీ డేటాపై ప్రశ్నలు అడగడానికి సిద్ధంగా ఉన్నారు. మీరు డేటాతో పని చేస్తూ ML పరిష్కారాలను అన్వయించినప్పుడు, మీ డేటాసెట్ యొక్క శక్తులను సక్రమంగా విశ్లేషించేందుకు సరైన ప్రశ్న ఎలా అడగాలి అనేది అర్థం చేసుకోవడం చాలా ముఖ్యం.

ఈ పాఠంలో మీరు నేర్చుకుంటారు:

  • మోడల్-బిల్డింగ్ కోసం మీ డేటాను ఎలా తయారు చేసుకోవాలి.
  • డేటా విజువలైజేషన్ కోసం Matplotlib ను ఎలా ఉపయోగించాలి.
  • మరింత స్పష్టమైన డేటా విజువలైజేషన్ కోసం Seaborn ను ఎలా ఉపయోగించాలి.

మీ డేటాకు సరైన ప్రశ్న అడగడం

మీరు సమాధానం కావలసిన ప్రశ్న మీరు ఉపయోగించబోయే ML ఆల్గోరిథమ్స్ రకాన్ని నిర్ణయిస్తుంది. మీరు పొందే సమాధానం నాణ్యత మీ డేటా స్వభావంపై బరువుగా ఆధారపడి ఉంటుంది.

ఈ పాఠానికి అందుబాటులో ఉన్న డేటా ను పరిశీలించండి. ఈ .csv ఫైల్‌ను VS Code లో తెరవొచ్చు. చురుకైన పరిశీలన వెంటనే తెలియజేస్తుంది ఈ డేటాలో ఖాళీలు, స్ట్రింగ్స్ మరియు సంఖ్యల మిశ్రమం ఉందని. 'Package' అనే విచిత్రమైన కాలమ్ కూడా ఉంది, డేటా 'sacks', 'bins' మరియు ఇతర విలువల మిశ్రమంగా ఉంది. వాస్తవానికి, డేటా కొంత అసమంజసంగా ఉంది.

ML for beginners - ఒక డేటాసెట్‌ను ఎలా విశ్లేషించి శుభ్రం చేయాలి

🎥 ఈ పాఠానికి డేటాను సిద్ధం చేసే సంక్షిప్త వీడియో కోసం పై చిత్రం క్లిక్ చేయండి.

వాస్తవానికి, ఓ డేటాసెట్‌ను పూర్తిగా ఉపయోగించడానికి సన్నద్ధంగా మిళితం చేయబడినట్లు అందుకోవడం అరుదు. ఈ పాఠంలో, మీరు ప్రామాణిక Python లైబ్రరీలు ఉపయోగించి రా డేటాను ఎలా సిద్దం చేయాలో నేర్చుకుంటారు. మీరు డేటాను విజువలైజ్ చేసే వివిధ సాంకేతికాలను కూడా నేర్చుకుంటారు.

కేస్ స్టడీ: 'పంప్కిన్ మార్కెట్'

ఈ ఫోల్డర్‌లో మీరు రూట్ data ఫోల్డర్‌లో US-pumpkins.csv అనే .csv ఫైల్‌ను కనుగొంటారు, దీనిలో సిటీల వారీగా వర్గీకరించిన 1757 లైన్లుగా pumpkins మార్కెట్ గురించి డేటా ఉంది. ఇది యునైటెడ్ స్టేట్స్ డిపార్ట్‌మెంట్ ఆఫ్ అగ్రికల్చర్ పంపిణీ చేసే Specialty Crops Terminal Markets Standard Reports నుండి వెలికి తీయబడిన రా డేటా.

డేటా సిద్ధం చేయడం

ఈ డేటా పబ్లిక్ డొమైన్ లో ఉంది. USDA వెబ్‌సైట్ నుండి సిటీ వారీగా వేరే వేరే ఫైళ్లలో డౌన్‌లోడ్ చేయవచ్చు. చాలా వేర్వేరు ఫైళ్లను సృష్టించకుండా ఉండేందుకు, మేము అన్ని సిటీ డేటాను ఒక స్ప్రెడ్షీట్‌లో మిళితం చేశాము, కాబట్టి కొంత వరకు మేము డేటాను సిద్ధం చేసినట్టే. ఇప్పుడు, డేటాను మరింత దగ్గరగా పరిశీలిద్దాం.

సంపూర్ణ పంప్కిన్ డేటా - ప్రారంభ నిష్కర్షలు

ఈ డేటా గురించి మీరు ఏమి గమనిస్తారు? మీరు ఇప్పటికే స్ట్రింగ్స్, సంఖ్యలు, ఖాళీలు మరియు విచిత్రమైన విలువల మిశ్రమం ఉందని చూశారు, ఇవి మీరు అర్థం చేసుకోవాలి.

రిగ్రెషన్ సాంకేతికత వాడి ఈ డేటాకు మీరు ఏమి ప్రశ్న అడగగలరు? ఉదాహరణకు "నిర్దిష్ట నెలలో అమ్మకానికి ఉండే పంప్కిన్ ధరను అంచనా వేయండి" అనే ప్రశ్న ఎలానో చూడండి. డేటాను మరోసారి పరిశీలిస్తే, ఈ పని కోసం అవసరమైన డేటా నిర్మాణాన్ని సృష్టించడానికి కొన్ని మార్పులు అవసరం.

వ్యాయామం - పంప్కిన్ డేటా విశ్లేషణ

Pandas, (పేరు Python Data Analysis కి సంక్షిప్తం), డేటా ఆకారాన్ని మార్చటానికి చాలా ఉపయోగకరమైన సాధనం, ఉపయోగించి ఈ పంప్కిన్ డేటాను విశ్లేషించి సిద్దం చేయండి.

ముందుగా, మిస్సింగ్ తేదీలను పరిశీలించండి

ముందుగా మీరు మిస్సింగ్ తేదీలు ఉన్నాయో లేదో పరిశీలించండి:

  1. తేదీలను నెల ఫార్మాట్‌గా మార్చండి (ఇవి US తేదీలు, కాబట్టి ఫార్మాట్ MM/DD/YYYY).
  2. నెలను కొత్త కాలమ్‌లో తీసుకోండి.

Visual Studio Code లో notebook.ipynb ఫైల్ తెరవండి మరియు స్ప్రెడ్షీట్‌ను కొత్త Pandas డేటాఫ్రేమ్‌లో దిగుమతి చేయండి.

  1. మొదటి ఐదు పంగ్తులను చూడటానికి head() ఫంక్షన్ వాడండి.

    import pandas as pd
    pumpkins = pd.read_csv('../data/US-pumpkins.csv')
    pumpkins.head()
    

    చివరి ఐదు పంగ్తులను చూడటానికి మీరు ఏ ఫంక్షన్ వాడతారు?

  2. ప్రస్తుత డేటాఫ్రేమ్ లో మిస్సింగ్ డేటా ఉన్నదేమో చూడండి:

    pumpkins.isnull().sum()
    

    మిస్సింగ్ డేటా ఉంది, కానీ మీరు చేసే పనికి అది ప్రాముఖ్యం కాకపోవచ్చు.

  3. మీ డేటాఫ్రేమ్‌తో పని సులభం చేయడానికి, అవసరమైన కాలమ్స్ ని మాత్రమే loc ఫంక్షన్ ద్వారా ఎంచుకోండి, ఇది ఒరిజినల్ డేటాఫ్రేమ్ నుండి పంగ్తులు (మొదటి పారామీటర్) మరియు కాలమ్స్ (రెండవ పారామీటర్) ను తీసుకుంటుంది. క్రింద ఉన్న : అర్థం "అన్ని పంగ్తులు".

    columns_to_select = ['Package', 'Low Price', 'High Price', 'Date']
    pumpkins = pumpkins.loc[:, columns_to_select]
    

రెండవది, పంప్కిన్ సగటు ధర నిర్ణయించండి

ఒక నెలలో పంప్కిన్ సగటు ధర ఎలా నిర్ణయించాలో ఆలోచించండి. ఈ పనికి మీరు ఏ కాలమ్స్ ఎంచుకుంటారు? సూచన: మీరు 3 కాలమ్స్ అవసరం.

పరిష్కారం: కొత్త ధర కాలమ్ నింపడానికి Low Price మరియు High Price కాలమ్స్ సగటు తీసుకోవడం, మరియు Date కాలమ్‌ను కేవలం నెలను చూపించేలా మార్చడం. అదృష్టవశాత్తూ, పై తనిఖీ ప్రకారం, తేదీలు లేదా ధరల కోసం మిస్సింగ్ డేటా లేదు.

  1. సగటు ధర ఖరారుచేయడానికి ఈ కోడ్ జోడించండి:

    price = (pumpkins['Low Price'] + pumpkins['High Price']) / 2
    
    month = pd.DatetimeIndex(pumpkins['Date']).month
    
    

    మీరు print(month) ఉపయోగించి ఏ డేటా అయినా చూడవచ్చు.

  2. ఇప్పుడు, మార్చిన డేటాను కొత్త Pandas డేటాఫ్రేమ్‌లో నకలుచేసుకోండి:

    new_pumpkins = pd.DataFrame({'Month': month, 'Package': pumpkins['Package'], 'Low Price': pumpkins['Low Price'],'High Price': pumpkins['High Price'], 'Price': price})
    

    మీ డేటాఫ్రేమ్ ముద్రించితే, మీరు ఒక శుభ్ర మరియు సముచితమైన డేటాసెట్ చూస్తారు, దీని పై మీరు కొత్త రిగ్రెషన్ మోడల్ నిర్మించవచ్చు.

అయితే! ఇక్కడ కొంత విచిత్రత ఉంది

మీరు Package కాలమ్ గమనిస్తే, pumpkins అనేక రకాలుగా అమ్మబడుతున్నాయి. కొంత '1 1/9 bushel' కొలమానం, కొంత '1/2 bushel', కొంత pumpkin ప్రాతినిథ్యం, మరికొంత పౌండ్ల అనుగుణంగా, ఇంకా కొంత పెద్ద బాక్సుల్లో వివిధ వెడల్పులతో.

pumpkins ని స్థిరంగా తూకం పంపించడం చాలా కష్టం అని కనిపిస్తోంది

అసలు డేటాలో చూపిస్తున్నట్లుగా, Unit of Sale 'EACH' లేదా 'PER BIN' గా ఉన్న ఏదైనా Package రకం అంగుళం, బిన్, లేదా 'each'గా వుంది. pumpkins ని స్థిరంగా తూకం పంపించడం చాలా కష్టం కనుక, వారి Package కాలమ్లో 'bushel' స్ట్రింగ్ ఉన్న pumpkins మాత్రమే ఎంచుకుని ఫిల్టర్ చేయండి.

  1. ఫైల్ ప్రారంభంలో, మొదటి .csv దిగుమతుల తర్వాత ఫిల్టర్ జోడించండి:

    pumpkins = pumpkins[pumpkins['Package'].str.contains('bushel', case=True, regex=True)]
    

    మీరు ఇప్పుడు డేటాను ప్రింట్ చేస్తే, మీరు బస్సెల్ ద్వారా pumpkins కలిగి ఉన్న సుమారు 415 ఎంట్రీలను మాత్రమే చూస్తారు.

కానీ! ఇంకో పని ఒకది చేయాల్సి ఉంది

మీరు గమనిస్తారా, ప్రతి పంగ్తిలో బస్సెల్ పరిమాణం మారుతుంది? మీరు ధరలను ఒకే ప్రమాణంలో చూపించాలంటే, బస్సెల్ ప్రామాణానికి సరిపడ도록 గణితశాస్త్రం చేయాలి.

  1. ఈ క్రొత్త_new_pumpkins డేటాఫ్రేమ్ సృష్టించిన బ్లాక్ తరువాత ఈ వరుసలు జోడించండి:

    new_pumpkins.loc[new_pumpkins['Package'].str.contains('1 1/9'), 'Price'] = price/(1 + 1/9)
    
    new_pumpkins.loc[new_pumpkins['Package'].str.contains('1/2'), 'Price'] = price/(1/2)
    

The Spruce Eats ప్రకారం, బస్సెల్ యొక్క బరువు ఉత్పత్తి రకంపై ఆధారపడి ఉంటుంది, ఇది వాల్యూమ్ కొలత. "ఉదాహరణకు, టమాటోలు బస్సెల్ 56 పౌండ్ల బరువు కలిగి ఉండాలి... ఆకు కూరగాయలు తక్కువ బరువుతో ఎక్కువ స్థలాన్ని తీసుకుంటాయి, కాబట్టి స్పిన్నాచ్ బస్సెల్ 20 పౌండ్ల మాత్రమే ఉంటుంది." ఇది చాలా జటిలం! బస్సెల్ నుండి పౌండ్లకు మార్పిడి చేయకుండా బస్సెల్ ప్రకారం ధరను చూపిద్దాం. పంప్కిన్ బస్సెల్స్ పై ఈ అధ్యయనం మీ డేటా స్వభావాన్ని అర్థం చేసుకోవటం ఎంత ముఖ్యం అనేది చూపిస్తుంది!

ఇప్పుడు, మీరు బస్సెల్ కొలత ఆధారంగా యూనిట్ ప్రైసింగ్‌ను విశ్లేషించవచ్చు. మీరు ఒక దఫా మరల డేటా ప్రింట్ చేస్తే, అది ఎలా ప్రమాణీకరించబడిందో చూడగలరు.

మీరు గమనించారా, అর্ধ బస్సెల్ ద్వారా అమ్ముతున్న pumpkins చాలా ఖరీదైనవి. దీని కారణం మీకు అర్థమవుతుందా? సూచన: చిన్న pumpkins పెద్ద pumpkins కంటే చాలా ఎక్కువ ధర కలుగుతుంది, ఎందుకంటే పెద్ద బస్సెల్ ఓ పెద్ద, ఖాళీ పిండి పంప్కిన్ తీసుకునే స్థలాన్ని తగ్గిస్తుంది, అందుబాటులో లేని స్థలం కారణంగా ఎక్కువ pumpkins ఉంటాయి.

విజువలైజేషన్ యుక్తులు

డేటా శాస్త్రవేత్తగా మీ పని భాగం మీరు పని చేస్తున్న డేటా నాణ్యత మరియు స్వభావాన్ని ప్రదర్శించడం. దీని కోసం, వారు తరచుగా వివిధ డేటా పార్శ్వాలను చూపించే ఆసక్తికరమైన విజువలైజేషన్లు, ప్లాట్లు, గ్రాఫ్లు, చార్ట్లు తయారుచేస్తారు. అలా చేస్తే, సానుకూల సంబంధాలు మరియు గ్యాప్‌లు చూపించబడతాయి, ఇవి మరలా కనుగొనడం కష్టమైనవి.

ML for beginners - Matplotlib తో డేటా విజువలైజ్ ఎలా చేయాలి

🎥 ఈ పాఠానికి డేటా విజువలైజ్ చేసే సంక్షిప్త వీడియో కోసం పై చిత్రం క్లిక్ చేయండి.

విజువలైజేషన్లు డేటాకు అత్యుత్తమ యాంత్రిక అభ్యాస సాంకేతికాన్ని ఎంపిక చేయడంలో కూడా సహాయపడతాయి. ఉదాహరణకు, ఒక స్కాటర్‌ప్లాట్ లైన్‌ను అనుసరిస్తుందని కనిపిస్తే, ఆ డేటా లీనియర్ రిగ్రెషన్ ఉపయోగించడానికి అనుకూలంగా ఉండవచ్చు.

Jupyter నోట్బుక్‌లలో బాగా పనిచేసే ఒక డేటా విజువలైజేషన్ లైబ్రరీ Matplotlib (ముందరి పాఠంలో మీరు దీనిని చూశారు).

మరింత అనుభవం కోసం ఈ ట్యుటోరియల్స్ చూడండి.

వ్యాయామం - Matplotlib తో ప్రయోగం చేయండి

మీరు సృష్టించిన కొత్త డేటాఫ్రేమ్ ప్రదర్శించడానికి కొంత సరళమైన ప్లాట్లు తయారుచేయండి. ఒక సాధారణ లైన్ ప్లాట్ ఏం చూపిస్తుంది?

  1. ఫైల్ టాప్‌లో Pandas దిగుమతి కింద Matplotlib దిగుమతి చేయండి:

    import matplotlib.pyplot as plt
    
  2. మొత్తం నోట్బుక్‌ను తిరిగి పరుగెత్తించండి.

  3. నోట్బుక్ దిగువ భాగంలో, డేటాను బాక్స్ ప్లాట్‌గా చూపడానికి ఒక సెల్ జోడించండి:

    price = new_pumpkins.Price
    month = new_pumpkins.Month
    plt.scatter(price, month)
    plt.show()
    

    ధర మరియు నెల సంబంధం చూపించే స్కాటర్‌ప్లాట్

    ఇది ఉపయోగకరమైన ప్లాట్ అని మీరు అనుకుంటారా? ఏమీ మీరు ఆశ్చర్యపరుస్తుందా?

    ఇది అంతగా ఉపయోగకరం కాదు, ఎందుకంటే ఇది కేవలం మీ డేటాను ఒక నెలలో పాయింట్లు ఆవర్తనంగా మాత్రమే చూపుతోంది.

ఉపయోగకరంగా మార్చండి

డేటాను ఉపయోగకరంగా చూపించాలంటే, మీరు సాధారణంగా డేటాను ఏదో విధంగా సమూహాలుగా పంచడం చాలా అవసరం. y అక్షం నెలలను చూపిస్తూ, డేటా పంపిణీని చూపించే ప్లాట్ తయారుచేయాలని ప్రయత్నిద్దాం.

  1. సమూహ బార్ చార్ట్ సృష్టించడానికి సెల్ జోడించండి:

    new_pumpkins.groupby(['Month'])['Price'].mean().plot(kind='bar')
    plt.ylabel("Pumpkin Price")
    

    ధర మరియు నెల సంబంధం చూపించే బార్ చార్ట్

    ఇది మరింత ఉపయోగకరమైన డేటా విజువలైజేషన్! pumpkins కి అత్యధిక ధర సెప్టెంబర్ మరియు అక్టోబర్ నెలల్లో ఉందని ఇది సూచిస్తుంది. మీ అంచనాలకు ఇది సరిపోతుందా? ఎందుకు లేదా ఎందుకు కాదు?

వ్యాయామం - Seaborn తో ప్రయోగం చేయండి

Matplotlib శక్తివంతమైనది, కానీ మంచి ప్లాట్ తయారుచేసేందుకు చాలా కోడ్ అవసరం. Seaborn Matplotlib పై నిర్మించిన లైబ్రరీ, ఇది గణాంక డేటా విజువలైజేషన్ కోసం రూపొందించబడింది. ఇది ప్రత్యక్షంగా Pandas డేటాఫ్రేమ్‌లతో పనిచేస్తుంది, ఆకర్షణీయ డిఫాల్ట్ శైలులు వర్తింపజేస్తుంది, మరియు బాగున్న కోడ్ తో సమాచారం పూర్వకమైన ప్లాట్‌లను సృష్టిస్తుంది. Seaborn Matplotlib ఆబ్జెక్టులనిస్తాయి, అందువల్ల మీరు Matplotlib గురించి ఇప్పటికే తెలిసిన వాటితో ఫలితాన్ని మెరిట్వారుగా మార్చుకోవచ్చు.

మీరు ఇప్పటికే Seaborn ఇన్‌స్టాల్ చేయలేదు అయితే, pip install seabornతో ఇన్‌స్టాల్ చేయండి.

  1. ఇతర దిగుమతుల కింద నోట్బుక్ టాప్ లో Seaborn ను దిగుమతి చేయండి. ఇది సాధారణంగా sns గా దిగుమతి చేయబడుతుంది:

    import seaborn as sns
    

సంబంధాలు చూపించే స్కాటర్ ప్లాట్లు

నమూనా నిర్మించే ముందు డేటాను పరిశీలించడం లో పెద్ద భాగం వేరియబుల్స్ మధ్య సంభందాలు చూడటం. ఒక scatter plot ఈకార్యం కోసం మంచి సాధనం: పాయింట్లు ఒక లైన్‌ను అనుసరిస్తే, రెండు వేరియబుల్స్ సంబంధం కలిగి ఉండవచ్చు, ఇది ఒక లీనియర్ రిగ్రెషన్ మోడల్ పనిచేయవచ్చని మంచి సంకేతం.

  1. కూర్మిక కాలమ్‌లతో నేరుగా పనిచేసే Seaborn యొక్క relplot() (సంబంధిత ప్లాట్) ఉపయోగించి గతంలో చేసిన ధర-నెల స్కాటర్ ప్లాట్ పునఃసృష్టించండి:

    sns.relplot(x="Price", y="Month", data=new_pumpkins)
    

    ధర మరియు నెల సంబంధం చూపించే Seaborn స్కాటర్‌ప్లాట్

    మీరు కాలమ్ పేర్లను మరియు డేటాఫ్రేమ్‌ని ఎలా పాస్ చేస్తున్నారో గమనించండి, Seaborn ఆక్సిస్ లేబుల్స్‌ను మీ తరఫున చూసుకుంటుంది.

  2. kind="line" ను పాస్ చేసి లైన్ ప్లాట్‌కు మారవచ్చు. Seaborn లైన్ చుట్టూ విశ్వసనతా అంతరాన్ని చూపించే షేడెడ్ బ్యాండ్ కూడా డ్రా చేస్తుంది:

    sns.relplot(x="Price", y="Month", kind="line", data=new_pumpkins)
    

    ధర మరియు నెల సంబంధం చూపించే Seaborn లైన్ ప్లాట్

    ఈ విశిష్ట డేటా చాలా శబ్దంతో ఉందని, కాబట్టి లైన్ ప్లాట్ స్పష్టమైన ఎంపిక కాదు — కానీ Seaborn లో మీరు చార్ట్ రకాలను సులభంగా మార్చగలుతారు.

పంపిణీలు చూపించే బార్ చార్ట్‌లు

ముందుగా మీరు Matplotlibతో బార్ చార్ట్ సృష్టించడానికి డేటాను చేతితో సమూహీకరించారు. Seaborn యొక్క catplot() (వర్గీకరణ ప్లాట్) మీ కోసం సమూహీకరణ మరియు సమాహరణ చేయవచ్చు. డీఫాల్ట్‌గా kind="bar" ప్రతి వర్గం సగటును చూపిస్తుంది మరియు నమ్మక పరిధిని సూచించే బ్లాక్ లైన్ ఉంటుంది.

  1. నెలకు సగటు ధర యొక్క బార్ చార్ట్ సృష్టించండి:

    sns.catplot(x="Month", y="Price", data=new_pumpkins, kind="bar")
    

    నెల వారీగా ధర పంపిణీని చూపించే సీబోర్న్ బార్ చార్ట్

    ఇది మీరు Matplotlibతో చూశినదాన్ని నిర్ధారిస్తుంది — ధరలు సెప్టెంబర్ మరియు అక్టోబర్ లో శీఖరానికి చేరతాయి — కానీ Seaborn ప్రతి నెలలో ధర ఎంత మారుతుందో కూడా చూపిస్తుంది.

హీట్మ్యాప్లు సంబంధాలను చూపుటకు

స్కాటర్ ప్లాట్లు ఒకేసారి ఇద్దరు చొప్పున వేరియబుల్స్‌ను పోల్చుతాయి. మీరు చాలా సంఖ్యాత్మక కాలమ్స్ ఉన్నప్పుడు, ఒక హీట్మ్యాప్ ప్రతి జోడిలోని సంబంధ బలాన్ని ఒక్కసారిగా చూడడానికి సహాయపడుతుంది. మోడల్‌కు ఎం పెట్టాలో ఎంచుకునే ముందు ఏ లక్షణాలు ఎక్కువగా సంబంధం ఉన్నాయో పరిక్షించడానికి ఇది సాధారణ పద్ధతి (మరియు తరచూ వర్గీకరణలో కన్ఫ్యూజన్ మ్యాట్రిసెస్ చూపించడానికి కూడా ఇదే చార్ట్ ఉపయోగిస్తారు).

  1. Pandasతో సంబంధ మ్యాట్రిక్స్ సృష్టించండి, తరువాత Seaborn యొక్క heatmap() తో దానిని வரைచండి. annot=True ఎంపిక ప్రతి సెల్‌పై సంబంధ విలువలను ప్రింట్ చేస్తుంది:

    correlations = new_pumpkins[['Month', 'Low Price', 'High Price', 'Price']].corr()
    sns.heatmap(correlations, annot=True, cmap="coolwarm")
    

    సంఖ్యాత్మక కాలమ్స్ మధ్య సంబంధాలను చూపించే సీబోర్న్ హీట్మ్యాప్

    1 (లేదా -1) కి దగ్గరగా విలువలు అంటే కాలమ్స్ బలమైన రేఖీయ సంబంధాన్ని కలిగి ఉంటాయి. Low Price మరియు High Price చాలా తగిన విధంగా సంబంధం ఉన్నట్లు గమనించండి. మరోవైపు, Month ధరతో బలమైన రేఖీయ సంబంధం చూపించదు — అయితే పై బార్ చార్ట్ సెప్టెంబర్ మరియు అక్టోబర్‌లో స్పష్టమైన సీజనల్ శిఖరం చూపించింది. ఇది ముఖ్యమైన పాఠం: సంబంధ గుణకము సరియైన సంబంధాలను మాత్రమే కొలుస్తుంది, కాబట్టి సీజనల్ లేదా ఇతర రీతిలో రేఖీయ కాని నమూనాలను మూసివేయొచ్చు. బార్ చార్ట్ వంటి చార్ట్‌లు మరియు హీట్మ్యాప్ రెండింటినీ చూడటం ఎందుకు ఉపయోగకరమో?

Matplotlib లేదా Seaborn?

రెండు లైబ్రరీలు తెలుసుకోవడం లాభదాయకం:

  • Matplotlib ప్రతి చార్ట్ మూలకం మీద మీరు శ్రేణిపరమైన నియంత్రణను అందిస్తుంది మరియు ఇది మరిన్ని Python ప్లాటింగ్ లైబ్రరీలు స్థాపించునప్పుడు ఆదారంగా ఉంటుంది.
  • Seaborn గణాంక చార్ట్స్ కోసం అధిక-స్థాయి ఫంక్షన్లు మరియు ఆకర్షణీయమైన డీఫాల్ట్‌లు అందిస్తుంది, నేరుగా డేటాఫ్రేమ్‌లతో పని చేస్తుంది, మరియు అన్వేషణాత్మక డేటా విశ్లేషణ కోసం త్వరగా ఉంటుంది.

సాధారణ వర్క్‌ఫ్లోగా, మీరు మీ డేటాను త్వరగా అన్వేషించడానికి Seaborn ఉపయోగించి, తరువాత వివరాలను సరిచేసుకోవడానికి Matplotlib కి దిగండి.


🚀సవాలు

Matplotlib మరియు Seaborn అందించే వేర్వేరు దృశ్య రూపీకరణ రకాలను అన్వేషించండి. రిగ్రెషన్ సమస్యలకు ఏ రకాలు ఎక్కువగా తగినవిగా ఉంటాయి?

లెక్చర్ తర్వాత క్విజ్

సమీక్ష & స్వీయ అధ్యయనం

వివిధ మార్గాల్లో డేటాను దృశ్యీకరించే పద్ధతులను పరిశీలించండి. వివిధ లైబ్రరీలను జతచేసి వాటిలో ఏవి ఏ రకమైన పనులకు ఉత్తమమో గుర్తించండి, ఉదాహరణకు 2D vs 3D దృశ్యీకరణ. మీరు ఏమి కనుగొంటారు?

అసైన్మెంట్

దృశ్యీకరణ అన్వేషణ


అస్వీకరణ: ఈ పత్రం AI అనువాద సేవ Co-op Translator ఉపయోగించి అనువదించబడింది. మేము ఖచ్చితత్వానికి ప్రయత్నిస్తున్నప్పటికీ, ఆటోమేటెడ్ అనువాదాలు తప్పులు లేదా అసమగ్రతలను కలిగి ఉండవచ్చు. దాని స్వదేశ భాషలో ఉన్న అసలు పత్రాన్ని అధికారం కలిగిన మూలంగా పరిగణించాలి. కీలకమైన సమాచారం కోసం, ప్రొఫెషనల్ మానవ అనువాదాన్ని సిఫారసు చేస్తాము. ఈ అనువాదం ఉపయోగం వల్ల కలిగే ఏవైనా అపార్థాలు లేదా తప్పుదారులు కోసం మేము బాధ్యత వహించము.