You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
ML-For-Beginners/translations/pa/5-Clustering/1-Visualize/README.md

43 KiB

ਕਲੱਸਟਰਿੰਗ ਦਾ ਪਰਿਚਯ

ਕਲੱਸਟਰਿੰਗ ਇੱਕ ਪ੍ਰਕਾਰ ਦੀ ਅਨਸੁਪਰਵਾਈਜ਼ਡ ਲਰਨਿੰਗ ਹੈ ਜੋ ਮੰਨਦੀ ਹੈ ਕਿ ਡਾਟਾਸੈੱਟ ਲੇਬਲ ਰਹਿਤ ਹੈ ਜਾਂ ਇਸਦੇ ਇੰਪੁੱਟ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਿਤ ਆਊਟਪੁੱਟ ਨਾਲ ਮੇਲ ਨਹੀਂ ਖਾਂਦੇ। ਇਹ ਵੱਖ-ਵੱਖ ਅਲਗੋਰਿਦਮਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਲੇਬਲ ਰਹਿਤ ਡਾਟਾ ਵਿੱਚੋਂ ਗੁੱਛੇ ਬਣਾਉਂਦਾ ਹੈ ਅਤੇ ਡਾਟਾ ਵਿੱਚ ਪੈਟਰਨਸ ਦੇ ਅਨੁਸਾਰ ਸਮੂਹਕਰਨ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।

No One Like You by PSquare

🎥 ਉੱਪਰ ਦਿੱਤੀ ਚਿੱਤਰ ਤੇ ਕਲਿੱਕ ਕਰੋ ਇੱਕ ਵੀਡੀਓ ਲਈ। ਜਦੋਂ ਤੁਸੀਂ ਕਲੱਸਟਰਿੰਗ ਸਹਿਤ ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਦਾ ਅਧਿਐਨ ਕਰ ਰਹੇ ਹੋ, ਤਾਂ ਕੁਝ ਨਾਈਜੀਰੀਆਈ ਡਾਂਸ ਹਾਲ ਟਰੈਕਸ ਦਾ ਮਜ਼ਾ ਲਓ - ਇਹ 2014 ਦੀ PSquare ਵੱਲੋਂ ਇੱਕ ਬਹੁਤ ਪ੍ਰਸ਼ੰਸਿਤ ਗੀਤ ਹੈ।

ਪ੍ਰੀ-ਲੇਕਚਰ ਕਵਿਜ਼

ਪਰੀਚਯ

ਕਲੱਸਟਰਿੰਗ ਡੇਟਾ ਖੋਜ ਲਈ ਬਹੁਤ ਲਾਭਦਾਇਕ ਹੈ। ਆਓ ਵੇਖੀਏ ਕਿ ਇਹ ਨਾਈਜੀਰੀਆਈ ਦਰਸ਼ਕਾਂ ਦੇ ਸੰਗੀਤ ਦੀ ਖਪਤ ਦੇ ਰੁਝਾਨ ਅਤੇ ਪੈਟਰਨਸ ਨੂੰ ਵੇਖਣ ਵਿੱਚ ਕਿਹੜਾ ਮਦਦਗਾਰ ਸਾਬਤ ਹੁੰਦਾ ਹੈ।

ਇਕ ਮਿੰਟ ਲਈ ਸੋਚੋ ਕਿ ਕਲੱਸਟਰਿੰਗ ਕਿੱਥੇ ਵਰਤੀ ਜਾਂਦੀ ਹੈ। ਅਸਲ ਜ਼ਿੰਦਗੀ ਵਿੱਚ, ਕਲੱਸਟਰਿੰਗ ਉਸ ਸਮੇਂ ਹੁੰਦੀ ਹੈ ਜਦੋਂ ਤੁਹਾਡੇ ਕੋਲ ਕੱਪੜੇ ਦੀ ਢੇਰ ਹੋਵੇ ਅਤੇ ਤੁਹਾਨੂੰ ਆਪਣੇ ਪਰਿਵਾਰਕ ਮੈਂਬਰਾਂ ਦੇ ਕੱਪੜੇ ਵੱਖਰੇ ਕਰਨੇ ਹੋਣ 🧦👕👖🩲। ਡਾਟਾ ਸਾਇੰਸ ਵਿੱਚ, ਕਲੱਸਟਰਿੰਗ ਉਸ ਸਮੇਂ ਹੁੰਦੀ ਹੈ ਜਦੋਂ ਕਿਸੇ ਯੂਜ਼ਰ ਦੀ ਪਸੰਦ ਦੀ ਵਿਸ਼ਲੇਸ਼ਣਾ ਕਰਨੀ ਹੋਵੇ ਜਾਂ ਕਿਸੇ ਲੇਬਲ ਰਹਿਤ ਡਾਟਾਸੈੱਟ ਦੀ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦਾ ਪਤਾ ਲਗਾਉਣਾ ਹੋਵੇ। ਕਲੱਸਟਰਿੰਗ, ਕਿਸੇ ਹੱਦ ਤੱਕ, ਉਥਲ-ਪੁਥਲ ਨੂੰ ਸਮਝਣ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ, ਜਿਵੇਂ ਮੋਜ਼ਿਆਂ ਦੀ ਡਰਾਅਰ।

Introduction to ML

🎥 ਉੱਪਰ ਦਿੱਤੀ ਚਿੱਤਰ ਤੇ ਕਲਿੱਕ ਕਰੋ ਇੱਕ ਵੀਡੀਓ ਲਈ: MIT ਦੇ John Guttag ਕਲੱਸਟਰਿੰਗ ਦਾ ਪਰਿਚਯ ਕਰਵਾਉਂਦੇ ਹਨ

ਇੱਕ ਪੇਸ਼ਾਵਰ ਸੈਟਿੰਗ ਵਿੱਚ, ਕਲੱਸਟਰਿੰਗ ਦਾ ਵਰਤੋਂ ਮਾਰਕੀਟ ਸੈਗਮੈਂਟੇਸ਼ਨ, ਕਿਸ ਉਮਰ ਦੇ ਗਰੁੱਪ ਕਿਹੜੇ ਆਈਟਮ ਖਰੀਦਦੇ ਹਨ ਇਸਦਾ ਨਿਰਧਾਰਨ ਕਰਨ ਲਈ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਇੱਕ ਹੋਰ ਵਰਤੋਂ ਅਨੋਮਲੀ ਖੋਜ ਵਾਸਤੇ ਹੋ ਸਕਦੀ ਹੈ, ਜਿਵੇਂ ਕਿ ਕ੍ਰੈਡਿਟ ਕਾਰਡ ਟ੍ਰਾਂਜ਼ੈਕਸ਼ਨਾਂ ਦੇ ਡਾਟਾ ਵਿੱਚ ਧੋਖਾਧੜੀ ਦਾ ਪਤਾ ਲਗਾਉਣਾ। ਜਾਂ ਤੁਸੀਂ ਕਲੱਸਟਰਿੰਗ ਦੀ ਵਰਤੋਂ ਮੇਡੀਕਲ ਸਕੈਨਜ਼ ਦੇ ਬੈਚ ਵਿੱਚ ਟਿਊਮਰਾਂ ਦਾ ਨਿਰਧਾਰਨ ਕਰਨ ਲਈ ਕਰ ਸਕਦੇ ਹੋ।

ਸੋਚੋ ਕਿ ਤੁਸੀਂ 'ਵਾਲਡ' ਵਿੱਚ ਕਿਵੇਂ ਕਲੱਸਟਰਿੰਗ ਦਾ ਸਾਮਨਾ ਕੀਤਾ ਹੋਵੇਗਾ, ਕਿਸੇ ਬੈਂਕਿੰਗ, ਈ-ਕਾਮਰਸ ਜਾਂ ਵਿਹਾਰਕ ਸੈਟਿੰਗ ਵਿੱਚ।

🎓 ਫ਼਼ੈਸਲਾ ਲੈਣ ਵਾਲੀ ਗੱਲ ਇਹ ਹੈ ਕਿ ਕਲੱਸਟਰ ਵਿਸ਼ਲੇਸ਼ਣ 1930 ਦੇ ਦਹਾਕੇ ਵਿੱਚ ਮਨੁੱਖੀ ਵਿਗਿਆਨ ਅਤੇ ਮਨੋਵਿਗਿਆਨ ਖੇਤਰਾਂ ਵਿੱਚ ਉਤਪੰਨ ਹੋਇਆ ਸੀ। ਤੁਸੀਂ ਸੋਚ ਸਕਦੇ ਹੋ ਕਿ ਇਸਦਾ ਇਸਤਮਾਲ ਕਿਵੇਂ ਕੀਤਾ ਗਿਆ ਹੋਵੇਗਾ?

ਚੋਣਨ ਲਈ ਤੁਸੀਂ ਖੋਜ ਨਤੀਜੇ - ਖਰੀਦਦਾਰੀ ਲਿੰਕ, ਚਿੱਤਰ, ਜਾਂ ਸਮੀਖਿਆਵਾਂ - ਲਈ ਵੀ ਇਸਦਾ ਉਪਯੋਗ ਕਰ ਸਕਦੇ ਹੋ। ਕਲੱਸਟਰਿੰਗ ਉਪਯੋਗੀ ਹੁੰਦੀ ਹੈ ਜਦੋਂ ਤੁਹਾਡੇ ਕੋਲ ਇੱਕ ਵੱਡਾ ਡਾਟਾਸੈੱਟ ਹੁੰਦਾ ਹੈ ਜਿਸਨੂੰ ਤੁਸੀਂ ਘਟਾਉਣਾ ਚਾਹੁੰਦੇ ਹੋ ਅਤੇ ਜਿਸ ਉੱਪਰ ਤੁਸੀਂ ਹੋਰ ਵਿਸਤ੍ਰਿਤ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਇਸ ਲਈ ਇਹ ਤਕਨੀਕ ਮਾਡਲਾਂ ਦੇ ਬਣਨ ਤੋਂ ਪਹਿਲਾਂ ਡਾਟਾ ਬਾਰੇ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਵਰਤੀ ਜਾ ਸਕਦੀ ਹੈ।

ਜਦੋਂ ਤੁਹਾਡਾ ਡਾਟਾ ਕਲੱਸਟਰਾਂ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ, ਤੁਸੀਂ ਇਸਨੂੰ ਇੱਕ ਕਲੱਸਟਰ ID ਦੇਂਦੇ ਹੋ, ਅਤੇ ਇਹ ਤਕਨੀਕ ਡਾਟਾਸੈੱਟ ਦੀ ਗੋਪਨੀਯਤਾ ਸੁਰੱਖਿਅਤ ਕਰਨ ਵਿੱਚ ਲਾਭਕਾਰੀ ਸਾਬਤ ਹੋ ਸਕਦੀ ਹੈ; ਤੁਸੀਂ ਕਿਸੇ ਡਾਟਾ ਪਾਇੰਟ ਨੂੰ ਇਸਦੀ ਕਲੱਸਟਰ ID ਨਾਲ ਸੂਚਿਤ ਕਰ ਸਕਦੇ ਹੋ, ਬਜਾਏ ਵਧੇਰੇ ਪ੍ਰਗਟ ਕਰਨ ਵਾਲੇ ਪਛਾਣ ਵਾਲੇ ਡਾਟਾ ਨਾਲ। ਕੀ ਤੁਸੀਂ ਹੋਰ ਕਾਰਨਾਂ ਬਾਰੇ ਸੋਚ ਸਕਦੇ ਹੋ ਕਿ ਤੁਸੀਂ ਕਿਸੇ ਕਲੱਸਟਰ ਨੂੰ ਪਛਾਣਣ ਵਾਸਤੇ ਹੋਰ ਤੱਤਾਂ ਦੀ ਤੁਲਨਾ ਵਿੱਚ ਕਲੱਸਟਰ ID ਨੂੰ ਕਿਉਂ ਵਰਤੋਗੇ?

ਕਲੱਸਟਰਿੰਗ ਤਕਨੀਕਾਂ ਦੀ ਸਮਝ ਨੂੰ ਵਿਚਾਰੋ ਇਸ Learn ਮੋਡਿਊਲ ਵਿੱਚ।

ਕਲੱਸਟਰਿੰਗ ਸ਼ੁਰੂ ਕਰਨਾ

Scikit-learn ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ ਕਲੱਸਟਰਿੰਗ ਕਰਨ ਦੇ ਤਰੀਕੇ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਤੁਹਾਡਾ ਚੁਣਾਵ ਤੁਹਾਡੇ ਉਪਯੋਗ ਮੁਕਾਮ 'ਤੇ ਨਿਰਭਰ ਕਰੇਗਾ। ਡੌਕਯੂਮੈਂਟੇਸ਼ਨ ਦੇ ਹੁਕਮਾਂ ਅਨੁਸਾਰ, ਹਰ ਤਰੀਕੇ ਦੇ ਵੱਖ-ਵੱਖ ਫਾਇਦੇ ਹਨ। ਹੇਠਾਂ Scikit-learn ਦੁਆਰਾ ਸਹਾਇਤ ਕੀਤੇ ਗਏ ਤਰੀਕਿਆਂ ਅਤੇ ਉਚਿਤ ਉਪਯੋਗ ਦੀ ਸਧਾਰਨ ਤਾਲਿਕਾ ਹੈ:

ਤਰੀਕੇ ਦਾ ਨਾਮ ਉਪਯੋਗ
ਕੇ-ਮੀਨਸ (K-Means) ਆਮ ਮਕਸਦ, ਇੰਡਕਟੀਵ
ਐਫਿਨਿਟੀ ਪ੍ਰੋਪੈਗੇਸ਼ਨ ਬਹੁਤ ਸਾਰੇ, ਅਸਮਾਨ ਕੁਲੱਸਟਰ, ਇੰਡਕਟੀਵ
ਮੀਨ-ਸ਼ਿਫਟ ਬਹੁਤ ਸਾਰੇ, ਅਸਮਾਨ ਕੁਲੱਸਟਰ, ਇੰਡਕਟੀਵ
ਸਪੈਕਟ੍ਰਲ ਕਲਸਟਰਿੰਗ ਥੋੜੇ, ਸਮਾਨ ਕੁਲੱਸਟਰ, ਟ੍ਰਾਂਸਡਕਟੀਵ
ਵਾਰਡ ਹਾਇਰਾਰਕੀਕਲ ਕਲਸਟਰਿੰਗ ਬਹੁਤ ਸਾਰੇ, ਸੀਮਿਤ ਕੁਲੱਸਟਰ, ਟ੍ਰਾਂਸਡਕਟੀਵ
ਐਗਲੋਮੇਰਟਿਵ ਕਲੱਸਟਰਿੰਗ ਬਹੁਤ ਸਾਰੇ, ਸੀਮਿਤ, ਗੈਰ ਯੂਕਲੀਡਿਅਨ ਦੂਰੀਆਂ, ਟ੍ਰਾਂਸਡਕਟੀਵ
ਡੀਬੀਸਕੈਨ (DBSCAN) ਗੈਰ-ਫਲੈਟ ਜਿਓਮੇਟ੍ਰੀ, ਅਸਮਾਨ ਕੁਲੱਸਟਰ, ਟ੍ਰਾਂਸਡਕਟੀਵ
ਓਪਟਿਕਸ (OPTICS) ਗੈਰ-ਫਲੈਟ ਜਿਓਮੇਟ੍ਰੀ, ਅਸਮਾਨ ਘਣਤਾ ਵਾਲੇ ਕੁਲੱਸਟਰ, ਟ੍ਰਾਂਸਡਕਟੀਵ
ਗਾਸੀਅਨ ਮਿਕਸਚਰ ਫਲੈਟ ਜਿਓਮੇਟ੍ਰੀ, ਇੰਡਕਟੀਵ
ਬਿਰਚ (BIRCH) ਵੱਡਾ ਡਾਟਾਸੈੱਟ ਆਊਟਲਾਇਰਾਂ ਨਾਲ, ਇੰਡਕਟੀਵ

🎓 ਅਸੀਂ ਕਲੱਸਟਰ ਕਿਵੇਂ ਬਣਾਉਂਦੇ ਹਾਂ ਇਸਦਾ ਬਹੁਤ ਸਬੰਧ ਹੈ ਕਿ ਅਸੀਂ ਅੰਕੜਿਆਂ ਨੂੰ ਸਮੂਹਾਂ ਵਿੱਚ ਕਿਵੇਂ ਇਕੱਠਾ ਕਰਦੇ ਹਾਂ। ਆਓ ਕੁਝ ਸ਼ਬਦਾਵਲੀ ਸਮਝੀਏ:

🎓 'ਟ੍ਰਾਂਸਡਕਟੀਵ' ਬਨਾਮ 'ਇੰਡਕਟੀਵ'

ਟ੍ਰਾਂਸਡਕਟੀਵ ਅਨੁਮਾਨ ਆਪਣੇ ਪ੍ਰੇਖਿਅਤ ਟਰੇਨਿੰਗ ਕੇਸਾਂ ਤੋਂ ਲਿਆ ਜਾਂਦਾ ਹੈ ਜੋ ਖਾਸ ਟੈਸਟ ਕੇਸਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ। ਇੰਡਕਟੀਵ ਅਨੁਮਾਨ ਟਰੇਨਿੰਗ ਕੇਸਾਂ ਤੋਂ ਆਮ ਕਾਇਦੇ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਫਿਰ ਟੈਸਟ ਕੇਸਾਂ 'ਤੇ ਲਾਗੂ ਹੁੰਦੇ ਹਨ।

ਇੱਕ ਉਦਾਹਰਨ: ਸੋਚੋ ਤੁਹਾਡੇ ਕੋਲ ਸਿਰਫ਼ ਹਿੱਸੇਵਾਰ ਲੇਬਲ ਕੀਤਾ ਗਿਆ ਡਾਟਾ ਹੈ। ਕੁਝ ਚੀਜ਼ਾਂ 'ਰੈਕਾਰਡ' ਹਨ, ਕੁਝ 'ਸੀਡੀ', ਅਤੇ ਕੁਝ ਖਾਲੀ। ਤੁਹਾਡਾ ਕੰਮ ਖਾਲੀ ਨੂੰ ਲੇਬਲ ਕਰਨਾ ਹੈ। ਜੇ ਤੁਸੀਂ ਇੰਡਕਟੀਵ ਰਵੱਈਆ ਚੁਣੋਂਗੇ, ਤਾਂ ਤੁਸੀਂ ਮਾਡਲ ਟ੍ਰੇਨ ਕਰੋਗੇ ਜੋ 'ਰੈਕਾਰਡ' ਅਤੇ 'ਸੀਡੀ' ਲੱਭਦਾ ਹੈ ਅਤੇ ਉਹ ਲੇਬਲ ਅਣਲੈਬਲਡ ਡਾਟੇ 'ਤੇ ਲਾਗੂ ਕਰੋਗਾ। ਇਹ ਢੁਕਵਾਂ ਨਹੀਂ ਹੋਵੇਗਾ ਜੇ ਚੀਜ਼ਾਂ ਅਸਲ 'ਕੈਸੇਟ' ਹਨ। ਇੱਕ ਟ੍ਰਾਂਸਡਕਟੀਵ ਰਵੱਈਆ, ਦੂਜੇ ਪਾਸੇ, ਇਸ ਅਣਜਾਣ ਡਾਟਾ ਨਾਲ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਨਿਪਟਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਮਿਲਦੇ ਜੁਲਦੇ ਆਈਟਮ ਇਕੱਠੇ ਕਰਦਾ ਹੈ ਅਤੇ ਫਿਰ ਸਮੂਹ ਨੂੰ ਇੱਕ ਲੇਬਲ ਦਿੰਦਾ ਹੈ। ਇਸ ਸੰਦਰਭ ਵਿੱਚ, ਕੁਲੱਸਟਰ 'ਗੋਲ ਮਿਊਜ਼ਿਕਲ ਚੀਜ਼ਾਂ' ਅਤੇ 'ਚੌਕੋਰ ਮਿਊਜ਼ਿਕਲ ਚੀਜ਼ਾਂ' ਹੋ ਸਕਦੀਆਂ ਹਨ।

🎓 'ਗੈਰ-ਫਲੈਟ' ਬਨਾਮ 'ਫਲੈਟ' ਜਿਓਮੇਟ੍ਰੀ

ਗਣਿਤੀਕ ਸ਼ਬਦਾਵਲੀ ਤੋਂ ਲਿਆ ਗਿਆ, ਗੈਰ-ਫਲੈਟ ਬਨਾਮ ਫਲੈਟ ਜਿਓਮੇਟ੍ਰੀ ਅਰਥ ਹੈ ਦੁਰੀਆਂ ਦੀ ਮਾਪ ਫਲੈਟ (ਯੂਕਲੀਡਿਅਨ) ਜਾਂ ਗੈਰ-ਫਲੈਟ (ਗੈਰ-ਯੂਕਲੀਡਿਅਨ) ਭੌਗੋਲਿਕ ਤਰੀਕੇ ਨਾਲ ਕੀਤੀ ਗਈ।

'ਫਲੈਟ' ਇਸ ਸੰਦਰਭ ਵਿੱਚ ਯੂਕਲੀਡਿਅਨ ਜਿਓਮੇਟ੍ਰੀ ਦੱਸਦਾ ਹੈ (ਜਿਸ ਦਾ ਕੁਝ ਹਿੱਸਾ 'ਪਲੇਨ' ਜਿਓਮੇਟ੍ਰੀ ਵਜੋਂ ਪੜਾਇਆ ਜਾਂਦਾ ਹੈ), ਅਤੇ ਗੈਰ-ਫਲੈਟ ਦਾ ਅਰਥ ਗੈਰ-ਯੂਕਲੀਡਿਅਨ ਜਿਓਮੇਟ੍ਰੀ ਹੁੰਦਾ ਹੈ। ਮਸ਼ੀਨ ਲਰਨਿੰਗ ਨਾਲ ਜਿਓਮੇਟ੍ਰੀ ਦਾ ਕੀ ਸਬੰਧ? ਅਸਲ ਵਿੱਚ, ਜਿਵੇਂ ਦੋ ਖੇਤਰ ਗਣਿਤ ਵਿੱਚ ਆਧਾਰਤ ਹਨ, ਕੁਲੱਸਟਰਾਂ ਵਿੱਚ ਬਿੰਦੂਆਂ ਦੀ ਦੂਰੀ ਮਾਪਣ ਲਈ ਏੱਕ ਸਾਂਝਾ ਤਰੀਕਾ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਉਹ 'ਫਲੈਟ' ਜਾਂ 'ਗੈਰ-ਫਲੈਟ' ਤਰੀਕਿਆਂ ਤੋਂ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਡਾਟੇ ਦੀ ਪ੍ਰਕ੍ਰਿਤੀ ਦੇ ਅਨੁਸਾਰ। ਯੂਕਲੀਡਿਅਨ ਦੂਰੀਆਂ ਦੋ ਬਿੰਦੂਆਂ ਵਿਚਕਾਰ ਰੇਖਾ ਖੰਡ ਦੀ ਲੰਬਾਈ ਵਜੋਂ ਮਾਪੀਆਂ ਜਾਂਦੀਆਂ ਹਨ। ਗੈਰ-ਯੂਕਲੀਡਿਅਨ ਦੂਰੀਆਂ ਵਾਲੇ ਬਿੰਦੂਆਂ ਦੇ ਵਿਚਕਾਰ ਕਰਵ ਰਾਹੀਂ ਮਾਪੀਆਂ ਜਾਂਦੀਆਂ ਹਨ। ਜੇ ਤੁਹਾਡਾ ਡਾਟਾ, ਦਿੱਖ ਵਿੱਚ, ਪਲੇਨ ਉੱਤੇ ਨਹੀਂ ਹੁੰਦਾ, ਤਾਂ ਤੁਹਾਨੂੰ ਇਸਨੂੰ ਸੰਭਾਲਣ ਲਈ ਖਾਸ ਅਲਗੋਰਿਦਮ ਦੀ ਲੋੜ ਹੋ ਸਕਦੀ ਹੈ।

ਫਲੈਟ ਬਨਾਮ ਗੈਰ-ਫਲੈਟ ਜਿਓਮੇਟ੍ਰੀ ਇਨਫੋਗ੍ਰਾਫਿਕ

ਇਨਫੋਗ੍ਰਾਫਿਕ ਦੁਆਰਾ ਦਸਾਨੀ ਮਾਡਿਪੱਲੀ

🎓 'ਦੂਰੀਆਂ'

ਕੁਲੱਸਟਰਾਂ ਨੂੰ ਉਹਨਾਂ ਦੀ ਦੂਰੀ ਮੈਟ੍ਰਿਕਸ ਦੁਆਰਾ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਜਿਵੇਂ ਕਿ ਬਿੰਦੂਆਂ ਵਿਚਕਾਰ ਦੂਰੀਆਂ। ਇਹ ਦੂਰੀ ਕਈ ਤਰੀਕਿਆਂ ਨਾਲ ਮਾਪੀ ਜਾ ਸਕਦੀ ਹੈ। ਯੂਕਲੀਡਿਅਨ ਕੁਲੱਸਟਰਾਂ ਦੀ ਪਰਿਭਾਸ਼ਾ ਬਿੰਦੂਆਂ ਦੇ ਮਿਡਲ ਅੰਕ ਦੇ ਆਧਾਰ 'ਤੇ ਹੁੰਦੀ ਹੈ, ਜਿਸ ਵਿੱਚ ਇੱਕ 'ਸੈਂਟਰਾਇਡ' ਜਾਂ ਕੇਂਦਰੀ ਬਿੰਦੂ ਹੁੰਦਾ ਹੈ। ਇਸ ਤਰ੍ਹਾਂ ਦੂਰੀ ਉਸ ਕੇਂਦਰੀ ਬਿੰਦੂ ਤੱਕ ਦੀ ਮਾਪ ਹੁੰਦੀ ਹੈ। ਗੈਰ-ਯੂਕਲੀਡਿਅਨ ਦੂਰੀਆਂ 'ਕਲੱਸਟਰਾਇਡ' ਨੂੰ ਦਰਸਾਉਂਦੀਆਂ ਹਨ, ਜੋ ਕਿ ਹੋਰ ਬਿੰਦੂਆਂ ਦੇ ਸਭ ਤੋਂ ਨੇੜੇ ਬਿੰਦੂ ਹੁੰਦਾ ਹੈ। ਕਲੱਸਟਰਾਇਡ ਨੂੰ ਵੱਖ-ਵੱਖ ਤਰੀਕਿਆਂ ਨਾਲ ਪਰਿਭਾਸ਼ਿਤ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।

🎓 'ਸੀਮਿਤ'

ਸੀਮਿਤ ਕਲੱਸਟਰਿੰਗ ਵਿੱਚ 'ਅਰਧ-ਸੁਪਰਵਾਈਜ਼ਡ' ਲਰਨਿੰਗ ਲਾਈ ਜਾਂਦੀ ਹੈ ਇਸ ਅਨਸੁਪਰਵਾਈਜ਼ਡ ਤਰੀਕੇ ਵਿੱਚ। ਬਿੰਦੂਆਂ ਵਿਚਕਾਰ ਸਬੰਧਾਂ ਨੂੰ 'ਲਿੰਕ ਨਹੀਂ ਕਰ ਸਕਦਾ' ਜਾਂ 'ਲਿੰਕ ਕਰਨ ਦੀ ਲੋੜ' ਵਜੋਂ ਨਿਸ਼ਾਨちਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਜਿਸ ਨਾਲ ਕੁਝ ਨਿਯਮ ਡਾਟਾਸੈੱਟ ਤੇ ਲਾਗੂ ਕੀਤੇ ਜਾਂਦੇ ਹਨ।

ਇੱਕ ਉਦਾਹਰਨ: ਜੇ ਇੱਕ ਅਲਗੋਰਿਦਮ ਅਣਲੇਬਲਡ ਜਾਂ ਅਰਧ ਲੇਬਲਡ ਡਾਟਾ ਦੇ ਬੈਚ 'ਤੇ ਮੁਕਤ ਛੱਡ ਦਿਉਂਦਾ ਹੈ, ਤਾਂ ਇਹ ਦੁਆਰਾ ਬਣਾਏ ਗਏ ਕੁਲੱਸਟਰਾਂ ਦੀ ਗੁਣਵੱਤਾ ਖ਼ਰਾਬ ਹੋ ਸਕਦੀ ਹੈ। ਉਪਰ ਦਿੱਤੇ ਉਦਾਹਰਨ ਵਿੱਚ, ਕੁਲੱਸਟਰਾਂ 'ਗੋਲ ਸੰਗੀਤਮਈ ਚੀਜ਼ਾਂ', 'ਚੌਕੋਰ ਸੰਗੀਤਮਈ ਚੀਜ਼ਾਂ', 'ਤਰਿਭੁਜਾਕਾਰ ਚੀਜ਼ਾਂ' ਅਤੇ 'ਕੁਕੀਜ਼' ਵਿਚਕਾਰ ਵੰਡਦੀਆਂ ਹਨ। ਜੇ ਕੁਝ ਸੀਮਾਵਾਂ ਜਾਂ ਨਿਯਮ ਦਿੱਤੇ ਜਾਣ ਤਾਂ ("ਚੀਜ਼ ਪਲਾਸਟਿਕ ਦੀ ਬਣੀ ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ", "ਚੀਜ਼ ਨੂੰ ਸੰਗੀਤ ਪੈਦਾ ਕਰਨ ਯੋਗ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ") ਇਹ ਅਲਗੋਰਿਦਮ ਨੂੰ ਬਿਹਤਰ ਚੋਣਾਂ ਕਰਨ ਲਈ ਸੀਮਿਤ ਕਰ ਸਕਦਾ ਹੈ।

🎓 'ਘਣਤਾ'

ਉਹ ਡਾਟਾ ਜੋ 'ਸ਼ੋਰ ਵਾਲਾ' ਹੈ, ਉਸਨੂੰ 'ਘਨਾ' ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ। ਹਰ ਕੁਲੱਸਟਰ ਦੇ ਬਿੰਦੂਆਂ ਵਿਚਕਾਰ ਦੂਰੀਆਂ ਦੇਖਣ 'ਤੇ ਇਹ ਸਮਝ ਆਉਂਦੀ ਹੈ ਕਿ ਇਹ ਵਧੀਏ ਜਾਂ ਘੱਟ ਘਣਾ ਹੈ, ਜਾਂ ਕਦਰਾਂ ਭੀੜ ਵਾਲੀਆਂ ਹਨ ਅਤੇ ਇਸਡਾਟੇ ਨੂੰ ਉਚਿਤ ਕਲੱਸਟਰਿੰਗ ਤਰੀਕੇ ਨਾਲ ਵਿਸ਼ਲੇਸ਼ਣ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਇਹ ਲੇਖ ਇੱਕ ਸ਼ੋਰ ਵਾਲੇ ਡਾਟਾਸੈੱਟ ਨੂੰ ਖੰਗਾਲਣ ਲਈ ਕੇ-ਮੀਨਸ ਕਲੱਸਟਰਿੰਗ ਵਿਰੁੱਧ HDBSCAN ਅਲਗੋਰਿਦਮ ਦੀ ਵਰਤੋਂ ਵਿੱਚ ਫ਼ਰਕ ਦਿਖਾਉਂਦਾ ਹੈ, ਜਿਥੇ ਕੁਲੱਸਟਰ ਘਣਤਾ ਅਸਮਾਨ ਹੁੰਦੀ ਹੈ।

ਕਲੱਸਟਰਿੰਗ ਅਲਗੋਰਿਦਮ

100 ਤੋਂ ਵੱਧ ਕਲੱਸਟਰਿੰਗ ਅਲਗੋਰਿਦਮ ਉਪਲਬਧ ਹਨ, ਅਤੇ ਉਹਨਾਂ ਦੀ ਵਰਤੋਂ ਡਾਟੇ ਦੀ ਸੁਭਾਅ 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ। ਆਓ ਕੁਝ ਪ੍ਰਮੁੱਖਾਂ ਬਾਰੇ ਗੱਲ ਕਰੀਏ:

  • ਹਾਇਰਾਰਕੀਕਲ ਕਲੱਸਟਰਿੰਗ। ਜੇ ਕਿਸੇ ਵਸਤੂ ਦੀ ਵਰਗੀਕਰਨ ਉਸਦੇ ਨੇੜਲੇ ਵਸਤੂ ਦੀ ਪਹੁੰਚ ਦੇ ਅਧਾਰ ਤੇ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਨਾ ਕਿ ਦੂਰ ਦੇ ਕਿਸੇ ਹੋਰ ਦੀ, ਤਾਂ ਕਲੱਸਟਰ ਬਣਾਏ ਜਾਂਦੇ ਹਨ ਜੋ ਆਪਣੇ ਮੈਂਬਰਾਂ ਦੀ ਦੂਰੀ ਤੋਂ ਥਾਪ ਵੀਧੀ ਕਰਦੇ ਹਨ। Scikit-learn ਦੀ ਐਗਲੋਮੇਰਟਿਵ ਕਲੱਸਟਰਿੰਗ ਹਾਇਰਾਰਕੀਕਲ ਹੈ।

    ਹਾਇਰਾਰਕੀਕਲ ਕਲੱਸਟਰਿੰਗ ਇਨਫੋਗ੍ਰਾਫਿਕ

    ਇਨਫੋਗ੍ਰਾਫਿਕ ਦੁਆਰਾ ਦਸਾਨੀ ਮਾਡਿਪੱਲੀ

  • ਸੈਂਟਰਾਇਡ ਕਲੱਸਟਰਿੰਗ। ਇਹ ਪ੍ਰਚਲਿਤ ਅਲਗੋਰਿਦਮ ਕਲੱਸਟਰਾਂ ਦੀ ਸੰਖਿਆ 'k' ਦੇ ਚੋਣ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ, ਜਿਨ੍ਹਾਂ ਤੋਂ ਬਾਅਦ ਅਲਗੋਰਿਦਮ ਕੁਲੱਸਟਰ ਦਾ ਕੇਂਦਰੀ ਬਿੰਦੂ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ ਅਤੇ ਉਸ ਬਿੰਦੂ ਦੇ ਆਲੇ ਦੁਆਲੇ ਡਾਟਾ ਇਕੱਤਰ ਕਰਦਾ ਹੈ। K-means ਕਲੱਸਟਰਿੰਗ ਇਸ ਤਰੀਕੇ ਦੀ ਇੱਕ ਪ੍ਰਸਿੱਧ ਕਿਸਮ ਹੈ। ਕੇਂਦਰ ਨੇੜਲੇ ਮੀਨ ਨਾਲ ਨਿਰਧਾਰਤ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਇਸ ਲਈ ਨਾਮ। ਕੁਲੱਸਟਰ ਤੋਂ ਵਰਗਮੂਲ ਦੂਰੀ ਘਟਾਈ ਜਾਂਦੀ ਹੈ।

    ਸੈਂਟਰਾਇਡ ਕਲੱਸਟਰਿੰਗ ਇਨਫੋਗ੍ਰਾਫਿਕ

    ਇਨਫੋਗ੍ਰਾਫਿਕ ਦੁਆਰਾ ਦਸਾਨੀ ਮਾਡਿਪੱਲੀ

  • ਵਿਤਰਨ-ਆਧਾਰਿਤ ਕਲੱਸਟਰਿੰਗ। ਸਾਂਖਿਆਕੀ ਮਾਡਲਿੰਗ 'ਤੇ ਆਧਾਰਿਤ, ਵੰਡ-ਆਧਾਰਿਤ ਕਲੱਸਟਰਿੰਗ ਇਹ ਤਜਵੀਜ਼ ਕਰਦਾ ਹੈ ਕਿ ਇੱਕ ਡਾਟਾ ਬਿੰਦੂ ਕਿਸ ਕੁਲੱਸਟਰ ਦਾ ਸਦੱਸ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਕਿੰਨੀ ਹੈ ਅਤੇ ਉਸ ਅਨੁਸਾਰ ਅਸਾਈਨਮੈਂਟ ਕਰਦਾ ਹੈ। ਗਾਸੀਆਨ ਮਿਕਸਚਰ ਮੈਥਡ ਇਸ ਪ੍ਰਕਾਰ ਵਿੱਚ ਆਉਂਦੇ ਹਨ।

  • ਘਣਤਾ-ਆਧਾਰਿਤ ਕਲੱਸਟਰਿੰਗ। ਡਾਟਾ ਬਿੰਦੂਆਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੀ ਘਣਤਾ, ਜਾਂ ਇਕ ਦੂਜੇ ਦੇ ਆਲੇ ਦੁਆਲੇ ਸਮੂਹਿਤ ਹੋਣ ਦੇ ਆਧਾਰ 'ਤੇ ਕੁਲੱਸਟਰਾਂ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ। ਸਮੂਹ ਤੋਂ ਦੂਰ ਬਿੰਦੂਆਂ ਨੂੰ ਆਊਟਲਾਇਰ ਜਾਂ ਸ਼ੋਰ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ। DBSCAN, ਮੀਨ-ਸ਼ਿਫਟ ਅਤੇ ਓਪਟਿਕਸ ਕਲੱਸਟਰਿੰਗ ਦੇ ਇਹ ਵਰਗ ਹਨ।

  • ਗ੍ਰਿਡ-ਆਧਾਰਿਤ ਕਲੱਸਟਰਿੰਗ। ਬਹੁ-ਪਰਿਮਾਣਵਾਚੀ ਡਾਟਾਸੈੱਟ ਲਈ, ਇੱਕ ਗ੍ਰਿਡ ਬਣਾਈ ਜਾਂਦੀ ਹੈ ਅਤੇ ਡਾਟਾ ਗ੍ਰਿਡ ਦੀਆਂ ਸੈਲਾਂ ਵਿੱਚ ਵੰਡਿਆ ਜਾਂਦਾ ਹੈ, ਇਸ ਤਰ੍ਹਾਂ ਕੁਲੱਸਟਰ ਬਣਦੇ ਹਨ।

ਅਭਿਆਸ - ਆਪਣੇ ਡਾਟੇ ਨੂੰ ਕਲੱਸਟਰ ਕਰੋ

ਕਲੱਸਟਰਿੰਗ ਇੱਕ ਤਕਨੀਕ ਵਜੋਂ ਸਹੀ ਵਿਜ਼ੁਅਲਾਈਜੇਸ਼ਨ ਨਾਲ ਬਹੁਤ ਸਹਾਇਤਾ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਆਓ ਸਾਡਾ ਸੰਗੀਤ ਡਾਟਾ ਵਿਜ਼ੁਅਲਾਈਜ਼ ਕਰਕੇ ਸ਼ੁਰੂ ਕਰੀਏ। ਇਹ ਅਭਿਆਸ ਸਾਨੂੰ ਇਹ ਫੈਸਲਾ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰੇਗਾ ਕਿ ਇਸ ਡਾਟੇ ਦੀ ਪ੍ਰਕ੍ਰਿਤੀ ਲਈ ਕਲੱਸਟਰਿੰਗ ਦੇ ਕਿਸ ਤਰੀਕੇ ਨੂੰ ਸਭ ਤੋਂ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਤਰੀਕੇ ਨਾਲ ਵਰਤਣਾ ਚਾਹੀਦਾ ਹੈ।

  1. ਇਸ ਫੋਲਡਰ ਵਿੱਚ notebook.ipynb ਫਾਇਲ ਖੋਲ੍ਹੋ।

  2. ਵਧੀਆ ਡਾਟਾ ਵਿਜ਼ੁਅਲਾਈਜੇਸ਼ਨ ਲਈ Seaborn ਪੈਕੇਜ ਇੰਪੋਰਟ ਕਰੋ।

    !pip install seaborn
    
  3. nigerian-songs.csv ਤੋਂ ਸੰਗੀਤ ਡਾਟਾ ਜੋੜੋ। ਕੁਝ ਗੀਤਾਂ ਬਾਰੇ ਡਾਟਾ ਲੋਡ ਕਰਨ ਲਈ ਡਾਟਾ ਫ੍ਰੇਮ ਬਣਾਓ। ਲਾਇਬਰੈਰੀਜ਼ ਇੰਪੋਰਟ ਕਰਕੇ ਅਤੇ ਡਾਟਾ ਦਿਖਾ ਕੇ ਇਸ ਡਾਟੇ ਦੀ ਖੋਜ ਕਰਨ ਲਈ ਤਿਆਰ ਹੋ ਜਾਓ:

    import matplotlib.pyplot as plt
    import pandas as pd
    
    df = pd.read_csv("../data/nigerian-songs.csv")
    df.head()
    

    ਡਾਟੇ ਦੀਆਂ ਪਹਿਲੀਆਂ ਕਈ ਲਾਈਨਾਂ ਦੇਖੋ:

    name album artist artist_top_genre release_date length popularity danceability acousticness energy instrumentalness liveness loudness speechiness tempo time_signature
    0 Sparky Mandy & The Jungle Cruel Santino alternative r&b 2019 144000 48 0.666 0.851 0.42 0.534 0.11 -6.699 0.0829 133.015 5
    1 shuga rush EVERYTHING YOU HEARD IS TRUE Odunsi (The Engine) afropop 2020 89488 30 0.71 0.0822 0.683 0.000169 0.101 -5.64 0.36 129.993 3
    2 LITT! LITT! AYLØ indie r&b 2018 207758 40 0.836 0.272 0.564 0.000537 0.11 -7.127 0.0424 130.005 4
    3 Confident / Feeling Cool Enjoy Your Life Lady Donli nigerian pop 2019 175135 14 0.894 0.798 0.611 0.000187 0.0964 -4.961 0.113 111.087 4
    4 wanted you rare. Odunsi (The Engine) afropop 2018 152049 25 0.702 0.116 0.833 0.91 0.348 -6.044 0.0447 105.115 4
  4. ਡੇਟਾਫ੍ਰੇਮ ਬਾਰੇ ਕੁਝ ਜਾਣਕਾਰੀ ਪ੍ਰਾਪਤ ਕਰੋ, info() ਕਾਲ ਕਰਕੇ:

    df.info()
    

    ਨਤੀਜਾ ਇਸ ਤਰ੍ਹਾਂ ਦਾ ਹੈ:

    <class 'pandas.core.frame.DataFrame'>
    RangeIndex: 530 entries, 0 to 529
    Data columns (total 16 columns):
     #   Column            Non-Null Count  Dtype  
    ---  ------            --------------  -----  
     0   name              530 non-null    object 
     1   album             530 non-null    object 
     2   artist            530 non-null    object 
     3   artist_top_genre  530 non-null    object 
     4   release_date      530 non-null    int64  
     5   length            530 non-null    int64  
     6   popularity        530 non-null    int64  
     7   danceability      530 non-null    float64
     8   acousticness      530 non-null    float64
     9   energy            530 non-null    float64
     10  instrumentalness  530 non-null    float64
     11  liveness          530 non-null    float64
     12  loudness          530 non-null    float64
     13  speechiness       530 non-null    float64
     14  tempo             530 non-null    float64
     15  time_signature    530 non-null    int64  
    dtypes: float64(8), int64(4), object(4)
    memory usage: 66.4+ KB
    
  5. ਨੱਲ ਮੁੱਲਾਂ ਲਈ ਡਬਲ-ਚੈੱਕ ਕਰੋ, isnull() ਕਾਲ ਕਰਕੇ ਅਤੇ ਜੋੜ ਵੇਰਵਾ 0 ਹੋਵੇ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉ:

    df.isnull().sum()
    

    ਠੀਕ ਲੱਗ ਰਿਹਾ ਹੈ:

    name                0
    album               0
    artist              0
    artist_top_genre    0
    release_date        0
    length              0
    popularity          0
    danceability        0
    acousticness        0
    energy              0
    instrumentalness    0
    liveness            0
    loudness            0
    speechiness         0
    tempo               0
    time_signature      0
    dtype: int64
    
  6. ਡੇਟਾ ਦਾ ਵਰਣਨ ਕਰੋ:

    df.describe()
    
    release_date length popularity danceability acousticness energy instrumentalness liveness loudness speechiness tempo time_signature
    count 530 530 530 530 530 530 530 530 530 530 530 530
    mean 2015.390566 222298.1698 17.507547 0.741619 0.265412 0.760623 0.016305 0.147308 -4.953011 0.130748 116.487864 3.986792
    std 3.131688 39696.82226 18.992212 0.117522 0.208342 0.148533 0.090321 0.123588 2.464186 0.092939 23.518601 0.333701
    min 1998 89488 0 0.255 0.000665 0.111 0 0.0283 -19.362 0.0278 61.695 3
    25% 2014 199305 0 0.681 0.089525 0.669 0 0.07565 -6.29875 0.0591 102.96125 4
    50% 2016 218509 13 0.761 0.2205 0.7845 0.000004 0.1035 -4.5585 0.09795 112.7145 4
    75% 2017 242098.5 31 0.8295 0.403 0.87575 0.000234 0.164 -3.331 0.177 125.03925 4
    max 2020 511738 73 0.966 0.954 0.995 0.91 0.811 0.582 0.514 206.007 5

🤔 ਜੇ ਅਸੀਂ ਕਲੱਸਟਰਿੰਗ ਨਾਲ ਕੰਮ ਕਰ ਰਹੇ ਹਾਂ, ਜੋ ਇੱਕ ਆਨਸੁਪਰਵਾਈਜ਼ਡ ਤਰੀਕਾ ਹੈ ਜੋ ਲੇਬਲਡ ਡੇਟਾ ਦੀ ਲੋੜ ਨਹੀਂ ਰੱਖਦਾ, ਤਾਂ ਸਾਡੇ ਵੱਲੋਂ ਇਹ ਡੇਟਾ ਲੇਬਲਾਂ ਨਾਲ ਵੇਖਾਉਣ ਦੀ ਲੋੜ ਕਿਉਂ ਹੈ? ਡੇਟਾ ਐਕਸਪਲੋਰੇਸ਼ਨ ਦੀ фаз ਵਿੱਚ ਇਹ ਲਾਭਦਾਇਕ ਹੁੰਦੇ ਹਨ, ਪਰ ਕਲੱਸਟਰਿੰਗ ਐਲਗੋਰਿਦਮ ਲਈ ਇਹ ਜ਼ਰੂਰੀ ਨਹੀਂ ਹੁੰਦੇ। ਤੁਸੀਂ ਸਿਰਫ ਕਾਲਮ ਨੰਬਰਾਂ ਨਾਲ ਡੇਟਾ ਦਾ ਹਵਾਲਾ ਦੇ ਕੇ ਕਾਲਮ ਸਿਰਲੇਖ ਹਟਾ ਵੀ ਸਕਦੇ ਹੋ।

ਡੇਟਾ ਦੇ ਆਮ ਮੁੱਲਾਂ 'ਤੇ ਨਜ਼ਰ ਮਾਰੋ। ਧਿਆਨ ਦਿਓ ਕਿ popularity '0' ਹੋ ਸਕਦੀ ਹੈ, ਜੋ ਗੀਤਾਂ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ ਜਿਨ੍ਹਾਂ ਦੀ ਕੋਈ ਰੈਂਕਿੰਗ ਨਹੀਂ ਹੈ। ਆਓ ਅਸੀਂ ਹੁਣ ਉਹਨਾਂ ਨੂੰ ਹਟਾਉਂਦੇ ਹਾਂ।

  1. ਸਭ ਤੋਂ ਪ੍ਰਸਿੱਧ ਜਾਨਰਾਂ ਨੂੰ ਖੋਜ ਲਈ ਬਾਰਪਲੌਟ ਦੀ ਵਰਤੋਂ ਕਰੋ:

    import seaborn as sns
    
    top = df['artist_top_genre'].value_counts()
    plt.figure(figsize=(10,7))
    sns.barplot(x=top[:5].index,y=top[:5].values)
    plt.xticks(rotation=45)
    plt.title('Top genres',color = 'blue')
    

    most popular

ਜੇ ਤੁਸੀਂ ਜ਼ਿਆਦਾ ਸਿਖਰ ਦੇ ਮੁੱਲ ਵੇਖਣੇ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਟਾਪ [:5] ਨੂੰ ਵੱਡੀ ਕੀਮਤ ਨਾਲ ਬਦਲੋ ਜਾਂ ਇਸਨੂੰ ਹਟਾ ਦਿਓ ਤਾਂ ਜੋ ਸਾਰੇ ਮੁੱਲ ਦੇਖ ਸਕੋ।

ਦਿਆਨ ਦਿਓ, ਜਦੋਂ ਸਿਖਰਲਾ ਜਾਨਰ 'Missing' ਵਜੋਂ ਦੱਸਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ Spotify ਨੇ ਇਸਦੀ ਵਰਗੀਕਰਨ ਨਹੀਂ ਕੀਤੀ, ਇਸ ਲਈ ਆਓ ਇਸ ਨੂੰ ਹਟਾਈਏ।

  1. ਗੁੰਮ ਹੋਈ ਡੇਟਾ ਨੂੰ ਫਿਲਟਰ ਕਰਕੇ ਹਟਾਓ

    df = df[df['artist_top_genre'] != 'Missing']
    top = df['artist_top_genre'].value_counts()
    plt.figure(figsize=(10,7))
    sns.barplot(x=top.index,y=top.values)
    plt.xticks(rotation=45)
    plt.title('Top genres',color = 'blue')
    

    ਹੁਣ ਜਾਨਰਾਂ ਦਾ ਮੁੜ ਮੁਆਇਨਾ ਕਰੋ:

    most popular

  2. ਇਸ ਡੈਟਾਸੇਟ ਵਿੱਚ ਤਿੰਨ ਸਿਖਰਲੇ ਜਾਨਰ ਬੜੀ ਸਖਤੀ ਨਾਲ ਪ੍ਰਭਾਵਿਤ ਹਨ। ਆਓ afro dancehall, afropop, ਅਤੇ nigerian pop ’ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰੀਏ, ਨਾਲ ਹੀ ਡੈਟਾਸੇਟ ਤੋਂ ਉਹ ਸਾਰੇ ਰਿਕਾਰਡ ਹਟਾਓ ਜਿਨ੍ਹਾਂ ਦੀ popularity 0 ਹੈ (ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਉਹ ਡੈਟਾ ਵਿੱਚ popularity ਨਾਲ ਵਰਗੀਕ੍ਰਿਤ ਨਹੀਂ ਕੀਤੇ ਗਏ ਅਤੇ ਸਾਡੇ ਮਕਸਦ ਲਈ ਸ਼ੋਰ ਮੰਨੇ ਜਾ ਸਕਦੇ ਹਨ):

    df = df[(df['artist_top_genre'] == 'afro dancehall') | (df['artist_top_genre'] == 'afropop') | (df['artist_top_genre'] == 'nigerian pop')]
    df = df[(df['popularity'] > 0)]
    top = df['artist_top_genre'].value_counts()
    plt.figure(figsize=(10,7))
    sns.barplot(x=top.index,y=top.values)
    plt.xticks(rotation=45)
    plt.title('Top genres',color = 'blue')
    
  3. ਇੱਕ ਛੋਟੀ ਟੈਸਟ ਕਰੋ ਜੁੜਾਵਾਂ ਨੂੰ ਕਿਸੇ ਖ਼ਾਸ ਤਾਕਤਵਰ ਢੰਗ ਨਾਲ ਦੇਖਣ ਲਈ:

    corrmat = df.corr(numeric_only=True)
    f, ax = plt.subplots(figsize=(12, 9))
    sns.heatmap(corrmat, vmax=.8, square=True)
    

    correlations

    ਸਿਰਫ਼ energy ਅਤੇ loudness ਵਿਚਕਾਰ ਹੀ ਤਾਕਤਵਰ ਜੁੜਾਵ ਹੈ, ਜੋ ਕਿ ਹੈਰਾਨ ਕਰਨ ਵਾਲੀ ਗੱਲ ਨਹੀਂ, ਕਿਉਂਕਿ ਉੱਚ ਸ਼ੋਰ ਵਾਲਾ ਸੰਗੀਤ ਆਮਤੌਰ 'ਤੇ ਬਹੁਤ ਉਰਜਾਵਾਨ ਹੁੰਦਾ ਹੈ। ਹੋਰਾਂ correlations ਕਾਫੀ ਨਰਮ ਹਨ। ਦੇਖਣਾ ਮਨੋਰੰਜਕ ਰਹੇਗਾ ਕਿ ਕਲੱਸਟਰਿੰਗ ਐਲਗੋਰਿਦਮ ਇਸ ਡੇਟਾ ਨਾਲ ਕੀ ਕਰਦਾ ਹੈ।

    🎓 ਧਿਆਨ ਦਿਓ ਕਿ correlation causation ਨੂੰ ਸਾਬਤ ਨਹੀਂ ਕਰਦਾ! ਸਾਡੇ ਕੋਲ correlation ਦਾ ਸਬੂਤ ਹੈ ਪਰ causation ਦਾ ਨਹੀਂ। ਇੱਕ ਮਜ਼ੇਦਾਰ ਵੈੱਬਸਾਈਟ ਕੁਝ ਵਿਜ਼ੂਅਲਜ਼ ਦੇ ਕੇ ਇਸ ਬਿੰਦੂ ਨੂੰ ਝਲਕਾਉਂਦੀ ਹੈ।

ਕੀ ਇਸ ਡੇਟਾਸੇਟ ਵਿੱਚ ਗੀਤ ਦੀ ਸਮਝੀ ਗਈ ਪ੍ਰਸਿੱਧੀ ਅਤੇ ਨੱਚਣਯੋਗਤਾ ਵਿਚ ਕੋਈ ਇਕੱਤਰਤਾ ਹੈ? FacetGrid ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਉਹਨਾਂ ਦੇ ਗੋਲ-ਗੋਲ ਚੱਕਰ ਹਨ ਜੋ ਜਾਨਰ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਲਗਦੇ ਹਨ। ਕੀ ਇਹ ਹੋ ਸਕਦਾ ਹੈ ਕਿ ਨਾਈਜੀਰੀਆਈ ਸਵਾਦ ਇਸ ਜਾਨਰ ਲਈ ਇੱਕ ਨੱਚਣਯੋਗਤਾ ਦੇ ਇੱਕ ਖਾਸ ਸਤਰ 'ਤੇ ਮਿਲਦੇ ਹਨ?

ਵੱਖ-ਵੱਖ ਡੇਟਾਪੋਇੰਟ (energy, loudness, speechiness) ਅਤੇ ਹੋਰ ਜਾਂ ਵੱਖਰੇ ਸੰਗੀਤਕ ਜਾਨਰਾਂ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ। ਤੁਸੀਂ ਕੀ ਖੋਜ ਸਕਦੇ ਹੋ? ਗਲੋਬਲ ਡੇਟਾਪੋਇੰਟ ਦੇ ਫੈਲਾਵ ਨੂੰ ਵੇਖਣ ਲਈ df.describe() ਟੇਬਲ ਨੂੰ ਦੇਖੋ।

ਵਿਆਯਾਮ - ਡੇਟਾ ਵੰਡ

ਕੀ ਇਹ ਤਿੰਨ ਜਾਨਰ ਆਪਣੇ ਪ੍ਰਸਿੱਧੀ ਦੇ ਆਧਾਰ 'ਤੇ ਆਪਣੇ ਨੱਚਣਯੋਗਤਾ ਦੀ ਸਮਝ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਵੱਖਰੇ ਹਨ?

  1. ਸਾਡੇ ਟਾਪ ਤਿੰਨ ਜਾਨਰਾਂ ਦੀ ਡੇਟਾ ਵੰਡ ਦੀ ਜਾਂਚ ਕਰੋ, ਪ੍ਰਸਿੱਧੀ ਅਤੇ ਨੱਚਣਯੋਗਤਾ ਲਈ ਦਿੱਤੇ ਹੋਏ x ਅਤੇ y ਧੁਰੀਆਂ 'ਤੇ।

    sns.set_theme(style="ticks")
    
    g = sns.jointplot(
        data=df,
        x="popularity", y="danceability", hue="artist_top_genre",
        kind="kde",
    )
    

    ਤੁਸੀਂ ਇੱਕ ਆਮ ਇਕੱਤਰਤਾ ਬਿੰਦੂ ਦੇ ਆਸ-ਪਾਸ ਗੋਲ-ਗੋਲ ਚੱਕਰ ਖੋਜ ਸਕਦੇ ਹੋ, ਜੋ ਪੌਇੰਟਸ ਦੀ ਵੰਡ ਦਰਸਾਉਂਦਾ ਹੈ।

    🎓 ਧਿਆਨ ਦਿਓ ਕਿ ਇਹ ਉਦਾਹਰਨ KDE (Kernel Density Estimate) ਗ੍ਰਾਫ ਦੀ ਵਰਤੋਂ ਕਰਦੀ ਹੈ ਜੋ ਡੇਟਾ ਨੂੰ ਇੱਕ ਲਗਾਤਾਰ ਸੰਭਾਵਨਾ ਘਣਤਾ ਵੇਖਾਵਟ ਨਾਲ ਦਰਸਾਉਂਦਾ ਹੈ। ਇਹ ਸਾਨੂੰ ਕਈ ਵੰਡਾਂ ਨਾਲ ਕੰਮ ਕਰਦੇ ਸਮੇਂ ਡੇਟਾ ਦੀ ਵਿਵਖਿਆ ਕਰਨ ਦੀ ਆਗਿਆ ਦਿੰਦਾ ਹੈ।

    ਆਮ ਤੌਰ 'ਤੇ, ਇਹ ਤਿੰਨ ਜਾਨਰ ਆਪਣੀ ਪ੍ਰਸਿੱਧੀ ਅਤੇ ਨੱਚਣਯੋਗਤਾ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਖੁਲ੍ਹੇ ਤੌਰ 'ਤੇ ਮਿਲਦੇ ਹਨ। ਇਸ ਖੁੱਲੀ ਵੰਡ ਵਿੱਚ ਕਲੱਸਟਰ ਤੈਅ ਕਰਨਾ ਚੁਣੌਤੀਪੂਰਨ ਹੋਵੇਗਾ:

    distribution

  2. ਇੱਕ ਸਕੈਟਰ ਪਲੌਟ ਬਣਾਓ:

    sns.FacetGrid(df, hue="artist_top_genre", height=5) \
       .map(plt.scatter, "popularity", "danceability") \
       .add_legend()
    

    ਉਹੀ ਧੁਰੀਆਂ ਵਾਲਾ ਸਕੈਟਰਪਲੌਟ ਇੱਕ ਸਮਾਨ ਇਕੱਤਰਤਾ ਪੈਟਰਨ ਦਰਸਾਉਂਦਾ ਹੈ

    Facetgrid

ਆਮ ਤੌਰ 'ਤੇ, ਕਲੱਸਟਰਿੰਗ ਲਈ, ਤੁਸੀਂ ਡੇਟਾ ਦੇ ਕਲੱਸਟਰਾਂ ਨੂੰ ਵੇਖਾਉਣ ਲਈ ਸਕੈਟਰਪਲੌਟ ਵਰਤ ਸਕਦੇ ਹੋ, ਇਸ ਲਈ ਇਸ ਕਿਸਮ ਦੀ ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨ ਨੂੰ ਜਾਣਨਾ ਬਹੁਤ ਲਾਭਦਾਇਕ ਹੈ। ਅਗਲੇ ਪਾਠ ਵਿੱਚ, ਅਸੀਂ ਇਸ ਫਿਲਟਰਡ ਡੇਟਾ ਦੀ ਵਰਤੋਂ ਕਰਕੇ k-means ਕਲੱਸਟਰਿੰਗ ਨਾਲ ਉਹ ਗਰੁੱਪ ਖੋਜਾਂਗੇ ਜੋ ਇਸ ਡੇਟਾ ਵਿੱਚ ਦਿਲਚਸਪ ਤਰੀਕੇ ਨਾਲ ਓਵਰਲੈਪ ਹੋਦੇ ਹਨ।


🚀ਚੁਣੌਤੀ

ਅਗਲੇ ਪਾਠ ਦੀ ਤਿਆਰੀ ਲਈ, ਉਹ ਵੱਖ-ਵੱਖ ਕਲੱਸਟਰਿੰਗ ਐਲਗੋਰਿਦਮਾਂ ਬਾਰੇ ਇੱਕ ਚਾਰਟ ਬਣਾਓ ਜੋ ਤੁਸੀਂ ਪ੍ਰੋਡਕਸ਼ਨ ਮਾਹੌਲ ਵਿੱਚ ਲੱਭ ਸਕਦੇ ਹੋ ਅਤੇ ਵਰਤ ਸਕਦੇ ਹੋ। ਕਿਹੜੇ ਕਿਸਮ ਦੇ ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਕਲੱਸਟਰਿੰਗ ਹੱਲ ਕਰਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰ ਰਹੀ ਹੈ?

ਪੋਸਟ-ਲੈੱਕਚਰ ਕੁਇਜ਼

ਸਮੀਖਿਆ ਅਤੇ ਖੁਦ-ਅਧਿਐਨ

ਕਲੱਸਟਰਿੰਗ ਐਲਗੋਰਿਦਮ ਲਾਗੂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ, ਜਿਵੇਂ ਕਿ ਅਸੀਂ ਸਿੱਖਿਆ ਹੈ, ਇਹ ਬਿਹਤਰ ਹੈ ਕਿ ਤੁਸੀਂ ਆਪਣੇ ਡੇਟਾਸੇਟ ਦੀ ਕੁਦਰਤ ਜਾਨਣ। ਇਸ ਵਿਸ਼ੇ 'ਤੇ ਵਧੇਰੇ ਪੜ੍ਹੋ ਇੱਥੇ

ਇਹ ਸਹਾਇਕ ਲੇਖ ਤੁਹਾਨੂੰ ਵੱਖ-ਵੱਖ ਕਲੱਸਟਰਿੰਗ ਐਲਗੋਰਿਦਮਾਂ ਦੇ ਵਿਵਹਾਰ ਬਾਰੇ ਗਾਈਡ ਕਰਦਾ ਹੈ, ਜੋ ਵੱਖਰੇ ਡੇਟਾ ਰੂਪਾਂ 'ਤੇ ਆਧਾਰਿਤ ਹਨ।

ਅਸਾਈਨਮੈਂਟ

ਕਲੱਸਟਰਿੰਗ ਲਈ ਹੋਰ ਵਿਜ਼ੂਅਲਾਈਜ਼ੇਸ਼ਨਾਂ ਦੀ ਖੋਜ ਕਰੋ


ਅਸਵੀਕਾਰੋਪਣ: ਇਸ ਦਸਤਾਵੇਜ਼ ਦਾ ਅਨੁਵਾਦ ਏਆਈ ਅਨੁਵਾਦ ਸੇਵਾ Co-op Translator ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤਾ ਗਿਆ ਹੈ। ਜਦੋਂ ਕਿ ਅਸੀਂ ਸਹੀਤਾਵਾਂ ਲਈ ਯਤਨਸ਼ੀਲ ਹਾਂ, ਕਿਰਪਾ ਕਰਕੇ ਧਿਆਨ ਰੱਖੋ ਕਿ ਸਵੈਚਾਲਿਤ ਅਨੁਵਾਦਾਂ ਵਿੱਚ ਗਲਤੀਆਂ ਜਾਂ ਅਸਮੱਤਿਆਵਾਂ ਹੋ ਸਕਦੀਆਂ ਹਨ। ਮੂਲ ਦਸਤਾਵੇਜ਼ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਅਧਿਕਾਰਕ ਸਰੋਤ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਰੂਰੀ ਜਾਣਕਾਰੀ ਲਈ, ਪੇਸ਼ੇਵਰ ਮਨੁੱਖੀ ਅਨੁਵਾਦ ਦੀ ਸਿਫ਼ਾਰਸ਼ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਅਸੀਂ ਇਸ ਅਨੁਵਾਦ ਦੇ ਉਪਯੋਗ ਤੋਂ ਪੈਦਾ ਹੋਣ ਵਾਲੀਆਂ ਕਿਸੇ ਵੀ ਗਲਤਫਹਿਮੀਆਂ ਜਾਂ ਗਲਤ ਵਿਆਖਿਆਵਾਂ ਲਈ ਜਵਾਬਦੇਹ ਨਹੀਂ ਹਾਂ।