You can not select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.
ML-For-Beginners/translations/he/1-Introduction/4-techniques-of-ML
localizeflow[bot] f9e9c997fc
chore(i18n): sync translations with latest source changes (chunk 1/1, 12 changes)
4 months ago
..
README.md chore(i18n): sync translations with latest source changes (chunk 1/1, 12 changes) 4 months ago
assignment.md chore(i18n): sync translations with latest source changes (chunk 1/1, 300 changes) 7 months ago

README.md

טכניקות של למידת מכונה

תהליך בניית, שימוש ותחזוקה של מודלים ללמידת מכונה והנתונים שהם משתמשים בהם הוא תהליך שונה מאוד מהרבה תהליכים אחרים בפיתוח. בשיעור זה, נמיר את המסתורין סביב התהליך, ונסקור את הטכניקות העיקריות שעליך להכיר. תלמדו:

  • להבין את התהליכים הבסיסיים של למידת מכונה ברמה גבוהה.
  • לחקור מושגים בסיסיים כמו 'מודלים', 'תחזיות', ו'נתוני אימון'.

מבחן טרום-הרצאה

למידת מכונה למתחילים - טכניקות של למידת מכונה

🎥 לחצו על התמונה למעלה כדי לצפות בסרטון קצר שעובר על השיעור הזה.

מבוא

ברמה גבוהה, מלאכת יצירת תהליכי למידת מכונה (ML) מורכבת ממספר שלבים:

  1. החלטה על השאלה. רוב תהליכי ה-ML מתחילים עם שאלה שלא ניתן לענות עליה באמצעות תוכנית פשוטה מבוססת תנאים או מנוע כללים. השאלות האלו בדרך כלל מתמקדות בתחזיות המבוססות על אוסף נתונים.
  2. איסוף והכנת נתונים. כדי שתוכל לענות על שאלתך, אתה זקוק לנתונים. איכות וכמות הנתונים שלך יקבעו עד כמה תוכל לענות על השאלה הראשונית. ויזואליזציה של נתונים היא היבט חשוב של שלב זה. שלב זה כולל גם חלוקה של הנתונים לקבוצת אימון וקבוצת בדיקה כדי לבנות מודל.
  3. בחירת שיטת אימון. בהתאם לשאלה שלך וטיב הנתונים, עליך לבחור כיצד לאמן את המודל כך שישקף בצורה הטובה ביותר את הנתונים שלך ויעשה תחזיות מדויקות. זהו חלק מתהליך ה-ML שדורש מומחיות ספציפית ולעיתים גם הרבה ניסוי וטעייה.
  4. אימון המודל. באמצעות נתוני האימון תשתמש באלגוריתמים שונים כדי לאמן מודל שיזהה דפוסים בנתונים. המודל יכול לנצל משקלים פנימיים שניתן לכוונם כדי להעדיף חלקים מסוימים בנתונים על פני אחרים כדי לבנות מודל טוב יותר.
  5. הערכת המודל. אתה משתמש בנתונים שטרם נראו (נתוני הבדיקה) מתוך האוסף שלך כדי לראות כיצד המודל מתפקד.
  6. כוונון פרמטרים. בהתבסס על ביצועי המודל, אתה יכול לחזור על התהליך עם פרמטרים שונים או משתנים שבוחנים את התנהגות האלגוריתמים לאימון המודל.
  7. חיזוי. השתמש בקלטים חדשים כדי לבדוק את דיוק המודל שלך.

איזו שאלה לשאול

מחשבים מיומנים במיוחד בגילוי דפוסים נסתרים בנתונים. תכונה זו מועילה מאוד לחוקרים שיש להם שאלות בתחום נתון שקשה לענות עליהן על ידי יצירת מנוע כללים מבוסס תנאים. לדוגמה, מטלה אקטוארית, מדען נתונים יכול לבנות כללים ידניים סביב תמותה של מעשנים מול לא מעשנים.

כאשר נכנסות למערכת משתנים רבים נוספים, ייתכן שמודל למידת מכונה יהיה יעיל יותר לחיזוי שיעורי תמותה עתידיים על סמך היסטוריית בריאות קודמת. דוגמה יותר עליזה יכולה להיות חיזוי מזג אוויר לחודש אפריל במקום מסוים בהתבסס על נתונים הכוללים רוחב, אורך, שינויי אקלים, קרבה לאוקיינוס, דפוסי זרם ג'ט ועוד.

מצגת זו על מודלים של מזג אוויר מציעה פרספקטיבה היסטורית על שימוש בלמידת מכונה לניתוח מזג אוויר.

משימות לפני הבנייה

לפני שתתחיל לבנות את המודל שלך, יש מספר משימות שעליך להשלים. כדי לבדוק את שאלתך וליצור היפותזה בהתבסס על תחזיות המודל, עליך לזהות ולהגדיר כמה אלמנטים.

נתונים

כדי שתוכל לענות על השאלה שלך בוודאות מסוימת, אתה זקוק לכמות טובה של נתונים מסוג מתאים. יש שתי פעולות שעליך לבצע בשלב זה:

  • איסוף נתונים. תוך התחשבות בשיעור הקודם על הוגנות בניתוח הנתונים, אסוף את הנתונים שלך בזהירות. היה מודע למקורות הנתונים, ההטיות הטבועות בהם, ותעד את מקורם.
  • הכנת נתונים. ישנם מספר שלבים בתהליך הכנת הנתונים. ייתכן שתצטרך לאסוף את הנתונים ולנרמל אותם אם הם מגיעים ממקורות מגוונים. ניתן לשפר את איכות וכמות הנתונים בשיטות שונות, כגון המרת מחרוזות למספרים (כפי שאנו עושים ב-Clustering). ייתכן גם שתיצור נתונים חדשים על בסיס המקוריים (כפי שאנו עושים ב-Classification). ניתן לנקות ולערוך את הנתונים (כפי שנעשה לפני השיעור Web App). לבסוף, ייתכן שתצטרך גם לשרשר ולערבב אותם, בהתאם לטכניקות האימון שלך.

לאחר איסוף ועיבוד הנתונים שלך, עצור לרגע וראה אם צורתם תאפשר לך לטפל בשאלה שלך. ייתכן שהנתונים לא יתפקדו היטב במשימה הנתונה, כפי שאנו מגלים בשיעורי Clustering!

תכונות ויעד

feature היא תכונה שניתנת למדידה של הנתונים שלך. ברבים ממאגרי הנתונים היא מבוטאת כתואר עמודה כמו 'תאריך', 'גודל' או 'צבע'. משתנה התכונה שלך, המיוצג בדרך כלל כ-X בקוד, מייצג את משתנה הקלט שישמש לאימון המודל.

היעד הוא הדבר שאתה מנסה לחזות. היעד, המיוצג בדרך כלל כ-y בקוד, מייצג את התשובה לשאלה שאתה שואל את הנתונים: בדצמבר, אילו דלעות יהיו בצבע הזול ביותר? בסן פרנסיסקו, באילו שכונות יהיה המחיר הנדל"ני הטוב ביותר? לפעמים היעד מכונה גם תכונת תווית.

בחירת משתנה התכונה

🎓 בחירת תכונה וחילוץ תכונה איך תדע איזה משתנה לבחור בונה מודל? ככל הנראה תעבור תהליך של בחירת תכונה או חילוץ תכונה כדי לבחור את המשתנים הנכונים למודל היעיל ביותר. עם זאת, הם לא אותו דבר: "חילוץ תכונה יוצר תכונות חדשות מפונקציות של התכונות המקוריות, בעוד שבחירת תכונה מחזירה תת-קבוצה של התכונות." (מקור)

ויזואליזציה של הנתונים שלך

היבט חשוב בערכת הכלים של מדען הנתונים הוא היכולת ליצור ויזואליזציות של הנתונים באמצעות כמה ספריות מצוינות כמו Seaborn או MatPlotLib. ייצוג הנתונים ויזואלית עשוי לאפשר לך לחשוף מתאמים נסתרים שניתן לנצל. הוויזואליזציות עשויות גם לסייע לך לחשוף הטיה או נתונים לא מאוזנים (כפי שאנו מגלים ב-Classification).

חלוקת מאגר הנתונים

לפני האימון, עליך לחלק את מאגר הנתונים שלך לשני חלקים או יותר בגודל שונה אך שמייצגים היטב את הנתונים.

  • אימון. חלק זה של מאגר הנתונים מתאים למודל שלך כדי לאמן אותו. סט זה מהווה את רוב מאגר הנתונים המקורי.
  • בדיקה. קבוצת בדיקה היא קבוצת נתונים עצמאית, שלעתים נאספה מתוך הנתונים המקוריים, שבה תשתמש כדי לאשר את ביצועי המודל.
  • אימות. קבוצת אימות היא קבוצה עצמאית קטנה של דוגמאות שבה תשתמש כדי לכוונן את ההיפרפרמטרים או את הארכיטקטורה של המודל לשיפורו. בהתאם לגודל הנתונים והשאלה שאתה שואל, ייתכן שלא תצטרך לבנות קבוצה שלישית זו (כפי שמצויין ב-Time Series Forecasting).

בניית מודל

באמצעות נתוני האימון שלך, המטרה היא לבנות מודל, או ייצוג סטטיסטי של הנתונים שלך, באמצעות אלגוריתמים שונים להנחת אימון עליו. אימון מודל חושף אותו לנתונים ומאפשר לו להניח הנחות לגבי דפוסים שהוא מגלה, מאמת, ומקבל או דוחה.

החלטה על שיטת אימון

בהתאם לשאלה שלך וטיב הנתונים, תבחר שיטה לאימון המודל. על ידי מעבר על התיעוד של Scikit-learn שאותו אנו משתמשים בקורס זה תוכל לחקור דרכים רבות לאימון מודל. בהתאם לניסיונך, ייתכן שתצטרך לנסות מספר שיטות שונות כדי לבנות את המודל הטוב ביותר. סביר שתעבור תהליך שבו מדעני נתונים מעריכים את ביצועי המודל על ידי הזנת נתונים שטרם נראו, בדיקת דיוק, הטיה ובעיות אחרות שמשחיתות איכות, ובחירת שיטת האימון המתאימה ביותר למשימה.

אימון מודל

מצויד בנתוני האימון שלך, אתה מוכן 'להתאים' אותו כדי ליצור מודל. תבחין שבספריות למידת מכונה רבות תראה את הקוד 'model.fit' בשלב זה אתה מזין את משתנה התכונה כמערך ערכים (בדרך כלל 'X') ואת משתנה היעד (בדרך כלל 'y').

הערכת המודל

לאחר תהליך האימון הושלם (הוא יכול לקחת מספר רב של איטרציות, או 'אפיקים', לאימון מודל גדול), תוכל להעריך את איכות המודל על ידי שימוש בנתוני בדיקה למדידת ביצועיו. נתונים אלו הם תת-קבוצה של הנתונים המקוריים שהמודל טרם ניתח. תוכל להדפיס טבלת מדדים על איכות המודל שלך.

🎓 התאמת מודל

בהקשר של למידת מכונה, התאמת מודל מתייחסת לדיוק הפונקציה הבסיסית של המודל כשהיא מנסה לנתח נתונים שהיא לא מכירה.

🎓 Underfitting ו-overfitting הן בעיות נפוצות שמורידות את איכות המודל, מאחר שהמודל מתאים לא טוב מספיק או מתאים מדי. זה גורם למודל לחזות באופן הדוק מדי או רופף מדי בהתאם לנתוני האימון שלו. מודל עם overfit חוזה טוב מדי את נתוני האימון כי למד את הפרטים והרעש בנתונים לעומק. מודל עם underfit אינו מדויק, כיוון שאינו מסוגל לנתח בצורה מדויקת את נתוני האימון שלו או את הנתונים שטרם 'ראה'.

מודל עם התאמה יתרה

אינפוגרפיקה מאת Jen Looper

כוונון פרמטרים

לאחר סיום האימון הראשוני, בחן את איכות המודל וחשב לשפר אותו על ידי כוונון 'היפרפרמטרים'. קרא עוד על התהליך בתיעוד.

חיזוי

זהו הרגע שבו תוכל להשתמש בנתונים חדשים לגמרי כדי לבדוק את דיוק המודל שלך. בסביבת ML 'מיושמת', שבה בונים נכסי רשת לשימוש במודל בפרודקשן, תהליך זה עשוי לכלול איסוף קלט משתמש (לדוגמה לחצן), הגדרת משתנה ושליחתו למודל להסקת מסקנות או הערכה.

בשיעורים אלה תגלו כיצד להשתמש בשלבים אלה כדי להכין, לבנות, לבדוק, להעריך ולחזות כל המהלכים של מדען נתונים ועוד, ככל שתתקדם במסעך להפוך למהנדס ML 'פול סטאק'.


🚀 אתגר

צייר תרשים זרימה שמשקף את השלבים של מומחה למידת מכונה. איפה אתה רואה את עצמך כרגע בתהליך? היכן אתה חושב שתיתקל בקושי? מה נראה לך קל?

מבחן לאחר ההרצאה

סקירה ולימוד עצמי

חפש באינטרנט ראיונות עם מדעני נתונים שמספרים על עבודתם היומית. הנה ראיון אחד.

מטלה

ראיין מדען נתונים


כתב ויתור:
מסמך זה תורגם באמצעות שירות תרגום מבוסס בינה מלאכותית Co-op Translator. למרות שאנו שואפים לדייק, יש לקחת בחשבון שתרגומים אוטומטיים עשויים להכיל שגיאות או אי דיוקים. יש להתייחס למסמך המקורי בשפת המקור כמקור המוסמך. עבור מידע קריטי, מומלץ תרגום מקצועי על ידי אדם. אנו איננו אחראים לכל אי הבנה או פרשנות מוטעית הנובעים מהשימוש בתרגום זה.