Tsoof Bar Or
הקטעים בעמוד הם הסברים שרלוונטים לתוכן שאני מייצר בטלגרם
למידת חיזוקים (Reinforcement Learning)
למידת חיזוקים (RL) היא שיטה בלימוד מכונה שבה האלגוריתם מתאמן לא בעזרת דאטה מתוייג (Ground Truth) אלא באמצעות אינטראקציה עם סביבה, קבלת תגמול (או קנס) ושיפור ההתנהגות בהתאם.
באופן כללי, בעולם הRL נהוג להשתמש בכמה מונחים בסיסיים.
ישנם מצבים (States) - תמונות של העולם הנלמד.
ישנן פעולות (Actions) - האפשרויות השונות של האלגוריתם לאינטרקציה עם עולם.
וישנו פרס (Reward) - יכול להיות חיובי, שלילי או שניהם, אותו האלגוריתם מקבל אחרי שקיבל כקלט מצב, וביצע פעולה.
למידת חיזוקים משמשת בעיקר במצבים בהם אין "אמת אחת", אלא מטרה, והאלגוריתם צריך למצוא את הדרך להשיג אותה.
בהקשר של מודלי שפה גדולים, אחרי האימון המקדים (Pretraining) והאימון המונחה (SFT) מגיעים בדרך כלל שני סבבים של למידת חיזוקים המכונים RLHF וRLVR, אך למידת חיזוקים היא אלגוריתם כללי מאד ובעל מגוון של שימושים.