למידת חיזוק מבוססת משוב אנושי
term_id: rlhf
Category: training_techniques
Definition
למידת חיזוק מבוססת משוב אנושי (RLHF) היא שיטה המשמשת לדיוק עדין (Fine-tuning) של דגמי שפה גדולים כך שפלטם יהיה מותאם יותר לערכים ולציפיות האנושיים. התהליך כולל בדרך כלל שלושה שלבים: אימון מודל פרס על בסיס העדפות אנושיות, ולאחר מכן שימוש בלמידת חיזוק כדי לשפר את הדגם הראשי.
Summary
RLHF היא טכניקה המיישרת מודלי בינה מלאכותית עם העדפות אנושיות באמצעות שימוש במשוב אנושי לאימון מודל פרס ללמידת חיזוק.
Key Concepts
- נתוני העדפה
- מודל פרס
- יישור (Alignment)
- PPO (אופטימיזציית מדיניות קרובה)
Use Cases
- שיפור בוטים לשיחה (Chatbots)
- מדיניות תוכן
- שיפור עקביות בביצוע הנחיות