למידת חיזוק מבוססת משוב אנושי

term_id: rlhf

Category: training_techniques

Definition

למידת חיזוק מבוססת משוב אנושי (RLHF) היא שיטה המשמשת לדיוק עדין (Fine-tuning) של דגמי שפה גדולים כך שפלטם יהיה מותאם יותר לערכים ולציפיות האנושיים. התהליך כולל בדרך כלל שלושה שלבים: אימון מודל פרס על בסיס העדפות אנושיות, ולאחר מכן שימוש בלמידת חיזוק כדי לשפר את הדגם הראשי.

Summary

RLHF היא טכניקה המיישרת מודלי בינה מלאכותית עם העדפות אנושיות באמצעות שימוש במשוב אנושי לאימון מודל פרס ללמידת חיזוק.

Key Concepts

  • נתוני העדפה
  • מודל פרס
  • יישור (Alignment)
  • PPO (אופטימיזציית מדיניות קרובה)

Use Cases

  • שיפור בוטים לשיחה (Chatbots)
  • מדיניות תוכן
  • שיפור עקביות בביצוע הנחיות