למידת העדפות

term_id: preference_learning

Category: training_techniques

Definition

למידת העדפות מתמקדת בהוראת מודלים להבחין בין פלט טוב לפלט גרוע בהתבסס על שיפוט אנושי ולא על תוויות מוחלטות. היא כוללת בדרך כלל איסוף זוגות תגובות כאשר אחד נחשב עדיף על השני, ומאפשרת למודל ללמוד פונקציית פרסום המשקפת העדפות אנושיות.

Summary

טכניקה המאמנת מודלים להתאים פלט להעדפות אנושיות באמצעות משוב השוואתי.

Key Concepts

  • משוב אנושי
  • השוואה בזוגות
  • מודלי פרס
  • יישור

Use Cases

  • RLHF (הכשרה מחזקת עם משוב אנושי) עבור מודלי שפה גדולים
  • מערכות המלצה
  • סינון תוכן ומודרציה