למידת העדפות
term_id: preference_learning
Category: training_techniques
Definition
למידת העדפות מתמקדת בהוראת מודלים להבחין בין פלט טוב לפלט גרוע בהתבסס על שיפוט אנושי ולא על תוויות מוחלטות. היא כוללת בדרך כלל איסוף זוגות תגובות כאשר אחד נחשב עדיף על השני, ומאפשרת למודל ללמוד פונקציית פרסום המשקפת העדפות אנושיות.
Summary
טכניקה המאמנת מודלים להתאים פלט להעדפות אנושיות באמצעות משוב השוואתי.
Key Concepts
- משוב אנושי
- השוואה בזוגות
- מודלי פרס
- יישור
Use Cases
- RLHF (הכשרה מחזקת עם משוב אנושי) עבור מודלי שפה גדולים
- מערכות המלצה
- סינון תוכן ומודרציה