Förstärkningsinlärning från mänsklig feedback
term_id: rlhf
Category: training_techniques
Definition
Förstärkningsinlärning från mänsklig feedback (RLHF) är en metod som används för att finjustera stora språkmodeller så att deras utdata bättre överensstämmer med mänskliga värderingar och förväntningar. Den involverar vanligtvis tre steg: samlning av preferensdata, träning av en belöningsmodell och finjustering av den primära modellen med förstärkningsinlärning.
Summary
RLHF är en teknik som alignerar AI-modeller med mänskliga preferenser genom att använda mänsklig feedback för att träna en belöningsmodell för förstärkningsinlärning.
Key Concepts
- Preferensdata
- Belöningsmodell
- Alignering
- PPO (Proximal Policy Optimization)
Use Cases
- Förfining av chattbots
- Innehållsmoderering
- Förbättrad följsamhet till instruktioner