Forstærkningslæring fra Menneskelig Feedback
term_id: rlhf
Category: training_techniques
Definition
Forstærkningslæring fra Menneskelig Feedback (RLHF) er en metode, der bruges til at finjustere store sprogmodeller, så deres output bedre stemmer overens med menneskelige værdier og forventninger. Det involverer typisk tre trin: træning af en belønningsmodel, sampling og rangering, og endelig forstærkningslæringstrin.
Summary
RLHF er en teknik, der tilpasser AI-modeller til menneskelige præferencer ved at bruge menneskelig feedback til at træne en belønningsmodel til forstærkningslæring.
Key Concepts
- Præferencedata
- Belønningsmodel
- Alignering (tilpasning)
- PPO (Proximal Policy Optimization)
Use Cases
- Forbedring af chatbots
- Indholdsgodkendelse
- Forbedring af instruktionsoverholdelse