Forsterkningslæring fra menneskelig tilbakemelding
term_id: rlhf
Category: training_techniques
Definition
Forsterkningslæring fra menneskelig tilbakemelding (RLHF) er en metode brukt til å finjustere store språkmodeller slik at outputen deres samsvarer bedre med menneskelige verdier og forventninger. Prosessen involverer typisk tre trinn: trening av en belønningsmodell basert på menneselige rangeringer, og deretter bruk av forsterkningslæring for å optimalisere språkmodellen mot denne belønningsmodellen.
Summary
RLHF er en teknikk som tilpasser AI-modeller etter menneskelige preferanser ved å bruke menneskelig tilbakemelding til å trene en belønningsmodell for forsterkningslæring.
Key Concepts
- Preferansedata
- Belønningsmodell
- Tilpasning (Alignment)
- PPO (Proksimal politikkoptimalisering)
Use Cases
- Forbedring av chatbots
- Innholdsmoderasjon
- Økt evne til å følge instruksjoner