Forstærkningslæring fra Menneskelig Feedback

term_id: rlhf

Category: training_techniques

Definition

Forstærkningslæring fra Menneskelig Feedback (RLHF) er en metode, der bruges til at finjustere store sprogmodeller, så deres output bedre stemmer overens med menneskelige værdier og forventninger. Det involverer typisk tre trin: træning af en belønningsmodel, sampling og rangering, og endelig forstærkningslæringstrin.

Summary

RLHF er en teknik, der tilpasser AI-modeller til menneskelige præferencer ved at bruge menneskelig feedback til at træne en belønningsmodel til forstærkningslæring.

Key Concepts

  • Præferencedata
  • Belønningsmodel
  • Alignering (tilpasning)
  • PPO (Proximal Policy Optimization)

Use Cases

  • Forbedring af chatbots
  • Indholdsgodkendelse
  • Forbedring af instruktionsoverholdelse