Posilované učení z lidské zpětné vazby
term_id: rlhf
Category: training_techniques
Definition
Posilované učení z lidské zpětné vazby (RLHF) je metoda používaná k doladění velkých jazykových modelů tak, aby jejich výstupy lépe odpovídaly lidským hodnotám a očekáváním. Obvykle zahrnuje tři hlavní kroky: sběr preferenčních dat, trénování odměňovacího modelu a finální ladění pomocí RL.
Summary
RLHF je technika, která ladí modely AI podle lidských preferencí pomocí lidské zpětné vazby k trénování odměňovacího modelu pro posilované učení.
Key Concepts
- Preferenční data
- Odměňovací model
- Ladění (Alignment)
- PPO (Proximální politická optimalizace)
Use Cases
- Vylepšování chatbotů
- Moderace obsahu
- Zlepšování dodržování pokynů