Emberi visszajelzésen alapuló megerősítési tanulás
term_id: rlhf
Category: training_techniques
Definition
Az emberi visszajelzésen alapuló megerősítési tanulás (RLHF) egy módszer nagy nyelvi modellek finomhangolására, hogy kimeneteik jobban illeszkedjenek az emberi értékekhez és elvárásokhoz. Általában három lépésből áll: az alapmodell képzése, egy jutalommodell létrehozása emberi rangsorolt adatokkal, és végül az alapmodell finomhangolása a megerősítési tanulás segítségével.
Summary
Az RLHF egy technika, amely emberi visszajelzések felhasználásával igazítja az AI modelleket az emberi preferenciákhoz, egy megerősítési tanításhoz szükséges jutalommodellt képezve.
Key Concepts
- Preferencia-adatok
- Jutalommodell
- Igazítás (Alignment)
- PPO (Proximal Policy Optimization)
Use Cases
- Chatbotok fejlesztése
- Tartalommoderáció
- Utasszabálykövetés javítása