Uczenie przez wzmacnianie z ludzkiej informacji zwrotnej
term_id: rlhf
Category: training_techniques
Definition
Uczenie przez wzmacnianie z ludzkiej informacji zwrotnej (RLHF) to metoda stosowana do dopracowywania dużych modeli językowych, aby ich wyjścia lepiej odpowiadały ludzkim wartościom i oczekiwaniom. Zazwyczaj obejmuje trzy kroki
Summary
RLHF to technika dostosowująca modele AI do preferencji ludzkich poprzez wykorzystanie ludzkiej informacji zwrotnej do trenowania modelu nagrody dla uczenia przez wzmacnianie.
Key Concepts
- Dane preferencji
- Model nagrody
- Dopasowanie (Alignment)
- PPO (Optymalizacja polityki proksymalnej)
Use Cases
- Udoskonalanie chatbotów
- Moderacja treści
- Poprawa przestrzegania instrukcji