Apprendimento per Rinforzo dal Feedback Umano
term_id: rlhf
Category: training_techniques
Definition
L’Apprendimento per Rinforzo dal Feedback Umano (RLHF) è un metodo utilizzato per affinare i grandi modelli linguistici in modo che i loro output siano meglio allineati con i valori e le aspettative umane. Tipicamente coinvolge tre fasi…
Summary
RLHF è una tecnica che allinea i modelli di IA alle preferenze umane utilizzando il feedback umano per addestrare un modello di ricompensa per l’apprendimento per rinforzo.
Key Concepts
- Dati di Preferenza
- Modello di Ricompensa
- Allineamento
- PPO (Ottimizzazione della Politica Prossimale)
Use Cases
- Raffinamento dei chatbot
- Moderazione dei contenuti
- Miglioramento del rispetto delle istruzioni