Aliniere
term_id: alignment
Category: ethics_safety
Definition
Alinierea se concentrează pe asigurarea faptului că sistemele de IA fac ceea ce oamenii doresc cu adevărat, nu doar ceea ce li se cere literal. Implică tehnici precum Învățarea prin Întărire din Feedback Uman (RLHF) pentru a calibra răspunsurile modelelor, evitând interpretările eronate sau comportamentele nedorite care ar putea contrazice etica sau siguranța umană.
Summary
Procesul de asigurare a faptului că obiectivele și comportamentele unui sistem de IA corespund valorilor și intențiilor umane.
Key Concepts
- RLHF (Învățare prin Întărire din Feedback Uman)
- Încărcarea valorilor
- Potrivirea intenției
- Modelarea recompensei
Use Cases
- Reglarea chatbot-urilor pentru politețe
- Asigurarea acurateței factuale în rezumate
- Prevenirea exploit-urilor de tip jailbreak