Aliniere

term_id: alignment

Category: ethics_safety

Definition

Alinierea se concentrează pe asigurarea faptului că sistemele de IA fac ceea ce oamenii doresc cu adevărat, nu doar ceea ce li se cere literal. Implică tehnici precum Învățarea prin Întărire din Feedback Uman (RLHF) pentru a calibra răspunsurile modelelor, evitând interpretările eronate sau comportamentele nedorite care ar putea contrazice etica sau siguranța umană.

Summary

Procesul de asigurare a faptului că obiectivele și comportamentele unui sistem de IA corespund valorilor și intențiilor umane.

Key Concepts

  • RLHF (Învățare prin Întărire din Feedback Uman)
  • Încărcarea valorilor
  • Potrivirea intenției
  • Modelarea recompensei

Use Cases

  • Reglarea chatbot-urilor pentru politețe
  • Asigurarea acurateței factuale în rezumate
  • Prevenirea exploit-urilor de tip jailbreak