Zarovnání (Alignment)
term_id: alignment
Category: ethics_safety
Definition
Zarovnání se zaměřuje na to, aby systémy AI dělaly to, co lidé skutečně chtějí, nikoliv jen to, co doslovně požadují. Zahrnuje techniky jako učení z posilování s lidskou zpětnou vazbou (RLHF) k ladění chování modelu.
Summary
Proces zajišťující, že cíle a chování systému AI odpovídají lidským hodnotám a úmyslům.
Key Concepts
- RLHF (Učení z posilování s lidskou zpětnou vazbou)
- Načítání hodnot
- Shoda úmyslů
- Modelování odměn
Use Cases
- Ladění chatbotů pro zdvořilejší tón
- Zajištění faktické přesnosti v shrnutích
- Prevence zneužití bezpečnostních mezer (jailbreak)