AI alignment
term_id: ai_alignment
Category: ethics_safety
Definition
AI alignment řeší výzvu zajistit, aby umělá inteligence robustně dělala to, co uživatelé zamýšlejí, nikoliv pouze to, co doslovně specifikovali. Zahrnuje technické metody, které zajišťují, že…
Summary
Obor studia zaměřený na zajištění toho, aby se systémy AI chovaly v souladu s lidskými hodnotami a úmysly.
Key Concepts
- učení hodnot
- prospěšné chování
- problém kontroly
- interpretovatelnost
Use Cases
- Výzkum bezpečnosti u velkých jazykových modelů
- Vývoj odměňovacích funkcí pro RLHF
- Implementace etických směrnic