AI igazítás
term_id: ai_alignment
Category: ethics_safety
Definition
Az AI igazítás a mesterséges intelligencia rendszerek robusztus működésének biztosítására irányuló kihívással foglalkozik, annak érdekében, hogy a rendszerek azt tegyék, amit a felhasználók szándékoznak, nem pedig azt, amit szó szerint megadnak. Technikai módszereket foglal magában a biztonság és az etikai összhang garantálására.
Summary
Az a tudományterület, amelynek célja, hogy biztosítsa az AI rendszerek emberi értékekkel és szándékokkal összhangban történő viselkedését.
Key Concepts
- érték tanulás
- hasznos viselkedés
- kontroll probléma
- magyarázhatóság
Use Cases
- Biztonsági kutatás nagy nyelvi modellekben
- Díjfunkciók fejlesztése az RLHF-hez
- Etikai irányelvek implementálása