Uzgodnienie AI
term_id: ai_alignment
Category: ethics_safety
Definition
Uzgodnienie AI rozwiązuje wyzwanie polegające na tym, aby sztuczna inteligencja była niezawodnie zgodna z tym, czego użytkownicy naprawdę chcą, a nie tylko z tym, co dosłownie określili. Obejmuje techniczne metody zapewniające, że systemy te są bezpieczne i etyczne.
Summary
Dziedzina badań skupiająca się na zapewnieniu, że systemy AI zachowują się zgodnie z ludzkimi wartościami i intencjami.
Key Concepts
- uczenie wartości
- pożyteczne zachowanie
- problem kontroli
- wyjaśnialność
Use Cases
- Badania nad bezpieczeństwem dużych modeli językowych
- Tworzenie funkcji nagrody dla RLHF
- Wdrażanie wytycznych etycznych