AI-alignering
term_id: ai_alignment
Category: ethics_safety
Definition
AI-alignering adresserer udfordringen ved at gøre kunstig intelligens robust nok til at gøre, hvad brugerne har til hensigt, frem for det, de bogstaveligt talt specificerer. Det involverer tekniske metoder til at sikre, at systemets adfærd er sikker og nyttig.
Summary
Det forskningsfelt, der fokuserer på at sikre, at AI-systemer opfører sig i overensstemmelse med menneskelige værdier og intentioner.
Key Concepts
- værdilæring
- gavnlig adfærd
- kontrolproblem
- fortolkelighed
Use Cases
- Sikkerhedsforskning i store sprogmodeller
- Udvikling af belønningsfunktioner til RLHF
- Implementering af etiske retningslinjer