AI-alignering
term_id: ai_alignment
Category: ethics_safety
Definition
AI-alignering adresserar utmaningen med att göra artificiella intelligenssystem robusta nog att göra vad användarna avser, snarare än vad de bokstavligen specificerar. Det innebär tekniska metoder för att säkerställa att systemets beteende är säkert och önskvärt.
Summary
Det forskningsfält som fokuserar på att säkerställa att AI-system beter sig i enlighet med mänskliga värderingar och intentioner.
Key Concepts
- värdeinlärning
- gynnande beteende
- kontrollproblemet
- tolkbarhet
Use Cases
- Säkerhetsforskning inom stora språkmodeller
- Utveckling av belöningsfunktioner för RLHF
- Implementering av etiska riktlinjer