AI-justering
term_id: ai_alignment
Category: ethics_safety
Definition
AI-justering adresserer utfordringen med å gjøre kunstig intelligens robust nok til å gjøre det brukerne mener, snarere enn det de bokstavelig talt spesifiserer. Det involverer tekniske metoder for å sikre at systemets oppførsel er trygg, forutsigbar og i tråd med menneskelig etikk og hensikt.
Summary
Fagfeltet som fokuserer på å sikre at AI-systemer oppfører seg i samsvar med menneskelige verdier og intensjoner.
Key Concepts
- verdilæring
- fordelaktig atferd
- kontrollproblemet
- tolkbarhet
Use Cases
- Sikkerhetsforskning i store språkmodeller
- Utvikling av belønningsfunksjoner for RLHF
- Implementering av etiske retningslinjer