Justering (Alignment)
term_id: alignment
Category: ethics_safety
Definition
Justering fokuserer på å sikre at AI-systemer gjør det menneskene faktisk ønsker, snarere enn bare det de bokstavelig talt ber om. Det involverer teknikker som Forsterket læring fra menneskelig tilbakemelding (RLHF) for å rette opp adferd.
Summary
Prosessen med å sikre at et AI-systems mål og atferd samsvarer med menneskelige verdier og intensjoner.
Key Concepts
- RLHF (Forsterket læring fra menneskelig tilbakemelding)
- Verdilasting
- Intensjonsmatching
- Belønningmodellering
Use Cases
- Tilpasning av chatbots for høflighet
- Sikre faktabasert nøyaktighet i sammendrag
- Forebygge «jailbreak»-utnyttelser