Justering (Alignment)

term_id: alignment

Category: ethics_safety

Definition

Justering fokuserer på å sikre at AI-systemer gjør det menneskene faktisk ønsker, snarere enn bare det de bokstavelig talt ber om. Det involverer teknikker som Forsterket læring fra menneskelig tilbakemelding (RLHF) for å rette opp adferd.

Summary

Prosessen med å sikre at et AI-systems mål og atferd samsvarer med menneskelige verdier og intensjoner.

Key Concepts

  • RLHF (Forsterket læring fra menneskelig tilbakemelding)
  • Verdilasting
  • Intensjonsmatching
  • Belønningmodellering

Use Cases

  • Tilpasning av chatbots for høflighet
  • Sikre faktabasert nøyaktighet i sammendrag
  • Forebygge «jailbreak»-utnyttelser