AI-justering

term_id: ai_alignment

Category: ethics_safety

Definition

AI-justering adresserer utfordringen med å gjøre kunstig intelligens robust nok til å gjøre det brukerne mener, snarere enn det de bokstavelig talt spesifiserer. Det involverer tekniske metoder for å sikre at systemets oppførsel er trygg, forutsigbar og i tråd med menneskelig etikk og hensikt.

Summary

Fagfeltet som fokuserer på å sikre at AI-systemer oppfører seg i samsvar med menneskelige verdier og intensjoner.

Key Concepts

  • verdilæring
  • fordelaktig atferd
  • kontrollproblemet
  • tolkbarhet

Use Cases

  • Sikkerhetsforskning i store språkmodeller
  • Utvikling av belønningsfunksjoner for RLHF
  • Implementering av etiske retningslinjer