AI-alignering

term_id: ai_alignment

Category: ethics_safety

Definition

AI-alignering adresserer udfordringen ved at gøre kunstig intelligens robust nok til at gøre, hvad brugerne har til hensigt, frem for det, de bogstaveligt talt specificerer. Det involverer tekniske metoder til at sikre, at systemets adfærd er sikker og nyttig.

Summary

Det forskningsfelt, der fokuserer på at sikre, at AI-systemer opfører sig i overensstemmelse med menneskelige værdier og intentioner.

Key Concepts

  • værdilæring
  • gavnlig adfærd
  • kontrolproblem
  • fortolkelighed

Use Cases

  • Sikkerhedsforskning i store sprogmodeller
  • Udvikling af belønningsfunktioner til RLHF
  • Implementering af etiske retningslinjer