AI-alignering

term_id: ai_alignment

Category: ethics_safety

Definition

AI-alignering adresserar utmaningen med att göra artificiella intelligenssystem robusta nog att göra vad användarna avser, snarare än vad de bokstavligen specificerar. Det innebär tekniska metoder för att säkerställa att systemets beteende är säkert och önskvärt.

Summary

Det forskningsfält som fokuserar på att säkerställa att AI-system beter sig i enlighet med mänskliga värderingar och intentioner.

Key Concepts

  • värdeinlärning
  • gynnande beteende
  • kontrollproblemet
  • tolkbarhet

Use Cases

  • Säkerhetsforskning inom stora språkmodeller
  • Utveckling av belöningsfunktioner för RLHF
  • Implementering av etiska riktlinjer