Alignment

term_id: alignment

Category: ethics_safety

Definition

Alignment fokuserer på at sikre, at AI-systemer gør, hvad mennesker faktisk ønsker, frem for blot det, de bogstaveligt talt beder om. Det involverer teknikker som Reinforcement Learning from Human Feedback (RLHF) for at justere modellernes adfærd.

Summary

Processen med at sikre, at et AI-systems mål og adfærd stemmer overens med menneskelige værdier og hensigter.

Key Concepts

  • RLHF
  • Værdiladning
  • Hensigtsmatchning
  • Belønningmodellering

Use Cases

  • Finjustering af chatbots for høflighed
  • Sikring af faktuelt nøjagtighed i resuméer
  • Forebyggelse af jailbreak-angreb