Alignment

term_id: alignment

Category: ethics_safety

Definition

Alignment richt zich op het verzekeren dat AI-systemen doen wat mensen eigenlijk willen, in plaats van slechts wat ze letterlijk vragen. Het omvat technieken zoals Reinforcement Learning from Human Feedback (RLHF) om het gedrag van modellen af te stemmen.

Summary

Het proces waarbij wordt gewaarborgd dat de doelen en het gedrag van een AI-systeem overeenkomen met menselijke waarden en intenties.

Key Concepts

  • RLHF (Reinforcement Learning from Human Feedback)
  • Value loading (waarde-inladen)
  • Intent matching (intentieovereenstemming)
  • Reward modeling (beloningsmodellering)

Use Cases

  • Chatbots afstemmen op beleefdheid
  • Zorgen voor feitelijke nauwkeurigheid in samenvattingen
  • Voorkomen van jailbreak-exploits