Alignment

term_id: alignment

Category: ethics_safety

Definition

Alignment fokuserar på att säkerställa att AI-system gör vad människor faktiskt vill ha, snarare än bara vad de bokstavligen ber om. Det involverar tekniker som Reinforcement Learning from Human Feedback (RLHF) för att justera modellbeteende.

Summary

Processen att säkerställa att ett AI-systems mål och beteenden stämmer överens med mänskliga värderingar och intentioner.

Key Concepts

  • RLHF (Reinforcement Learning from Human Feedback)
  • Värdeladdning
  • Intentmatchning
  • Belöningsmodellering

Use Cases

  • Justering av chattbottar för artighet
  • Säkerställande av faktabaserad noggrannhet i sammanfattningar
  • Förhindrande av jailbreak-exploater