Alignment
term_id: alignment
Category: ethics_safety
Definition
Alignment zielt darauf ab, sicherzustellen, dass KI-Systeme genau das tun, was Menschen wirklich wollen, und nicht nur das, was sie wörtlich anfordern. Dazu gehören Techniken wie Reinforcement Learning from Human Feedback (RLHF), um das Verhalten der Modelle an menschliche Präferenzen anzupassen.
Summary
Der Prozess, sicherzustellen, dass die Ziele und Verhaltensweisen eines KI-Systems mit menschlichen Werten und Absichten übereinstimmen.
Key Concepts
- RLHF
- Value Loading (Werteladung)
- Intent Matching (Absichtsanpassung)
- Reward Modeling (Belohnungsmodellierung)
Use Cases
- Feinabstimmung von Chatbots für Höflichkeit
- Gewährleistung faktischer Genauigkeit bei Zusammenfassungen
- Verhinderung von Jailbreak-Angriffen