Alignment
term_id: alignment
Category: ethics_safety
Definition
Alignment fokuserer på at sikre, at AI-systemer gør, hvad mennesker faktisk ønsker, frem for blot det, de bogstaveligt talt beder om. Det involverer teknikker som Reinforcement Learning from Human Feedback (RLHF) for at justere modellernes adfærd.
Summary
Processen med at sikre, at et AI-systems mål og adfærd stemmer overens med menneskelige værdier og hensigter.
Key Concepts
- RLHF
- Værdiladning
- Hensigtsmatchning
- Belønningmodellering
Use Cases
- Finjustering af chatbots for høflighed
- Sikring af faktuelt nøjagtighed i resuméer
- Forebyggelse af jailbreak-angreb