Alignment
term_id: alignment
Category: ethics_safety
Definition
Alignment fokuserar på att säkerställa att AI-system gör vad människor faktiskt vill ha, snarare än bara vad de bokstavligen ber om. Det involverar tekniker som Reinforcement Learning from Human Feedback (RLHF) för att justera modellbeteende.
Summary
Processen att säkerställa att ett AI-systems mål och beteenden stämmer överens med mänskliga värderingar och intentioner.
Key Concepts
- RLHF (Reinforcement Learning from Human Feedback)
- Värdeladdning
- Intentmatchning
- Belöningsmodellering
Use Cases
- Justering av chattbottar för artighet
- Säkerställande av faktabaserad noggrannhet i sammanfattningar
- Förhindrande av jailbreak-exploater