AI-alignement
term_id: ai_alignment
Category: ethics_safety
Definition
AI-alignement behandelt de uitdaging om kunstmatige intelligentiesystemen robuust te laten doen wat hun gebruikers bedoelen, in plaats van wat ze letterlijk specificeren. Het omvat technische methoden om ervoor te zorgen dat AI-systemen veilig en nuttig blijven, zelfs wanneer ze worden geconfronteerd met onverwachte situaties of ambiguïteiten.
Summary
Het studiegebied gericht op het waarborgen dat AI-systemen zich gedragen in overeenstemming met menselijke waarden en intenties.
Key Concepts
- waardenleren
- gunstig gedrag
- controleprobleem
- interpretabiliteit
Use Cases
- Onderzoek naar veiligheid bij grote taalmodellen
- Ontwikkeling van beloningsfuncties voor RLHF
- Implementatie van ethische richtlijnen