AI-alignement

term_id: ai_alignment

Category: ethics_safety

Definition

AI-alignement behandelt de uitdaging om kunstmatige intelligentiesystemen robuust te laten doen wat hun gebruikers bedoelen, in plaats van wat ze letterlijk specificeren. Het omvat technische methoden om ervoor te zorgen dat AI-systemen veilig en nuttig blijven, zelfs wanneer ze worden geconfronteerd met onverwachte situaties of ambiguïteiten.

Summary

Het studiegebied gericht op het waarborgen dat AI-systemen zich gedragen in overeenstemming met menselijke waarden en intenties.

Key Concepts

  • waardenleren
  • gunstig gedrag
  • controleprobleem
  • interpretabiliteit

Use Cases

  • Onderzoek naar veiligheid bij grote taalmodellen
  • Ontwikkeling van beloningsfuncties voor RLHF
  • Implementatie van ethische richtlijnen