AI alignment

term_id: ai_alignment

Category: ethics_safety

Definition

AI alignment řeší výzvu zajistit, aby umělá inteligence robustně dělala to, co uživatelé zamýšlejí, nikoliv pouze to, co doslovně specifikovali. Zahrnuje technické metody, které zajišťují, že…

Summary

Obor studia zaměřený na zajištění toho, aby se systémy AI chovaly v souladu s lidskými hodnotami a úmysly.

Key Concepts

  • učení hodnot
  • prospěšné chování
  • problém kontroly
  • interpretovatelnost

Use Cases

  • Výzkum bezpečnosti u velkých jazykových modelů
  • Vývoj odměňovacích funkcí pro RLHF
  • Implementace etických směrnic