AI igazítás

term_id: ai_alignment

Category: ethics_safety

Definition

Az AI igazítás a mesterséges intelligencia rendszerek robusztus működésének biztosítására irányuló kihívással foglalkozik, annak érdekében, hogy a rendszerek azt tegyék, amit a felhasználók szándékoznak, nem pedig azt, amit szó szerint megadnak. Technikai módszereket foglal magában a biztonság és az etikai összhang garantálására.

Summary

Az a tudományterület, amelynek célja, hogy biztosítsa az AI rendszerek emberi értékekkel és szándékokkal összhangban történő viselkedését.

Key Concepts

  • érték tanulás
  • hasznos viselkedés
  • kontroll probléma
  • magyarázhatóság

Use Cases

  • Biztonsági kutatás nagy nyelvi modellekben
  • Díjfunkciók fejlesztése az RLHF-hez
  • Etikai irányelvek implementálása