Igazítás

term_id: alignment

Category: ethics_safety

Definition

Az igazítás arra fókuszál, hogy az AI rendszerek azt tegyék, amit az emberek valójában akarnak, nem pedig csak azt, amit szó szerint kérnek. Magában foglal olyan technikákat, mint az Emberi Visszajelzésen alapuló Erősített Tanulás (RLHF) a modellek viselkedésének formálására.

Summary

A folyamat, amely biztosítja, hogy egy AI rendszer céljai és viselkedése összhangban legyenek az emberi értékekkel és szándékokkal.

Key Concepts

  • RLHF (Emberi Visszajelzésen alapuló Erősített Tanulás)
  • Értékbevitel
  • Szándékillesztés
  • Díjmeghatározás (Reward modeling)

Use Cases

  • Chatbotok udvariasabbá tétele
  • Ténybeli pontosság biztosítása összefoglalásoknál
  • Jailbreak exploitok megelőzése