Zarovnání (Alignment)

term_id: alignment

Category: ethics_safety

Definition

Zarovnání se zaměřuje na to, aby systémy AI dělaly to, co lidé skutečně chtějí, nikoliv jen to, co doslovně požadují. Zahrnuje techniky jako učení z posilování s lidskou zpětnou vazbou (RLHF) k ladění chování modelu.

Summary

Proces zajišťující, že cíle a chování systému AI odpovídají lidským hodnotám a úmyslům.

Key Concepts

  • RLHF (Učení z posilování s lidskou zpětnou vazbou)
  • Načítání hodnot
  • Shoda úmyslů
  • Modelování odměn

Use Cases

  • Ladění chatbotů pro zdvořilejší tón
  • Zajištění faktické přesnosti v shrnutích
  • Prevence zneužití bezpečnostních mezer (jailbreak)