Uzgodnienie

term_id: alignment

Category: ethics_safety

Definition

Uzgodnienie koncentruje się na zapewnieniu, że systemy AI robią to, czego ludzie naprawdę chcą, a nie tylko to, co dosłownie poprosili. Obejmuje techniki takie jak Uczenie Wzmocnione z Ludzką Opiną (RLHF) w celu dopasowania zachowań modelu do oczekiwań.

Summary

Proces zapewniający, że cele i zachowania systemu AI są zgodne z ludzkimi wartościami i intencjami.

Key Concepts

  • RLHF (Uczenie Wzmocnione z Ludzką Opiną)
  • Ładowanie wartości
  • Dopasowanie intencji
  • Modelowanie nagrody

Use Cases

  • Dostosowywanie chatbotów do uprzejmości
  • Zapewnianie faktograficznej poprawności streszczeń
  • Zapobieganie exploitom typu jailbreak