Uzgodnienie
term_id: alignment
Category: ethics_safety
Definition
Uzgodnienie koncentruje się na zapewnieniu, że systemy AI robią to, czego ludzie naprawdę chcą, a nie tylko to, co dosłownie poprosili. Obejmuje techniki takie jak Uczenie Wzmocnione z Ludzką Opiną (RLHF) w celu dopasowania zachowań modelu do oczekiwań.
Summary
Proces zapewniający, że cele i zachowania systemu AI są zgodne z ludzkimi wartościami i intencjami.
Key Concepts
- RLHF (Uczenie Wzmocnione z Ludzką Opiną)
- Ładowanie wartości
- Dopasowanie intencji
- Modelowanie nagrody
Use Cases
- Dostosowywanie chatbotów do uprzejmości
- Zapewnianie faktograficznej poprawności streszczeń
- Zapobieganie exploitom typu jailbreak