Arvonsuuntaus
term_id: alignment
Category: ethics_safety
Definition
Arvonsuuntaus keskittyy varmistamaan, että tekoälyjärjestelmät tekevät sen, mitä ihmiset todella haluavat, eikä vain sitä, mitä ne kirjaimellisesti pyytävät. Se sisältää tekniikoita, kuten vahvistusoppimista ihmispalautteella (RLHF), ohjatakseen mallien käyttäytymistä.
Summary
Prosessi, jossa varmistetaan, että tekoälyjärjestelmän tavoitteet ja käyttäytyminen vastaavat ihmisten arvoja ja aikomuksia.
Key Concepts
- RLHF (Vahvistusoppiminen ihmispalautteella)
- Arvojen lataaminen
- Tarkoituksen vastaavuus
- Palkintomallinnus
Use Cases
- Chatbotien säätäminen kohteliaammaksi
- Faktuaalisen tarkkuuden varmistaminen yhteenvedoissa
- Jailbreak-hyökkäysten ehkäisy