tekoälyn yhdenmukaistus
term_id: ai_alignment
Category: ethics_safety
Definition
Tekoälyn yhdenmukaistus käsittelee haastetta saada tekoälyjärjestelmät toimimaan luotettavasti niin kuin käyttäjät tarkoittavat, eikä niinkuin ne kirjaimellisesti määräytyvät. Se sisältää teknisiä menetelmiä varmistamaan, että järjestelmän toiminta on hyödyllistä ja turvallista.
Summary
Tutkimusala, jonka tavoitteena on varmistaa, että tekoälyjärjestelmät käyttäytyvät ihmisten arvojen ja aikomusten mukaisesti.
Key Concepts
- arvojen oppiminen
- hyödyllinen käyttäytyminen
- kontrollointiongelma
- tulkittavuus
Use Cases
- Suurten kielimallien turvallisuustutkimus
- Palkkafunktioiden kehittäminen RLHF-menetelmään
- Eettisten ohjeistusten toteutus