tekoälyn yhdenmukaistus

term_id: ai_alignment

Category: ethics_safety

Definition

Tekoälyn yhdenmukaistus käsittelee haastetta saada tekoälyjärjestelmät toimimaan luotettavasti niin kuin käyttäjät tarkoittavat, eikä niinkuin ne kirjaimellisesti määräytyvät. Se sisältää teknisiä menetelmiä varmistamaan, että järjestelmän toiminta on hyödyllistä ja turvallista.

Summary

Tutkimusala, jonka tavoitteena on varmistaa, että tekoälyjärjestelmät käyttäytyvät ihmisten arvojen ja aikomusten mukaisesti.

Key Concepts

  • arvojen oppiminen
  • hyödyllinen käyttäytyminen
  • kontrollointiongelma
  • tulkittavuus

Use Cases

  • Suurten kielimallien turvallisuustutkimus
  • Palkkafunktioiden kehittäminen RLHF-menetelmään
  • Eettisten ohjeistusten toteutus