Arvonsuuntaus

term_id: alignment

Category: ethics_safety

Definition

Arvonsuuntaus keskittyy varmistamaan, että tekoälyjärjestelmät tekevät sen, mitä ihmiset todella haluavat, eikä vain sitä, mitä ne kirjaimellisesti pyytävät. Se sisältää tekniikoita, kuten vahvistusoppimista ihmispalautteella (RLHF), ohjatakseen mallien käyttäytymistä.

Summary

Prosessi, jossa varmistetaan, että tekoälyjärjestelmän tavoitteet ja käyttäytyminen vastaavat ihmisten arvoja ja aikomuksia.

Key Concepts

  • RLHF (Vahvistusoppiminen ihmispalautteella)
  • Arvojen lataaminen
  • Tarkoituksen vastaavuus
  • Palkintomallinnus

Use Cases

  • Chatbotien säätäminen kohteliaammaksi
  • Faktuaalisen tarkkuuden varmistaminen yhteenvedoissa
  • Jailbreak-hyökkäysten ehkäisy