Ihmispalautteeseen perustuva vahvistusoppiminen

term_id: rlhf

Category: training_techniques

Definition

Ihmispalautteeseen perustuva vahvistusoppiminen (RLHF) on menetelmä, jota käytetään suurten kielimallien hienosäätöön, jotta mallin tuotokset vastaavat paremmin ihmisten arvoja ja odotuksia. Se koostuu tyypillisesti kolmesta vaiheesta: supervoitu hienosäätö, palkkamallin koulutus ja RLHF-vaihe.

Summary

RLHF on tekniikka, joka sovittaa tekoälymallit ihmisten mieltymysten mukaisiksi käyttämällä ihmispalautetta vahvistusoppimisen palkkamallin kouluttamiseen.

Key Concepts

  • Mieltymysdata
  • Palkkamalli
  • Sovitus (Alignment)
  • PPO (Lähisekäpolitiikan optimointi)

Use Cases

  • Chatbot-hienosäätö
  • Sisällön moderointi
  • Ohjeiden noudattamisen parantaminen