Distilasi

term_id: distillation

Category: training_techniques

Definition

Proses ini melibatkan transfer pengetahuan dari jaringan saraf ‘guru’ yang kompleks dan berkinerja tinggi ke jaringan ‘siswa’ yang lebih sederhana dan efisien. Siswa belajar tidak hanya dari label keras tetapi juga dari probabilitas kelas yang diprediksi oleh guru, yang memberikan informasi lebih kaya daripada label biner saja.

Summary

Distilasi pengetahuan adalah teknik kompresi model di mana model siswa yang lebih kecil belajar meniru perilaku model guru yang lebih besar.

Key Concepts

  • Arsitektur Guru-Siswa
  • Target Lembut
  • Kompresi Model
  • Efisiensi Inferensi

Use Cases

  • Menyebarkan model bahasa besar pada perangkat seluler
  • Mengurangi latensi dalam aplikasi visi komputer waktu nyata
  • Mengoptimalkan model pembelajaran mendalam untuk lingkungan komputasi tepi