Distilasi
term_id: distillation
Category: training_techniques
Definition
Proses ini melibatkan transfer pengetahuan dari jaringan saraf ‘guru’ yang kompleks dan berkinerja tinggi ke jaringan ‘siswa’ yang lebih sederhana dan efisien. Siswa belajar tidak hanya dari label keras tetapi juga dari probabilitas kelas yang diprediksi oleh guru, yang memberikan informasi lebih kaya daripada label biner saja.
Summary
Distilasi pengetahuan adalah teknik kompresi model di mana model siswa yang lebih kecil belajar meniru perilaku model guru yang lebih besar.
Key Concepts
- Arsitektur Guru-Siswa
- Target Lembut
- Kompresi Model
- Efisiensi Inferensi
Use Cases
- Menyebarkan model bahasa besar pada perangkat seluler
- Mengurangi latensi dalam aplikasi visi komputer waktu nyata
- Mengoptimalkan model pembelajaran mendalam untuk lingkungan komputasi tepi