Interpretabilitas Mekanistik
term_id: mechanistic_interpretability
Category: basic_concepts
Definition
Interpretabilitas mekanistik berfokus pada rekayasa balik jaringan saraf untuk memahami bagaimana mereka menghitung fungsi tertentu pada tingkat neuron individu, bobot, dan sirkuit. Alih-alih memperlakukan…
Summary
Pendekatan untuk memahami model AI dengan menganalisis komponen internal dan mekanismenya, bukan hanya perilaku input-outputnya.
Key Concepts
- Sirkuit Saraf
- Analisis Kausal
- Visualisasi Fitur
- Transparansi Model
Use Cases
- Audit keamanan model
- Memahami kemampuan penalaran
- Men-debug perilaku tak terduga