Mekanisk fortolkelighed
term_id: mechanistic_interpretability
Category: basic_concepts
Definition
Mekanisk fortolkelighed fokuserer på reverse-engineering af neurale netværk for at forstå, hvordan de beregner specifikke funktioner på niveauet med individuelle neuroner, vægte og kredsløb. I stedet for at behandle…
Summary
En tilgang til at forstå AI-modeller ved at analysere deres interne komponenter og mekanismer frem for kun deres input-udgang-adfærd.
Key Concepts
- Neurale kredsløb
- Kausal analyse
- Visualisering af funktioner
- Modelgennemsigtighed
Use Cases
- Revision af modelsikkerhed
- Forståelse af evnen til ræsonnement
- Fejlfinding af uventet adfærd