Mekanisk fortolkelighed

term_id: mechanistic_interpretability

Category: basic_concepts

Definition

Mekanisk fortolkelighed fokuserer på reverse-engineering af neurale netværk for at forstå, hvordan de beregner specifikke funktioner på niveauet med individuelle neuroner, vægte og kredsløb. I stedet for at behandle…

Summary

En tilgang til at forstå AI-modeller ved at analysere deres interne komponenter og mekanismer frem for kun deres input-udgang-adfærd.

Key Concepts

  • Neurale kredsløb
  • Kausal analyse
  • Visualisering af funktioner
  • Modelgennemsigtighed

Use Cases

  • Revision af modelsikkerhed
  • Forståelse af evnen til ræsonnement
  • Fejlfinding af uventet adfærd