Gradientenakkumulation

term_id: gradient_accumulation

Category: training_techniques

Definition

Diese Optimierungsstrategie ermöglicht es, Deep-Learning-Modelle mit effektiven Batch-Größen zu trainieren, die größer sind als der verfügbare GPU-Speicher. Durch das Akkumulieren von Gradienten aus mehreren Mini-Batches und das anschließende Aktualisieren der Gewichte wird dies erreicht.

Summary

Gradientenakkumulation ist eine Technik, die größere Batch-Größen simuliert, indem Gradienten über mehrere Vorwärts-/Rückwärtsdurchläufe summiert werden, bevor die Gewichte aktualisiert werden.

Key Concepts

  • Simulation der Batch-Größe
  • Speicheroptimierung
  • Stochastischer Gradientenabstieg
  • Gewichtaktualisierung

Use Cases

  • Feinabstimmung großer Modelle
  • Training bei begrenztem VRAM
  • Stabilisierung der Verlustkonvergenz