Gradientenakkumulation
term_id: gradient_accumulation
Category: training_techniques
Definition
Diese Optimierungsstrategie ermöglicht es, Deep-Learning-Modelle mit effektiven Batch-Größen zu trainieren, die größer sind als der verfügbare GPU-Speicher. Durch das Akkumulieren von Gradienten aus mehreren Mini-Batches und das anschließende Aktualisieren der Gewichte wird dies erreicht.
Summary
Gradientenakkumulation ist eine Technik, die größere Batch-Größen simuliert, indem Gradienten über mehrere Vorwärts-/Rückwärtsdurchläufe summiert werden, bevor die Gewichte aktualisiert werden.
Key Concepts
- Simulation der Batch-Größe
- Speicheroptimierung
- Stochastischer Gradientenabstieg
- Gewichtaktualisierung
Use Cases
- Feinabstimmung großer Modelle
- Training bei begrenztem VRAM
- Stabilisierung der Verlustkonvergenz