Kritische Batchgröße
Kritische Batchgröße
Du möchtest das Training beschleunigen, indem du dem Modell mehr Beispiele gleichzeitig zeigst. Anfangs hilft das. Ab einem gewissen Punkt verarbeitest du jedoch deutlich mehr Daten, während die Zahl der Schritte bis zu einem bestimmten Ergebnis nur noch wenig sinkt. Wo endet der Nutzen der Gruppenvergrößerung?
Critical Batch Size ist eine charakteristische Batchgröße, oberhalb derer der Nutzen weiterer Vergrößerungen der Datengruppe pro Schritt nachlässt. Ein Batch bezeichnet die Beispiele oder Tokens — Textstücke —, aus denen wir gemeinsam eine Korrektur der Modellgewichte berechnen.
Das Mitteln über mehr Beispiele verringert die Zufälligkeit des Hinweises zur Verbesserung der Gewichte. Bei fester Datenmenge bedeutet ein größerer Batch aber weniger Korrekturen. Der Übergang von 100 auf 200 Beispiele kann viele Schritte sparen; eine weitere Verdopplung muss keinen proportionalen Gewinn ergeben. Das veranschaulicht den Kompromiss und gibt keine universellen Grenzwerte an.
McCandlish und Mitautoren, §2–3, modellieren diese Beziehung anhand der Gradient Noise Scale. Die Grenze hängt von der Aufgabe und der Trainingsphase ab. Eine schnellere Datenverarbeitung auf der Hardware muss kein ebenso effizientes Lernen pro gelesenem Token bedeuten.