Zurück zum Archiv

Skalierungsgesetze

Skalierungsgesetze

Du hast ein Budget für das Modelltraining. Du kannst ein größeres Modell bauen oder einem kleineren mehr Text zeigen. Jede Kombination vollständig zu prüfen wäre teuer. Du brauchst eine Möglichkeit, den Nutzen zusätzlicher Skalierung abzuschätzen, bevor du das gesamte Budget ausgibst.

Scaling Laws sind empirische Beziehungen zwischen Modellgröße, Datenmenge, Berechnungen und Trainingsergebnis. „Empirisch“ bedeutet, dass sie durch Messungen entdeckt wurden. Häufig beschreiben sie die Abnahme des Textvorhersagefehlers mit zunehmenden Ressourcen.

Forscher trainieren mehrere kleinere Modelle und passen eine Kurve an. Auf dieser Grundlage versuchen sie, das Ergebnis eines größeren Trainings vorherzusagen. Die Verdopplung der Parameterzahl, also der gelernten Zahlen im Modell, muss keine Verdopplung der Qualität bedeuten: Der Nutzen hängt auch von der Datenmenge ab. Kaplan und Mitautoren, §3–6, beschreiben solche Beziehungen; die Chinchilla-Arbeit untersucht die Budgetaufteilung zwischen Modell und Daten.

Es ist ein Planungswerkzeug, kein Gesetz, das garantiert, dass ein größeres Modell jede Aufgabe besser löst. Ein geringerer Textvorhersageverlust bedeutet nicht automatisch wahrere Antworten. Eine Änderung der Daten, Architektur oder des Trainingsziels kann neue Messungen erfordern.

Verbindungen

Können wir eine physikalische Theorie des Lernprozesses entwickeln, die das makroskopische Verhalten von Netzen vorhersagt? [Polski]