Quantisierungsfehler gleichen sich zwischen den Modellschichten teilweise aus
Du möchtest ein Sprachmodell auf deiner eigenen Grafikkarte ausführen, aber seine Gewichte benötigen zu viel Speicher. Eine Lösung ist die Quantisierung nach dem Training: Die im fertigen Modell gespeicherten Zahlen werden durch Werte aus einer kleineren Menge ersetzt. Das spart Speicher auf Kosten der Darstellungsgenauigkeit.
Diese Zahlen gehen jedoch bei jedem weiteren Antwortstück in die Berechnung ein. Das Modell sagt das nächste Token, also eine Texteinheit, anhand des bisherigen Textes und seiner Gewichte voraus. Nach der Quantisierung stehen ihm Näherungen dieser Gewichte zur Verfügung. Ein Fehler kann die Tokenwahl verändern. Die weitere Antwort entsteht dann mit einem anderen Verlauf.
Man könnte deshalb erwarten, dass Abweichungen beim Durchlaufen weiterer Schichten anwachsen. Das komprimierte Modell behält jedoch häufig eine brauchbare Qualität. Die bloße Information, dass jede Rundung klein ist, erklärt noch nicht, was mehrere Dutzend Operationen später mit ihren Folgen geschieht.
Im Modellinneren haben Fehler Richtungen. Die Abweichung eines aktuellen Blocks kann die aus früheren Berechnungen übernommene Abweichung teilweise ausgleichen. Dies untersucht der Preprint „Why Does Post-Training Quantization Work?“ aus dem Bereich Modellkompression und LLM-Inferenz, also der Ausführung nach dem Training. Die Autoren prüfen auch, was geschieht, wenn sie diesen Ausgleich gezielt entfernen.
Der Block verarbeitet eine bereits von früheren Schichten veränderte Eingabe
Ein Transformer speichert das Zwischenergebnis seiner Berechnungen als Vektor, also als geordnete Zahlenliste. Der Vektor beschreibt den bisher verarbeiteten Text und durchläuft weitere Blöcke. Dank einer Residualverbindung addiert ein Block sein eigenes Ergebnis zur erhaltenen Eingabe. Er gibt also eine Summe weiter: Eingabe plus berechnete Aktualisierung.
Vergleichen wir zwei Durchläufe für denselben Text: das Modell mit ursprünglichen Gewichten und seine quantisierte Version. Am Eingang eines ausgewählten Blocks unterscheiden sich ihre Vektoren bereits. Der Block berechnet auch zwei unterschiedliche Aktualisierungen, denn sowohl seine Gewichte als auch seine Eingabe unterscheiden sich. Die Aktualisierungsdifferenz umfasst beide Einflüsse; sie darf nicht ausschließlich mit einem neuen Rundungsfehler der Gewichte gleichgesetzt werden.
Nach der Addition ist die Ausgabedifferenz die Summe aus Eingabedifferenz und Aktualisierungsdifferenz. Das folgt unmittelbar aus der Residualverbindung. Haben beide Differenzen teilweise entgegengesetzte Richtungen, kann ihre Summe kleiner sein als der von der Eingabe übernommene Fehler. Das Modell berechnet diese Differenzen im normalen Betrieb nicht und vergleicht sich nicht mit einer genaueren Kopie. Diesen Vergleich führen die Forscher durch, indem sie beide Versionen nebeneinander ausführen.
Die gleiche Fehlergröße kann eine andere Summe ergeben
Nehmen wir ein didaktisches Beispiel mit Vektoren aus jeweils zwei Zahlen. Dies sind vorbereitete Zahlen, keine Messwerte aus der Arbeit. Das Vorzeichen jeder Koordinate zeigt, in welche Richtung das jeweilige Ergebnis vom Referenzwert abweicht.
| Phase eines Blocks | Ursprüngliche Gewichte | Nach Quantisierung | Differenz: quantisiert minus Original |
|---|---|---|---|
| Eingabe | (10, 10) | (13, 10) | (3, 0) |
| Vom Block berechnete Aktualisierung | (0, 2) | (-1, 3) | (-1, 1) |
| Ausgabe: Eingabe plus Aktualisierung | (10, 12) | (12, 13) | (2, 1) |
In der Studie ist die Eingabe der verborgene Zustand an der Blockgrenze, die Aktualisierung das durch die Residualverbindung addierte Ergebnis. Beide Spalten entsprechen Durchläufen desselben Modells vor und nach der Quantisierung. Die Eingabedifferenz (3, 0) und die Aktualisierungsdifferenz (-1, 1) ergeben zusammen (2, 1). Die erste Koordinate nähert sich dem Referenzergebnis, während in der zweiten eine neue Abweichung entsteht.
Die Abweichungsgröße berechnen wir als Summe der quadrierten Koordinaten. Vor dem Block beträgt sie 3² + 0² = 9, danach 2² + 1² = 5. Ein kleinerer Wert bedeutet hier eine kleinere Differenz zwischen den Durchläufen. Dies misst einen internen Fehler ohne direkte Umrechnung in den Anteil korrekter Antworten.
Ändern wir nun nur die Richtung der Aktualisierungsdifferenz. Wir ersetzen (-1, 1) durch (0, √2), wobei √2 die Quadratwurzel aus zwei bezeichnet. Beide Vektoren haben dieselbe Quadratsumme 2, aber der neue steht senkrecht auf der Eingabedifferenz. Nach der Addition erhalten wir (3, √2) mit der Quadratsumme 9 + 2 = 11. Wir haben die Komponente entfernt, die die erste Abweichung verringerte, und die Größe der addierten Differenz erhalten.
Diese letzte Operation entspricht dem Eingriff der Autoren: Sie entfernen aus der Aktualisierungsdifferenz die zum Eingabefehler parallele Komponente und stellen danach ihre ursprüngliche Länge wieder her. Im tatsächlichen Modell haben die Vektoren viele Koordinaten, und der Eingriff betrifft eine Reihe von Blöcken. Bei jedem Schritt wird die Aktualisierung anhand der bereits veränderten Eingabe neu berechnet. Unser einzelner Schritt lässt diese weiteren Berechnungen sowie Längenänderungen des Referenzvektors weg.
Das Entfernen des Ausgleichs vergrößert den Fehler bei unveränderten Gewichten
Im Hauptexperiment verwenden die Autoren das fertige Qwen3-32B und runden ausgewählte Gewichte auf ein Vierbitformat. Sie stimmen das Modell weder nachträglich ab noch wählen sie Rundungen anhand von Kalibrierungsdaten. Gewöhnliche Quantisierung senkt die mittlere Genauigkeit in sechs Antwortauswahltests gegenüber den ursprünglichen Gewichten um 0,43 Prozentpunkte. Die genauen Aufgaben und das Bewertungsverfahren stehen im Anhang unten.
Ein separates Experiment untersucht die Ursache des langsamen Fehlerwachstums. Auf Webtextabschnitten aus C4 wenden die Autoren den oben beschriebenen Eingriff an und behalten dabei dasselbe trainierte Modell und dieselben quantisierten Gewichte. Der abschließende relative Fehler des verborgenen Zustands wird 2,94-mal größer als bei gewöhnlicher Quantisierung. „Relativ“ bedeutet die Länge der Vektordifferenz geteilt durch die Länge des Referenzvektors. In beiden Vergleichen ist das nicht quantisierte Modell die Fehlerreferenz.
Dies ist ein diagnostischer Eingriff: Die Forscher verändern interne Berechnungen, um die Rolle der Fehlerrichtung zu prüfen. Das Ergebnis stützt die These, dass ein teilweiser Ausgleich der Differenzen ihr späteres Wachstum begrenzt. Es bedeutet keine nahezu dreifache Änderung der Antwortgenauigkeit. Der Eingriff benötigt zudem einen zusätzlichen Referenzdurchlauf und ist daher keine vorgeschlagene Technik für günstige Inferenz.
Bei der Analyse aufeinanderfolgender Gewichtsspeicherungen beobachten die Autoren, wie dieser Ausgleich während des Trainings zunimmt. Sie bestimmen aber nicht, welche Trainingseigenschaft ihn verursacht. Die Annahme, jedes weitere Modell lerne automatisch einen ebenso guten Fehlerausgleich, ginge über das Ergebnis der Arbeit hinaus.
Ausgabevektor und Tokenwahl sind zwei unterschiedliche Messungen
Der letzte Vektor gelangt zum LM Head, der Schicht, die eine numerische Bewertung für jedes Vokabulartoken berechnet. Jedes Token hat einen eigenen Gewichtsvektor. Seine Bewertung entsteht durch Multiplikation entsprechender Koordinaten und Addition der Ergebnisse. Der Einfluss einer Änderung des verborgenen Zustands hängt deshalb auch von ihrer Richtung relativ zu den Gewichten des jeweiligen Tokens ab.
In den untersuchten Modellen sind die Bewertungen hoch platzierter Tokens nach der Quantisierung stabiler als die niedriger platzierter Tokens. Die Autoren erklären dies anhand der Vektorgeometrie und prüfen theoretische Näherungen gegen Messwerte. Die Herleitung setzt jedoch eine gleichmäßig zufällige Rotationsrichtung des verborgenen Zustands voraus. Sie garantiert nichts für eine beliebige Richtung des tatsächlichen Fehlers.
Schon kleine Bewertungsänderungen können zwei ähnliche Kandidaten vertauschen. Stabile mittlere Qualität und identischer Antworttext sind unterschiedliche Anforderungen. Bei einer Anwendung, die einen konkreten Werkzeugaufruf erwartet, zählt auch die zweite.
Vor der Bereitstellung müssen vollständige generierte Antworten geprüft werden
Die wichtigste Einschränkung der Studie ergibt sich aus dem gemeinsamen Textverlauf. In den Tokenanalysen erhalten beide Modellversionen dieselben vorherigen Tokens. Das Experiment verfolgt nicht, wie die erste abweichende Auswahl eine lange, frei generierte Antwort verändert. Auch die geometrische Analyse beschreibt durchschnittliches Verhalten; sie schließt seltene große Abweichungen nicht aus.
Einzelheiten des Experiments
Quelle und Checkpoint. Yuxiang Chen, Michael Beyer, Jun Zhu und Jianfei Chen, „Why Does Post-Training Quantization Work?“, arXiv:2609.11716v1, erstmals eingereicht am 10. September 2026. Die Arbeit ist ein Preprint. Der Hauptvergleich verwendet den veröffentlichten trainierten Checkpoint Qwen3-32B, ein Modell mit 32 Milliarden Parametern. Es gibt weder eine Trainingsphase nach der Quantisierung noch eine Wahl des besten Checkpoints anhand ihrer Ergebnisse. Vergleiche mit zufälligen Gewichten und früheren Trainingsphasen sind separate diagnostische Analysen.
Gewichtsformat. Die Referenz ist BF16 [Polski], ein Gleitkommaformat mit sechzehn Bit. Die Variante W4 verwendet NVFP4 und RTN, also die Rundung auf den nächsten darstellbaren Wert. Die Quantisierung umfasst Projektionsmatrizen in Self-attention, dem Mechanismus des Informationsaustauschs zwischen Textpositionen, und in der MLP, dem Netz, das den Vektor jeder Position verarbeitet. Die Tokens zugewiesenen Eingabevektoren, Normalisierungsschichten, Zwischenergebnisse und der LM Head bleiben in der ursprünglichen Präzision. NVFP4 verbindet Vierbitwerte mit einer zusätzlichen Skala für jede Gruppe von 16 Elementen und einer Skala für die gesamte Matrix. Die Autoren simulieren die Rundung und rekonstruieren die Gewichte für die Berechnungen. Sie messen weder die Beschleunigung noch den Speicherbedarf einer Engine, die Operationen auf gepackten Vierbitgewichten ausführt.
Texte und Aggregation. Die Standard-Tokenanalyse umfasst je 64 zufällig ausgewählte Sequenzen mit 512 Vorhersagepositionen pro Datensatz: C4 (Webtexte), WikiText-103 (Wikipedia) und GSM8K (mathematische Aufgaben mit Referenzlösungen). Bei GSM8K sagt das Modell das nächste Token des vorgegebenen korrekten Textes voraus; das Ergebnis misst daher kein selbstständiges Lösen der Aufgaben. Statistiken werden zuerst über Positionen, dann über Eingaben gemittelt. Die Fehlerbalken der Tokenanalysen zeigen die Standardabweichung zwischen vollständigen Eingaben, nicht die Unsicherheit des Mittelwerts.
Eingriff. Das Ergebnis 2,94× stammt von Qwen3-32B auf C4 mit RTN NVFP4 und entferntem Ausgleich in den Blöcken 17–48. Vergleich ist gewöhnliches W4, Messgröße der abschließende relative Fehler des verborgenen Zustands (Abb. 3A, Abschnitt 3.3, Anhang E.7). Die Länge der Aktualisierungsdifferenz bleibt bei ihrer Änderung lokal erhalten. Nachfolgende Blöcke erhalten den veränderten Zustand; ihre Differenzen können daher bereits andere Längen haben als im Durchlauf ohne Eingriff. Die vollständige Studie umfasst auch das Umkehren der Richtung bei negativer Interaktion sowie Messungen von Änderungen der Token-Wahrscheinlichkeitsverteilung. Für diese Durchläufe werden Referenzberechnungen, quantisierte Berechnungen und zusätzliche Durchläufe mit Eingriffen benötigt. Die Veröffentlichung nennt keinen Gesamtaufwand in GPU-Stunden.
Filter. Bei der Berechnung der Fehlerkomponenten in Abb. 2 wurden die erste Sequenzposition und Trajektorien ausgeschlossen, bei denen der relative Längenunterschied der Zustände auf irgendeiner Tiefe 0,5 überschritt. Der zweite Filter entfernte 0,08% der Qwen3-32B-Positionen auf C4. Der Anhang zeigt auch Ergebnisse ohne diesen Filter. Diese Auswahl darf nicht auf die Antwortgenauigkeitstests übertragen werden. Die Analyse typischer Trajektorien ist keine Garantie für Extremfälle.
Antworttests. Der mittlere Rückgang um 0,43 Prozentpunkte betrifft Qwen3-32B, W4 gegenüber BF16, ohne Aufgabenbeispiele im Prompt und ohne Chatvorlage. Verwendet wurden die vollständigen Testdatensätze von ARC-Challenge, ARC-Easy und MMLU sowie die Validierungsdatensätze von HellaSwag, WinoGrande und TruthfulQA. Sie umfassen Wissensfragen, die Auswahl von Textfortsetzungen, die Bestimmung von Pronomenbezügen und die Auswahl wahrer Antworten. ARC und HellaSwag bewerten die Kandidatenwahrscheinlichkeit normalisiert nach Zeichenanzahl, MMLU die Antwortbuchstaben und WinoGrande das gemeinsame Satzende unter der Bedingung des Kandidaten; TruthfulQA nutzt MC1-Genauigkeit. Das ist eine separate Evaluation gegenüber der Analyse verborgener Zustände. Auf C4 verändert gewöhnliches W4 bei 10,7% der untersuchten Positionen das am höchsten bewertete Token trotz kleiner mittlerer Qualitätsänderungen (Anhang C.6).
Umfang zusätzlicher Prüfungen. Die Arbeit umfasst Qwen3-4B, 8B, 14B, 30B-A3B und 32B, OLMo3-7B und 32B, OLMoE-1B-7B, Gemma3-4B sowie Pythia-1.4B und 2.8B. Die Analyse des Fehlerwachstums vergleicht Qwen3-32B mit zehn zufälligen Initialisierungen; die Zufallsreferenz für die LM-Head-Geometrie nutzt drei. Außerdem wurden sechs Checkpoints von OLMo3-7B Stage-1 und Trainingsphasen von Pythia untersucht. Die Anhänge enthalten die Quantisierung nur der Aktivierungen, die gemeinsame Quantisierung von Gewichten und Aktivierungen sowie GPTQ und AWQ, Verfahren zur Wahl der Quantisierung anhand von Kalibrierungsdaten. Dies sind nicht die Einstellungen des Ergebnisses 2,94×. Beim Vergleich von GPTQ und AWQ wurden 64 C4-Kalibrierungseingaben und acht davon getrennte Evaluationseingaben verwendet; RTN benötigt keine Kalibrierung.
Yuxiang Chen, Michael Beyer, Jun Zhu, Jianfei Chen, Why Does Post-Training Quantization Work?, vollständiger Text v1. Mechanismus: Abschnitte 3–4; Einstellungen: Anhang D.3; Eingriffe: E.7; Einschränkungen: 5.4. Metadaten und Versionsverlauf, DOI: 10.48550/arXiv.2609.11716. Die Quelle ist unter CC BY 4.0 verfügbar. Der obige Text ist eine polnische Besprechung mit eigenem Zahlenbeispiel.
Meine Empfehlung bei der Wahl einer komprimierten Modellversion: Den Erfolg der gesamten Aufgabe mit repräsentativen Prompts messen, einschließlich langer Antworten und Werkzeugaufrufe. Der Vergleich von Gewichten allein oder der mittleren Genauigkeit kurzer Tests prüft nicht die Folgen auseinanderlaufender Generierungsverläufe. Die Korrektheit von Werkzeugaufrufen und abschließenden Antworten sollte bei identischem Generierungsverfahren separat verglichen werden.