Zurück zum Archiv
#ai#papers#aigen#llm#inference

Quantisierung nach dem Training

Du hast bereits ein trainiertes Modell, aber es benötigt zu viel Speicher, um auf dem gewählten Computer zu laufen. Ein großer Teil des Platzes entfällt auf die Zahlen, die seine Berechnungen steuern. Lassen sie sich mit geringerer Genauigkeit speichern, um das Modell zu verkleinern?

Post-training Quantization (PTQ) begrenzt die Präzision von Zahlen nach dem Abschluss des wesentlichen Trainings. Bei der Gewichtsvariante ersetzt es gelernte Werte durch Zahlen aus einer kleineren Menge, die mit weniger Bit gespeichert werden können.

In einem vereinfachten Format mit dem Schritt 0,1 wird das Gewicht 0,73 zu 0,7. Wir sparen Platz, fügen aber einen Fehler von −0,03 hinzu. Aufwendigere Methoden verwenden Datenproben zur Auswahl von Rundungen oder Skalen, um das Ergebnis weniger zu verschlechtern. GPTQ, §3, beschreibt eine solche Methode.

Weniger Bit bedeuten nicht automatisch einen proportional geringeren gesamten Speicherverbrauch oder eine schnellere Ausführung. Eine Engine muss das Format unterstützen; außerdem entstehen Kosten für Skalen und weitere Bestandteile. PTQ ist kein beliebiges erneutes Training des Modells. Den Einfluss der Fehler auf die Antwort behandelt der Artikel über die Weitergabe von Abweichungen zwischen Schichten.