Zurück zum Archiv
#ai#llm#glossary#aigen

Experience Replay

Ein Modell hat gelernt, Kundenfragen an „Lieferung“ und „Rücksendungen“ weiterzuleiten. Jetzt trainierst du es weiter, damit es Reklamationen erkennt, etwa „Das Produkt kam beschädigt an“. Enthalten die nächsten Übungen nur Reklamationen, kann es bei der vertrauten Frage „Wo ist mein Paket?“ schlechter werden. Das vollständige alte Archiv ist nicht verfügbar. Könnte es zumindest einige gespeicherte Nachrichten erneut durchgehen?

Experience Replay (ER) bedeutet, einen Teil früherer Beispiele zu speichern und erneut zum Lernen zu verwenden. In einer einfachen Variante mischen wir Beispiele aus dem Speicher in eine Portion neuer Daten. Dieser Speicher heißt replay buffer: ein Behälter für Übungsdaten, kein Verzeichnis des gesamten Modellwissens. Dieses gemeinsame Training beschreiben Chaudhry et al., Continual Learning with Tiny Episodic Memories, §2, Algorithmus 1.

Gespeicherte indigoblaue und ockerfarbene Karten kehren aus einer kleinen Box in eine Reihe neuer roter Karten zurück: eine Metapher für Wiederholungen beim weiteren Lernen.

Was in die nächste Übung kommt

Bevor das Archiv verloren ging, speicherten wir vier Nachrichten zusammen mit den richtigen Abteilungen. Jetzt haben wir vier neue Reklamationen. Ohne Wiederholungen lernt das Modell anhand von vier neuen Nachrichten. Mit Wiederholungen übt es zusätzlich mit vier alten: Es erhält erneut das Signal, dass „Wo ist mein Paket?“ zur Lieferung gehört. In diesem kleinen Beispiel verwenden wir den gesamten Puffer; größere Puffer liefern gewöhnlich eine zufällig ausgewählte Portion.

Es reicht jedoch nicht, Speicherplätze zu zählen. Vier gespeicherte Lieferfragen enthalten kein einziges Beispiel für Rücksendungen. Ersetzen wir zwei davon durch „Wie schicke ich meinen Einkauf zurück?“ und „Ich möchte ein T-Shirt zurückgeben“, bleibt die Zahl der wiederholten Beispiele gleich, umfasst aber beide früheren Abteilungen. Das folgende Experiment zählt Beispiele in einer Datenportion; es sagt die Treffergenauigkeit des Modells nicht voraus.

Wiederholungen helfen nur mit verfügbaren Daten

Das Modell erhält Gelegenheit, frühere Antworten zu üben, aber keine Garantie, sämtliche Fähigkeiten zu behalten. Eine kleine Zufallsstichprobe kann eine seltene Kategorie vollständig auslassen; dieses Problem beobachteten die Forschenden bei sehr kleinen Puffern (§4.4 derselben Arbeit). Unsere Nachrichten sind ein eigenes Beispiel, kein Ergebnis dieser Experimente. Die Wirkung des Trainings muss anhand getrennter alter und neuer Nachrichten geprüft werden, die nicht zum Training verwendet wurden. Der Puffer belegt zudem Speicher und erfordert, ausgewählte Daten aufzubewahren.

In Spielen, beim Reinforcement Learning — dem Erlernen von Handlungen anhand von Belohnungen — speichert man eine Situation, eine Handlung, eine Belohnung und die nächste Situation. Die zufällige Auswahl solcher Einträge verringert die Abhängigkeit von unmittelbar aufeinanderfolgenden Ereignissen (Mnih et al., Human-level control through deep reinforcement learning, Methods, „Training algorithm for deep Q-networks“). Das sind andere Daten als eine Nachricht mit ihrer richtigen Abteilung; Atari-Ergebnisse sollten nicht unmittelbar auf LLMs übertragen werden.

  • Continual Learning bezeichnet das Ziel, weiterzulernen und frühere Fähigkeiten zu behalten; ER ist ein Weg dorthin.
  • Catastrophic Forgetting [Polski] beschreibt eine erhebliche Verschlechterung früherer Fähigkeiten, die Wiederholungen verringern können.
  • Fine-tuning ist das weitere Training eines Modells; replay verändert die Auswahl seiner Trainingsdaten. Alte Nachrichten lediglich in ein Gespräch einzufügen, ist keine solche Modellaktualisierung.

Text und Illustration wurden mit KI-Unterstützung erstellt. Nachrichten und Demonstration sind ein eigenes vereinfachtes Lernbeispiel; die Illustration ist eine Metapher, kein Schema der Modellarchitektur.