<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
<channel>
  <title>Paweł Dubiel Tech Blog</title>
  <link>https://paweldubiel.com</link>
  <atom:link href="https://paweldubiel.com/de/rss.xml" rel="self" type="application/rss+xml" />
  <description>A public digital garden about AI, software engineering, books, and learning.</description>
  <language>de</language>
  <lastBuildDate>Wed, 07 Oct 2026 00:00:00 GMT</lastBuildDate>
<item>
  <title>Sequence Packing</title>
  <link>https://paweldubiel.com/de/notes/42gq%E2%81%9D%20Sequence%20Packing</link>
  <guid>https://paweldubiel.com/de/notes/42gq%E2%81%9D%20Sequence%20Packing</guid>
  <pubDate>Wed, 07 Oct 2026 00:00:00 GMT</pubDate>
  <description>Du trainierst ein Modell, kurze Antworten an Kunden zu schreiben: „Vielen Dank“, „Nein“ und „Ja“. Nach der Aufteilung in Textstücke, also Tokens, haben die Beispiele hier vereinfachend 3, 2 und 2 Positionen, einschließli</description>
</item>
<item>
  <title>Reinforcement Learning</title>
  <link>https://paweldubiel.com/de/notes/42gk%E2%81%9D%20Reinforcement%20Learning</link>
  <guid>https://paweldubiel.com/de/notes/42gk%E2%81%9D%20Reinforcement%20Learning</guid>
  <pubDate>Mon, 05 Oct 2026 00:00:00 GMT</pubDate>
  <description>Du möchtest einem Programm beibringen, ein kleines Spiel zu gewinnen. An einer Weggabelung kann es Weg A wählen, sofort zwei Münzen sammeln und die zweite Runde ohne neue Münzen beenden. Weg B gibt in der ersten Runde ni</description>
</item>
<item>
  <title>Das Vorhersagen von Befehlsausgaben hilft beim späteren Training des Agenten</title>
  <link>https://paweldubiel.com/de/notes/42eo%E2%81%9D%20Przewidywanie%20wynik%C3%B3w%20polece%C5%84%20pomaga%20w%20p%C3%B3%C5%BAniejszym%20treningu%20agenta</link>
  <guid>https://paweldubiel.com/de/notes/42eo%E2%81%9D%20Przewidywanie%20wynik%C3%B3w%20polece%C5%84%20pomaga%20w%20p%C3%B3%C5%BAniejszym%20treningu%20agenta</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein Agent, der im Terminal arbeitet, versucht, ein Programm auszuführen. Er sendet einen Befehl, liest eine Fehlermeldung und wählt die nächste Aktion. Dabei muss er die Ausgabe mit dem vorherigen Befehl verknüpfen: erke</description>
</item>
<item>
  <title>Loss Masking</title>
  <link>https://paweldubiel.com/de/notes/42eo1%E2%81%9D%20Loss%20masking</link>
  <guid>https://paweldubiel.com/de/notes/42eo1%E2%81%9D%20Loss%20masking</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du trainierst einen Agenten anhand von Aufzeichnungen seiner Gespräche mit Werkzeugen. Die Aufzeichnung enthält seine Befehle und die Antworten der Werkzeuge. Du möchtest ihn für ausgewählte Abschnitte bewerten, ihm aber</description>
</item>
<item>
  <title>pass@k</title>
  <link>https://paweldubiel.com/de/notes/42eo2%E2%81%9D%20pass%40k</link>
  <guid>https://paweldubiel.com/de/notes/42eo2%E2%81%9D%20pass%40k</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein Modell hat zehn Programme erstellt, von denen eines die Tests bestanden hat. Bedeutet das eine hohe Erfolgsquote für eine einzelne Antwort? Du musst „beim ersten Versuch gelungen“ von „unter vielen Versuchen einen Er</description>
</item>
<item>
  <title>Continuous Batching</title>
  <link>https://paweldubiel.com/de/notes/42el%E2%81%9D%20Continuous%20Batching</link>
  <guid>https://paweldubiel.com/de/notes/42el%E2%81%9D%20Continuous%20Batching</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein Server erzeugt zwei Antworten gleichzeitig. Eine endet schnell, die andere ist lang. Wenn der nächste Nutzer warten muss, bis das gesamte Paar fertig ist, bleibt der frei gewordene Platz viele Schritte lang ungenutzt</description>
</item>
<item>
  <title>PagedAttention</title>
  <link>https://paweldubiel.com/de/notes/42ek%E2%81%9D%20PagedAttention</link>
  <guid>https://paweldubiel.com/de/notes/42ek%E2%81%9D%20PagedAttention</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein Server bearbeitet Gespräche unterschiedlicher Länge. Wenn er für jedes im Voraus einen großen zusammenhängenden Speicherbereich für die gesamte künftige Antwort reserviert, bleibt ein Teil des Platzes ungenutzt. Du m</description>
</item>
<item>
  <title>Prefix Caching</title>
  <link>https://paweldubiel.com/de/notes/42em%E2%81%9D%20Prefix%20Caching</link>
  <guid>https://paweldubiel.com/de/notes/42em%E2%81%9D%20Prefix%20Caching</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du stellst fünf Fragen zum selben langen Dokument. Jede Eingabe beginnt mit derselben Anweisung und dem Dokumenttext; erst am Ende steht die neue Frage. Den gleichen Anfang erneut zu berechnen würde Arbeit wiederholen. P</description>
</item>
<item>
  <title>Zeit bis zum ersten Token</title>
  <link>https://paweldubiel.com/de/notes/42en%E2%81%9D%20Time%20to%20First%20Token</link>
  <guid>https://paweldubiel.com/de/notes/42en%E2%81%9D%20Time%20to%20First%20Token</guid>
  <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du klickst auf „Senden“ und schaust auf einen leeren Chat. Für den Nutzerkomfort ist entscheidend, wann der Anfang der Antwort erscheint, auch wenn die gesamte Antwort deutlich länger braucht. Du benötigst eine Messung d</description>
</item>
<item>
  <title>Decode</title>
  <link>https://paweldubiel.com/de/notes/42eg%E2%81%9D%20Decode</link>
  <guid>https://paweldubiel.com/de/notes/42eg%E2%81%9D%20Decode</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das erste Fragment der Antwort ist bereits erschienen. Das nächste muss berücksichtigen, was gerade geschrieben wurde: Nach „Heute trinke ich Tee“ hat das Modell einen anderen Kontext als nach „Heute trinke ich Wasser“. </description>
</item>
<item>
  <title>FlashAttention</title>
  <link>https://paweldubiel.com/de/notes/42eh%E2%81%9D%20FlashAttention</link>
  <guid>https://paweldubiel.com/de/notes/42eh%E2%81%9D%20FlashAttention</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Attention vergleicht viele Paare von Textfragmenten. Wenn alle Zwischenergebnisse in den großen Speicher der Rechenkarte geschrieben werden, kann die Datenübertragung teuer werden. Du möchtest dieselbe Berechnung ausführ</description>
</item>
<item>
  <title>Prefill</title>
  <link>https://paweldubiel.com/de/notes/42ef%E2%81%9D%20Prefill</link>
  <guid>https://paweldubiel.com/de/notes/42ef%E2%81%9D%20Prefill</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du sendest eine lange Frage an den Chat und wartest auf das erste Wort. Bevor das Modell eine Antwort hinzufügt, muss es den bereits erhaltenen Inhalt verarbeiten. Diese anfängliche Phase kann viel Arbeit erfordern, beso</description>
</item>
<item>
  <title>Speculative Decoding</title>
  <link>https://paweldubiel.com/de/notes/42ei%E2%81%9D%20Speculative%20Decoding</link>
  <guid>https://paweldubiel.com/de/notes/42ei%E2%81%9D%20Speculative%20Decoding</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein großes Modell erzeugt korrekten Text, ist aber langsam. Ein kleineres Modell kann schnell mehrere weitere Stücke vorschlagen. Du möchtest seine Arbeit nutzen und dabei die Kontrolle des großen Modells über das endgül</description>
</item>
<item>
  <title>Beam Search</title>
  <link>https://paweldubiel.com/de/notes/42eb%E2%81%9D%20Beam%20Search</link>
  <guid>https://paweldubiel.com/de/notes/42eb%E2%81%9D%20Beam%20Search</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Bei der Auswahl des ersten Antwortfragments kannst du einen Weg zu früh verwerfen, der sich später als besser erwiesen hätte. Alle möglichen Folgen zu prüfen ist jedoch zu teuer. Du brauchst eine begrenzte Menge an Alter</description>
</item>
<item>
  <title>Greedy Decoding</title>
  <link>https://paweldubiel.com/de/notes/42ea%E2%81%9D%20Greedy%20Decoding</link>
  <guid>https://paweldubiel.com/de/notes/42ea%E2%81%9D%20Greedy%20Decoding</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell kann mehrere unterschiedliche Fragmente hinzufügen. Die einfachste Wahl besteht darin, immer das mit der höchsten Wahrscheinlichkeit zu nehmen. Das erspart die Betrachtung von Alternativen, aber führt der best</description>
</item>
<item>
  <title>Grouped-Query Attention</title>
  <link>https://paweldubiel.com/de/notes/42ed%E2%81%9D%20Grouped-Query%20Attention</link>
  <guid>https://paweldubiel.com/de/notes/42ed%E2%81%9D%20Grouped-Query%20Attention</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell liest früheren Text auf mehrere Arten parallel. Jede solche Berechnung ist ein Attention Kopf, also ein Aufmerksamkeitskopf. Du möchtest den Speicherbedarf dieser Köpfe verringern, aber die vollständige gemein</description>
</item>
<item>
  <title>Multi-Query Attention</title>
  <link>https://paweldubiel.com/de/notes/42ec%E2%81%9D%20Multi-Query%20Attention</link>
  <guid>https://paweldubiel.com/de/notes/42ec%E2%81%9D%20Multi-Query%20Attention</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell verbindet das aktuelle Textfragment über mehrere parallele Berechnungen mit dem früheren Gespräch. Solche Berechnungen heißen Attention Köpfe, also Aufmerksamkeitsköpfe. Wenn jeder Kopf seine eigenen Beschreib</description>
</item>
<item>
  <title>Rotary Position Embedding</title>
  <link>https://paweldubiel.com/de/notes/42ee%E2%81%9D%20Rotary%20Position%20Embedding</link>
  <guid>https://paweldubiel.com/de/notes/42ee%E2%81%9D%20Rotary%20Position%20Embedding</guid>
  <pubDate>Fri, 18 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell vergleicht Textfragmente, muss aber auch wissen, wie weit sie voneinander entfernt liegen. „Gestern“ neben einem Verb kann eine andere Rolle spielen als dasselbe Wort in einem entfernten Zitat. Wie lässt sich </description>
</item>
<item>
  <title>KL-Divergenz</title>
  <link>https://paweldubiel.com/de/notes/42dw%E2%81%9D%20KL%20Divergence</link>
  <guid>https://paweldubiel.com/de/notes/42dw%E2%81%9D%20KL%20Divergence</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Zwei Modelle verteilen die Wahrscheinlichkeiten unterschiedlich auf dieselben Antworten. Eines setzt 90% auf A und 10% auf B, das andere gibt beiden 50% . Du möchtest messen, wie gut das zweite die Vorhersagen des ersten</description>
</item>
<item>
  <title>KV-Cache</title>
  <link>https://paweldubiel.com/de/notes/42dy%E2%81%9D%20KV%20Cache</link>
  <guid>https://paweldubiel.com/de/notes/42dy%E2%81%9D%20KV%20Cache</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell ergänzt die Antwort Stück für Stück. Viele Informationen über den früheren Text hat es bereits berechnet; sie in jedem Schritt von Grund auf neu zu berechnen würde Arbeit wiederholen. Du möchtest die weiterhin</description>
</item>
<item>
  <title>Top-k-Sampling</title>
  <link>https://paweldubiel.com/de/notes/42du%E2%81%9D%20Top-k%20Sampling</link>
  <guid>https://paweldubiel.com/de/notes/42du%E2%81%9D%20Top-k%20Sampling</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Bei der zufälligen Auswahl des nächsten Fragments lässt das Modell viele sehr unwahrscheinliche Möglichkeiten zu. Du möchtest etwas Vielfalt behalten, aber den fernen Rand der Kandidaten entfernen. Du kannst nur eine fes</description>
</item>
<item>
  <title>Top-p-Sampling</title>
  <link>https://paweldubiel.com/de/notes/42dv%E2%81%9D%20Top-p%20Sampling</link>
  <guid>https://paweldubiel.com/de/notes/42dv%E2%81%9D%20Top-p%20Sampling</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Manchmal hat das Modell einen klaren Spitzenreiter, manchmal viele ähnlich bewertete Fortsetzungen. Stets fünf Kandidaten zuzulassen berücksichtigt diesen Unterschied nicht. Du möchtest die Gruppengröße danach wählen, wo</description>
</item>
<item>
  <title>Wissensdestillation</title>
  <link>https://paweldubiel.com/de/notes/42dx%E2%81%9D%20Knowledge%20Distillation</link>
  <guid>https://paweldubiel.com/de/notes/42dx%E2%81%9D%20Knowledge%20Distillation</guid>
  <pubDate>Wed, 16 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein großes Modell löst die Aufgabe gut, ist aber für den täglichen Einsatz zu teuer. Ein kleineres Modell könnte versuchen, sein Verhalten nachzubilden. Es braucht jedoch Beispiele oder Bewertungen, die mehr zeigen als n</description>
</item>
<item>
  <title>Kreuzentropie</title>
  <link>https://paweldubiel.com/de/notes/42do%E2%81%9D%20Cross-entropy</link>
  <guid>https://paweldubiel.com/de/notes/42do%E2%81%9D%20Cross-entropy</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Zwei Modelle nennen dasselbe Wort als beste Fortsetzung, aber das erste gibt ihm 80% Wahrscheinlichkeit, das zweite nur 20% . Den Gewinner allein zu prüfen übersieht diesen Unterschied. Beim Lernen brauchen wir eine Bewe</description>
</item>
<item>
  <title>LoRA</title>
  <link>https://paweldubiel.com/de/notes/42ds%E2%81%9D%20LoRA</link>
  <guid>https://paweldubiel.com/de/notes/42ds%E2%81%9D%20LoRA</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du hast ein großes Modell und möchtest es an den Stil deiner Dokumente anpassen. Alle seine Gewichte zu trainieren — Zahlen, die die Berechnungen steuern — erfordert viel Speicher. Lässt sich nur eine kleinere Korrektur </description>
</item>
<item>
  <title>Maskierte Sprachmodellierung</title>
  <link>https://paweldubiel.com/de/notes/42dq%E2%81%9D%20Masked%20Language%20Modeling</link>
  <guid>https://paweldubiel.com/de/notes/42dq%E2%81%9D%20Masked%20Language%20Modeling</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du möchtest ein Modell trainieren, das gesamte Satzumfeld zu nutzen. Du verdeckst ein Fragment in „Ala hat MASK “ oder „Ala MASK eine Katze“ und bittest um die Wiederherstellung des Originals. Informationen auf beiden Se</description>
</item>
<item>
  <title>Perplexität</title>
  <link>https://paweldubiel.com/de/notes/42dp%E2%81%9D%20Perplexity</link>
  <guid>https://paweldubiel.com/de/notes/42dp%E2%81%9D%20Perplexity</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du vergleichst zwei Modelle anhand desselben Textes. Du möchtest wissen, welches seine aufeinanderfolgenden Fragmente besser vorhersagt, und nicht nur, welches mehr einzelne Gewinner erraten hat. Du brauchst eine Zahl, d</description>
</item>
<item>
  <title>Temperatur</title>
  <link>https://paweldubiel.com/de/notes/42dr%E2%81%9D%20Temperature</link>
  <guid>https://paweldubiel.com/de/notes/42dr%E2%81%9D%20Temperature</guid>
  <pubDate>Tue, 15 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell wählt gewöhnlich ähnliche Fortsetzungen, und du möchtest die Vielfalt der Zufallsauswahl steuern. Du veränderst weder sein Wissen noch seine Gewichte. Du veränderst nur, wie stark der Vorsprung der höchstbewer</description>
</item>
<item>
  <title>Autoregressive Sprachmodellierung</title>
  <link>https://paweldubiel.com/de/notes/42dj%E2%81%9D%20Autoregressive%20Language%20Modeling</link>
  <guid>https://paweldubiel.com/de/notes/42dj%E2%81%9D%20Autoregressive%20Language%20Modeling</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du beginnst den Satz „Heute trinke ich …“. Nach dem Ergänzen von „Tee“ unterscheiden sich die Möglichkeiten der Fortsetzung von denen nach „Wasser“. Das Modell muss den bereits gewählten Text bei jedem weiteren Schritt b</description>
</item>
<item>
  <title>Byte Pair Encoding</title>
  <link>https://paweldubiel.com/de/notes/42dl%E2%81%9D%20Byte%20Pair%20Encoding</link>
  <guid>https://paweldubiel.com/de/notes/42dl%E2%81%9D%20Byte%20Pair%20Encoding</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein Wörterbuch mit jedem möglichen Wort wäre riesig, und dennoch würden ständig neue Namen fehlen. Ein Wörterbuch nur mit Zeichen ist klein, verwandelt den Text aber in eine sehr lange Folge. Du brauchst einen Kompromiss</description>
</item>
<item>
  <title>Fine-Tuning</title>
  <link>https://paweldubiel.com/de/notes/42dn%E2%81%9D%20Fine-tuning</link>
  <guid>https://paweldubiel.com/de/notes/42dn%E2%81%9D%20Fine-tuning</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Ein trainiertes Modell kann Sprache verarbeiten, aber du möchtest, dass es Unternehmensnachrichten als „Rückgabe“, „Lieferung“ oder „Zahlung“ klassifiziert. Die allgemeine Fähigkeit ergibt noch nicht die erwartete Arbeit</description>
</item>
<item>
  <title>Pre-Training</title>
  <link>https://paweldubiel.com/de/notes/42dm%E2%81%9D%20Pre-training</link>
  <guid>https://paweldubiel.com/de/notes/42dm%E2%81%9D%20Pre-training</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du möchtest, dass ein Modell Zusammenhänge in der Sprache erkennt, bevor du es an eine konkrete Arbeit anpasst, etwa das Klassifizieren von Kundennachrichten. Antworten für den gesamten Text von Hand vorzubereiten wäre n</description>
</item>
<item>
  <title>Softmax</title>
  <link>https://paweldubiel.com/de/notes/42dk%E2%81%9D%20Softmax</link>
  <guid>https://paweldubiel.com/de/notes/42dk%E2%81%9D%20Softmax</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell hat drei mögliche Satzfortsetzungen mit den Zahlen 2 , 1 und 0 bewertet. Du möchtest die Antwort nach ihren Wahrscheinlichkeiten ziehen. Rohe Bewertungen sind keine Wahrscheinlichkeiten: Sie können negativ sei</description>
</item>
<item>
  <title>Cross-Attention</title>
  <link>https://paweldubiel.com/de/notes/42dd%E2%81%9D%20Cross-attention</link>
  <guid>https://paweldubiel.com/de/notes/42dd%E2%81%9D%20Cross-attention</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Beim Übersetzen hat das Modell zwei unterschiedliche Texte: das Original und die erst entstehende Antwort. Wenn es das nächste Wort der Übersetzung ergänzt, braucht es Informationen aus dem Original. Allein das Mischen d</description>
</item>
<item>
  <title>Kausale Maskierung</title>
  <link>https://paweldubiel.com/de/notes/42dc%E2%81%9D%20Causal%20Masking</link>
  <guid>https://paweldubiel.com/de/notes/42dc%E2%81%9D%20Causal%20Masking</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du trainierst ein Modell, „eine Katze“ nach „Ala hat“ hinzuzufügen. Im fertigen Beispiel existiert „eine Katze“ bereits. Könnte das Modell bei der Vorhersage darauf zugreifen, wäre die Aufgabe scheinbar leicht, würde abe</description>
</item>
<item>
  <title>Layer-Normalisierung</title>
  <link>https://paweldubiel.com/de/notes/42df%E2%81%9D%20Layer%20Normalization</link>
  <guid>https://paweldubiel.com/de/notes/42df%E2%81%9D%20Layer%20Normalization</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Die nächste Schicht erhält die Beschreibung eines Fragments mit den Zahlen 2, 4 und eines anderen mit 20, 40 . Die Signalgröße kann stark variieren. Du möchtest die Berechnungen erleichtern, indem du die Zahlen innerhalb</description>
</item>
<item>
  <title>Positionsweises Feed-Forward-Netz</title>
  <link>https://paweldubiel.com/de/notes/42de%E2%81%9D%20Position-wise%20Feed-Forward%20Network</link>
  <guid>https://paweldubiel.com/de/notes/42de%E2%81%9D%20Position-wise%20Feed-Forward%20Network</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell hat für ein Fragment Informationen aus dem restlichen Satz gesammelt. Jetzt muss diese gesammelte Beschreibung verarbeitet werden: Merkmale verbinden und eine neue Repräsentation berechnen. Andere Positionen e</description>
</item>
<item>
  <title>Token-Embedding</title>
  <link>https://paweldubiel.com/de/notes/42db%E2%81%9D%20Token%20Embedding</link>
  <guid>https://paweldubiel.com/de/notes/42db%E2%81%9D%20Token%20Embedding</guid>
  <pubDate>Mon, 14 Sep 2026 00:00:00 GMT</pubDate>
  <description>Der Computer erhält eine Zahl, die ein Textfragment bezeichnet. Die Zahl 17 allein sagt ihm weder, was dieses Fragment ist, noch wie es mit anderen zusammenhängt. Er braucht eine nützliche numerische Beschreibung, die er</description>
</item>
<item>
  <title>Quantisierungsfehler gleichen sich zwischen den Modellschichten teilweise aus</title>
  <link>https://paweldubiel.com/de/notes/42da%E2%81%9D%20B%C5%82%C4%99dy%20kwantyzacji%20cz%C4%99%C5%9Bciowo%20znosz%C4%85%20si%C4%99%20mi%C4%99dzy%20warstwami%20modelu</link>
  <guid>https://paweldubiel.com/de/notes/42da%E2%81%9D%20B%C5%82%C4%99dy%20kwantyzacji%20cz%C4%99%C5%9Bciowo%20znosz%C4%85%20si%C4%99%20mi%C4%99dzy%20warstwami%20modelu</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du möchtest ein Sprachmodell auf deiner eigenen Grafikkarte ausführen, aber seine Gewichte benötigen zu viel Speicher. Eine Lösung ist die Quantisierung nach dem Training: Die im fertigen Modell gespeicherten Zahlen werd</description>
</item>
<item>
  <title>Quantisierung nach dem Training</title>
  <link>https://paweldubiel.com/de/notes/42da1%E2%81%9D%20Post-training%20quantization</link>
  <guid>https://paweldubiel.com/de/notes/42da1%E2%81%9D%20Post-training%20quantization</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du hast bereits ein trainiertes Modell, aber es benötigt zu viel Speicher, um auf dem gewählten Computer zu laufen. Ein großer Teil des Platzes entfällt auf die Zahlen, die seine Berechnungen steuern. Lassen sie sich mit</description>
</item>
<item>
  <title>Residualverbindung</title>
  <link>https://paweldubiel.com/de/notes/42da2%E2%81%9D%20Residual%20connection</link>
  <guid>https://paweldubiel.com/de/notes/42da2%E2%81%9D%20Residual%20connection</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell verarbeitet die Textbeschreibung durch viele Schichten. Müsste jede Schicht die gesamte Information von Grund auf neu aufbauen, könnte das ihre Weitergabe leicht erschweren. Hilfreich ist, die Eingabe zu bewah</description>
</item>
<item>
  <title>LM Head</title>
  <link>https://paweldubiel.com/de/notes/42da3%E2%81%9D%20LM%20head</link>
  <guid>https://paweldubiel.com/de/notes/42da3%E2%81%9D%20LM%20head</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell hat „Heute trinke ich“ verarbeitet und besitzt eine interne Beschreibung dieses Inhalts als Zahlenliste. Der Nutzer wartet jedoch auf Text. Wir brauchen den Übergang von der im Modell verborgenen Beschreibung </description>
</item>
<item>
  <title>Multi-Head Attention</title>
  <link>https://paweldubiel.com/de/notes/42cy%E2%81%9D%20Multi-Head%20Attention</link>
  <guid>https://paweldubiel.com/de/notes/42cy%E2%81%9D%20Multi-Head%20Attention</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Eine einzige Zusammenstellung von Informationen kann verschiedene Beziehungen im Satz zu stark vermischen. Beim Übersetzen können zugleich Verbindungen zwischen Personen, Zeit und grammatischer Form nützlich sein. Wir mö</description>
</item>
<item>
  <title>Positionskodierung</title>
  <link>https://paweldubiel.com/de/notes/42cz%E2%81%9D%20Positional%20Encoding</link>
  <guid>https://paweldubiel.com/de/notes/42cz%E2%81%9D%20Positional%20Encoding</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du liest die Sätze „BMW hat Volvo überholt“ und „Volvo hat BMW überholt“. Sie enthalten genau dieselben Wörter, aber die Änderung der Reihenfolge vertauscht die Rollen der Autos. Wenn der Modellmechanismus nur Wortbeschr</description>
</item>
<item>
  <title>Scaled Dot-Product Attention</title>
  <link>https://paweldubiel.com/de/notes/42cx%E2%81%9D%20Scaled%20Dot-Product%20Attention</link>
  <guid>https://paweldubiel.com/de/notes/42cx%E2%81%9D%20Scaled%20Dot-Product%20Attention</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Das Modell soll Informationen aus mehreren Satzfragmenten verbinden. Ein Fragment ist nützlicher, ein anderes weniger. Es braucht eine konkrete Methode zur Berechnung ihrer Anteile und zur anschließenden Zusammenstellung</description>
</item>
<item>
  <title>Self-Attention</title>
  <link>https://paweldubiel.com/de/notes/42cw%E2%81%9D%20Self-attention</link>
  <guid>https://paweldubiel.com/de/notes/42cw%E2%81%9D%20Self-attention</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Im Satz „Anna legte das Buch weg, weil es schwer war“ erklärt das Wort „war“ allein wenig. Es muss mit früheren Fragmenten verbunden werden. Ein Modell zur Textverarbeitung braucht eine Methode, damit die Beschreibung ei</description>
</item>
<item>
  <title>Transformer</title>
  <link>https://paweldubiel.com/de/notes/42cv%E2%81%9D%20Transformer</link>
  <guid>https://paweldubiel.com/de/notes/42cv%E2%81%9D%20Transformer</guid>
  <pubDate>Sun, 13 Sep 2026 00:00:00 GMT</pubDate>
  <description>Du möchtest den Satz „Der Zug kommt morgen an“ übersetzen. Jedes Wort einzeln zu übersetzen genügt nicht: Die richtige Form hängt von anderen Wörtern und ihrer Reihenfolge ab. Das Modell braucht eine Methode zum Verbinde</description>
</item>
<item>
  <title>Gleiche Rankingqualität, andere Entscheidungen nach einer Änderung der Reihenfolge</title>
  <link>https://paweldubiel.com/de/notes/42be%E2%81%9D%20Ten%20sam%20ranking%20daje%20inne%20decyzje%20po%20zmianie%20kolejno%C5%9Bci</link>
  <guid>https://paweldubiel.com/de/notes/42be%E2%81%9D%20Ten%20sam%20ranking%20daje%20inne%20decyzje%20po%20zmianie%20kolejno%C5%9Bci</guid>
  <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
  <description>Ein System, das Fragen anhand von Dokumenten beantwortet, arbeitet häufig in vier Schritten. Eine Suchmaschine findet Kandidaten, ein Scorer weist jedem eine Zahl für seine Nützlichkeit zu, ein Schwellenwert verwirft zu </description>
</item>
<item>
  <title>Batched Pointwise Scoring</title>
  <link>https://paweldubiel.com/de/notes/42be1%E2%81%9D%20Batched%20pointwise%20scoring</link>
  <guid>https://paweldubiel.com/de/notes/42be1%E2%81%9D%20Batched%20pointwise%20scoring</guid>
  <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
  <description>Du hast eine Frage und drei gefundene Dokumente. Du möchtest jedem einen Nützlichkeitswert geben, aber drei getrennte Modellaufrufe wiederholen dieselbe Anweisung und Frage. Du kannst alle drei zusammen zeigen und um dre</description>
</item>
<item>
  <title>nDCG@10</title>
  <link>https://paweldubiel.com/de/notes/42be2%E2%81%9D%20nDCG%20at%2010</link>
  <guid>https://paweldubiel.com/de/notes/42be2%E2%81%9D%20nDCG%20at%2010</guid>
  <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
  <description>Eine Suchmaschine liefert zehn Ergebnisse. Gute Dokumente können in der Liste enthalten sein, aber wenn das nützlichste erst an zehnter Stelle steht, erreicht der Leser es möglicherweise nicht. Du brauchst eine Bewertung</description>
</item>
</channel>
</rss>