· Daniel Schleipfer · KI · 7 Min. Lesezeit
Warum eine Antwort langsamer entsteht, als die GPU erlaubt
Bei jedem Token liest die GPU die kompletten Modellgewichte neu, nur um ein einziges Token zu berechnen. Speculative Decoding lässt ein kleines Modell vorausraten und spart genau diese Wartezeit.

Was ist Speculative Decoding?
Ein Verfahren, bei dem ein kleines Draft-Modell mehrere Tokens vorschlägt und das große Zielmodell sie in einem Durchlauf prüft, statt jedes Token einzeln selbst zu schreiben. Richtige Vorschläge werden übernommen, der erste falsche wird korrigiert.
Ein Modell schreibt seine Antwort Token für Token. Für jedes davon liest die GPU sämtliche Modellgewichte neu, allein für dieses eine Token. Dieses Lesen kostet mehr Zeit als die Rechnung selbst. Es prägt die langsamere der beiden Phasen einer Anfrage. Ein Großteil der Rechenkapazität bleibt dabei ungenutzt.
Ein kleines Modell rät vor, das große prüft nach
Dieser Begriff sitzt bei "Efficiency" in der Gruppe "Die Maschine".
Die Maschine
- Architecture
- Mental Models
- Inference
- Efficiency
Das Harness
- Reliable Outputs
- Agents
- RAG
Die Disziplin
- Evals
- Production
Das Urteil
- Synthesis
Mehrere Tokens auf einmal zu prüfen kostet die GPU kaum mehr. Die Leseoperation für die Gewichte bleibt dieselbe. Das gilt für ein Token genauso wie für mehrere.
Diese Beobachtung dreht die Reihenfolge um. Ein kleines, schnelles Modell schlägt zuerst mehrere Tokens am Stück vor. Das große Modell prüft alle Vorschläge danach in einem Durchlauf. Jedes richtige Token übernimmt es, ohne es selbst zu schreiben. Beim ersten falschen Vorschlag korrigiert es. Den Rest der Vermutung verwirft es.
Dieses Vorgehen hat einen Namen: Speculative Decoding.
Für die Technik-Tiefe
Das vorschlagende Modell heißt Draft-Modell, das prüfende das Zielmodell. Das Draft-Modell erzeugt seine Tokens weiterhin ganz normal einzeln, ist dafür aber klein und günstig. Das Zielmodell verifiziert die vorgeschlagene Folge in einem parallelen Durchlauf, demselben Rechenmuster wie bei Prefill: mehrere Positionen auf einmal. Bei einer Handvoll vorgeschlagener Tokens bleibt dieser Durchlauf weiterhin durch das Lesen der Gewichte begrenzt, nicht durch die Rechenleistung. Er dauert deshalb kaum länger als der Durchlauf für ein einzelnes Token.
Die Prüfung ist kein einfacher Token-für-Token-Vergleich. Das Zielmodell vergleicht für jedes vorgeschlagene Token seine eigene Wahrscheinlichkeit mit der des Draft-Modells und akzeptiert es mit einer Wahrscheinlichkeit, die sich aus diesem Verhältnis ergibt. Diese Stichprobenregel (rejection sampling) garantiert mathematisch, dass die akzeptierte Tokenfolge derselben Wahrscheinlichkeitsverteilung folgt wie eine Antwort, die das Zielmodell ganz allein erzeugt hätte. Einzelne Antworten können sich im Wortlaut trotzdem unterscheiden, wie bei jedem Sampling. Chen et al. weisen ausdrücklich darauf hin, dass unterschiedliche Zufallsverarbeitung und Rechengenauigkeit keine identischen Ausgaben erwarten lassen. Anders als bei Quantisierung ist die Beschleunigung damit kein Kompromiss bei der Antwortqualität, sondern ausschließlich ein Zeitgewinn.
Zwei unabhängige Arbeiten belegen die Größenordnung. Leviathan et al. (Google, ICML 2023) maßen eine 2- bis 3-fache Beschleunigung gegenüber Standard-Decoding auf einem T5-XXL-Modell, bei gleicher Ausgabeverteilung. Chen et al. (DeepMind, 2023) erreichten 2- bis 2,5-fache Beschleunigung auf dem 70-Milliarden-Parameter-Modell Chinchilla, mit einem eigens trainierten 4-Milliarden-Parameter-Draft-Modell.
Wenn das Draft-Modell zu oft danebenliegt
Der Zeitgewinn hängt vor allem von der Trefferquote des Draft-Modells ab. Das ist der Anteil seiner Vorschläge, die das Zielmodell annimmt. Sie ist hoch, wenn beide Modelle ähnlich einschätzen, welches Token als Nächstes passt. Rät das kleine Modell meist passend, greift das große selten ein, und die Ersparnis ist groß. Rät es oft daneben, greift das große oft ein, und der Vorteil schrumpft. Zwei weitere Größen spielen mit: wie schnell das kleine Modell im Vergleich zum großen läuft und wie viele Tokens es je Runde vorschlägt. Gleiche Trefferquote heißt darum nicht gleicher Gewinn auf jeder Hardware. Im schlechtesten Fall zahlt ein Betreiber die Rechenzeit des kleinen Modells, ohne viel zurückzubekommen.
Die Trefferquote hängt vom Text ab. Ein kleines Modell, das auf Web-Text trainiert wurde, trifft bei Alltagssätzen gut. Bei Fachsprache, etwa in Verträgen oder den Unterlagen eines Betriebs, kann sie stark sinken. Beide Modelle schätzen dann anders ein, was als Nächstes kommt. Hong et al. messen so einen Einbruch bei Fachfragen an ein fachlich trainiertes Zielmodell. Ein Wert aus einem Paper sagt deshalb nichts über die eigene Aufgabe. Er muss auf den eigenen Texten nachgemessen werden.
Speculative Decoding senkt zudem nicht von selbst die Kosten. Es kauft Zeit mit mehr Rechenzeit für das kleine Modell. Wer vor allem auf Durchsatz zielt, also viele Anfragen zugleich statt eine schnelle Antwort, rechnet anders. Die GPU-Zeit, die das kleine Modell braucht, fehlt dann für weitere Anfragen.
Speculative Decoding lässt ein kleines Modell vorausraten. Das große Modell prüft nur noch, statt jedes Token selbst zu schreiben. Trifft die Vermutung, ist die Antwort schneller da. An ihrer Qualität ändert das nichts.
Nächster Begriff: Prompt Caching. Wie ein Server bereits berechnete Gesprächsanfänge wiederverwendet, statt sie neu zu rechnen.
Häufige Fragen
Was ist Speculative Decoding? Ein Verfahren, bei dem ein kleines Draft-Modell mehrere Tokens vorschlägt und das große Zielmodell sie in einem Durchlauf prüft, statt jedes Token einzeln selbst zu schreiben. Richtige Vorschläge werden übernommen, der erste falsche wird korrigiert.
Was ist der Unterschied zwischen Draft-Modell und Zielmodell? Das Draft-Modell ist klein und günstig und schlägt Tokens einzeln vor. Das Zielmodell ist das größere Modell, dessen Antwort zählt. Es prüft mehrere vorgeschlagene Tokens gemeinsam in einem Durchlauf.
Verändert Speculative Decoding die Qualität der Antwort? Nein. Die Prüfung folgt einer Stichprobenregel, die garantiert, dass die akzeptierte Tokenfolge derselben Wahrscheinlichkeitsverteilung folgt wie eine Antwort, die das Zielmodell allein erzeugt hätte.
Wovon hängt die Beschleunigung durch Speculative Decoding ab? Vor allem von der Trefferquote des Draft-Modells, dem Anteil seiner Vorschläge, die das Zielmodell akzeptiert. Dazu kommen seine Laufzeit im Verhältnis zum Zielmodell und die Zahl der Tokens je Runde. Die Trefferquote ist textabhängig und muss auf der eigenen Aufgabe gemessen werden, nicht an einem fremden Benchmark abgelesen.
Quellen
- Leviathan, Kalman, Matias, Fast Inference from Transformers via Speculative Decoding, Google, ICML 2023: 2- bis 3-fache Beschleunigung auf T5-XXL, gleiche Ausgabeverteilung; Abschnitt 2.3: Akzeptanz nach dem Verhältnis von Ziel- und Draft-Wahrscheinlichkeit; Theorem 3.8: Beschleunigung als Funktion von Trefferquote, Vorschlagslänge und Draft-Laufzeit im Verhältnis zum Zielmodell; Abschnitt 3.4 und Discussion: insgesamt mehr Rechenoperationen, kein Gewinn ohne freie Rechenkapazität.
- Liu et al., Optimizing Speculative Decoding for Serving Large Language Models Using Goodput, 2024: unter hoher Last verlängert Speculative Decoding die Antwortzeit statt sie zu verkürzen (Abschnitt 3, Abbildung 1).
- Chen et al., Accelerating Large Language Model Decoding with Speculative Sampling, DeepMind, 2023: 2- bis 2,5-fache Beschleunigung auf Chinchilla 70B bei Batch-Größe 1 im verteilten Aufbau, Draft-Modell mit 4 Milliarden Parametern auf denselben Daten trainiert, verteilungserhaltendes rejection sampling; Abschnitt 4.1: bei wenigen vorgeschlagenen Tokens bleibt die Prüfung durch die Speicherbandbreite begrenzt und dauert kaum länger; Abschnitt 6.1: wegen Zufallsverarbeitung und Numerik keine identischen Ausgaben zu erwarten.
- Hong et al., Training Domain Draft Models for Speculative Decoding: Best Practices and Insights, 2025: die Trefferquote eines allgemeinen Draft-Modells fällt bei fachspezifischen Anfragen an ein fachlich angepasstes Zielmodell deutlich, Tabelle 1: Biologie von 60,7 auf 37,5 Prozent.
Teil der Serie AI-Engineering-Begriffe erklärt. Verwandt: Warum dieselbe KI-Anfrage zwei Geschwindigkeiten hat (Prefill/Decode), Warum ein Modell teurer wird, je länger es spricht (KV-Cache) und Warum eine fertige Antwort noch warten muss (Continuous Batching).



