· Daniel Schleipfer · KI  · 7 Min. Lesezeit

Warum dieselbe lange Anweisung mal fast nichts und mal den vollen Preis kostet

Ein Server kann den Anfang einer Anfrage wiederverwenden, statt ihn neu zu berechnen. Das klappt nur, wenn der Anfang Zeichen für Zeichen derselbe ist. Ab dem ersten abweichenden Token ist die Ersparnis weg.

Ein Server kann den Anfang einer Anfrage wiederverwenden, statt ihn neu zu berechnen. Das klappt nur, wenn der Anfang Zeichen für Zeichen derselbe ist. Ab dem ersten abweichenden Token ist die Ersparnis weg.

Was ist Prompt Caching?

Ein Server behält den Rechenzwischenstand für den Anfang einer Anfrage und nutzt ihn bei der nächsten Anfrage mit demselben Anfang wieder, statt ihn neu zu berechnen. Der Anfang muss dafür Token für Token identisch sein.

Ein Unternehmen schickt jeder Anfrage dieselbe lange Anweisung voraus: Rolle, Regeln, dazu ein Vertragswerk als Nachschlagetext. Manche Anfragen rechnen sich danach günstig ab. Andere kosten den vollen Preis, obwohl die Anweisung dieselbe ist. Der Unterschied liegt in einem einzigen Zeichen.

Was gleich bleibt, muss nicht neu berechnet werden

Die Serie, und wo dieser Begriff sitzt

Dieser Begriff sitzt bei "Efficiency" in der Gruppe "Die Maschine".

Die Maschine

  • Architecture
  • Mental Models
  • Inference
  • Efficiency

Das Harness

  • Reliable Outputs
  • Agents
  • RAG

Die Disziplin

  • Evals
  • Production

Das Urteil

  • Synthesis

Bevor ein Modell das erste Token einer Antwort schreibt, liest es die gesamte Anfrage in einem Durchlauf. Das ist die erste der beiden Phasen. Sie erzeugt den Zwischenstand, den das Modell danach für jedes weitere Token braucht: den KV-Cache.

Beginnen zwei Anfragen mit demselben Text, ist dieser Zwischenstand für den gemeinsamen Anfang derselbe. Ein Server kann ihn deshalb aufheben und beim zweiten Mal übernehmen. Er berechnet nur den Rest neu.

Das gilt aber nur für einen gemeinsamen Anfang. Der Zwischenstand jedes Tokens hängt von allen Tokens davor ab. Weicht ein Token ab, ist alles danach ungültig.

Dieses Vorgehen hat einen Namen: Prompt Caching.

Für die Technik-Tiefe

Ein Prompt Cache speichert den KV-Zwischenstand eines Präfix, also der ersten n Tokens. Bei einer neuen Anfrage sucht der Server den längsten gespeicherten Präfix, der mit ihr übereinstimmt, und berechnet erst ab der ersten Abweichung. Der Vergleich ist exakt. Ähnlich genügt nicht, ein anderes Token an Position 3 macht den Cache für die gesamte Anfrage unbrauchbar.

Bei Anthropic liegt dafür eine feste Reihenfolge zugrunde: erst die Werkzeugdefinitionen, dann der System-Prompt, dann die Nachrichten. Eine Änderung auf einer Ebene entwertet diese und alle folgenden. Der Vorteil zeigt sich in der Preisliste. Ein Lesetreffer kostet dort bei den meisten Modellen ein Zehntel des normalen Eingabepreises, bei einzelnen neueren noch weniger. Das erstmalige Schreiben des Caches kostet 1,25-mal so viel. Die Standardlebensdauer beträgt fünf Minuten, gemessen ab der letzten Nutzung. Sehr kurze Prompts lassen sich gar nicht zwischenspeichern, die Untergrenze liegt je nach Modell zwischen 512 und 4.096 Tokens. Preise und Grenzen setzt jeder Anbieter selbst und ändert sie. Sie stehen hier nur als Größenordnung.

Bei selbst betriebenen Modellen liefert Paged Attention die Grundlage. Anfragen mit gleichem Anfang teilen sich dieselben Speicherseiten des KV-Cache, statt sie mehrfach anzulegen. Teilen sich mehrere Mandanten einen Server, gehört auch dieser Cache getrennt. Sonst verrät die Antwortzeit, ob jemand anderes denselben Anfang schon geschickt hat. vLLM bietet dafür einen Zusatz je Anfrage an, den cache_salt.

Wo der Cache nicht trifft und wo er falsch trifft

Prompt Caching hebt Rechenzwischenstände auf. Die Antwort schreibt das Modell danach trotzdem neu, sie bleibt unverändert. Deshalb liefert es keine falsche Antwort. Es hat aber eine harte Bedingung: Der Anfang muss stimmen.

Ein typischer Fehler ist ein veränderlicher Baustein an der falschen Stelle. Ein Zeitstempel, ein Nutzername oder eine Anfrage-ID weit vorn macht jede Anfrage schon dort anders. Der Cache trifft dann nie. Niemand sieht es, denn die Antworten sind korrekt. Nur die Rechnung fällt höher aus. Die Abhilfe ist eine Reihenfolge. Feste Teile wie Rolle, Regeln und lange Dokumente stehen vorn. Veränderliche wie Datum und Frage stehen hinten. Bei Anthropic gehört außerdem die Cache-Markierung ans Ende des festen Teils. Steht sie hinter dem Veränderlichen, wird der feste Teil nie für sich gespeichert. Ob ein Treffer zustande kam, zeigen die Nutzungsangaben der Antwort. Wer sie nicht prüft, spart womöglich nichts.

Dazu kommt die Lebensdauer. Kommt dieselbe Anweisung seltener, als der Cache lebt, wird er jedes Mal neu geschrieben. Das Schreiben kostet mehr als das Lesen. Bei einer Anfrage pro Stunde lohnt sich die Standardlebensdauer nicht.

Semantic Caching geht einen Schritt weiter und hebt fertige Antworten auf. Eine neue Frage wird in einen Zahlenvektor umgewandelt, der ihre Bedeutung beschreibt. Liegt er nahe genug an dem einer früheren Frage, kommt deren Antwort zurück. Das Modell läuft dann gar nicht. Ein Treffer spart damit mehr als beim Prompt Caching, ist aber nicht exakt. Ein zu großzügig eingestellter Schwellenwert liefert die Antwort auf eine andere Frage. „Kündigungsfrist bei Kunde A“ und „Kündigungsfrist bei Kunde B“ können im Zahlenraum dicht beieinanderliegen. Die Antworten unterscheiden sich aber.

Im Mittelstand wiegt das doppelt. Antworten, die sich auf einen Mandanten, einen Vertrag oder eine Person beziehen, dürfen nie aus dem Cache eines anderen kommen. Ein gemeinsamer Antwort-Cache, der nicht erzwungen nach Mandant trennt, ist ein Datenleck. Antworten mit Zeitbezug veralten außerdem, ohne dass es auffällt.


Prompt Caching hebt auf, was sich nicht ändert: Nur ein identischer Anfang wird nicht neu berechnet. Wer die Reihenfolge seiner Anfrage nicht kennt, zahlt den Vollpreis.

Nächster Begriff: Structured Output. Wie ein Modell Antworten in einem festen Format liefert und was passiert, wenn das Format nicht stimmt.

Häufige Fragen

Was ist Prompt Caching? Ein Server behält den Rechenzwischenstand für den Anfang einer Anfrage und nutzt ihn bei der nächsten Anfrage mit demselben Anfang wieder, statt ihn neu zu berechnen. Der Anfang muss dafür Token für Token identisch sein.

Was ist der Unterschied zwischen Prompt Caching und Semantic Caching? Prompt Caching hebt den Rechenzwischenstand eines identischen Anfangs auf, das Modell schreibt danach weiterhin eine neue Antwort. Semantic Caching hebt fertige Antworten auf und liefert sie bei inhaltlich ähnlichen Fragen. Dann läuft das Modell gar nicht mehr, die Antwort kann aber falsch sein.

Warum trifft der Cache nicht, obwohl der Prompt fast gleich ist? Der Vergleich läuft Token für Token vom Anfang an. Steht vorn etwas Veränderliches wie ein Zeitstempel, weicht die Anfrage schon dort ab. Ab da wird alles neu berechnet. Feste Teile gehören nach vorn, veränderliche ans Ende.

Wie lange bleibt ein Prompt Cache erhalten? Das legt der Anbieter fest. Bei Anthropic beträgt die Standardlebensdauer fünf Minuten, gemessen ab der letzten Nutzung, optional eine Stunde. Danach wird der Anfang wieder voll berechnet.

Quellen

  • Anthropic, Prompt caching, Dokumentation, abgerufen am 25.09.2026, erneut geprüft am 02.10.2026: Treffer nur bei vollständig identischen Abschnitten bis zum markierten Block; Reihenfolge Werkzeuge, System, Nachrichten, Änderungen entwerten die jeweilige und alle folgenden Ebenen; Standardlebensdauer fünf Minuten, ab Beginn der letzten Nutzung gemessen; Schreiben 1,25-fach, Lesen 0,1-fach des Basispreises für Eingabe (Standardmodelle; Claude Opus 5.5 0,05-fach, Claude Fable 5.1 0,025-fach); Untergrenze je nach Modell 512 bis 4.096 Tokens, kürzere Prompts werden ohne Fehlermeldung nicht zwischengespeichert; geschrieben wird nur an der Cache-Markierung, eine Markierung hinter veränderlichem Inhalt trifft nie (Abschnitt “Common mistake: Breakpoint on content that changes every request”).
  • Kwon et al., Efficient Memory Management for Large Language Model Serving with PagedAttention, SOSP 2023: gemeinsame Speicherseiten für Anfragen mit gleichem Anfang.
  • vLLM, Automatic Prefix Caching, Design-Dokumentation, abgerufen am 02.10.2026: cache_salt trennt den Cache je Vertrauensgruppe und verhindert Timing-Angriffe über Latenzunterschiede.
  • Redis, Semantic cache with redis-py, abgerufen am 02.10.2026: Frage als Vektor, Treffer nur unterhalb eines Distanz-Schwellenwerts, Trennung nach Mandant per Filter in der Abfrage.

Teil der Serie AI-Engineering-Begriffe erklärt. Verwandt: Warum dieselbe KI-Anfrage zwei Geschwindigkeiten hat (Prefill/Decode), Warum ein Modell teurer wird, je länger es spricht (KV-Cache) und Warum der GPU-Speicher voll ist, bevor er es sein müsste (Paged Attention).

Zurück zum Blog

Ähnliche Beiträge

Alle Beiträge ansehen »
Warum eine fertige Antwort noch warten muss

Warum eine fertige Antwort noch warten muss

Acht Anfragen starten gleichzeitig auf demselben Server. Die kürzeste ist nach drei Tokens fertig. Trotzdem kommt ihre Antwort erst an, wenn die längste der acht ihr letztes Wort geschrieben hat.