
· Daniel Schleipfer · KI
Warum der GPU-Speicher voll ist, bevor er es sein müsste
Eine kurze Antwort kann viel GPU-Speicher blockieren. Paged Attention teilt den KV-Cache in Blöcke auf, die eine Anfrage erst bei Bedarf erhält.

Eine kurze Antwort kann viel GPU-Speicher blockieren. Paged Attention teilt den KV-Cache in Blöcke auf, die eine Anfrage erst bei Bedarf erhält.

Acht Anfragen starten gleichzeitig auf demselben Server. Die kürzeste ist nach drei Tokens fertig. Trotzdem kommt ihre Antwort erst an, wenn die längste der acht ihr letztes Wort geschrieben hat.

Bei der einen Anfrage kommt die Antwort sofort und tröpfelt dann langsam. Bei der anderen dauert das erste Wort, danach läuft der Rest zügig durch. Der Grund: zwei Phasen mit unterschiedlichen Grenzen.

Dasselbe Modell, dieselbe Frage. Jede Antwort kostet mehr, je länger das Gespräch läuft. Der Grund dafür hat einen Namen: KV-Cache.