
Warum eine fertige Antwort noch warten muss
Acht Anfragen starten gleichzeitig auf demselben Server. Die kürzeste ist nach drei Tokens fertig. Trotzdem kommt ihre Antwort erst an, wenn die längste der acht ihr letztes Wort geschrieben hat.

Acht Anfragen starten gleichzeitig auf demselben Server. Die kürzeste ist nach drei Tokens fertig. Trotzdem kommt ihre Antwort erst an, wenn die längste der acht ihr letztes Wort geschrieben hat.

Eine Extraktion liest zuverlässig Werte aus Verträgen, bis ein Feld einmal fehlt. Dieselbe Anfrage liefert trotzdem eine Zahl, sauber formatiert, nur erfunden. Warum ein Sprachmodell keine Datenbank ist und was das für die Prüfung bedeutet.

Ein Entwicklerteam bei Vercel lässt inzwischen ein Viertel bis ein Drittel seiner Pull Requests von einem Agenten schreiben. Der genaue Anteil ist nicht die interessante Zahl. Interessant ist, dass jemand ihn überhaupt gemessen hat.

Im Juni knackte ein offenes Modell erstmals die 50-Punkte-Marke im wichtigsten unabhängigen KI-Ranking, sechs Wochen später rückte ein zweites bis auf drei Punkte an die Spitze heran. Warum die Durchschnittszahl für die eigene Entscheidung trotzdem fast irrelevant ist.

Zweimal dieselbe Frage an dasselbe Modell, zweimal eine andere Antwort. Kein Fehler: Das Modell zieht bei jedem Wort aus einer Wahrscheinlichkeitsverteilung. Was Temperature, Top-p und Top-k dabei tatsächlich einstellen.

Ein KI-Anbieter kann verschwinden, egal wie groß er war. Drei Fragen entscheiden, ob das für Ihr Unternehmen eine Migration ist oder ein Neuanfang, und sie gehören vor die Unterschrift, nicht danach.