· KI · 6 min read
Welcher Anteil der KI-Aufgaben braucht das teuerste Modell
Ein Entwicklerteam bei Vercel lässt inzwischen ein Viertel bis ein Drittel seiner Pull Requests von einem Agenten schreiben. Der genaue Anteil ist nicht die interessante Zahl. Interessant ist, dass jemand ihn überhaupt gemessen hat.

Der Anteil der KI-Aufgaben, der ein günstiges offenes Modell genauso gut erledigt wie das teuerste Frontier-Modell, lässt sich messen statt schätzen.
Die Messung läuft über ein Aufgaben-Inventar aus Interviews und Nutzungsstichproben, geclustert nach Aufgabentyp und bewertet auf zwei Achsen: Schwierigkeit und Sensibilität. Das Ergebnis ist eine Zahl, keine Vermutung, und dieselbe Tabelle liefert nebenbei das Kostenmodell und das Datenwege-Profil.
Am 12. August 2026 veröffentlichte das Entwicklerteam hinter Vercels AI SDK einen Blogpost mit einer ungewöhnlich konkreten Zahl. Vier Wochen zuvor hatten sie einen Agenten-Prozess produktiv geschaltet, der Pull Requests für das eigene Open-Source-Projekt schreibt. Ergebnis nach vier Wochen: 25 bis 35 Prozent der wöchentlich gemergten Pull Requests stammen vom Agenten, über 75 Prozent der im Juli geschlossenen Issues gingen auf sein Konto, offene Bugs sanken um rund 25 Prozent. Gemergt wird nichts ohne menschliche Freigabe.
Die genaue Zahl ist nicht der Punkt. Der Punkt ist, dass Vercel sie überhaupt kennt. Die meisten Unternehmen könnten nicht sagen, welcher Anteil ihrer KI-Aufgaben genauso gut auf einem Modell laufen würde, das einen Bruchteil kostet. Nicht weil die Antwort geheim wäre, sondern weil niemand nachgesehen hat.
Der Aufgabenmix zählt, nicht der Durchschnitt
Der letzte Beitrag in dieser Reihe hat die Qualitätslücke zwischen offenen und proprietären Modellen beziffert: auf Benchmark-Ebene wenige Punkte, ungleich verteilt über Aufgabentypen. Auf Routineaufgaben mit vertrautem Muster ist der Unterschied kaum noch messbar, das ist das sogenannte Center of Distribution. Bei neuartigen Problemen mit mehrstufigem Schließen bleibt er real, das ist der Edge.
Die Konsequenz daraus war eine offene Frage: Ob ein Wechsel auf ein günstigeres Modell sich lohnt, hängt nicht vom Modell ab, sondern davon, wie groß der Center-Anteil der eigenen Aufgaben tatsächlich ist. Diese Zahl steht in keinem Benchmark. Sie steckt im eigenen Unternehmen, ungemessen.
Wie man den Anteil tatsächlich misst
Eine belastbare Messung braucht zwei Quellen. Interviews liefern, was Mitarbeitende mit KI tun und tun wollen, inklusive der Aufgaben, die heute noch niemand automatisiert. Wo zugänglich, ergänzen pseudonymisierte Nutzungsstichproben aus den vorhandenen Tools das Bild, gedeckt durch den bestehenden Auftragsverarbeitungsvertrag. Beides zusammen zeigt mehr als jede der beiden Quellen allein: Interviews finden Aufgaben, die noch nicht in den Logs stehen, Logs korrigieren, was Leute über die eigene Arbeit zu wissen glauben.
Der zweite Schritt clustert die gesammelten Aufgaben in Typen. Nicht “was Herr Meier macht”, sondern Aufgabentypen wie E-Mail-Entwurf, Meeting-Zusammenfassung, Vertragsprüfung oder Code-Snippet, die über mehrere Personen und Abteilungen hinweg wiederkehren.
Jeder Typ wird dann auf zwei Achsen bewertet, nicht nur einer:
| Achse | Fragt nach | Bestimmt |
|---|---|---|
| Schwierigkeit | Center of Distribution oder Edge: vertrautes Muster, leicht prüfbares Ergebnis, oder neuartiges Problem mit hohen Fehlerkosten? | Wie viel Modellqualität die Aufgabe tatsächlich braucht |
| Sensibilität | Routine oder vertraulich: Daten, die überall hin dürfen, oder Daten mit engerem Kreis? | Welche Datenwege für die Aufgabe infrage kommen |
Zwei Achsen aus einer Messung sind kein Zufall. Dieselbe Tabelle, die den Kostenanteil liefert, liefert nebenbei das Datenwege-Profil, das die Frage beantwortet, welche Daten das eigene Haus überhaupt verlassen dürfen. Eine Erhebung, zwei Antworten. Am Ende steht eine Zahl: X Prozent des Aufgabenvolumens sind Center of Distribution und Routine, und für genau diesen Anteil trägt ein günstiges Modell die Arbeit ohne spürbaren Qualitätsverlust.
Wo die Landkarte nicht stillhält
Eine Aufgabe, die heute als Edge gilt, kann in sechs Wochen im Center liegen. Der letzte Beitrag hat gezeigt, wie schnell sich das verschiebt: Als GLM-5.2 im Juni als erstes offenes Modell die 50-Punkte-Marke im Intelligence Index knackte, lagen die nächsten offenen Modelle noch klar dahinter. Sechs Wochen später gab Moonshot AI die Gewichte von Kimi K3 frei; im aktuellen Index liegt es nur noch drei Punkte hinter der Spitze. Eine Aufgabe, die im Juni noch ein teures Modell brauchte, könnte im August bereits auf einem günstigen laufen.
Eine einmalige Messung ist also eine Momentaufnahme, kein Endzustand. Wer den Aufgabenmix einmal erhebt und die Tabelle dann liegen lässt, arbeitet nach einem halben Jahr wieder mit einer Vermutung, nur mit mehr Aufwand dahinter.
Was die Messung nicht ersetzt
Eine Messung, die pauschal zum Wechsel auf günstigere Modelle rät, wäre keine Messung, sondern ein Verkaufsargument mit Zwischenschritt. Interaktive, anspruchsvolle Arbeit mit hohen Fehlerkosten, etwa Softwareentwicklung oder strategische Analysen, liegt bei den meisten Unternehmen überwiegend am Edge. Dort bleibt ein teureres Modell oft die richtige Wahl, selbst wenn andere Abteilungen im selben Haus überwiegend Routineaufgaben erledigen. Der Vercel-Agent schreibt einen Teil der Pull Requests, nicht alle, und nichts wird ohne menschliche Prüfung gemergt. Genau diese Differenzierung ist der Grund, warum die Messung pro Aufgabentyp läuft und nicht pro Abteilung oder Unternehmen als Ganzes.
Welcher Teil dieser Zahl sich überhaupt aus dem vorhandenen Admin Center ablesen lässt und welcher nicht, ist Thema des nächsten Beitrags.
Häufige Fragen
Wie misst man, welcher Anteil der eigenen KI-Aufgaben auf einem günstigen Modell läuft? Über ein Aufgaben-Inventar aus Interviews und, wo zugänglich, pseudonymisierten Nutzungsstichproben. Die Aufgaben werden in Typen geclustert und auf zwei Achsen bewertet: Schwierigkeit (Center oder Edge of Distribution) und Sensibilität (Routine oder vertraulich). Aus der Verteilung der Typen ergibt sich der Anteil, der ein günstiges Modell verträgt.
Warum reicht das Admin Center von Copilot oder ähnlichen Tools dafür nicht? Admin-Center zeigen Nutzungshäufigkeit und Lizenzverbrauch, aber keine Aufgabenverteilung, keinen Kostenvergleich zwischen Modellen und kein Sensibilitätsprofil der Daten. Die Rohdaten sind ein Ausgangspunkt, keine Antwort.
Bedeutet ein hoher Center-Anteil automatisch, dass man auf ein günstiges Modell wechseln sollte? Nein. Die Messung liefert die Grundlage für eine Entscheidung, keine automatische Empfehlung. Teams mit viel interaktiver, anspruchsvoller Arbeit, etwa Entwicklung oder Strategie, bleiben oft besser bei einem teureren Modell, selbst wenn andere Abteilungen überwiegend Routineaufgaben erledigen.
Quellen
- Vercel AI SDK Factory, vier Wochen produktiv: 25-35 % der wöchentlich gemergten Pull Requests, über 75 % der im Juli 2026 geschlossenen Issues, rund 25 % weniger offene Bugs, kein Merge ohne menschliche Freigabe (veröffentlicht 12.08.2026): Vercel Blog, “Building a software factory for AI SDK”
- GLM-5.2 als erstes offenes Modell über 50 Punkte (Juni 2026); Kimi-K3-Gewichte am 27. Juli 2026 freigegeben, im aktuellen Index 60 Punkte gegen 61 bis 63 an der Spitze: Artificial Analysis, Tom’s Hardware zur Gewichte-Freigabe, Artificial Analysis, Modell-Leaderboard (abgerufen 26.08.2026)
Verwandt: Die Qualitätslücke offener KI-Modelle, ehrlich beziffert, Residenz ist nicht Jurisdiktion und Bezahlt pro Lizenz, genutzt pro Aufgabe.



