· KI  · 6 min read

Welcher Anteil der KI-Aufgaben braucht das teuerste Modell

Ein Entwicklerteam bei Vercel lässt inzwischen ein Viertel bis ein Drittel seiner Pull Requests von einem Agenten schreiben. Der genaue Anteil ist nicht die interessante Zahl. Interessant ist, dass jemand ihn überhaupt gemessen hat.

Ein Entwicklerteam bei Vercel lässt inzwischen ein Viertel bis ein Drittel seiner Pull Requests von einem Agenten schreiben. Der genaue Anteil ist nicht die interessante Zahl. Interessant ist, dass jemand ihn überhaupt gemessen hat.

Der Anteil der KI-Aufgaben, der ein günstiges offenes Modell genauso gut erledigt wie das teuerste Frontier-Modell, lässt sich messen statt schätzen.

Die Messung läuft über ein Aufgaben-Inventar aus Interviews und Nutzungsstichproben, geclustert nach Aufgabentyp und bewertet auf zwei Achsen: Schwierigkeit und Sensibilität. Das Ergebnis ist eine Zahl, keine Vermutung, und dieselbe Tabelle liefert nebenbei das Kostenmodell und das Datenwege-Profil.

Am 12. August 2026 veröffentlichte das Entwicklerteam hinter Vercels AI SDK einen Blogpost mit einer ungewöhnlich konkreten Zahl. Vier Wochen zuvor hatten sie einen Agenten-Prozess produktiv geschaltet, der Pull Requests für das eigene Open-Source-Projekt schreibt. Ergebnis nach vier Wochen: 25 bis 35 Prozent der wöchentlich gemergten Pull Requests stammen vom Agenten, über 75 Prozent der im Juli geschlossenen Issues gingen auf sein Konto, offene Bugs sanken um rund 25 Prozent. Gemergt wird nichts ohne menschliche Freigabe.

Die genaue Zahl ist nicht der Punkt. Der Punkt ist, dass Vercel sie überhaupt kennt. Die meisten Unternehmen könnten nicht sagen, welcher Anteil ihrer KI-Aufgaben genauso gut auf einem Modell laufen würde, das einen Bruchteil kostet. Nicht weil die Antwort geheim wäre, sondern weil niemand nachgesehen hat.

Der Aufgabenmix zählt, nicht der Durchschnitt

Der letzte Beitrag in dieser Reihe hat die Qualitätslücke zwischen offenen und proprietären Modellen beziffert: auf Benchmark-Ebene wenige Punkte, ungleich verteilt über Aufgabentypen. Auf Routineaufgaben mit vertrautem Muster ist der Unterschied kaum noch messbar, das ist das sogenannte Center of Distribution. Bei neuartigen Problemen mit mehrstufigem Schließen bleibt er real, das ist der Edge.

Die Konsequenz daraus war eine offene Frage: Ob ein Wechsel auf ein günstigeres Modell sich lohnt, hängt nicht vom Modell ab, sondern davon, wie groß der Center-Anteil der eigenen Aufgaben tatsächlich ist. Diese Zahl steht in keinem Benchmark. Sie steckt im eigenen Unternehmen, ungemessen.

Wie man den Anteil tatsächlich misst

Eine belastbare Messung braucht zwei Quellen. Interviews liefern, was Mitarbeitende mit KI tun und tun wollen, inklusive der Aufgaben, die heute noch niemand automatisiert. Wo zugänglich, ergänzen pseudonymisierte Nutzungsstichproben aus den vorhandenen Tools das Bild, gedeckt durch den bestehenden Auftragsverarbeitungsvertrag. Beides zusammen zeigt mehr als jede der beiden Quellen allein: Interviews finden Aufgaben, die noch nicht in den Logs stehen, Logs korrigieren, was Leute über die eigene Arbeit zu wissen glauben.

Der zweite Schritt clustert die gesammelten Aufgaben in Typen. Nicht “was Herr Meier macht”, sondern Aufgabentypen wie E-Mail-Entwurf, Meeting-Zusammenfassung, Vertragsprüfung oder Code-Snippet, die über mehrere Personen und Abteilungen hinweg wiederkehren.

Jeder Typ wird dann auf zwei Achsen bewertet, nicht nur einer:

AchseFragt nachBestimmt
SchwierigkeitCenter of Distribution oder Edge: vertrautes Muster, leicht prüfbares Ergebnis, oder neuartiges Problem mit hohen Fehlerkosten?Wie viel Modellqualität die Aufgabe tatsächlich braucht
SensibilitätRoutine oder vertraulich: Daten, die überall hin dürfen, oder Daten mit engerem Kreis?Welche Datenwege für die Aufgabe infrage kommen

Zwei Achsen aus einer Messung sind kein Zufall. Dieselbe Tabelle, die den Kostenanteil liefert, liefert nebenbei das Datenwege-Profil, das die Frage beantwortet, welche Daten das eigene Haus überhaupt verlassen dürfen. Eine Erhebung, zwei Antworten. Am Ende steht eine Zahl: X Prozent des Aufgabenvolumens sind Center of Distribution und Routine, und für genau diesen Anteil trägt ein günstiges Modell die Arbeit ohne spürbaren Qualitätsverlust.

Wo die Landkarte nicht stillhält

Eine Aufgabe, die heute als Edge gilt, kann in sechs Wochen im Center liegen. Der letzte Beitrag hat gezeigt, wie schnell sich das verschiebt: Als GLM-5.2 im Juni als erstes offenes Modell die 50-Punkte-Marke im Intelligence Index knackte, lagen die nächsten offenen Modelle noch klar dahinter. Sechs Wochen später gab Moonshot AI die Gewichte von Kimi K3 frei; im aktuellen Index liegt es nur noch drei Punkte hinter der Spitze. Eine Aufgabe, die im Juni noch ein teures Modell brauchte, könnte im August bereits auf einem günstigen laufen.

Eine einmalige Messung ist also eine Momentaufnahme, kein Endzustand. Wer den Aufgabenmix einmal erhebt und die Tabelle dann liegen lässt, arbeitet nach einem halben Jahr wieder mit einer Vermutung, nur mit mehr Aufwand dahinter.

Was die Messung nicht ersetzt

Eine Messung, die pauschal zum Wechsel auf günstigere Modelle rät, wäre keine Messung, sondern ein Verkaufsargument mit Zwischenschritt. Interaktive, anspruchsvolle Arbeit mit hohen Fehlerkosten, etwa Softwareentwicklung oder strategische Analysen, liegt bei den meisten Unternehmen überwiegend am Edge. Dort bleibt ein teureres Modell oft die richtige Wahl, selbst wenn andere Abteilungen im selben Haus überwiegend Routineaufgaben erledigen. Der Vercel-Agent schreibt einen Teil der Pull Requests, nicht alle, und nichts wird ohne menschliche Prüfung gemergt. Genau diese Differenzierung ist der Grund, warum die Messung pro Aufgabentyp läuft und nicht pro Abteilung oder Unternehmen als Ganzes.

Welcher Teil dieser Zahl sich überhaupt aus dem vorhandenen Admin Center ablesen lässt und welcher nicht, ist Thema des nächsten Beitrags.

Häufige Fragen

Wie misst man, welcher Anteil der eigenen KI-Aufgaben auf einem günstigen Modell läuft? Über ein Aufgaben-Inventar aus Interviews und, wo zugänglich, pseudonymisierten Nutzungsstichproben. Die Aufgaben werden in Typen geclustert und auf zwei Achsen bewertet: Schwierigkeit (Center oder Edge of Distribution) und Sensibilität (Routine oder vertraulich). Aus der Verteilung der Typen ergibt sich der Anteil, der ein günstiges Modell verträgt.

Warum reicht das Admin Center von Copilot oder ähnlichen Tools dafür nicht? Admin-Center zeigen Nutzungshäufigkeit und Lizenzverbrauch, aber keine Aufgabenverteilung, keinen Kostenvergleich zwischen Modellen und kein Sensibilitätsprofil der Daten. Die Rohdaten sind ein Ausgangspunkt, keine Antwort.

Bedeutet ein hoher Center-Anteil automatisch, dass man auf ein günstiges Modell wechseln sollte? Nein. Die Messung liefert die Grundlage für eine Entscheidung, keine automatische Empfehlung. Teams mit viel interaktiver, anspruchsvoller Arbeit, etwa Entwicklung oder Strategie, bleiben oft besser bei einem teureren Modell, selbst wenn andere Abteilungen überwiegend Routineaufgaben erledigen.

Quellen


Verwandt: Die Qualitätslücke offener KI-Modelle, ehrlich beziffert, Residenz ist nicht Jurisdiktion und Bezahlt pro Lizenz, genutzt pro Aufgabe.

Back to Blog

Related Posts

View All Posts »
Die Qualitätslücke offener KI-Modelle, ehrlich beziffert

Die Qualitätslücke offener KI-Modelle, ehrlich beziffert

Im Juni knackte ein offenes Modell erstmals die 50-Punkte-Marke im wichtigsten unabhängigen KI-Ranking, sechs Wochen später rückte ein zweites bis auf drei Punkte an die Spitze heran. Warum die Durchschnittszahl für die eigene Entscheidung trotzdem fast irrelevant ist.

Was kostet ein KI-Projekt im Mittelstand?

Was kostet ein KI-Projekt im Mittelstand?

Individuelle KI-Anwendungen für den Mittelstand kosten zwischen 15.000 und 60.000 Euro. Dieser Artikel zeigt, welche Faktoren den Preis bestimmen und wann sich die Investition lohnt.

Was passiert, wenn der KI-Dienstleister wegfällt

Was passiert, wenn der KI-Dienstleister wegfällt

Ein KI-Anbieter kann verschwinden, egal wie groß er war. Drei Fragen entscheiden, ob das für Ihr Unternehmen eine Migration ist oder ein Neuanfang, und sie gehören vor die Unterschrift, nicht danach.