Kurz beantwortet
Eine Studie zeigt: Bei gleichem KI-Modell kann allein das umgebende Werkzeug die Kosten im Schnitt verdoppeln, ohne den Erfolg spürbar zu verbessern. Ein schlankes Werkzeug schneidet oft ähnlich gut ab. Wer nur das Modell vergleicht, übersieht die halbe Rechnung.
Wer einen KI-Agenten für Programmieraufgaben einsetzt, wählt zuerst meist ein Modell. Übersehen wird dabei ein zweiter Faktor: das Werkzeug, mit dem das Modell arbeitet, also die Software, die ihm Aufgaben, Anweisungen und Zugriff auf Dateien gibt. Ich habe an dieser Stelle bereits gezeigt, dass ein Großteil der KI-Agenten-Kosten in der Architektur liegt, nicht im Modell selbst. Eine neue Studie namens HarnessTax zeigt jetzt, wie stark allein die Wahl dieses Werkzeugs die Rechnung verändert, noch bevor der laufende Betrieb überhaupt beginnt. Eine kompakte Einordnung mit den wichtigsten Zahlen hat Arena veröffentlicht.
Warum kann dasselbe Modell doppelt so teuer sein?
Weil das Werkzeug rund um das Modell bestimmt, wie viel Kontext bei jedem einzelnen Arbeitsschritt mitgeschickt wird, und genau dieser Kontext wird mitberechnet, nicht nur die eigentliche Aufgabe. In der Untersuchung löste ein umfangreiches, funktionsreiches Werkzeug eine Programmieraufgabe in 97,8 Prozent der Versuche, ein sehr schlankes Werkzeug mit nur vier Grundfunktionen (lesen, schreiben, bearbeiten, eine Befehlszeile ausführen) in 96,7 Prozent, bei identischem Modell. Kaum ein Unterschied im Ergebnis. Bei den Kosten pro Versuch lag das umfangreiche Werkzeug aber bei 1,33 US-Dollar, das schlanke bei 0,67 US-Dollar. Fast das Doppelte für praktisch dasselbe Ergebnis.
Woher kommt der Unterschied?
Aus dem, was das Werkzeug bei jedem einzelnen Arbeitsschritt an Kontext mitschickt, bevor die eigentliche Aufgabe überhaupt beginnt. Beide Werkzeuge brauchten für dieselbe Aufgabe im Schnitt etwa gleich viele Arbeitsschritte. Der Unterschied lag im Umfang jedes einzelnen Schritts: Das umfangreiche Werkzeug schickte im Mittel über zehnmal mehr Text mit, lange Anweisungen und ausführliche Beschreibungen aller verfügbaren Funktionen, unabhängig davon, ob die konkrete Aufgabe sie überhaupt brauchte.
Ist ein schlankes Werkzeug also immer die bessere Wahl?
Nein. Die Studie zeigt nur, dass ein schlankes Werkzeug bei den getesteten Aufgaben mit dem umfangreichen mindestens mithalten konnte, nicht, dass es in jedem Fall reicht. Die Untersuchung deckte zwei öffentliche Testfelder ab und maß weder Integrationen in bestehende Systeme noch Zugriffsrechte, Erinnerungsvermögen über mehrere Aufgaben hinweg oder Arbeitsablauf-Funktionen, die in der Praxis ebenfalls den Ausschlag geben können. Auffällig war zudem: Das Werkzeug des jeweiligen Modell-Anbieters war nicht automatisch die beste Wahl für das eigene Modell. In neun von zwölf Vergleichen erzielte ein anderes Werkzeug die höhere Erfolgsquote. Ein schlankes Werkzeug ist damit ein sinnvoller Ausgangspunkt, kein automatisches Urteil gegen jede zusätzliche Funktion.
Was bedeutet das für Entscheider im Mittelstand?
Wer ein KI-Werkzeug für Programmier- oder Automatisierungsaufgaben einführt, sollte Modell und Werkzeug gemeinsam bewerten und dabei prüfen, wie viel Kontext das Werkzeug tatsächlich benötigt, um die eigene Aufgabe zu lösen. Wer stattdessen die Standardkombination des Anbieters übernimmt, ohne diese Frage zu stellen, zahlt möglicherweise über Monate für Funktionen, die niemand nutzt, ohne dass es auf der Rechnung als eigener Posten auftaucht. Die Frage ist selten, ob ein Werkzeug zu viel kann. Sie ist, wer im Unternehmen bemerkt, wenn es das tut.
Wer nur das Modell vergleicht,
übersieht die halbe Rechnung.
Wenn Sie prüfen möchten, wo in Ihren laufenden oder geplanten KI-Projekten Werkzeug und Modell tatsächlich zusammenpassen:

