Niemand im Einkauf hat die Stichprobengröße festgelegt
Ein Paper aus dem Inneren eines Produktivagenten beziffert die Kostenposition, die Einzelhandelsverträge auslassen: drei Stunden für einen vollständigen Benchmark-Durchlauf, fällig jedes Mal, wenn sich Modell, Prompt oder Katalog ändern. Was Teams stattdessen laufen lassen, ist eine Teilstichprobe – und deren Größe legt fest, wer das Evaluationsbudget verantwortet, nicht wer das Service Level unterschrieben hat.
Admiral Neritus Vale
Die wiederkehrende Kostenposition in einem agentenbasierten Einzelhandelsvertrag ist die Bewertung, nicht der Modellaufruf. Händler, die Shopping- und Service-Agenten einkaufen, haben Inference und Integration bepreist; die Evaluation ist die Position, die sich immer wieder erneuert – jedes Mal, wenn sich das Modell, der Prompt, das Tool-Schema oder der zugrunde liegende Katalog ändert. Weil ein vollständiger Benchmark-Rerun in diesem Takt nicht bezahlbar ist, wird der in Produktion laufende Agent an einer schrumpfenden Stichprobe gemessen. Deren Größe hat niemand im Einkauf festgelegt.
Eines der ersten veröffentlichten Kostenbilder aus dem Inneren eines Produktivagenten erschien letzten Freitag auf arXiv, und die entscheidende Zahl ist eine Dauer. Yining She und Lei Lin, die über einen im Einsatz befindlichen Analytics-Agenten berichten, schreiben, dass ein einzelner Durchlauf seines zentralen Benchmarks mit 519 Fragen rund drei Stunden dauert. Das sind die Stückkosten dafür, zu wissen, ob die Sache noch funktioniert. Die Liste der Auslöser stammt von ihnen: “Wenn sich bei einem Produktivagenten Modelle, Prompts, Tools und umgebende Systeme ändern, müssen Entwickler dessen Konfigurationen wiederholt evaluieren.” Im Einzelhandel kommen noch der Katalog, die Rückgabebedingungen und der Aktionskalender hinzu – keines von ihnen folgt dem Release-Rhythmus des darunterliegenden Modells.
Über die meisten Uhren, die einen Retest erzwingen, haben Händler keine Kontrolle. Ask Ralph, der Styling-Assistent, den Ralph Lauren im vergangenen September zusammen mit Microsoft gestartet hat, läuft auf Azure OpenAI und empfiehlt vorrätige Polo-Produkte innerhalb der Marken-App. Drei Dinge darunter bewegen sich nach drei verschiedenen Zeitplänen: das gehostete Modell, der Merchandising-Prompt und der Bestand, auf den sich die Antworten beziehen. Der Agent von She und Lin erzeugte in Entwicklung und Monitoring zehntausende Evaluationsläufe – das passiert, wenn jeder Bestandteil seinen eigenen Release-Zyklus hat. Ein Händler, der nur dann neu testet, wenn er selbst etwas ändert, testet nur die halbe Angriffsfläche.
Die Kosten richten sich danach, was der Agent zu tun bekommt, und Shopping-Agenten bekommt man die teure Aufgabe gestellt. Princetons Holistic Agent Leaderboard hat die Kosten der Agenten-Evaluation über Coding, Wissenschaft, Web-Navigation und Kundenservice hinweg beziffert, und der günstigste Benchmark kostete im Schnitt 13 Dollar für den Lauf eines einzelnen Agenten. Das ist die Untergrenze der Spanne, nicht das, wonach ein Shopping-Agent aussieht. Online Mind2Web, bei dem der Agent live auf Websites navigieren muss, kam im Schnitt auf über 450 Dollar. Ein Shopping-Assistent durchstöbert einen Katalog, ruft Tools auf und verhandelt mit einer Nutzerin oder einem Nutzer, die oder der ständig die Meinung ändert – das rückt ihn bei jeder Neubewertung ans teure Ende dieser Spanne.
Was Teams statt zu zahlen tatsächlich tun, ist subsampeln, und die ehrlichen unter ihnen messen den Fehler, den das mit sich bringt. She und Lin haben Random Sampling, historisches Caching, feste Teilmengen und adaptives Testen anhand mehrerer hundert protokollierter Läufe desselben Benchmarks verglichen. Ihre beste Methode reproduzierte den Score des vollständigen Laufs auf etwa einen Prozentpunkt genau – bei deutlich weniger als der halben Anzahl an Fragen. Und trotzdem haben sie sich dagegen entschieden. In Produktion gingen stattdessen nach Schwierigkeit gestaffelte, feste Teilmengen, gewählt aus operativer Einfachheit, ausgeliefert als Menü unterschiedlicher Teilmengengrößen, damit Nutzende Ausführungszeit gegen Genauigkeit abwägen können.
Die Genauigkeit des Tests ist ein Dropdown-Menü.

Der Einwand gegen diesen Alarmismus ist stark, und er hat eine Literaturgrundlage. Subsampling ist eine publizierte Methode mit Fehlerbalken, keine von müden Ingenieuren erfundene Abkürzung. tinyBenchmarks hat gezeigt, dass hundert sorgfältig ausgewählte Beispiele den MMLU-Score eines Modells auf zwei Punkte genau vorhersagen, und die Item-Response-Theorie erklärt auch warum: Eine gut gewählte Frage trägt mehr Information als ein Haufen redundanter. Wenn sich Benchmarks für Einzelhandelsagenten wie MMLU verhalten, ist die schrumpfende Stichprobe schlicht eine Ersparnis, und der einzige Fehler im Vertrag bestand jemals darin, einen vollständigen Lauf einzuplanen. Das ist die Bedingung, die dieses Argument erfüllen muss: Die Teilmenge muss das bewahren, was ein Händler wissen muss.
Genau das tut sie nicht, und das sagt sogar das Paper, das Agenten-Subsampling erst praxistauglich gemacht hat. Franck Ndzombas Studie zu effizientem Agenten-Benchmarking hat die Methode über Dutzende Agenten-Architekturen hinweg getestet und die Asymmetrie klar herausgearbeitet: Die Vorhersage der Rangfolge bleibt bei Verteilungsverschiebungen stabil, während die Vorhersage des absoluten Scores nachlässt. Sein Schwierigkeitsfilter reduziert die Anzahl der Aufgaben um 44 bis 70 Prozent und hält dabei die Reihenfolge ehrlich – das richtige Ziel, wenn man zwischen Anbietern wählt. Ein Händler wählt an einem beliebigen Dienstag aber nicht zwischen Anbietern. Er fragt sich, ob der Build dieser Woche noch immer die Rückerstattung verweigert, die er letzte Woche verweigert hat, und das ist eine Frage des Niveaus, nicht des Rangs.
Was einen Händler Geld kostet, ist Inkonsistenz, und Inkonsistenz ist die Eigenschaft, für die sich am schwersten subsampeln lässt. τ-bench, der Tool- und Policy-Benchmark, der die pass^k-Metrik eingeführt hat, fand heraus, dass führende funktionsaufrufende Agenten bei weniger als der Hälfte der Aufgaben erfolgreich waren. Ein solcher Mittelwert ist zu verkraften, wenn er sich nicht bewegt, denn eine bekannte Fehlerrate lässt sich personell einplanen. Nur bewegt er sich eben nicht: Bei wiederholten Versuchen an derselben Einzelhandelsaufgabe hielten diese Agenten in unter einem Viertel der Fälle durch. Zuverlässigkeit misst man durch Wiederholung, und das ist genau das eine Experiment, das sich eine geschrumpfte Stichprobe nicht leisten kann.
Die Lösung steht in demselben Paper, das die Stichprobe verkleinert hat. She und Lin raten Entwicklerteams, nach wesentlichen Änderungen an Modellen, Prompts, Tools oder Ausführungssystemen neu zu kalibrieren und regelmäßig den vollständigen Benchmark laufen zu lassen, um den Fehler zu messen, den ihre Teilmenge einführt. Dieser Abgleichslauf ist die Position ohne Besitzer: Er liefert kein Feature, schließt kein Ticket, und er fällt als Erstes weg, wenn ein Agent vom Launch-Budget ins laufende Betriebsbudget wandert. Gartner erwartet, dass bis Ende 2027 mehr als 40 % der agentenbasierten KI-Projekte eingestellt werden, mit steigenden Kosten als einem der genannten Gründe – und die Kosten, die zur Einstellung führen, tauchen erst nach der Unterschrift auf. Wenn Händler die Evaluation weiterhin als Launch-Ausgabe verbuchen, verlieren sie zuerst genau die Messung, die ihnen gesagt hätte, dass der Agent aufgehört hat zu funktionieren. Die Anzahl der Fragen hinter einem Service Level ist eine Vertragsklausel, und sie sollte neben der Verfügbarkeitszahl bepreist werden.