Zehn Sprachen gingen in den Benchmark ein. Commerce schnitt am schlechtesten ab.
PolyWorkBench ist der erste Agenten-Benchmark, der Sprachvariation in die gesamte Ausführungstrajektorie einbaut statt nur in die Eingaben. Commerce ist die Domäne, in der Agenten versagen, und das Fehlerverhalten besteht jede strukturelle Prüfung, die ein Händler sich ausdenken würde.
Admiral Neritus Vale
Jeder Pitch für agentisches Commerce, den ein Händler dieses Jahr zu hören bekam, stützte sich auf Benchmark-Werte, die in einer einzigen Sprache erhoben wurden. PolyWorkBench, am 7. Juli auf arXiv veröffentlicht von Forschenden der Beijing Jiaotong University und Tencents Weixin AI, ist der erste Benchmark, der diese Annahme über einen gesamten Workflow hinweg bepreist statt an einem einzelnen Übersetzungsschritt. Von den fünf Arbeitsdomänen, die er testet, ist Commerce diejenige, in der leistungsfähige Agenten zusammenbrechen.
Dieser Zusammenbruch ist ein Effekt des Bewertungsregimes, kein Effekt der Schwierigkeit. Starke Allround-Modelle halten bei Wissens-, Rechts- und Fertigungsaufgaben einen Grade von 0,85 bis 0,95, was respektabel ist. Bei Commerce fallen dieselben Modelle auf Werte zwischen 0,57 und 0,72. Die Commerce-Aufgaben des Benchmarks sind grenzüberschreitende Preisgestaltung, Logistikvergleiche, Marktplatz-Listings und Markteinführungen, bei denen ein einziger Rechenfehler oder ein defektes Tabellenschema das gesamte Ergebnis zunichtemacht. Bei Rechts- und Wissensaufgaben scheint es dagegen Teilpunkte für strukturelle Korrektheit zu geben, sodass derselbe Fehler nur einen Bruchteil des Durchlaufs kostet statt des Ganzen. Der Gesamtdurchschnitt schmeichelt Agenten also gerade bei der Arbeit, die ein Händler am liebsten abgeben würde.
Die Tabelle auf Aufgabenebene ist das, was ein grenzüberschreitend tätiger Betreiber lesen sollte, bevor er irgendetwas unterschreibt. Siebenundzwanzig der dreißig getesteten Modell-Harness-Kombinationen scheiterten an einem Russisch-Vietnamesisch-Logistikvergleich – jener Art von Routing-Entscheidung, die ein Großhändler wöchentlich trifft. Das schlechteste Ergebnis im gesamten Benchmark ist ein russisches Marktplatz-Listing, bei dem gescheiterte Agenten im Schnitt einen Grade von 0,04 erreichten – eine Zahl, die eher ein fehlendes Ergebnis beschreibt als ein schwaches. Keine dieser Aufgaben ist ungewöhnlich, und keine davon zeigt sich in der Demo.
Nichts davon kommt als Fehlermeldung an.
Die Autoren benennen das Fehlerverhalten, und es sollte jeden beunruhigen, der einen Checkout in mehr als einer Sprache betreibt. Neben Verständnisfehlern identifizieren sie sprachübergreifende Koordinationsfehler, bei denen der Agent die Quelle korrekt liest, Quelle und Ziel über eine mehrstufige Trajektorie hinweg aber nicht in Deckung halten kann, sodass das Endergebnis abdriftet, obwohl jeder Zwischenschritt plausibel aussah. Plausibel ist das entscheidende Wort. Ein Agent, der eine koreanische Rechnung falsch liest, produziert etwas, das jemandem auffällt; einer, der sie richtig liest und dann über elf weitere Schritte hinweg abdriftet, liefert eine saubere, überzeugend wirkende, falsche Zahl.
Das eigene Bewertungsdesign des Benchmarks zeigt, dass diese Abdrift strukturelle Prüfungen übersteht. PolyWorkBench bewertet jeden Durchlauf auf drei Arten: mit einer aufgabenspezifischen Rubrik, mit ausführbaren Tests und mit einem LLM-Richter für Kohärenz und Treue. Rubrik und Tests stimmen eng überein, da beide dieselben Schemata und dieselbe Arithmetik prüfen; der Richter stimmt mit keinem von beiden überein. Beschränkt auf Durchläufe, die die deterministischen Auswerter als mindestens zur Hälfte gelöst einstufen, fällt seine Korrelation mit ihnen auf 0,02 – praktisch Rauschen, gegenüber 0,23 über die gesamte Stichprobe. Es ist dieselbe Divergenz zwischen maschinell überprüfbarem Erfolg und beurteilter Qualität, die wir im Mai auf rund dreißig Punkte bezifferten für Shopping-Agenten – jetzt taucht sie im eigenen Bewertungsstapel eines einzigen Benchmarks auf. Was auch immer ein Händler an Monitoring um seinen agentischen Checkout gelegt hat, ist eine Testsuite, kein Richter.
Das beste Modell zu kaufen, klärt die Frage nicht, denn das umgebende Gerüst verschiebt den Wert stärker als die Sprache. Claude Opus 4.8 erreicht innerhalb des ClaudeCode-Harness 0,923 Pass@1. Tauscht man das Harness aus und hält die Aufgaben konstant, fällt dasselbe Modell innerhalb von Codex auf 0,698 – eine Spanne von 0,225 Punkten über die vier getesteten Harnesses hinweg, breiter als die gesamte Spanne des Modells von 0,15 Punkten über alle zehn Sprachen, von seinem Tiefpunkt im Russischen bis zu seinem Höchststand im Französischen, allein innerhalb von ClaudeCode. Ein Händler, der ein Modell im Vertrag festschreibt und das Harness dem Anbieter überlässt, hat die kleinere Variable spezifiziert.

Der stärkste Einwand lautet, die Lücke sei durch die Messmethode selbst erzeugt. Im April veröffentlichten Yunsu Kim und Kolleg:innen GAIA-v2-LILT, einen Re-Audit des GAIA-Agentenbenchmarks in fünf nicht-englischen Sprachen, und argumentierten, dass maschinell übersetzte multilinguale Benchmarks ihre eigene Validität durch Fehlausrichtungen zwischen Frage und Antwort sowie kulturell unpassenden Kontext untergraben. Ihr korrigierter Workflow hob die Erfolgsraten der Agenten um bis zu 32,7 % gegenüber den minimal übersetzten Versionen an, und ihr Fazit ist unverblümt: Ein erheblicher Teil der multilingualen Leistungslücke sei benchmark-bedingter Messfehler. Damit dieses Argument hier greift, müsste der Commerce-Einbruch von PolyWorkBench dasselbe Artefakt sein.
Ist er nicht, und die Konstruktionspipeline liefert den Grund. Die Aufgaben von PolyWorkBench gehen von realen Datenkeimen aus – Quittungen, Verträgen und Vorfallprotokollen –, die eine Autorin oder ein Autor direkt in der Zielsprache in eine Aufgabenspezifikation überführt, welche anschließend von einer zweiten Person vor der Veröffentlichung geprüft wird. Das ist eine andere Fehlerquelle als ein Benchmark, der komplett aus dem Englischen übersetzt wurde – genau das Defizit, das GAIA-v2-LILT diagnostiziert. Die Kritik trifft Suiten wie MAPS, die vier englische Agenten-Benchmarks in elf Sprachen übertrug und deren Datenpaket inzwischen die Korrekturen von GAIA-v2-LILT trägt. Sie trifft nicht hier zu, und die Autoren von GAIA-v2-LILT räumen selbst ein, dass in vielen Settings auch nach der Korrektur erhebliche Lücken bestehen blieben.
Die Angriffsfläche liegt an der falschen Stelle, und Käufer sagen das bereits. DeepLs Borderless-Business-Report 2026, von AI News im April aufgegriffen, fand, dass nur 17 % der befragten international tätigen Unternehmen ihre multilingualen Abläufe auf Large Language Models oder agentische KI umgestellt hatten, während sie globale Expansion zugleich als größten einzelnen Treiber ihrer Language-AI-Ausgaben nannten. Die Befragten saßen in den USA, Großbritannien, Frankreich, Deutschland und Japan: Firmen, die Sprachautomatisierung kaufen, um in Märkte einzutreten, und sie anhand von Erfahrungen aus den Märkten beurteilen, die sie bereits halten.
In diesen Daten steckt ein Hebel, und es ist nicht der, der gerade verkauft wird. Modelle im mittleren Segment gewinnen durch Best-of-Three-Sampling bis zu 14 Grade-Punkte zurück, weil die meisten ihrer Fehler transient statt strukturell sind. Das Spitzenmodell gewinnt durch dieselbe Technik fast nichts hinzu, sodass Verifikations-Rechenleistung dort mehr bringt, wo das günstigere Modell läuft, als dort, wo das beste läuft. Wenn das Wachstum eines Händlers in Vietnamesisch, Russisch und Koreanisch verbucht wird, während das Testbudget im englischsprachigen Betrieb sitzt, ist das eine Allokation, die er selbst getroffen hat, keine Grenze, an die er gestoßen ist. Die Allokation lässt sich verschieben, und der Umsatz, den sie derzeit schützt, ist nicht der Umsatz aus dem Plan.