Agentic Commerce

Dix langues sont entrées dans le benchmark. Le commerce en est sorti dernier.

PolyWorkBench est le premier benchmark d'agents à intégrer la variation linguistique dans toute la trajectoire d'exécution plutôt que dans les seules entrées. Le commerce est le domaine où les agents flanchent, et le mode d'échec passe tous les contrôles structurels qu'un distributeur penserait à effectuer.

A nautilus at an inspection desk holding a Russian-language marketplace listing form up to a lamp, while a scoreboard of language columns behind it stays lit except for one dark row marked COMMERCE.

Admiral Neritus Vale

Tous les argumentaires sur le commerce agentique entendus cette année par les distributeurs reposaient sur des scores de benchmark obtenus dans une seule langue. PolyWorkBench, publié sur arXiv le 7 juillet par des chercheurs de l’Université Jiaotong de Pékin et de Weixin AI, la division IA de Tencent, est le premier à chiffrer ce postulat sur l’ensemble d’un flux de travail plutôt qu’à une seule étape de traduction. Sur les cinq domaines professionnels testés, c’est dans le commerce que les modèles les plus performants s’effondrent.

Cet effondrement relève d’un effet du régime de notation plutôt que d’un effet de difficulté. Les modèles polyvalents solides maintiennent un Grade de 0,85 à 0,95 sur les tâches de connaissance, juridiques et manufacturières, ce qui est honorable. Le commerce fait chuter ces mêmes modèles entre 0,57 et 0,72. Les tâches commerciales du benchmark portent sur la tarification transfrontalière, la comparaison logistique, les fiches produits de marketplace et les lancements de marché, où une seule erreur de calcul ou un schéma de tableur cassé invalide l’ensemble du livrable. Les tâches juridiques et de connaissance semblent, elles, accorder un crédit partiel pour l’exactitude structurelle, si bien que la même erreur ne coûte qu’une fraction de l’exécution plutôt que la totalité. La moyenne globale flatte donc les agents précisément sur le travail qu’un distributeur souhaite le plus déléguer.

Le tableau détaillé par tâche est ce qu’un opérateur transfrontalier devrait lire avant de signer quoi que ce soit. Vingt-sept des trente combinaisons modèle-harnais évaluées ont échoué à une comparaison logistique russe-vietnamien, ce type de décision d’acheminement qu’un grossiste prend chaque semaine. Le pire résultat de tout le benchmark concerne une fiche produit de marketplace en russe, où les agents en échec obtiennent en moyenne un Grade de 0,04, un chiffre qui décrit un livrable absent plutôt qu’un livrable médiocre. Aucune de ces tâches n’est inhabituelle, et aucune ne correspond à ce que montre la démo.

Rien de tout cela n’arrive sous forme de message d’erreur.

Les auteurs nomment le mode d’échec, et il devrait inquiéter quiconque exploite un tunnel d’achat en plusieurs langues. Aux côtés des erreurs de compréhension, ils identifient des erreurs de coordination interlinguistique, où l’agent lit correctement la source mais ne parvient pas à maintenir l’alignement entre source et cible tout au long d’une trajectoire à étapes multiples, de sorte que l’artefact final dérive alors que chaque étape intermédiaire semblait plausible. Plausible est le mot clé. Un agent qui interprète mal une facture coréenne produit quelque chose qu’une personne remarquera ; un agent qui la lit correctement puis dérive sur onze étapes suivantes renvoie un chiffre propre, assuré, et faux.

La conception même de l’évaluation du benchmark montre que cette dérive survit aux contrôles structurels. PolyWorkBench note chaque exécution de trois façons : une grille spécifique à la tâche, des tests exécutables, et un juge LLM pour la cohérence et la fidélité. La grille et les tests concordent étroitement, puisque tous deux vérifient les mêmes schémas et les mêmes calculs ; le juge ne concorde avec aucun des deux. En se limitant aux exécutions que les évaluateurs déterministes jugent au moins à moitié résolues, sa corrélation avec eux tombe à 0,02, un niveau de bruit statistique, contre 0,23 sur l’échantillon complet. C’est le même écart entre réussite vérifiable par machine et qualité jugée que nous avions chiffré à environ trente points en mai pour les agents d’achat, qui refait surface ici à l’intérieur même du dispositif de notation d’un benchmark. Quel que soit le système de surveillance qu’un distributeur a déployé autour de son tunnel d’achat agentique, c’est une suite de tests, pas un juge.

Acheter le meilleur modèle ne règle pas la question, car l’échafaudage qui l’entoure fait varier le score bien plus que la langue. Claude Opus 4.8 obtient un Pass@1 de 0,923 dans le harnais ClaudeCode. En changeant de harnais à tâches constantes, le même modèle chute à 0,698 dans Codex, un écart de 0,225 point sur les quatre harnais testés — plus large que l’ensemble de la plage de 0,15 point du modèle sur les dix langues, entre son minimum en russe et son maximum en français, au sein du seul ClaudeCode. Un distributeur qui spécifie un modèle dans son contrat et laisse le harnais au fournisseur a fixé la variable la moins déterminante.

A checkout terminal glowing green with a PASSED indicator while the receipt spooling from it prints mismatched currency symbols and garbled mixed-script product names

L’objection la plus solide serait que l’écart soit fabriqué par la mesure elle-même. En avril, Yunsu Kim et ses collègues ont publié GAIA-v2-LILT, un ré-audit du benchmark d’agents GAIA dans cinq langues non anglaises, soutenant que les benchmarks multilingues construits par traduction automatique compromettent leur propre validité par un désalignement question-réponse et un contexte culturellement décalé. Leur flux de travail corrigé a relevé les taux de réussite des agents jusqu’à 32,7 % par rapport aux versions minimalement traduites, et leur conclusion est sans détour : une part substantielle de l’écart de performance multilingue est une erreur de mesure induite par le benchmark lui-même. Pour que l’argument développé ici s’effondre, il faudrait que la chute du commerce dans PolyWorkBench soit le même artefact.

Ce n’est pas le cas, et le pipeline de construction en est la raison. Les tâches de PolyWorkBench partent de données réelles — reçus, contrats et journaux d’incidents — qu’un auteur transforme directement en spécification de tâche dans la langue cible, laquelle est ensuite auditée par un second auteur avant publication. C’est une surface d’échec différente de celle d’un benchmark traduit en bloc depuis l’anglais, qui est précisément la déficience diagnostiquée par GAIA-v2-LILT. La critique s’applique à des suites comme MAPS, qui a traduit quatre benchmarks d’agents anglais en onze langues et dont le corpus reprend désormais les corrections de GAIA-v2-LILT. Elle ne s’applique pas ici, et ses propres auteurs reconnaissent que des écarts substantiels subsistaient dans de nombreux cas même après correction.

L’exposition au risque se situe au mauvais endroit, et les acheteurs commencent à le dire. Le rapport Borderless Business 2026 de DeepL, relayé par AI News en avril, a établi que seuls 17 % des entreprises internationales interrogées avaient basculé leurs opérations multilingues vers des grands modèles de langage ou de l’IA agentique, tout en désignant l’expansion internationale comme le premier moteur des dépenses en IA linguistique. Les répondants étaient basés aux États-Unis, au Royaume-Uni, en France, en Allemagne et au Japon : des entreprises qui achètent de l’automatisation linguistique pour entrer sur de nouveaux marchés, et qui la jugent à l’aune des marchés qu’elles maîtrisent déjà.

Ces données révèlent un levier, et ce n’est pas celui qu’on vous vend. Les modèles de milieu de gamme récupèrent jusqu’à 14 points de Grade grâce à l’échantillonnage best-of-three, car la majorité de leurs échecs sont transitoires plutôt que structurels. Le modèle de pointe, lui, ne gagne quasiment rien avec la même technique, si bien que le calcul de vérification rapporte davantage là où tourne le modèle le moins cher que là où tourne le meilleur. Si la croissance d’un distributeur se joue en vietnamien, en russe et en coréen alors que son budget de tests reste cantonné à son activité en anglais, c’est une allocation qu’il a choisie, pas une limite qu’il a subie. Cette allocation peut être déplacée, et le chiffre d’affaires qu’elle protège aujourd’hui n’est pas celui inscrit au plan.