L'agent peut remplir un panier. Il ne sait pas renoncer à un coupon.
Onze agents LLM ont été évalués sur des paniers construits sous contrainte de budget avec coupons attachés, et le meilleur n'a réussi que 61,2 % des tâches. Les échecs se concentrent sur les coupons qui s'excluent mutuellement, soit exactement le mécanisme sur lequel reposent les promotions dans l'habillement.
Sir John Crabstone
Onze agents LLM se sont vu confier un brief d’achat, une fourchette de dépense et un dossier de coupons ; le meilleur a mené à terme 61,2 % des tâches. ComboShoppingBench, publié le 10 août par des chercheurs de JD.com, évalue les agents sur les deux éléments que l’habillement vend toujours ensemble : un ensemble d’articles, et la promotion qui y est attachée. Les agents savaient trouver la marchandise. Ce qui les a mis en échec, c’est l’offre.
L’environnement est vaste et les tâches ne relèvent pas de la mode. 4 306 132 références commerce, 5 171 points de livraison et 1 711 coupons alimentent 291 tâches couvrant l’installation d’appareils, la préparation de repas, l’organisation d’événements et les commandes groupées à emporter. Ce qui se transpose à l’habillement, c’est la forme plutôt que la marchandise : des articles qui doivent fonctionner ensemble, mis en prix face à des remises qui ne s’appliquent pas toutes simultanément. Le budget comporte un plancher autant qu’un plafond, ce qui n’est jamais que le principe du seuil de dépense-pour-économiser. C’est une tenue et une promotion, spécifiées par des gens qui n’ont jamais vendu un manteau.
Les mécaniques de remise seront familières. Une somme fixe déduite une fois un seuil franchi ; un pourcentage plafonné ; chacun circonscrit par catégorie et régi par des groupes d’exclusion qui déterminent ce qui peut se combiner avec quoi. Quiconque a déjà écrit « ne peut être cumulé avec aucune autre offre » a construit à la main l’une de ces règles.
L’évaluation se scinde en deux : du code déterministe vérifie l’argent, des modèles-juges évaluent le sens. Chaque vérification, prise isolément, semble presque résolue. Le meilleur score a maintenu ses coupons dans la légalité 96,6 % du temps et est resté dans le budget 86,3 % du temps. Mais le succès global exige que chaque vérification passe sur le même panier, ce qui explique comment des chiffres proches de 100 % s’effondrent à 61,2. Un panier est une conjonction, et les conjonctions ne se moyennent pas.
L’étude chiffre cet effet cumulatif. À mesure que les briefs se complexifient, le taux d’échec sur un seul critère pris isolément ne grimpe que d’environ 4,8 % à 6,6 %, tandis que la part des tâches satisfaisant l’ensemble de leurs critères s’effondre. Les relations entre articles échouent plus souvent que toute autre catégorie. Chaque exigence supplémentaire coûte peu à écrire dans un brief et beaucoup à satisfaire à l’intérieur d’un seul panier.
L’échec sur les coupons est plus étroit que ne le laisse penser l’expression « cumul de remises ». Les agents ratent rarement un coupon cumulable ; l’écart se creuse sur les coupons qui s’excluent mutuellement, où le bon choix dépend d’un panier que l’agent n’a pas encore fini de construire. L’optimalité des coupons va de 15,5 % en bas du classement à 94,2 % en tête. Ce n’est pas une capacité que le marché a déjà banalisée.
Ajouter une remise relève de l’arithmétique ; en refuser une relève du jugement.
Les rails de paiement ont commis la même omission. L’Agentic Checkout Spec d’OpenAI permet à un marchand de renvoyer une remise sur une ligne d’article et une ligne de remise dans les totaux. Elle ne donne à l’acheteur aucun champ pour en appliquer une ; un agent peut envoyer un identifiant produit et une quantité. C’est un distributeur automatique aux manières plus policées.
La partie facile a déjà été testée en public. Instant Checkout a été lancé en septembre 2025 avec des achats d’un seul article chez des vendeurs Etsy, sans panier multi-articles et sans codes promo. En mars, Forbes évaluait à une douzaine le nombre de marchands Shopify actifs, en citant le président de Shopify Harley Finkelstein, et OpenAI avait fini par renvoyer l’acte d’achat vers des applications tierces. Forbes attribue ce recul à des distractions ailleurs — un pari matériel, une activité publicitaire, du terrain perdu face aux chatbots concurrents — et non à un échec du paiement lui-même. Ce que l’article confirme, en revanche, c’est le périmètre : neuf mois après le lancement, les rails ne géraient qu’un article à la fois, sans panier, sans code promo. La transaction la plus complexe n’avait jamais été construite, encore moins testée.
L’explication habituellement avancée pour tout cela, c’est la donnée. Nettoyez le flux, renseignez les attributs, et l’agent performera ; un confrère développe une version rigoureuse de cet argument ailleurs aujourd’hui. ComboShoppingBench pointe ailleurs. Ses agents ne manquaient pas d’informations produit ; il leur manquait un moyen de raisonner sur l’offre qui y était attachée.
Reste alors une question pour le calendrier promotionnel de l’habillement lui-même. Les règles d’exclusion et les seuils qui poussent un panier vers le haut ont été rédigés pour se situer juste au-delà du point où l’acheteur cesse d’optimiser. Ce n’est pas un accident de la complexité — c’est là que se loge la marge. On demande désormais aux distributeurs de rendre cette mécanique lisible à quelque chose qui ne s’ennuie jamais.