Operations

Personne au service Achats n'a choisi la taille de l'échantillon

Un article rédigé depuis l'intérieur d'un agent en production chiffre un coût que les contrats de retail passent sous silence : trois heures pour un seul cycle complet de benchmark, déclenché chaque fois qu'un modèle, un prompt ou un catalogue change. Ce que les équipes exécutent à la place, c'est un sous-ensemble, dont la taille est fixée par celui qui détient le budget d'évaluation, et non par celui qui a signé le niveau de service.

A nautilus examines an agent contract whose RE-TEST line has been left blank, while a three-hour sandglass drains beside it.

Admiral Neritus Vale

Le coût récurrent d’un contrat de retail agentique, c’est la notation, pas l’appel au modèle. Les enseignes qui achètent des agents de shopping et de service ont chiffré l’inférence et l’intégration ; l’évaluation, elle, est la ligne qui se renouvelle, à chaque fois que le modèle, le prompt, le schéma d’outils ou le catalogue sous-jacent change. Comme un benchmark complet relancé à ce rythme devient inabordable, l’agent en production finit noté sur un échantillon qui rétrécit. Et personne au service achats n’a choisi sa taille.

L’une des premières évaluations de coût publiées depuis l’intérieur d’un agent en production est arrivée sur arXiv vendredi dernier, et le chiffre qui compte est une durée. Yining She et Lei Lin, dans un rapport sur un agent d’analytique déployé en production, écrivent qu’un seul passage sur son benchmark central de 519 questions prend environ trois heures. C’est le coût unitaire pour savoir si la chose fonctionne encore. La liste des déclencheurs, c’est la leur : « À mesure que les modèles, prompts, outils et systèmes environnants d’un agent en production évoluent, les développeurs doivent réévaluer ses configurations de façon répétée. » Dans le retail, il faut y ajouter le catalogue, la politique de retours et le calendrier promotionnel, aucun d’entre eux ne suivant le calendrier de sortie du modèle sous-jacent.

Les enseignes ne contrôlent pas la plupart des horloges qui imposent un nouveau test. Ask Ralph, l’assistant de style que Ralph Lauren a lancé avec Microsoft en septembre dernier, tourne sur Azure OpenAI et recommande des produits Polo en stock dans l’application de la marque. Trois éléments sous-jacents bougent selon trois calendriers différents : le modèle hébergé, le prompt de merchandising, et l’inventaire vers lequel pointent les réponses. L’agent de She et Lin a généré des dizaines de milliers d’exécutions d’évaluation entre développement et supervision, ce qui arrive dès que chaque composant a son propre cycle de mise à jour. Une enseigne qui ne retteste que lorsqu’elle change quelque chose de son côté ne teste que la moitié de la surface.

Le coût suit ce qu’on demande à l’agent de faire, et on demande aux agents de shopping de faire la chose coûteuse. Le Holistic Agent Leaderboard de Princeton a chiffré l’évaluation d’agents sur le code, les sciences, la navigation web et le service client, et son benchmark le moins cher revenait en moyenne à 13 dollars pour l’exécution d’un seul agent. C’est le plancher de la fourchette, pas à quoi ressemble un agent de shopping. Online Mind2Web, qui envoie l’agent naviguer sur des sites web réels, coûtait en moyenne plus de 450 dollars. Un assistant de shopping parcourt un catalogue, appelle des outils et négocie avec un utilisateur qui change d’avis, ce qui le place systématiquement au mauvais bout de cette fourchette à chaque nouvelle notation.

Ce que font les équipes au lieu de payer, c’est du sous-échantillonnage, et les plus honnêtes mesurent l’erreur que cela introduit. She et Lin ont comparé échantillonnage aléatoire, mise en cache historique, sous-ensembles fixes et tests adaptatifs sur plusieurs centaines d’exécutions enregistrées du même benchmark. Leur meilleure méthode reproduisait le score du run complet à environ un point de pourcentage près, tout en exécutant bien moins de la moitié des questions. Puis ils l’ont écartée. Ce sont des sous-ensembles fixes stratifiés par difficulté qui sont partis en production, choisis pour leur simplicité opérationnelle, livrés sous forme d’un menu de tailles d’échantillons pour que l’utilisateur puisse arbitrer entre temps d’exécution et fidélité.

La fidélité du test est devenue un menu déroulant.

![A shop service counter where a brass dial marked 100, 200, 300, 400 is being turned down to 100, in front of a wall of numbered question cards that are still sealed.](/{{generate: A department-store service counter with a hand-lettered sign reading ‘AGENT RE-TEST’; a clerk’s hand turning a large brass dial whose engraved positions read 100, 200, 300, 400 down to the 100 setting. Behind the counter, a floor-to-ceiling wall of numbered pigeonholes holding question cards, only the bottom row unsealed and the rest still tied with string. A customer waits at the counter with a returns slip. Composition: dial and hand in the foreground right, wall of pigeonholes filling the background, waiting customer small at the left edge. Mood: bureaucratic, quietly ominous.}})

L’objection à cette alarme est solide, et elle s’appuie sur une littérature établie. Le sous-échantillonnage est une méthode publiée, avec ses marges d’erreur, pas un raccourci inventé par des ingénieurs fatigués. tinyBenchmarks a montré qu’une centaine d’exemples soigneusement choisis prédit le score MMLU d’un modèle à deux points près, et la théorie de la réponse à l’item explique pourquoi : une question bien choisie porte plus d’information qu’un tas de questions redondantes. Si les benchmarks d’agents retail se comportaient comme MMLU, l’échantillon qui rétrécit serait une économie, et la seule erreur du contrat aurait été de budgétiser un run complet. C’est la condition que cet argument doit remplir pour tenir : le sous-ensemble doit préserver ce qu’une enseigne a besoin de savoir.

Ce n’est pas le cas, et l’article même qui a rendu le sous-échantillonnage d’agents praticable le dit. L’étude de Franck Ndzomga sur l’évaluation efficace d’agents a testé la méthode sur des dizaines d’architectures d’agents et a mis en évidence l’asymétrie sans détour : la prédiction du classement relatif reste stable face au décalage de distribution, tandis que la prédiction du score absolu se dégrade. Son filtre de difficulté réduit le nombre de tâches de 44 à 70 %, tout en gardant le classement fiable, ce qui est le bon objectif si l’on choisit entre fournisseurs. Or une enseigne ne choisit pas entre fournisseurs un mardi après-midi. Elle se demande si le build de cette semaine refuse toujours le remboursement qu’il refusait la semaine dernière, et c’est une question de niveau, pas de classement.

Ce qui coûte de l’argent à une enseigne, c’est l’inconstance, et l’inconstance est la propriété la plus difficile à sous-échantillonner. τ-bench, le benchmark d’outils et de politiques qui a introduit la métrique pass^k, a constaté que les meilleurs agents d’appel de fonctions réussissaient moins de la moitié de ses tâches. Une telle moyenne est vivable si elle reste stable, car un taux d’échec connu peut être compensé par les effectifs. Sauf qu’elle ne reste pas stable : sur des tentatives répétées de la même tâche retail, ces agents ne tenaient bon qu’un quart du temps. La fiabilité se mesure par la répétition, et c’est justement l’expérience qu’un échantillon réduit ne peut pas se permettre.

La correction est écrite dans le même article qui a réduit l’échantillon. She et Lin disent aux développeurs de recalibrer après tout changement significatif de modèles, de prompts, d’outils ou de systèmes d’exécution, et de faire tourner le benchmark complet périodiquement pour mesurer l’erreur introduite par leur sous-ensemble. Ce run de recalage, c’est la ligne budgétaire sans propriétaire : il ne livre aucune fonctionnalité, ne clôt aucun ticket, et c’est le premier poste sacrifié quand un agent passe du budget de lancement au budget de fonctionnement. Gartner prévoit que plus de 40 % des projets d’IA agentique seront annulés d’ici fin 2027, la hausse des coûts figurant parmi les raisons invoquées, et les coûts qui provoquent ces annulations arrivent après la signature. Si les enseignes continuent de comptabiliser l’évaluation comme une dépense de lancement, la première mesure qu’elles perdront sera précisément celle qui leur aurait dit que l’agent avait cessé de fonctionner. Le nombre de questions derrière un niveau de service est une clause contractuelle, et elle mérite d’être chiffrée au même titre que le taux de disponibilité.