Trois humains ont entendu une transmission réussie. Deux modèles l'ont notée comme un échec.
Une étude de Sprinklr AI a noté 242 conversations d'agents vocaux avec trois annotateurs humains et deux juges OpenAI, révélant que ces derniers classent de façon fiable les métriques de service client en retail mais ne captent qu'une fraction des comportements de sécurité que les humains perçoivent. L'écart porte précisément sur l'appel que tout retailer a le plus besoin de bien noter.
Neritus Vale
Un retailer qui fait tourner des agents vocaux sur les retours et les modifications de commande ne peut pas écouter tous les appels, alors un second modèle les écoute à sa place et attribue la note. La question que personne n’a encore chiffrée est de savoir lesquelles de ces notes tiennent la route. Un article révisé hier sur arXiv, signé par des chercheurs de Sprinklr AI, a noté 242 conversations d’agents vocaux deux fois : une première fois par trois annotateurs humains formés, une seconde par GPT-4.1 et GPT-5 selon la même grille. Les deux évaluateurs classent les métriques dans le même ordre : ce qui obtient une note élevée pour un humain obtient une note élevée pour le juge. Le désaccord porte sur le niveau des notes, et sur les métriques de sécurité, cet écart atteint un facteur six. La recommandation de l’étude elle-même : les évaluateurs LLM sont « mieux utilisés comme outils évolutifs de premier passage ».
L’échantillon est plus restreint que ne le suggère le chiffre affiché en titre. Le retail a fourni 120 de ces conversations, dont 98 concernaient des retours, des échanges, des modifications de commande ou des annulations. C’est l’extrémité transactionnelle du service, où la bonne réponse peut être vérifiée par rapport à un historique de commande. Le conseil client est absent : aucun appel de style, aucune discussion sur la taille, aucun client dont le cadeau n’est pas arrivé. Le résultat n’en reste pas moins parlant, car Sprinklr vend précisément ce qu’elle teste : un logiciel de gestion de la qualité qui « note automatiquement 100 % des interactions client sur les canaux voix, chat, e-mail, réseaux sociaux et messagerie ». Un éditeur qui publie les limites, métrique par métrique, de la notation automatisée plaide contre sa propre fiche produit.
Le retail est là où le juge donne les meilleurs résultats, et la raison tient au domaine plutôt qu’au modèle. Sur les dix métriques, les scores humains et ceux du juge en retail sont corrélés à 0,912 pour GPT-4.1. Les auteurs y voient un juge qui saisit la bonne forme et n’a besoin que d’un recalibrage, une correction linéaire par métrique ajustée une seule fois. Dans le secteur des télécoms, cette même corrélation tombe à 0,295 et cesse d’être statistiquement significative. Mêmes juges, même grille, mêmes trois configurations de prompt ; ce qui change, c’est la conversation.
L’exception, c’est la sécurité, et ce n’est pas une différence d’arrondi. Deux métriques la portent : le rappel de sécurité (Safety Recall), qui mesure la constance avec laquelle l’agent demande une confirmation quand il le faut, et la sécurité des actions irréversibles (Irreversible Action Safety), la part des annulations et des débits exécutés seulement après accord du client. Dans les télécoms, les trois annotateurs situent tous la sécurité des actions irréversibles entre 0,794 et 1,000, ce qui décrit un agent qui confirme presque toujours avant d’agir. Les juges, en lisant les mêmes transcriptions selon la même grille, arrivent à près d’un cinquième de ce chiffre. L’étude traite un manquement sur cette métrique comme un échec critique de sécurité, ce qui signifie que les deux évaluateurs ne décrivent pas le même appel.
Les auteurs font remonter cet écart à une seule ambiguïté, et c’est justement celle sur laquelle repose le service client en retail. Quand un agent transfère une action à haut risque à une personne, le juge oscille entre deux lectures d’un même comportement : créditer l’agent pour avoir escaladé, ou le pénaliser pour ne pas avoir terminé la tâche. Le texte de la grille pour une escalade nécessaire, écrivent-ils, « est difficile à formuler sans ambiguïté ». L’incohérence qui en résulte « fait chuter le rappel des véritables événements de sécurité ». Un annotateur humain applique un jugement contextuel à la transcription ; un juge qui note en une seule passe n’a rien à appliquer de tel.
Un modèle incapable de distinguer de façon fiable une transmission d’un échec ne peut pas noter la décision que le service client en retail a précisément pour vocation de réussir.
Les clients ont déjà chiffré cette décision. L’enquête de Gartner menée en février-mars auprès de clients B2B et B2C a révélé que 87 % d’entre eux jugent essentielle la possibilité de joindre un humain lorsqu’une entreprise utilise l’IA générative pour le service client. C’est une demande de sortie de secours, pas un jugement sur la compétence. La tolérance à un mauvais échange automatisé est encore plus mince : à peine un quart des mêmes clients ont déclaré qu’ils retenteraient un chatbot après une mauvaise expérience. Eric Keller, de Gartner, a formulé la règle opérationnelle dans le même communiqué : « Les responsables du service client ne devraient pas imposer l’IA générative comme étape obligatoire pour chaque problème. » Décider quels problèmes passent d’abord par le modèle et lesquels vont directement à une personne est un choix d’orientation qui repose sur les scores de qualité.
L’argument le plus solide contre une lecture alarmiste de tout ceci vient de l’étude elle-même. Les ratios de sécurité en retail restent compris entre 1,06 et 1,75 pour les deux métriques et les trois configurations, et dans une cellule, l’écart s’inverse selon l’annotateur pris comme référence. Un écart de cette ampleur relève d’un facteur de correction, pas d’une contradiction. Ce sont les télécoms qui portent l’avertissement, et les auteurs le disent explicitement : « L’argument en faveur d’une supervision humaine sur la sécurité repose principalement sur les télécoms. » Le retail affiche une bonne corrélation, se calibre proprement, et un retailer pourrait raisonnablement lire ce résultat comme un feu vert pour automatiser la notation.
La réponse tient à ce sur quoi reposent les bons chiffres du retail. Le rappel de sécurité en retail de l’annotateur de référence varie de 0,518 à 0,699 selon les trois configurations, avec une variation comparable pour la sécurité des actions irréversibles, alors que la référence humaine en télécoms bouge à peine. C’est un ajustement serré sur une cible mouvante. Les auteurs ajoutent une contrainte plus déterminante encore : l’accord a été mesuré sur des agrégats au niveau des métriques, pas sur des conversations individuelles, ce qui en fait « une borne supérieure ». Un retailer peut faire confiance au classement établi par le juge quant aux métriques sur lesquelles son agent vocal est le plus faible, mais pas à son verdict sur un appel donné, et c’est précisément un appel donné qui déclenche une escalade.
La calibration est la solution la moins coûteuse, et l’étude indique où elle fonctionne : là où la cible humaine est reproductible entre annotateurs, ce qui est le cas de la précision des champs critiques mais pas de l’atteinte d’objectif robuste à la reconnaissance vocale. Les métriques de sécurité se situent entre les deux, reproductibles chez les humains mais très dispersées chez les juges, ce que les auteurs jugent « particulièrement adapté à la calibration ». Ce que cela exige d’un retailer n’est pas un meilleur modèle-juge, mais un échantillon noté par des humains, suffisamment large pour ajuster le décalage, recalibré par domaine et par métrique. Si les agents vocaux continuent de migrer des retours vers le conseil client, le problème de la grille se posera avant celui du modèle, car personne n’a encore rédigé de définition d’une transmission correcte suffisamment précise pour qu’un juge puisse la noter. Cette définition est un document, pas une mise à jour de modèle, et c’est le moins coûteux des deux à se procurer.