Research & Trends

Un reranker ne peut pas choisir ce que la recherche a laissé de côté

Une étude présentée à CIKM 2026 montre que certains des gains publiés pour les rerankers LLM proviennent d'un test qui place la réponse dans la liste, et que dans des conditions de recherche réalistes, aucune des mises à niveau testées ne surpasse significativement le simple filtrage collaboratif. Avant d'acheter un reranker plus intelligent, un e-commerçant devrait se demander quelle part des achats finaux son étage de recherche montre réellement au modèle.

A robot butler fussily rearranges a dozen garments on a small rail while a nautilus in a naval coat watches from a gantry above a vast warehouse of racks the robot cannot reach.

Admiral Neritus Vale

Un reranker de recommandation ne peut réordonner que ce que la recherche lui transmet, et une étude publiée sur arXiv fin du mois dernier mesure à quel point le bon produit y figure rarement. Dans The Recall Ceiling of LLM Recommendation Reranking, acceptée pour une présentation orale à CIKM en novembre, Zhaohui Wang constate qu’une recherche réaliste ne place que 2 à 19 % des articles pertinents dans une liste de 100 candidats, sur huit jeux de données. Dans ces conditions, aucune des mises à niveau qu’il a testées ne bat significativement une simple référence de filtrage collaboratif (CF) sur ses trois principaux jeux de données Amazon. Un e-commerçant à qui l’on propose une « personnalisation propulsée par LLM » devrait d’abord demander quelle part des bons produits son étage de recherche fait même remonter.

Une partie des gains publiés pour les rerankers LLM provient d’un test qui plante la réponse. Une étude de 2023 sur les LLM en tant que « classificateurs zero-shot » les a évalués sur des listes mélangeant l’article que chaque utilisateur a fini par choisir avec des alternatives échantillonnées. Wang compare cette méthode à « tester un moteur de recherche après avoir préchargé la réponse dans l’index ». Sur ses trois jeux de données Amazon, elle surestimait le NDCG@10 réaliste — un score standard mesurant à quel point les bons articles se hissent dans un top dix — de 92 à 95 %. Ce format perdure : MemRerank, un article de mars sur le reranking personnalisé pour les agents d’achat, rapporte la précision à choisir le bon produit parmi cinq candidats, dont l’un est toujours correct. De tels tests peuvent légitimement comparer les rerankers entre eux, mais Wang note que le protocole ne permet pas « une affirmation absolue sur la performance en déploiement, car la quantité qu’il maintient fixe est précisément celle qui est contraignante en production ».

Un reranker obtient un score nul pour tout acheteur dont le prochain achat n’a jamais atteint sa liste, aussi ingénieux que soit le modèle. Sous la recherche CF standard de l’étude, c’était le cas pour 92 à 98 % des utilisateurs sur les trois jeux de données Amazon. Wang transforme ce constat en plafond : dans son test principal, le NDCG attendu d’un reranker ne peut pas dépasser le rappel de la liste qu’il lit. Il concède que l’idée est intuitive ; ce que la borne apporte, c’est un chiffre auquel comparer tout score annoncé.

Rendre le reranker plus intelligent ne lui a pas permis de dépasser le CF. Wang a essayé l’ingénierie de prompt, des modèles de langage couvrant une amplitude de taille de 168 fois, des rerankers supervisés, le fine-tuning LoRA, la recherche hybride texte-et-comportement et la fusion LLM-plus-CF. Aucun n’a produit de gain statistiquement significatif sur les trois principaux jeux de données Amazon. Avec son mode « réflexion » activé, DeepSeek V4-Pro, sorti en avril, a obtenu un score inférieur de 43 % au CF sur Amazon Movies. Les chaînes de raisonnement, écrit Wang, « n’ont rien sur quoi s’appuyer quand les articles pertinents sont absents ».

En disposant des rangs et scores propres au CF, le modèle de langage s’est surtout amélioré en s’en remettant à eux. Sa précision a augmenté sur chaque jeu de données à mesure que son classement se rapprochait de celui du CF. Aucune variante n’a battu le CF de façon significative. Selon les mots de Wang, « dire au modèle ce que croyait le CF lui apprend surtout à ne pas bouger ». Même un mélange des deux, ajusté a posteriori sur les utilisateurs de test, « retrouve la performance du CF, pas plus ». À ces niveaux de rappel, ce que le modèle de langage apportait de son cru était un ensemble d’hypothèses sur les articles qui vont ensemble — et ces hypothèses ont fait plus de mal que de bien.

Le chiffre qu’un e-commerçant devrait demander à un fournisseur de personnalisation, c’est le rappel : la part des produits que les clients ont fini par acheter et qui figuraient dans la liste que le modèle a été autorisé à lire.

La liste qu’un LLM lit est souvent plus courte que celle que renvoie la recherche, et l’allonger n’a pas aidé. Les LLM zero-shot des tests de Wang ne lisaient que les 30 premiers des 100 candidats, un choix de budget de contexte qu’il dit conforme à la pratique courante. Sur Amazon Beauty, cela réduisait la part d’articles pertinents dans le champ de vision du modèle de 8,2 % à 3,2 %. Élargir la liste de 10 à 200 candidats augmentait le rappel, pourtant le LLM restait derrière le CF à chaque longueur. Le rappel contraignant est celui de la fenêtre, et chaque candidat qui s’y ajoute allonge un prompt que le fournisseur paie.

Les meilleures preuves publiques venant de la mode se situent dans la même fourchette de faible rappel. Aucun des huit jeux de données de Wang n’est un catalogue de vêtements. La compétition Kaggle 2022 de H&M demandait cependant aux équipes de prédire les achats de chaque client pour la semaine suivante à partir de deux ans de véritables transactions H&M. L’étage de recherche de l’équipe gagnante a capté 18,3 % des achats de la dernière semaine des données parmi ses 100 meilleurs candidats par client, comme le résume Kazuki Fujikawa, de l’équipe classée 12e. Même la meilleure des quelque 3 000 équipes a laissé la plupart des achats de la semaine suivante là où aucun reranker ne pouvait les atteindre.

L’objection la plus solide, que Wang soulève lui-même, est qu’un système de recommandation en production en sait bien plus que n’importe quel benchmark. Les systèmes en production puisent des candidats à de multiples sources, utilisent des signaux comme le temps de consultation et le contexte de session que ses rerankers n’ont jamais vus, et apprennent du retour en ligne. Si ces avantages portent le rappel à 30 % ou plus — ce que le protocole de Wang juge suffisant — le plafond se relâche et un reranker plus intelligent a de la marge pour justifier son coût. C’est une affirmation portant sur un chiffre mesurable, et la charge de le produire incombe à quiconque vend le reranker. Le cas le plus proche dans l’étude ne joue pas en faveur du vendeur : MovieLens atteignait 17,4 % de rappel, à peu près le niveau des gagnants de H&M, et les cinq modèles de langage que Wang y a testés obtenaient tous un score inférieur au CF.

Le résultat de Wang laisse aux e-commerçants un choix sur la destination de leur argent. Une meilleure recherche relève le plafond. La seule voie pour le contourner que permet son cadre est la recherche générative, où le modèle produit lui-même les candidats, et il la laisse non testée. Shopee fait déjà tourner un tel système, UniRec, que nous avons couvert en mai. Tant qu’un fournisseur ne peut pas dire quelle part des achats finaux son modèle voit réellement, un budget de reranking plus élevé achète surtout un juge plus coûteux pour une liste courte qui, dans les huit jeux de données de Wang, manquait généralement la réponse.