Research & Trends

Ein Reranker kann nicht auswählen, was die Retrieval-Stufe ausgelassen hat

Eine CIKM-2026-Studie zeigt, dass ein Teil der veröffentlichten Erfolge von LLM-Rerankern auf einen Test zurückgeht, der die richtige Antwort bereits in die Liste einschleust – und dass unter realistischen Retrieval-Bedingungen keines der getesteten Upgrades signifikant besser abschnitt als einfaches Collaborative Filtering. Bevor ein Händler in einen intelligenteren Reranker investiert, sollte er fragen, welcher Anteil der späteren Käufe die Retrieval-Stufe dem Modell überhaupt jemals zeigt.

A robot butler fussily rearranges a dozen garments on a small rail while a nautilus in a naval coat watches from a gantry above a vast warehouse of racks the robot cannot reach.

Admiral Neritus Vale

Ein Empfehlungs-Reranker kann nur neu ordnen, was ihm die Retrieval-Stufe liefert – und eine Ende letzten Monats auf arXiv veröffentlichte Studie misst, wie selten das richtige Produkt überhaupt darunter ist. In The Recall Ceiling of LLM Recommendation Reranking, das im November als Vortrag auf der CIKM angenommen wurde, zeigt Zhaohui Wang, dass realistisches Retrieval über acht Datensätze hinweg nur 2–19 % der relevanten Artikel in eine 100 Elemente umfassende Kandidatenliste bringt. Unter diesen Bedingungen schlug keines der getesteten Upgrades die einfache Collaborative-Filtering-Basislinie (CF) auf seinen drei wichtigsten Amazon-Datensätzen signifikant. Ein Händler, dem “LLM-gestützte Personalisierung” angeboten wird, sollte zunächst fragen, welchen Anteil der richtigen Produkte seine Retrieval-Stufe überhaupt zutage fördert.

Ein Teil der veröffentlichten Erfolge von LLM-Rerankern stammt aus einem Test, der die Antwort vorab einschleust. Ein Teil einer Studie aus dem Jahr 2023 über LLMs als “Zero-Shot-Ranker” bewertete diese anhand von Listen, in denen das Element, für das sich der jeweilige Nutzer letztlich entschied, mit zufällig ausgewählten Alternativen gemischt wurde. Wang vergleicht die Methode damit, “eine Suchmaschine zu testen, nachdem man die Antwort vorab in den Index geladen hat”. Auf seinen drei Amazon-Datensätzen überschätzte dieser Ansatz den realistischen NDCG@10 – ein Standardwert dafür, wie weit oben die richtigen Elemente in einer Top-Ten-Liste stehen – um 92–95 %. Das Format hält sich hartnäckig: MemRerank, eine Arbeit vom März über personalisiertes Reranking für Shopping-Agenten, berichtet über die Trefferquote beim Auswählen des richtigen Produkts aus fünf Kandidaten, von denen einer immer korrekt ist. Solche Tests können Reranker fair miteinander vergleichen, aber Wang weist darauf hin, dass das Protokoll keine “absolute Aussage über die Leistung im Einsatz” zulässt, “weil die Größe, die dabei konstant gehalten wird, genau diejenige ist, die in der Praxis begrenzend wirkt.”

Ein Reranker erzielt für jeden Käufer, dessen nächster Kauf nie in seiner Liste auftauchte, den Wert null – egal wie klug das Modell ist. Beim in der Studie verwendeten Standard-CF-Retrieval traf das auf 92–98 % der Nutzer in den drei Amazon-Datensätzen zu. Wang macht daraus eine Obergrenze: In seinem Haupttest kann der erwartete NDCG eines Rerankers nicht höher liegen als der Recall der Liste, die er liest. Er räumt ein, dass die Idee intuitiv ist; was die Schranke hinzufügt, ist eine Zahl, an der sich jeder gemeldete Wert messen lässt.

Den Reranker intelligenter zu machen, brachte ihn nicht über CF hinaus. Wang probierte Prompt Engineering, Sprachmodelle mit einer 168-fachen Spanne an Größe, überwachte Reranker, LoRA-Feintuning, hybrides Retrieval aus Text und Verhalten sowie eine Fusion aus LLM und CF. Keiner dieser Ansätze erzielte auf den drei wichtigsten Amazon-Datensätzen einen statistisch signifikanten Gewinn. Mit aktiviertem “Denk”-Modus schnitt DeepSeeks im April veröffentlichtes V4-Pro bei Amazon Movies 43 % schlechter ab als CF. Denkketten, schreibt Wang, “haben nichts, womit sie arbeiten können, wenn die relevanten Elemente fehlen”.

Erhielt das Sprachmodell die eigenen Ränge und Werte von CF, verbesserte es sich vor allem dadurch, dass es sich diesen unterordnete. Seine Genauigkeit stieg bei jedem Datensatz, je näher seine Reihenfolge an die von CF heranrückte. Keine Variante schlug CF signifikant. In Wangs Worten: “Dem Modell zu sagen, was CF für richtig hielt, bringt ihm vor allem bei, stillzuhalten.” Selbst eine Mischung aus beiden, im Nachhinein auf die Testnutzer abgestimmt, “erreicht lediglich die Leistung von CF, nicht mehr”. Bei diesen Recall-Werten bestand das, was das Sprachmodell von sich aus beisteuerte, aus einer Reihe von Annahmen darüber, welche Artikel zueinander passen – und diese Annahmen schadeten mehr, als sie nutzten.

Die Kennzahl, nach der ein Händler bei einem Anbieter von Personalisierungslösungen fragen sollte, ist der Recall: der Anteil der später tatsächlich gekauften Produkte, die sich in der Liste befanden, die das Modell überhaupt lesen durfte.

Die Liste, die ein LLM liest, ist oft kürzer als die, die das Retrieval zurückgibt, und sie zu verlängern half nicht. Die Zero-Shot-LLMs in Wangs Tests lasen nur die obersten 30 von 100 Kandidaten – eine durch das Kontextbudget bedingte Entscheidung, die laut Wang gängiger Praxis entspricht. Bei Amazon Beauty senkte das den Anteil der relevanten Elemente im Blickfeld des Modells von 8,2 % auf 3,2 %. Eine Erweiterung der Liste von 10 auf 200 Kandidaten erhöhte den Recall, doch das LLM lag bei jeder Länge hinter CF zurück. Maßgeblich ist der Recall des Fensters, und jeder zusätzliche Kandidat verlängert einen Prompt, für den der Anbieter zahlt.

Die besten öffentlich verfügbaren Belege aus dem Modebereich liegen in derselben Recall-Region. Keiner von Wangs acht Datensätzen ist ein Bekleidungskatalog. H&Ms Kaggle-Wettbewerb von 2022 verlangte jedoch von den Teams, anhand von zwei Jahren echter H&M-Transaktionsdaten die Käufe jedes Kunden für die folgende Woche vorherzusagen. Die Retrieval-Stufe des Gewinnerteams erfasste 18,3 % der Käufe der letzten Woche des Datensatzes innerhalb ihrer Top-100-Kandidaten pro Kunde, wie Kazuki Fujikawa vom zwölftplatzierten Team zusammenfasst. Selbst das beste von rund 3.000 Teams ließ den Großteil der Käufe der folgenden Woche dort, wo kein Ranker sie erreichen konnte.

Der stärkste Einwand, den Wang selbst vorbringt, ist, dass ein System im Live-Betrieb weit mehr weiß als jeder Benchmark. Produktivsysteme beziehen Kandidaten aus vielen Quellen, nutzen Signale wie Verweildauer und Sitzungskontext, die seine Reranker nie zu sehen bekamen, und lernen aus Online-Feedback. Heben diese Vorteile den Recall auf 30 % oder mehr – was Wangs Protokoll als ausreichend einstuft –, lockert sich die Obergrenze, und ein intelligenterer Reranker hat Spielraum, seine Kosten zu rechtfertigen. Das ist eine Behauptung über eine messbare Zahl, und die Beweislast dafür liegt bei demjenigen, der den Reranker verkauft. Der Fall in der Studie, der dem am nächsten kommt, spricht nicht für den Verkäufer: MovieLens erreichte einen Recall von 17,4 % – etwa dort, wo die H&M-Gewinner lagen –, und alle fünf Sprachmodelle, die Wang dort testete, schnitten weiterhin schlechter ab als CF.

Wangs Ergebnis lässt Händlern die Wahl, wohin das Geld fließt. Besseres Retrieval hebt die Obergrenze an. Der einzige Weg, den sein Rahmenwerk darum herum zulässt, ist generatives Retrieval, bei dem das Modell die Kandidaten selbst erzeugt – und das lässt er ungetestet. Shopee betreibt mit UniRec, über das wir im Mai berichteten, bereits ein solches System. Solange ein Anbieter nicht sagen kann, welcher Anteil der späteren Käufe seinem Modell überhaupt gezeigt wird, kauft ein größeres Reranker-Budget lediglich einen teureren Richter über eine Shortlist, der in allen acht Datensätzen von Wang meist die richtige Antwort fehlte.