Händler können fünfzig Policies betreiben. Vergleichen können sie sich nur drei leisten.
Ranking-, Pricing- und Shopping-Agenten sind allesamt zu austauschbaren Policies zusammengeschmolzen, und eine neue zu erzeugen kostet inzwischen nur noch einen Prompt. Sie zu vergleichen kostet abgeschlossene Bestellungen, und die Rechnung sagt: Ein Händler kann sich etwa drei leisten.
Admiral Neritus Vale
Der knappe Rohstoff im Retail-AI-Geschäft ist längst nicht mehr das Modell. Es ist der Kunde, dessen Bestellung man dafür opfert, zu beweisen, dass ein Modell besser ist als ein anderes. Ranking-Engines, Pricing-Regeln und konversationelle Shopping-Agenten sind alle beim selben Objekt gelandet: einer austauschbaren Policy, billig in der Herstellung und teuer in der Beurteilung. Das Angebot an Kandidaten ist rasant gestiegen, der verfügbare Traffic, um zwischen ihnen zu entscheiden, hat sich dagegen kaum bewegt. Der bindende Engpass hat sich verschoben – weg von dem, was ein Händler bauen kann, hin zu dem, was er sich zu vergleichen leisten kann.
Kandidaten-Policies werden inzwischen von anderen Modellen geschrieben, weshalb es plötzlich so viele davon gibt. MetaStrategy, im Einsatz auf Taobaos Startseiten-Feed, lässt ein LLM ein typisiertes JSON-Bündel aus Zielgewichtungen, Kategorienpräferenzen und Positionsregeln ausgeben und kompiliert es dann zu einem Generator, der “atomar mit den bisherigen Platzhirschen konkurriert”. Netflix’ GenRec ersetzt einen mit Feature-Engineering gebauten Ranker durch ein LLM, das auf Ranking-Labels nachtrainiert wurde. Beide können plausible Varianten schneller ausspucken, als ein Team sie testen kann. Einen Herausforderer zu produzieren ist praktisch kostenlos; zu belegen, dass er besser ist, wird in Käufen bezahlt.
Wie viele Käufe ein Vergleich braucht, bestimmt der Effekt, den man sucht, und das hängt stärker von der Baseline ab, als die Intuition vermuten lässt. Statistische Power skaliert die benötigte Stichprobe mit der Varianz geteilt durch das Quadrat des Effekts – ein Zusammenhang, den Ronny Kohavi in seiner KDD-2015-Keynote als n proportional zu Sigma-Quadrat über Delta-Quadrat formuliert. Bei einem fixen relativen Lift belohnt diese Formel eine Seite mit hoher Conversion und bestraft eine mit niedriger: Dieselbe prozentuale Bewegung erzeugt auf einer kleineren Basis eine kleinere absolute Verschiebung, die eine größere Stichprobe braucht, um überhaupt entdeckt zu werden. Bei 95 % Konfidenz und 80 % Power braucht es rund 7,7 Millionen Bestellungen über beide Arme hinweg, um eine relative Bewegung von einem Prozent gegen eine Baseline-Conversion von vier Prozent zu erfassen. Gegen eine Baseline von einem Prozent braucht derselbe Test etwa das Vierfache: rund 31,7 Millionen. Sensitivität wird in Transaktionen erkauft, und Transaktionen sind der eine Rohstoff, den ein Händler nicht einfach herstellen kann.
Weitere Kandidaten treiben diese Rechnung gleich zweifach in die Höhe, und die zweite Steigerung ist die, die Teams gerne vergessen. Eine gemeinsame Kontrollgruppe hilft, denn bei der Standard-Allokation gegen eine einzelne Baseline bemisst sich die Kontrollgruppengröße an der Quadratwurzel der Anzahl der Herausforderer multipliziert mit dem Traffic jedes einzelnen. Die Korrektur für multiple Vergleiche wirkt dem entgegen, weil eine fixe familienweise Fehlerrate jeden Test auf eine strengere Schwelle und damit eine größere Stichprobe zwingt. Verrechnet man beides, ist die Arithmetik gnadenlos. Drei Kandidaten-Policies kosten etwa das Zweieinhalbfache eines einzelnen A/B-Tests. Fünfzig kosten etwa das Fünfunddreißigfache – ein Multiplikator, der nur deshalb so niedrig bleibt, weil die gemeinsame Kontrollgruppe tatsächlich etwas leistet.
Hält man diese Multiplikatoren gegen ein reales Auftragsbuch, hört der Engpass auf, abstrakt zu sein. ASOS lieferte in den 52 Wochen bis zum 31. August 2025 57,3 Millionen Bestellungen aus, wie die Ergebnismitteilung des Unternehmens zeigt. Das sind rund 157.000 pro Tag – klingt üppig, bis man sie auf mehrere Arme aufteilen muss.
Bei diesem Volumen kostet der Vergleich von drei Policies bei einprozentiger Sensitivität, selbst gegen die gnädigere Baseline von vier Prozent, rund vier Monate von allem, was ASOS verkauft – unter der fantastischen Annahme, dass das gesamte Auftragsbuch in den Test fließt. Weitet man das Feld auf fünfzig aus, verschlingt dieselbe fantastische Annahme den größten Teil von fünf Jahren.
Kein Händler steckt sein gesamtes Auftragsbuch in eine einzige Testzelle. Reduziert man die Allokation auf ein Viertel des Traffics, überdauert allein der Drei-Policy-Vergleich ein ganzes Handelsjahr. Die fünfzig Policies sind kein Portfolio an Optionen; sie sind eine Warteschlange.
Kohavi hat die Obergrenze bereits 2015 festgehalten, als Kandidaten noch von Hand gebaut wurden: Bei zwanzig Prozent der Nutzer “konnte Bing nur 5 disjunkte Varianten laufen lassen”.
Bings 250 Experimente an einem typischen Tag sind nicht das Gegenbeispiel, als das sie erscheinen. Sie überlappen sich über getrennte Oberflächen hinweg, jede mit einer unabhängigen Fragestellung, während fünfzig Kandidaten-Ranker für einen einzigen Slot um dieselben Conversion-Events konkurrieren.

Der stärkste Einwand lautet, der Vergleich sei doch schon offline billig gemacht worden. Man spielt die Logs erneut ab, bewertet fünfzig Kandidaten anhand historischer Interaktionen, befördert die besten drei, und die Rechnung schrumpft zusammen. Damit das trägt, müsste offline ermitteltes Ranking die Online-Reihenfolge erhalten – der Kandidat mit dem besten Score auf historischen Daten müsste auch derjenige sein, der tatsächlich Umsatz bewegt. Booking.com hat diese These über 23 Vergleiche eines bewährten Modells gegen einen Herausforderer getestet. Die Korrelation zwischen offline gemessenem Leistungsgewinn und geschäftlichem Wertgewinn lag bei minus 0,1, mit einem 90-%-Konfidenzintervall von minus 0,45 bis 0,27. Die Korrelation hielt nur dort, wo die Offline-Metrik die Geschäftsmetrik bereits fast exakt abbildete – was in einem lebenden Ranking-System selten der Fall war.
Dass dieser Befund so eng gefasst ist, ist der eigentliche Punkt, kein Makel. Bookings Modelle waren bereits gut, ausgerichtet auf eine einzige Metrik innerhalb eines einzigen Produkts – genau die Position, in der jeder ausgereifte Händler steckt, wenn er fünfzig Kandidaten-Ranker aufreiht. Taobaos Team ist aufschlussreich: MetaStrategy wurde in einer Replay-Umgebung trainiert, die geloggte Anfragen erneut durch den Live-Stack laufen lässt, ohne Nutzer tatsächlich auszusetzen – und kaufte sich trotzdem einen siebentägigen randomisierten Test, um einen Gewinn von 2,11 % bei Click Page Views zu belegen. CASP, ein im April auf arXiv erschienenes Paper zur Offline-Policy-Selektion, validiert an Simulationen und einem rekonstruierten MovieLens-Katalog statt an einem echten Retail-Deployment, benennt den Mechanismus: Ein Wechsel des Kandidaten-Generators verändert sowohl den Wert einer Policy als auch die Datenbasis, auf der ihre Schätzung ruht. Offline-Screening verengt das Feld; es entscheidet nicht darüber, und das Entscheiden ist es, was kostet.
Die Forschung greift das Vergleichsbudget inzwischen direkt an, allerdings nicht aus dem Retail-Bereich heraus. Dynamically Allocating Evaluation Effort for Model Ranking, veröffentlicht am 4. August, behandelt die Bewertung mehrerer Modelle als Best-Arm-Identifikation mit korrelierten Armen und samplet adaptiv, sodass sich das Budget auf die noch aussichtsreichen Modelle konzentriert. Der Anwendungsfall ist menschliche Bewertung von NLP-Systemen, nicht Shopper, und der Optimalitätsbeweis betrifft Annotationsstunden. Die Struktur überträgt sich trotzdem auf ein Retail-A/B/n-Programm, weil das zugrunde liegende Problem identisch ist: kostspielige Rollouts, ein festes Budget, ein Feld von Kandidaten, von denen die meisten verlieren. Was sich nicht überträgt, ist die Währung, denn ein Retail-Rollout wird in Kunden bezahlt, die die verlierende Policy zu spüren bekommen haben.
Fünfzig Policies sind keine Strategie; sie sind eine Rechnung, die niemand gelesen hat. Wenn die Erzeugung von Kandidaten immer billiger wird, während das Bestellvolumen es nicht tut, wandert der Vorteil zu den Händlern mit den besten Fragen, nicht zu denen mit den besten Modellen. Die drei Vergleiche zu benennen, die ein Jahr an Sensitivität wert sind, ist eine Merchandising-Entscheidung im Gewand eines Statistikers, und sie gehört in die Hände von Leuten, die wissen, was das Geschäft eigentlich bewegen soll. Die siebenundvierzig Policies, die nie getestet werden, sind keine verpassten Gelegenheiten. Sie sind der Preis für drei gute Fragen.