Drei Menschen hörten eine sichere Übergabe. Zwei Modelle bewerteten sie als Fehlschlag.
Ein Sprinklr-AI-Paper bewertete 242 Voice-Agent-Gespräche mit drei menschlichen Annotatoren und zwei OpenAI-Richtern und stellte fest, dass die Richter Retail-Servicekennzahlen zuverlässig einordnen, dabei aber nur einen Bruchteil des Sicherheitsverhaltens erfassen, das Menschen wahrnehmen. Die Lücke betrifft ausgerechnet den einen Anruf, den ein Händler am dringendsten korrekt bewertet haben muss.
Neritus Vale
Ein Händler, der Voice Agents für Retouren und Bestelländerungen einsetzt, kann sich nicht jeden Anruf selbst anhören – also hört ein zweites Modell mit und vergibt die Note. Welche dieser Noten tatsächlich belastbar sind, hat bislang niemand beziffert. Ein gestern auf arXiv überarbeitetes Paper von Forschern bei Sprinklr AI hat 242 Voice-Agent-Gespräche zweifach bewertet: einmal durch drei geschulte menschliche Annotatoren, einmal durch GPT-4.1 und GPT-5 nach demselben Bewertungsraster. Beide Bewertungsverfahren sortieren die Kennzahlen gleich: Was bei einem Menschen hoch bewertet wird, bewertet auch das Modell hoch. Uneinig sind sie sich beim Niveau – und bei den Sicherheitskennzahlen erreicht diese Uneinigkeit den Faktor sechs. Die Empfehlung des Papers selbst: LLM-Bewerter seien “am besten als skalierbares Werkzeug für eine erste Durchsicht” geeignet.
Die Stichprobe ist enger gefasst, als die Gesamtzahl vermuten lässt. Aus dem Einzelhandel stammten 120 dieser Gespräche, davon waren 98 Retouren, Umtausch, Bestelländerungen oder Stornierungen. Das ist das transaktionale Ende des Service, bei dem sich die richtige Antwort anhand eines Bestelldatensatzes überprüfen lässt. Beratungsgespräche fehlen völlig: kein Styling-Anruf, kein Streit um Größen, kein Kunde, dessen Geschenk nicht ankam. Der Befund bleibt dennoch bestehen – denn Sprinklr verkauft genau das, was hier getestet wird: Software für Qualitätsmanagement, die “automatisch 100 % der Kundeninteraktionen über Sprache, Chat, E-Mail, Social Media und Messaging-Kanäle bewertet”. Ein Anbieter, der die Grenzen automatisierter Bewertung auf Kennzahlenebene veröffentlicht, argumentiert damit gegen seine eigene Produktseite.
Im Einzelhandel schneidet das Modell am besten ab, und der Grund liegt in der Domäne, nicht im Modell selbst. Über alle zehn Kennzahlen hinweg korrelieren menschliche und modellgestützte Bewertungen im Einzelhandel bei 0,912 für GPT-4.1. Die Autoren deuten das so, dass das Modell die richtige Struktur erfasst und lediglich eine Neuskalierung braucht – eine einmal angepasste, lineare Korrektur pro Kennzahl. Im Telekombereich fällt dieselbe Korrelation auf 0,295 und ist statistisch nicht mehr signifikant. Gleiche Modelle, gleiches Bewertungsraster, dieselben drei Prompt-Konfigurationen – verändert hat sich nur das Gespräch.
Die Ausnahme ist Sicherheit, und das ist kein Rundungsfehler. Zwei Kennzahlen tragen diese Lücke: Safety Recall, also wie konsequent der Agent nachfragt, wenn eine Bestätigung nötig ist, und Irreversible Action Safety, der Anteil an Stornierungen und Belastungen, die erst nach Zustimmung des Kunden ausgeführt wurden. Im Telekombereich setzten alle drei Annotatoren die Irreversible Action Safety zwischen 0,794 und 1,000 an – das beschreibt einen Agenten, der fast immer nachfragt, bevor er handelt. Die Modelle, die dieselben Transkripte nach demselben Raster lesen, landen bei etwa einem Fünftel dieses Werts. Das Paper behandelt ein Defizit bei dieser Kennzahl als kritisches Sicherheitsversagen – die beiden Bewertungsverfahren beschreiben also nicht denselben Anruf.
Die Autoren führen die Lücke auf eine einzige Mehrdeutigkeit zurück – und genau die entscheidet auch im Retail-Service. Wenn ein Agent eine risikoreiche Aktion an einen Menschen übergibt, schwankt das Modell zwischen zwei Lesarten identischen Verhaltens: den Agenten für die Eskalation zu belohnen oder ihn dafür zu bestrafen, die Aufgabe nicht selbst zu Ende gebracht zu haben. Der Text des Bewertungsrasters für eine notwendige Eskalation lasse sich, so schreiben sie, “kaum eindeutig formulieren”. Die daraus folgende Inkonsistenz “unterdrückt die Erkennung realer Sicherheitsereignisse”. Ein menschlicher Annotator wendet auf das Transkript situatives Urteilsvermögen an; ein Modell, das in einem einzigen Durchgang bewertet, hat nichts dergleichen zur Verfügung.
Ein Modell, das eine Übergabe nicht zuverlässig von einem Fehlschlag unterscheiden kann, kann auch nicht die Entscheidung bewerten, um die es im Retail-Service eigentlich geht.
Kunden haben diese Entscheidung längst eingepreist. Eine Gartner-Umfrage aus Februar/März unter B2B- und B2C-Kunden ergab, dass 87 % die Möglichkeit, einen Menschen zu erreichen, für unverzichtbar halten, sobald ein Unternehmen generative KI im Service einsetzt. Das ist die Forderung nach einem Ausweg, kein Urteil über Kompetenz. Noch dünner ist die Toleranz für eine schlechte automatisierte Interaktion: Kaum ein Viertel derselben Kunden gab an, einen Chatbot nach einer negativen Erfahrung noch einmal zu nutzen. Gartners Eric Keller formulierte in derselben Pressemitteilung die Grundregel: “Serviceverantwortliche sollten GenAI nicht als verpflichtenden ersten Schritt für jedes Anliegen einsetzen.” Welche Anliegen zuerst auf ein Modell treffen und welche auf einen Menschen, ist eine Routing-Entscheidung, die auf Qualitätsbewertungen beruht.
Das stärkste Argument dagegen, all das als Warnung zu lesen, liefert das Paper selbst. Die Sicherheitsverhältnisse im Einzelhandel bleiben über beide Kennzahlen und alle drei Konfigurationen hinweg zwischen 1,06 und 1,75, und in einer Zelle kehrt sich die Lücke sogar um, je nachdem, welcher Annotator als Referenz dient. Eine Abweichung dieser Größenordnung ist ein Korrekturfaktor, kein Widerspruch. Der Telekombereich trägt die Warnung, und die Autoren sagen das auch so: “Das Argument für menschliche Aufsicht bei Sicherheit stützt sich hauptsächlich auf den Telekombereich.” Im Einzelhandel korreliert das Modell gut, kalibriert sauber, und ein Händler könnte das Ergebnis durchaus als Freigabe lesen, die Bewertung zu automatisieren.
Die Antwort liegt darin, worauf die guten Zahlen im Einzelhandel eigentlich beruhen. Der Safety-Recall-Wert des Referenz-Annotators im Einzelhandel reicht über die drei Konfigurationen hinweg von 0,518 bis 0,699, mit vergleichbaren Schwankungen bei der Irreversible Action Safety – während sich die menschliche Baseline im Telekombereich kaum bewegt. Das ist eine enge Passung auf ein bewegliches Ziel. Die Autoren fügen die wichtigere Einschränkung hinzu: Die Übereinstimmung wurde auf Ebene aggregierter Kennzahlen gemessen, nicht auf Ebene einzelner Gespräche, was sie zu “einer oberen Grenze” macht. Ein Händler kann der Rangordnung des Modells vertrauen, welche Kennzahlen bei seinem Voice Agent am schwächsten sind – nicht aber dessen Urteil über einen einzelnen Anruf. Und genau ein einzelner Anruf ist es, der eskaliert wird.
Kalibrierung ist die günstige Lösung, und das Paper zeigt, wo sie greift: dort, wo der menschliche Zielwert über Annotatoren hinweg reproduzierbar ist – was bei Critical Field Accuracy der Fall ist, bei ASR-robuster Zielerreichung aber nicht. Die Sicherheitskennzahlen liegen dazwischen: unter Menschen reproduzierbar, gegenüber den Modellen aber weit auseinander – ein Zustand, den die Autoren als “gut geeignet für Kalibrierung” bezeichnen. Was das von einem Händler verlangt, ist nicht ein besseres Bewertungsmodell, sondern eine ausreichend große, menschlich bewertete Stichprobe, um den Versatz zu bestimmen – neu kalibriert pro Domäne und pro Kennzahl. Wenn sich Voice Agents zunehmend von Retouren hin zu Beratungsgesprächen bewegen, taucht das Problem des Bewertungsrasters vor dem Modellproblem auf, denn niemand hat bislang eine Definition einer korrekten Übergabe formuliert, die präzise genug wäre, damit ein Modell sie bewerten kann. Diese Definition ist ein Dokument, kein Modell-Upgrade – und von beidem das günstigere.