Fortgeschritten 11 Min.Optimierung

LLM-as-a-judge: Ein Modell durch einen Modell

Direkte Antwort

LLM-as-a-judge bedeutet, die Antworten eines Systems von einem anderen Modell bewerten zu lassen. Die grundlegende Studie (Zheng et al., MT-Bench und Chatbot Arena, 2023) zeigt, dass ein leistungsfähiges Bewertungsmodell wie GPT-4 eine Übereinstimmung von über 80 % mit menschlichen Präferenzen erreicht, vergleichbar mit der Übereinstimmung zwischen zwei Menschen — mit dokumentierten Verzerrungen hinsichtlich Position, Ausführlichkeit und Bevorzugung eigener Antworten sowie einer begrenzten Fähigkeit zum logischen Schlussfolgern. Bei lokalem Betrieb liefert ein Bewertungsmodell mit 13 bis 14 Milliarden Parametern bei paarweisen Vergleichen verwertbare Ergebnisse.

Die Antworten eines Modells von einem anderen Modell bewerten zu lassen, ist zur am weitesten verbreiteten Evaluationsmethode geworden, aus einem einfachen Grund: Sie ist die einzige, die sich skalieren lässt. Sie ist zugleich verzerrungsanfällig, manipulierbar und irreführend, wenn man ihre Ergebnisse als absolute Bewertung liest. Die Studie, die den Referenzrahmen geschaffen hat, vom LMSYS-Team (Chatbot Arena) veröffentlicht und auf der NeurIPS 2023 vorgestellt, sagt es selbst: Richtig eingesetzt vergleicht diese Methode zwei Versionen eines Systems; falsch eingesetzt liefert sie eine beruhigende Zahl, die nichts misst.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Der Ansatz und sein Vorteil

Man gibt einem Modell eine Frage, die Antwort des zu bewertenden Systems, gegebenenfalls die zur Beantwortung verwendeten Textpassagen und eine Referenzantwort sowie anschließend ein Bewertungsraster. Es liefert eine Note und eine Begründung. Wiederholt man dies für hundert Fälle, erhält man einen Indikator, den man im Zeitverlauf bei jeder Änderung des Prompts, des Modells oder eines Suchparameters verfolgen kann.

Die Alternative ist die menschliche Bewertung, die weiterhin als Maßstab gilt und sich nicht skalieren lässt: Niemand wird bei jeder Änderung des Prompts hundert Antworten erneut lesen. Der automatische Bewerter ermöglicht es, die Frage „Hat diese Änderung das System verbessert oder verschlechtert?“ in zehn Minuten zu beantworten, was die Arbeitsweise verändert. Genau diese Erkenntnis war der Anlass für den grundlegenden Artikel von Zheng et al.: Die bestehenden Benchmarks (MMLU und andere) messen nicht, worauf es in einem offenen Gespräch ankommt, und menschliche Bewertungen in großem Umfang sind zu teuer, um ein System, das sich jede Woche verändert, in schnellen Iterationen weiterzuentwickeln.

#Ein tragfähiges Bewertungsraster erstellen

Das RAG-Local-Kit

Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
  1. 01
    Jeweils ein Kriterium
    Eine Gesamtbewertung anzufordern, ist nicht aussagekräftig. Quellentreue, Relevanz und Vollständigkeit werden getrennt bewertet.
  2. 02
    Eine kurze, erläuterte Skala
    Drei oder vier Stufen, jeweils mit einer Erklärung ihrer Bedeutung. Eine Zehnerskala liefert Bewertungen, die nicht reproduzierbar sind.
  3. 03
    Die Begründung vor der Bewertung verlangen
    Ein Bewertungsmodell, das aufgefordert wird, zuerst zu schlussfolgern und dann ein Fazit zu ziehen, ist deutlich stabiler als eines, das einfach eine Zahl ausgibt. Dahinter steht dieselbe Logik wie bei der von Zheng et al. festgestellten „limited reasoning ability“: Die Vorgabe, den Gedankengang ausdrücklich darzulegen, verringert diese Einschränkung.
  4. 04
    Paarweise Vergleiche bevorzugen
    „Welche dieser beiden Antworten ist besser?“ ist eine Frage, die ein Modell viel besser beantworten kann als die Aufforderung „Bewerten Sie diese Antwort auf einer Skala bis fünf“ — dieses Format nutzt Chatbot Arena, um Modelle miteinander zu vergleichen.
i
Der paarweise Vergleich ist der Trick mit dem besten Aufwand-Nutzen-Verhältnis
Sie macht die Frage nach der Bewertungsskala überflüssig, reduziert die Varianz deutlich und beantwortet direkt, was Sie interessiert: Ist die neue Version besser als die alte? Denken Sie nur daran, die Reihenfolge der beiden Antworten abzuwechseln, da bei den bewertenden Modellen eine positionsbedingte Verzerrung dokumentiert ist.

#Verzerrungen und wie man sie begrenzt

Der maßgebliche Artikel zu diesem Thema benennt genau drei Verzerrungen und eine Einschränkung: Positionsbias, Verbositätsbias, Selbstbevorzugung (self-enhancement) und eine eingeschränkte Fähigkeit zum Schlussfolgern. Das ist keine Blog-Hypothese, sondern das zentrale Ergebnis der Studie, die MT-Bench und Chatbot Arena eingeführt hat – zwei Referenzen, die noch heute zur Rangordnung von Modellen verwendet werden.

Was eine automatische Bewertung verfälscht, nach Zheng et al. (2023)
BiasEffektContre-mesure
PositionDie erste angegebene Antwort wird bevorzugtDie Reihenfolge wechseln und den Mittelwert aus beiden Durchläufen bilden
AusführlichkeitEine längere Antwort wird bei gleicher Qualität als besser bewertetDies im Bewertungsraster angeben, die Länge auf beiden Seiten prüfen
Bevorzugung eigener AntwortenEin Bewerter bevorzugt Antworten aus seiner eigenen ModellfamilieEin Modell nicht mit sich selbst oder einem eng verwandten Modell beurteilen
Begrenztes SchlussfolgernDer Richter macht Fehler bei Aufgaben, die Berechnungen oder Schlussfolgerungen erfordernEine schriftliche Begründung vor der Note verlangen, niemals nur eine Note
GefälligkeitAlles erhält gute Bewertungen; die Bewertungen konzentrieren sich am oberen Ende der SkalaEin anspruchsvolles Bewertungsraster und Beispiele für schlechte Antworten im Prompt

Die gute Nachricht, die dieselbe Studie dokumentiert: Ein leistungsfähiger Bewerter wie GPT-4 erreicht auf MT-Bench und Chatbot Arena mehr als 80 % Übereinstimmung mit menschlichen Präferenzen – denselben Grad an Übereinstimmung, der auch zwischen zwei menschlichen Bewertern gemessen wurde. Die Faustregel, die dieses ganze Kapitel zusammenfasst: Ein Bewerter dient zum Vergleichen, niemals dazu, Qualität absolut zu bescheinigen. Eine Bewertung von 4,2 von 5 sagt nichts aus; eine Steigerung von 3,1 auf 3,8 auf demselben Testdatensatz mit demselben Bewerter sagt etwas tatsächlich Aussagekräftiges aus.

Die Bevorzugung ausführlicher Antworten ist keine rein theoretische Sorge: Der Benchmark AlpacaEval, der häufig zum Vergleich von Modellen verwendet wird, die anhand von Instruktionen angepasst wurden, ist ausdrücklich dafür bekannt, bei gleicher Qualität Modelle zu bevorzugen, die längere Antworten erzeugen. Seine längenkontrollierte Version („length-controlled“) erhöht die Korrelation mit den Ranglisten von Chatbot Arena von 0,94 auf 0,98 – ein zahlenmäßiger Beleg dafür, dass schon die Neutralisierung dieser einen Verzerrung die automatische Bewertung zwangsläufig näher an die menschliche Bewertung heranführt, statt sie davon zu entfernen.

#Ist ein lokaler Richter ernst zu nehmen?

Ja, unter zwei Bedingungen. Die erste betrifft die Größe: Unterhalb von etwa 14 Milliarden Parametern werden die Bewertungen instabil und das Ausgabeformat wird nicht mehr eingehalten, wodurch die Evaluationskampagne unbrauchbar wird – das entspricht dem Speicherrichtwert der Website (14B ≈ 9 GB in Q4). Die zweite betrifft den Kontext: Das bewertende Modell muss die Frage, die Passagen und die Antwort gleichzeitig in seinem Kontext aufnehmen können – ein ausgeschöpfter Kontext führt dazu, dass ein abgeschnittener Text bewertet wird, und niemand bemerkt es, weil das Modell auf Grundlage dessen, was es tatsächlich erhalten hat, weiterhin normal antwortet.

Der Vorteil eines lokalen Bewertungsmodells liegt auf der Hand, wenn die bewerteten Daten vertraulich sind: Jede Antwort und jede Passage zur Bewertung an eine externe API zu senden, macht den Vorteil zunichte, das System lokal gehalten zu haben. Das gilt besonders für medizinische, juristische oder finanzielle Anwendungsfälle, in denen die Quellpassagen selbst sensible Daten enthalten. Anders als im Produktivbetrieb ist eine Evaluationskampagne auch mit langsamer Verarbeitung gut vereinbar: Man startet sie nachts auf einer GPU, die tagsüber für andere Aufgaben genutzt wird, und ruft morgens die Ergebnisse ab.

#Werkzeuge, um die Pipeline nicht neu zu erfinden

Es ist nicht erforderlich, ein eigenes Judge-Harness von Grund auf zu schreiben. Prometheus, ein Open-Source-Forschungsprojekt, trainiert speziell ein Modell mit 13 Milliarden Parametern für diesen Zweck: « We train Prometheus, a 13B evaluator LLM that can assess any given long-form text based on customized score rubric provided by the user » (Wir trainieren Prometheus, ein 13B-Evaluator-LLM, das jeden beliebigen langen Text basierend auf einer von der Benutzerin oder dem Benutzer bereitgestellten benutzerdefinierten Bewertungsskala bewerten kann). Die Autoren berichten über eine Pearson-Korrelation von 0,897 mit menschlichen Bewertern über 45 benutzerdefinierte Bewertungsskalen, im Vergleich zu 0,882 für GPT-4 und nur 0,392 für ChatGPT im selben Protokoll — eine Lücke, die verdeutlicht, wie schlecht ein nicht spezialisiertes Modell urteilen kann, selbst wenn es in der Konversation ansonsten korrekte Antworten generiert.

Prometheus
13B, offen, speziell für eine differenzierte Bewertung anhand eines individuell angepassten Bewertungsrasters entwickelt; eine solide Grundlage für ein dediziertes lokales Bewertungsmodell statt eines Allzweckmodells, das zweckentfremdet wird.
Ein Allzweckmodell mit 14 Milliarden Parametern oder mehr
Qwen, Llama oder Mistral in diesem Größenbereich eignen sich ebenfalls als Bewertungsinstanz – mit einem sorgfältig formulierten Bewertungsraster statt eines speziell auf diese konkrete Aufgabe ausgerichteten Trainings.
Ein Framework für Orchestrationsprozesse
Nützlich, um die Testkampagne zu starten, die Ergebnisse zu speichern und die Entwicklung des Scores im Laufe der Zeit zu verfolgen, statt jedes Mal alles neu zu programmieren, wenn ein Test mit einer neuen Version erneut durchgeführt werden muss.

#Wie ein robuster Judge-Prompt aussieht

Wenden wir die vier Regeln aus dem vorherigen Abschnitt auf einen konkreten Fall an: ein internes RAG-System, das Fragen zu Verfahrensabläufen beantwortet. Der Prompt für das bewertende Modell muss ausdrücklich die gestellte Frage, die gefundenen Quellpassagen, die zu bewertende Antwort, ein Bewertungsraster mit getrennten Kriterien und die Anweisung enthalten, die Bewertung vor der Punktevergabe zu begründen. Das zu formulieren dauert länger als ein einfaches „Bewerte diese Antwort auf einer Skala von zehn Punkten“, aber genau dieses Detail unterscheidet eine auswertbare Evaluationskampagne von einer Zahl, die beruhigt, ohne etwas zu messen.

Prompt-Grundgerüst für ein Bewertungsmodell (paarweiser Vergleich)
Question de l'utilisateur : {question}
Passages source fournis au système : {passages}

Réponse A : {reponse_a}
Réponse B : {reponse_b}

Pour chaque réponse, évalue séparément :
1. Fidélité aux passages fournis (aucune affirmation absente des sources)
2. Pertinence par rapport à la question posée
3. Complétude (la question est traitée entièrement)

Justifie d'abord ton analyse pour chaque critère, puis conclus par :
Meilleure réponse : A ou B
Raison en une phrase.

Zwei Details machen in diesem Grundgerüst den entscheidenden Unterschied. Erstens erhält das bewertende Modell die Quellpassagen, nicht nur die Antwort: Ohne sie lässt sich nur die Form prüfen, nicht die inhaltliche Treue. Zweitens steht die Begründung im Prompt vor der Schlussfolgerung — ein bewertendes Modell, das zuerst eine Bewertung abgeben soll, neigt dazu, diese nachträglich zu rechtfertigen, statt vor der Entscheidung zu schlussfolgern. Dies verschärft die in der Referenzstudie festgestellte begrenzte Fähigkeit zum logischen Schlussfolgern. Schließlich neutralisiert ein Wechsel der Reihenfolge der Antworten A und B von Fall zu Fall mit anschließender Mittelung der beiden Durchläufe den Großteil der von Zheng et al. dokumentierten Positionsverzerrung.

#Wann man darauf verzichten sollte

Um ein System mit hohem Risiko zu validieren
Medizin, Recht, Finanzen: Ein automatisches Bewertungssystem ersetzt keine menschliche Prüfung bei Fällen, in denen Haftungsfragen berührt werden.
Um zwei sehr unterschiedliche Systeme zu vergleichen
Verzerrungen zugunsten bestimmter Stile und Antwortlängen dominieren, sobald sich die Antwortformate unterscheiden, wie die von Zheng et al. dokumentierte Bevorzugung ausführlicher Antworten zeigt.
Wenn ein deterministischer Test existiert
Wenn die richtige Antwort eine Zahl oder ein exakter Wert ist, ist ein einfacher Vergleich genauer und unendlich viel günstiger als ein LLM als Bewertungsinstanz.
Bei zu geringer Anzahl von Fällen
Bei zehn Fragen ist die Varianz der Generierung größer als der Unterschied, den Sie messen möchten.

#FAQ

Kann ein Modell ein anderes wirklich beurteilen?+
Gut genug, um zwei Versionen desselben Systems anhand eines unveränderten Testdatensatzes zu vergleichen: Die Referenzstudie misst eine Übereinstimmung von mehr als 80 % zwischen einem leistungsfähigen Bewertungsmodell und menschlichen Präferenzen – ein Niveau, das mit der Übereinstimmung zwischen zwei Menschen vergleichbar ist. Nicht gut genug, um eine absolute Bewertung abzugeben oder einen folgenreichen Einsatz allein zu validieren.
Welche Modellgröße für das Bewertungsmodell?+
In der Praxis mindestens 13 bis 14 Milliarden Parameter, bei langen Antworten auch mehr: Das ist die Größe des speziell für diese Rolle entwickelten Modells Prometheus. Darunter sind die Bewertungen instabil, und das erwartete Ausgabeformat (Bewertung, Begründung) wird häufig nicht eingehalten.
Muss das bewertende Modell ein anderes sein als das bewertete Modell?+
Ja. Die Studie von Zheng et al. dokumentiert eine Bevorzugung der eigenen Modellfamilie (self-enhancement): Ein Modell neigt dazu, Antworten aus seiner eigenen Familie besser zu bewerten, auch die einer leicht abweichenden Version seiner selbst. Dasselbe Modell auf beiden Seiten einzusetzen, liefert eine schmeichelhafte Zahl, die für keinerlei Entscheidung brauchbar ist, insbesondere vor einem Versionswechsel im Produktivbetrieb.
Bewertung oder Paarvergleich?+
Fast immer der paarweise Vergleich: weniger Varianz, keine Probleme mit der Bewertungsskala, und er beantwortet direkt die Frage „Ist es besser als vorher?“. Dieses Format nutzt Chatbot Arena, um Modelle in eine Rangfolge zu bringen. Denken Sie daran, die Reihenfolge der Präsentation abzuwechseln, um positionsbedingten Verzerrungen entgegenzuwirken.
Wie viele Fälle sind für eine aussagekräftige Evaluationskampagne erforderlich?+
Dreißig bis fünfzig reale Fälle bilden eine vernünftige Grundlage, um damit zu beginnen, einen echten Unterschied vom Generationsrauschen zu unterscheiden, vorausgesetzt, sie decken die tatsächliche Vielfalt der an das System gestellten Fragen ab. Bei weniger als etwa zehn Fragen übersteigt die Variabilität der Generierung die Unterschiede bei Weitem, die Sie zwischen zwei Versionen desselben Systems zu messen versuchen.
Ist Prometheus als Bewerter besser als ein Allzweckmodell?+
Bei den im Artikel getesteten individuellen Bewertungsrastern erreicht Prometheus (13B) eine Korrelation von 0,897 mit menschlichen Bewertungen, gegenüber 0,882 für GPT-4 und 0,392 für ChatGPT. Das ist ein starkes Indiz, wurde aber mit seinem eigenen Evaluationsprotokoll ermittelt: Sie müssen das Modell weiterhin anhand Ihres eigenen Bewertungsrasters validieren, bevor Sie ihm im Produktivbetrieb vertrauen.
Ist der Verbosity-Bias wirklich messbar?+
Ja: Der Benchmark AlpacaEval, der dafür bekannt ist, lange Antworten zu bevorzugen, hat den Effekt durch die Korrektur dieser Verzerrung präzise gemessen. Seine Version, die den Einfluss der Antwortlänge neutralisiert, erhöht die Korrelation mit den von Menschen erstellten Ranglisten von Chatbot Arena von 0,94 auf 0,98. Damit wird der Gewinn konkret beziffert, der durch die Beseitigung allein dieser Verzerrung bei der automatischen Bewertung erzielt wird.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.