LLM-as-a-judge: Ein Modell durch einen Modell
LLM-as-a-judge bedeutet, die Antworten eines Systems von einem anderen Modell bewerten zu lassen. Die grundlegende Studie (Zheng et al., MT-Bench und Chatbot Arena, 2023) zeigt, dass ein leistungsfähiges Bewertungsmodell wie GPT-4 eine Übereinstimmung von über 80 % mit menschlichen Präferenzen erreicht, vergleichbar mit der Übereinstimmung zwischen zwei Menschen — mit dokumentierten Verzerrungen hinsichtlich Position, Ausführlichkeit und Bevorzugung eigener Antworten sowie einer begrenzten Fähigkeit zum logischen Schlussfolgern. Bei lokalem Betrieb liefert ein Bewertungsmodell mit 13 bis 14 Milliarden Parametern bei paarweisen Vergleichen verwertbare Ergebnisse.
Die Antworten eines Modells von einem anderen Modell bewerten zu lassen, ist zur am weitesten verbreiteten Evaluationsmethode geworden, aus einem einfachen Grund: Sie ist die einzige, die sich skalieren lässt. Sie ist zugleich verzerrungsanfällig, manipulierbar und irreführend, wenn man ihre Ergebnisse als absolute Bewertung liest. Die Studie, die den Referenzrahmen geschaffen hat, vom LMSYS-Team (Chatbot Arena) veröffentlicht und auf der NeurIPS 2023 vorgestellt, sagt es selbst: Richtig eingesetzt vergleicht diese Methode zwei Versionen eines Systems; falsch eingesetzt liefert sie eine beruhigende Zahl, die nichts misst.
#Der Ansatz und sein Vorteil
Man gibt einem Modell eine Frage, die Antwort des zu bewertenden Systems, gegebenenfalls die zur Beantwortung verwendeten Textpassagen und eine Referenzantwort sowie anschließend ein Bewertungsraster. Es liefert eine Note und eine Begründung. Wiederholt man dies für hundert Fälle, erhält man einen Indikator, den man im Zeitverlauf bei jeder Änderung des Prompts, des Modells oder eines Suchparameters verfolgen kann.
Die Alternative ist die menschliche Bewertung, die weiterhin als Maßstab gilt und sich nicht skalieren lässt: Niemand wird bei jeder Änderung des Prompts hundert Antworten erneut lesen. Der automatische Bewerter ermöglicht es, die Frage „Hat diese Änderung das System verbessert oder verschlechtert?“ in zehn Minuten zu beantworten, was die Arbeitsweise verändert. Genau diese Erkenntnis war der Anlass für den grundlegenden Artikel von Zheng et al.: Die bestehenden Benchmarks (MMLU und andere) messen nicht, worauf es in einem offenen Gespräch ankommt, und menschliche Bewertungen in großem Umfang sind zu teuer, um ein System, das sich jede Woche verändert, in schnellen Iterationen weiterzuentwickeln.
#Ein tragfähiges Bewertungsraster erstellen
Ihre Dokumente, Ihre KI: ein zuverlässiges lokales RAG für Ihre PDFs, Notizen und E-Mails – ohne Daten in die Cloud zu senden.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- 01Jeweils ein KriteriumEine Gesamtbewertung anzufordern, ist nicht aussagekräftig. Quellentreue, Relevanz und Vollständigkeit werden getrennt bewertet.
- 02Eine kurze, erläuterte SkalaDrei oder vier Stufen, jeweils mit einer Erklärung ihrer Bedeutung. Eine Zehnerskala liefert Bewertungen, die nicht reproduzierbar sind.
- 03Die Begründung vor der Bewertung verlangenEin Bewertungsmodell, das aufgefordert wird, zuerst zu schlussfolgern und dann ein Fazit zu ziehen, ist deutlich stabiler als eines, das einfach eine Zahl ausgibt. Dahinter steht dieselbe Logik wie bei der von Zheng et al. festgestellten „limited reasoning ability“: Die Vorgabe, den Gedankengang ausdrücklich darzulegen, verringert diese Einschränkung.
- 04Paarweise Vergleiche bevorzugen„Welche dieser beiden Antworten ist besser?“ ist eine Frage, die ein Modell viel besser beantworten kann als die Aufforderung „Bewerten Sie diese Antwort auf einer Skala bis fünf“ — dieses Format nutzt Chatbot Arena, um Modelle miteinander zu vergleichen.
#Verzerrungen und wie man sie begrenzt
Der maßgebliche Artikel zu diesem Thema benennt genau drei Verzerrungen und eine Einschränkung: Positionsbias, Verbositätsbias, Selbstbevorzugung (self-enhancement) und eine eingeschränkte Fähigkeit zum Schlussfolgern. Das ist keine Blog-Hypothese, sondern das zentrale Ergebnis der Studie, die MT-Bench und Chatbot Arena eingeführt hat – zwei Referenzen, die noch heute zur Rangordnung von Modellen verwendet werden.
| Bias | Effekt | Contre-mesure |
|---|---|---|
| Position | Die erste angegebene Antwort wird bevorzugt | Die Reihenfolge wechseln und den Mittelwert aus beiden Durchläufen bilden |
| Ausführlichkeit | Eine längere Antwort wird bei gleicher Qualität als besser bewertet | Dies im Bewertungsraster angeben, die Länge auf beiden Seiten prüfen |
| Bevorzugung eigener Antworten | Ein Bewerter bevorzugt Antworten aus seiner eigenen Modellfamilie | Ein Modell nicht mit sich selbst oder einem eng verwandten Modell beurteilen |
| Begrenztes Schlussfolgern | Der Richter macht Fehler bei Aufgaben, die Berechnungen oder Schlussfolgerungen erfordern | Eine schriftliche Begründung vor der Note verlangen, niemals nur eine Note |
| Gefälligkeit | Alles erhält gute Bewertungen; die Bewertungen konzentrieren sich am oberen Ende der Skala | Ein anspruchsvolles Bewertungsraster und Beispiele für schlechte Antworten im Prompt |
Die gute Nachricht, die dieselbe Studie dokumentiert: Ein leistungsfähiger Bewerter wie GPT-4 erreicht auf MT-Bench und Chatbot Arena mehr als 80 % Übereinstimmung mit menschlichen Präferenzen – denselben Grad an Übereinstimmung, der auch zwischen zwei menschlichen Bewertern gemessen wurde. Die Faustregel, die dieses ganze Kapitel zusammenfasst: Ein Bewerter dient zum Vergleichen, niemals dazu, Qualität absolut zu bescheinigen. Eine Bewertung von 4,2 von 5 sagt nichts aus; eine Steigerung von 3,1 auf 3,8 auf demselben Testdatensatz mit demselben Bewerter sagt etwas tatsächlich Aussagekräftiges aus.
Die Bevorzugung ausführlicher Antworten ist keine rein theoretische Sorge: Der Benchmark AlpacaEval, der häufig zum Vergleich von Modellen verwendet wird, die anhand von Instruktionen angepasst wurden, ist ausdrücklich dafür bekannt, bei gleicher Qualität Modelle zu bevorzugen, die längere Antworten erzeugen. Seine längenkontrollierte Version („length-controlled“) erhöht die Korrelation mit den Ranglisten von Chatbot Arena von 0,94 auf 0,98 – ein zahlenmäßiger Beleg dafür, dass schon die Neutralisierung dieser einen Verzerrung die automatische Bewertung zwangsläufig näher an die menschliche Bewertung heranführt, statt sie davon zu entfernen.
#Ist ein lokaler Richter ernst zu nehmen?
Ja, unter zwei Bedingungen. Die erste betrifft die Größe: Unterhalb von etwa 14 Milliarden Parametern werden die Bewertungen instabil und das Ausgabeformat wird nicht mehr eingehalten, wodurch die Evaluationskampagne unbrauchbar wird – das entspricht dem Speicherrichtwert der Website (14B ≈ 9 GB in Q4). Die zweite betrifft den Kontext: Das bewertende Modell muss die Frage, die Passagen und die Antwort gleichzeitig in seinem Kontext aufnehmen können – ein ausgeschöpfter Kontext führt dazu, dass ein abgeschnittener Text bewertet wird, und niemand bemerkt es, weil das Modell auf Grundlage dessen, was es tatsächlich erhalten hat, weiterhin normal antwortet.
Der Vorteil eines lokalen Bewertungsmodells liegt auf der Hand, wenn die bewerteten Daten vertraulich sind: Jede Antwort und jede Passage zur Bewertung an eine externe API zu senden, macht den Vorteil zunichte, das System lokal gehalten zu haben. Das gilt besonders für medizinische, juristische oder finanzielle Anwendungsfälle, in denen die Quellpassagen selbst sensible Daten enthalten. Anders als im Produktivbetrieb ist eine Evaluationskampagne auch mit langsamer Verarbeitung gut vereinbar: Man startet sie nachts auf einer GPU, die tagsüber für andere Aufgaben genutzt wird, und ruft morgens die Ergebnisse ab.
#Werkzeuge, um die Pipeline nicht neu zu erfinden
Es ist nicht erforderlich, ein eigenes Judge-Harness von Grund auf zu schreiben. Prometheus, ein Open-Source-Forschungsprojekt, trainiert speziell ein Modell mit 13 Milliarden Parametern für diesen Zweck: « We train Prometheus, a 13B evaluator LLM that can assess any given long-form text based on customized score rubric provided by the user » (Wir trainieren Prometheus, ein 13B-Evaluator-LLM, das jeden beliebigen langen Text basierend auf einer von der Benutzerin oder dem Benutzer bereitgestellten benutzerdefinierten Bewertungsskala bewerten kann). Die Autoren berichten über eine Pearson-Korrelation von 0,897 mit menschlichen Bewertern über 45 benutzerdefinierte Bewertungsskalen, im Vergleich zu 0,882 für GPT-4 und nur 0,392 für ChatGPT im selben Protokoll — eine Lücke, die verdeutlicht, wie schlecht ein nicht spezialisiertes Modell urteilen kann, selbst wenn es in der Konversation ansonsten korrekte Antworten generiert.
- Prometheus
- 13B, offen, speziell für eine differenzierte Bewertung anhand eines individuell angepassten Bewertungsrasters entwickelt; eine solide Grundlage für ein dediziertes lokales Bewertungsmodell statt eines Allzweckmodells, das zweckentfremdet wird.
- Ein Allzweckmodell mit 14 Milliarden Parametern oder mehr
- Qwen, Llama oder Mistral in diesem Größenbereich eignen sich ebenfalls als Bewertungsinstanz – mit einem sorgfältig formulierten Bewertungsraster statt eines speziell auf diese konkrete Aufgabe ausgerichteten Trainings.
- Ein Framework für Orchestrationsprozesse
- Nützlich, um die Testkampagne zu starten, die Ergebnisse zu speichern und die Entwicklung des Scores im Laufe der Zeit zu verfolgen, statt jedes Mal alles neu zu programmieren, wenn ein Test mit einer neuen Version erneut durchgeführt werden muss.
#Wie ein robuster Judge-Prompt aussieht
Wenden wir die vier Regeln aus dem vorherigen Abschnitt auf einen konkreten Fall an: ein internes RAG-System, das Fragen zu Verfahrensabläufen beantwortet. Der Prompt für das bewertende Modell muss ausdrücklich die gestellte Frage, die gefundenen Quellpassagen, die zu bewertende Antwort, ein Bewertungsraster mit getrennten Kriterien und die Anweisung enthalten, die Bewertung vor der Punktevergabe zu begründen. Das zu formulieren dauert länger als ein einfaches „Bewerte diese Antwort auf einer Skala von zehn Punkten“, aber genau dieses Detail unterscheidet eine auswertbare Evaluationskampagne von einer Zahl, die beruhigt, ohne etwas zu messen.
Zwei Details machen in diesem Grundgerüst den entscheidenden Unterschied. Erstens erhält das bewertende Modell die Quellpassagen, nicht nur die Antwort: Ohne sie lässt sich nur die Form prüfen, nicht die inhaltliche Treue. Zweitens steht die Begründung im Prompt vor der Schlussfolgerung — ein bewertendes Modell, das zuerst eine Bewertung abgeben soll, neigt dazu, diese nachträglich zu rechtfertigen, statt vor der Entscheidung zu schlussfolgern. Dies verschärft die in der Referenzstudie festgestellte begrenzte Fähigkeit zum logischen Schlussfolgern. Schließlich neutralisiert ein Wechsel der Reihenfolge der Antworten A und B von Fall zu Fall mit anschließender Mittelung der beiden Durchläufe den Großteil der von Zheng et al. dokumentierten Positionsverzerrung.
#Wann man darauf verzichten sollte
- Um ein System mit hohem Risiko zu validieren
- Medizin, Recht, Finanzen: Ein automatisches Bewertungssystem ersetzt keine menschliche Prüfung bei Fällen, in denen Haftungsfragen berührt werden.
- Um zwei sehr unterschiedliche Systeme zu vergleichen
- Verzerrungen zugunsten bestimmter Stile und Antwortlängen dominieren, sobald sich die Antwortformate unterscheiden, wie die von Zheng et al. dokumentierte Bevorzugung ausführlicher Antworten zeigt.
- Wenn ein deterministischer Test existiert
- Wenn die richtige Antwort eine Zahl oder ein exakter Wert ist, ist ein einfacher Vergleich genauer und unendlich viel günstiger als ein LLM als Bewertungsinstanz.
- Bei zu geringer Anzahl von Fällen
- Bei zehn Fragen ist die Varianz der Generierung größer als der Unterschied, den Sie messen möchten.
- Ragas: das eigene lokale RAG-System anhand von Zahlen bewerten
- Langfuse: lokale LLMs überwachen (Traces, Prompts, Evaluationen)
- Die Modellranglisten korrekt lesen
- Lokales RAG: Einführung (zur Einordnung dessen, was wir bewerten)
- Quelle: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (Zheng et al., 2023)
- Quelle: Prometheus, ein Open-Source-Bewertungsmodell mit 13B (Kim et al., 2023)
- Quelle: offizielles GitHub-Repository von Prometheus
#FAQ
Kann ein Modell ein anderes wirklich beurteilen?+
Welche Modellgröße für das Bewertungsmodell?+
Muss das bewertende Modell ein anderes sein als das bewertete Modell?+
Bewertung oder Paarvergleich?+
Wie viele Fälle sind für eine aussagekräftige Evaluationskampagne erforderlich?+
Ist Prometheus als Bewerter besser als ein Allzweckmodell?+
Ist der Verbosity-Bias wirklich messbar?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.