---
title: "ELO-Ranking von Sprachmodellen"
source: "https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen"
wiki: "systems-analysis.info/int"
article: "ELO-Ranking_von_Sprachmodellen"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 1789
wiki_created_at: 2026-09-06T22:54:00Z
wiki_modified_at: 2026-09-06T22:54:00Z
downloaded_at: 2026-09-07T22:47:44Z
---

# ELO-Ranking von Sprachmodellen

**ELO-Ranking von Sprachmodellen** ist eine Methode zur Bewertung und zum Vergleich von großen Sprachmodellen (LLMs), die auf einer angepassten Version des Elo-Systems basiert, das ursprünglich für das Schachspiel entwickelt wurde. Dieser Ansatz verwendet Paarvergleiche von Modellen auf der Grundlage menschlicher Präferenzen, um ein einziges Ranking zu erstellen, das die relative Leistung der Modelle widerspiegelt<sup>[\[1\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-medium_elo_intro-1)</sup>.

Im Gegensatz zu traditionellen Benchmarks, die absolute Leistungsmetriken für spezifische Aufgaben messen, bestimmen ELO-Systeme die relativen Fähigkeiten von Modellen auf der Grundlage direkter Vergleiche ihrer Antworten durch menschliche Bewerter. Das Grundprinzip besteht darin, dass Benutzer die Antworten zweier anonymer Modelle auf dieselbe Anfrage vergleichen und die bessere Option auswählen. Auf der Grundlage dieser Präferenzen wird für jedes Modell eine Bewertung berechnet, wobei eine höhere Bewertung auf eine Überlegenheit in menschlichen Beurteilungen hinweist<sup>[\[2\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-lmsys_blog-2)</sup>.

## Entwicklungsgeschichte

### Ursprung des ELO-Systems

Das ELO-Ratingsystem wurde in den 1960er Jahren vom ungarisch-amerikanischen Physiker **Arpad Elo** (*Arpad Emrick Elo*, 1903–1992) entwickelt, um die Spielstärke von Schachspielern zu bewerten. Elo, ein Physikprofessor, schuf das System als Verbesserung des bestehenden Harkness-Systems, das erhebliche Mängel in der Genauigkeit der Bewertungen aufwies<sup>[\[3\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-wiki_elo-3)</sup>.

- **1960**: Die United States Chess Federation (USCF) übernahm offiziell das Elo-System.
- **1970**: Die Weltschachorganisation (FIDE) begann, das System zu verwenden<sup>[\[4\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-history_hit_elo-4)</sup>.

### Anpassung für Sprachmodelle

Die Anwendung von ELO zur Bewertung von LLMs begann mit dem Start der Plattform **LMSYS Chatbot Arena** am 3. Mai 2023. Die Plattform wurde von der Organisation LMSYS (*Large Model Systems Organization*) ins Leben gerufen – einer Zusammenarbeit von Forschern des UC Berkeley SkyLab, der UC San Diego und der Carnegie Mellon University<sup>[\[5\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-originality_ai_lmsys-5)</sup>.

## Methodik

### Mathematische Grundlagen

#### Klassische ELO-Formel

Die klassische ELO-Formel zur Berechnung der erwarteten Gewinnwahrscheinlichkeit von Modell A gegenüber Modell B lautet: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` wobei \`R_A\` und \`R_B\` die aktuellen Ratings der Modelle sind.

Die Aktualisierung des Ratings nach einem Vergleich erfolgt nach der Formel: `R'_A = R_A + K × (S_A - E_A)` wobei \`K\` der Entwicklungsfaktor (K-Faktor) ist, \`S_A\` das tatsächliche Ergebnis (1 für einen Sieg, 0,5 für ein Unentschieden, 0 für eine Niederlage) und \`E_A\` das erwartete Ergebnis ist<sup>[\[4\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-history_hit_elo-4)</sup>.

#### Bradley-Terry-Modell

Moderne Plattformen, einschließlich der LMSYS Chatbot Arena, sind zum Bradley-Terry-Modell übergegangen, das einen statistisch fundierteren Ansatz darstellt. Die Wahrscheinlichkeit, dass Modell \`i\` gegenüber Modell \`j\` bevorzugt wird, wird wie folgt berechnet:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` wobei \`β_i\` und \`β_j\` die Koeffizienten (Ratings) der Modelle sind, die mittels der Maximum-Likelihood-Methode geschätzt werden<sup>[\[2\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-lmsys_blog-2)</sup>. Diese Methode ist stabiler und zeigt eine bessere Übereinstimmung mit menschlichen Präferenzen<sup>[\[6\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-elo_uncovered_arxiv-6)</sup>.

## Bewertungsprozess in der Chatbot Arena

1.  **Anonymer Vergleich:** Benutzer interagieren parallel mit zwei anonymen Modellen.
2.  **Abstimmung:** Nach Erhalt der Antworten wählen die Benutzer die bevorzugte Variante aus.
3.  **Offenlegung der Identität:** Die Namen der Modelle werden erst nach der Abstimmung angezeigt.
4.  **Rating-Aktualisierung:** Die Ratings werden auf der Grundlage der Abstimmungsergebnisse aktualisiert, in der Regel durch eine Stapelverarbeitung zur Erhöhung der Stabilität<sup>[\[2\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-lmsys_blog-2)</sup>.

## Vor- und Nachteile

### Vorteile

- **Einfachheit und Interpretierbarkeit:** Das System ist leicht zu verstehen und zu implementieren.
- **Skalierbarkeit:** Es ermöglicht die Bewertung einer großen Anzahl von Modellen, ohne dass vollständige Paarvergleiche erforderlich sind.
- **Übereinstimmung mit menschlichen Präferenzen:** Das Ranking spiegelt direkt die realen Präferenzen der Benutzer wider und nicht abstrakte Metriken.

### Nachteile und Einschränkungen

- **Zuverlässigkeitsprobleme:** Individuelle ELO-Berechnungen können eine erhebliche Volatilität aufweisen.
- **Verletzung der Transitivität:** Das System erfüllt nicht immer die Bedingung A\>B und B\>C → A\>C, was eine fundamentale Einschränkung darstellt.
- **Abhängigkeit von der Stichprobengröße:** Um stabile Ratings zu erhalten, ist eine große Stichprobe erforderlich (Hunderte bis Tausende von Vergleichen)<sup>[\[6\]](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_note-elo_uncovered_arxiv-6)</sup>.
- **Bewertungsbias:** Die Ergebnisse können durch die Bevorzugung längerer oder stilistisch formatierter Antworten durch die Benutzer sowie durch kulturelle Unterschiede der Bewerter verzerrt werden.

## Fazit

Das ELO-Ranking ist ein wichtiges Werkzeug im Ökosystem der Bewertung von Sprachmodellen und bietet eine intuitive Methode, sie auf der Grundlage menschlicher Präferenzen zu vergleichen. Trotz des Erfolgs von Plattformen wie der LMSYS Chatbot Arena weist die Methode grundlegende Einschränkungen auf, darunter Probleme mit der Transitivität und Zuverlässigkeit. Der Übergang vom klassischen ELO zum Bradley-Terry-Modell stellt eine wichtige Verbesserung dar, doch die Zukunft der LLM-Bewertung wird wahrscheinlich in der Kombination mehrerer Ansätze liegen, um ein umfassenderes Bild der Fähigkeiten der Modelle zu erhalten.

## Weblinks

- <a href="https://chat.lmsys.org/" class="external text" rel="nofollow">Offizielle Website der LMSYS Chatbot Arena</a>
- <a href="https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard" class="external text" rel="nofollow">Bestenliste der LMSYS Chatbot Arena</a>

## Literatur

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. <a href="https://archive.org/details/ratingofchesspla00unse" class="external text" rel="nofollow">archive.org</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. <a href="https://arxiv.org/abs/2411.14483" class="external text" rel="nofollow">arXiv:2411.14483</a>.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. <a href="https://arxiv.org/abs/2403.16950" class="external text" rel="nofollow">arXiv:2403.16950</a>.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. <a href="https://arxiv.org/abs/2402.17826" class="external text" rel="nofollow">arXiv:2402.17826</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. <a href="https://arxiv.org/abs/2505.03475" class="external text" rel="nofollow">arXiv:2505.03475</a>.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. <a href="https://arxiv.org/abs/2502.10985" class="external text" rel="nofollow">arXiv:2502.10985</a>.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. <a href="https://arxiv.org/abs/2506.00178" class="external text" rel="nofollow">arXiv:2506.00178</a>.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. <a href="https://arxiv.org/abs/2411.04991" class="external text" rel="nofollow">arXiv:2411.04991</a>.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. <a href="https://arxiv.org/abs/2505.24783" class="external text" rel="nofollow">arXiv:2505.24783</a>.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. <a href="https://arxiv.org/abs/2506.11354" class="external text" rel="nofollow">arXiv:2506.11354</a>.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. <a href="https://arxiv.org/abs/2310.10386" class="external text" rel="nofollow">arXiv:2310.10386</a>.

## Einzelnachweise

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-medium_elo_intro_1-0) „Elo Rating for LLMs: A Deep Dive“. *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-lmsys_blog_2-2)</sup> „Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings“. *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-wiki_elo_3-0) „Elo rating system“. In *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-history_hit_elo_4-1)</sup> „How Does the Elo Rating System Work?“. *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-originality_ai_lmsys_5-0) „LMSYS Chatbot Arena: The Ultimate LLM Leaderboard“. *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/ELO-Ranking_von_Sprachmodellen#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. „Elo Uncovered: Robustness and Best Practices in Language Model Evaluation“. *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
