---
title: "LMArena (Chatbot Arena) (DE)"
source: "https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)"
wiki: "systems-analysis.info/int"
article: "LMArena_(Chatbot_Arena)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3698
wiki_created_at: 2026-09-06T23:24:38Z
wiki_modified_at: 2026-09-06T23:24:38Z
downloaded_at: 2026-09-07T22:58:22Z
---

# LMArena (Chatbot Arena) (DE)

**LMArena** (*Large Model Arena*, früher bekannt als **Chatbot Arena**) ist eine offene Web-Plattform für die Crowdsourcing-basierte Bewertung und den vergleichenden Benchmark von großen Sprachmodellen (LLMs und multimodalen Modellen) basierend auf menschlichen Präferenzen, mit anonymen paarweisen Vergleichen und öffentlichen Leaderboards<sup>[\[1\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-chiang2024-1)[\[2\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-hello_2025-2)</sup>.

Die Plattform ging aus der Forschungsinitiative **LMSYS** (UC Berkeley/CMU/UC San Diego) <a href="https://lmsys.org/" class="external autonumber" rel="nofollow">[41]</a> hervor, wurde im September 2024 auf eine eigenständige Website <a href="https://lmarena.ai/" class="external text" rel="nofollow">lmarena.ai</a> ausgegliedert<sup>[\[3\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-new_site_2024-3)</sup> und im Mai 2025 als Unternehmen formalisiert. Sie erhielt eine Seed-Finanzierung in Höhe von **100 Mio. US-Dollar** (von a16z, UC Investments u. a.) für den Ausbau der Infrastruktur für offene Bewertungen<sup>[\[4\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-seed_prn-4)[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-tc_seed-5)</sup>.

## Geschichte

Die Plattform startete im Mai 2023 unter dem Namen Chatbot Arena. Im Frühjahr 2025 wurde die Plattform offiziell in LMArena (Large Model Arena) umbenannt und als eigenständige Organisation formalisiert.

- **3. Mai 2023** – Start der Chatbot Arena, das erste Leaderboard basierend auf anonymen „Battles“<sup>[\[6\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-lmsys_launch_2023-6)</sup>.
- **2023** – Veröffentlichung von Datensätzen: 33K paarweise Dialoge (Juli) und **LMSYS‑Chat‑1M** (September, 1 Million reale Dialoge)<sup>[\[7\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-7)[\[8\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-8)</sup>.
- **20. September 2024** – „Graduation“: Ausgliederung auf die eigene Domain **lmarena.ai**<sup>[\[3\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-new_site_2024-3)</sup>.
- **2024–2025** – Erweiterung der Methodik und der Arenen (Arena-Hard, Style/Sentiment Control, WebDev/RepoChat etc.)<sup>[\[9\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-arena_hard-9)[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-sentiment_control-10)[\[11\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-webdev_arena-11)[\[12\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-repochat_arena-12)</sup>.
- **27. April 2025** – Insgesamt **3+ Millionen** Stimmen, **400+** öffentliche Modelle und **300+** geschlossene Vorabversionen<sup>[\[13\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-3m_2025-13)</sup>.
- **21. Mai 2025** – LMArena gibt die Gründung eines Unternehmens und eine Seed-Runde in Höhe von 100 Mio. US-Dollar bekannt<sup>[\[4\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-seed_prn-4)[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-tc_seed-5)</sup>.
- **31. Juli 2025** – Veröffentlichung eines offenen Datensatzes von **140.000** aktuellen Dialogen aus der Text Arena<sup>[\[14\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-opendata_2025-14)</sup>.
- **26.–27. August 2025** – Anonymes Testen von **Gemini 2.5 Flash Image** unter dem Codenamen „nano‑banana“; anschließend führt das Modell die Ranglisten für Text‑to‑Image/Image Edit an<sup>[\[15\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-nanobanana_blog-15)[\[16\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-tti_page-16)</sup>.
- **28. August 2025** – Hinzufügung von **Microsoft MAI‑1‑preview** zur Text-Rangliste (siehe *Changelog*)<sup>[\[17\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-changelog-17)</sup>.
- **Status**: Unter dem Reiter *Text Arena* sind **4.075.191** Stimmen verzeichnet (Stand: **8. September 2025**)<sup>[\[18\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-text_stats-18)</sup>.

## Funktionsweise der Bewertung

Ein Nutzer gibt einen Prompt ein und erhält zwei Antworten von zufällig ausgewählten, anonymen Modellen („A“ und „B“). Anschließend stimmt der Nutzer für die bessere Antwort ab (oder meldet ein Unentschieden bzw. unzureichende Antworten). Das Ranking basiert auf dem statistischen **Bradley-Terry-Modell** (eine logistische Regression über paarweise Präferenzen), das intuitiv dem Elo-System ähnelt<sup>[\[1\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-chiang2024-1)</sup>. Die Plattform veröffentlicht einen **Arena Score** und Konfidenzintervalle und wendet Stichprobenkorrekturen (Re-Weighting) an, um die Unverzerrtheit bei ungleichmäßiger Stichprobennahme zu gewährleisten<sup>[\[19\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-policy-19)</sup>.

**Transparenz und Offenheit.** Die zugrunde liegenden Pipelines für Bewertung und Ranking sind im **FastChat**-Repository als Open Source verfügbar<sup>[\[20\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-20)</sup>; Teile der Rohdaten werden regelmäßig zur Verifizierung und für Forschungszwecke veröffentlicht (z. B. die Veröffentlichung von 140.000 Dialogen im Juli 2025)<sup>[\[19\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-policy-19)[\[14\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-opendata_2025-14)</sup>. Gemäß den *FAQ* und den Hinweisen auf der Startseite können Nutzeranfragen an die Modellanbieter weitergegeben und teilweise zu Forschungszwecken veröffentlicht werden – es sollten keine sensiblen Daten übermittelt werden<sup>[\[21\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-21)[\[22\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-22)</sup>.

**Auswahl- und Sampling-Regeln.** In die Leaderboards werden Modelle mit allgemeinem Zugang aufgenommen (offene Gewichte/öffentliche API/öffentlicher Dienst). Zur Stabilisierung der Bewertung sind in der Regel ≥**1000** Stimmen erforderlich; mindestens **20 %** der Battles finden nur zwischen öffentlichen Modellen statt; die Sampling-Wahrscheinlichkeit steigt mit dem Rating und der Unsicherheit, und die Regression mit Neugewichtung stellt die Unverzerrtheit der Endergebnisse sicher<sup>[\[19\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-policy-19)</sup>.

**Automatische Metriken und Stilkontrolle.** Um die Bewertung zu beschleunigen und die Effekte von „stilistischen“ Präferenzen zu reduzieren, werden unterstützende Methoden eingesetzt: *MT-Bench* (LLM-as-a-judge)<sup>[\[23\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-23)</sup>, *Arena-Hard* (automatische Generierung komplexer Fragen)<sup>[\[9\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-arena_hard-9)</sup> sowie **Style/Sentiment Control** (Modellierung und „Bereinigung“ des Effekts von Ton/Emotionen auf die Präferenzen)<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-sentiment_control-10)</sup>. Für *Arena-Hard-Auto* wurde eine sehr hohe Übereinstimmung mit „echten“ menschlichen Bewertungen berichtet (bis zu **≈98,6 %** unter kontrollierten Bedingungen)<sup>[\[24\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-24)</sup>.

## Arenen und Bewertungsdomänen

Die Plattform hat sich zu einer Sammlung von „Arenen“ für verschiedene Aufgabentypen entwickelt:

- **Text Arena** – allgemeine Dialoge/Aufgaben, die Haupt-Rangliste<sup>[\[18\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-text_stats-18)</sup>.
- **Vision Arena** – multimodale Modelle für „Text→Bild/Video/Bildanalyse“<sup>[\[25\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-25)</sup>.
- **Text‑to‑Image** und **Image Edit** – Generierung und Bearbeitung von Bildern (einschließlich des Falls *nano‑banana*)<sup>[\[16\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-tti_page-16)[\[15\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-nanobanana_blog-15)</sup>.
- **Text‑/Image‑to‑Video** – Videogenerierung<sup>[\[26\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-26)</sup>.
- **WebDev Arena** – Erstellung von Webanwendungen aus Beschreibungen<sup>[\[11\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-webdev_arena-11)</sup>.
- **RepoChat Arena** – Aufgaben des KI-Engineerings im Bereich Code/Repositories<sup>[\[12\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-repochat_arena-12)</sup>.
- **Search Arena** – Modelle mit Anbindung an die Websuche; ursprünglich im April 2025 gestartet (legacy), dann auf die Hauptseite überführt und durch einen Datensatz und eine Publikation begleitet<sup>[\[27\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-27)[\[28\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-28)[\[29\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-29)</sup>.
- **BiomedArena.AI** – domänenspezifische Bewertung für biomedizinische Aufgaben (in Partnerschaft mit DataTecnica)<sup>[\[30\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-30)</sup>.

## Anwendung und Einfluss

- **Schaufenster für die Industrie.** Führende Anbieter (OpenAI, Anthropic, Google u. a.) testen und präsentieren regelmäßig Modelle auf LMArena; Branchenmedien beschreiben die Plattform als einen wichtigen Maßstab<sup>[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-tc_seed-5)[\[31\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-31)</sup>. In einer Industriepublikation der NAACL-2025 wurde die Elo-Bewertung der Chatbot Arena als „**gold industry‑standard**“ bezeichnet<sup>[\[32\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-32)</sup>.
- **Pre-Release-Tests.** Die Richtlinien erlauben anonyme Vorabansichten von unveröffentlichten Modellen mit Benachrichtigung der Community und anschließender Veröffentlichung der öffentlichen Bewertungen nach dem Release; zur Stabilisierung sind mindestens ≈1000 Stimmen erforderlich<sup>[\[19\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-policy-19)</sup>.
- **Nennenswerte Vorfälle.** Im Frühjahr 2025 wurde das anonyme Modell *Llama‑4 Maverick‑03‑26‑Experimental* diskutiert (ein Vorfall im Zusammenhang mit Vergleichen zu öffentlichen Versionen), was breite Aufmerksamkeit der Presse auf sich zog und zu Aktualisierungen der Regeln und Kommunikation führte<sup>[\[33\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-33)[\[34\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-34)</sup>. Im August 2025 wurde „nano‑banana“ als **Gemini 2.5 Flash Image** enthüllt und übernahm Spitzenpositionen in den visuellen Arenen<sup>[\[15\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-nanobanana_blog-15)[\[16\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-tti_page-16)</sup>.

## Einschränkungen und Kritik

Trotz ihres Umfangs und ihrer Popularität hat die Methode ihre Grenzen:

- **Subjektivität und stilistische Effekte.** Die Präferenzen der Abstimmenden hängen vom Ton und Stil der Antwort ab; das Team implementiert **Style/Sentiment Control**, um „Stil“ und „Inhalt“ zu entkoppeln<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-sentiment_control-10)</sup>.
- **Nicht repräsentative Nutzerschaft.** Die Kernnutzer sind Technik-Enthusiasten und Entwickler; für domänenspezifische Szenarien werden spezialisierte Arenen geschaffen (Search, WebDev, Biomed etc.)<sup>[\[35\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-35)</sup>.
- **Anfälligkeit für Manipulation und Verzerrungen.** Studien aus dem Jahr 2025 zeigen, dass ohne strenge Schutzmaßnahmen Strategien zur Stimmenmanipulation („Vote Rigging“) mit Hunderten bis Tausenden von Stimmen möglich sind. Die Zusammenarbeit von Forschern mit LMArena führte jedoch zur Implementierung von Schutzmaßnahmen (CAPTCHA/Login/Bot-Schutz/Anomalieerkennung) und zu einer Erhöhung der „Kosten eines Angriffs“<sup>[\[36\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-36)[\[37\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-37)[\[38\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-38)</sup>.
- **Methodologische Kritik.** Die Arbeit *The Leaderboard Illusion* (April 2025) weist auf systematische und institutionelle Faktoren hin, die das Wettbewerbsfeld verzerren können. LMArena veröffentlichte eine ausführliche Antwort und führt einen öffentlichen *Changelog* zur Methodik<sup>[\[39\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-39)[\[40\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-40)[\[17\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_note-changelog-17)</sup>.

## Weblinks

- <a href="https://lmarena.ai/" class="external text" rel="nofollow">Offizielle Website von LMArena</a>
- <a href="https://news.lmarena.ai/" class="external text" rel="nofollow">Blog/Richtlinien und Updates von LMArena</a>
- <a href="https://lmsys.org/" class="external text" rel="nofollow">Website der Forschungsgruppe LMSYS (ursprünglicher Inkubator des Projekts)</a>

## Literatur

- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Zheng, L. et al. (2023). *Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena*. <a href="https://arxiv.org/abs/2306.05685" class="external text" rel="nofollow">arXiv:2306.05685</a>.
- Li, T. et al. (2024). *From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline*. <a href="https://arxiv.org/abs/2406.11939" class="external text" rel="nofollow">arXiv:2406.11939</a>.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). *A Statistical Framework for Ranking LLM-Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non-Transitivity in LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Li, H. et al. (2024). *LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods*. <a href="https://arxiv.org/abs/2412.05579" class="external text" rel="nofollow">arXiv:2412.05579</a>.
- Zheng, L. et al. (2024). *LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset*. <a href="https://arxiv.org/abs/2309.11998" class="external text" rel="nofollow">arXiv:2309.11998</a>.
- Dubois, Y. et al. (2024). *Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators*. <a href="https://arxiv.org/abs/2404.04475" class="external text" rel="nofollow">arXiv:2404.04475</a>.
- Singh, S. et al. (2025). *The Leaderboard Illusion*. <a href="https://arxiv.org/abs/2504.20879" class="external text" rel="nofollow">arXiv:2504.20879</a>.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). *Improving Your Model Ranking on Chatbot Arena by Vote Rigging*. <a href="https://arxiv.org/abs/2501.17858" class="external text" rel="nofollow">arXiv:2501.17858</a>.

## Einzelnachweise

1.  <span id="cite_note-chiang2024-1">↑ <sup>[1.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-chiang2024_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-chiang2024_1-1)</sup> Chiang, W.-L. et al. „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference“. *arXiv:2403.04132*, 2024. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv</a></span>
2.  <span id="cite_note-hello_2025-2">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-hello_2025_2-0) „Hello from LMArena: The Community Platform for Exploring Frontier AI“. *LMArena Blog*, 23. Juni 2025. <a href="https://news.lmarena.ai/hello-from-lmarena/" class="external autonumber" rel="nofollow">[1]</a></span>
3.  <span id="cite_note-new_site_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-new_site_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-new_site_2024_3-1)</sup> „Announcing a New Site for Chatbot Arena“. *LMSYS Blog*, 20. September 2024. <a href="https://lmsys.org/blog/2024-09-20-arena-new-site/" class="external autonumber" rel="nofollow">[2]</a></span>
4.  <span id="cite_note-seed_prn-4">↑ <sup>[4.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-seed_prn_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-seed_prn_4-1)</sup> „LMArena Secures \$100M in Seed Funding…“. *PR Newswire*, 21. Mai 2025. <a href="https://www.prnewswire.com/news-releases/lmarena-secures-100m-in-seed-funding-to-bring-scientific-rigor-to-ai-reliability-302462025.html" class="external autonumber" rel="nofollow">[3]</a></span>
5.  <span id="cite_note-tc_seed-5">↑ <sup>[5.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-tc_seed_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-tc_seed_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-tc_seed_5-2)</sup> Wiggers, K. „LM Arena… lands \$100M“. *TechCrunch*, 21. Mai 2025. <a href="https://techcrunch.com/2025/05/21/lm-arena-the-organization-behind-popular-ai-leaderboards-lands-100m/" class="external autonumber" rel="nofollow">[4]</a></span>
6.  <span id="cite_note-lmsys_launch_2023-6">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-lmsys_launch_2023_6-0) „Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings“. *LMSYS Blog*, 3. Mai 2023. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[5]</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-7) „Chatbot Arena Conversation Dataset Release“. *LMSYS Blog*, 20. Juli 2023. <a href="https://lmsys.org/blog/2023-07-20-dataset/" class="external autonumber" rel="nofollow">[6]</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-8) Zheng, L. et al. „LMSYS‑Chat‑1M“. *arXiv:2309.11998*, 2023. <a href="https://arxiv.org/abs/2309.11998" class="external autonumber" rel="nofollow">[7]</a></span>
9.  <span id="cite_note-arena_hard-9">↑ <sup>[9.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-arena_hard_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-arena_hard_9-1)</sup> Li, T. et al. „From Crowdsourced Data to High‑Quality Benchmarks: Arena‑Hard and BenchBuilder Pipeline“. *arXiv:2406.11939*, 2024. <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[8]</a></span>
10. <span id="cite_note-sentiment_control-10">↑ <sup>[10.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-sentiment_control_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-sentiment_control_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-sentiment_control_10-2)</sup> „Does Sentiment Matter Too? Introducing Sentiment Control“. *LMArena Blog*, 22. April 2025. <a href="https://news.lmarena.ai/sentiment-control/" class="external autonumber" rel="nofollow">[9]</a></span>
11. <span id="cite_note-webdev_arena-11">↑ <sup>[11.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-webdev_arena_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-webdev_arena_11-1)</sup> „WebDev Arena: A Live LLM Leaderboard for Web App Development“. *LMArena Blog*, 10. März 2025. <a href="https://lmarena.github.io/blog/2025/webdev-arena/" class="external autonumber" rel="nofollow">[10]</a></span>
12. <span id="cite_note-repochat_arena-12">↑ <sup>[12.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-repochat_arena_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-repochat_arena_12-1)</sup> „RepoChat Arena: A Live Benchmark for AI Software Engineers“. *LMArena Blog*, 9. April 2025. <a href="https://lmarena.github.io/blog/2025/repochat-arena/" class="external autonumber" rel="nofollow">[11]</a></span>
13. <span id="cite_note-3m_2025-13">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-3m_2025_13-0) „Celebrating Community Impact: 3M+ votes, 400+ models…“. *LMArena Blog*, 27. April 2025. <a href="https://news.lmarena.ai/two-year-celebration/" class="external autonumber" rel="nofollow">[12]</a></span>
14. <span id="cite_note-opendata_2025-14">↑ <sup>[14.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-opendata_2025_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-opendata_2025_14-1)</sup> Y. Song. „A Deep Dive into Recent Arena Data“. *LMArena Blog*, 31. Juli 2025. <a href="https://news.lmarena.ai/opendata-july2025/" class="external autonumber" rel="nofollow">[13]</a></span>
15. <span id="cite_note-nanobanana_blog-15">↑ <sup>[15.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-nanobanana_blog_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-nanobanana_blog_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-nanobanana_blog_15-2)</sup> „Nano Banana (Gemini 2.5 Flash Image): Try it on LMArena“. *LMArena Blog*, 27. August 2025. <a href="https://news.lmarena.ai/nano-banana/" class="external autonumber" rel="nofollow">[14]</a></span>
16. <span id="cite_note-tti_page-16">↑ <sup>[16.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-tti_page_16-0)</sup> <sup>[16.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-tti_page_16-1)</sup> <sup>[16.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-tti_page_16-2)</sup> *Text‑to‑Image Arena*. *LMArena*, aktualisiert am 25. August 2025. <a href="https://lmarena.ai/leaderboard/text-to-image" class="external autonumber" rel="nofollow">[15]</a></span>
17. <span id="cite_note-changelog-17">↑ <sup>[17.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-changelog_17-0)</sup> <sup>[17.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-changelog_17-1)</sup> *Leaderboard Changelog*. *LMArena Blog*, Einträge für August 2025. <a href="https://news.lmarena.ai/leaderboard-changelog/" class="external autonumber" rel="nofollow">[16]</a></span>
18. <span id="cite_note-text_stats-18">↑ <sup>[18.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-text_stats_18-0)</sup> <sup>[18.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-text_stats_18-1)</sup> *Text Arena (English)*. *LMArena*. <a href="https://lmarena.ai/leaderboard/text/english" class="external autonumber" rel="nofollow">[17]</a></span>
19. <span id="cite_note-policy-19">↑ <sup>[19.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-policy_19-0)</sup> <sup>[19.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-policy_19-1)</sup> <sup>[19.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-policy_19-2)</sup> <sup>[19.3](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-policy_19-3)</sup> *LMArena Leaderboard Policy*. *LMArena Blog*, Fassung vom 8. September 2025. <a href="https://news.lmarena.ai/policy/" class="external autonumber" rel="nofollow">[18]</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-20) lm‑sys/FastChat (GitHub). <a href="https://github.com/lm-sys/FastChat" class="external autonumber" rel="nofollow">[19]</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-21) *FAQ*. *LMArena*. <a href="https://lmarena.ai/faq" class="external autonumber" rel="nofollow">[20]</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-22) Startseite *LMArena* (Disclaimer zur möglichen Veröffentlichung von Daten und Weitergabe an Anbieter). <a href="https://lmarena.ai/" class="external autonumber" rel="nofollow">[21]</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-23) Zheng, L. et al. „Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena“. *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[22]</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-24) Li, T. et al. „From Crowdsourced Data…“ *arXiv:2406.11939* (Tabellen zur Übereinstimmung). <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[23]</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-25) *Vision Arena*. *LMArena*, aktualisiert am 2. September 2025. <a href="https://lmarena.ai/leaderboard/vision" class="external autonumber" rel="nofollow">[24]</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-26) *Text‑to‑Video* und *Image‑to‑Video Leaderboards*. *LMArena*, August 2025. <a href="https://lmarena.ai/leaderboard/text-to-video" class="external autonumber" rel="nofollow">[25]</a> <a href="https://lmarena.ai/leaderboard/image-to-video" class="external autonumber" rel="nofollow">[26]</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-27) „Introducing the Search Arena“. *LMArena Blog*, 14. April 2025. <a href="https://news.lmarena.ai/search-arena/" class="external autonumber" rel="nofollow">[27]</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-28) „Search Arena & What We’re Learning About Human Preference“. *LMArena Blog*, 23. Juli 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[28]</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-29) Frick, E. et al. „Search Arena: Analyzing Search‑Augmented LLMs“. *arXiv:2506.05334*, 2025. <a href="https://arxiv.org/abs/2506.05334" class="external autonumber" rel="nofollow">[29]</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-30) „Introducing BiomedArena.AI“. *LMArena Blog*, 19. August 2025. <a href="https://news.lmarena.ai/introducing-biomedarena/" class="external autonumber" rel="nofollow">[30]</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-31) Google. „Gemma 3…“, 12. März 2025 (Verweis auf LMArena-Ergebnisse). <a href="https://blog.google/technology/developers/gemma-3/" class="external autonumber" rel="nofollow">[31]</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-32) Spangher, L. et al. „Chatbot Arena Estimate…“. *NAACL Industry*, 2025. <a href="https://aclanthology.org/2025.naacl-industry.77.pdf" class="external autonumber" rel="nofollow">[32]</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-33) „Meta’s experimental Llama 4 model briefly topped AI leaderboard…“. *The Register*, 7. April 2025. <a href="https://www.theregister.com/2025/04/07/meta_llama_arena/" class="external autonumber" rel="nofollow">[33]</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-34) Offizielle Erklärungen/Posts von LMArena auf X zum Vorfall (April 2025). <a href="https://x.com/lmarena_ai/status/1776881220809552182" class="external autonumber" rel="nofollow">[34]</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-35) „Search Arena & What We’re Learning…“. *LMArena Blog*, 23. Juli 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[35]</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-36) Min, R. et al. „Improving Your Model Ranking on Chatbot Arena by Vote Rigging“. *arXiv:2501.17858*, 2025. <a href="https://arxiv.org/abs/2501.17858" class="external autonumber" rel="nofollow">[36]</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-37) Huang, Y. et al. „Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards“. *arXiv:2501.07493*, 2025. <a href="https://arxiv.org/abs/2501.07493" class="external autonumber" rel="nofollow">[37]</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-38) „Hundreds of rigged votes can skew…“. *Fast Company*, 6. Februar 2025. <a href="https://www.fastcompany.com/91273226/rigged-votes-ai-model-rankings-chatbot-arena" class="external autonumber" rel="nofollow">[38]</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-39) Singh, S. et al. „The Leaderboard Illusion“. *arXiv:2504.20879*, 2025. <a href="https://arxiv.org/abs/2504.20879" class="external autonumber" rel="nofollow">[39]</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(DE)#cite_ref-40) „Our Response to ‘The Leaderboard Illusion’“. *LMArena Blog*, 9. Mai 2025. <a href="https://news.lmarena.ai/our-response/" class="external autonumber" rel="nofollow">[40]</a></span>
