LMArena (Chatbot Arena) (DE)
LMArena (Large Model Arena, früher bekannt als Chatbot Arena) ist eine offene Web-Plattform für die Crowdsourcing-basierte Bewertung und den vergleichenden Benchmark von großen Sprachmodellen (LLMs und multimodalen Modellen) basierend auf menschlichen Präferenzen, mit anonymen paarweisen Vergleichen und öffentlichen Leaderboards[1][2].
Die Plattform ging aus der Forschungsinitiative LMSYS (UC Berkeley/CMU/UC San Diego) [41] hervor, wurde im September 2024 auf eine eigenständige Website lmarena.ai ausgegliedert[3] und im Mai 2025 als Unternehmen formalisiert. Sie erhielt eine Seed-Finanzierung in Höhe von 100 Mio. US-Dollar (von a16z, UC Investments u. a.) für den Ausbau der Infrastruktur für offene Bewertungen[4][5].
Geschichte
Die Plattform startete im Mai 2023 unter dem Namen Chatbot Arena. Im Frühjahr 2025 wurde die Plattform offiziell in LMArena (Large Model Arena) umbenannt und als eigenständige Organisation formalisiert.
- 3. Mai 2023 – Start der Chatbot Arena, das erste Leaderboard basierend auf anonymen „Battles“[6].
- 2023 – Veröffentlichung von Datensätzen: 33K paarweise Dialoge (Juli) und LMSYS‑Chat‑1M (September, 1 Million reale Dialoge)[7][8].
- 20. September 2024 – „Graduation“: Ausgliederung auf die eigene Domain lmarena.ai[3].
- 2024–2025 – Erweiterung der Methodik und der Arenen (Arena-Hard, Style/Sentiment Control, WebDev/RepoChat etc.)[9][10][11][12].
- 27. April 2025 – Insgesamt 3+ Millionen Stimmen, 400+ öffentliche Modelle und 300+ geschlossene Vorabversionen[13].
- 21. Mai 2025 – LMArena gibt die Gründung eines Unternehmens und eine Seed-Runde in Höhe von 100 Mio. US-Dollar bekannt[4][5].
- 31. Juli 2025 – Veröffentlichung eines offenen Datensatzes von 140.000 aktuellen Dialogen aus der Text Arena[14].
- 26.–27. August 2025 – Anonymes Testen von Gemini 2.5 Flash Image unter dem Codenamen „nano‑banana“; anschließend führt das Modell die Ranglisten für Text‑to‑Image/Image Edit an[15][16].
- 28. August 2025 – Hinzufügung von Microsoft MAI‑1‑preview zur Text-Rangliste (siehe Changelog)[17].
- Status: Unter dem Reiter Text Arena sind 4.075.191 Stimmen verzeichnet (Stand: 8. September 2025)[18].
Funktionsweise der Bewertung
Ein Nutzer gibt einen Prompt ein und erhält zwei Antworten von zufällig ausgewählten, anonymen Modellen („A“ und „B“). Anschließend stimmt der Nutzer für die bessere Antwort ab (oder meldet ein Unentschieden bzw. unzureichende Antworten). Das Ranking basiert auf dem statistischen Bradley-Terry-Modell (eine logistische Regression über paarweise Präferenzen), das intuitiv dem Elo-System ähnelt[1]. Die Plattform veröffentlicht einen Arena Score und Konfidenzintervalle und wendet Stichprobenkorrekturen (Re-Weighting) an, um die Unverzerrtheit bei ungleichmäßiger Stichprobennahme zu gewährleisten[19].
Transparenz und Offenheit. Die zugrunde liegenden Pipelines für Bewertung und Ranking sind im FastChat-Repository als Open Source verfügbar[20]; Teile der Rohdaten werden regelmäßig zur Verifizierung und für Forschungszwecke veröffentlicht (z. B. die Veröffentlichung von 140.000 Dialogen im Juli 2025)[19][14]. Gemäß den FAQ und den Hinweisen auf der Startseite können Nutzeranfragen an die Modellanbieter weitergegeben und teilweise zu Forschungszwecken veröffentlicht werden – es sollten keine sensiblen Daten übermittelt werden[21][22].
Auswahl- und Sampling-Regeln. In die Leaderboards werden Modelle mit allgemeinem Zugang aufgenommen (offene Gewichte/öffentliche API/öffentlicher Dienst). Zur Stabilisierung der Bewertung sind in der Regel ≥1000 Stimmen erforderlich; mindestens 20 % der Battles finden nur zwischen öffentlichen Modellen statt; die Sampling-Wahrscheinlichkeit steigt mit dem Rating und der Unsicherheit, und die Regression mit Neugewichtung stellt die Unverzerrtheit der Endergebnisse sicher[19].
Automatische Metriken und Stilkontrolle. Um die Bewertung zu beschleunigen und die Effekte von „stilistischen“ Präferenzen zu reduzieren, werden unterstützende Methoden eingesetzt: MT-Bench (LLM-as-a-judge)[23], Arena-Hard (automatische Generierung komplexer Fragen)[9] sowie Style/Sentiment Control (Modellierung und „Bereinigung“ des Effekts von Ton/Emotionen auf die Präferenzen)[10]. Für Arena-Hard-Auto wurde eine sehr hohe Übereinstimmung mit „echten“ menschlichen Bewertungen berichtet (bis zu ≈98,6 % unter kontrollierten Bedingungen)[24].
Arenen und Bewertungsdomänen
Die Plattform hat sich zu einer Sammlung von „Arenen“ für verschiedene Aufgabentypen entwickelt:
- Text Arena – allgemeine Dialoge/Aufgaben, die Haupt-Rangliste[18].
- Vision Arena – multimodale Modelle für „Text→Bild/Video/Bildanalyse“[25].
- Text‑to‑Image und Image Edit – Generierung und Bearbeitung von Bildern (einschließlich des Falls nano‑banana)[16][15].
- Text‑/Image‑to‑Video – Videogenerierung[26].
- WebDev Arena – Erstellung von Webanwendungen aus Beschreibungen[11].
- RepoChat Arena – Aufgaben des KI-Engineerings im Bereich Code/Repositories[12].
- Search Arena – Modelle mit Anbindung an die Websuche; ursprünglich im April 2025 gestartet (legacy), dann auf die Hauptseite überführt und durch einen Datensatz und eine Publikation begleitet[27][28][29].
- BiomedArena.AI – domänenspezifische Bewertung für biomedizinische Aufgaben (in Partnerschaft mit DataTecnica)[30].
Anwendung und Einfluss
- Schaufenster für die Industrie. Führende Anbieter (OpenAI, Anthropic, Google u. a.) testen und präsentieren regelmäßig Modelle auf LMArena; Branchenmedien beschreiben die Plattform als einen wichtigen Maßstab[5][31]. In einer Industriepublikation der NAACL-2025 wurde die Elo-Bewertung der Chatbot Arena als „gold industry‑standard“ bezeichnet[32].
- Pre-Release-Tests. Die Richtlinien erlauben anonyme Vorabansichten von unveröffentlichten Modellen mit Benachrichtigung der Community und anschließender Veröffentlichung der öffentlichen Bewertungen nach dem Release; zur Stabilisierung sind mindestens ≈1000 Stimmen erforderlich[19].
- Nennenswerte Vorfälle. Im Frühjahr 2025 wurde das anonyme Modell Llama‑4 Maverick‑03‑26‑Experimental diskutiert (ein Vorfall im Zusammenhang mit Vergleichen zu öffentlichen Versionen), was breite Aufmerksamkeit der Presse auf sich zog und zu Aktualisierungen der Regeln und Kommunikation führte[33][34]. Im August 2025 wurde „nano‑banana“ als Gemini 2.5 Flash Image enthüllt und übernahm Spitzenpositionen in den visuellen Arenen[15][16].
Einschränkungen und Kritik
Trotz ihres Umfangs und ihrer Popularität hat die Methode ihre Grenzen:
- Subjektivität und stilistische Effekte. Die Präferenzen der Abstimmenden hängen vom Ton und Stil der Antwort ab; das Team implementiert Style/Sentiment Control, um „Stil“ und „Inhalt“ zu entkoppeln[10].
- Nicht repräsentative Nutzerschaft. Die Kernnutzer sind Technik-Enthusiasten und Entwickler; für domänenspezifische Szenarien werden spezialisierte Arenen geschaffen (Search, WebDev, Biomed etc.)[35].
- Anfälligkeit für Manipulation und Verzerrungen. Studien aus dem Jahr 2025 zeigen, dass ohne strenge Schutzmaßnahmen Strategien zur Stimmenmanipulation („Vote Rigging“) mit Hunderten bis Tausenden von Stimmen möglich sind. Die Zusammenarbeit von Forschern mit LMArena führte jedoch zur Implementierung von Schutzmaßnahmen (CAPTCHA/Login/Bot-Schutz/Anomalieerkennung) und zu einer Erhöhung der „Kosten eines Angriffs“[36][37][38].
- Methodologische Kritik. Die Arbeit The Leaderboard Illusion (April 2025) weist auf systematische und institutionelle Faktoren hin, die das Wettbewerbsfeld verzerren können. LMArena veröffentlichte eine ausführliche Antwort und führt einen öffentlichen Changelog zur Methodik[39][40][17].
Weblinks
- Offizielle Website von LMArena
- Blog/Richtlinien und Updates von LMArena
- Website der Forschungsgruppe LMSYS (ursprünglicher Inkubator des Projekts)
Literatur
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Einzelnachweise
- ↑ 1.0 1.1 Chiang, W.-L. et al. „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference“. arXiv:2403.04132, 2024. arXiv
- ↑ „Hello from LMArena: The Community Platform for Exploring Frontier AI“. LMArena Blog, 23. Juni 2025. [1]
- ↑ 3.0 3.1 „Announcing a New Site for Chatbot Arena“. LMSYS Blog, 20. September 2024. [2]
- ↑ 4.0 4.1 „LMArena Secures $100M in Seed Funding…“. PR Newswire, 21. Mai 2025. [3]
- ↑ 5.0 5.1 5.2 Wiggers, K. „LM Arena… lands $100M“. TechCrunch, 21. Mai 2025. [4]
- ↑ „Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings“. LMSYS Blog, 3. Mai 2023. [5]
- ↑ „Chatbot Arena Conversation Dataset Release“. LMSYS Blog, 20. Juli 2023. [6]
- ↑ Zheng, L. et al. „LMSYS‑Chat‑1M“. arXiv:2309.11998, 2023. [7]
- ↑ 9.0 9.1 Li, T. et al. „From Crowdsourced Data to High‑Quality Benchmarks: Arena‑Hard and BenchBuilder Pipeline“. arXiv:2406.11939, 2024. [8]
- ↑ 10.0 10.1 10.2 „Does Sentiment Matter Too? Introducing Sentiment Control“. LMArena Blog, 22. April 2025. [9]
- ↑ 11.0 11.1 „WebDev Arena: A Live LLM Leaderboard for Web App Development“. LMArena Blog, 10. März 2025. [10]
- ↑ 12.0 12.1 „RepoChat Arena: A Live Benchmark for AI Software Engineers“. LMArena Blog, 9. April 2025. [11]
- ↑ „Celebrating Community Impact: 3M+ votes, 400+ models…“. LMArena Blog, 27. April 2025. [12]
- ↑ 14.0 14.1 Y. Song. „A Deep Dive into Recent Arena Data“. LMArena Blog, 31. Juli 2025. [13]
- ↑ 15.0 15.1 15.2 „Nano Banana (Gemini 2.5 Flash Image): Try it on LMArena“. LMArena Blog, 27. August 2025. [14]
- ↑ 16.0 16.1 16.2 Text‑to‑Image Arena. LMArena, aktualisiert am 25. August 2025. [15]
- ↑ 17.0 17.1 Leaderboard Changelog. LMArena Blog, Einträge für August 2025. [16]
- ↑ 18.0 18.1 Text Arena (English). LMArena. [17]
- ↑ 19.0 19.1 19.2 19.3 LMArena Leaderboard Policy. LMArena Blog, Fassung vom 8. September 2025. [18]
- ↑ lm‑sys/FastChat (GitHub). [19]
- ↑ FAQ. LMArena. [20]
- ↑ Startseite LMArena (Disclaimer zur möglichen Veröffentlichung von Daten und Weitergabe an Anbieter). [21]
- ↑ Zheng, L. et al. „Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena“. arXiv:2306.05685, 2023. [22]
- ↑ Li, T. et al. „From Crowdsourced Data…“ arXiv:2406.11939 (Tabellen zur Übereinstimmung). [23]
- ↑ Vision Arena. LMArena, aktualisiert am 2. September 2025. [24]
- ↑ Text‑to‑Video und Image‑to‑Video Leaderboards. LMArena, August 2025. [25] [26]
- ↑ „Introducing the Search Arena“. LMArena Blog, 14. April 2025. [27]
- ↑ „Search Arena & What We’re Learning About Human Preference“. LMArena Blog, 23. Juli 2025. [28]
- ↑ Frick, E. et al. „Search Arena: Analyzing Search‑Augmented LLMs“. arXiv:2506.05334, 2025. [29]
- ↑ „Introducing BiomedArena.AI“. LMArena Blog, 19. August 2025. [30]
- ↑ Google. „Gemma 3…“, 12. März 2025 (Verweis auf LMArena-Ergebnisse). [31]
- ↑ Spangher, L. et al. „Chatbot Arena Estimate…“. NAACL Industry, 2025. [32]
- ↑ „Meta’s experimental Llama 4 model briefly topped AI leaderboard…“. The Register, 7. April 2025. [33]
- ↑ Offizielle Erklärungen/Posts von LMArena auf X zum Vorfall (April 2025). [34]
- ↑ „Search Arena & What We’re Learning…“. LMArena Blog, 23. Juli 2025. [35]
- ↑ Min, R. et al. „Improving Your Model Ranking on Chatbot Arena by Vote Rigging“. arXiv:2501.17858, 2025. [36]
- ↑ Huang, Y. et al. „Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards“. arXiv:2501.07493, 2025. [37]
- ↑ „Hundreds of rigged votes can skew…“. Fast Company, 6. Februar 2025. [38]
- ↑ Singh, S. et al. „The Leaderboard Illusion“. arXiv:2504.20879, 2025. [39]
- ↑ „Our Response to ‘The Leaderboard Illusion’“. LMArena Blog, 9. Mai 2025. [40]