LMArena (Chatbot Arena) (NL)
Arena (tot 28 januari 2026 bekend als LMArena (Large Model Arena), eerder als Chatbot Arena) — een open crowdsourcing-webplatform voor de evaluatie en vergelijkende rangschikking van grote taalmodellen (LLM) en multimodale modellen (tekst, afbeelding, video) op basis van echte menselijke voorkeuren. De kern van het platform bestaat uit anonieme paarsgewijze vergelijkingen (blind battles) van modellen en een Elo-ratingsysteem; op basis hiervan worden transparante publieke leaderboards gepubliceerd, die worden beschouwd als een van de meest gezaghebbende onafhankelijke benchmarks voor frontier-modellen van kunstmatige intelligentie.[1][2]
Het platform ontstond in 2023 als een academisch onderzoeksproject van de organisatie LMSYS Org (Large Model Systems Organization) aan de Universiteit van Californië in Berkeley (Sky Computing Lab). In september 2024 'studeerde' het project af naar een zelfstandig domein lmarena.ai ('Graduation')[3]. In april 2025 werd het onafhankelijke bedrijf Arena Intelligence Inc. opgericht, en op 21 mei 2025 werd een seed-ronde van $100 miljoen aangetrokken (waardering $600 miljoen, belangrijkste investeerders — a16z en UC Investments)[4][5]. Op 6 januari 2026 sloot het bedrijf een Series A-ronde van $150 miljoen bij een post-money waardering van $1,7 miljard[6]. Op 28 januari 2026 vond de definitieve rebranding plaats — het platform ging Arena heten en verhuisde naar het domein arena.ai[7][8].
Geschiedenis
Het platform werd in april 2023 gelanceerd onder de naam Chatbot Arena als onderzoeksproject van de organisatie LMSYS Org (Large Model Systems Organization) aan de Universiteit van Californië in Berkeley (Sky Computing Lab). Het werd een van de eerste instrumenten voor crowdsourcing-evaluatie van grote taalmodellen via anonieme paarsgewijze vergelijkingen (blind battles) en een Elo-ratingsysteem op basis van echte gebruikersvoorkeuren.
- 24 april 2023 — technische lancering van Chatbot Arena.
- 3 mei 2023 — officiële publieke release en publicatie van het eerste leaderboard.
- 2023 — release van de eerste open datasets: 33.000 paarsgewijze dialogen (juli) en LMSYS‑Chat‑1M (september, circa 1 miljoen echte dialogen).
- 1 maart 2024 — publicatie van het officiële platformbeleid, formalisering van de missie als een open community-gedreven evaluatiesysteem.
- 27 juni 2024 — toevoeging van ondersteuning voor afbeeldingen en begin van uitbreiding naar multimodale taken.
- 20 september 2024 — 'Graduation': overgang naar het zelfstandige domein lmarena.ai.
- Eind 2024 — voorjaar 2025 — lancering van gespecialiseerde arena's (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control, e.a.).
- 17 april 2025 — officiële incorporatie als onafhankelijk bedrijf Arena Intelligence Inc., lancering van de bètaversie van het vernieuwde platform onder de naam LMArena.
- 21 mei 2025 — aankondiging van de oprichting van het bedrijf en het aantrekken van een seed-ronde van $100 miljoen (waardering — $600 miljoen).
- 31 juli 2025 — publicatie van een open dataset van 140.000 recente dialogen van Text Arena.
- 6 januari 2026 — aantrekken van een Series A-ronde van $150 miljoen bij een post-money waardering van $1,7 miljard.
- Januari 2026 — lancering van Video Arena (volledige ondersteuning van video-modaliteit).
- 28 januari 2026 — definitieve rebranding: het platform ging Arena heten en verhuisde naar het domein arena.ai.
Tegen maart 2026 bedient Arena (arena.ai) meer dan 5 miljoen maandelijkse actieve gebruikers uit 150+ landen, heeft tientallen miljoenen stemmen verzameld en blijft een van de meest gezaghebbende onafhankelijke instrumenten voor de evaluatie van frontier-AI-modellen op basis van echte menselijke voorkeuren.
Hoe de evaluatie werkt
De gebruiker voert een verzoek in en ontvangt twee antwoorden van willekeurig gekozen anonieme modellen ('A' en 'B'), waarna hij stemt voor het beste antwoord (of een gelijkspel/ontevredenheid registreert). De rangschikking is gebaseerd op het statistische model van Bradley–Terry (logistische regressie op paarsgewijze voorkeuren), intuïtief verwant aan Elo[1]. Het platform publiceert de Arena Score en betrouwbaarheidsintervallen, en past ook steekproefcorrecties (re‑weighting) toe om onvertekendheid te behouden bij ongelijkmatige sampling[9].
Transparantie en openheid. De bronpijplijnen voor evaluatie en rangschikking zijn openbaar beschikbaar in de FastChat-repository[10]; periodiek worden delen van ruwe gegevens gepubliceerd voor verificatie en onderzoek (bijv. de release van 140K dialogen in juli 2025)[9][11]. Volgens de FAQ en waarschuwingen op de hoofdpagina kunnen gebruikersverzoeken worden gedeeld met modelproviders en gedeeltelijk worden gepubliceerd voor onderzoeksdoeleinden — men dient geen gevoelige gegevens in te dienen[12][13].
Selectie- en samplingregels. In de leaderboards worden modellen opgenomen die algemeen toegankelijk zijn (open gewichten/publieke API/publieke service). Voor het stabiliseren van de score zijn doorgaans ≥1000 stemmen vereist; ten minste 20% van de battles vindt uitsluitend plaats tussen publieke modellen; de samplingkans neemt toe met de rating en onzekerheid, en regressie met herweging zorgt voor onvertekendheid van de eindscores[9].
Automatische metrieken en stijlcontrole. Voor versnelde evaluatie en vermindering van 'stijl'-voorkeurseffecten worden aanvullende methoden toegepast: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (automatische generatie van complexe vragen)[15], en Style/Sentiment Control (modellering en 'correctie' van het effect van toon/emoties op voorkeuren)[16]. Voor Arena‑Hard‑Auto werd een zeer hoge overeenstemming met 'live' menselijke stemmen gerapporteerd (tot ≈98,6% onder gecontroleerde omstandigheden)[17].
Arena's en evaluatiedomeinen
Het platform heeft zich ontwikkeld tot een reeks 'arena's' per taaktype:
- Text Arena — algemene dialogen/taken, de hoofdtabel[18].
- Vision Arena — multimodale modellen 'tekst→afbeelding/video/beeldanalyse'[19].
- Text‑to‑Image en Image Edit — generatie en bewerking van afbeeldingen (waaronder de nano‑banana-casus)[20][21].
- Text‑/Image‑to‑Video — videogeneratie[22].
- WebDev Arena — bouwen van webapplicaties vanuit beschrijvingen[23].
- RepoChat Arena — AI-engineeringstaken op code/repositories[24].
- Search Arena — modellen met aansluiting op webzoekopdrachten; eerst gelanceerd in april 2025 (legacy), daarna naar de hoofdsite gebracht, vergezeld van een dataset en publicatie[25][26][27].
- BiomedArena.AI — domeinspecifieke evaluatie voor biomedische taken (in samenwerking met DataTecnica)[28].
Toepassing en invloed
- Industriële etalage. De grootste leveranciers (OpenAI, Anthropic, Google e.a.) testen en presenteren hun modellen regelmatig op LMArena; industriële media beschrijven het platform als een belangrijk referentiepunt[5][29]. In een industriële publicatie van NAACL‑2025 wordt de Elo-score van Chatbot Arena aangeduid als gold industry‑standard[30].
- Pre-release testen. Het beleid staat anonieme previews van 'niet-gereleaste' modellen toe met kennisgeving aan de gemeenschap en daaropvolgende publicatie van publieke scores na de release; minimaal ≈1000 stemmen voor stabilisatie[9].
- Bekende incidenten. In het voorjaar van 2025 werd het anonieme model Llama‑4 Maverick‑03‑26‑Experimental besproken (incident rond vergelijking met publieke versies), wat brede persaandacht trok en aanleiding gaf tot updates van regels en communicatie[31][32]. In augustus 2025 bleek 'nano‑banana' Gemini 2.5 Flash Image te zijn en bezette het de leidende posities in de visuele arena's[21][20].
Beperkingen en kritiek
Ondanks de schaal en populariteit heeft de aanpak beperkingen:
- Subjectiviteit en stijleffecten. Stemvoorkeuren zijn afhankelijk van toon/stijl van het antwoord; het team implementeert Style/Sentiment Control voor het ontkoppelen van 'stijl' en 'inhoud'[16].
- Niet-representativiteit van het publiek. De kerngebruikers zijn tech-enthousiastelingen/ontwikkelaars; voor domeinspecifieke scenario's worden gespecialiseerde arena's gecreëerd (Search, WebDev, Biomed e.a.)[33].
- Kwetsbaarheid voor manipulatie en vertekening. Onderzoek uit 2025 toont aan dat bij afwezigheid van strenge beveiligingen strategieën voor het 'opblazen' van stemmen met honderden tot duizenden stemmen mogelijk zijn; de samenwerking tussen onderzoekers en LMArena heeft geleid tot de implementatie van beveiligingsmaatregelen (CAPTCHA/login/botbeveiliging/anomaliedetectie) en een hogere 'aanvalskosten'[34][35][36].
- Methodologische kritiek. Het werk The Leaderboard Illusion (april 2025) wijst op systematische en institutionele factoren die het speelveld kunnen vervormen; LMArena heeft een uitgebreid antwoord gepubliceerd en onderhoudt een publieke changelog van de methodologie[37][38][39].
Externe koppelingen
- Officiële website van LMArena
- Blog/beleid en updates van LMArena
- Website van de onderzoeksgroep LMSYS (de oorspronkelijke incubator van het project)
Literatuur
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Noten
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]