LMArena (Chatbot Arena) (SV)
Arena (före 28 januari 2026 — LMArena (Large Model Arena), tidigare — Chatbot Arena) — en öppen crowdsourcad webbplattform för utvärdering och jämförande rankning av stora språkmodeller (LLM) och multimodala modeller (text, bild, video) baserat på verkliga mänskliga preferenser. Plattformens grund utgörs av anonyma parjämförelser (blind battles) mellan modeller och ett Elo-ratingsystem; utifrån dessa publiceras transparenta offentliga leaderboards, som betraktas som ett av de mest auktoritativa oberoende benchmarken för frontier-modeller inom artificiell intelligens.[1][2]
Plattformen uppstod 2023 som ett akademiskt forskningsprojekt inom organisationen LMSYS Org (Large Model Systems Organization) vid University of California, Berkeley (Sky Computing Lab). I september 2024 "tog projektet examen" till en självständig domän lmarena.ai ("Graduation")[3]. I april 2025 grundades det oberoende företaget Arena Intelligence Inc., och den 21 maj 2025 genomfördes en seed-runda på 100 miljoner USD (värdering 600 miljoner USD, huvudinvesterare — a16z och UC Investments)[4][5]. Den 6 januari 2026 stängde företaget en Series A-runda på 150 miljoner USD vid en post-money-värdering på 1,7 miljarder USD[6]. Den 28 januari 2026 genomfördes den slutliga omprofileringen — plattformen fick namnet Arena och bytte till domänen arena.ai[7][8].
Historia
Plattformen lanserades i april 2023 under namnet Chatbot Arena som ett forskningsprojekt inom organisationen LMSYS Org (Large Model Systems Organization) vid University of California, Berkeley (Sky Computing Lab). Den blev ett av de första verktygen för crowdsourcad utvärdering av stora språkmodeller genom anonyma parjämförelser (blind battles) och ett Elo-ratingsystem baserat på verkliga användarpreferenser.
- 24 april 2023 — teknisk lansering av Chatbot Arena.
- 3 maj 2023 — officiell publik release och publicering av det första leaderboardet.
- 2023 — release av de första öppna dataseten: 33 000 parvisa dialoger (juli) och LMSYS‑Chat‑1M (september, cirka 1 miljon verkliga dialoger).
- 1 mars 2024 — publicering av plattformens officiella policy, formalisering av uppdraget som ett öppet community-drivet utvärderingssystem.
- 27 juni 2024 — tillägg av bildstöd och påbörjad expansion mot multimodala uppgifter.
- 20 september 2024 — "Graduation": övergång till den självständiga domänen lmarena.ai.
- Slutet av 2024 — våren 2025 — lansering av specialiserade arenor (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control m.fl.).
- 17 april 2025 — officiell inkorporering som det oberoende företaget Arena Intelligence Inc., lansering av betaversion av den uppdaterade plattformen under varumärket LMArena.
- 21 maj 2025 — tillkännagivande av företagets grundande och genomförande av en seed-runda på 100 miljoner USD (värdering — 600 miljoner USD).
- 31 juli 2025 — publicering av ett öppet dataset med 140 000 nyliga dialoger från Text Arena.
- 6 januari 2026 — genomförande av en Series A-runda på 150 miljoner USD vid en post-money-värdering på 1,7 miljarder USD.
- Januari 2026 — lansering av Video Arena (fullt stöd för videomodalitet).
- 28 januari 2026 — slutlig omprofiling: plattformen fick namnet Arena och bytte till domänen arena.ai.
Fram till mars 2026 betjänar Arena (arena.ai) mer än 5 miljoner månatligt aktiva användare från 150+ länder, har samlat in tiotals miljoner röster och förblir ett av de mest auktoritativa oberoende verktygen för utvärdering av frontier-modeller inom AI baserat på verkliga mänskliga preferenser.
Hur utvärderingen fungerar
Användaren skriver in en fråga och får två svar från slumpmässigt utvalda anonyma modeller ("A" och "B"), varefter hen röstar på det bästa svaret (eller registrerar oavgjort/otillfredsställande). Rankningen baseras på den statistiska modellen Bradley–Terry (logistisk regression på parvisa preferenser), intuitivt snarlik Elo[1]. Plattformen publicerar Arena Score och konfidensintervall, samt tillämpar samplingskorrektioner (re‑weighting) för att bevara opartiskhet vid ojämn sampling[9].
Transparens och öppenhet. De ursprungliga utvärdering- och rankningspipelines är öppna i repositoriet FastChat[10]; delar av rådata publiceras regelbundet för verifiering och forskning (t.ex. releasen av 140K dialoger i juli 2025)[9][11]. Enligt FAQ och varningar på startsidan kan användarfrågor lämnas ut till modelleverantörer och delvis publiceras för forskningssyften — känslig information bör inte skickas in[12][13].
Urvals- och samplingregler. I leaderboards inkluderas modeller med allmän tillgång (öppna vikter/publikt API/publik tjänst). För stabil utvärdering krävs vanligtvis ≥1 000 röster; minst 20% av battles ska vara enbart mellan offentliga modeller; sannolikheten för sampling ökar med rating och osäkerhet, och regression med omviktning säkerställer opartiskhet i slutliga bedömningar[9].
Automatiska mätvärden och stilkontroll. För snabbare utvärdering och minskning av "stil"-preferenseffekter används hjälpmetoder: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (autogenerering av svåra frågor)[15], samt Style/Sentiment Control (modellering och "bokning" av ton/känsloeffekter på preferenser)[16]. För Arena‑Hard‑Auto rapporterades mycket hög överensstämmelse med "levande" mänskliga röster (upp till ≈98,6% under kontrollerade förhållanden)[17].
Arenor och utvärderingsdomäner
Plattformen har utvecklats till en uppsättning "arenor" efter uppgiftstyp:
- Text Arena — allmänna dialoger/uppgifter, huvudtabellen[18].
- Vision Arena — multimodala modeller "text→bild/video/bildanalys"[19].
- Text‑to‑Image och Image Edit — generering och redigering av bilder (inkl. fallet nano‑banana)[20][21].
- Text‑/Image‑to‑Video — videogenerering[22].
- WebDev Arena — byggande av webbapplikationer utifrån beskrivningar[23].
- RepoChat Arena — AI-ingenjörsuppgifter med kod/repositorier[24].
- Search Arena — modeller med koppling till webbsökning; lanserades först i april 2025 (legacy), sedan förd till huvudsajten, åtföljs av ett dataset och en publikation[25][26][27].
- BiomedArena.AI — domänspecifik utvärdering för biomedicinska uppgifter (partnerskap med DataTecnica)[28].
Användning och inflytande
- Industriell skyltfönster. Stora leverantörer (OpenAI, Anthropic, Google m.fl.) testar och presenterar regelbundet modeller på LMArena; branschmedia beskriver plattformen som en viktig referenspunkt[5][29]. I en branschpublikation från NAACL‑2025 betecknas Chatbot Arenas Elo-betyg som "gold industry‑standard"[30].
- Testning inför release. Policyn tillåter anonyma förhandsvisningar av "ej releasade" modeller med kommunikation till communityt och efterföljande publicering av offentliga betyg efter release; minimum ≈1 000 röster för stabilisering[9].
- Kända händelser. Våren 2025 diskuterades den anonyma modellen Llama‑4 Maverick‑03‑26‑Experimental (incident kring jämförelse med offentliga versioner), vilket väckte stor uppmärksamhet i pressen och utlöste uppdateringar av regler och kommunikation[31][32]. I augusti 2025 avslöjades "nano‑banana" som Gemini 2.5 Flash Image och intog ledande positioner i de visuella arenorna[21][20].
Begränsningar och kritik
Trots sin skala och popularitet har metoden begränsningar:
- Subjektivitet och stileffekter. Röstpreferenser beror på svarets ton och stil; teamet implementerar Style/Sentiment Control för att frikoppla "stil" och "innehåll"[16].
- Publikens bristande representativitet. Kärnaktivisterna är teknikentusiaster/utvecklare; för domänspecifika scenarier skapas specialiserade arenor (Search, WebDev, Biomed m.fl.)[33].
- Sårbarhet för manipulation och bias. Forskning från 2025 visar att utan strikta skydd är strategier för "röstmanipulation" med hundratals till tusentals röster möjliga; samtidigt ledde samarbete mellan forskare och LMArena till implementering av skyddsåtgärder (CAPTCHA/inloggning/botskydd/anomalidetektion) och ökade "attackkostnader"[34][35][36].
- Metodologisk kritik. Arbetet The Leaderboard Illusion (april 2025) pekar på systematiska och institutionella faktorer som kan snedvrida tävlingsfältet; LMArena publicerade ett utförligt svar och upprätthåller en offentlig changelog för metodologi[37][38][39].
Länkar
- Officiell webbplats för LMArena
- Blogg/policies och uppdateringar för LMArena
- Webbplats för forskningsgruppen LMSYS (projektets ursprungliga inkubator)
Litteratur
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Noter
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]