LMArena (Chatbot Arena) (CS)
Arena (do 28. ledna 2026 — LMArena (Large Model Arena), dříve — Chatbot Arena) — otevřená crowdsourcingová webová platforma pro hodnocení a srovnávací řazení velkých jazykových modelů (LLM) a multimodálních modelů (text, obraz, video) podle skutečných lidských preferencí. Základem platformy jsou anonymní párová srovnání (blind battles) modelů a ratingový systém Elo; na jejich základě jsou zveřejňovány transparentní veřejné žebříčky, považované za jeden z nejautoritativnějších nezávislých benchmarků frontier modelů umělé inteligence.[1][2]
Platforma vznikla v roce 2023 jako akademický výzkumný projekt organizace LMSYS Org (Large Model Systems Organization) při Kalifornské univerzitě v Berkeley (Sky Computing Lab). V září 2024 projekt „promoval" na samostatnou doménu lmarena.ai („Graduation")[3]. V dubnu 2025 byla vytvořena nezávislá společnost Arena Intelligence Inc. a 21. května 2025 bylo získáno seed-kolo ve výši $100 milionů (ocenění $600 milionů, hlavní investoři — a16z a UC Investments)[4][5]. 6. ledna 2026 společnost uzavřela kolo Series A ve výši $150 milionů při post-money ocenění $1,7 miliardy[6]. 28. ledna 2026 proběhl závěrečný rebranding — platforma se začala nazývat Arena a přešla na doménu arena.ai[7][8].
Historie
Platforma byla spuštěna v dubnu 2023 pod názvem Chatbot Arena jako výzkumný projekt organizace LMSYS Org (Large Model Systems Organization) při Kalifornské univerzitě v Berkeley (Sky Computing Lab). Stala se jedním z prvních nástrojů crowdsourcingového hodnocení velkých jazykových modelů prostřednictvím anonymních párových srovnání (blind battles) a ratingového systému Elo na základě skutečných preferencí uživatelů.
- 24. dubna 2023 — technické spuštění Chatbot Arena.
- 3. května 2023 — oficiální veřejné vydání a zveřejnění prvního žebříčku.
- 2023 — vydání prvních otevřených datasetů: 33 tisíc párových dialogů (červenec) a LMSYS‑Chat‑1M (září, přibližně 1 milion skutečných dialogů).
- 1. března 2024 — zveřejnění oficiální politiky platformy, formalizace mise jako otevřeného community-driven systému hodnocení.
- 27. června 2024 — přidání podpory obrázků a zahájení rozšíření na multimodální úlohy.
- 20. září 2024 — „Graduation": přechod na samostatnou doménu lmarena.ai.
- Konec roku 2024 — jaro 2025 — spuštění specializovaných arén (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control a další).
- 17. dubna 2025 — oficiální inkorporace jako nezávislá společnost Arena Intelligence Inc., spuštění beta verze aktualizované platformy pod značkou LMArena.
- 21. května 2025 — oznámení o vytvoření společnosti a získání seed-kola ve výši $100 milionů (ocenění — $600 milionů).
- 31. července 2025 — zveřejnění otevřeného datasetu obsahujícího 140 tisíc nedávných dialogů z Text Arena.
- 6. ledna 2026 — získání kola Series A ve výši $150 milionů při post-money ocenění $1,7 miliardy.
- Leden 2026 — spuštění Video Arena (plná podpora video-modality).
- 28. ledna 2026 — závěrečný rebranding: platforma se začala nazývat Arena a přešla na doménu arena.ai.
K březnu 2026 obsluhuje Arena (arena.ai) více než 5 milionů měsíčně aktivních uživatelů ze 150+ zemí, nashromáždila desítky milionů hlasů a zůstává jedním z nejautoritativnějších nezávislých nástrojů pro hodnocení frontier modelů AI podle skutečných lidských preferencí.
Jak funguje hodnocení
Uživatel zadá dotaz a obdrží dvě odpovědi od náhodně vybraných anonymních modelů („A" a „B"), poté hlasuje pro lepší odpověď (nebo zaznamenává remízu/nespokojenost). Řazení je založeno na statistickém modelu Bradleyho—Terryho (logistická regrese podle párových preferencí), intuitivně blízkém Elu[1]. Platforma zveřejňuje Arena Score a intervaly spolehlivosti a také uplatňuje korekce výběru (re‑weighting), aby zachovala nestrannost při nerovnoměrném vzorkování[9].
Transparentnost a otevřenost. Zdrojové pipeline hodnocení a řazení jsou otevřeny v repozitáři FastChat[10]; pravidelně jsou zveřejňovány části surových dat pro ověření a výzkum (např. vydání 140K dialogů v červenci 2025)[9][11]. Podle FAQ a upozornění na hlavní stránce mohou být uživatelské dotazy sdíleny s poskytovateli modelů a částečně zveřejněny pro výzkumné účely — citlivá data by neměla být odesílána[12][13].
Pravidla výběru a vzorkování. Do žebříčků jsou zařazovány modely s obecným přístupem (otevřené váhy/veřejné API/veřejná služba). Pro stabilizaci hodnocení je obvykle vyžadováno ≥1000 hlasů; nejméně 20 % soubojů probíhá pouze mezi veřejnými modely; pravděpodobnost vzorkování roste s ratingem a nejistotou a regrese s převáženými vahami zajišťuje nestrannost výsledných hodnocení[9].
Automatické metriky a kontrola stylu. Pro zrychlené hodnocení a snížení efektů „stylistických" preferencí se používají pomocné metodiky: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (automatické generování obtížných otázek)[15] a také Style/Sentiment Control (modelování a „léčba" efektu tónu/emocí na preference)[16]. Pro Arena‑Hard‑Auto byla hlášena velmi vysoká shoda s „živými" lidskými hlasy (až ≈98,6 % v kontrolovaných podmínkách)[17].
Arény a oblasti hodnocení
Platforma se rozvinula do sady „arén" podle typů úloh:
- Text Arena — obecné dialogy/úlohy, hlavní tabulka[18].
- Vision Arena — multimodální modely „text→obraz/video/analýza obrázků"[19].
- Text‑to‑Image a Image Edit — generování a úpravy obrázků (včetně případu nano‑banana)[20][21].
- Text‑/Image‑to‑Video — generování videa[22].
- WebDev Arena — tvorba webových aplikací z popisů[23].
- RepoChat Arena — úlohy AI inženýrství nad kódem/repozitáři[24].
- Search Arena — modely s připojením k webovému vyhledávání; nejprve spuštěna v dubnu 2025 (legacy), poté přesunuta na hlavní web, doprovázena datasetem a publikací[25][26][27].
- BiomedArena.AI — doménově specifické hodnocení pro biomedicínské úlohy (partnerství s DataTecnica)[28].
Využití a vliv
- Průmyslová výkladní skříň. Největší dodavatelé (OpenAI, Anthropic, Google a další) pravidelně testují a prezentují modely na LMArena; průmyslová média popisují platformu jako důležitý orientační bod[5][29]. V průmyslové publikaci NAACL‑2025 je Elo hodnocení Chatbot Arena označeno jako „gold industry‑standard"[30].
- Předvydávací testování. Politika umožňuje anonymní náhledy „nevydaných" modelů s oznámením komunitě a následným zveřejněním veřejných hodnocení po vydání; minimum ≈1000 hlasů pro stabilizaci[9].
- Známé epizody. Na jaře 2025 se diskutovalo o anonymním modelu Llama‑4 Maverick‑03‑26‑Experimental (incident kolem srovnání s veřejnými verzemi), což přitáhlo širokou pozornost tisku a vyvolalo aktualizace pravidel a komunikace[31][32]. V srpnu 2025 se „nano‑banana" odhalilo jako Gemini 2.5 Flash Image a zaujalo vedoucí pozice ve vizuálních arénách[21][20].
Omezení a kritika
Navzdory rozsahu a popularitě má přístup svá omezení:
- Subjektivita a stylistické efekty. Hlasové preference závisí na tónu/způsobu odpovědi; tým zavádí Style/Sentiment Control pro oddělení „stylu" a „obsahu"[16].
- Nepředstavitelnost publika. Jádro aktivních uživatelů tvoří techno-nadšenci/vývojáři; pro doménové scénáře jsou vytvářeny specializované arény (Search, WebDev, Biomed a další)[33].
- Zranitelnost vůči manipulacím a zkreslením. Výzkumy z roku 2025 ukazují, že bez pevných ochranných opatření jsou možné strategie „nafukování hlasů" se stovkami až tisíci hlasů; přičemž spolupráce výzkumníků s LMArena vedla k zavedení ochranných opatření (CAPTCHA/přihlášení/ochrana před boty/detekce anomálií) a zvýšení „nákladů útoku"[34][35][36].
- Metodologická kritika. Práce The Leaderboard Illusion (duben 2025) poukazuje na systematické a institucionální faktory, které mohou zkreslit soutěžní prostředí; LMArena zveřejnila obsáhlou odpověď a udržuje veřejný changelog metodologie[37][38][39].
Odkazy
- Oficiální web LMArena
- Blog/politiky a aktualizace LMArena
- Web výzkumné skupiny LMSYS (původní inkubátor projektu)
Literatura
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Poznámky
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]