LMArena (Chatbot Arena) (BG)
Arena (до 28 януари 2026 година — LMArena (Large Model Arena), по-рано — Chatbot Arena) — отворена краудсорсинг уеб платформа за оценка и сравнително класиране на големи езикови модели (LLM) и мултимодални модели (текст, изображение, видео) въз основа на реални човешки предпочитания. Основата на платформата се състои от анонимни двойни сравнения (blind battles) между модели и система за рейтинг Elo; въз основа на тях се публикуват прозрачни публични класации, считани за един от най-авторитетните независими benchmark-ове на frontier модели за изкуствен интелект.[1][2]
Платформата възниква през 2023 година като академически изследователски проект на организацията LMSYS Org (Large Model Systems Organization) към Калифорнийския университет в Бъркли (Sky Computing Lab). През септември 2024 година проектът „завършва" на самостоятелен домейн lmarena.ai („Graduation")[3]. През април 2025 година е създадена независимата компания Arena Intelligence Inc., а на 21 май 2025 година е привлечен seed-рунд от $100 млн (оценка $600 млн, основни инвеститори — a16z и UC Investments)[4][5]. На 6 януари 2026 година компанията приключва Series A рунд от $150 млн при пост-мани оценка от $1,7 млрд[6]. На 28 януари 2026 година се осъществява окончателният ребрандинг — платформата започва да се нарича Arena и преминава към домейна arena.ai[7][8].
История
Платформата е стартирана през април 2023 година под наименованието Chatbot Arena като изследователски проект на организацията LMSYS Org (Large Model Systems Organization) към Калифорнийския университет в Бъркли (Sky Computing Lab). Тя става един от първите инструменти за краудсорсинг оценка на големи езикови модели чрез анонимни двойни сравнения (blind battles) и система за рейтинг Elo въз основа на реалните предпочитания на потребителите.
- 24 април 2023 — техническо стартиране на Chatbot Arena.
- 3 май 2023 — официален публичен релийз и публикуване на първата класация.
- 2023 — релийз на първите отворени dataset-а: 33 хил. двойни диалога (юли) и LMSYS‑Chat‑1M (септември, около 1 млн реални диалога).
- 1 март 2024 — публикуване на официалната политика на платформата, формализиране на мисията като открита community-driven система за оценка.
- 27 юни 2024 — добавяне на поддръжка за изображения и начало на разширяване към мултимодални задачи.
- 20 септември 2024 — „Graduation": преминаване към самостоятелен домейн lmarena.ai.
- Край на 2024 — пролет 2025 — стартиране на специализирани арени (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control и др.).
- 17 април 2025 — официално учредяване като независима компания Arena Intelligence Inc., стартиране на бета версия на обновената платформа под бранда LMArena.
- 21 май 2025 — обявяване на създаването на компанията и привличане на seed-рунд от $100 млн (оценка — $600 млн).
- 31 юли 2025 — публикуване на отворен dataset от 140 хил. скорошни диалога от Text Arena.
- 6 януари 2026 — привличане на Series A рунд от $150 млн при пост-мани оценка от $1,7 млрд.
- Януари 2026 — стартиране на Video Arena (пълна поддръжка на видео-модалност).
- 28 януари 2026 — окончателен ребрандинг: платформата започва да се нарича Arena и преминава към домейна arena.ai.
Към март 2026 година Arena (arena.ai) обслужва повече от 5 млн месечно активни потребители от 150+ държави, натрупала е десетки милиони гласа и остава един от най-авторитетните независими инструменти за оценка на frontier модели за ИИ въз основа на реални човешки предпочитания.
Как работи оценката
Потребителят въвежда заявка и получава два отговора от случайно избрани анонимни модели („A" и „B"), след което гласува за по-добрия отговор (или отбелязва равенство/незадоволителност). Класирането се основава на статистическия модел Брадли—Тери (логистична регресия по двойни предпочитания), интуитивно близък до Elo[1]. Платформата публикува Arena Score и доверителни интервали, а също прилага корекции на извадката (re‑weighting), за да запази безпристрастността при неравномерно семплиране[9].
Прозрачност и откритост. Изходните pipeline-и за оценка и класиране са отворени в репозиторито FastChat[10]; периодично се публикуват части от суровите данни за верификация и изследвания (напр., релийзът на 140K диалога през юли 2025)[9][11]. Съгласно FAQ и предупрежденията на началната страница, потребителските заявки могат да бъдат разкривани на доставчиците на модели и частично публикувани за изследователски цели — не бива да се изпращат чувствителни данни[12][13].
Правила за подбор и семплиране. В класациите се включват модели с общ достъп (отворени тегла/публичен API/публична услуга). За стабилизиране на оценката обикновено са необходими ≥1000 гласа; не по-малко от 20% от битките са само между публични модели; вероятността за семплиране нараства с рейтинга и несигурността, а регресията с претегляне осигурява безпристрастност на крайните оценки[9].
Авто‑метрики и контрол на стила. За ускорена оценка и намаляване на ефектите от „стилови" предпочитания се прилагат спомагателни методики: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (автогенериране на трудни въпроси)[15], а също Style/Sentiment Control (моделиране и „лекуване" на ефекта от тона/емоциите върху предпочитанията)[16]. За Arena‑Hard‑Auto е докладвана много висока съгласуваност с „живите" човешки гласове (до ≈98,6% при контролирани условия)[17].
Арени и домейни за оценка
Платформата се е развила в набор от „арени" по типове задачи:
- Text Arena — общи диалози/задачи, основна таблица[18].
- Vision Arena — мултимодални модели „текст→изображение/видео/анализ на изображения"[19].
- Text‑to‑Image и Image Edit — генериране и редактиране на изображения (вкл. случаят nano‑banana)[20][21].
- Text‑/Image‑to‑Video — генериране на видео[22].
- WebDev Arena — изграждане на уеб приложения от описания[23].
- RepoChat Arena — задачи за ИИ инженерство по код/репозитории[24].
- Search Arena — модели с връзка към уеб търсене; първоначално стартирана през април 2025 (legacy), след това изведена на основния сайт, придружена от dataset и публикация[25][26][27].
- BiomedArena.AI — домейно-специфична оценка за биомедицински задачи (партньорство с DataTecnica)[28].
Приложение и влияние
- Индустриална витрина. Най-големите доставчици (OpenAI, Anthropic, Google и др.) редовно тестват и демонстрират модели на LMArena; индустриалните медии описват платформата като важен ориентир[5][29]. В индустриална публикация NAACL‑2025 Elo оценката на Chatbot Arena е наречена „gold industry‑standard"[30].
- Тестване преди релийз. Политиката допуска анонимни предварителни прегледи на „нерелийзнати" модели с уведомление на общността и последваща публикация на публични оценки след релийза; минимум ≈1000 гласа за стабилизиране[9].
- Известни епизоди. През пролетта на 2025 година се обсъждаше анонимният модел Llama‑4 Maverick‑03‑26‑Experimental (инцидент около сравнението с публичните версии), което привлече широко медийно внимание и провокира актуализации на правилата и комуникациите[31][32]. През август 2025 година „nano‑banana" се разкри като Gemini 2.5 Flash Image и зае водещи позиции във визуалните арени[21][20].
Ограничения и критика
Въпреки мащаба и популярността, подходът има ограничения:
- Субективност и стилови ефекти. Гласовите предпочитания зависят от тона/маниера на отговора; екипът въвежда Style/Sentiment Control за декаплинг на „стил" и „съдържание"[16].
- Непредставителност на аудиторията. Ядрото на активните потребители са технологични ентусиасти/разработчици; за домейн-специфични сценарии се създават специализирани арени (Search, WebDev, Biomed и др.)[33].
- Уязвимост към манипулации и изкривявания. Изследвания от 2025 година показват, че при липса на строга защита са възможни стратегии за „накрутване" с стотици–хиляди гласа; при това съвместната работа на изследователите с LMArena е довела до въвеждане на защитни мерки (CAPTCHA/вход/защита от ботове/засичане на аномалии) и повишаване на „цената на атаката"[34][35][36].
- Методологична критика. Трудът The Leaderboard Illusion (април 2025) посочва системни и институционални фактори, способни да изкривят конкурентното поле; LMArena е публикувала подробен отговор и поддържа публичен changelog на методологията[37][38][39].
Връзки
- Официален сайт на LMArena
- Блог/политики и актуализации на LMArena
- Сайт на изследователската група LMSYS (оригинален инкубатор на проекта)
Литература
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Бележки
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]