LMArena (Chatbot Arena) (PL)
Arena (do 28 stycznia 2026 roku — LMArena (Large Model Arena), wcześniej — Chatbot Arena) — otwarta, oparta na crowdsourcingu platforma internetowa służąca do oceny i porównawczego rankingowania dużych modeli językowych (LLM) oraz modeli multimodalnych (tekst, obraz, wideo) na podstawie rzeczywistych preferencji ludzkich. Podstawę platformy stanowią anonimowe porównania parowe (blind battles) modeli oraz system rankingowy Elo; na ich podstawie publikowane są przejrzyste, publiczne tablice liderów (leaderboardy), uznawane za jeden z najbardziej miarodajnych niezależnych benchmarków frontier-modeli sztucznej inteligencji.[1][2]
Platforma powstała w 2023 roku jako akademicki projekt badawczy organizacji LMSYS Org (Large Model Systems Organization) przy Uniwersytecie Kalifornijskim w Berkeley (Sky Computing Lab). We wrześniu 2024 roku projekt „ukończył inkubację" i przeniósł się na samodzielną domenę lmarena.ai („Graduation")[3]. W kwietniu 2025 roku utworzono niezależną spółkę Arena Intelligence Inc., a 21 maja 2025 roku pozyskano rundę seed w wysokości 100 mln USD (wycena 600 mln USD, główni inwestorzy — a16z i UC Investments)[4][5]. 6 stycznia 2026 roku spółka zamknęła rundę Series A o wartości 150 mln USD przy wycenie post-money wynoszącej 1,7 mld USD[6]. 28 stycznia 2026 roku przeprowadzono finalny rebranding — platforma przyjęła nazwę Arena i przeniosła się na domenę arena.ai[7][8].
Historia
Platforma została uruchomiona w kwietniu 2023 roku pod nazwą Chatbot Arena jako projekt badawczy organizacji LMSYS Org (Large Model Systems Organization) przy Uniwersytecie Kalifornijskim w Berkeley (Sky Computing Lab). Stała się jednym z pierwszych narzędzi crowdsourcingowej oceny dużych modeli językowych za pomocą anonimowych porównań parowych (blind battles) oraz systemu rankingowego Elo, opartego na rzeczywistych preferencjach użytkowników.
- 24 kwietnia 2023 — techniczne uruchomienie Chatbot Arena.
- 3 maja 2023 — oficjalne publiczne wydanie i publikacja pierwszego leaderboardu.
- 2023 — wydanie pierwszych otwartych datasetów: 33 tys. dialogów parowych (lipiec) oraz LMSYS‑Chat‑1M (wrzesień, ok. 1 mln rzeczywistych dialogów).
- 1 marca 2024 — publikacja oficjalnej polityki platformy, formalizacja misji jako otwartego, community-driven systemu oceny.
- 27 czerwca 2024 — dodanie obsługi obrazów i rozpoczęcie rozszerzenia o zadania multimodalne.
- 20 września 2024 — „Graduation": przeniesienie na samodzielną domenę lmarena.ai.
- Koniec 2024 — wiosna 2025 — uruchomienie wyspecjalizowanych aren (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control i in.).
- 17 kwietnia 2025 — oficjalna inkorporacja jako niezależna spółka Arena Intelligence Inc., uruchomienie wersji beta zaktualizowanej platformy pod marką LMArena.
- 21 maja 2025 — ogłoszenie powołania spółki i pozyskanie rundy seed w wysokości 100 mln USD (wycena — 600 mln USD).
- 31 lipca 2025 — publikacja otwartego datasetu zawierającego 140 tys. najnowszych dialogów Text Arena.
- 6 stycznia 2026 — pozyskanie rundy Series A w wysokości 150 mln USD przy wycenie post-money 1,7 mld USD.
- Styczeń 2026 — uruchomienie Video Arena (pełna obsługa modalności wideo).
- 28 stycznia 2026 — finalny rebranding: platforma przyjęła nazwę Arena i przeniosła się na domenę arena.ai.
Do marca 2026 roku Arena (arena.ai) obsługuje ponad 5 mln miesięcznie aktywnych użytkowników ze 150+ krajów, zgromadziła dziesiątki milionów głosów i pozostaje jednym z najbardziej miarodajnych niezależnych narzędzi oceny frontier-modeli AI na podstawie rzeczywistych preferencji ludzkich.
Jak działa ocena
Użytkownik wprowadza zapytanie i otrzymuje dwie odpowiedzi od losowo wybranych anonimowych modeli („A" i „B"), po czym głosuje na lepszą odpowiedź (lub odnotowuje remis/niezadowolenie). Ranking oparty jest na statystycznym modelu Bradleya–Terry'ego (regresja logistyczna na preferencjach parowych), intuicyjnie zbliżonym do Elo[1]. Platforma publikuje Arena Score wraz z przedziałami ufności, a także stosuje korekty próbkowania (re‑weighting) w celu zachowania nieobciążoności przy nierównomiernym samplingiem[9].
Przejrzystość i otwartość. Źródłowe pipeline'y oceny i rankingowania są otwarte w repozytorium FastChat[10]; okresowo publikowane są fragmenty surowych danych do weryfikacji i badań (np. wydanie 140K dialogów w lipcu 2025)[9][11]. Zgodnie z FAQ i ostrzeżeniami na stronie głównej, zapytania użytkowników mogą być ujawniane dostawcom modeli i częściowo publikowane w celach badawczych — nie należy przesyłać danych wrażliwych[12][13].
Zasady doboru i samplingowania. Do leaderboardów włączane są modele ogólnodostępne (otwarte wagi/publiczne API/publiczny serwis). Dla stabilizacji oceny wymagane jest zazwyczaj ≥1000 głosów; co najmniej 20% starć — wyłącznie między modelami publicznymi; prawdopodobieństwo samplingowania rośnie wraz z rankingiem i niepewnością, a regresja z przeważaniem zapewnia nieobciążoność końcowych ocen[9].
Auto‑metryki i kontrola stylu. W celu przyspieszenia oceny i ograniczenia efektów „stylowych" preferencji stosowane są pomocnicze metody: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (autogeneracja trudnych pytań)[15] oraz Style/Sentiment Control (modelowanie i „leczenie" wpływu tonu/emocji na preferencje)[16]. Dla Arena‑Hard‑Auto odnotowano bardzo wysoką zgodność z „żywymi" głosami ludzkimi (do ≈98,6% w warunkach kontrolowanych)[17].
Areny i domeny oceny
Platforma rozwinęła się w zestaw „aren" według typów zadań:
- Text Arena — ogólne dialogi/zadania, główna tabela[18].
- Vision Arena — modele multimodalne „tekst→obraz/wideo/analiza obrazów"[19].
- Text‑to‑Image i Image Edit — generowanie i edycja obrazów (m.in. przypadek nano‑banana)[20][21].
- Text‑/Image‑to‑Video — generowanie wideo[22].
- WebDev Arena — budowanie aplikacji webowych na podstawie opisów[23].
- RepoChat Arena — zadania z zakresu inżynierii AI dotyczące kodu/repozytoriów[24].
- Search Arena — modele z podłączeniem do wyszukiwania internetowego; początkowo uruchomiona w kwietniu 2025 (legacy), następnie przeniesiona na główną stronę, towarzyszy jej dataset i publikacja[25][26][27].
- BiomedArena.AI — dziedzinowa ocena dla zadań biomedycznych (partnerstwo z DataTecnica)[28].
Zastosowanie i wpływ
- Witryna przemysłowa. Najwięksi dostawcy (OpenAI, Anthropic, Google i in.) regularnie testują i prezentują modele na LMArena; branżowe media opisują platformę jako ważny punkt odniesienia[5][29]. W branżowej publikacji NAACL‑2025 ocena Elo Chatbot Arena została nazwana „gold industry‑standard"[30].
- Testowanie przedwydaniowe. Polityka dopuszcza anonimowe podglądy „niewydanych" modeli z powiadomieniem społeczności i późniejszą publikacją ocen publicznych po wydaniu; minimum ≈1000 głosów dla stabilizacji[9].
- Znane epizody. Wiosną 2025 roku dyskutowano o anonimowym modelu Llama‑4 Maverick‑03‑26‑Experimental (incydent dotyczący porównania z wersjami publicznymi), co przyciągnęło szeroką uwagę prasy i sprowokowało aktualizacje zasad/komunikacji[31][32]. W sierpniu 2025 „nano‑banana" okazał się Gemini 2.5 Flash Image i zajął czołowe pozycje w arenach wizualnych[21][20].
Ograniczenia i krytyka
Pomimo skali i popularności, podejście ma swoje ograniczenia:
- Subiektywność i efekty stylowe. Preferencje głosów zależą od tonu/sposobu odpowiedzi; zespół wdrożył Style/Sentiment Control w celu oddzielenia „stylu" od „treści"[16].
- Niereprezentacyjność odbiorców. Aktywne jądro to entuzjaści technologii/deweloperzy; dla scenariuszy dziedzinowych tworzone są wyspecjalizowane areny (Search, WebDev, Biomed i in.)[33].
- Podatność na manipulacje i obciążenia. Badania z 2025 roku wykazują, że przy braku ścisłych zabezpieczeń możliwe są strategie „nabijania głosów" z setkami–tysiącami głosów; przy czym współpraca badaczy z LMArena doprowadziła do wdrożenia środków ochrony (CAPTCHA/logowanie/ochrona przed botami/wykrywanie anomalii) i wzrostu „kosztu ataku"[34][35][36].
- Krytyka metodologiczna. Praca The Leaderboard Illusion (kwiecień 2025) wskazuje na systematyczne i instytucjonalne czynniki mogące wypaczać pole rywalizacji; LMArena opublikowała obszerną odpowiedź i prowadzi publiczny changelog metodologii[37][38][39].
Linki
- Oficjalna strona LMArena
- Blog/polityki i aktualizacje LMArena
- Strona grupy badawczej LMSYS (oryginalny inkubator projektu)
Literatura
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Przypisy
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]