LMArena (Chatbot Arena) (TL)
Arena (hanggang 28 Enero 2026 — LMArena (Large Model Arena), dating — Chatbot Arena) — isang bukas na crowdsourcing na web platform para sa pagtatasa at paghahambing ng ranggo ng malalaking language model (LLM) at multimodal na modelo (teksto, larawan, video) batay sa tunay na kagustuhan ng tao. Ang pundasyon ng platform ay ang mga anonymous na pairwise comparison (blind battles) ng mga modelo at ang sistema ng rating na Elo; batay dito ay inilalathala ang mga transparent na pampublikong leaderboard, na itinuturing na isa sa pinaka-awtoritatibong independiyenteng benchmark ng mga frontier model ng artificial intelligence.[1][2]
Ang platform ay isinilang noong 2023 bilang isang akademikong proyektong pananaliksik ng organisasyong LMSYS Org (Large Model Systems Organization) sa Unibersidad ng California sa Berkeley (Sky Computing Lab). Noong Setyembre 2024, ang proyekto ay "nagtapos" sa isang hiwalay na domain na lmarena.ai («Graduation»)[3]. Noong Abril 2025, ang isang independiyenteng kumpanya na Arena Intelligence Inc. ay itinatag, at noong 21 Mayo 2025 ay nakaakit ng seed round na $100 milyon (pagpapahalaga na $600 milyon, pangunahing mga mamumuhunan — a16z at UC Investments)[4][5]. Noong 6 Enero 2026, isinara ng kumpanya ang isang Series A round na nagkakahalaga ng $150 milyon sa post-money na pagpapahalaga na $1.7 bilyon[6]. Noong 28 Enero 2026, naganap ang panghuling rebranding — ang platform ay naging Arena at lumipat sa domain na arena.ai[7][8].
Kasaysayan
Ang platform ay inilunsad noong Abril 2023 sa ilalim ng pangalang Chatbot Arena bilang isang proyektong pananaliksik ng organisasyong LMSYS Org (Large Model Systems Organization) sa Unibersidad ng California sa Berkeley (Sky Computing Lab). Naging isa ito sa mga unang kagamitan para sa crowdsourcing na pagtatasa ng malalaking language model sa pamamagitan ng mga anonymous na pairwise comparison (blind battles) at sistema ng rating na Elo batay sa tunay na kagustuhan ng mga gumagamit.
- 24 Abril 2023 — teknikal na paglulunsad ng Chatbot Arena.
- 3 Mayo 2023 — opisyal na pampublikong release at paglalathala ng unang leaderboard.
- 2023 — release ng mga unang bukas na dataset: 33 libong pairwise na diyalogo (Hulyo) at LMSYS‑Chat‑1M (Setyembre, humigit-kumulang 1 milyong tunay na diyalogo).
- 1 Marso 2024 — paglalathala ng opisyal na patakaran ng platform, pormalisasyon ng misyon bilang isang bukas na community-driven na sistema ng pagtatasa.
- 27 Hunyo 2024 — pagdaragdag ng suporta para sa mga larawan at simula ng pagpapalawak sa mga multimodal na gawain.
- 20 Setyembre 2024 — «Graduation»: paglipat sa isang hiwalay na domain na lmarena.ai.
- Katapusan ng 2024 — tagsibol ng 2025 — paglulunsad ng mga espesyalisadong arena (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control at iba pa).
- 17 Abril 2025 — opisyal na inkorporasyon bilang isang independiyenteng kumpanya na Arena Intelligence Inc., paglulunsad ng beta na bersyon ng na-update na platform sa ilalim ng brand na LMArena.
- 21 Mayo 2025 — anunsyo ng paglikha ng kumpanya at pag-akit ng seed round na $100 milyon (pagpapahalaga — $600 milyon).
- 31 Hulyo 2025 — paglalathala ng bukas na dataset mula sa 140 libo kamakailan lamang na diyalogo ng Text Arena.
- 6 Enero 2026 — pag-akit ng Series A round na $150 milyon sa post-money na pagpapahalaga na $1.7 bilyon.
- Enero 2026 — paglulunsad ng Video Arena (buong suporta para sa video modality).
- 28 Enero 2026 — panghuling rebranding: ang platform ay naging Arena at lumipat sa domain na arena.ai.
Sa Marso 2026, ang Arena (arena.ai) ay naglilingkod sa mahigit 5 milyong buwanang aktibong gumagamit mula sa 150+ na bansa, nakalapat ng dose-dosenang milyong boto at nananatiling isa sa pinaka-awtoritatibong independiyenteng kagamitan para sa pagtatasa ng mga frontier model ng AI batay sa tunay na kagustuhan ng tao.
Paano Gumagana ang Pagtatasa
Inilalagay ng gumagamit ang isang kahilingan at tumatanggap ng dalawang sagot mula sa mga random na piniling anonymous na modelo («A» at «B»), pagkatapos ay bumoboto para sa pinakamahusay na sagot (o itinatala ang pantay/hindi kasiya-siya). Ang ranggo ay batay sa estadistikal na modelo ng Bradley–Terry (logistic regression sa pairwise na kagustuhan), na intuitive na katulad ng Elo[1]. Inilalathala ng platform ang Arena Score at mga agwat ng kumpiyansa, at naglalapat din ng mga pagwawasto ng sample (re‑weighting) upang mapanatili ang kawalan ng pagkiling sa hindi pantay na sampling[9].
Transparency at Pagiging Bukas. Ang mga pinagmulang pipeline ng pagtatasa at pagra-ranggo ay bukas sa repositoryo ng FastChat[10]; pana-panahong inilalathala ang mga bahagi ng hilaw na datos para sa pag-verify at pananaliksik (hal., release ng 140K diyalogo noong Hulyo 2025)[9][11]. Ayon sa FAQ at mga babala sa pangunahing pahina, ang mga kahilingan ng gumagamit ay maaaring ibunyag sa mga provider ng modelo at bahagyang ilathala para sa mga layuning pangpananaliksik — hindi dapat magpadala ng sensitibong datos[12][13].
Mga Panuntunan sa Pagpili at Sampling. Kasama sa mga leaderboard ang mga modelo na may pangkalahatang access (bukas na timbang/pampublikong API/pampublikong serbisyo). Para sa pagpapanatag ng pagtatasa, karaniwang kinakailangan ang ≥1000 boto; hindi bababa sa 20% ng mga battle — sa pagitan lamang ng mga pampublikong modelo; ang posibilidad ng sampling ay lumalaki kasabay ng rating at kawalan ng katiyakan, at ang regression na may muling pagtitimbang ay tinitiyak ang kawalan ng pagkiling ng mga panghuling pagtatantya[9].
Auto-Metric at Kontrol ng Estilo. Para sa pinabilis na pagtatasa at pagbabawas ng mga epekto ng «estilo» sa kagustuhan, gumagamit ng mga karagdagang pamamaraan: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (auto-henerasyon ng mga mahirap na tanong)[15], pati na rin ang Style/Sentiment Control (pagmomodelo at «paglulunas» ng epekto ng tono/emosyon sa kagustuhan)[16]. Para sa Arena‑Hard‑Auto ay naiulat na napakataas na pagkakatugma sa «live» na boto ng tao (hanggang ≈98.6% sa mga kontroladong kondisyon)[17].
Mga Arena at Domain ng Pagtatasa
Ang platform ay naging isang koleksyon ng mga «arena» ayon sa uri ng gawain:
- Text Arena — mga pangkalahatang diyalogo/gawain, pangunahing talahanayan[18].
- Vision Arena — mga multimodal na modelo «teksto→larawan/video/pagsusuri ng larawan»[19].
- Text‑to‑Image at Image Edit — henerasyon at pag-edit ng mga larawan (kasama ang kaso ng nano‑banana)[20][21].
- Text‑/Image‑to‑Video — henerasyon ng video[22].
- WebDev Arena — pagbuo ng mga web application mula sa mga paglalarawan[23].
- RepoChat Arena — mga gawain ng AI engineering sa code/repositoryo[24].
- Search Arena — mga modelo na may koneksyon sa web search; unang inilunsad noong Abril 2025 (legacy), pagkatapos ay inilipat sa pangunahing site, sinasamahan ng dataset at publikasyon[25][26][27].
- BiomedArena.AI — domain-specific na pagtatasa para sa mga biomedical na gawain (pakikipagtulungan sa DataTecnica)[28].
Paggamit at Impluwensya
- Industriyal na Showcase. Ang mga pinakamalalaking vendor (OpenAI, Anthropic, Google at iba pa) ay regular na sumusubok at nagpapakita ng mga modelo sa LMArena; inilarawan ng mga industriyal na media ang platform bilang isang mahalagang sanggunian[5][29]. Sa isang industriyal na publikasyon ng NAACL‑2025, ang Elo rating ng Chatbot Arena ay tinawag na «gold industry‑standard»[30].
- Pre-release na Pagsubok. Pinapayagan ng patakaran ang mga anonymous na preview ng mga modelong «hindi pa inilabas» na may abiso sa komunidad at kasunod na paglalathala ng mga pampublikong pagtatantya pagkatapos ng release; minimum na ≈1000 boto para sa pagpapanatag[9].
- Mga Kilalang Pangyayari. Noong tagsibol ng 2025, pinag-usapan ang anonymous na modelo na Llama‑4 Maverick‑03‑26‑Experimental (insidente sa paligid ng paghahambing sa mga pampublikong bersyon), na nakaakit ng malawak na atensyon ng press at nagbigay ng dahilan para sa mga update sa mga panuntunan/komunikasyon[31][32]. Noong Agosto 2025, ang «nano‑banana» ay natuklasan bilang Gemini 2.5 Flash Image at umabot sa mga nangungunang posisyon sa mga visual na arena[21][20].
Mga Limitasyon at Kritisismo
Sa kabila ng sukat at katanyagan, ang pamamaraan ay may mga limitasyon:
- Subjektibidad at Mga Epekto ng Estilo. Ang mga kagustuhan ng boto ay nakasalalay sa tono/paraan ng sagot; ipinapatupad ng koponan ang Style/Sentiment Control para sa pag-decouple ng «estilo» at «nilalaman»[16].
- Kawalan ng Representasyon ng Madla. Ang pangunahing aktibo ay mga tech-enthusiast/developer; para sa mga domain na sitwasyon, nilikha ang mga espesyalisadong arena (Search, WebDev, Biomed at iba pa)[33].
- Kahinaan sa Manipulasyon at Pagkiling. Ipinapakita ng mga pag-aaral noong 2025 na sa kawalan ng mahigpit na pangangalaga, posible ang mga estratehiya ng «pagmamanipula» na may daan-daang–libu-libong boto; sa kasong ito, ang magkasamang trabaho ng mga mananaliksik kasama ang LMArena ay humantong sa pagpapatupad ng mga hakbangin sa pangangalaga (CAPTCHA/login/proteksyon laban sa bot/deteksyon ng anomalya) at pagtaas ng «gastos ng pag-atake»[34][35][36].
- Metodolohikal na Kritisismo. Itinuturo ng gawain na The Leaderboard Illusion (Abril 2025) ang mga sistematiko at institusyonal na salik na maaaring makasama sa larangan ng kompetisyon; naglathala ang LMArena ng detalyadong tugon at nagpapanatili ng pampublikong changelog ng metodolohiya[37][38][39].
Mga Link
- Opisyal na website ng LMArena
- Blog/mga patakaran at update ng LMArena
- Website ng pangkat ng pananaliksik ng LMSYS (orihinal na inkubator ng proyekto)
Literaturang Sanggunian
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Mga Tala
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]