LMArena (Chatbot Arena) (HU)
Arena (2026. január 28-ig — LMArena (Large Model Arena), korábban — Chatbot Arena) — nyílt, közösségi alapú (crowdsourcing) webes platform nagy nyelvi modellek (LLM) és multimodális modellek (szöveg, kép, videó) értékelésére és összehasonlító rangsorolására, valós emberi preferenciák alapján. A platform alapját névtelen páros összehasonlítások (blind battles) és az Elo-értékelési rendszer képezi; ezekre épülnek az átlátható, nyilvános ranglisták (leaderboard-ok), amelyeket a mesterséges intelligencia frontier-modelljeinek egyik legmegbízhatóbb független benchmark-jaként tartanak számon.[1][2]
A platform 2023-ban jött létre az LMSYS Org (Large Model Systems Organization) akadémiai kutatási projekteként, a Berkeley-i Kaliforniai Egyetemen (Sky Computing Lab). 2024 szeptemberében a projekt önálló tartományra váltott: lmarena.ai („Graduation")[3]. 2025 áprilisában megalakult az önálló Arena Intelligence Inc. vállalat, 2025. május 21-én pedig 100 millió dolláros magvetési (seed) finanszírozási kört zártak le (600 millió dolláros értékeléssel; fő befektetők: a16z és UC Investments)[4][5]. 2026. január 6-án a vállalat lezárta az A sorozatú finanszírozási körét, amely 150 millió dollár értékű volt, a post-money értékelés 1,7 milliárd dollár volt[6]. 2026. január 28-án megtörtént a végleges márkaváltás — a platform neve Arena lett, és átköltözött az arena.ai tartományra[7][8].
Történet
A platform 2023 áprilisában indult Chatbot Arena néven, az LMSYS Org (Large Model Systems Organization) kutatási projekteként, a Berkeley-i Kaliforniai Egyetemen (Sky Computing Lab). Az első olyan eszközök egyike volt, amely közösségi alapú (crowdsourcing) értékelést kínált nagy nyelvi modellek számára névtelen páros összehasonlítások (blind battles) és Elo-értékelési rendszer segítségével, valós felhasználói preferenciák alapján.
- 2023. április 24. — a Chatbot Arena technikai indítása.
- 2023. május 3. — hivatalos nyilvános kiadás és az első rangsor publikálása.
- 2023 — az első nyílt adathalmazok (dataset) megjelenése: 33 ezer páros párbeszéd (július) és LMSYS‑Chat‑1M (szeptember, kb. 1 millió valós párbeszéd).
- 2024. március 1. — a platform hivatalos szabályzatának közzététele, a nyílt, közösség által vezérelt (community-driven) értékelési rendszer küldetésének formalizálása.
- 2024. június 27. — képtámogatás hozzáadása és a multimodális feladatokra való bővítés megkezdése.
- 2024. szeptember 20. — „Graduation": átállás az önálló lmarena.ai tartományra.
- 2024 vége – 2025 tavasza — szakosított arénák indítása (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control stb.).
- 2025. április 17. — hivatalos inkorporáció önálló vállalatként (Arena Intelligence Inc.), az LMArena márkanév alatt frissített platform béta verziójának indítása.
- 2025. május 21. — a vállalat alapításának bejelentése és 100 millió dolláros magvetési finanszírozási kör zárása (600 millió dolláros értékelés).
- 2025. július 31. — nyílt adathalmaz publikálása, amely 140 ezer legutóbbi Text Arena párbeszédet tartalmaz.
- 2026. január 6. — 150 millió dolláros A sorozatú finanszírozási kör lezárása, 1,7 milliárd dolláros post-money értékeléssel.
- 2026. január — Video Arena elindítása (teljes videó-modalitás támogatás).
- 2026. január 28. — végleges márkaváltás: a platform neve Arena lett, és átköltözött az arena.ai tartományra.
2026 márciusára az Arena (arena.ai) havonta több mint 5 millió aktív felhasználót szolgál ki 150+ országból, több tízmillió szavazatot gyűjtött össze, és továbbra is az egyik legmegbízhatóbb független eszköz marad a frontier AI-modellek valós emberi preferenciák alapján történő értékelésére.
Az értékelés működése
A felhasználó begépel egy kérést, és két véletlenszerűen kiválasztott, névtelen modell („A" és „B") válaszát kapja meg, majd szavaz a jobb válaszra (vagy rögzíti a döntetlent/elégedetlenséget). A rangsorolás a Bradley–Terry-modellen alapul (logisztikus regresszió páros preferenciák alapján), amely intuitívan közel áll az Elo-rendszerhez[1]. A platform közli az Arena Score-t és a megbízhatósági intervallumokat, valamint mintavételi korrekciókat (re‑weighting) alkalmaz az egyenlőtlen mintavételezés esetén is megőrzött torzítatlanság érdekében[9].
Átláthatóság és nyitottság. Az értékelési és rangsorolási pipeline-ok forráskódja nyíltan elérhető a FastChat adattárban[10]; rendszeresen közzéteszik a nyers adatok egyes részeit ellenőrzés és kutatás céljából (pl. 140 ezer párbeszéd kiadása 2025 júliusában)[9][11]. A GYIK és a főoldalon található figyelmeztetések szerint a felhasználói kérések megoszthatók a modellek szolgáltatóival és részben közzétehetők kutatási célokra — érzékeny adatokat nem szabad beküldeni[12][13].
Kiválasztási és mintavételezési szabályok. A rangsorokba nyilvánosan hozzáférhető modellek kerülnek (nyílt súlyok/nyilvános API/nyilvános szolgáltatás). Az értékelés stabilizálásához általában ≥1000 szavazat szükséges; az ütközések legalább 20%‑a csak nyilvános modellek között zajlik; a mintavétel valószínűsége a ranggal és a bizonytalansággal együtt nő, az újrasúlyozással végzett regresszió pedig biztosítja a végső értékelések torzítatlanságát[9].
Automatikus metrikák és stílusvezérlés. A gyorsított értékelés és a „stílusos" preferenciák hatásának csökkentése érdekében segédmódszereket alkalmaznak: MT‑Bench (LLM-as-a-judge)[14], Arena‑Hard (összetett kérdések automatikus generálása)[15], valamint Style/Sentiment Control (a hangnem/érzelmek preferenciákra gyakorolt hatásának modellezése és „kezelése")[16]. Az Arena‑Hard‑Auto esetében nagyon magas egyezést mutattak ki az „élő" emberi szavazatokkal (ellenőrzött körülmények között akár ≈98,6%)[17].
Arénák és értékelési tartományok
A platform feladattípusonkénti „arénák" gyűjteményévé fejlődött:
- Text Arena — általános párbeszédek/feladatok, a fő táblázat[18].
- Vision Arena — multimodális modellek „szöveg→kép/videó/képelemzés" feladatokhoz[19].
- Text‑to‑Image és Image Edit — képgenerálás és képszerkesztés (beleértve a nano‑banana esetet)[20][21].
- Text‑/Image‑to‑Video — videógenerálás[22].
- WebDev Arena — webalkalmazások összeállítása leírások alapján[23].
- RepoChat Arena — AI-mérnöki feladatok kóddal/adattárakkal[24].
- Search Arena — webes kereséshez kapcsolódó modellek; először 2025 áprilisában indult (korábbi verzió), majd a főoldalra került, adathalmazzal és publikációval kísérve[25][26][27].
- BiomedArena.AI — tartomány-specifikus értékelés biomedicinális feladatokhoz (DataTecnica partnerség)[28].
Alkalmazás és hatás
- Ipari bemutató. A legnagyobb gyártók (OpenAI, Anthropic, Google stb.) rendszeresen tesztelik és mutatják be modelljeiket az LMArena platformon; az iparági médiumok fontos referenciapontként írják le a platformot[5][29]. A NAACL‑2025 iparági kiadványban a Chatbot Arena Elo-értékelését „gold industry‑standard"-nak nevezik[30].
- Kiadás előtti tesztelés. A szabályzat lehetővé teszi „még ki nem adott" modellek névtelen előnézetét a közösség értesítésével és a nyilvános értékelések kiadás utáni közzétételével; a stabilizáláshoz legalább ≈1000 szavazat szükséges[9].
- Ismert esetek. 2025 tavaszán az anonimizált Llama‑4 Maverick‑03‑26‑Experimental modell körüli vita (a nyilvános verziókkal való összehasonlítás körüli incidens) széles sajtófigyelmet kapott, és a szabályok/kommunikáció frissítéséhez vezetett[31][32]. 2025 augusztusában a „nano‑banana" a Gemini 2.5 Flash Image modellként azonosítódott, és vezető pozíciót szerzett a vizuális arénákban[21][20].
Korlátok és kritika
A méret és a népszerűség ellenére a megközelítésnek megvannak a korlátai:
- Szubjektivitás és stílushatások. A szavazati preferenciák függnek a válasz hangjától/stílusától; a csapat Style/Sentiment Control megoldást vezet be a „stílus" és a „tartalom" szétválasztásához[16].
- A közönség reprezentativitásának hiánya. Az aktív mag technológia-rajongókból/fejlesztőkből áll; tartomány-specifikus forgatókönyvekhez szakosított arénák jönnek létre (Search, WebDev, Biomed stb.)[33].
- Manipulációra és torzítására való sebezhetőség. A 2025-ös kutatások megmutatták, hogy erős védelem nélkül lehetséges a szavazatok „feltornázása" több száz–ezer szavazattal; ugyanakkor a kutatók és az LMArena együttműködése védelmi intézkedések bevezetéséhez vezetett (CAPTCHA/bejelentkezés/bot-védelem/anomáliadetektálás) és a „támadás költségének" növekedéséhez[34][35][36].
- Módszertani kritika. The Leaderboard Illusion (2025. április) című munka szisztematikus és intézményi tényezőkre mutat rá, amelyek torzíthatják a versenyterületet; az LMArena részletes választ tett közzé, és nyilvános módszertani changelog-ot vezet[37][38][39].
Hivatkozások
- Az LMArena hivatalos weboldala
- Az LMArena blogja/szabályzatai és frissítései
- Az LMSYS kutatócsoport weboldala (a projekt eredeti inkubátora)
Irodalom
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Megjegyzések
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]