LMArena (Chatbot Arena) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (2026. január 28-ig — LMArena (Large Model Arena), korábban — Chatbot Arena) — nyílt, közösségi alapú (crowdsourcing) webes platform nagy nyelvi modellek (LLM) és multimodális modellek (szöveg, kép, videó) értékelésére és összehasonlító rangsorolására, valós emberi preferenciák alapján. A platform alapját névtelen páros összehasonlítások (blind battles) és az Elo-értékelési rendszer képezi; ezekre épülnek az átlátható, nyilvános ranglisták (leaderboard-ok), amelyeket a mesterséges intelligencia frontier-modelljeinek egyik legmegbízhatóbb független benchmark-jaként tartanak számon.[1][2]

A platform 2023-ban jött létre az LMSYS Org (Large Model Systems Organization) akadémiai kutatási projekteként, a Berkeley-i Kaliforniai Egyetemen (Sky Computing Lab). 2024 szeptemberében a projekt önálló tartományra váltott: lmarena.ai („Graduation")[3]. 2025 áprilisában megalakult az önálló Arena Intelligence Inc. vállalat, 2025. május 21-én pedig 100 millió dolláros magvetési (seed) finanszírozási kört zártak le (600 millió dolláros értékeléssel; fő befektetők: a16z és UC Investments)[4][5]. 2026. január 6-án a vállalat lezárta az A sorozatú finanszírozási körét, amely 150 millió dollár értékű volt, a post-money értékelés 1,7 milliárd dollár volt[6]. 2026. január 28-án megtörtént a végleges márkaváltás — a platform neve Arena lett, és átköltözött az arena.ai tartományra[7][8].

Történet

A platform 2023 áprilisában indult Chatbot Arena néven, az LMSYS Org (Large Model Systems Organization) kutatási projekteként, a Berkeley-i Kaliforniai Egyetemen (Sky Computing Lab). Az első olyan eszközök egyike volt, amely közösségi alapú (crowdsourcing) értékelést kínált nagy nyelvi modellek számára névtelen páros összehasonlítások (blind battles) és Elo-értékelési rendszer segítségével, valós felhasználói preferenciák alapján.

  • 2023. április 24. — a Chatbot Arena technikai indítása.
  • 2023. május 3. — hivatalos nyilvános kiadás és az első rangsor publikálása.
  • 2023 — az első nyílt adathalmazok (dataset) megjelenése: 33 ezer páros párbeszéd (július) és LMSYS‑Chat‑1M (szeptember, kb. 1 millió valós párbeszéd).
  • 2024. március 1. — a platform hivatalos szabályzatának közzététele, a nyílt, közösség által vezérelt (community-driven) értékelési rendszer küldetésének formalizálása.
  • 2024. június 27. — képtámogatás hozzáadása és a multimodális feladatokra való bővítés megkezdése.
  • 2024. szeptember 20. — „Graduation": átállás az önálló lmarena.ai tartományra.
  • 2024 vége – 2025 tavasza — szakosított arénák indítása (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control stb.).
  • 2025. április 17. — hivatalos inkorporáció önálló vállalatként (Arena Intelligence Inc.), az LMArena márkanév alatt frissített platform béta verziójának indítása.
  • 2025. május 21. — a vállalat alapításának bejelentése és 100 millió dolláros magvetési finanszírozási kör zárása (600 millió dolláros értékelés).
  • 2025. július 31. — nyílt adathalmaz publikálása, amely 140 ezer legutóbbi Text Arena párbeszédet tartalmaz.
  • 2026. január 6.150 millió dolláros A sorozatú finanszírozási kör lezárása, 1,7 milliárd dolláros post-money értékeléssel.
  • 2026. januárVideo Arena elindítása (teljes videó-modalitás támogatás).
  • 2026. január 28. — végleges márkaváltás: a platform neve Arena lett, és átköltözött az arena.ai tartományra.

2026 márciusára az Arena (arena.ai) havonta több mint 5 millió aktív felhasználót szolgál ki 150+ országból, több tízmillió szavazatot gyűjtött össze, és továbbra is az egyik legmegbízhatóbb független eszköz marad a frontier AI-modellek valós emberi preferenciák alapján történő értékelésére.

Az értékelés működése

A felhasználó begépel egy kérést, és két véletlenszerűen kiválasztott, névtelen modell („A" és „B") válaszát kapja meg, majd szavaz a jobb válaszra (vagy rögzíti a döntetlent/elégedetlenséget). A rangsorolás a Bradley–Terry-modellen alapul (logisztikus regresszió páros preferenciák alapján), amely intuitívan közel áll az Elo-rendszerhez[1]. A platform közli az Arena Score-t és a megbízhatósági intervallumokat, valamint mintavételi korrekciókat (re‑weighting) alkalmaz az egyenlőtlen mintavételezés esetén is megőrzött torzítatlanság érdekében[9].

Átláthatóság és nyitottság. Az értékelési és rangsorolási pipeline-ok forráskódja nyíltan elérhető a FastChat adattárban[10]; rendszeresen közzéteszik a nyers adatok egyes részeit ellenőrzés és kutatás céljából (pl. 140 ezer párbeszéd kiadása 2025 júliusában)[9][11]. A GYIK és a főoldalon található figyelmeztetések szerint a felhasználói kérések megoszthatók a modellek szolgáltatóival és részben közzétehetők kutatási célokra — érzékeny adatokat nem szabad beküldeni[12][13].

Kiválasztási és mintavételezési szabályok. A rangsorokba nyilvánosan hozzáférhető modellek kerülnek (nyílt súlyok/nyilvános API/nyilvános szolgáltatás). Az értékelés stabilizálásához általában ≥1000 szavazat szükséges; az ütközések legalább 20%‑a csak nyilvános modellek között zajlik; a mintavétel valószínűsége a ranggal és a bizonytalansággal együtt nő, az újrasúlyozással végzett regresszió pedig biztosítja a végső értékelések torzítatlanságát[9].

Automatikus metrikák és stílusvezérlés. A gyorsított értékelés és a „stílusos" preferenciák hatásának csökkentése érdekében segédmódszereket alkalmaznak: MT‑Bench (LLM-as-a-judge)[14], Arena‑Hard (összetett kérdések automatikus generálása)[15], valamint Style/Sentiment Control (a hangnem/érzelmek preferenciákra gyakorolt hatásának modellezése és „kezelése")[16]. Az Arena‑Hard‑Auto esetében nagyon magas egyezést mutattak ki az „élő" emberi szavazatokkal (ellenőrzött körülmények között akár ≈98,6%)[17].

Arénák és értékelési tartományok

A platform feladattípusonkénti „arénák" gyűjteményévé fejlődött:

  • Text Arena — általános párbeszédek/feladatok, a fő táblázat[18].
  • Vision Arena — multimodális modellek „szöveg→kép/videó/képelemzés" feladatokhoz[19].
  • Text‑to‑Image és Image Edit — képgenerálás és képszerkesztés (beleértve a nano‑banana esetet)[20][21].
  • Text‑/Image‑to‑Video — videógenerálás[22].
  • WebDev Arena — webalkalmazások összeállítása leírások alapján[23].
  • RepoChat Arena — AI-mérnöki feladatok kóddal/adattárakkal[24].
  • Search Arena — webes kereséshez kapcsolódó modellek; először 2025 áprilisában indult (korábbi verzió), majd a főoldalra került, adathalmazzal és publikációval kísérve[25][26][27].
  • BiomedArena.AI — tartomány-specifikus értékelés biomedicinális feladatokhoz (DataTecnica partnerség)[28].

Alkalmazás és hatás

  • Ipari bemutató. A legnagyobb gyártók (OpenAI, Anthropic, Google stb.) rendszeresen tesztelik és mutatják be modelljeiket az LMArena platformon; az iparági médiumok fontos referenciapontként írják le a platformot[5][29]. A NAACL‑2025 iparági kiadványban a Chatbot Arena Elo-értékelését „gold industry‑standard"-nak nevezik[30].
  • Kiadás előtti tesztelés. A szabályzat lehetővé teszi „még ki nem adott" modellek névtelen előnézetét a közösség értesítésével és a nyilvános értékelések kiadás utáni közzétételével; a stabilizáláshoz legalább ≈1000 szavazat szükséges[9].
  • Ismert esetek. 2025 tavaszán az anonimizált Llama‑4 Maverick‑03‑26‑Experimental modell körüli vita (a nyilvános verziókkal való összehasonlítás körüli incidens) széles sajtófigyelmet kapott, és a szabályok/kommunikáció frissítéséhez vezetett[31][32]. 2025 augusztusában a „nano‑banana" a Gemini 2.5 Flash Image modellként azonosítódott, és vezető pozíciót szerzett a vizuális arénákban[21][20].

Korlátok és kritika

A méret és a népszerűség ellenére a megközelítésnek megvannak a korlátai:

  • Szubjektivitás és stílushatások. A szavazati preferenciák függnek a válasz hangjától/stílusától; a csapat Style/Sentiment Control megoldást vezet be a „stílus" és a „tartalom" szétválasztásához[16].
  • A közönség reprezentativitásának hiánya. Az aktív mag technológia-rajongókból/fejlesztőkből áll; tartomány-specifikus forgatókönyvekhez szakosított arénák jönnek létre (Search, WebDev, Biomed stb.)[33].
  • Manipulációra és torzítására való sebezhetőség. A 2025-ös kutatások megmutatták, hogy erős védelem nélkül lehetséges a szavazatok „feltornázása" több száz–ezer szavazattal; ugyanakkor a kutatók és az LMArena együttműködése védelmi intézkedések bevezetéséhez vezetett (CAPTCHA/bejelentkezés/bot-védelem/anomáliadetektálás) és a „támadás költségének" növekedéséhez[34][35][36].
  • Módszertani kritika. The Leaderboard Illusion (2025. április) című munka szisztematikus és intézményi tényezőkre mutat rá, amelyek torzíthatják a versenyterületet; az LMArena részletes választ tett közzé, és nyilvános módszertani changelog-ot vezet[37][38][39].

Hivatkozások

  • Az LMArena hivatalos weboldala
  • Az LMArena blogja/szabályzatai és frissítései
  • Az LMSYS kutatócsoport weboldala (a projekt eredeti inkubátora)

Irodalom

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Megjegyzések

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [4]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
  10. lm‑sys/FastChat (GitHub). [6]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
  12. FAQ. LMArena. [8]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
  18. Text Arena (English). LMArena. [14]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [20]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
  39. «Methodology Changelog». LMArena Blog. [36]