LMArena (Chatbot Arena) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Arena (până la 28 ianuarie 2026 — LMArena (Large Model Arena), anterior — Chatbot Arena) — platformă web deschisă, bazată pe crowdsourcing, pentru evaluarea și clasarea comparativă a modelelor lingvistice de mari dimensiuni (LLM) și a modelelor multimodale (text, imagine, video) pe baza preferințelor reale ale utilizatorilor. Fundamentul platformei îl constituie comparațiile anonime perechi (blind battles) între modele și sistemul de rating Elo; pe baza acestora sunt publicate clasamente publice transparente, considerate unul dintre cele mai autoritare benchmark-uri independente ale modelelor frontier de inteligență artificială.[1][2]

Platforma a apărut în 2023 ca proiect academic de cercetare al organizației LMSYS Org (Large Model Systems Organization) din cadrul Universității California din Berkeley (Sky Computing Lab). În septembrie 2024, proiectul a „absolvit" pe domeniul independent lmarena.ai („Graduation\")[3]. În aprilie 2025 a fost înființată compania independentă Arena Intelligence Inc., iar pe 21 mai 2025 a fost atras un seed round de 100 milioane USD (evaluare de 600 milioane USD, principalii investitori — a16z și UC Investments)[4][5]. Pe 6 ianuarie 2026, compania a închis o rundă Series A de 150 milioane USD la o evaluare post-money de 1,7 miliarde USD[6]. Pe 28 ianuarie 2026 a avut loc rebrandingul final — platforma a primit denumirea Arena și a trecut pe domeniul arena.ai[7][8].

Istoric

Platforma a fost lansată în aprilie 2023 sub denumirea Chatbot Arena ca proiect de cercetare al organizației LMSYS Org (Large Model Systems Organization) din cadrul Universității California din Berkeley (Sky Computing Lab). Aceasta a devenit unul dintre primele instrumente de evaluare crowdsourcing a modelelor lingvistice de mari dimensiuni prin comparații anonime perechi (blind battles) și sistemul de rating Elo bazat pe preferințele reale ale utilizatorilor.

  • 24 aprilie 2023 — lansarea tehnică a Chatbot Arena.
  • 3 mai 2023 — lansarea publică oficială și publicarea primului clasament.
  • 2023 — lansarea primelor dataset-uri deschise: 33 de mii de dialoguri perechi (iulie) și LMSYS‑Chat‑1M (septembrie, aproximativ 1 milion de dialoguri reale).
  • 1 martie 2024 — publicarea politicii oficiale a platformei, formalizarea misiunii ca sistem deschis de evaluare bazat pe comunitate (community-driven).
  • 27 iunie 2024 — adăugarea suportului pentru imagini și începerea extinderii spre sarcini multimodale.
  • 20 septembrie 2024 — „Graduation": tranziția pe domeniul independent lmarena.ai.
  • Sfârșitul anului 2024 — primăvara anului 2025 — lansarea arenelor specializate (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control și altele).
  • 17 aprilie 2025 — înregistrarea oficială ca companie independentă Arena Intelligence Inc., lansarea versiunii beta a platformei actualizate sub brandul LMArena.
  • 21 mai 2025 — anunțarea creării companiei și atragerea unui seed round de 100 milioane USD (evaluare — 600 milioane USD).
  • 31 iulie 2025 — publicarea unui dataset deschis cu 140 de mii de dialoguri recente din Text Arena.
  • 6 ianuarie 2026 — atragerea rundei Series A de 150 milioane USD la o evaluare post-money de 1,7 miliarde USD.
  • Ianuarie 2026 — lansarea Video Arena (suport complet pentru modalitatea video).
  • 28 ianuarie 2026 — rebranding final: platforma a primit denumirea Arena și a trecut pe domeniul arena.ai.

Până în martie 2026, Arena (arena.ai) deservea peste 5 milioane de utilizatori activi lunar din peste 150 de țări, acumulând zeci de milioane de voturi și rămânând unul dintre cele mai autoritare instrumente independente de evaluare a modelelor frontier de IA pe baza preferințelor reale ale utilizatorilor.

Cum funcționează evaluarea

Utilizatorul introduce o interogare și primește două răspunsuri de la modele anonime selectate aleatoriu („A" și „B"), după care votează pentru cel mai bun răspuns (sau constată o remiză/nesatisfacție). Clasarea se bazează pe modelul statistic Bradley–Terry (regresie logistică pe preferințe perechi), intuitiv apropiat de Elo[1]. Platforma publică Arena Score și intervale de încredere, aplicând totodată corecții de eșantionare (re‑weighting) pentru a menține caracterul nedeformat al estimărilor în cazul eșantionării neuniforme[9].

Transparență și deschidere. Pipeline-urile sursă de evaluare și clasare sunt deschise în depozitul FastChat[10]; periodic sunt publicate părți din datele brute pentru verificare și cercetare (de exemplu, lansarea a 140K dialoguri în iulie 2025)[9][11]. Conform FAQ-ului și avertismentelor de pe pagina principală, interogările utilizatorilor pot fi dezvăluite furnizorilor de modele și parțial publicate în scopuri de cercetare — nu trebuie transmise date sensibile[12][13].

Reguli de selecție și eșantionare. În clasamente sunt incluse modele de acces general (ponderi deschise/API public/serviciu public). Pentru stabilizarea evaluării sunt necesare de obicei ≥1000 de voturi; cel puțin 20% dintre confruntări sunt exclusiv între modele publice; probabilitatea de eșantionare crește odată cu ratingul și incertitudinea, iar regresia cu reponderare asigură caracterul nedeformat al evaluărilor finale[9].

Auto-metrici și controlul stilului. Pentru accelerarea evaluării și reducerea efectelor preferințelor „stilistice" se aplică metodologii auxiliare: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (autogenerarea întrebărilor dificile)[15], precum și Style/Sentiment Control (modelarea și „eliminarea" efectului tonului/emoțiilor asupra preferințelor)[16]. Pentru Arena‑Hard‑Auto a fost raportată o concordanță foarte ridicată cu voturile „live" ale utilizatorilor umani (până la ≈98,6% în condiții controlate)[17].

Arene și domenii de evaluare

Platforma s-a dezvoltat într-un set de „arene" pe tipuri de sarcini:

  • Text Arena — dialoguri/sarcini generale, tabelul principal[18].
  • Vision Arena — modele multimodale „text→imagine/video/analiză de imagini"[19].
  • Text‑to‑Image și Image Edit — generare și editare de imagini (inclusiv cazul nano‑banana)[20][21].
  • Text‑/Image‑to‑Video — generare video[22].
  • WebDev Arena — construirea de aplicații web din descrieri[23].
  • RepoChat Arena — sarcini de inginerie IA pe cod/depozite[24].
  • Search Arena — modele cu acces la căutare web; lansată inițial în aprilie 2025 (legacy), apoi integrată pe site-ul principal, însoțită de un dataset și o publicație[25][26][27].
  • BiomedArena.AI — evaluare specifică domeniului pentru sarcini biomedicale (parteneriat cu DataTecnica)[28].

Utilizare și impact

  • Vitrină industrială. Principalii furnizori (OpenAI, Anthropic, Google și alții) testează și demonstrează în mod regulat modele pe LMArena; publicațiile industriale descriu platforma ca un reper important[5][29]. Într-o publicație industrială NAACL‑2025, scorul Elo al Chatbot Arena este denumit „gold industry‑standard\"[30].
  • Testare pre-lansare. Politica permite previzualizări anonime ale modelelor „nelansate" cu notificarea comunității și publicarea ulterioară a evaluărilor publice după lansare; minimum ≈1000 de voturi pentru stabilizare[9].
  • Episoade notabile. În primăvara anului 2025 a fost discutat modelul anonim Llama‑4 Maverick‑03‑26‑Experimental (incident legat de compararea cu versiunile publice), ceea ce a atras o atenție largă din partea presei și a declanșat actualizări ale regulilor și comunicărilor[31][32]. În august 2025, „nano‑banana" s-a dezvăluit ca Gemini 2.5 Flash Image și a ocupat poziții de frunte în arenele vizuale[21][20].

Limitări și critici

În ciuda dimensiunii și popularității, abordarea prezintă limitări:

  • Subiectivitate și efecte stilistice. Preferințele exprimate prin vot depind de tonul/maniera răspunsului; echipa implementează Style/Sentiment Control pentru decuplarea „stilului" de „conținut"[16].
  • Nereprezentativitatea publicului. Nucleul activ îl constituie entuziaștii tehnici/dezvoltatorii; pentru scenarii de domeniu sunt create arene specializate (Search, WebDev, Biomed și altele)[33].
  • Vulnerabilitate la manipulare și distorsiuni. Studii din 2025 arată că, în absența unor protecții stricte, sunt posibile strategii de „umflare" a voturilor cu sute–mii de voturi; colaborarea cercetătorilor cu LMArena a condus la implementarea unor măsuri de protecție (CAPTCHA/autentificare/protecție anti-bot/detectare anomalii) și la creșterea „costului atacului"[34][35][36].
  • Critici metodologice. Lucrarea The Leaderboard Illusion (aprilie 2025) semnalează factori sistematici și instituționali care pot distorsiona câmpul competiției; LMArena a publicat un răspuns detaliat și menține un changelog public al metodologiei[37][38][39].

Referințe

  • Site-ul oficial LMArena
  • Blog/politici și actualizări LMArena
  • Site-ul grupului de cercetare LMSYS (incubatorul original al proiectului)

Bibliografie

  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
  • Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
  • Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
  • Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
  • Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
  • Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
  • Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
  • Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.

Note

  1. 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
  2. «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
  3. «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
  4. «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
  5. 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
  6. «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
  7. «We Are Now Arena». Arena Blog, 28 января 2026. [4]
  8. «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
  9. 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
  10. lm‑sys/FastChat (GitHub). [6]
  11. «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
  12. FAQ. LMArena. [8]
  13. Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
  14. Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
  15. Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
  16. 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
  17. Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
  18. Text Arena (English). LMArena. [14]
  19. Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
  20. 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
  21. 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
  22. Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
  23. «Introducing WebDev Arena». LMArena Blog, 2025. [20]
  24. «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
  25. «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
  26. «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
  27. Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
  28. «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
  29. Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
  30. Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
  31. «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
  32. Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
  33. «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
  34. Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
  35. Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
  36. «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
  37. Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
  38. «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
  39. «Methodology Changelog». LMArena Blog. [36]