LMArena (Chatbot Arena) (IT)
Arena (fino al 28 gennaio 2026 — LMArena (Large Model Arena), precedentemente — Chatbot Arena) — piattaforma web aperta e crowdsourcing per la valutazione e il ranking comparativo di grandi modelli linguistici (LLM) e modelli multimodali (testo, immagine, video) in base alle reali preferenze umane. Il nucleo della piattaforma è costituito da confronti anonimi a coppie (blind battles) tra modelli e da un sistema di rating Elo; su questa base vengono pubblicati trasparenti leaderboard pubblici, considerati uno dei benchmark indipendenti più autorevoli per i modelli frontier di intelligenza artificiale.[1][2]
La piattaforma è nata nel 2023 come progetto di ricerca accademico dell'organizzazione LMSYS Org (Large Model Systems Organization) presso l'Università della California a Berkeley (Sky Computing Lab). Nel settembre 2024 il progetto ha ottenuto un dominio autonomo lmarena.ai («Graduation»)[3]. Nell'aprile 2025 è stata costituita la società indipendente Arena Intelligence Inc., e il 21 maggio 2025 è stato raccolto un seed round da $100 milioni (valutazione $600 milioni, principali investitori — a16z e UC Investments)[4][5]. Il 6 gennaio 2026 la società ha chiuso un round Series A da $150 milioni con una valutazione post-money di $1,7 miliardi[6]. Il 28 gennaio 2026 è avvenuto il rebranding finale — la piattaforma ha assunto il nome Arena ed è migrata al dominio arena.ai[7][8].
Storia
La piattaforma è stata lanciata nell'aprile 2023 con il nome Chatbot Arena come progetto di ricerca dell'organizzazione LMSYS Org (Large Model Systems Organization) presso l'Università della California a Berkeley (Sky Computing Lab). È diventata uno dei primi strumenti di valutazione crowdsourcing dei grandi modelli linguistici attraverso confronti anonimi a coppie (blind battles) e un sistema di rating Elo basato sulle reali preferenze degli utenti.
- 24 aprile 2023 — lancio tecnico di Chatbot Arena.
- 3 maggio 2023 — rilascio pubblico ufficiale e pubblicazione del primo leaderboard.
- 2023 — rilascio dei primi dataset aperti: 33 mila dialoghi a coppie (luglio) e LMSYS‑Chat‑1M (settembre, circa 1 milione di dialoghi reali).
- 1 marzo 2024 — pubblicazione della politica ufficiale della piattaforma, formalizzazione della missione come sistema di valutazione aperto e community-driven.
- 27 giugno 2024 — aggiunta del supporto alle immagini e inizio dell'espansione verso le attività multimodali.
- 20 settembre 2024 — «Graduation»: migrazione al dominio autonomo lmarena.ai.
- Fine 2024 — primavera 2025 — lancio di arene specializzate (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control e altre).
- 17 aprile 2025 — incorporazione ufficiale come società indipendente Arena Intelligence Inc., lancio della versione beta della piattaforma aggiornata con il brand LMArena.
- 21 maggio 2025 — annuncio della costituzione della società e raccolta di un seed round da $100 milioni (valutazione — $600 milioni).
- 31 luglio 2025 — pubblicazione di un dataset aperto di 140 mila dialoghi recenti di Text Arena.
- 6 gennaio 2026 — raccolta di un round Series A da $150 milioni con valutazione post-money di $1,7 miliardi.
- Gennaio 2026 — lancio di Video Arena (pieno supporto della modalità video).
- 28 gennaio 2026 — rebranding finale: la piattaforma ha assunto il nome Arena ed è migrata al dominio arena.ai.
A marzo 2026, Arena (arena.ai) serve più di 5 milioni di utenti attivi mensili in oltre 150 paesi, ha accumulato decine di milioni di voti e rimane uno degli strumenti indipendenti più autorevoli per la valutazione dei modelli frontier di IA in base alle reali preferenze umane.
Come funziona la valutazione
L'utente inserisce una richiesta e riceve due risposte da modelli anonimi scelti casualmente («A» e «B»), dopodiché vota la risposta migliore (oppure registra un pareggio o l'insoddisfazione). Il ranking si basa sul modello statistico Bradley–Terry (regressione logistica sulle preferenze a coppie), intuitivamente vicino all'Elo[1]. La piattaforma pubblica l'Arena Score e gli intervalli di confidenza, e applica correzioni del campionamento (re‑weighting) per mantenere la non distorsione in presenza di campionamento non uniforme[9].
Trasparenza e apertura. Le pipeline di valutazione e ranking originali sono aperte nel repository FastChat[10]; periodicamente vengono pubblicati estratti dei dati grezzi per la verifica e la ricerca (ad es. il rilascio di 140K dialoghi nel luglio 2025)[9][11]. Secondo le FAQ e gli avvisi sulla pagina principale, le richieste degli utenti possono essere divulgate ai fornitori di modelli e parzialmente pubblicate per scopi di ricerca — non è consigliabile inviare dati sensibili[12][13].
Regole di selezione e campionamento. Nei leaderboard vengono inclusi modelli ad accesso pubblico (pesi aperti / API pubblica / servizio pubblico). Per stabilizzare la valutazione sono generalmente necessari ≥1000 voti; almeno il 20% delle battle riguarda solo modelli pubblici; la probabilità di campionamento aumenta con il rating e l'incertezza, mentre la regressione con ribilanciamento garantisce la non distorsione delle valutazioni finali[9].
Auto‑metriche e controllo dello stile. Per accelerare la valutazione e ridurre gli effetti delle preferenze «stilistiche» vengono applicate metodiche ausiliarie: MT‑Bench (LLM‑as‑a‑judge)[14], Arena‑Hard (autogenerazione di domande complesse)[15], nonché Style/Sentiment Control (modellazione e «correzione» dell'effetto del tono/emozioni sulle preferenze)[16]. Per Arena‑Hard‑Auto è stata riportata una concordanza molto elevata con i voti umani «live» (fino a ≈98,6% in condizioni controllate)[17].
Arene e domini di valutazione
La piattaforma si è evoluta in un insieme di «arene» per tipologia di attività:
- Text Arena — dialoghi/attività generali, tabella principale[18].
- Vision Arena — modelli multimodali «testo→immagine/video/analisi di immagini»[19].
- Text‑to‑Image e Image Edit — generazione e modifica di immagini (incluso il caso nano‑banana)[20][21].
- Text‑/Image‑to‑Video — generazione di video[22].
- WebDev Arena — costruzione di applicazioni web a partire da descrizioni[23].
- RepoChat Arena — attività di ingegneria IA su codice/repository[24].
- Search Arena — modelli con connessione alla ricerca web; inizialmente lanciata nell'aprile 2025 (legacy), poi integrata nel sito principale, accompagnata da un dataset e da una pubblicazione[25][26][27].
- BiomedArena.AI — valutazione domain-specific per attività biomediche (in partnership con DataTecnica)[28].
Utilizzo e impatto
- Vetrina industriale. I principali vendor (OpenAI, Anthropic, Google e altri) testano e presentano regolarmente i propri modelli su LMArena; i media di settore descrivono la piattaforma come un punto di riferimento fondamentale[5][29]. In una pubblicazione di settore NAACL‑2025, il punteggio Elo di Chatbot Arena è definito «gold industry‑standard»[30].
- Test pre-rilascio. La politica consente anteprime anonime di modelli «non ancora rilasciati» con notifica alla community e successiva pubblicazione delle valutazioni pubbliche dopo il rilascio; minimo ≈1000 voti per la stabilizzazione[9].
- Episodi noti. Nella primavera 2025 è stato discusso il modello anonimo Llama‑4 Maverick‑03‑26‑Experimental (incidente relativo al confronto con le versioni pubbliche), che ha attirato ampia attenzione mediatica e ha provocato aggiornamenti delle regole e delle comunicazioni[31][32]. Nell'agosto 2025, «nano‑banana» si è rivelato essere Gemini 2.5 Flash Image e ha conquistato le posizioni di vertice nelle arene visive[21][20].
Limitazioni e critiche
Nonostante la scala e la popolarità, l'approccio presenta delle limitazioni:
- Soggettività ed effetti stilistici. Le preferenze di voto dipendono dal tono e dal modo in cui viene fornita la risposta; il team ha introdotto Style/Sentiment Control per disaccoppiare «stile» e «contenuto»[16].
- Non rappresentatività del pubblico. Il nucleo attivo è composto da appassionati di tecnologia e sviluppatori; per gli scenari di dominio vengono create arene specializzate (Search, WebDev, Biomed e altre)[33].
- Vulnerabilità a manipolazioni e distorsioni. Ricerche del 2025 dimostrano che in assenza di protezioni rigide sono possibili strategie di «manipolazione» con centinaia o migliaia di voti; al contempo, la collaborazione dei ricercatori con LMArena ha portato all'implementazione di misure di protezione (CAPTCHA/login/protezione dai bot/rilevamento anomalie) e all'aumento del «costo dell'attacco»[34][35][36].
- Critica metodologica. Il lavoro The Leaderboard Illusion (aprile 2025) segnala fattori sistematici e istituzionali che possono distorcere il campo di competizione; LMArena ha pubblicato una risposta articolata e gestisce un changelog pubblico della metodologia[37][38][39].
Collegamenti esterni
- Sito ufficiale di LMArena
- Blog/politiche e aggiornamenti di LMArena
- Sito del gruppo di ricerca LMSYS (incubatore originale del progetto)
Bibliografia
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Note
- ↑ 1.0 1.1 Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». arXiv:2403.04132, 2024.
- ↑ «Hello from LMArena: The Community Platform for Exploring Frontier AI». LMArena Blog, 23 июня 2025.
- ↑ «Announcing a New Site for Chatbot Arena». LMSYS Blog, 20 сентября 2024.
- ↑ «Arena Intelligence Raises $100M Seed Round to Build the Standard for AI Evaluation». PR Newswire / Arena Intelligence, 21 мая 2025. [1]
- ↑ 5.0 5.1 Wiggers, K. «LMArena, the Chatbot Arena spinoff, raises $100M seed at a $600M valuation». TechCrunch, 21 мая 2025. [2]
- ↑ «Arena Intelligence Closes $150M Series A at $1.7B Valuation». Arena Intelligence Blog, 6 января 2026. [3]
- ↑ «We Are Now Arena». Arena Blog, 28 января 2026. [4]
- ↑ «LMArena is Growing to Support our Community Platform». LMArena Blog, 17 апреля 2025.
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, ред. 8 сентября 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ «Releasing 140K Text Arena Conversations». LMArena Blog, 31 июля 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Главная страница LMArena (дисклеймер о возможной публикации данных и передачи провайдерам). [9]
- ↑ Zheng, L. et al. «Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 «Style and Sentiment Control in the Arena». LMArena Blog, 2025. [12]
- ↑ Li, T. et al. «From Crowdsourced Data…» arXiv:2406.11939 (таблицы согласованности). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, обновлено 2 сентября 2025. [15]
- ↑ 20.0 20.1 Text-to-Image Leaderboard. LMArena. [16]
- ↑ 21.0 21.1 «The nano-banana Story: Gemini 2.5 Flash Image Tops the Visual Arena». LMArena Blog, август 2025. [17]
- ↑ Text‑to‑Video и Image‑to‑Video Leaderboards. LMArena, август 2025. [18] [19]
- ↑ «Introducing WebDev Arena». LMArena Blog, 2025. [20]
- ↑ «Introducing RepoChat Arena». LMArena Blog, 2025. [21]
- ↑ «Introducing the Search Arena». LMArena Blog, 14 апреля 2025. [22]
- ↑ «Search Arena & What We're Learning About Human Preference». LMArena Blog, 23 июля 2025. [23]
- ↑ Frick, E. et al. «Search Arena: Analyzing Search‑Augmented LLMs». arXiv:2506.05334, 2025. [24]
- ↑ «Introducing BiomedArena.AI». LMArena Blog, 19 августа 2025. [25]
- ↑ Google. «Gemma 3…», 12 марта 2025 (ссылка на результаты LMArena). [26]
- ↑ Spangher, L. et al. «Chatbot Arena Estimate…». NAACL Industry, 2025. [27]
- ↑ «Meta's experimental Llama 4 model briefly topped AI leaderboard…». The Register, 7 апреля 2025. [28]
- ↑ Официальные разъяснения/посты LMArena в X по инциденту (апрель 2025). [29]
- ↑ «Search Arena & What We're Learning…». LMArena Blog, 23 июля 2025. [30]
- ↑ Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards». arXiv:2501.07493, 2025. [32]
- ↑ «Hundreds of rigged votes can skew…». Fast Company, 6 февраля 2025. [33]
- ↑ Singh, S. et al. «The Leaderboard Illusion». arXiv:2504.20879, 2025. [34]
- ↑ «Our Response to 'The Leaderboard Illusion'». LMArena Blog, 9 мая 2025. [35]
- ↑ «Methodology Changelog». LMArena Blog. [36]