LMArena (Chatbot Arena) (FR)
Arena (jusqu'au 28 janvier 2026 : LMArena (Large Model Arena), auparavant : Chatbot Arena) est une plateforme web ouverte et participative (crowdsourcing) destinée à l'évaluation et au classement comparatif des grands modèles de langage (LLM) et des modèles multimodaux (texte, image, vidéo) d'après les préférences humaines réelles. Elle repose sur des comparaisons anonymes par paires (blind battles) et sur un système de classement de type Elo ; sur cette base sont publiés des classements publics (leaderboards) transparents, considérés comme l'un des bancs d'essai (benchmarks) indépendants les plus reconnus pour les modèles d'IA de pointe (frontier).[1][2]
La plateforme est née en 2023 comme projet de recherche académique de l'organisation LMSYS Org (Large Model Systems Organization) à l'université de Californie à Berkeley (Sky Computing Lab). En septembre 2024, le projet a pris son indépendance (« graduation ») en migrant vers son propre domaine, lmarena.ai[3]. En avril 2025, la société indépendante Arena Intelligence Inc. a été créée[4] ; le 21 mai 2025, elle a levé 100 millions de dollars lors d'un tour d'amorçage (seed), à une valorisation de 600 millions de dollars (principaux investisseurs : a16z et UC Investments)[5][6]. Le 6 janvier 2026, la société a bouclé un tour de série A de 150 millions de dollars, portant sa valorisation post-money à 1,7 milliard de dollars[7]. Le 28 janvier 2026 a eu lieu le changement de marque final : la plateforme a été rebaptisée Arena et a migré vers le domaine arena.ai[8].
Histoire
La plateforme a été lancée en avril 2023 sous le nom de Chatbot Arena, comme projet de recherche de l'organisation LMSYS Org (Large Model Systems Organization) à l'université de Californie à Berkeley (Sky Computing Lab). Elle est devenue l'un des premiers outils d'évaluation participative des grands modèles de langage au moyen de comparaisons anonymes par paires (blind battles) et d'un système de classement Elo fondé sur les préférences réelles des utilisateurs.
- 24 avril 2023 — lancement technique de Chatbot Arena.
- 3 mai 2023 — lancement public officiel et publication du premier classement.
- 2023 — publication des premiers jeux de données ouverts : 33 000 dialogues par paires (juillet) et LMSYS‑Chat‑1M (septembre, environ 1 million de dialogues réels).
- 1er mars 2024 — publication de la politique officielle de la plateforme et formalisation de sa mission comme système d'évaluation ouvert et piloté par la communauté.
- 27 juin 2024 — ajout de la prise en charge des images et début de l'extension aux tâches multimodales.
- 20 septembre 2024 — prise d'indépendance (« graduation ») : migration vers le domaine indépendant lmarena.ai.
- Fin 2024 – printemps 2025 — lancement d'arènes spécialisées (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control, etc.).
- 17 avril 2025 — constitution officielle en société indépendante, Arena Intelligence Inc., et lancement d'une version bêta de la plateforme rénovée sous la marque LMArena.
- 21 mai 2025 — annonce de la création de la société et levée de fonds d'amorçage de 100 millions de dollars (valorisation : 600 millions de dollars).
- 31 juillet 2025 — publication d'un jeu de données ouvert de 140 000 dialogues récents de la Text Arena.
- 6 janvier 2026 — levée de 150 millions de dollars lors d'un tour de série A, portant la valorisation post-money à 1,7 milliard de dollars.
- Janvier 2026 — lancement de la Video Arena (prise en charge complète de la modalité vidéo).
- 28 janvier 2026 — changement de marque final : la plateforme devient Arena et migre vers le domaine arena.ai.
En mars 2026, Arena (arena.ai) compte plus de 5 millions d'utilisateurs actifs mensuels répartis dans plus de 150 pays, a accumulé des dizaines de millions de votes et demeure l'un des outils indépendants les plus reconnus pour l'évaluation des modèles d'IA de pointe d'après les préférences humaines réelles.
Fonctionnement de l'évaluation
L'utilisateur saisit une requête et reçoit deux réponses de modèles anonymes choisis au hasard (« A » et « B »), puis vote pour la meilleure réponse (ou signale une égalité ou une réponse insatisfaisante). Le classement est fondé sur le modèle statistique de Bradley-Terry (une régression logistique sur les préférences par paires), dont le principe est proche du système de classement Elo[1]. La plateforme publie un Arena Score et des intervalles de confiance, et applique une repondération (re-weighting) pour maintenir l'impartialité en cas d'échantillonnage non uniforme[9].
Transparence et ouverture. Les pipelines initiaux d'évaluation et de classement sont disponibles en open source dans le dépôt FastChat[10] ; une partie des données brutes est publiée périodiquement à des fins de vérification et de recherche (par ex., la publication de 140 000 dialogues en juillet 2025)[9][11]. Selon la FAQ et les avertissements sur la page d'accueil, les requêtes des utilisateurs peuvent être transmises aux fournisseurs de modèles et partiellement publiées à des fins de recherche — il est conseillé de ne pas soumettre de données sensibles[12][13].
Règles de sélection et d'échantillonnage. Les classements incluent des modèles accessibles au public (poids ouverts/API publique/service accessible au public). Pour fiabiliser une évaluation, au moins 1 000 votes sont généralement requis ; au moins 20 % des batailles ont lieu uniquement entre des modèles publics ; la probabilité d'échantillonnage augmente avec le rang et l'incertitude, et la régression avec repondération garantit l'impartialité des scores finaux[9].
Métriques automatiques et contrôle du style. Pour accélérer l'évaluation et réduire les effets des préférences stylistiques, des techniques auxiliaires sont utilisées : MT-Bench (LLM-as-a-judge)[14], Arena-Hard (génération automatique de questions difficiles)[15], ainsi que le Style/Sentiment Control (modélisation et « correction » de l'effet du ton/des émotions sur les préférences)[16]. Pour Arena-Hard-Auto, une très forte concordance avec les votes humains « en direct » a été observée (jusqu'à ≈98,6 % dans des conditions contrôlées)[17].
Arènes et domaines d'évaluation
La plateforme a évolué pour devenir un ensemble d'« arènes » spécialisées par type de tâches :
- Text Arena — dialogues/tâches générales, classement principal[18].
- Vision Arena — modèles multimodaux (compréhension d'image/vidéo, analyse visuelle)[19].
- Text-to-Image et Image Edit — génération et édition d'images (y compris le cas de nano-banana)[20][21].
- Text‑/Image‑to‑Video — génération de vidéos[22].
- WebDev Arena — création d'applications web à partir de descriptions[23].
- RepoChat Arena — tâches d'ingénierie IA sur du code/des dépôts[24].
- Search Arena — modèles connectés à la recherche web ; lancée initialement en avril 2025 (legacy), puis intégrée au site principal, accompagnée d'un jeu de données et d'une publication[25][26][27].
- BiomedArena.AI — évaluation spécifique au domaine pour les tâches biomédicales (en partenariat avec DataTecnica)[28].
Applications et influence
- Vitrine de l'industrie. Les plus grands fournisseurs (OpenAI, Anthropic, Google, etc.) testent et présentent régulièrement leurs modèles sur la plateforme ; les médias spécialisés la décrivent comme une référence importante[6][29]. Dans une communication de la session Industrie de NAACL 2025, l'évaluation Elo de Chatbot Arena est qualifiée de « gold industry-standard »[30].
- Tests de pré-lancement. La politique autorise les aperçus anonymes de modèles non publiés, avec notification à la communauté et publication ultérieure des évaluations publiques après le lancement ; un minimum de ≈1 000 votes est requis pour la stabilisation[9].
- Faits marquants. Au printemps 2025, le modèle anonyme Llama-4 Maverick-03-26-Experimental a fait l'objet de discussions (incident concernant sa comparaison avec des versions publiques), attirant une large attention médiatique et entraînant des mises à jour des règles et de la communication[31][32]. En août 2025, « nano-banana » s'est révélé être Gemini 2.5 Flash Image et a pris la tête des classements visuels[21][20].
Limites et critiques
Malgré son ampleur et sa popularité, l'approche présente des limites :
- Subjectivité et effets de style. Les préférences de vote dépendent du ton et du style de la réponse ; l'équipe met en œuvre le Style/Sentiment Control pour découpler le « style » du « contenu »[16].
- Non-représentativité de l'audience. Le noyau actif est composé de passionnés de technologie et de développeurs ; pour les scénarios spécifiques à un domaine, des arènes spécialisées sont créées (Search, WebDev, Biomed, etc.)[33].
- Vulnérabilité aux manipulations et aux biais. Des recherches de 2025 montrent qu'en l'absence de protections strictes, des stratégies de « truquage des votes » avec des centaines ou des milliers de votes sont possibles ; cependant, la collaboration entre les chercheurs et LMArena a conduit à la mise en place de mesures de protection (CAPTCHA/connexion/protection anti-bot/détection d'anomalies) et à l'augmentation du « coût de l'attaque »[34][35][36].
- Critiques méthodologiques. L'étude The Leaderboard Illusion (avril 2025) souligne des facteurs systémiques et institutionnels susceptibles de fausser la compétition ; LMArena a publié une réponse détaillée et tient à jour un changelog public de sa méthodologie[37][38][39].
Liens externes
- Site officiel d'Arena (anciennement lmarena.ai)
- Blog, politiques et mises à jour
- Site du groupe de recherche LMSYS (incubateur original du projet)
Bibliographie
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
- Li, T. et al. (2024). From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline. arXiv:2406.11939.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). A Statistical Framework for Ranking LLM-Based Chatbots. arXiv:2412.18407.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings. arXiv:2508.11847.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non-Transitivity in LLM-as-a-Judge. arXiv:2502.14074.
- Li, H. et al. (2024). LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods. arXiv:2412.05579.
- Zheng, L. et al. (2024). LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset. arXiv:2309.11998.
- Dubois, Y. et al. (2024). Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators. arXiv:2404.04475.
- Singh, S. et al. (2025). The Leaderboard Illusion. arXiv:2504.20879.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). Improving Your Model Ranking on Chatbot Arena by Vote Rigging. arXiv:2501.17858.
Références
- ↑ 1.0 1.1 Chiang, W.-L. et al. « Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference ». arXiv:2403.04132, 2024.
- ↑ « Hello from LMArena: The Community Platform for Exploring Frontier AI ». LMArena Blog, 23 juin 2025.
- ↑ « Announcing a New Site for Chatbot Arena ». LMSYS Blog, 20 septembre 2024.
- ↑ « LMArena is Growing to Support our Community Platform ». LMArena Blog, 17 avril 2025.
- ↑ « LMArena Secures $100M in Seed Funding… ». PR Newswire, 21 mai 2025. [1]
- ↑ 6.0 6.1 Wiggers, K. « LM Arena… lands $100M ». TechCrunch, 21 mai 2025. [2]
- ↑ « Arena Intelligence Closes $150M Series A at $1.7B Valuation ». Arena Intelligence Blog, 6 janvier 2026. [3]
- ↑ « LMArena is now Arena ». Arena Blog, 28 janvier 2026. [4]
- ↑ 9.0 9.1 9.2 9.3 LMArena Leaderboard Policy. LMArena Blog, éd. 8 septembre 2025. [5]
- ↑ lm‑sys/FastChat (GitHub). [6]
- ↑ Y. Song. « A Deep Dive into Recent Arena Data ». LMArena Blog, 31 juillet 2025. [7]
- ↑ FAQ. LMArena. [8]
- ↑ Page d'accueil de LMArena (avertissement sur la publication possible des données et leur transmission aux fournisseurs). [9]
- ↑ Zheng, L. et al. « Judging LLM‑as‑a‑Judge with MT‑Bench and Chatbot Arena ». arXiv:2306.05685, 2023. [10]
- ↑ Li, T. et al. « From Crowdsourced Data to High‑Quality Benchmarks: Arena‑Hard and BenchBuilder Pipeline ». arXiv:2406.11939, 2024. [11]
- ↑ 16.0 16.1 « Does Sentiment Matter Too? Introducing Sentiment Control ». LMArena Blog, 22 avril 2025. [12]
- ↑ Li, T. et al. « From Crowdsourced Data… » arXiv:2406.11939 (tableaux de concordance). [13]
- ↑ Text Arena (English). LMArena. [14]
- ↑ Vision Arena. LMArena, mis à jour le 2 septembre 2025. [15]
- ↑ 20.0 20.1 Text‑to‑Image Arena. LMArena, mis à jour le 25 août 2025. [16]
- ↑ 21.0 21.1 « Nano Banana (Gemini 2.5 Flash Image): Try it on LMArena ». LMArena Blog, 27 août 2025. [17]
- ↑ Text‑to‑Video et Image‑to‑Video Leaderboards. LMArena, août 2025. [18] [19]
- ↑ « WebDev Arena: A Live LLM Leaderboard for Web App Development ». LMArena Blog, 10 mars 2025. [20]
- ↑ « RepoChat Arena: A Live Benchmark for AI Software Engineers ». LMArena Blog, 9 avril 2025. [21]
- ↑ « Introducing the Search Arena ». LMArena Blog, 14 avril 2025. [22]
- ↑ « Search Arena & What We're Learning About Human Preference ». LMArena Blog, 23 juillet 2025. [23]
- ↑ Frick, E. et al. « Search Arena: Analyzing Search‑Augmented LLMs ». arXiv:2506.05334, 2025. [24]
- ↑ « Introducing BiomedArena.AI ». LMArena Blog, 19 août 2025. [25]
- ↑ Google. « Gemma 3… », 12 mars 2025 (lien vers les résultats de LMArena). [26]
- ↑ Spangher, L. et al. « Chatbot Arena Estimate… ». NAACL Industry, 2025. [27]
- ↑ « Meta's experimental Llama 4 model briefly topped AI leaderboard… ». The Register, 7 avril 2025. [28]
- ↑ Clarifications/posts officiels de LMArena sur X concernant l'incident (avril 2025). [29]
- ↑ « Search Arena & What We're Learning… ». LMArena Blog, 23 juillet 2025. [30]
- ↑ Min, R. et al. « Improving Your Model Ranking on Chatbot Arena by Vote Rigging ». arXiv:2501.17858, 2025. [31]
- ↑ Huang, Y. et al. « Exploring and Mitigating Adversarial Manipulation of Voting‑Based Leaderboards ». arXiv:2501.07493, 2025. [32]
- ↑ « Hundreds of rigged votes can skew… ». Fast Company, 6 février 2025. [33]
- ↑ Singh, S. et al. « The Leaderboard Illusion ». arXiv:2504.20879, 2025. [34]
- ↑ « Our Response to 'The Leaderboard Illusion' ». LMArena Blog, 9 mai 2025. [35]
- ↑ Leaderboard Changelog. LMArena Blog, entrées d'août 2025. [36]