---
title: "LMArena (Chatbot Arena) (ES)"
source: "https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)"
wiki: "systems-analysis.info/int"
article: "LMArena_(Chatbot_Arena)_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 3700
wiki_created_at: 2026-09-06T23:24:40Z
wiki_modified_at: 2026-09-06T23:24:40Z
downloaded_at: 2026-09-07T22:58:23Z
---

# LMArena (Chatbot Arena) (ES)

**Arena** (hasta el 28 de enero de 2026, **LMArena** (*Large Model Arena*); anteriormente, **Chatbot Arena**) es una plataforma web abierta de evaluación colaborativa (*crowdsourcing*) y comparación de [grandes modelos de lenguaje](https://systems-analysis.info/int/Grandes_modelos_de_lenguaje "Grandes modelos de lenguaje") (LLM) y modelos multimodales (texto, imagen, vídeo) basada en preferencias humanas reales. Su núcleo son las comparaciones anónimas por pares (*blind battles*) de modelos y el sistema de puntuación Elo; sobre ellas se publican tablas de clasificación públicas y transparentes, consideradas uno de los referentes independientes más reconocidos para los modelos de IA de frontera (*frontier*).<sup>[\[1\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-chiang2024-1)[\[2\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-hello_2025-2)</sup>

La plataforma surgió en 2023 como un proyecto académico de investigación de la organización **LMSYS Org** (Large Model Systems Organization) de la Universidad de California en Berkeley (Sky Computing Lab). En septiembre de 2024, el proyecto «se graduó» a su propio dominio, lmarena.ai («Graduation»)<sup>[\[3\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-new_site_2024-3)</sup>. En abril de 2025 se constituyó la compañía independiente **Arena Intelligence Inc.**, y el 21 de mayo de 2025 cerró una ronda semilla de **100 millones de dólares** (valoración de 600 millones; inversores principales: a16z y UC Investments)<sup>[\[4\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-seed_prn-4)[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-tc_seed-5)</sup>. El 6 de enero de 2026, la empresa cerró una ronda de Series A de **150 millones de dólares** con una valoración post-money de **1700 millones**, liderada por Felicis y UC Investments<sup>[\[6\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-series_a_2026-6)[\[7\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-tc_seriesa-7)</sup>. El 28 de enero de 2026 se produjo el cambio de marca definitivo: la plataforma pasó a llamarse **Arena** y se trasladó al dominio <a href="https://arena.ai/" class="external text" rel="nofollow">arena.ai</a><sup>[\[8\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-arena_rebrand_2026-8)[\[9\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-new_beta_2025-9)</sup>.

## Historia

La plataforma se lanzó en abril de 2023 con el nombre de **Chatbot Arena**, como proyecto de investigación de la organización LMSYS Org (Large Model Systems Organization) en la Universidad de California en Berkeley (Sky Computing Lab). Fue una de las primeras herramientas de evaluación colaborativa de grandes modelos de lenguaje mediante comparaciones anónimas por pares (*blind battles*) y el sistema de puntuación Elo a partir de las preferencias reales de los usuarios.

- **24 de abril de 2023** — lanzamiento técnico de Chatbot Arena.
- **3 de mayo de 2023** — lanzamiento público oficial y publicación de la primera tabla de clasificación.
- **2023** — publicación de los primeros conjuntos de datos abiertos: 33 mil diálogos por pares (julio) y **LMSYS-Chat-1M** (septiembre, alrededor de 1 millón de diálogos reales).
- **1 de marzo de 2024** — publicación de la política oficial de la plataforma y formalización de su misión como sistema de evaluación abierto y dirigido por la comunidad.
- **27 de junio de 2024** — incorporación del soporte de imágenes e inicio de la expansión hacia tareas multimodales.
- **20 de septiembre de 2024** — «Graduation»: traslado al dominio independiente **lmarena.ai**.
- **Finales de 2024 – primavera de 2025** — lanzamiento de arenas especializadas (Arena-Hard, WebDev Arena, RepoChat Arena, Style/Sentiment Control, etc.).
- **17 de abril de 2025** — incorporación oficial como compañía independiente **Arena Intelligence Inc.** y lanzamiento de la versión beta de la plataforma renovada bajo la marca LMArena.
- **21 de mayo de 2025** — anuncio de la constitución de la empresa y cierre de la ronda semilla de **100 millones de dólares** (valoración: 600 millones).
- **31 de julio de 2025** — publicación de un conjunto de datos abierto con **140 mil** diálogos recientes de la Text Arena.
- **18 de diciembre de 2025** — publicación de **Arena-Rank**, el paquete de código abierto que implementa la metodología de clasificación.
- **6 de enero de 2026** — cierre de la ronda de Series A de **150 millones de dólares** con una valoración post-money de **1700 millones**.
- **Enero de 2026** — lanzamiento de **Video Arena** (soporte completo de la modalidad de vídeo).
- **28 de enero de 2026** — cambio de marca definitivo: la plataforma pasó a llamarse **Arena** y se trasladó al dominio **arena.ai**.

Para marzo de 2026, Arena (arena.ai) da servicio a más de 5 millones de usuarios activos mensuales de más de 150 países, ha acumulado decenas de millones de votos y sigue siendo una de las herramientas independientes más reconocidas para evaluar modelos de IA de frontera según las preferencias humanas reales.

## Cómo funciona la evaluación

El usuario introduce una consulta (*prompt*) y recibe dos respuestas de modelos anónimos seleccionados al azar («A» y «B»), tras lo cual vota por la mejor respuesta (o declara un empate o que ninguna es satisfactoria). La clasificación se basa en el modelo estadístico de **Bradley-Terry** (una regresión logística sobre preferencias por pares), conceptualmente próximo al sistema Elo<sup>[\[1\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-chiang2024-1)</sup>. La plataforma publica el **Arena Score** y los intervalos de confianza, y aplica correcciones de muestreo (*re-weighting*) para mantener la imparcialidad ante un muestreo no uniforme<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-policy-10)</sup>.

**Transparencia y apertura.** Los pipelines de evaluación y clasificación son de código abierto: la infraestructura original reside en el repositorio **FastChat**<sup>[\[11\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-11)</sup>, y en diciembre de 2025 la metodología de las tablas se publicó como un paquete de Python independiente, **Arena-Rank** —que alimenta hoy todas las clasificaciones del sitio y es unas 30 veces más rápido que la versión basada en FastChat—<sup>[\[12\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-arena_rank-12)</sup>. Además, periódicamente se publican fragmentos de los datos brutos para verificación e investigación (por ejemplo, la publicación de 140K conversaciones en julio de 2025)<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-policy-10)[\[13\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-opendata_2025-13)</sup>. Según las *FAQ* y las advertencias en la página principal, las consultas de los usuarios pueden compartirse con los proveedores de los modelos y publicarse parcialmente con fines de investigación, por lo que no se deben enviar datos sensibles<sup>[\[14\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-14)[\[15\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-15)</sup>.

**Reglas de selección y muestreo.** En las tablas de clasificación se incluyen modelos de acceso público (pesos abiertos, API pública o servicio público). Para estabilizar la puntuación se requieren habitualmente ≥**1000** votos; al menos el **20%** de las batallas se libran solo entre modelos públicos; la probabilidad de muestreo aumenta con la calificación y la incertidumbre, y la regresión con reponderación garantiza la imparcialidad de las puntuaciones finales<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-policy-10)</sup>.

**Métricas automáticas y control de estilo.** Para acelerar la evaluación y reducir los efectos de las preferencias de «estilo» se emplean metodologías auxiliares: *MT-Bench* (LLM-as-a-judge)<sup>[\[16\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-16)</sup>, *Arena-Hard* (generación automática de preguntas difíciles)<sup>[\[17\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-arena_hard-17)</sup> y **Style/Sentiment Control** (modelado y corrección del efecto del tono/emoción sobre las preferencias)<sup>[\[18\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-sentiment_control-18)</sup>. Para *Arena-Hard-Auto* se ha reportado una concordancia muy alta con los votos humanos en tiempo real (hasta aproximadamente un **98,6%** en condiciones controladas)<sup>[\[19\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-19)</sup>.

## Arenas y dominios de evaluación

La plataforma ha evolucionado hasta convertirse en un conjunto de «arenas» según el tipo de tarea:

- **Text Arena** — conversaciones y tareas generales; es la tabla principal<sup>[\[20\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-text_stats-20)</sup>.
- **Vision Arena** — modelos multimodales «texto→imagen/vídeo/análisis de imágenes»<sup>[\[21\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-21)</sup>.
- **Text-to-Image** e **Image Edit** — generación y edición de imágenes (incluido el caso de *nano-banana*)<sup>[\[22\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-tti_page-22)[\[23\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-nanobanana_blog-23)</sup>.
- **Text-/Image-to-Video** — generación de vídeo<sup>[\[24\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-24)</sup>.
- **WebDev Arena** — construcción de aplicaciones web a partir de descripciones<sup>[\[25\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-webdev_arena-25)</sup>.
- **RepoChat Arena** — tareas de ingeniería de IA sobre código y repositorios<sup>[\[26\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-repochat_arena-26)</sup>.
- **Search Arena** — modelos con conexión a búsqueda web; lanzada inicialmente en abril de 2025 (legacy), luego migrada al sitio principal, acompañada de un conjunto de datos y una publicación<sup>[\[27\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-27)[\[28\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-28)[\[29\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-29)</sup>.
- **BiomedArena.AI** — evaluación específica de dominio para tareas biomédicas (en colaboración con DataTecnica)<sup>[\[30\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-30)</sup>.

## Aplicación e impacto

- **Escaparate para la industria.** Los principales proveedores (OpenAI, Anthropic, Google, etc.) prueban y presentan regularmente sus modelos en la plataforma; los medios del sector la describen como un referente importante<sup>[\[5\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-tc_seed-5)[\[31\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-31)</sup>. En una publicación de la industria de NAACL-2025, la puntuación Elo de Chatbot Arena se describe como el «**gold industry-standard**»<sup>[\[32\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-32)</sup>.
- **Pruebas de prelanzamiento.** La política permite vistas previas anónimas de modelos «no lanzados», con notificación a la comunidad y posterior publicación de las evaluaciones públicas tras el lanzamiento; se requiere un mínimo de ≈1000 votos para la estabilización<sup>[\[10\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-policy-10)</sup>.
- **Episodios notables.** En la primavera de 2025 se discutió el modelo anónimo *Llama-4 Maverick-03-26-Experimental* (un incidente relacionado con su comparación con las versiones públicas), lo que atrajo una amplia atención de la prensa y motivó actualizaciones en las reglas y la comunicación<sup>[\[33\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-33)[\[34\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-34)</sup>. En agosto de 2025, «nano-banana» se reveló como **Gemini 2.5 Flash Image** y ocupó las primeras posiciones en las arenas visuales<sup>[\[23\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-nanobanana_blog-23)[\[22\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-tti_page-22)</sup>.

## Limitaciones y críticas

A pesar de su escala y popularidad, el enfoque tiene limitaciones:

- **Subjetividad y efectos de estilo.** Las preferencias en la votación dependen del tono y la manera de la respuesta; el equipo está implementando **Style/Sentiment Control** para desacoplar el «estilo» del «contenido»<sup>[\[18\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-sentiment_control-18)</sup>.
- **Falta de representatividad de la audiencia.** El núcleo activo está formado por entusiastas de la tecnología y desarrolladores; para los escenarios de dominio específico se crean arenas especializadas (Search, WebDev, Biomed, etc.)<sup>[\[35\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-35)</sup>.
- **Vulnerabilidad a la manipulación y los sesgos.** Investigaciones de 2025 demuestran que, sin defensas estrictas, son posibles estrategias de manipulación de votos (*vote rigging*) con cientos o miles de votos; no obstante, la colaboración entre investigadores y LMArena ha llevado a implementar medidas de protección (CAPTCHA, inicio de sesión, protección contra bots, detección de anomalías) y a aumentar el «coste del ataque»<sup>[\[36\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-36)[\[37\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-37)[\[38\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-38)</sup>.
- **Críticas metodológicas.** El trabajo *The Leaderboard Illusion* (abril de 2025) señala factores sistemáticos e institucionales que pueden distorsionar el campo competitivo; LMArena publicó una respuesta detallada y mantiene un *changelog* público de su metodología<sup>[\[39\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-39)[\[40\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-40)[\[41\]](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_note-changelog-41)</sup>.

## Enlaces externos

- <a href="https://arena.ai/" class="external text" rel="nofollow">Sitio web oficial de Arena (anteriormente LMArena)</a>
- <a href="https://arena.ai/blog/" class="external text" rel="nofollow">Blog, políticas y actualizaciones de Arena</a>
- <a href="https://lmsys.org/" class="external text" rel="nofollow">Sitio web del grupo de investigación LMSYS (incubadora original del proyecto)</a>

## Bibliografía

- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Zheng, L. et al. (2023). *Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena*. <a href="https://arxiv.org/abs/2306.05685" class="external text" rel="nofollow">arXiv:2306.05685</a>.
- Li, T. et al. (2024). *From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline*. <a href="https://arxiv.org/abs/2406.11939" class="external text" rel="nofollow">arXiv:2406.11939</a>.
- Ameli, S.; Zhuang, S.; Stoica, I.; Mahoney, M. W. (2024). *A Statistical Framework for Ranking LLM-Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non-Transitivity in LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Li, H. et al. (2024). *LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods*. <a href="https://arxiv.org/abs/2412.05579" class="external text" rel="nofollow">arXiv:2412.05579</a>.
- Zheng, L. et al. (2024). *LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset*. <a href="https://arxiv.org/abs/2309.11998" class="external text" rel="nofollow">arXiv:2309.11998</a>.
- Dubois, Y. et al. (2024). *Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators*. <a href="https://arxiv.org/abs/2404.04475" class="external text" rel="nofollow">arXiv:2404.04475</a>.
- Singh, S. et al. (2025). *The Leaderboard Illusion*. <a href="https://arxiv.org/abs/2504.20879" class="external text" rel="nofollow">arXiv:2504.20879</a>.
- Min, R.; Pang, T.; Du, C.; Liu, Q.; Cheng, M.; Lin, M. (2025). *Improving Your Model Ranking on Chatbot Arena by Vote Rigging*. <a href="https://arxiv.org/abs/2501.17858" class="external text" rel="nofollow">arXiv:2501.17858</a>.

## Referencias

1.  <span id="cite_note-chiang2024-1">↑ <sup>[1.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-chiang2024_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-chiang2024_1-1)</sup> Chiang, W.-L. et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference». *arXiv:2403.04132*, 2024. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv</a></span>
2.  <span id="cite_note-hello_2025-2">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-hello_2025_2-0) «Hello from LMArena: The Community Platform for Exploring Frontier AI». *LMArena Blog*, 23 de junio de 2025. <a href="https://news.lmarena.ai/hello-from-lmarena/" class="external autonumber" rel="nofollow">[1]</a></span>
3.  <span id="cite_note-new_site_2024-3">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-new_site_2024_3-0) «Announcing a New Site for Chatbot Arena». *LMSYS Blog*, 20 de septiembre de 2024. <a href="https://lmsys.org/blog/2024-09-20-arena-new-site/" class="external autonumber" rel="nofollow">[2]</a></span>
4.  <span id="cite_note-seed_prn-4">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-seed_prn_4-0) «LMArena Secures \$100M in Seed Funding to Bring Scientific Rigor to AI Reliability». *PR Newswire*, 21 de mayo de 2025. <a href="https://www.prnewswire.com/news-releases/lmarena-secures-100m-in-seed-funding-to-bring-scientific-rigor-to-ai-reliability-302462025.html" class="external autonumber" rel="nofollow">[3]</a></span>
5.  <span id="cite_note-tc_seed-5">↑ <sup>[5.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-tc_seed_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-tc_seed_5-1)</sup> Wiggers, K. «LM Arena, the organization behind popular AI leaderboards, lands \$100M». *TechCrunch*, 21 de mayo de 2025. <a href="https://techcrunch.com/2025/05/21/lm-arena-the-organization-behind-popular-ai-leaderboards-lands-100m/" class="external autonumber" rel="nofollow">[4]</a></span>
6.  <span id="cite_note-series_a_2026-6">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-series_a_2026_6-0) «LMArena Raises \$150 Million to Build the World's Most Trusted AI Evaluation Platform». *PR Newswire*, 6 de enero de 2026. <a href="https://www.prnewswire.com/news-releases/lmarena-raises-150-million-to-build-the-worlds-most-trusted-ai-evaluation-platform-302653012.html" class="external autonumber" rel="nofollow">[5]</a></span>
7.  <span id="cite_note-tc_seriesa-7">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-tc_seriesa_7-0) «LMArena lands \$1.7B valuation four months after launching its product». *TechCrunch*, 6 de enero de 2026. <a href="https://techcrunch.com/2026/01/06/lmarena-lands-1-7b-valuation-four-months-after-launching-its-product/" class="external autonumber" rel="nofollow">[6]</a></span>
8.  <span id="cite_note-arena_rebrand_2026-8">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-arena_rebrand_2026_8-0) «LMArena is now Arena». *Arena Blog*, 28 de enero de 2026. <a href="https://arena.ai/blog/lmarena-is-now-arena/" class="external autonumber" rel="nofollow">[7]</a></span>
9.  <span id="cite_note-new_beta_2025-9">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-new_beta_2025_9-0) «LMArena is Growing to Support our Community Platform». *LMArena Blog*, 17 de abril de 2025.</span>
10. <span id="cite_note-policy-10">↑ <sup>[10.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-policy_10-0)</sup> <sup>[10.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-policy_10-1)</sup> <sup>[10.2](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-policy_10-2)</sup> <sup>[10.3](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-policy_10-3)</sup> *Arena Leaderboard Policy*. *Arena Blog*, última actualización: 30 de abril de 2026. <a href="https://arena.ai/blog/policy/" class="external autonumber" rel="nofollow">[8]</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-11) lm-sys/FastChat (GitHub). <a href="https://github.com/lm-sys/FastChat" class="external autonumber" rel="nofollow">[9]</a></span>
12. <span id="cite_note-arena_rank-12">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-arena_rank_12-0) «Arena-Rank: Open Sourcing the Leaderboard Methodology». *Arena Blog*, 18 de diciembre de 2025. <a href="https://arena.ai/blog/arena-rank/" class="external autonumber" rel="nofollow">[10]</a>. Repositorio: <a href="https://github.com/lmarena/arena-rank" class="external text" rel="nofollow">lmarena/arena-rank</a>.</span>
13. <span id="cite_note-opendata_2025-13">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-opendata_2025_13-0) Y. Song. «A Deep Dive into Recent Arena Data». *LMArena Blog*, 31 de julio de 2025. <a href="https://news.lmarena.ai/opendata-july2025/" class="external autonumber" rel="nofollow">[11]</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-14) *FAQ*. *Arena*. <a href="https://arena.ai/faq" class="external autonumber" rel="nofollow">[12]</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-15) Página principal de *Arena* (descargo de responsabilidad sobre la posible publicación de datos y su transferencia a los proveedores). <a href="https://arena.ai/" class="external autonumber" rel="nofollow">[13]</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-16) Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[14]</a></span>
17. <span id="cite_note-arena_hard-17">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-arena_hard_17-0) Li, T. et al. «From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline». *arXiv:2406.11939*, 2024. <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[15]</a></span>
18. <span id="cite_note-sentiment_control-18">↑ <sup>[18.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-sentiment_control_18-0)</sup> <sup>[18.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-sentiment_control_18-1)</sup> «Does Sentiment Matter Too? Introducing Sentiment Control». *LMArena Blog*, 22 de abril de 2025. <a href="https://news.lmarena.ai/sentiment-control/" class="external autonumber" rel="nofollow">[16]</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-19) Li, T. et al. «From Crowdsourced Data…» *arXiv:2406.11939* (tablas de concordancia). <a href="https://arxiv.org/abs/2406.11939" class="external autonumber" rel="nofollow">[17]</a></span>
20. <span id="cite_note-text_stats-20">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-text_stats_20-0) *Text Arena (English)*. *Arena*. <a href="https://arena.ai/leaderboard/text/english" class="external autonumber" rel="nofollow">[18]</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-21) *Vision Arena*. *Arena*. <a href="https://arena.ai/leaderboard/vision" class="external autonumber" rel="nofollow">[19]</a></span>
22. <span id="cite_note-tti_page-22">↑ <sup>[22.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-tti_page_22-0)</sup> <sup>[22.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-tti_page_22-1)</sup> *Text-to-Image Arena*. *Arena*. <a href="https://arena.ai/leaderboard/text-to-image" class="external autonumber" rel="nofollow">[20]</a></span>
23. <span id="cite_note-nanobanana_blog-23">↑ <sup>[23.0](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-nanobanana_blog_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-nanobanana_blog_23-1)</sup> «Nano-Banana (Gemini 2.5 Flash Image): Try it on LMArena». *LMArena Blog*, 27 de agosto de 2025. <a href="https://news.lmarena.ai/nano-banana/" class="external autonumber" rel="nofollow">[21]</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-24) *Text-to-Video* e *Image-to-Video Leaderboards*. *Arena*. <a href="https://arena.ai/leaderboard/text-to-video" class="external autonumber" rel="nofollow">[22]</a> <a href="https://arena.ai/leaderboard/image-to-video" class="external autonumber" rel="nofollow">[23]</a></span>
25. <span id="cite_note-webdev_arena-25">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-webdev_arena_25-0) «WebDev Arena: A Live LLM Leaderboard for Web App Development». *LMArena Blog*, 10 de marzo de 2025. <a href="https://lmarena.github.io/blog/2025/webdev-arena/" class="external autonumber" rel="nofollow">[24]</a></span>
26. <span id="cite_note-repochat_arena-26">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-repochat_arena_26-0) «RepoChat Arena: A Live Benchmark for AI Software Engineers». *LMArena Blog*, 9 de abril de 2025. <a href="https://lmarena.github.io/blog/2025/repochat-arena/" class="external autonumber" rel="nofollow">[25]</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-27) «Introducing the Search Arena». *LMArena Blog*, 14 de abril de 2025. <a href="https://news.lmarena.ai/search-arena/" class="external autonumber" rel="nofollow">[26]</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-28) «Search Arena & What We're Learning About Human Preference». *LMArena Blog*, 23 de julio de 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[27]</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-29) Frick, E. et al. «Search Arena: Analyzing Search-Augmented LLMs». *arXiv:2506.05334*, 2025. <a href="https://arxiv.org/abs/2506.05334" class="external autonumber" rel="nofollow">[28]</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-30) «Introducing BiomedArena.AI». *LMArena Blog*, 19 de agosto de 2025. <a href="https://news.lmarena.ai/introducing-biomedarena/" class="external autonumber" rel="nofollow">[29]</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-31) Google. «Gemma 3…», 12 de marzo de 2025 (enlace a los resultados de LMArena). <a href="https://blog.google/technology/developers/gemma-3/" class="external autonumber" rel="nofollow">[30]</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-32) Spangher, L. et al. «Chatbot Arena Estimate…». *NAACL Industry*, 2025. <a href="https://aclanthology.org/2025.naacl-industry.77.pdf" class="external autonumber" rel="nofollow">[31]</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-33) «Meta's experimental Llama 4 model briefly topped AI leaderboard…». *The Register*, 7 de abril de 2025. <a href="https://www.theregister.com/2025/04/07/meta_llama_arena/" class="external autonumber" rel="nofollow">[32]</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-34) Aclaraciones y publicaciones oficiales de LMArena en X sobre el incidente (abril de 2025). <a href="https://x.com/lmarena_ai/status/1776881220809552182" class="external autonumber" rel="nofollow">[33]</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-35) «Search Arena & What We're Learning…». *LMArena Blog*, 23 de julio de 2025. <a href="https://news.lmarena.ai/search-arena-update/" class="external autonumber" rel="nofollow">[34]</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-36) Min, R. et al. «Improving Your Model Ranking on Chatbot Arena by Vote Rigging». *arXiv:2501.17858*, 2025. <a href="https://arxiv.org/abs/2501.17858" class="external autonumber" rel="nofollow">[35]</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-37) Huang, Y. et al. «Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards». *arXiv:2501.07493*, 2025. <a href="https://arxiv.org/abs/2501.07493" class="external autonumber" rel="nofollow">[36]</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-38) «Hundreds of rigged votes can skew…». *Fast Company*, 6 de febrero de 2025. <a href="https://www.fastcompany.com/91273226/rigged-votes-ai-model-rankings-chatbot-arena" class="external autonumber" rel="nofollow">[37]</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-39) Singh, S. et al. «The Leaderboard Illusion». *arXiv:2504.20879*, 2025. <a href="https://arxiv.org/abs/2504.20879" class="external autonumber" rel="nofollow">[38]</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-40) «Our Response to 'The Leaderboard Illusion'». *LMArena Blog*, 9 de mayo de 2025. <a href="https://news.lmarena.ai/our-response/" class="external autonumber" rel="nofollow">[39]</a></span>
41. <span id="cite_note-changelog-41">[↑](https://systems-analysis.info/int/LMArena_(Chatbot_Arena)_(ES)#cite_ref-changelog_41-0) *Leaderboard Changelog*. *Arena Blog*. <a href="https://arena.ai/blog/leaderboard-changelog/" class="external autonumber" rel="nofollow">[40]</a></span>
