---
title: "Ranking Elo de modelos de lenguaje"
source: "https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje"
wiki: "systems-analysis.info/int"
article: "Ranking_Elo_de_modelos_de_lenguaje"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 6161
wiki_created_at: 2026-09-06T23:59:10Z
wiki_modified_at: 2026-09-06T23:59:10Z
downloaded_at: 2026-09-07T23:12:23Z
---

# Ranking Elo de modelos de lenguaje

**El ranking ELO de modelos de lenguaje** es un método para evaluar y comparar grandes modelos de lenguaje (LLM) basado en una adaptación del sistema de clasificación Elo, desarrollado originalmente para el ajedrez. Este enfoque utiliza comparaciones por pares de modelos basadas en las preferencias humanas para crear una clasificación unificada que refleja el rendimiento relativo de los modelos<sup>[\[1\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-medium_elo_intro-1)</sup>.

A diferencia de los benchmarks tradicionales, que miden métricas absolutas en tareas específicas, los sistemas ELO determinan las capacidades relativas de los modelos basándose en comparaciones directas de sus respuestas por parte de evaluadores humanos. El principio fundamental es que los usuarios comparan las respuestas de dos modelos anónimos a la misma consulta y eligen la mejor opción. Basándose en estas preferencias, se calcula la clasificación de cada modelo, donde una puntuación más alta indica superioridad en las evaluaciones humanas<sup>[\[2\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-lmsys_blog-2)</sup>.

## Historia y desarrollo

### Origen del sistema ELO

El sistema de clasificación ELO fue desarrollado por el físico húngaro-estadounidense **Arpad Elo** (*Arpad Emrick Elo*, 1903–1992) en la década de 1960 para evaluar la habilidad de los jugadores de ajedrez. Elo, profesor de física, creó el sistema como una mejora del sistema Harkness existente, que tenía importantes deficiencias en la precisión de las evaluaciones<sup>[\[3\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-wiki_elo-3)</sup>.

- **1960**: La Federación de Ajedrez de Estados Unidos (USCF) adoptó oficialmente el sistema Elo.
- **1970**: La Federación Internacional de Ajedrez (FIDE) comenzó a utilizar el sistema<sup>[\[4\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-history_hit_elo-4)</sup>.

### Adaptación para modelos de lenguaje

La aplicación del sistema ELO para la evaluación de LLM comenzó con el lanzamiento de la plataforma **LMSYS Chatbot Arena** el 3 de mayo de 2023. La plataforma fue creada por la organización LMSYS (*Large Model Systems Organization*), una colaboración de investigadores de UC Berkeley SkyLab, UC San Diego y la Carnegie Mellon University<sup>[\[5\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-originality_ai_lmsys-5)</sup>.

## Metodología

### Fundamentos matemáticos

#### Fórmula clásica de ELO

La fórmula clásica de ELO para calcular la probabilidad esperada de que el modelo A gane al modelo B es: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` donde `R_A` y `R_B` son las clasificaciones actuales de los modelos.

La actualización de la clasificación después de una comparación se realiza mediante la siguiente fórmula: `R'_A = R_A + K × (S_A - E_A)` donde `K` es el factor de desarrollo (factor K), `S_A` es el resultado real (1 para una victoria, 0.5 para un empate, 0 para una derrota), y `E_A` es el resultado esperado<sup>[\[4\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-history_hit_elo-4)</sup>.

#### Modelo de Bradley-Terry

Las plataformas modernas, incluida LMSYS Chatbot Arena, han adoptado el modelo de Bradley-Terry, que representa un enfoque estadísticamente más sólido. La probabilidad de que el modelo `i` sea preferido sobre el modelo `j` se calcula como:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` donde `β_i` y `β_j` son los coeficientes (ratings) de los modelos, estimados mediante el método de máxima verosimilitud<sup>[\[2\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-lmsys_blog-2)</sup>. Este método es más estable y muestra una mejor concordancia con las preferencias humanas<sup>[\[6\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-elo_uncovered_arxiv-6)</sup>.

## Proceso de evaluación en Chatbot Arena

1.  **Comparación anónima:** Los usuarios interactúan con dos modelos anónimos en paralelo.
2.  **Votación:** Después de recibir las respuestas, los usuarios eligen la opción que prefieren.
3.  **Revelación de identidad:** Los nombres de los modelos se muestran solo después de la votación.
4.  **Actualización de la clasificación:** Las clasificaciones se actualizan en función de los resultados de la votación, generalmente mediante un procesamiento por lotes para mejorar la estabilidad<sup>[\[2\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-lmsys_blog-2)</sup>.

## Ventajas y desventajas

### Ventajas

- **Simplicidad e interpretabilidad:** El sistema es fácil de entender e implementar.
- **Escalabilidad:** Permite evaluar un gran número de modelos sin necesidad de comparaciones exhaustivas por pares.
- **Alineación con las preferencias humanas:** La clasificación refleja directamente las preferencias reales de los usuarios en lugar de métricas abstractas.

### Desventajas y limitaciones

- **Problemas de fiabilidad:** Los cálculos individuales de ELO pueden mostrar una volatilidad significativa.
- **Violaciones de la transitividad:** El sistema no siempre satisface la condición A\>B y B\>C → A\>C, lo que constituye una limitación fundamental.
- **Dependencia del tamaño de la muestra:** Se necesita una muestra grande (cientos o miles de comparaciones) para obtener clasificaciones estables<sup>[\[6\]](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_note-elo_uncovered_arxiv-6)</sup>.
- **Sesgos en la evaluación:** Los resultados pueden estar sesgados por la preferencia de los usuarios hacia respuestas más largas o con un formato estilizado, así como por las diferencias culturales de los evaluadores.

## Conclusión

El ranking ELO es una herramienta importante en el ecosistema de evaluación de modelos de lenguaje, ya que proporciona una forma intuitiva de compararlos basándose en las preferencias humanas. A pesar del éxito de plataformas como LMSYS Chatbot Arena, el método tiene limitaciones fundamentales, incluidos problemas de transitividad y fiabilidad. La transición del ELO clásico al modelo de Bradley-Terry es una mejora significativa, pero el futuro de la evaluación de LLM probablemente radicará en la combinación de múltiples enfoques para obtener una imagen más completa de las capacidades de los modelos.

## Enlaces externos

- <a href="https://chat.lmsys.org/" class="external text" rel="nofollow">Sitio web oficial de LMSYS Chatbot Arena</a>
- <a href="https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard" class="external text" rel="nofollow">Tabla de clasificación de LMSYS Chatbot Arena</a>

## Bibliografía

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. <a href="https://archive.org/details/ratingofchesspla00unse" class="external text" rel="nofollow">archive.org</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. <a href="https://arxiv.org/abs/2411.14483" class="external text" rel="nofollow">arXiv:2411.14483</a>.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. <a href="https://arxiv.org/abs/2403.16950" class="external text" rel="nofollow">arXiv:2403.16950</a>.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. <a href="https://arxiv.org/abs/2402.17826" class="external text" rel="nofollow">arXiv:2402.17826</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. <a href="https://arxiv.org/abs/2505.03475" class="external text" rel="nofollow">arXiv:2505.03475</a>.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. <a href="https://arxiv.org/abs/2502.10985" class="external text" rel="nofollow">arXiv:2502.10985</a>.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. <a href="https://arxiv.org/abs/2506.00178" class="external text" rel="nofollow">arXiv:2506.00178</a>.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. <a href="https://arxiv.org/abs/2411.04991" class="external text" rel="nofollow">arXiv:2411.04991</a>.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. <a href="https://arxiv.org/abs/2505.24783" class="external text" rel="nofollow">arXiv:2505.24783</a>.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. <a href="https://arxiv.org/abs/2506.11354" class="external text" rel="nofollow">arXiv:2506.11354</a>.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. <a href="https://arxiv.org/abs/2310.10386" class="external text" rel="nofollow">arXiv:2310.10386</a>.

## Referencias

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-wiki_elo_3-0) «Elo rating system». En *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Ranking_Elo_de_modelos_de_lenguaje#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
