---
title: "Ranking ELO de Modelos"
source: "https://systems-analysis.info/int/Ranking_ELO_de_Modelos"
wiki: "systems-analysis.info/int"
article: "Ranking_ELO_de_Modelos"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 6160
wiki_created_at: 2026-09-06T23:59:10Z
wiki_modified_at: 2026-09-06T23:59:10Z
downloaded_at: 2026-09-07T23:12:23Z
---

# Ranking ELO de Modelos

**Ranking ELO de modelos de linguagem** é um método para avaliar e comparar grandes modelos de linguagem (LLMs), baseado em uma adaptação do sistema de rating Elo, originalmente desenvolvido para o xadrez. Esta abordagem utiliza comparações par a par de modelos com base em preferências humanas para criar um ranking unificado que reflete o desempenho relativo dos modelos<sup>[\[1\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-medium_elo_intro-1)</sup>.

Diferentemente dos benchmarks tradicionais, que medem métricas absolutas em tarefas específicas, os sistemas ELO determinam as capacidades relativas dos modelos com base em comparações diretas de suas respostas por avaliadores humanos. O princípio fundamental é que os usuários comparam as respostas de dois modelos anônimos para a mesma solicitação e escolhem a melhor opção. Com base nessas preferências, o rating de cada modelo é calculado, onde um rating mais alto indica superioridade nas avaliações humanas<sup>[\[2\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-lmsys_blog-2)</sup>.

## Histórico do Desenvolvimento

### Origem do sistema ELO

O sistema de rating ELO foi desenvolvido pelo físico húngaro-americano **Arpad Elo** (*Arpad Emrick Elo*, 1903–1992) na década de 1960 para avaliar a habilidade de jogadores de xadrez. Elo, um professor de física, criou o sistema como uma melhoria do sistema Harkness existente, que possuía desvantagens significativas na precisão das avaliações<sup>[\[3\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-wiki_elo-3)</sup>.

- **1960**: A Federação de Xadrez dos Estados Unidos (USCF) adotou oficialmente o sistema Elo.
- **1970**: A Federação Internacional de Xadrez (FIDE) começou a usar o sistema<sup>[\[4\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-history_hit_elo-4)</sup>.

### Adaptação para Modelos de Linguagem

A aplicação do ELO para avaliar LLMs começou com o lançamento da plataforma **LMSYS Chatbot Arena** em 3 de maio de 2023. A plataforma foi criada pela organização LMSYS (*Large Model Systems Organization*) — uma colaboração de pesquisadores do UC Berkeley SkyLab, UC San Diego e Carnegie Mellon University<sup>[\[5\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-originality_ai_lmsys-5)</sup>.

## Metodologia

### Fundamentos Matemáticos

#### Fórmula Clássica do ELO

A fórmula clássica do ELO para calcular a probabilidade esperada de vitória do modelo A sobre o modelo B é: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` onde `R_A` e `R_B` são os ratings atuais dos modelos.

A atualização do rating após uma comparação ocorre de acordo com a fórmula: `R'_A = R_A + K × (S_A - E_A)` onde `K` é o fator de desenvolvimento (fator K), `S_A` é o resultado real (1 para vitória, 0.5 para empate, 0 para derrota), e `E_A` é o resultado esperado<sup>[\[4\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-history_hit_elo-4)</sup>.

#### Modelo de Bradley-Terry

Plataformas modernas, incluindo a LMSYS Chatbot Arena, migraram para o modelo de Bradley-Terry, que é uma abordagem estatisticamente mais robusta. A probabilidade de preferência do modelo `i` sobre o modelo `j` é calculada como:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` onde `β_i` e `β_j` são os coeficientes (ratings) dos modelos, estimados pelo método da máxima verossimilhança<sup>[\[2\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-lmsys_blog-2)</sup>. Este método é mais estável e demonstra melhor alinhamento com as preferências humanas<sup>[\[6\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-elo_uncovered_arxiv-6)</sup>.

## Processo de Avaliação na Chatbot Arena

1.  **Comparação Anônima:** Os usuários interagem com dois modelos anônimos em paralelo.
2.  **Votação:** Após receberem as respostas, os usuários escolhem a opção preferida.
3.  **Revelação da Identidade:** Os nomes dos modelos são exibidos somente após a votação.
4.  **Atualização do Ranking:** Os ratings são atualizados com base nos resultados da votação, geralmente por meio de processamento em lote para aumentar a estabilidade<sup>[\[2\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-lmsys_blog-2)</sup>.

## Vantagens e Desvantagens

### Vantagens

- **Simplicidade e Interpretabilidade:** O sistema é fácil de entender e implementar.
- **Escalabilidade:** Permite avaliar um grande número de modelos sem a necessidade de comparações par a par completas.
- **Alinhamento com as Preferências Humanas:** O ranking reflete diretamente as preferências reais dos usuários, em vez de métricas abstratas.

### Desvantagens e Limitações

- **Problemas de Confiabilidade:** Cálculos individuais de ELO podem apresentar volatilidade significativa.
- **Violações da Transitividade:** O sistema nem sempre satisfaz a condição A\>B e B\>C → A\>C, o que é uma limitação fundamental.
- **Dependência do Tamanho da Amostra:** Para obter ratings estáveis, é necessária uma amostra grande (centenas ou milhares de comparações)<sup>[\[6\]](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_note-elo_uncovered_arxiv-6)</sup>.
- **Vieses na Avaliação:** Os resultados podem ser enviesados pela preferência dos usuários por respostas mais longas ou estilisticamente formatadas, bem como por diferenças culturais entre os avaliadores.

## Conclusão

O ranking ELO representa uma ferramenta importante no ecossistema de avaliação de modelos de linguagem, proporcionando um método intuitivo para compará-los com base nas preferências humanas. Apesar do sucesso de plataformas como a LMSYS Chatbot Arena, o método possui limitações fundamentais, incluindo problemas de transitividade e confiabilidade. A transição do ELO clássico para o modelo de Bradley-Terry é um aprimoramento significativo, mas o futuro da avaliação de LLMs provavelmente envolverá a combinação de múltiplas abordagens para obter uma visão mais completa das capacidades dos modelos.

## Ligações externas

- <a href="https://chat.lmsys.org/" class="external text" rel="nofollow">Site oficial da LMSYS Chatbot Arena</a>
- <a href="https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard" class="external text" rel="nofollow">Tabela de líderes da LMSYS Chatbot Arena</a>

## Literatura

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. <a href="https://archive.org/details/ratingofchesspla00unse" class="external text" rel="nofollow">archive.org</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. <a href="https://arxiv.org/abs/2411.14483" class="external text" rel="nofollow">arXiv:2411.14483</a>.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. <a href="https://arxiv.org/abs/2403.16950" class="external text" rel="nofollow">arXiv:2403.16950</a>.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. <a href="https://arxiv.org/abs/2402.17826" class="external text" rel="nofollow">arXiv:2402.17826</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. <a href="https://arxiv.org/abs/2505.03475" class="external text" rel="nofollow">arXiv:2505.03475</a>.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. <a href="https://arxiv.org/abs/2502.10985" class="external text" rel="nofollow">arXiv:2502.10985</a>.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. <a href="https://arxiv.org/abs/2506.00178" class="external text" rel="nofollow">arXiv:2506.00178</a>.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. <a href="https://arxiv.org/abs/2411.04991" class="external text" rel="nofollow">arXiv:2411.04991</a>.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. <a href="https://arxiv.org/abs/2505.24783" class="external text" rel="nofollow">arXiv:2505.24783</a>.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. <a href="https://arxiv.org/abs/2506.11354" class="external text" rel="nofollow">arXiv:2506.11354</a>.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. <a href="https://arxiv.org/abs/2310.10386" class="external text" rel="nofollow">arXiv:2310.10386</a>.

## Notas

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-wiki_elo_3-0) «Elo rating system». Em *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Ranking_ELO_de_Modelos#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
