Ranking ELO de Modelos

From Systems analysis Wiki
Jump to navigation Jump to search

Ranking ELO de modelos de linguagem é um método para avaliar e comparar grandes modelos de linguagem (LLMs), baseado em uma adaptação do sistema de rating Elo, originalmente desenvolvido para o xadrez. Esta abordagem utiliza comparações par a par de modelos com base em preferências humanas para criar um ranking unificado que reflete o desempenho relativo dos modelos[1].

Diferentemente dos benchmarks tradicionais, que medem métricas absolutas em tarefas específicas, os sistemas ELO determinam as capacidades relativas dos modelos com base em comparações diretas de suas respostas por avaliadores humanos. O princípio fundamental é que os usuários comparam as respostas de dois modelos anônimos para a mesma solicitação e escolhem a melhor opção. Com base nessas preferências, o rating de cada modelo é calculado, onde um rating mais alto indica superioridade nas avaliações humanas[2].

Histórico do Desenvolvimento

Origem do sistema ELO

O sistema de rating ELO foi desenvolvido pelo físico húngaro-americano Arpad Elo (Arpad Emrick Elo, 1903–1992) na década de 1960 para avaliar a habilidade de jogadores de xadrez. Elo, um professor de física, criou o sistema como uma melhoria do sistema Harkness existente, que possuía desvantagens significativas na precisão das avaliações[3].

  • 1960: A Federação de Xadrez dos Estados Unidos (USCF) adotou oficialmente o sistema Elo.
  • 1970: A Federação Internacional de Xadrez (FIDE) começou a usar o sistema[4].

Adaptação para Modelos de Linguagem

A aplicação do ELO para avaliar LLMs começou com o lançamento da plataforma LMSYS Chatbot Arena em 3 de maio de 2023. A plataforma foi criada pela organização LMSYS (Large Model Systems Organization) — uma colaboração de pesquisadores do UC Berkeley SkyLab, UC San Diego e Carnegie Mellon University[5].

Metodologia

Fundamentos Matemáticos

Fórmula Clássica do ELO

A fórmula clássica do ELO para calcular a probabilidade esperada de vitória do modelo A sobre o modelo B é: P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400)) onde R_A e R_B são os ratings atuais dos modelos.

A atualização do rating após uma comparação ocorre de acordo com a fórmula: R'_A = R_A + K × (S_A - E_A) onde K é o fator de desenvolvimento (fator K), S_A é o resultado real (1 para vitória, 0.5 para empate, 0 para derrota), e E_A é o resultado esperado[4].

Modelo de Bradley-Terry

Plataformas modernas, incluindo a LMSYS Chatbot Arena, migraram para o modelo de Bradley-Terry, que é uma abordagem estatisticamente mais robusta. A probabilidade de preferência do modelo i sobre o modelo j é calculada como:

P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j)) onde β_i e β_j são os coeficientes (ratings) dos modelos, estimados pelo método da máxima verossimilhança[2]. Este método é mais estável e demonstra melhor alinhamento com as preferências humanas[6].

Processo de Avaliação na Chatbot Arena

  1. Comparação Anônima: Os usuários interagem com dois modelos anônimos em paralelo.
  2. Votação: Após receberem as respostas, os usuários escolhem a opção preferida.
  3. Revelação da Identidade: Os nomes dos modelos são exibidos somente após a votação.
  4. Atualização do Ranking: Os ratings são atualizados com base nos resultados da votação, geralmente por meio de processamento em lote para aumentar a estabilidade[2].

Vantagens e Desvantagens

Vantagens

  • Simplicidade e Interpretabilidade: O sistema é fácil de entender e implementar.
  • Escalabilidade: Permite avaliar um grande número de modelos sem a necessidade de comparações par a par completas.
  • Alinhamento com as Preferências Humanas: O ranking reflete diretamente as preferências reais dos usuários, em vez de métricas abstratas.

Desvantagens e Limitações

  • Problemas de Confiabilidade: Cálculos individuais de ELO podem apresentar volatilidade significativa.
  • Violações da Transitividade: O sistema nem sempre satisfaz a condição A>B e B>C → A>C, o que é uma limitação fundamental.
  • Dependência do Tamanho da Amostra: Para obter ratings estáveis, é necessária uma amostra grande (centenas ou milhares de comparações)[6].
  • Vieses na Avaliação: Os resultados podem ser enviesados pela preferência dos usuários por respostas mais longas ou estilisticamente formatadas, bem como por diferenças culturais entre os avaliadores.

Conclusão

O ranking ELO representa uma ferramenta importante no ecossistema de avaliação de modelos de linguagem, proporcionando um método intuitivo para compará-los com base nas preferências humanas. Apesar do sucesso de plataformas como a LMSYS Chatbot Arena, o método possui limitações fundamentais, incluindo problemas de transitividade e confiabilidade. A transição do ELO clássico para o modelo de Bradley-Terry é um aprimoramento significativo, mas o futuro da avaliação de LLMs provavelmente envolverá a combinação de múltiplas abordagens para obter uma visão mais completa das capacidades dos modelos.

Ligações externas

Literatura

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.

Notas

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». Em Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]