Elo ranking of language models — 언어 모델 ELO 랭킹
언어 모델의 ELO 랭킹 — 이는 체스를 위해 최초로 개발된 Elo 등급 시스템을 응용하여 대형 언어 모델(LLM)을 평가하고 비교하는 방법입니다. 이 접근 방식은 인간의 선호도를 기반으로 한 모델 간 쌍별 비교를 사용하여 모델의 상대적 성능을 반영하는 단일 등급을 생성합니다[1].
특정 과제에서의 절대적 지표를 측정하는 전통적인 benchmark와 달리, ELO 시스템은 인간 평가자가 모델의 응답을 직접 비교함으로써 모델의 상대적 능력을 결정합니다. 핵심 원칙은 사용자가 동일한 질의에 대한 두 익명 모델의 응답을 비교하여 더 나은 답변을 선택한다는 것입니다. 이러한 선호도를 바탕으로 각 모델의 등급이 산출되며, 높은 등급은 인간 평가에서의 우위를 나타냅니다[2].
발전의 역사
ELO 시스템의 기원
ELO 등급 시스템은 헝가리계 미국인 물리학자 아르파드 엘로 (Arpad Emrick Elo, 1903–1992)가 1960년대에 체스 선수의 기량을 평가하기 위해 개발하였습니다. 물리학 교수였던 엘로는 정확도 면에서 심각한 결점을 지닌 기존 Harkness 시스템을 개선하기 위해 이 시스템을 고안하였습니다[3].
- 1960년: 미국 체스 연맹(USCF)이 엘로 시스템을 공식 채택하였습니다.
- 1970년: 세계 체스 연맹(FIDE)이 이 시스템을 사용하기 시작하였습니다[4].
언어 모델에의 적용
LLM 평가를 위한 ELO 활용은 2023년 5월 3일 LMSYS Chatbot Arena 플랫폼의 출범과 함께 시작되었습니다. 이 플랫폼은 UC Berkeley SkyLab, UC San Diego, Carnegie Mellon University 연구자들의 협력체인 LMSYS (Large Model Systems Organization)에 의해 구축되었습니다[5].
방법론
수학적 기초
고전 ELO 공식
모델 A가 모델 B를 이길 기대 확률을 계산하는 고전 ELO 공식: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` 여기서 `R_A`와 `R_B`는 각 모델의 현재 등급입니다.
비교 후 등급 갱신은 다음 공식에 따라 이루어집니다: `R'_A = R_A + K × (S_A - E_A)` 여기서 `K`는 발전 계수(K-인수), `S_A`는 실제 결과(승리는 1, 무승부는 0.5, 패배는 0), `E_A`는 기대 결과입니다[4].
Bradley-Terry 모델
LMSYS Chatbot Arena를 포함한 현대 플랫폼들은 통계적으로 더 엄밀한 접근 방식인 Bradley-Terry 모델로 전환하였습니다. 모델 `i`가 모델 `j`보다 선호될 확률은 다음과 같이 계산됩니다:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` 여기서 `β_i`와 `β_j`는 최대 우도 방법으로 추정되는 모델의 계수(등급)입니다[2]. 이 방법은 더 안정적이며 인간의 선호도와 더 잘 일치하는 것으로 나타납니다[6].
Chatbot Arena의 평가 과정
- 익명 비교: 사용자는 두 개의 익명 모델과 동시에 상호작용합니다.
- 투표: 응답을 받은 후 사용자는 선호하는 답변을 선택합니다.
- 신원 공개: 모델의 이름은 투표 이후에만 공개됩니다.
- 등급 갱신: 등급은 투표 결과를 바탕으로 갱신되며, 안정성 향상을 위해 일반적으로 일괄 처리 방식으로 진행됩니다[2].
장점과 단점
장점
- 단순성과 해석 가능성: 시스템은 이해하고 구현하기 쉽습니다.
- 확장성: 전체 쌍별 비교 없이도 많은 수의 모델을 평가할 수 있습니다.
- 인간 선호도와의 일치: 등급이 추상적인 지표가 아닌 실제 사용자 선호도를 직접 반영합니다.
단점 및 한계
- 신뢰성 문제: 개별적인 ELO 계산은 상당한 변동성을 보일 수 있습니다.
- 이행성 위반: 시스템이 항상 A>B이고 B>C이면 A>C라는 조건을 만족하지 않으며, 이는 근본적인 한계입니다.
- 표본 크기 의존성: 안정적인 등급을 얻으려면 대규모 표본(수백에서 수천 건의 비교)이 필요합니다[6].
- 평가 편향: 사용자들이 더 길거나 스타일적으로 서식화된 답변을 선호하거나, 평가자의 문화적 차이로 인해 결과가 편향될 수 있습니다.
결론
ELO 랭킹은 언어 모델 평가 생태계에서 인간의 선호도를 기반으로 모델을 직관적으로 비교할 수 있는 수단을 제공하는 중요한 도구입니다. LMSYS Chatbot Arena와 같은 플랫폼의 성공에도 불구하고, 이 방법은 이행성 및 신뢰성 문제를 포함한 근본적인 한계를 지닙니다. 고전 ELO에서 Bradley-Terry 모델로의 전환은 중요한 개선이지만, LLM 평가의 미래는 모델 능력의 보다 완전한 그림을 얻기 위해 여러 접근 방식을 결합하는 데 있을 것으로 보입니다.
참조
- LMSYS Chatbot Arena 공식 웹사이트
- LMSYS Chatbot Arena 리더보드
참고 문헌
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
주석
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [1]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]