---
title: "Elo ranking of language models — 언어 모델 ELO 랭킹"
source: "https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9"
wiki: "systems-analysis.info/int"
article: "Elo_ranking_of_language_models_—_언어_모델_ELO_랭킹"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 1858
wiki_created_at: 2026-09-06T22:55:07Z
wiki_modified_at: 2026-09-06T22:55:07Z
downloaded_at: 2026-09-07T22:48:13Z
---

# Elo ranking of language models — 언어 모델 ELO 랭킹

**언어 모델의 ELO 랭킹** — 이는 체스를 위해 최초로 개발된 Elo 등급 시스템을 응용하여 대형 언어 모델(LLM)을 평가하고 비교하는 방법입니다. 이 접근 방식은 인간의 선호도를 기반으로 한 모델 간 쌍별 비교를 사용하여 모델의 상대적 성능을 반영하는 단일 등급을 생성합니다<sup>[\[1\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-medium_elo_intro-1)</sup>.

특정 과제에서의 절대적 지표를 측정하는 전통적인 benchmark와 달리, ELO 시스템은 인간 평가자가 모델의 응답을 직접 비교함으로써 모델의 상대적 능력을 결정합니다. 핵심 원칙은 사용자가 동일한 질의에 대한 두 익명 모델의 응답을 비교하여 더 나은 답변을 선택한다는 것입니다. 이러한 선호도를 바탕으로 각 모델의 등급이 산출되며, 높은 등급은 인간 평가에서의 우위를 나타냅니다<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-lmsys_blog-2)</sup>.

## 발전의 역사

### ELO 시스템의 기원

ELO 등급 시스템은 헝가리계 미국인 물리학자 **아르파드 엘로** (*Arpad Emrick Elo*, 1903–1992)가 1960년대에 체스 선수의 기량을 평가하기 위해 개발하였습니다. 물리학 교수였던 엘로는 정확도 면에서 심각한 결점을 지닌 기존 Harkness 시스템을 개선하기 위해 이 시스템을 고안하였습니다<sup>[\[3\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-wiki_elo-3)</sup>.

- **1960년**: 미국 체스 연맹(USCF)이 엘로 시스템을 공식 채택하였습니다.
- **1970년**: 세계 체스 연맹(FIDE)이 이 시스템을 사용하기 시작하였습니다<sup>[\[4\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-history_hit_elo-4)</sup>.

### 언어 모델에의 적용

LLM 평가를 위한 ELO 활용은 2023년 5월 3일 **LMSYS Chatbot Arena** 플랫폼의 출범과 함께 시작되었습니다. 이 플랫폼은 UC Berkeley SkyLab, UC San Diego, Carnegie Mellon University 연구자들의 협력체인 LMSYS (*Large Model Systems Organization*)에 의해 구축되었습니다<sup>[\[5\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-originality_ai_lmsys-5)</sup>.

## 방법론

### 수학적 기초

#### 고전 ELO 공식

모델 A가 모델 B를 이길 기대 확률을 계산하는 고전 ELO 공식: \`P(A \> B) = 1 / (1 + 10^((R_B - R_A) / 400))\` 여기서 \`R_A\`와 \`R_B\`는 각 모델의 현재 등급입니다.

비교 후 등급 갱신은 다음 공식에 따라 이루어집니다: \`R'\_A = R_A + K × (S_A - E_A)\` 여기서 \`K\`는 발전 계수(K-인수), \`S_A\`는 실제 결과(승리는 1, 무승부는 0.5, 패배는 0), \`E_A\`는 기대 결과입니다<sup>[\[4\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-history_hit_elo-4)</sup>.

#### Bradley-Terry 모델

LMSYS Chatbot Arena를 포함한 현대 플랫폼들은 통계적으로 더 엄밀한 접근 방식인 Bradley-Terry 모델로 전환하였습니다. 모델 \`i\`가 모델 \`j\`보다 선호될 확률은 다음과 같이 계산됩니다:

\`P(i \> j) = e^(β_i) / (e^(β_i) + e^(β_j))\` 여기서 \`β_i\`와 \`β_j\`는 최대 우도 방법으로 추정되는 모델의 계수(등급)입니다<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-lmsys_blog-2)</sup>. 이 방법은 더 안정적이며 인간의 선호도와 더 잘 일치하는 것으로 나타납니다<sup>[\[6\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-elo_uncovered_arxiv-6)</sup>.

## Chatbot Arena의 평가 과정

1.  **익명 비교:** 사용자는 두 개의 익명 모델과 동시에 상호작용합니다.
2.  **투표:** 응답을 받은 후 사용자는 선호하는 답변을 선택합니다.
3.  **신원 공개:** 모델의 이름은 투표 이후에만 공개됩니다.
4.  **등급 갱신:** 등급은 투표 결과를 바탕으로 갱신되며, 안정성 향상을 위해 일반적으로 일괄 처리 방식으로 진행됩니다<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-lmsys_blog-2)</sup>.

## 장점과 단점

### 장점

- **단순성과 해석 가능성:** 시스템은 이해하고 구현하기 쉽습니다.
- **확장성:** 전체 쌍별 비교 없이도 많은 수의 모델을 평가할 수 있습니다.
- **인간 선호도와의 일치:** 등급이 추상적인 지표가 아닌 실제 사용자 선호도를 직접 반영합니다.

### 단점 및 한계

- **신뢰성 문제:** 개별적인 ELO 계산은 상당한 변동성을 보일 수 있습니다.
- **이행성 위반:** 시스템이 항상 A\>B이고 B\>C이면 A\>C라는 조건을 만족하지 않으며, 이는 근본적인 한계입니다.
- **표본 크기 의존성:** 안정적인 등급을 얻으려면 대규모 표본(수백에서 수천 건의 비교)이 필요합니다<sup>[\[6\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_note-elo_uncovered_arxiv-6)</sup>.
- **평가 편향:** 사용자들이 더 길거나 스타일적으로 서식화된 답변을 선호하거나, 평가자의 문화적 차이로 인해 결과가 편향될 수 있습니다.

## 결론

ELO 랭킹은 언어 모델 평가 생태계에서 인간의 선호도를 기반으로 모델을 직관적으로 비교할 수 있는 수단을 제공하는 중요한 도구입니다. LMSYS Chatbot Arena와 같은 플랫폼의 성공에도 불구하고, 이 방법은 이행성 및 신뢰성 문제를 포함한 근본적인 한계를 지닙니다. 고전 ELO에서 Bradley-Terry 모델로의 전환은 중요한 개선이지만, LLM 평가의 미래는 모델 능력의 보다 완전한 그림을 얻기 위해 여러 접근 방식을 결합하는 데 있을 것으로 보입니다.

## 참조

- LMSYS Chatbot Arena 공식 웹사이트
- LMSYS Chatbot Arena 리더보드

## 참고 문헌

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. arXiv:2411.14483.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. arXiv:2502.14074.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. arXiv:2502.10985.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. arXiv:2506.00178.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. arXiv:2411.04991.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. arXiv:2505.24783.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. arXiv:2310.10386.

  

## 주석

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-wiki_elo_3-0) «Elo rating system». В *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%EC%96%B8%EC%96%B4_%EB%AA%A8%EB%8D%B8_ELO_%EB%9E%AD%ED%82%B9#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
