---
title: "ELO‑ранжирование моделей"
source: "https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9"
wiki: "systems-analysis.info/wiki"
article: "ELO‑ранжирование_моделей"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 88
wiki_created_at: 2026-09-06T21:54:49Z
wiki_modified_at: 2026-09-06T21:54:49Z
downloaded_at: 2026-09-07T22:17:20Z
---

# ELO‑ранжирование моделей

**ELO-ранжирование языковых моделей** — это метод оценки и сравнения [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM), основанный на адаптированной системе рейтингов Эло, изначально разработанной для шахмат. Данный подход использует попарные сравнения моделей на основе человеческих предпочтений для создания единого рейтинга, отражающего относительную производительность моделей<sup>[\[1\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-medium_elo_intro-1)</sup>.

В отличие от традиционных [бенчмарков](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM"), измеряющих абсолютные показатели на конкретных задачах, ELO-системы определяют относительные способности моделей на основе прямых сравнений их ответов человеческими оценщиками. Основной принцип заключается в том, что пользователи сравнивают ответы двух анонимных моделей на один и тот же запрос и выбирают лучший вариант. На основе этих предпочтений рассчитывается рейтинг каждой модели, где более высокий рейтинг указывает на превосходство в человеческих оценках<sup>[\[2\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-lmsys_blog-2)</sup>.

## История развития

### Происхождение системы ELO

Система рейтингов ELO была разработана венгерско-американским физиком **Арпад Эло** (*Arpad Emrick Elo*, 1903–1992) в 1960-х годах для оценки мастерства шахматистов. Эло, профессор физики, создал систему в качестве улучшения существовавшей системы Харкнесса, которая имела существенные недостатки в точности оценок<sup>[\[3\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-wiki_elo-3)</sup>.

- **1960**: Шахматная федерация США (USCF) официально приняла систему Эло.
- **1970**: Всемирная шахматная федерация (FIDE) начала использовать систему<sup>[\[4\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-history_hit_elo-4)</sup>.

### Адаптация для языковых моделей

Применение ELO для [оценки LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM") началось с запуска платформы **LMSYS Chatbot Arena** 3 мая 2023 года. Платформа была создана организацией LMSYS (*Large Model Systems Organization*) — коллаборацией исследователей из UC Berkeley SkyLab, UC San Diego и Carnegie Mellon University<sup>[\[5\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-originality_ai_lmsys-5)</sup>.

## Методология

### Математические основы

#### Классическая формула ELO

Классическая формула ELO для вычисления ожидаемой вероятности победы модели А над моделью В: \`P(A \> B) = 1 / (1 + 10^((R_B - R_A) / 400))\` где \`R_A\` и \`R_B\` — текущие рейтинги моделей.

Обновление рейтинга после сравнения происходит по формуле: \`R'\_A = R_A + K × (S_A - E_A)\` где \`K\` — коэффициент развития (К-фактор), \`S_A\` — фактический результат (1 для победы, 0.5 для ничьей, 0 для поражения), а \`E_A\` — ожидаемый результат<sup>[\[4\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-history_hit_elo-4)</sup>.

#### Модель Брэдли-Терри

Современные платформы, включая LMSYS Chatbot Arena, перешли на модель Брэдли-Терри, которая представляет собой статистически более обоснованный подход. Вероятность предпочтения модели \`i\` над моделью \`j\` вычисляется как:

\`P(i \> j) = e^(β_i) / (e^(β_i) + e^(β_j))\` где \`β_i\` и \`β_j\` — коэффициенты (рейтинги) моделей, оцениваемые методом максимального правдоподобия<sup>[\[2\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-lmsys_blog-2)</sup>. Этот метод более стабилен и показывает лучшее согласование с человеческими предпочтениями<sup>[\[6\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-elo_uncovered_arxiv-6)</sup>.

## Процесс оценки в Chatbot Arena

1.  **Анонимное сравнение:** Пользователи взаимодействуют с двумя анонимными моделями параллельно.
2.  **Голосование:** После получения ответов пользователи выбирают предпочтительный вариант.
3.  **Раскрытие идентичности:** Названия моделей показываются только после голосования.
4.  **Обновление рейтинга:** Рейтинги обновляются на основе результатов голосования, как правило, пакетной обработкой для повышения стабильности<sup>[\[2\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-lmsys_blog-2)</sup>.

## Преимущества и недостатки

### Преимущества

- **Простота и интерпретируемость:** Система легка для понимания и реализации.
- **Масштабируемость:** Позволяет оценивать большое количество моделей без необходимости полных попарных сравнений.
- **Соответствие человеческим предпочтениям:** Рейтинг напрямую отражает реальные предпочтения пользователей, а не абстрактные метрики.

### Недостатки и ограничения

- **Проблемы надёжности:** Индивидуальные вычисления ELO могут демонстрировать значительную волатильность.
- **Нарушения транзитивности:** Система не всегда удовлетворяет условию A\>B и B\>C → A\>C, что является фундаментальным ограничением.
- **Зависимость от размера выборки:** Для получения стабильных рейтингов требуется большая выборка (сотни и тысячи сравнений)<sup>[\[6\]](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_note-elo_uncovered_arxiv-6)</sup>.
- **Предвзятости в оценке:** Результаты могут быть смещены из-за предпочтения пользователями более длинных или стилистически отформатированных ответов, а также из-за культурных различий оценщиков.

## Заключение

ELO-ранжирование представляет собой важный инструмент в экосистеме оценки языковых моделей, обеспечивая интуитивно понятный способ их сравнения на основе человеческих предпочтений. Несмотря на успех платформ вроде LMSYS Chatbot Arena, метод имеет фундаментальные ограничения, включая проблемы транзитивности и надёжности. Переход от классического ELO к модели Брэдли-Терри является важным усовершенствованием, но будущее оценки LLM, вероятно, будет заключаться в комбинировании множественных подходов для получения более полной картины возможностей моделей.

## См. также

- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [BIG-bench](https://systems-analysis.info/wiki/BIG-bench "BIG-bench")
- [HumanEval benchmark](https://systems-analysis.info/wiki/HumanEval_benchmark "HumanEval benchmark")
- [Humanity's Last Exam](https://systems-analysis.info/wiki/Humanity%27s_Last_Exam "Humanity's Last Exam")
- [MATH benchmark](https://systems-analysis.info/wiki/MATH_benchmark "MATH benchmark")

## Ссылки

- <a href="https://chat.lmsys.org/" class="external text" rel="nofollow">Официальный сайт LMSYS Chatbot Arena</a>
- <a href="https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard" class="external text" rel="nofollow">Таблица лидеров LMSYS Chatbot Arena</a>

## Литература

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. <a href="https://archive.org/details/ratingofchesspla00unse" class="external text" rel="nofollow">archive.org</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. <a href="https://arxiv.org/abs/2411.14483" class="external text" rel="nofollow">arXiv:2411.14483</a>.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. <a href="https://arxiv.org/abs/2403.16950" class="external text" rel="nofollow">arXiv:2403.16950</a>.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. <a href="https://arxiv.org/abs/2402.17826" class="external text" rel="nofollow">arXiv:2402.17826</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. <a href="https://arxiv.org/abs/2505.03475" class="external text" rel="nofollow">arXiv:2505.03475</a>.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. <a href="https://arxiv.org/abs/2502.10985" class="external text" rel="nofollow">arXiv:2502.10985</a>.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. <a href="https://arxiv.org/abs/2506.00178" class="external text" rel="nofollow">arXiv:2506.00178</a>.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. <a href="https://arxiv.org/abs/2411.04991" class="external text" rel="nofollow">arXiv:2411.04991</a>.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. <a href="https://arxiv.org/abs/2505.24783" class="external text" rel="nofollow">arXiv:2505.24783</a>.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. <a href="https://arxiv.org/abs/2506.11354" class="external text" rel="nofollow">arXiv:2506.11354</a>.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. <a href="https://arxiv.org/abs/2310.10386" class="external text" rel="nofollow">arXiv:2310.10386</a>.

## Примечания

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-lmsys_blog_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-lmsys_blog_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-wiki_elo_3-0) «Elo rating system». В *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-history_hit_elo_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
