---
title: "ELO-ранжиране на модели"
source: "https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8"
wiki: "systems-analysis.info/int"
article: "ELO-ранжиране_на_модели"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 1797
wiki_created_at: 2026-09-06T22:54:08Z
wiki_modified_at: 2026-09-06T22:54:08Z
downloaded_at: 2026-09-07T22:47:47Z
---

# ELO-ранжиране на модели

**ELO-ранжиране на езикови модели** — това е метод за оценка и сравнение на големи езикови модели (LLM), основан на адаптирана система от рейтинги на Ело, първоначално разработена за шах. Този подход използва попарни сравнения на модели въз основа на човешки предпочитания за създаване на единен рейтинг, отразяващ относителната производителност на моделите<sup>[\[1\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-medium_elo_intro-1)</sup>.

За разлика от традиционните benchmark-ове, измерващи абсолютни показатели при конкретни задачи, ELO-системите определят относителните способности на моделите въз основа на директни сравнения на техните отговори от човешки оценители. Основният принцип се състои в това, че потребителите сравняват отговорите на два анонимни модела на един и същ запрос и избират по-добрия вариант. Въз основа на тези предпочитания се изчислява рейтингът на всеки модел, като по-високият рейтинг указва превъзходство в човешките оценки<sup>[\[2\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-lmsys_blog-2)</sup>.

## История на развитието

### Произход на системата ELO

Системата от рейтинги ELO е разработена от унгарско-американския физик **Арпад Ело** (*Arpad Emrick Elo*, 1903–1992) през 60-те години на XX век за оценка на майсторството на шахматисти. Ело, професор по физика, създава системата като подобрение на съществуващата система на Харкнес, която имала съществени недостатъци по отношение на точността на оценките<sup>[\[3\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-wiki_elo-3)</sup>.

- **1960**: Шахматната федерация на САЩ (USCF) официално приема системата на Ело.
- **1970**: Световната шахматна федерация (FIDE) започва да използва системата<sup>[\[4\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-history_hit_elo-4)</sup>.

### Адаптация за езикови модели

Прилагането на ELO за оценка на LLM започва със стартирането на платформата **LMSYS Chatbot Arena** на 3 май 2023 г. Платформата е създадена от организацията LMSYS (*Large Model Systems Organization*) — колаборация на изследователи от UC Berkeley SkyLab, UC San Diego и Carnegie Mellon University<sup>[\[5\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-originality_ai_lmsys-5)</sup>.

## Методология

### Математически основи

#### Класическа формула ELO

Класическата формула ELO за изчисляване на очакваната вероятност за победа на модел А над модел В: \`P(A \> B) = 1 / (1 + 10^((R_B - R_A) / 400))\` където \`R_A\` и \`R_B\` — текущите рейтинги на моделите.

Актуализирането на рейтинга след сравнение се извършва по формулата: \`R'\_A = R_A + K × (S_A - E_A)\` където \`K\` — коефициент на развитие (К-фактор), \`S_A\` — фактическият резултат (1 за победа, 0.5 за равенство, 0 за загуба), а \`E_A\` — очакваният резултат<sup>[\[4\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-history_hit_elo-4)</sup>.

#### Модел на Bradley-Terry

Съвременните платформи, включително LMSYS Chatbot Arena, преминаха към модела на Bradley-Terry, който представлява статистически по-обоснован подход. Вероятността за предпочитане на модел \`i\` пред модел \`j\` се изчислява като:

\`P(i \> j) = e^(β_i) / (e^(β_i) + e^(β_j))\` където \`β_i\` и \`β_j\` — коефициентите (рейтингите) на моделите, оценявани по метода на максималното правдоподобие<sup>[\[2\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-lmsys_blog-2)</sup>. Този метод е по-стабилен и показва по-добро съответствие с човешките предпочитания<sup>[\[6\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-elo_uncovered_arxiv-6)</sup>.

## Процес на оценяване в Chatbot Arena

1.  **Анонимно сравнение:** Потребителите взаимодействат с два анонимни модела едновременно.
2.  **Гласуване:** След получаване на отговорите потребителите избират предпочитания вариант.
3.  **Разкриване на идентичността:** Имената на моделите се показват едва след гласуването.
4.  **Актуализиране на рейтинга:** Рейтингите се актуализират въз основа на резултатите от гласуването, обикновено чрез пакетна обработка за повишаване на стабилността<sup>[\[2\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-lmsys_blog-2)</sup>.

## Предимства и недостатъци

### Предимства

- **Простота и интерпретируемост:** Системата е лесна за разбиране и реализиране.
- **Мащабируемост:** Позволява оценяване на голям брой модели без необходимост от пълни попарни сравнения.
- **Съответствие с човешките предпочитания:** Рейтингът пряко отразява реалните предпочитания на потребителите, а не абстрактни метрики.

### Недостатъци и ограничения

- **Проблеми с надеждността:** Индивидуалните изчисления на ELO могат да демонстрират значителна волатилност.
- **Нарушения на транзитивността:** Системата не винаги удовлетворява условието A\>B и B\>C → A\>C, което представлява фундаментално ограничение.
- **Зависимост от размера на извадката:** За получаване на стабилни рейтинги се изисква голяма извадка (стотици и хиляди сравнения)<sup>[\[6\]](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_note-elo_uncovered_arxiv-6)</sup>.
- **Предубеждения при оценяването:** Резултатите могат да бъдат изкривени поради предпочитанието на потребителите към по-дълги или стилистично форматирани отговори, както и поради културни различия между оценителите.

## Заключение

ELO-ранжирането представлява важен инструмент в екосистемата за оценка на езикови модели, осигурявайки интуитивно разбираем начин за тяхното сравняване въз основа на човешки предпочитания. Въпреки успеха на платформи като LMSYS Chatbot Arena, методът има фундаментални ограничения, включително проблеми с транзитивността и надеждността. Преходът от класическото ELO към модела на Bradley-Terry представлява важно усъвършенстване, но бъдещето на оценяването на LLM вероятно ще се крие в комбинирането на множество подходи за получаване на по-пълна картина на възможностите на моделите.

## Препратки

- Официален сайт на LMSYS Chatbot Arena
- Класация на LMSYS Chatbot Arena

## Литература

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. arXiv:2411.14483.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. arXiv:2502.14074.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. arXiv:2502.10985.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. arXiv:2506.00178.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. arXiv:2411.04991.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. arXiv:2505.24783.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. arXiv:2310.10386.

  

## Бележки

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-wiki_elo_3-0) «Elo rating system». В *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/ELO-%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%B0%D0%BD%D0%B5_%D0%BD%D0%B0_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
