---
title: "ELO-rangsorolás modellek"
source: "https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek"
wiki: "systems-analysis.info/int"
article: "ELO-rangsorolás_modellek"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 1793
wiki_created_at: 2026-09-06T22:54:04Z
wiki_modified_at: 2026-09-06T22:54:04Z
downloaded_at: 2026-09-07T22:47:45Z
---

# ELO-rangsorolás modellek

**A nyelvmodellek ELO-rangsorolása** egy olyan módszer a nagy nyelvi modellek (LLM) értékelésére és összehasonlítására, amely az eredetileg sakkhoz kifejlesztett Élő-féle értékelési rendszer adaptált változatán alapul. Ez a megközelítés a modellek páronkénti összehasonlítását alkalmazza az emberi preferenciák alapján, hogy egyetlen ranglistát hozzon létre, amely tükrözi a modellek relatív teljesítményét<sup>[\[1\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-medium_elo_intro-1)</sup>.

A hagyományos benchmarkokkal ellentétben, amelyek abszolút mutatókat mérnek konkrét feladatokon, az ELO-rendszerek a modellek relatív képességeit határozzák meg válaszaik közvetlen összehasonlítása alapján, amelyet emberi értékelők végeznek. Az alapelv az, hogy a felhasználók összehasonlítják két anonim modell válaszát ugyanarra a kérésre, és kiválasztják a jobbik változatot. Ezen preferenciák alapján kiszámítják az egyes modellek értékelését, ahol a magasabb értékelés az emberi megítélésben való fölényt jelzi<sup>[\[2\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-lmsys_blog-2)</sup>.

## A fejlődés története

### Az ELO-rendszer eredete

Az ELO-értékelési rendszert **Élő Árpád** (*Arpad Emrick Elo*, 1903–1992) magyar-amerikai fizikus fejlesztette ki az 1960-as években a sakkjátékosok tudásszintjének értékelésére. Élő, aki fizikaprofesszor volt, a rendszert a korábbi Harkness-rendszer továbbfejlesztéseként hozta létre, amelynek komoly hiányosságai voltak az értékelések pontosságában<sup>[\[3\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-wiki_elo-3)</sup>.

- **1960**: Az Egyesült Államok Sakk-szövetsége (USCF) hivatalosan elfogadta az Élő-rendszert.
- **1970**: A Nemzetközi Sakk-szövetség (FIDE) elkezdte alkalmazni a rendszert<sup>[\[4\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-history_hit_elo-4)</sup>.

### Adaptáció nyelvi modellekhez

Az ELO alkalmazása LLM-ek értékelésére a **LMSYS Chatbot Arena** platform 2023. május 3-i elindításával kezdődött. A platformot az LMSYS (*Large Model Systems Organization*) szervezet hozta létre — az UC Berkeley SkyLab, az UC San Diego és a Carnegie Mellon University kutatóinak együttműködéseként<sup>[\[5\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-originality_ai_lmsys-5)</sup>.

## Módszertan

### Matematikai alapok

#### Klasszikus ELO-képlet

A klasszikus ELO-képlet az A modell B modell feletti győzelmének várható valószínűségének kiszámítására: \`P(A \> B) = 1 / (1 + 10^((R_B - R_A) / 400))\` ahol \`R_A\` és \`R_B\` a modellek aktuális értékelései.

Az értékelés frissítése összehasonlítás után a következő képlettel történik: \`R'\_A = R_A + K × (S_A - E_A)\` ahol \`K\` a fejlődési együttható (K-faktor), \`S_A\` a tényleges eredmény (1 győzelem esetén, 0,5 döntetlen esetén, 0 vereség esetén), \`E_A\` pedig a várható eredmény<sup>[\[4\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-history_hit_elo-4)</sup>.

#### Bradley–Terry-modell

A modern platformok, köztük a LMSYS Chatbot Arena, áttértek a Bradley–Terry-modellre, amely statisztikailag megalapozottabb megközelítést jelent. Az \`i\` modell \`j\` modellel szembeni preferenciájának valószínűsége a következőképpen számítható:

\`P(i \> j) = e^(β_i) / (e^(β_i) + e^(β_j))\` ahol \`β_i\` és \`β_j\` a modellek együtthatói (értékelései), amelyeket a maximális valószínűség módszerével becsülnek<sup>[\[2\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-lmsys_blog-2)</sup>. Ez a módszer stabilabb, és jobb egyezést mutat az emberi preferenciákkal<sup>[\[6\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-elo_uncovered_arxiv-6)</sup>.

## Az értékelési folyamat a Chatbot Arénában

1.  **Anonim összehasonlítás:** A felhasználók párhuzamosan két anonim modellel lépnek kapcsolatba.
2.  **Szavazás:** A válaszok megérkezése után a felhasználók kiválasztják az előnyben részesített változatot.
3.  **Személyazonosság felfedése:** A modellek neve csak a szavazás után jelenik meg.
4.  **Értékelés frissítése:** Az értékelések a szavazási eredmények alapján frissülnek, általában kötegelt feldolgozással a stabilitás növelése érdekében<sup>[\[2\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-lmsys_blog-2)</sup>.

## Előnyök és hátrányok

### Előnyök

- **Egyszerűség és értelmezhetőség:** A rendszer könnyen érthető és megvalósítható.
- **Skálázhatóság:** Lehetővé teszi nagyszámú modell értékelését anélkül, hogy teljes páronkénti összehasonlításra lenne szükség.
- **Megfelelés az emberi preferenciáknak:** Az értékelés közvetlenül tükrözi a felhasználók valós preferenciáit, nem pedig elvont metrikákat.

### Hátrányok és korlátok

- **Megbízhatósági problémák:** Az egyedi ELO-számítások jelentős volatilitást mutathatnak.
- **Tranzitivitási sértések:** A rendszer nem mindig teljesíti az A\>B és B\>C → A\>C feltételt, ami alapvető korlátot jelent.
- **Mintaméretfüggőség:** A stabil értékelések eléréséhez nagy mintára van szükség (több száz vagy ezer összehasonlítás)<sup>[\[6\]](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_note-elo_uncovered_arxiv-6)</sup>.
- **Értékelési torzítások:** Az eredmények torzítottak lehetnek, mivel a felhasználók előnyben részesítik a hosszabb vagy stilisztikailag formázott válaszokat, valamint az értékelők kulturális különbségei miatt.

## Összefoglalás

Az ELO-rangsorolás fontos eszközt jelent a nyelvi modellek értékelési ökoszisztémájában, intuitív módot biztosítva azok összehasonlítására az emberi preferenciák alapján. Az olyan platformok sikerére való tekintettel, mint a LMSYS Chatbot Arena, a módszernek alapvető korlátai vannak, beleértve a tranzitivitási és megbízhatósági problémákat. A klasszikus ELO-ról a Bradley–Terry-modellre való átállás fontos fejlesztést jelent, de az LLM-ek értékelésének jövője valószínűleg abban rejlik, hogy több megközelítést kombinálnak a modellek képességeinek teljesebb képe érdekében.

## Hivatkozások

- Az LMSYS Chatbot Arena hivatalos weboldala
- Az LMSYS Chatbot Arena ranglista

## Irodalom

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. arXiv:2411.14483.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. arXiv:2502.14074.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. arXiv:2502.10985.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. arXiv:2506.00178.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. arXiv:2411.04991.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. arXiv:2505.24783.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. arXiv:2310.10386.

  

## Megjegyzések

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-wiki_elo_3-0) «Elo rating system». В *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/ELO-rangsorol%C3%A1s_modellek#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
