Elo ranking of language models (CS)
ELO-hodnocení jazykových modelů — je metoda hodnocení a porovnávání velkých jazykových modelů (LLM), založená na adaptovaném systému Elo ratingů, původně vyvinutém pro šachy. Tento přístup využívá párová srovnání modelů na základě lidských preferencí k vytvoření jednotného žebříčku odrážejícího relativní výkon modelů[1].
Na rozdíl od tradičních benchmarků měřících absolutní ukazatele na konkrétních úlohách, ELO systémy určují relativní schopnosti modelů na základě přímých srovnání jejich odpovědí lidskými hodnotiteli. Základní princip spočívá v tom, že uživatelé porovnávají odpovědi dvou anonymních modelů na stejný dotaz a vybírají lepší variantu. Na základě těchto preferencí se vypočítává hodnocení každého modelu, přičemž vyšší hodnocení signalizuje převahu v lidských hodnoceních[2].
Historie vývoje
Původ systému ELO
Systém ratingů ELO byl vyvinut maďarsko-americkým fyzikem Árpádem Eloem (Arpad Emrick Elo, 1903–1992) v 60. letech 20. století pro hodnocení dovedností šachových hráčů. Elo, profesor fyziky, vytvořil systém jako zdokonalení tehdejšího Harknessova systému, který měl podstatné nedostatky v přesnosti hodnocení[3].
- 1960: Šachová federace USA (USCF) systém Elo oficiálně přijala.
- 1970: Světová šachová federace (FIDE) začala systém používat[4].
Adaptace pro jazykové modely
Použití ELO pro hodnocení LLM začalo spuštěním platformy LMSYS Chatbot Arena dne 3. května 2023. Platforma byla vytvořena organizací LMSYS (Large Model Systems Organization) — spoluprací výzkumníků z UC Berkeley SkyLab, UC San Diego a Carnegie Mellon University[5].
Metodologie
Matematické základy
Klasický vzorec ELO
Klasický vzorec ELO pro výpočet očekávané pravděpodobnosti vítězství modelu A nad modelem B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` kde `R_A` a `R_B` jsou aktuální hodnocení modelů.
Aktualizace hodnocení po srovnání probíhá podle vzorce: `R'_A = R_A + K × (S_A - E_A)` kde `K` je koeficient rozvoje (K-faktor), `S_A` je skutečný výsledek (1 za vítězství, 0,5 za remízu, 0 za prohru) a `E_A` je očekávaný výsledek[4].
Bradley-Terry model
Moderní platformy, včetně LMSYS Chatbot Arena, přešly na Bradley-Terry model, který představuje statisticky lépe odůvodněný přístup. Pravděpodobnost preference modelu `i` nad modelem `j` se vypočítává jako:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` kde `β_i` a `β_j` jsou koeficienty (hodnocení) modelů odhadované metodou maximální věrohodnosti[2]. Tato metoda je stabilnější a vykazuje lepší shodu s lidskými preferencemi[6].
Proces hodnocení v Chatbot Arena
- Anonymní srovnání: Uživatelé pracují paralelně se dvěma anonymními modely.
- Hlasování: Po obdržení odpovědí uživatelé zvolí preferovanou variantu.
- Odhalení identity: Názvy modelů jsou zobrazeny až po hlasování.
- Aktualizace hodnocení: Hodnocení jsou aktualizována na základě výsledků hlasování, zpravidla dávkovým zpracováním pro zvýšení stability[2].
Výhody a nevýhody
Výhody
- Jednoduchost a srozumitelnost: Systém je snadno pochopitelný a implementovatelný.
- Škálovatelnost: Umožňuje hodnotit velké množství modelů bez nutnosti úplných párových srovnání.
- Soulad s lidskými preferencemi: Hodnocení přímo odráží skutečné preference uživatelů, nikoli abstraktní metriky.
Nevýhody a omezení
- Problémy se spolehlivostí: Individuální výpočty ELO mohou vykazovat značnou volatilitu.
- Porušení tranzitivity: Systém ne vždy splňuje podmínku A>B a B>C → A>C, což je zásadní omezení.
- Závislost na velikosti vzorku: Pro získání stabilního hodnocení je zapotřebí velký vzorek (stovky až tisíce srovnání)[6].
- Zaujatost v hodnocení: Výsledky mohou být zkresleny preferencí uživatelů pro delší nebo stylisticky formátované odpovědi, jakož i kulturními rozdíly hodnotitelů.
Závěr
ELO-hodnocení představuje důležitý nástroj v ekosystému hodnocení jazykových modelů a poskytuje intuitivní způsob jejich srovnávání na základě lidských preferencí. Navzdory úspěchu platforem jako LMSYS Chatbot Arena má tato metoda zásadní omezení, včetně problémů s tranzitivitou a spolehlivostí. Přechod od klasického ELO k Bradley-Terry modelu je významným zdokonalením, avšak budoucnost hodnocení LLM bude pravděpodobně spočívat v kombinování více přístupů za účelem získání komplexnějšího obrazu schopností modelů.
Odkazy
- Oficiální stránky LMSYS Chatbot Arena
- Žebříček LMSYS Chatbot Arena
Literatura
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
Poznámky
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [1]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]