ELO-rangschikking van modellen
ELO-rangschikking van taalmodellen — dit is een methode voor het evalueren en vergelijken van grote taalmodellen (LLM), gebaseerd op een aangepast Elo-ratingsysteem dat oorspronkelijk werd ontwikkeld voor schaken. Deze aanpak maakt gebruik van paarsgewijze vergelijkingen van modellen op basis van menselijke voorkeuren om één enkele rangschikking te creëren die de relatieve prestaties van modellen weerspiegelt[1].
In tegenstelling tot traditionele benchmarks die absolute prestaties op specifieke taken meten, bepalen ELO-systemen de relatieve capaciteiten van modellen op basis van directe vergelijkingen van hun antwoorden door menselijke beoordelaars. Het basisprincipe is dat gebruikers de antwoorden van twee anonieme modellen op dezelfde vraag vergelijken en de beste optie kiezen. Op basis van deze voorkeuren wordt de rating van elk model berekend, waarbij een hogere rating duidt op superioriteit in menselijke beoordelingen[2].
Geschiedenis van de ontwikkeling
Oorsprong van het ELO-systeem
Het ELO-ratingsysteem werd ontwikkeld door de Hongaars-Amerikaanse natuurkundige Arpad Elo (Arpad Emrick Elo, 1903–1992) in de jaren zestig voor het beoordelen van de vaardigheid van schakers. Elo, professor in de natuurkunde, creëerde het systeem als verbetering van het bestaande Harkness-systeem, dat aanzienlijke tekortkomingen kende in de nauwkeurigheid van beoordelingen[3].
- 1960: De Amerikaanse schaakfederatie (USCF) nam het Elo-systeem officieel aan.
- 1970: De Wereldschaakfederatie (FIDE) begon het systeem te gebruiken[4].
Aanpassing voor taalmodellen
De toepassing van ELO voor de evaluatie van LLM's begon met de lancering van het platform LMSYS Chatbot Arena op 3 mei 2023. Het platform werd opgericht door de organisatie LMSYS (Large Model Systems Organization) — een samenwerking van onderzoekers van UC Berkeley SkyLab, UC San Diego en Carnegie Mellon University[5].
Methodologie
Wiskundige grondslagen
Klassieke ELO-formule
De klassieke ELO-formule voor het berekenen van de verwachte kans dat model A wint van model B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` waar `R_A` en `R_B` de huidige ratings van de modellen zijn.
De ratingupdate na een vergelijking verloopt volgens de formule: `R'_A = R_A + K × (S_A - E_A)` waar `K` de ontwikkelingscoëfficiënt (K-factor) is, `S_A` het werkelijke resultaat (1 voor een overwinning, 0,5 voor een gelijkspel, 0 voor een verlies), en `E_A` het verwachte resultaat[4].
Bradley-Terry-model
Moderne platforms, waaronder LMSYS Chatbot Arena, zijn overgestapt op het Bradley-Terry-model, dat een statistisch beter onderbouwde aanpak vertegenwoordigt. De kans dat model `i` de voorkeur krijgt boven model `j` wordt berekend als:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` waar `β_i` en `β_j` de coëfficiënten (ratings) van de modellen zijn, geschat via de methode van maximale aannemelijkheid[2]. Deze methode is stabieler en toont een betere overeenstemming met menselijke voorkeuren[6].
Evaluatieproces in Chatbot Arena
- Anonieme vergelijking: Gebruikers werken gelijktijdig met twee anonieme modellen.
- Stemming: Na het ontvangen van de antwoorden kiezen gebruikers de voorkeursoptie.
- Onthulling van de identiteit: De namen van de modellen worden pas na de stemming getoond.
- Ratingupdate: Ratings worden bijgewerkt op basis van de stemresultaten, doorgaans via batchverwerking voor meer stabiliteit[2].
Voordelen en nadelen
Voordelen
- Eenvoud en interpreteerbaarheid: Het systeem is gemakkelijk te begrijpen en te implementeren.
- Schaalbaarheid: Maakt het mogelijk om een groot aantal modellen te evalueren zonder dat volledige paarsgewijze vergelijkingen nodig zijn.
- Overeenstemming met menselijke voorkeuren: De rating weerspiegelt direct de werkelijke voorkeuren van gebruikers, in plaats van abstracte metrieken.
Nadelen en beperkingen
- Betrouwbaarheidsproblemen: Individuele ELO-berekeningen kunnen aanzienlijke volatiliteit vertonen.
- Schendingen van transitiviteit: Het systeem voldoet niet altijd aan de voorwaarde A>B en B>C → A>C, wat een fundamentele beperking is.
- Afhankelijkheid van steekproefgrootte: Voor stabiele ratings is een grote steekproef nodig (honderden tot duizenden vergelijkingen)[6].
- Vooroordelen bij beoordeling: Resultaten kunnen vertekend zijn doordat gebruikers de voorkeur geven aan langere of stilistisch opgemaakte antwoorden, evenals door culturele verschillen tussen beoordelaars.
Conclusie
ELO-rangschikking is een belangrijk instrument in het ecosysteem voor de evaluatie van taalmodellen en biedt een intuïtieve manier om ze te vergelijken op basis van menselijke voorkeuren. Ondanks het succes van platforms zoals LMSYS Chatbot Arena heeft de methode fundamentele beperkingen, waaronder problemen met transitiviteit en betrouwbaarheid. De overgang van klassiek ELO naar het Bradley-Terry-model is een belangrijke verbetering, maar de toekomst van LLM-evaluatie ligt waarschijnlijk in het combineren van meerdere benaderingen om een volledigere weergave van de mogelijkheden van modellen te verkrijgen.
Verwijzingen
- Officiële website van LMSYS Chatbot Arena
- Leaderboard van LMSYS Chatbot Arena
Literatuur
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
Noten
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [1]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]