ELO-clasamentul modelelor

From Systems analysis Wiki
Jump to navigation Jump to search

ELO-clasamentul modelelor de limbaj — este o metodă de evaluare și comparare a modelelor mari de limbaj (LLM), bazată pe un sistem adaptat de ratinguri Elo, dezvoltat inițial pentru șah. Această abordare utilizează comparații perechi ale modelelor pe baza preferințelor umane pentru a crea un clasament unic care reflectă performanța relativă a modelelor[1].

Spre deosebire de benchmark-urile tradiționale, care măsoară indicatori absoluți pe sarcini specifice, sistemele ELO determină capacitățile relative ale modelelor pe baza comparațiilor directe ale răspunsurilor acestora de către evaluatori umani. Principiul de bază constă în faptul că utilizatorii compară răspunsurile a două modele anonime la aceeași solicitare și aleg varianta mai bună. Pe baza acestor preferințe se calculează ratingul fiecărui model, unde un rating mai ridicat indică superioritatea în evaluările umane[2].

Istoria dezvoltării

Originea sistemului ELO

Sistemul de ratinguri ELO a fost dezvoltat de fizicianul hungaro-american Arpad Elo (Arpad Emrick Elo, 1903–1992) în anii 1960 pentru evaluarea măiestriei jucătorilor de șah. Elo, profesor de fizică, a creat sistemul ca o îmbunătățire a sistemului Harkness existent, care prezenta deficiențe semnificative în precizia evaluărilor[3].

  • 1960: Federația de Șah a SUA (USCF) a adoptat oficial sistemul Elo.
  • 1970: Federația Mondială de Șah (FIDE) a început să utilizeze sistemul[4].

Adaptarea pentru modelele de limbaj

Aplicarea ELO pentru evaluarea LLM-urilor a început odată cu lansarea platformei LMSYS Chatbot Arena pe 3 mai 2023. Platforma a fost creată de organizația LMSYS (Large Model Systems Organization) — o colaborare a cercetătorilor din UC Berkeley SkyLab, UC San Diego și Carnegie Mellon University[5].

Metodologie

Bazele matematice

Formula clasică ELO

Formula clasică ELO pentru calcularea probabilității așteptate ca modelul A să câștige în fața modelului B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` unde `R_A` și `R_B` sunt ratingurile curente ale modelelor.

Actualizarea ratingului după comparație se realizează conform formulei: `R'_A = R_A + K × (S_A - E_A)` unde `K` este coeficientul de dezvoltare (factorul K), `S_A` este rezultatul efectiv (1 pentru victorie, 0.5 pentru egal, 0 pentru înfrângere), iar `E_A` este rezultatul așteptat[4].

Modelul Bradley-Terry

Platformele moderne, inclusiv LMSYS Chatbot Arena, au trecut la modelul Bradley-Terry, care reprezintă o abordare mai solidă din punct de vedere statistic. Probabilitatea ca modelul `i` să fie preferat față de modelul `j` se calculează astfel:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` unde `β_i` și `β_j` sunt coeficienții (ratingurile) modelelor, estimați prin metoda maximului de plauzibilitate[2]. Această metodă este mai stabilă și prezintă o mai bună concordanță cu preferințele umane[6].

Procesul de evaluare în Chatbot Arena

  1. Comparație anonimă: Utilizatorii interacționează în paralel cu două modele anonime.
  2. Votare: După primirea răspunsurilor, utilizatorii aleg varianta preferată.
  3. Dezvăluirea identității: Denumirile modelelor sunt afișate doar după votare.
  4. Actualizarea ratingului: Ratingurile sunt actualizate pe baza rezultatelor votării, de regulă prin procesare în lot pentru creșterea stabilității[2].

Avantaje și dezavantaje

Avantaje

  • Simplitate și interpretabilitate: Sistemul este ușor de înțeles și de implementat.
  • Scalabilitate: Permite evaluarea unui număr mare de modele fără necesitatea comparațiilor perechi complete.
  • Concordanța cu preferințele umane: Ratingul reflectă direct preferințele reale ale utilizatorilor, nu metrici abstracte.

Dezavantaje și limitări

  • Probleme de fiabilitate: Calculele individuale ELO pot prezenta o volatilitate semnificativă.
  • Încălcări ale tranzitivității: Sistemul nu satisface întotdeauna condiția A>B și B>C → A>C, ceea ce reprezintă o limitare fundamentală.
  • Dependența de dimensiunea eșantionului: Pentru obținerea unor ratinguri stabile este necesară o mostră mare (sute și mii de comparații)[6].
  • Părtiniri în evaluare: Rezultatele pot fi distorsionate din cauza preferinței utilizatorilor pentru răspunsuri mai lungi sau formatate stilistic, precum și din cauza diferențelor culturale ale evaluatorilor.

Concluzie

Clasamentul ELO reprezintă un instrument important în ecosistemul de evaluare a modelelor de limbaj, oferind o modalitate intuitivă de comparare a acestora pe baza preferințelor umane. În ciuda succesului platformelor precum LMSYS Chatbot Arena, metoda are limitări fundamentale, inclusiv probleme de tranzitivitate și fiabilitate. Tranziția de la ELO clasic la modelul Bradley-Terry constituie o îmbunătățire importantă, însă viitorul evaluării LLM-urilor va consta, cel mai probabil, în combinarea mai multor abordări pentru a obține o imagine mai completă a capacităților modelelor.

Referințe

  • Site-ul oficial LMSYS Chatbot Arena
  • Clasamentul LMSYS Chatbot Arena

Bibliografie

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


Note

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]