ELO-rankowanie modeli

From Systems analysis Wiki
Jump to navigation Jump to search

ELO-rankowanie modeli językowych — to metoda oceny i porównywania dużych modeli językowych (LLM), oparta na zaadaptowanym systemie rankingów Elo, pierwotnie opracowanym dla szachów. Podejście to wykorzystuje porównania parami modeli na podstawie ludzkich preferencji w celu stworzenia jednolitego rankingu odzwierciedlającego względną wydajność modeli[1].

W odróżnieniu od tradycyjnych benchmarków mierzących bezwzględne wyniki na konkretnych zadaniach, systemy ELO określają względne zdolności modeli na podstawie bezpośrednich porównań ich odpowiedzi przez ludzkich oceniających. Główna zasada polega na tym, że użytkownicy porównują odpowiedzi dwóch anonimowych modeli na to samo zapytanie i wybierają lepszy wariant. Na podstawie tych preferencji obliczany jest ranking każdego modelu, gdzie wyższy ranking wskazuje na przewagę w ocenach ludzkich[2].

Historia rozwoju

Pochodzenie systemu ELO

System rankingów ELO został opracowany przez węgiersko-amerykańskiego fizyka Arpada Elo (Arpad Emrick Elo, 1903–1992) w latach 60. XX wieku w celu oceny umiejętności szachistów. Elo, profesor fizyki, stworzył system jako udoskonalenie istniejącego systemu Harknessa, który miał istotne wady w dokładności ocen[3].

  • 1960: Szachowa federacja USA (USCF) oficjalnie przyjęła system Elo.
  • 1970: Światowa federacja szachowa (FIDE) rozpoczęła korzystanie z systemu[4].

Adaptacja dla modeli językowych

Zastosowanie ELO do oceny LLM rozpoczęło się wraz z uruchomieniem platformy LMSYS Chatbot Arena 3 maja 2023 roku. Platforma została stworzona przez organizację LMSYS (Large Model Systems Organization) — współpracę badaczy z UC Berkeley SkyLab, UC San Diego i Carnegie Mellon University[5].

Metodologia

Podstawy matematyczne

Klasyczna formuła ELO

Klasyczna formuła ELO do obliczania oczekiwanego prawdopodobieństwa wygranej modelu A nad modelem B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` gdzie `R_A` i `R_B` — bieżące rankingi modeli.

Aktualizacja rankingu po porównaniu odbywa się według formuły: `R'_A = R_A + K × (S_A - E_A)` gdzie `K` — współczynnik rozwoju (współczynnik K), `S_A` — rzeczywisty wynik (1 za wygraną, 0.5 za remis, 0 za przegraną), a `E_A` — oczekiwany wynik[4].

Model Bradleya-Terry'ego

Współczesne platformy, w tym LMSYS Chatbot Arena, przeszły na model Bradleya-Terry'ego, który stanowi statystycznie bardziej uzasadnione podejście. Prawdopodobieństwo preferowania modelu `i` nad modelem `j` obliczane jest jako:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` gdzie `β_i` i `β_j` — współczynniki (rankingi) modeli, szacowane metodą największej wiarygodności[2]. Metoda ta jest bardziej stabilna i wykazuje lepszą zgodność z ludzkimi preferencjami[6].

Proces oceny w Chatbot Arena

  1. Anonimowe porównanie: Użytkownicy wchodzą w interakcję z dwoma anonimowymi modelami równolegle.
  2. Głosowanie: Po otrzymaniu odpowiedzi użytkownicy wybierają preferowany wariant.
  3. Ujawnienie tożsamości: Nazwy modeli są pokazywane dopiero po głosowaniu.
  4. Aktualizacja rankingu: Rankingi są aktualizowane na podstawie wyników głosowania, zazwyczaj przetwarzaniem wsadowym w celu zwiększenia stabilności[2].

Zalety i wady

Zalety

  • Prostota i interpretowalność: System jest łatwy do zrozumienia i wdrożenia.
  • Skalowalność: Pozwala oceniać dużą liczbę modeli bez konieczności przeprowadzania pełnych porównań parami.
  • Zgodność z ludzkimi preferencjami: Ranking bezpośrednio odzwierciedla rzeczywiste preferencje użytkowników, a nie abstrakcyjne metryki.

Wady i ograniczenia

  • Problemy z rzetelnością: Indywidualne obliczenia ELO mogą wykazywać znaczną zmienność.
  • Naruszenia przechodniości: System nie zawsze spełnia warunku A>B i B>C → A>C, co stanowi fundamentalne ograniczenie.
  • Zależność od wielkości próby: Uzyskanie stabilnych rankingów wymaga dużej próby (setki i tysiące porównań)[6].
  • Stronniczość w ocenie: Wyniki mogą być zaburzone przez preferencje użytkowników wobec dłuższych lub stylistycznie sformatowanych odpowiedzi, a także przez różnice kulturowe oceniających.

Podsumowanie

ELO-rankowanie stanowi ważne narzędzie w ekosystemie oceny modeli językowych, zapewniając intuicyjny sposób ich porównywania na podstawie ludzkich preferencji. Pomimo sukcesu platform takich jak LMSYS Chatbot Arena, metoda ma fundamentalne ograniczenia, w tym problemy z przechodniością i rzetelnością. Przejście od klasycznego ELO do modelu Bradleya-Terry'ego jest istotnym udoskonaleniem, jednak przyszłość oceny LLM będzie prawdopodobnie polegać na łączeniu wielu podejść w celu uzyskania pełniejszego obrazu możliwości modeli.

Odnośniki

  • Oficjalna strona LMSYS Chatbot Arena
  • Tabela liderów LMSYS Chatbot Arena

Literatura

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


Przypisy

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]