ELO Sıralaması

From Systems analysis Wiki
Jump to navigation Jump to search

Dil modellerinin ELO sıralaması — başlangıçta satranç için geliştirilen Elo derecelendirme sisteminin uyarlanmasına dayanan, büyük dil modellerini (LLM) değerlendirme ve karşılaştırma yöntemidir. Bu yaklaşım, modellerin göreli performansını yansıtan tek bir sıralama oluşturmak amacıyla insan tercihlerine dayalı ikili model karşılaştırmalarını kullanır[1].

Belirli görevlerdeki mutlak ölçümleri ölçen geleneksel benchmark'ların aksine, ELO sistemleri modellerin yanıtlarını doğrudan insan değerlendiricilerle karşılaştırarak göreceli yeteneklerini belirler. Temel ilke, kullanıcıların aynı sorguya verilen iki anonim modelin yanıtını karşılaştırması ve en iyi seçeneği seçmesidir. Bu tercihler temelinde her modelin derecelendirmesi hesaplanır; daha yüksek derece, insan değerlendirmelerinde üstünlüğe işaret eder[2].

Gelişim tarihi

ELO sisteminin kökeni

ELO derecelendirme sistemi, satranç oyuncularının ustalığını değerlendirmek amacıyla 1960'lı yıllarda Macar-Amerikalı fizikçi Arpad Elo (Arpad Emrick Elo, 1903–1992) tarafından geliştirilmiştir. Fizik profesörü olan Elo, sistemi; değerlendirme doğruluğu açısından önemli eksiklikleri bulunan mevcut Harkness sistemine bir iyileştirme olarak oluşturmuştur[3].

  • 1960: Amerika Birleşik Devletleri Satranç Federasyonu (USCF), Elo sistemini resmi olarak benimsedi.
  • 1970: Dünya Satranç Federasyonu (FIDE) sistemi kullanmaya başladı[4].

Dil modelleri için uyarlama

LLM değerlendirmesinde ELO'nun kullanımı, 3 Mayıs 2023 tarihinde LMSYS Chatbot Arena platformunun hayata geçirilmesiyle başlamıştır. Platform, UC Berkeley SkyLab, UC San Diego ve Carnegie Mellon University'den araştırmacıların iş birliğiyle oluşturulan LMSYS (Large Model Systems Organization) kuruluşu tarafından kurulmuştur[5].

Metodoloji

Matematiksel temeller

Klasik ELO formülü

A modelinin B modeli üzerinde kazanma beklenen olasılığını hesaplamak için klasik ELO formülü: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` burada `R_A` ve `R_B` modellerin mevcut derecelendirmeleridir.

Karşılaştırma sonrası derecelendirme güncellemesi şu formülle yapılır: `R'_A = R_A + K × (S_A - E_A)` burada `K` — gelişim katsayısı (K-faktörü), `S_A` — gerçek sonuç (galibiyet için 1, beraberlik için 0,5, yenilgi için 0), `E_A` ise beklenen sonuçtur[4].

Bradley-Terry modeli

LMSYS Chatbot Arena dahil modern platformlar, istatistiksel açıdan daha sağlam bir yaklaşım olan Bradley-Terry modeline geçiş yapmıştır. `i` modelinin `j` modeline tercih edilme olasılığı şöyle hesaplanır:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` burada `β_i` ve `β_j` — maksimum olabilirlik yöntemiyle tahmin edilen model katsayıları (derecelendirmeleri)[2]. Bu yöntem daha kararlıdır ve insan tercihleriyle daha iyi uyum gösterir[6].

Chatbot Arena'da değerlendirme süreci

  1. Anonim karşılaştırma: Kullanıcılar iki anonim modelle eş zamanlı olarak etkileşime girer.
  2. Oylama: Yanıtlar alındıktan sonra kullanıcılar tercih ettikleri seçeneği belirler.
  3. Kimlik açıklaması: Model adları yalnızca oylamadan sonra gösterilir.
  4. Derecelendirme güncellemesi: Derecelendirmeler, oylama sonuçlarına göre güncellenir; istikrarı artırmak amacıyla genellikle toplu işleme yapılır[2].

Avantajlar ve dezavantajlar

Avantajlar

  • Basitlik ve yorumlanabilirlik: Sistem anlaşılması ve uygulanması kolaydır.
  • Ölçeklenebilirlik: Tam ikili karşılaştırmalara gerek kalmaksızın çok sayıda modelin değerlendirilmesine olanak tanır.
  • İnsan tercihlerine uygunluk: Derecelendirme, soyut metrikler yerine kullanıcıların gerçek tercihlerini doğrudan yansıtır.

Dezavantajlar ve sınırlılıklar

  • Güvenilirlik sorunları: Bireysel ELO hesaplamaları önemli ölçüde dalgalanma gösterebilir.
  • Geçişkenlik ihlalleri: Sistem her zaman A>B ve B>C → A>C koşulunu sağlamaz; bu temel bir sınırlılıktır.
  • Örneklem büyüklüğüne bağımlılık: Kararlı derecelendirmeler elde etmek için büyük bir örneklem (yüzlerce ve binlerce karşılaştırma) gerekmektedir[6].
  • Değerlendirme önyargıları: Sonuçlar, kullanıcıların daha uzun veya stilistik açıdan biçimlendirilmiş yanıtlara olan tercihi ile değerlendiricilerin kültürel farklılıklarından kaynaklanabilecek önyargılardan etkilenebilir.

Sonuç

ELO sıralaması, dil modeli değerlendirme ekosisteminde önemli bir araç niteliği taşımakta; modellerin insan tercihlerine göre karşılaştırılması için sezgisel bir yöntem sunmaktadır. LMSYS Chatbot Arena gibi platformların başarısına karşın, yöntemin geçişkenlik ve güvenilirlik sorunları da dahil olmak üzere temel sınırlılıkları mevcuttur. Klasik ELO'dan Bradley-Terry modeline geçiş önemli bir ilerlemeyi temsil etmektedir; ancak LLM değerlendirmesinin geleceği, büyük olasılıkla modellerin yeteneklerinin daha kapsamlı bir tablosunu elde etmek için birden fazla yaklaşımın bir arada kullanılmasında yatmaktadır.

Dış bağlantılar

  • LMSYS Chatbot Arena resmi sitesi
  • LMSYS Chatbot Arena lider tablosu

Kaynakça

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.

Notlar

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]