Elo ranking of language models — ELO-رتبهبندی مدلها
ELO-رتبهبندی مدلهای زبانی روشی برای ارزیابی و مقایسه مدلهای زبانی بزرگ (LLM) است که بر پایه سیستم رتبهبندی الو — که در اصل برای شطرنج طراحی شده بود — استوار است. این رویکرد از مقایسههای دوتایی مدلها بر اساس ترجیحات انسانی بهره میگیرد تا رتبهبندی یکپارچهای را شکل دهد که عملکرد نسبی مدلها را منعکس میکند[1].
برخلاف benchmarkهای سنتی که شاخصهای مطلق را در وظایف مشخص اندازه میگیرند، سیستمهای ELO تواناییهای نسبی مدلها را بر اساس مقایسه مستقیم پاسخهایشان توسط ارزیابان انسانی تعیین میکنند. اصل اساسی آن است که کاربران پاسخ دو مدل ناشناس به یک پرسش یکسان را مقایسه کرده و گزینه بهتر را انتخاب میکنند. بر اساس این ترجیحات، رتبه هر مدل محاسبه میشود؛ رتبه بالاتر نشاندهنده برتری در ارزیابیهای انسانی است[2].
تاریخچه توسعه
خاستگاه سیستم ELO
سیستم رتبهبندی ELO توسط فیزیکدان مجاریالاصل آمریکایی آرپاد الو (Arpad Emrick Elo، ۱۹۰۳–۱۹۹۲) در دهه ۱۹۶۰ برای سنجش مهارت شطرنجبازان طراحی شد. الو، استاد فیزیک، این سیستم را به عنوان بهبودی بر سیستم هارکنس موجود ایجاد کرد که نقصهای قابل توجهی در دقت ارزیابی داشت[3].
- ۱۹۶۰: فدراسیون شطرنج آمریکا (USCF) سیستم الو را به طور رسمی پذیرفت.
- ۱۹۷۰: فدراسیون جهانی شطرنج (FIDE) استفاده از این سیستم را آغاز کرد[4].
انطباق برای مدلهای زبانی
بهکارگیری ELO برای ارزیابی LLM با راهاندازی پلتفرم LMSYS Chatbot Arena در ۳ مه ۲۰۲۳ آغاز شد. این پلتفرم توسط سازمان LMSYS (Large Model Systems Organization) — همکاری پژوهشگران از UC Berkeley SkyLab، UC San Diego و Carnegie Mellon University — ایجاد شد[5].
روششناسی
مبانی ریاضی
فرمول کلاسیک ELO
فرمول کلاسیک ELO برای محاسبه احتمال مورد انتظار پیروزی مدل A بر مدل B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` که در آن `R_A` و `R_B` رتبههای جاری مدلها هستند.
بهروزرسانی رتبه پس از مقایسه بر اساس فرمول زیر انجام میشود: `R'_A = R_A + K × (S_A - E_A)` که در آن `K` ضریب توسعه (K-factor)، `S_A` نتیجه واقعی (۱ برای پیروزی، ۰.۵ برای تساوی، ۰ برای شکست) و `E_A` نتیجه مورد انتظار است[4].
مدل Bradley-Terry
پلتفرمهای مدرن، از جمله LMSYS Chatbot Arena، به مدل Bradley-Terry روی آوردهاند که رویکردی از نظر آماری مستدلتر است. احتمال ترجیح مدل `i` بر مدل `j` به صورت زیر محاسبه میشود:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` که در آن `β_i` و `β_j` ضرایب (رتبههای) مدلها هستند که با روش حداکثر درستنمایی برآورد میشوند[2]. این روش پایدارتر است و همخوانی بهتری با ترجیحات انسانی نشان میدهد[6].
فرآیند ارزیابی در Chatbot Arena
- مقایسه ناشناس: کاربران با دو مدل ناشناس به صورت موازی تعامل میکنند.
- رأیگیری: پس از دریافت پاسخها، کاربران گزینه مطلوب را انتخاب میکنند.
- آشکارسازی هویت: نام مدلها تنها پس از رأیگیری نمایش داده میشود.
- بهروزرسانی رتبه: رتبهها بر اساس نتایج رأیگیری بهروزرسانی میشوند و معمولاً برای افزایش پایداری به صورت دستهای پردازش میگردند[2].
مزایا و معایب
مزایا
- سادگی و تفسیرپذیری: سیستم برای درک و پیادهسازی آسان است.
- مقیاسپذیری: امکان ارزیابی تعداد زیادی از مدلها را بدون نیاز به مقایسههای دوتایی کامل فراهم میکند.
- همخوانی با ترجیحات انسانی: رتبهبندی مستقیماً ترجیحات واقعی کاربران را منعکس میکند، نه معیارهای انتزاعی.
معایب و محدودیتها
- مشکلات پایایی: محاسبات فردی ELO میتوانند نوسان قابل توجهی نشان دهند.
- نقض تعدی: سیستم همیشه شرط A>B و B>C → A>C را برآورده نمیکند که یک محدودیت بنیادی است.
- وابستگی به حجم نمونه: برای به دست آوردن رتبهبندیهای پایدار، نمونه بزرگی (صدها و هزاران مقایسه) لازم است[6].
- سوگیری در ارزیابی: نتایج ممکن است به دلیل ترجیح کاربران به پاسخهای طولانیتر یا دارای قالببندی سبکی، و همچنین به دلیل تفاوتهای فرهنگی ارزیابان، منحرف شوند.
نتیجهگیری
ELO-رتبهبندی ابزاری مهم در اکوسیستم ارزیابی مدلهای زبانی است که روشی شهودی برای مقایسه آنها بر اساس ترجیحات انسانی فراهم میآورد. علیرغم موفقیت پلتفرمهایی مانند LMSYS Chatbot Arena، این روش محدودیتهای بنیادی از جمله مشکلات تعدی و پایایی دارد. گذار از ELO کلاسیک به مدل Bradley-Terry پیشرفت مهمی است، اما آینده ارزیابی LLM احتمالاً در ترکیب رویکردهای متعدد برای به دست آوردن تصویری جامعتر از تواناییهای مدلها نهفته است.
پیوندها
- وبسایت رسمی LMSYS Chatbot Arena
- جدول ردهبندی LMSYS Chatbot Arena
منابع
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
یادداشتها
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [۱]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [۲]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [۳]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [۴]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [۵]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [۶]