Elo ranking of language models — ELO-رتبه‌بندی مدل‌ها

From Systems analysis Wiki
Jump to navigation Jump to search

ELO-رتبه‌بندی مدل‌های زبانی روشی برای ارزیابی و مقایسه مدل‌های زبانی بزرگ (LLM) است که بر پایه سیستم رتبه‌بندی الو — که در اصل برای شطرنج طراحی شده بود — استوار است. این رویکرد از مقایسه‌های دوتایی مدل‌ها بر اساس ترجیحات انسانی بهره می‌گیرد تا رتبه‌بندی یکپارچه‌ای را شکل دهد که عملکرد نسبی مدل‌ها را منعکس می‌کند[1].

برخلاف benchmark‌های سنتی که شاخص‌های مطلق را در وظایف مشخص اندازه می‌گیرند، سیستم‌های ELO توانایی‌های نسبی مدل‌ها را بر اساس مقایسه مستقیم پاسخ‌هایشان توسط ارزیابان انسانی تعیین می‌کنند. اصل اساسی آن است که کاربران پاسخ دو مدل ناشناس به یک پرسش یکسان را مقایسه کرده و گزینه بهتر را انتخاب می‌کنند. بر اساس این ترجیحات، رتبه هر مدل محاسبه می‌شود؛ رتبه بالاتر نشان‌دهنده برتری در ارزیابی‌های انسانی است[2].

تاریخچه توسعه

خاستگاه سیستم ELO

سیستم رتبه‌بندی ELO توسط فیزیکدان مجاری‌الاصل آمریکایی آرپاد الو (Arpad Emrick Elo، ۱۹۰۳–۱۹۹۲) در دهه ۱۹۶۰ برای سنجش مهارت شطرنج‌بازان طراحی شد. الو، استاد فیزیک، این سیستم را به عنوان بهبودی بر سیستم هارکنس موجود ایجاد کرد که نقص‌های قابل توجهی در دقت ارزیابی داشت[3].

  • ۱۹۶۰: فدراسیون شطرنج آمریکا (USCF) سیستم الو را به طور رسمی پذیرفت.
  • ۱۹۷۰: فدراسیون جهانی شطرنج (FIDE) استفاده از این سیستم را آغاز کرد[4].

انطباق برای مدل‌های زبانی

به‌کارگیری ELO برای ارزیابی LLM با راه‌اندازی پلتفرم LMSYS Chatbot Arena در ۳ مه ۲۰۲۳ آغاز شد. این پلتفرم توسط سازمان LMSYS (Large Model Systems Organization) — همکاری پژوهشگران از UC Berkeley SkyLab، UC San Diego و Carnegie Mellon University — ایجاد شد[5].

روش‌شناسی

مبانی ریاضی

فرمول کلاسیک ELO

فرمول کلاسیک ELO برای محاسبه احتمال مورد انتظار پیروزی مدل A بر مدل B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` که در آن `R_A` و `R_B` رتبه‌های جاری مدل‌ها هستند.

به‌روزرسانی رتبه پس از مقایسه بر اساس فرمول زیر انجام می‌شود: `R'_A = R_A + K × (S_A - E_A)` که در آن `K` ضریب توسعه (K-factor)، `S_A` نتیجه واقعی (۱ برای پیروزی، ۰.۵ برای تساوی، ۰ برای شکست) و `E_A` نتیجه مورد انتظار است[4].

مدل Bradley-Terry

پلتفرم‌های مدرن، از جمله LMSYS Chatbot Arena، به مدل Bradley-Terry روی آورده‌اند که رویکردی از نظر آماری مستدل‌تر است. احتمال ترجیح مدل `i` بر مدل `j` به صورت زیر محاسبه می‌شود:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` که در آن `β_i` و `β_j` ضرایب (رتبه‌های) مدل‌ها هستند که با روش حداکثر درستنمایی برآورد می‌شوند[2]. این روش پایدارتر است و همخوانی بهتری با ترجیحات انسانی نشان می‌دهد[6].

فرآیند ارزیابی در Chatbot Arena

  1. مقایسه ناشناس: کاربران با دو مدل ناشناس به صورت موازی تعامل می‌کنند.
  2. رأی‌گیری: پس از دریافت پاسخ‌ها، کاربران گزینه مطلوب را انتخاب می‌کنند.
  3. آشکارسازی هویت: نام مدل‌ها تنها پس از رأی‌گیری نمایش داده می‌شود.
  4. به‌روزرسانی رتبه: رتبه‌ها بر اساس نتایج رأی‌گیری به‌روزرسانی می‌شوند و معمولاً برای افزایش پایداری به صورت دسته‌ای پردازش می‌گردند[2].

مزایا و معایب

مزایا

  • سادگی و تفسیرپذیری: سیستم برای درک و پیاده‌سازی آسان است.
  • مقیاس‌پذیری: امکان ارزیابی تعداد زیادی از مدل‌ها را بدون نیاز به مقایسه‌های دوتایی کامل فراهم می‌کند.
  • همخوانی با ترجیحات انسانی: رتبه‌بندی مستقیماً ترجیحات واقعی کاربران را منعکس می‌کند، نه معیارهای انتزاعی.

معایب و محدودیت‌ها

  • مشکلات پایایی: محاسبات فردی ELO می‌توانند نوسان قابل توجهی نشان دهند.
  • نقض تعدی: سیستم همیشه شرط A>B و B>C → A>C را برآورده نمی‌کند که یک محدودیت بنیادی است.
  • وابستگی به حجم نمونه: برای به دست آوردن رتبه‌بندی‌های پایدار، نمونه بزرگی (صدها و هزاران مقایسه) لازم است[6].
  • سوگیری در ارزیابی: نتایج ممکن است به دلیل ترجیح کاربران به پاسخ‌های طولانی‌تر یا دارای قالب‌بندی سبکی، و همچنین به دلیل تفاوت‌های فرهنگی ارزیابان، منحرف شوند.

نتیجه‌گیری

ELO-رتبه‌بندی ابزاری مهم در اکوسیستم ارزیابی مدل‌های زبانی است که روشی شهودی برای مقایسه آن‌ها بر اساس ترجیحات انسانی فراهم می‌آورد. علی‌رغم موفقیت پلتفرم‌هایی مانند LMSYS Chatbot Arena، این روش محدودیت‌های بنیادی از جمله مشکلات تعدی و پایایی دارد. گذار از ELO کلاسیک به مدل Bradley-Terry پیشرفت مهمی است، اما آینده ارزیابی LLM احتمالاً در ترکیب رویکردهای متعدد برای به دست آوردن تصویری جامع‌تر از توانایی‌های مدل‌ها نهفته است.

پیوندها

  • وب‌سایت رسمی LMSYS Chatbot Arena
  • جدول رده‌بندی LMSYS Chatbot Arena

منابع

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.

یادداشت‌ها

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [۱]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [۲]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [۳]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [۴]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [۵]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [۶]