---
title: "Elo ranking of language models — تصنيف ELO للنماذج"
source: "https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC"
wiki: "systems-analysis.info/int"
article: "Elo_ranking_of_language_models_—_تصنيف_ELO_للنماذج"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 1851
wiki_created_at: 2026-09-06T22:55:00Z
wiki_modified_at: 2026-09-06T22:55:00Z
downloaded_at: 2026-09-07T22:48:11Z
---

# Elo ranking of language models — تصنيف ELO للنماذج

**تصنيف ELO لنماذج اللغة** هو طريقة لتقييم ومقارنة نماذج اللغة الكبيرة (LLM)، تعتمد على نظام تصنيف إيلو (Elo) المُكيَّف، والذي تم تطويره في الأصل للشطرنج. يستخدم هذا النهج مقارنات زوجية بين النماذج بناءً على التفضيلات البشرية لإنشاء تصنيف موحد يعكس الأداء النسبي للنماذج<sup>[\[1\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-medium_elo_intro-1)</sup>.

على عكس مقاييس الأداء (benchmarks) التقليدية التي تقيس الأداء المطلق في مهام محددة، تحدد أنظمة ELO القدرات النسبية للنماذج بناءً على المقارنات المباشرة لإجاباتها من قبل مقيِّمين بشريين. المبدأ الأساسي هو أن المستخدمين يقارنون إجابات نموذجين مجهولين على نفس الموجه ويختارون الخيار الأفضل. بناءً على هذه التفضيلات، يتم حساب تصنيف كل نموذج، حيث يشير التصنيف الأعلى إلى التفوق في التقييمات البشرية<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-lmsys_blog-2)</sup>.

## تاريخ التطوير

### أصل نظام ELO

تم تطوير نظام تصنيف ELO على يد الفيزيائي المجري الأمريكي **أرباد إيلو** (*Arpad Emrick Elo*، 1903-1992) في الستينيات من القرن الماضي لتقييم مهارات لاعبي الشطرنج. إيلو، الذي كان أستاذًا في الفيزياء، أنشأ هذا النظام كتحسين لنظام هاركنيس (Harkness system) الذي كان موجودًا آنذاك، والذي كان يعاني من عيوب كبيرة في دقة التقييمات<sup>[\[3\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-wiki_elo-3)</sup>.

- **1960**: اعتمد اتحاد الشطرنج الأمريكي (USCF) نظام إيلو رسميًا.
- **1970**: بدأ الاتحاد الدولي للشطرنج (FIDE) في استخدام النظام<sup>[\[4\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-history_hit_elo-4)</sup>.

### التكييف لنماذج اللغة

بدأ تطبيق تصنيف ELO لتقييم نماذج اللغة الكبيرة (LLM) مع إطلاق منصة **LMSYS Chatbot Arena** في 3 مايو 2023. تم إنشاء المنصة من قبل منظمة LMSYS (*Large Model Systems Organization*)، وهي تعاون بحثي بين باحثين من UC Berkeley SkyLab وUC San Diego وجامعة كارنيجي ميلون<sup>[\[5\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-originality_ai_lmsys-5)</sup>.

## المنهجية

### الأسس الرياضية

#### صيغة ELO الكلاسيكية

صيغة ELO الكلاسيكية لحساب الاحتمال المتوقع لفوز النموذج A على النموذج B هي: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` حيث `R_A` و `R_B` هما التصنيفان الحاليان للنموذجين.

يتم تحديث التصنيف بعد المقارنة باستخدام الصيغة التالية: `R'_A = R_A + K × (S_A - E_A)` حيث `K` هو معامل التطوير (K-factor)، و`S_A` هي النتيجة الفعلية (1 للفوز، 0.5 للتعادل، 0 للخسارة)، و`E_A` هي النتيجة المتوقعة<sup>[\[4\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-history_hit_elo-4)</sup>.

#### Bradley-Terry Model - نموذج برادلي-تيري

المنصات الحديثة، بما في ذلك LMSYS Chatbot Arena، انتقلت إلى استخدام نموذج برادلي-تيري، الذي يمثل نهجًا أكثر قوة من الناحية الإحصائية. يتم حساب احتمال تفضيل النموذج `i` على النموذج `j` على النحو التالي:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` حيث `β_i` و `β_j` هما معاملات (تصنيفات) النماذج، والتي يتم تقديرها باستخدام طريقة الإمكان الأعظم (maximum likelihood estimation)<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-lmsys_blog-2)</sup>. هذه الطريقة أكثر استقرارًا وتُظهر توافقًا أفضل مع التفضيلات البشرية<sup>[\[6\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-elo_uncovered_arxiv-6)</sup>.

## Evaluation Process in Chatbot Arena - عملية التقييم في Chatbot Arena

1.  **المقارنة المجهولة:** يتفاعل المستخدمون مع نموذجين مجهولين بشكل متوازٍ.
2.  **التصويت:** بعد الحصول على الإجابات، يختار المستخدمون الخيار المفضل لديهم.
3.  **الكشف عن الهوية:** لا يتم عرض أسماء النماذج إلا بعد التصويت.
4.  **تحديث التصنيف:** يتم تحديث التصنيفات بناءً على نتائج التصويت، وعادةً ما يتم ذلك من خلال معالجة دُفعية لزيادة الاستقرار<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-lmsys_blog-2)</sup>.

## المزايا والعيوب

### المزايا

- **البساطة والقابلية للتفسير:** النظام سهل الفهم والتطبيق.
- **قابلية التوسع:** يسمح بتقييم عدد كبير من النماذج دون الحاجة إلى إجراء مقارنات زوجية كاملة.
- **التوافق مع التفضيلات البشرية:** يعكس التصنيف بشكل مباشر التفضيلات الحقيقية للمستخدمين، بدلاً من المقاييس المجردة.

### العيوب والقيود

- **مشاكل الموثوقية:** قد تظهر حسابات ELO الفردية تقلبًا كبيرًا.
- **انتهاك خاصية التعدي (Transitivity):** لا يفي النظام دائمًا بشرط أن A\>B و B\>C يؤدي إلى A\>C، وهو ما يمثل قيدًا أساسيًا.
- **الاعتماد على حجم العينة:** للحصول على تصنيفات مستقرة، يتطلب الأمر عينة كبيرة (مئات وآلاف المقارنات)<sup>[\[6\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_note-elo_uncovered_arxiv-6)</sup>.
- **التحيزات في التقييم:** قد تكون النتائج متحيزة بسبب تفضيل المستخدمين للإجابات الأطول أو المنسقة بشكل أفضل، وكذلك بسبب الاختلافات الثقافية بين المقيِّمين.

## الخلاصة

يمثل تصنيف ELO أداة مهمة في منظومة تقييم نماذج اللغة، حيث يوفر طريقة بديهية لمقارنتها بناءً على التفضيلات البشرية. على الرغم من نجاح منصات مثل LMSYS Chatbot Arena، إلا أن لهذه الطريقة قيودًا جوهرية، بما في ذلك مشاكل خاصية التعدي والموثوقية. يعد الانتقال من نظام ELO الكلاسيكي إلى نموذج برادلي-تيري تحسينًا مهمًا، ولكن من المرجح أن يكمن مستقبل تقييم نماذج اللغة الكبيرة في الجمع بين أساليب متعددة للحصول على صورة أكثر شمولاً لقدرات النماذج.

## روابط خارجية

- <a href="https://chat.lmsys.org/" class="external text" rel="nofollow">الموقع الرسمي لـ LMSYS Chatbot Arena</a>
- <a href="https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard" class="external text" rel="nofollow">لوحة صدارة LMSYS Chatbot Arena</a>

## المراجع

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. <a href="https://archive.org/details/ratingofchesspla00unse" class="external text" rel="nofollow">archive.org</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. <a href="https://arxiv.org/abs/2411.14483" class="external text" rel="nofollow">arXiv:2411.14483</a>.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. <a href="https://arxiv.org/abs/2403.16950" class="external text" rel="nofollow">arXiv:2403.16950</a>.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. <a href="https://arxiv.org/abs/2402.17826" class="external text" rel="nofollow">arXiv:2402.17826</a>.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. <a href="https://arxiv.org/abs/2502.14074" class="external text" rel="nofollow">arXiv:2502.14074</a>.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. <a href="https://arxiv.org/abs/2505.03475" class="external text" rel="nofollow">arXiv:2505.03475</a>.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. <a href="https://arxiv.org/abs/2502.10985" class="external text" rel="nofollow">arXiv:2502.10985</a>.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. <a href="https://arxiv.org/abs/2506.00178" class="external text" rel="nofollow">arXiv:2506.00178</a>.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. <a href="https://arxiv.org/abs/2412.18407" class="external text" rel="nofollow">arXiv:2412.18407</a>.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. <a href="https://arxiv.org/abs/2508.11847" class="external text" rel="nofollow">arXiv:2508.11847</a>.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. <a href="https://arxiv.org/abs/2411.04991" class="external text" rel="nofollow">arXiv:2411.04991</a>.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. <a href="https://arxiv.org/abs/2505.24783" class="external text" rel="nofollow">arXiv:2505.24783</a>.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. <a href="https://arxiv.org/abs/2506.11354" class="external text" rel="nofollow">arXiv:2506.11354</a>.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. <a href="https://arxiv.org/abs/2310.10386" class="external text" rel="nofollow">arXiv:2310.10386</a>.

## ملاحظات

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-wiki_elo_3-0) «Elo rating system». В *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[٤]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[٥]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%D8%AA%D8%B5%D9%86%D9%8A%D9%81_ELO_%D9%84%D9%84%D9%86%D9%85%D8%A7%D8%B0%D8%AC#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[٦]</a></span>
