Elo ranking of language models — דירוג ELO של מודלי שפה
דירוג ELO של מודלי שפה — שיטה להערכה והשוואה של מודלי שפה גדולים (LLM), המבוססת על מערכת דירוגי Elo המותאמת, שפותחה במקורה לשחמט. גישה זו משתמשת בהשוואות זוגיות של מודלים על בסיס העדפות אנושיות ליצירת דירוג אחיד המשקף את הביצועים היחסיים של המודלים[1].
בניגוד לבנצ'מרקים מסורתיים המודדים ביצועים מוחלטים במשימות ספציפיות, מערכות ELO קובעות את היכולות היחסיות של המודלים על בסיס השוואות ישירות של תשובותיהם על ידי מעריכים אנושיים. העיקרון הבסיסי הוא שמשתמשים משווים את תשובות שני מודלים אנונימיים לאותה שאילתה ובוחרים את האפשרות הטובה יותר. על בסיס העדפות אלו מחושב דירוגו של כל מודל, כאשר דירוג גבוה יותר מצביע על עליונות בהערכות אנושיות[2].
תולדות ההתפתחות
מקורות מערכת ELO
מערכת דירוגי ELO פותחה על ידי הפיזיקאי ההונגרי-אמריקאי ארפד אלו (Arpad Emrick Elo, 1903–1992) בשנות ה-60 של המאה ה-20 להערכת מיומנות שחמטאים. אלו, פרופסור לפיזיקה, יצר את המערכת כשיפור למערכת הארקנס הקיימת, שסבלה מחסרונות משמעותיים בדיוק ההערכות[3].
- 1960: התאחדות השחמט האמריקאית (USCF) אימצה רשמית את מערכת אלו.
- 1970: התאחדות השחמט העולמית (FIDE) החלה להשתמש במערכת[4].
התאמה למודלי שפה
היישום של ELO להערכת LLM החל עם השקת הפלטפורמה LMSYS Chatbot Arena ב-3 במאי 2023. הפלטפורמה נוצרה על ידי ארגון LMSYS (Large Model Systems Organization) — שיתוף פעולה של חוקרים מ-UC Berkeley SkyLab, UC San Diego ו-Carnegie Mellon University[5].
מתודולוגיה
יסודות מתמטיים
נוסחת ELO הקלאסית
נוסחת ELO הקלאסית לחישוב ההסתברות הצפויה לניצחון מודל A על מודל B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` כאשר `R_A` ו-`R_B` הם הדירוגים הנוכחיים של המודלים.
עדכון הדירוג לאחר ההשוואה מתבצע לפי הנוסחה: `R'_A = R_A + K × (S_A - E_A)` כאשר `K` — מקדם הפיתוח (K-factor), `S_A` — התוצאה בפועל (1 לניצחון, 0.5 לתיקו, 0 להפסד), ו-`E_A` — התוצאה הצפויה[4].
מודל Bradley-Terry
פלטפורמות מודרניות, כולל LMSYS Chatbot Arena, עברו למודל Bradley-Terry, המהווה גישה מוצדקת יותר סטטיסטית. הסתברות ההעדפה של מודל `i` על פני מודל `j` מחושבת כ:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` כאשר `β_i` ו-`β_j` — מקדמים (דירוגים) של המודלים, המוערכים בשיטת הסבירות המרבית[2]. שיטה זו יציבה יותר ומציגה התאמה טובה יותר להעדפות אנושיות[6].
תהליך ההערכה ב-Chatbot Arena
- השוואה אנונימית: משתמשים מתקשרים עם שני מודלים אנונימיים במקביל.
- הצבעה: לאחר קבלת התשובות, משתמשים בוחרים את האפשרות המועדפת.
- חשיפת זהות: שמות המודלים מוצגים רק לאחר ההצבעה.
- עדכון דירוג: הדירוגים מתעדכנים על בסיס תוצאות ההצבעה, בדרך כלל בעיבוד אצווה לשיפור היציבות[2].
יתרונות וחסרונות
יתרונות
- פשטות ופרשנות: המערכת קלה להבנה וליישום.
- מדרגיות: מאפשרת הערכה של מספר רב של מודלים ללא צורך בהשוואות זוגיות מלאות.
- התאמה להעדפות אנושיות: הדירוג משקף ישירות את ההעדפות האמיתיות של המשתמשים, ולא מדדים מופשטים.
חסרונות ומגבלות
- בעיות אמינות: חישובי ELO בודדים עשויים להפגין תנודתיות משמעותית.
- הפרות טרנזיטיביות: המערכת אינה תמיד מקיימת את התנאי A>B וגם B>C → A>C, וזוהי מגבלה יסודית.
- תלות בגודל המדגם: לקבלת דירוגים יציבים נדרש מדגם גדול (מאות ואלפי השוואות)[6].
- הטיות בהערכה: התוצאות עשויות להיות מוטות בשל העדפת משתמשים לתשובות ארוכות יותר או מעוצבות סגנונית, וכן בשל הבדלים תרבותיים בין המעריכים.
סיכום
דירוג ELO מהווה כלי חשוב במערכת האקולוגית של הערכת מודלי שפה, ומספק דרך אינטואיטיבית להשוואתם על בסיס העדפות אנושיות. למרות ההצלחה של פלטפורמות כגון LMSYS Chatbot Arena, לשיטה יש מגבלות יסודיות, כולל בעיות טרנזיטיביות ואמינות. המעבר מ-ELO הקלאסי למודל Bradley-Terry הוא שיפור חשוב, אך עתיד הערכת ה-LLM טמון ככל הנראה בשילוב גישות מרובות לקבלת תמונה מקיפה יותר של יכולות המודלים.
קישורים
- האתר הרשמי של LMSYS Chatbot Arena
- טבלת המובילים של LMSYS Chatbot Arena
ספרות
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
הערות
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [1]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]