---
title: "Elo ranking of language models — การจัดอันดับโมเดลด้วย ELO"
source: "https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO"
wiki: "systems-analysis.info/int"
article: "Elo_ranking_of_language_models_—_การจัดอันดับโมเดลด้วย_ELO"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 1855
wiki_created_at: 2026-09-06T22:55:05Z
wiki_modified_at: 2026-09-06T22:55:05Z
downloaded_at: 2026-09-07T22:48:12Z
---

# Elo ranking of language models — การจัดอันดับโมเดลด้วย ELO

**การจัดอันดับโมเดลภาษาด้วย ELO** คือวิธีการประเมินและเปรียบเทียบโมเดลภาษาขนาดใหญ่ (LLM) โดยอาศัยระบบคะแนน Elo ที่ดัดแปลงมาจากต้นฉบับซึ่งพัฒนาขึ้นสำหรับหมากรุกในตอนแรก แนวทางนี้ใช้การเปรียบเทียบโมเดลแบบคู่บนพื้นฐานของความชอบของมนุษย์เพื่อสร้างการจัดอันดับเดียวที่สะท้อนประสิทธิภาพสัมพัทธ์ของโมเดล<sup>[\[1\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-medium_elo_intro-1)</sup>

ต่างจาก benchmark แบบดั้งเดิมที่วัดค่าสัมบูรณ์บนงานเฉพาะเจาะจง ระบบ ELO จะกำหนดความสามารถสัมพัทธ์ของโมเดลโดยอิงจากการเปรียบเทียบคำตอบโดยตรงผ่านผู้ประเมินที่เป็นมนุษย์ หลักการสำคัญคือผู้ใช้จะเปรียบเทียบคำตอบของโมเดลที่ไม่เปิดเผยตัวตนสองโมเดลสำหรับคำถามเดียวกัน แล้วเลือกตัวเลือกที่ดีกว่า คะแนนของแต่ละโมเดลจะถูกคำนวณจากความชอบเหล่านี้ โดยคะแนนที่สูงกว่าบ่งชี้ถึงความเหนือกว่าในการประเมินของมนุษย์<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-lmsys_blog-2)</sup>

## ประวัติความเป็นมา

### ต้นกำเนิดของระบบ ELO

ระบบคะแนน ELO ได้รับการพัฒนาโดย **อาร์แพด เอโล** นักฟิสิกส์ชาวฮังการี-อเมริกัน (*Arpad Emrick Elo*, 1903–1992) ในช่วงทศวรรษ 1960 เพื่อใช้ประเมินทักษะของนักหมากรุก เอโล ซึ่งเป็นศาสตราจารย์ด้านฟิสิกส์ ได้สร้างระบบนี้ขึ้นเพื่อปรับปรุงระบบ Harkness ที่มีอยู่เดิมซึ่งมีข้อบกพร่องสำคัญด้านความแม่นยำในการประเมิน<sup>[\[3\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-wiki_elo-3)</sup>

- **1960**: สหพันธ์หมากรุกสหรัฐอเมริกา (USCF) รับรองระบบ Elo อย่างเป็นทางการ
- **1970**: สหพันธ์หมากรุกโลก (FIDE) เริ่มนำระบบนี้มาใช้<sup>[\[4\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-history_hit_elo-4)</sup>

### การดัดแปลงสำหรับโมเดลภาษา

การนำ ELO มาใช้ประเมิน LLM เริ่มต้นจากการเปิดตัวแพลตฟอร์ม **LMSYS Chatbot Arena** เมื่อวันที่ 3 พฤษภาคม 2023 แพลตฟอร์มนี้สร้างขึ้นโดยองค์กร LMSYS (*Large Model Systems Organization*) ซึ่งเป็นความร่วมมือของนักวิจัยจาก UC Berkeley SkyLab, UC San Diego และ Carnegie Mellon University<sup>[\[5\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-originality_ai_lmsys-5)</sup>

## วิธีการ

### พื้นฐานทางคณิตศาสตร์

#### สูตร ELO แบบดั้งเดิม

สูตร ELO แบบดั้งเดิมสำหรับคำนวณความน่าจะเป็นที่คาดหวังว่าโมเดล A จะชนะโมเดล B: \`P(A \> B) = 1 / (1 + 10^((R_B - R_A) / 400))\` โดยที่ \`R_A\` และ \`R_B\` คือคะแนนปัจจุบันของโมเดล

การอัปเดตคะแนนหลังการเปรียบเทียบใช้สูตร: \`R'\_A = R_A + K × (S_A - E_A)\` โดยที่ \`K\` คือค่าสัมประสิทธิ์การพัฒนา (K-factor), \`S_A\` คือผลลัพธ์จริง (1 สำหรับชนะ, 0.5 สำหรับเสมอ, 0 สำหรับแพ้) และ \`E_A\` คือผลลัพธ์ที่คาดหวัง<sup>[\[4\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-history_hit_elo-4)</sup>

#### Bradley-Terry Model

แพลตฟอร์มสมัยใหม่ รวมถึง LMSYS Chatbot Arena ได้เปลี่ยนไปใช้ Bradley-Terry Model ซึ่งเป็นแนวทางที่มีความน่าเชื่อถือทางสถิติมากกว่า ความน่าจะเป็นที่โมเดล \`i\` จะเป็นที่ชอบมากกว่าโมเดล \`j\` คำนวณได้ดังนี้:

\`P(i \> j) = e^(β_i) / (e^(β_i) + e^(β_j))\` โดยที่ \`β_i\` และ \`β_j\` คือค่าสัมประสิทธิ์ (คะแนน) ของโมเดล ซึ่งประเมินด้วยวิธี maximum likelihood<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-lmsys_blog-2)</sup> วิธีนี้มีเสถียรภาพมากกว่าและแสดงให้เห็นความสอดคล้องกับความชอบของมนุษย์ได้ดีกว่า<sup>[\[6\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-elo_uncovered_arxiv-6)</sup>

## กระบวนการประเมินใน Chatbot Arena

1.  **การเปรียบเทียบแบบไม่เปิดเผยตัวตน:** ผู้ใช้โต้ตอบกับโมเดลที่ไม่ระบุชื่อสองโมเดลพร้อมกัน
2.  **การลงคะแนน:** หลังจากได้รับคำตอบแล้ว ผู้ใช้จะเลือกตัวเลือกที่ชอบ
3.  **การเปิดเผยตัวตน:** ชื่อโมเดลจะแสดงหลังจากการลงคะแนนเสร็จสิ้นเท่านั้น
4.  **การอัปเดตคะแนน:** คะแนนจะถูกอัปเดตตามผลการลงคะแนน โดยทั่วไปใช้การประมวลผลแบบชุดเพื่อเพิ่มเสถียรภาพ<sup>[\[2\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-lmsys_blog-2)</sup>

## ข้อดีและข้อเสีย

### ข้อดี

- **ความเรียบง่ายและการตีความได้:** ระบบง่ายต่อการทำความเข้าใจและนำไปใช้งาน
- **ความสามารถในการขยายขนาด:** สามารถประเมินโมเดลจำนวนมากได้โดยไม่จำเป็นต้องเปรียบเทียบแบบคู่ครบทุกคู่
- **ความสอดคล้องกับความชอบของมนุษย์:** คะแนนสะท้อนความชอบจริงของผู้ใช้โดยตรง ไม่ใช่เมตริกเชิงนามธรรม

### ข้อเสียและข้อจำกัด

- **ปัญหาด้านความน่าเชื่อถือ:** การคำนวณ ELO รายบุคคลอาจแสดงให้เห็นความผันผวนสูง
- **การละเมิดสภาวะถ่ายทอด:** ระบบไม่ได้ตอบสนองเงื่อนไข A\>B และ B\>C → A\>C เสมอไป ซึ่งเป็นข้อจำกัดพื้นฐาน
- **การพึ่งพาขนาดตัวอย่าง:** ต้องการตัวอย่างขนาดใหญ่ (หลายร้อยถึงหลายพันการเปรียบเทียบ) เพื่อให้ได้คะแนนที่มีเสถียรภาพ<sup>[\[6\]](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_note-elo_uncovered_arxiv-6)</sup>
- **อคติในการประเมิน:** ผลลัพธ์อาจเกิดความเอนเอียงเนื่องจากผู้ใช้ชอบคำตอบที่ยาวกว่าหรือมีรูปแบบที่จัดแต่ง รวมถึงความแตกต่างทางวัฒนธรรมของผู้ประเมิน

## บทสรุป

การจัดอันดับด้วย ELO เป็นเครื่องมือสำคัญในระบบนิเวศของการประเมินโมเดลภาษา โดยให้วิธีการเปรียบเทียบที่เข้าใจง่ายบนพื้นฐานของความชอบของมนุษย์ แม้แพลตฟอร์มอย่าง LMSYS Chatbot Arena จะประสบความสำเร็จ แต่วิธีการนี้มีข้อจำกัดพื้นฐาน รวมถึงปัญหาด้านสภาวะถ่ายทอดและความน่าเชื่อถือ การเปลี่ยนผ่านจาก ELO แบบดั้งเดิมไปสู่ Bradley-Terry Model ถือเป็นการปรับปรุงที่สำคัญ แต่อนาคตของการประเมิน LLM น่าจะอยู่ที่การผสมผสานแนวทางหลายอย่างเข้าด้วยกันเพื่อให้ได้ภาพรวมที่สมบูรณ์ยิ่งขึ้นของความสามารถของโมเดล

## ลิงก์ภายนอก

- เว็บไซต์อย่างเป็นทางการของ LMSYS Chatbot Arena
- ตารางอันดับ LMSYS Chatbot Arena

## บรรณานุกรม

- Elo, A. E. (1978). *The Rating of Chessplayers, Past and Present*. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Daynauth, R. et al. (2025). *Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat*. arXiv:2411.14483.
- Liu, Y. et al. (2024). *Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators*. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). *Prediction‑Powered Ranking of Large Language Models*. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). *Investigating Non‑Transitivity in LLM‑as‑a‑Judge*. arXiv:2502.14074.
- Liu, Z. et al. (2025). *am‑ELO: A Stable Framework for Arena‑based LLM Evaluation*. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). *Is Elo Rating Reliable? A Study Under Model Misspecification*. arXiv:2502.10985.
- Nair, A. et al. (2025). *Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings*. arXiv:2506.00178.
- Ameli, S. et al. (2024). *A Statistical Framework for Ranking LLM‑Based Chatbots*. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). *Dropping Just a Handful of Preferences Can Change Top LLM Rankings*. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). *Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives*. arXiv:2411.04991.
- Glickman, M. E. (2025). *Paired Comparison Models with Strength‑Dependent Ties and Order Effects*. arXiv:2505.24783.
- Glickman, M. E. (2025). *Rating Competitors in Games with Strength‑Dependent Tie Probabilities*. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). *Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model*. arXiv:2310.10386.

  

## หมายเหตุ

1.  <span id="cite_note-medium_elo_intro-1">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-medium_elo_intro_1-0) «Elo Rating for LLMs: A Deep Dive». *Medium*. <a href="https://medium.com/elo-rating-for-llms-a-deep-dive" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lmsys_blog-2">↑ <sup>[2.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-lmsys_blog_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-lmsys_blog_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-lmsys_blog_2-2)</sup> «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». *LMSYS Org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wiki_elo-3">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-wiki_elo_3-0) «Elo rating system». В *Wikipedia, The Free Encyclopedia*. <a href="https://en.wikipedia.org/wiki/Elo_rating_system" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-history_hit_elo-4">↑ <sup>[4.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-history_hit_elo_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-history_hit_elo_4-1)</sup> «How Does the Elo Rating System Work?». *History Hit*. <a href="https://www.historyhit.com/how-does-the-elo-rating-system-work/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-originality_ai_lmsys-5">[↑](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-originality_ai_lmsys_5-0) «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». *Originality.AI*. <a href="https://originality.ai/blog/lmsys-chatbot-arena" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-elo_uncovered_arxiv-6">↑ <sup>[6.0](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-elo_uncovered_arxiv_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Elo_ranking_of_language_models_%E2%80%94_%E0%B8%81%E0%B8%B2%E0%B8%A3%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5%E0%B8%94%E0%B9%89%E0%B8%A7%E0%B8%A2_ELO#cite_ref-elo_uncovered_arxiv_6-1)</sup> Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». *arXiv:2310.09277*. <a href="https://arxiv.org/abs/2310.09277" class="external autonumber" rel="nofollow">[6]</a></span>
