Elo ranking of language models — การจัดอันดับโมเดลด้วย ELO
การจัดอันดับโมเดลภาษาด้วย ELO คือวิธีการประเมินและเปรียบเทียบโมเดลภาษาขนาดใหญ่ (LLM) โดยอาศัยระบบคะแนน Elo ที่ดัดแปลงมาจากต้นฉบับซึ่งพัฒนาขึ้นสำหรับหมากรุกในตอนแรก แนวทางนี้ใช้การเปรียบเทียบโมเดลแบบคู่บนพื้นฐานของความชอบของมนุษย์เพื่อสร้างการจัดอันดับเดียวที่สะท้อนประสิทธิภาพสัมพัทธ์ของโมเดล[1]
ต่างจาก benchmark แบบดั้งเดิมที่วัดค่าสัมบูรณ์บนงานเฉพาะเจาะจง ระบบ ELO จะกำหนดความสามารถสัมพัทธ์ของโมเดลโดยอิงจากการเปรียบเทียบคำตอบโดยตรงผ่านผู้ประเมินที่เป็นมนุษย์ หลักการสำคัญคือผู้ใช้จะเปรียบเทียบคำตอบของโมเดลที่ไม่เปิดเผยตัวตนสองโมเดลสำหรับคำถามเดียวกัน แล้วเลือกตัวเลือกที่ดีกว่า คะแนนของแต่ละโมเดลจะถูกคำนวณจากความชอบเหล่านี้ โดยคะแนนที่สูงกว่าบ่งชี้ถึงความเหนือกว่าในการประเมินของมนุษย์[2]
ประวัติความเป็นมา
ต้นกำเนิดของระบบ ELO
ระบบคะแนน ELO ได้รับการพัฒนาโดย อาร์แพด เอโล นักฟิสิกส์ชาวฮังการี-อเมริกัน (Arpad Emrick Elo, 1903–1992) ในช่วงทศวรรษ 1960 เพื่อใช้ประเมินทักษะของนักหมากรุก เอโล ซึ่งเป็นศาสตราจารย์ด้านฟิสิกส์ ได้สร้างระบบนี้ขึ้นเพื่อปรับปรุงระบบ Harkness ที่มีอยู่เดิมซึ่งมีข้อบกพร่องสำคัญด้านความแม่นยำในการประเมิน[3]
- 1960: สหพันธ์หมากรุกสหรัฐอเมริกา (USCF) รับรองระบบ Elo อย่างเป็นทางการ
- 1970: สหพันธ์หมากรุกโลก (FIDE) เริ่มนำระบบนี้มาใช้[4]
การดัดแปลงสำหรับโมเดลภาษา
การนำ ELO มาใช้ประเมิน LLM เริ่มต้นจากการเปิดตัวแพลตฟอร์ม LMSYS Chatbot Arena เมื่อวันที่ 3 พฤษภาคม 2023 แพลตฟอร์มนี้สร้างขึ้นโดยองค์กร LMSYS (Large Model Systems Organization) ซึ่งเป็นความร่วมมือของนักวิจัยจาก UC Berkeley SkyLab, UC San Diego และ Carnegie Mellon University[5]
วิธีการ
พื้นฐานทางคณิตศาสตร์
สูตร ELO แบบดั้งเดิม
สูตร ELO แบบดั้งเดิมสำหรับคำนวณความน่าจะเป็นที่คาดหวังว่าโมเดล A จะชนะโมเดล B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` โดยที่ `R_A` และ `R_B` คือคะแนนปัจจุบันของโมเดล
การอัปเดตคะแนนหลังการเปรียบเทียบใช้สูตร: `R'_A = R_A + K × (S_A - E_A)` โดยที่ `K` คือค่าสัมประสิทธิ์การพัฒนา (K-factor), `S_A` คือผลลัพธ์จริง (1 สำหรับชนะ, 0.5 สำหรับเสมอ, 0 สำหรับแพ้) และ `E_A` คือผลลัพธ์ที่คาดหวัง[4]
Bradley-Terry Model
แพลตฟอร์มสมัยใหม่ รวมถึง LMSYS Chatbot Arena ได้เปลี่ยนไปใช้ Bradley-Terry Model ซึ่งเป็นแนวทางที่มีความน่าเชื่อถือทางสถิติมากกว่า ความน่าจะเป็นที่โมเดล `i` จะเป็นที่ชอบมากกว่าโมเดล `j` คำนวณได้ดังนี้:
`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` โดยที่ `β_i` และ `β_j` คือค่าสัมประสิทธิ์ (คะแนน) ของโมเดล ซึ่งประเมินด้วยวิธี maximum likelihood[2] วิธีนี้มีเสถียรภาพมากกว่าและแสดงให้เห็นความสอดคล้องกับความชอบของมนุษย์ได้ดีกว่า[6]
กระบวนการประเมินใน Chatbot Arena
- การเปรียบเทียบแบบไม่เปิดเผยตัวตน: ผู้ใช้โต้ตอบกับโมเดลที่ไม่ระบุชื่อสองโมเดลพร้อมกัน
- การลงคะแนน: หลังจากได้รับคำตอบแล้ว ผู้ใช้จะเลือกตัวเลือกที่ชอบ
- การเปิดเผยตัวตน: ชื่อโมเดลจะแสดงหลังจากการลงคะแนนเสร็จสิ้นเท่านั้น
- การอัปเดตคะแนน: คะแนนจะถูกอัปเดตตามผลการลงคะแนน โดยทั่วไปใช้การประมวลผลแบบชุดเพื่อเพิ่มเสถียรภาพ[2]
ข้อดีและข้อเสีย
ข้อดี
- ความเรียบง่ายและการตีความได้: ระบบง่ายต่อการทำความเข้าใจและนำไปใช้งาน
- ความสามารถในการขยายขนาด: สามารถประเมินโมเดลจำนวนมากได้โดยไม่จำเป็นต้องเปรียบเทียบแบบคู่ครบทุกคู่
- ความสอดคล้องกับความชอบของมนุษย์: คะแนนสะท้อนความชอบจริงของผู้ใช้โดยตรง ไม่ใช่เมตริกเชิงนามธรรม
ข้อเสียและข้อจำกัด
- ปัญหาด้านความน่าเชื่อถือ: การคำนวณ ELO รายบุคคลอาจแสดงให้เห็นความผันผวนสูง
- การละเมิดสภาวะถ่ายทอด: ระบบไม่ได้ตอบสนองเงื่อนไข A>B และ B>C → A>C เสมอไป ซึ่งเป็นข้อจำกัดพื้นฐาน
- การพึ่งพาขนาดตัวอย่าง: ต้องการตัวอย่างขนาดใหญ่ (หลายร้อยถึงหลายพันการเปรียบเทียบ) เพื่อให้ได้คะแนนที่มีเสถียรภาพ[6]
- อคติในการประเมิน: ผลลัพธ์อาจเกิดความเอนเอียงเนื่องจากผู้ใช้ชอบคำตอบที่ยาวกว่าหรือมีรูปแบบที่จัดแต่ง รวมถึงความแตกต่างทางวัฒนธรรมของผู้ประเมิน
บทสรุป
การจัดอันดับด้วย ELO เป็นเครื่องมือสำคัญในระบบนิเวศของการประเมินโมเดลภาษา โดยให้วิธีการเปรียบเทียบที่เข้าใจง่ายบนพื้นฐานของความชอบของมนุษย์ แม้แพลตฟอร์มอย่าง LMSYS Chatbot Arena จะประสบความสำเร็จ แต่วิธีการนี้มีข้อจำกัดพื้นฐาน รวมถึงปัญหาด้านสภาวะถ่ายทอดและความน่าเชื่อถือ การเปลี่ยนผ่านจาก ELO แบบดั้งเดิมไปสู่ Bradley-Terry Model ถือเป็นการปรับปรุงที่สำคัญ แต่อนาคตของการประเมิน LLM น่าจะอยู่ที่การผสมผสานแนวทางหลายอย่างเข้าด้วยกันเพื่อให้ได้ภาพรวมที่สมบูรณ์ยิ่งขึ้นของความสามารถของโมเดล
ลิงก์ภายนอก
- เว็บไซต์อย่างเป็นทางการของ LMSYS Chatbot Arena
- ตารางอันดับ LMSYS Chatbot Arena
บรรณานุกรม
- Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
- Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
- Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
- Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
- Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
- Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
- Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
- Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
- Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
- Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
- Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
- Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
- Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.
หมายเหตุ
- ↑ «Elo Rating for LLMs: A Deep Dive». Medium. [1]
- ↑ 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
- ↑ «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
- ↑ 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
- ↑ «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
- ↑ 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]