Elo ranking of language models — การจัดอันดับโมเดลด้วย ELO

From Systems analysis Wiki
Jump to navigation Jump to search

การจัดอันดับโมเดลภาษาด้วย ELO คือวิธีการประเมินและเปรียบเทียบโมเดลภาษาขนาดใหญ่ (LLM) โดยอาศัยระบบคะแนน Elo ที่ดัดแปลงมาจากต้นฉบับซึ่งพัฒนาขึ้นสำหรับหมากรุกในตอนแรก แนวทางนี้ใช้การเปรียบเทียบโมเดลแบบคู่บนพื้นฐานของความชอบของมนุษย์เพื่อสร้างการจัดอันดับเดียวที่สะท้อนประสิทธิภาพสัมพัทธ์ของโมเดล[1]

ต่างจาก benchmark แบบดั้งเดิมที่วัดค่าสัมบูรณ์บนงานเฉพาะเจาะจง ระบบ ELO จะกำหนดความสามารถสัมพัทธ์ของโมเดลโดยอิงจากการเปรียบเทียบคำตอบโดยตรงผ่านผู้ประเมินที่เป็นมนุษย์ หลักการสำคัญคือผู้ใช้จะเปรียบเทียบคำตอบของโมเดลที่ไม่เปิดเผยตัวตนสองโมเดลสำหรับคำถามเดียวกัน แล้วเลือกตัวเลือกที่ดีกว่า คะแนนของแต่ละโมเดลจะถูกคำนวณจากความชอบเหล่านี้ โดยคะแนนที่สูงกว่าบ่งชี้ถึงความเหนือกว่าในการประเมินของมนุษย์[2]

ประวัติความเป็นมา

ต้นกำเนิดของระบบ ELO

ระบบคะแนน ELO ได้รับการพัฒนาโดย อาร์แพด เอโล นักฟิสิกส์ชาวฮังการี-อเมริกัน (Arpad Emrick Elo, 1903–1992) ในช่วงทศวรรษ 1960 เพื่อใช้ประเมินทักษะของนักหมากรุก เอโล ซึ่งเป็นศาสตราจารย์ด้านฟิสิกส์ ได้สร้างระบบนี้ขึ้นเพื่อปรับปรุงระบบ Harkness ที่มีอยู่เดิมซึ่งมีข้อบกพร่องสำคัญด้านความแม่นยำในการประเมิน[3]

  • 1960: สหพันธ์หมากรุกสหรัฐอเมริกา (USCF) รับรองระบบ Elo อย่างเป็นทางการ
  • 1970: สหพันธ์หมากรุกโลก (FIDE) เริ่มนำระบบนี้มาใช้[4]

การดัดแปลงสำหรับโมเดลภาษา

การนำ ELO มาใช้ประเมิน LLM เริ่มต้นจากการเปิดตัวแพลตฟอร์ม LMSYS Chatbot Arena เมื่อวันที่ 3 พฤษภาคม 2023 แพลตฟอร์มนี้สร้างขึ้นโดยองค์กร LMSYS (Large Model Systems Organization) ซึ่งเป็นความร่วมมือของนักวิจัยจาก UC Berkeley SkyLab, UC San Diego และ Carnegie Mellon University[5]

วิธีการ

พื้นฐานทางคณิตศาสตร์

สูตร ELO แบบดั้งเดิม

สูตร ELO แบบดั้งเดิมสำหรับคำนวณความน่าจะเป็นที่คาดหวังว่าโมเดล A จะชนะโมเดล B: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` โดยที่ `R_A` และ `R_B` คือคะแนนปัจจุบันของโมเดล

การอัปเดตคะแนนหลังการเปรียบเทียบใช้สูตร: `R'_A = R_A + K × (S_A - E_A)` โดยที่ `K` คือค่าสัมประสิทธิ์การพัฒนา (K-factor), `S_A` คือผลลัพธ์จริง (1 สำหรับชนะ, 0.5 สำหรับเสมอ, 0 สำหรับแพ้) และ `E_A` คือผลลัพธ์ที่คาดหวัง[4]

Bradley-Terry Model

แพลตฟอร์มสมัยใหม่ รวมถึง LMSYS Chatbot Arena ได้เปลี่ยนไปใช้ Bradley-Terry Model ซึ่งเป็นแนวทางที่มีความน่าเชื่อถือทางสถิติมากกว่า ความน่าจะเป็นที่โมเดล `i` จะเป็นที่ชอบมากกว่าโมเดล `j` คำนวณได้ดังนี้:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` โดยที่ `β_i` และ `β_j` คือค่าสัมประสิทธิ์ (คะแนน) ของโมเดล ซึ่งประเมินด้วยวิธี maximum likelihood[2] วิธีนี้มีเสถียรภาพมากกว่าและแสดงให้เห็นความสอดคล้องกับความชอบของมนุษย์ได้ดีกว่า[6]

กระบวนการประเมินใน Chatbot Arena

  1. การเปรียบเทียบแบบไม่เปิดเผยตัวตน: ผู้ใช้โต้ตอบกับโมเดลที่ไม่ระบุชื่อสองโมเดลพร้อมกัน
  2. การลงคะแนน: หลังจากได้รับคำตอบแล้ว ผู้ใช้จะเลือกตัวเลือกที่ชอบ
  3. การเปิดเผยตัวตน: ชื่อโมเดลจะแสดงหลังจากการลงคะแนนเสร็จสิ้นเท่านั้น
  4. การอัปเดตคะแนน: คะแนนจะถูกอัปเดตตามผลการลงคะแนน โดยทั่วไปใช้การประมวลผลแบบชุดเพื่อเพิ่มเสถียรภาพ[2]

ข้อดีและข้อเสีย

ข้อดี

  • ความเรียบง่ายและการตีความได้: ระบบง่ายต่อการทำความเข้าใจและนำไปใช้งาน
  • ความสามารถในการขยายขนาด: สามารถประเมินโมเดลจำนวนมากได้โดยไม่จำเป็นต้องเปรียบเทียบแบบคู่ครบทุกคู่
  • ความสอดคล้องกับความชอบของมนุษย์: คะแนนสะท้อนความชอบจริงของผู้ใช้โดยตรง ไม่ใช่เมตริกเชิงนามธรรม

ข้อเสียและข้อจำกัด

  • ปัญหาด้านความน่าเชื่อถือ: การคำนวณ ELO รายบุคคลอาจแสดงให้เห็นความผันผวนสูง
  • การละเมิดสภาวะถ่ายทอด: ระบบไม่ได้ตอบสนองเงื่อนไข A>B และ B>C → A>C เสมอไป ซึ่งเป็นข้อจำกัดพื้นฐาน
  • การพึ่งพาขนาดตัวอย่าง: ต้องการตัวอย่างขนาดใหญ่ (หลายร้อยถึงหลายพันการเปรียบเทียบ) เพื่อให้ได้คะแนนที่มีเสถียรภาพ[6]
  • อคติในการประเมิน: ผลลัพธ์อาจเกิดความเอนเอียงเนื่องจากผู้ใช้ชอบคำตอบที่ยาวกว่าหรือมีรูปแบบที่จัดแต่ง รวมถึงความแตกต่างทางวัฒนธรรมของผู้ประเมิน

บทสรุป

การจัดอันดับด้วย ELO เป็นเครื่องมือสำคัญในระบบนิเวศของการประเมินโมเดลภาษา โดยให้วิธีการเปรียบเทียบที่เข้าใจง่ายบนพื้นฐานของความชอบของมนุษย์ แม้แพลตฟอร์มอย่าง LMSYS Chatbot Arena จะประสบความสำเร็จ แต่วิธีการนี้มีข้อจำกัดพื้นฐาน รวมถึงปัญหาด้านสภาวะถ่ายทอดและความน่าเชื่อถือ การเปลี่ยนผ่านจาก ELO แบบดั้งเดิมไปสู่ Bradley-Terry Model ถือเป็นการปรับปรุงที่สำคัญ แต่อนาคตของการประเมิน LLM น่าจะอยู่ที่การผสมผสานแนวทางหลายอย่างเข้าด้วยกันเพื่อให้ได้ภาพรวมที่สมบูรณ์ยิ่งขึ้นของความสามารถของโมเดล

ลิงก์ภายนอก

  • เว็บไซต์อย่างเป็นทางการของ LMSYS Chatbot Arena
  • ตารางอันดับ LMSYS Chatbot Arena

บรรณานุกรม

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


หมายเหตุ

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [1]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [2]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [3]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [4]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [5]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [6]