Elo ranking of language models — ভাষা মডেলের ELO র‍্যাংকিং

From Systems analysis Wiki
Jump to navigation Jump to search

ভাষা মডেলের ELO র‍্যাংকিং — এটি বড় ভাষা মডেল (LLM) মূল্যায়ন ও তুলনার একটি পদ্ধতি, যা মূলত দাবার জন্য তৈরি অভিযোজিত Elo রেটিং সিস্টেমের উপর ভিত্তি করে গড়ে উঠেছে। এই পদ্ধতিতে মানবিক পছন্দের উপর ভিত্তি করে মডেলগুলির জোড়ায় জোড়ায় তুলনা করে একটি একক রেটিং তৈরি করা হয়, যা মডেলগুলির আপেক্ষিক কর্মক্ষমতা প্রতিফলিত করে[1]

নির্দিষ্ট কাজে পরম মান পরিমাপকারী প্রচলিত benchmark-এর বিপরীতে, ELO সিস্টেম মানব মূল্যায়নকারীদের দ্বারা সরাসরি উত্তর তুলনার মাধ্যমে মডেলগুলির আপেক্ষিক সক্ষমতা নির্ধারণ করে। মূল নীতি হলো ব্যবহারকারীরা একই অনুরোধে দুটি বেনামি মডেলের উত্তর তুলনা করে সেরা বিকল্পটি বেছে নেন। এই পছন্দের ভিত্তিতে প্রতিটি মডেলের রেটিং গণনা করা হয়, যেখানে উচ্চতর রেটিং মানব মূল্যায়নে শ্রেষ্ঠত্ব নির্দেশ করে[2]

ইতিহাস

ELO সিস্টেমের উৎপত্তি

ELO রেটিং সিস্টেম হাঙ্গেরীয়-আমেরিকান পদার্থবিজ্ঞানী আরপাদ এলো (Arpad Emrick Elo, ১৯০৩–১৯৯২) ১৯৬০-এর দশকে দাবাড়ুদের দক্ষতা মূল্যায়নের জন্য তৈরি করেছিলেন। পদার্থবিজ্ঞানের অধ্যাপক এলো হার্কনেস সিস্টেমের উন্নতি হিসেবে এই সিস্টেম তৈরি করেন, কারণ হার্কনেস সিস্টেমে মূল্যায়নের নির্ভুলতায় উল্লেখযোগ্য ত্রুটি ছিল[3]

  • ১৯৬০: মার্কিন যুক্তরাষ্ট্রের দাবা ফেডারেশন (USCF) আনুষ্ঠানিকভাবে Elo সিস্টেম গ্রহণ করে।
  • ১৯৭০: বিশ্ব দাবা ফেডারেশন (FIDE) সিস্টেমটি ব্যবহার শুরু করে[4]

ভাষা মডেলের জন্য অভিযোজন

LLM মূল্যায়নে ELO প্রয়োগ শুরু হয় ২০২৩ সালের ৩ মে LMSYS Chatbot Arena প্ল্যাটফর্ম চালু হওয়ার মাধ্যমে। প্ল্যাটফর্মটি তৈরি করেছিল LMSYS (Large Model Systems Organization) — UC Berkeley SkyLab, UC San Diego এবং Carnegie Mellon University-র গবেষকদের একটি সহযোগিতামূলক সংস্থা[5]

পদ্ধতিবিদ্যা

গাণিতিক ভিত্তি

ক্লাসিক্যাল ELO সূত্র

মডেল A-এর মডেল B-এর বিরুদ্ধে প্রত্যাশিত জয়ের সম্ভাবনা গণনার জন্য ক্লাসিক্যাল ELO সূত্র: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` যেখানে `R_A` এবং `R_B` হলো মডেলগুলির বর্তমান রেটিং।

তুলনার পরে রেটিং আপডেট নিচের সূত্র অনুযায়ী হয়: `R'_A = R_A + K × (S_A - E_A)` যেখানে `K` হলো উন্নয়ন সহগ (K-ফ্যাক্টর), `S_A` হলো প্রকৃত ফলাফল (জয়ের জন্য ১, ড্রয়ের জন্য ০.৫, পরাজয়ের জন্য ০), এবং `E_A` হলো প্রত্যাশিত ফলাফল[4]

Bradley-Terry মডেল

LMSYS Chatbot Arena সহ আধুনিক প্ল্যাটফর্মগুলি Bradley-Terry মডেলে রূপান্তরিত হয়েছে, যা পরিসংখ্যানগতভাবে আরও সুপ্রতিষ্ঠিত পদ্ধতি। মডেল `i`-এর মডেল `j`-এর উপর পছন্দ পাওয়ার সম্ভাবনা গণনা করা হয় এভাবে:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` যেখানে `β_i` এবং `β_j` হলো সর্বোচ্চ সম্ভাবনা পদ্ধতিতে অনুমানকৃত মডেলগুলির সহগ (রেটিং)[2]। এই পদ্ধতি আরও স্থিতিশীল এবং মানবিক পছন্দের সাথে আরও ভালো সামঞ্জস্য দেখায়[6]

Chatbot Arena-তে মূল্যায়ন প্রক্রিয়া

  1. বেনামি তুলনা: ব্যবহারকারীরা একসাথে দুটি বেনামি মডেলের সাথে মিথস্ক্রিয়া করেন।
  2. ভোটদান: উত্তর পাওয়ার পরে ব্যবহারকারীরা পছন্দের বিকল্পটি বেছে নেন।
  3. পরিচয় প্রকাশ: ভোটদানের পরেই মডেলগুলির নাম দেখানো হয়।
  4. রেটিং আপডেট: স্থিতিশীলতা বাড়াতে সাধারণত ব্যাচ প্রক্রিয়াকরণের মাধ্যমে ভোটের ফলাফলের ভিত্তিতে রেটিং আপডেট করা হয়[2]

সুবিধা ও অসুবিধা

সুবিধাসমূহ

  • সরলতা ও বোধগম্যতা: সিস্টেমটি বোঝা ও বাস্তবায়ন করা সহজ।
  • মাপযোগ্যতা: সম্পূর্ণ জোড়ায় জোড়ায় তুলনার প্রয়োজন ছাড়াই বিপুল সংখ্যক মডেল মূল্যায়ন করা সম্ভব।
  • মানবিক পছন্দের সাথে সামঞ্জস্য: রেটিং সরাসরি বিমূর্ত মেট্রিক্সের পরিবর্তে ব্যবহারকারীদের প্রকৃত পছন্দ প্রতিফলিত করে।

অসুবিধা ও সীমাবদ্ধতা

  • নির্ভরযোগ্যতার সমস্যা: পৃথকভাবে ELO গণনা উল্লেখযোগ্য অস্থিরতা দেখাতে পারে।
  • ট্রানজিটিভিটি লঙ্ঘন: সিস্টেম সবসময় A>B এবং B>C → A>C শর্ত পূরণ করে না, যা একটি মৌলিক সীমাবদ্ধতা।
  • নমুনা আকারের উপর নির্ভরতা: স্থিতিশীল রেটিং পেতে বড় নমুনা প্রয়োজন (শত শত এবং হাজার হাজার তুলনা)[6]
  • মূল্যায়নে পক্ষপাত: ব্যবহারকারীদের দীর্ঘ বা স্টাইলিস্টিকভাবে ফরম্যাট করা উত্তরের প্রতি পছন্দ এবং মূল্যায়নকারীদের সাংস্কৃতিক পার্থক্যের কারণে ফলাফল বিকৃত হতে পারে।

উপসংহার

ELO র‍্যাংকিং ভাষা মডেল মূল্যায়নের ইকোসিস্টেমে একটি গুরুত্বপূর্ণ হাতিয়ার, যা মানবিক পছন্দের ভিত্তিতে মডেল তুলনার একটি স্বজ্ঞাত পদ্ধতি প্রদান করে। LMSYS Chatbot Arena-র মতো প্ল্যাটফর্মের সাফল্য সত্ত্বেও, পদ্ধতিটির ট্রানজিটিভিটি ও নির্ভরযোগ্যতার সমস্যাসহ মৌলিক সীমাবদ্ধতা রয়েছে। ক্লাসিক্যাল ELO থেকে Bradley-Terry মডেলে রূপান্তর একটি গুরুত্বপূর্ণ উন্নতি, তবে LLM মূল্যায়নের ভবিষ্যৎ সম্ভবত মডেলগুলির সক্ষমতার আরও সম্পূর্ণ চিত্র পেতে একাধিক পদ্ধতির সমন্বয়ের মধ্যে নিহিত।

তথ্যসূত্র

  • LMSYS Chatbot Arena-র অফিসিয়াল ওয়েবসাইট
  • LMSYS Chatbot Arena লিডারবোর্ড

সাহিত্য

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


টীকা

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [১]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [২]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [৩]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [৪]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [৫]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [৬]