Elo ranking of language models — भाषा मॉडलों की ELO-रैंकिंग

From Systems analysis Wiki
Jump to navigation Jump to search

भाषा मॉडलों की ELO-रैंकिंग — यह बड़े भाषा मॉडलों (LLM) के मूल्यांकन और तुलना की एक विधि है, जो Elo रेटिंग प्रणाली के अनुकूलित संस्करण पर आधारित है, जिसे मूल रूप से शतरंज के लिए विकसित किया गया था। यह दृष्टिकोण मानवीय प्राथमिकताओं के आधार पर मॉडलों की युगल तुलना का उपयोग करते हुए एक एकीकृत रेटिंग तैयार करता है, जो मॉडलों की सापेक्ष प्रदर्शन क्षमता को दर्शाती है[1]

पारंपरिक benchmark से भिन्न, जो विशिष्ट कार्यों पर निरपेक्ष मापदंडों को मापते हैं, ELO-प्रणालियाँ मानव मूल्यांकनकर्ताओं द्वारा उनके उत्तरों की सीधी तुलना के आधार पर मॉडलों की सापेक्ष क्षमताओं का निर्धारण करती हैं। मूल सिद्धांत यह है कि उपयोगकर्ता एक ही प्रश्न पर दो अज्ञात मॉडलों के उत्तरों की तुलना करते हैं और बेहतर विकल्प चुनते हैं। इन प्राथमिकताओं के आधार पर प्रत्येक मॉडल की रेटिंग की गणना की जाती है, जहाँ उच्च रेटिंग मानवीय मूल्यांकनों में श्रेष्ठता का संकेत देती है[2]

विकास का इतिहास

ELO प्रणाली की उत्पत्ति

ELO रेटिंग प्रणाली को हंगेरियन-अमेरिकी भौतिकशास्त्री आर्पाद एलो (Arpad Emrick Elo, 1903–1992) ने 1960 के दशक में शतरंज खिलाड़ियों की दक्षता मापने के लिए विकसित किया था। भौतिकी के प्रोफेसर एलो ने यह प्रणाली हार्कनेस प्रणाली के सुधार के रूप में बनाई, जिसमें मूल्यांकन की सटीकता में महत्वपूर्ण कमियाँ थीं[3]

  • 1960: अमेरिकी शतरंज महासंघ (USCF) ने आधिकारिक रूप से Elo प्रणाली को अपनाया।
  • 1970: विश्व शतरंज महासंघ (FIDE) ने इस प्रणाली का उपयोग शुरू किया[4]

भाषा मॉडलों के लिए अनुकूलन

LLM के मूल्यांकन के लिए ELO का उपयोग LMSYS Chatbot Arena प्लेटफ़ॉर्म के 3 मई 2023 को लॉन्च के साथ शुरू हुआ। यह प्लेटफ़ॉर्म संगठन LMSYS (Large Model Systems Organization) — UC Berkeley SkyLab, UC San Diego और Carnegie Mellon University के शोधकर्ताओं के सहयोग — द्वारा बनाया गया था[5]

पद्धति

गणितीय आधार

क्लासिक ELO सूत्र

मॉडल A के मॉडल B पर जीत की अपेक्षित संभावना की गणना के लिए क्लासिक ELO सूत्र: `P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))` जहाँ `R_A` और `R_B` — मॉडलों की वर्तमान रेटिंग हैं।

तुलना के बाद रेटिंग अद्यतन निम्न सूत्र के अनुसार होता है: `R'_A = R_A + K × (S_A - E_A)` जहाँ `K` — विकास गुणांक (K-factor), `S_A` — वास्तविक परिणाम (जीत के लिए 1, बराबरी के लिए 0.5, हार के लिए 0), और `E_A` — अपेक्षित परिणाम है[4]

Bradley-Terry मॉडल

आधुनिक प्लेटफ़ॉर्म, जिनमें LMSYS Chatbot Arena भी शामिल है, Bradley-Terry मॉडल पर स्थानांतरित हो गए हैं, जो सांख्यिकीय दृष्टि से अधिक सुदृढ़ दृष्टिकोण है। मॉडल `i` को मॉडल `j` पर प्राथमिकता देने की संभावना इस प्रकार गणना की जाती है:

`P(i > j) = e^(β_i) / (e^(β_i) + e^(β_j))` जहाँ `β_i` और `β_j` — मॉडलों के गुणांक (रेटिंग) हैं, जिनका अनुमान अधिकतम संभावना विधि द्वारा लगाया जाता है[2]। यह विधि अधिक स्थिर है और मानवीय प्राथमिकताओं के साथ बेहतर सामंजस्य दर्शाती है[6]

Chatbot Arena में मूल्यांकन प्रक्रिया

  1. अज्ञात तुलना: उपयोगकर्ता दो अज्ञात मॉडलों के साथ समानांतर में संवाद करते हैं।
  2. मतदान: उत्तर प्राप्त करने के बाद उपयोगकर्ता पसंदीदा विकल्प चुनते हैं।
  3. पहचान का खुलासा: मतदान के बाद ही मॉडलों के नाम दिखाए जाते हैं।
  4. रेटिंग अद्यतन: रेटिंग मतदान परिणामों के आधार पर अद्यतन की जाती है, आमतौर पर स्थिरता बढ़ाने के लिए बैच प्रोसेसिंग के माध्यम से[2]

लाभ और हानियाँ

लाभ

  • सरलता और व्याख्यायोग्यता: प्रणाली को समझना और लागू करना सरल है।
  • मापनीयता: पूर्ण युगल तुलना की आवश्यकता के बिना बड़ी संख्या में मॉडलों का मूल्यांकन संभव है।
  • मानवीय प्राथमिकताओं से मेल: रेटिंग सीधे उपयोगकर्ताओं की वास्तविक प्राथमिकताओं को दर्शाती है, न कि अमूर्त मापदंडों को।

हानियाँ और सीमाएँ

  • विश्वसनीयता की समस्याएँ: व्यक्तिगत ELO गणनाएँ महत्वपूर्ण अस्थिरता प्रदर्शित कर सकती हैं।
  • सकर्मकता का उल्लंघन: प्रणाली हमेशा A>B और B>C → A>C की शर्त को पूरा नहीं करती, जो एक मूलभूत सीमा है।
  • नमूना आकार पर निर्भरता: स्थिर रेटिंग प्राप्त करने के लिए बड़े नमूने (सैकड़ों और हजारों तुलनाएँ) की आवश्यकता होती है[6]
  • मूल्यांकन में पूर्वाग्रह: परिणाम इस कारण विकृत हो सकते हैं कि उपयोगकर्ता लंबे या शैलीगत रूप से स्वरूपित उत्तरों को पसंद करते हैं, साथ ही मूल्यांकनकर्ताओं के सांस्कृतिक अंतरों के कारण भी।

निष्कर्ष

ELO-रैंकिंग भाषा मॉडलों के मूल्यांकन पारिस्थितिकी तंत्र में एक महत्वपूर्ण उपकरण है, जो मानवीय प्राथमिकताओं के आधार पर उनकी तुलना का एक सहज तरीका प्रदान करता है। LMSYS Chatbot Arena जैसे प्लेटफ़ॉर्मों की सफलता के बावजूद, इस विधि में मूलभूत सीमाएँ हैं, जिनमें सकर्मकता और विश्वसनीयता की समस्याएँ शामिल हैं। क्लासिक ELO से Bradley-Terry मॉडल की ओर संक्रमण एक महत्वपूर्ण सुधार है, किंतु LLM मूल्यांकन का भविष्य संभवतः मॉडलों की क्षमताओं का अधिक संपूर्ण चित्र प्राप्त करने के लिए अनेक दृष्टिकोणों के संयोजन में निहित है।

संदर्भ

  • LMSYS Chatbot Arena की आधिकारिक वेबसाइट
  • LMSYS Chatbot Arena की लीडरबोर्ड तालिका

साहित्य

  • Elo, A. E. (1978). The Rating of Chessplayers, Past and Present. Arco Publishing. archive.org.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Daynauth, R. et al. (2025). Ranking Unraveled: Recipes for LLM Rankings in Head-to-Head AI Combat. arXiv:2411.14483.
  • Liu, Y. et al. (2024). Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators. arXiv:2403.16950.
  • Chatzi, I.; Straitouri, E.; Thejaswi, S.; Gomez‑Rodriguez, M. (2024). Prediction‑Powered Ranking of Large Language Models. arXiv:2402.17826.
  • Xu, Y.; Ruis, L.; Rocktäschel, T.; Kirk, R. (2025). Investigating Non‑Transitivity in LLM‑as‑a‑Judge. arXiv:2502.14074.
  • Liu, Z. et al. (2025). am‑ELO: A Stable Framework for Arena‑based LLM Evaluation. arXiv:2505.03475.
  • Tang, S.; Wang, Y.; Jin, C. (2025). Is Elo Rating Reliable? A Study Under Model Misspecification. arXiv:2502.10985.
  • Nair, A. et al. (2025). Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings. arXiv:2506.00178.
  • Ameli, S. et al. (2024). A Statistical Framework for Ranking LLM‑Based Chatbots. arXiv:2412.18407.
  • Huang, J. Y.; Shen, Y.; Wei, D.; Broderick, T. (2025). Dropping Just a Handful of Preferences Can Change Top LLM Rankings. arXiv:2508.11847.
  • Sun, H.; Shen, Y.; Ton, J.‑F. (2024). Rethinking Bradley‑Terry Models in Preference‑Based Reward Modeling: Foundations, Theory, and Alternatives. arXiv:2411.04991.
  • Glickman, M. E. (2025). Paired Comparison Models with Strength‑Dependent Ties and Order Effects. arXiv:2505.24783.
  • Glickman, M. E. (2025). Rating Competitors in Games with Strength‑Dependent Tie Probabilities. arXiv:2506.11354.
  • Hua, H.-F.; Dong, J.; Liu, Z. (2023). Rating of Players by Laplace Approximation and Dynamic Bradley–Terry Model. arXiv:2310.10386.


टिप्पणियाँ

  1. «Elo Rating for LLMs: A Deep Dive». Medium. [१]
  2. 2.0 2.1 2.2 «Chatbot Arena: Benchmarking LLMs in the Wild with Elo Ratings». LMSYS Org. [२]
  3. «Elo rating system». В Wikipedia, The Free Encyclopedia. [३]
  4. 4.0 4.1 «How Does the Elo Rating System Work?». History Hit. [४]
  5. «LMSYS Chatbot Arena: The Ultimate LLM Leaderboard». Originality.AI. [५]
  6. 6.0 6.1 Boubdir, N., et al. «Elo Uncovered: Robustness and Best Practices in Language Model Evaluation». arXiv:2310.09277. [६]