MT-Bench (benchmark) (HI)
MT-Bench (संक्षेप में अंग्रेज़ी Multi-Turn Benchmark, «बहु-चरण बेंचमार्क») — यह बड़े भाषा मॉडलों (LLM) का बहु-चरण संवाद की परिस्थितियों में मूल्यांकन करने के लिए एक मानक परीक्षण कार्य-संच (benchmark) है। यह बेंचमार्क 2023 में LMSYS के शोधकर्ताओं की टीम (Lianmin Zheng के नेतृत्व में) द्वारा चैटबॉट की गुणवत्ता की वस्तुनिष्ठ तुलना के लिए LLM-as-a-Judge («LLM न्यायाधीश की भूमिका में») पद्धति के एक भाग के रूप में प्रस्तावित किया गया था[1]।
पारंपरिक एकल-चरण परीक्षणों (जैसे MMLU) के विपरीत, MT-Bench मॉडलों की बहु-चरणीय संवाद करने, क्रमिक रूप से नए निर्देशों को ग्रहण करने और उपयोगकर्ता के निर्देशों का सटीक रूप से पालन करने की क्षमता की जाँच करता है। इसका उद्देश्य जटिल परिदृश्यों में चैटबॉट के कार्य का अधिक यथार्थवादी मूल्यांकन करना है, जो मानवीय प्राथमिकताओं और संवाद प्रणालियों की व्यावहारिक आवश्यकताओं के अनुरूप हो[2]।
निर्माण की पृष्ठभूमि
ChatGPT, GPT-4 और Vicuna जैसे संवाद-आधारित LLM मॉडलों के विकास ने पारंपरिक गुणवत्ता मेट्रिक्स और वास्तविक उपयोगकर्ता अनुभव के बीच की खाई को उजागर किया। यह पाया गया कि मानवीय निर्देशों के अनुपालन (RLHF के माध्यम से) की दृष्टि से मॉडल में सुधार हमेशा पुराने, एकल-चरण बेंचमार्क पर परिणाम नहीं सुधारता। MMLU या HELM जैसे परीक्षण अक्सर उन्नत («संरेखित») चैटबॉट और उनके आधार मॉडलों के बीच अंतर नहीं कर पाते। यह पूर्ववर्ती पद्धतियों की सीमाओं को दर्शाता है, जो बहु-चरण संवाद और खुले रूप के निर्देशों की गुणवत्ता को प्रतिबिंबित नहीं करती थीं।
MT-Bench इस समस्या के समाधान के रूप में सामने आया, जो संवाद प्रारूप में खुले प्रकार के प्रश्नों का एक संच प्रस्तुत करता है और दो पहलुओं पर केंद्रित है: 1. कई चरणों (turns) में सुसंगत वार्तालाप बनाए रखने की मॉडल की क्षमता। 2. उपयोगकर्ता के जटिल निर्देशों का सटीक पालन[1]।
बेंचमार्क की संरचना और सामग्री
MT-Bench में 80 सावधानीपूर्वक चुने गए बहु-चरण संवाद परिदृश्य हैं, जो विभिन्न प्रकार के कार्यों को समाहित करते हैं। प्रत्येक परिदृश्य में उपयोगकर्ता और मॉडल के बीच कई आदान-प्रदान की एक श्रृंखला शामिल है, जो मॉडल की संदर्भ बनाए रखने और नए निर्देशों के अनुकूल होने की क्षमता की जाँच करती है। संवादों को 8 श्रेणियों में वर्गीकृत किया गया है:
- Writing (पाठ लेखन) — रचनात्मक कौशल की जाँच (उदाहरण के लिए, ब्लॉग रचना)।
- Roleplay (भूमिका-आधारित वार्तालाप) — निर्धारित भूमिकाओं में संवाद का अनुकरण।
- Extraction (सूचना निष्कर्षण) — दिए गए संदर्भ से तथ्य निकालने की क्षमता।
- Reasoning (तार्किक विवेचन) — तार्किक चिंतन पर आधारित समस्याओं का समाधान।
- Math (गणित) — गणितीय समस्याओं का समाधान।
- Coding (प्रोग्रामिंग) — कोड लिखना या डीबग करना।
- STEM (विज्ञान एवं प्रौद्योगिकी) — प्राकृतिक विज्ञान के क्षेत्रों से प्रश्न।
- Humanities (मानविकी) — इतिहास, साहित्य, सामाजिक विज्ञान से संबंधित प्रश्न।
प्रत्येक श्रेणी में 10 संवाद कार्य हैं। कार्यों में जानबूझकर कठिन निरंतरताएँ (उदाहरण के लिए, अचानक स्पष्टीकरण-संबंधी प्रश्न) शामिल की गई हैं, ताकि मॉडल को «वास्तविक» वार्तालाप जैसी परिस्थितियों में परखा जा सके[3]।
मूल्यांकन पद्धति: LLM-as-a-Judge
MT-Bench की प्रमुख विशेषता उत्तरों के स्वचालित मूल्यांकन के लिए एक शक्तिशाली भाषा मॉडल को न्यायाधीश की भूमिका में उपयोग करना है (LLM-as-a-Judge)। मूल शोध में यह भूमिका GPT-4 मॉडल ने निभाई थी[1]।
मूल्यांकन की प्रक्रिया इस प्रकार है: 1. प्रत्येक संवाद परिदृश्य के लिए कई प्रतिभागी मॉडल उत्तर उत्पन्न करते हैं। 2. न्यायाधीश मॉडल (GPT-4) इन उत्तरों की तुलना (युगल तुलना या अंक-आधारित मूल्यांकन के रूप में) करता है और वरीयता का निर्णय देता है।
स्वचालित निर्णयन कठिन मानवीय लेबलिंग का स्थान लेता है। शोधकर्ताओं ने दिखाया कि न्यायाधीश के रूप में GPT-4 के मूल्यांकन में मानव विशेषज्ञों के परिणामों के साथ 80% से अधिक सहमति होती है, जो मनुष्यों के बीच आपसी सहमति के स्तर के बराबर है। यह पद्धति की विश्वसनीयता और मानवीय भागीदारी के बिना मूल्यांकन को विस्तारित करने की संभावना को दर्शाता है। निष्पक्षता बढ़ाने के लिए न्यायाधीश मॉडल के संभावित पूर्वाग्रहों, जैसे स्थिति-संबंधी पूर्वाग्रह (पहले उत्तर को प्राथमिकता), वाचालता (लंबे उत्तर को प्राथमिकता) और आत्म-प्रशंसा (अपनी शैली के उत्तरों के प्रति उदारता) को पहचाना और कम किया गया[1]।
परिणाम और उपयोग
MT-Bench ने आधुनिक मॉडलों की गुणवत्ता में स्पष्ट अंतर उजागर किए। तार्किक विवेचन, गणित और प्रोग्रामिंग की श्रेणियों में GPT-4 ने पिछले संस्करणों (जैसे GPT-3.5) को काफी पीछे छोड़ दिया। इसने पुष्टि की कि बड़े मॉडल संवाद के कई चरणों में संदर्भ बेहतर बनाए रखते हैं।
परिणामों के व्यावहारिक उपयोग के लिए LMSYS टीम ने एक सार्वजनिक लीडरबोर्ड लॉन्च किया, जहाँ मॉडलों को औसत MT-Bench स्कोर और Chatbot Arena के Elo रेटिंग के आधार पर क्रमबद्ध किया जाता है। यह रेटिंग नियमित रूप से अद्यतन की जाती है, जो उद्योग की प्रगति को दर्शाती है। dataset और इसे चलाने का कोड सार्वजनिक रूप से उपलब्ध कराया गया है, जिससे स्वतंत्र डेवलपर अपने मॉडलों का परीक्षण कर सकते हैं[2]।
सीमाएँ और आलोचना
सफल उपयोग के बावजूद, MT-Bench और LLM-as-a-Judge दृष्टिकोण की कुछ सीमाएँ हैं:
- न्यायाधीश की अपूर्णता। न्यायाधीश मॉडल (उदाहरण के लिए, GPT-4) सर्वशक्तिमान नहीं है: यह परीक्षित मॉडलों के उत्तरों में तथ्यात्मक त्रुटियों या मतिभ्रम (hallucinations) को हमेशा नहीं पहचान पाता।
- तर्क और गणित के मूल्यांकन में कठिनाइयाँ। LLM न्यायाधीश जटिल तर्क को पूरी तरह से नहीं समझ सकता या प्रमाण की जाँच नहीं कर सकता, जिससे मूल्यांकन में त्रुटियाँ हो सकती हैं।
- पूर्वाग्रह (Biases)। कम करने के उपायों के बावजूद, न्यायाधीश मॉडल किसी विशेष शैली या उत्तर के प्रारूप के प्रति पक्षपात बनाए रख सकता है।
ये पहलू यह दर्शाते हैं कि महत्वपूर्ण अनुप्रयोगों में मानवीय निगरानी या संयुक्त मूल्यांकन पद्धतियाँ अभी भी वांछनीय हैं।
विकास और विस्तार
MT-Bench की सफलता ने विस्तारित संस्करणों को प्रेरित किया। 2024 में MT-Bench-101 पद्धति प्रस्तावित की गई, जो संवाद में मॉडलों की क्षमताओं के और भी विस्तृत विश्लेषण पर लक्षित है। लेखकों ने कौशल की एक त्रि-स्तरीय वर्गीकरण प्रणाली बनाई और एक काफी बड़ा dataset एकत्र किया, जिसने संवाद के विभिन्न चरणों में मॉडलों के व्यवहार में सूक्ष्म अंतर उजागर करना संभव बनाया[4]।
संदर्भ
- GitHub पर MT-Bench डेटा का आधिकारिक भंडार
साहित्य
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
टिप्पणियाँ
- ↑ 1.0 1.1 1.2 1.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [१]
- ↑ 2.0 2.1 «MT-Bench (Multi-turn Benchmark)». Klu.ai Glossary. [२]
- ↑ «MT-Bench - GM-RKB». GaborMelli.com. [३]
- ↑ Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». arXiv:2402.14762, 2024. [४]