MT-Bench (benchmark) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

MT-Bench (مختصر انگریزی Multi-Turn Benchmark، «کثیر مرحلہ بینچ مارک») — یہ بڑے لسانی ماڈلز (LLM) کی کثیر مرحلہ مکالمے کی صورت میں جانچ کے لیے ایک معیاری تشخیصی مجموعہ (benchmark) ہے۔ یہ benchmark سن 2023 میں LMSYS کے محققین کی ٹیم (جن کی قیادت لیان مِن ژنگ، Lianmin Zheng کر رہے تھے) نے LLM-as-a-Judge («LLM بطور منصف») کے طریقے کے حصے کے طور پر چیٹ بوٹس کے معیار کے معروضی موازنے کے لیے پیش کیا[1]۔

روایتی یک مرحلہ تجربات (جیسے MMLU) کے برعکس، MT-Bench ماڈلز کی کثیر مرحلہ مکالمہ برقرار رکھنے، یکے بعد دیگرے نئی معلومات کو سمجھنے اور صارف کی ہدایات پر دقیق عمل کرنے کی صلاحیت کو جانچتا ہے۔ اس کا مقصد پیچیدہ منظرناموں میں چیٹ بوٹس کی انسانی ترجیحات اور گفتگوئی نظاموں کی عملی ضروریات کے مطابق زیادہ حقیقت پسندانہ تشخیص ہے[2]۔

تخلیق کے محرکات

گفتگوئی LLM ماڈلز، جیسے ChatGPT، GPT-4 اور Vicuna، کی ترقی نے روایتی معیاری پیمانوں اور حقیقی صارفین کے تجربے کے درمیان خلاء کو واضح کیا۔ یہ بات سامنے آئی کہ انسانی ہدایات کے ساتھ ہم آہنگی (RLHF کے ذریعے) کے لحاظ سے ماڈل کی بہتری ہمیشہ پرانے، یک مرحلہ benchmarks پر نتائج میں اضافہ نہیں کرتی۔ MMLU یا HELM جیسے تجربات اکثر بہتر («ہم آہنگ») چیٹ بوٹس اور ان کے بنیادی ماڈلز میں فرق نہیں کر پاتے۔ یہ پرانے طریقوں کی محدودیت کی نشاندہی کرتا ہے، جو کثیر مرحلہ تعامل اور کھلی شکل کی ہدایات کے معیار کی عکاسی نہیں کرتے۔

MT-Bench اس مسئلے کے جواب کے طور پر سامنے آیا، جو مکالماتی شکل میں کھلے سوالات کا مجموعہ پیش کرتا ہے اور دو پہلوؤں پر توجہ مرکوز کرتا ہے: 1. کئی مراحل (turns) میں مسلسل گفتگو برقرار رکھنے کی ماڈل کی صلاحیت۔ 2. صارف کی پیچیدہ ہدایات پر دقیق عمل[1]۔

benchmark کی ساخت اور مواد

MT-Bench 80 احتیاط سے منتخب کثیر مرحلہ مکالماتی منظرناموں پر مشتمل ہے جو مختلف قسم کے کاموں کا احاطہ کرتے ہیں۔ ہر منظرنامے میں صارف اور ماڈل کے درمیان کئی تبادلوں کا سلسلہ شامل ہے، جو ماڈل کی سیاق و سباق برقرار رکھنے اور نئی معلومات کے ساتھ ڈھلنے کی صلاحیت کو جانچتا ہے۔ مکالمات کو 8 زمروں میں تقسیم کیا گیا ہے:

  • Writing (متن نویسی) — تخلیقی مہارتوں کی جانچ (مثلاً بلاگ لکھنا)۔
  • Roleplay (کردار نبھانا) — مخصوص کرداروں میں مکالموں کی نقل۔
  • Extraction (معلومات کا اخذ) — فراہم کردہ سیاق و سباق سے حقائق نکالنے کی صلاحیت۔
  • Reasoning (منطقی استدلال) — منطقی سوچ کے مسائل کا حل۔
  • Math (ریاضی) — ریاضیاتی مسائل کا حل۔
  • Coding (پروگرامنگ) — کوڈ لکھنا یا اس میں خامیاں دور کرنا۔
  • STEM (سائنس اور ٹیکنالوجی) — قدرتی علوم کے شعبوں سے سوالات۔
  • Humanities (انسانی علوم) — تاریخ، ادب اور سماجی علوم سے سوالات۔

ہر زمرے میں 10 مکالماتی کام شامل ہیں۔ کاموں میں جان بوجھ کر پیچیدہ تسلسل (مثلاً اچانک واضح کرنے والے سوالات) شامل کیے گئے ہیں تاکہ ماڈل کو قدرے «حقیقی» گفتگو میں آزمایا جا سکے[3]۔

تشخیص کا طریقہ: LLM-as-a-Judge

MT-Bench کی بنیادی خصوصیت جوابات کی خودکار تشخیص کے لیے ایک طاقتور لسانی ماڈل کو منصف کے طور پر استعمال کرنا ہے (LLM-as-a-Judge)۔ اصل تحقیق میں اس کردار میں GPT-4 ماڈل استعمال کیا گیا[1]۔

تشخیص کا طریقہ کار اس طرح ہے: 1. ہر مکالماتی منظرنامے کے لیے متعدد شریک ماڈلز جوابات تیار کرتے ہیں۔ 2. منصف ماڈل (GPT-4) ان جوابات کا موازنہ کرتا ہے (جوڑی کے موازنے یا نمبری پیمانے پر جانچ کی شکل میں) اور ترجیح کا فیصلہ دیتا ہے۔

خودکار فیصلہ سازی محنت طلب دستی درجہ بندی کی جگہ لیتی ہے۔ محققین نے ثابت کیا کہ منصف کے طور پر GPT-4 کی جانچ ماہر انسانوں کے نتائج سے 80 فیصد سے زیادہ مطابقت رکھتی ہے، جو خود انسانوں کے درمیان اتفاق رائے کے برابر ہے۔ یہ طریقے کی قابل اعتمادی اور انسانی براہ راست شرکت کے بغیر جانچ کو وسعت دینے کے امکان کی نشاندہی کرتا ہے۔ معروضیت بڑھانے کے لیے منصف ماڈل کے ممکنہ تعصبات، جیسے پوزیشنی تعصب (پہلے جواب کو ترجیح)، کثرت الفاظ (لمبے جواب کو ترجیح) اور خود ستائی (اپنے انداز کے جوابات سے نرمی) کو مدنظر رکھا گیا اور ان کو کم کرنے کی کوشش کی گئی[1]۔

نتائج اور استعمال

MT-Bench نے جدید ماڈلز کے معیار میں نمایاں فرق ظاہر کیا۔ منطقی استدلال، ریاضی اور coding کے زمروں میں GPT-4 نے پچھلے ورژنز (مثلاً GPT-3.5) کو نمایاں طور پر پیچھے چھوڑ دیا۔ اس سے تصدیق ہوئی کہ بڑے ماڈلز کئی مراحل کے مکالمے میں سیاق و سباق بہتر برقرار رکھتے ہیں۔

نتائج کے عملی استعمال کے لیے LMSYS ٹیم نے ایک عوامی لیڈربورڈ شروع کیا، جہاں ماڈلز کو اوسط MT-Bench سکور اور Chatbot Arena کی Elo رینکنگ کے مطابق ترتیب دیا جاتا ہے۔ یہ درجہ بندی باقاعدگی سے تازہ کی جاتی ہے اور صنعت میں پیشرفت کی عکاسی کرتی ہے۔ dataset اور اسے چلانے کا کوڈ کھلی رسائی میں فراہم کیا گیا، جس سے آزاد ڈویلپرز اپنے ماڈلز کی جانچ کر سکتے ہیں[2]۔

حدود اور تنقید

کامیاب استعمال کے باوجود MT-Bench اور LLM-as-a-Judge کے نقطہ نظر میں کچھ حدود ہیں:

  • منصف کی ناکاملیت۔ منصف ماڈل (مثلاً GPT-4) سب کچھ جاننے والا نہیں: وہ ہمیشہ تجربہ کیے جانے والے ماڈلز کے جوابات میں حقیقی غلطیاں یا hallucinations نہیں پہچان پاتا۔
  • منطق اور ریاضی کی جانچ میں مشکلات۔ LLM منصف پیچیدہ استدلال کو مکمل طور پر نہیں سمجھ سکتا یا ثبوت کی تصدیق نہیں کر سکتا، جس سے جانچ میں غلطیوں کا خطرہ ہے۔
  • Biases (تعصبات)۔ ان کو کم کرنے کی کوششوں کے باوجود منصف ماڈل کسی مخصوص انداز یا جواب کی شکل کے لیے تعصب برقرار رکھ سکتا ہے۔

یہ پہلو اس بات کی نشاندہی کرتے ہیں کہ نازک اہمیت کی حامل استعمالات میں انسانی نگرانی یا مشترکہ تشخیصی طریقے ابھی بھی مطلوب ہیں۔

ترقی اور توسیعات

MT-Bench کی کامیابی نے توسیع شدہ ورژنز کی راہ ہموار کی۔ 2024 میں MT-Bench-101 کا طریقہ پیش کیا گیا، جو مکالمے میں ماڈلز کی صلاحیتوں کے اور بھی تفصیلی تجزیے پر مرکوز ہے۔ مصنفین نے مہارتوں کی تین سطحی درجہ بندی تشکیل دی اور کافی بڑا dataset جمع کیا، جس سے مکالمے کے مختلف مراحل پر ماڈلز کے رویے میں باریک فرق واضح ہوئے[4]۔

روابط

  • GitHub پر MT-Bench ڈیٹا کا سرکاری ذخیرہ

کتابیات

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.


حواشی

  1. 1.0 1.1 1.2 1.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [1]
  2. 2.0 2.1 «MT-Bench (Multi-turn Benchmark)». Klu.ai Glossary. [2]
  3. «MT-Bench - GM-RKB». GaborMelli.com. [3]
  4. Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». arXiv:2402.14762, 2024. [4]