MT-Bench (benchmark) (FA)
MT-Bench (مخفف انگلیسی Multi-Turn Benchmark، «بنچمارک چندمرحلهای») — مجموعهای استاندارد از وظایف آزمایشی (بنچمارک) برای ارزیابی مدلهای زبانی بزرگ (LLM) در شرایط گفتگوی چندمرحلهای است. این بنچمارک در سال ۲۰۲۳ توسط تیمی از پژوهشگران LMSYS (به رهبری لیانمین ژنگ، Lianmin Zheng) به عنوان بخشی از روش LLM-as-a-Judge («LLM در نقش داور») برای مقایسه عینی کیفیت چتباتها معرفی شد[1].
برخلاف آزمونهای تکمرحلهای سنتی (مانند MMLU)، MT-Bench توانایی مدلها را در برقراری گفتگوی چندمرحلهای، دریافت متوالی اطلاعات جدید و پیروی دقیق از دستورالعملهای کاربر میسنجد. هدف آن ارزیابی واقعبینانهتر عملکرد چتباتها در سناریوهای پیچیده است که بر انطباق با ترجیحات انسانی و الزامات عملی سیستمهای مکالمهای تمرکز دارد[2].
پیشزمینه و انگیزه پیدایش
توسعه مدلهای LLM مکالمهای، مانند ChatGPT، GPT-4 و Vicuna، شکافی را میان معیارهای کیفی سنتی و درک واقعی کاربران از پاسخها آشکار کرد. معلوم شد که بهبود مدل از نظر همسویی با دستورالعملهای انسانی (از طریق RLHF) همیشه نتایج بنچمارکهای قدیمی و تکمرحلهای را بهبود نمیبخشد. آزمونهایی مانند MMLU یا HELM اغلب نمیتوانند چتباتهای بهبودیافته («تراز شده») را از مدلهای پایهشان تمیز دهند. این امر محدودیت روشهای پیشین را نشان میدهد که کیفیت تعامل چندمرحلهای و دستورالعملهای آزاد را منعکس نمیکنند.
MT-Bench به عنوان پاسخی به این مشکل پدید آمد و مجموعهای از سؤالات باز در قالب گفتگو ارائه داد که بر دو جنبه تمرکز دارد: 1. توانایی مدل در حفظ گفتگوی پیوسته در چندین مرحله (turns). 2. پیروی دقیق از دستورالعملهای پیچیده کاربر[1].
ساختار و محتوای بنچمارک
MT-Bench از ۸۰ سناریوی گفتگویی چندمرحلهای به دقت انتخابشده تشکیل شده است که انواع مختلفی از وظایف را پوشش میدهد. هر سناریو شامل مجموعهای از چند تبادل میان کاربر و مدل است و توانایی مدل را در نگهداشتن زمینه و انطباق با اطلاعات جدید میسنجد. گفتگوها در ۸ دسته وظیفه گروهبندی شدهاند:
- Writing (نوشتن متن) — ارزیابی مهارتهای خلاقانه (مانند نوشتن مطلب وبلاگ).
- Roleplay (گفتگوی نقشآفرینی) — شبیهسازی گفتگو در نقشهای مشخص.
- Extraction (استخراج اطلاعات) — توانایی استخراج حقایق از زمینه ارائهشده.
- Reasoning (استدلال منطقی) — حل مسائل تفکر منطقی.
- Math (ریاضیات) — حل مسائل ریاضی.
- Coding (برنامهنویسی) — نوشتن یا اشکالزدایی کد.
- STEM (علوم و فناوری) — سؤالات از حوزههای علوم طبیعی.
- Humanities (علوم انسانی) — سؤالات تاریخ، ادبیات و علوم اجتماعی.
در هر دسته ۱۰ وظیفه گفتگویی وجود دارد. وظایف عمداً شامل ادامههای چالشبرانگیز (مانند سؤالات تکمیلی ناگهانی) هستند تا مدل را در شرایط گفتگوی «واقعی» بیازمایند[3].
روش ارزیابی: LLM-as-a-Judge
ویژگی کلیدی MT-Bench استفاده از یک مدل زبانی قوی در نقش داور برای ارزیابی خودکار پاسخها (LLM-as-a-Judge) است. در پژوهش اصلی، مدل GPT-4 این نقش را ایفا میکرد[1].
رویه ارزیابی به شرح زیر است: 1. برای هر سناریوی گفتگویی، چند مدل شرکتکننده پاسخ تولید میکنند. 2. مدل داور (GPT-4) این پاسخها را (در قالب مقایسه زوجی یا نمرهدهی بر اساس مقیاس امتیازی) مقایسه کرده و حکم ترجیح را صادر میکند.
داوری خودکار جایگزین برچسبگذاری دستی زمانبر میشود. پژوهشگران نشان دادند که ارزیابیهای GPT-4 به عنوان داور بیش از ۸۰٪ همخوانی با نتایج متخصصان انسانی دارد که با میزان توافق خود انسانها با یکدیگر قابل مقایسه است. این امر نشاندهنده قابلیت اطمینان روش و امکان مقیاسبخشی به ارزیابیها بدون مشارکت مستقیم انسان است. برای افزایش عینیت، سوگیریهای احتمالی مدل داور شناسایی و کاهش یافت، از جمله اثر سوگیری موقعیتی (ترجیح پاسخ اول)، پرحرفی (ترجیح پاسخ طولانیتر) و خودستایی (لطف به پاسخهایی در سبک خود)[1].
نتایج و کاربرد
MT-Bench تفاوتهای قابل توجهی را در کیفیت مدلهای مدرن آشکار کرد. در دستههای استدلال منطقی، ریاضیات و برنامهنویسی، GPT-4 به طور چشمگیری از نسخههای قبلی (مانند GPT-3.5) پیشی گرفت. این امر تأیید کرد که مدلهای بزرگتر زمینه را در چندین مرحله گفتگو بهتر حفظ میکنند.
برای استفاده عملی از نتایج، تیم LMSYS یک تابلوی امتیازات عمومی راهاندازی کرد که مدلها بر اساس میانگین امتیاز MT-Bench و رتبهبندی Elo از Chatbot Arena رتبهبندی میشوند. این رتبهبندی به طور منظم بهروزرسانی میشود و پیشرفت صنعت را منعکس میکند. خود dataset و کد اجرای آن در دسترس عموم قرار گرفته است که به توسعهدهندگان مستقل امکان آزمایش مدلهایشان را میدهد[2].
محدودیتها و انتقادات
با وجود کاربرد موفق، MT-Bench و رویکرد LLM-as-a-Judge دارای محدودیتهایی هستند:
- ناقص بودن داور. مدل داور (مانند GPT-4) همهتوان نیست: همیشه خطاهای واقعی یا توهمات در پاسخهای مدلهای آزمایششده را تشخیص نمیدهد.
- دشواری در ارزیابی منطق و ریاضیات. داور LLM ممکن است نتواند استدلال پیچیده را به طور کامل دنبال کند یا یک اثبات را بررسی نماید، که میتواند به خطا در ارزیابی منجر شود.
- سوگیریها (Biases). علیرغم اقدامات کاهشی، مدل داور ممکن است نسبت به سبک یا قالب خاصی از پاسخ تعصب داشته باشد.
این جنبهها به این معنا هستند که در کاربردهای حیاتی، نظارت انسانی یا روشهای ارزیابی ترکیبی همچنان مطلوب است.
توسعه و گسترش
موفقیت MT-Bench به پیدایش نسخههای گسترشیافته انجامید. در سال ۲۰۲۴، روش MT-Bench-101 معرفی شد که هدفش تحلیل دقیقتر تواناییهای مدلها در گفتگو بود. نویسندگان یک طبقهبندی سهسطحی از مهارتها تدوین و dataset بسیار بزرگتری گردآوری کردند که امکان شناسایی تفاوتهای ظریف در رفتار مدلها در مراحل مختلف گفتگو را فراهم آورد[4].
پیوندها
- مخزن رسمی دادههای MT-Bench در GitHub
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [۱]
- ↑ 2.0 2.1 «MT-Bench (Multi-turn Benchmark)». Klu.ai Glossary. [۲]
- ↑ «MT-Bench - GM-RKB». GaborMelli.com. [۳]
- ↑ Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». arXiv:2402.14762, 2024. [۴]