MT-Bench (benchmark) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

MT-Bench (مخفف انگلیسی Multi-Turn Benchmark، «بنچمارک چندمرحله‌ای») — مجموعه‌ای استاندارد از وظایف آزمایشی (بنچمارک) برای ارزیابی مدل‌های زبانی بزرگ (LLM) در شرایط گفتگوی چندمرحله‌ای است. این بنچمارک در سال ۲۰۲۳ توسط تیمی از پژوهشگران LMSYS (به رهبری لیانمین ژنگ، Lianmin Zheng) به عنوان بخشی از روش LLM-as-a-Judge («LLM در نقش داور») برای مقایسه عینی کیفیت چت‌بات‌ها معرفی شد[1].

برخلاف آزمون‌های تک‌مرحله‌ای سنتی (مانند MMLU)، MT-Bench توانایی مدل‌ها را در برقراری گفتگوی چندمرحله‌ای، دریافت متوالی اطلاعات جدید و پیروی دقیق از دستورالعمل‌های کاربر می‌سنجد. هدف آن ارزیابی واقع‌بینانه‌تر عملکرد چت‌بات‌ها در سناریوهای پیچیده است که بر انطباق با ترجیحات انسانی و الزامات عملی سیستم‌های مکالمه‌ای تمرکز دارد[2].

پیش‌زمینه و انگیزه پیدایش

توسعه مدل‌های LLM مکالمه‌ای، مانند ChatGPT، GPT-4 و Vicuna، شکافی را میان معیارهای کیفی سنتی و درک واقعی کاربران از پاسخ‌ها آشکار کرد. معلوم شد که بهبود مدل از نظر همسویی با دستورالعمل‌های انسانی (از طریق RLHF) همیشه نتایج بنچمارک‌های قدیمی و تک‌مرحله‌ای را بهبود نمی‌بخشد. آزمون‌هایی مانند MMLU یا HELM اغلب نمی‌توانند چت‌بات‌های بهبودیافته («تراز شده») را از مدل‌های پایه‌شان تمیز دهند. این امر محدودیت روش‌های پیشین را نشان می‌دهد که کیفیت تعامل چندمرحله‌ای و دستورالعمل‌های آزاد را منعکس نمی‌کنند.

MT-Bench به عنوان پاسخی به این مشکل پدید آمد و مجموعه‌ای از سؤالات باز در قالب گفتگو ارائه داد که بر دو جنبه تمرکز دارد: 1. توانایی مدل در حفظ گفتگوی پیوسته در چندین مرحله (turns). 2. پیروی دقیق از دستورالعمل‌های پیچیده کاربر[1].

ساختار و محتوای بنچمارک

MT-Bench از ۸۰ سناریوی گفتگویی چندمرحله‌ای به دقت انتخاب‌شده تشکیل شده است که انواع مختلفی از وظایف را پوشش می‌دهد. هر سناریو شامل مجموعه‌ای از چند تبادل میان کاربر و مدل است و توانایی مدل را در نگه‌داشتن زمینه و انطباق با اطلاعات جدید می‌سنجد. گفتگوها در ۸ دسته وظیفه گروه‌بندی شده‌اند:

  • Writing (نوشتن متن) — ارزیابی مهارت‌های خلاقانه (مانند نوشتن مطلب وبلاگ).
  • Roleplay (گفتگوی نقش‌آفرینی) — شبیه‌سازی گفتگو در نقش‌های مشخص.
  • Extraction (استخراج اطلاعات) — توانایی استخراج حقایق از زمینه ارائه‌شده.
  • Reasoning (استدلال منطقی) — حل مسائل تفکر منطقی.
  • Math (ریاضیات) — حل مسائل ریاضی.
  • Coding (برنامه‌نویسی) — نوشتن یا اشکال‌زدایی کد.
  • STEM (علوم و فناوری) — سؤالات از حوزه‌های علوم طبیعی.
  • Humanities (علوم انسانی) — سؤالات تاریخ، ادبیات و علوم اجتماعی.

در هر دسته ۱۰ وظیفه گفتگویی وجود دارد. وظایف عمداً شامل ادامه‌های چالش‌برانگیز (مانند سؤالات تکمیلی ناگهانی) هستند تا مدل را در شرایط گفتگوی «واقعی» بیازمایند[3].

روش ارزیابی: LLM-as-a-Judge

ویژگی کلیدی MT-Bench استفاده از یک مدل زبانی قوی در نقش داور برای ارزیابی خودکار پاسخ‌ها (LLM-as-a-Judge) است. در پژوهش اصلی، مدل GPT-4 این نقش را ایفا می‌کرد[1].

رویه ارزیابی به شرح زیر است: 1. برای هر سناریوی گفتگویی، چند مدل شرکت‌کننده پاسخ تولید می‌کنند. 2. مدل داور (GPT-4) این پاسخ‌ها را (در قالب مقایسه زوجی یا نمره‌دهی بر اساس مقیاس امتیازی) مقایسه کرده و حکم ترجیح را صادر می‌کند.

داوری خودکار جایگزین برچسب‌گذاری دستی زمان‌بر می‌شود. پژوهشگران نشان دادند که ارزیابی‌های GPT-4 به عنوان داور بیش از ۸۰٪ همخوانی با نتایج متخصصان انسانی دارد که با میزان توافق خود انسان‌ها با یکدیگر قابل مقایسه است. این امر نشان‌دهنده قابلیت اطمینان روش و امکان مقیاس‌بخشی به ارزیابی‌ها بدون مشارکت مستقیم انسان است. برای افزایش عینیت، سوگیری‌های احتمالی مدل داور شناسایی و کاهش یافت، از جمله اثر سوگیری موقعیتی (ترجیح پاسخ اول)، پرحرفی (ترجیح پاسخ طولانی‌تر) و خودستایی (لطف به پاسخ‌هایی در سبک خود)[1].

نتایج و کاربرد

MT-Bench تفاوت‌های قابل توجهی را در کیفیت مدل‌های مدرن آشکار کرد. در دسته‌های استدلال منطقی، ریاضیات و برنامه‌نویسی، GPT-4 به طور چشمگیری از نسخه‌های قبلی (مانند GPT-3.5) پیشی گرفت. این امر تأیید کرد که مدل‌های بزرگ‌تر زمینه را در چندین مرحله گفتگو بهتر حفظ می‌کنند.

برای استفاده عملی از نتایج، تیم LMSYS یک تابلوی امتیازات عمومی راه‌اندازی کرد که مدل‌ها بر اساس میانگین امتیاز MT-Bench و رتبه‌بندی Elo از Chatbot Arena رتبه‌بندی می‌شوند. این رتبه‌بندی به طور منظم به‌روزرسانی می‌شود و پیشرفت صنعت را منعکس می‌کند. خود dataset و کد اجرای آن در دسترس عموم قرار گرفته است که به توسعه‌دهندگان مستقل امکان آزمایش مدل‌هایشان را می‌دهد[2].

محدودیت‌ها و انتقادات

با وجود کاربرد موفق، MT-Bench و رویکرد LLM-as-a-Judge دارای محدودیت‌هایی هستند:

  • ناقص بودن داور. مدل داور (مانند GPT-4) همه‌توان نیست: همیشه خطاهای واقعی یا توهمات در پاسخ‌های مدل‌های آزمایش‌شده را تشخیص نمی‌دهد.
  • دشواری در ارزیابی منطق و ریاضیات. داور LLM ممکن است نتواند استدلال پیچیده را به طور کامل دنبال کند یا یک اثبات را بررسی نماید، که می‌تواند به خطا در ارزیابی منجر شود.
  • سوگیری‌ها (Biases). علی‌رغم اقدامات کاهشی، مدل داور ممکن است نسبت به سبک یا قالب خاصی از پاسخ تعصب داشته باشد.

این جنبه‌ها به این معنا هستند که در کاربردهای حیاتی، نظارت انسانی یا روش‌های ارزیابی ترکیبی همچنان مطلوب است.

توسعه و گسترش

موفقیت MT-Bench به پیدایش نسخه‌های گسترش‌یافته انجامید. در سال ۲۰۲۴، روش MT-Bench-101 معرفی شد که هدفش تحلیل دقیق‌تر توانایی‌های مدل‌ها در گفتگو بود. نویسندگان یک طبقه‌بندی سه‌سطحی از مهارت‌ها تدوین و dataset بسیار بزرگ‌تری گردآوری کردند که امکان شناسایی تفاوت‌های ظریف در رفتار مدل‌ها در مراحل مختلف گفتگو را فراهم آورد[4].

پیوندها

  • مخزن رسمی داده‌های MT-Bench در GitHub

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [۱]
  2. 2.0 2.1 «MT-Bench (Multi-turn Benchmark)». Klu.ai Glossary. [۲]
  3. «MT-Bench - GM-RKB». GaborMelli.com. [۳]
  4. Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». arXiv:2402.14762, 2024. [۴]