MT-Bench (benchmark) (VI)
MT-Bench (viết tắt của Multi-Turn Benchmark, «benchmark đa lượt») — là một bộ bài kiểm tra chuẩn (benchmark) dùng để đánh giá các mô hình ngôn ngữ lớn (LLM) trong điều kiện hội thoại đa lượt. Benchmark này được đề xuất vào năm 2023 bởi nhóm nghiên cứu LMSYS (do Lianmin Zheng dẫn đầu) như một phần của phương pháp LLM-as-a-Judge («LLM trong vai trò giám khảo») nhằm so sánh khách quan chất lượng các chatbot[1].
Khác với các bài kiểm tra một lượt truyền thống (như MMLU), MT-Bench kiểm tra khả năng của mô hình trong việc duy trì hội thoại nhiều bước, liên tục tiếp nhận thông tin mới và tuân thủ chính xác các hướng dẫn của người dùng. Mục tiêu là đánh giá thực tế hơn hoạt động của các chatbot trong các tình huống phức tạp, hướng tới sự phù hợp với sở thích của con người và các yêu cầu thực tiễn của hệ thống hội thoại[2].
Bối cảnh ra đời
Sự phát triển của các mô hình LLM dạng hội thoại như ChatGPT, GPT-4 và Vicuna đã bộc lộ khoảng cách giữa các chỉ số chất lượng truyền thống và nhận thức thực tế của người dùng về các câu trả lời. Hóa ra, việc cải thiện mô hình theo hướng tuân thủ hướng dẫn của con người (thông qua RLHF) không phải lúc nào cũng nâng cao kết quả trên các benchmark cũ, đơn lượt. Các bài kiểm tra như MMLU hay HELM thường không phân biệt được các chatbot đã được «tinh chỉnh» («aligned») với các mô hình cơ sở của chúng. Điều này cho thấy hạn chế của các phương pháp cũ, vốn không phản ánh chất lượng tương tác đa lượt và các hướng dẫn dạng mở.
MT-Bench ra đời như một giải pháp cho vấn đề này, đề xuất một bộ câu hỏi dạng mở theo định dạng hội thoại, tập trung vào hai khía cạnh: 1. Khả năng của mô hình trong việc duy trì cuộc trò chuyện liền mạch qua nhiều bước (turns). 2. Tuân thủ chính xác các hướng dẫn phức tạp của người dùng[1].
Cấu trúc và nội dung của benchmark
MT-Bench bao gồm 80 kịch bản hội thoại đa lượt được tuyển chọn kỹ lưỡng, bao quát nhiều loại nhiệm vụ khác nhau. Mỗi kịch bản gồm một chuỗi trao đổi giữa người dùng và mô hình, kiểm tra khả năng của mô hình trong việc duy trì ngữ cảnh và thích nghi với các thông tin mới. Các hội thoại được nhóm theo 8 danh mục nhiệm vụ:
- Writing (viết văn bản) — kiểm tra kỹ năng sáng tạo (ví dụ: viết blog).
- Roleplay (nhập vai) — mô phỏng hội thoại theo các vai diễn cụ thể.
- Extraction (trích xuất thông tin) — khả năng trích xuất dữ kiện từ ngữ cảnh được cung cấp.
- Reasoning (lập luận logic) — giải quyết các bài toán tư duy logic.
- Math (toán học) — giải các bài toán toán học.
- Coding (lập trình) — viết hoặc gỡ lỗi mã nguồn.
- STEM (khoa học và kỹ thuật) — câu hỏi từ các lĩnh vực khoa học tự nhiên.
- Humanities (khoa học nhân văn) — câu hỏi về lịch sử, văn học, khoa học xã hội.
Mỗi danh mục có 10 nhiệm vụ hội thoại. Các bài tập được cố tình bao gồm các phần tiếp nối hóc búa (ví dụ: câu hỏi làm rõ đột ngột) để thử thách mô hình trong các cuộc trò chuyện gần với thực tế[3].
Phương pháp đánh giá: LLM-as-a-Judge
Đặc điểm then chốt của MT-Bench là sử dụng một mô hình ngôn ngữ mạnh trong vai trò giám khảo để tự động hóa việc đánh giá các câu trả lời (LLM-as-a-Judge). Trong công trình gốc, mô hình GPT-4 đảm nhận vai trò này[1].
Quy trình đánh giá được xây dựng như sau: 1. Với mỗi kịch bản hội thoại, một số mô hình tham gia tạo ra các câu trả lời. 2. Mô hình giám khảo (GPT-4) so sánh các câu trả lời đó (theo định dạng so sánh cặp đôi hoặc chấm điểm theo thang) và đưa ra phán quyết về mức độ ưu tiên.
Việc chấm điểm tự động thay thế cho quá trình gán nhãn thủ công tốn nhiều công sức. Các nhà nghiên cứu đã chỉ ra rằng điểm đánh giá của GPT-4 với tư cách giám khảo có tỷ lệ trùng khớp hơn 80% với kết quả của các chuyên gia con người, tương đương với mức độ đồng thuận giữa chính những người đánh giá với nhau. Điều này chứng minh độ tin cậy của phương pháp và khả năng mở rộng quy mô đánh giá mà không cần sự tham gia trực tiếp của con người. Để nâng cao tính khách quan, các sai lệch tiềm ẩn của mô hình giám khảo đã được xác định và giảm thiểu, chẳng hạn như hiệu ứng lệch vị trí (ưu tiên câu trả lời đứng trước), ưa dài dòng (ưu tiên câu trả lời dài hơn) và tự đề cao (ưu tiên câu trả lời theo phong cách của chính mình)[1].
Kết quả và ứng dụng
MT-Bench đã giúp phát hiện ra những khác biệt đáng kể về chất lượng giữa các mô hình hiện đại. Trong các danh mục lập luận logic, toán học và lập trình, GPT-4 vượt trội đáng kể so với các phiên bản trước (ví dụ: GPT-3.5). Điều này xác nhận rằng các mô hình lớn hơn duy trì ngữ cảnh tốt hơn qua nhiều bước hội thoại.
Để ứng dụng kết quả thực tiễn, nhóm LMSYS đã ra mắt bảng xếp hạng công khai, nơi các mô hình được xếp hạng theo điểm MT-Bench trung bình và chỉ số Elo từ Chatbot Arena. Bảng xếp hạng này được cập nhật thường xuyên, phản ánh tiến bộ của ngành. Bản thân dataset và mã nguồn để chạy benchmark đã được công bố công khai, cho phép các nhà phát triển độc lập kiểm tra mô hình của mình[2].
Hạn chế và phê bình
Mặc dù được ứng dụng thành công, MT-Bench và phương pháp LLM-as-a-Judge vẫn có một số hạn chế:
- Sự không hoàn hảo của giám khảo. Mô hình giám khảo (ví dụ: GPT-4) không phải là toàn năng: nó không phải lúc nào cũng nhận ra các lỗi thực tế hay hiện tượng hallucination trong câu trả lời của các mô hình được kiểm tra.
- Khó khăn trong đánh giá logic và toán học. LLM giám khảo có thể không theo dõi đầy đủ một lập luận phức tạp hoặc kiểm chứng một bằng chứng, dẫn đến nguy cơ sai sót trong đánh giá.
- Sai lệch (Biases). Dù đã có các biện pháp giảm thiểu, mô hình giám khảo vẫn có thể giữ định kiến đối với một phong cách hoặc định dạng câu trả lời nhất định.
Các khía cạnh này có nghĩa là trong các ứng dụng quan trọng, vẫn nên có sự giám sát của con người hoặc các phương pháp đánh giá kết hợp.
Phát triển và mở rộng
Thành công của MT-Bench đã thúc đẩy sự ra đời của các phiên bản mở rộng. Năm 2024, phương pháp MT-Bench-101 được đề xuất, nhắm đến việc phân tích chi tiết hơn nữa các năng lực của mô hình trong hội thoại. Các tác giả đã xây dựng một phân loại kỹ năng ba cấp và thu thập một dataset lớn hơn đáng kể, cho phép phát hiện những khác biệt tinh tế trong hành vi của mô hình ở các giai đoạn hội thoại khác nhau[4].
Liên kết ngoài
- Kho lưu trữ chính thức với dữ liệu MT-Bench trên GitHub
Tài liệu tham khảo
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Chú thích
- ↑ 1.0 1.1 1.2 1.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [1]
- ↑ 2.0 2.1 «MT-Bench (Multi-turn Benchmark)». Klu.ai Glossary. [2]
- ↑ «MT-Bench - GM-RKB». GaborMelli.com. [3]
- ↑ Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». arXiv:2402.14762, 2024. [4]