MT-Bench (benchmark) (TL)
MT-Bench (pinaikling mula sa Ingles na Multi-Turn Benchmark, «multi-turn benchmark») — isang etalon na hanay ng mga pagsubok (benchmark) para sa pagtatasa ng malalaking language model (LLM) sa mga kondisyon ng multi-turn na diyalogo. Ang benchmark ay iminungkahi noong 2023 ng koponan ng mga mananaliksik ng LMSYS (pinamumunuan ni Lianmin Zheng) bilang bahagi ng pamamaraan ng LLM-as-a-Judge («LLM bilang hukom») para sa layuning paghahambing ng kalidad ng mga chat-bot[1].
Kaiba sa mga tradisyonal na one-turn na pagsubok (tulad ng MMLU), sinusuri ng MT-Bench ang kakayahan ng mga modelo na magsagawa ng multi-stage na diyalogo, sunud-sunod na tanggapin ang mga bagong input, at tumpak na sundin ang mga instruksyon ng gumagamit. Ang layunin ay ang mas makatotohanang pagtatasa ng gawain ng mga chat-bot sa mga kumplikadong senaryo, nakatuon sa pagsasabagay sa mga kagustuhan ng tao at sa mga praktikal na pangangailangan ng mga conversational na sistema[2].
Mga Paunang Kondisyon ng Paglikha
Ang pag-unlad ng mga conversational na LLM na modelo, tulad ng ChatGPT, GPT-4 at Vicuna, ay nagpakita ng agwat sa pagitan ng mga tradisyonal na sukatan ng kalidad at ng tunay na pang-unawa ng gumagamit sa mga sagot. Lumabas na ang pagpapabuti ng modelo mula sa pananaw ng pagkakatugma sa mga instruksyon ng tao (sa pamamagitan ng RLHF) ay hindi palaging nagpapataas ng mga resulta sa mga lumang, one-turn na benchmark. Ang mga pagsubok tulad ng MMLU o HELM ay kadalasang hindi nakikilala ang mga pinahusay («na-align») na chat-bot mula sa kanilang mga batayang modelo. Ipinapakita nito ang limitasyon ng mga nakaraang pamamaraan, na hindi sumasalamin sa kalidad ng multi-turn na pakikipag-ugnayan at ng mga instruksyon sa bukas na anyo.
Lumabas ang MT-Bench bilang tugon sa problemang ito, na nag-aalok ng hanay ng mga tanong na bukas ang uri sa format ng diyalogo, na nakatuon sa dalawang aspeto: 1. Ang kakayahan ng modelo na mapanatili ang magkakasunod na pag-uusap sa loob ng ilang hakbang (turns). 2. Tumpak na pagsunod sa mga kumplikadong instruksyon ng gumagamit[1].
Estruktura at Nilalaman ng Benchmark
Ang MT-Bench ay binubuo ng 80 maingat na piniling multi-turn na mga senaryo ng diyalogo, sumasaklaw sa iba't ibang uri ng gawain. Bawat senaryo ay naglalaman ng serye ng ilang palitan sa pagitan ng gumagamit at ng modelo, sinusuri ang kakayahan ng modelo na mapanatili ang konteksto at mag-adapt sa mga bagong input. Ang mga diyalogo ay iniklot ayon sa 8 kategorya ng mga gawain:
- Writing (pagsulat ng teksto) — pagsubok ng mga malikhaing kasanayan (halimbawa, pagsulat ng blog).
- Roleplay (pag-uusap sa papel) — pagmomodelo ng mga diyalogo sa ilang partikular na papel.
- Extraction (pagkuha ng impormasyon) — kakayahang kunin ang mga katotohanan mula sa ibinigay na konteksto.
- Reasoning (lohikal na pangangatuwiran) — paglutas ng mga gawaing nangangailangan ng lohikal na pag-iisip.
- Math (matematika) — paglutas ng mga gawaing matematikal.
- Coding (pagpoprograma) — pagsulat o pag-debug ng code.
- STEM (agham at teknolohiya) — mga tanong mula sa mga natural na larangan ng agham.
- Humanities (humanidades) — mga tanong tungkol sa kasaysayan, panitikan, at agham panlipunan.
Sa bawat kategorya ay may 10 gawaing pang-diyalogo. Ang mga gawain ay sadyang naglalaman ng mga nakakalito na pagpapatuloy (halimbawa, biglaang mga tanong na naglilinaw), upang subukan ang modelo sa kondisyonalmenteng «tunay» na pag-uusap[3].
Pamamaraan ng Pagtatasa: LLM-as-a-Judge
Ang pangunahing katangian ng MT-Bench ay ang paggamit ng isang malakas na language model bilang hukom para sa awtomatikong pagtatasa ng mga sagot (LLM-as-a-Judge). Sa orihinal na gawain, ang modelong GPT-4 ang gumanap ng papel na ito[1].
Ang pamamaraan ng pagtatasa ay itinayo tulad ng sumusunod: 1. Para sa bawat senaryo ng diyalogo, ilang modelo na kalahok ang nagbibigay ng mga sagot. 2. Ang modelo-hukom (GPT-4) ay naghahambing ng mga sagot na ito (sa format ng pares na paghahambing o pagtatasa ayon sa punto) at nagbibigay ng hatol tungkol sa kagustuhan.
Ang awtomatikong paghuhukom ay pumapalit sa mapagod na manu-manong paglalabeling. Ipinakita ng mga mananaliksik na ang mga marka ng GPT-4 bilang hukom ay may mahigit 80% na pagkakatugma sa mga resulta ng mga dalubhasang tao, na maihahambing sa pagkakatugma sa pagitan ng mga tao mismo. Pinatutunayan nito ang pagiging maaasahan ng pamamaraan at ang posibilidad na palawakin ang mga pagtatasa nang walang direktang pakikilahok ng tao. Upang mapataas ang objectivity, ang mga potensyal na pagkiling ng modelo-hukom ay isinaalang-alang at pinababa, tulad ng epekto ng positional bias (kagustuhan sa unang sagot), verbosity (kagustuhan sa mas mahabang sagot) at self-enhancement (kagandahang-loob sa mga sagot sa sariling istilo)[1].
Mga Resulta at Paggamit
Pinahintulutan ng MT-Bench na matuklasan ang kapansin-pansing mga pagkakaiba sa mga kalidad ng mga modernong modelo. Sa mga kategorya ng lohikal na pangangatuwiran, matematika, at coding, ang GPT-4 ay malaki ang inuna kumpara sa mga nakaraang bersyon (halimbawa, GPT-3.5). Nakumpirma nito na ang mas malalaking modelo ay mas maayos na nagpapanatili ng konteksto sa loob ng ilang hakbang ng diyalogo.
Para sa praktikal na paggamit ng mga resulta, naglunsad ang koponan ng LMSYS ng pampublikong leaderboard, kung saan ang mga modelo ay inilalagay sa ranggo ayon sa average na MT-Bench score at Elo rating mula sa Chatbot Arena. Ang rating na ito ay regular na ina-update, sumasalamin sa pag-unlad ng industriya. Ang dataset mismo at ang code para sa pagpapatakbo nito ay inilabas sa bukas na access, na nagbibigay-daan sa mga independyenteng developer na subukan ang kanilang mga modelo[2].
Mga Limitasyon at Kritisismo
Kabila ng matagumpay na paggamit, ang MT-Bench at ang pamamaraang LLM-as-a-Judge ay may ilang limitasyon:
- Kakulangan ng hukom. Ang modelo-hukom (halimbawa, GPT-4) ay hindi makapangyarihan sa lahat: hindi nito palaging nakikilala ang mga katotohanang pagkakamali o hallucination sa mga sagot ng mga modelo na sinusubukan.
- Mga kahirapan sa pagtatasa ng lohika at matematika. Ang LLM-hukom ay maaaring hindi ganap na masubaybayan ang kumplikadong pangangatuwiran o suriin ang patunay, na nagreresulta sa mga pagkakamali sa pagtatasa.
- Mga pagkiling (Biases). Sa kabila ng mga hakbang upang mapababa ang mga ito, ang modelo-hukom ay maaaring mapanatili ang pagkiling sa isang partikular na istilo o format ng sagot.
Ang mga aspetong ito ay nangangahulugang sa mga kritikal na aplikasyon, ang pangangasiwa ng tao o mga pinagsanib na pamamaraan ng pagtatasa ay nananatiling kanais-nais.
Pag-unlad at mga Pagpapalawak
Ang tagumpay ng MT-Bench ay nagpasigla sa paglabas ng mga pinalawig na bersyon. Noong 2024, isang pamamaraan ng MT-Bench-101 ang iminungkahi, naglalayong mas detalyadong pagsusuri ng mga kakayahan ng mga modelo sa diyalogo. Ang mga may-akda ay bumuo ng tatlong antas na taksonomy ng mga kasanayan at nangolekta ng mas malaking dataset, na nagpahintulot na matukoy ang mga banayad na pagkakaiba sa gawi ng mga modelo sa iba't ibang yugto ng diyalogo[4].
Mga Kawing
- Opisyal na repositoryo na may datos ng MT-Bench sa GitHub
Panitikan
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv:2306.05685, 2023. [1]
- ↑ 2.0 2.1 «MT-Bench (Multi-turn Benchmark)». Klu.ai Glossary. [2]
- ↑ «MT-Bench - GM-RKB». GaborMelli.com. [3]
- ↑ Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». arXiv:2402.14762, 2024. [4]