---
title: "MT-Bench (benchmark) (CS)"
source: "https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)"
wiki: "systems-analysis.info/int"
article: "MT-Bench_(benchmark)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4097
wiki_created_at: 2026-09-06T23:30:31Z
wiki_modified_at: 2026-09-06T23:30:31Z
downloaded_at: 2026-09-07T23:00:52Z
---

# MT-Bench (benchmark) (CS)

**MT-Bench** (zkr. z angl. *Multi-Turn Benchmark*, „vícekrokový benchmark") — je referenční sada testovacích úloh (benchmark) pro hodnocení velkých jazykových modelů (LLM) v podmínkách vícekrokového dialogu. Benchmark byl navržen v roce 2023 týmem výzkumníků **LMSYS** (v čele s **Lianminem Zhengem**, *Lianmin Zheng*) jako součást metody **LLM-as-a-Judge** („LLM v roli soudce") pro objektivní porovnání kvality chatbotů<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-mt_bench_paper-1)</sup>.

Na rozdíl od tradičních jednokrokových testů (jako je MMLU) MT-Bench prověřuje schopnost modelů vést víceetapový dialog, postupně vstřebávat nové informace a přesně se řídit pokyny uživatele. Cílem je realističtější hodnocení fungování chatbotů ve složitých scénářích, orientované na soulad s lidskými preferencemi a praktickými požadavky konverzačních systémů<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-klu_glossary-2)</sup>.

## Předpoklady vzniku

Rozvoj dialogových LLM modelů, jako jsou ChatGPT, GPT-4 a Vicuna, odhalil propast mezi tradičními metrikami kvality a skutečným uživatelským vnímáním odpovědí. Ukázalo se, že zlepšení modelu z hlediska souladu s lidskými pokyny (prostřednictvím RLHF) ne vždy zvyšuje výsledky na starších, jednokrokových benchmarcích. Testy jako MMLU nebo HELM často nerozlišují vylepšené („zarovnané") chatboty od jejich základních modelů. To poukazuje na omezenost dřívějších metodik, které neodrážejí kvalitu vícekrokové interakce a pokynů v otevřené formě.

MT-Bench vznikl jako odpověď na tento problém a nabízí sadu otevřených otázek ve formátu dialogu, který se zaměřuje na dva aspekty: 1. Schopnost modelu udržovat plynulou konverzaci napříč několika kroky (*turns*). 2. Přesné plnění složitých pokynů uživatele<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-mt_bench_paper-1)</sup>.

## Struktura a obsah benchmarku

MT-Bench se skládá z **80** pečlivě vybraných vícekrokových dialogových scénářů pokrývajících různé typy úloh. Každý scénář zahrnuje sérii několika výměn mezi uživatelem a modelem a prověřuje schopnost modelu udržovat kontext a přizpůsobovat se novým informacím. Dialogy jsou rozděleny do **8 kategorií** úloh:

- **Writing** (psaní textu) — prověření tvůrčích dovedností (například sepsání blogu).
- **Roleplay** (hraní rolí) — simulace dialogů v určitých rolích.
- **Extraction** (extrakce informací) — schopnost extrahovat fakta z poskytnutého kontextu.
- **Reasoning** (logické uvažování) — řešení úloh na logické myšlení.
- **Math** (matematika) — řešení matematických úloh.
- **Coding** (programování) — psaní nebo ladění kódu.
- **STEM** (věda a technika) — otázky z přírodovědných oblastí.
- **Humanities** (humanitní vědy) — otázky z historie, literatury a společenských věd.

V každé kategorii je zastoupeno 10 dialogových úloh. Zadání záměrně zahrnují záludná pokračování (například náhlé upřesňující otázky), aby model otestovala v podmínkách „reálné" konverzace<sup>[\[3\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-gabor_melli_rkb-3)</sup>.

## Metodika hodnocení: LLM-as-a-Judge

Klíčovým rysem MT-Bench je využití silného jazykového modelu v roli **soudce** pro automatizované hodnocení odpovědí (**LLM-as-a-Judge**). V původní práci tuto roli zastával model GPT-4<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-mt_bench_paper-1)</sup>.

Postup hodnocení je následující: 1. Pro každý dialogový scénář generuje několik modelů-účastníků odpovědi. 2. Model-soudce (GPT-4) tyto odpovědi porovnává (ve formátu párového srovnání nebo hodnocení na bodové škále) a vynáší verdikt o preferenci.

Automatizované rozhodování nahrazuje pracné ruční anotování. Výzkumníci prokázali, že hodnocení GPT-4 jakožto soudce vykazuje **více než 80% shodu** s výsledky lidských expertů, což je srovnatelné se shodou mezi samotnými lidmi. To svědčí o spolehlivosti metody a možnosti škálovat hodnocení bez přímé účasti člověka. Pro zvýšení objektivity byla zohledněna a zmírněna potenciální zkreslení modelu-soudce, jako je efekt **pozičního zkreslení** (preference první odpovědi), **mnohomluvnosti** (preference delší odpovědi) a **sebeprosazování** (shovívavost k odpovědím ve vlastním stylu)<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-mt_bench_paper-1)</sup>.

## Výsledky a využití

MT-Bench umožnil odhalit výrazné rozdíly v kvalitách současných modelů. V kategoriích logického uvažování, matematiky a programování GPT-4 výrazně překonal předchozí verze (například GPT-3.5). To potvrdilo, že větší modely lépe udržují kontext napříč několika kroky dialogu.

Pro praktické využití výsledků spustil tým LMSYS **veřejný žebříček**, kde jsou modely řazeny podle průměrného skóre MT-Bench a Elo ratingu z Chatbot Arena. Tento rating je pravidelně aktualizován a odráží pokrok v odvětví. Samotný dataset i kód pro jeho spuštění byly zveřejněny, což umožňuje nezávislým vývojářům testovat své modely<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-klu_glossary-2)</sup>.

## Omezení a kritika

Navzdory úspěšnému využití mají MT-Bench a přístup LLM-as-a-Judge řadu omezení:

- **Nedokonalost soudce**. Model-soudce (například GPT-4) není všemocný: ne vždy rozpozná faktické chyby nebo halucinace v odpovědích testovaných modelů.
- **Obtíže s hodnocením logiky a matematiky**. LLM-soudce nemusí plně sledovat složité uvažování nebo ověřit důkaz, což může vést k chybám při hodnocení.
- **Zkreslení (Biases)**. Navzdory opatřením ke zmírnění může model-soudce zachovávat předpojatost vůči určitému stylu nebo formátu odpovědi.

Tyto aspekty znamenají, že v kriticky důležitých aplikacích je stále žádoucí lidský dohled nebo kombinované metody hodnocení.

## Vývoj a rozšíření

Úspěch MT-Bench podnítil vznik rozšířených verzí. V roce 2024 byla navržena metodika **MT-Bench-101**, zaměřená na ještě podrobnější analýzu schopností modelů v dialogu. Autoři sestavili třístupňovou taxonomii dovedností a shromáždili výrazně větší dataset, což umožnilo odhalit jemné rozdíly v chování modelů v různých fázích dialogu<sup>[\[4\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_note-mt_bench_101_paper-4)</sup>.

## Odkazy

- Oficiální repozitář s daty MT-Bench na GitHubu

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## Poznámky

1.  <span id="cite_note-mt_bench_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-mt_bench_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-mt_bench_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-mt_bench_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-mt_bench_paper_1-3)</sup> Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/html/2306.05685v4" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-klu_glossary-2">↑ <sup>[2.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-klu_glossary_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-klu_glossary_2-1)</sup> «MT-Bench (Multi-turn Benchmark)». *Klu.ai Glossary*. <a href="https://klu.ai/glossary/mt-bench-eval" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gabor_melli_rkb-3">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-gabor_melli_rkb_3-0) «MT-Bench - GM-RKB». *GaborMelli.com*. <a href="https://www.gabormelli.com/RKB/MT-Bench" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mt_bench_101_paper-4">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(CS)#cite_ref-mt_bench_101_paper_4-0) Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». *arXiv:2402.14762*, 2024. <a href="https://arxiv.org/abs/2402.14762" class="external autonumber" rel="nofollow">[4]</a></span>
