---
title: "MT-Bench (benchmark) (IT)"
source: "https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)"
wiki: "systems-analysis.info/int"
article: "MT-Bench_(benchmark)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4106
wiki_created_at: 2026-09-06T23:30:39Z
wiki_modified_at: 2026-09-06T23:30:39Z
downloaded_at: 2026-09-07T23:00:55Z
---

# MT-Bench (benchmark) (IT)

**MT-Bench** (abbreviazione dall'inglese *Multi-Turn Benchmark*, «benchmark multi-turno») — è un insieme di riferimento di compiti di test (benchmark) per la valutazione dei grandi modelli linguistici (LLM) in condizioni di dialogo multi-turno. Il benchmark è stato proposto nel 2023 dal team di ricercatori **LMSYS** (guidato da **Lianmin Zheng**) come parte del metodo **LLM-as-a-Judge** («LLM nel ruolo di giudice») per il confronto oggettivo della qualità dei chatbot<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-mt_bench_paper-1)</sup>.

A differenza dei tradizionali test a turno singolo (come MMLU), MT-Bench verifica la capacità dei modelli di condurre un dialogo a più fasi, di recepire progressivamente nuovi input e di seguire con precisione le istruzioni dell'utente. L'obiettivo è una valutazione più realistica del funzionamento dei chatbot in scenari complessi, orientata alla corrispondenza con le preferenze umane e ai requisiti pratici dei sistemi conversazionali<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-klu_glossary-2)</sup>.

## Premesse della creazione

Lo sviluppo di modelli LLM conversazionali, come ChatGPT, GPT-4 e Vicuna, ha messo in luce il divario tra le metriche di qualità tradizionali e la reale percezione degli utenti delle risposte. Si è rivelato che il miglioramento del modello dal punto di vista dell'allineamento alle istruzioni umane (tramite RLHF) non sempre migliora i risultati sui vecchi benchmark a turno singolo. Test come MMLU o HELM spesso non distinguono i chatbot migliorati («allineati») dai loro modelli base. Ciò indica i limiti delle metodologie precedenti, che non riflettono la qualità dell'interazione multi-turno e delle istruzioni in forma aperta.

MT-Bench è emerso come risposta a questo problema, proponendo un insieme di domande a risposta aperta in formato dialogico, che si concentra su due aspetti: 1. La capacità del modello di sostenere una conversazione coerente attraverso diversi turni (*turns*). 2. Il rispetto preciso di istruzioni complesse da parte dell'utente<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-mt_bench_paper-1)</sup>.

## Struttura e contenuto del benchmark

MT-Bench è composto da **80** scenari dialogici multi-turno accuratamente selezionati, che coprono diversi tipi di compiti. Ogni scenario include una serie di più scambi tra l'utente e il modello, verificando la capacità del modello di mantenere il contesto e adattarsi a nuovi input. I dialoghi sono raggruppati in **8 categorie** di compiti:

- **Writing** (scrittura di testi) — verifica delle capacità creative (ad esempio, la composizione di un blog).
- **Roleplay** (conversazione di ruolo) — simulazione di dialoghi in ruoli specifici.
- **Extraction** (estrazione di informazioni) — capacità di estrarre fatti dal contesto fornito.
- **Reasoning** (ragionamento logico) — risoluzione di problemi di pensiero logico.
- **Math** (matematica) — risoluzione di problemi matematici.
- **Coding** (programmazione) — scrittura o debug di codice.
- **STEM** (scienze e tecnologia) — domande provenienti da ambiti scientifico-naturali.
- **Humanities** (conoscenze umanistiche) — domande di storia, letteratura e scienze sociali.

In ciascuna categoria sono presenti 10 compiti dialogici. I compiti includono deliberatamente continuazioni insidiose (ad esempio, domande di chiarimento improvvise), per mettere alla prova il modello in una conversazione «reale» in senso lato<sup>[\[3\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-gabor_melli_rkb-3)</sup>.

## Metodologia di valutazione: LLM-as-a-Judge

La caratteristica fondamentale di MT-Bench è l'utilizzo di un potente modello linguistico nel ruolo di **giudice** per la valutazione automatizzata delle risposte (**LLM-as-a-Judge**). Nel lavoro originale, questo ruolo era svolto dal modello GPT-4<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-mt_bench_paper-1)</sup>.

La procedura di valutazione è strutturata come segue: 1. Per ogni scenario dialogico, diversi modelli partecipanti generano le risposte. 2. Il modello-giudice (GPT-4) confronta queste risposte (in formato di confronto a coppie o di valutazione su scala numerica) e pronuncia un verdetto sulla preferibilità.

La valutazione automatizzata sostituisce la laboriosa annotazione manuale. I ricercatori hanno dimostrato che i giudizi di GPT-4 in veste di giudice presentano una **concordanza superiore all'80%** con i risultati degli esperti umani, paragonabile alla concordanza tra gli esseri umani stessi. Ciò attesta l'affidabilità del metodo e la possibilità di scalare le valutazioni senza la partecipazione diretta di un essere umano. Per aumentare l'obiettività, sono stati considerati e mitigati i potenziali bias del modello-giudice, come l'effetto del **bias posizionale** (preferenza per la prima risposta), della **verbosità** (preferenza per la risposta più lunga) e dell'**auto-esaltazione** (indulgenza verso le risposte nel proprio stile)<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-mt_bench_paper-1)</sup>.

## Risultati e applicazioni

MT-Bench ha permesso di evidenziare differenze significative nelle qualità dei modelli contemporanei. Nelle categorie di ragionamento logico, matematica e programmazione, GPT-4 ha superato notevolmente le versioni precedenti (ad esempio GPT-3.5). Ciò ha confermato che i modelli più grandi mantengono meglio il contesto nel corso di più turni di dialogo.

Per l'utilizzo pratico dei risultati, il team LMSYS ha lanciato una **classifica pubblica** (leaderboard) dove i modelli sono classificati in base al punteggio medio MT-Bench e alla valutazione Elo della Chatbot Arena. Questa classifica viene aggiornata regolarmente, riflettendo i progressi del settore. Il dataset stesso e il codice per eseguirlo sono stati resi pubblicamente disponibili, consentendo agli sviluppatori indipendenti di testare i propri modelli<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-klu_glossary-2)</sup>.

## Limitazioni e critiche

Nonostante il successo della sua applicazione, MT-Bench e l'approccio LLM-as-a-Judge presentano alcune limitazioni:

- **Imperfezione del giudice**. Il modello-giudice (ad esempio GPT-4) non è onnipotente: non sempre riconosce errori fattuali o allucinazioni nelle risposte dei modelli testati.
- **Difficoltà nella valutazione della logica e della matematica**. Il giudice LLM potrebbe non riuscire a seguire completamente un ragionamento complesso o a verificare una dimostrazione, il che è foriero di errori nella valutazione.
- **Bias (Distorsioni)**. Nonostante le misure di mitigazione, il modello-giudice può conservare una predisposizione verso un certo stile o formato di risposta.

Questi aspetti implicano che, nelle applicazioni critiche, sia ancora auspicabile la supervisione umana o l'utilizzo di metodi di valutazione combinati.

## Sviluppi ed estensioni

Il successo di MT-Bench ha stimolato la nascita di versioni ampliate. Nel 2024 è stata proposta la metodologia **MT-Bench-101**, finalizzata a un'analisi ancora più dettagliata delle capacità dei modelli nel dialogo. Gli autori hanno costituito una tassonomia delle competenze a tre livelli e hanno raccolto un dataset significativamente più ampio, il che ha permesso di individuare sottili differenze nel comportamento dei modelli nelle diverse fasi del dialogo<sup>[\[4\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_note-mt_bench_101_paper-4)</sup>.

## Collegamenti esterni

- Repository ufficiale con i dati MT-Bench su GitHub

## Bibliografia

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Note

1.  <span id="cite_note-mt_bench_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-mt_bench_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-mt_bench_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-mt_bench_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-mt_bench_paper_1-3)</sup> Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/html/2306.05685v4" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-klu_glossary-2">↑ <sup>[2.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-klu_glossary_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-klu_glossary_2-1)</sup> «MT-Bench (Multi-turn Benchmark)». *Klu.ai Glossary*. <a href="https://klu.ai/glossary/mt-bench-eval" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gabor_melli_rkb-3">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-gabor_melli_rkb_3-0) «MT-Bench - GM-RKB». *GaborMelli.com*. <a href="https://www.gabormelli.com/RKB/MT-Bench" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mt_bench_101_paper-4">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(IT)#cite_ref-mt_bench_101_paper_4-0) Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». *arXiv:2402.14762*, 2024. <a href="https://arxiv.org/abs/2402.14762" class="external autonumber" rel="nofollow">[4]</a></span>
