---
title: "MT-Bench (benchmark) (PT)"
source: "https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)"
wiki: "systems-analysis.info/int"
article: "MT-Bench_(benchmark)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 4110
wiki_created_at: 2026-09-06T23:30:42Z
wiki_modified_at: 2026-09-06T23:30:42Z
downloaded_at: 2026-09-07T23:00:56Z
---

# MT-Bench (benchmark) (PT)

**MT-Bench** (abreviação do inglês *Multi-Turn Benchmark*, ou "benchmark de múltiplos turnos") — é um conjunto de tarefas de teste de referência (benchmark) para avaliar modelos de linguagem grandes (LLMs) em cenários de diálogo de múltiplos turnos. O benchmark foi proposto em 2023 por uma equipe de pesquisadores do **LMSYS** (liderada por **Lianmin Zheng**) como parte do método **LLM-as-a-Judge** ("LLM como um juiz") para a comparação objetiva da qualidade de chatbots<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-mt_bench_paper-1)</sup>.

Diferente dos testes tradicionais de um único turno (como o MMLU), o MT-Bench avalia a capacidade dos modelos de conduzir um diálogo de múltiplos estágios, processar novas informações de forma sequencial e seguir com precisão as instruções do usuário. O objetivo é fornecer uma avaliação mais realista do desempenho de chatbots em cenários complexos, focada na correspondência com as preferências humanas e os requisitos práticos de sistemas conversacionais<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-klu_glossary-2)</sup>.

## Contexto da Criação

O desenvolvimento de modelos de LLM de diálogo, como ChatGPT, GPT-4 e Vicuna, revelou uma lacuna entre as métricas de qualidade tradicionais e a percepção real dos usuários sobre as respostas. Verificou-se que a melhoria do modelo em termos de alinhamento com as instruções humanas (através de RLHF) nem sempre melhora os resultados em benchmarks mais antigos e de um único turno. Testes como MMLU ou HELM muitas vezes não conseguem distinguir entre chatbots aprimorados ("alinhados") e seus modelos base. Isso indica a limitação das metodologias anteriores, que não refletem a qualidade da interação de múltiplos turnos e das instruções de formato aberto.

O MT-Bench surgiu como uma resposta a esse problema, oferecendo um conjunto de perguntas de formato aberto em um formato de diálogo, que se concentra em dois aspectos:

1.  A capacidade do modelo de manter uma conversa coerente ao longo de vários passos (*turns*).
2.  O seguimento preciso de instruções complexas do usuário<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-mt_bench_paper-1)</sup>.

## Estrutura e Conteúdo do Benchmark

O MT-Bench consiste em **80** cenários de diálogo de múltiplos turnos cuidadosamente selecionados, cobrindo diversos tipos de tarefas. Cada cenário inclui uma série de trocas entre o usuário e o modelo, testando a capacidade do modelo de manter o contexto e se adaptar a novas informações. Os diálogos são agrupados em **8 categorias** de tarefas:

- **Writing** (escrita) — avaliação de habilidades criativas (por exemplo, escrever uma postagem de blog).
- **Roleplay** (interpretação de papéis) — simulação de diálogos em papéis específicos.
- **Extraction** (extração de informação) — capacidade de extrair fatos de um contexto fornecido.
- **Reasoning** (raciocínio lógico) — resolução de problemas que exigem pensamento lógico.
- **Math** (matemática) — resolução de problemas matemáticos.
- **Coding** (programação) — escrita ou depuração de código.
- **STEM** (ciências e tecnologia) — perguntas de áreas de ciências naturais e tecnologia.
- **Humanities** (humanidades) — perguntas sobre história, literatura e ciências sociais.

Cada categoria contém 10 tarefas de diálogo. As tarefas incluem intencionalmente continuações complicadas (por exemplo, perguntas de esclarecimento súbitas) para testar o modelo em uma conversa que simula a realidade<sup>[\[3\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-gabor_melli_rkb-3)</sup>.

## Metodologia de Avaliação: LLM-as-a-Judge

A principal característica do MT-Bench é o uso de um modelo de linguagem forte no papel de **juiz** para a avaliação automatizada de respostas (**LLM-as-a-Judge**). No trabalho original, o modelo GPT-4 desempenhou esse papel<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-mt_bench_paper-1)</sup>.

A procedura de avaliação é a seguinte:

1.  Para cada cenário de diálogo, vários modelos participantes geram respostas.
2.  O modelo-juiz (GPT-4) compara essas respostas (em formato de comparação par a par ou avaliação em escala de pontos) e emite um veredito sobre qual é a preferível.

O julgamento automatizado substitui a trabalhosa rotulagem manual. Os pesquisadores demonstraram que as avaliações do GPT-4 como juiz têm **mais de 80% de concordância** com os resultados de especialistas humanos, o que é comparável à consistência entre os próprios humanos. Isso comprova a confiabilidade do método e a possibilidade de escalar as avaliações sem a participação humana direta. Para aumentar a objetividade, foram considerados e mitigados os potenciais vieses do modelo-juiz, como o **viés de posição** (preferência pela primeira resposta), o **viés de verbosidade** (preferência por respostas mais longas) e o **viés de autoafirmação** (lealdade a respostas em seu próprio estilo)<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-mt_bench_paper-1)</sup>.

## Resultados e Aplicação

O MT-Bench permitiu identificar diferenças notáveis na qualidade dos modelos contemporâneos. Nas categorias de raciocínio lógico, matemática e programação, o GPT-4 superou significativamente as versões anteriores (como o GPT-3.5). Isso confirmou que modelos maiores são mais eficazes em manter o contexto ao longo de múltiplos turnos de diálogo.

Para a aplicação prática dos resultados, a equipe do LMSYS lançou um **leaderboard público**, onde os modelos são classificados pela pontuação média no MT-Bench e pela classificação Elo da Chatbot Arena. Essa classificação é atualizada regularmente, refletindo o progresso no setor. O próprio dataset e o código para sua execução foram disponibilizados em acesso aberto, permitindo que desenvolvedores independentes testem seus modelos<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-klu_glossary-2)</sup>.

## Limitações e Críticas

Apesar de sua aplicação bem-sucedida, o MT-Bench e a abordagem LLM-as-a-Judge possuem algumas limitações:

- **Imperfeição do juiz**. O modelo-juiz (por exemplo, GPT-4) não é infalível: ele nem sempre reconhece erros factuais ou alucinações nas respostas dos modelos avaliados.
- **Dificuldades na avaliação de lógica e matemática**. O LLM-juiz pode não conseguir acompanhar completamente um raciocínio complexo ou verificar uma prova, o que pode levar a erros na avaliação.
- **Vieses (Biases)**. Apesar das medidas para mitigá-los, o modelo-juiz pode manter um viés em relação a um determinado estilo ou formato de resposta.

Esses aspectos significam que, em aplicações críticas, a supervisão humana ou métodos de avaliação combinados ainda são desejáveis.

## Desenvolvimento e Extensões

O sucesso do MT-Bench estimulou o surgimento de versões estendidas. Em 2024, foi proposta a metodologia **MT-Bench-101**, visando uma análise ainda mais detalhada das capacidades dos modelos em diálogo. Os autores desenvolveram uma taxonomia de habilidades em três níveis e coletaram um dataset significativamente maior, o que permitiu identificar diferenças sutis no comportamento dos modelos em diferentes estágios do diálogo<sup>[\[4\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_note-mt_bench_101_paper-4)</sup>.

## Ligações externas

- <a href="https://github.com/lm-sys/FastChat/tree/main/fastchat/llm_judge" class="external text" rel="nofollow">Repositório oficial com os dados do MT-Bench no GitHub</a>

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Notas

1.  <span id="cite_note-mt_bench_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-mt_bench_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-mt_bench_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-mt_bench_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-mt_bench_paper_1-3)</sup> Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/html/2306.05685v4" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-klu_glossary-2">↑ <sup>[2.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-klu_glossary_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-klu_glossary_2-1)</sup> «MT-Bench (Multi-turn Benchmark)». *Klu.ai Glossary*. <a href="https://klu.ai/glossary/mt-bench-eval" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gabor_melli_rkb-3">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-gabor_melli_rkb_3-0) «MT-Bench - GM-RKB». *GaborMelli.com*. <a href="https://www.gabormelli.com/RKB/MT-Bench" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mt_bench_101_paper-4">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(PT)#cite_ref-mt_bench_101_paper_4-0) Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». *arXiv:2402.14762*, 2024. <a href="https://arxiv.org/abs/2402.14762" class="external autonumber" rel="nofollow">[4]</a></span>
