---
title: "MMLU Benchmark (PT)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(PT)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 4084
wiki_created_at: 2026-09-06T23:30:19Z
wiki_modified_at: 2026-09-06T23:30:19Z
downloaded_at: 2026-09-07T23:00:48Z
---

# MMLU Benchmark (PT)

**MMLU** (abreviação de **Measuring Massive Multitask Language Understanding**) é um conjunto de tarefas de referência (benchmark) projetado para avaliar as capacidades de grandes modelos de linguagem (LLMs) em uma ampla gama de áreas de conhecimento. O benchmark foi desenvolvido em 2020 por uma equipe de pesquisadores liderada por **Dan Hendrycks** da UC Berkeley e publicado na conferência ICLR em 2021<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_paper-1)</sup>.

O objetivo do MMLU é verificar o quão bem um modelo assimila conhecimentos e habilidades diversas adquiridas durante a fase de pré-treinamento, por meio de testes no modo *zero-shot* ou *few-shot* (com zero ou poucos exemplos), sem ajuste fino adicional. O MMLU foi criado como uma alternativa mais desafiadora aos testes existentes anteriormente (como GLUE e SuperGLUE), nos quais muitos modelos já haviam alcançado o desempenho de nível humano até 2020<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_wiki-2)</sup>.

## Descrição e conteúdo

O MMLU consiste em **15.908 perguntas** de múltipla escolha, cobrindo **57 disciplinas diferentes**. Os temas das tarefas incluem:

- Disciplinas da área STEM (matemática, física, biologia, ciência da computação).
- Ciências humanas e sociais (história, literatura, direito, gestão).
- Áreas aplicadas e profissionais (medicina, jurisprudência, negócios)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_paper-1)</sup>.

O nível de dificuldade varia do ensino fundamental ao profissional avançado. As perguntas são baseadas em materiais de exames reais para escolas, universidades e testes profissionais, como o GRE e o USMLE<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_paper-1)</sup>. O formato das tarefas é de quatro opções de resposta para cada pergunta, o que significa que a precisão por adivinhação aleatória é de 25%. Para alcançar um resultado alto, o modelo deve possuir vasto conhecimento enciclopédico e capacidade de raciocínio.

## Resultados e desenvolvimento

Quando o MMLU foi lançado em 2020, a maioria dos LLMs apresentava resultados apenas ligeiramente acima da adivinhação aleatória. O melhor resultado foi demonstrado pelo modelo GPT-3 (175 bilhões de parâmetros), que alcançou **~43,9%** de respostas corretas. Em comparação, um especialista humano atingia, em média, **~90%**<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_paper-1)</sup>. Essa diferença confirmou a complexidade e o alto padrão do novo benchmark.

Com o tempo, o MMLU tornou-se um dos testes mais populares para LLMs, alcançando o status de "padrão ouro" nos relatórios das principais empresas de IA<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-new_savanna_2024-3)</sup>. Entre 2023 e 2024, os modelos mais recentes, como o GPT-4, o **Gemini Ultra** do Google e o **Claude 3.5** da Anthropic, aproximaram-se do nível humano, atingindo uma precisão de **~85-90%**<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-new_savanna_2024-3)</sup>.

O rápido progresso levou a uma "saturação" gradual do benchmark: os principais modelos começaram a atingir pontuações próximas do máximo, o que reduziu a capacidade do MMLU de diferenciar suas capacidades intelectuais. Isso estimulou a comunidade a desenvolver novos testes mais difíceis<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-new_savanna_2024-3)</sup>.

## Limitações e críticas

Apesar de sua ampla adoção, o MMLU possui várias limitações significativas.

### Qualidade e correção dos dados

Em junho de 2024, pesquisadores realizaram uma análise manual de uma amostra de 5.700 perguntas do MMLU e encontraram um número significativo de erros<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-done_with_mmlu_2024-4)</sup>.

- Cerca de **6,5%** de todas as perguntas do MMLU contêm erros na rotulagem ou na formulação.
- Em algumas categorias, a proporção de tarefas incorretas é muito alta. Por exemplo, na seção "Virologia", **57%** das tarefas continham erros (múltiplas respostas corretas, formulações incorretas ou uma resposta de referência indicada erroneamente).

Isso significa que mesmo um modelo ideal não pode atingir 100% no dataset original, e parte das melhorias nas métricas pode estar relacionada à memorização dos erros sistemáticos do conjunto de dados pelo modelo<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-done_with_mmlu_2024-4)</sup>.

### Metodologia de avaliação e vazamento de dados

- **Falta de um padrão de teste**. Diferentes desenvolvedores podem usar prompts e modos few-shot distintos, o que dificulta a comparação direta dos resultados dos modelos.
- **Vazamento de dados** (*data contamination*). Existe o risco de que perguntas e respostas de benchmarks públicos sejam incluídas nos conjuntos de dados de treinamento dos LLMs. Nesse caso, o modelo efetivamente "sabe" as respostas corretas, tornando a avaliação injusta<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-new_savanna_2024-3)</sup>.

## Versões derivadas e extensões

Para resolver os problemas do MMLU original, várias de suas variantes foram criadas.

- **MMLU-Redux**. Uma versão corrigida e refinada do conjunto de dados, apresentada em junho de 2024. Inclui 3.000 perguntas rerrotuladas de 30 categorias e destina-se a uma avaliação mais confiável dos modelos, sem as distorções causadas por erros nos dados<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-done_with_mmlu_2024-4)</sup>.
- **MMLU-Pro**. Uma versão expandida e mais difícil do teste, apresentada no final de 2024. Contém mais de 12.000 perguntas, cada uma com **10 opções de resposta** em vez de quatro. Isso reduz a probabilidade de acerto aleatório para 10%. As perguntas foram revisadas por especialistas e incluem novas tarefas de fontes mais complexas<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmlu_pro_vals_ai-5)</sup>.
- **MMMLU** (*Multilingual MMLU*). Uma versão multilíngue lançada pela OpenAI em 2023. Todo o conjunto de dados do MMLU foi traduzido por tradutores profissionais para 14 idiomas, incluindo idiomas comuns (espanhol, chinês, russo) e de baixos recursos (como iorubá). Isso permite avaliar e comparar as capacidades dos modelos em diferentes idiomas<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_note-mmmlu_hf-6)</sup>.

## Ligações externas

- <a href="https://github.com/hendrycks/test" class="external text" rel="nofollow">Repositório oficial do MMLU no GitHub</a>
- <a href="https://paperswithcode.com/dataset/mmlu" class="external text" rel="nofollow">Página do MMLU no Papers with Code com resultados de modelos</a>

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Notas

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(PT)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[6]</a></span>
