MMLU Benchmark (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (acrónimo de Measuring Massive Multitask Language Understanding) es un conjunto de tareas de referencia (benchmark) diseñado para evaluar las capacidades de los modelos grandes de lenguaje (LLM) en una amplia gama de áreas temáticas. El benchmark fue desarrollado en 2020 por un equipo de investigadores dirigido por Dan Hendrycks de UC Berkeley y publicado en la conferencia ICLR en 2021[1].

El objetivo de MMLU es verificar en qué medida un modelo asimila conocimientos y habilidades diversas adquiridas durante la etapa de preentrenamiento, mediante pruebas en modo de cero ejemplos o pocos ejemplos (zero-shot/few-shot) sin ajuste fino adicional. MMLU fue creado como una alternativa más compleja a las pruebas existentes anteriormente (como GLUE y SuperGLUE), en las que muchos modelos ya habían alcanzado el nivel humano para 2020[2].

Descripción y contenido

MMLU consta de 15 908 preguntas de opción múltiple que abarcan 57 disciplinas diferentes. La temática de las tareas incluye:

  • Materias del ámbito STEM (matemáticas, física, biología, informática).
  • Humanidades y ciencias sociales (historia, literatura, derecho, administración).
  • Áreas aplicadas y profesionales (medicina, jurisprudencia, negocios)[1].

El rango de dificultad varía desde el nivel de escuela primaria hasta un nivel profesional avanzado. Las preguntas se basan en materiales de exámenes reales para escuelas, universidades y pruebas profesionales, como el GRE y el USMLE[1]. El formato de las tareas es de cuatro opciones de respuesta por cada pregunta, lo que significa que la precisión por azar es del 25%. Para lograr un resultado alto, el modelo debe poseer un amplio conocimiento enciclopédico y capacidad de razonamiento.

Resultados y desarrollo

En su lanzamiento en 2020, la mayoría de los LLM mostraban resultados apenas superiores al azar. El mejor resultado lo demostró el modelo GPT-3 (175 mil millones de parámetros), obteniendo aproximadamente un ~43,9% de respuestas correctas. En comparación, un experto humano alcanzaba en promedio un ~90%[1]. Esta brecha confirmó la complejidad y el alto estándar del nuevo benchmark.

Con el tiempo, MMLU se convirtió en una de las pruebas más populares para los LLM, adquiriendo el estatus de "estándar de oro" en los informes de las principales empresas de IA[3]. Para 2023-2024, los modelos más recientes, como GPT-4, Gemini Ultra de Google y Claude 3.5 de Anthropic, se acercaron al nivel humano, alcanzando una precisión de aproximadamente 85-90%[2][3].

El rápido progreso llevó a una "saturación" gradual del benchmark: los modelos líderes comenzaron a alcanzar puntuaciones cercanas al máximo, lo que redujo la capacidad de MMLU para diferenciar sus capacidades intelectuales. Esto ha estimulado a la comunidad a desarrollar nuevas pruebas más difíciles[3].

Limitaciones y críticas

A pesar de su amplia difusión, MMLU tiene varias limitaciones significativas.

Calidad y corrección de los datos

En junio de 2024, investigadores realizaron un análisis manual de una muestra de 5700 preguntas de MMLU y encontraron una cantidad significativa de errores[4].

  • Alrededor del 6,5% de todas las preguntas de MMLU contienen errores en el etiquetado o en las formulaciones.
  • En algunas categorías, la proporción de tareas incorrectas es muy alta. Por ejemplo, en la sección "Virología", el 57% de las tareas contenían errores (múltiples respuestas correctas, formulaciones incorrectas o una respuesta de referencia incorrecta).

Esto significa que incluso un modelo perfecto no puede obtener un 100% en el conjunto de datos original, y parte de las mejoras en las métricas podría deberse a que el modelo memoriza los errores sistemáticos del conjunto[4].

Metodología de evaluación y fuga de datos

  • Falta de un estándar de prueba. Diferentes desarrolladores pueden usar diferentes prompts y modos de few-shot, lo que dificulta la comparación directa de los resultados de los modelos.
  • Fuga de datos (data contamination). Existe el riesgo de que las preguntas y respuestas de los benchmarks públicos se incluyan en los conjuntos de datos de entrenamiento de los LLM. En tal caso, el modelo "conoce" las respuestas correctas, lo que hace que la evaluación sea injusta[3].

Versiones derivadas y extensiones

Para abordar los problemas del MMLU original, se han creado varias de sus variantes.

  • MMLU-Redux. Una versión corregida y refinada del conjunto de datos, presentada en junio de 2024. Incluye 3000 preguntas reetiquetadas de 30 categorías y está diseñada para una evaluación más fiable de los modelos, sin las distorsiones causadas por errores en los datos[4].
  • MMLU-Pro. Una versión ampliada y más difícil de la prueba, presentada a finales de 2024. Contiene más de 12 000 preguntas, cada una con 10 opciones de respuesta en lugar de cuatro. Esto reduce la probabilidad de acierto por azar al 10%. Las preguntas han sido verificadas por expertos e incluyen nuevas tareas de fuentes más complejas[5].
  • MMMLU (Multilingual MMLU). Una versión multilingüe lanzada por OpenAI en 2023. El conjunto completo de MMLU fue traducido por traductores profesionales a 14 idiomas, incluyendo tanto idiomas comunes (español, chino, ruso) como de bajos recursos (por ejemplo, yoruba). Esto permite evaluar y comparar las capacidades de los modelos en diferentes idiomas[6].

Enlaces externos

Bibliografía

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Referencias

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]