BIG-bench (benchmark) (FR)

From Systems analysis Wiki
Jump to navigation Jump to search

BIG-bench (acronyme de l'anglais Beyond the Imitation Game benchmark) est un vaste ensemble de tâches (benchmark) créé pour évaluer les capacités et les limites des grands modèles de langage (LLM). Le projet a été développé en 2021-2022 grâce à un effort collaboratif de plus de 450 chercheurs issus de 132 organisations, sous l'égide de Google[1].

Le benchmark comprend 204 tâches diverses qui couvrent un large éventail de domaines : linguistique, mathématiques, programmation, raisonnement de sens commun, biologie, physique et évaluation des biais sociaux. L'objectif principal de BIG-bench est de dépasser le cadre du « jeu de l'imitation » (test de Turing) et de tester les modèles sur des tâches considérées comme difficiles ou insolubles pour les architectures existantes. Le benchmark est conçu non seulement pour mesurer les capacités actuelles, mais aussi pour extrapoler leurs performances futures à mesure que leur échelle augmente[2].

Développement et structure

La création de BIG-bench a été initiée par un groupe de chercheurs de Google, qui a organisé une collecte ouverte de tâches auprès de la communauté scientifique. En conséquence, l'ensemble final comprend 204 tâches provenant de dizaines d'équipes indépendantes. Chaque tâche a été conçue comme un défi pour les LLM et possède son propre format et sa propre métrique d'évaluation (par exemple, la précision du choix, l'évaluation d'une réponse générée librement).

Les tâches varient des questions académiques standard aux énigmes non conventionnelles, telles que :

  • La résolution de problèmes mathématiques et logiques.
  • La compréhension de séquences d'émojis.
  • La résolution de problèmes d'échecs à partir d'une description textuelle.
  • L'identification de stéréotypes sociaux dans les réponses du modèle.

L'ensemble du benchmark et son code sont disponibles en open source sur GitHub, ce qui permet aux chercheurs de tester de nouveaux modèles et de proposer des tâches supplémentaires[3].

Évaluation des modèles et niveau de référence humain

Dans l'article original de 2022, une évaluation à grande échelle a été menée sur plusieurs modèles, y compris la famille GPT d'OpenAI, ainsi que des modèles denses et creux de Google, tels que PaLM et Switch Transformers.

Pour comparer les résultats, un niveau de référence humain a été établi. Des évaluateurs humains experts ont réalisé toutes les tâches en utilisant les ressources à leur disposition. Deux indicateurs ont été définis :

  • Score moyen des experts : environ 45/100 sur une échelle normalisée.
  • Meilleur score des experts : environ 80/100 (lorsqu'au moins un expert résolvait la tâche de manière optimale).

Même les plus grands modèles de l'époque étaient nettement inférieurs aux performances humaines. Par exemple, les meilleurs d'entre eux (y compris GPT-3) n'obtenaient qu'environ 15/100 points, ce qui soulignait la difficulté des tâches et le grand potentiel de progrès futurs[1].

Principaux résultats et conclusions

L'analyse des résultats sur BIG-bench a révélé plusieurs tendances clés :

  1. Impact de l'échelle. La précision des modèles augmente avec le nombre de paramètres dans presque toutes les catégories de tâches.
  2. Capacités émergentes. Pour de nombreuses tâches, la performance des modèles reste longtemps au niveau d'une estimation aléatoire, mais après avoir atteint une certaine échelle « critique », une amélioration spectaculaire de la qualité se produit. Ce phénomène a été appelé comportement émergent (emergent behavior).
  3. Biais sociaux (bias). À mesure que la taille du modèle augmente, le niveau de manifestation des stéréotypes sociaux appris à partir des données d'entraînement peut également augmenter. Cependant, il a été démontré qu'une formulation adéquate de la requête (prompting) peut atténuer cet effet.

Évolution du benchmark

À mesure que les modèles devenaient plus puissants, certaines tâches de BIG-bench ont cessé d'être difficiles. Cela a conduit à la création de sous-ensembles plus ardus.

Big-bench Hard (BBH)

En 2022, les chercheurs ont identifié les 23 tâches les plus difficiles, sur lesquelles tous les modèles étaient initialement inférieurs au niveau humain moyen. Cet ensemble a été nommé BIG-bench Hard (BBH). Des expériences ont montré que l'utilisation de la technique de la chaîne de pensée (Chain-of-Thought, CoT) — où le modèle génère une série de raisonnements avant de donner sa réponse — augmente considérablement les performances. Avec la CoT, le modèle PaLM (540 milliards de paramètres) a réussi à surpasser le score humain moyen sur 10 des 23 tâches, et Codex (une version de GPT-3) sur 17 des 23[4].

Big-bench Extra Hard (BBEH)

En 2024, alors que même les tâches de BBH étaient résolues par les modèles de pointe, une nouvelle étape a été proposée : BIG-bench Extra Hard (BBEH). Les auteurs de DeepMind ont remplacé chacune des 23 tâches de BBH par une nouvelle, similaire en termes de type de raisonnement, mais beaucoup plus complexe[5]. Les premiers tests sur BBEH ont montré que même les LLM contemporains les plus puissants sont loin de pouvoir les résoudre, ce qui constitue un défi à long terme pour les futurs modèles.

Big-bench Lite (BBL)

Pour des tests plus rapides et moins coûteux en ressources, une version allégée a été créée : BIG-bench Lite (BBL). Elle consiste en un échantillon de 24 tâches qui reflètent la diversité de l'ensemble complet. BBL permet aux développeurs d'évaluer rapidement leurs modèles et de les comparer sur un classement public (leaderboard).

Liens externes

Littérature

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Références

  1. 1.0 1.1 Srivastava, A., et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv:2206.04615. [1]
  2. «BIG-Bench: The New Benchmark for Language Models». Deepgram. [2]
  3. «google/BIG-bench». GitHub. [3]
  4. Suzgun, M., et al. «Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them». arXiv:2210.09261. [4]
  5. Arora, S., et al. «BIG-Bench Extra Hard». arXiv:2502.19187. [5]