---
title: "HumanEval Benchmark (FR)"
source: "https://systems-analysis.info/int/HumanEval_Benchmark_(FR)"
wiki: "systems-analysis.info/int"
article: "HumanEval_Benchmark_(FR)"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2996
wiki_created_at: 2026-09-06T23:14:05Z
wiki_modified_at: 2026-09-06T23:14:05Z
downloaded_at: 2026-09-07T22:54:22Z
---

# HumanEval Benchmark (FR)

**HumanEval** est un jeu de données de référence (benchmark) conçu pour l'évaluation objective de la qualité du code généré par des modèles d'intelligence artificielle à partir d'une description textuelle de la tâche<sup>[\[1\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_paper-1)</sup>. Il a été présenté en juillet 2021 par des chercheurs d'OpenAI dirigés par **Mark Chen** (*Mark Chen*) et est devenu l'une des normes clés pour mesurer la correction fonctionnelle des programmes générés.

Le développement de HumanEval a été motivé par le besoin d'une méthode fiable pour évaluer la génération de code. Auparavant, la qualité du code généré par les [modèles de langage](https://systems-analysis.info/int/Grands_mod%C3%A8les_de_langage "Grands modèles de langage") était souvent évaluée à l'aide de métriques indirectes (par exemple, BLEU) ou manuellement, ce qui ne garantissait pas que les programmes soient réellement fonctionnels. HumanEval résout ce problème en se concentrant sur la **correction fonctionnelle** : le code généré n'est pas évalué sur sa similarité syntaxique avec une référence, mais sur sa capacité à passer avec succès une série de tests unitaires automatisés<sup>[\[1\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_paper-1)</sup>.

## Structure de l'ensemble de tâches

Le benchmark se compose de **164 problèmes** de programmation, rédigés manuellement spécifiquement pour ce jeu de données afin de garantir leur absence dans les ensembles de données d'entraînement des modèles. Tous les problèmes sont formulés en langage Python et présentés sous forme de fragments de code avec une description<sup>[\[2\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_hf-2)</sup>.

Chaque tâche comprend :

- **En-tête de la fonction** : La signature de la fonction avec son nom et ses paramètres.
- **Description textuelle** : Une docstring en anglais décrivant la fonctionnalité requise.
- **Corps de la fonction** : Un espace vide que le modèle doit remplir avec le code généré.

Pour chaque problème, des éléments cachés au modèle sont également prévus :

- **Solution canonique** : L'implémentation correcte (de référence) de la fonction.
- **Suite de tests unitaires** : Utilisée pour la vérification automatique de la correction du code généré. Les tests couvrent aussi bien les cas nominaux que les cas limites.

Les problèmes couvrent un large éventail de sujets, allant des constructions de base du langage et des algorithmes à des mathématiques simples, ce qui rend l'ensemble varié et complexe pour les modèles.

## Méthodologie d'évaluation des modèles

La principale métrique de succès sur HumanEval est **pass@k**, qui mesure la proportion de problèmes résolus par le modèle de manière fonctionnellement correcte<sup>[\[1\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_paper-1)</sup>. Une solution est considérée comme réussie si le code généré passe tous les tests automatisés pour le problème donné.

- **pass@1** : L'indicateur principal et le plus fréquemment utilisé. Il représente le pourcentage de problèmes résolus par le modèle à la **première tentative** (c'est-à-dire en ne générant qu'une seule variante de solution par problème).
- **pass@k** : De manière générale, cette métrique indique la proportion de problèmes pour lesquels **au moins une des k** variantes de solution générées par le modèle passe tous les tests. Par exemple, *pass@10* indique la proportion de problèmes que le modèle est capable de résoudre s'il dispose de jusqu'à 10 tentatives pour chacun.

Comme le calcul direct de *pass@k* nécessite un grand nombre d'échantillons, les auteurs ont proposé une méthode statistiquement correcte pour calculer cette métrique, ce qui permet d'obtenir une estimation non biaisée<sup>[\[1\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_paper-1)</sup>.

Les tests pratiques se déroulent dans un « bac à sable » (sandbox) spécial : le code généré est compilé et exécuté sur une série de tests de vérification. Cette approche permet de mesurer la capacité du modèle à générer du code exécutable et correct, et non simplement du code syntaxiquement similaire à une référence.

## Résultats et impact sur l'industrie

Les premières expériences sur HumanEval ont révélé un écart significatif entre les modèles généralistes et les modèles spécifiquement entraînés sur du code.

- En 2021, le modèle OpenAI Codex (12 milliards de paramètres, entraîné sur du code de GitHub) a réussi à résoudre **~28,8 %** des problèmes à la première tentative (*pass@1*).
- Parallèlement, le modèle de langage plus grand GPT-3 (175 milliards), non entraîné sur du code, **n'a réussi à résoudre correctement aucun problème**<sup>[\[1\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_paper-1)</sup>.

Ces résultats ont souligné la nécessité d'un entraînement spécialisé sur des données de programmation pour une génération de code réussie. Après son introduction, le benchmark HumanEval est rapidement devenu un test standard pour comparer les progrès des nouveaux modèles.

- Les modèles de la série **GPT-3.5** (début 2023) ont atteint **~72 %** de *pass@1*.
- Le modèle GPT-4 (2023) a montré des résultats encore plus élevés, atteignant **~67 %** dans sa version de base et dépassant **85 %** après des ajustements supplémentaires<sup>[\[3\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-niu_2024_efficiency-3)</sup>.
- Les modèles ouverts, tels que **Code Llama** (Meta, 2023) et **WizardCoder** (2023), ont également obtenu des scores élevés (respectivement **~53 %** et **~57 %** de *pass@1*), surpassant les premiers modèles propriétaires<sup>[\[4\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-lutfullaev_2023_revisited-4)</sup>.

## Extensions et variantes du benchmark

Le succès de HumanEval a inspiré la création de plusieurs versions dérivées, conçues pour évaluer les modèles dans des conditions plus larges.

- **CL-HumanEval** (*Cross-Lingual HumanEval*) : Une variante cross-linguistique (2024), où les problèmes de l'HumanEval original sont adaptés pour évaluer la capacité des modèles à comprendre des descriptions dans différentes langues (autres que l'anglais), tout en générant du code en Python<sup>[\[5\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-cl_humaneval_2024-5)</sup>.
- **Multilingual HumanEval** : Une extension (2023) visant à évaluer la génération de code dans **12 langages de programmation différents** (dont Java, C#, JavaScript, etc.) à partir de descriptions en anglais<sup>[\[6\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-multilingual_humaneval_2024-6)</sup>.
- **HumanEval-XL** : Un benchmark à grande échelle (2024) qui combine les deux approches. Il contient des problèmes dans 12 langages de programmation et des traductions des descriptions textuelles dans 23 langues du monde, dont le russe, le chinois, l'arabe, etc. Au total, HumanEval-XL compte plus de 22 000 paires « description-code »<sup>[\[7\]](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_note-humaneval_xl_2024-7)</sup>.

## Liens externes

- <a href="https://huggingface.co/datasets/openai/openai_humaneval" class="external text" rel="nofollow">HumanEval sur Hugging Face</a>
- <a href="https://paperswithcode.com/dataset/humaneval" class="external text" rel="nofollow">Page HumanEval sur Papers with Code</a>

## Bibliographie

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Références

1.  <span id="cite_note-humaneval_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_paper_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_paper_1-4)</sup> Chen, M. et al. «Evaluating Large Language Models Trained on Code». *arXiv:2107.03374*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2107.03374" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-humaneval_hf-2">[↑](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_hf_2-0) «openai/openai_humaneval». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/openai_humaneval" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-niu_2024_efficiency-3">[↑](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-niu_2024_efficiency_3-0) Niu, C. et al. «On Evaluating the Efficiency of Source Code Generated by LLMs». *Proceedings of the 2nd International Conference on AI-generated Content*, 2024. <a href="https://arxiv.org/html/2404.06041v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-lutfullaev_2023_revisited-4">[↑](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-lutfullaev_2023_revisited_4-0) Lutfullaev, J. «HumanEval on LLMs Revisited in Late 2023». *arXiv:2402.14852*, 2023. <a href="https://arxiv.org/html/2402.14852v1" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-cl_humaneval_2024-5">[↑](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-cl_humaneval_2024_5-0) Sato, M. et al. «CL-HumanEval: A Benchmark for Evaluating Cross-Lingual Transfer through Code Generation». *Proceedings of the 38th Pacific Asia Conference on Language, Information and Computation*, 2024. <a href="https://aclanthology.org/2024.paclic-1.62.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-multilingual_humaneval_2024-6">[↑](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-multilingual_humaneval_2024_6-0) Athiwaratkun, B. et al. «Multilingual HumanEval: A Multilingual Code Generation Benchmark». *arXiv:2307.11892*, 2023. <a href="https://aclanthology.org/2024.lrec-main.735.pdf" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-humaneval_xl_2024-7">[↑](https://systems-analysis.info/int/HumanEval_Benchmark_(FR)#cite_ref-humaneval_xl_2024_7-0) Liu, J. et al. «HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization». *LREC-COLING 2024*. <a href="https://aclanthology.org/2024.lrec-main.735.pdf" class="external autonumber" rel="nofollow">[7]</a></span>
