FLORES-200 (FR)
FLORES-200 est un jeu de données d'évaluation pour la traduction automatique multilingue, couvrant environ 200 langues. Il a été créé par des chercheurs de Meta dans le cadre du projet No Language Left Behind (NLLB) et présenté en 2022. FLORES-200 est une extension du jeu de données précédent, FLORES-101, et est conçu pour évaluer objectivement la qualité de la traduction, en particulier pour les langues à faibles ressources[1].
La principale caractéristique de ce jeu de données est que tous les textes ont été traduits par des traducteurs professionnels, ce qui garantit une haute qualité des traductions de référence et en fait une norme fiable pour la comparaison des systèmes de traduction automatique[2].
Contexte et création
La première version, FLORES-101, a été présentée en 2022 et contenait 3001 phrases issues de la Wikipédia anglophone, traduites en 101 langues[3]. Ce jeu de données a comblé une lacune importante dans l'évaluation des systèmes de traduction pour les langues disposant de peu de données.
En 2022, dans le cadre du projet No Language Left Behind, Meta a étendu le corpus à 200 langues, créant ainsi FLORES-200[4]. Le développement a rencontré plusieurs difficultés :
- De nombreuses langues ajoutées avaient un faible niveau de standardisation et un manque de spécialistes bilingues.
- Une partie des langues n'a pas été traduite directement de l'anglais, mais via des langues pivots (espagnol, français, russe).
- Pour certaines langues, différents systèmes d'écriture (par exemple, les alphabets latin et cyrillique) ont été inclus pour tenir compte de leur usage dans diverses communautés[5].
Composition et structure
Le corpus FLORES-200 comprend 3001 phrases, sélectionnées à partir de 842 articles web et documents variés issus des projets Wikimedia. Contrairement à la première version, les sources incluent non seulement Wikipédia, mais aussi d'autres projets tels que Wikinews, Wikijunior et Wikivoyage. Cela garantit une grande diversité thématique (actualités, science, culture, voyages), ce qui permet une évaluation complète de la qualité de la traduction.
Chaque phrase anglaise a été traduite professionnellement dans environ 200 langues cibles, formant ainsi un corpus parallèle entièrement aligné. Le jeu de données est divisé en trois parties :
- dev (développement) — pour l'ajustement des modèles.
- devtest (test de développement) — pour l'évaluation préliminaire.
- test (test final) — une partie cachée pour une comparaison équitable des modèles lors de compétitions.
Pour désigner les langues, la norme ISO 639-3 est utilisée avec l'indication du script, par exemple, eng_Latn pour l'anglais en alphabet latin ou rus_Cyrl pour le russe en alphabet cyrillique[5].
Application et importance
FLORES-200 est devenu une norme de référence clé pour l'évaluation des systèmes de traduction automatique multilingues. Il a été utilisé pour évaluer le modèle phare de Meta, le NLLB-200. Les tests sur FLORES-200 ont montré que le NLLB-200 a amélioré la qualité de la traduction de 44 % en moyenne selon la métrique BLEU, par rapport aux systèmes de pointe précédents[6]. Pour certaines langues d'Afrique et d'Inde, l'amélioration de la précision a dépassé 70 %[4].
Meta a rendu le jeu de données et les outils pour son utilisation librement accessibles sous la licence Creative Commons BY-SA 4.0. Grâce à cela, FLORES-200 a été rapidement et largement adopté, devenant une norme de facto dans les travaux de recherche, les compétitions de traduction automatique (par exemple, WMT) et les initiatives de préservation des langues. En 2023, la communauté OLDI (Open Language Data Initiative) a commencé à étendre le corpus sous le nom de FLORES+[2].
Liens externes
Bibliographie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Références
- ↑ « FLoRes-200 Dataset ». Papers With Code. [1]
- ↑ 2.0 2.1 « FLORES+ Translation and Machine Translation Evaluation for the Erzya Language ». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. « The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation ». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 « New AI Model Translates 200 Languages, Making Technology Accessible to More People ». Meta Newsroom. [4]
- ↑ 5.0 5.1 « Muennighoff/flores200 ». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. « No Language Left Behind: Scaling Human-Centered Machine Translation ». arXiv:2207.04672. [6]