FLORES-200 (CS)
FLORES-200 — je hodnoticí dataset pro vícejazyčný strojový překlad, pokrývající přibližně 200 jazyků světa. Byl vytvořen výzkumníky společnosti Meta v rámci projektu No Language Left Behind (NLLB) a představen v roce 2022. FLORES-200 je rozšířením předchozího datasetu FLORES-101 a je určen k objektivnímu hodnocení kvality překladu, zejména pro nízkozdrojové jazyky[1].
Klíčovou vlastností datasetu je to, že všechny texty byly přeloženy profesionálními překladateli, což zajišťuje vysokou kvalitu referenčních překladů a činí z něj spolehlivý standard pro porovnávání systémů strojového překladu[2].
Předhistorie a vznik datasetu
První verze, FLORES-101, byla představena v roce 2022 a obsahovala 3001 vět z anglické Wikipedie přeložených do 101 jazyků[3]. Tento dataset zaplnil důležitou mezeru v hodnocení překladových systémů pro jazyky s malým množstvím dat.
V roce 2022 v rámci projektu No Language Left Behind společnost Meta rozšířila korpus na 200 jazyků a vytvořila FLORES-200[4]. Vývoj narazil na řadu obtíží:
- Mnohé přidané jazyky měly nízkou standardizaci a nedostatek dvojjazyčných odborníků.
- Část jazyků byla přeložena nikoliv přímo z angličtiny, ale prostřednictvím zprostředkujících jazyků (španělštiny, francouzštiny, ruštiny).
- Pro některé jazyky byly zahrnuty různé systémy písma (například latinka a cyrilice), aby bylo zohledněno jejich využití v různých komunitách[5].
Složení a struktura
Korpus FLORES-200 obsahuje 3001 vět vybraných z 842 různých webových článků a dokumentů projektů Wikimedia. Na rozdíl od první verze zdroje zahrnují nejen Wikipedii, ale i další projekty, jako jsou Wikinews, Wikijunior a Wikivoyage. To zajišťuje širokou tematickou různorodost (zprávy, věda, kultura, cestování), která umožňuje komplexní ověřování kvality překladu.
Každá anglická věta byla profesionálně přeložena do přibližně 200 cílových jazyků, čímž vznikl plně zarovnaný paralelní korpus. Dataset je rozdělen na tři části:
- dev (vývoj) — pro ladění modelů.
- devtest (průběžné testování) — pro předběžné hodnocení.
- test (finální testování) — skrytá část pro férové porovnávání modelů v soutěžích.
Pro označení jazyků je používán standard ISO 639-3 s uvedením písma, například `eng_Latn` pro angličtinu v latince nebo `rus_Cyrl` pro ruštinu v cyrilici[5].
Využití a význam
FLORES-200 se stal klíčovým standardem pro hodnocení vícejazyčných systémů strojového překladu. Byl použit k hodnocení vlajkového modelu od Meta — NLLB-200. Testování na FLORES-200 ukázalo, že NLLB-200 zlepšila kvalitu překladu v průměru o 44 % podle metriky BLEU ve srovnání s předchozími nejlepšími systémy[6]. Pro některé jazyky Afriky a Indie nárůst přesnosti překročil 70 %[4].
Meta zpřístupnila dataset a nástroje pro jeho využití pod licencí Creative Commons BY-SA 4.0. Díky tomu se FLORES-200 rychle rozšířil a stal se de facto standardem ve vědeckých pracích, soutěžích ve strojovém překladu (např. WMT) a iniciativách na ochranu jazyků. V roce 2023 komunita OLDI (Open Language Data Initiative) začala rozšiřovat korpus pod názvem FLORES+[2].
Odkazy
- Oficiální dataset na Hugging Face
- Oficiální repozitář na GitHubu
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Poznámky
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]