FLORES-200 (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — dit is een evaluatiedataset voor meertalige machinevertaling die ongeveer 200 talen van de wereld omvat. Het werd gecreëerd door onderzoekers van Meta in het kader van het project No Language Left Behind (NLLB) en werd in 2022 gepresenteerd. FLORES-200 is een uitbreiding van de eerdere dataset FLORES-101 en is bedoeld voor een objectieve beoordeling van de vertaalkwaliteit, met name voor laag-resource talen[1].

Een belangrijk kenmerk van de dataset is dat alle teksten zijn vertaald door professionele vertalers, wat zorgt voor een hoge kwaliteit van de referentievertaingen en het een betrouwbare standaard maakt voor het vergelijken van machineverta­alsystemen[2].

Voorgeschiedenis en totstandkoming van de dataset

De eerste versie, FLORES-101, werd in 2022 gepresenteerd en bevatte 3001 zinnen uit de Engelstalige Wikipedia, vertaald in 101 talen[3]. Deze dataset vulde een belangrijke leemte op in de evaluatie van vertaalsystemen voor talen met weinig beschikbare gegevens.

In 2022 breidde Meta in het kader van het project No Language Left Behind het corpus uit naar 200 talen, waarmee FLORES-200 ontstond[4]. De ontwikkeling stuitte op een aantal uitdagingen:

  • Veel toegevoegde talen hadden een lage mate van standaardisatie en een tekort aan tweetalige specialisten.
  • Een deel van de talen werd niet rechtstreeks vanuit het Engels vertaald, maar via tussentalen (Spaans, Frans, Russisch).
  • Voor sommige talen werden verschillende schrijfsystemen opgenomen (bijvoorbeeld het Latijnse en het Cyrillische schrift), om het gebruik ervan in verschillende gemeenschappen te weerspiegelen[5].

Samenstelling en structuur

Het FLORES-200-corpus omvat 3001 zinnen, geselecteerd uit 842 verschillende webartikelen en documenten van Wikimedia-projecten. In tegenstelling tot de eerste versie omvatten de bronnen niet alleen Wikipedia, maar ook andere projecten zoals Wikinews, Wikijunior en Wikivoyage. Dit zorgt voor een brede thematische verscheidenheid (nieuws, wetenschap, cultuur, reizen), waardoor de vertaalkwaliteit uitgebreid kan worden getoetst.

Elke Engelse zin werd professioneel vertaald naar ~200 doeltalen, wat een volledig uitgelijnd parallel corpus oplevert. De dataset is opgesplitst in drie delen:

  • dev (ontwikkeling) — voor het afstemmen van modellen.
  • devtest (tussentijdse toetsing) — voor voorlopige evaluatie.
  • test (eindtoetsing) — een verborgen deel voor een eerlijke vergelijking van modellen in wedstrijden.

Voor de aanduiding van talen wordt de ISO 639-3-standaard gebruikt met vermelding van het schrift, bijvoorbeeld `eng_Latn` voor het Engels in Latijns schrift of `rus_Cyrl` voor het Russisch in Cyrillisch schrift[5].

Toepassing en betekenis

FLORES-200 is uitgegroeid tot een sleutelstandaard voor de evaluatie van meertalige machineverta­alsystemen. Het werd gebruikt voor de beoordeling van het vlaggenschipmodel van Meta — NLLB-200. Testen op FLORES-200 toonden aan dat NLLB-200 de vertaalkwaliteit gemiddeld met 44% verbeterde op de BLEU-metriek in vergelijking met eerder beste systemen[6]. Voor sommige talen in Afrika en India oversteeg de nauwkeurigheidswinst 70%[4].

Meta heeft de dataset en de bijbehorende tools vrij beschikbaar gesteld onder de licentie Creative Commons BY-SA 4.0. Hierdoor verwierf FLORES-200 snel een brede verspreiding en werd het de de-facto standaard in wetenschappelijke publicaties, machineverta­alwedstrijden (zoals WMT) en initiatieven voor taalbehoud. In 2023 begon de gemeenschap OLDI (Open Language Data Initiative) het corpus uit te breiden onder de naam FLORES+[2].

Verwijzingen

  • Officiële dataset op Hugging Face
  • Officiële repository op GitHub

Literatuur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Noten

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]