FLORES-200 (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — este un set de date de evaluare pentru traducerea automată multilingvă, acoperind aproximativ 200 de limbi ale lumii. A fost creat de cercetătorii companiei Meta în cadrul proiectului No Language Left Behind (NLLB) și prezentat în 2022. FLORES-200 reprezintă o extensie a setului anterior FLORES-101 și este destinat evaluării obiective a calității traducerii, în special pentru limbile cu resurse reduse[1].

Caracteristica principală a dataset-ului constă în faptul că toate textele au fost traduse de traducători profesioniști, ceea ce asigură o calitate ridicată a traducerilor de referință și îl face un standard fiabil pentru compararea sistemelor de traducere automată[2].

Istoric și crearea setului

Prima versiune, FLORES-101, a fost prezentată în 2022 și conținea 3001 propoziții din Wikipedia în limba engleză, traduse în 101 limbi[3]. Acest set a umplut un gol important în evaluarea sistemelor de traducere pentru limbile cu date insuficiente.

În 2022, în cadrul proiectului No Language Left Behind, compania Meta a extins corpusul la 200 de limbi, creând FLORES-200[4]. Dezvoltarea a întâmpinat o serie de dificultăți:

  • Multe dintre limbile adăugate aveau un nivel scăzut de standardizare și o lipsă de specialiști bilingvi.
  • O parte din limbi nu au fost traduse direct din engleză, ci prin limbi intermediare (spaniolă, franceză, rusă).
  • Pentru unele limbi au fost incluse sisteme de scriere diferite (de exemplu, alfabet latin și chirilic), pentru a reflecta utilizarea lor în comunități diferite[5].

Compoziție și structură

Corpusul FLORES-200 include 3001 propoziții, selectate din 842 de articole web și documente ale proiectelor Wikimedia. Spre deosebire de prima versiune, sursele includ nu doar Wikipedia, ci și alte proiecte, precum Wikinews, Wikijunior și Wikivoyage. Aceasta asigură o diversitate tematică largă (știri, știință, cultură, călătorii), permițând o verificare cuprinzătoare a calității traducerii.

Fiecare propoziție în limba engleză a fost tradusă profesional în ~200 de limbi țintă, formând un corpus paralel complet aliniat. Setul este împărțit în trei părți:

  • dev (dezvoltare) — pentru ajustarea modelelor.
  • devtest (testare intermediară) — pentru evaluarea preliminară.
  • test (testare finală) — parte ascunsă pentru compararea corectă a modelelor în competiții.

Pentru desemnarea limbilor se folosește standardul ISO 639-3 cu indicarea scriptului, de exemplu, `eng_Latn` pentru engleză cu alfabet latin sau `rus_Cyrl` pentru rusă cu alfabet chirilic[5].

Utilizare și importanță

FLORES-200 a devenit un standard esențial pentru evaluarea sistemelor multilingve de traducere automată. A fost utilizat pentru evaluarea modelului emblematic al Meta — NLLB-200. Testarea pe FLORES-200 a arătat că NLLB-200 a îmbunătățit calitatea traducerii în medie cu 44% conform metricii BLEU față de cele mai bune sisteme anterioare[6]. Pentru unele limbi din Africa și India, creșterea preciziei a depășit 70%[4].

Meta a oferit acces liber la dataset și la instrumentele de utilizare a acestuia sub licența Creative Commons BY-SA 4.0. Datorită acestui fapt, FLORES-200 a câștigat rapid o largă răspândire și a devenit standardul de facto în lucrările științifice, competițiile de traducere automată (de exemplu, WMT) și inițiativele de prezervare a limbilor. În 2023, comunitatea OLDI (Open Language Data Initiative) a început extinderea corpusului sub denumirea FLORES+[2].

Referințe

  • Dataset-ul oficial pe Hugging Face
  • Depozitul oficial pe GitHub

Bibliografie

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Note

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]