FLORES-200 (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — è un dataset di valutazione per la traduzione automatica multilingue, che copre circa 200 lingue del mondo. È stato creato dai ricercatori della società Meta nell'ambito del progetto No Language Left Behind (NLLB) ed è stato presentato nel 2022. FLORES-200 è un'estensione del precedente dataset FLORES-101 ed è destinato alla valutazione obiettiva della qualità della traduzione, in particolare per le lingue a basse risorse[1].

La caratteristica principale del dataset è che tutti i testi sono stati tradotti da traduttori professionisti, il che garantisce un'alta qualità delle traduzioni di riferimento e lo rende uno standard affidabile per il confronto tra sistemi di traduzione automatica[2].

Contesto e creazione del dataset

La prima versione, FLORES-101, è stata presentata nel 2022 e conteneva 3001 frasi tratte da Wikipedia in lingua inglese, tradotte in 101 lingue[3]. Questo dataset ha colmato un'importante lacuna nella valutazione dei sistemi di traduzione per le lingue con scarsità di dati.

Nel 2022, nell'ambito del progetto No Language Left Behind, la società Meta ha ampliato il corpus fino a 200 lingue, creando FLORES-200[4]. Lo sviluppo ha incontrato una serie di difficoltà:

  • Molte delle lingue aggiunte presentavano una bassa standardizzazione e una carenza di specialisti bilingui.
  • Alcune lingue sono state tradotte non direttamente dall'inglese, ma tramite lingue intermediarie (spagnolo, francese, russo).
  • Per alcune lingue sono stati inclusi diversi sistemi di scrittura (ad esempio, alfabeto latino e cirillico), per tenere conto del loro utilizzo in comunità differenti[5].

Composizione e struttura

Il corpus FLORES-200 comprende 3001 frasi, selezionate da 842 diversi articoli web e documenti dei progetti Wikimedia. A differenza della prima versione, le fonti includono non solo Wikipedia, ma anche altri progetti come Wikinews, Wikijunior e Wikivoyage. Ciò garantisce un'ampia varietà tematica (notizie, scienza, cultura, viaggi), che consente una valutazione completa della qualità della traduzione.

Ogni frase inglese è stata tradotta professionalmente in ~200 lingue di destinazione, formando un corpus parallelo completamente allineato. Il dataset è suddiviso in tre parti:

  • dev (sviluppo) — per la messa a punto dei modelli.
  • devtest (test intermedio) — per la valutazione preliminare.
  • test (test finale) — la parte nascosta per un confronto equo tra i modelli nelle competizioni.

Per la designazione delle lingue viene utilizzato lo standard ISO 639-3 con l'indicazione dello script, ad esempio `eng_Latn` per l'inglese in alfabeto latino o `rus_Cyrl` per il russo in alfabeto cirillico[5].

Applicazione e importanza

FLORES-200 è diventato uno standard fondamentale per la valutazione dei sistemi di traduzione automatica multilingue. È stato utilizzato per valutare il modello di punta di Meta — NLLB-200. I test su FLORES-200 hanno dimostrato che NLLB-200 ha migliorato la qualità della traduzione in media del 44% secondo la metrica BLEU rispetto ai precedenti migliori sistemi[6]. Per alcune lingue dell'Africa e dell'India, il miglioramento della precisione ha superato il 70%[4].

Meta ha reso liberamente accessibile il dataset e gli strumenti per il suo utilizzo sotto la licenza Creative Commons BY-SA 4.0. Grazie a ciò, FLORES-200 si è rapidamente diffuso ed è diventato lo standard de facto nei lavori scientifici, nelle competizioni di traduzione automatica (ad esempio, WMT) e nelle iniziative per la preservazione delle lingue. Nel 2023, la comunità OLDI (Open Language Data Initiative) ha iniziato ad ampliare il corpus con il nome FLORES+[2].

Riferimenti

  • Dataset ufficiale su Hugging Face
  • Repository ufficiale su GitHub

Bibliografia

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Note

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]