FLORES-200 (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — ito ay isang ebalwasyon na dataset para sa maramihang-wikang machine translation, sumasaklaw sa halos 200 wika sa buong mundo. Ito ay nilikha ng mga mananaliksik ng kumpanyang Meta bilang bahagi ng proyektong No Language Left Behind (NLLB) at ipinakita noong 2022. Ang FLORES-200 ay isang pagpapalawak ng naunang dataset na FLORES-101 at inilaan para sa layuning pagtatasa ng kalidad ng pagsasalin, lalo na sa mga wikang may limitadong mapagkukunan[1].

Ang pangunahing katangian ng dataset ay ang lahat ng teksto ay isinalin ng mga propesyonal na tagapagsalin, na tinitiyak ang mataas na kalidad ng mga sangguniang pagsasalin at ginagawa itong maaasahang pamantayan para sa paghahambing ng mga sistema ng machine translation[2].

Kasaysayan at paglikha ng dataset

Ang unang bersyon, FLORES-101, ay ipinakita noong 2022 at naglaman ng 3001 pangungusap mula sa Ingles na Wikipedia, na isinalin sa 101 wika[3]. Pinunan ng dataset na ito ang isang mahalagang puwang sa pagtatasa ng mga sistema ng pagsasalin para sa mga wikang may kakaunting datos.

Noong 2022, sa loob ng proyektong No Language Left Behind, pinalawak ng Meta ang corpus sa 200 wika, na lumikha ng FLORES-200[4]. Nakaharap ang pagbuo sa ilang mga hamon:

  • Maraming mga wikang idinagdag ay may mababang antas ng standardisasyon at kakulangan ng mga bilingwal na espesyalista.
  • Ang ilang bahagi ng mga wika ay hindi direktang isinalin mula sa Ingles kundi sa pamamagitan ng mga intermediate na wika (Espanyol, Pranses, Ruso).
  • Para sa ilang wika, kasama ang iba't ibang sistema ng pagsulat (halimbawa, Latin at Cyrillic) upang isaalang-alang ang kanilang paggamit sa iba't ibang komunidad[5].

Nilalaman at istraktura

Ang corpus ng FLORES-200 ay binubuo ng 3001 pangungusap, na pinili mula sa 842 iba't ibang web na artikulo at dokumento ng mga proyekto ng Wikimedia. Hindi tulad ng unang bersyon, ang mga pinagkukunan ay kinabibilangan hindi lamang ng Wikipedia kundi pati na rin ng iba pang mga proyekto tulad ng Wikinews, Wikijunior at Wikivoyage. Tinitiyak nito ang malawak na pagkakaiba-iba ng paksa (balita, agham, kultura, paglalakbay), na nagbibigay-daan sa komprehensibong pagsusuri ng kalidad ng pagsasalin.

Bawat Ingles na pangungusap ay propesyonal na isinalin sa ~200 target na wika, na bumubuo ng ganap na nakahanay na parallel corpus. Ang dataset ay nahahati sa tatlong bahagi:

  • dev (pagpapaunlad) — para sa pag-aayos ng mga modelo.
  • devtest (intermediate na pagsubok) — para sa paunang pagtatasa.
  • test (panghuling pagsubok) — nakatagong bahagi para sa makatarungang paghahambing ng mga modelo sa mga paligsahan.

Para sa pagtukoy ng mga wika, ginagamit ang pamantayang ISO 639-3 na may indikasyon ng script, halimbawa, `eng_Latn` para sa Ingles sa Latin na titik o `rus_Cyrl` para sa Ruso sa Cyrillic na titik[5].

Paggamit at kahalagahan

Ang FLORES-200 ay naging pangunahing pamantayan para sa pagtatasa ng mga maramihang-wikang sistema ng machine translation. Ginamit ito para sa pagtatasa ng pangunahing modelo ng Meta — NLLB-200. Ipinakita ng pagsubok sa FLORES-200 na ang NLLB-200 ay nagpabuti ng kalidad ng pagsasalin nang average na 44% ayon sa sukatan ng BLEU kumpara sa mga naunang pinakamahusay na sistema[6]. Para sa ilang wika ng Africa at India, ang pagtaas ng katumpakan ay lumampas sa 70%[4].

Binuksan ng Meta ang libreng access sa dataset at sa mga kasangkapan para sa paggamit nito sa ilalim ng lisensyang Creative Commons BY-SA 4.0. Dahil dito, ang FLORES-200 ay mabilis na kumalat at naging de facto na pamantayan sa mga siyentipikong gawa, mga paligsahan sa machine translation (halimbawa, WMT) at mga inisyatiba sa pangangalaga ng wika. Noong 2023, sinimulan ng komunidad na OLDI (Open Language Data Initiative) na palawakin ang corpus sa ilalim ng pangalang FLORES+[2].

Mga Sanggunian

  • Opisyal na dataset sa Hugging Face
  • Opisyal na repositoryo sa GitHub

Literatura

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Mga Tala

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]