FLORES-200 (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — това е оценъчен набор от данни за многоезичен машинен превод, обхващащ около 200 езика по света. Той е създаден от изследователи на компанията Meta в рамките на проекта No Language Left Behind (NLLB) и е представен през 2022 година. FLORES-200 е разширение на предишния набор FLORES-101 и е предназначен за обективна оценка на качеството на превода, особено за езици с малко ресурси[1].

Ключова особеност на dataset-а е, че всички текстове са преведени от професионални преводачи, което осигурява високо качество на еталонните преводи и го прави надежден стандарт за сравняване на системи за машинен превод[2].

Предистория и създаване на набора

Първата версия, FLORES-101, е представена през 2022 година и съдържа 3001 изречения от англоезичната Уикипедия, преведени на 101 езика[3]. Този набор запълва важна празнина в оценяването на системите за превод за езици с малко данни.

През 2022 година в рамките на проекта No Language Left Behind компанията Meta разширява корпуса до 200 езика, създавайки FLORES-200[4]. Разработката се сблъска с редица трудности:

  • Много от добавените езици имаха ниска стандартизация и недостиг на двуезични специалисти.
  • Част от езиците бяха преведени не директно от английски, а чрез езици-посредници (испански, френски, руски).
  • За някои езици бяха включени различни писмени системи (например латиница и кирилица), за да се отчете употребата им в различни общности[5].

Състав и структура

Корпусът FLORES-200 включва 3001 изречения, подбрани от 842 различни уеб статии и документи на проектите на Wikimedia. За разлика от първата версия, източниците включват не само Уикипедия, но и други проекти като Wikinews, Wikijunior и Wikivoyage. Това осигурява широко тематично разнообразие (новини, наука, култура, пътувания), което позволява всестранна проверка на качеството на превода.

Всяко английско изречение е професионално преведено на ~200 целеви езика, образувайки напълно изравнен паралелен корпус. Наборът е разделен на три части:

  • dev (разработка) — за настройване на модели.
  • devtest (междинно тестване) — за предварителна оценка.
  • test (финално тестване) — скрита част за честно сравняване на модели в състезания.

За означаване на езиците се използва стандартът ISO 639-3 с указване на скрипта, например `eng_Latn` за английски на латиница или `rus_Cyrl` за руски на кирилица[5].

Приложение и значение

FLORES-200 се превърна в ключов стандарт за оценка на многоезични системи за машинен превод. Той беше използван за оценка на флагманския модел на Meta — NLLB-200. Тестването върху FLORES-200 показа, че NLLB-200 подобрява качеството на превода средно с 44% по метриката BLEU в сравнение с предишните най-добри системи[6]. За някои езици в Африка и Индия нарастването на точността надвишава 70%[4].

Meta предоставя свободен достъп до dataset-а и инструментите за използването му под лиценза Creative Commons BY-SA 4.0. Благодарение на това FLORES-200 бързо получи широко разпространение и се превърна в де факто стандарт в научните трудове, в състезанията по машинен превод (например WMT) и в инициативите за опазване на езиците. През 2023 година общността OLDI (Open Language Data Initiative) започна да разширява корпуса под наименованието FLORES+[2].

Препратки

  • Официален dataset на Hugging Face
  • Официално хранилище на GitHub

Литература

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Бележки

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]