FLORES-200 (BG)
FLORES-200 — това е оценъчен набор от данни за многоезичен машинен превод, обхващащ около 200 езика по света. Той е създаден от изследователи на компанията Meta в рамките на проекта No Language Left Behind (NLLB) и е представен през 2022 година. FLORES-200 е разширение на предишния набор FLORES-101 и е предназначен за обективна оценка на качеството на превода, особено за езици с малко ресурси[1].
Ключова особеност на dataset-а е, че всички текстове са преведени от професионални преводачи, което осигурява високо качество на еталонните преводи и го прави надежден стандарт за сравняване на системи за машинен превод[2].
Предистория и създаване на набора
Първата версия, FLORES-101, е представена през 2022 година и съдържа 3001 изречения от англоезичната Уикипедия, преведени на 101 езика[3]. Този набор запълва важна празнина в оценяването на системите за превод за езици с малко данни.
През 2022 година в рамките на проекта No Language Left Behind компанията Meta разширява корпуса до 200 езика, създавайки FLORES-200[4]. Разработката се сблъска с редица трудности:
- Много от добавените езици имаха ниска стандартизация и недостиг на двуезични специалисти.
- Част от езиците бяха преведени не директно от английски, а чрез езици-посредници (испански, френски, руски).
- За някои езици бяха включени различни писмени системи (например латиница и кирилица), за да се отчете употребата им в различни общности[5].
Състав и структура
Корпусът FLORES-200 включва 3001 изречения, подбрани от 842 различни уеб статии и документи на проектите на Wikimedia. За разлика от първата версия, източниците включват не само Уикипедия, но и други проекти като Wikinews, Wikijunior и Wikivoyage. Това осигурява широко тематично разнообразие (новини, наука, култура, пътувания), което позволява всестранна проверка на качеството на превода.
Всяко английско изречение е професионално преведено на ~200 целеви езика, образувайки напълно изравнен паралелен корпус. Наборът е разделен на три части:
- dev (разработка) — за настройване на модели.
- devtest (междинно тестване) — за предварителна оценка.
- test (финално тестване) — скрита част за честно сравняване на модели в състезания.
За означаване на езиците се използва стандартът ISO 639-3 с указване на скрипта, например `eng_Latn` за английски на латиница или `rus_Cyrl` за руски на кирилица[5].
Приложение и значение
FLORES-200 се превърна в ключов стандарт за оценка на многоезични системи за машинен превод. Той беше използван за оценка на флагманския модел на Meta — NLLB-200. Тестването върху FLORES-200 показа, че NLLB-200 подобрява качеството на превода средно с 44% по метриката BLEU в сравнение с предишните най-добри системи[6]. За някои езици в Африка и Индия нарастването на точността надвишава 70%[4].
Meta предоставя свободен достъп до dataset-а и инструментите за използването му под лиценза Creative Commons BY-SA 4.0. Благодарение на това FLORES-200 бързо получи широко разпространение и се превърна в де факто стандарт в научните трудове, в състезанията по машинен превод (например WMT) и в инициативите за опазване на езиците. През 2023 година общността OLDI (Open Language Data Initiative) започна да разширява корпуса под наименованието FLORES+[2].
Препратки
- Официален dataset на Hugging Face
- Официално хранилище на GitHub
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Бележки
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]