FLORES-200 (FA)
FLORES-200 — یک مجموعه داده ارزیابی برای ترجمه ماشینی چندزبانه است که حدود ۲۰۰ زبان جهان را پوشش میدهد. این مجموعه توسط پژوهشگران شرکت Meta در چارچوب پروژه No Language Left Behind (NLLB) ایجاد شده و در سال ۲۰۲۲ معرفی شد. FLORES-200 گسترشی از مجموعه پیشین FLORES-101 است و برای ارزیابی عینی کیفیت ترجمه، بهویژه در زبانهای کممنبع، طراحی شده است[1].
ویژگی کلیدی این dataset آن است که تمام متون توسط مترجمان حرفهای ترجمه شدهاند، که این امر کیفیت بالای ترجمههای مرجع را تضمین کرده و آن را به یک استاندارد معتبر برای مقایسه سیستمهای ترجمه ماشینی تبدیل میکند[2].
پیشینه و ایجاد مجموعه
نسخه اول، FLORES-101، در سال ۲۰۲۲ معرفی شد و شامل ۳۰۰۱ جمله از ویکیپدیای انگلیسیزبان بود که به ۱۰۱ زبان ترجمه شده بودند[3]. این مجموعه شکاف مهمی را در ارزیابی سیستمهای ترجمه برای زبانهای کمداده پر کرد.
در سال ۲۰۲۲، در چارچوب پروژه No Language Left Behind، شرکت Meta پیکره را تا ۲۰۰ زبان گسترش داد و FLORES-200 را ایجاد کرد[4]. در فرایند توسعه با چالشهایی روبهرو شدند:
- بسیاری از زبانهای افزودهشده استانداردسازی پایینی داشتند و متخصصان دوزبانه کافی برای آنها وجود نداشت.
- برخی زبانها نه مستقیم از انگلیسی، بلکه از طریق زبانهای واسطه (اسپانیایی، فرانسوی، روسی) ترجمه شدند.
- برای بعضی زبانها، خطهای نوشتاری مختلف (مانند لاتین و سیریلیک) گنجانده شد تا کاربرد آنها در جوامع گوناگون لحاظ شود[5].
ترکیب و ساختار
پیکره FLORES-200 شامل ۳۰۰۱ جمله است که از ۸۴۲ مقاله وب و سند متعلق به پروژههای Wikimedia انتخاب شدهاند. برخلاف نسخه اول، منابع تنها ویکیپدیا نیستند، بلکه پروژههای دیگری مانند Wikinews، Wikijunior و Wikivoyage نیز در آنها گنجانده شدهاند. این امر تنوع موضوعی گستردهای (خبر، علم، فرهنگ، سفر) فراهم میکند که امکان ارزیابی جامع کیفیت ترجمه را میدهد.
هر جمله انگلیسی بهصورت حرفهای به حدود ۲۰۰ زبان هدف ترجمه شده و یک پیکره موازی کاملاً ترازشده را تشکیل میدهد. مجموعه به سه بخش تقسیم شده است:
- dev (توسعه) — برای تنظیم مدلها.
- devtest (آزمایش میانی) — برای ارزیابی مقدماتی.
- test (آزمایش نهایی) — بخش پنهان برای مقایسه منصفانه مدلها در مسابقات.
برای نامگذاری زبانها از استاندارد ISO 639-3 همراه با مشخصکردن خط نوشتاری استفاده میشود؛ برای نمونه، `eng_Latn` برای انگلیسی با خط لاتین یا `rus_Cyrl` برای روسی با خط سیریلیک[5].
کاربرد و اهمیت
FLORES-200 به استاندارد کلیدی برای ارزیابی سیستمهای ترجمه ماشینی چندزبانه تبدیل شده است. این مجموعه برای ارزیابی مدل پیشرو Meta یعنی NLLB-200 به کار رفت. آزمایش روی FLORES-200 نشان داد که NLLB-200 کیفیت ترجمه را بهطور میانگین ۴۴٪ بر اساس معیار BLEU نسبت به بهترین سیستمهای پیشین بهبود داده است[6]. برای برخی زبانهای آفریقا و هند، افزایش دقت از ۷۰٪ نیز فراتر رفت[4].
Meta دسترسی آزاد به dataset و ابزارهای مربوط به آن را تحت مجوز Creative Commons BY-SA 4.0 فراهم کرد. به همین دلیل، FLORES-200 بهسرعت گسترش یافت و به استاندارد de facto در پژوهشهای علمی، مسابقات ترجمه ماشینی (مانند WMT) و ابتکارات حفظ زبانها تبدیل شد. در سال ۲۰۲۳، جامعه OLDI (Open Language Data Initiative) گسترش پیکره را تحت عنوان FLORES+ آغاز کرد[2].
پیوندها
- مجموعه داده رسمی در Hugging Face
- مخزن رسمی در GitHub
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ «FLoRes-200 Dataset». Papers With Code. [۱]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [۲]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [۳]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [۴]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [۵]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [۶]