FLORES-200 (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — یک مجموعه داده ارزیابی برای ترجمه ماشینی چندزبانه است که حدود ۲۰۰ زبان جهان را پوشش می‌دهد. این مجموعه توسط پژوهشگران شرکت Meta در چارچوب پروژه No Language Left Behind (NLLB) ایجاد شده و در سال ۲۰۲۲ معرفی شد. FLORES-200 گسترشی از مجموعه پیشین FLORES-101 است و برای ارزیابی عینی کیفیت ترجمه، به‌ویژه در زبان‌های کم‌منبع، طراحی شده است[1].

ویژگی کلیدی این dataset آن است که تمام متون توسط مترجمان حرفه‌ای ترجمه شده‌اند، که این امر کیفیت بالای ترجمه‌های مرجع را تضمین کرده و آن را به یک استاندارد معتبر برای مقایسه سیستم‌های ترجمه ماشینی تبدیل می‌کند[2].

پیشینه و ایجاد مجموعه

نسخه اول، FLORES-101، در سال ۲۰۲۲ معرفی شد و شامل ۳۰۰۱ جمله از ویکی‌پدیای انگلیسی‌زبان بود که به ۱۰۱ زبان ترجمه شده بودند[3]. این مجموعه شکاف مهمی را در ارزیابی سیستم‌های ترجمه برای زبان‌های کم‌داده پر کرد.

در سال ۲۰۲۲، در چارچوب پروژه No Language Left Behind، شرکت Meta پیکره را تا ۲۰۰ زبان گسترش داد و FLORES-200 را ایجاد کرد[4]. در فرایند توسعه با چالش‌هایی روبه‌رو شدند:

  • بسیاری از زبان‌های افزوده‌شده استانداردسازی پایینی داشتند و متخصصان دوزبانه کافی برای آن‌ها وجود نداشت.
  • برخی زبان‌ها نه مستقیم از انگلیسی، بلکه از طریق زبان‌های واسطه (اسپانیایی، فرانسوی، روسی) ترجمه شدند.
  • برای بعضی زبان‌ها، خط‌های نوشتاری مختلف (مانند لاتین و سیریلیک) گنجانده شد تا کاربرد آن‌ها در جوامع گوناگون لحاظ شود[5].

ترکیب و ساختار

پیکره FLORES-200 شامل ۳۰۰۱ جمله است که از ۸۴۲ مقاله وب و سند متعلق به پروژه‌های Wikimedia انتخاب شده‌اند. برخلاف نسخه اول، منابع تنها ویکی‌پدیا نیستند، بلکه پروژه‌های دیگری مانند Wikinews، Wikijunior و Wikivoyage نیز در آن‌ها گنجانده شده‌اند. این امر تنوع موضوعی گسترده‌ای (خبر، علم، فرهنگ، سفر) فراهم می‌کند که امکان ارزیابی جامع کیفیت ترجمه را می‌دهد.

هر جمله انگلیسی به‌صورت حرفه‌ای به حدود ۲۰۰ زبان هدف ترجمه شده و یک پیکره موازی کاملاً تراز‌شده را تشکیل می‌دهد. مجموعه به سه بخش تقسیم شده است:

  • dev (توسعه) — برای تنظیم مدل‌ها.
  • devtest (آزمایش میانی) — برای ارزیابی مقدماتی.
  • test (آزمایش نهایی) — بخش پنهان برای مقایسه منصفانه مدل‌ها در مسابقات.

برای نام‌گذاری زبان‌ها از استاندارد ISO 639-3 همراه با مشخص‌کردن خط نوشتاری استفاده می‌شود؛ برای نمونه، `eng_Latn` برای انگلیسی با خط لاتین یا `rus_Cyrl` برای روسی با خط سیریلیک[5].

کاربرد و اهمیت

FLORES-200 به استاندارد کلیدی برای ارزیابی سیستم‌های ترجمه ماشینی چندزبانه تبدیل شده است. این مجموعه برای ارزیابی مدل پیشرو Meta یعنی NLLB-200 به کار رفت. آزمایش روی FLORES-200 نشان داد که NLLB-200 کیفیت ترجمه را به‌طور میانگین ۴۴٪ بر اساس معیار BLEU نسبت به بهترین سیستم‌های پیشین بهبود داده است[6]. برای برخی زبان‌های آفریقا و هند، افزایش دقت از ۷۰٪ نیز فراتر رفت[4].

Meta دسترسی آزاد به dataset و ابزارهای مربوط به آن را تحت مجوز Creative Commons BY-SA 4.0 فراهم کرد. به همین دلیل، FLORES-200 به‌سرعت گسترش یافت و به استاندارد de facto در پژوهش‌های علمی، مسابقات ترجمه ماشینی (مانند WMT) و ابتکارات حفظ زبان‌ها تبدیل شد. در سال ۲۰۲۳، جامعه OLDI (Open Language Data Initiative) گسترش پیکره را تحت عنوان FLORES+ آغاز کرد[2].

پیوندها

  • مجموعه داده رسمی در Hugging Face
  • مخزن رسمی در GitHub

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. «FLoRes-200 Dataset». Papers With Code. [۱]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [۲]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [۳]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [۴]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [۵]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [۶]