FLORES-200 (UR)
FLORES-200 — یہ کثیر اللسانی مشین ترجمے کے لیے ایک تشخیصی dataset ہے جو دنیا کی تقریباً 200 زبانوں کو محیط ہے۔ اسے Meta کمپنی کے محققین نے No Language Left Behind (NLLB) منصوبے کے تحت تیار کیا اور 2022 میں پیش کیا۔ FLORES-200 پچھلے dataset FLORES-101 کی توسیع ہے اور خصوصاً کم وسائل والی زبانوں میں ترجمے کے معیار کی معروضی جانچ کے لیے وضع کیا گیا ہے[1]۔
اس dataset کی کلیدی خصوصیت یہ ہے کہ تمام متون پیشہ ور مترجمین نے ترجمہ کیے ہیں، جس سے حوالہ جاتی ترجمے اعلیٰ معیار کے ہیں اور یہ مشین ترجمے کے نظاموں کے موازنے کے لیے ایک قابلِ اعتماد معیار بن گیا ہے[2]۔
پس منظر اور تخلیق
پہلا ورژن، FLORES-101، 2022 میں پیش کیا گیا اور اس میں انگریزی ویکیپیڈیا سے لیے گئے 3001 جملے شامل تھے جنہیں 101 زبانوں میں ترجمہ کیا گیا تھا[3]۔ اس dataset نے کم ڈیٹا والی زبانوں کے ترجمے کے نظاموں کی جانچ میں ایک اہم خلا پُر کیا۔
2022 میں No Language Left Behind منصوبے کے تحت Meta نے corpus کو 200 زبانوں تک وسعت دیتے ہوئے FLORES-200 تخلیق کیا[4]۔ اس کی تیاری میں کئی مشکلات پیش آئیں:
- شامل کی گئی بہت سی زبانوں میں معیاربندی کم اور دوزبانی ماہرین کی کمی تھی۔
- کچھ زبانوں کا ترجمہ براہِ راست انگریزی سے نہیں بلکہ واسطہ زبانوں (ہسپانوی، فرانسیسی، روسی) کے ذریعے کیا گیا۔
- بعض زبانوں کے لیے مختلف رسم الخط (مثلاً لاطینی اور سیریلک) شامل کیے گئے تاکہ مختلف برادریوں میں ان کے استعمال کو مدنظر رکھا جا سکے[5]۔
ساخت اور تشکیل
FLORES-200 corpus میں 3001 جملے شامل ہیں جو Wikimedia کے 842 مختلف ویب مضامین اور دستاویزات سے منتخب کیے گئے ہیں۔ پہلے ورژن کے برعکس، ذرائع میں نہ صرف ویکیپیڈیا بلکہ Wikinews، Wikijunior اور Wikivoyage جیسے دیگر منصوبے بھی شامل ہیں۔ اس سے موضوعاتی تنوع وسیع ہو جاتا ہے (خبریں، سائنس، ثقافت، سفر)، جو ترجمے کے معیار کی جامع جانچ ممکن بناتا ہے۔
ہر انگریزی جملے کا پیشہ ورانہ طور پر تقریباً 200 ہدفی زبانوں میں ترجمہ کیا گیا، جس سے ایک مکمل ہم ترازی یافتہ متوازی corpus بنا۔ Dataset تین حصوں میں تقسیم ہے:
- dev (ترقی) — ماڈلز کی ترتیب کے لیے۔
- devtest (درمیانی جانچ) — ابتدائی تشخیص کے لیے۔
- test (حتمی جانچ) — مقابلوں میں ماڈلز کے منصفانہ موازنے کے لیے پوشیدہ حصہ۔
زبانوں کی نشاندہی کے لیے ISO 639-3 معیار رسم الخط کے تعین کے ساتھ استعمال کیا جاتا ہے، مثلاً انگریزی لاطینی رسم الخط کے لیے `eng_Latn` یا روسی سیریلک رسم الخط کے لیے `rus_Cyrl`[5]۔
اطلاق اور اہمیت
FLORES-200 کثیر اللسانی مشین ترجمے کے نظاموں کی جانچ کا ایک کلیدی معیار بن گیا ہے۔ اسے Meta کے اہم ماڈل — NLLB-200 — کی تشخیص کے لیے استعمال کیا گیا۔ FLORES-200 پر جانچ سے ظاہر ہوا کہ NLLB-200 نے BLEU میٹرک کے اعتبار سے پچھلے بہترین نظاموں کے مقابلے میں اوسطاً 44% ترجمے کے معیار میں بہتری لائی[6]۔ افریقہ اور ہندوستان کی بعض زبانوں میں درستگی میں اضافہ 70% سے بھی زیادہ رہا[4]۔
Meta نے dataset اور اسے استعمال کرنے کے اوزاروں تک Creative Commons BY-SA 4.0 لائسنس کے تحت کھلی رسائی فراہم کی۔ اس کی بدولت FLORES-200 تیزی سے مقبول ہوا اور علمی تحقیقات، مشین ترجمے کے مقابلوں (مثلاً WMT) اور زبانوں کے تحفظ کی کوششوں میں عملاً ایک معیار بن گیا۔ 2023 میں OLDI (Open Language Data Initiative) برادری نے FLORES+ کے نام سے corpus کو مزید وسعت دینا شروع کیا[2]۔
روابط
- Hugging Face پر سرکاری dataset
- GitHub پر سرکاری ذخیرہ
کتابیات
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
حواشی
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]