FLORES-200 (BN)
FLORES-200 — এটি একটি মূল্যায়ন dataset যা বহুভাষিক machine translation-এর জন্য তৈরি, যা বিশ্বের প্রায় ২০০টি ভাষাকে অন্তর্ভুক্ত করে। এটি Meta কোম্পানির গবেষকরা No Language Left Behind (NLLB) প্রকল্পের অংশ হিসেবে তৈরি করেছেন এবং ২০২২ সালে উপস্থাপন করেছেন। FLORES-200 হলো পূর্ববর্তী FLORES-101 dataset-এর একটি সম্প্রসারণ এবং এটি বিশেষত স্বল্প-সম্পদ ভাষাগুলোর ক্ষেত্রে অনুবাদের মান নিরপেক্ষভাবে মূল্যায়নের জন্য ডিজাইন করা হয়েছে[1]।
এই dataset-এর মূল বৈশিষ্ট্য হলো সমস্ত পাঠ্য পেশাদার অনুবাদকদের দ্বারা অনুবাদ করা হয়েছে, যা রেফারেন্স অনুবাদের উচ্চমান নিশ্চিত করে এবং machine translation সিস্টেম তুলনার জন্য এটিকে একটি নির্ভরযোগ্য মানদণ্ডে পরিণত করে[2]।
dataset-এর পটভূমি এবং নির্মাণ
প্রথম সংস্করণ, FLORES-101, ২০২২ সালে উপস্থাপিত হয়েছিল এবং এতে ইংরেজি Wikipedia থেকে নেওয়া ৩০০১টি বাক্য ছিল, যা ১০১টি ভাষায় অনুবাদ করা হয়েছিল[3]। এই dataset স্বল্প-ডেটা ভাষার অনুবাদ সিস্টেম মূল্যায়নের একটি গুরুত্বপূর্ণ শূন্যস্থান পূরণ করেছিল।
২০২২ সালে No Language Left Behind প্রকল্পের অংশ হিসেবে Meta corpus-টি ২০০ ভাষায় সম্প্রসারিত করে FLORES-200 তৈরি করে[4]। এই উন্নয়নে বেশ কিছু চ্যালেঞ্জের মুখোমুখি হতে হয়েছিল:
- নতুন যুক্ত হওয়া অনেক ভাষায় মানকীকরণের মাত্রা কম ছিল এবং দ্বিভাষিক বিশেষজ্ঞের অভাব ছিল।
- কিছু ভাষায় সরাসরি ইংরেজি থেকে নয়, বরং মধ্যবর্তী ভাষা (স্পেনীয়, ফরাসি, রুশ) হয়ে অনুবাদ করা হয়েছিল।
- কিছু ভাষার জন্য বিভিন্ন লিখন পদ্ধতি (যেমন, লাতিন ও সিরিলিক) অন্তর্ভুক্ত করা হয়েছিল, যাতে বিভিন্ন সম্প্রদায়ে তাদের ব্যবহার প্রতিফলিত হয়[5]।
গঠন ও কাঠামো
FLORES-200 corpus-এ ৩০০১টি বাক্য রয়েছে, যা Wikimedia প্রকল্পের ৮৪২টি বিভিন্ন ওয়েব-নিবন্ধ ও নথি থেকে বাছাই করা হয়েছে। প্রথম সংস্করণের বিপরীতে, এখানে শুধু Wikipedia নয়, Wikinews, Wikijunior ও Wikivoyage-এর মতো অন্যান্য প্রকল্পও উৎস হিসেবে অন্তর্ভুক্ত রয়েছে। এটি বিষয়ভিত্তিক বৈচিত্র্য নিশ্চিত করে (সংবাদ, বিজ্ঞান, সংস্কৃতি, ভ্রমণ), যা অনুবাদের মান সামগ্রিকভাবে যাচাই করতে সহায়তা করে।
প্রতিটি ইংরেজি বাক্য পেশাদারভাবে প্রায় ২০০টি লক্ষ্য ভাষায় অনুবাদ করা হয়েছে, যা একটি সম্পূর্ণ সংরেখিত parallel corpus গঠন করেছে। dataset-টি তিনটি অংশে বিভক্ত:
- dev (উন্নয়ন) — মডেল সমন্বয়ের জন্য।
- devtest (মধ্যবর্তী পরীক্ষা) — প্রাথমিক মূল্যায়নের জন্য।
- test (চূড়ান্ত পরীক্ষা) — প্রতিযোগিতায় মডেলের নিরপেক্ষ তুলনার জন্য গোপন অংশ।
ভাষা চিহ্নিত করতে ISO 639-3 মান ব্যবহার করা হয়, যেখানে লিপির উল্লেখও থাকে, যেমন ইংরেজির লাতিন লিপির জন্য `eng_Latn` বা রুশ ভাষার সিরিলিক লিপির জন্য `rus_Cyrl`[5]।
প্রয়োগ ও গুরুত্ব
FLORES-200 বহুভাষিক machine translation সিস্টেম মূল্যায়নের একটি মূল মানদণ্ডে পরিণত হয়েছে। এটি Meta-এর ফ্ল্যাগশিপ মডেল — NLLB-200 মূল্যায়নে ব্যবহৃত হয়েছিল। FLORES-200-এ পরীক্ষার ফলাফলে দেখা গেছে যে NLLB-200 BLEU মেট্রিকে পূর্ববর্তী সেরা সিস্টেমগুলোর তুলনায় গড়ে ৪৪% অনুবাদের মান উন্নত করেছে[6]। আফ্রিকা ও ভারতের কিছু ভাষার ক্ষেত্রে নির্ভুলতার উন্নতি ৭০%-এরও বেশি হয়েছে[4]।
Meta dataset ও ব্যবহারের সরঞ্জামগুলো Creative Commons BY-SA 4.0 লাইসেন্সের অধীনে বিনামূল্যে উন্মুক্ত করে দিয়েছে। এর ফলে FLORES-200 দ্রুত ব্যাপক প্রচলন লাভ করেছে এবং বৈজ্ঞানিক গবেষণাপত্র, machine translation প্রতিযোগিতা (যেমন WMT) ও ভাষা সংরক্ষণ উদ্যোগে কার্যত একটি মানদণ্ডে পরিণত হয়েছে। ২০২৩ সালে OLDI (Open Language Data Initiative) সম্প্রদায় FLORES+ নামে corpus-টি সম্প্রসারিত করতে শুরু করে[2]।
তথ্যসূত্র
- Hugging Face-এ অফিসিয়াল dataset
- GitHub-এ অফিসিয়াল রিপোজিটরি
সাহিত্য
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
টীকা
- ↑ «FLoRes-200 Dataset». Papers With Code. [১]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [২]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [৩]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [৪]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [৫]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [৬]