---
title: "FLORES-200 (BN)"
source: "https://systems-analysis.info/int/FLORES-200_(BN)"
wiki: "systems-analysis.info/int"
article: "FLORES-200_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2081
wiki_created_at: 2026-09-06T22:58:19Z
wiki_modified_at: 2026-09-06T22:58:19Z
downloaded_at: 2026-09-07T22:49:14Z
---

# FLORES-200 (BN)

**FLORES-200** — এটি একটি মূল্যায়ন dataset যা বহুভাষিক machine translation-এর জন্য তৈরি, যা বিশ্বের প্রায় ২০০টি ভাষাকে অন্তর্ভুক্ত করে। এটি Meta কোম্পানির গবেষকরা **No Language Left Behind (NLLB)** প্রকল্পের অংশ হিসেবে তৈরি করেছেন এবং ২০২২ সালে উপস্থাপন করেছেন। FLORES-200 হলো পূর্ববর্তী **FLORES-101** dataset-এর একটি সম্প্রসারণ এবং এটি বিশেষত স্বল্প-সম্পদ ভাষাগুলোর ক্ষেত্রে অনুবাদের মান নিরপেক্ষভাবে মূল্যায়নের জন্য ডিজাইন করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-pwc_flores-1)</sup>।

এই dataset-এর মূল বৈশিষ্ট্য হলো সমস্ত পাঠ্য পেশাদার অনুবাদকদের দ্বারা অনুবাদ করা হয়েছে, যা রেফারেন্স অনুবাদের উচ্চমান নিশ্চিত করে এবং machine translation সিস্টেম তুলনার জন্য এটিকে একটি নির্ভরযোগ্য মানদণ্ডে পরিণত করে<sup>[\[2\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-flores_plus-2)</sup>।

## dataset-এর পটভূমি এবং নির্মাণ

প্রথম সংস্করণ, **FLORES-101**, ২০২২ সালে উপস্থাপিত হয়েছিল এবং এতে ইংরেজি Wikipedia থেকে নেওয়া ৩০০১টি বাক্য ছিল, যা ১০১টি ভাষায় অনুবাদ করা হয়েছিল<sup>[\[3\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-flores101_paper-3)</sup>। এই dataset স্বল্প-ডেটা ভাষার অনুবাদ সিস্টেম মূল্যায়নের একটি গুরুত্বপূর্ণ শূন্যস্থান পূরণ করেছিল।

২০২২ সালে **No Language Left Behind** প্রকল্পের অংশ হিসেবে Meta corpus-টি ২০০ ভাষায় সম্প্রসারিত করে **FLORES-200** তৈরি করে<sup>[\[4\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-meta_news-4)</sup>। এই উন্নয়নে বেশ কিছু চ্যালেঞ্জের মুখোমুখি হতে হয়েছিল:

- নতুন যুক্ত হওয়া অনেক ভাষায় মানকীকরণের মাত্রা কম ছিল এবং দ্বিভাষিক বিশেষজ্ঞের অভাব ছিল।
- কিছু ভাষায় সরাসরি ইংরেজি থেকে নয়, বরং মধ্যবর্তী ভাষা (স্পেনীয়, ফরাসি, রুশ) হয়ে অনুবাদ করা হয়েছিল।
- কিছু ভাষার জন্য বিভিন্ন লিখন পদ্ধতি (যেমন, লাতিন ও সিরিলিক) অন্তর্ভুক্ত করা হয়েছিল, যাতে বিভিন্ন সম্প্রদায়ে তাদের ব্যবহার প্রতিফলিত হয়<sup>[\[5\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-huggingface_flores-5)</sup>।

## গঠন ও কাঠামো

FLORES-200 corpus-এ **৩০০১টি বাক্য** রয়েছে, যা Wikimedia প্রকল্পের ৮৪২টি বিভিন্ন ওয়েব-নিবন্ধ ও নথি থেকে বাছাই করা হয়েছে। প্রথম সংস্করণের বিপরীতে, এখানে শুধু Wikipedia নয়, Wikinews, Wikijunior ও Wikivoyage-এর মতো অন্যান্য প্রকল্পও উৎস হিসেবে অন্তর্ভুক্ত রয়েছে। এটি বিষয়ভিত্তিক বৈচিত্র্য নিশ্চিত করে (সংবাদ, বিজ্ঞান, সংস্কৃতি, ভ্রমণ), যা অনুবাদের মান সামগ্রিকভাবে যাচাই করতে সহায়তা করে।

প্রতিটি ইংরেজি বাক্য পেশাদারভাবে প্রায় ২০০টি লক্ষ্য ভাষায় অনুবাদ করা হয়েছে, যা একটি সম্পূর্ণ সংরেখিত parallel corpus গঠন করেছে। dataset-টি তিনটি অংশে বিভক্ত:

- **dev** (উন্নয়ন) — মডেল সমন্বয়ের জন্য।
- **devtest** (মধ্যবর্তী পরীক্ষা) — প্রাথমিক মূল্যায়নের জন্য।
- **test** (চূড়ান্ত পরীক্ষা) — প্রতিযোগিতায় মডেলের নিরপেক্ষ তুলনার জন্য গোপন অংশ।

ভাষা চিহ্নিত করতে ISO 639-3 মান ব্যবহার করা হয়, যেখানে লিপির উল্লেখও থাকে, যেমন ইংরেজির লাতিন লিপির জন্য \`eng_Latn\` বা রুশ ভাষার সিরিলিক লিপির জন্য \`rus_Cyrl\`<sup>[\[5\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-huggingface_flores-5)</sup>।

## প্রয়োগ ও গুরুত্ব

FLORES-200 বহুভাষিক machine translation সিস্টেম মূল্যায়নের একটি মূল মানদণ্ডে পরিণত হয়েছে। এটি Meta-এর ফ্ল্যাগশিপ মডেল — **NLLB-200** মূল্যায়নে ব্যবহৃত হয়েছিল। FLORES-200-এ পরীক্ষার ফলাফলে দেখা গেছে যে NLLB-200 BLEU মেট্রিকে পূর্ববর্তী সেরা সিস্টেমগুলোর তুলনায় গড়ে **৪৪%** অনুবাদের মান উন্নত করেছে<sup>[\[6\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-nllb_paper-6)</sup>। আফ্রিকা ও ভারতের কিছু ভাষার ক্ষেত্রে নির্ভুলতার উন্নতি **৭০%**-এরও বেশি হয়েছে<sup>[\[4\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-meta_news-4)</sup>।

Meta dataset ও ব্যবহারের সরঞ্জামগুলো **Creative Commons BY-SA 4.0** লাইসেন্সের অধীনে বিনামূল্যে উন্মুক্ত করে দিয়েছে। এর ফলে FLORES-200 দ্রুত ব্যাপক প্রচলন লাভ করেছে এবং বৈজ্ঞানিক গবেষণাপত্র, machine translation প্রতিযোগিতা (যেমন WMT) ও ভাষা সংরক্ষণ উদ্যোগে কার্যত একটি মানদণ্ডে পরিণত হয়েছে। ২০২৩ সালে OLDI (Open Language Data Initiative) সম্প্রদায় **FLORES+** নামে corpus-টি সম্প্রসারিত করতে শুরু করে<sup>[\[2\]](https://systems-analysis.info/int/FLORES-200_(BN)#cite_note-flores_plus-2)</sup>।

## তথ্যসূত্র

- Hugging Face-এ অফিসিয়াল dataset
- GitHub-এ অফিসিয়াল রিপোজিটরি

## সাহিত্য

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## টীকা

1.  <span id="cite_note-pwc_flores-1">[↑](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-pwc_flores_1-0) «FLoRes-200 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/flores-200" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-flores_plus-2">↑ <sup>[2.0](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-flores_plus_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-flores_plus_2-1)</sup> «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». *Proceedings of the Ninth Conference on Machine Translation (WMT24)*. <a href="https://www2.statmt.org/wmt24/pdf/2024.wmt-1.49.pdf" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-flores101_paper-3">[↑](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-flores101_paper_3-0) Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». *Transactions of the Association for Computational Linguistics*. <a href="https://aclanthology.org/2022.tacl-1.30/" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-meta_news-4">↑ <sup>[4.0](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-meta_news_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-meta_news_4-1)</sup> «New AI Model Translates 200 Languages, Making Technology Accessible to More People». *Meta Newsroom*. <a href="https://about.fb.com/news/2022/07/new-meta-ai-model-translates-200-languages-making-technology-more-accessible/" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-huggingface_flores-5">↑ <sup>[5.0](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-huggingface_flores_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-huggingface_flores_5-1)</sup> «Muennighoff/flores200». *Hugging Face*. <a href="https://huggingface.co/datasets/Muennighoff/flores200" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-nllb_paper-6">[↑](https://systems-analysis.info/int/FLORES-200_(BN)#cite_ref-nllb_paper_6-0) Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». *arXiv:2207.04672*. <a href="https://arxiv.org/abs/2207.04672" class="external autonumber" rel="nofollow">[৬]</a></span>
