---
title: "FLORES-200 (HI)"
source: "https://systems-analysis.info/int/FLORES-200_(HI)"
wiki: "systems-analysis.info/int"
article: "FLORES-200_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2089
wiki_created_at: 2026-09-06T22:58:26Z
wiki_modified_at: 2026-09-06T22:58:26Z
downloaded_at: 2026-09-07T22:49:17Z
---

# FLORES-200 (HI)

**FLORES-200** — यह बहुभाषी मशीन अनुवाद के लिए एक मूल्यांकन dataset है, जो विश्व की लगभग 200 भाषाओं को समाहित करता है। इसे Meta कंपनी के शोधकर्ताओं द्वारा **No Language Left Behind (NLLB)** परियोजना के अंतर्गत बनाया गया था और 2022 में प्रस्तुत किया गया था। FLORES-200, पिछले dataset **FLORES-101** का विस्तार है और इसका उद्देश्य अनुवाद गुणवत्ता का वस्तुनिष्ठ मूल्यांकन करना है, विशेष रूप से अल्प-संसाधन भाषाओं के लिए<sup>[\[1\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-pwc_flores-1)</sup>।

इस dataset की मुख्य विशेषता यह है कि सभी पाठों का अनुवाद पेशेवर अनुवादकों द्वारा किया गया है, जो संदर्भ अनुवादों की उच्च गुणवत्ता सुनिश्चित करता है और इसे मशीन अनुवाद प्रणालियों की तुलना के लिए एक विश्वसनीय मानक बनाता है<sup>[\[2\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-flores_plus-2)</sup>।

## पृष्ठभूमि और निर्माण

पहला संस्करण, **FLORES-101**, 2022 में प्रस्तुत किया गया था और इसमें अंग्रेज़ी भाषा की Wikipedia से लिए गए 3001 वाक्य थे, जिन्हें 101 भाषाओं में अनुवादित किया गया था<sup>[\[3\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-flores101_paper-3)</sup>। इस dataset ने अल्प-डेटा भाषाओं के लिए अनुवाद प्रणालियों के मूल्यांकन में एक महत्वपूर्ण रिक्तता को भरा।

2022 में **No Language Left Behind** परियोजना के अंतर्गत Meta कंपनी ने corpus को 200 भाषाओं तक विस्तारित करते हुए **FLORES-200** बनाया<sup>[\[4\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-meta_news-4)</sup>। विकास के दौरान कई कठिनाइयाँ सामने आईं:

- जोड़ी गई कई भाषाओं में मानकीकरण का अभाव था और द्विभाषी विशेषज्ञों की कमी थी।
- कुछ भाषाओं का अनुवाद सीधे अंग्रेज़ी से नहीं, बल्कि मध्यवर्ती भाषाओं (स्पेनिश, फ्रेंच, रूसी) के माध्यम से किया गया।
- कुछ भाषाओं के लिए विभिन्न लिपि प्रणालियाँ शामिल की गईं (जैसे, लैटिन और सिरिलिक), ताकि विभिन्न समुदायों में उनके उपयोग को ध्यान में रखा जा सके<sup>[\[5\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-huggingface_flores-5)</sup>।

## संरचना और स्वरूप

FLORES-200 corpus में **3001 वाक्य** शामिल हैं, जो Wikimedia परियोजनाओं के 842 विभिन्न वेब-लेखों और दस्तावेज़ों से चुने गए हैं। पहले संस्करण के विपरीत, स्रोतों में केवल Wikipedia नहीं, बल्कि Wikinews, Wikijunior और Wikivoyage जैसी अन्य परियोजनाएँ भी शामिल हैं। इससे व्यापक विषयगत विविधता (समाचार, विज्ञान, संस्कृति, यात्रा) सुनिश्चित होती है, जो अनुवाद गुणवत्ता की व्यापक जाँच की अनुमति देती है।

प्रत्येक अंग्रेज़ी वाक्य को पेशेवर रूप से ~200 लक्षित भाषाओं में अनुवादित किया गया है, जिससे एक पूरी तरह से संरेखित समानांतर corpus बनता है। Dataset को तीन भागों में विभाजित किया गया है:

- **dev** (विकास) — मॉडल को ट्यून करने के लिए।
- **devtest** (मध्यवर्ती परीक्षण) — प्रारंभिक मूल्यांकन के लिए।
- **test** (अंतिम परीक्षण) — प्रतियोगिताओं में मॉडलों की निष्पक्ष तुलना के लिए छिपा हुआ भाग।

भाषाओं को इंगित करने के लिए ISO 639-3 मानक का उपयोग लिपि के उल्लेख के साथ किया जाता है, उदाहरण के लिए, लैटिन लिपि में अंग्रेज़ी के लिए \`eng_Latn\` या सिरिलिक लिपि में रूसी के लिए \`rus_Cyrl\`<sup>[\[5\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-huggingface_flores-5)</sup>।

## उपयोग और महत्व

FLORES-200 बहुभाषी मशीन अनुवाद प्रणालियों के मूल्यांकन का एक प्रमुख मानक बन गया है। इसका उपयोग Meta की प्रमुख मॉडल — **NLLB-200** — के मूल्यांकन के लिए किया गया था। FLORES-200 पर परीक्षण से पता चला कि NLLB-200 ने पिछली सर्वश्रेष्ठ प्रणालियों की तुलना में BLEU मेट्रिक पर औसतन **44%** अनुवाद गुणवत्ता में सुधार किया<sup>[\[6\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-nllb_paper-6)</sup>। अफ्रीका और भारत की कुछ भाषाओं के लिए सटीकता में वृद्धि **70%** से अधिक रही<sup>[\[4\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-meta_news-4)</sup>।

Meta ने **Creative Commons BY-SA 4.0** लाइसेंस के अंतर्गत dataset और उपकरणों तक मुफ्त पहुँच प्रदान की। इसके कारण FLORES-200 ने शीघ्र ही व्यापक प्रसार प्राप्त किया और वैज्ञानिक कार्यों, मशीन अनुवाद प्रतियोगिताओं (जैसे WMT) तथा भाषा संरक्षण पहलों में वास्तविक मानक बन गया। 2023 में OLDI (Open Language Data Initiative) समुदाय ने corpus को **FLORES+** नाम से विस्तारित करना शुरू किया<sup>[\[2\]](https://systems-analysis.info/int/FLORES-200_(HI)#cite_note-flores_plus-2)</sup>।

## संदर्भ

- Hugging Face पर आधिकारिक dataset
- GitHub पर आधिकारिक repository

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## टिप्पणियाँ

1.  <span id="cite_note-pwc_flores-1">[↑](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-pwc_flores_1-0) «FLoRes-200 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/flores-200" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-flores_plus-2">↑ <sup>[2.0](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-flores_plus_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-flores_plus_2-1)</sup> «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». *Proceedings of the Ninth Conference on Machine Translation (WMT24)*. <a href="https://www2.statmt.org/wmt24/pdf/2024.wmt-1.49.pdf" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-flores101_paper-3">[↑](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-flores101_paper_3-0) Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». *Transactions of the Association for Computational Linguistics*. <a href="https://aclanthology.org/2022.tacl-1.30/" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-meta_news-4">↑ <sup>[4.0](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-meta_news_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-meta_news_4-1)</sup> «New AI Model Translates 200 Languages, Making Technology Accessible to More People». *Meta Newsroom*. <a href="https://about.fb.com/news/2022/07/new-meta-ai-model-translates-200-languages-making-technology-more-accessible/" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-huggingface_flores-5">↑ <sup>[5.0](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-huggingface_flores_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-huggingface_flores_5-1)</sup> «Muennighoff/flores200». *Hugging Face*. <a href="https://huggingface.co/datasets/Muennighoff/flores200" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-nllb_paper-6">[↑](https://systems-analysis.info/int/FLORES-200_(HI)#cite_ref-nllb_paper_6-0) Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». *arXiv:2207.04672*. <a href="https://arxiv.org/abs/2207.04672" class="external autonumber" rel="nofollow">[६]</a></span>
