---
title: "FLORES-200 (DE)"
source: "https://systems-analysis.info/int/FLORES-200_(DE)"
wiki: "systems-analysis.info/int"
article: "FLORES-200_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2083
wiki_created_at: 2026-09-06T22:58:21Z
wiki_modified_at: 2026-09-06T22:58:21Z
downloaded_at: 2026-09-07T22:49:15Z
---

# FLORES-200 (DE)

**FLORES-200** ist ein Evaluationsdatensatz für die mehrsprachige maschinelle Übersetzung, der rund 200 Sprachen der Welt abdeckt. Er wurde von Forschern des Unternehmens Meta im Rahmen des Projekts **No Language Left Behind (NLLB)** entwickelt und im Jahr 2022 vorgestellt. FLORES-200 ist eine Erweiterung des früheren Datensatzes **FLORES-101** und dient der objektiven Bewertung der Übersetzungsqualität, insbesondere für ressourcenarme Sprachen<sup>[\[1\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-pwc_flores-1)</sup>.

Ein wesentliches Merkmal des Datensatzes ist, dass alle Texte von professionellen Übersetzern übersetzt wurden, was eine hohe Qualität der Referenzübersetzungen gewährleistet und ihn zu einem zuverlässigen Standard für den Vergleich von maschinellen Übersetzungssystemen macht<sup>[\[2\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-flores_plus-2)</sup>.

## Hintergrund und Erstellung des Datensatzes

Die erste Version, **FLORES-101**, wurde 2022 vorgestellt und enthielt 3001 Sätze aus der englischsprachigen Wikipedia, die in 101 Sprachen übersetzt wurden<sup>[\[3\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-flores101_paper-3)</sup>. Dieser Datensatz schloss eine wichtige Lücke bei der Evaluierung von Übersetzungssystemen für Sprachen mit geringen Datenmengen.

Im Jahr 2022 erweiterte Meta im Rahmen des Projekts **No Language Left Behind** das Korpus auf 200 Sprachen und schuf damit **FLORES-200**<sup>[\[4\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-meta_news-4)</sup>. Die Entwicklung war mit einer Reihe von Schwierigkeiten verbunden:

- Viele der hinzugefügten Sprachen hatten einen geringen Standardisierungsgrad und es mangelte an zweisprachigen Fachkräften.
- Einige Sprachen wurden nicht direkt aus dem Englischen, sondern über Brückensprachen (z. B. Spanisch, Französisch, Russisch) übersetzt.
- Für einige Sprachen wurden verschiedene Schriftsysteme (z. B. lateinische und kyrillische Schrift) berücksichtigt, um ihre Verwendung in unterschiedlichen Gemeinschaften abzubilden<sup>[\[5\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-huggingface_flores-5)</sup>.

## Aufbau und Struktur

Das FLORES-200-Korpus umfasst **3001 Sätze**, die aus 842 verschiedenen Web-Artikeln und Dokumenten von Wikimedia-Projekten ausgewählt wurden. Im Gegensatz zur ersten Version stammen die Quellen nicht nur aus Wikipedia, sondern auch aus anderen Projekten wie Wikinews, Wikijunior und Wikivoyage. Dies gewährleistet eine breite thematische Vielfalt (Nachrichten, Wissenschaft, Kultur, Reisen), die eine umfassende Überprüfung der Übersetzungsqualität ermöglicht.

Jeder englische Satz wurde professionell in rund 200 Zielsprachen übersetzt, wodurch ein vollständig paralleles Korpus entstand. Der Datensatz ist in drei Teile aufgeteilt:

- **dev** (Entwicklung) – zur Feinabstimmung der Modelle.
- **devtest** (Zwischentest) – zur vorläufigen Evaluierung.
- **test** (Abschlusstest) – ein verborgener Teil für den fairen Vergleich von Modellen in Wettbewerben.

Zur Kennzeichnung der Sprachen wird der Standard ISO 639-3 mit Angabe des Schriftsystems verwendet, zum Beispiel \`eng_Latn\` für Englisch in lateinischer Schrift oder \`rus_Cyrl\` für Russisch in kyrillischer Schrift<sup>[\[5\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-huggingface_flores-5)</sup>.

## Anwendung und Bedeutung

FLORES-200 hat sich zu einem Schlüsselstandard für die Evaluierung mehrsprachiger maschineller Übersetzungssysteme entwickelt. Er wurde zur Bewertung des Flaggschiff-Modells von Meta, **NLLB-200**, verwendet. Tests mit FLORES-200 zeigten, dass NLLB-200 die Übersetzungsqualität im Durchschnitt um **44 %** gemäß der BLEU-Metrik im Vergleich zu früheren Spitzenmodellen verbesserte<sup>[\[6\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-nllb_paper-6)</sup>. Für einige afrikanische und indische Sprachen betrug die Genauigkeitssteigerung sogar mehr als **70 %**<sup>[\[4\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-meta_news-4)</sup>.

Meta hat den Datensatz und die zugehörigen Tools unter der Lizenz **Creative Commons BY-SA 4.0** frei zugänglich gemacht. Dadurch fand FLORES-200 schnell weite Verbreitung und wurde zum De-facto-Standard in wissenschaftlichen Arbeiten, Wettbewerben zur maschinellen Übersetzung (wie WMT) und Initiativen zur Spracherhaltung. Im Jahr 2023 begann die OLDI-Community (Open Language Data Initiative), das Korpus unter dem Namen **FLORES+** zu erweitern<sup>[\[2\]](https://systems-analysis.info/int/FLORES-200_(DE)#cite_note-flores_plus-2)</sup>.

## Weblinks

- <a href="https://huggingface.co/datasets/facebook/flores" class="external text" rel="nofollow">Offizieller Datensatz auf Hugging Face</a>
- <a href="https://github.com/facebookresearch/flores/tree/main/flores200" class="external text" rel="nofollow">Offizielles Repository auf GitHub</a>

## Literatur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Einzelnachweise

1.  <span id="cite_note-pwc_flores-1">[↑](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-pwc_flores_1-0) „FLoRes-200 Dataset“. *Papers With Code*. <a href="https://paperswithcode.com/dataset/flores-200" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-flores_plus-2">↑ <sup>[2.0](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-flores_plus_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-flores_plus_2-1)</sup> „FLORES+ Translation and Machine Translation Evaluation for the Erzya Language“. *Proceedings of the Ninth Conference on Machine Translation (WMT24)*. <a href="https://www2.statmt.org/wmt24/pdf/2024.wmt-1.49.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-flores101_paper-3">[↑](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-flores101_paper_3-0) Goyal, N., et al. „The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation“. *Transactions of the Association for Computational Linguistics*. <a href="https://aclanthology.org/2022.tacl-1.30/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-meta_news-4">↑ <sup>[4.0](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-meta_news_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-meta_news_4-1)</sup> „New AI Model Translates 200 Languages, Making Technology Accessible to More People“. *Meta Newsroom*. <a href="https://about.fb.com/news/2022/07/new-meta-ai-model-translates-200-languages-making-technology-more-accessible/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface_flores-5">↑ <sup>[5.0](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-huggingface_flores_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-huggingface_flores_5-1)</sup> „Muennighoff/flores200“. *Hugging Face*. <a href="https://huggingface.co/datasets/Muennighoff/flores200" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-nllb_paper-6">[↑](https://systems-analysis.info/int/FLORES-200_(DE)#cite_ref-nllb_paper_6-0) Costa-jussà, M.R., et al. „No Language Left Behind: Scaling Human-Centered Machine Translation“. *arXiv:2207.04672*. <a href="https://arxiv.org/abs/2207.04672" class="external autonumber" rel="nofollow">[6]</a></span>
