FLORES-200 (SV)
FLORES-200 — är ett utvärderingsdataset för flerspråkig maskinöversättning som täcker cirka 200 av världens språk. Det skapades av forskare på Meta inom ramen för projektet No Language Left Behind (NLLB) och presenterades år 2022. FLORES-200 är en utökning av det tidigare datasetet FLORES-101 och är avsett för objektiv utvärdering av översättningskvalitet, särskilt för lågresursspråk[1].
En nyckelegenskap hos datasetet är att alla texter har översatts av professionella översättare, vilket säkerställer hög kvalitet på referensöversättningarna och gör det till en tillförlitlig standard för jämförelse av maskinöversättningssystem[2].
Bakgrund och tillkomst
Den första versionen, FLORES-101, presenterades år 2022 och innehöll 3 001 meningar hämtade från den engelskspråkiga Wikipedia, översatta till 101 språk[3]. Detta dataset fyllde ett viktigt tomrum i utvärderingen av översättningssystem för språk med begränsad datamängd.
År 2022 utökade Meta korpusen till 200 språk inom ramen för projektet No Language Left Behind och skapade därigenom FLORES-200[4]. Utvecklingen stötte på ett antal svårigheter:
- Många av de tillagda språken hade låg standardisering och brist på tvåspråkiga experter.
- En del språk översattes inte direkt från engelska utan via mellanspråk (spanska, franska, ryska).
- För vissa språk inkluderades olika skriftsystem (till exempel latinska och kyrilliska alfabetet) för att spegla deras användning i olika språkgemenskaper[5].
Sammansättning och struktur
Korpusen FLORES-200 innehåller 3 001 meningar utvalda från 842 olika webbartiklar och dokument från Wikimedia-projekt. Till skillnad från den första versionen inkluderar källorna inte bara Wikipedia utan även andra projekt som Wikinews, Wikijunior och Wikivoyage. Detta säkerställer en bred tematisk variation (nyheter, vetenskap, kultur, resor), vilket möjliggör en allsidig bedömning av översättningskvaliteten.
Varje engelsk mening har professionellt översatts till ungefär 200 målspråk, vilket skapar en fullt alignerad parallellkorpus. Datasetet är uppdelat i tre delar:
- dev (utveckling) — för finjustering av modeller.
- devtest (mellanliggande testning) — för preliminär utvärdering.
- test (slutlig testning) — en dold del för rättvis jämförelse av modeller i tävlingar.
För att beteckna språk används standarden ISO 639-3 med angivelse av skrift, till exempel `eng_Latn` för engelska med latinskt alfabet eller `rus_Cyrl` för ryska med kyrilliskt alfabet[5].
Användning och betydelse
FLORES-200 har blivit en central standard för utvärdering av flerspråkiga maskinöversättningssystem. Det användes för att utvärdera Metas flaggskeppsmodell NLLB-200. Testning på FLORES-200 visade att NLLB-200 förbättrade översättningskvaliteten med i genomsnitt 44 % enligt BLEU-måttet jämfört med tidigare ledande system[6]. För vissa afrikanska och indiska språk översteg kvalitetsförbättringen 70 %[4].
Meta har gjort datasetet och tillhörande verktyg fritt tillgängliga under licensen Creative Commons BY-SA 4.0. Tack vare detta fick FLORES-200 snabbt bred spridning och har blivit en de facto-standard i vetenskapliga arbeten, tävlingar inom maskinöversättning (till exempel WMT) och initiativ för bevarande av språk. År 2023 började gemenskapen OLDI (Open Language Data Initiative) utöka korpusen under namnet FLORES+[2].
Externa länkar
- Officiellt dataset på Hugging Face
- Officiellt arkiv på GitHub
Litteratur
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Noter
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]