FLORES-200 (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

FLORES-200 — to zbiór danych ewaluacyjnych do wielojęzycznego maszynowego tłumaczenia, obejmujący około 200 języków świata. Został stworzony przez badaczy firmy Meta w ramach projektu No Language Left Behind (NLLB) i zaprezentowany w 2022 roku. FLORES-200 jest rozszerzeniem poprzedniego zbioru FLORES-101 i przeznaczony jest do obiektywnej oceny jakości tłumaczenia, szczególnie dla języków o niskich zasobach[1].

Kluczową cechą datasetu jest to, że wszystkie teksty zostały przetłumaczone przez profesjonalnych tłumaczy, co zapewnia wysoką jakość tłumaczeń referencyjnych i czyni go wiarygodnym standardem do porównywania systemów maszynowego tłumaczenia[2].

Historia i powstanie zbioru

Pierwsza wersja, FLORES-101, została zaprezentowana w 2022 roku i zawierała 3001 zdań z anglojęzycznej Wikipedii, przetłumaczonych na 101 języków[3]. Ten zbiór wypełnił istotną lukę w ocenie systemów tłumaczenia dla języków o małej ilości danych.

W 2022 roku w ramach projektu No Language Left Behind firma Meta rozszerzyła korpus do 200 języków, tworząc FLORES-200[4]. Podczas opracowywania napotkano szereg trudności:

  • Wiele dodanych języków cechowała niska standaryzacja i brak dwujęzycznych specjalistów.
  • Część języków była tłumaczona nie bezpośrednio z angielskiego, lecz za pośrednictwem języków-pośredników (hiszpańskiego, francuskiego, rosyjskiego).
  • Dla niektórych języków uwzględniono różne systemy pisma (np. łacińskie i cyrylicę), aby uwzględnić ich użycie w różnych społecznościach[5].

Skład i struktura

Korpus FLORES-200 zawiera 3001 zdań, wybranych z 842 różnych artykułów internetowych i dokumentów projektów Wikimedia. W odróżnieniu od pierwszej wersji, źródła obejmują nie tylko Wikipedię, lecz również inne projekty, takie jak Wikinews, Wikijunior i Wikivoyage. Zapewnia to szeroką różnorodność tematyczną (wiadomości, nauka, kultura, podróże), co pozwala wszechstronnie sprawdzać jakość tłumaczenia.

Każde angielskie zdanie zostało profesjonalnie przetłumaczone na ~200 języków docelowych, tworząc w pełni wyrównany korpus równoległy. Zbiór podzielony jest na trzy części:

  • dev (rozwojowa) — do dostrajania modeli.
  • devtest (pośrednie testowanie) — do wstępnej oceny.
  • test (finalne testowanie) — ukryta część służąca do rzetelnego porównywania modeli w konkursach.

Do oznaczania języków stosowany jest standard ISO 639-3 z podaniem skryptu, na przykład `eng_Latn` dla języka angielskiego w piśmie łacińskim lub `rus_Cyrl` dla języka rosyjskiego w cyrylicy[5].

Zastosowanie i znaczenie

FLORES-200 stał się kluczowym standardem do oceny wielojęzycznych systemów maszynowego tłumaczenia. Został wykorzystany do ewaluacji flagowego modelu firmy Meta — NLLB-200. Testowanie na FLORES-200 wykazało, że NLLB-200 poprawiła jakość tłumaczenia średnio o 44% według metryki BLEU w porównaniu z poprzednimi najlepszymi systemami[6]. Dla niektórych języków Afryki i Indii wzrost dokładności przekroczył 70%[4].

Meta udostępniła dataset oraz narzędzia do jego wykorzystania na wolnej licencji Creative Commons BY-SA 4.0. Dzięki temu FLORES-200 szybko zyskał szerokie rozpowszechnienie i stał się standardem de facto w pracach naukowych, konkursach maszynowego tłumaczenia (np. WMT) oraz inicjatywach na rzecz ochrony języków. W 2023 roku społeczność OLDI (Open Language Data Initiative) rozpoczęła rozszerzanie korpusu pod nazwą FLORES+[2].

Odnośniki

  • Oficjalny dataset na Hugging Face
  • Oficjalne repozytorium na GitHub

Literatura

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Przypisy

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]