FLORES-200 (TR)
FLORES-200 — dünya genelinde yaklaşık 200 dili kapsayan çok dilli makine çevirisi için bir değerlendirme veri kümesidir. Meta şirketinin araştırmacıları tarafından No Language Left Behind (NLLB) projesi kapsamında oluşturulmuş ve 2022 yılında tanıtılmıştır. FLORES-200, önceki FLORES-101 veri kümesinin genişletilmiş bir sürümüdür ve özellikle düşük kaynaklı dillerde çeviri kalitesini nesnel biçimde değerlendirmek amacıyla tasarlanmıştır[1].
Veri kümesinin temel özelliği, tüm metinlerin profesyonel çevirmenler tarafından çevrilmiş olmasıdır; bu durum, referans çevirilerin yüksek kalitesini güvence altına almakta ve veri kümesini makine çevirisi sistemlerini karşılaştırmak için güvenilir bir standart hâline getirmektedir[2].
Arka Plan ve Veri Kümesinin Oluşturulması
İlk sürüm olan FLORES-101, 2022 yılında tanıtılmış ve İngilizce Wikipedia'dan alınan 3001 cümlenin 101 dile çevrilmesinden oluşmaktadır[3]. Bu veri kümesi, az sayıda veri içeren diller için çeviri sistemlerinin değerlendirilmesindeki önemli bir boşluğu doldurmuştur.
2022 yılında No Language Left Behind projesi kapsamında Meta, korpusu 200 dile genişleterek FLORES-200'ü oluşturmuştur[4]. Geliştirme sürecinde bir dizi güçlükle karşılaşılmıştır:
- Eklenen dillerin birçoğunun standartlaşma düzeyi düşük olup iki dilli uzman sayısı yetersizdi.
- Bazı diller doğrudan İngilizce'den değil, aracı diller (İspanyolca, Fransızca, Rusça) üzerinden çevrilmiştir.
- Bazı diller için farklı yazı sistemleri (örneğin Latin ve Kiril alfabeleri) dahil edilerek bu dillerin farklı topluluklar tarafından kullanımı gözetilmiştir[5].
İçerik ve Yapı
FLORES-200 korpusu, 842 farklı web makalesi ve Wikimedia projelerine ait belgelerden seçilmiş 3001 cümle içermektedir. İlk sürümün aksine kaynaklar yalnızca Wikipedia ile sınırlı kalmayıp Wikinews, Wikijunior ve Wikivoyage gibi diğer projeleri de kapsamaktadır. Bu durum geniş bir konu çeşitliliğini (haberler, bilim, kültür, seyahat) sağlamakta ve çeviri kalitesinin kapsamlı biçimde sınanmasına olanak tanımaktadır.
Her İngilizce cümle, ~200 hedef dile profesyonel olarak çevrilerek tam hizalanmış paralel bir korpus oluşturmuştur. Veri kümesi üç bölüme ayrılmıştır:
- dev (geliştirme) — model ayarlama için kullanılır.
- devtest (ara test) — ön değerlendirme için kullanılır.
- test (nihai test) — yarışmalarda modellerin adil karşılaştırılması için saklı tutulan bölümdür.
Dillerin belirtilmesinde ISO 639-3 standardı kullanılmakta olup komut dosyası bilgisi de eklenmektedir; örneğin Latin alfabesiyle İngilizce için `eng_Latn`, Kiril alfabesiyle Rusça için `rus_Cyrl`[5].
Kullanım ve Önemi
FLORES-200, çok dilli makine çevirisi sistemlerinin değerlendirilmesinde temel bir standart hâline gelmiştir. Meta'nın amiral gemisi modeli NLLB-200'ün değerlendirilmesinde kullanılmıştır. FLORES-200 üzerinde yapılan testler, NLLB-200'ün önceki en iyi sistemlere kıyasla BLEU metriğinde ortalama %44 oranında çeviri kalitesini artırdığını ortaya koymuştur[6]. Bazı Afrika ve Hindistan dillerinde doğruluk artışı %70'i aşmıştır[4].
Meta, veri kümesine ve kullanım araçlarına Creative Commons BY-SA 4.0 lisansı altında ücretsiz erişim sağlamıştır. Bu sayede FLORES-200, bilimsel çalışmalarda, makine çevirisi yarışmalarında (örneğin WMT) ve dil koruma girişimlerinde fiilî standart olarak hızla yaygınlaşmıştır. 2023 yılında OLDI (Open Language Data Initiative) topluluğu, korpusu FLORES+ adıyla genişletmeye başlamıştır[2].
Dış bağlantılar
- Hugging Face'teki resmi veri kümesi
- GitHub'daki resmi depo
Kaynakça
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Notlar
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]