FLORES-200 (KO)
FLORES-200 — 전 세계 약 200개 언어를 아우르는 다국어 기계 번역 평가 dataset입니다. Meta 연구진이 No Language Left Behind (NLLB) 프로젝트의 일환으로 개발하여 2022년에 공개하였습니다. FLORES-200은 이전 dataset인 FLORES-101의 확장판으로, 특히 저자원 언어에 대한 번역 품질을 객관적으로 평가하기 위해 설계되었습니다[1].
이 dataset의 핵심 특징은 모든 텍스트가 전문 번역가에 의해 번역되었다는 점으로, 이를 통해 높은 품질의 참조 번역이 보장되어 기계 번역 시스템 비교를 위한 신뢰할 수 있는 표준으로 자리매김하였습니다[2].
개발 배경 및 제작 과정
첫 번째 버전인 FLORES-101은 2022년에 공개되었으며, 영어 위키백과에서 추출한 3001개의 문장을 101개 언어로 번역한 내용을 담고 있었습니다[3]. 이 dataset은 데이터가 부족한 언어들에 대한 번역 시스템 평가에서 중요한 공백을 메워 주었습니다.
2022년 Meta는 No Language Left Behind 프로젝트를 통해 코퍼스를 200개 언어로 확장하여 FLORES-200을 만들었습니다[4]. 개발 과정에서는 다음과 같은 여러 어려움이 있었습니다:
- 새로 추가된 많은 언어들은 표준화 수준이 낮고 이중 언어 전문가가 부족하였습니다.
- 일부 언어는 영어에서 직접 번역되지 않고 스페인어, 프랑스어, 러시아어 등 중간 언어를 거쳐 번역되었습니다.
- 다양한 커뮤니티에서의 사용을 반영하기 위해 일부 언어에는 여러 표기 체계(예: 라틴 문자와 키릴 문자)가 포함되었습니다[5].
구성 및 구조
FLORES-200 코퍼스는 Wikimedia 프로젝트의 842개 웹 문서 및 자료에서 선별된 3001개의 문장으로 구성되어 있습니다. 첫 번째 버전과 달리, 출처에는 위키백과뿐만 아니라 Wikinews, Wikijunior, Wikivoyage 등 다른 프로젝트도 포함됩니다. 이를 통해 뉴스, 과학, 문화, 여행 등 폭넓은 주제 다양성이 확보되어 번역 품질을 종합적으로 평가할 수 있습니다.
각 영어 문장은 약 200개의 목표 언어로 전문적으로 번역되어 완전히 정렬된 병렬 코퍼스를 이루고 있습니다. Dataset은 세 부분으로 나뉩니다:
- dev (개발 세트) — 모델 튜닝에 활용됩니다.
- devtest (중간 테스트 세트) — 사전 평가에 활용됩니다.
- test (최종 테스트 세트) — 대회에서 공정한 모델 비교를 위한 비공개 세트입니다.
언어 표기에는 스크립트 정보를 포함한 ISO 639-3 표준이 사용되며, 예를 들어 라틴 문자 영어는 `eng_Latn`, 키릴 문자 러시아어는 `rus_Cyrl`로 표기됩니다[5].
활용 및 의의
FLORES-200은 다국어 기계 번역 시스템 평가의 핵심 표준으로 자리잡았습니다. Meta의 대표 모델인 NLLB-200 평가에 활용되었으며, FLORES-200을 이용한 테스트 결과 NLLB-200은 이전 최고 성능 시스템 대비 BLEU 지표 기준 평균 44% 향상된 번역 품질을 보여주었습니다[6]. 아프리카 및 인도의 일부 언어에서는 정확도 향상폭이 70%를 초과하였습니다[4].
Meta는 Creative Commons BY-SA 4.0 라이선스 하에 dataset과 활용 도구를 자유롭게 공개하였습니다. 이를 통해 FLORES-200은 빠르게 보급되어 학술 연구, 기계 번역 대회(예: WMT), 언어 보존 이니셔티브에서 사실상의 표준으로 자리잡았습니다. 2023년에는 OLDI(Open Language Data Initiative) 커뮤니티가 FLORES+라는 이름으로 코퍼스 확장을 시작하였습니다[2].
외부 링크
- Hugging Face 공식 dataset
- GitHub 공식 저장소
참고 문헌
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
각주
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]