FLORES-200 (VI)
FLORES-200 — đây là bộ dữ liệu đánh giá dành cho dịch máy đa ngôn ngữ, bao gồm khoảng 200 ngôn ngữ trên thế giới. Bộ dữ liệu này được tạo ra bởi các nhà nghiên cứu của công ty Meta trong khuôn khổ dự án No Language Left Behind (NLLB) và được giới thiệu vào năm 2022. FLORES-200 là phần mở rộng của bộ dữ liệu trước đó là FLORES-101 và được thiết kế để đánh giá khách quan chất lượng dịch thuật, đặc biệt đối với các ngôn ngữ ít tài nguyên[1].
Đặc điểm then chốt của dataset là tất cả các văn bản đều được dịch bởi các dịch giả chuyên nghiệp, điều này đảm bảo chất lượng cao của các bản dịch tham chiếu và biến nó thành một tiêu chuẩn đáng tin cậy để so sánh các hệ thống dịch máy[2].
Lịch sử hình thành và tạo lập bộ dữ liệu
Phiên bản đầu tiên, FLORES-101, được giới thiệu vào năm 2022 và chứa 3001 câu từ Wikipedia tiếng Anh, được dịch sang 101 ngôn ngữ[3]. Bộ dữ liệu này đã lấp đầy một khoảng trống quan trọng trong việc đánh giá các hệ thống dịch thuật cho các ngôn ngữ có ít dữ liệu.
Vào năm 2022, trong khuôn khổ dự án No Language Left Behind, công ty Meta đã mở rộng kho ngữ liệu lên 200 ngôn ngữ, tạo ra FLORES-200[4]. Quá trình phát triển gặp phải một số khó khăn:
- Nhiều ngôn ngữ được bổ sung có mức độ chuẩn hóa thấp và thiếu các chuyên gia song ngữ.
- Một phần các ngôn ngữ được dịch không trực tiếp từ tiếng Anh mà thông qua các ngôn ngữ trung gian (tiếng Tây Ban Nha, tiếng Pháp, tiếng Nga).
- Đối với một số ngôn ngữ, các hệ thống chữ viết khác nhau được đưa vào (ví dụ, chữ Latin và chữ Cyrillic) để phản ánh việc sử dụng chúng trong các cộng đồng khác nhau[5].
Thành phần và cấu trúc
Kho ngữ liệu FLORES-200 bao gồm 3001 câu, được chọn lọc từ 842 bài viết web và tài liệu khác nhau của các dự án Wikimedia. Khác với phiên bản đầu tiên, các nguồn không chỉ bao gồm Wikipedia mà còn các dự án khác như Wikinews, Wikijunior và Wikivoyage. Điều này đảm bảo sự đa dạng chủ đề phong phú (tin tức, khoa học, văn hóa, du lịch), cho phép kiểm tra toàn diện chất lượng dịch thuật.
Mỗi câu tiếng Anh được dịch chuyên nghiệp sang ~200 ngôn ngữ đích, tạo thành một kho ngữ liệu song song được căn chỉnh hoàn toàn. Bộ dữ liệu được chia thành ba phần:
- dev (phát triển) — để tinh chỉnh các mô hình.
- devtest (kiểm tra trung gian) — để đánh giá sơ bộ.
- test (kiểm tra cuối cùng) — phần ẩn dùng để so sánh công bằng các mô hình trong các cuộc thi.
Để ký hiệu các ngôn ngữ, tiêu chuẩn ISO 639-3 được sử dụng kèm theo chỉ định chữ viết, ví dụ `eng_Latn` cho tiếng Anh viết bằng chữ Latin hoặc `rus_Cyrl` cho tiếng Nga viết bằng chữ Cyrillic[5].
Ứng dụng và ý nghĩa
FLORES-200 đã trở thành tiêu chuẩn then chốt để đánh giá các hệ thống dịch máy đa ngôn ngữ. Bộ dữ liệu này được sử dụng để đánh giá mô hình hàng đầu của Meta — NLLB-200. Việc kiểm tra trên FLORES-200 cho thấy NLLB-200 đã cải thiện chất lượng dịch thuật trung bình 44% theo chỉ số BLEU so với các hệ thống tốt nhất trước đó[6]. Đối với một số ngôn ngữ ở châu Phi và Ấn Độ, mức tăng độ chính xác đã vượt quá 70%[4].
Meta đã mở quyền truy cập tự do vào dataset và các công cụ sử dụng nó theo giấy phép Creative Commons BY-SA 4.0. Nhờ đó, FLORES-200 nhanh chóng được phổ biến rộng rãi và trở thành tiêu chuẩn thực tế trong các công trình khoa học, các cuộc thi dịch máy (ví dụ, WMT) và các sáng kiến bảo tồn ngôn ngữ. Vào năm 2023, cộng đồng OLDI (Open Language Data Initiative) bắt đầu mở rộng kho ngữ liệu dưới tên FLORES+[2].
Liên kết
- Dataset chính thức trên Hugging Face
- Kho lưu trữ chính thức trên GitHub
Tài liệu tham khảo
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Ghi chú
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]