METEOR (metric) (VI)
METEOR — đây là tên gọi được sử dụng trong lĩnh vực xử lý ngôn ngữ tự nhiên (NLP) cho một số khái niệm có liên quan nhưng khác biệt nhau. Trước hết, đây là một metric tự động nổi tiếng dùng để đánh giá chất lượng dịch máy. Ngoài ra, vào năm 2024, hai dự án nghiên cứu độc lập liên quan đến các mô hình ngôn ngữ lớn (LLM) cũng được giới thiệu với cùng tên gọi này: một phương pháp huấn luyện tiến hóa và một mô hình ngôn ngữ đa phương thức.
METEOR với tư cách là metric đánh giá chất lượng dịch
METEOR (viết tắt của Metric for Evaluation of Translation with Explicit ORdering) — là một metric tự động dùng để đánh giá chất lượng dịch máy, được đề xuất vào năm 2005 bởi các nhà nghiên cứu tại Đại học Carnegie Mellon là Satanjeev Banerjee và Alon Lavie[1]. Mục tiêu của nó là nâng cao sự tương đồng giữa các đánh giá tự động và phán xét của con người, đặc biệt ở cấp độ từng câu, bằng cách khắc phục một số hạn chế của metric BLEU trước đó.
Các đặc điểm chính của metric METEOR:
- Tính đến độ chính xác và độ bao phủ: Khác với BLEU chỉ tập trung vào độ chính xác (precision), METEOR tính trung bình điều hòa giữa độ chính xác và độ bao phủ (recall), cho phép phạt các bản dịch vì bỏ sót các từ quan trọng.
- Khớp từ linh hoạt: METEOR sử dụng các đặc điểm ngôn ngữ học để khớp bản dịch với bản tham chiếu. Nó tính đến không chỉ các kết quả khớp chính xác mà còn cả các dạng khác nhau của từ (thông qua stemming) và từ đồng nghĩa (thông qua WordNet).
- Phạt vi phạm thứ tự từ: Metric này có tích hợp một khoản phạt cho thứ tự từ không đúng trong bản dịch ứng viên, ngay cả khi tất cả các từ đều khớp với bản tham chiếu.
Những cải tiến này cho phép metric METEOR tương quan với đánh giá của con người tốt hơn đáng kể so với BLEU[2]. Metric này được ứng dụng rộng rãi trong nghiên cứu dịch máy, tóm tắt văn bản tự động và đánh giá chú thích hình ảnh[3].
METEOR với tư cách là phương pháp huấn luyện tiến hóa LLM
Vào năm 2024, một nhóm các nhà nghiên cứu Trung Quốc đã giới thiệu phương pháp có tên METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth[4]. Phương pháp này được thiết kế để huấn luyện hiệu quả các LLM chuyên biệt trong các lĩnh vực chủ đề hẹp (ví dụ: tài chính, y tế) mà không cần huấn luyện mô hình từ đầu.
Các tác giả mô tả một sơ đồ ba giai đoạn «tiến hóa» của LLM:
- Chưng cất tri thức từ mô hình mạnh sang mô hình yếu (weak-to-strong data distillation): Một mô hình «giáo viên» mạnh hơn (ví dụ: GPT-4) được sử dụng để tạo ra kho dữ liệu huấn luyện. Trong đó, mô hình chuyên ngành trước tiên tạo ra kế hoạch giải quyết, còn mô hình mạnh tạo ra câu trả lời theo kế hoạch đó. Điều này cân bằng phân phối tri thức và cho phép mô hình mục tiêu tiếp thu tri thức hiệu quả hơn.
- Huấn luyện lặp có hướng dẫn với phản hồi bên ngoài (guided iterative training): Mô hình đã được huấn luyện ở giai đoạn đầu tự giải quyết các bài toán, còn mô hình mạnh đóng vai trò «trọng tài», đánh giá câu trả lời và chỉ ra các lỗi. Chu kỳ phản chiếu này phát triển ở mô hình chuyên ngành khả năng tự kiểm tra.
- Tự tiến hóa (self-evolution): Mô hình tiếp tục cải thiện mà không cần người giám sát bên ngoài, sử dụng các kỹ năng tích lũy để tạo ra và hiệu chỉnh dữ liệu mới.
Phương pháp này đề xuất một cách tiếp cận thực tế để tạo ra các LLM chuyên gia nhỏ gọn và tiết kiệm chi phí cho các ngành cụ thể[5].
METEOR với tư cách là mô hình LLM đa phương thức
Cũng vào năm 2024, một nhóm các nhà nghiên cứu từ KAIST đã giới thiệu một mô hình ngôn ngữ đa phương thức lớn có tên METEOR: Mamba-based Traversal of Rationales[6]. Mô hình được thiết kế để hiểu toàn diện thông tin hình ảnh và tạo ra câu trả lời cho các câu hỏi về hình ảnh.
Đặc điểm nổi bật của METEOR là việc sử dụng các lập luận (rationales) chi tiết. Mô hình không chỉ đưa ra câu trả lời cuối cùng mà còn tạo ra và dựa vào một «chuỗi lập luận» ẩn — lời giải thích tuần tự về cách đi đến câu trả lời đó, tương tự như cách một con người suy luận.
Kiến trúc METEOR sử dụng một module đặc biệt dựa trên mô hình Mamba — một kiến trúc hiệu quả để xử lý các chuỗi rất dài. Module này mã hóa các chuỗi lập luận dài, có thể bao gồm mô tả các đối tượng trong hình ảnh, quan hệ không gian của chúng và các bước để giải quyết bài toán[7].
Mô hình đã được kiểm nghiệm thành công trên các benchmark đa phương thức phức tạp như MME, AI2D (hiểu sơ đồ) và MathVista (giải bài toán toán học trong bối cảnh hình ảnh). Nó đạt kết quả cao mà không cần các module thị giác máy tính bên ngoài bổ sung, cho thấy việc sử dụng hiệu quả các tham số nội tại của mô hình[7].
Ghi chú
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]