MM-RAG (Multimodal RAG) (VI)
MM-RAG (tiếng Anh: Multimodal Retrieval-Augmented Generation) — là phần mở rộng của mô hình RAG cổ điển, trong đó LLM sử dụng để trả lời không chỉ văn bản mà còn cả dữ liệu trực quan (hình ảnh, sơ đồ, bảng biểu, đồ thị). Truy xuất đa phương thức cho phép tìm kiếm và liên kết bằng chứng ở các dạng biểu diễn khác nhau, giảm thiểu nguy cơ ảo giác nhờ dựa vào các nguồn bên ngoài với sự gắn kết chính xác vào các đoạn trang và vùng (bounding boxes)[1][2].
MM-RAG đặc biệt hữu ích với các tài liệu mà phần lớn ý nghĩa được thể hiện dưới dạng phi văn bản (bố cục trang, sơ đồ, cấu trúc bảng). Trong những trường hợp như vậy, RAG văn bản cổ điển thường bỏ sót các yếu tố ngữ cảnh quan trọng[3][4].
Bối cảnh và vấn đề được giải quyết
RAG cổ điển hoạt động với các đoạn văn bản và không nhìn thấy các cấu trúc trực quan (vị trí các phần tử, chú thích hình ảnh, trục đồ thị). MM-RAG lấp đầy những khoảng trống này: trích xuất các phần tử có cấu trúc (văn bản, bảng, hình ảnh kèm tọa độ), lập chỉ mục chúng vào không gian vector và kết hợp bằng chứng từ các phương thức khác nhau[5][6].
Kiến trúc MM-RAG
Pipeline MM-RAG bổ sung vào RAG cổ điển các giai đoạn xử lý dữ liệu trực quan và căn chỉnh phương thức: tiếp nhận → lập chỉ mục → truy xuất đa phương thức → hợp nhất và tái xếp hạng → tạo sinh kèm truy vết.
- Thu thập và tiền xử lý (Ingestion). Đầu vào là PDF/bản quét/hình ảnh. Thực hiện OCR và phân tích bố cục trang để xác định các vùng: đoạn văn, tiêu đề, bảng, hình ảnh và tọa độ của chúng. Công cụ điển hình — các mô hình thuộc họ LayoutLM và thư viện công cụ LayoutParser; việc kiểm định và huấn luyện thường dựa vào các dataset PubLayNet và DocLayNet[7][8][9].
- Phân đoạn theo vùng. Trích xuất các đối tượng trực quan (biểu đồ, bảng, minh họa, chú thích). Để tăng độ ổn định, sử dụng các mô hình OCR‑free (ví dụ: Donut) hoặc các pipeline kết hợp OCR+VLM[10].
- Lập chỉ mục (Vector Index). Các chunk văn bản và phần tử trực quan (hình ảnh hoặc mô tả của chúng) được chuyển đổi thành biểu diễn vector và đưa vào cơ sở dữ liệu vector. Để tạo không gian thống nhất text↔image sử dụng CLIP hoặc SigLIP; cho môi trường sản xuất, các chỉ mục đa phương thức/đa vector rất tiện dụng (một đối tượng — nhiều vector)[6][11][12].
- Truy xuất đa phương thức và tái xếp hạng. Thực hiện kết hợp tìm kiếm văn bản và trực quan; các ứng viên (đoạn văn, bảng, hình ảnh/vùng) được hợp nhất và tái xếp hạng bởi mô hình "nặng" hơn (cross-encoder/LLM-reranker) để tăng độ chính xác[13].
- Đóng gói ngữ cảnh và tạo sinh. Các đoạn được chọn được đưa vào LLM/VLM. Nếu mô hình là đa phương thức (ví dụ: GPT‑4V/4o), hình ảnh có thể được đưa vào trực tiếp; với LLM văn bản, hình ảnh được chuyển đổi trước thành mô tả chi tiết[14][15].
- Truy vết và trích dẫn. Câu trả lời được kèm theo các trích dẫn có thể nhấp vào, gắn kết không chỉ với tài liệu/trang mà còn với vùng (tọa độ). Điều này nâng cao mức độ grounding và sự tin tưởng của người dùng[2].
Đánh giá chất lượng và các chỉ số
Hiệu quả của MM‑RAG được đánh giá ở các cấp độ trích xuất, truy xuất và tạo sinh.
- Chất lượng trích xuất dữ liệu trực quan. Độ chính xác OCR (WER/CER), chất lượng phân tích bố cục (mAP/Precision/Recall) trên các tập DocLayNet/PubLayNet[8][7].
- Chất lượng truy xuất. Các chỉ số tìm kiếm thông tin tiêu chuẩn: Recall@K, Precision@K, MRR; cho đa phương thức — riêng biệt theo từng phương thức và kết hợp.
- Chất lượng câu trả lời (end‑to‑end). Các chỉ số tự động faithfulness/groundedness và đánh giá của con người. Trong thực tế, sử dụng các framework RAGAS/TruLens/DeepEval[16].
- Benchmark.
- DocVQA: câu hỏi về hình ảnh tài liệu[3].
- TextVQA: câu hỏi yêu cầu đọc văn bản trong hình ảnh[4].
- InfographicVQA: câu hỏi về đồ họa thông tin[17].
- ChartQA: câu hỏi về biểu đồ với yêu cầu suy luận logic[18].
- MMDocRAG: benchmark đa phương thức RAG cho DocQA (tài liệu nhiều trang, chuỗi bằng chứng xuyên phương thức)[19].
Bảng so sánh các thành phần
| Thành phần | Các biến thể triển khai | Ưu điểm | Nhược điểm / rủi ro | Khi nào nên chọn |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / API đám mây | Cục bộ — quyền riêng tư và kiểm soát; đám mây — độ chính xác cao ngay từ đầu. | Lỗi trên bố cục phức tạp; API — chi phí và yêu cầu tuân thủ. | Dữ liệu riêng tư — OCR cục bộ; độ chính xác tối đa — đám mây (nếu được phép). |
| Phân tích bố cục | Quy tắc / Mô hình ML (LayoutLM, LayoutParser) | Quy tắc đơn giản cho các mẫu đồng nhất; ML — ổn định với sự đa dạng. | Quy tắc hỏng trên các bố cục mới; ML đòi hỏi tài nguyên/dữ liệu. | Biểu mẫu đồng nhất — quy tắc; kho tài liệu đa dạng — ML. |
| Vector hóa (hình ảnh) | CLIP / SigLIP / Mô tả OCR‑free (Donut/Pix2Struct) | Không gian ẩn chung text↔image (CLIP/SigLIP); OCR‑free loại bỏ sự phụ thuộc vào OCR. | CLIP không đọc văn bản bên trong hình ảnh; mô tả có thể làm sai lệch ý nghĩa. | CLIP/SigLIP — tìm kiếm đa phương thức cơ bản; OCR‑free cho bản quét chất lượng phức tạp. |
| Hợp nhất kết quả | Sắp xếp theo điểm / hạn mức theo phương thức / LLM‑reranker | Reranker cải thiện đáng kể độ chính xác trong lựa chọn ngữ cảnh. | Tăng độ trễ và chi phí. | Các tình huống đòi hỏi độ chính xác cao; phương pháp đơn giản — cho PoC. |
| Kho lưu trữ/chỉ mục | Một vector / Đa vector (text+image) / Lai (BM25+vector) | Đa vector bao phủ các biểu diễn khác nhau của một đối tượng; lai hỗ trợ từ khóa/mã. | Phức tạp hóa sơ đồ và cập nhật. | Hệ thống sản xuất với dữ liệu hỗn hợp và SLA nghiêm ngặt. |
Nhận xét thực tiễn
- Tìm kiếm lai (BM25 + vector) — tiêu chuẩn thực tế để tăng độ đầy đủ và chính xác với các thuật ngữ/mã đặc thù[20].
- Tái xếp hạng bằng cross-encoder/LLM tiết kiệm token bằng cách loại bỏ các ứng viên "rác" trước khi tạo sinh[13].
- Các VLM-retriever hiện đại (ví dụ: ColPali) cho thấy ưu thế trên các tài liệu giàu hình ảnh nhờ lập chỉ mục trực tiếp các trang dưới dạng hình ảnh[21].
Tài liệu tham khảo
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
Xem thêm
- Retrieval-Augmented Generation
- Cơ sở dữ liệu vector
- Embedding
- GraphRAG
Ghi chú
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.