MM-RAG (Multimodal RAG) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

MM-RAG (Ingg. Multimodal Retrieval-Augmented Generation) — adalah perluasan dari paradigma klasik RAG, di mana LLM menggunakan tidak hanya teks, tetapi juga data visual (gambar, skema, tabel, grafik) untuk menjawab pertanyaan. Retrieval multimodal memungkinkan pencarian dan penghubungan bukti dalam berbagai representasi, mengurangi risiko halusinasi dengan mengandalkan sumber eksternal yang terikat secara tepat pada fragmen halaman dan area (bounding boxes)[1][2].

MM-RAG sangat berguna untuk dokumen yang sebagian besar maknanya disajikan dalam bentuk non-teks (tata letak halaman, diagram, struktur tabel). Dalam kasus seperti itu, RAG teks klasik sering kehilangan elemen konteks yang penting[3][4].

Konteks dan Masalah yang Diselesaikan

RAG klasik beroperasi dengan passages teks dan tidak dapat melihat struktur visual (posisi elemen, keterangan gambar, sumbu grafik). MM-RAG menutup kesenjangan ini: mengekstrak elemen terstruktur (teks, tabel, gambar dengan koordinat), mengindeksnya ke dalam ruang vektor, dan menggabungkan bukti dari berbagai modalitas[5][6].

Arsitektur MM-RAG

Pipeline MM-RAG menambahkan tahap pemrosesan data visual dan penyelarasan modalitas ke RAG klasik: ingesti → pengindeksan → retrieval multimodal → penggabungan dan reranking → generasi dengan tracing.

  1. Pengumpulan dan Preprocessing (Ingestion). Input berupa PDF/scan/gambar. Dilakukan OCR dan analisis tata letak halaman untuk mengidentifikasi zona: paragraf, judul, tabel, gambar beserta koordinatnya. Alat yang umum digunakan adalah model dari keluarga LayoutLM dan library LayoutParser; validasi dan pelatihan sering bergantung pada dataset PubLayNet dan DocLayNet[7][8][9].
  2. Segmentasi Region. Objek visual diekstrak (diagram, tabel, ilustrasi, keterangan). Untuk ketahanan yang lebih tinggi, digunakan model OCR‑free (misalnya, Donut) atau pipeline gabungan OCR+VLM[10].
  3. Pengindeksan (Vector Index). Chunks teks dan elemen visual (gambar atau deskripsinya) diubah menjadi representasi vektor dan dimasukkan ke dalam basis data vektor. Untuk ruang gabungan text↔image digunakan CLIP atau SigLIP; untuk lingkungan produksi, indeks multimodal/multivektor (satu objek — beberapa vektor) lebih praktis[6][11][12].
  4. Retrieval Multimodal dan Reranking. Dilakukan kombinasi pencarian teks dan visual; kandidat (paragraf, tabel, gambar/region) digabungkan dan di-rerank oleh model yang lebih "berat" (cross‑encoder/LLM‑reranker) untuk meningkatkan akurasi[13].
  5. Pengemasan Konteks dan Generasi. Fragmen yang dipilih dimasukkan ke LLM/VLM. Jika model bersifat multimodal (misalnya, GPT‑4V/4o), gambar dapat dimasukkan secara langsung; pada LLM berbasis teks, gambar terlebih dahulu dikonversi menjadi deskripsi terperinci[14][15].
  6. Tracing dan Sitasi. Jawaban disertai dengan sitasi yang dapat diklik, yang terhubung tidak hanya ke dokumen/halaman, tetapi juga ke region (koordinat). Hal ini meningkatkan tingkat grounding dan kepercayaan pengguna[2].

Evaluasi Kualitas dan Metrik

Efektivitas MM‑RAG dievaluasi pada tingkat ekstraksi, retrieval, dan generasi.

  • Kualitas ekstraksi data visual. Akurasi OCR (WER/CER), kualitas analisis tata letak (mAP/Precision/Recall) pada dataset DocLayNet/PubLayNet[8][7].
  • Kualitas retrieval. Metrik standar pencarian informasi: Recall@K, Precision@K, MRR; untuk multimodalitas — secara terpisah per modalitas dan secara gabungan.
  • Kualitas jawaban (end‑to‑end). Metrik otomatis faithfulness/groundedness dan evaluasi manusia. Dalam praktiknya digunakan framework RAGAS/TruLens/DeepEval[16].
  • Benchmark.
    • DocVQA: pertanyaan berdasarkan gambar dokumen[3].
    • TextVQA: pertanyaan yang memerlukan pembacaan teks pada gambar[4].
    • InfographicVQA: pertanyaan berdasarkan infografis[17].
    • ChartQA: pertanyaan berdasarkan diagram dengan persyaratan penalaran logis[18].
    • MMDocRAG: benchmark multimodal RAG untuk DocQA (dokumen multi-halaman, rantai bukti lintas modalitas)[19].

Tabel Perbandingan Komponen

Perbandingan komponen dan pendekatan utama dalam MM‑RAG
Komponen Varian Implementasi Kelebihan Kekurangan / Risiko Kapan Memilih
OCR Tesseract / PaddleOCR / API cloud Lokal — privasi dan kontrol; cloud — akurasi tinggi siap pakai. Kesalahan pada tata letak kompleks; API — biaya dan persyaratan kepatuhan. Data privat — OCR lokal; akurasi maksimal — cloud (jika diizinkan).
Analisis tata letak Aturan / model ML (LayoutLM, LayoutParser) Aturan sederhana untuk template seragam; ML — tahan terhadap keberagaman. Aturan gagal pada tata letak baru; ML membutuhkan sumber daya/data. Formulir seragam — aturan; korpus heterogen — ML.
Vektorisasi (gambar) CLIP / SigLIP / deskripsi OCR‑free (Donut/Pix2Struct) Ruang laten gabungan text↔image (CLIP/SigLIP); OCR‑free menghilangkan ketergantungan pada OCR. CLIP tidak membaca teks di dalam gambar; deskripsi dapat mendistorsi makna. CLIP/SigLIP — pencarian multimodal dasar; OCR‑free untuk scan berkualitas kompleks.
Penggabungan hasil Pengurutan berdasarkan score / kuota per modalitas / LLM‑reranker Reranker secara signifikan meningkatkan akurasi pemilihan konteks. Peningkatan latensi dan biaya. Skenario high‑precision; metode sederhana — untuk PoC.
Penyimpanan/indeks Satu vektor / multivektor (text+image) / hibrida (BM25+vektor) Multivektor mencakup representasi berbeda dari satu objek; hibrida membantu kata kunci/kode. Kompleksitas skema dan pembaruan. Sistem produksi dengan data campuran dan SLA ketat.

Catatan Praktis

  • Pencarian hibrida (BM25 + vektor) — standar de‑facto untuk meningkatkan kelengkapan dan akurasi pada istilah/kode spesifik[20].
  • Reranking dengan cross‑encoder/LLM menghemat token dengan membuang kandidat "sampah" sebelum generasi[13].
  • Retriever VLM modern (misalnya, ColPali) menunjukkan keunggulan pada dokumen kaya visual berkat pengindeksan langsung halaman sebagai gambar[21].

Referensi

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

Lihat Juga

  • Retrieval-Augmented Generation
  • Basis data vektor
  • Embedding
  • GraphRAG

Catatan

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.