MM-RAG (Multimodal RAG) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

MM-RAG (Ingles: Multimodal Retrieval-Augmented Generation) — ito ay isang pagpapalawak ng klasikong paradigma ng RAG, kung saan ginagamit ng mga LLM para sagutin ang mga tanong hindi lamang ang teksto kundi pati na rin ang mga visual na datos (mga larawan, diagram, talahanayan, grap). Ang multimodal retrieval ay nagbibigay-kakayaang hanapin at ikonekta ang mga patunay sa iba't ibang representasyon, binabawasan ang panganib ng mga hallucination sa pamamagitan ng pag-asa sa mga panlabas na pinagkukunan na may tumpak na pagkakabit sa mga fragment ng pahina at sa mga rehiyon (bounding boxes)[1][2].

Ang MM-RAG ay lalong kapaki-pakinabang para sa mga dokumento kung saan ang malaking bahagi ng kahulugan ay nasa di-tekstwal na anyo (layout ng pahina, mga diagram, istruktura ng talahanayan). Sa mga ganitong kaso, ang klasikong tekstwal na RAG ay madalas na nawawalan ng mahahalagang elemento ng konteksto[3][4].

Konteksto at Problemang Nireresolba

Ang klasikong RAG ay nagtatrabaho sa mga tekstwal na sipi at hindi nakakakita ng mga visual na istruktura (pagkakalagay ng mga elemento, mga caption ng larawan, mga aksis ng grap). Isinasara ng MM-RAG ang mga agwat na ito: kinukuha ang mga nakaistrakturang elemento (teksto, talahanayan, mga larawan na may mga koordinada), ini-index ang mga ito sa vector space, at pinagsasama ang mga patunay mula sa iba't ibang modalidad[5][6].

Arkitektura ng MM-RAG

Idinaragdag ng pipeline ng MM-RAG sa klasikong RAG ang mga yugto ng pagpoproseso ng visual na datos at pag-align ng mga modalidad: ingestion → pag-iindex → multimodal retrieval → pagsasama at reranking → paglikha na may tracing.

  1. Pagkolekta at Preprocessing (Ingestion). Tumatanggap ng PDF/scan/larawan bilang input. Isinasagawa ang OCR at pagsusuri ng layout ng pahina upang matukoy ang mga zona: mga talata, pamagat, talahanayan, larawan at ang kanilang mga koordinada. Ang mga karaniwang kagamitan ay ang mga modelo ng pamilyang LayoutLM at ang instrumental na aklatan na LayoutParser; ang validation at pagsasanay ay madalas na umaasa sa mga dataset na PubLayNet at DocLayNet[7][8][9].
  2. Segmentasyon sa mga Rehiyon. Kinukuha ang mga visual na bagay (mga diagram, talahanayan, ilustrasyon, caption). Para sa mas mataas na katatagan, ginagamit ang mga OCR‑free na modelo (hal., Donut) o mga pinagsanib na pipeline na OCR+VLM[10].
  3. Pag-iindex (Vector Index). Ang mga tekstwal na chunk at visual na elemento (mga larawan o ang kanilang mga paglalarawan) ay ginagawang vector representation at inilalagay sa vector database. Para sa pinagsanib na espasyong text↔image ginagamit ang CLIP o SigLIP; para sa produksyon, maginhawa ang mga multimodal/multivector na index (isang bagay — maraming vector)[6][11][12].
  4. Multimodal Retrieval at Reranking. Isinasagawa ang kombinasyon ng tekstwal at visual na paghahanap; pinagsasama at rina-rerank ang mga kandidato (mga talata, talahanayan, larawan/rehiyon) ng mas "mabigat" na modelo (cross‑encoder/LLM‑reranker) upang mapataas ang katumpakan[13].
  5. Pagpapakete ng Konteksto at Paglikha. Ang mga piling fragment ay ipinagkakaloob sa LLM/VLM. Kung ang modelo ay multimodal (hal., GPT‑4V/4o), ang mga larawan ay maaaring ipasa nang direkta; sa tekstwal na LLM ang mga larawan ay naunang kino-convert sa mga detalyadong paglalarawan[14][15].
  6. Tracing at Sitatyon. Ang sagot ay sinasamahan ng mga naki-click na sitatyon na nakakabit hindi lamang sa dokumento/pahina, kundi pati na rin sa rehiyon (mga koordinada). Pinapataas nito ang antas ng grounding at tiwala ng mga gumagamit[2].

Pagtatasa ng Kalidad at mga Sukatan

Sinusukat ang bisa ng MM‑RAG sa mga antas ng extraction, retrieval, at paglikha.

  • Kalidad ng Pagkuha ng Visual na Datos. Katumpakan ng OCR (WER/CER), kalidad ng pagsusuri ng layout (mAP/Precision/Recall) sa mga koleksyon ng DocLayNet/PubLayNet[8][7].
  • Kalidad ng Retrieval. Mga karaniwang sukatan ng information retrieval: Recall@K, Precision@K, MRR; para sa multimodality — nang hiwalay ayon sa modalidad at sa pinagsama.
  • Kalidad ng Sagot (end‑to‑end). Mga awtomatikong sukatan ng faithfulness/groundedness at pagtatasa ng tao. Sa praktika, ginagamit ang mga framework na RAGAS/TruLens/DeepEval[16].
  • Mga Benchmark.
    • DocVQA: mga tanong tungkol sa mga larawan ng dokumento[3].
    • TextVQA: mga tanong na nangangailangan ng pagbabasa ng teksto sa mga larawan[4].
    • InfographicVQA: mga tanong tungkol sa mga infographic[17].
    • ChartQA: mga tanong tungkol sa mga diagram na nangangailangan ng lohikal na pag-iisip[18].
    • MMDocRAG: benchmark ng multimodal RAG para sa DocQA (mga maramihang pahina ng dokumento, mga cross‑modal na tanikala ng patunay)[19].

Comparative na Talahanayan ng mga Komponente

Paghahambing ng mga pangunahing komponente at diskarte sa MM‑RAG
Komponente Mga Pagpipilian sa Implementasyon Mga Kalamangan Mga Kahinaan / Panganib Kailan Pipiliin
OCR Tesseract / PaddleOCR / mga cloud na API Lokal — privacy at kontrol; cloud — mataas na katumpakan "agad". Mga pagkakamali sa kumplikadong layout; API — gastos at mga kinakailangan sa compliance. Pribadong datos — lokal na OCR; pinakamataas na katumpakan — cloud (kung pinahihintulutan).
Pagsusuri ng Layout Mga panuntunan / ML‑modelo (LayoutLM, LayoutParser) Ang mga panuntunan ay simple para sa mga template na magkakatulad; ML — matatag sa pagkakaiba-iba. Ang mga panuntunan ay nasisira sa mga bagong layout; ang ML ay nangangailangan ng mga mapagkukunan/datos. Mga magkaparehong form — mga panuntunan; magkakaibang corpus — ML.
Vectorization (larawan) CLIP / SigLIP / OCR‑free na mga paglalarawan (Donut/Pix2Struct) Karaniwang latent na espasyo ng text↔image (CLIP/SigLIP); ang OCR‑free ay nag-aalis ng dependensya sa OCR. Hindi nagbabasa ang CLIP ng teksto sa loob ng mga larawan; ang mga paglalarawan ay maaaring magbago ng kahulugan. CLIP/SigLIP — pangunahing multimodal na paghahanap; OCR‑free para sa mga scan na may kumplikadong kalidad.
Pagsasama ng mga Resulta Pag-uuri ayon sa score / quota ayon sa modalidad / LLM‑reranker Ang reranker ay kapansin-pansing nagpapataas ng katumpakan ng pagpili ng konteksto. Pagtaas ng latency at gastos. Mga senaryo na nangangailangan ng mataas na katumpakan; mga simpleng pamamaraan — para sa PoC.
Storage/Index Isang vector / multivector (text+image) / hybrid (BM25+vector) Ang multivector ay sumasaklaw sa iba't ibang representasyon ng isang bagay; ang hybrid ay nagliligtas ng mga keyword/code. Kumplikasyon ng schema at mga update. Mga production system na may pinaghalo-halong datos at mahigpit na SLA.

Mga Praktikal na Puna

  • Hybrid na Paghahanap (BM25 + vector) — de‑facto na pamantayan para sa pagpapataas ng kumpleto at katumpakan sa mga espesipikong termino/code[20].
  • Reranking gamit ang cross‑encoder/LLM ay nakakatipid ng mga token sa pamamagitan ng pagtatanggal ng mga "basura" na kandidato bago ang paglikha[13].
  • Mga modernong VLM retriever (hal., ColPali) ay nagpapakita ng mga kalamangan sa mga visual na mayamang dokumento sa pamamagitan ng direktang pag-iindex ng mga pahina bilang larawan[21].

Talasanggunian

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

Tingnan Din

  • Retrieval-Augmented Generation
  • Vector database - Vektoral na Database
  • Embedding
  • GraphRAG

Mga Tala

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.