MM-RAG (Multimodal RAG) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

MM-RAG (angl. Multimodal Retrieval-Augmented Generation) — je rozšíření klasické paradigmy RAG, ve kterém LLM využívají pro odpovědi nejen text, ale i vizuální data (obrázky, schémata, tabulky, grafy). Multimodální retrieval umožňuje nacházet a propojovat důkazy v různých reprezentacích, čímž snižuje riziko halucinací díky opoře o externí zdroje s přesným odkazem na fragmenty stránek a oblasti (bounding boxes)[1][2].

MM-RAG je zvláště užitečný pro dokumenty, kde podstatná část významu je vyjádřena v netextové podobě (rozvržení stránky, diagramy, struktury tabulek). V takových případech klasický textový RAG často ztrácí důležité prvky kontextu[3][4].

Kontext a řešený problém

Klasický RAG pracuje s textovými pasážemi a nevidí vizuální struktury (rozmístění prvků, popisky obrázků, osy grafů). MM-RAG tyto mezery uzavírá: extrahuje strukturované prvky (text, tabulky, obrázky se souřadnicemi), indexuje je do vektorového prostoru a kombinuje důkazy z různých modalit[5][6].

Architektura MM-RAG

Konvejr MM-RAG přidává ke klasickému RAG fáze zpracování vizuálních dat a zarovnání modalit: ingest → indexování → multimodální retrieval → slučování a reranking → generování s trasováním.

  1. Sběr a předzpracování (Ingestion). Na vstup přicházejí PDF/skeny/obrázky. Provádí se OCR a analýza rozvržení stránky pro vymezení zón: odstavce, nadpisy, tabulky, obrázky a jejich souřadnice. Typické nástroje jsou modely rodiny LayoutLM a nástrojové knihovny LayoutParser; validace a trénování se často opírají o datasety PubLayNet a DocLayNet[7][8][9].
  2. Segmentace na regiony. Extrahují se vizuální objekty (diagramy, tabulky, ilustrace, popisky). Pro vyšší odolnost se používají OCR‑free modely (např. Donut) nebo kombinované pipeliny OCR+VLM[10].
  3. Indexování (Vector Index). Textové chunky a vizuální prvky (obrázky nebo jejich popisy) se převádějí na vektorové reprezentace a ukládají do vektorové databáze. Pro sjednocený prostor text↔image se používají CLIP nebo SigLIP; pro produkci jsou vhodné multimodální/multivektorové indexy (jeden objekt — více vektorů)[6][11][12].
  4. Multimodální retrieval a reranking. Provádí se kombinace textového a vizuálního vyhledávání; kandidáti (odstavce, tabulky, obrázky/regiony) jsou sloučeni a rerankováni „těžším" modelem (cross‑encoder/LLM‑reranker) pro zvýšení přesnosti[13].
  5. Zabalení kontextu a generování. Vybrané fragmenty jsou předány do LLM/VLM. Pokud je model multimodální (např. GPT‑4V/4o), obrázky mohou být předány přímo; při textovém LLM jsou obrázky předem převedeny na podrobné popisy[14][15].
  6. Trasování a citování. Odpověď je doprovázena klikatelnými citacemi s odkazem nejen na dokument/stránku, ale i na region (souřadnice). To zvyšuje úroveň grounding a důvěru uživatelů[2].

Hodnocení kvality a metriky

Efektivita MM‑RAG se hodnotí na úrovních extrakce, retrievalu a generování.

  • Kvalita extrakce vizuálních dat. Přesnost OCR (WER/CER), kvalita analýzy rozvržení (mAP/Precision/Recall) na sadách DocLayNet/PubLayNet[8][7].
  • Kvalita retrievalu. Standardní metriky informačního vyhledávání: Recall@K, Precision@K, MRR; pro multimodalitu — zvlášť podle modalit a v jejich souhrnu.
  • Kvalita odpovědi (end‑to‑end). Automatické metriky faithfulness/groundedness a lidské hodnocení. V praxi se používají frameworky RAGAS/TruLens/DeepEval[16].
  • Benchmarky.
    • DocVQA: otázky k obrázkům dokumentů[3].
    • TextVQA: otázky vyžadující čtení textu na obrázcích[4].
    • InfographicVQA: otázky k infografikám[17].
    • ChartQA: otázky k diagramům s požadavkem logického uvažování[18].
    • MMDocRAG: benchmark multimodálního RAG pro DocQA (vícestránkové dokumenty, cross‑modální řetězce důkazů)[19].

Srovnávací tabulka komponent

Srovnání klíčových komponent a přístupů v MM‑RAG
Komponenta Varianty implementace Výhody Nevýhody / rizika Kdy volit
OCR Tesseract / PaddleOCR / cloudová API Lokální — soukromí a kontrola; cloudová — vysoká přesnost „z krabice". Chyby na složitém rozvržení; API — náklady a požadavky na compliance. Soukromá data — lokální OCR; maximální přesnost — cloud (pokud je přípustné).
Analýza rozvržení Pravidla / ML‑model (LayoutLM, LayoutParser) Pravidla jsou jednoduchá pro jednotné šablony; ML — odolný vůči různorodosti. Pravidla selhávají na nových rozvrzeních; ML vyžaduje zdroje/data. Jednotné formuláře — pravidla; heterogenní korpus — ML.
Vektorizace (obr.) CLIP / SigLIP / OCR‑free popisy (Donut/Pix2Struct) Společný latentní prostor text↔image (CLIP/SigLIP); OCR‑free odstraňuje závislost na OCR. CLIP nečte text uvnitř obrázků; popisy mohou zkreslovat smysl. CLIP/SigLIP — základní multimodální vyhledávání; OCR‑free pro skeny složité kvality.
Slučování výsledků Řazení podle skóre / kvóty podle modalit / LLM‑reranker Reranker výrazně zvyšuje přesnost výběru kontextu. Nárůst zpoždění a nákladů. High‑precision scénáře; jednoduché metody — pro PoC.
Úložiště/index Jeden vektor / multivektor (text+image) / hybridní (BM25+vector) Multivektor pokrývá různé reprezentace jednoho objektu; hybridní zachraňuje klíčová slova/kódy. Komplikace schématu a aktualizací. Produkční systémy se smíšenými daty a přísnými SLA.

Praktické poznámky

  • Hybridní vyhledávání (BM25 + vektor) — de‑facto standard pro zvýšení úplnosti a přesnosti u specifických termínů/kódů[20].
  • Reranking cross‑encoderem/LLM šetří tokeny tím, že před generováním odstraňuje „nepotřebné" kandidáty[13].
  • Moderní VLM‑retrievery (např. ColPali) vykazují výhody na vizuálně bohatých dokumentech díky přímé indexaci stránek jako obrázků[21].

Literatura

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

Viz také

  • Retrieval-Augmented Generation
  • Vektorová databáze
  • Embedding
  • GraphRAG

Poznámky

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.