MM-RAG (Multimodal RAG) (CS)
MM-RAG (angl. Multimodal Retrieval-Augmented Generation) — je rozšíření klasické paradigmy RAG, ve kterém LLM využívají pro odpovědi nejen text, ale i vizuální data (obrázky, schémata, tabulky, grafy). Multimodální retrieval umožňuje nacházet a propojovat důkazy v různých reprezentacích, čímž snižuje riziko halucinací díky opoře o externí zdroje s přesným odkazem na fragmenty stránek a oblasti (bounding boxes)[1][2].
MM-RAG je zvláště užitečný pro dokumenty, kde podstatná část významu je vyjádřena v netextové podobě (rozvržení stránky, diagramy, struktury tabulek). V takových případech klasický textový RAG často ztrácí důležité prvky kontextu[3][4].
Kontext a řešený problém
Klasický RAG pracuje s textovými pasážemi a nevidí vizuální struktury (rozmístění prvků, popisky obrázků, osy grafů). MM-RAG tyto mezery uzavírá: extrahuje strukturované prvky (text, tabulky, obrázky se souřadnicemi), indexuje je do vektorového prostoru a kombinuje důkazy z různých modalit[5][6].
Architektura MM-RAG
Konvejr MM-RAG přidává ke klasickému RAG fáze zpracování vizuálních dat a zarovnání modalit: ingest → indexování → multimodální retrieval → slučování a reranking → generování s trasováním.
- Sběr a předzpracování (Ingestion). Na vstup přicházejí PDF/skeny/obrázky. Provádí se OCR a analýza rozvržení stránky pro vymezení zón: odstavce, nadpisy, tabulky, obrázky a jejich souřadnice. Typické nástroje jsou modely rodiny LayoutLM a nástrojové knihovny LayoutParser; validace a trénování se často opírají o datasety PubLayNet a DocLayNet[7][8][9].
- Segmentace na regiony. Extrahují se vizuální objekty (diagramy, tabulky, ilustrace, popisky). Pro vyšší odolnost se používají OCR‑free modely (např. Donut) nebo kombinované pipeliny OCR+VLM[10].
- Indexování (Vector Index). Textové chunky a vizuální prvky (obrázky nebo jejich popisy) se převádějí na vektorové reprezentace a ukládají do vektorové databáze. Pro sjednocený prostor text↔image se používají CLIP nebo SigLIP; pro produkci jsou vhodné multimodální/multivektorové indexy (jeden objekt — více vektorů)[6][11][12].
- Multimodální retrieval a reranking. Provádí se kombinace textového a vizuálního vyhledávání; kandidáti (odstavce, tabulky, obrázky/regiony) jsou sloučeni a rerankováni „těžším" modelem (cross‑encoder/LLM‑reranker) pro zvýšení přesnosti[13].
- Zabalení kontextu a generování. Vybrané fragmenty jsou předány do LLM/VLM. Pokud je model multimodální (např. GPT‑4V/4o), obrázky mohou být předány přímo; při textovém LLM jsou obrázky předem převedeny na podrobné popisy[14][15].
- Trasování a citování. Odpověď je doprovázena klikatelnými citacemi s odkazem nejen na dokument/stránku, ale i na region (souřadnice). To zvyšuje úroveň grounding a důvěru uživatelů[2].
Hodnocení kvality a metriky
Efektivita MM‑RAG se hodnotí na úrovních extrakce, retrievalu a generování.
- Kvalita extrakce vizuálních dat. Přesnost OCR (WER/CER), kvalita analýzy rozvržení (mAP/Precision/Recall) na sadách DocLayNet/PubLayNet[8][7].
- Kvalita retrievalu. Standardní metriky informačního vyhledávání: Recall@K, Precision@K, MRR; pro multimodalitu — zvlášť podle modalit a v jejich souhrnu.
- Kvalita odpovědi (end‑to‑end). Automatické metriky faithfulness/groundedness a lidské hodnocení. V praxi se používají frameworky RAGAS/TruLens/DeepEval[16].
- Benchmarky.
- DocVQA: otázky k obrázkům dokumentů[3].
- TextVQA: otázky vyžadující čtení textu na obrázcích[4].
- InfographicVQA: otázky k infografikám[17].
- ChartQA: otázky k diagramům s požadavkem logického uvažování[18].
- MMDocRAG: benchmark multimodálního RAG pro DocQA (vícestránkové dokumenty, cross‑modální řetězce důkazů)[19].
Srovnávací tabulka komponent
| Komponenta | Varianty implementace | Výhody | Nevýhody / rizika | Kdy volit |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / cloudová API | Lokální — soukromí a kontrola; cloudová — vysoká přesnost „z krabice". | Chyby na složitém rozvržení; API — náklady a požadavky na compliance. | Soukromá data — lokální OCR; maximální přesnost — cloud (pokud je přípustné). |
| Analýza rozvržení | Pravidla / ML‑model (LayoutLM, LayoutParser) | Pravidla jsou jednoduchá pro jednotné šablony; ML — odolný vůči různorodosti. | Pravidla selhávají na nových rozvrzeních; ML vyžaduje zdroje/data. | Jednotné formuláře — pravidla; heterogenní korpus — ML. |
| Vektorizace (obr.) | CLIP / SigLIP / OCR‑free popisy (Donut/Pix2Struct) | Společný latentní prostor text↔image (CLIP/SigLIP); OCR‑free odstraňuje závislost na OCR. | CLIP nečte text uvnitř obrázků; popisy mohou zkreslovat smysl. | CLIP/SigLIP — základní multimodální vyhledávání; OCR‑free pro skeny složité kvality. |
| Slučování výsledků | Řazení podle skóre / kvóty podle modalit / LLM‑reranker | Reranker výrazně zvyšuje přesnost výběru kontextu. | Nárůst zpoždění a nákladů. | High‑precision scénáře; jednoduché metody — pro PoC. |
| Úložiště/index | Jeden vektor / multivektor (text+image) / hybridní (BM25+vector) | Multivektor pokrývá různé reprezentace jednoho objektu; hybridní zachraňuje klíčová slova/kódy. | Komplikace schématu a aktualizací. | Produkční systémy se smíšenými daty a přísnými SLA. |
Praktické poznámky
- Hybridní vyhledávání (BM25 + vektor) — de‑facto standard pro zvýšení úplnosti a přesnosti u specifických termínů/kódů[20].
- Reranking cross‑encoderem/LLM šetří tokeny tím, že před generováním odstraňuje „nepotřebné" kandidáty[13].
- Moderní VLM‑retrievery (např. ColPali) vykazují výhody na vizuálně bohatých dokumentech díky přímé indexaci stránek jako obrázků[21].
Literatura
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
Viz také
- Retrieval-Augmented Generation
- Vektorová databáze
- Embedding
- GraphRAG
Poznámky
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.