MM-RAG (Multimodal RAG) (SV)
MM-RAG (eng. Multimodal Retrieval-Augmented Generation) — är en utvidgning av det klassiska RAG-paradigmet, där LLM använder inte bara text utan även visuella data (bilder, scheman, tabeller, diagram) för att besvara frågor. Multimodal retrieval möjliggör sökning och sammankoppling av bevis i olika representationer, vilket minskar risken för hallucinationer genom att förlita sig på externa källor med exakt koppling till sidfragment och regioner (bounding boxes)[1][2].
MM-RAG är särskilt användbart för dokument där en väsentlig del av innebörden presenteras i icke-textform (sidlayout, diagram, tabellstrukturer). I sådana fall förlorar klassisk text-RAG ofta viktiga kontextelement[3][4].
Kontext och det problem som löses
Klassisk RAG arbetar med textpassager och ser inte visuella strukturer (elementplacering, bildtexter, diagramaxlar). MM-RAG täpper till dessa luckor: extraherar strukturerade element (text, tabeller, bilder med koordinater), indexerar dem i ett vektorutrymme och kombinerar bevis från olika modaliteter[5][6].
Arkitektur för MM-RAG
MM-RAG-pipelinen tillfogar steg för bearbetning av visuella data och modalitetsjustering till klassisk RAG: inläsning → indexering → multimodal retrieval → sammanslagning och omrankning → generering med spårning.
- Insamling och förbehandling (Ingestion). Indata är PDF-filer/skanningar/bilder. OCR utförs samt layoutanalys av sidan för att identifiera zoner: stycken, rubriker, tabeller, bilder och deras koordinater. Typiska verktyg är modeller ur LayoutLM-familjen och biblioteket LayoutParser; validering och träning stöder sig ofta på dataseten PubLayNet och DocLayNet[7][8][9].
- Segmentering i regioner. Visuella objekt extraheras (diagram, tabeller, illustrationer, bildtexter). För ökad robusthet används OCR-fria modeller (t.ex. Donut) eller kombinerade OCR+VLM-pipelines[10].
- Indexering (Vector Index). Textchunkar och visuella element (bilder eller deras beskrivningar) omvandlas till vektorrepresentationer och läggs in i en vektordatabas. För ett kombinerat text↔image-utrymme används CLIP eller SigLIP; för produktion är multimodala/multivektorindex praktiska (ett objekt — flera vektorer)[6][11][12].
- Multimodal retrieval och omrankning. En kombination av text- och visuell sökning utförs; kandidater (stycken, tabeller, bilder/regioner) slås samman och omrankas med en mer kapabel modell (kors-enkoder/LLM-reranker) för ökad precision[13].
- Kontextpaketering och generering. Utvalda fragment matas in i LLM/VLM. Om modellen är multimodal (t.ex. GPT-4V/4o) kan bilder skickas direkt; vid text-LLM konverteras bilder i förväg till detaljerade beskrivningar[14][15].
- Spårning och citering. Svaret åtföljs av klickbara citat kopplade inte bara till dokument/sida utan även till region (koordinater). Detta höjer nivån av grounding och användarnas förtroende[2].
Kvalitetsutvärdering och mätvärden
Effektiviteten hos MM-RAG utvärderas på nivåerna för extraktion, retrieval och generering.
- Kvalitet på visuell dataextraktion. OCR-precision (WER/CER), kvalitet på layoutanalys (mAP/Precision/Recall) på DocLayNet/PubLayNet-dataset[8][7].
- Retrieval-kvalitet. Standardmätvärden inom informationssökning: Recall@K, Precision@K, MRR; för multimodalitet — separat per modalitet och i kombination.
- Svarskvalitet (end-to-end). Automatiserade mätvärden för faithfulness/groundedness och mänsklig utvärdering. I praktiken används ramverken RAGAS/TruLens/DeepEval[16].
- Benchmark-dataset.
- DocVQA: frågor om dokumentbilder[3].
- TextVQA: frågor som kräver avläsning av text i bilder[4].
- InfographicVQA: frågor om infografik[17].
- ChartQA: frågor om diagram med krav på logiskt resonemang[18].
- MMDocRAG: benchmark för multimodal RAG inom DocQA (flersidiga dokument, korsmodala bevenskedjor)[19].
Jämförelsetabell över komponenter
| Komponent | Implementeringsalternativ | Fördelar | Nackdelar / risker | När ska man välja |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / molnbaserade API | Lokala — integritet och kontroll; molnbaserade — hög precision direkt ur lådan. | Fel vid komplex layout; API — kostnad och krav på regelefterlevnad. | Privata data — lokal OCR; maximal precision — molnet (om tillåtet). |
| Layoutanalys | Regler / ML-modell (LayoutLM, LayoutParser) | Regler är enkla för enhetliga mallar; ML — robust mot variation. | Regler brister vid nya layouter; ML kräver resurser/data. | Enhetliga formulär — regler; heterogent corpus — ML. |
| Vektorisering (bild.) | CLIP / SigLIP / OCR-fria beskrivningar (Donut/Pix2Struct) | Gemensamt latent utrymme text↔image (CLIP/SigLIP); OCR-fritt eliminerar OCR-beroendet. | CLIP läser inte text inuti bilder; beskrivningar kan förvanska innebörden. | CLIP/SigLIP — grundläggande multimodal sökning; OCR-fritt för skanningar med komplex kvalitet. |
| Sammanslagning av resultat | Sortering efter poäng / kvoter per modalitet / LLM-reranker | Omrankning förbättrar märkbart precisionen i kontextval. | Ökad latens och kostnad. | High-precision-scenarier; enkla metoder — för PoC. |
| Lagring/index | Enskild vektor / multivektor (text+bild) / hybrid (BM25+vektor) | Multivektor täcker olika representationer av samma objekt; hybrid räddar nyckelord/koder. | Ökad komplexitet i schema och uppdateringar. | Produktionssystem med blandade data och strikta SLA. |
Praktiska anmärkningar
- Hybridsökning (BM25 + vektor) — de facto-standard för att förbättra täckning och precision vid specifika termer/koder[20].
- Omrankning med kors-enkoder/LLM sparar tokens genom att filtrera bort irrelevanta kandidater före generering[13].
- Moderna VLM-retrievers (t.ex. ColPali) visar fördelar på visuellt rika dokument tack vare direkt indexering av sidor som bilder[21].
Litteratur
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero-Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval-Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi-modal Retrieval is What You Need for Multi-document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno-Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR-free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One-shot Visual Language Reasoning by Plot-to-Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2-VL: Enhancing Vision-Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval-Augmented Generation. arXiv:2309.15217.
Se även
- Retrieval-Augmented Generation
- Vektordatabas
- Embedding
- GraphRAG
Noter
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.