MM-RAG (Multimodal RAG) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

MM-RAG (ingl. Multimodal Retrieval-Augmented Generation) — è un'estensione del classico paradigma RAG, in cui i LLM utilizzano per rispondere non solo testo, ma anche dati visivi (immagini, schemi, tabelle, grafici). Il recupero multimodale consente di trovare e collegare prove in diverse rappresentazioni, riducendo il rischio di allucinazioni grazie all'ancoraggio a fonti esterne con preciso riferimento a frammenti di pagina e aree (bounding boxes)[1][2].

MM-RAG è particolarmente utile per i documenti in cui una parte significativa del significato è rappresentata in forma non testuale (layout di pagina, diagrammi, strutture di tabelle). In tali casi, il classico RAG testuale perde spesso elementi importanti del contesto[3][4].

Contesto e problema affrontato

Il classico RAG opera su passaggi testuali e non percepisce le strutture visive (disposizione degli elementi, didascalie delle figure, assi dei grafici). MM-RAG colma queste lacune: estrae elementi strutturati (testo, tabelle, immagini con coordinate), li indicizza in uno spazio vettoriale e combina prove provenienti da diverse modalità[5][6].

Architettura di MM-RAG

La pipeline MM-RAG aggiunge al classico RAG fasi di elaborazione dei dati visivi e di allineamento delle modalità: ingestione → indicizzazione → recupero multimodale → fusione e reranking → generazione con tracciabilità.

  1. Raccolta e preprocessamento (Ingestion). In ingresso arrivano PDF/scansioni/immagini. Vengono eseguiti OCR e analisi del layout di pagina per individuare zone: paragrafi, intestazioni, tabelle, immagini e le loro coordinate. Strumenti tipici — modelli della famiglia LayoutLM e librerie strumentali LayoutParser; la validazione e l'addestramento si basano spesso sui dataset PubLayNet e DocLayNet[7][8][9].
  2. Segmentazione in regioni. Vengono estratti oggetti visivi (diagrammi, tabelle, illustrazioni, didascalie). Per una maggiore robustezza si utilizzano modelli OCR-free (es. Donut) o pipeline combinate OCR+VLM[10].
  3. Indicizzazione (Vector Index). I chunk testuali e gli elementi visivi (immagini o loro descrizioni) vengono trasformati in rappresentazioni vettoriali e inseriti in un database vettoriale. Per lo spazio unificato text↔image si utilizzano CLIP o SigLIP; per la produzione sono comodi gli indici multimodali/multivettoriali (un oggetto — più vettori)[6][11][12].
  4. Recupero multimodale e reranking. Viene eseguita una combinazione di ricerca testuale e visiva; i candidati (paragrafi, tabelle, immagini/regioni) vengono uniti e riordinati da un modello più «pesante» (cross-encoder/LLM-reranker) per migliorare la precisione[13].
  5. Confezionamento del contesto e generazione. I frammenti selezionati vengono forniti al LLM/VLM. Se il modello è multimodale (es. GPT-4V/4o), le immagini possono essere fornite direttamente; con un LLM testuale, le immagini vengono preventivamente convertite in descrizioni dettagliate[14][15].
  6. Tracciabilità e citazione. La risposta è accompagnata da citazioni cliccabili con riferimento non solo al documento/pagina, ma anche alla regione (coordinate). Questo aumenta il livello di grounding e la fiducia degli utenti[2].

Valutazione della qualità e metriche

L'efficacia di MM-RAG viene valutata a livello di estrazione, recupero e generazione.

  • Qualità dell'estrazione dei dati visivi. Precisione dell'OCR (WER/CER), qualità dell'analisi del layout (mAP/Precision/Recall) sui dataset DocLayNet/PubLayNet[8][7].
  • Qualità del recupero. Metriche standard di recupero dell'informazione: Recall@K, Precision@K, MRR; per la multimodalità — separatamente per modalità e in combinazione.
  • Qualità della risposta (end-to-end). Metriche automatiche di faithfulness/groundedness e valutazione umana. In pratica si utilizzano i framework RAGAS/TruLens/DeepEval[16].
  • Benchmark.
    • DocVQA: domande su immagini di documenti[3].
    • TextVQA: domande che richiedono la lettura di testo nelle immagini[4].
    • InfographicVQA: domande su infografiche[17].
    • ChartQA: domande su diagrammi con requisiti di ragionamento logico[18].
    • MMDocRAG: benchmark di RAG multimodale per DocQA (documenti multipagina, catene di prove cross-modali)[19].

Tabella comparativa dei componenti

Confronto dei componenti e degli approcci chiave in MM-RAG
Componente Varianti di implementazione Pro Contro / rischi Quando scegliere
OCR Tesseract / PaddleOCR / API cloud Locali — privacy e controllo; cloud — alta precisione «out of the box». Errori su layout complessi; API — costo e requisiti di compliance. Dati privati — OCR locale; massima precisione — cloud (se consentito).
Analisi del layout Regole / Modello ML (LayoutLM, LayoutParser) Le regole sono semplici per template uniformi; ML — robusto alla varietà. Le regole si rompono su nuovi layout; ML richiede risorse/dati. Moduli uniformi — regole; corpus eterogeneo — ML.
Vettorizzazione (immagini) CLIP / SigLIP / Descrizioni OCR-free (Donut/Pix2Struct) Spazio latente comune text↔image (CLIP/SigLIP); OCR-free elimina la dipendenza dall'OCR. CLIP non legge il testo all'interno delle immagini; le descrizioni possono distorcere il significato. CLIP/SigLIP — ricerca multimodale di base; OCR-free per scansioni di qualità complessa.
Fusione dei risultati Ordinamento per score / quote per modalità / LLM-reranker Il reranker migliora notevolmente la precisione nella selezione del contesto. Aumento della latenza e del costo. Scenari ad alta precisione; metodi semplici — per PoC.
Archivio/indice Singolo vettore / multivettore (text+image) / ibrido (BM25+vector) Il multivettore copre diverse rappresentazioni dello stesso oggetto; l'ibrido salva parole chiave/codici. Complessità dello schema e degli aggiornamenti. Sistemi di produzione con dati misti e SLA stringenti.

Note pratiche

  • Ricerca ibrida (BM25 + vettore) — standard de facto per migliorare completezza e precisione su termini/codici specifici[20].
  • Reranking con cross-encoder/LLM consente di risparmiare token, scartando i candidati «di scarsa qualità» prima della generazione[13].
  • I moderni retriever VLM (es. ColPali) mostrano vantaggi su documenti visivamente ricchi grazie all'indicizzazione diretta delle pagine come immagini[21].

Vedi anche

  • Retrieval-Augmented Generation
  • Database vettoriale
  • Embedding
  • GraphRAG

Letteratura

  • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero-Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval-Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi-modal Retrieval is What You Need for Multi-document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno-Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR-free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One-shot Visual Language Reasoning by Plot-to-Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2-VL: Enhancing Vision-Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval-Augmented Generation. arXiv:2309.15217.

Note

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.