MM-RAG (Multimodal RAG) (IT)
MM-RAG (ingl. Multimodal Retrieval-Augmented Generation) — è un'estensione del classico paradigma RAG, in cui i LLM utilizzano per rispondere non solo testo, ma anche dati visivi (immagini, schemi, tabelle, grafici). Il recupero multimodale consente di trovare e collegare prove in diverse rappresentazioni, riducendo il rischio di allucinazioni grazie all'ancoraggio a fonti esterne con preciso riferimento a frammenti di pagina e aree (bounding boxes)[1][2].
MM-RAG è particolarmente utile per i documenti in cui una parte significativa del significato è rappresentata in forma non testuale (layout di pagina, diagrammi, strutture di tabelle). In tali casi, il classico RAG testuale perde spesso elementi importanti del contesto[3][4].
Contesto e problema affrontato
Il classico RAG opera su passaggi testuali e non percepisce le strutture visive (disposizione degli elementi, didascalie delle figure, assi dei grafici). MM-RAG colma queste lacune: estrae elementi strutturati (testo, tabelle, immagini con coordinate), li indicizza in uno spazio vettoriale e combina prove provenienti da diverse modalità[5][6].
Architettura di MM-RAG
La pipeline MM-RAG aggiunge al classico RAG fasi di elaborazione dei dati visivi e di allineamento delle modalità: ingestione → indicizzazione → recupero multimodale → fusione e reranking → generazione con tracciabilità.
- Raccolta e preprocessamento (Ingestion). In ingresso arrivano PDF/scansioni/immagini. Vengono eseguiti OCR e analisi del layout di pagina per individuare zone: paragrafi, intestazioni, tabelle, immagini e le loro coordinate. Strumenti tipici — modelli della famiglia LayoutLM e librerie strumentali LayoutParser; la validazione e l'addestramento si basano spesso sui dataset PubLayNet e DocLayNet[7][8][9].
- Segmentazione in regioni. Vengono estratti oggetti visivi (diagrammi, tabelle, illustrazioni, didascalie). Per una maggiore robustezza si utilizzano modelli OCR-free (es. Donut) o pipeline combinate OCR+VLM[10].
- Indicizzazione (Vector Index). I chunk testuali e gli elementi visivi (immagini o loro descrizioni) vengono trasformati in rappresentazioni vettoriali e inseriti in un database vettoriale. Per lo spazio unificato text↔image si utilizzano CLIP o SigLIP; per la produzione sono comodi gli indici multimodali/multivettoriali (un oggetto — più vettori)[6][11][12].
- Recupero multimodale e reranking. Viene eseguita una combinazione di ricerca testuale e visiva; i candidati (paragrafi, tabelle, immagini/regioni) vengono uniti e riordinati da un modello più «pesante» (cross-encoder/LLM-reranker) per migliorare la precisione[13].
- Confezionamento del contesto e generazione. I frammenti selezionati vengono forniti al LLM/VLM. Se il modello è multimodale (es. GPT-4V/4o), le immagini possono essere fornite direttamente; con un LLM testuale, le immagini vengono preventivamente convertite in descrizioni dettagliate[14][15].
- Tracciabilità e citazione. La risposta è accompagnata da citazioni cliccabili con riferimento non solo al documento/pagina, ma anche alla regione (coordinate). Questo aumenta il livello di grounding e la fiducia degli utenti[2].
Valutazione della qualità e metriche
L'efficacia di MM-RAG viene valutata a livello di estrazione, recupero e generazione.
- Qualità dell'estrazione dei dati visivi. Precisione dell'OCR (WER/CER), qualità dell'analisi del layout (mAP/Precision/Recall) sui dataset DocLayNet/PubLayNet[8][7].
- Qualità del recupero. Metriche standard di recupero dell'informazione: Recall@K, Precision@K, MRR; per la multimodalità — separatamente per modalità e in combinazione.
- Qualità della risposta (end-to-end). Metriche automatiche di faithfulness/groundedness e valutazione umana. In pratica si utilizzano i framework RAGAS/TruLens/DeepEval[16].
- Benchmark.
- DocVQA: domande su immagini di documenti[3].
- TextVQA: domande che richiedono la lettura di testo nelle immagini[4].
- InfographicVQA: domande su infografiche[17].
- ChartQA: domande su diagrammi con requisiti di ragionamento logico[18].
- MMDocRAG: benchmark di RAG multimodale per DocQA (documenti multipagina, catene di prove cross-modali)[19].
Tabella comparativa dei componenti
| Componente | Varianti di implementazione | Pro | Contro / rischi | Quando scegliere |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / API cloud | Locali — privacy e controllo; cloud — alta precisione «out of the box». | Errori su layout complessi; API — costo e requisiti di compliance. | Dati privati — OCR locale; massima precisione — cloud (se consentito). |
| Analisi del layout | Regole / Modello ML (LayoutLM, LayoutParser) | Le regole sono semplici per template uniformi; ML — robusto alla varietà. | Le regole si rompono su nuovi layout; ML richiede risorse/dati. | Moduli uniformi — regole; corpus eterogeneo — ML. |
| Vettorizzazione (immagini) | CLIP / SigLIP / Descrizioni OCR-free (Donut/Pix2Struct) | Spazio latente comune text↔image (CLIP/SigLIP); OCR-free elimina la dipendenza dall'OCR. | CLIP non legge il testo all'interno delle immagini; le descrizioni possono distorcere il significato. | CLIP/SigLIP — ricerca multimodale di base; OCR-free per scansioni di qualità complessa. |
| Fusione dei risultati | Ordinamento per score / quote per modalità / LLM-reranker | Il reranker migliora notevolmente la precisione nella selezione del contesto. | Aumento della latenza e del costo. | Scenari ad alta precisione; metodi semplici — per PoC. |
| Archivio/indice | Singolo vettore / multivettore (text+image) / ibrido (BM25+vector) | Il multivettore copre diverse rappresentazioni dello stesso oggetto; l'ibrido salva parole chiave/codici. | Complessità dello schema e degli aggiornamenti. | Sistemi di produzione con dati misti e SLA stringenti. |
Note pratiche
- Ricerca ibrida (BM25 + vettore) — standard de facto per migliorare completezza e precisione su termini/codici specifici[20].
- Reranking con cross-encoder/LLM consente di risparmiare token, scartando i candidati «di scarsa qualità» prima della generazione[13].
- I moderni retriever VLM (es. ColPali) mostrano vantaggi su documenti visivamente ricchi grazie all'indicizzazione diretta delle pagine come immagini[21].
Vedi anche
- Retrieval-Augmented Generation
- Database vettoriale
- Embedding
- GraphRAG
Letteratura
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero-Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval-Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi-modal Retrieval is What You Need for Multi-document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno-Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR-free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One-shot Visual Language Reasoning by Plot-to-Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2-VL: Enhancing Vision-Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval-Augmented Generation. arXiv:2309.15217.
Note
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.