MM-RAG (Multimodal RAG) (RO)
MM-RAG (engl. Multimodal Retrieval-Augmented Generation) — este o extensie a paradigmei clasice RAG, în care LLM utilizează pentru răspuns nu doar text, ci și date vizuale (imagini, scheme, tabele, grafice). Retrieval-ul multimodal permite găsirea și corelarea dovezilor în diverse reprezentări, reducând riscul halucinațiilor prin sprijinirea pe surse externe cu ancorare precisă la fragmente de pagini și regiuni (bounding boxes)[1][2].
MM-RAG este deosebit de util pentru documente în care o parte semnificativă a sensului este reprezentată în formă non-textuală (aspectul paginii, diagrame, structuri de tabele). În astfel de cazuri, RAG-ul textual clasic pierde adesea elemente importante de context[3][4].
Contextul și problema rezolvată
RAG-ul clasic operează cu pasaje de text și nu percepe structurile vizuale (dispunerea elementelor, legendele figurilor, axele graficelor). MM-RAG acoperă aceste lacune: extrage elemente structurate (text, tabele, imagini cu coordonate), le indexează în spațiul vectorial și combină dovezi din diferite modalități[5][6].
Arhitectura MM-RAG
Conveiorul MM-RAG adaugă la RAG-ul clasic etape de procesare a datelor vizuale și de aliniere a modalităților: ingestie → indexare → retrieval multimodal → fuziune și reranking → generare cu trasabilitate.
- Colectare și preprocesare (Ingestion). La intrare sosesc PDF-uri/scanări/imagini. Se efectuează OCR și analiza aspectului paginii pentru delimitarea zonelor: paragrafe, titluri, tabele, imagini și coordonatele lor. Instrumente tipice — modele din familia LayoutLM și biblioteca LayoutParser; validarea și antrenarea se bazează adesea pe dataseturile PubLayNet și DocLayNet[7][8][9].
- Segmentarea pe regiuni. Se extrag obiecte vizuale (diagrame, tabele, ilustrații, legende). Pentru robustețe sporită se utilizează modele OCR‑free (de ex., Donut) sau pipeline-uri combinate OCR+VLM[10].
- Indexare (Vector Index). Chunk-urile de text și elementele vizuale (imagini sau descrierile lor) sunt transformate în reprezentări vectoriale și înregistrate în baza de date vectorială. Pentru spațiul unificat text↔image se utilizează CLIP sau SigLIP; pentru producție sunt convenabile indexurile multimodale/multivectoriale (un obiect — mai mulți vectori)[6][11][12].
- Retrieval multimodal și reranking. Se realizează o combinație de căutare textuală și vizuală; candidații (paragrafe, tabele, imagini/regiuni) sunt uniți și rerankați de un model mai „greu" (cross-encoder/LLM-reranker) pentru creșterea preciziei[13].
- Ambalarea contextului și generarea. Fragmentele selectate sunt transmise LLM/VLM. Dacă modelul este multimodal (de ex., GPT‑4V/4o), imaginile pot fi furnizate direct; în cazul unui LLM textual, imaginile sunt convertite în prealabil în descrieri detaliate[14][15].
- Trasabilitate și citare. Răspunsul este însoțit de citate clicabile cu ancorare nu doar la document/pagină, ci și la regiune (coordonate). Aceasta îmbunătățește nivelul de grounding și încrederea utilizatorilor[2].
Evaluarea calității și metricile
Eficiența MM‑RAG este evaluată la nivelurile de extracție, retrieval și generare.
- Calitatea extracției datelor vizuale. Precizia OCR (WER/CER), calitatea analizei aspectului (mAP/Precision/Recall) pe seturile DocLayNet/PubLayNet[8][7].
- Calitatea retrieval-ului. Metrice standard de recuperare a informației: Recall@K, Precision@K, MRR; pentru multimodalitate — separat pe modalități și în combinație.
- Calitatea răspunsului (end‑to‑end). Metrice automate de faithfulness/groundedness și evaluare umană. În practică se utilizează framework-urile RAGAS/TruLens/DeepEval[16].
- Benchmark-uri.
- DocVQA: întrebări despre imagini de documente[3].
- TextVQA: întrebări care necesită citirea textului din imagini[4].
- InfographicVQA: întrebări despre infografice[17].
- ChartQA: întrebări despre diagrame cu cerință de raționament logic[18].
- MMDocRAG: benchmark de RAG multimodal pentru DocQA (documente cu mai multe pagini, lanțuri de dovezi cross-modale)[19].
Tabel comparativ al componentelor
| Componentă | Variante de implementare | Avantaje | Dezavantaje / riscuri | Când să alegi |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / API-uri cloud | Locale — confidențialitate și control; cloud — precizie ridicată „out of the box\". | Erori pe aspecte complexe; API — cost și cerințe de conformitate. | Date private — OCR local; precizie maximă — cloud (dacă este permis). |
| Analiza aspectului | Reguli / model ML (LayoutLM, LayoutParser) | Regulile sunt simple pentru șabloane uniforme; ML — robust la diversitate. | Regulile se defectează pe aspecte noi; ML necesită resurse/date. | Formulare uniforme — reguli; corpus eterogen — ML. |
| Vectorizare (imagini) | CLIP / SigLIP / descrieri OCR‑free (Donut/Pix2Struct) | Spațiu latent comun text↔image (CLIP/SigLIP); OCR‑free elimină dependența de OCR. | CLIP nu citește textul din interiorul imaginilor; descrierile pot distorsiona sensul. | CLIP/SigLIP — căutare multimodală de bază; OCR‑free pentru scanări de calitate complexă. |
| Fuziunea rezultatelor | Sortare după scor / cote pe modalități / LLM‑reranker | Reranker-ul îmbunătățește semnificativ precizia selectării contextului. | Creșterea latenței și a costului. | Scenarii de înaltă precizie; metode simple — pentru PoC. |
| Stocare/index | Un singur vector / multivector (text+image) / hibrid (BM25+vector) | Multivectorul acoperă reprezentări diferite ale aceluiași obiect; hibridul salvează cuvinte-cheie/coduri. | Complexitate sporită a schemei și actualizărilor. | Sisteme de producție cu date mixte și SLA stricte. |
Observații practice
- Căutarea hibridă (BM25 + vector) — standard de facto pentru îmbunătățirea completitudinii și preciziei pe termeni/coduri specifice[20].
- Rerankingul cu cross-encoder/LLM economisește tokeni, eliminând candidații „de calitate slabă\" înainte de generare[13].
- Retriever-ele VLM moderne (de ex., ColPali) demonstrează avantaje pe documente bogate vizual prin indexarea directă a paginilor ca imagini[21].
Bibliografie
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
Vezi și
- Retrieval-Augmented Generation
- Bază de date vectorială
- Embedding
- GraphRAG
Note
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.