MM-RAG (Multimodal RAG) (ES)
MM-RAG (del inglés Multimodal Retrieval-Augmented Generation) es una extensión del paradigma clásico de RAG en la que los modelos grandes de lenguaje (LLM) utilizan no solo texto para generar respuestas, sino también datos visuales (imágenes, diagramas, tablas, gráficos). La recuperación multimodal permite encontrar y vincular evidencia en diversas representaciones, reduciendo el riesgo de alucinaciones al basarse en fuentes externas con referencias precisas a fragmentos de páginas y áreas (bounding boxes)[1][2].
MM-RAG es especialmente útil para documentos donde una parte significativa del significado se presenta en forma no textual (diseño de página, diagramas, estructuras de tablas). En tales casos, el RAG textual clásico a menudo pierde elementos importantes del contexto[3][4].
Contexto y problema que resuelve
El RAG clásico opera con pasajes de texto y no percibe las estructuras visuales (la disposición de los elementos, los pies de foto, los ejes de los gráficos). MM-RAG cierra estas brechas: extrae elementos estructurados (texto, tablas, imágenes con coordenadas), los indexa en un espacio vectorial y combina evidencia de diferentes modalidades[5][6].
Arquitectura de MM-RAG
El pipeline de MM-RAG añade al RAG clásico etapas de procesamiento de datos visuales y alineación de modalidades: ingesta → indexación → recuperación multimodal → fusión y reclasificación → generación con trazabilidad.
- Recopilación y preprocesamiento (Ingestion). La entrada consiste en PDF/escaneos/imágenes. Se realiza OCR y análisis de diseño (layout analysis) de la página para identificar zonas: párrafos, encabezados, tablas, imágenes y sus coordenadas. Las herramientas típicas son los modelos de la familia LayoutLM y las bibliotecas instrumentales como LayoutParser; la validación y el entrenamiento a menudo se basan en los conjuntos de datos PubLayNet y DocLayNet[7][8][9].
- Segmentación en regiones. Se extraen objetos visuales (diagramas, tablas, ilustraciones, pies de foto). Para una mayor robustez, se utilizan modelos sin OCR (OCR-free, por ejemplo, Donut) o pipelines combinados OCR+VLM[10].
- Indexación (Vector Index). Los fragmentos de texto (chunks) y los elementos visuales (imágenes o sus descripciones) se convierten en representaciones vectoriales y se almacenan en una base de datos vectorial. Para el espacio unificado texto↔imagen se utilizan CLIP o SigLIP; para producción son convenientes los índices multimodales/multivectoriales (un objeto, varios vectores)[6][11][12].
- Recuperación multimodal y reclasificación. Se realiza una combinación de búsqueda textual y visual; los candidatos (párrafos, tablas, imágenes/regiones) se fusionan y se reclasifican con un modelo más "pesado" (cross-encoder/LLM-reranker) para mejorar la precisión[13].
- Empaquetado del contexto y generación. Los fragmentos seleccionados se introducen en un LLM/VLM. Si el modelo es multimodal (por ejemplo, GPT-4V/4o), las imágenes pueden ser ingresadas directamente; si se utiliza un LLM textual, las imágenes se convierten previamente en descripciones detalladas[14][15].
- Trazabilidad y citación. La respuesta se acompaña de citas clicables vinculadas no solo al documento/página, sino también a la región específica (coordenadas). Esto aumenta el nivel de grounding (anclaje en la evidencia) y la confianza del usuario[2].
Evaluación de calidad y métricas
La eficacia de MM‑RAG se evalúa en los niveles de extracción, recuperación y generación.
- Calidad de la extracción de datos visuales. Precisión del OCR (WER/CER), calidad del análisis de diseño (mAP/Precision/Recall) en los conjuntos de datos DocLayNet/PubLayNet[8][7].
- Calidad de la recuperación. Métricas estándar de recuperación de información (IR): Recall@K, Precision@K, MRR; para la multimodalidad, se evalúan por separado para cada modalidad y de forma combinada.
- Calidad de la respuesta (end‑to‑end). Métricas automáticas de faithfulness (fidelidad)/groundedness (anclaje en la evidencia) y evaluación humana. En la práctica, se utilizan frameworks como RAGAS/TruLens/DeepEval[16].
- Benchmarks.
- DocVQA: preguntas sobre imágenes de documentos[3].
- TextVQA: preguntas que requieren leer texto dentro de las imágenes[4].
- InfographicVQA: preguntas sobre infografías[17].
- ChartQA: preguntas sobre diagramas que requieren razonamiento lógico[18].
- MMDocRAG: un benchmark de RAG multimodal para DocQA (documentos de varias páginas, cadenas de evidencia cross-modales)[19].
Tabla comparativa de componentes
| Componente | Variantes de implementación | Ventajas | Desventajas / Riesgos | Cuándo elegir |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / API en la nube | Locales: privacidad y control; en la nube: alta precisión "de fábrica". | Errores en diseños complejos; API: costo y requisitos de cumplimiento (compliance). | Datos privados: OCR local; máxima precisión: en la nube (si está permitido). |
| Análisis de diseño | Reglas / Modelo de ML (LayoutLM, LayoutParser) | Las reglas son simples para plantillas uniformes; el ML es robusto ante la diversidad. | Las reglas fallan con nuevos diseños; el ML requiere recursos/datos. | Formularios estandarizados: reglas; corpus heterogéneo: ML. |
| Vectorización (imágenes) | CLIP / SigLIP / descripciones sin OCR (Donut/Pix2Struct) | Espacio latente común texto↔imagen (CLIP/SigLIP); los modelos sin OCR eliminan la dependencia del OCR. | CLIP no lee el texto dentro de las imágenes; las descripciones pueden distorsionar el significado. | CLIP/SigLIP para búsqueda multimodal básica; sin OCR para escaneos de baja calidad. |
| Fusión de resultados | Ordenamiento por puntuación (score) / cuotas por modalidad / LLM-reranker | El reclasificador (reranker) aumenta notablemente la precisión en la selección del contexto. | Aumento de la latencia y el costo. | Escenarios de alta precisión; métodos simples para pruebas de concepto (PoC). |
| Almacenamiento/Índice | Vector único / multivector (texto+imagen) / híbrido (BM25+vector) | El multivector cubre diferentes representaciones de un mismo objeto; el híbrido rescata palabras clave/códigos. | Complejidad del esquema y las actualizaciones. | Sistemas de producción con datos mixtos y SLAs estrictos. |
Consideraciones prácticas
- Búsqueda híbrida (BM25 + vector): es el estándar de facto para mejorar la exhaustividad (recall) y la precisión con términos/códigos específicos[20].
- Reclasificación (reranking) con un cross-encoder/LLM: ahorra tokens al descartar candidatos "basura" antes de la generación[13].
- Recuperadores VLM modernos (por ejemplo, ColPali): demuestran ventajas en documentos visualmente ricos gracias a la indexación directa de las páginas como imágenes[21].
Véase también
Bibliografía
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model’s Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
Referencias
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.