MM-RAG (Multimodal RAG) (PT)
MM-RAG (do inglês Multimodal Retrieval-Augmented Generation) é uma extensão do paradigma clássico de RAG, na qual os LLMs utilizam para gerar respostas não apenas texto, mas também dados visuais (imagens, diagramas, tabelas, gráficos). A recuperação multimodal permite encontrar e conectar evidências em diferentes representações, reduzindo o risco de alucinações ao se basear em fontes externas com vinculação precisa a fragmentos de páginas e áreas específicas (bounding boxes)[1][2].
O MM-RAG é especialmente útil para documentos onde uma parte significativa do significado é apresentada de forma não textual (layout da página, diagramas, estruturas de tabelas). Nesses casos, o RAG textual clássico frequentemente perde elementos importantes do contexto[3][4].
Contexto e problema abordado
O RAG clássico opera com passagens de texto e não "enxerga" as estruturas visuais (disposição de elementos, legendas de figuras, eixos de gráficos). O MM-RAG preenche essas lacunas: ele extrai elementos estruturados (texto, tabelas, imagens com coordenadas), indexa-os em um espaço vetorial e combina evidências de diferentes modalidades[5][6].
Arquitetura do MM-RAG
O pipeline do MM-RAG adiciona ao RAG clássico etapas de processamento de dados visuais e alinhamento de modalidades: ingestão → indexação → recuperação multimodal → fusão e reclassificação → geração com rastreabilidade.
- Coleta e pré-processamento (Ingestion). A entrada consiste em PDFs/scans/imagens. São executados OCR e a análise de layout da página para identificar zonas: parágrafos, títulos, tabelas, imagens e suas coordenadas. Ferramentas típicas incluem modelos da família LayoutLM e bibliotecas como LayoutParser; a validação e o treinamento frequentemente se baseiam nos datasets PubLayNet e DocLayNet[7][8][9].
- Segmentação em regiões. Objetos visuais (diagramas, tabelas, ilustrações, legendas) são extraídos. Para maior robustez, são utilizados modelos OCR‑free (ex., Donut) ou pipelines combinados OCR+VLM[10].
- Indexação (Vector Index). Chunks de texto e elementos visuais (imagens ou suas descrições) são convertidos em representações vetoriais e armazenados em um banco de dados vetorial. Para o espaço unificado text↔image, são aplicados modelos como CLIP ou SigLIP; para produção, são convenientes índices multimodais/multivetoriais (um objeto — múltiplos vetores)[6][11][12].
- Recuperação multimodal e reclassificação. É realizada uma combinação de busca textual e visual; os candidatos (parágrafos, tabelas, imagens/regiões) são unidos e reclassificados por um modelo mais "pesado" (cross‑encoder/LLM‑reranker) para aumentar a precisão[13].
- Empacotamento de contexto e geração. Os fragmentos selecionados são fornecidos a um LLM/VLM. Se o modelo for multimodal (ex., GPT‑4V/4o), as imagens podem ser passadas diretamente; com um LLM textual, as imagens são previamente convertidas em descrições detalhadas[14][15].
- Rastreabilidade e citação. A resposta é acompanhada por citações clicáveis, vinculadas não apenas ao documento/página, mas também à região (coordenadas). Isso aumenta o nível de grounding e a confiança do usuário[2].
Avaliação de qualidade e métricas
A eficácia do MM‑RAG é avaliada nos níveis de extração, recuperação e geração.
- Qualidade da extração de dados visuais. Precisão do OCR (WER/CER), qualidade da análise de layout (mAP/Precision/Recall) nos conjuntos de dados DocLayNet/PubLayNet[8][7].
- Qualidade da recuperação. Métricas padrão de recuperação de informação: Recall@K, Precision@K, MRR; para multimodalidade, avaliadas separadamente por modalidade e em conjunto.
- Qualidade da resposta (end‑to‑end). Métricas automáticas de faithfulness/groundedness e avaliação humana. Na prática, são utilizados frameworks como RAGAS/TruLens/DeepEval[16].
- Benchmarks.
- DocVQA: perguntas sobre imagens de documentos[3].
- TextVQA: perguntas que exigem a leitura de texto em imagens[4].
- InfographicVQA: perguntas sobre infográficos[17].
- ChartQA: perguntas sobre diagramas que exigem raciocínio lógico[18].
- MMDocRAG: benchmark de RAG multimodal para DocQA (documentos de múltiplas páginas, cadeias de evidências cross-modais)[19].
Tabela comparativa de componentes
| Componente | Opções de implementação | Prós | Contras / Riscos | Quando escolher |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / APIs na nuvem | Locais: privacidade e controle; Nuvem: alta precisão "out-of-the-box". | Erros em layouts complexos; APIs: custo e requisitos de conformidade. | Dados privados: OCR local; Precisão máxima: nuvem (se permitido). |
| Análise de layout | Regras / Modelo de ML (LayoutLM, LayoutParser) | Regras são simples para templates uniformes; ML é robusto à diversidade. | Regras falham em novos layouts; ML requer recursos/dados. | Formulários padronizados: regras; Corpus heterogêneo: ML. |
| Vetorização (imagens) | CLIP / SigLIP / Descrições OCR‑free (Donut/Pix2Struct) | Espaço latente comum text↔image (CLIP/SigLIP); OCR‑free elimina a dependência de OCR. | O CLIP não lê o texto dentro das imagens; descrições podem distorcer o significado. | CLIP/SigLIP para busca multimodal básica; OCR‑free para scans de baixa qualidade. |
| Fusão de resultados | Ordenação por score / Cotas por modalidade / LLM‑reranker | O reclassificador aumenta notavelmente a precisão da seleção de contexto. | Aumento da latência e do custo. | Cenários de alta precisão; métodos simples para PoC. |
| Armazenamento/Índice | Vetor único / Multivetor (texto+imagem) / Híbrido (BM25+vetor) | O multivetor cobre diferentes representações de um mesmo objeto; o híbrido é útil para palavras-chave/códigos. | Complexidade do esquema e das atualizações. | Sistemas de produção com dados mistos e SLAs rigorosos. |
Observações práticas
- Busca híbrida (BM25 + vetor) é o padrão de fato para aumentar a abrangência e a precisão em termos/códigos específicos[20].
- Reclassificação com cross-encoder/LLM economiza tokens ao descartar candidatos "lixo" antes da geração[13].
- Recuperadores VLM modernos (ex., ColPali) demonstram vantagens em documentos visualmente ricos devido à indexação direta de páginas como imagens[21].
Ver também
- Retrieval-Augmented Generation
- Banco de dados vetorial
- Embedding
- GraphRAG
Literatura
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model’s Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
Notas
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.