MM-RAG (Multimodal RAG)

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

MM-RAG (англ. Multimodal Retrieval-Augmented Generation) — это расширение классической парадигмы RAG, в котором LLM используют для ответа не только текст, но и визуальные данные (изображения, схемы, таблицы, графики). Мультимодальный ретрив позволяет находить и связывать доказательства в различных представлениях, снижая риск галлюцинаций за счёт опоры на внешние источники с точной привязкой к фрагментам страниц и областям (bounding boxes)[1][2].

MM-RAG особенно полезен для документов, где существенная часть смысла представлена в нетекстовой форме (макет страницы, диаграммы, структуры таблиц). В таких случаях классический текстовый RAG часто теряет важные элементы контекста[3][4].

Контекст и решаемая проблема

Классический RAG оперирует текстовыми пассажами и не видит визуальных структур (расположение элементов, подписи к рисункам, оси графиков). MM-RAG закрывает эти пробелы: извлекает структурированные элементы (текст, таблицы, изображения с координатами), индексирует их в векторное пространство и комбинирует доказательства из разных модальностей[5][6].

Архитектура MM-RAG

Конвейер MM-RAG добавляет к классическому RAG этапы обработки визуальных данных и выравнивания модальностей: ингест → индексирование → мультимодальный ретрив → слияние и реранжинг → генерация с трассировкой.

  1. Сбор и препроцессинг (Ingestion). На вход поступают PDF/сканы/изображения. Выполняются OCR и анализ макета страницы для выделения зон: абзацы, заголовки, таблицы, изображения и их координаты. Типичные средства — модели семейства LayoutLM и инструментальные библиотеки LayoutParser; валидация и обучение часто опираются на датасеты PubLayNet и DocLayNet[7][8][9].
  2. Сегментация на регионы. Извлекаются визуальные объекты (диаграммы, таблицы, иллюстрации, подписи). Для повышенной устойчивости применяются OCR‑free модели (напр., Donut) либо комбинированные пайплайны OCR+VLM[10].
  3. Индексирование (Vector Index). Текстовые чанки и визуальные элементы (изображения или их описания) преобразуются в векторные представления и заносятся в векторную БД. Для объединённого пространства text↔image применяются CLIP или SigLIP; для продакшена удобны мультимодальные/мультивекторные индексы (один объект — несколько векторов)[6][11][12].
  4. Мультимодальный ретрив и реранжинг. Выполняется комбинация текстового и визуального поиска; кандидаты (абзацы, таблицы, изображения/регионы) объединяются и реранжируются более «тяжёлой» моделью (кросс‑энкодер/LLM‑reranker) для повышения точности[13].
  5. Упаковка контекста и генерация. Отобранные фрагменты подаются в LLM/VLM. Если модель мультимодальная (напр., GPT‑4V/4o), изображения могут подаваться напрямую; при текстовой LLM изображения заранее конвертируются в детальные описания[14][15].
  6. Трассировка и цитирование. Ответ сопровождается кликабельными цитатами с привязкой не только к документу/странице, но и к региону (координатам). Это повышает уровень grounding и доверие пользователей[2].

Оценка качества и метрики

Эффективность MM‑RAG оценивается на уровнях извлечения, ретрива и генерации.

  • Качество извлечения визуальных данных. Точность OCR (WER/CER), качество анализа макета (mAP/Precision/Recall) на наборах DocLayNet/PubLayNet[8][7].
  • Качество ретрива. Стандартные метрики ИП: Recall@K, Precision@K, MRR; для мультимодальности — отдельно по модальностям и в объединении.
  • Качество ответа (end‑to‑end). Автоматические метрики faithfulness/groundedness и человеческая оценка. На практике применяются фреймворки RAGAS/TruLens/DeepEval[16].
  • Бенчмарки.
    • DocVQA: вопросы к изображениям документов[3].
    • TextVQA: вопросы, требующие чтения текста на изображениях[4].
    • InfographicVQA: вопросы по инфографикам[17].
    • ChartQA: вопросы по диаграммам с требованием логических рассуждений[18].
    • MMDocRAG: бенчмарк мультимодального RAG для DocQA (многостраничные документы, кросс‑модальные цепочки доказательств)[19].

Сравнительная таблица компонентов

Сравнение ключевых компонентов и подходов в MM‑RAG
Компонент Варианты реализации Плюсы Минусы / риски Когда выбирать
OCR Tesseract / PaddleOCR / облачные API Локальные — приватность и контроль; облачные — высокая точность «из коробки». Ошибки на сложном макете; API — стоимость и требования комплаенса. Приватные данные — локальный OCR; максимальная точность — облако (если допустимо).
Анализ макета Правила / ML‑модель (LayoutLM, LayoutParser) Правила просты для однотипных шаблонов; ML — устойчив к разнообразию. Правила ломаются на новых макетах; ML требует ресурсов/данных. Однотипные бланки — правила; разнородный корпус — ML.
Векторизация (изобр.) CLIP / SigLIP / OCR‑free описания (Donut/Pix2Struct) Общая латентная зона text↔image (CLIP/SigLIP); OCR‑free снимает зависимость от OCR. CLIP не читает текст внутрь изображений; описания могут искажать смысл. CLIP/SigLIP — базовый мультимодальный поиск; OCR‑free для сканов сложного качества.
Слияние результатов Сортировка по score / квоты по модальностям / LLM‑reranker Реранкер заметно повышает точность отбора контекста. Рост задержки и стоимости. High‑precision сценарии; простые методы — для PoC.
Хранилище/индекс Один вектор / мультивектор (text+image) / гибрид (BM25+vector) Мультивектор покрывает разные представления одного объекта; гибрид спасает ключевые слова/коды. Усложнение схемы и апдейтов. Производственные системы со смешанными данными и жёсткими SLA.

Практические замечания

  • Гибридный поиск (BM25 + вектор) — де‑факто стандарт для повышения полноты и точности на специфических терминах/кодах[20].
  • Реранжинг кросс‑энкодером/LLM экономит токены, отбрасывая «мусорные» кандидаты до генерации[13].
  • Современные VLM‑ретриверы (напр., ColPali) показывают преимущества на визуально богатых документах за счёт прямой индексации страниц‑изображений[21].

См. также

Литература

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOIarXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVFarXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACLarXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model’s Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

Примечания

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2,0 2,1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3,0 3,1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4,0 4,1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6,0 6,1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7,0 7,1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8,0 8,1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13,0 13,1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.