---
title: "MM-RAG (Multimodal RAG)"
source: "https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)"
wiki: "systems-analysis.info/wiki"
article: "MM-RAG_(Multimodal_RAG)"
language: "ru"
categories:
  - "Категория:Prompt инжиниринг"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
revision_id: 148
wiki_created_at: 2026-09-06T21:55:45Z
wiki_modified_at: 2026-09-06T21:55:45Z
downloaded_at: 2026-09-07T22:17:46Z
---

# MM-RAG (Multimodal RAG)

**MM-RAG** (англ. *Multimodal Retrieval-Augmented Generation*) — это расширение классической парадигмы [RAG](https://systems-analysis.info/wiki/Retrieval%E2%80%91Augmented_Generation_(RAG) "Retrieval‑Augmented Generation (RAG)"), в котором [LLM](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") используют для ответа не только текст, но и визуальные данные (изображения, схемы, таблицы, графики). Мультимодальный ретрив позволяет находить и связывать доказательства в различных представлениях, снижая риск галлюцинаций за счёт опоры на внешние источники с точной привязкой к фрагментам страниц и областям (*bounding boxes*)<sup>[\[1\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-lewis2020-1)[\[2\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-visrag2024-2)</sup>.

MM-RAG особенно полезен для документов, где существенная часть смысла представлена в нетекстовой форме (макет страницы, диаграммы, структуры таблиц). В таких случаях классический текстовый RAG часто теряет важные элементы контекста<sup>[\[3\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-docvqa2021-3)[\[4\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-textvqa2019-4)</sup>.

## Контекст и решаемая проблема

Классический RAG оперирует текстовыми пассажами и не видит визуальных структур (расположение элементов, подписи к рисункам, оси графиков). MM-RAG закрывает эти пробелы: извлекает структурированные элементы (текст, таблицы, изображения с координатами), индексирует их в векторное пространство и комбинирует доказательства из разных модальностей<sup>[\[5\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-layoutlm2020-5)[\[6\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-clip2021-6)</sup>.

## Архитектура MM-RAG

Конвейер MM-RAG добавляет к классическому RAG этапы обработки визуальных данных и выравнивания модальностей: **ингест → индексирование → мультимодальный ретрив → слияние и реранжинг → генерация с трассировкой**.

1.  **Сбор и препроцессинг (Ingestion).** На вход поступают PDF/сканы/изображения. Выполняются OCR и **анализ макета** страницы для выделения зон: абзацы, заголовки, таблицы, изображения и их координаты. Типичные средства — модели семейства LayoutLM и инструментальные библиотеки LayoutParser; валидация и обучение часто опираются на датасеты PubLayNet и DocLayNet<sup>[\[7\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-publaynet2019-7)[\[8\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-doclaynet2022-8)[\[9\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-layoutparser2021-9)</sup>.
2.  **Сегментация на регионы.** Извлекаются визуальные объекты (диаграммы, таблицы, иллюстрации, подписи). Для повышенной устойчивости применяются OCR‑free модели (напр., Donut) либо комбинированные пайплайны OCR+VLM<sup>[\[10\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-donut2021-10)</sup>.
3.  **Индексирование (Vector Index).** Текстовые чанки и визуальные элементы (изображения или их описания) преобразуются в [векторные представления](https://systems-analysis.info/wiki/Embedding "Embedding") и заносятся в векторную БД. Для объединённого пространства *text↔image* применяются CLIP или SigLIP; для продакшена удобны мультимодальные/мультивекторные индексы (один объект — несколько векторов)<sup>[\[6\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-clip2021-6)[\[11\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-siglip2023-11)[\[12\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-milvus-mv-12)</sup>.
4.  **Мультимодальный ретрив и реранжинг.** Выполняется комбинация текстового и визуального поиска; кандидаты (абзацы, таблицы, изображения/регионы) объединяются и реранжируются более «тяжёлой» моделью (кросс‑энкодер/LLM‑reranker) для повышения точности<sup>[\[13\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-cohere-rerank-13)</sup>.
5.  **Упаковка контекста и генерация.** Отобранные фрагменты подаются в LLM/VLM. Если модель мультимодальная (напр., [GPT](https://systems-analysis.info/wiki/GPT "GPT")‑4V/4o), изображения могут подаваться напрямую; при текстовой LLM изображения заранее конвертируются в детальные описания<sup>[\[14\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-gpt4v-14)[\[15\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-gpt4o-15)</sup>.
6.  **Трассировка и цитирование.** Ответ сопровождается кликабельными цитатами с привязкой не только к документу/странице, но и к региону (координатам). Это повышает уровень *grounding* и доверие пользователей<sup>[\[2\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-visrag2024-2)</sup>.

## Оценка качества и метрики

Эффективность MM‑RAG оценивается на уровнях извлечения, ретрива и генерации.

- **Качество извлечения визуальных данных.** Точность OCR (WER/CER), качество анализа макета (mAP/Precision/Recall) на наборах DocLayNet/PubLayNet<sup>[\[8\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-doclaynet2022-8)[\[7\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-publaynet2019-7)</sup>.
- **Качество ретрива.** Стандартные метрики ИП: Recall@K, Precision@K, MRR; для мультимодальности — отдельно по модальностям и в объединении.
- **Качество ответа (end‑to‑end).** Автоматические метрики *faithfulness*/*groundedness* и человеческая оценка. На практике применяются фреймворки RAGAS/TruLens/DeepEval<sup>[\[16\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-ragas-16)</sup>.
- **Бенчмарки.**
  - **DocVQA**: вопросы к изображениям документов<sup>[\[3\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-docvqa2021-3)</sup>.
  - **TextVQA**: вопросы, требующие чтения текста на изображениях<sup>[\[4\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-textvqa2019-4)</sup>.
  - **InfographicVQA**: вопросы по инфографикам<sup>[\[17\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-infographicvqa2021-17)</sup>.
  - **ChartQA**: вопросы по диаграммам с требованием логических рассуждений<sup>[\[18\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-chartqa2022-18)</sup>.
  - **MMDocRAG**: бенчмарк мультимодального RAG для DocQA (многостраничные документы, кросс‑модальные цепочки доказательств)<sup>[\[19\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-mmdocrag2025-19)</sup>.

## Сравнительная таблица компонентов

| Компонент             | Варианты реализации                                            | Плюсы                                                                                           | Минусы / риски                                                          | Когда выбирать                                                                      |
|-----------------------|----------------------------------------------------------------|-------------------------------------------------------------------------------------------------|-------------------------------------------------------------------------|-------------------------------------------------------------------------------------|
| OCR                   | Tesseract / PaddleOCR / облачные API                           | Локальные — приватность и контроль; облачные — высокая точность «из коробки».                   | Ошибки на сложном макете; API — стоимость и требования комплаенса.      | Приватные данные — локальный OCR; максимальная точность — облако (если допустимо).  |
| Анализ макета         | Правила / ML‑модель (LayoutLM, LayoutParser)                   | Правила просты для однотипных шаблонов; ML — устойчив к разнообразию.                           | Правила ломаются на новых макетах; ML требует ресурсов/данных.          | Однотипные бланки — правила; разнородный корпус — ML.                               |
| Векторизация (изобр.) | CLIP / SigLIP / OCR‑free описания (Donut/Pix2Struct)           | Общая латентная зона *text↔image* (CLIP/SigLIP); OCR‑free снимает зависимость от OCR.           | CLIP не читает текст внутрь изображений; описания могут искажать смысл. | CLIP/SigLIP — базовый мультимодальный поиск; OCR‑free для сканов сложного качества. |
| Слияние результатов   | Сортировка по score / квоты по модальностям / LLM‑reranker     | Реранкер заметно повышает точность отбора контекста.                                            | Рост задержки и стоимости.                                              | High‑precision сценарии; простые методы — для PoC.                                  |
| Хранилище/индекс      | Один вектор / мультивектор (text+image) / гибрид (BM25+vector) | Мультивектор покрывает разные представления одного объекта; гибрид спасает ключевые слова/коды. | Усложнение схемы и апдейтов.                                            | Производственные системы со смешанными данными и жёсткими SLA.                      |

Сравнение ключевых компонентов и подходов в MM‑RAG

## Практические замечания

- **Гибридный поиск** (BM25 + вектор) — де‑факто стандарт для повышения полноты и точности на специфических терминах/кодах<sup>[\[20\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-weaviate-hybrid-20)</sup>.
- **Реранжинг** кросс‑энкодером/LLM экономит [токены](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен"), отбрасывая «мусорные» кандидаты до генерации<sup>[\[13\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-cohere-rerank-13)</sup>.
- **Современные VLM‑ретриверы** (напр., ColPali) показывают преимущества на визуально богатых документах за счёт прямой индексации страниц‑изображений<sup>[\[21\]](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_note-colpali2024-21)</sup>.

## См. также

- [Retrieval-Augmented Generation](https://systems-analysis.info/wiki/Retrieval%E2%80%91Augmented_Generation_(RAG) "Retrieval‑Augmented Generation (RAG)")
- [Векторная база данных](https://systems-analysis.info/wiki/%D0%92%D0%B5%D0%BA%D1%82%D0%BE%D1%80%D0%BD%D1%8B%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85 "Векторные базы данных")
- [Embedding](https://systems-analysis.info/wiki/Embedding "Embedding")
- [GraphRAG](https://systems-analysis.info/wiki/GraphRAG "GraphRAG")

## Литература

- Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. NeurIPS. <a href="https://arxiv.org/abs/2005.11401" class="external text" rel="nofollow">arXiv:2005.11401</a>.
- Gao, L. et al. (2023). *Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)*. ACL 2023. <a href="https://arxiv.org/abs/2212.10496" class="external text" rel="nofollow">arXiv:2212.10496</a>.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). *A Survey of Multimodal Retrieval‑Augmented Generation*. <a href="https://arxiv.org/abs/2504.08748" class="external text" rel="nofollow">arXiv:2504.08748</a>.
- Abootorabi, M.M. et al. (2025). *Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation*. Findings of ACL 2025. <a href="https://aclanthology.org/2025.findings-acl.861/" class="external text" rel="nofollow">ACL Anthology</a>.
- Yu, S. et al. (2024). *VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents*. <a href="https://arxiv.org/abs/2410.10594" class="external text" rel="nofollow">arXiv:2410.10594</a>.
- Cho, J. et al. (2024). *M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA*. <a href="https://arxiv.org/abs/2411.04952" class="external text" rel="nofollow">arXiv:2411.04952</a>.
- Tanaka, R. et al. (2025). *VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents*. CVPR 2025. <a href="https://arxiv.org/abs/2504.09795" class="external text" rel="nofollow">arXiv:2504.09795</a> • <a href="https://openaccess.thecvf.com/content/CVPR2025/papers/Tanaka_VDocRAG_Retrieval-Augmented_Generation_over_Visually-Rich_Documents_CVPR_2025_paper.pdf" class="external text" rel="nofollow">CVF Open Access</a>.
- Dong, K. et al. (2025). *MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering*. <a href="https://arxiv.org/abs/2505.16470" class="external text" rel="nofollow">arXiv:2505.16470</a>.
- Wasserman, N. et al. (2025). *REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark*. <a href="https://arxiv.org/abs/2502.12342" class="external text" rel="nofollow">arXiv:2502.12342</a>.
- Faysse, M. et al. (2024). *ColPali: Efficient Document Retrieval with Vision Language Models*. <a href="https://arxiv.org/abs/2407.01449" class="external text" rel="nofollow">arXiv:2407.01449</a>.
- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision (CLIP)*. ICML 2021. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.
- Tschannen, M. et al. (2025). *SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features*. <a href="https://arxiv.org/abs/2502.14786" class="external text" rel="nofollow">arXiv:2502.14786</a>.
- Xu, Y. et al. (2020). *LayoutLM: Pre‑training of Text and Layout for Document Image Understanding*. KDD 2020. <a href="https://dl.acm.org/doi/10.1145/3394486.3403172" class="external text" rel="nofollow">DOI</a> • <a href="https://arxiv.org/abs/1912.13318" class="external text" rel="nofollow">arXiv:1912.13318</a>.
- Huang, Y. et al. (2022). *LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking*. <a href="https://arxiv.org/abs/2204.08387" class="external text" rel="nofollow">arXiv:2204.08387</a>.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). *PubLayNet: Largest Dataset Ever for Document Layout Analysis*. <a href="https://arxiv.org/abs/1908.07836" class="external text" rel="nofollow">arXiv:1908.07836</a>.
- Pfitzmann, B. et al. (2022). *DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis*. <a href="https://arxiv.org/abs/2206.01062" class="external text" rel="nofollow">arXiv:2206.01062</a>.
- Kim, G. et al. (2021). *OCR‑free Document Understanding Transformer (Donut)*. <a href="https://arxiv.org/abs/2111.15664" class="external text" rel="nofollow">arXiv:2111.15664</a>.
- Shen, Z. et al. (2021). *LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis*. <a href="https://arxiv.org/abs/2103.15348" class="external text" rel="nofollow">arXiv:2103.15348</a>.
- Singh, A. et al. (2019). *Towards VQA Models That Can Read (TextVQA)*. CVPR 2019. <a href="https://arxiv.org/abs/1904.08920" class="external text" rel="nofollow">arXiv:1904.08920</a>.
- Mathew, M. et al. (2021/2022). *DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics*. WACV 2021 / WACV 2022. <a href="https://openaccess.thecvf.com/content/WACV2021/html/Mathew_DocVQA_A_Dataset_for_VQA_on_Document_Images_WACV_2021_paper.html" class="external text" rel="nofollow">CVF</a> • <a href="https://arxiv.org/abs/2104.12756" class="external text" rel="nofollow">arXiv:2104.12756</a>.
- Masry, A. et al. (2022). *ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning*. Findings of ACL 2022. <a href="https://aclanthology.org/2022.findings-acl.177/" class="external text" rel="nofollow">ACL</a> • <a href="https://arxiv.org/abs/2203.10244" class="external text" rel="nofollow">arXiv:2203.10244</a>.
- Liu, F. et al. (2022). *DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation*. <a href="https://arxiv.org/abs/2212.10505" class="external text" rel="nofollow">arXiv:2212.10505</a>.
- Wang, P. et al. (2024). *Qwen2‑VL: Enhancing Vision‑Language Model’s Capabilities in OCR and Chart QA*. <a href="https://arxiv.org/abs/2409.12191" class="external text" rel="nofollow">arXiv:2409.12191</a>.
- Es, S. et al. (2023). *RAGAS: Automated Evaluation of Retrieval‑Augmented Generation*. <a href="https://arxiv.org/abs/2309.15217" class="external text" rel="nofollow">arXiv:2309.15217</a>.

## Примечания

1.  <span id="cite_note-lewis2020-1">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-lewis2020_1-0) Lewis, P., Perez, E., et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. NeurIPS. <a href="https://arxiv.org/abs/2005.11401" class="external text" rel="nofollow">arXiv:2005.11401</a>.</span>
2.  <span id="cite_note-visrag2024-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-visrag2024_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-visrag2024_2-1)</sup> Yu, S. et al. (2024). *VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents*. <a href="https://arxiv.org/abs/2407.06437" class="external text" rel="nofollow">arXiv:2407.06437</a>.</span>
3.  <span id="cite_note-docvqa2021-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-docvqa2021_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-docvqa2021_3-1)</sup> Mathew, M. et al. (2021). *DocVQA: A Dataset for VQA on Document Images*. WACV. <a href="https://arxiv.org/abs/2007.00398" class="external text" rel="nofollow">arXiv:2007.00398</a>.</span>
4.  <span id="cite_note-textvqa2019-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-textvqa2019_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-textvqa2019_4-1)</sup> Singh, A. et al. (2019). *TextVQA: Towards VQA Models That Can Read*. CVPR. <a href="https://arxiv.org/abs/1904.08920" class="external text" rel="nofollow">arXiv:1904.08920</a>.</span>
5.  <span id="cite_note-layoutlm2020-5">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-layoutlm2020_5-0) Xu, Y. et al. (2020). *LayoutLM: Pre-training of Text and Layout for Document Image Understanding*. KDD. <a href="https://dl.acm.org/doi/10.1145/3394486.3403172" class="external text" rel="nofollow">DOI</a>.</span>
6.  <span id="cite_note-clip2021-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-clip2021_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-clip2021_6-1)</sup> Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision (CLIP)*. ICML. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.</span>
7.  <span id="cite_note-publaynet2019-7">↑ <sup>[7,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-publaynet2019_7-0)</sup> <sup>[7,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-publaynet2019_7-1)</sup> Zhong, X., Tang, J., Yepes, A. J. (2019). *PubLayNet: Largest Dataset for Document Layout Analysis*. ICDAR. <a href="https://arxiv.org/abs/1908.07836" class="external text" rel="nofollow">arXiv:1908.07836</a>.</span>
8.  <span id="cite_note-doclaynet2022-8">↑ <sup>[8,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-doclaynet2022_8-0)</sup> <sup>[8,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-doclaynet2022_8-1)</sup> Pfitzmann, B. et al. (2022). *DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis*. KDD. <a href="https://dl.acm.org/doi/10.1145/3534678.3539043" class="external text" rel="nofollow">DOI</a> / <a href="https://arxiv.org/abs/2206.01062" class="external text" rel="nofollow">arXiv:2206.01062</a>.</span>
9.  <span id="cite_note-layoutparser2021-9">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-layoutparser2021_9-0) Shen, Z. et al. (2021). *LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis*. <a href="https://arxiv.org/abs/2103.15348" class="external text" rel="nofollow">arXiv:2103.15348</a>.</span>
10. <span id="cite_note-donut2021-10">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-donut2021_10-0) Kim, G. et al. (2021). *Donut: OCR‑free Document Understanding Transformer*. <a href="https://arxiv.org/abs/2111.15664" class="external text" rel="nofollow">arXiv:2111.15664</a>.</span>
11. <span id="cite_note-siglip2023-11">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-siglip2023_11-0) Zhai, X. et al. (2023). *Sigmoid Loss for Language‑Image Pre‑Training (SigLIP)*. ICCV. <a href="https://arxiv.org/abs/2303.15343" class="external text" rel="nofollow">arXiv:2303.15343</a>.</span>
12. <span id="cite_note-milvus-mv-12">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-milvus-mv_12-0) Milvus Docs. *Multi‑Vector Hybrid Search*. <a href="https://milvus.io/docs/multi-vector-search.md" class="external text" rel="nofollow">milvus.io/docs/multi-vector-search.md</a>.</span>
13. <span id="cite_note-cohere-rerank-13">↑ <sup>[13,0](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-cohere-rerank_13-0)</sup> <sup>[13,1](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-cohere-rerank_13-1)</sup> Cohere Docs. *Rerank API*. <a href="https://docs.cohere.com/reference/rerank" class="external text" rel="nofollow">docs.cohere.com/reference/rerank</a>.</span>
14. <span id="cite_note-gpt4v-14">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-gpt4v_14-0) OpenAI. *GPT‑4V(ision) System Card*. (2023). <a href="https://cdn.openai.com/papers/GPTV_System_Card.pdf" class="external text" rel="nofollow">PDF</a>.</span>
15. <span id="cite_note-gpt4o-15">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-gpt4o_15-0) OpenAI. *Hello GPT‑4o*. (2024). <a href="https://openai.com/index/hello-gpt-4o/" class="external text" rel="nofollow">openai.com/index/hello-gpt-4o/</a>.</span>
16. <span id="cite_note-ragas-16">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-ragas_16-0) Es, S. et al. (2023). *RAGAS: Automated Evaluation of Retrieval Augmented Generation*. <a href="https://arxiv.org/abs/2309.15217" class="external text" rel="nofollow">arXiv:2309.15217</a>.</span>
17. <span id="cite_note-infographicvqa2021-17">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-infographicvqa2021_17-0) Mathew, M. et al. (2021). *InfographicVQA: Understanding Infographics via Question Answering*. ICDAR. <a href="https://arxiv.org/abs/2104.12756" class="external text" rel="nofollow">arXiv:2104.12756</a>.</span>
18. <span id="cite_note-chartqa2022-18">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-chartqa2022_18-0) Masry, A. et al. (2022). *ChartQA: A Benchmark for Question Answering about Charts*. ACL (Findings). <a href="https://arxiv.org/abs/2103.16435" class="external text" rel="nofollow">arXiv:2103.16435</a>.</span>
19. <span id="cite_note-mmdocrag2025-19">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-mmdocrag2025_19-0) Dong, K. et al. (2025). *Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG)*. <a href="https://arxiv.org/abs/2505.16470" class="external text" rel="nofollow">arXiv:2505.16470</a>.</span>
20. <span id="cite_note-weaviate-hybrid-20">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-weaviate-hybrid_20-0) Weaviate Docs. *Hybrid search*. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external text" rel="nofollow">docs.weaviate.io/.../hybrid-search</a>.</span>
21. <span id="cite_note-colpali2024-21">[↑](https://systems-analysis.info/wiki/MM-RAG_(Multimodal_RAG)#cite_ref-colpali2024_21-0) Faysse, M. et al. (2024). *ColPali: Efficient Document Retrieval with Vision‑Language Models*. <a href="https://arxiv.org/abs/2407.01449" class="external text" rel="nofollow">arXiv:2407.01449</a>.</span>
