---
title: "MM-RAG (Multimodal RAG) (BN)"
source: "https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)"
wiki: "systems-analysis.info/int"
article: "MM-RAG_(Multimodal_RAG)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Prompt engineering"
revision_id: 4042
wiki_created_at: 2026-09-06T23:29:39Z
wiki_modified_at: 2026-09-06T23:29:39Z
downloaded_at: 2026-09-07T23:00:31Z
---

# MM-RAG (Multimodal RAG) (BN)

**MM-RAG** (ইংরেজি *Multimodal Retrieval-Augmented Generation*) — এটি ক্লাসিক RAG প্যারাডাইমের একটি সম্প্রসারণ, যেখানে LLM উত্তর দেওয়ার জন্য শুধু টেক্সট নয়, ভিজ্যুয়াল ডেটাও (ছবি, ডায়াগ্রাম, টেবিল, গ্রাফিক্স) ব্যবহার করে। মাল্টিমোডাল retrieval বিভিন্ন উপস্থাপনায় প্রমাণ খুঁজে বের করতে এবং সংযুক্ত করতে সক্ষম, পৃষ্ঠার অংশ ও অঞ্চলের (*bounding boxes*) সাথে সুনির্দিষ্ট সংযোগসহ বাহ্যিক উৎসের উপর নির্ভর করে হ্যালুসিনেশনের ঝুঁকি কমায়<sup>[\[1\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-lewis2020-1)[\[2\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-visrag2024-2)</sup>।

MM-RAG বিশেষভাবে এমন দলিলের জন্য উপকারী যেখানে অর্থের উল্লেখযোগ্য অংশ অ-পাঠ্য আকারে উপস্থাপিত (পৃষ্ঠার বিন্যাস, ডায়াগ্রাম, টেবিলের কাঠামো)। এই ধরনের ক্ষেত্রে ক্লাসিক টেক্সট RAG প্রায়ই গুরুত্বপূর্ণ প্রসঙ্গ উপাদান হারিয়ে ফেলে<sup>[\[3\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-docvqa2021-3)[\[4\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-textvqa2019-4)</sup>।

## প্রেক্ষাপট ও সমাধানযোগ্য সমস্যা

ক্লাসিক RAG টেক্সট প্যাসেজ নিয়ে কাজ করে এবং ভিজ্যুয়াল কাঠামো দেখতে পায় না (উপাদানের অবস্থান, চিত্রের ক্যাপশন, গ্রাফের অক্ষ)। MM-RAG এই ফাঁকগুলো পূরণ করে: কাঠামোগত উপাদান (টেক্সট, টেবিল, স্থানাঙ্কসহ ছবি) বের করে, সেগুলোকে ভেক্টর স্পেসে ইন্ডেক্স করে এবং বিভিন্ন modality থেকে প্রমাণ একত্রিত করে<sup>[\[5\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-layoutlm2020-5)[\[6\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-clip2021-6)</sup>।

## MM-RAG আর্কিটেকচার

MM-RAG পাইপলাইন ক্লাসিক RAG-এ ভিজ্যুয়াল ডেটা প্রক্রিয়াকরণ ও modality সংযোজনের ধাপ যোগ করে: **ইনজেস্ট → ইন্ডেক্সিং → মাল্টিমোডাল retrieval → একত্রীকরণ ও reranking → ট্রেসিং সহ জেনারেশন**।

1.  **সংগ্রহ ও প্রিপ্রসেসিং (Ingestion)।** ইনপুটে PDF/স্ক্যান/ছবি আসে। জোন চিহ্নিত করতে OCR ও পৃষ্ঠার **বিন্যাস বিশ্লেষণ** করা হয়: অনুচ্ছেদ, শিরোনাম, টেবিল, ছবি এবং তাদের স্থানাঙ্ক। সাধারণ সরঞ্জামগুলো হল LayoutLM পরিবারের মডেল এবং LayoutParser টুল লাইব্রেরি; যাচাইকরণ ও প্রশিক্ষণ প্রায়ই PubLayNet ও DocLayNet dataset-এর উপর নির্ভর করে<sup>[\[7\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-publaynet2019-7)[\[8\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-doclaynet2022-8)[\[9\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-layoutparser2021-9)</sup>।
2.  **অঞ্চলে বিভাজন।** ভিজ্যুয়াল অবজেক্ট (ডায়াগ্রাম, টেবিল, চিত্র, ক্যাপশন) বের করা হয়। উন্নত স্থিতিশীলতার জন্য OCR‑free মডেল (যেমন Donut) বা সংযুক্ত OCR+VLM পাইপলাইন ব্যবহার করা হয়<sup>[\[10\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-donut2021-10)</sup>।
3.  **ইন্ডেক্সিং (Vector Index)।** টেক্সট chunk এবং ভিজ্যুয়াল উপাদান (ছবি বা তাদের বিবরণ) ভেক্টর উপস্থাপনায় রূপান্তরিত হয়ে ভেক্টর ডেটাবেসে যুক্ত হয়। একত্রিত *text↔image* স্পেসের জন্য CLIP বা SigLIP ব্যবহার করা হয়; প্রোডাকশনে মাল্টিমোডাল/মাল্টিভেক্টর ইন্ডেক্স সুবিধাজনক (একটি অবজেক্ট — একাধিক ভেক্টর)<sup>[\[6\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-clip2021-6)[\[11\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-siglip2023-11)[\[12\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-milvus-mv-12)</sup>।
4.  **মাল্টিমোডাল retrieval ও reranking।** টেক্সট এবং ভিজ্যুয়াল অনুসন্ধানের সমন্বয় করা হয়; প্রার্থীরা (অনুচ্ছেদ, টেবিল, ছবি/অঞ্চল) একত্রিত হয়ে আরও "ভারী" মডেল (cross-encoder/LLM-reranker) দ্বারা নির্ভুলতা বাড়াতে reranked হয়<sup>[\[13\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-cohere-rerank-13)</sup>।
5.  **প্রসঙ্গ প্যাকেজিং ও জেনারেশন।** নির্বাচিত অংশগুলো LLM/VLM-এ পাঠানো হয়। যদি মডেলটি মাল্টিমোডাল হয় (যেমন GPT‑4V/4o), ছবি সরাসরি পাঠানো যায়; টেক্সট LLM-এর ক্ষেত্রে ছবি আগেই বিস্তারিত বিবরণে রূপান্তরিত হয়<sup>[\[14\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-gpt4v-14)[\[15\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-gpt4o-15)</sup>।
6.  **ট্রেসিং ও উদ্ধৃতি।** উত্তরে ক্লিকযোগ্য উদ্ধৃতি থাকে যা শুধু দলিল/পৃষ্ঠায় নয়, অঞ্চলেও (স্থানাঙ্কে) সংযুক্ত। এটি *grounding* স্তর ও ব্যবহারকারীর আস্থা বাড়ায়<sup>[\[2\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-visrag2024-2)</sup>।

## মান মূল্যায়ন ও মেট্রিক

MM‑RAG-এর কার্যকারিতা নিষ্কাশন, retrieval ও জেনারেশন স্তরে মূল্যায়ন করা হয়।

- **ভিজ্যুয়াল ডেটা নিষ্কাশনের মান।** OCR নির্ভুলতা (WER/CER), DocLayNet/PubLayNet সেটে বিন্যাস বিশ্লেষণের মান (mAP/Precision/Recall)<sup>[\[8\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-doclaynet2022-8)[\[7\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-publaynet2019-7)</sup>।
- **Retrieval-এর মান।** তথ্য অনুসন্ধানের আদর্শ মেট্রিক: Recall@K, Precision@K, MRR; মাল্টিমোডালিটির জন্য — আলাদাভাবে modality অনুযায়ী এবং একত্রে।
- **উত্তরের মান (end‑to‑end)।** স্বয়ংক্রিয় *faithfulness*/*groundedness* মেট্রিক ও মানবিক মূল্যায়ন। ব্যবহারিকভাবে RAGAS/TruLens/DeepEval ফ্রেমওয়ার্ক প্রয়োগ করা হয়<sup>[\[16\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-ragas-16)</sup>।
- **Benchmark।**
  - **DocVQA**: দলিলের ছবিতে প্রশ্ন<sup>[\[3\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-docvqa2021-3)</sup>।
  - **TextVQA**: ছবিতে টেক্সট পড়ার প্রয়োজন এমন প্রশ্ন<sup>[\[4\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-textvqa2019-4)</sup>।
  - **InfographicVQA**: ইনফোগ্রাফিক বিষয়ক প্রশ্ন<sup>[\[17\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-infographicvqa2021-17)</sup>।
  - **ChartQA**: যৌক্তিক বিশ্লেষণের প্রয়োজনীয় ডায়াগ্রাম বিষয়ক প্রশ্ন<sup>[\[18\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-chartqa2022-18)</sup>।
  - **MMDocRAG**: DocQA-এর জন্য মাল্টিমোডাল RAG benchmark (বহু-পৃষ্ঠার দলিল, cross-modal প্রমাণ শৃঙ্খল)<sup>[\[19\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-mmdocrag2025-19)</sup>।

## উপাদানের তুলনামূলক সারণি

| উপাদান            | বাস্তবায়নের বিকল্প                                            | সুবিধা                                                                           | অসুবিধা / ঝুঁকি                                                   | কখন বেছে নেবেন                                                           |
|-------------------|-------------------------------------------------------------|---------------------------------------------------------------------------------|----------------------------------------------------------------|--------------------------------------------------------------------------|
| OCR               | Tesseract / PaddleOCR / ক্লাউড API                           | স্থানীয় — গোপনীয়তা ও নিয়ন্ত্রণ; ক্লাউড — বাক্সের বাইরে উচ্চ নির্ভুলতা।                  | জটিল বিন্যাসে ত্রুটি; API — খরচ ও সম্মতির প্রয়োজনীয়তা।              | ব্যক্তিগত ডেটা — স্থানীয় OCR; সর্বোচ্চ নির্ভুলতা — ক্লাউড (যদি অনুমোদিত)।         |
| বিন্যাস বিশ্লেষণ    | নিয়ম / ML‑মডেল (LayoutLM, LayoutParser)                     | নিয়ম একই ধরনের টেমপ্লেটের জন্য সহজ; ML — বৈচিত্র্যে স্থিতিশীল।                       | নিয়ম নতুন বিন্যাসে ব্যর্থ হয়; ML-এর জন্য সম্পদ/ডেটা প্রয়োজন।          | একই ধরনের ফর্ম — নিয়ম; বৈচিত্র্যময় কর্পাস — ML।                              |
| ভেক্টরাইজেশন (ছবি) | CLIP / SigLIP / OCR‑free বিবরণ (Donut/Pix2Struct)           | সাধারণ *text↔image* latent স্পেস (CLIP/SigLIP); OCR‑free OCR নির্ভরতা দূর করে।     | CLIP ছবির ভেতরের টেক্সট পড়তে পারে না; বিবরণ অর্থ বিকৃত করতে পারে। | CLIP/SigLIP — মৌলিক মাল্টিমোডাল অনুসন্ধান; জটিল মানের স্ক্যানের জন্য OCR‑free। |
| ফলাফল একত্রীকরণ    | স্কোর অনুযায়ী সাজানো / modality কোটা / LLM‑reranker           | Reranker প্রসঙ্গ নির্বাচনের নির্ভুলতা উল্লেখযোগ্যভাবে বাড়ায়।                           | বিলম্ব ও খরচ বৃদ্ধি।                                              | High‑precision পরিস্থিতি; সহজ পদ্ধতি — PoC-এর জন্য।                         |
| স্টোরেজ/ইন্ডেক্স     | একক ভেক্টর / মাল্টিভেক্টর (text+image) / হাইব্রিড (BM25+vector) | মাল্টিভেক্টর একই অবজেক্টের বিভিন্ন উপস্থাপনা কভার করে; হাইব্রিড কীওয়ার্ড/কোড রক্ষা করে। | স্কিমা ও আপডেটের জটিলতা।                                        | মিশ্র ডেটা ও কঠোর SLA সহ প্রোডাকশন সিস্টেম।                                 |

MM‑RAG-এ মূল উপাদান ও পদ্ধতির তুলনা

## ব্যবহারিক মন্তব্য

- **হাইব্রিড অনুসন্ধান** (BM25 + ভেক্টর) — নির্দিষ্ট পদ/কোডে সম্পূর্ণতা ও নির্ভুলতা বাড়াতে ডি ফ্যাক্টো মান<sup>[\[20\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-weaviate-hybrid-20)</sup>।
- **Reranking** cross-encoder/LLM দিয়ে জেনারেশনের আগে "আবর্জনা" প্রার্থী বাদ দিয়ে token সাশ্রয় করে<sup>[\[13\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-cohere-rerank-13)</sup>।
- **আধুনিক VLM retriever** (যেমন ColPali) পৃষ্ঠা-ছবির সরাসরি ইন্ডেক্সিংয়ের মাধ্যমে ভিজ্যুয়ালভাবে সমৃদ্ধ দলিলে সুবিধা দেখায়<sup>[\[21\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_note-colpali2024-21)</sup>।

## সাহিত্য

- Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). *Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)*. ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). *A Survey of Multimodal Retrieval‑Augmented Generation*. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). *Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation*. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). *VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents*. arXiv:2410.10594.
- Cho, J. et al. (2024). *M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA*. arXiv:2411.04952.
- Tanaka, R. et al. (2025). *VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents*. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). *MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering*. arXiv:2505.16470.
- Wasserman, N. et al. (2025). *REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark*. arXiv:2502.12342.
- Faysse, M. et al. (2024). *ColPali: Efficient Document Retrieval with Vision Language Models*. arXiv:2407.01449.
- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision (CLIP)*. ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). *SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features*. arXiv:2502.14786.
- Xu, Y. et al. (2020). *LayoutLM: Pre‑training of Text and Layout for Document Image Understanding*. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). *LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking*. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). *PubLayNet: Largest Dataset Ever for Document Layout Analysis*. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). *DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis*. arXiv:2206.01062.
- Kim, G. et al. (2021). *OCR‑free Document Understanding Transformer (Donut)*. arXiv:2111.15664.
- Shen, Z. et al. (2021). *LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis*. arXiv:2103.15348.
- Singh, A. et al. (2019). *Towards VQA Models That Can Read (TextVQA)*. CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). *DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics*. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). *ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning*. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). *DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation*. arXiv:2212.10505.
- Wang, P. et al. (2024). *Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA*. arXiv:2409.12191.
- Es, S. et al. (2023). *RAGAS: Automated Evaluation of Retrieval‑Augmented Generation*. arXiv:2309.15217.

## আরও দেখুন

- Retrieval-Augmented Generation
- ভেক্টর ডেটাবেস
- Embedding
- GraphRAG

## টীকা

1.  <span id="cite_note-lewis2020-1">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-lewis2020_1-0) Lewis, P., Perez, E., et al. (2020). *Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks*. NeurIPS. <a href="https://arxiv.org/abs/2005.11401" class="external text" rel="nofollow">arXiv:2005.11401</a>.</span>
2.  <span id="cite_note-visrag2024-2">↑ <sup>[2.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-visrag2024_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-visrag2024_2-1)</sup> Yu, S. et al. (2024). *VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents*. <a href="https://arxiv.org/abs/2407.06437" class="external text" rel="nofollow">arXiv:2407.06437</a>.</span>
3.  <span id="cite_note-docvqa2021-3">↑ <sup>[3.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-docvqa2021_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-docvqa2021_3-1)</sup> Mathew, M. et al. (2021). *DocVQA: A Dataset for VQA on Document Images*. WACV. <a href="https://arxiv.org/abs/2007.00398" class="external text" rel="nofollow">arXiv:2007.00398</a>.</span>
4.  <span id="cite_note-textvqa2019-4">↑ <sup>[4.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-textvqa2019_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-textvqa2019_4-1)</sup> Singh, A. et al. (2019). *TextVQA: Towards VQA Models That Can Read*. CVPR. <a href="https://arxiv.org/abs/1904.08920" class="external text" rel="nofollow">arXiv:1904.08920</a>.</span>
5.  <span id="cite_note-layoutlm2020-5">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-layoutlm2020_5-0) Xu, Y. et al. (2020). *LayoutLM: Pre-training of Text and Layout for Document Image Understanding*. KDD. <a href="https://dl.acm.org/doi/10.1145/3394486.3403172" class="external text" rel="nofollow">DOI</a>.</span>
6.  <span id="cite_note-clip2021-6">↑ <sup>[6.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-clip2021_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-clip2021_6-1)</sup> Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision (CLIP)*. ICML. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.</span>
7.  <span id="cite_note-publaynet2019-7">↑ <sup>[7.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-publaynet2019_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-publaynet2019_7-1)</sup> Zhong, X., Tang, J., Yepes, A. J. (2019). *PubLayNet: Largest Dataset for Document Layout Analysis*. ICDAR. <a href="https://arxiv.org/abs/1908.07836" class="external text" rel="nofollow">arXiv:1908.07836</a>.</span>
8.  <span id="cite_note-doclaynet2022-8">↑ <sup>[8.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-doclaynet2022_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-doclaynet2022_8-1)</sup> Pfitzmann, B. et al. (2022). *DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis*. KDD. <a href="https://dl.acm.org/doi/10.1145/3534678.3539043" class="external text" rel="nofollow">DOI</a> / <a href="https://arxiv.org/abs/2206.01062" class="external text" rel="nofollow">arXiv:2206.01062</a>.</span>
9.  <span id="cite_note-layoutparser2021-9">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-layoutparser2021_9-0) Shen, Z. et al. (2021). *LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis*. <a href="https://arxiv.org/abs/2103.15348" class="external text" rel="nofollow">arXiv:2103.15348</a>.</span>
10. <span id="cite_note-donut2021-10">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-donut2021_10-0) Kim, G. et al. (2021). *Donut: OCR‑free Document Understanding Transformer*. <a href="https://arxiv.org/abs/2111.15664" class="external text" rel="nofollow">arXiv:2111.15664</a>.</span>
11. <span id="cite_note-siglip2023-11">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-siglip2023_11-0) Zhai, X. et al. (2023). *Sigmoid Loss for Language‑Image Pre‑Training (SigLIP)*. ICCV. <a href="https://arxiv.org/abs/2303.15343" class="external text" rel="nofollow">arXiv:2303.15343</a>.</span>
12. <span id="cite_note-milvus-mv-12">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-milvus-mv_12-0) Milvus Docs. *Multi‑Vector Hybrid Search*. <a href="https://milvus.io/docs/multi-vector-search.md" class="external text" rel="nofollow">milvus.io/docs/multi-vector-search.md</a>.</span>
13. <span id="cite_note-cohere-rerank-13">↑ <sup>[13.0](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-cohere-rerank_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-cohere-rerank_13-1)</sup> Cohere Docs. *Rerank API*. <a href="https://docs.cohere.com/reference/rerank" class="external text" rel="nofollow">docs.cohere.com/reference/rerank</a>.</span>
14. <span id="cite_note-gpt4v-14">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-gpt4v_14-0) OpenAI. *GPT‑4V(ision) System Card*. (2023). <a href="https://cdn.openai.com/papers/GPTV_System_Card.pdf" class="external text" rel="nofollow">PDF</a>.</span>
15. <span id="cite_note-gpt4o-15">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-gpt4o_15-0) OpenAI. *Hello GPT‑4o*. (2024). <a href="https://openai.com/index/hello-gpt-4o/" class="external text" rel="nofollow">openai.com/index/hello-gpt-4o/</a>.</span>
16. <span id="cite_note-ragas-16">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-ragas_16-0) Es, S. et al. (2023). *RAGAS: Automated Evaluation of Retrieval Augmented Generation*. <a href="https://arxiv.org/abs/2309.15217" class="external text" rel="nofollow">arXiv:2309.15217</a>.</span>
17. <span id="cite_note-infographicvqa2021-17">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-infographicvqa2021_17-0) Mathew, M. et al. (2021). *InfographicVQA: Understanding Infographics via Question Answering*. ICDAR. <a href="https://arxiv.org/abs/2104.12756" class="external text" rel="nofollow">arXiv:2104.12756</a>.</span>
18. <span id="cite_note-chartqa2022-18">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-chartqa2022_18-0) Masry, A. et al. (2022). *ChartQA: A Benchmark for Question Answering about Charts*. ACL (Findings). <a href="https://arxiv.org/abs/2103.16435" class="external text" rel="nofollow">arXiv:2103.16435</a>.</span>
19. <span id="cite_note-mmdocrag2025-19">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-mmdocrag2025_19-0) Dong, K. et al. (2025). *Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG)*. <a href="https://arxiv.org/abs/2505.16470" class="external text" rel="nofollow">arXiv:2505.16470</a>.</span>
20. <span id="cite_note-weaviate-hybrid-20">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-weaviate-hybrid_20-0) Weaviate Docs. *Hybrid search*. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external text" rel="nofollow">docs.weaviate.io/.../hybrid-search</a>.</span>
21. <span id="cite_note-colpali2024-21">[↑](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_(BN)#cite_ref-colpali2024_21-0) Faysse, M. et al. (2024). *ColPali: Efficient Document Retrieval with Vision‑Language Models*. <a href="https://arxiv.org/abs/2407.01449" class="external text" rel="nofollow">arXiv:2407.01449</a>.</span>
