---
title: "MM-RAG (Multimodal RAG) — التوليد المعزز بالاسترجاع متعدد الوسائط"
source: "https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7"
wiki: "systems-analysis.info/int"
article: "MM-RAG_(Multimodal_RAG)_—_التوليد_المعزز_بالاسترجاع_متعدد_الوسائط"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:Prompt engineering"
revision_id: 4064
wiki_created_at: 2026-09-06T23:29:59Z
wiki_modified_at: 2026-09-06T23:29:59Z
downloaded_at: 2026-09-07T23:00:40Z
---

# MM-RAG (Multimodal RAG) — التوليد المعزز بالاسترجاع متعدد الوسائط

**MM-RAG** (بالإنجليزية: *Multimodal Retrieval-Augmented Generation*) هو امتداد للنموذج الكلاسيكي RAG، حيث تستخدم LLM ليس فقط النصوص للإجابة، بل وأيضًا البيانات المرئية (الصور، المخططات، الجداول، الرسوم البيانية). يسمح الاسترجاع متعدد الوسائط بالعثور على الأدلة وربطها عبر تمثيلات مختلفة، مما يقلل من خطر الهلوسات بالاعتماد على مصادر خارجية مع تحديد دقيق لمقتطفات الصفحات والمناطق (*bounding boxes*)<sup>[\[1\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-lewis2020-1)[\[2\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-visrag2024-2)</sup>.

يعتبر MM-RAG مفيدًا بشكل خاص للمستندات التي يتم فيها تمثيل جزء كبير من المعنى في شكل غير نصي (تخطيط الصفحة، الرسوم البيانية، هياكل الجداول). في مثل هذه الحالات، غالبًا ما يفقد RAG النصي الكلاسيكي عناصر سياقية مهمة<sup>[\[3\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-docvqa2021-3)[\[4\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-textvqa2019-4)</sup>.

## السياق والمشكلة التي يتم حلها

يعمل RAG الكلاسيكي على مقاطع نصية ولا "يرى" الهياكل المرئية (مثل موضع العناصر، والتسميات التوضيحية للصور، ومحاور الرسوم البيانية). يسد MM-RAG هذه الثغرات: فهو يستخرج العناصر المهيكلة (النصوص، الجداول، الصور مع إحداثياتها)، ويفهرسها في فضاء متجهي، ويجمع الأدلة من وسائط مختلفة<sup>[\[5\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-layoutlm2020-5)[\[6\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-clip2021-6)</sup>.

## بنية MM-RAG

يضيف مسار عمل MM-RAG إلى RAG الكلاسيكي مراحل لمعالجة البيانات المرئية ومواءمة الوسائط: **الاستيعاب (Ingestion) ← الفهرسة ← الاسترجاع متعدد الوسائط ← الدمج وإعادة الترتيب ← التوليد مع التتبع**.

1.  **الجمع والمعالجة المسبقة (Ingestion).** يتم إدخال ملفات PDF/المسح الضوئي/الصور. يتم تنفيذ التعرف الضوئي على الحروف (OCR) و**تحليل تخطيط** الصفحة لاستخلاص المناطق: الفقرات، العناوين، الجداول، الصور وإحداثياتها. الأدوات النموذجية هي نماذج من عائلة LayoutLM ومكتبات أدوات مثل LayoutParser؛ غالبًا ما يعتمد التحقق والتدريب على مجموعات البيانات PubLayNet وDocLayNet<sup>[\[7\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-publaynet2019-7)[\[8\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-doclaynet2022-8)[\[9\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-layoutparser2021-9)</sup>.
2.  **التقسيم إلى مناطق.** يتم استخراج الكائنات المرئية (الرسوم البيانية، الجداول، الرسوم التوضيحية، التسميات التوضيحية). لزيادة المتانة، يتم استخدام نماذج لا تعتمد على OCR (مثل Donut) أو مسارات عمل مدمجة OCR+VLM<sup>[\[10\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-donut2021-10)</sup>.
3.  **الفهرسة (Vector Index).** يتم تحويل القطع النصية والعناصر المرئية (الصور أو أوصافها) إلى تمثيلات متجهية وتخزينها في قاعدة بيانات متجهية. بالنسبة للفضاء المشترك *text↔image*، يتم استخدام CLIP أو SigLIP؛ وللأنظمة الإنتاجية، تكون الفهارس متعددة الوسائط/متعددة المتجهات ملائمة (كائن واحد — عدة متجهات)<sup>[\[6\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-clip2021-6)[\[11\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-siglip2023-11)[\[12\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-milvus-mv-12)</sup>.
4.  **الاسترجاع متعدد الوسائط وإعادة الترتيب.** يتم تنفيذ مزيج من البحث النصي والمرئي؛ يتم دمج المرشحين (الفقرات، الجداول، الصور/المناطق) وإعادة ترتيبهم بواسطة نموذج أثقل (مشفّر متقاطع/LLM-reranker) لزيادة الدقة<sup>[\[13\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-cohere-rerank-13)</sup>.
5.  **تجميع السياق والتوليد.** يتم تمرير المقتطفات المحددة إلى LLM/VLM. إذا كان النموذج متعدد الوسائط (مثل GPT‑4V/4o)، يمكن تمرير الصور مباشرة؛ أما إذا كان LLM نصيًا، فيتم تحويل الصور مسبقًا إلى أوصاف تفصيلية<sup>[\[14\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-gpt4v-14)[\[15\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-gpt4o-15)</sup>.
6.  **التتبع والاقتباس.** تكون الإجابة مصحوبة باقتباسات قابلة للنقر لا ترتبط بالمستند/الصفحة فحسب، بل بالمنطقة المحددة (الإحداثيات) أيضًا. هذا يعزز مستوى *grounding* (التأصيل) وثقة المستخدمين<sup>[\[2\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-visrag2024-2)</sup>.

## تقييم الجودة والمقاييس

يتم تقييم فعالية MM-RAG على مستويات الاستخراج والاسترجاع والتوليد.

- **جودة استخراج البيانات المرئية.** دقة OCR (WER/CER)، وجودة تحليل التخطيط (mAP/Precision/Recall) على مجموعات بيانات DocLayNet/PubLayNet<sup>[\[8\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-doclaynet2022-8)[\[7\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-publaynet2019-7)</sup>.
- **جودة الاسترجاع.** مقاييس استرجاع المعلومات القياسية: Recall@K، Precision@K، MRR؛ بالنسبة للوسائط المتعددة، يتم التقييم بشكل منفصل لكل وسيطة وفي الدمج.
- **جودة الإجابة (end‑to‑end).** مقاييس تلقائية مثل *faithfulness* (الأمانة) / *groundedness* (التأصيل) والتقييم البشري. عمليًا، تُستخدم أطر عمل مثل RAGAS/TruLens/DeepEval<sup>[\[16\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-ragas-16)</sup>.
- **معايير التقييم (Benchmarks).**
  - **DocVQA**: أسئلة حول صور المستندات<sup>[\[3\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-docvqa2021-3)</sup>.
  - **TextVQA**: أسئلة تتطلب قراءة النص في الصور<sup>[\[4\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-textvqa2019-4)</sup>.
  - **InfographicVQA**: أسئلة حول الرسوم البيانية المعلوماتية (الإنفوجرافيك)<sup>[\[17\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-infographicvqa2021-17)</sup>.
  - **ChartQA**: أسئلة حول الرسوم البيانية تتطلب استدلالًا منطقيًا<sup>[\[18\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-chartqa2022-18)</sup>.
  - **MMDocRAG**: معيار تقييم لـ RAG متعدد الوسائط للإجابة على الأسئلة من المستندات (DocQA) (مستندات متعددة الصفحات، سلاسل أدلة عبر الوسائط)<sup>[\[19\]](https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-mmdocrag2025-19)</sup>.

## جدول مقارنة للمكونات

<table class="wikitable" style="width:100%;">
<caption>مقارنة بين المكونات والنهج الرئيسية في MM-RAG</caption>
<colgroup>
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
<col style="width: 16%" />
</colgroup>
<thead>
<tr class="header">
<th>المكون</th>
<th>خيارات التنفيذ</th>
<th>الإيجابيات</th>
<th>السلبيات / المخاطر</th>
<th>متى تختار</th>
<th></th>
</tr>
</thead>
<tbody>
<tr class="odd">
<th>OCR</th>
<td>Tesseract / PaddleOCR / واجهات برمجة التطبيقات السحابية (Cloud APIs)</td>
<td>المحلية تضمن الخصوصية والتحكم؛ السحابية توفر دقة عالية "جاهزة للاستخدام".</td>
<td>أخطاء في التخطيطات المعقدة؛ API — التكلفة ومتطلبات الامتثال.</td>
<td>للبيانات الخاصة — OCR محلي؛ لأقصى دقة — السحابة (إذا كان مسموحًا).</td>
<td></td>
</tr>
<tr class="even">
<th>تحليل التخطيط</th>
<td>قواعد / نموذج تعلم آلي (LayoutLM, LayoutParser)</td>
<td>القواعد بسيطة للقوالب الموحدة؛ نماذج تعلم الآلة أكثر متانة مع التنوع.</td>
<td>القواعد تفشل مع التخطيطات الجديدة؛ نماذج تعلم الآلة تتطلب موارد/بيانات.</td>
<td>للنماذج الموحدة — القواعد؛ لمتن متنوع من المستندات — تعلم الآلة.</td>
<td></td>
</tr>
<tr class="odd">
<th>التحويل إلى متجهات (صور)</th>
<td>CLIP / SigLIP / أوصاف لا تعتمد على OCR (Donut/Pix2Struct)</td>
<td>فضاء كامن مشترك بين النص والصورة (CLIP/SigLIP)؛ النماذج التي لا تعتمد على OCR تزيل الاعتماد على OCR.</td>
<td>نموذج CLIP لا يقرأ النص داخل الصور؛ الأوصاف قد تشوه المعنى.</td>
<td>CLIP/SigLIP للبحث الأساسي متعدد الوسائط؛ نماذج لا تعتمد على OCR للمسح الضوئي ذي الجودة المعقدة.</td>
<td></td>
</tr>
<tr class="even">
<th>دمج النتائج</th>
<td>الفرز حسب درجة الثقة (score) / حصص حسب الوسائط / LLM-reranker</td>
<td>أداة إعادة الترتيب تزيد بشكل ملحوظ من دقة اختيار السياق.</td>
<td>زيادة في زمن الاستجابة والتكلفة.</td>
<td>سيناريوهات تتطلب دقة عالية؛ الطرق البسيطة لإثبات المفهوم (PoC).</td>
<td></td>
</tr>
<tr class="odd">
<th>التخزين/الفهرس</th>
<td>متجه واحد / متجه متعدد (نص+صورة) / هجين (BM25+متجه)</td>
<td>المتجه المتعدد يغطي تمثيلات مختلفة لنفس الكائن؛ الهجين ينقذ الكلمات الرئيسية/الرموز.</td>
<td>تعقيد في البنية والتحديثات.</td>
<td>أنظمة إنتاجية ببيانات مختلطة واتفاقيات مستوى خدمة (SLA) صارمة.</td>
<td>}
<h2 id="ملاحظات_عملية">ملاحظات عملية</h2>
<ul>
<li><strong>البحث الهجين</strong> (BM25 + متجه) هو المعيار الفعلي لزيادة الشمولية والدقة للمصطلحات/الرموز المتخصصة<sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-weaviate-hybrid-20">[20]</a></sup>.</li>
<li><strong>إعادة الترتيب</strong> بواسطة مشفّر متقاطع/LLM توفر في استهلاك التوكنز عن طريق استبعاد المرشحين "غير المرغوب فيهم" قبل مرحلة التوليد<sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-cohere-rerank-13">[13]</a></sup>.</li>
<li><strong>مسترجعات VLM الحديثة</strong> (مثل ColPali) تظهر تفوقًا في المستندات الغنية بصريًا بفضل الفهرسة المباشرة لصفحات الصور<sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_note-colpali2024-21">[21]</a></sup>.</li>
</ul>
<h2 id="انظر_أيضًا">انظر أيضًا</h2>
<ul>
<li>Retrieval-Augmented Generation</li>
<li>قاعدة بيانات متجهية</li>
<li>Embedding</li>
<li>GraphRAG</li>
</ul>
<h2 id="المراجع">المراجع</h2>
<ul>
<li>Lewis, P. et al. (2020). <em>Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks</em>. NeurIPS. <a href="https://arxiv.org/abs/2005.11401" class="external text" rel="nofollow">arXiv:2005.11401</a>.</li>
<li>Gao, L. et al. (2023). <em>Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE)</em>. ACL 2023. <a href="https://arxiv.org/abs/2212.10496" class="external text" rel="nofollow">arXiv:2212.10496</a>.</li>
<li>Mei, L., Mo, S., Yang, Z., Chen, C. (2025). <em>A Survey of Multimodal Retrieval‑Augmented Generation</em>. <a href="https://arxiv.org/abs/2504.08748" class="external text" rel="nofollow">arXiv:2504.08748</a>.</li>
<li>Abootorabi, M.M. et al. (2025). <em>Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation</em>. Findings of ACL 2025. <a href="https://aclanthology.org/2025.findings-acl.861/" class="external text" rel="nofollow">ACL Anthology</a>.</li>
<li>Yu, S. et al. (2024). <em>VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents</em>. <a href="https://arxiv.org/abs/2410.10594" class="external text" rel="nofollow">arXiv:2410.10594</a>.</li>
<li>Cho, J. et al. (2024). <em>M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA</em>. <a href="https://arxiv.org/abs/2411.04952" class="external text" rel="nofollow">arXiv:2411.04952</a>.</li>
<li>Tanaka, R. et al. (2025). <em>VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents</em>. CVPR 2025. <a href="https://arxiv.org/abs/2504.09795" class="external text" rel="nofollow">arXiv:2504.09795</a> • <a href="https://openaccess.thecvf.com/content/CVPR2025/papers/Tanaka_VDocRAG_Retrieval-Augmented_Generation_over_Visually-Rich_Documents_CVPR_2025_paper.pdf" class="external text" rel="nofollow">CVF Open Access</a>.</li>
<li>Dong, K. et al. (2025). <em>MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering</em>. <a href="https://arxiv.org/abs/2505.16470" class="external text" rel="nofollow">arXiv:2505.16470</a>.</li>
<li>Wasserman, N. et al. (2025). <em>REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark</em>. <a href="https://arxiv.org/abs/2502.12342" class="external text" rel="nofollow">arXiv:2502.12342</a>.</li>
<li>Faysse, M. et al. (2024). <em>ColPali: Efficient Document Retrieval with Vision Language Models</em>. <a href="https://arxiv.org/abs/2407.01449" class="external text" rel="nofollow">arXiv:2407.01449</a>.</li>
<li>Radford, A. et al. (2021). <em>Learning Transferable Visual Models From Natural Language Supervision (CLIP)</em>. ICML 2021. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.</li>
<li>Tschannen, M. et al. (2025). <em>SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features</em>. <a href="https://arxiv.org/abs/2502.14786" class="external text" rel="nofollow">arXiv:2502.14786</a>.</li>
<li>Xu, Y. et al. (2020). <em>LayoutLM: Pre‑training of Text and Layout for Document Image Understanding</em>. KDD 2020. <a href="https://dl.acm.org/doi/10.1145/3394486.3403172" class="external text" rel="nofollow">DOI</a> • <a href="https://arxiv.org/abs/1912.13318" class="external text" rel="nofollow">arXiv:1912.13318</a>.</li>
<li>Huang, Y. et al. (2022). <em>LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking</em>. <a href="https://arxiv.org/abs/2204.08387" class="external text" rel="nofollow">arXiv:2204.08387</a>.</li>
<li>Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). <em>PubLayNet: Largest Dataset Ever for Document Layout Analysis</em>. <a href="https://arxiv.org/abs/1908.07836" class="external text" rel="nofollow">arXiv:1908.07836</a>.</li>
<li>Pfitzmann, B. et al. (2022). <em>DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis</em>. <a href="https://arxiv.org/abs/2206.01062" class="external text" rel="nofollow">arXiv:2206.01062</a>.</li>
<li>Kim, G. et al. (2021). <em>OCR‑free Document Understanding Transformer (Donut)</em>. <a href="https://arxiv.org/abs/2111.15664" class="external text" rel="nofollow">arXiv:2111.15664</a>.</li>
<li>Shen, Z. et al. (2021). <em>LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis</em>. <a href="https://arxiv.org/abs/2103.15348" class="external text" rel="nofollow">arXiv:2103.15348</a>.</li>
<li>Singh, A. et al. (2019). <em>Towards VQA Models That Can Read (TextVQA)</em>. CVPR 2019. <a href="https://arxiv.org/abs/1904.08920" class="external text" rel="nofollow">arXiv:1904.08920</a>.</li>
<li>Mathew, M. et al. (2021/2022). <em>DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics</em>. WACV 2021 / WACV 2022. <a href="https://openaccess.thecvf.com/content/WACV2021/html/Mathew_DocVQA_A_Dataset_for_VQA_on_Document_Images_WACV_2021_paper.html" class="external text" rel="nofollow">CVF</a> • <a href="https://arxiv.org/abs/2104.12756" class="external text" rel="nofollow">arXiv:2104.12756</a>.</li>
<li>Masry, A. et al. (2022). <em>ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning</em>. Findings of ACL 2022. <a href="https://aclanthology.org/2022.findings-acl.177/" class="external text" rel="nofollow">ACL</a> • <a href="https://arxiv.org/abs/2203.10244" class="external text" rel="nofollow">arXiv:2203.10244</a>.</li>
<li>Liu, F. et al. (2022). <em>DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation</em>. <a href="https://arxiv.org/abs/2212.10505" class="external text" rel="nofollow">arXiv:2212.10505</a>.</li>
<li>Wang, P. et al. (2024). <em>Qwen2‑VL: Enhancing Vision‑Language Model’s Capabilities in OCR and Chart QA</em>. <a href="https://arxiv.org/abs/2409.12191" class="external text" rel="nofollow">arXiv:2409.12191</a>.</li>
<li>Es, S. et al. (2023). <em>RAGAS: Automated Evaluation of Retrieval‑Augmented Generation</em>. <a href="https://arxiv.org/abs/2309.15217" class="external text" rel="nofollow">arXiv:2309.15217</a>.</li>
</ul>
<h2 id="ملاحظات">ملاحظات</h2>
<ol>
<li><span id="cite_note-lewis2020-1"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-lewis2020_1-0">↑</a> Lewis, P., Perez, E., et al. (2020). <em>Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks</em>. NeurIPS. <a href="https://arxiv.org/abs/2005.11401" class="external text" rel="nofollow">arXiv:2005.11401</a>.</span></li>
<li><span id="cite_note-visrag2024-2">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-visrag2024_2-0">2.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-visrag2024_2-1">2.1</a></sup> Yu, S. et al. (2024). <em>VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents</em>. <a href="https://arxiv.org/abs/2407.06437" class="external text" rel="nofollow">arXiv:2407.06437</a>.</span></li>
<li><span id="cite_note-docvqa2021-3">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-docvqa2021_3-0">3.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-docvqa2021_3-1">3.1</a></sup> Mathew, M. et al. (2021). <em>DocVQA: A Dataset for VQA on Document Images</em>. WACV. <a href="https://arxiv.org/abs/2007.00398" class="external text" rel="nofollow">arXiv:2007.00398</a>.</span></li>
<li><span id="cite_note-textvqa2019-4">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-textvqa2019_4-0">4.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-textvqa2019_4-1">4.1</a></sup> Singh, A. et al. (2019). <em>TextVQA: Towards VQA Models That Can Read</em>. CVPR. <a href="https://arxiv.org/abs/1904.08920" class="external text" rel="nofollow">arXiv:1904.08920</a>.</span></li>
<li><span id="cite_note-layoutlm2020-5"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-layoutlm2020_5-0">↑</a> Xu, Y. et al. (2020). <em>LayoutLM: Pre-training of Text and Layout for Document Image Understanding</em>. KDD. <a href="https://dl.acm.org/doi/10.1145/3394486.3403172" class="external text" rel="nofollow">DOI</a>.</span></li>
<li><span id="cite_note-clip2021-6">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-clip2021_6-0">6.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-clip2021_6-1">6.1</a></sup> Radford, A. et al. (2021). <em>Learning Transferable Visual Models From Natural Language Supervision (CLIP)</em>. ICML. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.</span></li>
<li><span id="cite_note-publaynet2019-7">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-publaynet2019_7-0">7.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-publaynet2019_7-1">7.1</a></sup> Zhong, X., Tang, J., Yepes, A. J. (2019). <em>PubLayNet: Largest Dataset for Document Layout Analysis</em>. ICDAR. <a href="https://arxiv.org/abs/1908.07836" class="external text" rel="nofollow">arXiv:1908.07836</a>.</span></li>
<li><span id="cite_note-doclaynet2022-8">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-doclaynet2022_8-0">8.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-doclaynet2022_8-1">8.1</a></sup> Pfitzmann, B. et al. (2022). <em>DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis</em>. KDD. <a href="https://dl.acm.org/doi/10.1145/3534678.3539043" class="external text" rel="nofollow">DOI</a> / <a href="https://arxiv.org/abs/2206.01062" class="external text" rel="nofollow">arXiv:2206.01062</a>.</span></li>
<li><span id="cite_note-layoutparser2021-9"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-layoutparser2021_9-0">↑</a> Shen, Z. et al. (2021). <em>LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis</em>. <a href="https://arxiv.org/abs/2103.15348" class="external text" rel="nofollow">arXiv:2103.15348</a>.</span></li>
<li><span id="cite_note-donut2021-10"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-donut2021_10-0">↑</a> Kim, G. et al. (2021). <em>Donut: OCR‑free Document Understanding Transformer</em>. <a href="https://arxiv.org/abs/2111.15664" class="external text" rel="nofollow">arXiv:2111.15664</a>.</span></li>
<li><span id="cite_note-siglip2023-11"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-siglip2023_11-0">↑</a> Zhai, X. et al. (2023). <em>Sigmoid Loss for Language‑Image Pre‑Training (SigLIP)</em>. ICCV. <a href="https://arxiv.org/abs/2303.15343" class="external text" rel="nofollow">arXiv:2303.15343</a>.</span></li>
<li><span id="cite_note-milvus-mv-12"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-milvus-mv_12-0">↑</a> Milvus Docs. <em>Multi‑Vector Hybrid Search</em>. <a href="https://milvus.io/docs/multi-vector-search.md" class="external text" rel="nofollow">milvus.io/docs/multi-vector-search.md</a>.</span></li>
<li><span id="cite_note-cohere-rerank-13">↑ <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-cohere-rerank_13-0">13.0</a></sup> <sup><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-cohere-rerank_13-1">13.1</a></sup> Cohere Docs. <em>Rerank API</em>. <a href="https://docs.cohere.com/reference/rerank" class="external text" rel="nofollow">docs.cohere.com/reference/rerank</a>.</span></li>
<li><span id="cite_note-gpt4v-14"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-gpt4v_14-0">↑</a> OpenAI. <em>GPT‑4V(ision) System Card</em>. (2023). <a href="https://cdn.openai.com/papers/GPTV_System_Card.pdf" class="external text" rel="nofollow">PDF</a>.</span></li>
<li><span id="cite_note-gpt4o-15"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-gpt4o_15-0">↑</a> OpenAI. <em>Hello GPT‑4o</em>. (2024). <a href="https://openai.com/index/hello-gpt-4o/" class="external text" rel="nofollow">openai.com/index/hello-gpt-4o/</a>.</span></li>
<li><span id="cite_note-ragas-16"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-ragas_16-0">↑</a> Es, S. et al. (2023). <em>RAGAS: Automated Evaluation of Retrieval Augmented Generation</em>. <a href="https://arxiv.org/abs/2309.15217" class="external text" rel="nofollow">arXiv:2309.15217</a>.</span></li>
<li><span id="cite_note-infographicvqa2021-17"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-infographicvqa2021_17-0">↑</a> Mathew, M. et al. (2021). <em>InfographicVQA: Understanding Infographics via Question Answering</em>. ICDAR. <a href="https://arxiv.org/abs/2104.12756" class="external text" rel="nofollow">arXiv:2104.12756</a>.</span></li>
<li><span id="cite_note-chartqa2022-18"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-chartqa2022_18-0">↑</a> Masry, A. et al. (2022). <em>ChartQA: A Benchmark for Question Answering about Charts</em>. ACL (Findings). <a href="https://arxiv.org/abs/2103.16435" class="external text" rel="nofollow">arXiv:2103.16435</a>.</span></li>
<li><span id="cite_note-mmdocrag2025-19"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-mmdocrag2025_19-0">↑</a> Dong, K. et al. (2025). <em>Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG)</em>. <a href="https://arxiv.org/abs/2505.16470" class="external text" rel="nofollow">arXiv:2505.16470</a>.</span></li>
<li><span id="cite_note-weaviate-hybrid-20"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-weaviate-hybrid_20-0">↑</a> Weaviate Docs. <em>Hybrid search</em>. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external text" rel="nofollow">docs.weaviate.io/.../hybrid-search</a>.</span></li>
<li><span id="cite_note-colpali2024-21"><a href="https://systems-analysis.info/int/MM-RAG_(Multimodal_RAG)_%E2%80%94_%D8%A7%D9%84%D8%AA%D9%88%D9%84%D9%8A%D8%AF_%D8%A7%D9%84%D9%85%D8%B9%D8%B2%D8%B2_%D8%A8%D8%A7%D9%84%D8%A7%D8%B3%D8%AA%D8%B1%D8%AC%D8%A7%D8%B9_%D9%85%D8%AA%D8%B9%D8%AF%D8%AF_%D8%A7%D9%84%D9%88%D8%B3%D8%A7%D8%A6%D8%B7#cite_ref-colpali2024_21-0">↑</a> Faysse, M. et al. (2024). <em>ColPali: Efficient Document Retrieval with Vision‑Language Models</em>. <a href="https://arxiv.org/abs/2407.01449" class="external text" rel="nofollow">arXiv:2407.01449</a>.</span></li>
</ol></td>
</tr>
</tbody>
</table>

مقارنة بين المكونات والنهج الرئيسية في MM-RAG
