MM-RAG (Multimodal RAG) (UR)
MM-RAG (انگریزی: Multimodal Retrieval-Augmented Generation) — یہ کلاسیکی RAG پیراڈائم کی توسیع ہے، جس میں LLM جواب دینے کے لیے نہ صرف متن بلکہ بصری ڈیٹا (تصاویر، خاکے، جدول، گراف) بھی استعمال کرتا ہے۔ Multimodal retrieval مختلف اظہارات میں شواہد تلاش کرنے اور انہیں جوڑنے کی صلاحیت دیتا ہے، اور بیرونی ذرائع پر انحصار کے ذریعے — صفحات کے ٹکڑوں اور علاقوں (bounding boxes) سے درست وابستگی کے ساتھ — فریب کاری (hallucinations) کا خطرہ کم کرتا ہے[1][2]۔
MM-RAG خاص طور پر ان دستاویزات کے لیے مفید ہے جہاں معنی کا اہم حصہ غیر متنی شکل میں موجود ہو (صفحے کی ترتیب، خاکے، جدولوں کی ساختیں)۔ ایسے معاملات میں کلاسیکی متنی RAG اکثر سیاق و سباق کے اہم عناصر کھو دیتا ہے[3][4]۔
سیاق و سباق اور حل ہونے والا مسئلہ
کلاسیکی RAG متنی اقتباسات پر کام کرتا ہے اور بصری ساختیں نہیں دیکھ پاتا (عناصر کی ترتیب، تصویروں کے عنوانات، گرافوں کے محور)۔ MM-RAG ان کمیوں کو پورا کرتا ہے: ساختی عناصر (متن، جدول، کوآرڈینیٹ کے ساتھ تصاویر) نکالتا ہے، انہیں vector space میں index کرتا ہے اور مختلف modalities سے شواہد یکجا کرتا ہے[5][6]۔
MM-RAG کا فن تعمیر (Architecture)
MM-RAG pipeline کلاسیکی RAG میں بصری ڈیٹا کی پروسیسنگ اور modalities کی ہم آہنگی کے مراحل کا اضافہ کرتا ہے: ingestion → indexing → multimodal retrieval → fusion اور reranking → traceability کے ساتھ generation۔
- جمع آوری اور پری پروسیسنگ (Ingestion)۔ ان پٹ میں PDF/اسکین/تصاویر آتی ہیں۔ OCR اور صفحے کا layout analysis انجام دیا جاتا ہے تاکہ زونز نکالے جا سکیں: پیراگراف، عنوانات، جدول، تصاویر اور ان کے کوآرڈینیٹ۔ عام ذرائع — LayoutLM فیملی کے models اور LayoutParser ٹول لائبریریاں؛ validation اور training اکثر PubLayNet اور DocLayNet datasets پر انحصار کرتی ہے[7][8][9]۔
- علاقوں میں تقسیم (Segmentation)۔ بصری اشیاء (خاکے، جدول، تصویریں، عنوانات) نکالے جاتے ہیں۔ بہتر استحکام کے لیے OCR‑free models (مثلاً Donut) یا مشترکہ OCR+VLM pipelines استعمال کیے جاتے ہیں[10]۔
- Indexing (Vector Index)۔ متنی chunks اور بصری عناصر (تصاویر یا ان کی تفصیلات) کو vector representations میں تبدیل کرکے vector database میں درج کیا جاتا ہے۔ مشترکہ text↔image فضا کے لیے CLIP یا SigLIP استعمال ہوتے ہیں؛ production کے لیے multimodal/multi-vector indexes (ایک آبجیکٹ — متعدد vectors) موزوں ہیں[6][11][12]۔
- Multimodal Retrieval اور Reranking۔ متنی اور بصری تلاش کا امتزاج کیا جاتا ہے؛ امیدوار (پیراگراف، جدول، تصاویر/علاقے) یکجا کیے جاتے ہیں اور درستگی بڑھانے کے لیے زیادہ بھاری ماڈل (cross‑encoder/LLM‑reranker) سے rerank کیے جاتے ہیں[13]۔
- سیاق و سباق کی پیکیجنگ اور Generation۔ منتخب ٹکڑے LLM/VLM کو بھیجے جاتے ہیں۔ اگر ماڈل multimodal ہو (مثلاً GPT‑4V/4o) تو تصاویر براہ راست بھیجی جا سکتی ہیں؛ متنی LLM کی صورت میں تصاویر پہلے سے تفصیلی تفصیلات میں تبدیل کی جاتی ہیں[14][15]۔
- Traceability اور حوالہ جات۔ جواب کے ساتھ کلک کے قابل حوالہ جات ہوتے ہیں جو نہ صرف دستاویز/صفحے سے بلکہ علاقے (کوآرڈینیٹ) سے بھی منسلک ہوتے ہیں۔ اس سے grounding کی سطح اور صارفین کا اعتماد بڑھتا ہے[2]۔
معیار کا اندازہ اور metrics
MM‑RAG کی کارکردگی extraction، retrieval اور generation کی سطحوں پر جانچی جاتی ہے۔
- بصری ڈیٹا نکالنے کا معیار۔ OCR درستگی (WER/CER)، DocLayNet/PubLayNet مجموعوں پر layout analysis کا معیار (mAP/Precision/Recall)[8][7]۔
- Retrieval کا معیار۔ اطلاعاتی بازیافت کی معیاری metrics: Recall@K، Precision@K، MRR؛ multimodality کے لیے — الگ الگ modalities اور مجموعی طور پر۔
- جواب کا معیار (end‑to‑end)۔ خودکار faithfulness/groundedness metrics اور انسانی جائزہ۔ عملی طور پر RAGAS/TruLens/DeepEval frameworks استعمال ہوتے ہیں[16]۔
- Benchmarks۔
- DocVQA: دستاویزی تصاویر سے متعلق سوالات[3]۔
- TextVQA: تصاویر پر موجود متن پڑھنے کی ضرورت والے سوالات[4]۔
- InfographicVQA: infographics سے متعلق سوالات[17]۔
- ChartQA: منطقی استدلال کے تقاضے کے ساتھ خاکوں سے متعلق سوالات[18]۔
- MMDocRAG: DocQA کے لیے multimodal RAG benchmark (کثیر صفحاتی دستاویزات، cross‑modal شواہد کی زنجیریں)[19]۔
اجزاء کا تقابلی جدول
| جزو | نفاذ کے اختیارات | فوائد | نقصانات / خطرات | کب منتخب کریں |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / کلاؤڈ API | مقامی — رازداری اور کنٹرول؛ کلاؤڈ — بلا ترمیم اعلی درستگی۔ | پیچیدہ layout پر غلطیاں؛ API — لاگت اور تعمیل کے تقاضے۔ | نجی ڈیٹا — مقامی OCR؛ زیادہ سے زیادہ درستگی — کلاؤڈ (اگر قابل قبول ہو)۔ |
| Layout Analysis | اصول / ML ماڈل (LayoutLM، LayoutParser) | اصول یکساں templates کے لیے آسان؛ ML — تنوع کے لیے مستحکم۔ | اصول نئے layouts پر ناکام؛ ML کو وسائل/ڈیٹا درکار۔ | یکساں فارم — اصول؛ متنوع مجموعہ — ML۔ |
| Vectorization (تصاویر) | CLIP / SigLIP / OCR‑free تفصیلات (Donut/Pix2Struct) | مشترکہ latent فضا text↔image (CLIP/SigLIP)؛ OCR‑free، OCR پر انحصار ختم کرتی ہے۔ | CLIP تصاویر کے اندر متن نہیں پڑھتا؛ تفصیلات معنی مسخ کر سکتی ہیں۔ | CLIP/SigLIP — بنیادی multimodal تلاش؛ OCR‑free پیچیدہ معیار کے اسکینز کے لیے۔ |
| نتائج کا fusion | Score کے مطابق ترتیب / modalities کے لیے کوٹے / LLM‑reranker | Reranker سیاق و سباق کے انتخاب کی درستگی نمایاں طور پر بڑھاتا ہے۔ | تاخیر اور لاگت میں اضافہ۔ | اعلی درستگی کے منظرنامے؛ آسان طریقے — PoC کے لیے۔ |
| ذخیرہ/index | ایک vector / multi-vector (text+image) / hybrid (BM25+vector) | Multi-vector ایک آبجیکٹ کی مختلف representations کا احاطہ کرتا ہے؛ hybrid کلیدی الفاظ/کوڈ محفوظ کرتا ہے۔ | schema اور updates کی پیچیدگی میں اضافہ۔ | مخلوط ڈیٹا اور سخت SLA والے پروڈکشن نظام۔ |
عملی ملاحظات
- Hybrid تلاش (BM25 + vector) — مخصوص اصطلاحات/کوڈز پر coverage اور درستگی بڑھانے کا de‑facto معیار ہے[20]۔
- Reranking cross‑encoder/LLM کے ذریعے generation سے پہلے ردی امیدواروں کو ہٹا کر tokens کی بچت کرتا ہے[13]۔
- جدید VLM retrievers (مثلاً ColPali) صفحات کی تصاویر کی براہ راست indexing کی بدولت بصری طور پر بھرپور دستاویزات میں برتری دکھاتے ہیں[21]۔
ادبیات
- Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.
مزید دیکھیں
- Retrieval-Augmented Generation
- ویکٹر ڈیٹا بیس
- Embedding
- GraphRAG
حواشی
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.