MM-RAG (Multimodal RAG) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

MM-RAG (İng. Multimodal Retrieval-Augmented Generation) — klasik RAG paradigmasının bir uzantısıdır; bu yaklaşımda LLM'ler yanıt üretmek için yalnızca metni değil, görsel verileri de (görüntüler, şemalar, tablolar, grafikler) kullanır. Multimodal retrieval, farklı temsiller arasında kanıt bulmayı ve ilişkilendirmeyi mümkün kılar; sayfa parçalarına ve bölgelere (bounding boxes) kesin bağlantı içeren dış kaynaklara dayanarak halüsinasyon riskini azaltır[1][2].

MM-RAG, anlamın önemli bir bölümünün metin dışı biçimde (sayfa düzeni, diyagramlar, tablo yapıları) sunulduğu belgeler için özellikle kullanışlıdır. Bu tür durumlarda klasik metin tabanlı RAG, bağlamın önemli öğelerini çoğunlukla kaybeder[3][4].

Bağlam ve Çözülen Problem

Klasik RAG, metin pasajları üzerinde çalışır ve görsel yapıları (öğelerin konumu, şekil açıklamaları, grafik eksenleri) göremez. MM-RAG bu boşlukları kapatır: yapılandırılmış öğeleri (koordinatlarıyla birlikte metin, tablolar, görüntüler) çıkarır, bunları vektör uzayına indeksler ve farklı modalitelerden gelen kanıtları birleştirir[5][6].

MM-RAG Mimarisi

MM-RAG boru hattı, klasik RAG'a görsel veri işleme ve modalite hizalama aşamaları ekler: veri alımı → indeksleme → multimodal retrieval → birleştirme ve yeniden sıralama → izlenebilirlik ile üretim.

  1. Veri Toplama ve Ön İşleme (Ingestion). Giriş olarak PDF/taramalar/görüntüler alınır. Bölgeleri ayırt etmek için OCR ve sayfa düzen analizi gerçekleştirilir: paragraflar, başlıklar, tablolar, görüntüler ve koordinatları. Tipik araçlar — LayoutLM ailesi modelleri ve LayoutParser araç kütüphaneleridir; doğrulama ve eğitim çoğunlukla PubLayNet ve DocLayNet dataset'lerine dayanır[7][8][9].
  2. Bölge Segmentasyonu. Görsel nesneler (diyagramlar, tablolar, görseller, açıklamalar) çıkarılır. Daha yüksek kararlılık için OCR‑free modeller (örn. Donut) veya birleşik OCR+VLM boru hatları kullanılır[10].
  3. İndeksleme (Vector Index). Metin parçaları ve görsel öğeler (görüntüler veya açıklamaları) vektör temsillerine dönüştürülür ve vektör veritabanına eklenir. text↔image birleşik uzayı için CLIP veya SigLIP kullanılır; üretim ortamları için multimodal/çok vektörlü indeksler (bir nesne — birden fazla vektör) kullanışlıdır[6][11][12].
  4. Multimodal Retrieval ve Yeniden Sıralama. Metin ve görsel arama kombinasyonu gerçekleştirilir; adaylar (paragraflar, tablolar, görüntüler/bölgeler) birleştirilerek daha "ağır" bir model (cross-encoder/LLM-reranker) ile hassasiyeti artırmak amacıyla yeniden sıralanır[13].
  5. Bağlam Paketleme ve Üretim. Seçilen parçalar LLM/VLM'e aktarılır. Model multimodal ise (örn. GPT‑4V/4o) görüntüler doğrudan iletilebilir; metin tabanlı LLM kullanılıyorsa görüntüler önceden ayrıntılı açıklamalara dönüştürülür[14][15].
  6. İzlenebilirlik ve Alıntılama. Yanıt; yalnızca belge/sayfaya değil, bölgeye (koordinatlara) bağlantılı tıklanabilir alıntılarla sunulur. Bu, grounding düzeyini ve kullanıcı güvenini artırır[2].

Kalite Değerlendirme ve Metrikler

MM‑RAG etkinliği; çıkarım, retrieval ve üretim düzeylerinde değerlendirilir.

  • Görsel Veri Çıkarım Kalitesi. OCR doğruluğu (WER/CER), DocLayNet/PubLayNet dataset'leri üzerinde düzen analizi kalitesi (mAP/Precision/Recall)[8][7].
  • Retrieval Kalitesi. Standart bilgi erişimi metrikleri: Recall@K, Precision@K, MRR; multimodal için — modalitelere göre ayrı ayrı ve birleşik olarak.
  • Yanıt Kalitesi (uçtan uca). Otomatik faithfulness/groundedness metrikleri ve insan değerlendirmesi. Pratikte RAGAS/TruLens/DeepEval framework'leri kullanılır[16].
  • Benchmark'lar.
    • DocVQA: belge görüntülerine yönelik sorular[3].
    • TextVQA: görüntüler içindeki metni okumayı gerektiren sorular[4].
    • InfographicVQA: infografiklere yönelik sorular[17].
    • ChartQA: mantıksal çıkarım gerektiren diyagram soruları[18].
    • MMDocRAG: DocQA için multimodal RAG benchmark'ı (çok sayfalı belgeler, modaliteler arası kanıt zincirleri)[19].

Bileşenlerin Karşılaştırma Tablosu

MM‑RAG'daki Temel Bileşen ve Yaklaşımların Karşılaştırması
Bileşen Uygulama Seçenekleri Artıları Eksileri / Riskler Ne Zaman Tercih Edilmeli
OCR Tesseract / PaddleOCR / bulut API'leri Yerel — gizlilik ve kontrol; bulut — kutudan çıkar çıkmaz yüksek doğruluk. Karmaşık düzende hatalar; API — maliyet ve uyumluluk gereksinimleri. Özel veriler — yerel OCR; maksimum doğruluk — bulut (uygunsa).
Düzen Analizi Kural tabanlı / ML modeli (LayoutLM, LayoutParser) Kurallar tek tip şablonlar için basittir; ML — çeşitliliğe karşı dayanıklıdır. Kurallar yeni düzenlerde çöker; ML kaynak/veri gerektirir. Tek tip formlar — kurallar; heterojen korpus — ML.
Vektörleştirme (görüntü) CLIP / SigLIP / OCR‑free açıklamalar (Donut/Pix2Struct) Ortak text↔image gizli uzay (CLIP/SigLIP); OCR‑free, OCR bağımlılığını ortadan kaldırır. CLIP görüntü içindeki metni okuyamaz; açıklamalar anlamı bozabilir. CLIP/SigLIP — temel multimodal arama; karmaşık kalitedeki taramalar için OCR‑free.
Sonuç Birleştirme Puana göre sıralama / modalite kotaları / LLM‑reranker Reranker, bağlam seçim doğruluğunu belirgin biçimde artırır. Gecikme ve maliyet artışı. Yüksek hassasiyet gerektiren senaryolar; PoC için basit yöntemler.
Depolama/İndeks Tek vektör / çok vektör (text+image) / hibrit (BM25+vektör) Çok vektör, bir nesnenin farklı temsillerini kapsar; hibrit, anahtar kelimeler/kodları kurtarır. Şema ve güncellemelerin karmaşıklaşması. Karışık verili ve katı SLA'lı üretim sistemleri.

Pratik Notlar

  • Hibrit arama (BM25 + vektör) — özel terimler/kodlarda kapsamı ve hassasiyeti artırmak için fiili standarttır[20].
  • Cross-encoder/LLM ile yeniden sıralama, üretimden önce "gereksiz" adayları eleyerek token tasarrufu sağlar[13].
  • Modern VLM retriever'ları (örn. ColPali), sayfa görüntülerini doğrudan indeksleyerek görsel açıdan zengin belgelerde avantaj sağlar[21].

Ayrıca bakınız

  • Retrieval-Augmented Generation
  • Vektör veritabanı
  • Embedding
  • GraphRAG

Kaynakça

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

Notlar

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.