MM-RAG (Multimodal RAG) (EL)
MM-RAG (αγγλ. Multimodal Retrieval-Augmented Generation) — είναι επέκταση του κλασικού παραδείγματος RAG, στο οποίο τα LLM χρησιμοποιούν για απάντηση όχι μόνο κείμενο, αλλά και οπτικά δεδομένα (εικόνες, διαγράμματα, πίνακες, γραφήματα). Το πολυτροπικό retrieval επιτρέπει την εύρεση και σύνδεση αποδείξεων σε διαφορετικές αναπαραστάσεις, μειώνοντας τον κίνδυνο παραισθήσεων μέσω της στήριξης σε εξωτερικές πηγές με ακριβή αντιστοίχιση σε τμήματα σελίδων και περιοχές (bounding boxes)[1][2].
Το MM-RAG είναι ιδιαίτερα χρήσιμο για έγγραφα όπου σημαντικό μέρος του νοήματος παρουσιάζεται σε μη κειμενική μορφή (διάταξη σελίδας, διαγράμματα, δομές πινάκων). Σε τέτοιες περιπτώσεις, το κλασικό κειμενικό RAG συχνά χάνει σημαντικά στοιχεία πλαισίου[3][4].
Πλαίσιο και το πρόβλημα που επιλύεται
Το κλασικό RAG λειτουργεί με κειμενικά αποσπάσματα και δεν αντιλαμβάνεται οπτικές δομές (διάταξη στοιχείων, λεζάντες εικόνων, άξονες γραφημάτων). Το MM-RAG καλύπτει αυτά τα κενά: εξάγει δομημένα στοιχεία (κείμενο, πίνακες, εικόνες με συντεταγμένες), τα ευρετηριάζει σε διανυσματικό χώρο και συνδυάζει αποδείξεις από διαφορετικές τροπικότητες[5][6].
Αρχιτεκτονική MM-RAG
Η αλυσίδα επεξεργασίας MM-RAG προσθέτει στο κλασικό RAG στάδια επεξεργασίας οπτικών δεδομένων και ευθυγράμμισης τροπικοτήτων: ingestion → ευρετηρίαση → πολυτροπικό retrieval → συγχώνευση και reranking → δημιουργία με 추跡ευσιμότητα.
- Συλλογή και προεπεξεργασία (Ingestion). Ως είσοδος λαμβάνονται PDF/σαρώσεις/εικόνες. Εκτελούνται OCR και ανάλυση διάταξης σελίδας για την εξαγωγή ζωνών: παράγραφοι, επικεφαλίδες, πίνακες, εικόνες και οι συντεταγμένες τους. Τυπικά εργαλεία — μοντέλα της οικογένειας LayoutLM και βιβλιοθήκες LayoutParser· η επικύρωση και εκπαίδευση συχνά βασίζονται στα dataset PubLayNet και DocLayNet[7][8][9].
- Τμηματοποίηση σε περιοχές. Εξάγονται οπτικά αντικείμενα (διαγράμματα, πίνακες, εικονογραφήσεις, λεζάντες). Για αυξημένη ανθεκτικότητα χρησιμοποιούνται μοντέλα χωρίς OCR (π.χ. Donut) ή συνδυαστικές αλυσίδες OCR+VLM[10].
- Ευρετηρίαση (Vector Index). Τα κειμενικά chunks και τα οπτικά στοιχεία (εικόνες ή περιγραφές τους) μετατρέπονται σε διανυσματικές αναπαραστάσεις και καταχωρούνται σε διανυσματική βάση δεδομένων. Για τον ενοποιημένο χώρο text↔image χρησιμοποιούνται CLIP ή SigLIP· για παραγωγικά περιβάλλοντα είναι βολικά πολυτροπικά/πολυδιανυσματικά ευρετήρια (ένα αντικείμενο — πολλά διανύσματα)[6][11][12].
- Πολυτροπικό retrieval και reranking. Εκτελείται συνδυασμός κειμενικής και οπτικής αναζήτησης· οι υποψήφιοι (παράγραφοι, πίνακες, εικόνες/περιοχές) συγχωνεύονται και επαναταξινομούνται από ένα πιο «βαρύ» μοντέλο (cross-encoder/LLM-reranker) για αύξηση ακρίβειας[13].
- Συσκευασία πλαισίου και δημιουργία. Τα επιλεγμένα τμήματα τροφοδοτούνται στο LLM/VLM. Αν το μοντέλο είναι πολυτροπικό (π.χ. GPT-4V/4o), οι εικόνες μπορούν να τροφοδοτηθούν απευθείας· με κειμενικό LLM οι εικόνες μετατρέπονται εκ των προτέρων σε λεπτομερείς περιγραφές[14][15].
- Ανιχνευσιμότητα και παραπομπές. Η απάντηση συνοδεύεται από κλικ able παραπομπές με αντιστοίχιση όχι μόνο στο έγγραφο/σελίδα, αλλά και στην περιοχή (συντεταγμένες). Αυτό αυξάνει το επίπεδο grounding και την εμπιστοσύνη των χρηστών[2].
Αξιολόγηση ποιότητας και μετρικές
Η αποδοτικότητα του MM-RAG αξιολογείται στα επίπεδα εξαγωγής, retrieval και δημιουργίας.
- Ποιότητα εξαγωγής οπτικών δεδομένων. Ακρίβεια OCR (WER/CER), ποιότητα ανάλυσης διάταξης (mAP/Precision/Recall) στα σύνολα DocLayNet/PubLayNet[8][7].
- Ποιότητα retrieval. Τυπικές μετρικές ανάκτησης πληροφοριών: Recall@K, Precision@K, MRR· για πολυτροπικότητα — ξεχωριστά ανά τροπικότητα και συνδυαστικά.
- Ποιότητα απάντησης (end-to-end). Αυτόματες μετρικές faithfulness/groundedness και ανθρώπινη αξιολόγηση. Στην πράξη χρησιμοποιούνται τα frameworks RAGAS/TruLens/DeepEval[16].
- Benchmarks.
- DocVQA: ερωτήσεις σε εικόνες εγγράφων[3].
- TextVQA: ερωτήσεις που απαιτούν ανάγνωση κειμένου σε εικόνες[4].
- InfographicVQA: ερωτήσεις σε infographics[17].
- ChartQA: ερωτήσεις σε διαγράμματα με απαίτηση λογικής συλλογιστικής[18].
- MMDocRAG: benchmark πολυτροπικού RAG για DocQA (πολυσέλιδα έγγραφα, διατροπικές αλυσίδες αποδείξεων)[19].
Συγκριτικός πίνακας συνιστωσών
| Συνιστώσα | Παραλλαγές υλοποίησης | Πλεονεκτήματα | Μειονεκτήματα / κίνδυνοι | Πότε να επιλέγεται |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / cloud API | Τοπικά — απόρρητο και έλεγχος· cloud — υψηλή ακρίβεια «out of the box». | Σφάλματα σε πολύπλοκη διάταξη· API — κόστος και απαιτήσεις συμμόρφωσης. | Ιδιωτικά δεδομένα — τοπικό OCR· μέγιστη ακρίβεια — cloud (αν επιτρέπεται). |
| Ανάλυση διάταξης | Κανόνες / μοντέλο ML (LayoutLM, LayoutParser) | Οι κανόνες είναι απλοί για ομοιόμορφα πρότυπα· ML — ανθεκτικό στην ποικιλομορφία. | Οι κανόνες αποτυγχάνουν σε νέες διατάξεις· ML απαιτεί πόρους/δεδομένα. | Ομοιόμορφες φόρμες — κανόνες· ετερογενές corpus — ML. |
| Διανυσματοποίηση (εικόν.) | CLIP / SigLIP / περιγραφές χωρίς OCR (Donut/Pix2Struct) | Κοινός λανθάνων χώρος text↔image (CLIP/SigLIP)· χωρίς OCR εξαλείφεται η εξάρτηση από OCR. | Το CLIP δεν διαβάζει κείμενο εντός εικόνων· οι περιγραφές μπορεί να παραμορφώνουν το νόημα. | CLIP/SigLIP — βασική πολυτροπική αναζήτηση· χωρίς OCR για σαρώσεις σύνθετης ποιότητας. |
| Συγχώνευση αποτελεσμάτων | Ταξινόμηση κατά score / ποσοστώσεις ανά τροπικότητα / LLM-reranker | Ο reranker αυξάνει αισθητά την ακρίβεια επιλογής πλαισίου. | Αύξηση καθυστέρησης και κόστους. | Σενάρια υψηλής ακρίβειας· απλές μέθοδοι — για PoC. |
| Αποθήκευση/ευρετήριο | Ένα διάνυσμα / πολλά διανύσματα (text+image) / υβριδικό (BM25+vector) | Τα πολλαπλά διανύσματα καλύπτουν διαφορετικές αναπαραστάσεις ενός αντικειμένου· το υβριδικό σώζει λέξεις-κλειδιά/κωδικούς. | Πολυπλοκότητα σχήματος και ενημερώσεων. | Παραγωγικά συστήματα με μικτά δεδομένα και αυστηρά SLA. |
Πρακτικές παρατηρήσεις
- Υβριδική αναζήτηση (BM25 + διάνυσμα) — de facto πρότυπο για αύξηση πληρότητας και ακρίβειας σε εξειδικευμένους όρους/κωδικούς[20].
- Reranking με cross-encoder/LLM εξοικονομεί tokens απορρίπτοντας «άχρηστους» υποψηφίους πριν τη δημιουργία[13].
- Σύγχρονοι VLM-retrievers (π.χ. ColPali) παρουσιάζουν πλεονεκτήματα σε οπτικά πλούσια έγγραφα χάρη στην άμεση ευρετηρίαση σελίδων-εικόνων[21].
Βιβλιογραφία
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero-Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval-Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi-modal Retrieval is What You Need for Multi-document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno-Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR-free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One-shot Visual Language Reasoning by Plot-to-Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2-VL: Enhancing Vision-Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval-Augmented Generation. arXiv:2309.15217.
Δείτε επίσης
- Retrieval-Augmented Generation
- Διανυσματική βάση δεδομένων
- Embedding
- GraphRAG
Παραπομπές
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.