MM-RAG (Multimodal RAG) (HU)
MM-RAG (angol: Multimodal Retrieval-Augmented Generation) — a klasszikus RAG paradigma kiterjesztése, amelyben az LLM-ek a válaszadáshoz nemcsak szöveget, hanem vizuális adatokat is felhasználnak (képek, sémák, táblázatok, grafikonok). A multimodális retrieval lehetővé teszi a bizonyítékok megtalálását és összekapcsolását különböző reprezentációkban, csökkentve a hallucinációk kockázatát azáltal, hogy külső forrásokra támaszkodik, pontos oldaltöredékekhez és régiókhoz kötve (bounding boxes)[1][2].
Az MM-RAG különösen hasznos olyan dokumentumoknál, ahol a jelentés lényeges része nem szöveges formában jelenik meg (oldal elrendezése, diagramok, táblázatszerkezetek). Ilyen esetekben a klasszikus szöveges RAG gyakran elveszíti a fontos kontextuális elemeket[3][4].
Kontextus és a megoldandó probléma
A klasszikus RAG szöveges passzusokkal dolgozik, és nem látja a vizuális struktúrákat (elemek elrendezése, ábrafeliratok, grafikontengelyek). Az MM-RAG ezeket a hiányosságokat pótolja: strukturált elemeket von ki (szöveg, táblázatok, koordinátákkal ellátott képek), vektortérbe indexeli azokat, és különböző modalitásokból kombinálja a bizonyítékokat[5][6].
MM-RAG architektúra
Az MM-RAG pipeline a klasszikus RAG-hoz képest vizuálisadat-feldolgozási és modalitásigazítási lépéseket ad hozzá: betöltés → indexelés → multimodális retrieval → összevonás és reranking → generálás nyomkövetéssel.
- Adatgyűjtés és előfeldolgozás (Ingestion). Bemenetként PDF/szkennelt dokumentumok/képek érkeznek. OCR és az oldal elrendezéselemzése hajtódik végre a zónák elkülönítésére: bekezdések, fejlécek, táblázatok, képek és koordinátáik. Tipikus eszközök — a LayoutLM modellcsalád és a LayoutParser eszközkészlet; a validáció és a tanítás gyakran a PubLayNet és DocLayNet datasetekre támaszkodik[7][8][9].
- Régiókra szegmentálás. Vizuális objektumok kerülnek kinyerésre (diagramok, táblázatok, illusztrációk, feliratok). A fokozott robusztusság érdekében OCR-free modellek (pl. Donut) vagy kombinált OCR+VLM pipeline-ok alkalmazhatók[10].
- Indexelés (Vector Index). A szöveges chunkok és a vizuális elemek (képek vagy leírásaik) vektoros reprezentációvá alakulnak, és vektoros adatbázisba kerülnek. Az egységesített text↔image térhez CLIP vagy SigLIP alkalmazható; produkciós környezetben kényelmesek a multimodális/multivektoros indexek (egy objektum — több vektor)[6][11][12].
- Multimodális retrieval és reranking. Szöveges és vizuális keresés kombinációja hajtódik végre; a jelöltek (bekezdések, táblázatok, képek/régiók) összevonásra és egy „nehezebb" modellel (kereszt-enkóder/LLM-reranker) újrarangsorolásra kerülnek a pontosság növelése érdekében[13].
- Kontextus csomagolása és generálás. A kiválasztott töredékeket az LLM/VLM kapja meg. Ha a modell multimodális (pl. GPT-4V/4o), a képek közvetlenül átadhatók; szöveges LLM esetén a képek előzetesen részletes leírásokká konvertálódnak[14][15].
- Nyomkövetés és idézés. A válasz kattintható idézetekkel egészül ki, amelyek nemcsak a dokumentumhoz/oldalhoz, hanem a régióhoz (koordinátákhoz) is kötöttek. Ez növeli a grounding szintjét és a felhasználók bizalmát[2].
Minőségértékelés és metrikák
Az MM-RAG hatékonysága a kinyerés, a retrieval és a generálás szintjén értékelhető.
- Vizuálisadat-kinyerés minősége. OCR pontosság (WER/CER), elrendezéselemzés minősége (mAP/Precision/Recall) a DocLayNet/PubLayNet készleteken[8][7].
- Retrieval minősége. Szabványos információ-visszakeresési metrikák: Recall@K, Precision@K, MRR; multimodalitásnál — modalitásonként külön és összesítve.
- Válasz minősége (end-to-end). Automatikus faithfulness/groundedness metrikák és emberi értékelés. A gyakorlatban RAGAS/TruLens/DeepEval keretrendszerek kerülnek alkalmazásra[16].
- Benchmarkok.
- DocVQA: dokumentumképekhez kapcsolódó kérdések[3].
- TextVQA: képeken lévő szöveg olvasását igénylő kérdések[4].
- InfographicVQA: infografikákhoz kapcsolódó kérdések[17].
- ChartQA: diagramokhoz kapcsolódó, logikai következtetést igénylő kérdések[18].
- MMDocRAG: multimodális RAG benchmark DocQA-hoz (többoldalas dokumentumok, kereszt-modális bizonyítékláncok)[19].
Összetevők összehasonlító táblázata
| Összetevő | Megvalósítási változatok | Előnyök | Hátrányok / kockázatok | Mikor válasszuk |
|---|---|---|---|---|
| OCR | Tesseract / PaddleOCR / felhőalapú API | Helyi megoldások — adatvédelem és kontroll; felhőalapúak — magas pontosság „dobozból\". | Hibák összetett elrendezésnél; API — költség és megfelelőségi követelmények. | Bizalmas adatoknál — helyi OCR; maximális pontossághoz — felhő (ha megengedett). |
| Elrendezéselemzés | Szabályok / ML-modell (LayoutLM, LayoutParser) | A szabályok egyszerűek egységes sablonokhoz; ML — robusztus a változatossággal szemben. | A szabályok új elrendezéseknél meghibásodnak; az ML erőforrásokat/adatokat igényel. | Egységes nyomtatványokhoz — szabályok; heterogén korpuszhoz — ML. |
| Vektorizáció (képek) | CLIP / SigLIP / OCR-free leírások (Donut/Pix2Struct) | Közös látens text↔image tér (CLIP/SigLIP); OCR-free megszünteti az OCR-függőséget. | A CLIP nem olvassa a képeken belüli szöveget; a leírások torzíthatják a jelentést. | CLIP/SigLIP — alapszintű multimodális keresés; OCR-free összetett minőségű szkennekhez. |
| Eredmények összevonása | Pontszám szerinti rendezés / modalitásonkénti kvóták / LLM-reranker | A reranker érezhetően növeli a kontextusválasztás pontosságát. | Megnövekedett késleltetés és költség. | Nagy pontosságot igénylő forgatókönyvek; egyszerű módszerek — PoC-hoz. |
| Tárolás/index | Egyvektoros / multivektoros (text+image) / hibrid (BM25+vektor) | A multivektor lefödi egy objektum különböző reprezentációit; a hibrid megmenti a kulcsszavakat/kódokat. | A séma és a frissítések bonyolultabbá válnak. | Vegyes adatokkal és szigorú SLA-val rendelkező produkciós rendszerek. |
Gyakorlati megjegyzések
- Hibrid keresés (BM25 + vektor) — de facto szabvány a teljességi és pontossági mutatók javítására specifikus kifejezések/kódok esetén[20].
- Reranking kereszt-enkóderrel/LLM-mel tokent takarít meg azáltal, hogy a generálás előtt elveti a „szemét\" jelölteket[13].
- Modern VLM-retrieverek (pl. ColPali) vizuálisan gazdag dokumentumokon előnyöket mutatnak az oldalképek közvetlen indexelése révén[21].
Irodalom
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- Gao, L. et al. (2023). Precise Zero-Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
- Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval-Augmented Generation. arXiv:2504.08748.
- Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation. Findings of ACL 2025. ACL Anthology.
- Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents. arXiv:2410.10594.
- Cho, J. et al. (2024). M3DocRAG: Multi-modal Retrieval is What You Need for Multi-document QA. arXiv:2411.04952.
- Tanaka, R. et al. (2025). VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
- Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
- Wasserman, N. et al. (2025). REAL-MM-RAG: A Real-World Multi-Modal Retrieval Benchmark. arXiv:2502.12342.
- Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
- Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
- Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
- Huang, Y. et al. (2022). LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
- Zhong, X., Tang, J., Jimeno-Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
- Pfitzmann, B. et al. (2022). DocLayNet: A Large Human-Annotated Dataset for Document-Layout Analysis. arXiv:2206.01062.
- Kim, G. et al. (2021). OCR-free Document Understanding Transformer (Donut). arXiv:2111.15664.
- Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
- Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
- Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
- Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
- Liu, F. et al. (2022). DePlot: One-shot Visual Language Reasoning by Plot-to-Table Translation. arXiv:2212.10505.
- Wang, P. et al. (2024). Qwen2-VL: Enhancing Vision-Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
- Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval-Augmented Generation. arXiv:2309.15217.
Lásd még
- Retrieval-Augmented Generation
- Vektoros adatbázis
- Embedding
- GraphRAG
Jegyzetek
- ↑ Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
- ↑ 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
- ↑ 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
- ↑ 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
- ↑ Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
- ↑ 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
- ↑ 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
- ↑ 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
- ↑ Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
- ↑ Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
- ↑ Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
- ↑ Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
- ↑ 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
- ↑ OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
- ↑ OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
- ↑ Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
- ↑ Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
- ↑ Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
- ↑ Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
- ↑ Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
- ↑ Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.