MM-RAG (Multimodal RAG) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

MM-RAG (англ. Multimodal Retrieval-Augmented Generation) — това е разширение на класическата парадигма RAG, при което LLM използват за отговор не само текст, но и визуални данни (изображения, схеми, таблици, графики). Мултимодалният retrieval позволява намиране и свързване на доказателства в различни представления, намалявайки риска от халюцинации чрез опора на външни източници с точна привързаност към фрагменти от страници и области (bounding boxes)[1][2].

MM-RAG е особено полезен за документи, в които съществена част от смисъла е представена в нетекстова форма (оформление на страницата, диаграми, структури на таблици). В такива случаи класическият текстов RAG често губи важни елементи от контекста[3][4].

Контекст и решаван проблем

Класическият RAG оперира с текстови пасажи и не вижда визуалните структури (наредба на елементите, надписи към фигури, оси на графики). MM-RAG затваря тези пропуски: извлича структурирани елементи (текст, таблици, изображения с координати), индексира ги в векторно пространство и комбинира доказателства от различни модалности[5][6].

Архитектура на MM-RAG

Конвейерът на MM-RAG добавя към класическия RAG етапи за обработка на визуални данни и изравняване на модалности: ingest → индексиране → мултимодален retrieval → сливане и reranking → генериране с трасиране.

  1. Събиране и предварителна обработка (Ingestion). На входа постъпват PDF/сканове/изображения. Изпълняват се OCR и анализ на оформлението на страницата за обособяване на зони: абзаци, заглавия, таблици, изображения и техните координати. Типични средства — модели от семейството LayoutLM и инструментални библиотеки LayoutParser; валидацията и обучението често разчитат на dataset-и PubLayNet и DocLayNet[7][8][9].
  2. Сегментиране на региони. Извличат се визуални обекти (диаграми, таблици, илюстрации, надписи). За по-висока устойчивост се прилагат OCR‑free модели (напр. Donut) или комбинирани pipeline-и OCR+VLM[10].
  3. Индексиране (Vector Index). Текстовите chunk-ове и визуалните елементи (изображения или техните описания) се преобразуват в векторни представления и се записват в векторна БД. За обединено пространство text↔image се прилагат CLIP или SigLIP; за production са удобни мултимодални/мултивекторни индекси (един обект — няколко вектора)[6][11][12].
  4. Мултимодален retrieval и reranking. Изпълнява се комбинация от текстово и визуално търсене; кандидатите (абзаци, таблици, изображения/региони) се обединяват и се rerank-ват с по-„тежък" модел (кросс‑енкодер/LLM‑reranker) за повишаване на точността[13].
  5. Опаковане на контекста и генериране. Избраните фрагменти се подават в LLM/VLM. Ако моделът е мултимодален (напр. GPT‑4V/4o), изображенията могат да се подават директно; при текстов LLM изображенията предварително се конвертират в подробни описания[14][15].
  6. Трасиране и цитиране. Отговорът се придружава от кликаеми цитати, обвързани не само с документа/страницата, но и с региона (координатите). Това повишава нивото на grounding и доверието на потребителите[2].

Оценка на качеството и метрики

Ефективността на MM‑RAG се оценява на нивата на извличане, retrieval и генериране.

  • Качество на извличане на визуалните данни. Точност на OCR (WER/CER), качество на анализа на оформлението (mAP/Precision/Recall) върху набори DocLayNet/PubLayNet[8][7].
  • Качество на retrieval. Стандартни метрики за информационно търсене: Recall@K, Precision@K, MRR; за мултимодалност — поотделно по модалности и в обединение.
  • Качество на отговора (end‑to‑end). Автоматични метрики faithfulness/groundedness и човешка оценка. На практика се прилагат фреймворките RAGAS/TruLens/DeepEval[16].
  • Benchmark-и.
    • DocVQA: въпроси към изображения на документи[3].
    • TextVQA: въпроси, изискващи четене на текст от изображения[4].
    • InfographicVQA: въпроси по инфографики[17].
    • ChartQA: въпроси по диаграми с изискване за логически разсъждения[18].
    • MMDocRAG: benchmark за мултимодален RAG при DocQA (многостранични документи, крос‑модални вериги от доказателства)[19].

Сравнителна таблица на компонентите

Сравнение на ключови компоненти и подходи в MM‑RAG
Компонент Варианти на реализация Предимства Недостатъци / рискове Кога да се избира
OCR Tesseract / PaddleOCR / облачни API Локалните — поверителност и контрол; облачните — висока точност „от кутията". Грешки при сложно оформление; API — цена и изисквания за съответствие. Поверителни данни — локален OCR; максимална точност — облак (ако е допустимо).
Анализ на оформлението Правила / ML‑модел (LayoutLM, LayoutParser) Правилата са прости за еднотипни шаблони; ML — устойчив на разнообразие. Правилата се чупят при нови оформления; ML изисква ресурси/данни. Еднотипни бланки — правила; разнороден корпус — ML.
Векторизация (изобр.) CLIP / SigLIP / OCR‑free описания (Donut/Pix2Struct) Обща латентна зона text↔image (CLIP/SigLIP); OCR‑free премахва зависимостта от OCR. CLIP не чете текст вътре в изображенията; описанията могат да изкривяват смисъла. CLIP/SigLIP — основно мултимодално търсене; OCR‑free за сканове со сложно качество.
Сливане на резултати Сортиране по score / квоти по модалности / LLM‑reranker Reranker-ът значително повишава точността на избора на контекст. Увеличаване на закъснението и разходите. High‑precision сценарии; прости методи — за PoC.
Хранилище/индекс Един вектор / мултивектор (text+image) / хибрид (BM25+vector) Мултивекторът покрива различни представления на един обект; хибридът спасява ключови думи/кодове. Усложняване на схемата и обновяванията. Производствени системи със смесени данни и строги SLA.

Практически бележки

  • Хибридно търсене (BM25 + вектор) — де‑факто стандарт за повишаване на пълнотата и точността при специфични термини/кодове[20].
  • Reranking с кросс‑енкодер/LLM икономи токени, отхвърляйки „боклучните" кандидати преди генерирането[13].
  • Съвременните VLM‑retriever-и (напр. ColPali) показват предимства при визуално богати документи благодарение на директно индексиране на страници‑изображения[21].

Литература

  • Lewis, P. et al. (2020). Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  • Gao, L. et al. (2023). Precise Zero‑Shot Dense Retrieval without Relevance Labels (HyDE). ACL 2023. arXiv:2212.10496.
  • Mei, L., Mo, S., Yang, Z., Chen, C. (2025). A Survey of Multimodal Retrieval‑Augmented Generation. arXiv:2504.08748.
  • Abootorabi, M.M. et al. (2025). Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval‑Augmented Generation. Findings of ACL 2025. ACL Anthology.
  • Yu, S. et al. (2024). VisRAG: Vision‑based Retrieval‑augmented Generation on Multi‑modality Documents. arXiv:2410.10594.
  • Cho, J. et al. (2024). M3DocRAG: Multi‑modal Retrieval is What You Need for Multi‑document QA. arXiv:2411.04952.
  • Tanaka, R. et al. (2025). VDocRAG: Retrieval‑Augmented Generation over Visually‑Rich Documents. CVPR 2025. arXiv:2504.09795 • CVF Open Access.
  • Dong, K. et al. (2025). MMDocRAG: Benchmarking Retrieval‑Augmented Multimodal Generation for Document Question Answering. arXiv:2505.16470.
  • Wasserman, N. et al. (2025). REAL‑MM‑RAG: A Real‑World Multi‑Modal Retrieval Benchmark. arXiv:2502.12342.
  • Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision Language Models. arXiv:2407.01449.
  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML 2021. arXiv:2103.00020.
  • Tschannen, M. et al. (2025). SigLIP 2: Multilingual Vision‑Language Encoders with Improved Semantic Understanding, Localization, and Dense Features. arXiv:2502.14786.
  • Xu, Y. et al. (2020). LayoutLM: Pre‑training of Text and Layout for Document Image Understanding. KDD 2020. DOI • arXiv:1912.13318.
  • Huang, Y. et al. (2022). LayoutLMv3: Pre‑training for Document AI with Unified Text and Image Masking. arXiv:2204.08387.
  • Zhong, X., Tang, J., Jimeno‑Yepes, A.J. (2019). PubLayNet: Largest Dataset Ever for Document Layout Analysis. arXiv:1908.07836.
  • Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. arXiv:2206.01062.
  • Kim, G. et al. (2021). OCR‑free Document Understanding Transformer (Donut). arXiv:2111.15664.
  • Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for Deep Learning Based Document Image Analysis. arXiv:2103.15348.
  • Singh, A. et al. (2019). Towards VQA Models That Can Read (TextVQA). CVPR 2019. arXiv:1904.08920.
  • Mathew, M. et al. (2021/2022). DocVQA / InfographicVQA: Datasets for VQA on Document Images and Infographics. WACV 2021 / WACV 2022. CVF • arXiv:2104.12756.
  • Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. Findings of ACL 2022. ACL • arXiv:2203.10244.
  • Liu, F. et al. (2022). DePlot: One‑shot Visual Language Reasoning by Plot‑to‑Table Translation. arXiv:2212.10505.
  • Wang, P. et al. (2024). Qwen2‑VL: Enhancing Vision‑Language Model's Capabilities in OCR and Chart QA. arXiv:2409.12191.
  • Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval‑Augmented Generation. arXiv:2309.15217.

Вижте също

  • Retrieval-Augmented Generation
  • Векторна база данни
  • Embedding
  • GraphRAG

Бележки

  1. Lewis, P., Perez, E., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS. arXiv:2005.11401.
  2. 2.0 2.1 Yu, S. et al. (2024). VisRAG: Vision-based Retrieval-Augmented Generation on Multi-modality Documents. arXiv:2407.06437.
  3. 3.0 3.1 Mathew, M. et al. (2021). DocVQA: A Dataset for VQA on Document Images. WACV. arXiv:2007.00398.
  4. 4.0 4.1 Singh, A. et al. (2019). TextVQA: Towards VQA Models That Can Read. CVPR. arXiv:1904.08920.
  5. Xu, Y. et al. (2020). LayoutLM: Pre-training of Text and Layout for Document Image Understanding. KDD. DOI.
  6. 6.0 6.1 Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ICML. arXiv:2103.00020.
  7. 7.0 7.1 Zhong, X., Tang, J., Yepes, A. J. (2019). PubLayNet: Largest Dataset for Document Layout Analysis. ICDAR. arXiv:1908.07836.
  8. 8.0 8.1 Pfitzmann, B. et al. (2022). DocLayNet: A Large Human‑Annotated Dataset for Document‑Layout Analysis. KDD. DOI / arXiv:2206.01062.
  9. Shen, Z. et al. (2021). LayoutParser: A Unified Toolkit for DL‑based Document Image Analysis. arXiv:2103.15348.
  10. Kim, G. et al. (2021). Donut: OCR‑free Document Understanding Transformer. arXiv:2111.15664.
  11. Zhai, X. et al. (2023). Sigmoid Loss for Language‑Image Pre‑Training (SigLIP). ICCV. arXiv:2303.15343.
  12. Milvus Docs. Multi‑Vector Hybrid Search. milvus.io/docs/multi-vector-search.md.
  13. 13.0 13.1 Cohere Docs. Rerank API. docs.cohere.com/reference/rerank.
  14. OpenAI. GPT‑4V(ision) System Card. (2023). PDF.
  15. OpenAI. Hello GPT‑4o. (2024). openai.com/index/hello-gpt-4o/.
  16. Es, S. et al. (2023). RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217.
  17. Mathew, M. et al. (2021). InfographicVQA: Understanding Infographics via Question Answering. ICDAR. arXiv:2104.12756.
  18. Masry, A. et al. (2022). ChartQA: A Benchmark for Question Answering about Charts. ACL (Findings). arXiv:2103.16435.
  19. Dong, K. et al. (2025). Benchmarking Retrieval‑Augmented Multimodal Generation for Document QA (MMDocRAG). arXiv:2505.16470.
  20. Weaviate Docs. Hybrid search. docs.weaviate.io/.../hybrid-search.
  21. Faysse, M. et al. (2024). ColPali: Efficient Document Retrieval with Vision‑Language Models. arXiv:2407.01449.