Multimodal CoT Prompting (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Мултимодален промптинг с верига от разсъждения (Multimodal Chain-of-Thought Prompting, MCoT) — това е разширение на метода верига от разсъждения (CoT) към задачи, включващи няколко типа данни (модалности). В MCoT-моделите езикът и другите модалности, като зрение или анализ на таблични данни, участват в единен процес на стъпково извеждане за решаване на сложни задачи[1].

Този подход възникна с развитието на мултимодалните големи езикови модели (MLLM), способни едновременно да обработват текст, изображения, аудио и видео. MCoT позволява на моделите да генерират интерпретируеми, стъпкови обяснения, обединяващи информация от различни източници, което повишава точността и прозрачността на тяхната работа.

Предпоставки: от текстов към мултимодален CoT

Chain-of-Thought - Верига от разсъждения в текст

Първоначално методът Chain-of-Thought (CoT) беше предложен от изследователи на Google през 2022 година за текстови големи езикови модели (LLM)[2]. Идеята се състои в това да се обучи моделът да генерира последователност от междинни стъпки на разсъждение преди да даде окончателен отговор. Добавянето в промпта на примери за стъпково решение (few-shot prompting) значително подобри способността на LLM да решават задачи, изискващи аритметични, логически и здравословни разсъждения, и повиши общата точност и надеждност на моделите[2].

Преход към мултимодалност

Успехът на текстовия CoT стимулира опити да се разпростре върху мултимодални сценарии. С появата на MLLM, като Kosmos-1 от Microsoft, които се обучават едновременно върху текст и изображения, възникна възможността да се интегрира CoT-логиката с мултимодалното възприятие[3]. Експериментите показаха, че такива модели могат да използват стъпкови разсъждения, отчитайки както текстови, така и визуални входни данни, което демонстрира принципната възможност за обединяване на логика и възприятие[3].

Основни подходи и методологии

От 2023 година насам бяха предложени редица методи за реализация на мултимодален CoT.

Двуетапен Multimodal-CoT (Zhang et al.)

Един от първите методи, предложен през 2023 година, използва двуетапна схема[4]:

  1. Генериране на обосновка: На първата стъпка моделът генерира текстова верига от разсъждения (rationale) въз основа на мултимодална информация (например текст и изображение).
  2. Формиране на отговор: На втората стъпка моделът дава окончателен отговор, опирайки се на генерираната обосновка.

Такъв разделен подход позволи на модел с по-малко от 1 млрд. параметра да постигне рекордно високо качество върху научния dataset ScienceQA, надминавайки дори големия модел GPT-3.5. Отбелязано беше и намаляване на халюцинациите[4].

Compositional CoT - Композиционен CoT

Представен на конференцията CVPR 2024, този метод се фокусира върху визуално-текстови задачи и предлага генериране на структурирано представяне на изображението като междинна стъпка[5]. Напред MLLM създава описание на сцената под формата на сценен граф, указвайки обектите и отношенията между тях. След това това структурирано описание се включва в промпта за финалния отговор. Такъв подход позволява на LLM по-задълбочено да отчита композиционните връзки между обектите и подобрява резултатите при задачи за описание на сложни сцени и визуален въпросно-отговорен анализ[5].

Duty-Distinct CoT - CoT с разделяне на отговорностите

Този метод, представен на NeurIPS 2023, предлага да се раздели отговорността между различни компоненти на системата[6]:

  • Езиковият модел отговаря за логическото разсъждение и интеграцията на информацията.
  • Визуалната подсистема (модел за компютърно зрение) отговаря за разпознаването на съдържанието на изображението.

Такъв „двоичен промптинг" осигурява „критично мислене": LLM оценява и използва визуалната информация, получена от специализирания зрителен модул. Подходът DDCoT позволи генерирането на по-общи и обясними разсъждения и съществено повиши точността при задачи за мултимодален научен QA[6].

Други варианти на MCoT

Активно се разработват и други подходи, адаптирани към конкретни модалности:

  • Dual CoT: Схема на паралелно двупосочно разсъждение.
  • Audio-CoT: Адаптация на веригата от мисли за задачи, свързани с аудио и реч.
  • Video-of-Thought: Техника за стъпков анализ на видеоданни[1].

Приложение и резултати

Мултимодалният CoT-промптинг демонстрира ефективност в множество области, където се изисква обединяване на разнородна информация.

  • Образование и научен QA: Позволява на системите да отговарят на въпроси с диаграми и илюстрации, предоставяйки разгърнато обяснение на решението (например върху dataset-а ScienceQA)[4].
  • Автономно шофиране и роботика: Помага за последователното интерпретиране на данни от лидари, сензори и камери, подобрявайки разбирането на сцената и вземането на решения от агентите.
  • Embodied AI: Осигурява по-надеждно планиране на действията за системи, взаимодействащи с физическия свят, въз основа на визуални и текстови подсказки.
  • Медицина и здравеопазване: Съчетаването на медицински изображения (например рентгенови снимки) с текстови описания повишава точността на диагностиката и обяснимостта на изводите на ИИ[1].

Проблеми и перспективи

Въпреки значителния напредък, мултимодалното използване на CoT остава сложен изследователски проблем.

  • Недостиг на анотирани данни: За обучението на модели да генерират коректни мултимодални разсъждения са необходими големи набори от данни с подробни пояснения, чието получаване е трудоемко.
  • Гъвкавост и обобщаемост: Методи, настроени за един тип задачи (например текст + изображение), могат да се пренасят лошо към други комбинации от модалности.
  • Оптимална интеграция: Остава открит въпросът как най-добре да се интегрират различните модалности в единен процес на разсъждение, така че той действително да усилва разбирането на модела, а не просто да удължава отговора.
  • Стандартизация и оценка: Съществува необходимост от разработване на стандартизирани benchmark-и за обективна оценка и сравнение на различните MCoT-подходи[6].

За постигането на мултимодален ИИ, близък до общоинтелектуалните възможности, са необходими допълнителни иновации в методите MCoT, отчитащи спецификата на възприятието на света чрез различни сензори[1].

Препратки

  • Преглед на Multimodal CoT в Prompting Guide
  • «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — подробен научен преглед

Литература

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

Бележки

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]