---
title: "Мультимодальное рассуждение"
source: "https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5"
wiki: "systems-analysis.info/wiki"
article: "Мультимодальное_рассуждение"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 306
wiki_created_at: 2026-09-06T22:06:53Z
wiki_modified_at: 2026-09-06T22:06:53Z
downloaded_at: 2026-09-07T22:18:59Z
---

# Мультимодальное рассуждение

**Мультимодальное рассуждение** (англ. *Multimodal Reasoning*) — это способность искусственного интеллекта, в частности [больших языковых моделей (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели"), одновременно обрабатывать, интерпретировать и логически связывать информацию из различных типов данных (модальностей), таких как **текст, изображения, аудио** и **видео**, для решения сложных задач<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-survey_perception-1)</sup>. Этот процесс имитирует многогранное человеческое восприятие и является ключевым шагом на пути к созданию более универсального и адаптивного общего искусственного интеллекта (AGI)<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-ms_kosmos1-2)</sup>.

Модели, обладающие такой способностью, называют **[мультимодальными большими языковыми моделями](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM "Мультимодальные LLM")** (**MLLM** или LMRM — *Large Multimodal Reasoning Models*). Они расширяют возможности традиционных LLM, которые обучались только на тексте, позволяя им понимать содержимое изображений, анализировать видео, управлять роботами и вести диалог на основе визуальных данных.

## Эволюция подходов

Подходы к мультимодальному рассуждению прошли стремительную эволюцию от модульных систем к унифицированным, язык-центричным архитектурам.

- **Ранние системы**: Основывались на раздельных конвейерах, где отдельные компоненты обрабатывали зрение, другие — текст, а на финальном этапе их представления объединялись. Такой подход требовал тщательного проектирования под каждую конкретную задачу.
- **Современные системы**: Перешли к унифицированным, язык-центричным моделям. В них большая языковая модель выступает центральным звеном, или «движком» рассуждения, который обрабатывает информацию из всех модальностей в едином формате. Это стало возможным благодаря методам, которые "научили" языковую модель понимать визуальные и другие данные, представляя их в виде специальных [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен")<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-survey_perception-1)</sup>.

Важной вехой в этом переходе стала концепция **«[мультимодальной цепочки рассуждений](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting "Multimodal CoT Prompting")»** (*Multimodal Chain-of-Thought, MCoT*), где модель получает последовательность подсказок, которые поэтапно ведут её через логические шаги, задействующие разные модальности.

## Архитектуры мультимодальных LLM

Существуют две основные архитектурные стратегии для объединения различных модальностей с языковой моделью<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-raschka_understanding-3)</sup>:

### 1. Унифицированная архитектура на уровне токенов

В этом подходе все модальности преобразуются в общее представление, совместимое с LLM. Например, изображение разбивается на фрагменты (патчи), пропускается через визуальный энкодер (например, Vision Transformer (ViT)) и превращается в последовательность векторных эмбеддингов — **визуальных токенов**. Затем эти визуальные токены конкатенируются (объединяются) с текстовыми токенами и подаются на вход большой языковой модели, которая обрабатывает их единым потоком.

- **Преимущества**: Эта схема практически не требует изменений в [архитектуре LLM](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D1%8B_LLM "Архитектуры LLM") и легко масштабируется.
- **Примеры**: GPT-4 от OpenAI, **PaLM-E** от Google.

### 2. Архитектура с кросс-модальным вниманием

Здесь языковая модель и визуальный энкодер остаются раздельными подсистемами, но соединяются специальными слоями **кросс-модального внимания** (*cross-attention*). Эти слои позволяют текстовым и визуальным представлениям влиять друг на друга в процессе генерации. Модель как бы "подглядывает" в визуальные признаки на каждом шаге создания текстового ответа.

- **Преимущества**: Позволяет эффективно использовать мощь уже существующих, предварительно обученных и замороженных моделей (например, крупной LLM и мощного ViT), обучая только связующие слои.
- **Пример**: **Flamingo** от DeepMind.

В современных исследованиях унифицированные *[decoder-only](https://systems-analysis.info/wiki/Decoder-only "Decoder-only")* архитектуры стали доминирующими, так как они проще масштабируются и лучше используют возможности существующих LLM<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-raschka_understanding-3)</sup>.

## Ключевые модели и исследования

Развитие MLLM особенно ускорилось в 2022–2024 годах.

- **Flamingo (DeepMind, 2022)**: Одна из первых крупных визуально-языковых моделей (VLM), способная в режиме few-shot learning решать разнообразные мультимодальные задачи без дополнительной донастройки. Flamingo продемонстрировала, что единая модель может быстро адаптироваться к новым задачам, получив лишь несколько примеров в подсказке<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-deepmind_flamingo-4)</sup>.

<!-- -->

- **Kosmos-1 (Microsoft Research, 2023)**: Первая MLLM, обученная с нуля на веб-данных. Она способна воспринимать текст и изображения как «общие модальности» и показала сильные результаты в решении текстовых задач с изображениями (OCR), мультимодальном диалоге и даже в задачах на невербальное логическое мышление (матрицы Равена)<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-ms_kosmos1-2)</sup>.

<!-- -->

- **GPT-4 (OpenAI, 2023)**: Флагманская модель, позиционируемая как «большая мультимодальная модель», способная принимать на вход текст и изображения. Хотя её архитектура не раскрыта, известно, что она может анализировать содержимое картинок, описывать графики и пояснять визуальные мемы. Доступ к её мультимодальным возможностям был предоставлен ограниченно, например, в сотрудничестве с приложением BeMyEyes для помощи слепым и слабовидящим<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-openai_gpt4-5)</sup>.

<!-- -->

- **PaLM-E (Google, 2023)**: Так называемая «воплощенная» (*embodied*) мультимодальная модель, созданная для интеграции визуального восприятия с физическими действиями робота. PaLM-E способна генерировать пошаговые планы для управления роботами, получая на вход комбинацию изображений с камер и показаний датчиков. Это продемонстрировало эффект «положительного трансфера»: обучение на общих задачах "визуализация+язык" улучшило эффективность робототехнических навыков<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-google_palm-e-6)</sup>.

<!-- -->

- **[LLAMA](https://systems-analysis.info/wiki/LLaMA "LLaMA") 3.2 (Meta, 2024)**: Открытая серия моделей, в которой появились и мультимодальные версии. Их появление делает технологии MLLM доступными широкому исследовательскому сообществу для дальнейших экспериментов<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-raschka_understanding-3)</sup>.

## Проблемы и ограничения

Несмотря на впечатляющие достижения, MLLM сталкиваются с рядом серьёзных проблем:

- **[Галлюцинации](https://systems-analysis.info/wiki/%D0%93%D0%B0%D0%BB%D0%BB%D1%8E%D1%86%D0%B8%D0%BD%D0%B0%D1%86%D0%B8%D0%B8_%D0%B8_%D0%BD%D0%B5%D0%BA%D0%BE%D1%80%D1%80%D0%B5%D0%BA%D1%82%D0%BD%D1%8B%D0%B5_%D0%BE%D1%82%D0%B2%D0%B5%D1%82%D1%8B_LLM "Галлюцинации и некорректные ответы LLM")**: Как и их текстовые предки, MLLM могут генерировать убедительно звучащие, но фактически неверные утверждения. Визуальная информация не устраняет эту проблему, а иногда усложняет её, приводя к неверным интерпретациям изображений<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-acl_multimodal_kg-7)</sup>.
- **Обобщающая способность и глубина рассуждений**: Модели часто не умеют надёжно переносить выводы на новые типы данных (омни-модальное обобщение), а их рассуждения могут быть поверхностными. Они могут описать картинку, но провалиться, если задача требует многошагового планирования с учётом текста и изображения<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-survey_perception-1)</sup>.
- **Технические сложности**: Обучение MLLM требует огромных вычислительных ресурсов и больших, тщательно подготовленных мультимодальных датасетов. Оценка качества таких моделей также сложна, так как требует специальных бенчмарков, учитывающих и понимание, и рассуждение.

## Перспективы развития

Тренды показывают, что мультимодальные модели будут становиться всё более **«родными» мультимодальными** (*Native Large Multimodal Models*), то есть изначально спроектированными для работы со всеми модальностями. Конечная цель — создать **универсальный интеллект**, способный воспринимать и понимать мир так же богато, как человек. Для этого исследователи работают над уменьшением зависимости от размеченных данных, обучением моделей более абстрактному, причинно-следственному мышлению и обеспечением безопасного контроля за такими мощными системами. Развитие вспомогательных подходов, таких как **HuggingGPT** — где LLM выступает координатором, распределяющим задачи по моделям-экспертам, — также прокладывает путь к более надёжному мультимодальному ИИ<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_note-hugging_gpt-8)</sup>.

## См. также

- [Multimodal CoT Prompting](https://systems-analysis.info/wiki/Multimodal_CoT_Prompting "Multimodal CoT Prompting")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [Галлюцинации и некорректные ответы LLM](https://systems-analysis.info/wiki/%D0%93%D0%B0%D0%BB%D0%BB%D1%8E%D1%86%D0%B8%D0%BD%D0%B0%D1%86%D0%B8%D0%B8_%D0%B8_%D0%BD%D0%B5%D0%BA%D0%BE%D1%80%D1%80%D0%B5%D0%BA%D1%82%D0%BD%D1%8B%D0%B5_%D0%BE%D1%82%D0%B2%D0%B5%D1%82%D1%8B_LLM "Галлюцинации и некорректные ответы LLM")
- [Мультимодальные LLM](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D1%8B%D0%B5_LLM "Мультимодальные LLM")
- [Function Calling](https://systems-analysis.info/wiki/Function_Calling "Function Calling")

## Ссылки

- <a href="https://arxiv.org/html/2505.04921v1" class="external text" rel="nofollow">Обзорная статья: A Survey on Large Multimodal Reasoning Models (2025)</a>
- <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external text" rel="nofollow">Статья Себастьяна Рашки о понимании мультимодальных LLM</a>

## Литература

- Li, Y. et al. (2025). *Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models*. <a href="https://arxiv.org/abs/2505.04921" class="external text" rel="nofollow">arXiv:2505.04921</a>.
- Lee, J. et al. (2024). *Multimodal Reasoning with Multimodal Knowledge Graph*. <a href="https://aclanthology.org/2024.acl-long.579.pdf" class="external text" rel="nofollow">ACL 2024</a>.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models*. <a href="https://arxiv.org/abs/2302.14045" class="external text" rel="nofollow">arXiv:2302.14045</a>.
- Shen, Y. et al. (2023). *HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face*. <a href="https://arxiv.org/abs/2303.17580" class="external text" rel="nofollow">arXiv:2303.17580</a>.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- OpenAI (2023). *GPT-4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external text" rel="nofollow">arXiv:2303.08774</a>.
- Chen, X. et al. (2023). *PaLI-X: On Scaling Up a Multilingual Vision and Language Model*. <a href="https://arxiv.org/abs/2305.18565" class="external text" rel="nofollow">arXiv:2305.18565</a>.
- Alayrac, J-B. et al. (2022). *Flamingo: A Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Chen, X. et al. (2022). *PaLI: A Jointly-Scaled Multilingual Language-Image Model*. <a href="https://arxiv.org/abs/2209.06794" class="external text" rel="nofollow">arXiv:2209.06794</a>.
- Huang, S. et al. (2022). *Multimodal Chain-of-Thought Prompting in Large Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.

## Примечания

1.  <span id="cite_note-survey_perception-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-survey_perception_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-survey_perception_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-survey_perception_1-2)</sup> Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». *arXiv:2505.04921* \[cs.AI\], 8 мая 2025 г. <a href="https://arxiv.org/html/2505.04921v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-ms_kosmos1-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-ms_kosmos1_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-ms_kosmos1_2-1)</sup> Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045* \[cs.CL\], 28 февр. 2023 г. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-raschka_understanding-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-raschka_understanding_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-raschka_understanding_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-raschka_understanding_3-2)</sup> Raschka, Sebastian. «Understanding Multimodal LLMs». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deepmind_flamingo-4">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-deepmind_flamingo_4-0) Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». *DeepMind Blog*. <a href="https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_gpt4-5">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-openai_gpt4_5-0) «GPT-4». *OpenAI*. <a href="https://openai.com/index/gpt-4-research/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-google_palm-e-6">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-google_palm-e_6-0) Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-acl_multimodal_kg-7">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-acl_multimodal_kg_7-0) Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». *ACL Anthology*, 2024. <a href="https://aclanthology.org/2024.acl-long.579/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hugging_gpt-8">[↑](https://systems-analysis.info/wiki/%D0%9C%D1%83%D0%BB%D1%8C%D1%82%D0%B8%D0%BC%D0%BE%D0%B4%D0%B0%D0%BB%D1%8C%D0%BD%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D1%81%D1%83%D0%B6%D0%B4%D0%B5%D0%BD%D0%B8%D0%B5#cite_ref-hugging_gpt_8-0) Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». *OpenReview*. <a href="https://openreview.net/forum?id=yHdTscY6Ci" class="external autonumber" rel="nofollow">[8]</a></span>
