---
title: "Razonamiento multimodal"
source: "https://systems-analysis.info/int/Razonamiento_multimodal"
wiki: "systems-analysis.info/int"
article: "Razonamiento_multimodal"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 6178
wiki_created_at: 2026-09-06T23:59:24Z
wiki_modified_at: 2026-09-06T23:59:24Z
downloaded_at: 2026-09-07T23:12:28Z
---

# Razonamiento multimodal

**Razonamiento multimodal** (del inglés *Multimodal Reasoning*) es la capacidad de la inteligencia artificial, en particular de los grandes modelos lingüísticos (LLM), para procesar, interpretar y conectar lógicamente información de diferentes tipos de datos (modalidades), como **texto, imágenes, audio** y **video**, para resolver tareas complejas<sup>[\[1\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-survey_perception-1)</sup>. Este proceso imita la percepción humana multifacética y es un paso clave hacia la creación de una inteligencia artificial general (AGI) más versátil y adaptable<sup>[\[2\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-ms_kosmos1-2)</sup>.

Los modelos que poseen esta capacidad se denominan **[grandes modelos lingüísticos multimodales](https://systems-analysis.info/int/LLM_multimodales "LLM multimodales")** (**MLLM** o LMRM — *Large Multimodal Reasoning Models*). Estos amplían las capacidades de los LLM tradicionales, que solo se entrenaban con texto, permitiéndoles comprender el contenido de las imágenes, analizar videos, controlar robots y mantener diálogos basados en datos visuales.

## Evolución de los enfoques

Los enfoques hacia el razonamiento multimodal han experimentado una rápida evolución, pasando de sistemas modulares a arquitecturas unificadas y centradas en el lenguaje.

- **Sistemas tempranos**: Se basaban en pipelines separados, donde componentes distintos procesaban la visión y otros el texto, y sus representaciones se combinaban en la etapa final. Este enfoque requería un diseño cuidadoso para cada tarea específica.
- **Sistemas modernos**: Han evolucionado hacia modelos unificados y centrados en el lenguaje. En estos, un gran modelo lingüístico actúa como el componente central, o «motor» de razonamiento, que procesa información de todas las modalidades en un formato único. Esto ha sido posible gracias a métodos que "enseñaron" al modelo de lenguaje a comprender datos visuales y de otro tipo, representándolos como tokens especiales<sup>[\[1\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-survey_perception-1)</sup>.

Un hito importante en esta transición fue el concepto de **«cadena de pensamiento multimodal»** (*Multimodal Chain-of-Thought, MCoT*), donde el modelo recibe una secuencia de instrucciones (prompts) que lo guían paso a paso a través de un proceso lógico que involucra diferentes modalidades.

## Arquitecturas de los LLM multimodales

Existen dos estrategias arquitectónicas principales para combinar diferentes modalidades con un modelo de lenguaje<sup>[\[3\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-raschka_understanding-3)</sup>:

### 1. Arquitectura unificada a nivel de tokens

En este enfoque, todas las modalidades se convierten en una representación común compatible con el LLM. Por ejemplo, una imagen se divide en fragmentos (patches), se pasa a través de un codificador visual (como un Vision Transformer (ViT)) y se transforma en una secuencia de embeddings vectoriales: **tokens visuales**. Luego, estos tokens visuales se concatenan (unen) con los tokens de texto y se introducen en el gran modelo lingüístico, que los procesa como un flujo único.

- **Ventajas**: Este esquema prácticamente no requiere cambios en la arquitectura del LLM y es fácil de escalar.
- **Ejemplos**: GPT-4 de OpenAI, **PaLM-E** de Google.

### 2. Arquitectura con atención cruzada (cross-attention)

Aquí, el modelo de lenguaje y el codificador visual permanecen como subsistemas separados, pero se conectan mediante capas especiales de **atención cruzada** (*cross-attention*). Estas capas permiten que las representaciones textuales y visuales se influyan mutuamente durante el proceso de generación. El modelo, por así decirlo, "echa un vistazo" a las características visuales en cada paso de la creación de la respuesta textual.

- **Ventajas**: Permite utilizar eficazmente el poder de modelos preentrenados y congelados (por ejemplo, un LLM grande y un ViT potente), entrenando únicamente las capas de conexión.
- **Ejemplo**: **Flamingo** de DeepMind.

En la investigación actual, las arquitecturas unificadas de tipo *decoder-only* se han vuelto dominantes, ya que son más fáciles de escalar y aprovechan mejor las capacidades de los LLM existentes<sup>[\[3\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-raschka_understanding-3)</sup>.

## Modelos e investigaciones clave

El desarrollo de los MLLM se aceleró especialmente entre 2022 y 2024.

- **Flamingo (DeepMind, 2022)**: Uno de los primeros grandes modelos de lenguaje y visión (VLM) capaz de resolver diversas tareas multimodales en modo de aprendizaje de pocos ejemplos (few-shot learning) sin necesidad de ajuste fino adicional. Flamingo demostró que un único modelo puede adaptarse rápidamente a nuevas tareas con solo unos pocos ejemplos en el prompt<sup>[\[4\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-deepmind_flamingo-4)</sup>.

<!-- -->

- **Kosmos-1 (Microsoft Research, 2023)**: El primer MLLM entrenado desde cero con datos de la web. Es capaz de percibir texto e imágenes como «modalidades comunes» y ha mostrado resultados sólidos en la resolución de tareas de texto con imágenes (OCR), diálogo multimodal e incluso en tareas de razonamiento lógico no verbal (matrices de Raven)<sup>[\[2\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-ms_kosmos1-2)</sup>.

<!-- -->

- **GPT-4 (OpenAI, 2023)**: El modelo insignia, posicionado como un «gran modelo multimodal», capaz de recibir texto e imágenes como entrada. Aunque su arquitectura no ha sido revelada, se sabe que puede analizar el contenido de imágenes, describir gráficos y explicar memes visuales. El acceso a sus capacidades multimodales se ha proporcionado de forma limitada, por ejemplo, en colaboración con la aplicación BeMyEyes para ayudar a personas ciegas y con discapacidad visual<sup>[\[5\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-openai_gpt4-5)</sup>.

<!-- -->

- **PaLM-E (Google, 2023)**: Un modelo multimodal «corporeizado» (*embodied*), creado para integrar la percepción visual con las acciones físicas de un robot. PaLM-E es capaz de generar planes paso a paso para controlar robots, recibiendo como entrada una combinación de imágenes de cámaras y lecturas de sensores. Esto demostró el efecto de «transferencia positiva»: el entrenamiento en tareas generales de «visión+lenguaje» mejoró la eficiencia de las habilidades robóticas<sup>[\[6\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-google_palm-e-6)</sup>.

<!-- -->

- **LLAMA 3.2 (Meta, 2024)**: Una serie de modelos de código abierto que también incluye versiones multimodales. Su lanzamiento hace que las tecnologías MLLM sean accesibles para la amplia comunidad de investigación para futuros experimentos<sup>[\[3\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-raschka_understanding-3)</sup>.

## Problemas y limitaciones

A pesar de los impresionantes avances, los MLLM se enfrentan a una serie de problemas serios:

- **Alucinaciones**: Al igual que sus predecesores textuales, los MLLM pueden generar afirmaciones que suenan convincentes pero que son incorrectas. La información visual no elimina este problema y, a veces, lo complica, llevando a interpretaciones erróneas de las imágenes<sup>[\[7\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-acl_multimodal_kg-7)</sup>.
- **Capacidad de generalización y profundidad de razonamiento**: Los modelos a menudo no pueden transferir de manera fiable sus conclusiones a nuevos tipos de datos (generalización omnimodal), y su razonamiento puede ser superficial. Pueden describir una imagen, pero fallar si la tarea requiere una planificación de varios pasos que tenga en cuenta tanto el texto como la imagen<sup>[\[1\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-survey_perception-1)</sup>.
- **Dificultades técnicas**: El entrenamiento de MLLM requiere enormes recursos computacionales y grandes conjuntos de datos multimodales cuidadosamente preparados. La evaluación de la calidad de estos modelos también es compleja, ya que requiere benchmarks especiales que tengan en cuenta tanto la comprensión como el razonamiento.

## Perspectivas de desarrollo

Las tendencias indican que los modelos multimodales se volverán cada vez más **«nativos multimodales»** (*Native Large Multimodal Models*), es decir, diseñados desde el principio para trabajar con todas las modalidades. El objetivo final es crear una **inteligencia universal**, capaz de percibir y comprender el mundo de una manera tan rica como un ser humano. Para ello, los investigadores están trabajando en reducir la dependencia de los datos etiquetados, entrenar a los modelos en un pensamiento más abstracto y causal, y garantizar un control seguro sobre sistemas tan potentes. El desarrollo de enfoques complementarios, como **HuggingGPT** —donde un LLM actúa como coordinador, distribuyendo tareas a modelos expertos— también está abriendo el camino hacia una IA multimodal más fiable<sup>[\[8\]](https://systems-analysis.info/int/Razonamiento_multimodal#cite_note-hugging_gpt-8)</sup>.

## Enlaces externos

- <a href="https://arxiv.org/html/2505.04921v1" class="external text" rel="nofollow">Artículo de revisión: A Survey on Large Multimodal Reasoning Models (2025)</a>
- <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external text" rel="nofollow">Artículo de Sebastian Raschka sobre la comprensión de los LLM multimodales</a>

## Bibliografía

- Li, Y. et al. (2025). *Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models*. <a href="https://arxiv.org/abs/2505.04921" class="external text" rel="nofollow">arXiv:2505.04921</a>.
- Lee, J. et al. (2024). *Multimodal Reasoning with Multimodal Knowledge Graph*. <a href="https://aclanthology.org/2024.acl-long.579.pdf" class="external text" rel="nofollow">ACL 2024</a>.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models*. <a href="https://arxiv.org/abs/2302.14045" class="external text" rel="nofollow">arXiv:2302.14045</a>.
- Shen, Y. et al. (2023). *HuggingGPT: Solving AI Tasks with ChatGPT and Its Friends in Hugging Face*. <a href="https://arxiv.org/abs/2303.17580" class="external text" rel="nofollow">arXiv:2303.17580</a>.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- OpenAI (2023). *GPT-4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external text" rel="nofollow">arXiv:2303.08774</a>.
- Chen, X. et al. (2023). *PaLI-X: On Scaling Up a Multilingual Vision and Language Model*. <a href="https://arxiv.org/abs/2305.18565" class="external text" rel="nofollow">arXiv:2305.18565</a>.
- Alayrac, J-B. et al. (2022). *Flamingo: A Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Chen, X. et al. (2022). *PaLI: A Jointly-Scaled Multilingual Language-Image Model*. <a href="https://arxiv.org/abs/2209.06794" class="external text" rel="nofollow">arXiv:2209.06794</a>.
- Huang, S. et al. (2022). *Multimodal Chain-of-Thought Prompting in Large Language Models*. <a href="https://arxiv.org/abs/2302.00923" class="external text" rel="nofollow">arXiv:2302.00923</a>.

## Referencias

1.  <span id="cite_note-survey_perception-1">↑ <sup>[1.0](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-survey_perception_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-survey_perception_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-survey_perception_1-2)</sup> Yang, Z., et al. «Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models». *arXiv:2505.04921* \[cs.AI\], 8 de mayo de 2025. <a href="https://arxiv.org/html/2505.04921v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-ms_kosmos1-2">↑ <sup>[2.0](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-ms_kosmos1_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-ms_kosmos1_2-1)</sup> Huang, S., et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045* \[cs.CL\], 28 de feb. de 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-raschka_understanding-3">↑ <sup>[3.0](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-raschka_understanding_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-raschka_understanding_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-raschka_understanding_3-2)</sup> Raschka, Sebastian. «Understanding Multimodal LLMs». *Ahead of AI Magazine*. <a href="https://magazine.sebastianraschka.com/p/understanding-multimodal-ilms" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deepmind_flamingo-4">[↑](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-deepmind_flamingo_4-0) Alayrac, Jean-Baptiste, et al. «Tackling multiple tasks with a single visual language model». *DeepMind Blog*. <a href="https://deepmind.google/discover/blog/tackling-multiple-tasks-with-a-single-visual-language-model/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_gpt4-5">[↑](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-openai_gpt4_5-0) «GPT-4». *OpenAI*. <a href="https://openai.com/index/gpt-4-research/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-google_palm-e-6">[↑](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-google_palm-e_6-0) Driess, Danny, et al. «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-acl_multimodal_kg-7">[↑](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-acl_multimodal_kg_7-0) Lee, D., et al. «Multimodal Reasoning with Multimodal Knowledge Graph». *ACL Anthology*, 2024. <a href="https://aclanthology.org/2024.acl-long.579/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hugging_gpt-8">[↑](https://systems-analysis.info/int/Razonamiento_multimodal#cite_ref-hugging_gpt_8-0) Shen, Y., et al. «HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face». *OpenReview*. <a href="https://openreview.net/forum?id=yHdTscY6Ci" class="external autonumber" rel="nofollow">[8]</a></span>
