---
title: "LLM multimodales"
source: "https://systems-analysis.info/int/LLM_multimodales"
wiki: "systems-analysis.info/int"
article: "LLM_multimodales"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 3651
wiki_created_at: 2026-09-06T23:23:57Z
wiki_modified_at: 2026-09-06T23:23:57Z
downloaded_at: 2026-09-07T22:58:07Z
---

# LLM multimodales

**Los modelos de lenguaje grandes multimodales** (del inglés **Multimodal Large Language Models, MLLMs**) son una clase de modelos de inteligencia artificial capaces de procesar y generar información en diversas modalidades, incluyendo texto, imágenes, audio y video<sup>[\[1\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-encord_intro-1)</sup>. A diferencia de los modelos de lenguaje unimodales, que trabajan exclusivamente con texto, los MLLM integran información de diferentes fuentes para resolver tareas complejas de comprensión y generación de contenido.

El concepto principal de los MLLM radica en la creación de una representación vectorial única (embedding) para diferentes modalidades. Esto permite que el modelo establezca conexiones semánticas entre, por ejemplo, una imagen y su descripción textual<sup>[\[2\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-acm_survey-2)</sup>. Un avance clave que sentó las bases de los MLLM modernos fue el uso del aprendizaje contrastivo para alinear las representaciones visuales y textuales en un espacio de características común, como se implementó en el modelo **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-radford2021-3)</sup>.

## Historia del desarrollo

### Período temprano (2013–2020)

Las bases conceptuales de la IA multimodal se sentaron en 2013, cuando investigadores de Stanford demostraron la viabilidad del aprendizaje sin ejemplos (zero-shot learning) utilizando representaciones vectoriales de palabras<sup>[\[4\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-deoldify2013-4)</sup>. En 2016, el equipo de **FAIR** (Meta AI) demostró la eficacia de utilizar descripciones en lenguaje natural para entrenar modelos de visión por computadora, logrando un 11,5% de precisión en ImageNet sin entrenamiento directo<sup>[\[5\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-openai_fair_2016-5)</sup>.

### La era de CLIP (2021)

Un momento revolucionario fue el lanzamiento del modelo **CLIP** (*Contrastive Language-Image Pre-training*) por parte de OpenAI en enero de 2021. El modelo, entrenado con 400 millones de pares de imagen-texto, demostró la capacidad de clasificar imágenes sin entrenamiento especializado en tareas específicas. CLIP se convirtió en la base para muchos MLLM posteriores<sup>[\[6\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-stanford_cs_clip-6)</sup>.

### Escalado e innovaciones (2022–2024)

Tras el éxito de CLIP, surgieron numerosos modelos clave:

- **Flamingo** (DeepMind, 2022): un modelo de 80 mil millones de parámetros que demostró capacidades excepcionales de aprendizaje con pocos ejemplos.
- **BLIP** (Salesforce, 2022): una arquitectura unificada para la comprensión y la generación.
- **GPT-4V** (OpenAI, 2023): el primer modelo multimodal comercial de esta escala.
- **LLaVA** (Microsoft, 2023): una popular alternativa de código abierto a GPT-4V.
- **Gemini** (Google, 2023): una arquitectura nativamente multimodal, diseñada desde el principio para trabajar con diferentes tipos de datos.
- **GPT-4o** (OpenAI, 2024): un modelo capaz de procesar texto, audio y video en tiempo real con baja latencia<sup>[\[1\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024): un modelo con capacidades mejoradas para el análisis de información visual.

## Enfoques arquitectónicos

### Arquitectura de doble codificador (Dual-Encoder)

Utiliza codificadores separados para cada modalidad, que proyectan los datos en un espacio de representación común. Un representante destacado es **CLIP**, donde un transformador visual procesa las imágenes y un transformador de texto procesa los datos lingüísticos. Sus ventajas son la modularidad y la eficiencia computacional, mientras que su desventaja es una interacción intermodal limitada<sup>[\[7\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-viso_ai_mllm-7)</sup>.

### Arquitectura codificador-decodificador

Un único codificador procesa la entrada multimodal, y un decodificador genera la salida de texto. El modelo **Flamingo** utiliza el mecanismo *Perceiver Resampler* para procesar entradas visuales de longitud variable y capas de atención intermodal. Este enfoque proporciona una rica interacción intermodal, pero requiere grandes recursos computacionales<sup>[\[8\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-determined_ai_arch-8)</sup>.

### Arquitectura de alineación (Alignment)

Este enfoque utiliza codificadores preentrenados y congelados, conectados a través de un pequeño módulo de alineación entrenable. Por ejemplo, **BLIP-2** utiliza un **Q-Former** (*Querying Transformer*) como un elemento de conexión ligero entre un codificador visual congelado y un modelo de lenguaje, lo que requiere significativamente menos parámetros entrenables<sup>[\[9\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-clarifai_blip2-9)</sup>.

## Modelos principales

### GPT-4V / GPT-4o (OpenAI)

Se estima que la familia de modelos GPT-4 cuenta con hasta **1,8 billones** de parámetros (en una arquitectura de mezcla de expertos). El modelo **GPT-4o**, lanzado en mayo de 2024, admite el procesamiento de texto, imágenes, audio y video en tiempo real. En el benchmark **MMMU**, alcanza una precisión del **69,1%**<sup>[\[10\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Una arquitectura nativamente multimodal, entrenada desde cero con texto, imágenes, audio y video. **Gemini 1.5 Pro** admite una ventana de contexto de hasta **10 millones de tokens** y supera a GPT-4 en 30 de los 32 benchmarks más populares<sup>[\[11\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Una familia de modelos (Haiku, Sonnet, Opus) con una ventana de contexto de hasta 200,000 tokens. **Claude 3 Opus** muestra un **58,5%** en el benchmark MMMU. Para mejorar la seguridad del modelo, se utiliza el enfoque de Constitutional AI<sup>[\[12\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (modelo de código abierto)

Combina el codificador visual CLIP con el modelo de lenguaje Vicuna. Existen variantes con 7, 13 y 34 mil millones de parámetros. El modelo alcanza un rendimiento relativo del 85,1% en comparación con GPT-4 en tareas sintéticas<sup>[\[13\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-llava_paper-13)</sup>.

## Áreas de aplicación

- **Preguntas y respuestas visuales (VQA)**: Permiten a los usuarios hacer preguntas sobre contenido visual.
- **Análisis de documentos**: Los MLLM modernos pueden procesar hasta 2000 páginas por minuto.
- **Visualización médica**: Modelos como **Med-PaLM M** (Google) analizan imágenes médicas y datos clínicos.
- **Robótica**: Modelos como **RT-2** (Google DeepMind) permiten a los robots comprender el entorno visual y ejecutar comandos en lenguaje natural.

## Limitaciones actuales

- **Alucinaciones**: El nivel de alucinaciones en el contenido generado se estima entre un 27% y un 46%. Los modelos pueden describir objetos inexistentes o interpretar incorrectamente la información visual<sup>[\[14\]](https://systems-analysis.info/int/LLM_multimodales#cite_note-arxiv_hallucinations-14)</sup>.
- **Altos requisitos computacionales**: El entrenamiento y el uso de MLLM requieren una infraestructura computacional significativa.
- **Sesgos en los datos**: La representación insuficiente de grupos demográficos, idiomas y culturas en los datos de entrenamiento conduce a errores sistemáticos.

## Enlaces externos

- <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external text" rel="nofollow">A Comprehensive Guide to Multimodal LLMs (Encord Blog)</a>
- <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external text" rel="nofollow">Multimodal LLMs: The Complete Guide (Viso.ai)</a>

## Literatura

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. <a href="https://arxiv.org/abs/2201.12086" class="external text" rel="nofollow">arXiv:2201.12086</a>.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. <a href="https://arxiv.org/abs/2301.12597" class="external text" rel="nofollow">arXiv:2301.12597</a>.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. <a href="https://arxiv.org/abs/2304.08485" class="external text" rel="nofollow">arXiv:2304.08485</a>.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. <a href="https://arxiv.org/abs/2307.15818" class="external text" rel="nofollow">arXiv:2307.15818</a>.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. <a href="https://arxiv.org/abs/2311.16502" class="external text" rel="nofollow">arXiv:2311.16502</a>.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. <a href="https://arxiv.org/abs/2106.13884" class="external text" rel="nofollow">arXiv:2106.13884</a>.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2306.13549" class="external text" rel="nofollow">arXiv:2306.13549</a>.

## Referencias

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_multimodales#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_multimodales#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/LLM_multimodales#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
