---
title: "LLMs Multimodais"
source: "https://systems-analysis.info/int/LLMs_Multimodais"
wiki: "systems-analysis.info/int"
article: "LLMs_Multimodais"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 3667
wiki_created_at: 2026-09-06T23:24:12Z
wiki_modified_at: 2026-09-06T23:24:12Z
downloaded_at: 2026-09-07T22:58:12Z
---

# LLMs Multimodais

**Modelos de Linguagem Grandes Multimodais** (em inglês, **Multimodal Large Language Models, MLLMs**) são uma classe de modelos de inteligência artificial capazes de processar e gerar informações em diversas modalidades, incluindo texto, imagens, áudio e vídeo<sup>[\[1\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-encord_intro-1)</sup>. Diferentemente dos modelos de linguagem unimodais, que trabalham exclusivamente com texto, os MLLMs integram informações de diferentes fontes para resolver tarefas complexas de compreensão e geração de conteúdo.

O conceito principal dos MLLMs consiste em criar uma representação vetorial unificada (embedding) para diferentes modalidades. Isso permite que o modelo estabeleça conexões semânticas entre, por exemplo, uma imagem e sua descrição textual<sup>[\[2\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-acm_survey-2)</sup>. O avanço fundamental que estabeleceu a base para os MLLMs modernos foi o uso do aprendizado contrastivo para alinhar representações visuais e textuais em um espaço de características comum, como foi implementado no modelo **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-radford2021-3)</sup>.

## História do Desenvolvimento

### Período Inicial (2013–2020)

As bases conceituais da IA multimodal foram estabelecidas em 2013, quando pesquisadores de Stanford demonstraram a possibilidade de aprendizado de tiro-zero (zero-shot learning) usando representações vetoriais de palavras<sup>[\[4\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-deoldify2013-4)</sup>. Em 2016, a equipe do **FAIR** (Meta AI) mostrou a eficácia do uso de descrições em linguagem natural para treinar modelos de visão computacional, alcançando 11,5% de precisão no ImageNet sem treinamento direto<sup>[\[5\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-openai_fair_2016-5)</sup>.

### A Era do CLIP (2021)

Um momento revolucionário foi o lançamento do modelo **CLIP** (*Contrastive Language-Image Pre-training*) pela OpenAI em janeiro de 2021. O modelo, treinado em 400 milhões de pares imagem-texto, demonstrou a capacidade de classificar imagens sem treinamento especializado para tarefas específicas. O CLIP tornou-se a base para muitos MLLMs subsequentes<sup>[\[6\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-stanford_cs_clip-6)</sup>.

### Escalonamento e Inovações (2022–2024)

Após o sucesso do CLIP, surgiram muitos modelos-chave:

- **Flamingo** (DeepMind, 2022) — um modelo de 80 bilhões de parâmetros que demonstrou capacidades notáveis de aprendizado com poucos exemplos (few-shot learning).
- **BLIP** (Salesforce, 2022) — uma arquitetura unificada para compreensão e geração.
- **GPT-4V** (OpenAI, 2023) — o primeiro modelo multimodal comercial dessa escala.
- **LLaVA** (Microsoft, 2023) — uma popular alternativa de código aberto ao GPT-4V.
- **Gemini** (Google, 2023) — uma arquitetura nativamente multimodal, projetada desde o início para trabalhar com diferentes tipos de dados.
- **GPT-4o** (OpenAI, 2024) — um modelo capaz de processar texto, áudio e vídeo em tempo real com baixa latência<sup>[\[1\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — um modelo com capacidades aprimoradas para análise de informações visuais.

## Abordagens Arquitetônicas

### Arquitetura de Codificador Duplo (Dual-Encoder)

Utiliza codificadores separados para cada modalidade, que projetam os dados em um espaço de representação comum. Um exemplo proeminente é o **CLIP**, onde um transformador visual processa as imagens, e um transformador de texto processa os dados linguísticos. As vantagens são a modularidade e a eficiência computacional, enquanto a desvantagem é a interação intermodal limitada<sup>[\[7\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-viso_ai_mllm-7)</sup>.

### Arquitetura Codificador-Decodificador

Um único codificador processa a entrada multimodal, e um decodificador gera a saída textual. O modelo **Flamingo** utiliza o mecanismo *Perceiver Resampler* para processar entradas visuais de comprimento variável e camadas de atenção intermodal. Essa abordagem proporciona uma rica interação intermodal, mas exige grandes recursos computacionais<sup>[\[8\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-determined_ai_arch-8)</sup>.

### Arquitetura de Alinhamento (Alignment)

Essa abordagem utiliza codificadores pré-treinados congelados, conectados por um pequeno módulo de alinhamento treinável. Por exemplo, o **BLIP-2** utiliza o **Q-Former** (*Querying Transformer*) como um elemento de conexão leve entre um codificador visual congelado e um modelo de linguagem, exigindo significativamente menos parâmetros treináveis<sup>[\[9\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-clarifai_blip2-9)</sup>.

## Principais Modelos

### GPT-4V / GPT-4o (OpenAI)

A família de modelos GPT-4 é estimada em até **1,8 trilhão** de parâmetros (em uma arquitetura de mistura de especialistas). O modelo **GPT-4o**, lançado em maio de 2024, suporta o processamento de texto, imagens, áudio e vídeo em tempo real. No benchmark **MMMU**, ele alcança **69,1%** de precisão<sup>[\[10\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Uma arquitetura nativamente multimodal, treinada desde o início com texto, imagens, áudio e vídeo. O **Gemini 1.5 Pro** suporta uma janela de contexto de até **10 milhões de tokens** e supera o GPT-4 em 30 dos 32 benchmarks populares<sup>[\[11\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Uma família de modelos (Haiku, Sonnet, Opus) com uma janela de contexto de até 200.000 tokens. O **Claude 3 Opus** alcança **58,5%** no benchmark MMMU. Para aumentar a segurança do modelo, é utilizada a abordagem de Constitutional AI<sup>[\[12\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (modelo de código aberto)

Combina o codificador visual CLIP com o modelo de linguagem Vicuna. Estão disponíveis variantes com 7, 13 e 34 bilhões de parâmetros. O modelo atinge 85,1% do desempenho relativo do GPT-4 em tarefas sintéticas<sup>[\[13\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-llava_paper-13)</sup>.

## Áreas de Aplicação

- **Perguntas e Respostas Visuais (VQA)**: Permitem que os usuários façam perguntas sobre o conteúdo visual.
- **Análise de Documentos**: MLLMs modernos são capazes de processar até 2000 páginas por minuto.
- **Imagens Médicas**: Modelos como o **Med-PaLM M** (Google) analisam imagens médicas e dados clínicos.
- **Robótica**: Modelos como o **RT-2** (Google DeepMind) permitem que robôs compreendam o ambiente visual e executem comandos em linguagem natural.

## Limitações Atuais

- **[Alucinações](https://systems-analysis.info/int/Alucina%C3%A7%C3%B5es_e_respostas_incorretas_de_LLMs "Alucinações e respostas incorretas de LLMs")**: O nível de alucinações no conteúdo gerado é estimado entre 27% e 46%. Os modelos podem descrever objetos inexistentes ou interpretar incorretamente as informações visuais<sup>[\[14\]](https://systems-analysis.info/int/LLMs_Multimodais#cite_note-arxiv_hallucinations-14)</sup>.
- **Altos requisitos computacionais**: O treinamento e o uso de MLLMs exigem uma infraestrutura computacional significativa.
- **Viés nos dados**: A sub-representação de grupos demográficos, idiomas e culturas nos dados de treinamento leva a erros sistemáticos.

## Ligações externas

- <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external text" rel="nofollow">A Comprehensive Guide to Multimodal LLMs (Encord Blog)</a>
- <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external text" rel="nofollow">Multimodal LLMs: The Complete Guide (Viso.ai)</a>

## Literatura

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. <a href="https://arxiv.org/abs/2201.12086" class="external text" rel="nofollow">arXiv:2201.12086</a>.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. <a href="https://arxiv.org/abs/2301.12597" class="external text" rel="nofollow">arXiv:2301.12597</a>.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. <a href="https://arxiv.org/abs/2304.08485" class="external text" rel="nofollow">arXiv:2304.08485</a>.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. <a href="https://arxiv.org/abs/2307.15818" class="external text" rel="nofollow">arXiv:2307.15818</a>.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. <a href="https://arxiv.org/abs/2311.16502" class="external text" rel="nofollow">arXiv:2311.16502</a>.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. <a href="https://arxiv.org/abs/2106.13884" class="external text" rel="nofollow">arXiv:2106.13884</a>.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2306.13549" class="external text" rel="nofollow">arXiv:2306.13549</a>.

## Notas

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-encord_intro_1-1)</sup> "A Comprehensive Guide to Multimodal LLMs". *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-acm_survey_2-0) "A Survey on Multimodal Large Language Models". *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-radford2021_3-0) Radford, A., et al. "Learning Transferable Visual Models From Natural Language Supervision". *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-deoldify2013_4-0) DeOldify, J. "Zero-Shot Learning by Predicting Attributes". *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-openai_fair_2016_5-0) "Learning from captions: A milestone in visual language understanding". *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-stanford_cs_clip_6-0) "Understanding CLIP". *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-viso_ai_mllm_7-0) "Multimodal LLMs: The Complete Guide". *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-determined_ai_arch_8-0) "The Architectures of Multimodal Language Models". *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-clarifai_blip2_9-0) "Understanding BLIP-2: The New Vision-Language Model". *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-encord_mmmu_perf_10-0) "MMMU: A New Benchmark for Multimodal LLMs". *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-daveai_gemini_11-0) "Google Gemini: A Deep Dive". *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-anthropic_claude3_12-0) "Introducing the Claude 3 Family". *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-llava_paper_13-0) Liu, H., et al. "Visual Instruction Tuning". *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/LLMs_Multimodais#cite_ref-arxiv_hallucinations_14-0) "Hallucinations in Multimodal Large Language Models". *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
