LLMs Multimodais
Modelos de Linguagem Grandes Multimodais (em inglês, Multimodal Large Language Models, MLLMs) são uma classe de modelos de inteligência artificial capazes de processar e gerar informações em diversas modalidades, incluindo texto, imagens, áudio e vídeo[1]. Diferentemente dos modelos de linguagem unimodais, que trabalham exclusivamente com texto, os MLLMs integram informações de diferentes fontes para resolver tarefas complexas de compreensão e geração de conteúdo.
O conceito principal dos MLLMs consiste em criar uma representação vetorial unificada (embedding) para diferentes modalidades. Isso permite que o modelo estabeleça conexões semânticas entre, por exemplo, uma imagem e sua descrição textual[2]. O avanço fundamental que estabeleceu a base para os MLLMs modernos foi o uso do aprendizado contrastivo para alinhar representações visuais e textuais em um espaço de características comum, como foi implementado no modelo CLIP[3].
História do Desenvolvimento
Período Inicial (2013–2020)
As bases conceituais da IA multimodal foram estabelecidas em 2013, quando pesquisadores de Stanford demonstraram a possibilidade de aprendizado de tiro-zero (zero-shot learning) usando representações vetoriais de palavras[4]. Em 2016, a equipe do FAIR (Meta AI) mostrou a eficácia do uso de descrições em linguagem natural para treinar modelos de visão computacional, alcançando 11,5% de precisão no ImageNet sem treinamento direto[5].
A Era do CLIP (2021)
Um momento revolucionário foi o lançamento do modelo CLIP (Contrastive Language-Image Pre-training) pela OpenAI em janeiro de 2021. O modelo, treinado em 400 milhões de pares imagem-texto, demonstrou a capacidade de classificar imagens sem treinamento especializado para tarefas específicas. O CLIP tornou-se a base para muitos MLLMs subsequentes[6].
Escalonamento e Inovações (2022–2024)
Após o sucesso do CLIP, surgiram muitos modelos-chave:
- Flamingo (DeepMind, 2022) — um modelo de 80 bilhões de parâmetros que demonstrou capacidades notáveis de aprendizado com poucos exemplos (few-shot learning).
- BLIP (Salesforce, 2022) — uma arquitetura unificada para compreensão e geração.
- GPT-4V (OpenAI, 2023) — o primeiro modelo multimodal comercial dessa escala.
- LLaVA (Microsoft, 2023) — uma popular alternativa de código aberto ao GPT-4V.
- Gemini (Google, 2023) — uma arquitetura nativamente multimodal, projetada desde o início para trabalhar com diferentes tipos de dados.
- GPT-4o (OpenAI, 2024) — um modelo capaz de processar texto, áudio e vídeo em tempo real com baixa latência[1].
- Claude 3.5 Sonnet (Anthropic, 2024) — um modelo com capacidades aprimoradas para análise de informações visuais.
Abordagens Arquitetônicas
Arquitetura de Codificador Duplo (Dual-Encoder)
Utiliza codificadores separados para cada modalidade, que projetam os dados em um espaço de representação comum. Um exemplo proeminente é o CLIP, onde um transformador visual processa as imagens, e um transformador de texto processa os dados linguísticos. As vantagens são a modularidade e a eficiência computacional, enquanto a desvantagem é a interação intermodal limitada[7].
Arquitetura Codificador-Decodificador
Um único codificador processa a entrada multimodal, e um decodificador gera a saída textual. O modelo Flamingo utiliza o mecanismo Perceiver Resampler para processar entradas visuais de comprimento variável e camadas de atenção intermodal. Essa abordagem proporciona uma rica interação intermodal, mas exige grandes recursos computacionais[8].
Arquitetura de Alinhamento (Alignment)
Essa abordagem utiliza codificadores pré-treinados congelados, conectados por um pequeno módulo de alinhamento treinável. Por exemplo, o BLIP-2 utiliza o Q-Former (Querying Transformer) como um elemento de conexão leve entre um codificador visual congelado e um modelo de linguagem, exigindo significativamente menos parâmetros treináveis[9].
Principais Modelos
GPT-4V / GPT-4o (OpenAI)
A família de modelos GPT-4 é estimada em até 1,8 trilhão de parâmetros (em uma arquitetura de mistura de especialistas). O modelo GPT-4o, lançado em maio de 2024, suporta o processamento de texto, imagens, áudio e vídeo em tempo real. No benchmark MMMU, ele alcança 69,1% de precisão[10].
Gemini (Google)
Uma arquitetura nativamente multimodal, treinada desde o início com texto, imagens, áudio e vídeo. O Gemini 1.5 Pro suporta uma janela de contexto de até 10 milhões de tokens e supera o GPT-4 em 30 dos 32 benchmarks populares[11].
Claude 3 (Anthropic)
Uma família de modelos (Haiku, Sonnet, Opus) com uma janela de contexto de até 200.000 tokens. O Claude 3 Opus alcança 58,5% no benchmark MMMU. Para aumentar a segurança do modelo, é utilizada a abordagem de Constitutional AI[12].
LLaVA (modelo de código aberto)
Combina o codificador visual CLIP com o modelo de linguagem Vicuna. Estão disponíveis variantes com 7, 13 e 34 bilhões de parâmetros. O modelo atinge 85,1% do desempenho relativo do GPT-4 em tarefas sintéticas[13].
Áreas de Aplicação
- Perguntas e Respostas Visuais (VQA): Permitem que os usuários façam perguntas sobre o conteúdo visual.
- Análise de Documentos: MLLMs modernos são capazes de processar até 2000 páginas por minuto.
- Imagens Médicas: Modelos como o Med-PaLM M (Google) analisam imagens médicas e dados clínicos.
- Robótica: Modelos como o RT-2 (Google DeepMind) permitem que robôs compreendam o ambiente visual e executem comandos em linguagem natural.
Limitações Atuais
- Alucinações: O nível de alucinações no conteúdo gerado é estimado entre 27% e 46%. Os modelos podem descrever objetos inexistentes ou interpretar incorretamente as informações visuais[14].
- Altos requisitos computacionais: O treinamento e o uso de MLLMs exigem uma infraestrutura computacional significativa.
- Viés nos dados: A sub-representação de grupos demográficos, idiomas e culturas nos dados de treinamento leva a erros sistemáticos.
Ligações externas
- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)
Literatura
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
- Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
- Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
- Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
- Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
- Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
Notas
- ↑ 1.0 1.1 "A Comprehensive Guide to Multimodal LLMs". Encord Blog. [1]
- ↑ "A Survey on Multimodal Large Language Models". ACM Computing Surveys. [2]
- ↑ Radford, A., et al. "Learning Transferable Visual Models From Natural Language Supervision". arXiv:2103.00020. [3]
- ↑ DeOldify, J. "Zero-Shot Learning by Predicting Attributes". arXiv:1312.5650. [4]
- ↑ "Learning from captions: A milestone in visual language understanding". OpenAI Blog. [5]
- ↑ "Understanding CLIP". Stanford CS231n. [6]
- ↑ "Multimodal LLMs: The Complete Guide". Viso.ai. [7]
- ↑ "The Architectures of Multimodal Language Models". Determined AI. [8]
- ↑ "Understanding BLIP-2: The New Vision-Language Model". Clarifai Blog. [9]
- ↑ "MMMU: A New Benchmark for Multimodal LLMs". Encord Blog. [10]
- ↑ "Google Gemini: A Deep Dive". DaveAI Blog. [11]
- ↑ "Introducing the Claude 3 Family". Anthropic. [12]
- ↑ Liu, H., et al. "Visual Instruction Tuning". arXiv:2304.08485. [13]
- ↑ "Hallucinations in Multimodal Large Language Models". arXiv:2308.08726. [14]