LLMs Multimodais

From Systems analysis Wiki
Jump to navigation Jump to search

Modelos de Linguagem Grandes Multimodais (em inglês, Multimodal Large Language Models, MLLMs) são uma classe de modelos de inteligência artificial capazes de processar e gerar informações em diversas modalidades, incluindo texto, imagens, áudio e vídeo[1]. Diferentemente dos modelos de linguagem unimodais, que trabalham exclusivamente com texto, os MLLMs integram informações de diferentes fontes para resolver tarefas complexas de compreensão e geração de conteúdo.

O conceito principal dos MLLMs consiste em criar uma representação vetorial unificada (embedding) para diferentes modalidades. Isso permite que o modelo estabeleça conexões semânticas entre, por exemplo, uma imagem e sua descrição textual[2]. O avanço fundamental que estabeleceu a base para os MLLMs modernos foi o uso do aprendizado contrastivo para alinhar representações visuais e textuais em um espaço de características comum, como foi implementado no modelo CLIP[3].

História do Desenvolvimento

Período Inicial (2013–2020)

As bases conceituais da IA multimodal foram estabelecidas em 2013, quando pesquisadores de Stanford demonstraram a possibilidade de aprendizado de tiro-zero (zero-shot learning) usando representações vetoriais de palavras[4]. Em 2016, a equipe do FAIR (Meta AI) mostrou a eficácia do uso de descrições em linguagem natural para treinar modelos de visão computacional, alcançando 11,5% de precisão no ImageNet sem treinamento direto[5].

A Era do CLIP (2021)

Um momento revolucionário foi o lançamento do modelo CLIP (Contrastive Language-Image Pre-training) pela OpenAI em janeiro de 2021. O modelo, treinado em 400 milhões de pares imagem-texto, demonstrou a capacidade de classificar imagens sem treinamento especializado para tarefas específicas. O CLIP tornou-se a base para muitos MLLMs subsequentes[6].

Escalonamento e Inovações (2022–2024)

Após o sucesso do CLIP, surgiram muitos modelos-chave:

  • Flamingo (DeepMind, 2022) — um modelo de 80 bilhões de parâmetros que demonstrou capacidades notáveis de aprendizado com poucos exemplos (few-shot learning).
  • BLIP (Salesforce, 2022) — uma arquitetura unificada para compreensão e geração.
  • GPT-4V (OpenAI, 2023) — o primeiro modelo multimodal comercial dessa escala.
  • LLaVA (Microsoft, 2023) — uma popular alternativa de código aberto ao GPT-4V.
  • Gemini (Google, 2023) — uma arquitetura nativamente multimodal, projetada desde o início para trabalhar com diferentes tipos de dados.
  • GPT-4o (OpenAI, 2024) — um modelo capaz de processar texto, áudio e vídeo em tempo real com baixa latência[1].
  • Claude 3.5 Sonnet (Anthropic, 2024) — um modelo com capacidades aprimoradas para análise de informações visuais.

Abordagens Arquitetônicas

Arquitetura de Codificador Duplo (Dual-Encoder)

Utiliza codificadores separados para cada modalidade, que projetam os dados em um espaço de representação comum. Um exemplo proeminente é o CLIP, onde um transformador visual processa as imagens, e um transformador de texto processa os dados linguísticos. As vantagens são a modularidade e a eficiência computacional, enquanto a desvantagem é a interação intermodal limitada[7].

Arquitetura Codificador-Decodificador

Um único codificador processa a entrada multimodal, e um decodificador gera a saída textual. O modelo Flamingo utiliza o mecanismo Perceiver Resampler para processar entradas visuais de comprimento variável e camadas de atenção intermodal. Essa abordagem proporciona uma rica interação intermodal, mas exige grandes recursos computacionais[8].

Arquitetura de Alinhamento (Alignment)

Essa abordagem utiliza codificadores pré-treinados congelados, conectados por um pequeno módulo de alinhamento treinável. Por exemplo, o BLIP-2 utiliza o Q-Former (Querying Transformer) como um elemento de conexão leve entre um codificador visual congelado e um modelo de linguagem, exigindo significativamente menos parâmetros treináveis[9].

Principais Modelos

GPT-4V / GPT-4o (OpenAI)

A família de modelos GPT-4 é estimada em até 1,8 trilhão de parâmetros (em uma arquitetura de mistura de especialistas). O modelo GPT-4o, lançado em maio de 2024, suporta o processamento de texto, imagens, áudio e vídeo em tempo real. No benchmark MMMU, ele alcança 69,1% de precisão[10].

Gemini (Google)

Uma arquitetura nativamente multimodal, treinada desde o início com texto, imagens, áudio e vídeo. O Gemini 1.5 Pro suporta uma janela de contexto de até 10 milhões de tokens e supera o GPT-4 em 30 dos 32 benchmarks populares[11].

Claude 3 (Anthropic)

Uma família de modelos (Haiku, Sonnet, Opus) com uma janela de contexto de até 200.000 tokens. O Claude 3 Opus alcança 58,5% no benchmark MMMU. Para aumentar a segurança do modelo, é utilizada a abordagem de Constitutional AI[12].

LLaVA (modelo de código aberto)

Combina o codificador visual CLIP com o modelo de linguagem Vicuna. Estão disponíveis variantes com 7, 13 e 34 bilhões de parâmetros. O modelo atinge 85,1% do desempenho relativo do GPT-4 em tarefas sintéticas[13].

Áreas de Aplicação

  • Perguntas e Respostas Visuais (VQA): Permitem que os usuários façam perguntas sobre o conteúdo visual.
  • Análise de Documentos: MLLMs modernos são capazes de processar até 2000 páginas por minuto.
  • Imagens Médicas: Modelos como o Med-PaLM M (Google) analisam imagens médicas e dados clínicos.
  • Robótica: Modelos como o RT-2 (Google DeepMind) permitem que robôs compreendam o ambiente visual e executem comandos em linguagem natural.

Limitações Atuais

  • Alucinações: O nível de alucinações no conteúdo gerado é estimado entre 27% e 46%. Os modelos podem descrever objetos inexistentes ou interpretar incorretamente as informações visuais[14].
  • Altos requisitos computacionais: O treinamento e o uso de MLLMs exigem uma infraestrutura computacional significativa.
  • Viés nos dados: A sub-representação de grupos demográficos, idiomas e culturas nos dados de treinamento leva a erros sistemáticos.

Ligações externas

Literatura

  • Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020.
  • Alayrac, J.-B. et al. (2022). Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198.
  • Li, J. et al. (2022). BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086.
  • Li, J. et al. (2023). BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597.
  • Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  • Driess, K. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  • Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502.
  • Tsimpoukelli, M. et al. (2021). Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884.
  • Singhal, K. et al. (2023). Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Yin, S. et al. (2023). A Survey on Multimodal Large Language Models. arXiv:2306.13549.

Notas

  1. 1.0 1.1 "A Comprehensive Guide to Multimodal LLMs". Encord Blog. [1]
  2. "A Survey on Multimodal Large Language Models". ACM Computing Surveys. [2]
  3. Radford, A., et al. "Learning Transferable Visual Models From Natural Language Supervision". arXiv:2103.00020. [3]
  4. DeOldify, J. "Zero-Shot Learning by Predicting Attributes". arXiv:1312.5650. [4]
  5. "Learning from captions: A milestone in visual language understanding". OpenAI Blog. [5]
  6. "Understanding CLIP". Stanford CS231n. [6]
  7. "Multimodal LLMs: The Complete Guide". Viso.ai. [7]
  8. "The Architectures of Multimodal Language Models". Determined AI. [8]
  9. "Understanding BLIP-2: The New Vision-Language Model". Clarifai Blog. [9]
  10. "MMMU: A New Benchmark for Multimodal LLMs". Encord Blog. [10]
  11. "Google Gemini: A Deep Dive". DaveAI Blog. [11]
  12. "Introducing the Claude 3 Family". Anthropic. [12]
  13. Liu, H., et al. "Visual Instruction Tuning". arXiv:2304.08485. [13]
  14. "Hallucinations in Multimodal Large Language Models". arXiv:2308.08726. [14]