PaLM (Pathways Language Model) (PT)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) é uma família de grandes modelos de linguagem (LLMs) desenvolvida pelo Google. A primeira versão do modelo, apresentada em abril de 2022, continha 540 bilhões de parâmetros e se tornou um dos maiores modelos de linguagem do mundo na época, demonstrando capacidades inovadoras resultantes de uma massiva escalabilidade[1].

A base tecnológica fundamental do PaLM foi o Pathways — uma nova arquitetura de sistemas de aprendizado de máquina do Google que permite coordenar eficientemente a computação distribuída em milhares de chips aceleradores[2]. O PaLM foi a primeira demonstração em larga escala desse sistema, exibindo uma eficiência de treinamento sem precedentes em escalas massivas.

O sistema Pathways: A base para a escalabilidade

O conceito Pathways, apresentado pelo Google em 2021, propunha a criação de uma única rede neural capaz de generalizar conhecimento de forma eficiente para diferentes domínios e executar milhares de tarefas simultaneamente. O PaLM foi a primeira aplicação em larga escala desse sistema: seu treinamento foi paralelizado em 6.144 processadores especializados TPU v4, organizados em dois clusters na nuvem (TPU v4 Pods)[1].

Na época de sua criação, essa era a maior configuração de TPU já utilizada para treinar um único modelo. O sistema alcançou uma eficiência recorde no uso de hardware (57,8% de eficiência de FLOPs), o que permitiu superar significativamente os projetos anteriores em escala e treinar com sucesso um modelo com mais de meio trilhão de parâmetros[3].

Arquitetura e dados de treinamento

Arquitetura do modelo

O PaLM é um modelo de linguagem denso (não esparso) com uma arquitetura "decoder-only" (apenas decodificador), similar aos modelos da série GPT. Essa arquitetura é voltada para tarefas de previsão do próximo token e é bem adequada para a geração de texto. Diferente da arquitetura Transformer padrão, o PaLM utiliza algumas modificações importantes para aumentar a eficiência[1]:

  • Camadas paralelas: Os mecanismos de atenção e as camadas totalmente conectadas são calculados em paralelo, o que permitiu acelerar o treinamento em aproximadamente 15%.
  • Ativação SwiGLU: O uso da função de ativação SwiGLU em vez da ReLU padrão, o que melhorou significativamente a qualidade do modelo.

Dados de treinamento

O PaLM foi treinado em um corpus de dados de alta qualidade com 780 bilhões de tokens. O conjunto de dados era multilíngue e diversificado, incluindo[1]:

  • Documentos web de alta qualidade e livros.
  • Artigos da Wikipédia.
  • Diálogos de redes sociais (50% do corpus).
  • Código-fonte do GitHub (5% do corpus).

Cerca de 78% dos dados estavam em inglês, enquanto os 22% restantes formavam um conjunto multilíngue. Para a tokenização, foi utilizada uma técnica especial "lossless" (sem perdas), que preservava todos os espaços em branco (crítico para código) e dividia caracteres Unicode não reconhecidos em bytes.

Capacidades e resultados

Habilidades emergentes e aprendizagem few-shot

O PaLM demonstrou que o aumento da escala do modelo, do volume de dados e do poder computacional pode levar a habilidades emergentes (que surgem inesperadamente). Em muitas tarefas, o desempenho do modelo aumentou de forma acentuada e não linear apenas ao atingir a escala máxima, indicando o surgimento de novas capacidades não observadas anteriormente[3].

O modelo foi avaliado no modo de aprendizagem few-shot (sem ajuste fino, com alguns exemplos no prompt) e superou modelos grandes anteriores (como GPT-3 e LaMDA) em 28 de 29 benchmarks populares de PNL. No abrangente conjunto de tarefas BIG-bench, o PaLM se tornou o primeiro modelo cujos resultados ultrapassaram o nível médio demonstrado por testadores humanos[1].

Raciocínio em cadeia de pensamento (Chain-of-Thought)

Uma das conquistas mais notáveis do PaLM foi sua capacidade de raciocínio lógico em múltiplos passos ao usar a técnica de prompting "cadeia de pensamento" (chain-of-thought prompting)[1]. Esse método consiste em fornecer ao modelo exemplos onde a solução de um problema é descrita passo a passo. Aprendendo com esses exemplos, o PaLM foi capaz de gerar sua própria "cadeia de pensamento" para resolver novas tarefas complexas, como:

  • Problemas matemáticos: No teste GSM8K (problemas de nível escolar primário), o PaLM resolveu 58% das tarefas, superando o resultado de ponta (state-of-the-art) anterior, alcançado por um modelo com ajuste fino.
  • Tarefas de bom senso: O modelo foi capaz de gerar explicações detalhadas para tarefas não triviais, como, por exemplo, interpretar piadas nunca vistas antes.

Essa capacidade tornou o processo de "pensamento" do modelo mais transparente e semelhante ao humano.

Geração de código e multilinguismo

Apesar de o código-fonte constituir apenas 5% dos dados de treinamento, o PaLM demonstrou um desempenho comparável ao do modelo especializado OpenAI Codex em tarefas de geração e transformação de código. O modelo também exibiu fortes capacidades em tarefas multilíngues, incluindo tradução[3].

Evolução e sucessores: A família PaLM

O PaLM se tornou a base para toda uma família de modelos desenvolvidos pelo Google.

PaLM 2

Apresentado em maio de 2023, o PaLM 2 tornou-se um sucessor mais eficiente e multilíngue. Em vez de focar na quantidade de parâmetros, a ênfase foi deslocada para a qualidade dos dados de treinamento e a eficiência da arquitetura. O PaLM 2 foi treinado em textos em mais de 100 idiomas e demonstra habilidades aprimoradas em lógica, programação e tradução[4]. O modelo é lançado em quatro tamanhos (do menor para o maior): Gecko, Otter, Bison e Unicorn. A variante mais compacta (Gecko) é leve o suficiente para funcionar em dispositivos móveis no modo offline.

Versões especializadas

Com base no PaLM e no PaLM 2, foram criadas versões para domínios específicos:

  • Med-PaLM 2: Um modelo especializado para medicina. Tornou-se o primeiro sistema de IA a atingir o nível de especialista em questões do exame de licenciamento médico dos EUA (USMLE)[4].
  • Sec-PaLM 2: Um modelo focado em cibersegurança, treinado para identificar vulnerabilidades e analisar código malicioso[5].

PaLM-E: Versão multimodal

PaLM-E (Pathways Language Model Embodied) é um modelo multimodal que combina o modelo de linguagem PaLM com dados visuais de um Vision Transformer (ViT). Isso permite que o modelo processe tanto texto quanto imagens, resolvendo tarefas relacionadas ao mundo físico, como, por exemplo, para o controle de robôs[6].

Aspectos éticos e limitações

Os criadores do PaLM enfatizam a necessidade de uma abordagem responsável no desenvolvimento de grandes modelos de linguagem. No artigo científico oficial, foi realizada uma análise de possíveis vieses e toxicidade no texto modelado. Para garantir a transparência, o Google publicou um Model Card (Cartão do Modelo) e um Datasheet (Folha de Dados) para o PaLM, onde são documentadas as características do conjunto de dados, os resultados dos testes e as limitações identificadas[1]. Essas medidas estão alinhadas com as práticas modernas de IA responsável e visam mitigar os riscos associados a preconceitos e à geração de conteúdo prejudicial.

Ligações externas

Literatura

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

Notas

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]