---
title: "PaLM (Pathways Language Model) (PT)"
source: "https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)"
wiki: "systems-analysis.info/int"
article: "PaLM_(Pathways_Language_Model)_(PT)"
language: "pt"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 5378
wiki_created_at: 2026-09-06T23:48:27Z
wiki_modified_at: 2026-09-06T23:48:27Z
downloaded_at: 2026-09-07T23:08:08Z
---

# PaLM (Pathways Language Model) (PT)

**PaLM** (**P**athways **L**anguage **M**odel) é uma família de grandes modelos de linguagem (LLMs) desenvolvida pelo Google. A primeira versão do modelo, apresentada em abril de 2022, continha **540 bilhões de parâmetros** e se tornou um dos maiores modelos de linguagem do mundo na época, demonstrando capacidades inovadoras resultantes de uma massiva escalabilidade<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>.

A base tecnológica fundamental do PaLM foi o **Pathways** — uma nova arquitetura de sistemas de aprendizado de máquina do Google que permite coordenar eficientemente a computação distribuída em milhares de chips aceleradores<sup>[\[2\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-blog-pathways-intro-2)</sup>. O PaLM foi a primeira demonstração em larga escala desse sistema, exibindo uma eficiência de treinamento sem precedentes em escalas massivas.

## O sistema Pathways: A base para a escalabilidade

O conceito **Pathways**, apresentado pelo Google em 2021, propunha a criação de uma única rede neural capaz de generalizar conhecimento de forma eficiente para diferentes domínios e executar milhares de tarefas simultaneamente. O PaLM foi a primeira aplicação em larga escala desse sistema: seu treinamento foi paralelizado em **6.144** processadores especializados **TPU v4**, organizados em dois clusters na nuvem (TPU v4 Pods)<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>.

Na época de sua criação, essa era a maior configuração de TPU já utilizada para treinar um único modelo. O sistema alcançou uma eficiência recorde no uso de hardware (**57,8% de eficiência de FLOPs**), o que permitiu superar significativamente os projetos anteriores em escala e treinar com sucesso um modelo com mais de meio trilhão de parâmetros<sup>[\[3\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-blog-palm-scaling-3)</sup>.

## Arquitetura e dados de treinamento

### Arquitetura do modelo

O PaLM é um modelo de linguagem denso (não esparso) com uma arquitetura **"decoder-only"** (apenas decodificador), similar aos modelos da série GPT. Essa arquitetura é voltada para tarefas de previsão do próximo token e é bem adequada para a geração de texto. Diferente da arquitetura Transformer padrão, o PaLM utiliza algumas modificações importantes para aumentar a eficiência<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>:

- **Camadas paralelas**: Os mecanismos de atenção e as camadas totalmente conectadas são calculados em paralelo, o que permitiu acelerar o treinamento em aproximadamente 15%.
- **Ativação SwiGLU**: O uso da função de ativação SwiGLU em vez da ReLU padrão, o que melhorou significativamente a qualidade do modelo.

### Dados de treinamento

O PaLM foi treinado em um corpus de dados de alta qualidade com **780 bilhões de tokens**. O conjunto de dados era multilíngue e diversificado, incluindo<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>:

- Documentos web de alta qualidade e livros.
- Artigos da Wikipédia.
- Diálogos de redes sociais (50% do corpus).
- Código-fonte do GitHub (5% do corpus).

Cerca de 78% dos dados estavam em inglês, enquanto os 22% restantes formavam um conjunto multilíngue. Para a tokenização, foi utilizada uma técnica especial "lossless" (sem perdas), que preservava todos os espaços em branco (crítico para código) e dividia caracteres Unicode não reconhecidos em bytes.

## Capacidades e resultados

### Habilidades emergentes e aprendizagem few-shot

O PaLM demonstrou que o aumento da escala do modelo, do volume de dados e do poder computacional pode levar a habilidades **emergentes** (que surgem inesperadamente). Em muitas tarefas, o desempenho do modelo aumentou de forma acentuada e não linear apenas ao atingir a escala máxima, indicando o surgimento de novas capacidades não observadas anteriormente<sup>[\[3\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-blog-palm-scaling-3)</sup>.

O modelo foi avaliado no modo de **aprendizagem few-shot** (sem ajuste fino, com alguns exemplos no prompt) e superou modelos grandes anteriores (como GPT-3 e LaMDA) em 28 de 29 benchmarks populares de PNL. No abrangente conjunto de tarefas **BIG-bench**, o PaLM se tornou o primeiro modelo cujos resultados ultrapassaram o nível médio demonstrado por testadores humanos<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>.

### Raciocínio em cadeia de pensamento (Chain-of-Thought)

Uma das conquistas mais notáveis do PaLM foi sua capacidade de raciocínio lógico em múltiplos passos ao usar a técnica de prompting **"cadeia de pensamento" (chain-of-thought prompting)**<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>. Esse método consiste em fornecer ao modelo exemplos onde a solução de um problema é descrita passo a passo. Aprendendo com esses exemplos, o PaLM foi capaz de gerar sua própria "cadeia de pensamento" para resolver novas tarefas complexas, como:

- **Problemas matemáticos**: No teste **GSM8K** (problemas de nível escolar primário), o PaLM resolveu 58% das tarefas, superando o resultado de ponta (state-of-the-art) anterior, alcançado por um modelo com ajuste fino.
- **Tarefas de bom senso**: O modelo foi capaz de gerar explicações detalhadas para tarefas não triviais, como, por exemplo, interpretar piadas nunca vistas antes.

Essa capacidade tornou o processo de "pensamento" do modelo mais transparente e semelhante ao humano.

### Geração de código e multilinguismo

Apesar de o código-fonte constituir apenas 5% dos dados de treinamento, o PaLM demonstrou um desempenho comparável ao do modelo especializado OpenAI Codex em tarefas de geração e transformação de código. O modelo também exibiu fortes capacidades em tarefas multilíngues, incluindo tradução<sup>[\[3\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-blog-palm-scaling-3)</sup>.

## Evolução e sucessores: A família PaLM

O PaLM se tornou a base para toda uma família de modelos desenvolvidos pelo Google.

### PaLM 2

Apresentado em maio de 2023, o **PaLM 2** tornou-se um sucessor mais eficiente e multilíngue. Em vez de focar na quantidade de parâmetros, a ênfase foi deslocada para a qualidade dos dados de treinamento e a eficiência da arquitetura. O PaLM 2 foi treinado em textos em **mais de 100 idiomas** e demonstra habilidades aprimoradas em lógica, programação e tradução<sup>[\[4\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-blog-palm2-4)</sup>. O modelo é lançado em quatro tamanhos (do menor para o maior): **Gecko**, **Otter**, **Bison** e **Unicorn**. A variante mais compacta (Gecko) é leve o suficiente para funcionar em dispositivos móveis no modo offline.

### Versões especializadas

Com base no PaLM e no PaLM 2, foram criadas versões para domínios específicos:

- **Med-PaLM 2**: Um modelo especializado para medicina. Tornou-se o primeiro sistema de IA a atingir o nível de especialista em questões do exame de licenciamento médico dos EUA (USMLE)<sup>[\[4\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-blog-palm2-4)</sup>.
- **Sec-PaLM 2**: Um modelo focado em cibersegurança, treinado para identificar vulnerabilidades e analisar código malicioso<sup>[\[5\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-google-cloud-sec-ai-5)</sup>.

### PaLM-E: Versão multimodal

**PaLM-E** (Pathways Language Model Embodied) é um modelo multimodal que combina o modelo de linguagem PaLM com dados visuais de um Vision Transformer (ViT). Isso permite que o modelo processe tanto texto quanto imagens, resolvendo tarefas relacionadas ao mundo físico, como, por exemplo, para o controle de robôs<sup>[\[6\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-palm-e-blog-6)</sup>.

## Aspectos éticos e limitações

Os criadores do PaLM enfatizam a necessidade de uma abordagem responsável no desenvolvimento de grandes modelos de linguagem. No artigo científico oficial, foi realizada uma análise de possíveis **vieses e toxicidade** no texto modelado. Para garantir a transparência, o Google publicou um **Model Card (Cartão do Modelo)** e um **Datasheet (Folha de Dados)** para o PaLM, onde são documentadas as características do conjunto de dados, os resultados dos testes e as limitações identificadas<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_note-chowdhery2022-1)</sup>. Essas medidas estão alinhadas com as práticas modernas de IA responsável e visam mitigar os riscos associados a preconceitos e à geração de conteúdo prejudicial.

## Ligações externas

- <a href="https://research.google/blog/pathways-language-model-palm-scaling-to-540-billion-parameters-for-breakthrough-performance/" class="external text" rel="nofollow">Blog oficial do Google sobre o PaLM</a>
- <a href="https://ai.google.dev/palm_docs" class="external text" rel="nofollow">API do PaLM para desenvolvedores</a>

## Literatura

- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external text" rel="nofollow">arXiv:2204.02311</a>.
- Anil, R. et al. (2023). *PaLM 2 Technical Report*. <a href="https://arxiv.org/abs/2305.10403" class="external text" rel="nofollow">arXiv:2305.10403</a>.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Singhal, K. et al. (2022). *Large Language Models Encode Clinical Knowledge*. <a href="https://arxiv.org/abs/2212.13138" class="external text" rel="nofollow">arXiv:2212.13138</a>.
- Singhal, K. et al. (2023). *Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Barham, P. et al. (2022). *Pathways: Asynchronous Distributed Dataflow for ML*. <a href="https://arxiv.org/abs/2203.12533" class="external text" rel="nofollow">arXiv:2203.12533</a>.
- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2201.11903" class="external text" rel="nofollow">arXiv:2201.11903</a>.
- Zhang, Z. et al. (2022). *Automatic Chain of Thought Prompting in Large Language Models*. <a href="https://arxiv.org/abs/2210.03493" class="external text" rel="nofollow">arXiv:2210.03493</a>.
- Wei, J. et al. (2022). *Emergent Abilities of Large Language Models*. <a href="https://arxiv.org/abs/2206.07682" class="external text" rel="nofollow">arXiv:2206.07682</a>.
- Schaeffer, R. et al. (2023). *Are Emergent Abilities of Large Language Models a Mirage?*. <a href="https://arxiv.org/abs/2304.15004" class="external text" rel="nofollow">arXiv:2304.15004</a>.
- Lu, S. et al. (2023). *Are Emergent Abilities in Large Language Models just In-Context Learning?*. <a href="https://arxiv.org/abs/2309.01809" class="external text" rel="nofollow">arXiv:2309.01809</a>.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Hoffmann, J. et al. (2022). *Training Compute-Optimal Large Language Models*. <a href="https://arxiv.org/abs/2203.15556" class="external text" rel="nofollow">arXiv:2203.15556</a>.
- Rae, J. W. et al. (2021). *Scaling Language Models: Methods, Analysis & Insights from Training Gopher*. <a href="https://arxiv.org/abs/2112.11446" class="external text" rel="nofollow">arXiv:2112.11446</a>.
- Diao, S. et al. (2023). *Active Prompting with Chain-of-Thought for Large Language Models*. <a href="https://arxiv.org/abs/2302.12246" class="external text" rel="nofollow">arXiv:2302.12246</a>.

## Notas

1.  <span id="cite_note-chowdhery2022-1">↑ <sup>[1.0](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-chowdhery2022_1-6)</sup> Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». *arXiv*. <a href="https://arxiv.org/abs/2204.02311" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-pathways-intro-2">[↑](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-blog-pathways-intro_2-0) «Introducing Pathways: A next-generation AI architecture». *Google AI Blog*. <a href="https://blog.google/technology/ai/introducing-pathways-next-generation-ai-architecture/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-google-blog-palm-scaling-3">↑ <sup>[3.0](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-blog-palm-scaling_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-blog-palm-scaling_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-blog-palm-scaling_3-2)</sup> «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». *Google Research Blog*. <a href="https://research.google/blog/pathways-language-model-palm-scaling-to-540-billion-parameters-for-breakthrough-performance/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google-blog-palm2-4">↑ <sup>[4.0](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-blog-palm2_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-blog-palm2_4-1)</sup> «Google AI: What to know about the PaLM 2 large language model». *Google AI Blog*. <a href="https://blog.google/technology/ai/google-palm-2-ai-large-language-model/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-google-cloud-sec-ai-5">[↑](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-google-cloud-sec-ai_5-0) «New AI capabilities that can help address your security challenges». *Google Cloud Blog*. <a href="https://cloud.google.com/blog/products/identity-security/security-ai-next23" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-palm-e-blog-6">[↑](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(PT)#cite_ref-palm-e-blog_6-0) «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[6]</a></span>
