---
title: "PaLM (Pathways Language Model) (SV)"
source: "https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)"
wiki: "systems-analysis.info/int"
article: "PaLM_(Pathways_Language_Model)_(SV)"
language: "sv"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 5380
wiki_created_at: 2026-09-06T23:48:28Z
wiki_modified_at: 2026-09-06T23:48:28Z
downloaded_at: 2026-09-07T23:08:09Z
---

# PaLM (Pathways Language Model) (SV)

**PaLM** (**P**athways **L**anguage **M**odel) — är en familj av stora språkmodeller (LLM), utvecklad av Google. Den första versionen av modellen, som presenterades i april 2022, innehöll **540 miljarder parametrar** och blev en av de största språkmodellerna i världen vid den tidpunkten, och visade banbrytande förmågor som uppstod till följd av massiv skalning<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>.

Den viktigaste teknologiska grunden för PaLM var **Pathways** — en ny arkitektur för Machine Learning-system från Google, som möjliggör effektiv koordination av distribuerade beräkningar på tusentals acceleratorchip<sup>[\[2\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-blog-pathways-intro-2)</sup>. PaLM blev den första storskaliga demonstrationen av detta system och visade en aldrig tidigare skådad träningseffektivitet i enorma skalor.

## Pathways-systemet: Grund för skalning

Konceptet **Pathways**, som presenterades av Google år 2021, syftade till att skapa ett enda neuralt nätverk som effektivt kan generalisera kunskap över olika domäner och utföra tusentals uppgifter samtidigt. PaLM blev den första storskaliga tillämpningen av detta system: dess träning parallelliserades över **6144** specialiserade processorer **TPU v4**, sammankopplade i två molnkluster (TPU v4 Pods)<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>.

Vid tidpunkten för sin skapelse var detta den största TPU-konfigurationen som någonsin använts för att träna en enda modell. Systemet uppnådde en rekordartad effektivitet i utnyttjandet av hårdvarukapacitet (**57,8 % FLOPs**), vilket möjliggjorde en avsevärt större skala än föregående projekt och framgångsrik träning av en modell med mer än en halv triljon parametrar<sup>[\[3\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-blog-palm-scaling-3)</sup>.

## Arkitektur och träningsdata

### Modellarkitektur

PaLM är en tät (icke-gles) språkmodell med en **"enbart dekoder"-arkitektur** (*decoder-only*), liknande modellerna i GPT-serien. Denna arkitektur är inriktad på uppgifter med förutsägelse av nästa token och lämpar sig väl för textgenerering. Till skillnad från standardarkitekturen för transformer använder PaLM flera viktiga modifieringar för att förbättra effektiviteten<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>:

- **Parallella lager**: Attention-mekanismer och fullständigt kopplade lager beräknas parallellt, vilket gjorde det möjligt att påskynda träningen med ungefär 15 %.
- **SwiGLU-aktivering**: Användning av aktiveringsfunktionen SwiGLU i stället för den vanliga ReLU, vilket avsevärt förbättrade modellens kvalitet.

### Träningsdata

PaLM tränades på ett högkvalitativt datakorpus med en volym på **780 miljarder token**. Datamängden var flerspråkig och varierad och inkluderade<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>:

- Högkvalitativa webbdokument och böcker.
- Artiklar från Wikipedia.
- Dialoger från sociala medier (50 % av korpusen).
- Källkod från GitHub (5 % av korpusen).

Ungefär 78 % av data var på engelska, medan de återstående 22 % utgjorde en flerspråkig datamängd. För tokenisering användes en speciell "förlustfri" teknik som bevarade alla blanksteg (kritiskt för kod) och delade upp okända Unicode-tecken i byte.

## Förmågor och resultat

### Emergenta förmågor och few-shot-inlärning

PaLM demonstrerade att ökad modellskala, datamängd och beräkningskraft kan leda till **emergenta** (oväntade) förmågor. På många uppgifter ökade modellens prestanda kraftigt och icke-linjärt först när maximal skala uppnåddes, vilket indikerade uppkomsten av nya, tidigare ej observerade förmågor<sup>[\[3\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-blog-palm-scaling-3)</sup>.

Modellen utvärderades i läget för **few-shot-inlärning** (utan fine-tuning, med några exempel i prompten) och överträffade tidigare stora modeller (såsom GPT-3 och LaMDA) på 28 av 29 populära NLP-benchmark. På den sammansatta uppgiftssamlingen **BIG-bench** blev PaLM den första modellen vars resultat översteg den genomsnittliga nivå som uppvisades av mänskliga testpersoner<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>.

### Resonemang via tankekedjor (Chain-of-Thought)

Ett av PaLMs mest anmärkningsvärda prestationer var förmågan till flerstegs logiskt resonemang vid användning av tekniken **"tankekedjor" (chain-of-thought prompting)**<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>. Denna metod innebär att modellen ges exempel där lösningen på en uppgift beskrivs steg för steg. Genom att träna på sådana exempel kunde PaLM generera en egen "tankekedjor" för att lösa nya komplexa uppgifter, till exempel:

- **Matematiska problem**: I testet **GSM8K** (uppgifter på grundskolenivå) löste PaLM 58 % av uppgifterna, vilket överträffade det tidigare state-of-the-art-resultatet som uppnåddes av en finjusterad modell.
- **Uppgifter med sunt förnuft**: Modellen kunde generera utförliga förklaringar till icke-triviala problem, till exempel tolka tidigare osedda skämt.

Denna förmåga gjorde modellens "tänkande" mer transparent och mer likt mänskligt resonemang.

### Kodgenerering och flerspråkighet

Trots att källkod bara utgjorde 5 % av träningsdatan visade PaLM en nivå jämförbar med den specialiserade modellen OpenAI Codex på uppgifter rörande generering och transformation av kod. Modellen visade även starka förmågor i flerspråkiga uppgifter, inklusive översättning<sup>[\[3\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-blog-palm-scaling-3)</sup>.

## Evolution och efterföljare: Familjen PaLM

PaLM blev grunden för en hel familj av modeller utvecklade av Google.

### PaLM 2

Den i maj 2023 presenterade **PaLM 2** blev en mer effektiv och flerspråkig efterföljare. I stället för att jaga antalet parametrar lades tonvikten på kvaliteten hos träningsdatan och arkitekturens effektivitet. PaLM 2 är tränad på texter på **mer än 100 språk** och uppvisar förbättrade förmågor inom logik, programmering och översättning<sup>[\[4\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-blog-palm2-4)</sup>. Modellen lanseras i fyra storlekar (från minst till störst): **Gecko**, **Otter**, **Bison** och **Unicorn**. Den mest kompakta varianten (Gecko) är tillräckligt lätt för att köras på mobila enheter i offlineläge.

### Specialiserade versioner

Baserade på PaLM och PaLM 2 skapades versioner för specifika domäner:

- **Med-PaLM 2**: En specialiserad modell för medicin. Blev det första AI-systemet som nådde expertnivå på frågor från det amerikanska läkarnas licensprov (USMLE)<sup>[\[4\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-blog-palm2-4)</sup>.
- **Sec-PaLM 2**: En modell inriktad på cybersäkerhet, tränad för att identifiera sårbarheter och analysera skadlig kod<sup>[\[5\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-google-cloud-sec-ai-5)</sup>.

### PaLM-E: Multimodal version

**PaLM-E** (Pathways Language Model Embodied) — är en multimodal modell som kombinerar språkmodellen PaLM med visuella data från Vision Transformer (ViT). Detta gör det möjligt för modellen att behandla både text och bilder för att lösa uppgifter kopplade till den fysiska världen, till exempel för styrning av robotar<sup>[\[6\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-palm-e-blog-6)</sup>.

## Etiska aspekter och begränsningar

Skaparna av PaLM betonar vikten av ett ansvarsfullt förhållningssätt till utvecklingen av stora språkmodeller. I den officiella vetenskapliga artikeln genomfördes en analys av möjliga **snedvridningar och toxicitet** i den genererade texten. För att säkerställa transparens publicerade Google ett **modellkort (Model Card)** och ett **datablad (Datasheet)** för PaLM, där datamängdens egenskaper, testresultat och identifierade begränsningar dokumenteras<sup>[\[1\]](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_note-chowdhery2022-1)</sup>. Dessa åtgärder överensstämmer med moderna metoder för ansvarsfull AI och syftar till att minska riskerna förknippade med fördomar och generering av skadligt innehåll.

## Referenser

- Googles officiella blogg om PaLM
- PaLM API för utvecklare

## Litteratur

- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. arXiv:2204.02311.
- Anil, R. et al. (2023). *PaLM 2 Technical Report*. arXiv:2305.10403.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Singhal, K. et al. (2022). *Large Language Models Encode Clinical Knowledge*. arXiv:2212.13138.
- Singhal, K. et al. (2023). *Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Barham, P. et al. (2022). *Pathways: Asynchronous Distributed Dataflow for ML*. arXiv:2203.12533.
- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. arXiv:2201.11903.
- Zhang, Z. et al. (2022). *Automatic Chain of Thought Prompting in Large Language Models*. arXiv:2210.03493.
- Wei, J. et al. (2022). *Emergent Abilities of Large Language Models*. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). *Are Emergent Abilities of Large Language Models a Mirage?*. arXiv:2304.15004.
- Lu, S. et al. (2023). *Are Emergent Abilities in Large Language Models just In-Context Learning?*. arXiv:2309.01809.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). *Training Compute-Optimal Large Language Models*. arXiv:2203.15556.
- Rae, J. W. et al. (2021). *Scaling Language Models: Methods, Analysis & Insights from Training Gopher*. arXiv:2112.11446.
- Diao, S. et al. (2023). *Active Prompting with Chain-of-Thought for Large Language Models*. arXiv:2302.12246.

## Noter

1.  <span id="cite_note-chowdhery2022-1">↑ <sup>[1.0](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-chowdhery2022_1-6)</sup> Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». *arXiv*. <a href="https://arxiv.org/abs/2204.02311" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-pathways-intro-2">[↑](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-blog-pathways-intro_2-0) «Introducing Pathways: A next-generation AI architecture». *Google AI Blog*. <a href="https://blog.google/technology/ai/introducing-pathways-next-generation-ai-architecture/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-google-blog-palm-scaling-3">↑ <sup>[3.0](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-blog-palm-scaling_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-blog-palm-scaling_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-blog-palm-scaling_3-2)</sup> «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». *Google Research Blog*. <a href="https://research.google/blog/pathways-language-model-palm-scaling-to-540-billion-parameters-for-breakthrough-performance/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google-blog-palm2-4">↑ <sup>[4.0](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-blog-palm2_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-blog-palm2_4-1)</sup> «Google AI: What to know about the PaLM 2 large language model». *Google AI Blog*. <a href="https://blog.google/technology/ai/google-palm-2-ai-large-language-model/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-google-cloud-sec-ai-5">[↑](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-google-cloud-sec-ai_5-0) «New AI capabilities that can help address your security challenges». *Google Cloud Blog*. <a href="https://cloud.google.com/blog/products/identity-security/security-ai-next23" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-palm-e-blog-6">[↑](https://systems-analysis.info/int/PaLM_(Pathways_Language_Model)_(SV)#cite_ref-palm-e-blog_6-0) «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[6]</a></span>
