---
title: "PaLM"
source: "https://systems-analysis.info/wiki/PaLM"
wiki: "systems-analysis.info/wiki"
article: "PaLM"
language: "ru"
categories:
  - "Категория:Google"
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Семейства LLM"
revision_id: 159
wiki_created_at: 2026-09-06T22:04:37Z
wiki_modified_at: 2026-09-06T22:04:37Z
downloaded_at: 2026-09-07T22:17:55Z
---

# PaLM

**PaLM** (**P**athways **L**anguage **M**odel) — это семейство [больших языковых моделей (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели"), разработанное компанией Google. Первая версия модели, представленная в апреле 2022 года, содержала **540 миллиардов параметров** и стала одной из крупнейших на тот момент языковых моделей в мире, продемонстрировав прорывные возможности, ставшие результатом массивного масштабирования<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>.

Ключевой технологической основой PaLM стала **Pathways** — новая архитектура систем машинного обучения от Google, позволяющая эффективно координировать распределенные вычисления на тысячах чипов-ускорителей<sup>[\[2\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-blog-pathways-intro-2)</sup>. PaLM стала первой крупномасштабной демонстрацией этой системы, показав беспрецедентную эффективность обучения на огромных масштабах.

## Система Pathways: Основа для масштабирования

Концепция **Pathways**, представленная Google в 2021 году, предполагала создание единой нейросети, способной эффективно обобщать знания для разных доменов и выполнять тысячи задач одновременно. PaLM стала первым крупномасштабным применением этой системы: её обучение было распараллелено на **6144** специализированных процессорах **TPU v4**, объединённых в два облачных кластера (TPU v4 Pods)<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>.

На момент своего создания это была крупнейшая конфигурация TPU, когда-либо использовавшаяся для обучения одной модели. Система достигла рекордной эффективности использования аппаратных мощностей (**57,8% FLOPs**), что позволило существенно превзойти по масштабу предшествующие проекты и успешно обучить модель с более чем полутриллионом параметров<sup>[\[3\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-blog-palm-scaling-3)</sup>.

## Архитектура и обучающие данные

### Архитектура модели

PaLM — это плотная (неразреженная) языковая модель с архитектурой **«только декодер»** (*[decoder-only](https://systems-analysis.info/wiki/Decoder-only "Decoder-only")*), аналогичная моделям серии [GPT](https://systems-analysis.info/wiki/GPT "GPT"). Такая архитектура ориентирована на задачи предсказания следующего [токена](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен") и хорошо подходит для генерации текста. В отличие от стандартной архитектуры трансформера, PaLM использует несколько ключевых модификаций для повышения эффективности<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>:

- **Параллельные слои**: Механизмы внимания и полносвязные слои вычисляются параллельно, что позволило ускорить обучение примерно на 15%.
- **SwiGLU активация**: Использование активационной функции SwiGLU вместо стандартной ReLU, что значительно улучшило качество модели.

### Обучающие данные

PaLM была обучена на высококачественном корпусе данных объёмом **780 миллиардов токенов**. Набор данных был многоязычным и разнообразным, включая<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>:

- Высококачественные веб-документы и книги.
- Статьи из Википедии.
- Диалоги из социальных сетей (50% корпуса).
- Исходный код с GitHub (5% корпуса).

Около 78% данных было на английском языке, а остальные 22% — мультиязычный набор. Для токенизации использовалась специальная «беспотерьная» методика, которая сохраняла все пробелы (критично для кода) и разбивала нераспознанные символы Unicode на байты.

## Возможности и результаты

### Эмерджентные способности и few-shot обучение

PaLM продемонстрировала, что увеличение масштаба модели, объёма данных и вычислительных мощностей может приводить к **эмерджентным** (неожиданно возникающим) способностям. На многих задачах производительность модели резко и нелинейно возрастала только при достижении максимального масштаба, что указывало на появление новых, ранее не наблюдавшихся возможностей<sup>[\[3\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-blog-palm-scaling-3)</sup>.

Модель оценивалась в режиме **few-shot обучения** (без донастройки, с несколькими примерами в промпте) и превзошла предыдущие крупные модели (такие как [GPT-3](https://systems-analysis.info/wiki/GPT "GPT") и LaMDA) на 28 из 29 популярных NLP-бенчмарков. На комплексном наборе заданий **BIG-bench** PaLM стала первой моделью, чьи результаты превзошли средний уровень, показанный людьми-испытателями<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>.

### Рассуждение по цепочке мыслей (Chain-of-Thought)

Одним из самых заметных достижений PaLM стала способность к многошаговому логическому рассуждению при использовании техники подсказок **«цепочка мыслей» (chain-of-thought prompting)**<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>. Эта методика заключается в предоставлении модели примеров, где решение задачи расписано по шагам. Обучившись на таких примерах, PaLM смогла генерировать собственную «цепочку мыслей» для решения новых сложных задач, таких как:

- **Математические задачи**: На тесте **GSM8K** (задачи уровня начальной школы) PaLM решила 58% задач, что превзошло предыдущий state-of-the-art результат, достигнутый дообученной моделью.
- **Задачи на здравый смысл**: Модель смогла генерировать развёрнутые объяснения для нетривиальных задач, например, давать толкование ранее не встречавшихся шуток.

Эта способность сделала процесс «мышления» модели более прозрачным и похожим на человеческий.

### Генерация кода и многоязычность

Несмотря на то, что исходный код составлял всего 5% обучающих данных, PaLM показала уровень, сравнимый со специализированной моделью [OpenAI Codex](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8_OpenAI "Большие языковые модели OpenAI") на задачах по генерации и трансформации кода. Модель также продемонстрировала сильные способности в многоязычных задачах, включая перевод<sup>[\[3\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-blog-palm-scaling-3)</sup>.

## Эволюция и преемники: Семейство PaLM

PaLM стала основой для целого семейства моделей, разработанных Google.

### PaLM 2

Представленная в мае 2023 года **PaLM 2** стала более эффективным и многоязычным преемником. Вместо погони за количеством параметров, акцент был смещен на качество обучающих данных и эффективность архитектуры. PaLM 2 обучена на текстах на **более чем 100 языках** и демонстрирует улучшенные способности в логике, программировании и переводе<sup>[\[4\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-blog-palm2-4)</sup>. Модель выпускается в четырёх размерах (от самого маленького к большому): **Gecko**, **Otter**, **Bison** и **Unicorn**. Самый компактный вариант (Gecko) достаточно лёгок для работы на мобильных устройствах в офлайн-режиме.

### Специализированные версии

На основе PaLM и PaLM 2 были созданы версии для конкретных доменов:

- **Med-PaLM 2**: Специализированная модель для медицины. Стала первой системой ИИ, достигшей уровня эксперта на вопросах лицензионного экзамена врача в США (USMLE)<sup>[\[4\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-blog-palm2-4)</sup>.
- **Sec-PaLM 2**: Модель, ориентированная на кибербезопасность, обученная выявлять уязвимости и анализировать вредоносный код<sup>[\[5\]](https://systems-analysis.info/wiki/PaLM#cite_note-google-cloud-sec-ai-5)</sup>.

### PaLM-E: Мультимодальная версия

**PaLM-E** (Pathways Language Model Embodied) — это мультимодальная модель, которая объединяет языковую модель PaLM с визуальными данными из Vision Transformer (ViT). Это позволяет модели обрабатывать как текст, так и изображения, решая задачи, связанные с физическим миром, например, для управления роботами<sup>[\[6\]](https://systems-analysis.info/wiki/PaLM#cite_note-palm-e-blog-6)</sup>.

## Этические аспекты и ограничения

Создатели PaLM подчеркивают необходимость ответственного подхода к разработке больших языковых моделей. В официальной научной статье был проведён анализ возможных **смещений и токсичности** в моделируемом тексте. Для обеспечения прозрачности Google опубликовала **карту модели (Model Card)** и **паспорт данных (Datasheet)** для PaLM, где документированы характеристики датасета, результаты тестирования и выявленные ограничения<sup>[\[1\]](https://systems-analysis.info/wiki/PaLM#cite_note-chowdhery2022-1)</sup>. Эти меры соответствуют современным практикам ответственного ИИ и призваны снизить риски, связанные с предубеждениями и генерацией вредоносного контента.

## См. также

- [Большие языковые модели Google](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8_Google "Большие языковые модели Google")
- [GPT](https://systems-analysis.info/wiki/GPT "GPT")
- [Большие языковые модели OpenAI](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8_OpenAI "Большие языковые модели OpenAI")
- [BERT](https://systems-analysis.info/wiki/BERT "BERT")
- [Gemma](https://systems-analysis.info/wiki/Gemma "Gemma")

## Ссылки

- <a href="https://research.google/blog/pathways-language-model-palm-scaling-to-540-billion-parameters-for-breakthrough-performance/" class="external text" rel="nofollow">Официальный блог Google о PaLM</a>
- <a href="https://ai.google.dev/palm_docs" class="external text" rel="nofollow">PaLM API для разработчиков</a>

## Литература

- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external text" rel="nofollow">arXiv:2204.02311</a>.
- Anil, R. et al. (2023). *PaLM 2 Technical Report*. <a href="https://arxiv.org/abs/2305.10403" class="external text" rel="nofollow">arXiv:2305.10403</a>.
- Driess, D. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Singhal, K. et al. (2022). *Large Language Models Encode Clinical Knowledge*. <a href="https://arxiv.org/abs/2212.13138" class="external text" rel="nofollow">arXiv:2212.13138</a>.
- Singhal, K. et al. (2023). *Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Barham, P. et al. (2022). *Pathways: Asynchronous Distributed Dataflow for ML*. <a href="https://arxiv.org/abs/2203.12533" class="external text" rel="nofollow">arXiv:2203.12533</a>.
- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2201.11903" class="external text" rel="nofollow">arXiv:2201.11903</a>.
- Zhang, Z. et al. (2022). *Automatic Chain of Thought Prompting in Large Language Models*. <a href="https://arxiv.org/abs/2210.03493" class="external text" rel="nofollow">arXiv:2210.03493</a>.
- Wei, J. et al. (2022). *Emergent Abilities of Large Language Models*. <a href="https://arxiv.org/abs/2206.07682" class="external text" rel="nofollow">arXiv:2206.07682</a>.
- Schaeffer, R. et al. (2023). *Are Emergent Abilities of Large Language Models a Mirage?*. <a href="https://arxiv.org/abs/2304.15004" class="external text" rel="nofollow">arXiv:2304.15004</a>.
- Lu, S. et al. (2023). *Are Emergent Abilities in Large Language Models just In-Context Learning?*. <a href="https://arxiv.org/abs/2309.01809" class="external text" rel="nofollow">arXiv:2309.01809</a>.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. <a href="https://arxiv.org/abs/2001.08361" class="external text" rel="nofollow">arXiv:2001.08361</a>.
- Hoffmann, J. et al. (2022). *Training Compute-Optimal Large Language Models*. <a href="https://arxiv.org/abs/2203.15556" class="external text" rel="nofollow">arXiv:2203.15556</a>.
- Rae, J. W. et al. (2021). *Scaling Language Models: Methods, Analysis & Insights from Training Gopher*. <a href="https://arxiv.org/abs/2112.11446" class="external text" rel="nofollow">arXiv:2112.11446</a>.
- Diao, S. et al. (2023). *Active Prompting with Chain-of-Thought for Large Language Models*. <a href="https://arxiv.org/abs/2302.12246" class="external text" rel="nofollow">arXiv:2302.12246</a>.

## Примечания

1.  <span id="cite_note-chowdhery2022-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-2)</sup> <sup>[1,3](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-3)</sup> <sup>[1,4](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-4)</sup> <sup>[1,5](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-5)</sup> <sup>[1,6](https://systems-analysis.info/wiki/PaLM#cite_ref-chowdhery2022_1-6)</sup> Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». *arXiv*. <a href="https://arxiv.org/abs/2204.02311" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-pathways-intro-2">[↑](https://systems-analysis.info/wiki/PaLM#cite_ref-google-blog-pathways-intro_2-0) «Introducing Pathways: A next-generation AI architecture». *Google AI Blog*. <a href="https://blog.google/technology/ai/introducing-pathways-next-generation-ai-architecture/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-google-blog-palm-scaling-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/PaLM#cite_ref-google-blog-palm-scaling_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/PaLM#cite_ref-google-blog-palm-scaling_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/PaLM#cite_ref-google-blog-palm-scaling_3-2)</sup> «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». *Google Research Blog*. <a href="https://research.google/blog/pathways-language-model-palm-scaling-to-540-billion-parameters-for-breakthrough-performance/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google-blog-palm2-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/PaLM#cite_ref-google-blog-palm2_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/PaLM#cite_ref-google-blog-palm2_4-1)</sup> «Google AI: What to know about the PaLM 2 large language model». *Google AI Blog*. <a href="https://blog.google/technology/ai/google-palm-2-ai-large-language-model/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-google-cloud-sec-ai-5">[↑](https://systems-analysis.info/wiki/PaLM#cite_ref-google-cloud-sec-ai_5-0) «New AI capabilities that can help address your security challenges». *Google Cloud Blog*. <a href="https://cloud.google.com/blog/products/identity-security/security-ai-next23" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-palm-e-blog-6">[↑](https://systems-analysis.info/wiki/PaLM#cite_ref-palm-e-blog_6-0) «PaLM-E: An embodied multimodal language model». *Google Research Blog*. <a href="https://research.google/blog/palm-e-an-embodied-multimodal-language-model/" class="external autonumber" rel="nofollow">[6]</a></span>
