---
title: "LLaMA"
source: "https://systems-analysis.info/wiki/LLaMA"
wiki: "systems-analysis.info/wiki"
article: "LLaMA"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Семейства LLM"
revision_id: 136
wiki_created_at: 2026-09-06T21:55:35Z
wiki_modified_at: 2026-09-06T21:55:35Z
downloaded_at: 2026-09-07T22:17:43Z
---

# LLaMA

**LLaMA** (*Large Language Model Meta AI*) — семейство [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) с преимущественно открытым исходным кодом, разрабатываемое исследовательским подразделением Meta AI. Модели LLaMA строятся на модифицированной архитектуре [трансформеров](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer") и ориентированы на высокую эффективность вычислений, демократизацию доступа к передовым ИИ-технологиям и лёгкую адаптацию под специализированные задачи. Семейство эволюционировало от первоначального исследовательского релиза LLaMA 1 (февраль 2023 года) до мультимодальных моделей LLaMA 4 (планируемый релиз в 2026 году).

## Наименование

Аббревиатура **LLaMA** расшифровывается как **Large Language Model Meta AI** (Большая языковая модель Meta AI).

- **Large Language Model** — подчёркивает масштаб моделей, параметры которых измеряются от миллиардов до триллионов.
- **Meta AI** — указывает на разработчика, исследовательскую группу Meta.

## История создания

Разработка LLaMA началась в конце 2022 года как стратегический ответ Meta на успех ChatGPT от OpenAI. Марк Цукерберг сформировал междисциплинарную команду, включающую исследователей из лаборатории FAIR (Facebook AI Research). Ключевую роль в философии проекта сыграл Янн Лекун, руководитель FAIR, который с 2013 года придерживался принципа полной открытости всех исследований лаборатории.

Первая версия, **LLaMA 1**, была выпущена в феврале 2023 года с исследовательской лицензией. Вскоре после релиза, в марте 2023 года, веса модели утекли в сеть через BitTorrent. Это событие, вопреки опасениям, не остановило, а, наоборот, подстегнуло развитие проекта, так как дало возможность независимым исследователям и энтузиастам по всему миру экспериментировать с моделью. В результате на платформе Hugging Face появились десятки тысяч производных моделей. Последующие версии, начиная с **LLaMA 2**, выпускались уже с коммерческой лицензией<sup>[\[1\]](https://systems-analysis.info/wiki/LLaMA#cite_note-1)</sup>, закрепляя статус LLaMA как ключевого игрока на рынке открытых ИИ-моделей.

## Эволюция моделей и хронология релизов

| Версия         | Дата выпуска                                                                      | Диапазон параметров                          | Ключевые инновации и особенности                                                                                                                                                                                                                                                                                                                                        |
|----------------|-----------------------------------------------------------------------------------|----------------------------------------------|-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| **LLaMA 1**    | Февраль 2023                                                                      | 7B – 65B                                     | Базовая архитектура (RMSNorm, SwiGLU, RoPE). Обучение на 1,4 трлн [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен"). [Контекстное окно](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно") 2048 токенов. Исследовательская лицензия. |
| **LLaMA 2**    | Июль 2023                                                                         | 7B – 70B                                     | Дообучение для диалогов ([RLHF](https://systems-analysis.info/wiki/RLHF "RLHF")). Внедрение Grouped-Query Attention (GQA). Контекстное окно 4096 токенов. Первая коммерческая лицензия.                                                                                                                                                                                 |
| **Code Llama** | Август 2023                                                                       | 7B – 70B                                     | Специализированная версия для кода. Дообучение на 500 млрд токенов кода. Варианты: базовый, Python-специализированный, instruction-tuned.                                                                                                                                                                                                                               |
| **LLaMA 3**    | Апрель 2024                                                                       | 8B, 70B                                      | Обучение на 15 трлн токенов. Улучшенный токенизатор со словарём на 128 тыс. токенов. Высокая производительность (82% на MMLU).                                                                                                                                                                                                                                          |
| **LLaMA 3.1**  | Июль 2024<sup>[\[2\]](https://systems-analysis.info/wiki/LLaMA#cite_note-2)</sup> | 8B, 70B, 405B                                | Флагманская модель 405B с производительностью на уровне [GPT-4o](https://systems-analysis.info/wiki/GPT-4o "GPT-4o"). Контекстное окно до 128 тыс. токенов. Появилась возможность обработки изображений.                                                                                                                                                                |
| **LLaMA 4**    | (план: апрель 2025)                                                               | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Архитектура Mixture-of-Experts (MoE). Нативная мультимодальность (текст, изображения, видео). Контекстное окно до 10 млн токенов.                                                                                                                                                                                                                                       |

Хронология развития моделей LLaMA

## Архитектура

LLaMA использует архитектуру авторегрессионного трансформера-декодера, но вводит ряд ключевых улучшений, повышающих эффективность вычислений и качество генерируемого текста:

- **Pre-normalization (Предварительная нормализация)**. Нормализация применяется на входе каждого подслоя трансформера, а не на выходе. Этот подход стабилизирует обучение очень глубоких сетей и предотвращает проблемы с градиентами.
- **RMSNorm (Root Mean Square Layer Normalization)**. Вместо стандартной LayerNorm используется RMSNorm. Эта техника нормализации устраняет операцию вычитания среднего, что ускоряет вычисления на 10–50% при сохранении стабильности.
- **SwiGLU (Swish-Gated Linear Unit)**. В качестве функции активации вместо ReLU или GELU используется SwiGLU. Этот механизм гейтирования (gating mechanism) создаёт более плавный градиентный поток и улучшает качество модели.
- **RoPE (Rotary Position Embeddings, Ротационные позиционные эмбеддинги)**. Для кодирования позиций токенов применяются относительные позиционные эмбеддинги RoPE, которые позволяют модели лучше экстраполировать на последовательности, превышающие по длине те, что использовались при обучении.
- **GQA (Grouped-Query Attention)**. Внедрённая в LLaMA 2, эта техника является оптимизацией многоголового внимания, которая значительно снижает требования к памяти и ускоряет генерацию текста.
- **Mixture-of-Experts (MoE)** (планируется в LLaMA 4). Архитектура, которая разделяет параметры модели на "экспертные" подсети, активируя лишь небольшую их часть для каждого запроса. Это резко сокращает вычислительные затраты на инференс.

### Конфигурации LLaMA 1

| Модель | Параметры | Размерность скрытого состояния | Кол-во слоёв | Кол-во голов внимания | Объём обучающих данных |
|--------|-----------|--------------------------------|--------------|-----------------------|------------------------|
| 7B     | 6.7B      | 4096                           | 32           | 32                    | 1.0T токенов           |
| 13B    | 13.0B     | 5120                           | 40           | 40                    | 1.0T токенов           |
| 33B    | 32.5B     | 6656                           | 60           | 52                    | 1.4T токенов           |
| 65B    | 65.2B     | 8192                           | 80           | 64                    | 1.4T токенов           |

Архитектурные параметры моделей LLaMA 1

## Обучающие данные

Объём обучающих корпусов вырос с 1,4 трлн токенов для LLaMA 1 до 15 трлн для LLaMA 3. Для обучения используются общедоступные источники, включая Common Crawl (составляет до 67% данных), C4, GitHub, Wikipedia, Books, ArXiv и Stack Exchange. Для LLaMA 3 также использовались высококачественные приватные данные.

## Производительность и сравнение

- **На бенчмарках**: Модель LLaMA 3.1 (405B) показывает результаты, близкие к GPT-4o: на тесте MMLU она достигает 88,6%, уступая GPT-4o всего 0,1 процентного пункта. На задаче генерации кода HumanEval LLaMA 3.1 показывает 89% (GPT-4o — 90,2%).
- **Параметрическая эффективность**: Модели LLaMA с меньшим числом параметров часто превосходят более крупные модели конкурентов. Например, LLaMA 1 (13B) превзошла GPT-3 (175B) на большинстве тестов.
- **Стоимость**: При локальном хостинге стоимость инференса LLaMA может быть до 50 раз ниже по сравнению с использованием проприетарных API, что делает технологию доступной для малого и среднего бизнеса.

## Лицензирование

- **LLaMA 1** распространялась по некоммерческой исследовательской лицензии с доступом по запросу.
- **LLaMA 2 и более поздние версии** распространяются по лицензии Llama Community License, которая разрешает коммерческое использование и модификацию. Однако лицензия содержит ограничения: компании с более чем 700 млн активных пользователей в месяц должны получать специальное разрешение от Meta. Это вызывает дискуссии о том, является ли LLaMA полностью открытой моделью.

## Применение

Модели LLaMA интегрированы в продукты тысяч компаний и используются в различных сферах:

- Корпоративный сектор: Zoom использует LLaMA в AI Companion для резюме встреч; Shopify — для обработки 40–60 млн запросов в день для обогащения метаданных товаров; Instacart — во внутреннем помощнике Ava.
- Наука и общество: Meditron (адаптация LLaMA) используется для медицинской диагностики в регионах с ограниченными ресурсами;
- Государственный сектор и промышленность: Meta заключила партнерства с Lockheed Martin и Palantir. NASA использует LLaMA 3 на МКС в качестве офлайн-ассистента для выполнения критических операций без связи с Землёй.

## Ограничения и критика

- Предвзятость и безопасность: Независимые аудиты показывают, что модели LLaMA, несмотря на меры безопасности, могут воспроизводить вредные стереотипы. Утечка весов LLaMA 1 обострила вопросы о потенциальном злонамеренном использовании технологии.
- Пробелы в знаниях: В узкоспециализированных областях LLaMA может демонстрировать пробелы. Например, точность на медицинском тесте nephSAP составила 17–30% против 73% у GPT-4.
- Энергопотребление: Обучение крупных моделей требует огромных ресурсов. Тренировка LLaMA 1 потребовала 2 638 МВт·ч, что эквивалентно выбросам 1 015 тонн CO₂.

## Будущее

Meta планирует инвестировать до 65 миллиардов долларов в AI-инфраструктуру к 2025 году. В разработке находится модель **LLaMA 4 Behemoth** с 2 триллионами параметров, которая будет поддерживать более 200 языков и получит глубокую интеграцию с продуктами метавселенной.

## См. также

- [GPT](https://systems-analysis.info/wiki/GPT "GPT")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [Трансформер (архитектура нейронной сети)](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")

## Литература

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Grattafiori, A. et al. (2024). *The Llama 3 Herd of Models*. <a href="https://arxiv.org/abs/2407.21783" class="external text" rel="nofollow">arXiv:2407.21783</a>.
- Jiang, Z. et al. (2023). *Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers*. <a href="https://arxiv.org/abs/2305.14858" class="external text" rel="nofollow">arXiv:2305.14858</a>.
- Rozière, B. et al. (2023). *Code Llama: Open Foundation Models for Code*. <a href="https://arxiv.org/abs/2308.12950" class="external text" rel="nofollow">arXiv:2308.12950</a>.
- Shazeer, N. (2020). *GLU Variants Improve Transformer*. <a href="https://arxiv.org/abs/2002.05202" class="external text" rel="nofollow">arXiv:2002.05202</a>.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Touvron, H. et al. (2023). *Llama 2: Open Foundation and Fine‑Tuned Chat Models*. <a href="https://arxiv.org/abs/2307.09288" class="external text" rel="nofollow">arXiv:2307.09288</a>.
- Zhang, B.; Sennrich, R. (2019). *Root Mean Square Layer Normalization*. <a href="https://arxiv.org/abs/1910.07467" class="external text" rel="nofollow">arXiv:1910.07467</a>.

## Примечания

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/wiki/LLaMA#cite_ref-1) Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/wiki/LLaMA#cite_ref-2) LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. <a href="https://ai.meta.com/blog/meta-llama-3-1/" class="external text" rel="nofollow">официальный анонс Meta</a>.</span>
