LLaMA

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

LLaMA (Large Language Model Meta AI) — семейство больших языковых моделей (LLM) с преимущественно открытым исходным кодом, разрабатываемое исследовательским подразделением Meta AI. Модели LLaMA строятся на модифицированной архитектуре трансформеров и ориентированы на высокую эффективность вычислений, демократизацию доступа к передовым ИИ-технологиям и лёгкую адаптацию под специализированные задачи. Семейство эволюционировало от первоначального исследовательского релиза LLaMA 1 (февраль 2023 года) до мультимодальных моделей LLaMA 4 (планируемый релиз в 2026 году).

Наименование

Аббревиатура LLaMA расшифровывается как Large Language Model Meta AI (Большая языковая модель Meta AI).

  • Large Language Model — подчёркивает масштаб моделей, параметры которых измеряются от миллиардов до триллионов.
  • Meta AI — указывает на разработчика, исследовательскую группу Meta.

История создания

Разработка LLaMA началась в конце 2022 года как стратегический ответ Meta на успех ChatGPT от OpenAI. Марк Цукерберг сформировал междисциплинарную команду, включающую исследователей из лаборатории FAIR (Facebook AI Research). Ключевую роль в философии проекта сыграл Янн Лекун, руководитель FAIR, который с 2013 года придерживался принципа полной открытости всех исследований лаборатории.

Первая версия, LLaMA 1, была выпущена в феврале 2023 года с исследовательской лицензией. Вскоре после релиза, в марте 2023 года, веса модели утекли в сеть через BitTorrent. Это событие, вопреки опасениям, не остановило, а, наоборот, подстегнуло развитие проекта, так как дало возможность независимым исследователям и энтузиастам по всему миру экспериментировать с моделью. В результате на платформе Hugging Face появились десятки тысяч производных моделей. Последующие версии, начиная с LLaMA 2, выпускались уже с коммерческой лицензией[1], закрепляя статус LLaMA как ключевого игрока на рынке открытых ИИ-моделей.

Эволюция моделей и хронология релизов

Хронология развития моделей LLaMA
Версия Дата выпуска Диапазон параметров Ключевые инновации и особенности
LLaMA 1 Февраль 2023 7B – 65B Базовая архитектура (RMSNorm, SwiGLU, RoPE). Обучение на 1,4 трлн токенов. Контекстное окно 2048 токенов. Исследовательская лицензия.
LLaMA 2 Июль 2023 7B – 70B Дообучение для диалогов (RLHF). Внедрение Grouped-Query Attention (GQA). Контекстное окно 4096 токенов. Первая коммерческая лицензия.
Code Llama Август 2023 7B – 70B Специализированная версия для кода. Дообучение на 500 млрд токенов кода. Варианты: базовый, Python-специализированный, instruction-tuned.
LLaMA 3 Апрель 2024 8B, 70B Обучение на 15 трлн токенов. Улучшенный токенизатор со словарём на 128 тыс. токенов. Высокая производительность (82% на MMLU).
LLaMA 3.1 Июль 2024[2] 8B, 70B, 405B Флагманская модель 405B с производительностью на уровне GPT-4o. Контекстное окно до 128 тыс. токенов. Появилась возможность обработки изображений.
LLaMA 4 (план: апрель 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Архитектура Mixture-of-Experts (MoE). Нативная мультимодальность (текст, изображения, видео). Контекстное окно до 10 млн токенов.

Архитектура

LLaMA использует архитектуру авторегрессионного трансформера-декодера, но вводит ряд ключевых улучшений, повышающих эффективность вычислений и качество генерируемого текста:

  • Pre-normalization (Предварительная нормализация). Нормализация применяется на входе каждого подслоя трансформера, а не на выходе. Этот подход стабилизирует обучение очень глубоких сетей и предотвращает проблемы с градиентами.
  • RMSNorm (Root Mean Square Layer Normalization). Вместо стандартной LayerNorm используется RMSNorm. Эта техника нормализации устраняет операцию вычитания среднего, что ускоряет вычисления на 10–50% при сохранении стабильности.
  • SwiGLU (Swish-Gated Linear Unit). В качестве функции активации вместо ReLU или GELU используется SwiGLU. Этот механизм гейтирования (gating mechanism) создаёт более плавный градиентный поток и улучшает качество модели.
  • RoPE (Rotary Position Embeddings, Ротационные позиционные эмбеддинги). Для кодирования позиций токенов применяются относительные позиционные эмбеддинги RoPE, которые позволяют модели лучше экстраполировать на последовательности, превышающие по длине те, что использовались при обучении.
  • GQA (Grouped-Query Attention). Внедрённая в LLaMA 2, эта техника является оптимизацией многоголового внимания, которая значительно снижает требования к памяти и ускоряет генерацию текста.
  • Mixture-of-Experts (MoE) (планируется в LLaMA 4). Архитектура, которая разделяет параметры модели на "экспертные" подсети, активируя лишь небольшую их часть для каждого запроса. Это резко сокращает вычислительные затраты на инференс.

Конфигурации LLaMA 1

Архитектурные параметры моделей LLaMA 1
Модель Параметры Размерность скрытого состояния Кол-во слоёв Кол-во голов внимания Объём обучающих данных
7B 6.7B 4096 32 32 1.0T токенов
13B 13.0B 5120 40 40 1.0T токенов
33B 32.5B 6656 60 52 1.4T токенов
65B 65.2B 8192 80 64 1.4T токенов

Обучающие данные

Объём обучающих корпусов вырос с 1,4 трлн токенов для LLaMA 1 до 15 трлн для LLaMA 3. Для обучения используются общедоступные источники, включая Common Crawl (составляет до 67% данных), C4, GitHub, Wikipedia, Books, ArXiv и Stack Exchange. Для LLaMA 3 также использовались высококачественные приватные данные.

Производительность и сравнение

  • На бенчмарках: Модель LLaMA 3.1 (405B) показывает результаты, близкие к GPT-4o: на тесте MMLU она достигает 88,6%, уступая GPT-4o всего 0,1 процентного пункта. На задаче генерации кода HumanEval LLaMA 3.1 показывает 89% (GPT-4o — 90,2%).
  • Параметрическая эффективность: Модели LLaMA с меньшим числом параметров часто превосходят более крупные модели конкурентов. Например, LLaMA 1 (13B) превзошла GPT-3 (175B) на большинстве тестов.
  • Стоимость: При локальном хостинге стоимость инференса LLaMA может быть до 50 раз ниже по сравнению с использованием проприетарных API, что делает технологию доступной для малого и среднего бизнеса.

Лицензирование

  • LLaMA 1 распространялась по некоммерческой исследовательской лицензии с доступом по запросу.
  • LLaMA 2 и более поздние версии распространяются по лицензии Llama Community License, которая разрешает коммерческое использование и модификацию. Однако лицензия содержит ограничения: компании с более чем 700 млн активных пользователей в месяц должны получать специальное разрешение от Meta. Это вызывает дискуссии о том, является ли LLaMA полностью открытой моделью.

Применение

Модели LLaMA интегрированы в продукты тысяч компаний и используются в различных сферах:

  • Корпоративный сектор: Zoom использует LLaMA в AI Companion для резюме встреч; Shopify — для обработки 40–60 млн запросов в день для обогащения метаданных товаров; Instacart — во внутреннем помощнике Ava.
  • Наука и общество: Meditron (адаптация LLaMA) используется для медицинской диагностики в регионах с ограниченными ресурсами;
  • Государственный сектор и промышленность: Meta заключила партнерства с Lockheed Martin и Palantir. NASA использует LLaMA 3 на МКС в качестве офлайн-ассистента для выполнения критических операций без связи с Землёй.

Ограничения и критика

  • Предвзятость и безопасность: Независимые аудиты показывают, что модели LLaMA, несмотря на меры безопасности, могут воспроизводить вредные стереотипы. Утечка весов LLaMA 1 обострила вопросы о потенциальном злонамеренном использовании технологии.
  • Пробелы в знаниях: В узкоспециализированных областях LLaMA может демонстрировать пробелы. Например, точность на медицинском тесте nephSAP составила 17–30% против 73% у GPT-4.
  • Энергопотребление: Обучение крупных моделей требует огромных ресурсов. Тренировка LLaMA 1 потребовала 2 638 МВт·ч, что эквивалентно выбросам 1 015 тонн CO₂.

Будущее

Meta планирует инвестировать до 65 миллиардов долларов в AI-инфраструктуру к 2025 году. В разработке находится модель LLaMA 4 Behemoth с 2 триллионами параметров, которая будет поддерживать более 200 языков и получит глубокую интеграцию с продуктами метавселенной.

См. также

Литература

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Примечания

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.