Gemma
Gemma — это семейство свободно доступных языковых моделей, разработанных и выпущенных компанией Google (подразделение Google DeepMind). Модели Gemma основаны на той же исследовательской и технологической базе, что и флагманское семейство Gemini, и позиционируются как их облегчённые, высокопроизводительные версии[1]. Название происходит от латинского слова gemma, означающего «драгоценный камень»[2].
Gemma относится к категории open models (открытые модели): Google публикует веса моделей, что позволяет исследователям и разработчикам свободно их использовать, дообучать и распространять, в том числе в коммерческих проектах, при соблюдении условий ответственного использования[2]. Это ключевое отличие от моделей Gemini, доступ к которым возможен только через облачные API. Модели Gemma способны работать локально на потребительском оборудовании (ноутбуках, настольных компьютерах с GPU), а не только в дата-центрах[3].
Разработка и релизы
Семейство Gemma включает несколько поколений моделей, каждое из которых привносило улучшения в архитектуре, производительности и возможностях.
Первое поколение: Gemma 1
Первая версия Gemma была выпущена 21 февраля 2024 года[4]. В её состав вошли две текстовые модели, основанные на архитектуре декодерного трансформера:
- Gemma 2B (2 миллиарда параметров)
- Gemma 7B (7 миллиардов параметров)
На момент выхода Google заявляла, что эти модели превосходят значительно более крупные аналоги по ключевым бенчмаркам[2]. Исходные модели были преимущественно англоязычными, но обучались на разнообразных данных, включая веб-документы, программный код и математические задачи[1]. Обе модели были выпущены в двух вариантах: базовом (pre-trained) и инструкционно-дообученном (instruction-tuned) для лучшего следования командам пользователя[2].
Второе поколение: Gemma 2
Gemma 2 была анонсирована 27 июня 2024 года и принесла значительные улучшения[1].
- Размеры моделей: Были выпущены модели на 9 и 27 миллиардов параметров. Меньшие варианты обучались с применением методики дистилляции знаний из более крупной модели для повышения качества[5].
- Контекстное окно: Было значительно расширено до 80 000 токенов (по сравнению с 8192 в первой версии)[6][7].
- Архитектурные улучшения: Были внедрены механизмы grouped-query attention и чередующаяся схема локального и глобального внимания для эффективной работы с длинным контекстом[1].
Третье поколение: Gemma 3
Gemma 3 была представлена в марте 2025 года как следующий шаг в развитии семейства с упором на мультимодальность и расширенный охват задач[6].
- Мультимодальность: Модели получили поддержку изображений и видео в качестве входных данных наряду с текстом.
- Размеры и языки: Модельный ряд охватывает четыре размера (1B, 4B, 12B, 27B) и поддерживает до 140 языков[6].
- Контекстное окно: Увеличено до 128 000 токенов[6].
По данным Google, Gemma 3 27B показала результаты на уровне лучших открытых моделей своего времени, уступив в рейтингах лишь специализированным моделям, таким как DeepSeek-R1[6].
Архитектура и технические особенности
Модели Gemma основаны на архитектуре трансформера в конфигурации «только декодер» (decoder-only), аналогичной моделям GPT[7]. Это означает, что модель генерирует текст авторегрессионно, предсказывая следующий токен на основе всех предыдущих. Ключевые технические решения включают:
- Ротационные позиционные эмбеддинги (RoPE): Вместо абсолютных позиционных эмбеддингов используются RoPE, что позволяет эффективно кодировать позиционную информацию.
- Multi-query и Grouped-query attention: Для ускорения и экономии памяти в меньших моделях (например, Gemma 2B) используется multi-query attention (единый ключ/значение для всех голов внимания). В Gemma 2 был внедрен механизм grouped-query attention, где запросы разбиваются на группы, что является компромиссом между скоростью и качеством[1][7].
- Чередующаяся схема внимания: В Gemma 2 реализована схема, где слои с глобальным самовниманием чередуются со слоями с ограниченным «скользящим окном», что позволяет эффективно обрабатывать длинные контексты[1].
Семейство моделей и варианты
Помимо универсальных базовых моделей, Google выпустила несколько производных версий Gemma, оптимизированных под конкретные задачи.
- CodeGemma: Модель для генерации и дополнения программного кода, поддерживающая C++, C#, Go, Java, JavaScript, Python, Rust и другие языки[1].
- DataGemma: Семейство моделей, дообученных для интеграции с внешними данными с использованием техник RAG. Модель способна выполнять поисковые запросы к базам данных (например, Google Data Commons) для повышения фактической точности ответов[1].
- PaliGemma: Мультимодальная модель, способная принимать на вход изображения и текст. Она предназначена для задач визуального вопросно-ответного взаимодействия, таких как описание изображений и распознавание объектов[1].
- RecurrentGemma: Экспериментальный вариант с гибридной архитектурой Griffin, сочетающей локальное внимание и линейные рекуррентные связи. Это позволяет значительно ускорить генерацию длинных последовательностей[7].
- MedGemma: Специализированная версия Gemma 3 для медицинской области. Включает мультимодальные (4B) и текстовые (27B) модели для анализа медицинских изображений (рентгенограмм, срезов) и клинических документов. Модели распространяются как открытые, но не предназначены для прямого клинического использования без дополнительной валидации[8].
- DolphinGemma: Исследовательский проект по применению технологий Gemma для расшифровки коммуникаций дельфинов. Модель обучена на многолетних аудио-записях и используется для выявления паттернов в языке животных[9].
Доступность и применение
Модели Gemma доступны на платформах Kaggle и Hugging Face, а также интегрированы в сервисы Google Colab и Vertex AI Model Garden[2]. Для ускорения инференса Google в сотрудничестве с NVIDIA провела адаптацию моделей под TensorRT. Лицензионные условия Gemma допускают коммерческое использование и модификацию моделей, что отличает их от некоторых других открытых проектов. Распространение регулируется лицензией Responsible AI License, которая накладывает ограничения на использование в определённых областях (например, разработка оружия) и требует от производных продуктов соблюдения принципов безопасного и этичного применения ИИ[3].
Безопасность и ответственность
Разработчики уделили большое внимание вопросам безопасности, учитывая открытый характер моделей.
- Фильтрация данных: При подготовке обучающих датасетов были автоматически отфильтрованы персональные данные и другая чувствительная информация для снижения риска утечек[2].
- Выравнивание (Alignment): Инструкционные версии моделей прошли многоэтапное выравнивание с использованием методик Supervised Fine-Tuning (SFT) и RLHF (обучение с подкреплением на основе отзывов человека) для закрепления предпочтительных стилей ответа[1].
- Ред-тиминг (Red Teaming): Перед выпуском модели были подвергнуты углублённой проверке на устойчивость к злонамеренным запросам. Эксперты пытались спровоцировать генерацию опасного или нежелательного контента для выявления уязвимостей[3].
- Инструментарий Responsible AI Toolkit: Вместе с моделями Google выпустила набор инструментов для облегчения безопасного развёртывания, включая утилиту Gemma Debugger для анализа внутренних состояний модели и классификаторы нежелательного контента[2].
- ShieldGemma: Специализированная модель-фильтр, предназначенная для предотвращения генерации небезопасного контента в мультимодальных версиях Gemma[6].
См. также
Ссылки
Литература
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
Примечания
- ↑ 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 «What Is Google Gemma?». IBM. [1]
- ↑ 2,0 2,1 2,2 2,3 2,4 2,5 2,6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
- ↑ 3,0 3,1 3,2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
- ↑ «Google launches two new open LLMs». TechCrunch. [4]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6,0 6,1 6,2 6,3 6,4 6,5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
- ↑ 7,0 7,1 7,2 7,3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]