Gemma (Google) (BG)
Gemma — това е семейство свободно достъпни езикови модели, разработени и пуснати от компанията Google (подразделение Google DeepMind). Моделите Gemma се основават на същата изследователска и технологична база като флагманското семейство Gemini и се позиционират като техни облекчени, високопроизводителни версии[1]. Наименованието произлиза от латинската дума gemma, означаваща „скъпоценен камък"[2].
Gemma принадлежи към категорията open models (отворени модели): Google публикува теглата на моделите, което позволява на изследователи и разработчици свободно да ги използват, дообучават и разпространяват, включително в търговски проекти, при спазване на условията за отговорно използване[2]. Това е ключовото отличие от моделите Gemini, достъпът до които е възможен само чрез облачни API. Моделите Gemma могат да работят локално на потребителско оборудване (лаптопи, настолни компютри с GPU), а не само в центрове за данни[3].
Разработка и издания
Семейството Gemma включва няколко поколения модели, всяко от които въвеждаше подобрения в архитектурата, производителността и възможностите.
Първо поколение: Gemma 1
Първата версия на Gemma беше пусната 21 февруари 2024 година[4]. В нейния състав влязоха два текстови модела, основани на архитектурата на декодерен transformer:
- Gemma 2B (2 милиарда параметра)
- Gemma 7B (7 милиарда параметра)
По времето на излизането си Google заявяваше, че тези модели превъзхождат значително по-големи аналози по ключови benchmark-ове[2]. Изходните модели бяха предимно англоезични, но обучавани върху разнообразни данни, включително уеб документи, програмен код и математически задачи[1]. И двата модела бяха пуснати в два варианта: базов (pre-trained) и инструкционно дообучен (instruction-tuned) за по-добро следване на командите на потребителя[2].
Второ поколение: Gemma 2
Gemma 2 беше анонсирана 27 юни 2024 година и донесе значителни подобрения[1].
- Размери на моделите: Бяха пуснати модели с 9 и 27 милиарда параметра. По-малките варианти бяха обучавани с прилагане на методиката за дистилация на знания от по-голям модел с цел повишаване на качеството[5].
- Контекстен прозорец: Беше значително разширен до 80 000 token-а (в сравнение с 8192 в първата версия)[6][7].
- Архитектурни подобрения: Бяха въведени механизми grouped-query attention и редуваща се схема на локално и глобално внимание за ефективна работа с дълъг контекст[1].
Трето поколение: Gemma 3
Gemma 3 беше представена март 2025 година като следваща стъпка в развитието на семейството с акцент върху мултимодалността и разширения обхват на задачите[6].
- Мултимодалност: Моделите получиха поддръжка на изображения и видео като входни данни наред с текст.
- Размери и езици: Гамата от модели обхваща четири размера (1B, 4B, 12B, 27B) и поддържа до 140 езика[6].
- Контекстен прозорец: Увеличен до 128 000 token-а[6].
Според данни на Google, Gemma 3 27B показа резултати на нивото на най-добрите отворени модели по своето време, отстъпвайки в класациите единствено на специализирани модели като DeepSeek-R1[6].
Архитектура и технически особености
Моделите Gemma се основават на архитектурата transformer в конфигурация „само декодер" (decoder-only), аналогична на моделите GPT[7]. Това означава, че моделът генерира текст авторегресионно, предсказвайки следващия token въз основа на всички предходни. Ключовите технически решения включват:
- Ротационни позиционни embedding-и (RoPE): Вместо абсолютни позиционни embedding-и се използват RoPE, което позволява ефективно кодиране на позиционната информация.
- Multi-query и Grouped-query attention: За ускоряване и икономия на памет в по-малките модели (например Gemma 2B) се използва multi-query attention (единичен ключ/стойност за всички глави на внимание). В Gemma 2 беше въведен механизмът grouped-query attention, при който заявките се разпределят в групи, което представлява компромис между скорост и качество[1][7].
- Редуваща се схема на внимание: В Gemma 2 е реализирана схема, при която слоевете с глобално самовнимание се редуват със слоеве с ограничен „плъзгащ се прозорец", което позволява ефективна обработка на дълги контексти[1].
Семейство модели и варианти
Освен универсалните базови модели, Google пусна няколко производни версии на Gemma, оптимизирани за конкретни задачи.
- CodeGemma: Модел за генериране и допълване на програмен код, поддържащ C++, C#, Go, Java, JavaScript, Python, Rust и други езици[1].
- DataGemma: Семейство модели, дообучени за интеграция с външни данни с използване на техники RAG. Моделът може да изпълнява заявки за търсене в бази данни (например Google Data Commons) за повишаване на фактическата точност на отговорите[1].
- PaliGemma: Мултимодален модел, способен да приема изображения и текст като входни данни. Той е предназначен за задачи на визуално въпросно-отговорно взаимодействие, като описание на изображения и разпознаване на обекти[1].
- RecurrentGemma: Експериментален вариант с хибридна архитектура Griffin, съчетаваща локално внимание и линейни рекурентни връзки. Това позволява значително ускоряване на генерирането на дълги последователности[7].
- MedGemma: Специализирана версия на Gemma 3 за медицинската област. Включва мултимодални (4B) и текстови (27B) модели за анализ на медицински изображения (рентгенограми, срезове) и клинични документи. Моделите се разпространяват като отворени, но не са предназначени за пряко клинично използване без допълнителна валидация[8].
- DolphinGemma: Изследователски проект за прилагане на технологиите Gemma за разшифроване на комуникациите на делфини. Моделът е обучен върху многогодишни аудиозаписи и се използва за разкриване на модели в езика на животните[9].
Достъпност и приложение
Моделите Gemma са достъпни на платформите Kaggle и Hugging Face, а също така са интегрирани в услугите Google Colab и Vertex AI Model Garden[2]. За ускоряване на инференса Google в сътрудничество с NVIDIA извърши адаптация на моделите за TensorRT. Лицензионните условия на Gemma допускат търговско използване и модификация на моделите, което ги отличава от някои други отворени проекти. Разпространението се регулира от лиценза Responsible AI License, който налага ограничения върху използването в определени области (например разработка на оръжие) и изисква от производните продукти да спазват принципите за безопасно и етично прилагане на ИИ[3].
Безопасност и отговорност
Разработчиците обърнаха голямо внимание на въпросите за безопасност, като се имат предвид отворения характер на моделите.
- Филтриране на данни: При подготовката на обучителните dataset-и личните данни и друга чувствителна информация бяха автоматично филтрирани за намаляване на риска от изтичане[2].
- Изравняване (Alignment): Инструкционните версии на моделите преминаха многоетапно изравняване с използване на методиките Supervised Fine-Tuning (SFT) и RLHF (обучение с подкрепление въз основа на обратна връзка от хора) за затвърждаване на предпочитани стилове на отговор[1].
- Ред-тийминг (Red Teaming): Преди пускането модели бяха подложени на задълбочена проверка за устойчивост към злонамерени заявки. Експерти се опитваха да предизвикат генериране на опасно или нежелано съдържание с цел разкриване на уязвимости[3].
- Инструментариум Responsible AI Toolkit: Заедно с моделите Google пусна набор от инструменти за улесняване на безопасното внедряване, включително помощната програма Gemma Debugger за анализ на вътрешните състояния на модела и класификатори на нежелано съдържание[2].
- ShieldGemma: Специализиран модел-филтър, предназначен за предотвратяване на генерирането на опасно съдържание в мултимодалните версии на Gemma[6].
Препратки
- Официална страница на Gemma на сайта Google AI
- Модели Gemma на Hugging Face
Литература
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
Бележки
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
- ↑ 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
- ↑ «Google launches two new open LLMs». TechCrunch. [4]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
- ↑ 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]