Gemma (Google) (CS)
Gemma — je rodina volně dostupných jazykových modelů, vyvinutých a vydaných společností Google (divize Google DeepMind). Modely Gemma jsou postaveny na stejném výzkumném a technologickém základu jako vlajková rodina Gemini a jsou prezentovány jako jejich odlehčené, vysoce výkonné verze[1]. Název pochází z latinského slova gemma, znamenajícího „drahokam"[2].
Gemma patří do kategorie open models (otevřené modely): Google zveřejňuje váhy modelů, což umožňuje výzkumníkům a vývojářům je volně používat, dolaďovat a šířit, a to i v komerčních projektech, při dodržení podmínek odpovědného využívání[2]. To je klíčový rozdíl od modelů Gemini, k nimž je přístup možný pouze prostřednictvím cloudových API. Modely Gemma jsou schopny fungovat lokálně na spotřebitelském hardwaru (noteboocích, stolních počítačích s GPU), nejen v datových centrech[3].
Vývoj a vydání
Rodina Gemma zahrnuje několik generací modelů, z nichž každá přinesla vylepšení v architektuře, výkonu a možnostech.
První generace: Gemma 1
První verze Gemma byla vydána 21. února 2024[4]. Zahrnovala dva textové modely založené na architektuře dekodérového transformeru:
- Gemma 2B (2 miliardy parametrů)
- Gemma 7B (7 miliard parametrů)
V době vydání Google prohlašoval, že tyto modely předčí výrazně větší alternativy v klíčových benchmarcích[2]. Původní modely byly převážně anglicky zaměřené, ale trénovány na různorodých datech, včetně webových dokumentů, programového kódu a matematických úloh[1]. Oba modely byly vydány ve dvou variantách: základní (pre-trained) a instrukčně doladěné (instruction-tuned) pro lepší následování příkazů uživatele[2].
Druhá generace: Gemma 2
Gemma 2 byla oznámena 27. června 2024 a přinesla významná vylepšení[1].
- Velikosti modelů: Byly vydány modely s 9 a 27 miliardami parametrů. Menší varianty byly trénovány s využitím metody destilace znalostí z většího modelu za účelem zvýšení kvality[5].
- Kontextové okno: Bylo výrazně rozšířeno na 80 000 tokenů (v porovnání s 8192 v první verzi)[6][7].
- Architektonická vylepšení: Byly zavedeny mechanismy grouped-query attention a střídající se schéma lokální a globální pozornosti pro efektivní práci s dlouhým kontextem[1].
Třetí generace: Gemma 3
Gemma 3 byla představena v březnu 2025 jako další krok v rozvoji rodiny s důrazem na multimodalitu a rozšířený záběr úloh[6].
- Multimodalita: Modely získaly podporu obrázků a videa jako vstupních dat společně s textem.
- Velikosti a jazyky: Modelová řada zahrnuje čtyři velikosti (1B, 4B, 12B, 27B) a podporuje až 140 jazyků[6].
- Kontextové okno: Zvětšeno na 128 000 tokenů[6].
Podle údajů Google dosáhla Gemma 3 27B výsledků na úrovni nejlepších otevřených modelů své doby, přičemž v žebříčcích zaostala pouze za specializovanými modely, jako je DeepSeek-R1[6].
Architektura a technické vlastnosti
Modely Gemma jsou postaveny na architektuře transformeru v konfiguraci „pouze dekodér" (decoder-only), analogické modelům GPT[7]. To znamená, že model generuje text autoregresivně, přičemž předpovídá následující token na základě všech předchozích. Klíčová technická řešení zahrnují:
- Rotační poziční embeddingy (RoPE): Namísto absolutních pozičních embeddingů jsou využívány RoPE, což umožňuje efektivní kódování poziční informace.
- Multi-query a Grouped-query attention: Pro urychlení a úsporu paměti v menších modelech (např. Gemma 2B) je využíváno multi-query attention (jeden klíč/hodnota pro všechny hlavy pozornosti). V Gemma 2 byl zaveden mechanismus grouped-query attention, kde jsou dotazy rozděleny do skupin, což představuje kompromis mezi rychlostí a kvalitou[1][7].
- Střídající se schéma pozornosti: V Gemma 2 je realizováno schéma, kde se vrstvy s globální vlastní pozorností střídají s vrstvami s omezeným „klouzavým oknem", což umožňuje efektivní zpracování dlouhých kontextů[1].
Rodina modelů a varianty
Kromě univerzálních základních modelů vydal Google několik odvozených verzí Gemma optimalizovaných pro konkrétní úlohy.
- CodeGemma: Model pro generování a doplňování programového kódu, podporující C++, C#, Go, Java, JavaScript, Python, Rust a další jazyky[1].
- DataGemma: Rodina modelů doladěných pro integraci s externími daty s využitím technik RAG. Model je schopen provádět vyhledávací dotazy do databází (např. Google Data Commons) pro zvýšení faktické přesnosti odpovědí[1].
- PaliGemma: Multimodální model schopný přijímat na vstupu obrázky i text. Je určen pro úlohy vizuálního otázání a odpovídání, jako je popis obrázků a rozpoznávání objektů[1].
- RecurrentGemma: Experimentální varianta s hybridní architekturou Griffin, kombinující lokální pozornost a lineární rekurentní vazby. To umožňuje výrazné urychlení generování dlouhých sekvencí[7].
- MedGemma: Specializovaná verze Gemma 3 pro medicínskou oblast. Zahrnuje multimodální (4B) a textové (27B) modely pro analýzu lékařských snímků (rentgenogramů, řezů) a klinických dokumentů. Modely jsou šířeny jako otevřené, avšak nejsou určeny k přímému klinickému použití bez dodatečné validace[8].
- DolphinGemma: Výzkumný projekt aplikující technologie Gemma k dešifrování komunikace delfínů. Model je trénován na mnohaletých audio nahrávkách a slouží k odhalování vzorců v jazyce zvířat[9].
Dostupnost a využití
Modely Gemma jsou dostupné na platformách Kaggle a Hugging Face a jsou také integrovány do služeb Google Colab a Vertex AI Model Garden[2]. Pro urychlení inference provedl Google ve spolupráci s NVIDIA adaptaci modelů pro TensorRT. Licenční podmínky Gemma umožňují komerční využití a úpravy modelů, což je odlišuje od některých jiných otevřených projektů. Šíření je regulováno licencí Responsible AI License, která ukládá omezení na použití v určitých oblastech (např. vývoj zbraní) a požaduje od odvozených produktů dodržování zásad bezpečného a etického využívání AI[3].
Bezpečnost a odpovědnost
Vývojáři věnovali velkou pozornost otázkám bezpečnosti s ohledem na otevřený charakter modelů.
- Filtrování dat: Při přípravě tréninkových datasetů byly automaticky odfiltrovány osobní údaje a další citlivé informace za účelem snížení rizika úniků[2].
- Vyrovnání (Alignment): Instrukční verze modelů prošly vícestupňovým vyrovnáním s využitím metodik Supervised Fine-Tuning (SFT) a RLHF (zpětnovazební učení na základě hodnocení člověkem) pro upevnění preferovaných stylů odpovědí[1].
- Red Teaming: Před vydáním byly modely podrobeny hloubkové prověrce odolnosti vůči záškodnickým dotazům. Experti se pokoušeli vyprovokovat generování nebezpečného nebo nežádoucího obsahu za účelem odhalení zranitelností[3].
- Sada nástrojů Responsible AI Toolkit: Spolu s modely vydal Google sadu nástrojů pro usnadnění bezpečného nasazení, včetně nástroje Gemma Debugger pro analýzu vnitřních stavů modelu a klasifikátorů nežádoucího obsahu[2].
- ShieldGemma: Specializovaný model-filtr určený k prevenci generování nebezpečného obsahu v multimodálních verzích Gemma[6].
Odkazy
- Oficiální stránka Gemma na webu Google AI
- Modely Gemma na Hugging Face
Literatura
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
Poznámky
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
- ↑ 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
- ↑ «Google launches two new open LLMs». TechCrunch. [4]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
- ↑ 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]