Gemma (Google) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Gemma — dit is een familie van vrij beschikbare taalmodellen, ontwikkeld en uitgebracht door Google (divisie Google DeepMind). De Gemma-modellen zijn gebaseerd op dezelfde onderzoeks- en technologiebasis als de vlaggenschipfamilie Gemini, en worden gepositioneerd als lichtgewicht, hoogperformante versies daarvan[1]. De naam is afkomstig van het Latijnse woord gemma, dat «edelsteen» betekent[2].

Gemma behoort tot de categorie open models (open modellen): Google publiceert de modelgewichten, waardoor onderzoekers en ontwikkelaars deze vrij kunnen gebruiken, fine-tunen en verspreiden, ook in commerciële projecten, mits de voorwaarden voor verantwoord gebruik worden nageleefd[2]. Dit is het belangrijkste verschil met de Gemini-modellen, die alleen toegankelijk zijn via cloud-API's. Gemma-modellen kunnen lokaal draaien op consumentenhardware (laptops, desktopcomputers met GPU), en niet alleen in datacenters[3].

Ontwikkeling en releases

De Gemma-familie omvat meerdere generaties modellen, waarbij elke generatie verbeteringen bracht op het gebied van architectuur, prestaties en mogelijkheden.

Eerste generatie: Gemma 1

De eerste versie van Gemma werd uitgebracht op 21 februari 2024[4]. Deze omvatte twee tekstmodellen gebaseerd op de decoder-only transformer-architectuur:

  • Gemma 2B (2 miljard parameters)
  • Gemma 7B (7 miljard parameters)

Ten tijde van de release verklaarde Google dat deze modellen aanzienlijk grotere tegenhangers overtroffen op belangrijke benchmarks[2]. De oorspronkelijke modellen waren voornamelijk Engelstalig, maar werden getraind op gevarieerde data, waaronder webdocumenten, broncode en wiskundige vraagstukken[1]. Beide modellen werden uitgebracht in twee varianten: een basisvariant (pre-trained) en een instructie-gefinetuned (instruction-tuned) variant voor betere opvolging van gebruikersopdrachten[2].

Tweede generatie: Gemma 2

Gemma 2 werd aangekondigd op 27 juni 2024 en bracht aanzienlijke verbeteringen[1].

  • Modelgroottes: Er werden modellen uitgebracht met 9 en 27 miljard parameters. De kleinere varianten werden getraind met behulp van knowledge distillation vanuit een groter model om de kwaliteit te verbeteren[5].
  • Contextvenster: Aanzienlijk uitgebreid tot 80.000 tokens (vergeleken met 8192 in de eerste versie)[6][7].
  • Architectuurverbeteringen: Er werden mechanismen voor grouped-query attention en een afwisselend schema van lokale en globale attention geïntroduceerd voor efficiënte verwerking van lange contexten[1].

Derde generatie: Gemma 3

Gemma 3 werd gepresenteerd in maart 2025 als de volgende stap in de ontwikkeling van de familie, met nadruk op multimodaliteit en een breder taakbereik[6].

  • Multimodaliteit: De modellen kregen ondersteuning voor afbeeldingen en video als invoer, naast tekst.
  • Groottes en talen: De modellijn omvat vier groottes (1B, 4B, 12B, 27B) en ondersteunt tot 140 talen[6].
  • Contextvenster: Vergroot tot 128.000 tokens[6].

Volgens Google behaalde Gemma 3 27B resultaten op het niveau van de beste open modellen van zijn tijd, en eindigde in ranglijsten alleen achter gespecialiseerde modellen zoals DeepSeek-R1[6].

Architectuur en technische kenmerken

De Gemma-modellen zijn gebaseerd op de transformer-architectuur in de configuratie «alleen decoder» (decoder-only), vergelijkbaar met GPT-modellen[7]. Dit betekent dat het model tekst autoregressief genereert door het volgende token te voorspellen op basis van alle voorgaande tokens. De belangrijkste technische keuzes omvatten:

  • Roterende positionele embeddings (RoPE): In plaats van absolute positionele embeddings worden RoPE gebruikt, waarmee positionele informatie efficiënt kan worden gecodeerd.
  • Multi-query en Grouped-query attention: Voor versnelling en geheugenbesparing wordt in kleinere modellen (bijv. Gemma 2B) multi-query attention gebruikt (één sleutel/waarde voor alle attention-heads). In Gemma 2 werd het mechanisme van grouped-query attention geïntroduceerd, waarbij queries worden opgesplitst in groepen, als compromis tussen snelheid en kwaliteit[1][7].
  • Afwisselend attention-schema: In Gemma 2 is een schema geïmplementeerd waarbij lagen met globale self-attention afwisselen met lagen met een beperkt «sliding window», waardoor lange contexten efficiënt kunnen worden verwerkt[1].

Modelfamilie en varianten

Naast de universele basismodellen heeft Google meerdere afgeleide versies van Gemma uitgebracht, geoptimaliseerd voor specifieke taken.

  • CodeGemma: Een model voor het genereren en aanvullen van broncode, met ondersteuning voor C++, C#, Go, Java, JavaScript, Python, Rust en andere talen[1].
  • DataGemma: Een familie van modellen die zijn gefinetuned voor integratie met externe data via RAG-technieken. Het model kan zoekopdrachten uitvoeren op databases (bijv. Google Data Commons) om de feitelijke nauwkeurigheid van antwoorden te verbeteren[1].
  • PaliGemma: Een multimodaal model dat afbeeldingen en tekst als invoer kan verwerken. Het is bedoeld voor visuele vraag-en-antwoordtaken, zoals het beschrijven van afbeeldingen en het herkennen van objecten[1].
  • RecurrentGemma: Een experimentele variant met een hybride Griffin-architectuur die lokale attention combineert met lineaire recurrente verbindingen. Dit maakt het mogelijk de generatie van lange reeksen aanzienlijk te versnellen[7].
  • MedGemma: Een gespecialiseerde versie van Gemma 3 voor het medische domein. Omvat multimodale (4B) en tekstuele (27B) modellen voor de analyse van medische beelden (röntgenfoto's, doorsneden) en klinische documenten. De modellen worden verspreid als open modellen, maar zijn niet bedoeld voor direct klinisch gebruik zonder aanvullende validatie[8].
  • DolphinGemma: Een onderzoeksproject waarbij Gemma-technologieën worden toegepast voor het ontcijferen van dolfijnencommunicatie. Het model is getraind op jarenlange audio-opnames en wordt gebruikt om patronen in dierentaal te identificeren[9].

Beschikbaarheid en toepassing

De Gemma-modellen zijn beschikbaar op de platformen Kaggle en Hugging Face, en zijn geïntegreerd in de diensten Google Colab en Vertex AI Model Garden[2]. Voor versnelling van inferentie heeft Google in samenwerking met NVIDIA de modellen aangepast voor TensorRT. De licentievoorwaarden van Gemma staan commercieel gebruik en aanpassing van modellen toe, wat hen onderscheidt van sommige andere open projecten. De verspreiding wordt geregeld door de Responsible AI License, die beperkingen oplegt aan gebruik in bepaalde domeinen (bijv. wapenontwikkeling) en van afgeleide producten vereist dat zij de principes van veilige en ethische toepassing van AI naleven[3].

Veiligheid en verantwoordelijkheid

De ontwikkelaars hebben grote aandacht besteed aan veiligheidsvraagstukken, gezien het open karakter van de modellen.

  • Gegevensfiltering: Bij de voorbereiding van de trainings-datasets werden persoonsgegevens en andere gevoelige informatie automatisch gefilterd om het risico op datalekken te verminderen[2].
  • Uitlijning (Alignment): De instructievarianten van de modellen ondergingen meerfasige uitlijning met behulp van Supervised Fine-Tuning (SFT) en RLHF (Reinforcement Learning from Human Feedback) om gewenste antwoordstijlen te verankeren[1].
  • Red Teaming: Vóór de release werden de modellen onderworpen aan diepgaande tests op weerstand tegen kwaadaardige verzoeken. Experts probeerden de generatie van gevaarlijke of ongewenste inhoud uit te lokken om kwetsbaarheden op te sporen[3].
  • Responsible AI Toolkit: Samen met de modellen bracht Google een set hulpmiddelen uit om veilige inzet te vergemakkelijken, waaronder het hulpprogramma Gemma Debugger voor de analyse van interne modeltoestanden en classifiers voor ongewenste inhoud[2].
  • ShieldGemma: Een gespecialiseerd filtermodel, bedoeld om de generatie van onveilige inhoud in multimodale versies van Gemma te voorkomen[6].

Verwijzingen

  • Officiële Gemma-pagina op de Google AI-website
  • Gemma-modellen op Hugging Face

Literatuur

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Noten

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]