Gemma (Google) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Gemma — är en familj av fritt tillgängliga språkmodeller, utvecklade och utgivna av Google (divisionen Google DeepMind). Gemma-modellerna bygger på samma forsknings- och teknikbas som flaggskeppsfamiljen Gemini och positioneras som lättare, högpresterande versioner av dessa[1]. Namnet kommer från det latinska ordet gemma, som betyder "ädelsten"[2].

Gemma tillhör kategorin open models (öppna modeller): Google publicerar modellernas vikter, vilket gör det möjligt för forskare och utvecklare att fritt använda, finjustera och distribuera dem, även i kommersiella projekt, under förutsättning att villkoren för ansvarsfull användning följs[2]. Detta är den viktigaste skillnaden mot Gemini-modellerna, som endast är tillgängliga via molnbaserade API:er. Gemma-modellerna kan köras lokalt på konsumenthårdvara (bärbara datorer, stationära datorer med GPU) och inte enbart i datacenter[3].

Utveckling och versioner

Gemma-familjen omfattar flera generationer av modeller, där varje generation har medfört förbättringar vad gäller arkitektur, prestanda och funktioner.

Första generationen: Gemma 1

Den första versionen av Gemma lanserades den 21 februari 2024[4]. Den bestod av två textmodeller baserade på en decoder-only transformer-arkitektur:

  • Gemma 2B (2 miljarder parametrar)
  • Gemma 7B (7 miljarder parametrar)

Vid lanseringen hävdade Google att dessa modeller överträffade betydligt större motsvarigheter på viktiga benchmark[2]. De ursprungliga modellerna var övervägande engelskspråkiga men tränades på varierande data, inklusive webbdokument, programkod och matematiska uppgifter[1]. Båda modellerna lanserades i två varianter: en basversion (pre-trained) och en instruktionsfinjusterad variant (instruction-tuned) för bättre följsamhet till användarkommandon[2].

Andra generationen: Gemma 2

Gemma 2 presenterades den 27 juni 2024 och medförde betydande förbättringar[1].

  • Modellstorlekar: Modeller med 9 och 27 miljarder parametrar lanserades. De mindre varianterna tränades med kunskapsdestillation från en större modell för att höja kvaliteten[5].
  • Kontextfönster: Utökades avsevärt till 80 000 token (jämfört med 8 192 i den första versionen)[6][7].
  • Arkitekturförbättringar: Mekanismer för grouped-query attention och ett alternerande schema för lokalt och globalt attention introducerades för effektiv hantering av långa kontexter[1].

Tredje generationen: Gemma 3

Gemma 3 presenterades i mars 2025 som nästa steg i familjens utveckling, med fokus på multimodalitet och utökat uppgiftsomfång[6].

  • Multimodalitet: Modellerna fick stöd för bilder och video som indata vid sidan av text.
  • Storlekar och språk: Modellserien omfattar fyra storlekar (1B, 4B, 12B, 27B) och stöder upp till 140 språk[6].
  • Kontextfönster: Utökades till 128 000 token[6].

Enligt Google nådde Gemma 3 27B resultat i nivå med de bästa öppna modellerna vid den tiden och placerade sig i rankningar strax efter specialiserade modeller som DeepSeek-R1[6].

Arkitektur och tekniska egenskaper

Gemma-modellerna bygger på en transformer-arkitektur i konfigurationen "enbart decoder" (decoder-only), liknande GPT-modellerna[7]. Det innebär att modellen genererar text autoregressivt genom att förutsäga nästa token utifrån alla föregående. De viktigaste tekniska lösningarna inkluderar:

  • Rotationsbaserade positionella embeddings (RoPE): I stället för absoluta positionella embeddings används RoPE, vilket möjliggör effektiv kodning av positionsinformation.
  • Multi-query och Grouped-query attention: För att påskynda beräkningar och spara minne i mindre modeller (till exempel Gemma 2B) används multi-query attention (gemensam nyckel/värde för alla attention-huvuden). I Gemma 2 introducerades mekanismen grouped-query attention, där frågor delas in i grupper – en kompromiss mellan hastighet och kvalitet[1][7].
  • Alternerande attention-schema: I Gemma 2 implementerades ett schema där lager med globalt självattention alternerar med lager med begränsat "glidande fönster", vilket möjliggör effektiv behandling av långa kontexter[1].

Modellfamilj och varianter

Utöver de universella basmodellerna har Google lanserat flera härledda versioner av Gemma, optimerade för specifika uppgifter.

  • CodeGemma: En modell för generering och komplettering av programkod med stöd för C++, C#, Go, Java, JavaScript, Python, Rust och andra språk[1].
  • DataGemma: En familj av modeller som finjusterats för integration med externa data med hjälp av RAG-tekniker. Modellen kan utföra sökfrågor mot databaser (till exempel Google Data Commons) för att öka den faktamässiga precisionen i svaren[1].
  • PaliGemma: En multimodal modell som kan ta emot bilder och text som indata. Den är avsedd för uppgifter inom visuell fråga-svar-interaktion, såsom bildbeskrivning och objektigenkänning[1].
  • RecurrentGemma: En experimentell variant med den hybrida Griffin-arkitekturen, som kombinerar lokalt attention och linjära rekurrenta kopplingar. Detta möjliggör avsevärt snabbare generering av långa sekvenser[7].
  • MedGemma: En specialiserad version av Gemma 3 för det medicinska området. Den inkluderar multimodala (4B) och textbaserade (27B) modeller för analys av medicinska bilder (röntgenbilder, snitt) och kliniska dokument. Modellerna distribueras som öppna men är inte avsedda för direkt klinisk användning utan ytterligare validering[8].
  • DolphinGemma: Ett forskningsprojekt om tillämpning av Gemma-teknologier för att tyda delfiners kommunikation. Modellen har tränats på mångåriga ljudinspelningar och används för att identifiera mönster i djurspråk[9].

Tillgänglighet och användning

Gemma-modellerna är tillgängliga på plattformarna Kaggle och Hugging Face samt integrerade i tjänsterna Google Colab och Vertex AI Model Garden[2]. För att påskynda inferens genomförde Google i samarbete med NVIDIA en anpassning av modellerna för TensorRT. Gemmas licensvillkor tillåter kommersiell användning och modifiering av modellerna, vilket skiljer dem från vissa andra öppna projekt. Distributionen regleras av licensen Responsible AI License, som begränsar användning inom vissa områden (till exempel vapenutveckling) och kräver att härledda produkter följer principerna för säker och etisk tillämpning av AI[3].

Säkerhet och ansvar

Utvecklarna har ägnat stor uppmärksamhet åt säkerhetsfrågor med tanke på modellernas öppna karaktär.

  • Datafiltrering: Vid förberedelse av träningsdataset filtrerades personuppgifter och annan känslig information automatiskt bort för att minska risken för läckor[2].
  • Anpassning (Alignment): De instruktionsfinjusterade versionerna av modellerna genomgick flerstegsanpassning med hjälp av metoderna Supervised Fine-Tuning (SFT) och RLHF (Reinforcement Learning from Human Feedback) för att befästa önskvärda svarsstilar[1].
  • Red Teaming: Innan lansering utsattes modellerna för en fördjupad granskning av motståndskraft mot skadliga förfrågningar. Experter försökte provocera fram generering av farligt eller oönskat innehåll för att identifiera sårbarheter[3].
  • Verktygsuppsättningen Responsible AI Toolkit: Tillsammans med modellerna lanserade Google en uppsättning verktyg för att underlätta säker driftsättning, inklusive verktyget Gemma Debugger för analys av modellens interna tillstånd och klassificerare för oönskat innehåll[2].
  • ShieldGemma: En specialiserad filtermodell avsedd att förhindra generering av osäkert innehåll i multimodala versioner av Gemma[6].

Länkar

  • Gemmas officiella sida på Google AI
  • Gemma-modeller på Hugging Face

Litteratur

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Noter

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]