Gemma (Google) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Gemma — to rodzina swobodnie dostępnych modeli językowych, opracowanych i wydanych przez firmę Google (oddział Google DeepMind). Modele Gemma opierają się na tej samej bazie badawczej i technologicznej co flagowa rodzina Gemini i są pozycjonowane jako ich lekkie, wysokowydajne wersje[1]. Nazwa pochodzi od łacińskiego słowa gemma, oznaczającego „klejnot"[2].

Gemma należy do kategorii open models (modeli otwartych): Google publikuje wagi modeli, co pozwala badaczom i programistom swobodnie je wykorzystywać, doszkalać i rozpowszechniać, w tym w projektach komercyjnych, przy zachowaniu warunków odpowiedzialnego użytkowania[2]. Jest to kluczowa różnica w stosunku do modeli Gemini, dostęp do których możliwy jest wyłącznie przez chmurowe API. Modele Gemma mogą działać lokalnie na sprzęcie konsumenckim (laptopach, komputerach stacjonarnych z GPU), a nie tylko w centrach danych[3].

Rozwój i wydania

Rodzina Gemma obejmuje kilka generacji modeli, z których każda wnosiła ulepszenia w architekturze, wydajności i możliwościach.

Pierwsza generacja: Gemma 1

Pierwsza wersja Gemma została wydana 21 lutego 2024 roku[4]. W jej skład weszły dwa modele tekstowe oparte na architekturze transformera dekodującego:

  • Gemma 2B (2 miliardy parametrów)
  • Gemma 7B (7 miliardów parametrów)

W momencie premiery Google twierdziła, że modele te przewyższają znacznie większe odpowiedniki w kluczowych benchmark'ach[2]. Pierwotne modele były przede wszystkim anglojęzyczne, lecz trenowano je na zróżnicowanych danych, obejmujących dokumenty webowe, kod programistyczny i zadania matematyczne[1]. Oba modele zostały wydane w dwóch wariantach: bazowym (pre-trained) oraz dostrojonym instrukcyjnie (instruction-tuned) dla lepszego wykonywania poleceń użytkownika[2].

Druga generacja: Gemma 2

Gemma 2 została zapowiedziana 27 czerwca 2024 roku i przyniosła znaczące ulepszenia[1].

  • Rozmiary modeli: Wydano modele o 9 i 27 miliardach parametrów. Mniejsze warianty trenowano z zastosowaniem metody destylacji wiedzy z większego modelu w celu poprawy jakości[5].
  • Okno kontekstowe: Zostało znacznie rozszerzone do 80 000 tokenów (w porównaniu z 8192 w pierwszej wersji)[6][7].
  • Ulepszenia architektoniczne: Wprowadzono mechanizmy grouped-query attention oraz naprzemienną strukturę lokalnej i globalnej uwagi dla efektywnej pracy z długim kontekstem[1].

Trzecia generacja: Gemma 3

Gemma 3 została zaprezentowana w marcu 2025 roku jako kolejny krok w rozwoju rodziny, z naciskiem na multimodalność i rozszerzony zakres zadań[6].

  • Multimodalność: Modele uzyskały wsparcie dla obrazów i wideo jako danych wejściowych obok tekstu.
  • Rozmiary i języki: Linia modelowa obejmuje cztery rozmiary (1B, 4B, 12B, 27B) i obsługuje do 140 języków[6].
  • Okno kontekstowe: Zwiększone do 128 000 tokenów[6].

Zgodnie z danymi Google, Gemma 3 27B osiągnęła wyniki na poziomie najlepszych otwartych modeli swojego czasu, ustępując w rankingach jedynie wyspecjalizowanym modelom, takim jak DeepSeek-R1[6].

Architektura i cechy techniczne

Modele Gemma opierają się na architekturze transformera w konfiguracji „tylko dekoder" (decoder-only), analogicznej do modeli GPT[7]. Oznacza to, że model generuje tekst autoregresyjnie, przewidując następny token na podstawie wszystkich poprzednich. Kluczowe rozwiązania techniczne obejmują:

  • Rotacyjne pozycyjne embedding'i (RoPE): Zamiast bezwzględnych pozycyjnych embedding'ów stosowane są RoPE, co pozwala efektywnie kodować informacje pozycyjne.
  • Multi-query i Grouped-query attention: W celu przyspieszenia i oszczędności pamięci w mniejszych modelach (np. Gemma 2B) stosowany jest multi-query attention (wspólny klucz/wartość dla wszystkich głowic uwagi). W Gemma 2 wprowadzono mechanizm grouped-query attention, w którym zapytania są dzielone na grupy, stanowiąc kompromis między szybkością a jakością[1][7].
  • Naprzemienna struktura uwagi: W Gemma 2 zrealizowano schemat, w którym warstwy z globalną uwagą własną przeplatają się z warstwami z ograniczonym „przesuwnym oknem", co pozwala efektywnie przetwarzać długie konteksty[1].

Rodzina modeli i warianty

Oprócz uniwersalnych modeli bazowych Google wydało kilka pochodnych wersji Gemma, zoptymalizowanych pod konkretne zadania.

  • CodeGemma: Model do generowania i uzupełniania kodu programistycznego, obsługujący C++, C#, Go, Java, JavaScript, Python, Rust i inne języki[1].
  • DataGemma: Rodzina modeli dostrojonych do integracji z zewnętrznymi danymi z wykorzystaniem technik RAG. Model jest w stanie wykonywać zapytania do baz danych (np. Google Data Commons) w celu zwiększenia faktycznej dokładności odpowiedzi[1].
  • PaliGemma: Multimodalny model zdolny do przyjmowania na wejście obrazów i tekstu. Przeznaczony jest do zadań wizualnego pytania i odpowiedzi, takich jak opisywanie obrazów i rozpoznawanie obiektów[1].
  • RecurrentGemma: Eksperymentalny wariant z hybrydową architekturą Griffin, łączącą lokalną uwagę i liniowe połączenia rekurencyjne. Pozwala to znacznie przyspieszyć generowanie długich sekwencji[7].
  • MedGemma: Wyspecjalizowana wersja Gemma 3 dla dziedziny medycznej. Obejmuje modele multimodalne (4B) i tekstowe (27B) do analizy obrazów medycznych (zdjęć rentgenowskich, przekrojów) oraz dokumentów klinicznych. Modele są rozpowszechniane jako otwarte, lecz nie są przeznaczone do bezpośredniego zastosowania klinicznego bez dodatkowej walidacji[8].
  • DolphinGemma: Projekt badawczy dotyczący zastosowania technologii Gemma do rozszyfrowywania komunikacji delfinów. Model wytrenowano na wieloletnich nagraniach audio i wykorzystywany jest do wykrywania wzorców w języku zwierząt[9].

Dostępność i zastosowanie

Modele Gemma dostępne są na platformach Kaggle i Hugging Face, a także zintegrowane z usługami Google Colab i Vertex AI Model Garden[2]. W celu przyspieszenia inferencji Google we współpracy z NVIDIA przeprowadziła adaptację modeli pod TensorRT. Warunki licencyjne Gemma dopuszczają komercyjne użytkowanie i modyfikację modeli, co odróżnia je od niektórych innych otwartych projektów. Dystrybucja regulowana jest licencją Responsible AI License, która nakłada ograniczenia na użytkowanie w określonych obszarach (np. tworzenie broni) i wymaga od produktów pochodnych przestrzegania zasad bezpiecznego i etycznego stosowania AI[3].

Bezpieczeństwo i odpowiedzialność

Twórcy poświęcili dużą uwagę kwestiom bezpieczeństwa, uwzględniając otwarty charakter modeli.

  • Filtrowanie danych: Podczas przygotowywania dataset'ów treningowych automatycznie odfiltrowano dane osobowe i inne wrażliwe informacje w celu zmniejszenia ryzyka ich wycieku[2].
  • Wyrównywanie (Alignment): Instrukcyjne wersje modeli przeszły wieloetapowe wyrównywanie z wykorzystaniem metod Supervised Fine-Tuning (SFT) i RLHF (uczenie ze wzmocnieniem na podstawie informacji zwrotnej od człowieka) w celu utrwalenia preferowanych stylów odpowiedzi[1].
  • Red Teaming: Przed wydaniem modele zostały poddane dogłębnej weryfikacji pod kątem odporności na złośliwe zapytania. Eksperci próbowali sprowokować generowanie niebezpiecznych lub niepożądanych treści w celu wykrycia podatności[3].
  • Zestaw narzędzi Responsible AI Toolkit: Wraz z modelami Google wydało zestaw narzędzi ułatwiających bezpieczne wdrożenie, w tym narzędzie Gemma Debugger do analizy wewnętrznych stanów modelu oraz klasyfikatory niepożądanych treści[2].
  • ShieldGemma: Wyspecjalizowany model-filtr przeznaczony do zapobiegania generowaniu niebezpiecznych treści w multimodalnych wersjach Gemma[6].

Odnośniki

  • Oficjalna strona Gemma w serwisie Google AI
  • Modele Gemma na Hugging Face

Literatura

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Przypisy

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]