Gemma (Google) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Gemma — egy szabadon elérhető nyelvi modellek családja, amelyet a Google (Google DeepMind részlege) fejlesztett ki és adott ki. A Gemma modellek ugyanazon kutatási és technológiai alapokra épülnek, mint a zászlóshajó Gemini modellcsalád, és azok könnyített, nagy teljesítményű változataiként kerülnek forgalomba[1]. A név a latin gemma szóból ered, amely „drágakövet" jelent[2].

A Gemma az open models (nyílt modellek) kategóriájába tartozik: a Google közzéteszi a modellek súlyait, ami lehetővé teszi a kutatók és fejlesztők számára, hogy azokat szabadon használják, finomhangolják és terjesszék, beleértve a kereskedelmi projekteket is, a felelős felhasználási feltételek betartása mellett[2]. Ez a legfontosabb különbség a Gemini modellekhez képest, amelyek csak felhőalapú API-kon keresztül érhetők el. A Gemma modellek képesek lokálisan futni fogyasztói hardveren (laptopokon, GPU-val rendelkező asztali számítógépeken), nem csupán adatközpontokban[3].

Fejlesztés és kiadások

A Gemma modellcsalád több generációt foglal magában, amelyek mindegyike fejlesztéseket hozott az architektúrában, a teljesítményben és a képességekben.

Első generáció: Gemma 1

A Gemma első verziója 2024. február 21-én jelent meg[4]. Két szöveges modellt tartalmazott, amelyek dekóderes transformer architektúrán alapulnak:

  • Gemma 2B (2 milliárd paraméter)
  • Gemma 7B (7 milliárd paraméter)

A megjelenéskor a Google azt állította, hogy ezek a modellek a legfontosabb benchmark-okban felülmúlják a náluk lényegesen nagyobb társaikat[2]. Az eredeti modellek elsősorban angol nyelvűek voltak, de változatos adatokon képezték őket, beleértve webes dokumentumokat, programkódot és matematikai feladatokat[1]. Mindkét modell két változatban jelent meg: alap (pre-trained) és instrukció-finomhangolt (instruction-tuned) verzióban, az utóbbi a felhasználói utasítások jobb követéséhez[2].

Második generáció: Gemma 2

A Gemma 2-t 2024. június 27-én jelentették be, és jelentős fejlesztéseket hozott[1].

  • Modellek mérete: 9 és 27 milliárd paraméteres modellek kerültek kiadásra. A kisebb változatokat tudásdesztilláció módszerével képezték egy nagyobb modellből a minőség javítása érdekében[5].
  • Kontextusablak: Jelentősen bővült, 80 000 tokenre (az első verzió 8192-jéhez képest)[6][7].
  • Architekturális fejlesztések: Bevezették a grouped-query attention mechanizmust és a lokális és globális figyelem váltakozó sémáját a hosszú kontextus hatékony kezeléséhez[1].

Harmadik generáció: Gemma 3

A Gemma 3-at 2025 márciusában mutatták be a modellcsalád fejlődésének következő lépéseként, a multimodalitásra és a feladatok szélesebb lefedettségére helyezve a hangsúlyt[6].

  • Multimodalitás: A modellek a szöveg mellett képek és videók fogadását is támogatják bemeneti adatként.
  • Méretek és nyelvek: A modellkínálat négy méretet ölel fel (1B, 4B, 12B, 27B), és akár 140 nyelvet támogat[6].
  • Kontextusablak: 128 000 tokenre bővült[6].

A Google adatai szerint a Gemma 3 27B a maga korának legjobb nyílt modelljei szintjén teljesített, és a ranglistákon csak olyan specializált modellektől maradt el, mint a DeepSeek-R1[6].

Architektúra és technikai jellemzők

A Gemma modellek transformer architektúrán alapulnak, „csak dekóderes" (decoder-only) konfigurációban, hasonlóan a GPT modellekhez[7]. Ez azt jelenti, hogy a modell autoregresszív módon generál szöveget, az összes korábbi token alapján megjósolva a következőt. A legfontosabb technikai megoldások a következők:

  • Forgó pozicionális embedding-ek (RoPE): Az abszolút pozicionális embedding-ek helyett RoPE-t alkalmaznak, ami lehetővé teszi a pozicionális információ hatékony kódolását.
  • Multi-query és Grouped-query attention: A gyorsítás és a memória-megtakarítás érdekében a kisebb modellekben (például Gemma 2B) multi-query attention-t (egyetlen kulcs/érték az összes figyelemfejhez) alkalmaznak. A Gemma 2-ben bevezették a grouped-query attention mechanizmust, ahol a lekérdezések csoportokra osztódnak, ami kompromisszumot jelent a sebesség és a minőség között[1][7].
  • Váltakozó figyelemséma: A Gemma 2-ben olyan séma valósult meg, ahol a globális önfigyelmes rétegek korlátozott „csúszóablakos" rétegekkel váltakoznak, ami lehetővé teszi a hosszú kontextusok hatékony feldolgozását[1].

Modellek és változatok

Az általános célú alapmodelleken túl a Google több, konkrét feladatokra optimalizált Gemma-származékot adott ki.

  • CodeGemma: Programkód generálására és kiegészítésére szolgáló modell, amely támogatja a C++, C#, Go, Java, JavaScript, Python, Rust és más nyelveket[1].
  • DataGemma: Modellek családja, amelyet külső adatokkal való integrációhoz finomhangoltak RAG technikák alkalmazásával. A modell képes keresési lekérdezéseket végrehajtani adatbázisokon (például Google Data Commons) a válaszok ténybeli pontosságának javítása érdekében[1].
  • PaliGemma: Multimodális modell, amely képes képeket és szöveget fogadni bemenetként. Vizuális kérdés-válasz feladatokra, például képleírásra és objektumfelismerésre készült[1].
  • RecurrentGemma: Kísérleti változat hibrid Griffin architektúrával, amely lokális figyelmet és lineáris rekurrens kapcsolatokat kombinál. Ez lehetővé teszi a hosszú sorozatok generálásának jelentős felgyorsítását[7].
  • MedGemma: A Gemma 3 specializált orvosi változata. Multimodális (4B) és szöveges (27B) modelleket tartalmaz orvosi képek (röntgenfelvételek, metszetek) és klinikai dokumentumok elemzéséhez. A modellek nyíltként terjesztett, de közvetlen klinikai felhasználásra további validáció nélkül nem alkalmasak[8].
  • DolphinGemma: Kutatási projekt a Gemma technológiáinak alkalmazásáról a delfinek kommunikációjának megfejtésére. A modellt évekig tartó hangfelvételeken képezték, és állati nyelvek mintáinak azonosítására használják[9].

Elérhetőség és alkalmazás

A Gemma modellek elérhetők a Kaggle és a Hugging Face platformokon, valamint integrálva vannak a Google Colab és a Vertex AI Model Garden szolgáltatásokba[2]. Az inferencia gyorsítása érdekében a Google az NVIDIA-val együttműködve adaptálta a modelleket TensorRT-hez. A Gemma licencfeltételei lehetővé teszik a modellek kereskedelmi felhasználását és módosítását, ami megkülönbözteti őket néhány más nyílt projekttől. A terjesztést a Responsible AI License szabályozza, amely korlátozásokat ír elő bizonyos területeken való felhasználásra (például fegyvergyártás) és megköveteli a származtatott termékektől a biztonságos és etikus MI-alkalmazás elveinek betartását[3].

Biztonság és felelősség

A fejlesztők nagy figyelmet fordítottak a biztonsági kérdésekre, tekintettel a modellek nyílt jellegére.

  • Adatszűrés: A tanítási adatkészletek előkészítésekor automatikusan kiszűrték a személyes adatokat és egyéb érzékeny információkat az adatszivárgás kockázatának csökkentése érdekében[2].
  • Igazítás (Alignment): A modellek instrukciós verziói többlépéses igazításon estek át Supervised Fine-Tuning (SFT) és RLHF (emberi visszajelzésen alapuló megerősítéses tanulás) módszerek alkalmazásával a kívánt válaszstílusok rögzítéséhez[1].
  • Red Teaming: A kiadás előtt a modelleket alapos vizsgálatnak vetették alá a rosszindulatú lekérdezésekkel szembeni ellenállás tekintetében. Szakértők megpróbálták veszélyes vagy nemkívánatos tartalom generálására késztetni a modelleket a sebezhetőségek feltárása érdekében[3].
  • Responsible AI Toolkit: A modellekkel együtt a Google kiadott egy eszközkészletet a biztonságos telepítés megkönnyítésére, beleértve a Gemma Debugger segédprogramot a modell belső állapotainak elemzéséhez és a nemkívánatos tartalom osztályozóit[2].
  • ShieldGemma: Specializált szűrőmodell, amelynek célja a nem biztonságos tartalom generálásának megakadályozása a Gemma multimodális verzióiban[6].

Hivatkozások

  • A Gemma hivatalos oldala a Google AI weboldalán
  • Gemma modellek a Hugging Face-en

Irodalom

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Megjegyzések

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]