Gemma (Google) (HE)
Gemma — היא משפחת מודלים לשוניים הזמינים בחופשיות, שפותחו ושוחררו על ידי חברת Google (חטיבת Google DeepMind). מודלי Gemma מבוססים על אותה תשתית מחקרית וטכנולוגית כמשפחת הדגל Gemini, ומוצגים כגרסאות קלות וביצועיות שלהם[1]. השם נגזר מהמילה הלטינית gemma, שמשמעותה «אבן יקרה»[2].
Gemma משתייכת לקטגוריית open models (מודלים פתוחים): Google מפרסמת את משקלי המודלים, מה שמאפשר לחוקרים ומפתחים להשתמש בהם בחופשיות, לבצע fine-tuning ולהפיצם, כולל בפרויקטים מסחריים, בכפוף לתנאי שימוש אחראי[2]. זהו ההבדל המרכזי ממודלי Gemini, שגישה אליהם אפשרית רק דרך API ענן. מודלי Gemma מסוגלים לפעול באופן מקומי על חומרת צרכן (מחשבים ניידים, מחשבים שולחניים עם GPU), ולא רק במרכזי נתונים[3].
פיתוח ושחרורים
משפחת Gemma כוללת מספר דורות של מודלים, כשכל אחד הביא שיפורים בארכיטקטורה, בביצועים וביכולות.
הדור הראשון: Gemma 1
הגרסה הראשונה של Gemma שוחררה ב-21 בפברואר 2024[4]. היא כללה שני מודלים טקסטואליים המבוססים על ארכיטקטורת transformer מסוג decoder:
- Gemma 2B (2 מיליארד פרמטרים)
- Gemma 7B (7 מיליארד פרמטרים)
בעת השקתם, Google הצהירה כי מודלים אלה עולים על מקביליהם הגדולים בהרבה ב-benchmark מרכזיים[2]. המודלים המקוריים היו בעיקרם דוברי אנגלית, אך אומנו על נתונים מגוונים, כולל מסמכי אינטרנט, קוד תוכנה ובעיות מתמטיות[1]. שני המודלים שוחררו בשני גרסאות: בסיסית (pre-trained) ומכוונת הוראות (instruction-tuned) למעקב טוב יותר אחר פקודות המשתמש[2].
הדור השני: Gemma 2
Gemma 2 הוכרזה ב-27 ביוני 2024 והביאה שיפורים משמעותיים[1].
- גדלי מודלים: שוחררו מודלים של 9 ו-27 מיליארד פרמטרים. הגרסאות הקטנות יותר אומנו תוך שימוש בטכניקת distillation מהמודל הגדול יותר לשיפור האיכות[5].
- חלון הקשר: הורחב משמעותית ל-80,000 token (לעומת 8,192 בגרסה הראשונה)[6][7].
- שיפורים ארכיטקטוניים: הוטמעו מנגנוני grouped-query attention וסכמה מתחלפת של attention מקומי וגלובלי לעבודה יעילה עם הקשר ארוך[1].
הדור השלישי: Gemma 3
Gemma 3 הוצגה ב-מרץ 2025 כצעד הבא בהתפתחות המשפחה, תוך דגש על מולטי-מודאליות וטווח רחב יותר של משימות[6].
- מולטי-מודאליות: המודלים קיבלו תמיכה בתמונות ווידאו כנתוני קלט לצד טקסט.
- גדלים ושפות: מגוון המודלים מכסה ארבעה גדלים (1B, 4B, 12B, 27B) ותומך בעד 140 שפות[6].
- חלון הקשר: הוגדל ל-128,000 token[6].
לפי נתוני Google, Gemma 3 27B הציגה תוצאות ברמת המודלים הפתוחים המובילים של תקופתה, ונפלה בדירוגים רק ממודלים מתמחים כגון DeepSeek-R1[6].
ארכיטקטורה ומאפיינים טכניים
מודלי Gemma מבוססים על ארכיטקטורת transformer בתצורת «decoder בלבד» (decoder-only), הדומה למודלי GPT[7]. פירוש הדבר שהמודל מייצר טקסט באופן אוטו-רגרסיבי, תוך חיזוי ה-token הבא על בסיס כל הקודמים לו. פתרונות טכניים מרכזיים כוללים:
- Rotational Positional Embeddings (RoPE): במקום embedding מיקומי מוחלט משתמשים ב-RoPE, המאפשר קידוד יעיל של מידע מיקומי.
- Multi-query ו-Grouped-query attention: להאצה וחיסכון בזיכרון במודלים קטנים יותר (כגון Gemma 2B) משתמשים ב-multi-query attention (מפתח/ערך יחיד לכל ראשי ה-attention). ב-Gemma 2 הוטמע מנגנון grouped-query attention, שבו השאילתות מחולקות לקבוצות, המהווה פשרה בין מהירות לאיכות[1][7].
- סכמת attention מתחלפת: ב-Gemma 2 ממומשת סכמה שבה שכבות של self-attention גלובלי מתחלפות עם שכבות של «חלון גולש» מוגבל, המאפשרת עיבוד יעיל של הקשרים ארוכים[1].
משפחת המודלים וגרסאותיה
מלבד מודלי הבסיס הכלליים, Google שחררה מספר גרסאות נגזרות של Gemma, המותאמות למשימות ספציפיות.
- CodeGemma: מודל ליצירה והשלמה של קוד תוכנה, התומך ב-C++, C#, Go, Java, JavaScript, Python, Rust ושפות נוספות[1].
- DataGemma: משפחת מודלים שעברו fine-tuning לשילוב עם נתונים חיצוניים תוך שימוש בטכניקות RAG. המודל מסוגל לבצע שאילתות חיפוש במאגרי נתונים (כגון Google Data Commons) לשיפור הדיוק העובדתי של תשובות[1].
- PaliGemma: מודל מולטי-מודאלי המסוגל לקבל כקלט תמונות וטקסט. הוא מיועד למשימות של שאלות-ותשובות ויזואליות, כגון תיאור תמונות וזיהוי אובייקטים[1].
- RecurrentGemma: גרסה ניסיונית עם ארכיטקטורה היברידית Griffin, המשלבת attention מקומי וקישורים רקורסיביים לינאריים. הדבר מאפשר האצה משמעותית של יצירת רצפים ארוכים[7].
- MedGemma: גרסה מתמחה של Gemma 3 לתחום הרפואה. כוללת מודלים מולטי-מודאליים (4B) וטקסטואליים (27B) לניתוח תמונות רפואיות (צילומי רנטגן, חתכים) ומסמכים קליניים. המודלים מופצים כפתוחים, אך אינם מיועדים לשימוש קליני ישיר ללא אימות נוסף[8].
- DolphinGemma: פרויקט מחקרי ליישום טכנולוגיות Gemma לפענוח תקשורת דולפינים. המודל אומן על הקלטות שמע רב-שנתיות ומשמש לאיתור דפוסים בשפת בעלי חיים[9].
זמינות ויישומים
מודלי Gemma זמינים בפלטפורמות Kaggle ו-Hugging Face, וכן משולבים בשירותי Google Colab ו-Vertex AI Model Garden[2]. להאצת ה-inference ביצעה Google, בשיתוף עם NVIDIA, התאמה של המודלים ל-TensorRT. תנאי הרישיון של Gemma מאפשרים שימוש מסחרי ושינוי המודלים, מה שמבדיל אותם מחלק מהפרויקטים הפתוחים האחרים. ההפצה מוסדרת על ידי רישיון Responsible AI License, המטיל מגבלות על שימוש בתחומים מסוימים (כגון פיתוח נשק) ומחייב מוצרים נגזרים לציית לעקרונות שימוש בטוח ואתי ב-AI[3].
בטיחות ואחריות
המפתחים הקדישו תשומת לב רבה לנושאי הבטיחות, בהתחשב באופי הפתוח של המודלים.
- סינון נתונים: בהכנת dataset האימון סוננו אוטומטית מידע אישי ומידע רגיש אחר להפחתת סיכוני דליפה[2].
- Alignment: גרסאות ההוראות של המודלים עברו alignment רב-שלבי תוך שימוש בטכניקות Supervised Fine-Tuning (SFT) ו-RLHF (Reinforcement Learning מבוסס משוב אנושי) לביסוס סגנונות תגובה רצויים[1].
- Red Teaming: לפני השחרור נבדקו המודלים לעומק לבחינת עמידותם בפני בקשות זדוניות. מומחים ניסו לגרום לייצור תוכן מסוכן או לא רצוי כדי לאתר פגיעויות[3].
- ערכת הכלים Responsible AI Toolkit: יחד עם המודלים, Google שחררה ערכת כלים להקלת פריסה בטוחה, כולל כלי השירות Gemma Debugger לניתוח מצבים פנימיים של המודל ומסווגי תוכן לא רצוי[2].
- ShieldGemma: מודל-פילטר מתמחה, המיועד למניעת ייצור תוכן לא בטוח בגרסאות המולטי-מודאליות של Gemma[6].
קישורים
- הדף הרשמי של Gemma באתר Google AI
- מודלי Gemma ב-Hugging Face
ספרות
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
הערות
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
- ↑ 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
- ↑ «Google launches two new open LLMs». TechCrunch. [4]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
- ↑ 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]