Gemma (Google) (FA)
Gemma — خانوادهای از مدلهای زبانی با دسترسی آزاد است که توسط شرکت Google (بخش Google DeepMind) توسعه یافته و منتشر شده است. مدلهای Gemma بر پایه همان زیرساخت پژوهشی و فناوری خانواده پرچمدار Gemini بنا شدهاند و به عنوان نسخههای سبکوزن و پرکارایی آنها معرفی میشوند[1]. این نام از واژه لاتین gemma به معنای «سنگ قیمتی» گرفته شده است[2].
Gemma در دسته open models (مدلهای باز) قرار میگیرد: Google وزنهای مدلها را منتشر میکند و این امر به پژوهشگران و توسعهدهندگان اجازه میدهد آنها را آزادانه استفاده کنند، fine-tuning انجام دهند و توزیع کنند، از جمله در پروژههای تجاری، با رعایت شرایط استفاده مسئولانه[2]. این تمایز کلیدی از مدلهای Gemini است که دسترسی به آنها تنها از طریق API ابری امکانپذیر است. مدلهای Gemma قادرند به صورت محلی روی سختافزار مصرفی (لپتاپها، رایانههای رومیزی با GPU) اجرا شوند، نه فقط در مراکز داده[3].
توسعه و نسخهها
خانواده Gemma شامل چندین نسل از مدلها است که هر کدام بهبودهایی در معماری، کارایی و قابلیتها به همراه داشتند.
نسل اول: Gemma 1
نخستین نسخه Gemma در ۲۱ فوریه ۲۰۲۴ منتشر شد[4]. این نسخه شامل دو مدل متنی مبتنی بر معماری transformer دیکودر بود:
- Gemma 2B (۲ میلیارد پارامتر)
- Gemma 7B (۷ میلیارد پارامتر)
Google در زمان انتشار اعلام کرد که این مدلها در benchmark های کلیدی از مدلهای بسیار بزرگتر پیشی میگیرند[2]. مدلهای اولیه عمدتاً انگلیسیزبان بودند، اما روی دادههای متنوعی شامل اسناد وب، کد برنامهنویسی و مسائل ریاضی آموزش دیده بودند[1]. هر دو مدل در دو نوع منتشر شدند: پایه (pre-trained) و دستورپذیر (instruction-tuned) برای پیروی بهتر از دستورات کاربر[2].
نسل دوم: Gemma 2
Gemma 2 در ۲۷ ژوئن ۲۰۲۴ معرفی شد و بهبودهای چشمگیری به همراه داشت[1].
- اندازه مدلها: مدلهایی با ۹ و ۲۷ میلیارد پارامتر منتشر شدند. نسخههای کوچکتر با استفاده از روش distillation دانش از مدل بزرگتر آموزش دیدند تا کیفیت بهتری داشته باشند[5].
- پنجره متن: به طور قابل توجهی تا ۸۰٬۰۰۰ token افزایش یافت (در مقایسه با ۸۱۹۲ در نسخه اول)[6][7].
- بهبودهای معماری: مکانیزمهای grouped-query attention و طرح متناوب توجه محلی و سراسری برای پردازش مؤثر متنهای طولانی پیادهسازی شدند[1].
نسل سوم: Gemma 3
Gemma 3 در مارس ۲۰۲۵ به عنوان گام بعدی در توسعه این خانواده با تأکید بر چندوجهی بودن و پوشش گستردهتر وظایف معرفی شد[6].
- چندوجهی بودن: مدلها از تصاویر و ویدیو به عنوان داده ورودی در کنار متن پشتیبانی میکنند.
- اندازهها و زبانها: طیف مدلها چهار اندازه (1B، 4B، 12B، 27B) را در بر میگیرد و تا ۱۴۰ زبان را پشتیبانی میکند[6].
- پنجره متن: تا ۱۲۸٬۰۰۰ token افزایش یافت[6].
بر اساس اعلام Google، مدل Gemma 3 27B نتایجی همسطح با بهترین مدلهای باز زمان خود نشان داد و تنها در رتبهبندیها از مدلهای تخصصی مانند DeepSeek-R1 عقب ماند[6].
معماری و ویژگیهای فنی
مدلهای Gemma بر پایه معماری transformer در پیکربندی «فقط دیکودر» (decoder-only)، مشابه مدلهای GPT، بنا شدهاند[7]. این بدان معناست که مدل متن را به صورت خودبازگشتی تولید میکند و token بعدی را بر اساس تمام token های قبلی پیشبینی میکند. راهحلهای فنی کلیدی عبارتند از:
- embedding های موقعیتی دورانی (RoPE): به جای embedding های موقعیتی مطلق، از RoPE استفاده میشود که امکان کدگذاری مؤثر اطلاعات موقعیتی را فراهم میکند.
- Multi-query و Grouped-query attention: برای افزایش سرعت و صرفهجویی در حافظه در مدلهای کوچکتر (مانند Gemma 2B) از multi-query attention (کلید/مقدار مشترک برای تمام هدهای توجه) استفاده میشود. در Gemma 2 مکانیزم grouped-query attention پیادهسازی شد که در آن کوئریها به گروههایی تقسیم میشوند و این راهحلی میانه میان سرعت و کیفیت است[1][7].
- طرح متناوب توجه: در Gemma 2 طرحی پیادهسازی شده که لایههای توجه سراسری با لایههای توجه «پنجره لغزنده» محدود تناوب مییابند و این امر پردازش مؤثر متنهای طولانی را ممکن میسازد[1].
خانواده مدلها و نسخههای مختلف
علاوه بر مدلهای پایه عمومی، Google چندین نسخه مشتق از Gemma را که برای وظایف خاص بهینه شدهاند منتشر کرده است.
- CodeGemma: مدلی برای تولید و تکمیل کد برنامهنویسی، با پشتیبانی از C++، C#، Go، Java، JavaScript، Python، Rust و زبانهای دیگر[1].
- DataGemma: خانوادهای از مدلهای fine-tuned برای یکپارچهسازی با دادههای خارجی با استفاده از تکنیکهای RAG. این مدل قادر است جستجو در پایگاههای داده (مانند Google Data Commons) را برای افزایش دقت واقعی پاسخها انجام دهد[1].
- PaliGemma: مدلی چندوجهی که قادر به پردازش تصاویر و متن به عنوان ورودی است. این مدل برای وظایف پرسش و پاسخ بصری مانند توصیف تصاویر و تشخیص اشیاء طراحی شده است[1].
- RecurrentGemma: نسخهای آزمایشی با معماری هیبریدی Griffin که توجه محلی و اتصالات بازگشتی خطی را ترکیب میکند. این امر تولید دنبالههای طولانی را به طور قابل توجهی تسریع میبخشد[7].
- MedGemma: نسخه تخصصی Gemma 3 برای حوزه پزشکی. شامل مدلهای چندوجهی (4B) و متنی (27B) برای تحلیل تصاویر پزشکی (رادیوگرافی، برشها) و اسناد بالینی است. مدلها به صورت باز توزیع میشوند اما بدون اعتبارسنجی اضافی برای استفاده مستقیم بالینی در نظر گرفته نشدهاند[8].
- DolphinGemma: پروژهای پژوهشی برای بهکارگیری فناوریهای Gemma در رمزگشایی ارتباطات دلفینها. مدل بر روی سالها ضبط صوتی آموزش دیده و برای شناسایی الگوها در زبان جانوران استفاده میشود[9].
دسترسپذیری و کاربرد
مدلهای Gemma در پلتفرمهای Kaggle و Hugging Face در دسترس هستند و همچنین در سرویسهای Google Colab و Vertex AI Model Garden یکپارچه شدهاند[2]. برای تسریع inference، Google در همکاری با NVIDIA مدلها را با TensorRT سازگار کرده است. شرایط مجوز Gemma استفاده تجاری و اصلاح مدلها را مجاز میداند که آنها را از برخی پروژههای باز دیگر متمایز میکند. توزیع تحت مجوز Responsible AI License انجام میشود که محدودیتهایی برای استفاده در حوزههای خاص (مانند توسعه سلاح) اعمال میکند و از محصولات مشتق میخواهد اصول استفاده ایمن و اخلاقی از هوش مصنوعی را رعایت کنند[3].
ایمنی و مسئولیت
توسعهدهندگان با توجه به ماهیت باز مدلها، توجه ویژهای به مسائل ایمنی داشتند.
- فیلترسازی دادهها: در آمادهسازی dataset های آموزشی، دادههای شخصی و سایر اطلاعات حساس به صورت خودکار فیلتر شدند تا خطر نشت اطلاعات کاهش یابد[2].
- همراستایی (Alignment): نسخههای دستورپذیر مدلها از همراستایی چندمرحلهای با استفاده از روشهای Supervised Fine-Tuning (SFT) و RLHF (یادگیری تقویتی بر اساس بازخورد انسانی) برای تثبیت سبکهای پاسخ مطلوب گذشتهاند[1].
- Red Teaming: پیش از انتشار، مدلها تحت آزمون عمیق برای بررسی مقاومت در برابر درخواستهای مخرب قرار گرفتند. متخصصان تلاش کردند تولید محتوای خطرناک یا ناخواسته را برانگیزند تا آسیبپذیریها شناسایی شوند[3].
- ابزارهای Responsible AI Toolkit: Google همراه با مدلها مجموعهای از ابزارها برای تسهیل استقرار ایمن منتشر کرد، از جمله ابزار Gemma Debugger برای تحلیل حالتهای داخلی مدل و دستهبندیکنندههای محتوای ناخواسته[2].
- ShieldGemma: مدل فیلتر تخصصی که برای جلوگیری از تولید محتوای ناایمن در نسخههای چندوجهی Gemma طراحی شده است[6].
پیوندها
- صفحه رسمی Gemma در سایت Google AI
- مدلهای Gemma در Hugging Face
منابع
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [۱]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [۲]
- ↑ 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [۳]
- ↑ «Google launches two new open LLMs». TechCrunch. [۴]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [۵]
- ↑ 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [۶]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [۷]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [۸]