Gemma (Google) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Gemma — خانواده‌ای از مدل‌های زبانی با دسترسی آزاد است که توسط شرکت Google (بخش Google DeepMind) توسعه یافته و منتشر شده است. مدل‌های Gemma بر پایه همان زیرساخت پژوهشی و فناوری خانواده پرچم‌دار Gemini بنا شده‌اند و به عنوان نسخه‌های سبک‌وزن و پرکارایی آن‌ها معرفی می‌شوند[1]. این نام از واژه لاتین gemma به معنای «سنگ قیمتی» گرفته شده است[2].

Gemma در دسته open models (مدل‌های باز) قرار می‌گیرد: Google وزن‌های مدل‌ها را منتشر می‌کند و این امر به پژوهشگران و توسعه‌دهندگان اجازه می‌دهد آن‌ها را آزادانه استفاده کنند، fine-tuning انجام دهند و توزیع کنند، از جمله در پروژه‌های تجاری، با رعایت شرایط استفاده مسئولانه[2]. این تمایز کلیدی از مدل‌های Gemini است که دسترسی به آن‌ها تنها از طریق API ابری امکان‌پذیر است. مدل‌های Gemma قادرند به صورت محلی روی سخت‌افزار مصرفی (لپ‌تاپ‌ها، رایانه‌های رومیزی با GPU) اجرا شوند، نه فقط در مراکز داده[3].

توسعه و نسخه‌ها

خانواده Gemma شامل چندین نسل از مدل‌ها است که هر کدام بهبودهایی در معماری، کارایی و قابلیت‌ها به همراه داشتند.

نسل اول: Gemma 1

نخستین نسخه Gemma در ۲۱ فوریه ۲۰۲۴ منتشر شد[4]. این نسخه شامل دو مدل متنی مبتنی بر معماری transformer دیکودر بود:

  • Gemma 2B (۲ میلیارد پارامتر)
  • Gemma 7B (۷ میلیارد پارامتر)

Google در زمان انتشار اعلام کرد که این مدل‌ها در benchmark های کلیدی از مدل‌های بسیار بزرگ‌تر پیشی می‌گیرند[2]. مدل‌های اولیه عمدتاً انگلیسی‌زبان بودند، اما روی داده‌های متنوعی شامل اسناد وب، کد برنامه‌نویسی و مسائل ریاضی آموزش دیده بودند[1]. هر دو مدل در دو نوع منتشر شدند: پایه (pre-trained) و دستورپذیر (instruction-tuned) برای پیروی بهتر از دستورات کاربر[2].

نسل دوم: Gemma 2

Gemma 2 در ۲۷ ژوئن ۲۰۲۴ معرفی شد و بهبودهای چشمگیری به همراه داشت[1].

  • اندازه مدل‌ها: مدل‌هایی با ۹ و ۲۷ میلیارد پارامتر منتشر شدند. نسخه‌های کوچک‌تر با استفاده از روش distillation دانش از مدل بزرگ‌تر آموزش دیدند تا کیفیت بهتری داشته باشند[5].
  • پنجره متن: به طور قابل توجهی تا ۸۰٬۰۰۰ token افزایش یافت (در مقایسه با ۸۱۹۲ در نسخه اول)[6][7].
  • بهبودهای معماری: مکانیزم‌های grouped-query attention و طرح متناوب توجه محلی و سراسری برای پردازش مؤثر متن‌های طولانی پیاده‌سازی شدند[1].

نسل سوم: Gemma 3

Gemma 3 در مارس ۲۰۲۵ به عنوان گام بعدی در توسعه این خانواده با تأکید بر چندوجهی بودن و پوشش گسترده‌تر وظایف معرفی شد[6].

  • چندوجهی بودن: مدل‌ها از تصاویر و ویدیو به عنوان داده ورودی در کنار متن پشتیبانی می‌کنند.
  • اندازه‌ها و زبان‌ها: طیف مدل‌ها چهار اندازه (1B، 4B، 12B، 27B) را در بر می‌گیرد و تا ۱۴۰ زبان را پشتیبانی می‌کند[6].
  • پنجره متن: تا ۱۲۸٬۰۰۰ token افزایش یافت[6].

بر اساس اعلام Google، مدل Gemma 3 27B نتایجی هم‌سطح با بهترین مدل‌های باز زمان خود نشان داد و تنها در رتبه‌بندی‌ها از مدل‌های تخصصی مانند DeepSeek-R1 عقب ماند[6].

معماری و ویژگی‌های فنی

مدل‌های Gemma بر پایه معماری transformer در پیکربندی «فقط دیکودر» (decoder-only)، مشابه مدل‌های GPT، بنا شده‌اند[7]. این بدان معناست که مدل متن را به صورت خودبازگشتی تولید می‌کند و token بعدی را بر اساس تمام token های قبلی پیش‌بینی می‌کند. راه‌حل‌های فنی کلیدی عبارتند از:

  • embedding های موقعیتی دورانی (RoPE): به جای embedding های موقعیتی مطلق، از RoPE استفاده می‌شود که امکان کدگذاری مؤثر اطلاعات موقعیتی را فراهم می‌کند.
  • Multi-query و Grouped-query attention: برای افزایش سرعت و صرفه‌جویی در حافظه در مدل‌های کوچک‌تر (مانند Gemma 2B) از multi-query attention (کلید/مقدار مشترک برای تمام هدهای توجه) استفاده می‌شود. در Gemma 2 مکانیزم grouped-query attention پیاده‌سازی شد که در آن کوئری‌ها به گروه‌هایی تقسیم می‌شوند و این راه‌حلی میانه میان سرعت و کیفیت است[1][7].
  • طرح متناوب توجه: در Gemma 2 طرحی پیاده‌سازی شده که لایه‌های توجه سراسری با لایه‌های توجه «پنجره لغزنده» محدود تناوب می‌یابند و این امر پردازش مؤثر متن‌های طولانی را ممکن می‌سازد[1].

خانواده مدل‌ها و نسخه‌های مختلف

علاوه بر مدل‌های پایه عمومی، Google چندین نسخه مشتق از Gemma را که برای وظایف خاص بهینه شده‌اند منتشر کرده است.

  • CodeGemma: مدلی برای تولید و تکمیل کد برنامه‌نویسی، با پشتیبانی از C++، C#، Go، Java، JavaScript، Python، Rust و زبان‌های دیگر[1].
  • DataGemma: خانواده‌ای از مدل‌های fine-tuned برای یکپارچه‌سازی با داده‌های خارجی با استفاده از تکنیک‌های RAG. این مدل قادر است جستجو در پایگاه‌های داده (مانند Google Data Commons) را برای افزایش دقت واقعی پاسخ‌ها انجام دهد[1].
  • PaliGemma: مدلی چندوجهی که قادر به پردازش تصاویر و متن به عنوان ورودی است. این مدل برای وظایف پرسش و پاسخ بصری مانند توصیف تصاویر و تشخیص اشیاء طراحی شده است[1].
  • RecurrentGemma: نسخه‌ای آزمایشی با معماری هیبریدی Griffin که توجه محلی و اتصالات بازگشتی خطی را ترکیب می‌کند. این امر تولید دنباله‌های طولانی را به طور قابل توجهی تسریع می‌بخشد[7].
  • MedGemma: نسخه تخصصی Gemma 3 برای حوزه پزشکی. شامل مدل‌های چندوجهی (4B) و متنی (27B) برای تحلیل تصاویر پزشکی (رادیوگرافی، برش‌ها) و اسناد بالینی است. مدل‌ها به صورت باز توزیع می‌شوند اما بدون اعتبارسنجی اضافی برای استفاده مستقیم بالینی در نظر گرفته نشده‌اند[8].
  • DolphinGemma: پروژه‌ای پژوهشی برای به‌کارگیری فناوری‌های Gemma در رمزگشایی ارتباطات دلفین‌ها. مدل بر روی سال‌ها ضبط صوتی آموزش دیده و برای شناسایی الگوها در زبان جانوران استفاده می‌شود[9].

دسترس‌پذیری و کاربرد

مدل‌های Gemma در پلتفرم‌های Kaggle و Hugging Face در دسترس هستند و همچنین در سرویس‌های Google Colab و Vertex AI Model Garden یکپارچه شده‌اند[2]. برای تسریع inference، Google در همکاری با NVIDIA مدل‌ها را با TensorRT سازگار کرده است. شرایط مجوز Gemma استفاده تجاری و اصلاح مدل‌ها را مجاز می‌داند که آن‌ها را از برخی پروژه‌های باز دیگر متمایز می‌کند. توزیع تحت مجوز Responsible AI License انجام می‌شود که محدودیت‌هایی برای استفاده در حوزه‌های خاص (مانند توسعه سلاح) اعمال می‌کند و از محصولات مشتق می‌خواهد اصول استفاده ایمن و اخلاقی از هوش مصنوعی را رعایت کنند[3].

ایمنی و مسئولیت

توسعه‌دهندگان با توجه به ماهیت باز مدل‌ها، توجه ویژه‌ای به مسائل ایمنی داشتند.

  • فیلترسازی داده‌ها: در آماده‌سازی dataset های آموزشی، داده‌های شخصی و سایر اطلاعات حساس به صورت خودکار فیلتر شدند تا خطر نشت اطلاعات کاهش یابد[2].
  • هم‌راستایی (Alignment): نسخه‌های دستورپذیر مدل‌ها از هم‌راستایی چندمرحله‌ای با استفاده از روش‌های Supervised Fine-Tuning (SFT) و RLHF (یادگیری تقویتی بر اساس بازخورد انسانی) برای تثبیت سبک‌های پاسخ مطلوب گذشته‌اند[1].
  • Red Teaming: پیش از انتشار، مدل‌ها تحت آزمون عمیق برای بررسی مقاومت در برابر درخواست‌های مخرب قرار گرفتند. متخصصان تلاش کردند تولید محتوای خطرناک یا ناخواسته را برانگیزند تا آسیب‌پذیری‌ها شناسایی شوند[3].
  • ابزارهای Responsible AI Toolkit: Google همراه با مدل‌ها مجموعه‌ای از ابزارها برای تسهیل استقرار ایمن منتشر کرد، از جمله ابزار Gemma Debugger برای تحلیل حالت‌های داخلی مدل و دسته‌بندی‌کننده‌های محتوای ناخواسته[2].
  • ShieldGemma: مدل فیلتر تخصصی که برای جلوگیری از تولید محتوای ناایمن در نسخه‌های چندوجهی Gemma طراحی شده است[6].

پیوندها

  • صفحه رسمی Gemma در سایت Google AI
  • مدل‌های Gemma در Hugging Face

منابع

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [۱]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [۲]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [۳]
  4. «Google launches two new open LLMs». TechCrunch. [۴]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [۵]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [۶]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [۷]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [۸]