---
title: "Gemini (Google) (FA)"
source: "https://systems-analysis.info/int/Gemini_(Google)_(FA)"
wiki: "systems-analysis.info/int"
article: "Gemini_(Google)_(FA)"
language: "fa"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 2528
wiki_created_at: 2026-09-06T23:05:37Z
wiki_modified_at: 2026-09-06T23:05:37Z
downloaded_at: 2026-09-07T22:51:53Z
---

# Gemini (Google) (FA)

**Google Gemini** — خانواده‌ای از مدل‌های زبانی بزرگ (LLM) چندوجهی است که توسط بخش تحقیقاتی Google DeepMind توسعه می‌یابد. مدل‌های Gemini که برای اولین بار در دسامبر ۲۰۲۳ معرفی شدند، بر پایه معماری transformer شبکه‌های عصبی با پشتیبانی بومی از پردازش و تولید داده‌های چندوجهی ساخته شده‌اند و متن، تصویر، صدا، ویدئو و کد برنامه‌نویسی را در بر می‌گیرند.

تا فوریه ۲۰۲۶، نسل فعلی خط **Gemini 3.x** است. توسعه معماری بر ادغام مکانیزم‌های مقیاس‌پذیر استنتاج در زمان inference (inference-time scaling) و بهینه‌سازی مدل‌ها برای استفاده در سیستم‌های عامل خودمختار (Agentic AI) متمرکز است. برنامه Gemini بیش از ۷۵۰ میلیون کاربر فعال ماهانه دارد.

## نام‌گذاری و فلسفه

نام **«Gemini»** (از لاتین — *دوقلوها*) نمادی است از اتحاد دو گروه تحقیقاتی پیشرو Google — یعنی Google Brain و DeepMind — برای خلق این پروژه. Jeff Dean، مدیر فنی مشترک Google DeepMind، این موضوع را در وبلاگ رسمی (مه ۲۰۲۴) تأیید کرد: «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». پروژه در ابتدا نام رمزی «Titan» داشت؛ نام «Gemini» در آوریل ۲۰۲۳ توسط Dean پیشنهاد شد — همان ماهی که ادغام رسمی Google Brain و DeepMind انجام گرفت. این نام همچنین اشاره‌ای دارد به برنامه فضایی ناسا «جمینی» (۱۹۶۵–۱۹۶۸)، که نقشش در آماده‌سازی برنامه «آپولو» در میان تیم توسعه‌دهندگان بازتاب یافت.

ویژگی کلیدی و بنیان فلسفی Gemini **چندوجهی بودن بومی** (native multimodality) است. برخلاف بسیاری از مدل‌های پیشین که قابلیت‌های چندوجهی را بر روی پایه متنی موجود اضافه می‌کردند، Gemini از ابتدا برای درک همزمان، پردازش و ترکیب انواع مختلف اطلاعات طراحی شده است. گزارش فنی Gemini 1.0 (arXiv:2312.11805) تأیید می‌کند که مدل «trained jointly across image, audio, video, and text data». این امر به مدل اجازه می‌دهد نه صرفاً داده‌ها را بین وجه‌ها ترجمه کند، بلکه درکی عمیق‌تر و جامع‌تر از آن‌ها شکل دهد.

## معماری و فناوری‌های کلیدی

موفقیت و قابلیت‌های مدل‌های Gemini توسط تعدادی از تصمیمات بنیادی معماری تعیین می‌شود. Google طراحی سطح پایین کامل تمام اجزای داخلی Gemini را منتشر نمی‌کند، اما منابع باز امکان تشخیص دسته معماری را فراهم می‌کنند: تمام مدل‌های خانواده ۱.۵ و بالاتر **sparse mixture-of-experts transformer-based models** با پشتیبانی چندوجهی بومی هستند (تأیید شده در model card مربوط به Gemini 2.5 Flash).

### معماری چندوجهی بومی

معماری Gemini بر مفهوم **ادغام زودهنگام** (early fusion) استوار است. پچ‌های پیکسلی تصاویر، فریم‌های زمانی ویدئو، اسپکتروگرام‌های صوتی و token های متنی همگی به یک فضای latent مشترک فرافکنده می‌شوند. گزارش فنی Gemini 2.5 این رویکرد را «Unified Multimodal Token Interleaving» توصیف می‌کند. از آنجا که تمام token های وجه‌های مختلف در یک دنباله مشترک پردازش می‌شوند، مکانیزم‌های self-attention استاندارد به طور طبیعی یکپارچه‌سازی متقاطع داده‌ها از وجه‌های مختلف را در هر لایه تأمین می‌کنند. سیگنال‌های صوتی مستقیماً از موج صوتی (waveform) توسط encoder های تخصصی پردازش می‌شوند که ویژگی‌های آکوستیک (لحن، تمبر، صداهای پس‌زمینه) را حفظ می‌کند — ویژگی‌هایی که در استفاده از سیستم‌های واسطه Speech-to-Text از دست می‌روند.

برای دسته transformer، عملیات پایه مکانیزم attention است:

$$
{Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V
$$

که در آن $Q$ ماتریس query، $K$ ماتریس key، $V$ ماتریس value و $d_{k}$ بُعد key هستند.

### Sparse Mixture of Experts (Sparse MoE)

از نسخه ۱.۵ به بعد، مدل‌های Gemini از معماری **Sparse Mixture-of-Experts (MoE)** استفاده می‌کنند. Gemini 1.0 از transformer متراکم (dense) بهره می‌برد؛ گذار به MoE مستقیماً در گزارش فنی ۱.۵ توصیف شده است: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».

در معماری MoE، لایه‌های fully connected استاندارد (Feed-Forward Networks) با مجموعه‌ای از زیرشبکه‌های تخصصی — «متخصصان» — جایگزین می‌شوند. برای token ورودی $x \in {\mathbb{R}}^{d}$، خروجی $y$ به صورت میانگین وزنی خروجی‌های $k$ متخصصان فعال ($k \ll E$، که $E$ تعداد کل متخصصان است) محاسبه می‌شود:

$$
y = \sum\limits_{i \in \mathcal{T}_{k}(x)}g_{i}(x)\, E_{i}(x)
$$

که در آن $E_{i}(x)$ تابع غیرخطی متخصص $i$-ام است، $\mathcal{T}_{k}(x)$ مجموعه اندیس‌های $k$ زیرشبکه‌های انتخاب‌شده است، و وزن مسیریابی $g_{i}(x)$ توسط تابع مسیریابی آموخته‌شده (learned routing function) با اعمال تابع Softmax بر $k$ بزرگ‌ترین مقادیر محاسبه می‌شود.

این رویکرد امکان افزایش قابل توجه ظرفیت پارامتری کلی مدل را فراهم می‌کند و در عین حال هزینه‌های محاسباتی (FLOPs) را پایین نگه می‌دارد، چرا که برای هر token تنها زیرمجموعه‌ای از پارامترها فعال می‌شود. Google تعداد واقعی پارامترهای مدل‌های Gemini را افشا نکرده است.

### بافت طولانی و «یادگیری در بافت»

Gemini 1.5 با افزایش اندازه پنجره بافت به **۱ میلیون token** در حالت production (با آزمایش تجربی تا ۱۰ میلیون token) پیشرفتی بزرگ ایجاد کرد. این مقدار به مراتب بیشتر از مدل‌های پیشین بود (مثلاً GPT-4 Turbo با ۱۲۸ هزار token). Google نتیجه ۹۹٪ در آزمون Needle In A Haystack با طول بافت ۱ میلیون token را اعلام کرد. در نسل‌های بعدی، بافت طولانی به عنوان یکی از ویژگی‌های کلیدی این خط مدل‌ها تثبیت شد. چنین بافت گسترده‌ای به مدل اجازه می‌دهد:

- کتاب‌های کامل، ویدئوهای چندساعته (تا ۳ ساعت) یا پایگاه‌های کد بزرگ را در یک درخواست واحد تحلیل کند.
- «یادگیری در بافت» (in-context learning) را بر روی حجم عظیمی از داده‌های ارائه‌شده در prompt انجام دهد، که امکان دریافت پاسخ‌های بسیار سفارشی را بدون نیاز به fine-tuning فراهم می‌کند.

### «مدل‌های اندیشنده» و مقیاس‌بندی محاسبات در زمان inference

از Gemini 2.5 به بعد، Google **thinking** را به عنوان حالت کاری مجزایی از مدل‌ها معرفی می‌کند. مستندات رسمی آن را به عنوان فرآیند محاسباتی داخلی تعریف می‌کند که برنامه‌ریزی چندمرحله‌ای و استدلال را بهبود می‌بخشد. مدل‌های نسخه ۲.۵ (که به عنوان «thinking models» توصیف می‌شوند) قادرند قبل از ارائه پاسخ نهایی، مراحل استدلال میانی را به صورت داخلی تولید و ارزیابی کنند. این امر دقت را در مسائل منطقی و ریاضی پیچیده به طور قابل توجهی افزایش می‌دهد.

تمایز میان دو مکانیزم اهمیت دارد:

- **تفکر درونی (Thinking)**: حالت پایه برای مدل‌های سری ۲.۵ و ۳، که زنجیره استدلال پنهان (Chain-of-Thought) تولید می‌کند. API می‌تواند **thought summaries** — خلاصه‌های مختصر از استدلال‌های داخلی — را به جای جریان کامل «افکار خام» بازگرداند. از مدل ۳.۱ Pro به بعد، بودجه تفکر از طریق پارامتر `thinking_level` با مقادیر از Low تا Max تنظیم می‌شود.
- **Deep Think**: **حالت استدلال پیشرفته آزمایشی** مجزایی که از تولید موازی فرضیه‌ها استفاده می‌کند و به منابع محاسباتی به مراتب بیشتری نیاز دارد. در Google I/O در ۲۰ مه ۲۰۲۵ اعلام شد و در ۱ اوت ۲۰۲۵ برای مشترکین AI Ultra باز شد. Deep Think را نباید با مکانیزم پایه thinking یکی دانست.

### قابلیت‌های عاملی (Agentic Capabilities)

از نسخه ۲.۰ به بعد، Gemini می‌تواند با دنیای خارج تعامل داشته باشد: ابزارها را فراخوانی کند، در Google جستجو کند، کد اجرا کند و عناصر UI را مدیریت کند. Google به صراحت Gemini 2.0 را به عنوان مدلی برای «عصر جدید عاملی» (agentic era) با پشتیبانی بومی از tool use معرفی کرد.

تا فوریه ۲۰۲۶، Gemini API شامل یک لایه رسمی‌شده از قابلیت‌های عاملی با پشتیبانی از ابزارهای زیر است: **Google Search**، **Google Maps**، **Code Execution**، **URL Context**، **Computer Use**، **File Search**، و همچنین **Live API** برای تعامل دوطرفه در زمان واقعی.

## تکامل مدل‌های Gemini

خانواده Gemini با سرعتی فوق‌العاده در حال توسعه است: در دوره دسامبر ۲۰۲۳ تا فوریه ۲۰۲۶، چهار نسل اصلی از مدل‌ها منتشر شده است.

### Gemini 1.0 (دسامبر ۲۰۲۳)

نسل اول که پایه چندوجهی بودن بومی را بنا نهاد. در ۶ دسامبر ۲۰۲۳ به صورت عمومی معرفی شد.

- **نسخه‌ها:** **Ultra** (پرچم‌دار برای پیچیده‌ترین وظایف)، **Pro** (مدل همه‌منظوره) و **Nano** (کم‌حجم برای دستگاه‌های موبایل؛ به Nano-1 با ۱.۸ میلیارد پارامتر و Nano-2 با ۳.۲۵ میلیارد پارامتر تقسیم می‌شد).
- **پنجره بافت:** **۳۲٬۷۶۸ token** برای تمام نسخه‌ها.
- **دستاوردها:** Gemini 1.0 Ultra اولین مدلی شد که به سطح متخصص انسانی در benchmark MMLU دست یافت و آن را با نتیجه **۹۰.۰۴٪** پشت سر گذاشت (با استفاده از تکنیک CoT@32 — زنجیره استدلال با ۳۲ نمونه و رأی‌گیری اکثریت؛ در prompting استاندارد ۵-shot نتیجه حدود ۸۳.۷٪ بود). نتایج SOTA را در ۳۰ از ۳۲ benchmark دانشگاهی به دست آورد.
- **پایان پشتیبانی:** Gemini 1.0 Pro در ۱۸ فوریه ۲۰۲۵ منسوخ اعلام شد.

### Gemini 1.5 (فوریه — مه ۲۰۲۴)

پیشرفتی بزرگ در طول بافت و کارایی.

- **معماری:** گذار از transformer متراکم به Mixture-of-Experts (MoE).
- **پنجره بافت:** تا **۱ میلیون token** در production (۲ میلیون — به صورت waitlist برای ۱.۵ Pro، اعلام شده در مه ۲۰۲۴ در Google I/O).
- **نسخه‌ها:** **1.5 Pro** (اعلام شده در فوریه ۲۰۲۴؛ با کیفیتی معادل ۱.۰ Ultra با هزینه‌های به مراتب کمتر) و **1.5 Flash** (نسخه سبک‌تر و سریع‌تر، در مه ۲۰۲۴ اضافه شد).
- **پایان پشتیبانی:** تمام مدل‌های Gemini 1.5 (Pro، Flash، Flash-8B) در **۲۹ سپتامبر ۲۰۲۵** از سرویس خارج شدند.

### Gemini 2.0 (دسامبر ۲۰۲۴ — فوریه ۲۰۲۵)

گذار به «عصر عاملی».

- **جدول زمانی:** ۱۱ دسامبر ۲۰۲۴ — اعلام **2.0 Flash Experimental** (ورودی چندوجهی، خروجی متنی)؛ ۵ فوریه ۲۰۲۵ — در دسترس عموم (GA) قرار گرفتن 2.0 Flash، انتشار **2.0 Pro Experimental** و **2.0 Flash-Lite**.
- **نوآوری‌های کلیدی:** قابلیت‌های عاملی درونی (tool use)، تولید بومی تصویر و صدا (ابتدا در حالت محدود برای شرکای early-access)، تمرکز بر سناریوهای عاملی.
- **پنجره بافت:** تا ۲ میلیون token (2.0 Pro)؛ تا ۱ میلیون token (2.0 Flash-Lite).
- **پایان پشتیبانی:** مدل‌های 2.0 Flash و Flash-Lite برنامه‌ریزی شده‌اند تا در **۱ ژوئن ۲۰۲۶** از سرویس خارج شوند.

### Gemini 2.5 (مارس — ژوئن ۲۰۲۵)

اولین «مدل اندیشنده» (thinking model) با بودجه استدلال قابل تنظیم.

- **جدول زمانی:** ۲۵ مارس ۲۰۲۵ — اعلام **2.5 Pro Experimental**؛ ۱۷ آوریل — **2.5 Flash** (اولین مدل reasoning کاملاً ترکیبی با حالت تفکر قابل تغییر)؛ ۲۰ مه (Google I/O) — به‌روزرسانی‌های ۲.۵ Pro و Flash، اعلام Deep Think؛ **۱۷ ژوئن ۲۰۲۵** — GA همزمان برای ۲.۵ Pro و ۲.۵ Flash؛ در همان روز — پیش‌نمایش **2.5 Flash-Lite** (GA در ۲۲ ژوئیه). ۱ اوت — Deep Think برای مشترکین AI Ultra باز شد.
- **نوآوری‌های کلیدی:** مکانیزم «تفکر» (thinking) درونی با بودجه‌های قابل تنظیم؛ Deep Think به عنوان حالت پیشرفته مجزا. نتایج SOTA در benchmark های پیچیده ریاضی، منطقی و برنامه‌نویسی (AIME 2025 — ۸۶.۷٪، GPQA Diamond — ۸۴.۰٪، Humanity's Last Exam — ۱۸.۸٪ بدون ابزار).
- **پنجره بافت:** **۱ میلیون token** در ورودی، تا ۶۴٬۰۰۰ token در خروجی. افزایش وعده‌داده‌شده تا ۲ میلیون token برای ۲.۵ Pro در طول چرخه حیات مدل تأیید نشد.
- **نسخه‌های تخصصی:** **Gemini 2.5 Flash Image** (نام رمزی «Nano Banana»، به صورت ناشناس در ۱۲ اوت در Arena ظاهر شد، در ۲۶ اوت ۲۰۲۵ رسماً منتشر شد — به دلیل «فیگورین‌های ۳D» فوتورئالیستی وایرال شد و ۱۰ میلیون کاربر جدید جذب کرد)؛ **Computer Use Preview** (۷ اکتبر ۲۰۲۵، بر پایه ۲.۵ Pro)؛ مدل‌های Text-to-Speech (2.5 Flash TTS، 2.5 Pro TTS).
- **گزارش فنی:** گزارش مشترک **Gemini 2.X** در ۷ ژوئیه ۲۰۲۵ روی arXiv منتشر شد (arXiv:2507.06261)، شامل بیش از ۳٬۳۰۰ نویسنده است و مدل‌های 2.5 Pro، 2.5 Flash، 2.0 Flash، 2.0 Flash-Lite را پوشش می‌دهد.

### Gemini 3.x (نوامبر ۲۰۲۵ — فوریه ۲۰۲۶)

نسل سوم نشانه‌ای از گذار از تولید پایه به فرآیندهای عاملی طولانی‌مدت (agentic workflows) و حل مسائل علمی میان‌رشته‌ای بود.

- **Gemini 3 Pro (۱۸ نوامبر ۲۰۲۵):** توسط Sundar Pichai، مدیرعامل Alphabet، و Demis Hassabis، رئیس DeepMind، به عنوان «هوشمندترین مدل Google» معرفی شد. اولین مدل Gemini که در روز راه‌اندازی در Google Search مستقر شد. اولین مدلی شد که از مرز **۱۵۰۰ Elo در LMArena** گذشت (1501 در لحظه راه‌اندازی). نتایج: GPQA Diamond — ۹۱.۹٪؛ SWE-bench Verified — ۷۶.۲٪؛ Humanity's Last Exam — ۳۷.۵٪ (بدون ابزار)؛ SimpleQA — ۷۲.۱٪.
- **Gemini 3 Flash (۱۷ دسامبر ۲۰۲۵):** به مدل پیش‌فرض در برنامه Gemini تبدیل شد. با قیمت ۰.۵۰ دلار به ازای هر ۱ میلیون token ورودی، در SWE-bench Verified (۷۸٪) از 3 Pro پیشی گرفت و ۳۰٪ کمتر از آن token برای وظایف استدلال مصرف کرد. GPQA Diamond — ۹۰.۴٪؛ HLE — ۳۳.۷٪.
- **Gemini 3.1 Pro (۱۹ فوریه ۲۰۲۶):** مدل پرچم‌دار در تاریخ انتشار. اولین انتشار «افزایشی» (.1 به جای .5 پیشین). نتیجه کلیدی — **ARC-AGI-2: ۷۷.۱٪** (بیش از دو برابر ۳۱.۱٪ مدل 3 Pro). AIME 2025 — ۹۱.۲٪؛ GPQA Diamond — ۹۴.۳٪؛ SWE-bench Verified — ۸۰.۶٪. سطح تفکر MEDIUM جدید از طریق پارامتر `thinking_level` معرفی شد. endpoint تخصصی `gemini-3.1-pro-preview-customtools` برای کار با bash terminal و توابع کاربر. مشکل برش خروجی در تولیدات طولانی رفع شد. کانال‌ها: Gemini App، Vertex AI، AI Studio، Gemini API، NotebookLM.
- **Gemini 3 Deep Think (به‌روزرسانی ۱۲ فوریه ۲۰۲۶):** به‌روزرسانی بزرگ حالت «اندیشنده» تخصصی. فراتر از ریاضیات و برنامه‌نویسی رفت: نتایج سطح مدال طلا در المپیادهای بین‌المللی فیزیک (IPhO) و شیمی (IChO) سال ۲۰۲۵؛ **ARC-AGI-2 — ۸۴.۶٪**؛ **Humanity's Last Exam — ۴۸.۴٪**؛ CMT-Benchmark (فیزیک نظری ماده متراکم) — ۵۰.۵٪؛ Codeforces Elo — 3455. بر پایه Deep Think، عامل پژوهشی **Aletheia** ساخته شد که به طور خودمختار چند مسئله باز از پایگاه Erdős (از جمله مسئله Erdős-1051) را حل کرد.

## جدول خلاصه نسل‌های Gemini

| نسل            | سال انتشار | نسخه‌های کلیدی                         | حداکثر پنجره بافت                           | نوآوری‌های معماری و بهبودهای کلیدی                                                                            |
|----------------|------------|---------------------------------------|---------------------------------------------|--------------------------------------------------------------------------------------------------------------|
| **Gemini 1.0** | 2023       | Ultra, Pro, Nano                      | 32٬768 token                                | چندوجهی بودن بومی از ابتدا؛ transformer متراکم؛ فراتر از انسان در MMLU (۹۰.۰۴٪ CoT@32).                      |
| **Gemini 1.5** | 2024       | Pro, Flash                            | 1٬000٬000 token (۲ میلیون به صورت waitlist) | معماری Mixture-of-Experts (MoE)؛ افزایش انقلابی بافت؛ ۹۹٪ در Needle In A Haystack.                           |
| **Gemini 2.0** | 2024–2025  | Pro, Flash, Flash-Lite                | 1٬000٬000 — 2٬000٬000 token                 | عصر «agentic AI»: یکپارچه‌سازی بومی ابزارها، تولید تصویر و صدا، Live API.                                     |
| **Gemini 2.5** | 2025       | Pro, Flash, Flash-Lite                | 1٬000٬000 token (ورودی)، 64٬000 (خروجی)     | «مدل اندیشنده» (thinking)؛ بودجه‌های استدلال قابل تنظیم؛ Deep Think؛ تولید تصویر (Nano Banana)؛ Computer Use. |
| **Gemini 3.x** | 2025–2026  | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1٬000٬000 token                             | Agentic workflows؛ پارامتر thinking_level؛ پیشرفت در ARC-AGI-2 و المپیادهای علمی؛ Aletheia.                  |

تکامل ویژگی‌های کلیدی مدل‌های Gemini

## نتایج کلیدی و benchmark ها

با توجه به اشباع benchmark های کلاسیک (مانند MMLU)، ارزیابی عملکرد مدل‌های Gemini به سمت وظایف استدلال انتزاعی، مدل‌سازی علمی و برنامه‌نویسی خودمختار تغییر یافته است. نتایج بر اساس داده‌های رسمی Google (self-reported) ارائه می‌شوند؛ مقایسه آن‌ها تنها در صورت یکسان بودن حالت inference، وجود/عدم وجود tool use، روش نمونه‌برداری (single-attempt در مقابل majority voting) و model-id مشخص معتبر است.

| Benchmark                | شرح وظیفه                         | Gemini 2.5 Pro (ژوئن ۲۰۲۵) | Gemini 3 Pro (نوامبر ۲۰۲۵) | Gemini 3.1 Pro (فوریه ۲۰۲۶) | Gemini 3 Deep Think (فوریه ۲۰۲۶) |
|--------------------------|-----------------------------------|----------------------------|----------------------------|-----------------------------|----------------------------------|
| **MMLU**                 | درک زبان چندوظیفه‌ای               | —                          | —                          | —                           | —                                |
| **GPQA Diamond**         | سؤالات علمی سطح دکتری             | 84.0%                      | 91.9%                      | **94.3%**                   | N/A                              |
| **Humanity's Last Exam** | دانش تخصصی مرزی                   | 18.8%                      | 37.5%                      | 44.4%                       | **48.4%**                        |
| **ARC-AGI-2**            | معماهای منطقی انتزاعی             | 4.9%                       | 31.1%                      | 77.1%                       | **84.6%**                        |
| **SWE-bench Verified**   | حل خودمختار مسائل در مخازن GitHub | 63.8%\*                    | 76.2%                      | **80.6%**                   | N/A                              |
| **AIME 2025**            | مسائل ریاضی سطح المپیاد           | 86.7%                      | —                          | **91.2%**                   | —                                |
| **Codeforces (Elo)**     | رتبه‌بندی در برنامه‌نویسی رقابتی    | —                          | —                          | 2887                        | **3455**                         |

نتایج مدل‌های Gemini در benchmark های کلیدی (داده‌های فوریه ۲۰۲۶)

\* نتیجه 2.5 Pro در SWE-bench با custom agent setup به دست آمده است.

### رتبه‌بندی در LMArena (برش پایان فوریه ۲۰۲۶)

LMArena (پیشتر Chatbot Arena) — پلتفرم مستقل رأی‌گیری کور زوجی. رتبه‌بندی‌ها به صورت پویا محاسبه می‌شوند؛ مقادیر در لحظه راه‌اندازی مدل ممکن است با مقادیر فعلی تفاوت داشته باشند.

| مدل                        | رتبه‌بندی | جایگاه | آرا    | یادداشت     |
|----------------------------|----------|--------|--------|-------------|
| **Gemini 3.1 Pro Preview** | 1500 ± 9 | \#3    | 4٬060  | Preliminary |
| **Gemini 3 Pro**           | 1486 ± 4 | \#5    | 37٬854 |             |
| **Gemini 3 Flash**         | 1473 ± 5 | \#7    | 28٬847 |             |
| **Gemini 2.5 Pro**         | 1464 ± 3 | \#9    | 97٬296 |             |
| **Gemini 2.5 Flash**       | 1411 ± 3 | \#64   | 96٬163 |             |

Overall (برش ۲۴ فوریه ۲۰۲۶)

در لحظه راه‌اندازی در ۱۸ نوامبر ۲۰۲۵، Gemini 3 Pro به رتبه‌بندی 1501 Elo دست یافت و اولین مدلی شد که از مرز ۱۵۰۰ در LMArena گذشت.

## سیستم‌های تخصصی و عاملی

aکوسیستم Gemini با مدل‌ها و پلتفرم‌هایی گسترش یافته که قادر به انجام اقدامات چندمرحله‌ای در محیط‌های دیجیتال و فیزیکی هستند.

### عوامل خودمختار

- **Jules** — عامل کدنویسی خودمختار که به صورت ناهمزمان در ماشین‌های مجازی ابری محافظت‌شده کار می‌کند. در GitHub شاخه و pull request می‌سازد. در Google I/O در ۲۰ مه ۲۰۲۵ به بتای عمومی وارد شد (بیش از ۱۴۰٬۰۰۰ بهبود کد در دوره آزمایش بتا)، GA — ۶ اوت ۲۰۲۵. تا پایان ۲۰۲۵ به یکی از بزرگترین مشارکت‌کنندگان در مخازن داخلی Google تبدیل شد.
- **Project Mariner** — نمونه اولیه تحقیقاتی عامل مرورگری برای وظایف چندمرحله‌ای وب. به ماشین‌های مجازی ابری منتقل شد با پشتیبانی از تا ۱۰ وظیفه موازی و قابلیت «Teach & Repeat». به ۸۳.۵٪ در benchmark WebVoyager دست یافت. قابلیت‌های Computer Use به Gemini API منتقل شدند.
- **Google Antigravity** — محیط توسعه یکپارچه (IDE) برای مدیریت عوامل هوش مصنوعی که در نوامبر ۲۰۲۵ معرفی شد. عوامل به صورت خودمختار کد را تغییر می‌دهند، با terminal و مرورگر داخلی تعامل دارند و آرتیفکت‌های قابل تأیید (diff های کد) را برای تأیید توسط توسعه‌دهنده بازمی‌گردانند.
- **عامل Aletheia** — عامل تحقیقات ریاضی تخصصی بر پایه Gemini 3 Deep Think. مجهز به تأییدکننده زبان طبیعی و ابزارهای جستجوی وب برای بررسی ادبیات است. در ابتدای ۲۰۲۶ به صورت خودمختار چند مسئله باز ریاضی از پایگاه Erdős را حل کرد و به عنوان نویسنده مشترک در انتشارات علمی شرکت کرد.

### عوامل هوش مصنوعی مصرفی

- **Phone Automations** — یکپارچه‌سازی عامل خودمختار در سطح سیستم‌عامل Android (نسخه بتا برای Pixel 10 و Samsung Galaxy S26). در یک محیط ایزوله امن (secure sandbox) کار می‌کند و قادر است بر اساس تحلیل بصری GUI در برنامه‌های شخص ثالث پیمایش کند.
- **Gemini in Chrome (Auto Browse)** — عامل مرورگری برای خودکارسازی وظایف چندمرحله‌ای وب، از سپتامبر ۲۰۲۵ برای تمام کاربران Chrome در دسترس است (در ژانویه ۲۰۲۶ به Gemini 3 به‌روزرسانی شد).

### Computer Use

مدل‌های **Gemini 2.5 Computer Use** برای مدیریت رابط‌های کاربری گرافیکی (UI) بهینه شده‌اند. سیستم اسکرین‌شات و تاریخچه اقدامات را به عنوان ورودی دریافت می‌کند و مختصات $(x,y)$ برای شبیه‌سازی نرم‌افزاری مکان‌نما و دستورات ورودی صفحه‌کلید تولید می‌کند.

### Gemini Robotics

مدل‌های کلاس Vision-Language-Action (VLA) و Embodied Reasoning (ER) که در مارس ۲۰۲۵ معرفی شدند. این معماری‌ها اطلاعات فضایی-زمانی را پردازش می‌کنند و مسیرهای ۳D حرکت بازوهای رباتیک را به عنوان وجه خروجی بومی پیش‌بینی می‌کنند (arXiv:2503.20020).

### مدل‌های تولیدی تخصصی (ابتدای ۲۰۲۶)

- **Nano Banana 2 (Gemini 3.1 Flash Image)** — در ۲۶ فوریه ۲۰۲۶ منتشر شد، مدل بصری‌ای که سرعت معماری Flash را با کیفیت Pro ترکیب می‌کند. حفظ دقیق هویت شخصیت‌ها (character consistency)، تولید بومی تایپوگرافی در داخل تصاویر و یکپارچه‌سازی واترمارک رمزنگاری‌شده SynthID با متادیتای C2PA را فراهم می‌کند.
- **Lyria 3** — مدل موسیقی که در ۱۸ فوریه ۲۰۲۶ در برنامه Gemini یکپارچه شد. قطعات موسیقی ۳۰ ثانیه‌ای (شامل آواز و ساز) را بر اساس prompt های متنی، عکس‌ها یا ویدئوها تولید می‌کند.
- **Veo 3.1** — مدل تولید ویدئو. از ساخت کلیپ با استفاده از تا سه تصویر مرجع («Ingredients to Video»)، تولید انتقال بین فریم اول و آخر مشخص‌شده، رندر بومی ویدئوی عمودی (9:16) و upscaling تا رزولوشن 4K پشتیبانی می‌کند.
- **Med-Gemini** — مدل خاص حوزه برای وظایف پزشکی (arXiv:2404.18416، arXiv:2405.03162).

## کاربرد و اکوسیستم

Google مدل‌های Gemini را به طور عمیق در محصولات مصرفی و توسعه‌دهنده خود یکپارچه کرده است.

### محصولات مصرفی

- **برنامه Gemini**: چت‌بات (پیشتر Bard، در ۸ فوریه ۲۰۲۴ تغییر نام یافت) که از مدل‌های خانواده Gemini به عنوان دستیار هوش مصنوعی همه‌منظوره استفاده می‌کند. تا فوریه ۲۰۲۶ بیش از ۷۵۰ میلیون کاربر فعال دارد. rollout فعلی شامل مدل 3.1 Pro است. اشتراک‌ها: **Google AI Pro** (۱۹.۹۹ دلار در ماه، جایگزین Google One AI Premium شد) و **Google AI Ultra** (۲۴۹.۹۹ دلار در ماه، با دسترسی به Deep Think، Veo 3 و ویژگی‌های اولویت‌دار).
- **Google Workspace**: یکپارچه‌سازی Gemini در Gmail، Docs، Sheets، Meet برای کمک در نوشتن متن، تحلیل داده و تولید محتوا (rebrand از Duet AI).
- **Google Search**: قابلیت **AI Overviews** پاسخ‌های خلاصه‌شده برای درخواست‌های پیچیده بر اساس مدل تخصصی Gemini تولید می‌کند. **AI Mode** که در Google I/O 2025 راه‌اندازی شد، جستجوی عمیق با قابلیت‌های عاملی (رزرو، خرید) را فراهم می‌کند.
- **Android و Pixel**: **Gemini Nano** (نسخه ۳ در Pixel 10 با تراشه Tensor G5، اوت ۲۰۲۵) به صورت محلی روی گوشی‌های هوشمند کار می‌کند و پاسخ‌های هوشمند، خلاصه‌سازی، تشخیص تماس‌های کلاهبرداری و دسترس‌پذیری را با حفظ حریم خصوصی داده‌ها فراهم می‌کند. ML Kit GenAI API برای توسعه‌دهندگان از خلاصه‌سازی، تصحیح و تشخیص گفتار روی دستگاه پشتیبانی می‌کند.
- **NotebookLM**: از ابزار یادداشت‌برداری به پلتفرم خلاقانه کامل تکامل یافته است. در مارس ۲۰۲۵ به Google Workspace پیوست. از Audio Overviews تعاملی، Video Overviews، Mind Maps، اسلایدها و اینفوگرافیک پشتیبانی می‌کند. در دسامبر ۲۰۲۵ به Gemini 3 به‌روزرسانی شد؛ پنجره بافت کامل ۱ میلیون token برای چت — از فوریه ۲۰۲۶.
- **Gemini Live**: قابلیت‌های دوربین و اشتراک‌گذاری صفحه از Project Astra برای تمام کاربران Android و iOS رایگان شدند.

### پلتفرم‌های توسعه‌دهنده

- **Google AI Studio و Gemini API**: رابط‌های اصلی برای دسترسی به مدل‌های Gemini از طریق API. تا فوریه ۲۰۲۶ از بلوک‌های قابلیتی پشتیبانی می‌کنند: Thinking، Thought signatures، Long context، Tools and agents (Google Search، Maps، Code Execution، URL Context، Computer Use، File Search، Deep Research، Live API).
- **Vertex AI**: پلتفرم سازمانی با قابلیت‌های پیشرفته امنیتی و مدیریتی.
- **Google Gen AI SDK**: تا مه ۲۰۲۵ به GA برای Python، JavaScript/TypeScript، Go و Java دست یافت و دسترسی یکپارچه به Gemini Developer API و Vertex AI را فراهم می‌کند. از **Model Context Protocol (MCP)** پشتیبانی می‌کند.
- **Gemini CLI**: ابزار خط فرمان برای کدنویسی هوش مصنوعی در terminal (در ژوئن ۲۰۲۵ راه‌اندازی شد).
- **Interactions API**: رابط یکپارچه برای مدل‌ها و عوامل (بتا از دسامبر ۲۰۲۵).

### چرخه حیات API و مدیریت نسخه

مدل‌های Gemini در API به دسته‌های **stable**، **preview**، **latest** و **experimental** تقسیم می‌شوند. `model_id` مشخص و خانواده مدل‌ها یکی نیستند؛ برای سناریوهای production، اتصال به نسخه مشخص و مهلت‌های پشتیبانی آن از اهمیت حیاتی برخوردار است. در مستندات API، یک رجیستری از deprecation ها با تاریخ‌های پایان پشتیبانی نگهداری می‌شود.

برای پشتیبانی از وظایف خودمختار طولانی‌مدت، **Session Resumption** (ذخیره وضعیت جلسه در سرور تا ۲۴ ساعت) و **Context Compression** (مکانیزم پنجره لغزنده برای فشرده‌سازی خودکار بافت در صورت تجاوز از حد مجاز) پیاده‌سازی شده‌اند.

در دسامبر ۲۰۲۵، Google سهمیه‌های سطح رایگان API را تقریباً ۹۲٪ کاهش داد (بدون اطلاع قبلی)، که واکنش شدید جامعه توسعه‌دهندگان را برانگیخت. در عین حال، هزینه سرویس‌دهی مدل‌های Gemini در طول سال ۲۰۲۵ به دلیل بهینه‌سازی‌ها ۷۸٪ کاهش یافت.

## محدودیت‌ها و مشکلات باز

- **توهم‌زایی و confabulation:** مدل‌ها تمایل به تولید اطلاعات واقعی نادرست را حفظ می‌کنند، به ویژه هنگامی که قابلیت‌های grounding (Search Grounding) غیرفعال باشند. Gemini 3.1 Pro سطح توهم‌زایی را بر اساس benchmark SimpleQA در مقایسه با نسخه‌های قبلی کاهش داد، اما مشکل برای همه LLM ها سیستمیک باقی می‌ماند.
- **سرقت ادبی ناخودآگاه (Subconscious Plagiarism):** در آزمایش‌ها با عامل Aletheia مشکل بازتولید اثبات‌های غیرتریویال از مجموعه آموزشی که به عنوان کشف‌های خودمختار ارائه می‌شوند شناسایی شد، که اعتبارسنجی نوآوری تحقیقات هوش مصنوعی را دشوار می‌کند.
- **افت عملکرد در بافت طولانی:** هنگام پردازش بافت‌هایی به اندازه ۱ میلیون token، مدل‌ها در معرض اثر «Lost in the Middle» قرار دارند — کاهش دقت در استخراج حقایق از وسط سند.
- **هزینه‌های محاسباتی بالا:** inference با حداکثر تنظیمات Deep Think به زمان و منابع (TPU) به مراتب بیشتری نیاز دارد، که استفاده در برنامه‌های همزمان زمان واقعی را محدود می‌کند.
- **رد درخواست‌های نادرست مثبت (Over-refusals):** به دلیل الگوریتم‌های سخت‌گیرانه alignment، مدل‌های استدلال پیچیده تمایل دارند درخواست‌های مشروع را با طبقه‌بندی نادرست آن‌ها به عنوان بالقوه مضر رد کنند (به ویژه در زمینه تحلیل کد و امنیت اطلاعات). در model card همچنین مشکلات لحن «موعظه‌گرانه» (preachy) در رد درخواست‌ها ذکر شده است.
- **محدودیت‌های استدلال:** model card های سری ۲.۵ و ۳ محدودیت‌هایی را در درک علّی (causal understanding)، استنتاج منطقی پیچیده (complex logical deduction) و استدلال خلاف واقع (counterfactual reasoning)، و همچنین قابلیت پیش‌بینی ناقص در رعایت بودجه‌های تفکر برمی‌شمارند.

## جنبه‌های اخلاقی و امنیت

استقرار مدل‌های Gemini با سیستم چندلایه‌ای از اقدامات امنیتی همراه است.

### چارچوب‌های کلی

**Secure AI Framework (SAIF)** — رویکرد کلی Google به امنیت سیستم‌های هوش مصنوعی (اعلام شده در ژوئن ۲۰۲۳) که زمینه توسعه را شکل می‌دهد اما یک استاندارد خاص Gemini نیست. **Frontier Safety Framework v3** (سپتامبر ۲۰۲۵) حوزه‌های CBRN، امنیت سایبری، ML R&D، تأثیر دستکارانه و رویکرد آزمایشی به خطرات عدم همسویی (misalignment) را پوشش می‌دهد.

### اقدامات خاص Gemini

- **Model cards** — منابع اولیه اطلاعات درباره محدودیت‌ها و امنیت مدل‌های خاص. بخش‌هایی از Intended Usage and Limitations، Ethics and Content Safety، Frontier Safety را دارند. Model card مربوط به Gemini 3 Pro تأیید کرد که مدل به هیچ سطح قابلیت بحرانی (Critical Capability Level) در حوزه‌های CBRN و امنیت سایبری دست نیافته است.
- **آزمایش تعصب و سمیت:** تحلیل و کاهش تعصب در داده‌های آموزشی و تولید محتوا.
- **تیم‌های قرمز (Red Teaming):** شبیه‌سازی حملات برای شناسایی آسیب‌پذیری‌ها و رفتارهای ناخواسته. آزمایش مستقل برای عدم همسویی «افزایش جزئی در آگاهی موقعیتی» را آشکار کرد اما هیچ خطر بحرانی نیافت.

### پروب‌های ایمنی (Safety Probes)

برای جلوگیری از تولید محتوای مضر، طبقه‌بندی فعال‌سازی‌های پنهان استفاده می‌شود. برای حل مشکل از دست رفتن سیگنال در بافت‌های طولانی، معماری **MultiMax** استفاده می‌شود: پروب حداکثر مقدار را از تمام لایه‌های $H$ برای هر token $j$ در دنباله $n_{i}$ استخراج می‌کند:

$$
f_{\text{MultiMax}}(S_{i}) = \sum\limits_{h = 1}^{H}\max\limits_{j \in \lbrack n_{i}\rbrack}\lbrack v_{h}^{\top}y_{i,j}\rbrack
$$

پروب‌ها با مدل‌های پایه در طبقه‌بندی‌کننده‌های آبشاری ترکیب می‌شوند و دقت فیلترسازی را با هزینه محاسباتی پایین افزایش می‌دهند (arXiv:2601.11516).

### نشانه‌گذاری رمزنگاری (SynthID)

داده‌های صوتی تولیدشده از طریق Live API و تصاویر (از مدل‌های Nano Banana / Flash Image) با الگوریتم **SynthID** علامت‌گذاری می‌شوند. واترمارک نامرئی در سطح پیکسل یا طیف صوتی جاسازی می‌شود و تشخیص ماشینی محتوای تولیدشده را تضمین می‌کند. مدل Nano Banana 2 (فوریه ۲۰۲۶) SynthID را با متادیتای C2PA یکپارچه می‌کند.

### Thinking و پرسش شفافیت

مدل‌هایی با حالت تفکر (سری ۲.۵/۳) می‌توانند **thought summaries** — خلاصه‌های مختصر از استدلال‌های داخلی — را به جای جریان کامل token های میانی بازگردانند. این سطح معینی از شفافیت فراهم می‌کند، اما به دلیل اینکه زنجیره‌های استدلال «خام» واقعی پشت خلاصه‌های ساده‌شده پنهان می‌مانند مورد انتقاد قرار می‌گیرد.

### جنبه‌های نظارتی

در چارچوب **قانون هوش مصنوعی اتحادیه اروپا** (EU AI Act)، Google کدکس عملکرد اتحادیه اروپا در مورد هوش مصنوعی (منتشرشده در ۱۰ ژوئیه ۲۰۲۵) را به همراه OpenAI و Anthropic امضا کرد. Gemini به عنوان مدل هوش مصنوعی با کاربرد عمومی (GPAI) با ریسک سیستمیک طبقه‌بندی می‌شود، که تعهدات امنیتی اضافی را به همراه دارد (از ۲ اوت ۲۰۲۵ لازم‌الاجرا).

## محیط رقابتی

دوره نوامبر — دسامبر ۲۰۲۵ متراکم‌ترین چرخه رقابتی در تاریخ هوش مصنوعی بود: Gemini 3 Pro (۱۸ نوامبر)، Claude Opus 4.5 از Anthropic (۲۴ نوامبر) و GPT-5.2 از OpenAI (۱۱ دسامبر) در طول ۲۴ روز منتشر شدند. تا فوریه ۲۰۲۶ هیچ مدلی در تمام دسته‌ها تسلط ندارد: Gemini 3 Pro در LMArena در متن، بینایی، جستجو و چندزبانگی پیشتاز است؛ GPT-5.2 در ریاضیات خالص (۱۰۰٪ AIME 2025 بدون ابزار) و SWE-bench Pro پیشتاز است؛ Claude Opus 4.5 در SWE-bench Verified رقابت می‌کند. از نظر هزینه API، Gemini تقریباً ۴۲٪ ارزان‌تر از GPT-5 در تماس‌های مشابه است.

## شاخص‌های تجاری

بر اساس گزارش مالی Alphabet برای Q4 2025 (منتشرشده در ۴ فوریه ۲۰۲۶): درآمد Google Cloud — ۱۷.۷ میلیارد دلار در فصل (+۴۸٪ سال به سال)؛ حاشیه سود عملیاتی — ۲۹.۹٪؛ سبد سفارشات Cloud — ۲۴۰ میلیارد دلار (دو برابر شدن در طول یک سال). بیش از ۱۲۰٬۰۰۰ شرکت از Gemini استفاده می‌کنند. در ژانویه ۲۰۲۶، Apple از برنامه‌های ادغام Gemini در Siri خبر داد. Google بیش از ۱۰ میلیارد token در دقیقه از طریق API پردازش می‌کند. عوامل هوش مصنوعی داخلی Google حدود ۵۰٪ از کد شرکت را تولید می‌کنند. هزینه‌های سرمایه‌ای برای ۲۰۲۶ در سطح ۱۷۵–۱۸۵ میلیارد دلار برنامه‌ریزی شده (رشد تقریباً دو برابری نسبت به ۹۱.۴۵ میلیارد دلار در ۲۰۲۵).

## پیوندها

- فهرست مدل‌های Google DeepMind
- مستندات Gemini API برای توسعه‌دهندگان
- کاتالوگ مدل‌های Gemini API
- مستندات Gemini Thinking
- رجیستری deprecation مدل‌های Gemini
- فهرست model card های Google DeepMind

## منابع

### گزارش‌های فنی اولیه Gemini

- Gemini Team, Google (2023). *Gemini: A Family of Highly Capable Multimodal Models*. arXiv:2312.11805.
- Gemini Team, Google (2024). *Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context*. arXiv:2403.05530.
- Comanici, G. et al. (2025). *Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities*. arXiv:2507.06261.

### مدل‌های تخصصی و کاربردها

- Saab, K. et al. (2024). *Capabilities of Gemini Models in Medicine*. arXiv:2404.18416.
- Yang, L. et al. (2024). *Advancing Multimodal Medical Capabilities of Gemini*. arXiv:2405.03162.
- Gemini Robotics Team (2025). *Gemini Robotics: Bringing AI into the Physical World*. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). *Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems*. arXiv:2601.22401.
- DeepMind Research Team (2026). *Building Production-Ready Probes For Gemini*. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). *Deep Think with Confidence*. arXiv:2508.15260.

### منابع (مرورها و روش‌ها)

- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. arXiv:2201.11903.
- Zhang, Z. et al. (2022). *Automatic Chain of Thought Prompting in Large Language Models*. arXiv:2210.03493.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Cai, W. et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Dai, Z. et al. (2019). *Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context*. arXiv:1901.02860.
- Ding, J. et al. (2023). *LongNet: Scaling Transformers to 1,000,000,000 Tokens*. arXiv:2307.02486.
- Yin, S. et al. (2024). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.
- Wang, X. et al. (2023). *Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey*. arXiv:2302.10035.
- Chen, Q. et al. (2025). *Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models*. arXiv:2503.09567.

### پست‌های رسمی وبلاگ Google

- Google (2023). *Introducing Gemini: Google's most capable AI model yet*. The Keyword, 06.12.2023.
- Google DeepMind (2024). *Introducing Gemini 1.5*. The Keyword, 15.02.2024.
- Google (2024). *Introducing Gemini 2.0: A new AI model for the agentic era*. The Keyword, 11.12.2024.
- Google DeepMind (2025). *Gemini 2.0 model updates*. The Keyword, 05.02.2025.
- Google DeepMind (2025). *Gemini 2.5: Our newest Gemini model with thinking*. The Keyword, 25.03.2025.
- Google DeepMind (2025). *Google I/O 2025: Updates to Gemini 2.5*. The Keyword, 20.05.2025.
- Google (2025). *Gemini 3: Introducing the latest Gemini AI model*. The Keyword, 18.11.2025.
- The Deep Think Team (2026). *Gemini 3 Deep Think: Advancing science, research and engineering*. Google Blog, 12.02.2026.
- The Gemini Team (2026). *Gemini 3.1 Pro: A smarter model for your most complex tasks*. Google Blog, 19.02.2026.
