Gemini (Google) (FA)
Google Gemini — خانوادهای از مدلهای زبانی بزرگ (LLM) چندوجهی است که توسط بخش تحقیقاتی Google DeepMind توسعه مییابد. مدلهای Gemini که برای اولین بار در دسامبر ۲۰۲۳ معرفی شدند، بر پایه معماری transformer شبکههای عصبی با پشتیبانی بومی از پردازش و تولید دادههای چندوجهی ساخته شدهاند و متن، تصویر، صدا، ویدئو و کد برنامهنویسی را در بر میگیرند.
تا فوریه ۲۰۲۶، نسل فعلی خط Gemini 3.x است. توسعه معماری بر ادغام مکانیزمهای مقیاسپذیر استنتاج در زمان inference (inference-time scaling) و بهینهسازی مدلها برای استفاده در سیستمهای عامل خودمختار (Agentic AI) متمرکز است. برنامه Gemini بیش از ۷۵۰ میلیون کاربر فعال ماهانه دارد.
نامگذاری و فلسفه
نام «Gemini» (از لاتین — دوقلوها) نمادی است از اتحاد دو گروه تحقیقاتی پیشرو Google — یعنی Google Brain و DeepMind — برای خلق این پروژه. Jeff Dean، مدیر فنی مشترک Google DeepMind، این موضوع را در وبلاگ رسمی (مه ۲۰۲۴) تأیید کرد: «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». پروژه در ابتدا نام رمزی «Titan» داشت؛ نام «Gemini» در آوریل ۲۰۲۳ توسط Dean پیشنهاد شد — همان ماهی که ادغام رسمی Google Brain و DeepMind انجام گرفت. این نام همچنین اشارهای دارد به برنامه فضایی ناسا «جمینی» (۱۹۶۵–۱۹۶۸)، که نقشش در آمادهسازی برنامه «آپولو» در میان تیم توسعهدهندگان بازتاب یافت.
ویژگی کلیدی و بنیان فلسفی Gemini چندوجهی بودن بومی (native multimodality) است. برخلاف بسیاری از مدلهای پیشین که قابلیتهای چندوجهی را بر روی پایه متنی موجود اضافه میکردند، Gemini از ابتدا برای درک همزمان، پردازش و ترکیب انواع مختلف اطلاعات طراحی شده است. گزارش فنی Gemini 1.0 (arXiv:2312.11805) تأیید میکند که مدل «trained jointly across image, audio, video, and text data». این امر به مدل اجازه میدهد نه صرفاً دادهها را بین وجهها ترجمه کند، بلکه درکی عمیقتر و جامعتر از آنها شکل دهد.
معماری و فناوریهای کلیدی
موفقیت و قابلیتهای مدلهای Gemini توسط تعدادی از تصمیمات بنیادی معماری تعیین میشود. Google طراحی سطح پایین کامل تمام اجزای داخلی Gemini را منتشر نمیکند، اما منابع باز امکان تشخیص دسته معماری را فراهم میکنند: تمام مدلهای خانواده ۱.۵ و بالاتر sparse mixture-of-experts transformer-based models با پشتیبانی چندوجهی بومی هستند (تأیید شده در model card مربوط به Gemini 2.5 Flash).
معماری چندوجهی بومی
معماری Gemini بر مفهوم ادغام زودهنگام (early fusion) استوار است. پچهای پیکسلی تصاویر، فریمهای زمانی ویدئو، اسپکتروگرامهای صوتی و token های متنی همگی به یک فضای latent مشترک فرافکنده میشوند. گزارش فنی Gemini 2.5 این رویکرد را «Unified Multimodal Token Interleaving» توصیف میکند. از آنجا که تمام token های وجههای مختلف در یک دنباله مشترک پردازش میشوند، مکانیزمهای self-attention استاندارد به طور طبیعی یکپارچهسازی متقاطع دادهها از وجههای مختلف را در هر لایه تأمین میکنند. سیگنالهای صوتی مستقیماً از موج صوتی (waveform) توسط encoder های تخصصی پردازش میشوند که ویژگیهای آکوستیک (لحن، تمبر، صداهای پسزمینه) را حفظ میکند — ویژگیهایی که در استفاده از سیستمهای واسطه Speech-to-Text از دست میروند.
برای دسته transformer، عملیات پایه مکانیزم attention است:
که در آن ماتریس query، ماتریس key، ماتریس value و بُعد key هستند.
Sparse Mixture of Experts (Sparse MoE)
از نسخه ۱.۵ به بعد، مدلهای Gemini از معماری Sparse Mixture-of-Experts (MoE) استفاده میکنند. Gemini 1.0 از transformer متراکم (dense) بهره میبرد؛ گذار به MoE مستقیماً در گزارش فنی ۱.۵ توصیف شده است: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».
در معماری MoE، لایههای fully connected استاندارد (Feed-Forward Networks) با مجموعهای از زیرشبکههای تخصصی — «متخصصان» — جایگزین میشوند. برای token ورودی ، خروجی به صورت میانگین وزنی خروجیهای متخصصان فعال (، که تعداد کل متخصصان است) محاسبه میشود:
که در آن تابع غیرخطی متخصص -ام است، مجموعه اندیسهای زیرشبکههای انتخابشده است، و وزن مسیریابی توسط تابع مسیریابی آموختهشده (learned routing function) با اعمال تابع Softmax بر بزرگترین مقادیر محاسبه میشود.
این رویکرد امکان افزایش قابل توجه ظرفیت پارامتری کلی مدل را فراهم میکند و در عین حال هزینههای محاسباتی (FLOPs) را پایین نگه میدارد، چرا که برای هر token تنها زیرمجموعهای از پارامترها فعال میشود. Google تعداد واقعی پارامترهای مدلهای Gemini را افشا نکرده است.
بافت طولانی و «یادگیری در بافت»
Gemini 1.5 با افزایش اندازه پنجره بافت به ۱ میلیون token در حالت production (با آزمایش تجربی تا ۱۰ میلیون token) پیشرفتی بزرگ ایجاد کرد. این مقدار به مراتب بیشتر از مدلهای پیشین بود (مثلاً GPT-4 Turbo با ۱۲۸ هزار token). Google نتیجه ۹۹٪ در آزمون Needle In A Haystack با طول بافت ۱ میلیون token را اعلام کرد. در نسلهای بعدی، بافت طولانی به عنوان یکی از ویژگیهای کلیدی این خط مدلها تثبیت شد. چنین بافت گستردهای به مدل اجازه میدهد:
- کتابهای کامل، ویدئوهای چندساعته (تا ۳ ساعت) یا پایگاههای کد بزرگ را در یک درخواست واحد تحلیل کند.
- «یادگیری در بافت» (in-context learning) را بر روی حجم عظیمی از دادههای ارائهشده در prompt انجام دهد، که امکان دریافت پاسخهای بسیار سفارشی را بدون نیاز به fine-tuning فراهم میکند.
«مدلهای اندیشنده» و مقیاسبندی محاسبات در زمان inference
از Gemini 2.5 به بعد، Google thinking را به عنوان حالت کاری مجزایی از مدلها معرفی میکند. مستندات رسمی آن را به عنوان فرآیند محاسباتی داخلی تعریف میکند که برنامهریزی چندمرحلهای و استدلال را بهبود میبخشد. مدلهای نسخه ۲.۵ (که به عنوان «thinking models» توصیف میشوند) قادرند قبل از ارائه پاسخ نهایی، مراحل استدلال میانی را به صورت داخلی تولید و ارزیابی کنند. این امر دقت را در مسائل منطقی و ریاضی پیچیده به طور قابل توجهی افزایش میدهد.
تمایز میان دو مکانیزم اهمیت دارد:
- تفکر درونی (Thinking): حالت پایه برای مدلهای سری ۲.۵ و ۳، که زنجیره استدلال پنهان (Chain-of-Thought) تولید میکند. API میتواند thought summaries — خلاصههای مختصر از استدلالهای داخلی — را به جای جریان کامل «افکار خام» بازگرداند. از مدل ۳.۱ Pro به بعد، بودجه تفکر از طریق پارامتر
thinking_levelبا مقادیر از Low تا Max تنظیم میشود. - Deep Think: حالت استدلال پیشرفته آزمایشی مجزایی که از تولید موازی فرضیهها استفاده میکند و به منابع محاسباتی به مراتب بیشتری نیاز دارد. در Google I/O در ۲۰ مه ۲۰۲۵ اعلام شد و در ۱ اوت ۲۰۲۵ برای مشترکین AI Ultra باز شد. Deep Think را نباید با مکانیزم پایه thinking یکی دانست.
قابلیتهای عاملی (Agentic Capabilities)
از نسخه ۲.۰ به بعد، Gemini میتواند با دنیای خارج تعامل داشته باشد: ابزارها را فراخوانی کند، در Google جستجو کند، کد اجرا کند و عناصر UI را مدیریت کند. Google به صراحت Gemini 2.0 را به عنوان مدلی برای «عصر جدید عاملی» (agentic era) با پشتیبانی بومی از tool use معرفی کرد.
تا فوریه ۲۰۲۶، Gemini API شامل یک لایه رسمیشده از قابلیتهای عاملی با پشتیبانی از ابزارهای زیر است: Google Search، Google Maps، Code Execution، URL Context، Computer Use، File Search، و همچنین Live API برای تعامل دوطرفه در زمان واقعی.
تکامل مدلهای Gemini
خانواده Gemini با سرعتی فوقالعاده در حال توسعه است: در دوره دسامبر ۲۰۲۳ تا فوریه ۲۰۲۶، چهار نسل اصلی از مدلها منتشر شده است.
Gemini 1.0 (دسامبر ۲۰۲۳)
نسل اول که پایه چندوجهی بودن بومی را بنا نهاد. در ۶ دسامبر ۲۰۲۳ به صورت عمومی معرفی شد.
- نسخهها: Ultra (پرچمدار برای پیچیدهترین وظایف)، Pro (مدل همهمنظوره) و Nano (کمحجم برای دستگاههای موبایل؛ به Nano-1 با ۱.۸ میلیارد پارامتر و Nano-2 با ۳.۲۵ میلیارد پارامتر تقسیم میشد).
- پنجره بافت: ۳۲٬۷۶۸ token برای تمام نسخهها.
- دستاوردها: Gemini 1.0 Ultra اولین مدلی شد که به سطح متخصص انسانی در benchmark MMLU دست یافت و آن را با نتیجه ۹۰.۰۴٪ پشت سر گذاشت (با استفاده از تکنیک CoT@32 — زنجیره استدلال با ۳۲ نمونه و رأیگیری اکثریت؛ در prompting استاندارد ۵-shot نتیجه حدود ۸۳.۷٪ بود). نتایج SOTA را در ۳۰ از ۳۲ benchmark دانشگاهی به دست آورد.
- پایان پشتیبانی: Gemini 1.0 Pro در ۱۸ فوریه ۲۰۲۵ منسوخ اعلام شد.
Gemini 1.5 (فوریه — مه ۲۰۲۴)
پیشرفتی بزرگ در طول بافت و کارایی.
- معماری: گذار از transformer متراکم به Mixture-of-Experts (MoE).
- پنجره بافت: تا ۱ میلیون token در production (۲ میلیون — به صورت waitlist برای ۱.۵ Pro، اعلام شده در مه ۲۰۲۴ در Google I/O).
- نسخهها: 1.5 Pro (اعلام شده در فوریه ۲۰۲۴؛ با کیفیتی معادل ۱.۰ Ultra با هزینههای به مراتب کمتر) و 1.5 Flash (نسخه سبکتر و سریعتر، در مه ۲۰۲۴ اضافه شد).
- پایان پشتیبانی: تمام مدلهای Gemini 1.5 (Pro، Flash، Flash-8B) در ۲۹ سپتامبر ۲۰۲۵ از سرویس خارج شدند.
Gemini 2.0 (دسامبر ۲۰۲۴ — فوریه ۲۰۲۵)
گذار به «عصر عاملی».
- جدول زمانی: ۱۱ دسامبر ۲۰۲۴ — اعلام 2.0 Flash Experimental (ورودی چندوجهی، خروجی متنی)؛ ۵ فوریه ۲۰۲۵ — در دسترس عموم (GA) قرار گرفتن 2.0 Flash، انتشار 2.0 Pro Experimental و 2.0 Flash-Lite.
- نوآوریهای کلیدی: قابلیتهای عاملی درونی (tool use)، تولید بومی تصویر و صدا (ابتدا در حالت محدود برای شرکای early-access)، تمرکز بر سناریوهای عاملی.
- پنجره بافت: تا ۲ میلیون token (2.0 Pro)؛ تا ۱ میلیون token (2.0 Flash-Lite).
- پایان پشتیبانی: مدلهای 2.0 Flash و Flash-Lite برنامهریزی شدهاند تا در ۱ ژوئن ۲۰۲۶ از سرویس خارج شوند.
Gemini 2.5 (مارس — ژوئن ۲۰۲۵)
اولین «مدل اندیشنده» (thinking model) با بودجه استدلال قابل تنظیم.
- جدول زمانی: ۲۵ مارس ۲۰۲۵ — اعلام 2.5 Pro Experimental؛ ۱۷ آوریل — 2.5 Flash (اولین مدل reasoning کاملاً ترکیبی با حالت تفکر قابل تغییر)؛ ۲۰ مه (Google I/O) — بهروزرسانیهای ۲.۵ Pro و Flash، اعلام Deep Think؛ ۱۷ ژوئن ۲۰۲۵ — GA همزمان برای ۲.۵ Pro و ۲.۵ Flash؛ در همان روز — پیشنمایش 2.5 Flash-Lite (GA در ۲۲ ژوئیه). ۱ اوت — Deep Think برای مشترکین AI Ultra باز شد.
- نوآوریهای کلیدی: مکانیزم «تفکر» (thinking) درونی با بودجههای قابل تنظیم؛ Deep Think به عنوان حالت پیشرفته مجزا. نتایج SOTA در benchmark های پیچیده ریاضی، منطقی و برنامهنویسی (AIME 2025 — ۸۶.۷٪، GPQA Diamond — ۸۴.۰٪، Humanity's Last Exam — ۱۸.۸٪ بدون ابزار).
- پنجره بافت: ۱ میلیون token در ورودی، تا ۶۴٬۰۰۰ token در خروجی. افزایش وعدهدادهشده تا ۲ میلیون token برای ۲.۵ Pro در طول چرخه حیات مدل تأیید نشد.
- نسخههای تخصصی: Gemini 2.5 Flash Image (نام رمزی «Nano Banana»، به صورت ناشناس در ۱۲ اوت در Arena ظاهر شد، در ۲۶ اوت ۲۰۲۵ رسماً منتشر شد — به دلیل «فیگورینهای ۳D» فوتورئالیستی وایرال شد و ۱۰ میلیون کاربر جدید جذب کرد)؛ Computer Use Preview (۷ اکتبر ۲۰۲۵، بر پایه ۲.۵ Pro)؛ مدلهای Text-to-Speech (2.5 Flash TTS، 2.5 Pro TTS).
- گزارش فنی: گزارش مشترک Gemini 2.X در ۷ ژوئیه ۲۰۲۵ روی arXiv منتشر شد (arXiv:2507.06261)، شامل بیش از ۳٬۳۰۰ نویسنده است و مدلهای 2.5 Pro، 2.5 Flash، 2.0 Flash، 2.0 Flash-Lite را پوشش میدهد.
Gemini 3.x (نوامبر ۲۰۲۵ — فوریه ۲۰۲۶)
نسل سوم نشانهای از گذار از تولید پایه به فرآیندهای عاملی طولانیمدت (agentic workflows) و حل مسائل علمی میانرشتهای بود.
- Gemini 3 Pro (۱۸ نوامبر ۲۰۲۵): توسط Sundar Pichai، مدیرعامل Alphabet، و Demis Hassabis، رئیس DeepMind، به عنوان «هوشمندترین مدل Google» معرفی شد. اولین مدل Gemini که در روز راهاندازی در Google Search مستقر شد. اولین مدلی شد که از مرز ۱۵۰۰ Elo در LMArena گذشت (1501 در لحظه راهاندازی). نتایج: GPQA Diamond — ۹۱.۹٪؛ SWE-bench Verified — ۷۶.۲٪؛ Humanity's Last Exam — ۳۷.۵٪ (بدون ابزار)؛ SimpleQA — ۷۲.۱٪.
- Gemini 3 Flash (۱۷ دسامبر ۲۰۲۵): به مدل پیشفرض در برنامه Gemini تبدیل شد. با قیمت ۰.۵۰ دلار به ازای هر ۱ میلیون token ورودی، در SWE-bench Verified (۷۸٪) از 3 Pro پیشی گرفت و ۳۰٪ کمتر از آن token برای وظایف استدلال مصرف کرد. GPQA Diamond — ۹۰.۴٪؛ HLE — ۳۳.۷٪.
- Gemini 3.1 Pro (۱۹ فوریه ۲۰۲۶): مدل پرچمدار در تاریخ انتشار. اولین انتشار «افزایشی» (.1 به جای .5 پیشین). نتیجه کلیدی — ARC-AGI-2: ۷۷.۱٪ (بیش از دو برابر ۳۱.۱٪ مدل 3 Pro). AIME 2025 — ۹۱.۲٪؛ GPQA Diamond — ۹۴.۳٪؛ SWE-bench Verified — ۸۰.۶٪. سطح تفکر MEDIUM جدید از طریق پارامتر
thinking_levelمعرفی شد. endpoint تخصصیgemini-3.1-pro-preview-customtoolsبرای کار با bash terminal و توابع کاربر. مشکل برش خروجی در تولیدات طولانی رفع شد. کانالها: Gemini App، Vertex AI، AI Studio، Gemini API، NotebookLM. - Gemini 3 Deep Think (بهروزرسانی ۱۲ فوریه ۲۰۲۶): بهروزرسانی بزرگ حالت «اندیشنده» تخصصی. فراتر از ریاضیات و برنامهنویسی رفت: نتایج سطح مدال طلا در المپیادهای بینالمللی فیزیک (IPhO) و شیمی (IChO) سال ۲۰۲۵؛ ARC-AGI-2 — ۸۴.۶٪؛ Humanity's Last Exam — ۴۸.۴٪؛ CMT-Benchmark (فیزیک نظری ماده متراکم) — ۵۰.۵٪؛ Codeforces Elo — 3455. بر پایه Deep Think، عامل پژوهشی Aletheia ساخته شد که به طور خودمختار چند مسئله باز از پایگاه Erdős (از جمله مسئله Erdős-1051) را حل کرد.
جدول خلاصه نسلهای Gemini
| نسل | سال انتشار | نسخههای کلیدی | حداکثر پنجره بافت | نوآوریهای معماری و بهبودهای کلیدی |
|---|---|---|---|---|
| Gemini 1.0 | 2023 | Ultra, Pro, Nano | 32٬768 token | چندوجهی بودن بومی از ابتدا؛ transformer متراکم؛ فراتر از انسان در MMLU (۹۰.۰۴٪ CoT@32). |
| Gemini 1.5 | 2024 | Pro, Flash | 1٬000٬000 token (۲ میلیون به صورت waitlist) | معماری Mixture-of-Experts (MoE)؛ افزایش انقلابی بافت؛ ۹۹٪ در Needle In A Haystack. |
| Gemini 2.0 | 2024–2025 | Pro, Flash, Flash-Lite | 1٬000٬000 — 2٬000٬000 token | عصر «agentic AI»: یکپارچهسازی بومی ابزارها، تولید تصویر و صدا، Live API. |
| Gemini 2.5 | 2025 | Pro, Flash, Flash-Lite | 1٬000٬000 token (ورودی)، 64٬000 (خروجی) | «مدل اندیشنده» (thinking)؛ بودجههای استدلال قابل تنظیم؛ Deep Think؛ تولید تصویر (Nano Banana)؛ Computer Use. |
| Gemini 3.x | 2025–2026 | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1٬000٬000 token | Agentic workflows؛ پارامتر thinking_level؛ پیشرفت در ARC-AGI-2 و المپیادهای علمی؛ Aletheia. |
نتایج کلیدی و benchmark ها
با توجه به اشباع benchmark های کلاسیک (مانند MMLU)، ارزیابی عملکرد مدلهای Gemini به سمت وظایف استدلال انتزاعی، مدلسازی علمی و برنامهنویسی خودمختار تغییر یافته است. نتایج بر اساس دادههای رسمی Google (self-reported) ارائه میشوند؛ مقایسه آنها تنها در صورت یکسان بودن حالت inference، وجود/عدم وجود tool use، روش نمونهبرداری (single-attempt در مقابل majority voting) و model-id مشخص معتبر است.
| Benchmark | شرح وظیفه | Gemini 2.5 Pro (ژوئن ۲۰۲۵) | Gemini 3 Pro (نوامبر ۲۰۲۵) | Gemini 3.1 Pro (فوریه ۲۰۲۶) | Gemini 3 Deep Think (فوریه ۲۰۲۶) |
|---|---|---|---|---|---|
| MMLU | درک زبان چندوظیفهای | — | — | — | — |
| GPQA Diamond | سؤالات علمی سطح دکتری | 84.0% | 91.9% | 94.3% | N/A |
| Humanity's Last Exam | دانش تخصصی مرزی | 18.8% | 37.5% | 44.4% | 48.4% |
| ARC-AGI-2 | معماهای منطقی انتزاعی | 4.9% | 31.1% | 77.1% | 84.6% |
| SWE-bench Verified | حل خودمختار مسائل در مخازن GitHub | 63.8%* | 76.2% | 80.6% | N/A |
| AIME 2025 | مسائل ریاضی سطح المپیاد | 86.7% | — | 91.2% | — |
| Codeforces (Elo) | رتبهبندی در برنامهنویسی رقابتی | — | — | 2887 | 3455 |
* نتیجه 2.5 Pro در SWE-bench با custom agent setup به دست آمده است.
رتبهبندی در LMArena (برش پایان فوریه ۲۰۲۶)
LMArena (پیشتر Chatbot Arena) — پلتفرم مستقل رأیگیری کور زوجی. رتبهبندیها به صورت پویا محاسبه میشوند؛ مقادیر در لحظه راهاندازی مدل ممکن است با مقادیر فعلی تفاوت داشته باشند.
| مدل | رتبهبندی | جایگاه | آرا | یادداشت |
|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 1500 ± 9 | #3 | 4٬060 | Preliminary |
| Gemini 3 Pro | 1486 ± 4 | #5 | 37٬854 | |
| Gemini 3 Flash | 1473 ± 5 | #7 | 28٬847 | |
| Gemini 2.5 Pro | 1464 ± 3 | #9 | 97٬296 | |
| Gemini 2.5 Flash | 1411 ± 3 | #64 | 96٬163 |
در لحظه راهاندازی در ۱۸ نوامبر ۲۰۲۵، Gemini 3 Pro به رتبهبندی 1501 Elo دست یافت و اولین مدلی شد که از مرز ۱۵۰۰ در LMArena گذشت.
سیستمهای تخصصی و عاملی
aکوسیستم Gemini با مدلها و پلتفرمهایی گسترش یافته که قادر به انجام اقدامات چندمرحلهای در محیطهای دیجیتال و فیزیکی هستند.
عوامل خودمختار
- Jules — عامل کدنویسی خودمختار که به صورت ناهمزمان در ماشینهای مجازی ابری محافظتشده کار میکند. در GitHub شاخه و pull request میسازد. در Google I/O در ۲۰ مه ۲۰۲۵ به بتای عمومی وارد شد (بیش از ۱۴۰٬۰۰۰ بهبود کد در دوره آزمایش بتا)، GA — ۶ اوت ۲۰۲۵. تا پایان ۲۰۲۵ به یکی از بزرگترین مشارکتکنندگان در مخازن داخلی Google تبدیل شد.
- Project Mariner — نمونه اولیه تحقیقاتی عامل مرورگری برای وظایف چندمرحلهای وب. به ماشینهای مجازی ابری منتقل شد با پشتیبانی از تا ۱۰ وظیفه موازی و قابلیت «Teach & Repeat». به ۸۳.۵٪ در benchmark WebVoyager دست یافت. قابلیتهای Computer Use به Gemini API منتقل شدند.
- Google Antigravity — محیط توسعه یکپارچه (IDE) برای مدیریت عوامل هوش مصنوعی که در نوامبر ۲۰۲۵ معرفی شد. عوامل به صورت خودمختار کد را تغییر میدهند، با terminal و مرورگر داخلی تعامل دارند و آرتیفکتهای قابل تأیید (diff های کد) را برای تأیید توسط توسعهدهنده بازمیگردانند.
- عامل Aletheia — عامل تحقیقات ریاضی تخصصی بر پایه Gemini 3 Deep Think. مجهز به تأییدکننده زبان طبیعی و ابزارهای جستجوی وب برای بررسی ادبیات است. در ابتدای ۲۰۲۶ به صورت خودمختار چند مسئله باز ریاضی از پایگاه Erdős را حل کرد و به عنوان نویسنده مشترک در انتشارات علمی شرکت کرد.
عوامل هوش مصنوعی مصرفی
- Phone Automations — یکپارچهسازی عامل خودمختار در سطح سیستمعامل Android (نسخه بتا برای Pixel 10 و Samsung Galaxy S26). در یک محیط ایزوله امن (secure sandbox) کار میکند و قادر است بر اساس تحلیل بصری GUI در برنامههای شخص ثالث پیمایش کند.
- Gemini in Chrome (Auto Browse) — عامل مرورگری برای خودکارسازی وظایف چندمرحلهای وب، از سپتامبر ۲۰۲۵ برای تمام کاربران Chrome در دسترس است (در ژانویه ۲۰۲۶ به Gemini 3 بهروزرسانی شد).
Computer Use
مدلهای Gemini 2.5 Computer Use برای مدیریت رابطهای کاربری گرافیکی (UI) بهینه شدهاند. سیستم اسکرینشات و تاریخچه اقدامات را به عنوان ورودی دریافت میکند و مختصات برای شبیهسازی نرمافزاری مکاننما و دستورات ورودی صفحهکلید تولید میکند.
Gemini Robotics
مدلهای کلاس Vision-Language-Action (VLA) و Embodied Reasoning (ER) که در مارس ۲۰۲۵ معرفی شدند. این معماریها اطلاعات فضایی-زمانی را پردازش میکنند و مسیرهای ۳D حرکت بازوهای رباتیک را به عنوان وجه خروجی بومی پیشبینی میکنند (arXiv:2503.20020).
مدلهای تولیدی تخصصی (ابتدای ۲۰۲۶)
- Nano Banana 2 (Gemini 3.1 Flash Image) — در ۲۶ فوریه ۲۰۲۶ منتشر شد، مدل بصریای که سرعت معماری Flash را با کیفیت Pro ترکیب میکند. حفظ دقیق هویت شخصیتها (character consistency)، تولید بومی تایپوگرافی در داخل تصاویر و یکپارچهسازی واترمارک رمزنگاریشده SynthID با متادیتای C2PA را فراهم میکند.
- Lyria 3 — مدل موسیقی که در ۱۸ فوریه ۲۰۲۶ در برنامه Gemini یکپارچه شد. قطعات موسیقی ۳۰ ثانیهای (شامل آواز و ساز) را بر اساس prompt های متنی، عکسها یا ویدئوها تولید میکند.
- Veo 3.1 — مدل تولید ویدئو. از ساخت کلیپ با استفاده از تا سه تصویر مرجع («Ingredients to Video»)، تولید انتقال بین فریم اول و آخر مشخصشده، رندر بومی ویدئوی عمودی (9:16) و upscaling تا رزولوشن 4K پشتیبانی میکند.
- Med-Gemini — مدل خاص حوزه برای وظایف پزشکی (arXiv:2404.18416، arXiv:2405.03162).
کاربرد و اکوسیستم
Google مدلهای Gemini را به طور عمیق در محصولات مصرفی و توسعهدهنده خود یکپارچه کرده است.
محصولات مصرفی
- برنامه Gemini: چتبات (پیشتر Bard، در ۸ فوریه ۲۰۲۴ تغییر نام یافت) که از مدلهای خانواده Gemini به عنوان دستیار هوش مصنوعی همهمنظوره استفاده میکند. تا فوریه ۲۰۲۶ بیش از ۷۵۰ میلیون کاربر فعال دارد. rollout فعلی شامل مدل 3.1 Pro است. اشتراکها: Google AI Pro (۱۹.۹۹ دلار در ماه، جایگزین Google One AI Premium شد) و Google AI Ultra (۲۴۹.۹۹ دلار در ماه، با دسترسی به Deep Think، Veo 3 و ویژگیهای اولویتدار).
- Google Workspace: یکپارچهسازی Gemini در Gmail، Docs، Sheets، Meet برای کمک در نوشتن متن، تحلیل داده و تولید محتوا (rebrand از Duet AI).
- Google Search: قابلیت AI Overviews پاسخهای خلاصهشده برای درخواستهای پیچیده بر اساس مدل تخصصی Gemini تولید میکند. AI Mode که در Google I/O 2025 راهاندازی شد، جستجوی عمیق با قابلیتهای عاملی (رزرو، خرید) را فراهم میکند.
- Android و Pixel: Gemini Nano (نسخه ۳ در Pixel 10 با تراشه Tensor G5، اوت ۲۰۲۵) به صورت محلی روی گوشیهای هوشمند کار میکند و پاسخهای هوشمند، خلاصهسازی، تشخیص تماسهای کلاهبرداری و دسترسپذیری را با حفظ حریم خصوصی دادهها فراهم میکند. ML Kit GenAI API برای توسعهدهندگان از خلاصهسازی، تصحیح و تشخیص گفتار روی دستگاه پشتیبانی میکند.
- NotebookLM: از ابزار یادداشتبرداری به پلتفرم خلاقانه کامل تکامل یافته است. در مارس ۲۰۲۵ به Google Workspace پیوست. از Audio Overviews تعاملی، Video Overviews، Mind Maps، اسلایدها و اینفوگرافیک پشتیبانی میکند. در دسامبر ۲۰۲۵ به Gemini 3 بهروزرسانی شد؛ پنجره بافت کامل ۱ میلیون token برای چت — از فوریه ۲۰۲۶.
- Gemini Live: قابلیتهای دوربین و اشتراکگذاری صفحه از Project Astra برای تمام کاربران Android و iOS رایگان شدند.
پلتفرمهای توسعهدهنده
- Google AI Studio و Gemini API: رابطهای اصلی برای دسترسی به مدلهای Gemini از طریق API. تا فوریه ۲۰۲۶ از بلوکهای قابلیتی پشتیبانی میکنند: Thinking، Thought signatures، Long context، Tools and agents (Google Search، Maps، Code Execution، URL Context، Computer Use، File Search، Deep Research، Live API).
- Vertex AI: پلتفرم سازمانی با قابلیتهای پیشرفته امنیتی و مدیریتی.
- Google Gen AI SDK: تا مه ۲۰۲۵ به GA برای Python، JavaScript/TypeScript، Go و Java دست یافت و دسترسی یکپارچه به Gemini Developer API و Vertex AI را فراهم میکند. از Model Context Protocol (MCP) پشتیبانی میکند.
- Gemini CLI: ابزار خط فرمان برای کدنویسی هوش مصنوعی در terminal (در ژوئن ۲۰۲۵ راهاندازی شد).
- Interactions API: رابط یکپارچه برای مدلها و عوامل (بتا از دسامبر ۲۰۲۵).
چرخه حیات API و مدیریت نسخه
مدلهای Gemini در API به دستههای stable، preview، latest و experimental تقسیم میشوند. model_id مشخص و خانواده مدلها یکی نیستند؛ برای سناریوهای production، اتصال به نسخه مشخص و مهلتهای پشتیبانی آن از اهمیت حیاتی برخوردار است. در مستندات API، یک رجیستری از deprecation ها با تاریخهای پایان پشتیبانی نگهداری میشود.
برای پشتیبانی از وظایف خودمختار طولانیمدت، Session Resumption (ذخیره وضعیت جلسه در سرور تا ۲۴ ساعت) و Context Compression (مکانیزم پنجره لغزنده برای فشردهسازی خودکار بافت در صورت تجاوز از حد مجاز) پیادهسازی شدهاند.
در دسامبر ۲۰۲۵، Google سهمیههای سطح رایگان API را تقریباً ۹۲٪ کاهش داد (بدون اطلاع قبلی)، که واکنش شدید جامعه توسعهدهندگان را برانگیخت. در عین حال، هزینه سرویسدهی مدلهای Gemini در طول سال ۲۰۲۵ به دلیل بهینهسازیها ۷۸٪ کاهش یافت.
محدودیتها و مشکلات باز
- توهمزایی و confabulation: مدلها تمایل به تولید اطلاعات واقعی نادرست را حفظ میکنند، به ویژه هنگامی که قابلیتهای grounding (Search Grounding) غیرفعال باشند. Gemini 3.1 Pro سطح توهمزایی را بر اساس benchmark SimpleQA در مقایسه با نسخههای قبلی کاهش داد، اما مشکل برای همه LLM ها سیستمیک باقی میماند.
- سرقت ادبی ناخودآگاه (Subconscious Plagiarism): در آزمایشها با عامل Aletheia مشکل بازتولید اثباتهای غیرتریویال از مجموعه آموزشی که به عنوان کشفهای خودمختار ارائه میشوند شناسایی شد، که اعتبارسنجی نوآوری تحقیقات هوش مصنوعی را دشوار میکند.
- افت عملکرد در بافت طولانی: هنگام پردازش بافتهایی به اندازه ۱ میلیون token، مدلها در معرض اثر «Lost in the Middle» قرار دارند — کاهش دقت در استخراج حقایق از وسط سند.
- هزینههای محاسباتی بالا: inference با حداکثر تنظیمات Deep Think به زمان و منابع (TPU) به مراتب بیشتری نیاز دارد، که استفاده در برنامههای همزمان زمان واقعی را محدود میکند.
- رد درخواستهای نادرست مثبت (Over-refusals): به دلیل الگوریتمهای سختگیرانه alignment، مدلهای استدلال پیچیده تمایل دارند درخواستهای مشروع را با طبقهبندی نادرست آنها به عنوان بالقوه مضر رد کنند (به ویژه در زمینه تحلیل کد و امنیت اطلاعات). در model card همچنین مشکلات لحن «موعظهگرانه» (preachy) در رد درخواستها ذکر شده است.
- محدودیتهای استدلال: model card های سری ۲.۵ و ۳ محدودیتهایی را در درک علّی (causal understanding)، استنتاج منطقی پیچیده (complex logical deduction) و استدلال خلاف واقع (counterfactual reasoning)، و همچنین قابلیت پیشبینی ناقص در رعایت بودجههای تفکر برمیشمارند.
جنبههای اخلاقی و امنیت
استقرار مدلهای Gemini با سیستم چندلایهای از اقدامات امنیتی همراه است.
چارچوبهای کلی
Secure AI Framework (SAIF) — رویکرد کلی Google به امنیت سیستمهای هوش مصنوعی (اعلام شده در ژوئن ۲۰۲۳) که زمینه توسعه را شکل میدهد اما یک استاندارد خاص Gemini نیست. Frontier Safety Framework v3 (سپتامبر ۲۰۲۵) حوزههای CBRN، امنیت سایبری، ML R&D، تأثیر دستکارانه و رویکرد آزمایشی به خطرات عدم همسویی (misalignment) را پوشش میدهد.
اقدامات خاص Gemini
- Model cards — منابع اولیه اطلاعات درباره محدودیتها و امنیت مدلهای خاص. بخشهایی از Intended Usage and Limitations، Ethics and Content Safety، Frontier Safety را دارند. Model card مربوط به Gemini 3 Pro تأیید کرد که مدل به هیچ سطح قابلیت بحرانی (Critical Capability Level) در حوزههای CBRN و امنیت سایبری دست نیافته است.
- آزمایش تعصب و سمیت: تحلیل و کاهش تعصب در دادههای آموزشی و تولید محتوا.
- تیمهای قرمز (Red Teaming): شبیهسازی حملات برای شناسایی آسیبپذیریها و رفتارهای ناخواسته. آزمایش مستقل برای عدم همسویی «افزایش جزئی در آگاهی موقعیتی» را آشکار کرد اما هیچ خطر بحرانی نیافت.
پروبهای ایمنی (Safety Probes)
برای جلوگیری از تولید محتوای مضر، طبقهبندی فعالسازیهای پنهان استفاده میشود. برای حل مشکل از دست رفتن سیگنال در بافتهای طولانی، معماری MultiMax استفاده میشود: پروب حداکثر مقدار را از تمام لایههای برای هر token در دنباله استخراج میکند:
پروبها با مدلهای پایه در طبقهبندیکنندههای آبشاری ترکیب میشوند و دقت فیلترسازی را با هزینه محاسباتی پایین افزایش میدهند (arXiv:2601.11516).
نشانهگذاری رمزنگاری (SynthID)
دادههای صوتی تولیدشده از طریق Live API و تصاویر (از مدلهای Nano Banana / Flash Image) با الگوریتم SynthID علامتگذاری میشوند. واترمارک نامرئی در سطح پیکسل یا طیف صوتی جاسازی میشود و تشخیص ماشینی محتوای تولیدشده را تضمین میکند. مدل Nano Banana 2 (فوریه ۲۰۲۶) SynthID را با متادیتای C2PA یکپارچه میکند.
Thinking و پرسش شفافیت
مدلهایی با حالت تفکر (سری ۲.۵/۳) میتوانند thought summaries — خلاصههای مختصر از استدلالهای داخلی — را به جای جریان کامل token های میانی بازگردانند. این سطح معینی از شفافیت فراهم میکند، اما به دلیل اینکه زنجیرههای استدلال «خام» واقعی پشت خلاصههای سادهشده پنهان میمانند مورد انتقاد قرار میگیرد.
جنبههای نظارتی
در چارچوب قانون هوش مصنوعی اتحادیه اروپا (EU AI Act)، Google کدکس عملکرد اتحادیه اروپا در مورد هوش مصنوعی (منتشرشده در ۱۰ ژوئیه ۲۰۲۵) را به همراه OpenAI و Anthropic امضا کرد. Gemini به عنوان مدل هوش مصنوعی با کاربرد عمومی (GPAI) با ریسک سیستمیک طبقهبندی میشود، که تعهدات امنیتی اضافی را به همراه دارد (از ۲ اوت ۲۰۲۵ لازمالاجرا).
محیط رقابتی
دوره نوامبر — دسامبر ۲۰۲۵ متراکمترین چرخه رقابتی در تاریخ هوش مصنوعی بود: Gemini 3 Pro (۱۸ نوامبر)، Claude Opus 4.5 از Anthropic (۲۴ نوامبر) و GPT-5.2 از OpenAI (۱۱ دسامبر) در طول ۲۴ روز منتشر شدند. تا فوریه ۲۰۲۶ هیچ مدلی در تمام دستهها تسلط ندارد: Gemini 3 Pro در LMArena در متن، بینایی، جستجو و چندزبانگی پیشتاز است؛ GPT-5.2 در ریاضیات خالص (۱۰۰٪ AIME 2025 بدون ابزار) و SWE-bench Pro پیشتاز است؛ Claude Opus 4.5 در SWE-bench Verified رقابت میکند. از نظر هزینه API، Gemini تقریباً ۴۲٪ ارزانتر از GPT-5 در تماسهای مشابه است.
شاخصهای تجاری
بر اساس گزارش مالی Alphabet برای Q4 2025 (منتشرشده در ۴ فوریه ۲۰۲۶): درآمد Google Cloud — ۱۷.۷ میلیارد دلار در فصل (+۴۸٪ سال به سال)؛ حاشیه سود عملیاتی — ۲۹.۹٪؛ سبد سفارشات Cloud — ۲۴۰ میلیارد دلار (دو برابر شدن در طول یک سال). بیش از ۱۲۰٬۰۰۰ شرکت از Gemini استفاده میکنند. در ژانویه ۲۰۲۶، Apple از برنامههای ادغام Gemini در Siri خبر داد. Google بیش از ۱۰ میلیارد token در دقیقه از طریق API پردازش میکند. عوامل هوش مصنوعی داخلی Google حدود ۵۰٪ از کد شرکت را تولید میکنند. هزینههای سرمایهای برای ۲۰۲۶ در سطح ۱۷۵–۱۸۵ میلیارد دلار برنامهریزی شده (رشد تقریباً دو برابری نسبت به ۹۱.۴۵ میلیارد دلار در ۲۰۲۵).
پیوندها
- فهرست مدلهای Google DeepMind
- مستندات Gemini API برای توسعهدهندگان
- کاتالوگ مدلهای Gemini API
- مستندات Gemini Thinking
- رجیستری deprecation مدلهای Gemini
- فهرست model card های Google DeepMind
منابع
گزارشهای فنی اولیه Gemini
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
- Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.
مدلهای تخصصی و کاربردها
- Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
- Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
- Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
- DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.
منابع (مرورها و روشها)
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
- Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
- Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.
پستهای رسمی وبلاگ Google
- Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
- Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
- Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
- Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
- Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
- Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
- Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
- The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
- The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.