---
title: "Gemini (Google) (UR)"
source: "https://systems-analysis.info/int/Gemini_(Google)_(UR)"
wiki: "systems-analysis.info/int"
article: "Gemini_(Google)_(UR)"
language: "ur"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 2541
wiki_created_at: 2026-09-06T23:05:51Z
wiki_modified_at: 2026-09-06T23:05:51Z
downloaded_at: 2026-09-07T22:51:59Z
---

# Gemini (Google) (UR)

**Google Gemini** — یہ Google DeepMind کے تحقیقی ڈویژن کی طرف سے تیار کردہ ملٹی موڈل بڑے لسانی ماڈلز (LLM) کا ایک خاندان ہے۔ Gemini کے ماڈلز، جو پہلی بار دسمبر 2023 میں پیش کیے گئے، Neural Network Transformer آرکیٹیکچر پر مبنی ہیں اور متن، تصاویر، آڈیو، ویڈیو اور پروگرامنگ کوڈ سمیت مختلف ڈیٹا کی اقسام کی پروسیسنگ اور تخلیق کی نیٹو سپورٹ رکھتے ہیں۔

فروری 2026 کی صورتحال کے مطابق موجودہ نسل **Gemini 3.x** کی لائن اپ ہے۔ آرکیٹیکچر کی ترقی کا مقصد inference کے دوران قابلِ توسیع منطقی نتیجہ اخذ کرنے (inference-time scaling) کے طریقہ کار کا انضمام اور خودمختار ایجنٹ سسٹمز (Agentic AI) میں استعمال کے لیے ماڈلز کی اصلاح ہے۔ Gemini ایپلیکیشن کے ماہانہ 750 ملین سے زائد فعال صارفین ہیں۔

## نام اور فلسفہ

**"Gemini"** کا نام (لاطینی سے — *جڑواں*) Google کے دو سرکردہ تحقیقی گروپوں — Google Brain اور DeepMind — کے اس منصوبے کی تخلیق کے لیے اتحاد کی علامت ہے۔ Google DeepMind کے شریک تکنیکی سربراہ Jeff Dean نے مئی 2024 کے سرکاری بلاگ میں اس کی تصدیق کی: «The twins here are the folks in the legacy Brain team and the legacy DeepMind team»۔ اس منصوبے کا ابتدائی کوڈ نام «Titan» تھا؛ «Gemini» کا نام Dean نے اپریل 2023 میں تجویز کیا — اسی مہینے میں جب Google Brain اور DeepMind کا باضابطہ انضمام ہوا۔ یہ نام NASA کے خلائی پروگرام «Gemini» (1965–1968) کی بھی طرف اشارہ کرتا ہے، جس کے Apollo پروگرام کی تیاری میں کردار نے ڈویلپر ٹیم کو متاثر کیا۔

Gemini کی کلیدی خصوصیت اور فلسفیانہ بنیاد **نیٹو ملٹی موڈالیٹی** ہے۔ بہت سے سابقہ ماڈلز کے برعکس، جہاں ملٹی موڈل صلاحیتیں موجودہ متنی بنیاد کے اوپر شامل کی جاتی تھیں، Gemini کو شروع سے ہی مختلف اقسام کی معلومات کو بیک وقت سمجھنے، ان کے ساتھ کام کرنے اور ان کو یکجا کرنے کے لیے ڈیزائن کیا گیا۔ Gemini 1.0 کی تکنیکی رپورٹ (arXiv:2312.11805) تصدیق کرتی ہے کہ ماڈل «trained jointly across image, audio, video, and text data»۔ یہ ماڈل کو نہ صرف ڈیٹا کو مختلف اقسام کے درمیان منتقل کرنے بلکہ ان کی گہری، مجموعی سمجھ بنانے کی اجازت دیتا ہے۔

## آرکیٹیکچر اور کلیدی ٹیکنالوجیز

Gemini ماڈلز کی کامیابی اور صلاحیتوں کا تعین متعدد بنیادی آرکیٹیکچرل فیصلوں سے ہوتا ہے۔ Google تمام Gemini کے داخلی اجزاء کا مکمل نچلے درجے کا ڈیزائن شائع نہیں کرتا، تاہم کھلے ذرائع سے آرکیٹیکچر کی قسم معلوم کی جا سکتی ہے: خاندان 1.5 اور اس سے اوپر کے تمام ماڈلز نیٹو ملٹی موڈل سپورٹ کے ساتھ **sparse mixture-of-experts transformer-based models** ہیں (جیسا کہ Gemini 2.5 Flash کے model card سے تصدیق ہوتی ہے)۔

### نیٹو ملٹی موڈل آرکیٹیکچر

Gemini کی آرکیٹیکچر **ابتدائی فیوژن** (early fusion) کے تصور پر مبنی ہے۔ تصاویر کے پکسل پیچ، ویڈیو کے وقتی فریم، آڈیوگرام اور متنی token ایک مشترک latent space میں پروجیکٹ کیے جاتے ہیں۔ Gemini 2.5 کی تکنیکی رپورٹ اس نقطہ نظر کو «Unified Multimodal Token Interleaving» قرار دیتی ہے۔ چونکہ مختلف اقسام کے تمام token مشترک ترتیب میں پروسیس ہوتے ہیں، اس لیے self-attention کے معیاری طریقہ کار ہر پرت پر مختلف اقسام کے ڈیٹا کے باہمی انضمام کو قدرتی طور پر یقینی بناتے ہیں۔ آواز کے سگنلز کو خصوصی encoders کے ذریعے براہِ راست آڈیو wave سے پروسیس کیا جاتا ہے، جو صوتی خصوصیات (لہجہ، آواز کا رنگ، پس منظر کے شور) کو محفوظ رکھتا ہے، جو Speech-to-Text ٹرانسکرپشن سسٹمز کے استعمال کے دوران ضائع ہو جاتی ہیں۔

Transformer کی بنیادی آپریشن کے لیے attention کا طریقہ کار استعمال ہوتا ہے:

$$
{Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{o}p}{\sqrt{d_{k}}} \right)V
$$

جہاں $Q$ — queries کی میٹرکس، $K$ — keys، $V$ — values، اور $d_{k}$ — keys کی جہت ہے۔

### Sparse Mixture of Experts (Sparse MoE)

ورژن 1.5 سے، Gemini ماڈلز **Sparse Mixture-of-Experts (MoE)** آرکیٹیکچر استعمال کرتے ہیں۔ Gemini 1.0 نے dense transformer استعمال کیا؛ MoE کی طرف منتقلی کا ذکر تکنیکی رپورٹ 1.5 میں براہِ راست کیا گیا ہے: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture»۔

MoE آرکیٹیکچر میں معیاری مکمل طور پر منسلک پرتیں (Feed-Forward Networks) خصوصی ذیلی نیٹ ورکس — «ماہرین» — کے سیٹ سے بدل دی جاتی ہیں۔ input token $x \in {\mathbb{R}}^{d}$ کے لیے output $y$ فعال ماہرین $k$ کی outputs کا وزنی مجموع ہے ($k \ll E$، جہاں $E$ — ماہرین کی کل تعداد):

$$
y = \sum\limits_{i \in \mathcal{T}_{k}(x)}g_{i}(x)\, E_{i}(x)
$$

جہاں $E_{i}(x)$ — $i$-ویں ماہر کا غیر خطی فنکشن، $\mathcal{T}_{k}(x)$ — منتخب ذیلی نیٹ ورکس $k$ کے اشاریوں کا مجموعہ، اور routing weight $g_{i}(x)$ کا حساب $k$ سب سے بڑی قدروں پر Softmax فنکشن کے اطلاق کے ساتھ سیکھے ہوئے routing function کے ذریعے کیا جاتا ہے۔

یہ نقطہ نظر ماڈل کی مجموعی پیرامیٹرک گنجائش کو نمایاں طور پر بڑھانے کی اجازت دیتا ہے، جبکہ ہر token کے لیے صرف پیرامیٹرز کا ایک ذیلی سیٹ فعال ہونے کی وجہ سے حسابی اخراجات (FLOPs) کم رہتے ہیں۔ Google نے Gemini ماڈلز کے پیرامیٹرز کی اصل تعداد ظاہر نہیں کی۔

### طویل context اور «In-Context Learning»

Gemini 1.5 نے production موڈ میں context window کا سائز **10 لاکھ tokens** تک بڑھا کر (10 ملین tokens تک تجرباتی جانچ کے ساتھ) ایک اہم پیش رفت کی۔ یہ سابقہ ماڈلز (مثلاً GPT-4 Turbo جس میں 128 ہزار tokens) سے کئی گنا زیادہ ہے۔ Google نے 1 ملین tokens کی context لمبائی پر Needle In A Haystack ٹیسٹ میں 99% کا نتیجہ دعویٰ کیا۔ اگلی نسلوں کے لیے long context لائن اپ کی ایک اہم خصوصیت کے طور پر مستحکم ہوا۔ اس پیمانے کا context ماڈل کو درج ذیل کام کرنے کی اجازت دیتا ہے:

- مکمل کتابوں، کئی گھنٹوں کی ویڈیوز (3 گھنٹے تک) یا بڑے کوڈ بیسز کا ایک ہی درخواست میں تجزیہ۔
- prompt میں فراہم کردہ ڈیٹا کے وسیع حجم پر «in-context learning» انجام دینا، جو fine-tuning کی ضرورت کے بغیر انتہائی حسب ضرورت جوابات حاصل کرنے کی اجازت دیتا ہے۔

### «سوچنے والے ماڈلز» اور inference کے وقت حسابات کی اسکیلنگ

Gemini 2.5 سے شروع ہو کر، Google **thinking** کو ماڈلز کے کام کرنے کے ایک الگ موڈ کے طور پر نمایاں کرتا ہے۔ سرکاری دستاویزات اسے ایک اندرونی حسابی عمل کے طور پر بیان کرتی ہیں جو کثیر مرحلہ منصوبہ بندی اور استدلال کو بہتر بناتا ہے۔ ورژن 2.5 کے ماڈلز (جنہیں «thinking models» کہا جاتا ہے) حتمی جواب دینے سے پہلے استدلال کے درمیانی مراحل کو اندرونی طور پر تیار اور جانچنے کی صلاحیت رکھتے ہیں۔ یہ پیچیدہ منطقی اور ریاضیاتی کاموں پر درستگی کو نمایاں طور پر بڑھاتا ہے۔

دو طریقہ کاروں میں فرق کرنا ضروری ہے:

- **بلٹ اِن Thinking**: 2.5 اور 3-سیریز کے ماڈلز کے لیے بنیادی موڈ، جو خفیہ Chain-of-Thought تیار کرتا ہے۔ API **thought summaries** — اندرونی استدلال کے مختصر خلاصے — واپس کر سکتا ہے، نہ کہ خام خیالات کا مکمل سلسلہ۔ ماڈل 3.1 Pro سے شروع ہو کر، thinking کا بجٹ `thinking_level` پیرامیٹر سے Low سے Max تک کی قدروں کے ساتھ ترتیب دیا جاتا ہے۔
- **Deep Think**: ایک الگ **تجرباتی توسیعی استدلال موڈ**، جو متوازی مفروضات کی تخلیق استعمال کرتا ہے اور نمایاں طور پر زیادہ حسابی وسائل کا تقاضا کرتا ہے۔ 20 مئی 2025 کو Google I/O پر اعلان کیا گیا اور 1 اگست 2025 کو AI Ultra سبسکرائبرز کے لیے کھولا گیا۔ Deep Think کو بنیادی thinking طریقہ کار سے یکسان نہیں سمجھنا چاہیے۔

### Agentic Capabilities

ورژن 2.0 سے، Gemini بیرونی دنیا کے ساتھ تعامل کر سکتا ہے: ٹولز کو بلانا، Google میں تلاش کرنا، کوڈ چلانا اور UI عناصر کا انتظام کرنا۔ Google نے Gemini 2.0 کو نیٹو tool use سپورٹ کے ساتھ «نئے agentic دور» (agentic era) کے لیے ماڈل کے طور پر واضح طور پر پیش کیا۔

فروری 2026 تک Gemini API میں ٹولز کی سپورٹ کے ساتھ باضابطہ طور پر مستحکم agentic صلاحیتوں کی پرت شامل ہے: **Google Search**، **Google Maps**، **Code Execution**، **URL Context**، **Computer Use**، **File Search**، اور حقیقی وقت میں دو طرفہ تعامل کے لیے **Live API**۔

## Gemini ماڈلز کا ارتقاء

Gemini خاندان انتہائی تیز رفتاری سے ترقی کر رہا ہے: دسمبر 2023 سے فروری 2026 کے درمیانی عرصے میں ماڈلز کی چار بنیادی نسلیں جاری کی گئیں۔

### Gemini 1.0 (دسمبر 2023)

پہلی نسل، جس نے نیٹو ملٹی موڈالیٹی کی بنیاد رکھی۔ عوامی طور پر 6 دسمبر 2023 کو پیش کی گئی۔

- **ورژنز:** **Ultra** (انتہائی پیچیدہ کاموں کے لیے فلیگ شپ)، **Pro** (عالمگیر ماڈل) اور **Nano** (موبائل آلات کے لیے کمپیکٹ؛ Nano-1 جس میں 1.8 ارب پیرامیٹرز اور Nano-2 جس میں 3.25 ارب پیرامیٹرز تھے)۔
- **Context Window:** تمام ورژنز کے لیے **32,768 tokens**۔
- **کامیابیاں:** Gemini 1.0 Ultra پہلا ماڈل بنا جس نے MMLU benchmark پر ماہر انسانی سطح حاصل کی اور اسے پار کیا، **90.04%** کے نتیجے کے ساتھ (CoT@32 تکنیک استعمال کرتے ہوئے — 32 نمونوں اور اکثریتی ووٹنگ کے ساتھ Chain-of-Thought؛ معیاری 5-shot prompting میں نتیجہ تقریباً 83.7% تھا)۔ 32 علمی benchmarks میں سے 30 پر SOTA نتائج دکھائے۔
- **سپورٹ کا خاتمہ:** Gemini 1.0 Pro کو 18 فروری 2025 کو deprecated قرار دیا گیا۔

### Gemini 1.5 (فروری — مئی 2024)

Context کی لمبائی اور کارکردگی میں پیش رفت۔

- **آرکیٹیکچر:** Dense transformer سے Mixture-of-Experts (MoE) کی طرف منتقلی۔
- **Context Window:** Production میں **10 لاکھ tokens** تک (waitlist پر 1.5 Pro کے لیے 20 لاکھ، مئی 2024 میں Google I/O پر اعلان)۔
- **ورژنز:** **1.5 Pro** (فروری 2024 میں اعلان؛ نمایاً کم اخراجات کے ساتھ 1.0 Ultra کے معیار پر) اور **1.5 Flash** (مئی 2024 میں شامل کردہ ہلکا اور تیز ورژن)۔
- **سپورٹ کا خاتمہ:** تمام Gemini 1.5 ماڈلز (Pro, Flash, Flash-8B) **29 ستمبر 2025** کو بند کر دیے گئے۔

### Gemini 2.0 (دسمبر 2024 — فروری 2025)

«Agentic دور» کی طرف منتقلی۔

- **ٹائم لائن:** 11 دسمبر 2024 — **2.0 Flash Experimental** کا اعلان (ملٹی موڈل ان پٹ، متنی آؤٹ پٹ)؛ 5 فروری 2025 — 2.0 Flash کی وسیع دستیابی (GA)، **2.0 Pro Experimental** اور **2.0 Flash-Lite** کا اجراء۔
- **کلیدی اختراعات:** بلٹ اِن agentic صلاحیتیں (tool use)، نیٹو تصویر اور آڈیو تخلیق (ابتداً early-access پارٹنرز کے لیے محدود موڈ میں)، agentic منظرناموں پر توجہ۔
- **Context Window:** 20 لاکھ tokens تک (2.0 Pro)؛ 10 لاکھ tokens تک (2.0 Flash-Lite)۔
- **سپورٹ کا خاتمہ:** 2.0 Flash اور Flash-Lite ماڈلز **1 جون 2026** کو بند کیے جانے کا منصوبہ ہے۔

### Gemini 2.5 (مارچ — جون 2025)

قابلِ ترتیب استدلال بجٹ کے ساتھ پہلا «thinking model»۔

- **ٹائم لائن:** 25 مارچ 2025 — **2.5 Pro Experimental** کا اعلان؛ 17 اپریل — **2.5 Flash** (قابلِ تبدیل thinking موڈ کے ساتھ پہلا مکمل hybrid reasoning ماڈل)؛ 20 مئی (Google I/O) — 2.5 Pro اور Flash کی اپ ڈیٹس، Deep Think کا اعلان؛ **17 جون 2025** — 2.5 Pro اور 2.5 Flash کے لیے بیک وقت GA؛ اسی دن — **2.5 Flash-Lite** کا preview (GA 22 جولائی)۔ 1 اگست — AI Ultra سبسکرائبرز کے لیے Deep Think کا کھلنا۔
- **کلیدی اختراعات:** قابلِ ترتیب بجٹ کے ساتھ بلٹ اِن thinking طریقہ کار؛ الگ توسیعی موڈ کے طور پر Deep Think۔ پیچیدہ ریاضیاتی، منطقی اور پروگرامنگ benchmarks پر SOTA نتائج (AIME 2025 — 86.7%، GPQA Diamond — 84.0%، Humanity's Last Exam — 18.8% بغیر ٹولز)۔
- **Context Window:** ان پٹ پر **10 لاکھ tokens**، آؤٹ پٹ پر 64,000 tokens تک۔ 2.5 Pro کے لیے 20 لاکھ tokens تک توسیع کا وعدہ ماڈل کے زندگی کے دوران پورا ہونے کی تصدیق نہیں ہوئی۔
- **خصوصی ورژنز:** **Gemini 2.5 Flash Image** (کوڈ نام «Nano Banana»، 12 اگست کو Arena پر گمنام طور پر ظاہر ہوا، سرکاری طور پر 26 اگست 2025 کو جاری — فوٹو ریئلسٹک «3D فگرینز» کی وجہ سے viral ہوا، 10 ملین نئے صارفین کو راغب کیا)؛ **Computer Use Preview** (7 اکتوبر 2025، 2.5 Pro کی بنیاد پر)؛ Text-to-Speech ماڈلز (2.5 Flash TTS، 2.5 Pro TTS)۔
- **تکنیکی رپورٹ:** مشترک **Gemini 2.X** رپورٹ 7 جولائی 2025 کو arXiv پر شائع ہوئی (arXiv:2507.06261)، جس میں 3,300 سے زائد مصنفین ہیں اور 2.5 Pro، 2.5 Flash، 2.0 Flash، 2.0 Flash-Lite ماڈلز شامل ہیں۔

### Gemini 3.x (نومبر 2025 — فروری 2026)

تیسری نسل نے بنیادی تخلیق سے طویل agentic workflows اور بین الشعبہ سائنسی مسائل کے حل کی طرف منتقلی کا اشارہ کیا۔

- **Gemini 3 Pro (18 نومبر 2025):** Alphabet کے چیف ایگزیکٹو آفیسر Sundar Pichai اور DeepMind کے سربراہ Demis Hassabis نے اسے «Google کا سب سے ذہین ماڈل» قرار دیا۔ پہلا Gemini ماڈل جو لانچ کے دن Google Search میں تعینات کیا گیا۔ **LMArena پر 1500 Elo کی حد** پار کرنے والا پہلا ماڈل بنا (لانچ کے وقت 1501)۔ نتائج: GPQA Diamond — 91.9%؛ SWE-bench Verified — 76.2%؛ Humanity's Last Exam — 37.5% (بغیر ٹولز)؛ SimpleQA — 72.1%۔
- **Gemini 3 Flash (17 دسمبر 2025):** Gemini ایپلیکیشن میں ڈیفالٹ ماڈل بن گیا۔ \$0.50 / 1M ان پٹ tokens کی قیمت پر، استدلالی کاموں پر 30% کم tokens استعمال کرتے ہوئے SWE-bench Verified (78%) پر 3 Pro کو پیچھے چھوڑا۔ GPQA Diamond — 90.4%؛ HLE — 33.7%۔
- **Gemini 3.1 Pro (19 فروری 2026):** اشاعت کی تاریخ پر فلیگ شپ ماڈل۔ پہلا «اضافی» ریلیز (.1 بجائے سابقہ .5)۔ کلیدی نتیجہ — **ARC-AGI-2: 77.1%** (3 Pro کے 31.1% سے دوگنا سے زیادہ)۔ AIME 2025 — 91.2%؛ GPQA Diamond — 94.3%؛ SWE-bench Verified — 80.6%۔ `thinking_level` پیرامیٹر کے ذریعے نئی MEDIUM thinking سطح متعارف کرائی گئی۔ bash ٹرمینل اور صارف کے فنکشنز کے ساتھ کام کرنے کے لیے خصوصی endpoint `gemini-3.1-pro-preview-customtools`۔ طویل generations میں آؤٹ پٹ کٹ جانے کا مسئلہ حل کیا گیا۔ چینلز: Gemini App، Vertex AI، AI Studio، Gemini API، NotebookLM۔
- **Gemini 3 Deep Think (12 فروری 2026 کا اپ ڈیٹ):** خصوصی «thinking» موڈ کا بڑا اپ ڈیٹ۔ ریاضیات اور پروگرامنگ سے آگے بڑھا: 2025 کے بین الاقوامی طبیعیات (IPhO) اور کیمسٹری (IChO) اولمپیاڈز میں سونے کے تمغے کی سطح کے نتائج؛ **ARC-AGI-2 — 84.6%**؛ **Humanity's Last Exam — 48.4%**؛ CMT-Benchmark (condensed matter نظریاتی طبیعیات) — 50.5%؛ Codeforces Elo — 3455۔ Deep Think کی بنیاد پر تحقیقی agent **Aletheia** بنایا گیا، جس نے خود مختاری سے Erdős کی بنیاد سے کئی کھلے مسائل حل کیے (Erdős-1051 مسئلے سمیت)۔

## Gemini نسلوں کا خلاصہ جدول

| نسل            | اجراء کا سال | کلیدی ورژنز                           | زیادہ سے زیادہ context window             | کلیدی آرکیٹیکچرل اختراعات اور بہتریاں                                                               |
|----------------|--------------|---------------------------------------|-------------------------------------------|-----------------------------------------------------------------------------------------------------|
| **Gemini 1.0** | 2023         | Ultra, Pro, Nano                      | 32,768 tokens                             | شروع سے نیٹو ملٹی موڈالیٹی؛ dense transformer؛ MMLU پر انسان سے برتری (90.04% CoT@32)۔              |
| **Gemini 1.5** | 2024         | Pro, Flash                            | 1,000,000 tokens (waitlist پر 20 لاکھ)    | Mixture-of-Experts (MoE) آرکیٹیکچر؛ context کا انقلابی اضافہ؛ 99% Needle In A Haystack۔             |
| **Gemini 2.0** | 2024–2025    | Pro, Flash, Flash-Lite                | 1,000,000 — 2,000,000 tokens              | «Agentic AI» کا دور: ٹولز کا نیٹو انضمام، تصاویر اور آڈیو کی تخلیق، Live API۔                       |
| **Gemini 2.5** | 2025         | Pro, Flash, Flash-Lite                | 1,000,000 tokens (ان پٹ)، 64,000 (آؤٹ پٹ) | «Thinking model»؛ قابلِ ترتیب استدلالی بجٹ؛ Deep Think؛ تصاویر کی تخلیق (Nano Banana)؛ Computer Use۔ |
| **Gemini 3.x** | 2025–2026    | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1,000,000 tokens                          | Agentic workflows؛ thinking_level پیرامیٹر؛ ARC-AGI-2 اور سائنسی اولمپیاڈز میں پیش رفت؛ Aletheia۔   |

Gemini ماڈلز کی کلیدی خصوصیات کا ارتقاء

## کلیدی نتائج اور benchmarks

کلاسیکل benchmarks (جیسے MMLU) سے سیری ہونے کے باعث، Gemini ماڈلز کی کارکردگی کی تشخیص تجریدی استدلال، سائنسی ماڈلنگ اور خودمختار پروگرامنگ کے کاموں کی طرف منتقل ہو گئی۔ نتائج Google کے سرکاری اعداد و شمار (self-reported) پر مبنی ہیں؛ ان کا موازنہ صرف inference موڈ، tool use کی موجودگی یا غیر موجودگی، نمونہ لینے کے طریقے (single-attempt بمقابلہ majority voting) اور مخصوص model-id کے یکساں ہونے پر درست ہے۔

| Benchmark                | کام کی تفصیل                                 | Gemini 2.5 Pro (جون 2025) | Gemini 3 Pro (نومبر 2025) | Gemini 3.1 Pro (فروری 2026) | Gemini 3 Deep Think (فروری 2026) |
|--------------------------|----------------------------------------------|---------------------------|---------------------------|-----------------------------|----------------------------------|
| **MMLU**                 | زبان کی کثیر کاموں پر سمجھ                   | —                         | —                         | —                           | —                                |
| **GPQA Diamond**         | PhD سطح کے سائنسی سوالات                     | 84.0%                     | 91.9%                     | **94.3%**                   | N/A                              |
| **Humanity's Last Exam** | اگلی سطح کا موضوعاتی علم                     | 18.8%                     | 37.5%                     | 44.4%                       | **48.4%**                        |
| **ARC-AGI-2**            | تجریدی منطقی پہیلیاں                         | 4.9%                      | 31.1%                     | 77.1%                       | **84.6%**                        |
| **SWE-bench Verified**   | GitHub repositories میں خودمختار مسائل کا حل | 63.8%\*                   | 76.2%                     | **80.6%**                   | N/A                              |
| **AIME 2025**            | اولمپیاڈ سطح کے ریاضیاتی مسائل               | 86.7%                     | —                         | **91.2%**                   | —                                |
| **Codeforces (Elo)**     | مسابقتی پروگرامنگ میں درجہ بندی              | —                         | —                         | 2887                        | **3455**                         |

کلیدی benchmarks پر Gemini ماڈلز کے نتائج (فروری 2026 تک کا ڈیٹا)

\* SWE-bench پر 2.5 Pro کا نتیجہ custom agent setup کے ساتھ حاصل کیا گیا۔

### LMArena پر پوزیشنز (فروری 2026 کے آخر کا جائزہ)

LMArena (پہلے Chatbot Arena) — اندھے جوڑی ووٹنگ کا آزاد پلیٹ فارم۔ درجہ بندیاں متحرک طور پر دوبارہ شمار کی جاتی ہیں؛ ماڈل لانچ کے وقت کی قدریں موجودہ سے مختلف ہو سکتی ہیں۔

| ماڈل                       | درجہ بندی | مقام | ووٹس   | نوٹ         |
|----------------------------|-----------|------|--------|-------------|
| **Gemini 3.1 Pro Preview** | 1500 ± 9  | \#3  | 4,060  | Preliminary |
| **Gemini 3 Pro**           | 1486 ± 4  | \#5  | 37,854 |             |
| **Gemini 3 Flash**         | 1473 ± 5  | \#7  | 28,847 |             |
| **Gemini 2.5 Pro**         | 1464 ± 3  | \#9  | 97,296 |             |
| **Gemini 2.5 Flash**       | 1411 ± 3  | \#64 | 96,163 |             |

Overall (24 فروری 2026 کا جائزہ)

18 نومبر 2025 کو لانچ کے وقت Gemini 3 Pro نے 1501 Elo درجہ بندی حاصل کی، LMArena پر 1500 کی حد پار کرنے والا پہلا ماڈل بنا۔

## خصوصی اور Agentic سسٹمز

Gemini کا ماحولیاتی نظام ایسے ماڈلز اور پلیٹ فارمز سے وسیع ہے جو ڈیجیٹل اور جسمانی ماحول میں کثیر مرحلہ کارروائیاں انجام دینے کی صلاحیت رکھتے ہیں۔

### خودمختار Agents

- **Jules** — ایک خودمختار coding agent جو محفوظ cloud virtual machines میں غیر ہم وقتی طریقے سے کام کرتا ہے۔ GitHub میں برانچیں اور pull-requests بناتا ہے۔ 20 مئی 2025 کو Google I/O پر کھلے beta میں آیا (beta testing کے دوران 140,000 سے زائد کوڈ بہتریاں)، GA — 6 اگست 2025۔ 2025 کے آخر تک Google کے اندرونی repositories میں سب سے بڑے contributors میں سے ایک بن گیا۔
- **Project Mariner** — کثیر مرحلہ ویب کاموں کے لیے browser-based agent کا تحقیقی نمونہ۔ 10 متوازی کاموں کی سپورٹ اور «Teach & Repeat» فیچر کے ساتھ cloud virtual machines میں منتقل ہوا۔ WebVoyager benchmark پر 83.5% حاصل کیا۔ Computer Use کی صلاحیتیں Gemini API میں منتقل کی گئیں۔
- **Google Antigravity** — نومبر 2025 میں پیش کردہ AI agents کے انتظام کے لیے مربوط ترقیاتی ماحول (IDE)۔ Agents خود مختاری سے کوڈ کو تبدیل کرتے ہیں، ٹرمینل اور بلٹ اِن براؤزر کے ساتھ تعامل کرتے ہیں، اور ڈویلپر کی منظوری کے لیے قابلِ تصدیق artifacts (کوڈ diffs) واپس کرتے ہیں۔
- **Aletheia Agent** — Gemini 3 Deep Think کی بنیاد پر خصوصی ریاضیاتی تحقیقی agent۔ قدرتی زبان verifier اور ادبیات کی جانچ کے لیے ویب تلاش کے ٹولز سے لیس ہے۔ 2026 کے آغاز میں Erdős کی بنیاد سے کئی کھلے ریاضیاتی مسائل خود مختاری سے حل کیے اور سائنسی اشاعتوں کے شریک مصنف کے طور پر شامل ہوا۔

### صارف AI Agents

- **Phone Automations** — Android آپریٹنگ سسٹم کی سطح پر خودمختار agent کا انضمام (Pixel 10 اور Samsung Galaxy S26 کے لیے beta ورژن)۔ محفوظ isolated ماحول (secure sandbox) میں کام کرتا ہے، GUI کے بصری تجزیے کی بنیاد پر تھرڈ پارٹی ایپلیکیشنز میں navigate کر سکتا ہے۔
- **Gemini in Chrome (Auto Browse)** — کثیر مرحلہ ویب کاموں کی آٹومیشن کے لیے browser agent، ستمبر 2025 سے تمام Chrome صارفین کے لیے دستیاب (جنوری 2026 میں Gemini 3 تک اپ ڈیٹ)۔

### Computer Use

**Gemini 2.5 Computer Use** ماڈلز graphical user interfaces (UI) کے انتظام کے لیے بہتر بنائے گئے ہیں۔ نظام screenshots اور عمل کی تاریخ کو input کے طور پر لیتا ہے، cursor کی پروگرامی تقلید کے لیے $(x,y)$ کوآرڈینیٹس اور کی بورڈ input کمانڈز تیار کرتا ہے۔

### Gemini Robotics

مارچ 2025 میں پیش کردہ Vision-Language-Action (VLA) اور Embodied Reasoning (ER) کلاس کے ماڈلز۔ یہ architectures مکانی-وقتی معلومات پروسیس کرتی ہیں اور ربوٹک manipulators کی 3D حرکت کے راستے نیٹو آؤٹ پٹ modality کے طور پر پیش گوئی کرتی ہیں (arXiv:2503.20020)۔

### خصوصی Generative ماڈلز (2026 کے آغاز)

- **Nano Banana 2 (Gemini 3.1 Flash Image)** — 26 فروری 2026 کو جاری، بصری ماڈل جو Flash آرکیٹیکچر کی رفتار کو Pro کے معیار کے ساتھ یکجا کرتا ہے۔ کرداروں کی سخت شناخت برقراری (character consistency)، تصاویر کے اندر typography کی نیٹو تخلیق اور C2PA میٹا ڈیٹا کے ساتھ SynthID کریپٹوگرافک watermarks کا انضمام فراہم کرتا ہے۔
- **Lyria 3** — موسیقی ماڈل، 18 فروری 2026 کو Gemini ایپلیکیشن میں ضم کیا گیا۔ متنی prompts، تصاویر یا ویڈیو کے ذریعے 30 سیکنڈ کی موسیقی (آواز اور ساز سمیت) تیار کرتا ہے۔
- **Veo 3.1** — ویڈیو تخلیق کا ماڈل۔ تین reference تصاویر («Ingredients to Video») تک استعمال کرتے ہوئے ویڈیو کلپس بنانا، مقررہ پہلے اور آخری فریم کے درمیان transitions تیار کرنا، عمودی ویڈیو (9:16) کا نیٹو rendering اور 4K ریزولیوشن تک upscaling سپورٹ کرتا ہے۔
- **Med-Gemini** — طبی کاموں کے لیے ڈومین مخصوص ماڈل (arXiv:2404.18416، arXiv:2405.03162)۔

## استعمال اور ماحولیاتی نظام

Google اپنے صارفین اور ڈویلپرز کی مصنوعات میں Gemini کو گہرائی سے ضم کرتا ہے۔

### صارف مصنوعات

- **Gemini ایپلیکیشن**: Chat bot (پہلے Bard، 8 فروری 2024 کو نام تبدیل کیا گیا)، Gemini خاندان کے ماڈلز کو عالمگیر AI-assistant کے طور پر استعمال کرتا ہے۔ فروری 2026 تک 750 ملین سے زائد ماہانہ فعال صارفین۔ موجودہ rollout میں 3.1 Pro ماڈل شامل ہے۔ سبسکرپشنز: **Google AI Pro** (\$19.99/ماہ، Google One AI Premium کی جگہ) اور **Google AI Ultra** (\$249.99/ماہ، Deep Think، Veo 3 اور ترجیحی فیچرز تک رسائی کے ساتھ)۔
- **Google Workspace**: Gmail، Docs، Sheets، Meet میں Gemini کا انضمام متن لکھنے، ڈیٹا تجزیے اور content تخلیق میں مدد کے لیے (Duet AI سے ری برانڈنگ)۔
- **Google Search**: **AI Overviews** فیچر Gemini کے خصوصی ماڈل کی بنیاد پر پیچیدہ سوالوں کے خلاصہ جوابات تیار کرتا ہے۔ Google I/O 2025 پر لانچ کردہ **AI Mode** agentic صلاحیتوں (بکنگ، خریداری) کے ساتھ گہری تلاش فراہم کرتا ہے۔
- **Android اور Pixel**: **Gemini Nano** (اگست 2025 میں Tensor G5 چپ کے ساتھ Pixel 10 پر v3) ڈیٹا کی رازداری برقرار رکھتے ہوئے smart جوابات، خلاصہ سازی، دھوکہ دہی والی calls کا پتہ لگانے اور accessibility کے لیے اسمارٹ فونز پر مقامی طور پر کام کرتا ہے۔ ML Kit GenAI API ڈویلپرز کے لیے آلے پر خلاصہ سازی، پروف ریڈنگ اور تقریر کی شناخت سپورٹ کرتا ہے۔
- **NotebookLM**: نوٹس ٹول سے مکمل تخلیقی پلیٹ فارم میں ارتقاء ہوا۔ مارچ 2025 میں Google Workspace کا حصہ بنا۔ interactive Audio Overviews، Video Overviews، Mind Maps، slides، infographics سپورٹ کرتا ہے۔ دسمبر 2025 میں Gemini 3 تک اپ ڈیٹ؛ chat کے لیے 10 لاکھ tokens کا مکمل context window — فروری 2026 سے۔
- **Gemini Live**: Project Astra کے camera اور screen sharing فیچرز ستمبر 2025 سے تمام Android اور iOS صارفین کے لیے مفت ہو گئے۔

### ڈویلپرز کے لیے پلیٹ فارمز

- **Google AI Studio اور Gemini API**: API کے ذریعے Gemini ماڈلز تک رسائی کے بنیادی interfaces۔ فروری 2026 تک capability blocks سپورٹ کرتے ہیں: Thinking، Thought signatures، Long context، Tools and agents (Google Search، Maps، Code Execution، URL Context، Computer Use، File Search، Deep Research، Live API)۔
- **Vertex AI**: توسیعی حفاظتی اور انتظامی صلاحیتوں کے ساتھ کارپوریٹ پلیٹ فارم۔
- **Google Gen AI SDK**: مئی 2025 تک Python، JavaScript/TypeScript، Go اور Java کے لیے GA تک پہنچا، Gemini Developer API اور Vertex AI تک یکساں رسائی فراہم کرتا ہے۔ **Model Context Protocol (MCP)** سپورٹ کرتا ہے۔
- **Gemini CLI**: ٹرمینل میں AI coding کے لیے command-line ٹول (جون 2025 میں لانچ)۔
- **Interactions API**: ماڈلز اور agents کے لیے یکساں interface (دسمبر 2025 سے beta)۔

### API کا lifecycle اور ورژن مینجمنٹ

API میں Gemini ماڈلز **stable**، **preview**، **latest** اور **experimental** زمروں میں تقسیم ہیں۔ مخصوص `model_id` اور ماڈل خاندان ایک چیز نہیں ہیں؛ production منظرناموں کے لیے مخصوص ورژن اور اس کی سپورٹ کی مدت کا پابند ہونا انتہائی ضروری ہے۔ API دستاویزات میں سپورٹ ختم ہونے کی تاریخوں کے ساتھ deprecations کا رجسٹر موجود ہے۔

طویل خودمختار کاموں کی سپورٹ کے لیے درج ذیل متعارف کرائے گئے: **Session Resumption** (سرور پر 24 گھنٹے تک session state کا ذخیرہ) اور **Context Compression** (حد سے تجاوز کرنے پر context کی خودکار compression کے لیے sliding window طریقہ کار)۔

dسمبر 2025 میں Google نے (پیشگی اطلاع کے بغیر) API کے مفت درجے کے quotas کو تقریباً 92% کم کیا، جس سے ڈویلپر کمیونٹی میں تیز ردعمل آیا۔ اس کے ساتھ ہی 2025 کے دوران اصلاحات کی بدولت Gemini ماڈلز کی خدمت کی لاگت 78% کم ہوئی۔

## محدودیتیں اور کھلے مسائل

- **Hallucinations اور Confabulations:** ماڈلز میں خاص طور پر Search Grounding فیچرز غیر فعال ہونے پر حقیقی طور پر غلط معلومات تیار کرنے کا رجحان برقرار ہے۔ Gemini 3.1 Pro نے SimpleQA benchmark پر سابقہ ورژنز کے مقابلے میں hallucinations کی سطح کم کی، تاہم مسئلہ تمام LLMs کے لیے نظامی رہتا ہے۔
- **Subconscious Plagiarism:** Aletheia agent کے ساتھ تجربات میں تربیتی ڈیٹا سے غیر معمولی دلائل کی تولید کا مسئلہ سامنے آیا جنہیں خودمختار دریافتیں ظاہر کیا جاتا ہے، جو AI تحقیق کی اصالت کی توثیق کو پیچیدہ بناتا ہے۔
- **طویل context میں کمزوری:** 10 لاکھ tokens کے contexts پروسیس کرتے وقت ماڈلز «Lost in the Middle» اثر کا شکار ہوتے ہیں — دستاویز کے وسط سے حقائق نکالنے کی درستگی کم ہو جاتی ہے۔
- **زیادہ حسابی اخراجات:** Deep Think کی زیادہ سے زیادہ سیٹنگز کے ساتھ inference کے لیے نمایاً زیادہ وقت اور وسائل (TPU) درکار ہیں، جو real-time synchronous ایپلیکیشنز میں استعمال کو محدود کرتا ہے۔
- **Over-refusals:** سخت alignment الگورتھمز کی وجہ سے پیچیدہ استدلال کے ماڈلز جائز درخواستوں کو ممکنہ طور پر خطرناک سمجھ کر مسترد کر دیتے ہیں (خاص طور پر کوڈ تجزیے اور معلوماتی سلامتی کے تناظر میں)۔ model card میں «ناصحانہ» (preachy) انکار کے لہجے کے مسائل بھی نوٹ کیے گئے ہیں۔
- **استدلال کی محدودیتیں:** 2.5 اور 3-سیریز کے Model cards causal understanding، complex logical deduction اور counterfactual reasoning میں محدودیتیں اور thinking بجٹوں کی تعمیل کی نامکمل پیش گوئی درج کرتے ہیں۔

## اخلاقی پہلو اور حفاظت

Gemini ماڈلز کی تعیناتی کثیر سطحی حفاظتی اقدامات کے ساتھ ہوتی ہے۔

### عمومی فریم ورک

**Secure AI Framework (SAIF)** — AI سسٹمز کی سلامتی کے لیے Google کا عمومی نقطہ نظر (جون 2023 میں اعلان)، جو ترقی کا سیاق و سباق بناتا ہے لیکن Gemini مخصوص معیار نہیں ہے۔ **Frontier Safety Framework v3** (ستمبر 2025) CBRN، سائبر سیکیورٹی، ML R&D، جوڑ توڑ اثر کے ڈومینز اور misalignment خطرات کے تجرباتی نقطہ نظر کو شامل کرتا ہے۔

### Gemini مخصوص اقدامات

- **Model cards** — مخصوص ماڈلز کی محدودیتوں اور حفاظت کے بارے میں بنیادی معلوماتی ذرائع۔ Intended Usage and Limitations، Ethics and Content Safety، Frontier Safety کے حصے شامل ہیں۔ Gemini 3 Pro کے model card نے تصدیق کی کہ ماڈل CBRN اور سائبر سیکیورٹی ڈومینز میں کوئی Critical Capability Level نہیں پہنچا۔
- **تعصب اور toxicity کی جانچ:** تربیتی ڈیٹا اور content تخلیق میں تعصب کا تجزیہ اور تخفیف۔
- **Red Teaming:** کمزوریوں اور ناپسندیدہ رویے کی نشاندہی کے لیے حملوں کی تقلید۔ misalignment کی آزادانہ جانچ میں «ستحالی آگاہی میں کچھ اضافہ» پایا گیا لیکن کوئی اہم خطرات نہیں ملے۔

### Safety Probes

nقصان دہ content کی تخلیق کو روکنے کے لیے پوشیدہ activations کی درجہ بندی استعمال ہوتی ہے۔ طویل contexts میں سگنل کے ضیاع کے مسئلے کے حل کے لیے **MultiMax** آرکیٹیکچر استعمال ہوتی ہے: probe ترتیب $n_{i}$ میں ہر token $j$ کے لیے تمام پرتوں $H$ پر زیادہ سے زیادہ قدر نکالتا ہے:

$$
f_{ext{MultiMax}}(S_{i}) = \sum\limits_{h = 1}^{H}\max\limits_{j \in \lbrack n_{i}\rbrack}\lbrack v_{h}^{o}py_{i,j}\rbrack
$$

Probes کو بنیادی ماڈلز کے ساتھ cascaded classifiers میں ملایا جاتا ہے، جو کم حسابی اخراجات پر فلٹریشن کی درستگی بڑھاتا ہے (arXiv:2601.11516)۔

### کریپٹوگرافک نشان زنی (SynthID)

Live API کے ذریعے تیار کردہ آڈیو ڈیٹا اور تصاویر (Nano Banana / Flash Image ماڈلز سے) **SynthID** الگورتھم سے نشان زد ہوتی ہیں۔ پکسل یا آڈیو spectrum کی سطح پر غیر مرئی watermark لگائی جاتی ہے، جو تیار کردہ content کی مشینی شناخت یقینی بناتی ہے۔ Nano Banana 2 ماڈل (فروری 2026) SynthID کو C2PA میٹا ڈیٹا کے ساتھ ضم کرتا ہے۔

### Thinking اور شفافیت کا سوال

Thinking موڈ والے ماڈلز (2.5/3-سیریز) **thought summaries** — اندرونی استدلال کے مختصر خلاصے — واپس کر سکتے ہیں، نہ کہ درمیانی tokens کا مکمل سلسلہ۔ یہ شفافیت کی ایک سطح فراہم کرتا ہے، تاہم اس پر تنقید کی جاتی ہے کہ اصل «خام» استدلال کے سلسلے سادہ خلاصوں کے پیچھے چھپے رہتے ہیں۔

### ریگولیٹری پہلو

**EU AI Act** (یورپی یونین کا مصنوعی ذہانت ایکٹ) کے تحت Google نے OpenAI اور Anthropic کے ساتھ EU AI Code of Practice (10 جولائی 2025 کو شائع) پر دستخط کیے۔ Gemini کو systemik خطرے والے general purpose AI (GPAI) ماڈل کے طور پر درجہ بند کیا گیا ہے، جو اضافی حفاظتی ذمہ داریاں عائد کرتا ہے (2 اگست 2025 سے نافذ)۔

## مسابقتی ماحول

nومبر — دسمبر 2025 کا عرصہ AI کی تاریخ میں سب سے گھنا مسابقتی دور بنا: Gemini 3 Pro (18 نومبر)، Anthropic کی Claude Opus 4.5 (24 نومبر) اور OpenAI کی GPT-5.2 (11 دسمبر) 24 دنوں کے اندر جاری ہوئیں۔ فروری 2026 تک کوئی ماڈل تمام زمروں میں غالب نہیں ہے: Gemini 3 Pro متن، بصارت، تلاش اور کثیر لسانی میں LMArena پر آگے ہے؛ GPT-5.2 خالص ریاضیات (بغیر ٹولز 100% AIME 2025) اور SWE-bench Pro پر آگے ہے؛ Claude Opus 4.5 SWE-bench Verified پر مقابلہ کرتی ہے۔ API لاگت میں Gemini مماثل calls پر GPT-5 سے تقریباً 42% سستا ہے۔

## کاروباری اشاریے

Q4 2025 کے Alphabet کی رپورٹ (4 فروری 2026 کو شائع) کے مطابق: Google Cloud کی آمدنی — \$17.7 ارب سہ ماہی (+48% سال بہ سال)؛ آپریشنل مارجن — 29.9%؛ Cloud آرڈر پورٹ فولیو — \$240 ارب (سال کے دوران دوگنا)۔ 120,000 سے زائد کاروباری ادارے Gemini استعمال کرتے ہیں۔ جنوری 2026 میں Apple نے Siri میں Gemini کے انضمام کے منصوبوں کا اعلان کیا۔ Google API کے ذریعے فی منٹ 10 ارب سے زائد tokens پروسیس کرتا ہے۔ Google کے اندرونی AI agents کمپنی کا تقریباً 50% کوڈ تیار کرتے ہیں۔ 2026 کے لیے سرمایہ کاری کے اخراجات \$175–185 ارب (2025 کے \$91.45 ارب کے مقابلے میں تقریباً دوگنا اضافہ) طے کیے گئے ہیں۔

## حوالہ جات

- Google DeepMind ماڈلز کا انڈیکس
- ڈویلپرز کے لیے Gemini API دستاویزات
- Gemini API ماڈلز کا کیٹلاگ
- Gemini Thinking کی دستاویزات
- Gemini ماڈلز کے deprecations کا رجسٹر
- Google DeepMind model cards کا انڈیکس

## ادبیات

### Gemini کی بنیادی تکنیکی رپورٹس

- Gemini Team, Google (2023). *Gemini: A Family of Highly Capable Multimodal Models*. arXiv:2312.11805.
- Gemini Team, Google (2024). *Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context*. arXiv:2403.05530.
- Comanici, G. et al. (2025). *Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities*. arXiv:2507.06261.

### خصوصی ماڈلز اور استعمالات

- Saab, K. et al. (2024). *Capabilities of Gemini Models in Medicine*. arXiv:2404.18416.
- Yang, L. et al. (2024). *Advancing Multimodal Medical Capabilities of Gemini*. arXiv:2405.03162.
- Gemini Robotics Team (2025). *Gemini Robotics: Bringing AI into the Physical World*. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). *Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems*. arXiv:2601.22401.
- DeepMind Research Team (2026). *Building Production-Ready Probes For Gemini*. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). *Deep Think with Confidence*. arXiv:2508.15260.

### ادبیات (جائزے اور طریقے)

- Wei, J. et al. (2022). *Chain-of-Thought Prompting Elicits Reasoning in Large Language Models*. arXiv:2201.11903.
- Zhang, Z. et al. (2022). *Automatic Chain of Thought Prompting in Large Language Models*. arXiv:2210.03493.
- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Cai, W. et al. (2024). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Dai, Z. et al. (2019). *Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context*. arXiv:1901.02860.
- Ding, J. et al. (2023). *LongNet: Scaling Transformers to 1,000,000,000 Tokens*. arXiv:2307.02486.
- Yin, S. et al. (2024). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.
- Wang, X. et al. (2023). *Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey*. arXiv:2302.10035.
- Chen, Q. et al. (2025). *Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models*. arXiv:2503.09567.

### Google کے سرکاری بلاگ پوسٹس

- Google (2023). *Introducing Gemini: Google's most capable AI model yet*. The Keyword, 06.12.2023.
- Google DeepMind (2024). *Introducing Gemini 1.5*. The Keyword, 15.02.2024.
- Google (2024). *Introducing Gemini 2.0: A new AI model for the agentic era*. The Keyword, 11.12.2024.
- Google DeepMind (2025). *Gemini 2.0 model updates*. The Keyword, 05.02.2025.
- Google DeepMind (2025). *Gemini 2.5: Our newest Gemini model with thinking*. The Keyword, 25.03.2025.
- Google DeepMind (2025). *Google I/O 2025: Updates to Gemini 2.5*. The Keyword, 20.05.2025.
- Google (2025). *Gemini 3: Introducing the latest Gemini AI model*. The Keyword, 18.11.2025.
- The Deep Think Team (2026). *Gemini 3 Deep Think: Advancing science, research and engineering*. Google Blog, 12.02.2026.
- The Gemini Team (2026). *Gemini 3.1 Pro: A smarter model for your most complex tasks*. Google Blog, 19.02.2026.
