Gemini (Google) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Google Gemini — यह मल्टीमॉडल बड़े भाषा मॉडलों (LLM) का एक परिवार है, जिसे Google DeepMind अनुसंधान प्रभाग द्वारा विकसित किया जा रहा है। Gemini मॉडल, जिन्हें पहली बार दिसंबर 2023 में प्रस्तुत किया गया था, Neural Network Transformer की वास्तुकला पर निर्मित हैं और इनमें विभिन्न माध्यमों के डेटा — जिनमें पाठ, चित्र, ऑडियो, वीडियो और प्रोग्राम कोड शामिल हैं — की प्रसंस्करण और उत्पादन के लिए मूलभूत (native) समर्थन है।

फरवरी 2026 की स्थिति के अनुसार, वर्तमान पीढ़ी Gemini 3.x श्रृंखला है। वास्तुकला का विकास inference के समय मापनीय तार्किक निष्कर्ष (inference-time scaling) के तंत्रों के एकीकरण और स्वायत्त एजेंट प्रणालियों (Agentic AI) में उपयोग के लिए मॉडलों के अनुकूलन की दिशा में है। Gemini एप्लिकेशन के प्रति माह 750 मिलियन से अधिक सक्रिय उपयोगकर्ता हैं।

नामकरण और दर्शन

"Gemini" नाम (लैटिन से — जुड़वाँ) Google के दो प्रमुख अनुसंधान समूहों — Google Brain और DeepMind — के इस परियोजना के लिए एकीकरण का प्रतीक है। Google DeepMind के सह-तकनीकी प्रमुख Jeff Dean ने मई 2024 के आधिकारिक ब्लॉग में इसकी पुष्टि की: «The twins here are the folks in the legacy Brain team and the legacy DeepMind team»। परियोजना का प्रारंभिक कोड नाम «Titan» था; «Gemini» नाम Dean द्वारा अप्रैल 2023 में प्रस्तावित किया गया था — उसी महीने जब Google Brain और DeepMind का औपचारिक विलय हुआ। यह नाम NASA के «Gemini» अंतरिक्ष कार्यक्रम (1965–1968) से भी प्रेरित है, जिसकी «Apollo» कार्यक्रम की तैयारी में भूमिका ने डेवलपर टीम को प्रभावित किया।

Gemini की मुख्य विशेषता और दार्शनिक आधार मूलभूत मल्टीमॉडलिटी (native multimodality) है। अनेक पूर्ववर्ती मॉडलों के विपरीत, जहाँ मल्टीमॉडल क्षमताएँ मौजूदा पाठ-आधारित आधार के ऊपर जोड़ी जाती थीं, Gemini को शुरू से ही विभिन्न प्रकार की सूचनाओं को एक साथ समझने, उनसे संचालित होने और उन्हें संयोजित करने के लिए डिज़ाइन किया गया था। Gemini 1.0 का तकनीकी रिपोर्ट (arXiv:2312.11805) पुष्टि करता है कि मॉडल «trained jointly across image, audio, video, and text data»। यह मॉडल को केवल माध्यमों के बीच डेटा अनुवाद करने के बजाय उनकी गहरी, समग्र (holistic) समझ विकसित करने में सक्षम बनाता है।

वास्तुकला और प्रमुख प्रौद्योगिकियाँ

Gemini मॉडलों की सफलता और क्षमताएँ कुछ मूलभूत वास्तुकला-संबंधी निर्णयों द्वारा निर्धारित होती हैं। Google Gemini के सभी आंतरिक घटकों का पूरा निम्न-स्तरीय डिज़ाइन प्रकाशित नहीं करता, तथापि खुले स्रोत वास्तुकला के वर्ग को स्थापित करने में सहायक हैं: 1.5 और उससे ऊपर के परिवार के सभी मॉडल sparse mixture-of-experts transformer-based models हैं जिनमें मूलभूत मल्टीमॉडल समर्थन है (Gemini 2.5 Flash के model card द्वारा पुष्टि)।

मूलभूत मल्टीमॉडल वास्तुकला

Gemini की वास्तुकला प्रारंभिक संलयन (early fusion) की अवधारणा पर आधारित है। चित्रों के पिक्सेल पैच, वीडियो के समयबद्ध फ्रेम, ऑडियोग्राम और पाठ token एक समान latent space में प्रक्षेपित किए जाते हैं। Gemini 2.5 का तकनीकी रिपोर्ट इस दृष्टिकोण को «Unified Multimodal Token Interleaving» के रूप में वर्णित करता है। चूँकि विभिन्न माध्यमों के सभी token एक सामान्य अनुक्रम में संसाधित होते हैं, self-attention के मानक तंत्र स्वाभाविक रूप से प्रत्येक परत पर विभिन्न माध्यमों के डेटा का क्रॉस-इंटीग्रेशन सुनिश्चित करते हैं। ध्वनि संकेतों को सीधे ऑडियो waveform से विशेष एनकोडर द्वारा संसाधित किया जाता है, जिससे ध्वनिक विशेषताएँ (स्वर, तिम्बर, पृष्ठभूमि शोर) संरक्षित रहती हैं, जो Speech-to-Text मध्यवर्ती प्रणालियों के उपयोग से खो जाती हैं।

Transformer वर्ग के लिए आधारभूत संक्रिया attention का तंत्र है:

Attention(Q,K,V)=softmax(QKopdk)V

जहाँ Q — queries का मैट्रिक्स, K — keys का, V — values का, और dk — keys की विमा है।

विरल मिश्रण-of-विशेषज्ञ (Sparse MoE)

संस्करण 1.5 से प्रारंभ होकर, Gemini मॉडल Sparse Mixture-of-Experts (MoE) वास्तुकला का उपयोग करते हैं। Gemini 1.0 ने घना (dense) Transformer उपयोग किया था; MoE में संक्रमण सीधे तकनीकी रिपोर्ट 1.5 में वर्णित है: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture»।

MoE वास्तुकला में मानक पूर्णतः संबद्ध परतें (Feed-Forward Networks) विशेषीकृत उप-नेटवर्कों के समूह — «विशेषज्ञों» — से प्रतिस्थापित होती हैं। इनपुट token xd के लिए आउटपुट y सक्रिय विशेषज्ञों k के आउटपुट के भारित योग के रूप में बनता है (kE, जहाँ E — विशेषज्ञों की कुल संख्या):

y=i𝒯k(x)gi(x)Ei(x)

जहाँ Ei(x)i-वें विशेषज्ञ की अरैखिक फलन (nonlinear function), 𝒯k(x) — चयनित उप-नेटवर्कों के k सूचकांकों का समुच्चय, और रूटिंग भार gi(x) की गणना k उच्चतम मानों पर Softmax फलन के साथ trained routing function द्वारा की जाती है।

यह दृष्टिकोण मॉडल की कुल पैरामीट्रिक क्षमता को महत्वपूर्ण रूप से बढ़ाता है, जबकि प्रत्येक token के लिए केवल पैरामीटरों के एक उपसमुच्चय को ही सक्रिय किया जाता है, जिससे गणनात्मक लागत (FLOPs) निम्न स्तर पर बनी रहती है। Google ने Gemini मॉडलों की वास्तविक पैरामीटर संख्या का खुलासा नहीं किया है।

लंबा संदर्भ और «इन-context अधिगम»

Gemini 1.5 ने production-मोड में संदर्भ विंडो का आकार 10 लाख token तक (और प्रायोगिक परीक्षण में 1 करोड़ token तक) बढ़ाकर एक महत्वपूर्ण सफलता हासिल की। यह पूर्ववर्ती मॉडलों (जैसे GPT-4 Turbo के 128 हजार token) की तुलना में परिमाण भर अधिक है। Google ने 10 लाख token की संदर्भ लंबाई पर Needle In A Haystack परीक्षण में 99% परिणाम का दावा किया। बाद की पीढ़ियों में long context श्रृंखला की एक प्रमुख विशेषता के रूप में स्थापित हो गया। इतने बड़े संदर्भ से मॉडल को निम्नलिखित सुविधाएँ मिलती हैं:

  • एकल अनुरोध के भीतर पूरी पुस्तकें, कई घंटों के वीडियो (3 घंटे तक) या बड़े कोड आधारों का विश्लेषण।
  • prompt में प्रदत्त विशाल डेटा पर «in-context learning» करना, जिससे fine-tuning की आवश्यकता के बिना अत्यधिक अनुकूलित उत्तर प्राप्त किए जा सकते हैं।

«Thinking मॉडल» और inference के समय गणना का मापन

Gemini 2.5 से प्रारंभ होकर, Google thinking को मॉडलों के संचालन के एक अलग मोड के रूप में परिभाषित करता है। आधिकारिक दस्तावेज़ीकरण इसे एक आंतरिक गणनात्मक प्रक्रिया के रूप में परिभाषित करता है जो बहु-चरणीय योजना और तर्क को बेहतर बनाती है। संस्करण 2.5 के मॉडल (जिन्हें «thinking models» के रूप में वर्णित किया गया है) अंतिम उत्तर देने से पहले आंतरिक रूप से मध्यवर्ती तर्क चरणों को उत्पन्न और मूल्यांकन करने में सक्षम हैं। यह जटिल तार्किक और गणितीय कार्यों पर सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

दो तंत्रों के बीच अंतर करना महत्वपूर्ण है:

  • अंतर्निहित thinking: 2.5 और 3-श्रृंखला मॉडलों के लिए आधारभूत मोड, एक छिपी हुई Chain-of-Thought उत्पन्न करता है। API thought summaries वापस कर सकता है — आंतरिक तर्क पर संक्षिप्त सारांश, न कि «कच्चे विचारों» की पूर्ण धारा। मॉडल 3.1 Pro से प्रारंभ होकर, thinking बजट को thinking_level पैरामीटर के माध्यम से Low से Max तक के मानों द्वारा नियंत्रित किया जाता है।
  • Deep Think: एक अलग प्रयोगात्मक विस्तारित तर्क मोड, जो समानांतर परिकल्पना उत्पादन का उपयोग करता है और काफी अधिक गणनात्मक संसाधनों की आवश्यकता होती है। इसकी घोषणा 20 मई 2025 को Google I/O पर की गई और 1 अगस्त 2025 को AI Ultra सदस्यों के लिए खोला गया। Deep Think को thinking के आधारभूत तंत्र के साथ समरूप नहीं समझा जाना चाहिए।

एजेंट क्षमताएँ (Agentic Capabilities)

संस्करण 2.0 से प्रारंभ होकर, Gemini बाहरी दुनिया के साथ संपर्क कर सकता है: उपकरणों को आमंत्रित करना, Google पर खोज करना, कोड निष्पादित करना और UI तत्वों का प्रबंधन करना। Google ने Gemini 2.0 को tool use के native समर्थन के साथ «नई एजेंट युग» (agentic era) के मॉडल के रूप में स्पष्ट रूप से प्रस्तुत किया।

फरवरी 2026 तक Gemini API में उपकरण समर्थन के साथ एजेंट क्षमताओं की एक औपचारिक रूप से स्थापित परत शामिल है: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, तथा वास्तविक समय में द्विदिशीय संपर्क के लिए Live API

Gemini मॉडलों का विकास

Gemini परिवार अत्यंत तीव्र गति से विकसित हो रहा है: दिसंबर 2023 से फरवरी 2026 की अवधि में मॉडलों की चार मुख्य पीढ़ियाँ जारी की गईं।

Gemini 1.0 (दिसंबर 2023)

पहली पीढ़ी, जिसने मूलभूत मल्टीमॉडलिटी की नींव रखी। 6 दिसंबर 2023 को सार्वजनिक रूप से प्रस्तुत की गई।

  • संस्करण: Ultra (सबसे जटिल कार्यों के लिए फ्लैगशिप), Pro (सार्वभौमिक मॉडल) और Nano (मोबाइल उपकरणों के लिए कॉम्पैक्ट; Nano-1 (1.8 अरब पैरामीटर) और Nano-2 (3.25 अरब) में विभाजित)।
  • संदर्भ विंडो: सभी संस्करणों के लिए 32,768 token
  • उपलब्धियाँ: Gemini 1.0 Ultra MMLU benchmark पर 90.04% परिणाम के साथ मानव-विशेषज्ञ स्तर को प्राप्त और पार करने वाला पहला मॉडल बना (CoT@32 तकनीक — 32 नमूनों और बहुमत मतदान के साथ तर्क श्रृंखला का उपयोग करते हुए; मानक 5-shot prompting पर परिणाम लगभग 83.7% था)। 32 में से 30 शैक्षणिक benchmarks पर SOTA परिणाम दिखाए।
  • समर्थन समाप्ति: Gemini 1.0 Pro को 18 फरवरी 2025 को अप्रचलित घोषित किया गया।

Gemini 1.5 (फरवरी — मई 2024)

संदर्भ लंबाई और दक्षता में सफलता।

  • वास्तुकला: घने Transformer से Mixture-of-Experts (MoE) में संक्रमण।
  • संदर्भ विंडो: production में 10 लाख token तक (1.5 Pro के लिए waitlist पर 20 लाख — मई 2024 में Google I/O पर घोषित)।
  • संस्करण: 1.5 Pro (फरवरी 2024 में घोषित; 1.0 Ultra के समान गुणवत्ता के साथ काफी कम लागत पर) और 1.5 Flash (हल्का और तेज़ संस्करण, मई 2024 में जोड़ा गया)।
  • समर्थन समाप्ति: सभी Gemini 1.5 मॉडल (Pro, Flash, Flash-8B) 29 सितंबर 2025 को सेवा से बाहर किए गए।

Gemini 2.0 (दिसंबर 2024 — फरवरी 2025)

«एजेंट युग» में संक्रमण।

  • कालक्रम: 11 दिसंबर 2024 — 2.0 Flash Experimental की घोषणा (मल्टीमॉडल इनपुट, पाठ आउटपुट); 5 फरवरी 2025 — 2.0 Flash की व्यापक उपलब्धता (GA), 2.0 Pro Experimental और 2.0 Flash-Lite का प्रकाशन।
  • प्रमुख नवाचार: अंतर्निहित एजेंट क्षमताएँ (tool use), मूलभूत छवि और ऑडियो उत्पादन (प्रारंभ में early-access साझेदारों के लिए सीमित मोड में), एजेंट परिदृश्यों पर ध्यान।
  • संदर्भ विंडो: 20 लाख token तक (2.0 Pro); 10 लाख token तक (2.0 Flash-Lite)।
  • समर्थन समाप्ति: 2.0 Flash और Flash-Lite मॉडलों को 1 जून 2026 को सेवा से बाहर करने की योजना है।

Gemini 2.5 (मार्च — जून 2025)

पहला «thinking model» जिसमें अनुकूलनीय तर्क बजट है।

  • कालक्रम: 25 मार्च 2025 — 2.5 Pro Experimental की घोषणा; 17 अप्रैल — 2.5 Flash (परिवर्तनीय thinking मोड के साथ पहला पूर्णतः हाइब्रिड reasoning मॉडल); 20 मई (Google I/O) — 2.5 Pro और Flash के अपडेट, Deep Think की घोषणा; 17 जून 2025 — 2.5 Pro और 2.5 Flash दोनों के लिए एक साथ GA; उसी दिन — 2.5 Flash-Lite का preview (GA 22 जुलाई)। 1 अगस्त — AI Ultra सदस्यों के लिए Deep Think खुला।
  • प्रमुख नवाचार: अनुकूलनीय बजट के साथ अंतर्निहित «thinking» तंत्र; अलग विस्तारित मोड के रूप में Deep Think। जटिल गणितीय, तार्किक और प्रोग्रामिंग benchmarks पर SOTA परिणाम (AIME 2025 — 86.7%, GPQA Diamond — 84.0%, Humanity's Last Exam — 18.8% बिना उपकरणों के)।
  • संदर्भ विंडो: इनपुट पर 10 लाख token, आउटपुट पर 64,000 token तक। 2.5 Pro के लिए 20 लाख token तक विस्तार का वादा मॉडल के जीवनचक्र के दौरान कार्यान्वित के रूप में पुष्टि नहीं हुआ।
  • विशेष संस्करण: Gemini 2.5 Flash Image (कोड नाम «Nano Banana», 12 अगस्त को गुमनाम रूप से Arena पर प्रकट हुआ, आधिकारिक रूप से 26 अगस्त 2025 को जारी हुआ — फोटोरियलिस्टिक «3D मूर्तियों» के कारण वायरल हुआ, 1 करोड़ नए उपयोगकर्ता आकर्षित हुए); Computer Use Preview (7 अक्टूबर 2025, 2.5 Pro पर आधारित); Text-to-Speech मॉडल (2.5 Flash TTS, 2.5 Pro TTS)।
  • तकनीकी रिपोर्ट: संयुक्त Gemini 2.X रिपोर्ट 7 जुलाई 2025 को arXiv पर प्रकाशित (arXiv:2507.06261), जिसमें 3,300 से अधिक लेखक हैं और 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite मॉडल शामिल हैं।

Gemini 3.x (नवंबर 2025 — फरवरी 2026)

तीसरी पीढ़ी ने आधारभूत उत्पादन से दीर्घकालिक एजेंट प्रक्रियाओं (agentic workflows) और अंतःविषयक वैज्ञानिक कार्यों के समाधान में संक्रमण को चिह्नित किया।

  • Gemini 3 Pro (18 नवंबर 2025): Alphabet के महानिदेशक Sundar Pichai और DeepMind के प्रमुख Demis Hassabis द्वारा «Google का सबसे बुद्धिमान मॉडल» घोषित किया गया। पहला Gemini मॉडल जिसे लॉन्च के दिन Google Search में तैनात किया गया। LMArena पर 1500 Elo का मील का पत्थर पार करने वाला पहला मॉडल बना (लॉन्च के समय 1501)। परिणाम: GPQA Diamond — 91.9%; SWE-bench Verified — 76.2%; Humanity's Last Exam — 37.5% (बिना उपकरणों के); SimpleQA — 72.1%।
  • Gemini 3 Flash (17 दिसंबर 2025): Gemini एप्लिकेशन में डिफ़ॉल्ट मॉडल बन गया। $0.50 / 1M इनपुट token की कीमत पर SWE-bench Verified (78%) पर 3 Pro को पार किया, जबकि तर्क कार्यों पर 30% कम token का उपयोग किया। GPQA Diamond — 90.4%; HLE — 33.7%।
  • Gemini 3.1 Pro (19 फरवरी 2026): प्रकाशन की तिथि पर फ्लैगशिप मॉडल। पहला «वृद्धिशील» रिलीज़ (.1 पूर्व के .5 की जगह)। मुख्य परिणाम — ARC-AGI-2: 77.1% (3 Pro के 31.1% से दोगुने से अधिक)। AIME 2025 — 91.2%; GPQA Diamond — 94.3%; SWE-bench Verified — 80.6%। thinking_level पैरामीटर के माध्यम से नया MEDIUM thinking स्तर लागू किया गया। bash टर्मिनल और उपयोगकर्ता फलनों के साथ कार्य के लिए विशेष endpoint gemini-3.1-pro-preview-customtools। लंबी उत्पादन के दौरान आउटपुट छंटाई की समस्या समाप्त। चैनल: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM।
  • Gemini 3 Deep Think (12 फरवरी 2026 का अपडेट): विशेषीकृत «thinking» मोड का प्रमुख अपडेट। गणित और प्रोग्रामिंग से परे गया: 2025 की अंतर्राष्ट्रीय भौतिकी (IPhO) और रसायन (IChO) ओलंपियाड में स्वर्ण पदक स्तर के परिणाम; ARC-AGI-2 — 84.6%; Humanity's Last Exam — 48.4%; CMT-Benchmark (संघनित पदार्थ सैद्धांतिक भौतिकी) — 50.5%; Codeforces Elo — 3455। Deep Think के आधार पर अनुसंधान एजेंट Aletheia बनाया गया, जिसने Erdős आधार से कई खुले कार्यों (Erdős-1051 समस्या सहित) को स्वायत्त रूप से हल किया।

Gemini पीढ़ियों का सारांश तालिका

Gemini मॉडलों की प्रमुख विशेषताओं का विकास
पीढ़ी रिलीज़ वर्ष प्रमुख संस्करण अधिकतम संदर्भ विंडो प्रमुख वास्तुकला नवाचार और सुधार
Gemini 1.0 2023 Ultra, Pro, Nano 32,768 token शुरू से मूलभूत मल्टीमॉडलिटी; घना Transformer; MMLU पर मानव स्तर से श्रेष्ठ (90.04% CoT@32)।
Gemini 1.5 2024 Pro, Flash 10,00,000 token (waitlist पर 20 लाख) Mixture-of-Experts (MoE) वास्तुकला; संदर्भ का क्रांतिकारी विस्तार; 99% Needle In A Haystack।
Gemini 2.0 2024–2025 Pro, Flash, Flash-Lite 10,00,000 — 20,00,000 token «Agentic AI» युग: उपकरणों का मूलभूत एकीकरण, छवि और ऑडियो उत्पादन, Live API।
Gemini 2.5 2025 Pro, Flash, Flash-Lite 10,00,000 token (इनपुट), 64,000 (आउटपुट) «Thinking model»; अनुकूलनीय तर्क बजट; Deep Think; छवि उत्पादन (Nano Banana); Computer Use।
Gemini 3.x 2025–2026 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think 10,00,000 token एजेंट workflows; thinking_level पैरामीटर; ARC-AGI-2 और वैज्ञानिक ओलंपियाड में सफलता; Aletheia।

प्रमुख परिणाम और benchmarks

MMLU जैसे शास्त्रीय benchmarks की संतृप्ति के कारण, Gemini मॉडलों के प्रदर्शन का मूल्यांकन अमूर्त तर्क, वैज्ञानिक मॉडलिंग और स्वायत्त प्रोग्रामिंग के कार्यों की ओर स्थानांतरित हो गया है। परिणाम Google के आधिकारिक डेटा (self-reported) के अनुसार दिए गए हैं; उनकी तुलना केवल inference मोड, tool use की उपस्थिति/अनुपस्थिति, sampling विधि (single-attempt बनाम majority voting) और विशिष्ट model-id के मिलान पर ही उचित है।

Gemini मॉडलों के प्रमुख benchmarks पर परिणाम (फरवरी 2026 के डेटा)
Benchmark कार्य विवरण Gemini 2.5 Pro (जून 2025) Gemini 3 Pro (नवं. 2025) Gemini 3.1 Pro (फर. 2026) Gemini 3 Deep Think (फर. 2026)
MMLU भाषा की बहु-कार्य समझ
GPQA Diamond PhD स्तर के वैज्ञानिक प्रश्न 84.0% 91.9% 94.3% अनुपलब्ध
Humanity's Last Exam अग्रणी विषय-क्षेत्र ज्ञान 18.8% 37.5% 44.4% 48.4%
ARC-AGI-2 अमूर्त तार्किक पहेलियाँ 4.9% 31.1% 77.1% 84.6%
SWE-bench Verified GitHub repositories में स्वायत्त कार्य समाधान 63.8%* 76.2% 80.6% अनुपलब्ध
AIME 2025 ओलंपियाड स्तर के गणितीय कार्य 86.7% 91.2%
Codeforces (Elo) प्रतिस्पर्धी प्रोग्रामिंग में रेटिंग 2887 3455

* SWE-bench पर 2.5 Pro का परिणाम custom agent setup के साथ प्राप्त हुआ।

LMArena पर स्थिति (फरवरी 2026 के अंत का कट)

LMArena (पहले Chatbot Arena) — अंध युगल मतदान का एक स्वतंत्र मंच। रेटिंग गतिशील रूप से पुनर्गणित होती है; मॉडल लॉन्च के समय के मान वर्तमान से भिन्न हो सकते हैं।

Overall (24 फरवरी 2026 का कट)
मॉडल रेटिंग स्थान मत टिप्पणी
Gemini 3.1 Pro Preview 1500 ± 9 #3 4,060 Preliminary
Gemini 3 Pro 1486 ± 4 #5 37,854
Gemini 3 Flash 1473 ± 5 #7 28,847
Gemini 2.5 Pro 1464 ± 3 #9 97,296
Gemini 2.5 Flash 1411 ± 3 #64 96,163

18 नवंबर 2025 को लॉन्च के समय Gemini 3 Pro ने 1501 Elo रेटिंग हासिल की, जो LMArena पर 1500 का मील का पत्थर पार करने वाला पहला मॉडल बना।

विशेषीकृत और एजेंट प्रणालियाँ

Gemini पारिस्थितिकी तंत्र ऐसे मॉडलों और प्लेटफॉर्मों से विस्तारित है जो डिजिटल और भौतिक वातावरण में बहु-चरणीय क्रियाएँ करने में सक्षम हैं।

स्वायत्त एजेंट

  • Jules — एक स्वायत्त कोडिंग एजेंट जो संरक्षित क्लाउड वर्चुअल मशीनों में अतुल्यकालिक रूप से काम करता है। GitHub में branches और pull requests बनाता है। 20 मई 2025 को Google I/O पर खुले beta में लॉन्च हुआ (बीटा परीक्षण के दौरान 1,40,000 से अधिक कोड सुधार), GA — 6 अगस्त 2025। 2025 के अंत तक Google के आंतरिक repositories में सबसे बड़े contributors में से एक बन गया।
  • Project Mariner — बहु-चरणीय वेब कार्यों के लिए ब्राउज़र एजेंट का अनुसंधान प्रोटोटाइप। 10 समानांतर कार्यों और «Teach & Repeat» फीचर के समर्थन के साथ क्लाउड वर्चुअल मशीनों में स्थानांतरित किया गया। WebVoyager benchmark पर 83.5% हासिल किया। Computer Use क्षमताएँ Gemini API में स्थानांतरित।
  • Google Antigravity — नवंबर 2025 में प्रस्तुत AI एजेंटों के प्रबंधन के लिए एकीकृत विकास वातावरण (IDE)। एजेंट स्वायत्त रूप से कोड संशोधित करते हैं, टर्मिनल और अंतर्निहित ब्राउज़र के साथ संपर्क करते हैं, डेवलपर द्वारा अनुमोदन के लिए सत्यापन योग्य artifacts (कोड diffs) लौटाते हैं।
  • एजेंट Aletheia — Gemini 3 Deep Think पर आधारित एक विशेषीकृत गणितीय अनुसंधान एजेंट। प्राकृतिक भाषा verifier और साहित्य सत्यापन के लिए वेब खोज उपकरणों से सुसज्जित। 2026 की शुरुआत में Erdős आधार से कई खुले गणितीय कार्यों को स्वायत्त रूप से हल किया और वैज्ञानिक प्रकाशनों में सह-लेखक बना।

उपभोक्ता AI एजेंट

  • Phone Automations — Android ऑपरेटिंग सिस्टम के स्तर पर स्वायत्त एजेंट का एकीकरण (Pixel 10 और Samsung Galaxy S26 के लिए बीटा संस्करण)। एक संरक्षित पृथक वातावरण (secure sandbox) में कार्य करता है, GUI के दृश्य विश्लेषण के आधार पर तृतीय-पक्ष अनुप्रयोगों में नेविगेट करने में सक्षम है।
  • Gemini in Chrome (Auto Browse) — बहु-चरणीय वेब कार्यों के स्वचालन के लिए ब्राउज़र एजेंट, सितंबर 2025 से सभी Chrome उपयोगकर्ताओं के लिए उपलब्ध (जनवरी 2026 में Gemini 3 में अपडेट किया गया)।

Computer Use

Gemini 2.5 Computer Use मॉडल ग्राफिकल यूज़र इंटरफेस (UI) के प्रबंधन के लिए अनुकूलित हैं। सिस्टम इनपुट के रूप में screenshots और क्रिया इतिहास स्वीकार करता है, cursor के प्रोग्रामेटिक अनुकरण के लिए (x,y) निर्देशांक और कीबोर्ड इनपुट कमांड उत्पन्न करता है।

Gemini Robotics

मार्च 2025 में प्रस्तुत Vision-Language-Action (VLA) और Embodied Reasoning (ER) वर्ग के मॉडल। ये वास्तुकलाएँ स्थानकालिक जानकारी संसाधित करती हैं और रोबोटिक मैनिपुलेटरों की 3D गति पथ को मूलभूत आउटपुट माध्यम के रूप में पूर्वानुमानित करती हैं (arXiv:2503.20020)।

विशेषीकृत जनरेटिव मॉडल (2026 की शुरुआत)

  • Nano Banana 2 (Gemini 3.1 Flash Image) — 26 फरवरी 2026 को जारी, एक दृश्य मॉडल जो Flash वास्तुकला की गति को Pro की गुणवत्ता के साथ जोड़ता है। पात्र पहचान का कठोर संरक्षण (character consistency), छवियों के भीतर टाइपोग्राफी का मूलभूत उत्पादन और C2PA मेटाडेटा के साथ SynthID क्रिप्टोग्राफिक वॉटरमार्क का एकीकरण प्रदान करता है।
  • Lyria 3 — संगीत मॉडल, 18 फरवरी 2026 को Gemini एप्लिकेशन में एकीकृत। पाठ prompts, फोटोग्राफ या वीडियो से 30-सेकंड की संगीत रचनाएँ (स्वर और वाद्य सहित) उत्पन्न करता है।
  • Veo 3.1 — वीडियो उत्पादन मॉडल। तीन आधार छवियों («Ingredients to Video») का उपयोग करके क्लिप बनाने, निर्दिष्ट पहले और अंतिम फ्रेम के बीच ट्रांज़िशन उत्पन्न करने, ऊर्ध्वाधर वीडियो (9:16) के मूलभूत रेंडरिंग और 4K रिज़ॉल्यूशन तक अपस्केलिंग का समर्थन करता है।
  • Med-Gemini — चिकित्सा कार्यों के लिए डोमेन-विशिष्ट मॉडल (arXiv:2404.18416, arXiv:2405.03162)।

अनुप्रयोग और पारिस्थितिकी तंत्र

Google Gemini को अपने उपभोक्ता और डेवलपर उत्पादों में गहराई से एकीकृत करता है।

उपभोक्ता उत्पाद

  • Gemini एप्लिकेशन: चैटबॉट (पहले Bard, 8 फरवरी 2024 को नामांकन परिवर्तित), जो एक सार्वभौमिक AI-सहायक के रूप में Gemini परिवार के मॉडलों का उपयोग करता है। फरवरी 2026 तक 75 करोड़ से अधिक मासिक सक्रिय उपयोगकर्ता हैं। वर्तमान rollout में 3.1 Pro मॉडल शामिल है। सदस्यताएँ: Google AI Pro ($19.99/माह, Google One AI Premium की जगह) और Google AI Ultra ($249.99/माह, Deep Think, Veo 3 और प्राथमिकता सुविधाओं तक पहुँच सहित)।
  • Google Workspace: Gmail, Docs, Sheets, Meet में Gemini का एकीकरण, पाठ लेखन, डेटा विश्लेषण और सामग्री उत्पादन में सहायता के लिए (Duet AI से रीब्रांडिंग)।
  • Google Search: AI Overviews फीचर एक विशेषीकृत Gemini मॉडल के आधार पर जटिल प्रश्नों पर सारांश उत्तर उत्पन्न करती है। Google I/O 2025 पर लॉन्च किया गया AI Mode एजेंट क्षमताओं (बुकिंग, खरीदारी) के साथ गहरी खोज प्रदान करता है।
  • Android और Pixel: Gemini Nano (Pixel 10 पर v3, Tensor G5 चिप के साथ, अगस्त 2025) स्मार्टफोन पर स्थानीय रूप से कार्य करता है, स्मार्ट उत्तर, संक्षेपण, धोखाधड़ी कॉल का पता लगाना और पहुँच योग्यता प्रदान करता है, डेटा गोपनीयता बनाए रखता है। डेवलपर्स के लिए ML Kit GenAI API डिवाइस पर संक्षेपण, प्रूफरीडिंग और वाक् पहचान का समर्थन करता है।
  • NotebookLM: नोट्स उपकरण से एक पूर्ण रचनात्मक मंच के रूप में विकसित हुआ। मार्च 2025 में Google Workspace का हिस्सा बना। इंटरैक्टिव Audio Overviews, Video Overviews, Mind Maps, स्लाइड, इन्फोग्राफिक का समर्थन करता है। दिसंबर 2025 में Gemini 3 में अपडेट; चैट के लिए पूर्ण 10 लाख token संदर्भ विंडो — फरवरी 2026 से।
  • Gemini Live: Project Astra से कैमरा और स्क्रीन शेयरिंग सुविधाएँ Android और iOS के सभी उपयोगकर्ताओं के लिए निःशुल्क हो गईं।

डेवलपर प्लेटफॉर्म

  • Google AI Studio और Gemini API: API के माध्यम से Gemini मॉडलों तक पहुँच के लिए मुख्य इंटरफेस। फरवरी 2026 तक capability blocks का समर्थन करते हैं: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API)।
  • Vertex AI: उन्नत सुरक्षा और प्रबंधन क्षमताओं के साथ कॉर्पोरेट प्लेटफॉर्म।
  • Google Gen AI SDK: मई 2025 तक Python, JavaScript/TypeScript, Go और Java के लिए GA प्राप्त किया, Gemini Developer API और Vertex AI तक एकल पहुँच प्रदान करता है। Model Context Protocol (MCP) का समर्थन करता है।
  • Gemini CLI: टर्मिनल में AI कोडिंग के लिए कमांड-लाइन उपकरण (जून 2025 में लॉन्च)।
  • Interactions API: मॉडलों और एजेंटों के लिए एकल इंटरफेस (दिसंबर 2025 से बीटा)।

API जीवनचक्र और संस्करण प्रबंधन

API में Gemini मॉडल stable, preview, latest और experimental श्रेणियों में विभाजित हैं। विशिष्ट model_id और मॉडल परिवार एक ही बात नहीं हैं; production परिदृश्यों के लिए एक विशिष्ट संस्करण और उसकी समर्थन अवधि से जुड़ाव अत्यंत महत्वपूर्ण है। API दस्तावेज़ीकरण में समर्थन समाप्ति तिथियों के साथ deprecation रजिस्ट्री बनाए रखी जाती है।

दीर्घकालिक स्वायत्त कार्यों के समर्थन के लिए लागू किए गए: Session Resumption (सर्वर पर 24 घंटे तक सत्र स्थिति का भंडारण) और Context Compression (सीमा से अधिक होने पर संदर्भ के स्वचालित संपीड़न के लिए स्लाइडिंग विंडो तंत्र)।

दिसंबर 2025 में Google ने API के निःशुल्क स्तर की सीमाएँ लगभग 92% कम कर दीं (बिना पूर्व चेतावनी के), जिससे डेवलपर समुदाय में तीखी प्रतिक्रिया हुई। इसके साथ ही, Gemini मॉडलों की सेवा लागत 2025 में अनुकूलन के कारण 78% घट गई।

सीमाएँ और खुली समस्याएँ

  • मतिभ्रम और भ्रामक उत्पादन (Hallucinations and Confabulations): मॉडल Search Grounding जैसी आधारभूत सुविधाओं के बंद होने पर विशेष रूप से तथ्यात्मक रूप से गलत जानकारी उत्पन्न करने की प्रवृत्ति बनाए रखते हैं। Gemini 3.1 Pro ने SimpleQA benchmark पर पिछले संस्करणों की तुलना में मतिभ्रम का स्तर कम किया, परंतु यह समस्या सभी LLM के लिए प्रणालीगत बनी हुई है।
  • अवचेतन साहित्यिक चोरी (Subconscious Plagiarism): Aletheia एजेंट के साथ प्रयोगों में प्रशिक्षण डेटा से गैर-तुच्छ साक्ष्यों के पुनरुत्पादन की समस्या पाई गई, जो स्वायत्त खोजों के रूप में प्रस्तुत किए जाते हैं, जो AI अनुसंधान की नवीनता के सत्यापन को जटिल बनाती है।
  • लंबे संदर्भ में गिरावट: 10 लाख token आकार के संदर्भों को संसाधित करते समय मॉडल «Lost in the Middle» प्रभाव के प्रति संवेदनशील होते हैं — दस्तावेज़ के मध्य से तथ्यों के निष्कर्षण की सटीकता में कमी।
  • उच्च गणनात्मक लागत: Deep Think की अधिकतम सेटिंग्स के साथ inference में काफी अधिक समय और संसाधन (TPU) की आवश्यकता होती है, जो तुल्यकालिक रीयल-टाइम अनुप्रयोगों में उपयोग को सीमित करती है।
  • अत्यधिक अस्वीकृति (Over-refusals): सख्त alignment एल्गोरिदम के कारण, जटिल तर्क मॉडल वैध अनुरोधों को अस्वीकार करने की प्रवृत्ति रखते हैं, उन्हें गलत तरीके से संभावित रूप से खतरनाक के रूप में वर्गीकृत करते हैं (विशेष रूप से कोड विश्लेषण और सूचना सुरक्षा के संदर्भ में)। model card में «उपदेशात्मक» (preachy) अस्वीकृति स्वर की समस्याएँ भी नोट की गई हैं।
  • तर्क की सीमाएँ: 2.5- और 3-श्रृंखला के model cards कारणात्मक समझ (causal understanding), जटिल तार्किक निगमन (complex logical deduction) और प्रतिपक्षी तर्क (counterfactual reasoning) में सीमाओं को सूचीबद्ध करते हैं, साथ ही thinking बजट के अनुपालन की अपूर्ण पूर्वानुमेयता भी।

नैतिक पहलू और सुरक्षा

Gemini मॉडलों की तैनाती बहु-स्तरीय सुरक्षा उपायों के साथ की जाती है।

सामान्य ढाँचा

Secure AI Framework (SAIF) — AI प्रणालियों की सुरक्षा के लिए Google का सामान्य दृष्टिकोण (जून 2023 में घोषित), जो विकास के संदर्भ को निर्धारित करता है, लेकिन Gemini-विशिष्ट मानक नहीं है। Frontier Safety Framework v3 (सितंबर 2025) CBRN, साइबर सुरक्षा, ML R&D, हेरफेर प्रभाव के क्षेत्रों और असंरेखण (misalignment) जोखिमों के प्रति प्रायोगिक दृष्टिकोण को कवर करता है।

Gemini-विशिष्ट उपाय

  • Model cards — विशिष्ट मॉडलों की सीमाओं और सुरक्षा के बारे में प्राथमिक सूचना स्रोत। इनमें Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety के अनुभाग हैं। Gemini 3 Pro के model card ने पुष्टि की कि मॉडल ने CBRN और साइबर सुरक्षा के क्षेत्रों में किसी भी Critical Capability Level को नहीं प्राप्त किया।
  • पूर्वाग्रह और विषाक्तता परीक्षण: प्रशिक्षण डेटा और सामग्री उत्पादन में पूर्वाग्रह का विश्लेषण और शमन।
  • Red Teaming: कमजोरियों और अवांछित व्यवहार की पहचान के लिए आक्रमण अनुकरण। असंरेखण पर स्वतंत्र परीक्षण ने «ситуационной осведомлённости में कुछ वृद्धि» पाई, लेकिन कोई महत्वपूर्ण जोखिम नहीं मिला।

सुरक्षा जाँचें (Safety Probes)

हानिकारक सामग्री की उत्पादन रोकने के लिए छिपी हुई activations के वर्गीकरण का उपयोग किया जाता है। लंबे संदर्भों में संकेत हानि की समस्या के समाधान के लिए MultiMax वास्तुकला का उपयोग किया जाता है: probe अनुक्रम ni में प्रत्येक token j के लिए सभी परतों H में अधिकतम मान चुनता है:

fextMultiMax(Si)=h=1Hmaxj[ni][vhopyi,j]

Probes को कैस्केड classifiers में आधारभूत मॉडलों के साथ जोड़ा जाता है, कम गणनात्मक लागत (arXiv:2601.11516) पर फ़िल्टरिंग की सटीकता बढ़ाता है।

क्रिप्टोग्राफिक अंकन (SynthID)

Live API के माध्यम से उत्पन्न ऑडियो डेटा और छवियाँ (Nano Banana / Flash Image मॉडलों से) SynthID एल्गोरिदम द्वारा अंकित होती हैं। एक अदृश्य वॉटरमार्क पिक्सेल या ऑडियो स्पेक्ट्रम स्तर पर एम्बेड किया जाता है, जो उत्पन्न सामग्री की मशीन पहचान सुनिश्चित करता है। Nano Banana 2 मॉडल (फरवरी 2026) SynthID को C2PA मेटाडेटा के साथ एकीकृत करता है।

Thinking और पारदर्शिता का प्रश्न

Thinking मोड (2.5/3-श्रृंखला) वाले मॉडल thought summaries वापस कर सकते हैं — आंतरिक तर्क की संक्षिप्त सारांश, न कि मध्यवर्ती tokens की पूर्ण धारा। यह एक निश्चित स्तर की पारदर्शिता प्रदान करता है, परंतु इस आलोचना का सामना करता है कि वास्तविक «कच्ची» तर्क श्रृंखलाएँ सरलीकृत सारांशों के पीछे छिपाई जाती हैं।

विनियामक पहलू

यूरोपीय संघ के कृत्रिम बुद्धिमत्ता अधिनियम (EU AI Act) के तहत Google ने OpenAI और Anthropic के साथ EU AI आचार संहिता पर हस्ताक्षर किए (10 जुलाई 2025 को प्रकाशित)। Gemini को प्रणालीगत जोखिम वाले सामान्य प्रयोजन AI (GPAI) मॉडल के रूप में वर्गीकृत किया गया है, जिससे अतिरिक्त सुरक्षा दायित्व उत्पन्न होते हैं (2 अगस्त 2025 से लागू)।

प्रतिस्पर्धी परिवेश

नवंबर — दिसंबर 2025 की अवधि AI इतिहास का सबसे घना प्रतिस्पर्धी चक्र बन गया: Gemini 3 Pro (18 नवंबर), Anthropic का Claude Opus 4.5 (24 नवंबर) और OpenAI का GPT-5.2 (11 दिसंबर) 24 दिनों के भीतर जारी किए गए। फरवरी 2026 की स्थिति में कोई भी मॉडल सभी श्रेणियों में प्रभुत्व नहीं रखता: Gemini 3 Pro पाठ, दृष्टि, खोज और बहुभाषी क्षेत्रों में LMArena पर अग्रणी है; GPT-5.2 शुद्ध गणित (AIME 2025 पर बिना उपकरणों के 100%) और SWE-bench Pro पर अग्रणी है; Claude Opus 4.5 SWE-bench Verified पर प्रतिस्पर्धा करता है। API लागत के संदर्भ में Gemini समान कॉल पर GPT-5 की तुलना में लगभग 42% सस्ता है।

व्यावसायिक संकेतक

Alphabet की Q4 2025 रिपोर्टिंग (4 फरवरी 2026 को प्रकाशित) के अनुसार: Google Cloud का राजस्व — $17.7 अरब प्रति तिमाही (+48% वर्ष दर वर्ष); परिचालन मार्जिन — 29.9%; Cloud ऑर्डर पोर्टफोलियो — $240 अरब (वर्ष में दोगुना)। 1,20,000 से अधिक उद्यम Gemini का उपयोग करते हैं। जनवरी 2026 में Apple ने Siri में Gemini के एकीकरण की योजना घोषित की। Google API के माध्यम से प्रति मिनट 1,000 करोड़ से अधिक tokens संसाधित करता है। Google के आंतरिक AI एजेंट कंपनी के लगभग 50% अपने कोड उत्पन्न करते हैं। 2026 के लिए पूंजीगत व्यय $175–185 अरब के स्तर पर नियोजित है (2025 में $91.45 अरब की लगभग दोगुनी वृद्धि)।

संदर्भ

  • Google DeepMind मॉडल सूचकांक
  • डेवलपर्स के लिए Gemini API दस्तावेज़ीकरण
  • Gemini API मॉडल कैटलॉग
  • Gemini Thinking दस्तावेज़ीकरण
  • Gemini मॉडल deprecation रजिस्ट्री
  • Google DeepMind model cards सूचकांक

साहित्य

Gemini के प्राथमिक तकनीकी रिपोर्ट

  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
  • Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
  • Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.

विशेषीकृत मॉडल और अनुप्रयोग

  • Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
  • Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
  • Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  • Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
  • DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
  • Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.

साहित्य (समीक्षाएँ और विधियाँ)

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
  • Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
  • Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.

Google के आधिकारिक ब्लॉग पोस्ट

  • Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
  • Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
  • Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
  • Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
  • Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
  • Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
  • Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
  • The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
  • The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.