Gemini (Google) (TL)
Google Gemini — ito ay isang pamilya ng multimodal na malalaking language model (LLM), na binuo ng research division ng Google DeepMind. Ang mga modelo ng Gemini, na unang ipinakita noong Disyembre 2023, ay itinayo sa arkitektura ng neural network transformer (Transformer) na may native na suporta para sa pagproseso at pagbuo ng datos sa iba't ibang modalidad, kabilang ang teksto, mga larawan, audio, video at program code.
Sa estado ng Pebrero 2026, ang kasalukuyang henerasyon ay ang linya ng Gemini 3.x. Ang pagpapaunlad ng arkitektura ay nakatuon sa integrasyon ng mga mekanismo ng scalable na lohikal na pagbabawas sa panahon ng inference (inference-time scaling) at ang pag-optimize ng mga modelo para sa paggamit bilang bahagi ng mga autonomous na agentic system (Agentic AI). Ang application na Gemini ay may mahigit 750 milyong aktibong gumagamit bawat buwan.
Pangalan at pilosopiya
Ang pangalan na "Gemini" (mula sa Latin — Mga Kambal) ay sumisimbolo sa pagsasama ng dalawang nangungunang research group ng Google — Google Brain at DeepMind — para sa paglikha ng proyektong ito. Kinumpirma ito ni Jeff Dean, co-technical lead ng Google DeepMind, sa opisyal na blog (Mayo 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». Ang proyekto ay orihinal na may code name na «Titan»; ang pangalang «Gemini» ay iminungkahi ni Dean noong Abril 2023 — sa parehong buwan na naganap ang pormal na pagsasama ng Google Brain at DeepMind. Ang pangalan ay tumutukoy din sa space program ng NASA na «Gemini» (1965–1968), na ang papel nito sa paghahanda ng programa ng «Apollo» ay umaalingawngaw sa koponan ng mga developer.
Ang pangunahing katangian at pilosopikal na pundasyon ng Gemini ay ang native na multimodality. Hindi tulad ng maraming naunang modelo, kung saan ang mga multimodal na kakayahan ay idinagdag sa ibabaw ng umiiral na tekstuwal na base, ang Gemini ay idinisenyo mula sa simula para sa sabay-sabay na pag-unawa, pag-operasyon at pagsasama ng iba't ibang uri ng impormasyon. Ang technical report ng Gemini 1.0 (arXiv:2312.11805) ay nagpapatunay na ang modelo ay «trained jointly across image, audio, video, and text data». Nagbibigay-daan ito sa modelo na hindi lamang magsalin ng datos sa pagitan ng mga modalidad, kundi bumuo ng mas malalim, holistikong pag-unawa sa mga ito.
Arkitektura at mga pangunahing teknolohiya
Ang tagumpay at mga kakayahan ng mga modelo ng Gemini ay tinutukoy ng ilang pundamental na desisyon sa arkitektura. Hindi inilalabas ng Google ang kumpletong low-level na disenyo ng lahat ng panloob na bahagi ng Gemini, ngunit ang mga bukas na pinagkukunan ay nagpapahintulot na matukoy ang klase ng arkitektura: lahat ng modelo ng pamilya 1.5 at pataas ay sparse mixture-of-experts transformer-based models na may native na multimodal na suporta (kinumpirma ng model card ng Gemini 2.5 Flash).
Native na multimodal na arkitektura
Ang arkitektura ng Gemini ay batay sa konsepto ng maagang pagsasama (early fusion). Ang mga pixel patch ng mga larawan, mga temporal na frame ng video, mga audiogram at mga text token ay pinoprodyekto sa iisang latent space. Ang technical report para sa Gemini 2.5 ay inilalarawan ang diskarteng ito bilang «Unified Multimodal Token Interleaving». Dahil lahat ng token ng iba't ibang modalidad ay pinoproseso sa karaniwang pagkakasunud-sunod, ang mga karaniwang mekanismo ng self-attention ay natural na nagbibigay ng cross-integration ng datos mula sa iba't ibang modalidad sa bawat layer. Ang mga audio signal ay pinoproseso ng mga espesyalisadong encoder nang direkta mula sa audio waveform, na nagpapanatili ng mga acoustic na katangian (intonasyon, timbre, mga background na ingay) na nawawala kapag gumagamit ng mga intermediate na Speech-to-Text transcription system.
Para sa transformer class, ang pangunahing operasyon ay ang mekanismo ng attention:
kung saan ang — ang matrix ng mga query, — ng mga susi, — ng mga halaga, at — ang dimensyon ng mga susi.
Sparse Mixture of Experts (Sparse MoE)
Simula sa bersyon 1.5, gumagamit ang mga modelo ng Gemini ng arkitektura ng Sparse Mixture-of-Experts (MoE). Ginamit ng Gemini 1.0 ang isang siksik (dense) na transformer; ang paglipat sa MoE ay direktang inilarawan sa technical report na 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».
Sa MoE-arkitektura, ang mga karaniwang fully-connected layer (Feed-Forward Networks) ay pinalitan ng isang hanay ng mga espesyalisadong subnetwork — «mga eksperto». Para sa input token na ang output na ay nabubuo bilang weighted na kabuuan ng mga output ng aktibong eksperto (, kung saan — ang kabuuang bilang ng mga eksperto):
kung saan ang — ang nonlinear na function ng -ng eksperto, — ang hanay ng mga indeks ng napiling subnetwork, at ang routing weight na ay kinakalkula ng learned routing function na may paggamit ng Softmax function sa pinakamalaking halaga.
Ang diskarteng ito ay nagpapahintulot na makabuluhang palakihin ang kabuuang parametric na kapasidad ng modelo, habang pinapanatili ang mga gastos sa pagkalkula (FLOPs) sa mababang antas, dahil para sa bawat token isang subset lamang ng mga parameter ang ina-activate. Hindi inilalabas ng Google ang aktwal na bilang ng mga parameter ng mga modelo ng Gemini.
Mahabang konteksto at «Pag-aaral sa konteksto»
Ang Gemini 1.5 ay gumawa ng breakthrough sa pamamagitan ng pagpapalaki ng laki ng context window sa 1 milyong token sa production mode (na may experimental na pagsubok hanggang 10 milyong token). Ito ay isang order of magnitude na mas malaki kaysa sa mga nakaraang modelo (halimbawa, GPT-4 Turbo na may 128 libo token). Inihayag ng Google ang resulta na 99% sa Needle In A Haystack test sa context length na 1 milyong token. Para sa mga kasunod na henerasyon, ang long context ay naitatag bilang isa sa mga pangunahing katangian ng linya. Ang ganitong malawak na konteksto ay nagpapahintulot sa modelo na:
- Suriin ang mga buong libro, mahabang oras na video (hanggang 3 oras) o malalaking code base sa loob ng isang query.
- Magsagawa ng «pag-aaral sa konteksto» (in-context learning) sa napakalaking dami ng datos na ibinibigay sa prompt, na nagpapahintulot ng pagkuha ng highly customized na mga sagot nang hindi na kailangang mag-fine-tuning.
«Mga nag-iisip na modelo» at pag-scale ng mga kalkulasyon sa panahon ng inference
Simula sa Gemini 2.5, tinutukoy ng Google ang thinking bilang isang hiwalay na mode ng operasyon ng mga modelo. Tinutukoy ito ng opisyal na dokumentasyon bilang isang panloob na proseso ng pagkalkula na nagpapabuti ng multi-step na pagpaplano at pangangatwiran. Ang mga modelo ng bersyon 2.5 (inilarawan bilang «thinking models») ay kayang panloob na bumuo at suriin ang mga intermediate na hakbang ng pangangatwiran bago magbigay ng panghuling sagot. Ito ay makabuluhang nagpapataas ng katumpakan sa mga kumplikadong lohikal at matematikal na gawain.
Mahalaga ang pagkakaiba ng dalawang mekanismo:
- Built-in na pag-iisip (Thinking): Pangunahing mode para sa mga modelo ng 2.5 at 3-serye, na bumubuo ng nakatagong chain of reasoning (Chain-of-Thought). Maaaring magbalik ang API ng thought summaries — mga maikling buod ng mga panloob na pangangatwiran, at hindi ang buong stream ng «mga hilaw na kaisipan». Simula sa modelo 3.1 Pro, ang budget ng pag-iisip ay kinokontrol ng parameter na
thinking_levelna may mga halaga mula Low hanggang Max. - Deep Think: Isang hiwalay na eksperimental na pinalawak na mode ng pangangatwiran, na gumagamit ng parallel na pagbuo ng mga hypothesis at nangangailangan ng mas malaking mapagkukunan sa pagkalkula. Inihayag ito sa Google I/O noong 20 Mayo 2025 at binuksan para sa mga subscriber ng AI Ultra noong 1 Agosto 2025. Ang Deep Think ay hindi dapat ipakahulugang katumbas ng pangunahing mekanismo ng thinking.
Mga kakayahan ng ahente (Agentic Capabilities)
Simula sa bersyon 2.0, ang Gemini ay maaaring makipag-ugnayan sa panlabas na mundo: tumawag ng mga tool, magsagawa ng paghahanap sa Google, mag-execute ng code at pamahalaan ang mga UI element. Direktang inipwesto ng Google ang Gemini 2.0 bilang modelo para sa «bagong agentic era» (agentic era) na may native na suporta para sa tool use.
Sa Pebrero 2026, kasama sa Gemini API ang isang pormal na itinatag na layer ng mga kakayahan ng ahente na may suporta para sa mga tool: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, pati na rin ang Live API para sa bidirectional na pakikipag-ugnayan sa real time.
Ebolusyon ng mga modelo ng Gemini
Ang pamilya ng Gemini ay nagbabago nang napakabilis: sa panahon mula Disyembre 2023 hanggang Pebrero 2026, apat na pangunahing henerasyon ng mga modelo ang inilabas.
Gemini 1.0 (Disyembre 2023)
Ang unang henerasyon, na naglatag ng pundasyon ng native na multimodality. Pampublikong ipinakita noong 6 Disyembre 2023.
- Mga bersyon: Ultra (flagship para sa pinaka-kumplikadong mga gawain), Pro (universal na modelo) at Nano (compact para sa mga mobile device; nahahati sa Nano-1 na may 1.8 bilyong parameter at Nano-2 na may 3.25 bilyon).
- Context window: 32 768 token para sa lahat ng bersyon.
- Mga tagumpay: Ang Gemini 1.0 Ultra ay naging unang modelo na umabot at nalampasan ang antas ng isang human expert sa benchmark na MMLU na may resulta na 90.04% (kapag gumagamit ng teknik na CoT@32 — chain of reasoning na may 32 sample at majority voting; sa karaniwang 5-shot prompting ang resulta ay humigit-kumulang 83.7%). Nagpakita ng SOTA na mga resulta sa 30 sa 32 academic benchmark.
- Katapusan ng suporta: Ang Gemini 1.0 Pro ay inihayag na luma na noong 18 Pebrero 2025.
Gemini 1.5 (Pebrero — Mayo 2024)
Breakthrough sa haba ng konteksto at kahusayan.
- Arkitektura: Paglipat mula sa dense transformer patungo sa Mixture-of-Experts (MoE).
- Context window: Hanggang 1 milyong token sa production (2 milyon — sa pamamagitan ng waitlist para sa 1.5 Pro, inihayag noong Mayo 2024 sa Google I/O).
- Mga bersyon: 1.5 Pro (inihayag noong Pebrero 2024; na may kalidad sa antas ng 1.0 Ultra sa mas mababang gastos) at 1.5 Flash (magaan at mabilis na bersyon, idinagdag noong Mayo 2024).
- Katapusan ng suporta: Lahat ng modelo ng Gemini 1.5 (Pro, Flash, Flash-8B) ay inalis sa operasyon noong 29 Setyembre 2025.
Gemini 2.0 (Disyembre 2024 — Pebrero 2025)
Paglipat sa «agentic era».
- Kronolohiya: 11 Disyembre 2024 — anunsyo ng 2.0 Flash Experimental (multimodal na input, text output); 5 Pebrero 2025 — malawak na availability (GA) ng 2.0 Flash, paglabas ng 2.0 Pro Experimental at 2.0 Flash-Lite.
- Mga pangunahing inobasyon: Mga built-in na kakayahan ng ahente (tool use), native na pagbuo ng larawan at audio (orihinal na sa limitadong mode para sa mga early-access partner), oryentasyon sa mga agentic na senaryo.
- Context window: Hanggang 2 milyong token (2.0 Pro); hanggang 1 milyong token (2.0 Flash-Lite).
- Katapusan ng suporta: Ang mga modelo ng 2.0 Flash at Flash-Lite ay nakatakdang alisin sa operasyon noong 1 Hunyo 2026.
Gemini 2.5 (Marso — Hunyo 2025)
Ang unang «nag-iisip na modelo» (thinking model) na may nababagong budget ng pangangatwiran.
- Kronolohiya: 25 Marso 2025 — anunsyo ng 2.5 Pro Experimental; 17 Abril — 2.5 Flash (unang ganap na hybrid na reasoning model na may naaayon na mode ng pag-iisip); 20 Mayo (Google I/O) — mga update sa 2.5 Pro at Flash, anunsyo ng Deep Think; 17 Hunyo 2025 — sabay-sabay na GA para sa 2.5 Pro at 2.5 Flash; sa parehong araw — preview ng 2.5 Flash-Lite (GA 22 Hulyo). 1 Agosto — binuksan ang Deep Think para sa mga subscriber ng AI Ultra.
- Mga pangunahing inobasyon: Built-in na mekanismo ng «pag-iisip» (thinking) na may nababagong mga budget; Deep Think bilang isang hiwalay na pinalawak na mode. Mga SOTA na resulta sa mga kumplikadong matematikal, lohikal at programming benchmark (AIME 2025 — 86.7%, GPQA Diamond — 84.0%, Humanity's Last Exam — 18.8% nang walang mga tool).
- Context window: 1 milyong token sa input, hanggang 64 000 token sa output. Ang pangako ng pagpapalawak hanggang 2 milyong token para sa 2.5 Pro ay hindi nakumpirma bilang naisakatuparan sa loob ng lifecycle ng modelo.
- Mga espesyalisadong variant: Gemini 2.5 Flash Image (code name na «Nano Banana», lumabas nang anonymously sa Arena noong 12 Agosto, opisyal na inilabas noong 26 Agosto 2025 — naging viral dahil sa photorealistic na «3D figure», nakaakit ng 10 milyong bagong gumagamit); Computer Use Preview (7 Oktubre 2025, batay sa 2.5 Pro); mga modelo ng Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS).
- Technical report: Ang pinagsama-samang ulat na Gemini 2.X ay inilathala sa arXiv noong 7 Hulyo 2025 (arXiv:2507.06261), naglalaman ng mahigit 3 300 may-akda at sumasaklaw sa mga modelo ng 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite.
Gemini 3.x (Nobyembre 2025 — Pebrero 2026)
Ang ikatlong henerasyon ay nagpapahiwatig ng paglipat mula sa pangunahing pagbuo patungo sa mga matagalang agentic na proseso (agentic workflows) at paglutas ng mga interdisciplinary na siyentipikong gawain.
- Gemini 3 Pro (18 Nobyembre 2025): Inihayag ng CEO ng Alphabet na si Sundar Pichai at ng pinuno ng DeepMind na si Demis Hassabis bilang «pinaka-matalinong modelo ng Google». Unang modelo ng Gemini na nai-deploy sa Google Search sa araw ng launch. Naging unang modelo na nalampasan ang hadlang na 1500 Elo sa LMArena (1501 sa oras ng launch). Mga resulta: GPQA Diamond — 91.9%; SWE-bench Verified — 76.2%; Humanity's Last Exam — 37.5% (nang walang mga tool); SimpleQA — 72.1%.
- Gemini 3 Flash (17 Disyembre 2025): Naging default na modelo sa application ng Gemini. Sa presyo na $0.50 / 1M input token, nalampasan ang 3 Pro sa SWE-bench Verified (78%) habang gumagamit ng 30% mas kaunting token para sa mga gawain ng pangangatwiran. GPQA Diamond — 90.4%; HLE — 33.7%.
- Gemini 3.1 Pro (19 Pebrero 2026): Flagship na modelo sa petsa ng publikasyon. Unang «incremental» na release (.1 sa halip ng dating .5). Pangunahing resulta — ARC-AGI-2: 77.1% (mahigit doble sa 31.1% ng 3 Pro). AIME 2025 — 91.2%; GPQA Diamond — 94.3%; SWE-bench Verified — 80.6%. Ipinakilala ang bagong antas ng pag-iisip na MEDIUM sa pamamagitan ng parameter na
thinking_level. Espesyalisadong endpoint nagemini-3.1-pro-preview-customtoolspara sa pagtatrabaho sa bash terminal at mga custom function. Naayos ang problema ng truncation ng output sa mahahabang generation. Mga channel: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM. - Gemini 3 Deep Think (update noong 12 Pebrero 2026): Major na update ng espesyalisadong «nag-iisip» na mode. Lumampas sa hangganan ng matematika at programming: mga resulta sa antas ng gold medal sa mga internasyonal na olympiad sa pisika (IPhO) at kimika (IChO) noong 2025; ARC-AGI-2 — 84.6%; Humanity's Last Exam — 48.4%; CMT-Benchmark (theoretical condensed matter physics) — 50.5%; Codeforces Elo — 3455. Batay sa Deep Think, nilikha ang research agent na Aletheia, na nag-autonomously na nalutas ng ilang bukas na gawain mula sa Erdős database (kabilang ang problema ng Erdős-1051).
Buod na talahanayan ng mga henerasyon ng Gemini
| Henerasyon | Taon ng paglabas | Mga pangunahing bersyon | Max. context window | Mga pangunahing arkitektura na inobasyon at pagpapabuti |
|---|---|---|---|---|
| Gemini 1.0 | 2023 | Ultra, Pro, Nano | 32 768 token | Native na multimodality mula sa simula; dense transformer; pagtatagumpay laban sa tao sa MMLU (90.04% CoT@32). |
| Gemini 1.5 | 2024 | Pro, Flash | 1 000 000 token (2 milyon sa pamamagitan ng waitlist) | Arkitektura ng Mixture-of-Experts (MoE); rebolusyonaryong pagtaas ng konteksto; 99% Needle In A Haystack. |
| Gemini 2.0 | 2024–2025 | Pro, Flash, Flash-Lite | 1 000 000 — 2 000 000 token | Panahon ng «agentic AI»: native na integrasyon ng mga tool, pagbuo ng larawan at audio, Live API. |
| Gemini 2.5 | 2025 | Pro, Flash, Flash-Lite | 1 000 000 token (input), 64 000 (output) | «Nag-iisip na modelo» (thinking); nababagong mga budget ng pangangatwiran; Deep Think; pagbuo ng larawan (Nano Banana); Computer Use. |
| Gemini 3.x | 2025–2026 | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1 000 000 token | Mga agentic na workflow; parameter na thinking_level; breakthrough sa ARC-AGI-2 at mga siyentipikong olympiad; Aletheia. |
Mga pangunahing resulta at benchmark
Dahil sa saturation ng mga klasikal na benchmark (tulad ng MMLU), ang pagtatasa ng pagganap ng mga modelo ng Gemini ay lumipat sa mga gawain ng abstract na pangangatwiran, siyentipikong modeling at autonomous na programming. Ang mga resulta ay ibinibigay ayon sa opisyal na datos ng Google (self-reported); ang kanilang paghahambing ay tama lamang kapag magkapareho ang mode ng inference, presensya/kawalan ng tool use, paraan ng sampling (single-attempt vs. majority voting) at tiyak na model-id.
| Benchmark | Paglalarawan ng gawain | Gemini 2.5 Pro (Hunyo 2025) | Gemini 3 Pro (Nob. 2025) | Gemini 3.1 Pro (Peb. 2026) | Gemini 3 Deep Think (Peb. 2026) |
|---|---|---|---|---|---|
| MMLU | Multitask na pag-unawa sa wika | — | — | — | — |
| GPQA Diamond | Mga siyentipikong tanong sa antas ng PhD | 84.0% | 91.9% | 94.3% | H/A |
| Humanity's Last Exam | Frontier na kaalaman sa paksa | 18.8% | 37.5% | 44.4% | 48.4% |
| ARC-AGI-2 | Mga abstract na lohikal na palaisipan | 4.9% | 31.1% | 77.1% | 84.6% |
| SWE-bench Verified | Autonomous na paglutas ng mga gawain sa mga repository ng GitHub | 63.8%* | 76.2% | 80.6% | H/A |
| AIME 2025 | Mga matematikal na gawain sa antas ng olympiad | 86.7% | — | 91.2% | — |
| Codeforces (Elo) | Rating sa competitive programming | — | — | 2887 | 3455 |
* Ang resulta ng 2.5 Pro sa SWE-bench ay nakuha sa custom agent setup.
Mga posisyon sa LMArena (snapshot ng katapusan ng Pebrero 2026)
Ang LMArena (dating Chatbot Arena) — ay isang independent na platform ng blind pairwise voting. Ang mga rating ay muling kinakalkula nang dinamiko; ang mga halaga sa oras ng launch ng modelo ay maaaring mag-iba sa kasalukuyan.
| Modelo | Rating | Lugar | Mga boto | Tala |
|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 1500 ± 9 | #3 | 4 060 | Preliminary |
| Gemini 3 Pro | 1486 ± 4 | #5 | 37 854 | |
| Gemini 3 Flash | 1473 ± 5 | #7 | 28 847 | |
| Gemini 2.5 Pro | 1464 ± 3 | #9 | 97 296 | |
| Gemini 2.5 Flash | 1411 ± 3 | #64 | 96 163 |
Sa launch noong 18 Nobyembre 2025, ang Gemini 3 Pro ay umabot sa rating na 1501 Elo, naging unang modelo na nalampasan ang hadlang na 1500 sa LMArena.
Mga espesyalisado at agentic na sistema
Ang ecosystem ng Gemini ay pinalawak ng mga modelo at platform na kayang magsagawa ng multi-step na mga aksyon sa digital at pisikal na kapaligiran.
Mga autonomous na ahente
- Jules — isang autonomous na coding agent na gumagana nang asynchronously sa mga protektadong cloud virtual machine. Lumilikha ng mga branch at pull request sa GitHub. Lumabas sa open beta sa Google I/O noong 20 Mayo 2025 (mahigit 140 000 na pagpapabuti ng code sa panahon ng beta testing), GA — 6 Agosto 2025. Sa katapusan ng 2025 naging isa sa mga pinakamalaking kontribyutor sa mga panloob na repository ng Google.
- Project Mariner — isang research prototype ng browser agent para sa mga multi-step na web task. Inilipat sa mga cloud virtual machine na may suporta para sa hanggang 10 parallel na gawain at tampok na «Teach & Repeat». Umabot ng 83.5% sa benchmark na WebVoyager. Ang mga kakayahan ng Computer Use ay inilipat sa Gemini API.
- Google Antigravity — isang integrated development environment (IDE) para sa pamamahala ng mga AI agent na ipinakita noong Nobyembre 2025. Ang mga ahente ay autonomously na nagbabago ng code, nakikipag-ugnayan sa terminal at built-in na browser, na nagbabalik ng mga verifiable na artifact (code diff) para sa pag-apruba ng developer.
- Ahente Aletheia — isang espesyalisadong mathematical research agent batay sa Gemini 3 Deep Think. Nilagyan ng verifier sa natural na wika at mga web search tool para sa pagsuri ng literatura. Noong simula ng 2026, nag-autonomously na nalutas ng ilang bukas na matematikal na gawain mula sa Erdős database at naging co-author ng mga siyentipikong publikasyon.
Mga consumer AI agent
- Phone Automations — integrasyon ng autonomous agent sa antas ng operating system ng Android (beta na bersyon para sa Pixel 10 at Samsung Galaxy S26). Gumagana sa isang protektadong isolated na kapaligiran (secure sandbox), kayang mag-navigate sa mga third-party na application batay sa visual na pagsusuri ng GUI.
- Gemini in Chrome (Auto Browse) — isang browser agent para sa automation ng mga multi-step na web task, na available sa lahat ng gumagamit ng Chrome mula Setyembre 2025 (na-update sa Gemini 3 noong Enero 2026).
Computer Use
Ang mga modelo ng Gemini 2.5 Computer Use ay na-optimize para sa pamamahala ng mga graphical user interface (UI). Ang sistema ay tumatanggap ng mga screenshot at kasaysayan ng mga aksyon bilang input, na bumubuo ng mga koordinasyon na para sa programmatic na simulation ng cursor at mga command ng keyboard input.
Gemini Robotics
Mga modelo ng klase ng Vision-Language-Action (VLA) at Embodied Reasoning (ER) na ipinakita noong Marso 2025. Ang mga arkitekturang ito ay nagpoproseso ng spatio-temporal na impormasyon at nagtataya ng mga 3D trajectory ng paggalaw ng mga robotic manipulator bilang native na output modality (arXiv:2503.20020).
Mga espesyalisadong generative na modelo (simula ng 2026)
- Nano Banana 2 (Gemini 3.1 Flash Image) — inilabas noong 26 Pebrero 2026, isang visual na modelo na pinagsasama ang bilis ng Flash-arkitektura at kalidad ng Pro. Nagbibigay ng mahigpit na pagpapanatili ng pagkakakilanlan ng mga karakter (character consistency), native na pagbuo ng typography sa loob ng mga larawan at integrasyon ng mga cryptographic watermark ng SynthID na may metadata ng C2PA.
- Lyria 3 — isang music model na integrated sa application ng Gemini noong 18 Pebrero 2026. Bumubuo ng 30-segundo na musikal na komposisyon (kabilang ang vocal at instrumental) batay sa mga text prompt, larawan o video.
- Veo 3.1 — isang video generation model. Sumusuporta sa paglikha ng mga video gamit ang hanggang tatlong reference na larawan («Ingredients to Video»), pagbuo ng mga transition sa pagitan ng tinukoy na una at huling frame, native na rendering ng mga vertical na video (9:16) at upscaling hanggang 4K resolution.
- Med-Gemini — isang domain-specific na modelo para sa mga medikal na gawain (arXiv:2404.18416, arXiv:2405.03162).
Aplikasyon at ecosystem
Malalim na iniintegrate ng Google ang Gemini sa mga consumer at developer na produkto nito.
Mga consumer na produkto
- Application ng Gemini: Chatbot (dating Bard, pinalitan ng pangalan noong 8 Pebrero 2024), na gumagamit ng mga modelo ng pamilya ng Gemini bilang universal na AI assistant. Sa Pebrero 2026 ay may mahigit 750 milyong aktibong gumagamit. Ang kasalukuyang rollout ay may kasamang modelo na 3.1 Pro. Mga subscription: Google AI Pro ($19.99/buwan, pumalit sa Google One AI Premium) at Google AI Ultra ($249.99/buwan, na may access sa Deep Think, Veo 3 at mga priority na tampok).
- Google Workspace: Integrasyon ng Gemini sa Gmail, Docs, Sheets, Meet para sa tulong sa pagsulat ng teksto, pagsusuri ng datos at pagbuo ng nilalaman (rebrand mula sa Duet AI).
- Google Search: Ang tampok na AI Overviews ay bumubuo ng mga buod na sagot sa mga kumplikadong query batay sa espesyalisadong modelo ng Gemini. Ang AI Mode, na inilunsad sa Google I/O 2025, ay nagbibigay ng malalim na paghahanap na may mga kakayahan ng ahente (pag-book, pamimili).
- Android at Pixel: Ang Gemini Nano (v3 sa Pixel 10 na may chip na Tensor G5, Agosto 2025) ay gumagana nang lokal sa mga smartphone, nagbibigay ng mga matalinong sagot, buod, pagtuklas ng mga mapanlinlang na tawag at accessibility, habang pinapanatili ang privacy ng datos. Ang ML Kit GenAI API para sa mga developer ay sumusuporta sa buod, pagwawasto at speech recognition sa device.
- NotebookLM: Lumago mula sa isang tool ng tala patungo sa isang ganap na creative platform. Naisama sa Google Workspace noong Marso 2025. Sumusuporta sa mga interactive na Audio Overview, Video Overview, Mind Map, slide, infographic. Na-update sa Gemini 3 noong Disyembre 2025; buong context window na 1 milyong token para sa chat — mula Pebrero 2026.
- Gemini Live: Ang mga tampok ng camera at screen sharing mula sa Project Astra ay naging libre para sa lahat ng gumagamit ng Android at iOS.
Mga platform para sa mga developer
- Google AI Studio at Gemini API: Mga pangunahing interface para sa pag-access sa mga modelo ng Gemini sa pamamagitan ng API. Sa Pebrero 2026 ay sumusuporta sa mga capability block: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
- Vertex AI: Corporate platform na may mga pinalawig na kakayahan sa seguridad at pamamahala.
- Google Gen AI SDK: Umabot sa GA para sa Python, JavaScript/TypeScript, Go at Java sa Mayo 2025, na nagbibigay ng unified na access sa Gemini Developer API at Vertex AI. Sumusuporta sa Model Context Protocol (MCP).
- Gemini CLI: Isang command-line tool para sa AI coding sa terminal (inilunsad noong Hunyo 2025).
- Interactions API: Unified na interface para sa mga modelo at ahente (beta mula Disyembre 2025).
Lifecycle ng API at pamamahala ng mga bersyon
Ang mga modelo ng Gemini sa API ay nahahati sa mga kategorya ng stable, preview, latest at experimental. Ang tiyak na model_id at pamilya ng mga modelo — ay hindi iisa; para sa mga production na senaryo, ang pagkakatali sa isang tiyak na bersyon at mga deadline ng suporta nito ay kritikal na mahalaga. Sa dokumentasyon ng API ay may rehistro ng mga deprecation na may mga petsa ng pagtatapos ng suporta.
Para sa suporta ng mga matagalang autonomous na gawain, ipinakilala ang: Session Resumption (pag-iimbak ng estado ng session sa server hanggang 24 na oras) at Context Compression (mekanismo ng sliding window para sa awtomatikong compression ng konteksto kapag nalampasan ang limitasyon).
Noong Disyembre 2025, binawasan ng Google ang mga quota ng libreng antas ng API ng humigit-kumulang 92% (nang walang paunang babala), na nagdulot ng matinding reaksyon ng komunidad ng mga developer. Samantala, ang gastos sa pagpapatakbo ng mga modelo ng Gemini ay bumaba ng 78% sa buong 2025 dahil sa mga pag-optimize.
Mga limitasyon at bukas na problema
- Mga hallucination at confabulation: Ang mga modelo ay nagpapanatili ng ugali na bumuo ng impormasyon na hindi tama sa katotohanan, lalo na kapag naka-off ang mga tampok ng grounding (Search Grounding). Ang Gemini 3.1 Pro ay nagpababa ng antas ng hallucination ayon sa benchmark na SimpleQA kumpara sa mga nakaraang bersyon, ngunit ang problema ay nananatiling systemic para sa lahat ng LLM.
- Subconscious Plagiarism: Sa mga eksperimento sa ahente na Aletheia, natukoy ang problema ng pagpapareplika ng mga non-trivial na patunay mula sa training sample, na ipinipresenta bilang autonomous na mga natuklasan, na nagpapalubha ng validation ng novelty ng AI research.
- Degradasyon sa mahabang konteksto: Kapag nagpoproseso ng mga konteksto na may laki na 1 milyong token, ang mga modelo ay naaapektuhan ng epekto ng «Lost in the Middle» — pagbaba ng katumpakan ng pagkuha ng mga katotohanan mula sa gitna ng dokumento.
- Mataas na gastos sa pagkalkula: Ang inference na may maximum na mga setting ng Deep Think ay nangangailangan ng mas malaking oras at mga mapagkukunan (TPU), na nagliligtas sa paggamit sa mga synchronous na real-time na application.
- Mga false positive na pagtanggi (Over-refusals): Dahil sa mahigpit na mga algorithm ng alignment, ang mga modelo para sa kumplikadong pangangatwiran ay may ugaling tanggihan ang mga lehitimong kahilingan, na maling ini-classify ang mga ito bilang potensyal na mapanganib (lalo na sa konteksto ng pagsusuri ng code at information security). Sa model card ay binabanggit din ang mga problema ng «preachy» (nagmamora) na tono ng mga pagtanggi.
- Mga limitasyon ng pangangatwiran: Ang mga model card ng 2.5- at 3-serye ay naglilista ng mga limitasyon sa causal understanding (causal understanding), kumplikadong logical deduction (complex logical deduction) at counterfactual reasoning (counterfactual reasoning), pati na rin ang hindi kumpletong predictability ng pagsunod sa mga budget ng pag-iisip.
Mga etikal na aspeto at seguridad
Ang pag-deploy ng mga modelo ng Gemini ay sinasamahan ng multi-level na sistema ng mga hakbang sa seguridad.
Mga pangkalahatang balangkas
Ang Secure AI Framework (SAIF) — ang pangkalahatang diskarte ng Google sa seguridad ng mga AI system (inihayag noong Hunyo 2023), na bumubuo ng konteksto ng pagpapaunlad, ngunit hindi isang Gemini-specific na pamantayan. Ang Frontier Safety Framework v3 (Setyembre 2025) ay sumasaklaw sa mga domain ng CBRN, cybersecurity, ML R&D, manipulative influence at eksperimental na diskarte sa mga panganib ng misalignment.
Mga hakbang na tiyak sa Gemini
- Mga model card — mga pangunahing pinagkukunan ng impormasyon tungkol sa mga limitasyon at seguridad ng mga tiyak na modelo. Naglalaman ng mga seksyon ng Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety. Kinumpirma ng model card ng Gemini 3 Pro na ang modelo ay hindi umabot sa anumang kritikal na antas ng kakayahan (Critical Capability Level) sa mga domain ng CBRN at cybersecurity.
- Pagsubok para sa bias at toxicity: Pagsusuri at pagpapagaan ng bias sa mga training data at pagbuo ng nilalaman.
- Mga red team (Red Teaming): Simulation ng mga pag-atake para matukoy ang mga kahinaan at hindi kanais-nais na pag-uugali. Ang independyenteng pagsubok para sa misalignment ay nagpakita ng «ilang pagtaas ng situational awareness», ngunit walang natuklasang kritikal na panganib.
Mga safety probe
Para mapigilan ang pagbuo ng mapanganib na nilalaman, ginagamit ang klasipikasyon ng mga nakatagong activation. Para malutas ang problema ng pagkawala ng signal sa mahahabang konteksto, ginagamit ang arkitektura ng MultiMax: ang probe ay nagtatanggal ng maximum na halaga sa lahat ng layer na para sa bawat token na sa sequence na :
Ang mga probe ay pinagsama sa mga base model sa mga cascaded classifier, na nagpapataas ng katumpakan ng filtering sa mababang gastos sa pagkalkula (arXiv:2601.11516).
Cryptographic na pagmamarka (SynthID)
Ang audio data na nabuo sa pamamagitan ng Live API, at mga larawan (mula sa mga modelo ng Nano Banana / Flash Image) ay dumadaan sa pagmamarka ng algorithm na SynthID. Ang isang hindi nakikitang watermark ay embedded sa antas ng pixel o audio spectrum, na nagbibigay ng machine recognition ng nabuong nilalaman. Ang modelo ng Nano Banana 2 (Pebrero 2026) ay nagintegrate ng SynthID na may metadata ng C2PA.
Thinking at ang tanong ng transparency
Ang mga modelo na may mode ng pag-iisip (2.5/3-serye) ay maaaring magbalik ng thought summaries — mga maikling buod ng mga panloob na pangangatwiran, at hindi ang buong stream ng mga intermediate na token. Nagbibigay ito ng tiyak na antas ng transparency, ngunit napipintasan dahil ang mga totoong «hilaw» na chain ng pangangatwiran ay natatagoan sa likod ng mga pinasimpleng buod.
Mga aspeto ng regulasyon
Sa loob ng balangkas ng Batas ng EU sa Artificial Intelligence (EU AI Act), nilagdaan ng Google ang Code of Practice ng EU sa AI (inilathala noong 10 Hulyo 2025) kasama ang OpenAI at Anthropic. Ang Gemini ay naiuri bilang isang modelo ng AI na pangkalahatang layunin (GPAI) na may systemic na panganib, na nagdudulot ng karagdagang mga obligasyon sa seguridad (may bisa mula 2 Agosto 2025).
Mapagkumpitensyang kapaligiran
Ang panahon ng Nobyembre — Disyembre 2025 ay naging pinaka-siksik na competitive cycle sa kasaysayan ng AI: ang Gemini 3 Pro (18 Nobyembre), Claude Opus 4.5 mula sa Anthropic (24 Nobyembre) at GPT-5.2 mula sa OpenAI (11 Disyembre) ay inilabas sa loob ng 24 na araw. Sa Pebrero 2026, walang modelo ang nangunguna sa lahat ng kategorya: Ang Gemini 3 Pro ang nangunguna sa LMArena sa teksto, bisyon, paghahanap at multilinguality; ang GPT-5.2 ang nangunguna sa purong matematika (100% AIME 2025 nang walang mga tool) at SWE-bench Pro; ang Claude Opus 4.5 ay nakikipagkumpitensya sa SWE-bench Verified. Sa halaga ng API, ang Gemini ay humigit-kumulang 42% na mas mura kaysa sa GPT-5 sa mga maihahambing na tawag.
Mga tagapagpahiwatig ng negosyo
Ayon sa datos ng ulat ng Alphabet para sa Q4 2025 (inilathala noong 4 Pebrero 2026): kita ng Google Cloud — $17.7 bilyon para sa quarter (+48% taon sa taon); operating margin — 29.9%; portfolio ng mga order ng Cloud — $240 bilyon (doble sa loob ng isang taon). Mahigit 120 000 na negosyo ang gumagamit ng Gemini. Noong Enero 2026, inihayag ng Apple ang mga plano para sa integrasyon ng Gemini sa Siri. Ang Google ay nagpoproseso ng mahigit 10 bilyong token bawat minuto sa pamamagitan ng API. Ang mga panloob na AI agent ng Google ay bumubuo ng humigit-kumulang 50% ng sariling code ng kumpanya. Ang mga kapital na gastos para sa 2026 ay nakatakda sa $175–185 bilyon (halos doble sa pagtaas kumpara sa $91.45 bilyon noong 2025).
Mga sanggunian
- Indeks ng mga modelo ng Google DeepMind
- Dokumentasyon ng Gemini API para sa mga developer
- Katalogo ng mga modelo ng Gemini API
- Dokumentasyon ng Gemini Thinking
- Rehistro ng mga deprecation ng mga modelo ng Gemini
- Indeks ng model card ng Google DeepMind
Literatura
Mga pangunahing technical report ng Gemini
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
- Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.
Mga espesyalisadong modelo at aplikasyon
- Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
- Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
- Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
- DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.
Literatura (mga pagrepaso at pamamaraan)
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
- Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
- Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.
Mga opisyal na blog post ng Google
- Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
- Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
- Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
- Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
- Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
- Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
- Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
- The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
- The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.