Gemini (Google) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Google Gemini — este o familie de modele lingvistice mari (LLM) multimodale, dezvoltată de divizia de cercetare Google DeepMind. Modelele Gemini, prezentate pentru prima dată în decembrie 2023, sunt construite pe arhitectura transformerului neuronal (Transformer) cu suport nativ pentru procesarea și generarea datelor din diverse modalități, inclusiv text, imagini, audio, video și cod sursă.

În ceea ce privește starea din februarie 2026, generația actuală este linia Gemini 3.x. Evoluția arhitecturii este orientată spre integrarea mecanismelor de scalare a inferenței (inference-time scaling) și optimizarea modelelor pentru utilizarea în cadrul sistemelor autonome agentice (Agentic AI). Aplicația Gemini numără peste 750 de milioane de utilizatori activi pe lună.

Denumire și filozofie

Numele "Gemini" (din latină — Gemeni) simbolizează unirea celor două grupuri de cercetare de vârf ale Google — Google Brain și DeepMind — pentru crearea acestui proiect. Jeff Dean, co-director tehnic al Google DeepMind, a confirmat acest lucru în blogul oficial (mai 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». Proiectul a avut inițial numele de cod «Titan»; denumirea «Gemini» a fost propusă de Dean în aprilie 2023 — în aceeași lună în care a avut loc fuziunea formală a Google Brain și DeepMind. Numele face referire și la programul spațial NASA «Gemini» (1965–1968), al cărui rol în pregătirea programului «Apollo» a rezonat cu echipa de dezvoltatori.

Caracteristica esențială și fundamentul filozofic al Gemini este multimodalitatea nativă. Spre deosebire de multe modele anterioare, unde capacitățile multimodale erau adăugate peste o bază textuală existentă, Gemini a fost proiectat de la zero pentru înțelegerea, operarea și combinarea simultană a diferitelor tipuri de informații. Raportul tehnic Gemini 1.0 (arXiv:2312.11805) confirmă că modelul a fost «trained jointly across image, audio, video, and text data». Aceasta permite modelului nu doar să transporte date între modalități, ci să formeze o înțelegere mai profundă și holistică a acestora.

Arhitectură și tehnologii cheie

Succesul și capacitățile modelelor Gemini sunt determinate de o serie de decizii arhitecturale fundamentale. Google nu publică designul complet la nivel scăzut al tuturor componentelor interne Gemini, însă sursele deschise permit stabilirea clasei arhitecturale: toate modelele din familia 1.5 și versiunile superioare sunt sparse mixture-of-experts transformer-based models cu suport multimodal nativ (confirmat de model card-ul Gemini 2.5 Flash).

Arhitectura multimodală nativă

Arhitectura Gemini se bazează pe conceptul fuziunii timpurii (early fusion). Patch-urile de pixeli din imagini, cadrele temporale ale videoclipurilor, audiogramele și token-urile de text sunt proiectate într-un spațiu latent unificat. Raportul tehnic Gemini 2.5 descrie această abordare ca «Unified Multimodal Token Interleaving». Deoarece toate token-urile din diferite modalități sunt procesate într-o secvență comună, mecanismele standard de auto-atenție (self-attention) asigură în mod natural integrarea încrucișată a datelor din modalități diferite la fiecare strat. Semnalele audio sunt procesate de codificatoare specializate direct din forma de undă audio (waveform), ceea ce păstrează caracteristicile acustice (intonație, timbru, zgomote de fundal) care se pierd la utilizarea sistemelor intermediare de transcriere Speech-to-Text.

Pentru clasa de transformere, operația de bază este mecanismul de atenție:

Attention(Q,K,V)=softmax(QKopdk)V

unde Q — matricea de interogări, K — a cheilor, V — a valorilor, iar dk — dimensiunea cheilor.

Mixture of Experts rarefiat (Sparse MoE)

Începând cu versiunea 1.5, modelele Gemini utilizează arhitectura Sparse Mixture-of-Experts (MoE). Gemini 1.0 folosea un transformer dens (dense); tranziția la MoE este descrisă direct în raportul tehnic 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».

În arhitectura MoE, straturile complet conectate standard (Feed-Forward Networks) sunt înlocuite cu un set de subrețele specializate — «experți». Pentru un token de intrare xd, ieșirea y este formată ca o sumă ponderată a ieșirilor k experților activi (kE, unde E — numărul total de experți):

y=i𝒯k(x)gi(x)Ei(x)

unde Ei(x) — funcția neliniară a expertului i, 𝒯k(x) — mulțimea indicilor k ai subrețelelor selectate, iar ponderea de rutare gi(x) este calculată de o funcție de rutare antrenată (learned routing function) cu aplicarea funcției Softmax peste cele mai mari k valori.

Această abordare permite creșterea semnificativă a capacității parametrice totale a modelului, menținând în același timp costurile computaționale (FLOPs) la un nivel scăzut, deoarece pentru fiecare token este activat doar un subset de parametri. Google nu a dezvăluit numărul real de parametri ai modelelor Gemini.

Context lung și «Învățare în context»

Gemini 1.5 a realizat un salt înainte, mărind dimensiunea ferestrei de context la 1 milion de token-uri în modul production (cu testare experimentală până la 10 milioane de token-uri). Aceasta este cu un ordin de mărime mai mult decât la modelele anterioare (de exemplu, GPT-4 Turbo cu 128 mii de token-uri). Google a raportat un rezultat de 99% la testul Needle In A Haystack la o lungime de context de 1 milion de token-uri. Pentru generațiile ulterioare, contextul lung s-a consolidat ca una dintre caracteristicile cheie ale liniei. Un astfel de context extins permite modelului să:

  • Analizeze cărți întregi, videoclipuri de mai multe ore (până la 3 ore) sau baze de cod mari în cadrul unei singure interogări.
  • Realizeze «învățare în context» (in-context learning) pe volume enorme de date furnizate în prompt, permițând obținerea de răspunsuri înalt personalizate fără necesitatea fine-tuning-ului.

«Modele gânditoare» și scalarea calculelor la inferență

Începând cu Gemini 2.5, Google prezintă thinking ca un mod separat de funcționare a modelelor. Documentația oficială îl definește ca un proces computațional intern care îmbunătățește planificarea și raționamentul în mai mulți pași. Modelele versiunii 2.5 (descrise ca «thinking models») sunt capabile să genereze și să evalueze intern pașii intermediari de raționament înainte de a oferi răspunsul final. Aceasta crește semnificativ precizia pe sarcini logice și matematice complexe.

Este important să se distingă două mecanisme:

  • Gândire încorporată (Thinking): Modul de bază pentru modelele din seria 2.5 și 3, care generează un lanț ascuns de raționament (Chain-of-Thought). API-ul poate returna thought summaries — rezumate scurte ale raționamentelor interne, nu întregul flux de «gânduri brute». Începând cu modelul 3.1 Pro, bugetul de gândire este reglat prin parametrul thinking_level cu valori de la Low la Max.
  • Deep Think: Un mod experimental extins de raționament separat, care utilizează generarea paralelă de ipoteze și necesită resurse computaționale semnificativ mai mari. A fost anunțat la Google I/O pe 20 mai 2025 și deschis pentru abonații AI Ultra pe 1 august 2025. Deep Think nu trebuie confundat cu mecanismul de bază thinking.

Capacități agentice (Agentic Capabilities)

Începând cu versiunea 2.0, Gemini poate interacționa cu lumea externă: apelează instrumente, efectuează căutări în Google, execută cod și gestionează elemente UI. Google a poziționat explicit Gemini 2.0 ca model pentru «noua eră agentică» (agentic era) cu suport nativ pentru tool use.

În februarie 2026, Gemini API include un strat de capacități agentice formal consolidat, cu suport pentru instrumentele: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, precum și Live API pentru interacțiune bidirecțională în timp real.

Evoluția modelelor Gemini

Familia Gemini evoluează într-un ritm extrem de rapid: în perioada decembrie 2023 — februarie 2026 au fost lansate patru generații principale de modele.

Gemini 1.0 (decembrie 2023)

Prima generație, care a pus bazele multimodalității native. Prezentată public pe 6 decembrie 2023.

  • Versiuni: Ultra (flagship pentru sarcinile cele mai complexe), Pro (model universal) și Nano (compact pentru dispozitive mobile; subdivizat în Nano-1 cu 1,8 miliarde de parametri și Nano-2 cu 3,25 miliarde).
  • Fereastra de context: 32 768 de token-uri pentru toate versiunile.
  • Realizări: Gemini 1.0 Ultra a devenit primul model care a atins și depășit nivelul expertului uman pe benchmark-ul MMLU cu un rezultat de 90,04% (utilizând tehnica CoT@32 — lanț de raționament cu 32 de eșantioane și vot majoritar; la prompting-ul standard 5-shot rezultatul a fost de aproximativ 83,7%). A înregistrat rezultate SOTA pe 30 din 32 de benchmark-uri academice.
  • Oprirea suportului: Gemini 1.0 Pro a fost declarat deprecat pe 18 februarie 2025.

Gemini 1.5 (februarie — mai 2024)

Salt înainte în lungimea contextului și eficiență.

  • Arhitectură: Tranziție de la transformerul dens la Mixture-of-Experts (MoE).
  • Fereastra de context: Până la 1 milion de token-uri în production (2 milioane — pe lista de așteptare pentru 1.5 Pro, anunțat în mai 2024 la Google I/O).
  • Versiuni: 1.5 Pro (anunțat în februarie 2024; cu calitate la nivelul 1.0 Ultra la costuri semnificativ mai mici) și 1.5 Flash (versiune ușoară și rapidă, adăugată în mai 2024).
  • Oprirea suportului: Toate modelele Gemini 1.5 (Pro, Flash, Flash-8B) au fost retrase din funcțiune pe 29 septembrie 2025.

Gemini 2.0 (decembrie 2024 — februarie 2025)

Tranziția la «era agentică».

  • Cronologie: 11 decembrie 2024 — anunțul 2.0 Flash Experimental (intrare multimodală, ieșire text); 5 februarie 2025 — disponibilitate generală (GA) pentru 2.0 Flash, lansarea 2.0 Pro Experimental și 2.0 Flash-Lite.
  • Inovații cheie: Capacități agentice încorporate (tool use), generare nativă de imagini și audio (inițial în mod limitat pentru partenerii early-access), orientare spre scenarii agentice.
  • Fereastra de context: Până la 2 milioane de token-uri (2.0 Pro); până la 1 milion de token-uri (2.0 Flash-Lite).
  • Oprirea suportului: Modelele 2.0 Flash și Flash-Lite sunt programate pentru retragere din funcțiune pe 1 iunie 2026.

Gemini 2.5 (martie — iunie 2025)

Primul «model gânditor» (thinking model) cu buget de raționament reglabil.

  • Cronologie: 25 martie 2025 — anunțul 2.5 Pro Experimental; 17 aprilie — 2.5 Flash (primul model de raționament hibrid complet cu mod de gândire comutabil); 20 mai (Google I/O) — actualizări 2.5 Pro și Flash, anunțul Deep Think; 17 iunie 2025 — GA simultană pentru 2.5 Pro și 2.5 Flash; în aceeași zi — previzualizarea 2.5 Flash-Lite (GA pe 22 iulie). 1 august — Deep Think deschis pentru abonații AI Ultra.
  • Inovații cheie: Mecanism de «gândire» (thinking) încorporat cu bugete reglabile; Deep Think ca mod extins separat. Rezultate SOTA pe benchmark-uri matematice, logice și de programare complexe (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% fără instrumente).
  • Fereastra de context: 1 milion de token-uri la intrare, până la 64 000 de token-uri la ieșire. Extinderea promisă la 2 milioane de token-uri pentru 2.5 Pro nu a fost confirmată ca implementată pe parcursul ciclului de viață al modelului.
  • Variante specializate: Gemini 2.5 Flash Image (numele de cod «Nano Banana», a apărut anonim pe Arena pe 12 august, lansat oficial pe 26 august 2025 — a devenit viral datorită «figurinelor 3D» fotorealiste, atrăgând 10 milioane de utilizatori noi); Computer Use Preview (7 octombrie 2025, bazat pe 2.5 Pro); modele Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS).
  • Raport tehnic: Raportul unificat Gemini 2.X publicat pe arXiv pe 7 iulie 2025 (arXiv:2507.06261), conține peste 3 300 de autori și acoperă modelele 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite.

Gemini 3.x (noiembrie 2025 — februarie 2026)

A treia generație a marcat tranziția de la generarea de bază la procese agentice de lungă durată (agentic workflows) și rezolvarea sarcinilor științifice interdisciplinare.

  • Gemini 3 Pro (18 noiembrie 2025): Anunțat de directorul general Alphabet Sundar Pichai și șeful DeepMind Demis Hassabis drept «cel mai inteligent model Google». Primul model Gemini implementat în Google Search în ziua lansării. A devenit primul model care a depășit pragul de 1500 Elo pe LMArena (1501 la momentul lansării). Rezultate: GPQA Diamond — 91,9%; SWE-bench Verified — 76,2%; Humanity's Last Exam — 37,5% (fără instrumente); SimpleQA — 72,1%.
  • Gemini 3 Flash (17 decembrie 2025): A devenit modelul implicit în aplicația Gemini. La prețul de $0,50 / 1M token-uri de intrare, a depășit 3 Pro pe SWE-bench Verified (78%) utilizând cu 30% mai puține token-uri pentru sarcini de raționament. GPQA Diamond — 90,4%; HLE — 33,7%.
  • Gemini 3.1 Pro (19 februarie 2026): Modelul flagship la data publicării. Prima lansare «incrementală» (.1 în loc de fostele .5). Rezultatul cheie — ARC-AGI-2: 77,1% (de mai mult de două ori mai mare față de 31,1% la 3 Pro). AIME 2025 — 91,2%; GPQA Diamond — 94,3%; SWE-bench Verified — 80,6%. A fost introdus un nou nivel de gândire MEDIUM prin parametrul thinking_level. Endpoint specializat gemini-3.1-pro-preview-customtools pentru lucrul cu terminalul bash și funcțiile utilizatorului. A fost rezolvată problema truncherii ieșirii la generări lungi. Canale: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM.
  • Gemini 3 Deep Think (actualizare 12 februarie 2026): Actualizare majoră a modului de «gândire» specializat. A depășit domeniul matematicii și programării: rezultate la nivelul medalielor de aur la olimpiadele internaționale de fizică (IPhO) și chimie (IChO) din 2025; ARC-AGI-2 — 84,6%; Humanity's Last Exam — 48,4%; CMT-Benchmark (fizica teoretică a materiei condensate) — 50,5%; Codeforces Elo — 3455. Pe baza Deep Think a fost creat agentul de cercetare Aletheia, care a rezolvat autonom mai multe probleme deschise din baza Erdős (inclusiv problema Erdős-1051).

Tabel rezumativ al generațiilor Gemini

Evoluția caracteristicilor cheie ale modelelor Gemini
Generație Anul lansării Versiuni cheie Fereastra de context maximă Inovații arhitecturale cheie și îmbunătățiri
Gemini 1.0 2023 Ultra, Pro, Nano 32 768 de token-uri Multimodalitate nativă de la zero; transformer dens; depășirea nivelului uman pe MMLU (90,04% CoT@32).
Gemini 1.5 2024 Pro, Flash 1 000 000 de token-uri (2 milioane pe lista de așteptare) Arhitectura Mixture-of-Experts (MoE); creștere revoluționară a contextului; 99% Needle In A Haystack.
Gemini 2.0 2024–2025 Pro, Flash, Flash-Lite 1 000 000 — 2 000 000 de token-uri Era «agentic AI»: integrare nativă a instrumentelor, generare de imagini și audio, Live API.
Gemini 2.5 2025 Pro, Flash, Flash-Lite 1 000 000 de token-uri (intrare), 64 000 (ieșire) «Model gânditor» (thinking); bugete de raționament reglabile; Deep Think; generare de imagini (Nano Banana); Computer Use.
Gemini 3.x 2025–2026 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think 1 000 000 de token-uri Agentic workflows; parametrul thinking_level; salt pe ARC-AGI-2 și olimpiadele științifice; Aletheia.

Rezultate cheie și benchmark-uri

Din cauza saturării benchmark-urilor clasice (precum MMLU), evaluarea performanței modelelor Gemini s-a deplasat spre sarcini de raționament abstract, modelare științifică și programare autonomă. Rezultatele sunt prezentate conform datelor oficiale Google (self-reported); compararea lor este corectă doar în cazul coinciderii modului de inferență, prezenței/absenței tool use, metodei de eșantionare (single-attempt vs. majority voting) și model-id-ului concret.

Rezultatele modelelor Gemini pe benchmark-urile cheie (date pentru februarie 2026)
Benchmark Descrierea sarcinii Gemini 2.5 Pro (iunie 2025) Gemini 3 Pro (nov. 2025) Gemini 3.1 Pro (feb. 2026) Gemini 3 Deep Think (feb. 2026)
MMLU Înțelegerea limbajului multisarcină
GPQA Diamond Întrebări științifice de nivel PhD 84,0% 91,9% 94,3% N/A
Humanity's Last Exam Cunoștințe de frontieră pe domenii 18,8% 37,5% 44,4% 48,4%
ARC-AGI-2 Puzzle-uri logice abstracte 4,9% 31,1% 77,1% 84,6%
SWE-bench Verified Rezolvarea autonomă a sarcinilor în repository-uri GitHub 63,8%* 76,2% 80,6% N/A
AIME 2025 Probleme matematice de nivel olimpic 86,7% 91,2%
Codeforces (Elo) Rating în programarea competițională 2887 3455

* Rezultatul 2.5 Pro pe SWE-bench a fost obținut cu custom agent setup.

Poziții pe LMArena (instantaneu sfârșitul lunii februarie 2026)

LMArena (anterior Chatbot Arena) — platformă independentă de vot orb în perechi. Ratingurile sunt recalculate dinamic; valorile de la momentul lansării modelului pot diferi de cele actuale.

Overall (instantaneu 24 februarie 2026)
Model Rating Loc Voturi Notă
Gemini 3.1 Pro Preview 1500 ± 9 #3 4 060 Preliminary
Gemini 3 Pro 1486 ± 4 #5 37 854
Gemini 3 Flash 1473 ± 5 #7 28 847
Gemini 2.5 Pro 1464 ± 3 #9 97 296
Gemini 2.5 Flash 1411 ± 3 #64 96 163

La lansarea din 18 noiembrie 2025, Gemini 3 Pro a atins ratingul de 1501 Elo, devenind primul model care a depășit pragul de 1500 pe LMArena.

Sisteme specializate și agentice

Ecosistemul Gemini este extins cu modele și platforme capabile să execute acțiuni cu mai mulți pași în mediul digital și fizic.

Agenți autonomi

  • Jules — agent autonom de codare, funcționând asincron în mașini virtuale cloud securizate. Creează branch-uri și pull request-uri în GitHub. A intrat în beta deschisă la Google I/O pe 20 mai 2025 (peste 140 000 de îmbunătățiri de cod pe perioada testării beta), GA — 6 august 2025. Până la sfârșitul anului 2025 a devenit unul dintre cei mai mari contribuitori la repository-urile interne ale Google.
  • Project Mariner — prototip de cercetare al unui agent de browser pentru sarcini web cu mai mulți pași. Mutat pe mașini virtuale cloud cu suport pentru până la 10 sarcini paralele și funcția «Teach & Repeat». A atins 83,5% pe benchmark-ul WebVoyager. Capacitățile Computer Use au fost transferate în Gemini API.
  • Google Antigravity — mediu integrat de dezvoltare (IDE) pentru gestionarea agenților AI, prezentat în noiembrie 2025. Agenții modifică autonom codul, interacționează cu terminalul și browserul încorporat, returnând artefacte verificabile (diff-uri de cod) pentru aprobare de către dezvoltator.
  • Agentul Aletheia — agent specializat de cercetare matematică bazat pe Gemini 3 Deep Think. Echipat cu un verificator în limbaj natural și instrumente de căutare web pentru verificarea literaturii. La începutul anului 2026 a rezolvat autonom mai multe probleme matematice deschise din baza Erdős și a co-semnat publicații științifice.

Agenți AI pentru consumatori

  • Phone Automations — integrarea agentului autonom la nivelul sistemului de operare Android (versiune beta pentru Pixel 10 și Samsung Galaxy S26). Funcționează într-un mediu sandbox securizat, capabil să navigheze prin aplicații terțe pe baza analizei vizuale a GUI.
  • Gemini in Chrome (Auto Browse) — agent de browser pentru automatizarea sarcinilor web cu mai mulți pași, disponibil tuturor utilizatorilor Chrome din septembrie 2025 (actualizat la Gemini 3 în ianuarie 2026).

Computer Use

Modelele Gemini 2.5 Computer Use sunt optimizate pentru controlul interfețelor grafice cu utilizatorul (UI). Sistemul primește la intrare capturi de ecran și istoricul acțiunilor, generând coordonate (x,y) pentru simularea programatică a cursorului și comenzi de introducere de la tastatură.

Gemini Robotics

Modele din clasa Vision-Language-Action (VLA) și Embodied Reasoning (ER) prezentate în martie 2025. Aceste arhitecturi procesează informații spațio-temporale și prezic traiectorii 3D ale mișcărilor manipulatoarelor robotice ca modalitate nativă de ieșire (arXiv:2503.20020).

Modele generative specializate (începutul anului 2026)

  • Nano Banana 2 (Gemini 3.1 Flash Image) — lansată pe 26 februarie 2026, model vizual care combină viteza arhitecturii Flash cu calitatea Pro. Asigură păstrarea strictă a identității personajelor (character consistency), generarea nativă a tipografiei în interiorul imaginilor și integrarea marcajelor criptografice SynthID cu metadate C2PA.
  • Lyria 3 — model muzical integrat în aplicația Gemini pe 18 februarie 2026. Generează compoziții muzicale de 30 de secunde (inclusiv vocal și instrumental) pe baza prompt-urilor text, fotografiilor sau videoclipurilor.
  • Veo 3.1 — model de generare video. Suportă crearea de clipuri utilizând până la trei imagini de referință («Ingredients to Video»), generarea de tranziții între primul și ultimul cadru specificate, redarea nativă a videoclipurilor verticale (9:16) și upscaling la rezoluție 4K.
  • Med-Gemini — model specific domeniului pentru sarcini medicale (arXiv:2404.18416, arXiv:2405.03162).

Aplicații și ecosistem

Google integrează profund Gemini în produsele sale pentru consumatori și dezvoltatori.

Produse pentru consumatori

  • Aplicația Gemini: Chatbot (anterior Bard, redenumit pe 8 februarie 2024), utilizând modelele familiei Gemini ca asistent AI universal. În februarie 2026 numără peste 750 de milioane de utilizatori activi. Rollout-ul actual include modelul 3.1 Pro. Abonamente: Google AI Pro ($19,99/lună, a înlocuit Google One AI Premium) și Google AI Ultra ($249,99/lună, cu acces la Deep Think, Veo 3 și funcții prioritare).
  • Google Workspace: Integrarea Gemini în Gmail, Docs, Sheets, Meet pentru asistență la redactarea textelor, analiza datelor și generarea de conținut (rebranding față de Duet AI).
  • Google Search: Funcția AI Overviews generează răspunsuri rezumative la interogări complexe pe baza unui model Gemini specializat. AI Mode, lansat la Google I/O 2025, oferă căutare aprofundată cu capacități agentice (rezervări, cumpărături).
  • Android și Pixel: Gemini Nano (v3 pe Pixel 10 cu cipul Tensor G5, august 2025) funcționează local pe smartphone-uri, oferind răspunsuri inteligente, rezumare, detectarea apelurilor frauduloase și accesibilitate, păstrând confidențialitatea datelor. ML Kit GenAI API pentru dezvoltatori suportă rezumarea, corectarea și recunoașterea vocală pe dispozitiv.
  • NotebookLM: A evoluat dintr-un instrument de notițe într-o platformă creativă completă. A intrat în portofoliul Google Workspace în martie 2025. Suportă Audio Overviews interactive, Video Overviews, hărți mentale, diapozitive, infografice. Actualizat la Gemini 3 în decembrie 2025; fereastra completă de context de 1 milion de token-uri pentru chat — din februarie 2026.
  • Gemini Live: Funcțiile de cameră și partajare a ecranului din Project Astra au devenit gratuite pentru toți utilizatorii Android și iOS.

Platforme pentru dezvoltatori

  • Google AI Studio și Gemini API: Interfețele principale pentru accesul la modelele Gemini prin API. În februarie 2026 suportă blocuri de capacități: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
  • Vertex AI: Platformă enterprise cu capacități extinse de securitate și guvernanță.
  • Google Gen AI SDK: A atins GA pentru Python, JavaScript/TypeScript, Go și Java până în mai 2025, oferind acces unificat la Gemini Developer API și Vertex AI. Suportă Model Context Protocol (MCP).
  • Gemini CLI: Instrument în linia de comandă pentru codarea cu AI în terminal (lansat în iunie 2025).
  • Interactions API: Interfață unificată pentru modele și agenți (beta din decembrie 2025).

Ciclul de viață al API și gestionarea versiunilor

Modelele Gemini din API sunt clasificate în categoriile stable, preview, latest și experimental. Un model_id concret și familia de modele nu sunt același lucru; pentru scenariile de producție, legarea la o versiune specifică și la termenele de suport ale acesteia este esențială. Documentația API menține un registru al deprecărilor cu datele de încetare a suportului.

Pentru suportul sarcinilor autonome de lungă durată au fost implementate: Session Resumption (stocarea stării sesiunii pe server până la 24 de ore) și Context Compression (mecanism de fereastră glisantă pentru comprimarea automată a contextului la depășirea limitei).

În decembrie 2025, Google a redus cotele nivelului gratuit al API cu aproximativ 92% (fără avertizare prealabilă), ceea ce a provocat o reacție puternică din partea comunității de dezvoltatori. În același timp, costul de servire a modelelor Gemini a scăzut cu 78% pe parcursul anului 2025 datorită optimizărilor.

Limitări și probleme deschise

  • Halucinații și confabulații: Modelele păstrează tendința de a genera informații factual incorecte, în special atunci când funcțiile de ancorare (Search Grounding) sunt dezactivate. Gemini 3.1 Pro a redus nivelul halucinațiilor conform benchmark-ului SimpleQA față de versiunile anterioare, însă problema rămâne sistemică pentru toate LLM-urile.
  • Plagiat subconștient (Subconscious Plagiarism): În experimentele cu agentul Aletheia a fost identificată problema reproducerii unor demonstrații netriviale din setul de antrenament, prezentate drept descoperiri autonome, ceea ce complică validarea noutății cercetărilor realizate de AI.
  • Degradarea în contextul lung: La procesarea contextelor de 1 milion de token-uri, modelele sunt supuse efectului «Lost in the Middle» — scăderea preciziei extragerii faptelor din mijlocul documentului.
  • Costuri computaționale ridicate: Inferența cu setările maxime Deep Think necesită semnificativ mai mult timp și resurse (TPU), ceea ce limitează utilizarea în aplicații sincrone în timp real.
  • Refuzuri fals pozitive (Over-refusals): Din cauza algoritmilor stricti de aliniere (alignment), modelele de raționament complex tind să respingă solicitări legitime, clasificându-le fals ca potențial periculoase (în special în contextul analizei de cod și securității informaționale). Model card-ul notează, de asemenea, probleme legate de tonul «moralizator» (preachy) al refuzurilor.
  • Limitări de raționament: Model card-urile seriei 2.5 și 3 enumeră limitări în înțelegerea cauzală (causal understanding), deducțiile logice complexe (complex logical deduction) și raționamentul contrafactual (counterfactual reasoning), precum și predictibilitatea incompletă a respectării bugetelor de gândire.

Aspecte etice și de securitate

Desfășurarea modelelor Gemini este însoțită de un sistem multinivelar de măsuri de securitate.

Cadre generale

Secure AI Framework (SAIF) — abordarea generală Google pentru securitatea sistemelor AI (anunțată în iunie 2023), formând contextul de dezvoltare, dar nefiind un standard specific Gemini. Frontier Safety Framework v3 (septembrie 2025) acoperă domeniile CBRN, securitate cibernetică, ML R&D, influență manipulativă și o abordare experimentală a riscurilor de desaliniere (misalignment).

Măsuri specifice Gemini

  • Model cards — sursele primare de informații despre limitările și securitatea modelelor specifice. Conțin secțiunile Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety. Model card-ul Gemini 3 Pro a confirmat că modelul nu a atins niciun nivel critic de capacități (Critical Capability Level) pe domeniile CBRN și securitate cibernetică.
  • Testarea pentru părtinire și toxicitate: Analiza și atenuarea părtinirilor în datele de antrenament și generarea de conținut.
  • Echipe roșii (Red Teaming): Simularea atacurilor pentru identificarea vulnerabilităților și comportamentului nedorit. Testarea independentă pentru desaliniere a identificat «o oarecare creștere a conștientizării situaționale», dar nu a descoperit riscuri critice.

Sonde de securitate (Safety Probes)

Pentru prevenirea generării de conținut dăunător se aplică clasificarea activărilor ascunse. Pentru rezolvarea problemei pierderii semnalului în contextele lungi se utilizează arhitectura MultiMax: sonda extrage valoarea maximă peste toate straturile H pentru fiecare token j din secvența ni:

fextMultiMax(Si)=h=1Hmaxj[ni][vhopyi,j]

Sondele sunt combinate cu modelele de bază în clasificatoare în cascadă, îmbunătățind precizia filtrării la costuri computaționale reduse (arXiv:2601.11516).

Marcare criptografică (SynthID)

Datele audio generate prin Live API și imaginile (de la modelele Nano Banana / Flash Image) sunt marcate prin algoritmul SynthID. Un filigran invizibil este incorporat la nivelul pixelilor sau al spectrului audio, asigurând recunoașterea automatizată a conținutului generat. Modelul Nano Banana 2 (februarie 2026) integrează SynthID cu metadate C2PA.

Thinking și problema transparenței

Modelele cu mod de gândire (seria 2.5/3) pot returna thought summaries — rezumate scurte ale raționamentelor interne, nu întregul flux de token-uri intermediare. Aceasta oferă un anumit nivel de transparență, însă este criticată pentru faptul că lanțurile de raționament «brute» reale sunt ascunse în spatele unor rezumate simplificate.

Aspecte de reglementare

În cadrul Actului UE privind inteligența artificială (EU AI Act), Google a semnat Codul de practici al UE privind AI (publicat pe 10 iulie 2025) alături de OpenAI și Anthropic. Gemini este clasificat ca model AI de uz general (GPAI) cu risc sistemic, ceea ce implică obligații suplimentare de securitate (în vigoare din 2 august 2025).

Mediul concurențial

Perioada noiembrie — decembrie 2025 a constituit cel mai dens ciclu concurențial din istoria AI: Gemini 3 Pro (18 noiembrie), Claude Opus 4.5 de la Anthropic (24 noiembrie) și GPT-5.2 de la OpenAI (11 decembrie) au fost lansate în decurs de 24 de zile. În februarie 2026, niciun model nu domină în toate categoriile: Gemini 3 Pro conduce pe LMArena la text, viziune, căutare și multilingvism; GPT-5.2 conduce la matematică pură (100% AIME 2025 fără instrumente) și SWE-bench Pro; Claude Opus 4.5 concurează pe SWE-bench Verified. La costul API, Gemini este cu aproximativ 42% mai ieftin decât GPT-5 la apeluri comparabile.

Indicatori de afaceri

Conform raportului financiar Alphabet pentru T4 2025 (publicat pe 4 februarie 2026): veniturile Google Cloud — $17,7 miliarde pentru trimestru (+48% față de anul anterior); marja operațională — 29,9%; portofoliul de comenzi Cloud — $240 miliarde (dublare într-un an). Peste 120 000 de întreprinderi utilizează Gemini. În ianuarie 2026, Apple a anunțat planuri de integrare a Gemini în Siri. Google procesează peste 10 miliarde de token-uri pe minut prin API. Agenții AI interni ai Google generează aproximativ 50% din codul propriu al companiei. Cheltuielile de capital pentru 2026 sunt planificate la nivelul de $175–185 miliarde (aproape dublul față de $91,45 miliarde în 2025).

Referințe

  • Indexul modelelor Google DeepMind
  • Documentația Gemini API pentru dezvoltatori
  • Catalogul modelelor Gemini API
  • Documentația Gemini Thinking
  • Registrul deprecărilor modelelor Gemini
  • Indexul model card-urilor Google DeepMind

Bibliografie

Rapoarte tehnice primare Gemini

  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
  • Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
  • Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.

Modele specializate și aplicații

  • Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
  • Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
  • Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  • Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
  • DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
  • Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.

Literatură (recenzii și metode)

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
  • Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
  • Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.

Postări oficiale pe blogul Google

  • Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
  • Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
  • Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
  • Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
  • Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
  • Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
  • Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
  • The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
  • The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.