Gemini (Google) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Google Gemini — een familie van multimodale grote taalmodellen (LLM), ontwikkeld door de onderzoeksafdeling Google DeepMind. De Gemini-modellen, voor het eerst gepresenteerd in december 2023, zijn gebouwd op de architectuur van neurale netwerk-transformers (Transformer) met native ondersteuning voor de verwerking en generatie van gegevens van verschillende modaliteiten, waaronder tekst, afbeeldingen, audio, video en programmacode.

Per februari 2026 is de actuele generatie de lijn Gemini 3.x. De ontwikkeling van de architectuur is gericht op de integratie van mechanismen voor schaalbare logische gevolgtrekking tijdens inferentie (inference-time scaling) en de optimalisatie van modellen voor gebruik binnen autonome agentsystemen (Agentic AI). De Gemini-applicatie telt meer dan 750 miljoen actieve gebruikers per maand.

Naam en filosofie

De naam "Gemini" (uit het Latijn — Tweelingen) symboliseert de samenvoeging van twee toonaangevende onderzoeksgroepen van Google — Google Brain en DeepMind — ten behoeve van dit project. Jeff Dean, co-technisch directeur van Google DeepMind, bevestigde dit in een officiële blogpost (mei 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». Het project had aanvankelijk de codenaam «Titan»; de naam «Gemini» werd in april 2023 door Dean voorgesteld — dezelfde maand waarin de formele fusie van Google Brain en DeepMind plaatsvond. De naam verwijst tevens naar het NASA-ruimteprogramma «Gemini» (1965–1968), waarvan de rol in de voorbereiding van het Apollo-programma weerklank vond bij het ontwikkelteam.

De belangrijkste eigenschap en filosofische basis van Gemini is native multimodaliteit. In tegenstelling tot veel eerdere modellen waarbij multimodale mogelijkheden bovenop een bestaande tekstuele basis werden toegevoegd, is Gemini vanaf de grond ontworpen voor het gelijktijdig begrijpen, verwerken en combineren van verschillende soorten informatie. Het technische rapport van Gemini 1.0 (arXiv:2312.11805) bevestigt dat het model «trained jointly across image, audio, video, and text data». Dit stelt het model in staat niet slechts gegevens tussen modaliteiten te vertalen, maar een dieper, holistisch begrip ervan te vormen.

Architectuur en sleuteltechnologieën

Het succes en de mogelijkheden van de Gemini-modellen worden bepaald door een aantal fundamentele architectuurkeuzes. Google publiceert niet het volledige laagniveau-ontwerp van alle interne componenten van Gemini, maar uit openbare bronnen valt de klasse van de architectuur vast te stellen: alle modellen van de familie 1.5 en hoger zijn sparse mixture-of-experts transformer-based models met native multimodale ondersteuning (bevestigd door de model card van Gemini 2.5 Flash).

Native multimodale architectuur

De architectuur van Gemini is gebaseerd op het concept van vroege fusie (early fusion). Pixelpatches van afbeeldingen, tijdelijke frames van video, audiogrammen en teksttokens worden geprojecteerd in één gezamenlijke latente ruimte. Het technische rapport van Gemini 2.5 beschrijft deze aanpak als «Unified Multimodal Token Interleaving». Omdat alle tokens van verschillende modaliteiten in een gemeenschappelijke reeks worden verwerkt, zorgen de standaard self-attention-mechanismen van nature voor kruislingse integratie van gegevens uit verschillende modaliteiten in elke laag. Geluidssignalen worden verwerkt door gespecialiseerde encoders rechtstreeks vanuit de audiogolf (waveform), waardoor akoestische kenmerken (intonatie, timbre, achtergrondgeluiden) behouden blijven die verloren gaan bij gebruik van tussenliggende Speech-to-Text-transcriptiesystemen.

Voor de transformer-klasse is het aandachtsmechanisme de basisoperatie:

Attention(Q,K,V)=softmax(QKopdk)V

waar Q de querymatrix is, K de sleutelmatrix, V de waardematrix, en dk de dimensie van de sleutels.

Schaarse mengsel van experts (Sparse MoE)

Vanaf versie 1.5 maken de Gemini-modellen gebruik van de Sparse Mixture-of-Experts (MoE)-architectuur. Gemini 1.0 gebruikte een dense transformer; de overgang naar MoE wordt rechtstreeks beschreven in het technische rapport van 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».

In de MoE-architectuur worden de standaard volledig verbonden lagen (Feed-Forward Networks) vervangen door een set gespecialiseerde subnetwerken — «experts». Voor een inkomend token xd wordt de uitvoer y gevormd als een gewogen som van de uitvoer k van actieve experts (kE, waarbij E het totale aantal experts is):

y=i𝒯k(x)gi(x)Ei(x)

waar Ei(x) de niet-lineaire functie is van de i-de expert, 𝒯k(x) de verzameling indices k van de geselecteerde subnetwerken, en het routeringsgewicht gi(x) wordt berekend door een aangeleerde routeringsfunctie (learned routing function) met toepassing van de Softmax-functie over de k grootste waarden.

Deze aanpak maakt het mogelijk de totale parametrische capaciteit van het model aanzienlijk te vergroten, terwijl de rekenkosten (FLOPs) laag blijven, omdat voor elk token slechts een deelverzameling van de parameters wordt geactiveerd. Google heeft het werkelijke aantal parameters van de Gemini-modellen niet vrijgegeven.

Lange context en «In-context leren»

Gemini 1.5 realiseerde een doorbraak door het contextvenster te vergroten tot 1 miljoen tokens in productiemodus (met experimentele tests tot 10 miljoen tokens). Dit is een orde van grootte meer dan bij eerdere modellen (bijvoorbeeld GPT-4 Turbo met 128 duizend tokens). Google meldde een resultaat van 99% op de Needle In A Haystack-test bij een contextlengte van 1 miljoen tokens. Voor latere generaties is lange context een van de belangrijkste kenmerken van de lijn geworden. Een dergelijke omvangrijke context stelt het model in staat om:

  • Volledige boeken, meerdere uren durende video's (tot 3 uur) of grote codebases binnen één verzoek te analyseren.
  • «In-context leren» (in-context learning) uit te voeren op enorme hoeveelheden gegevens die in de prompt worden aangeboden, waardoor sterk gepersonaliseerde antwoorden kunnen worden verkregen zonder de noodzaak van fine-tuning.

«Denkende modellen» en schaling van berekeningen tijdens inferentie

Vanaf Gemini 2.5 onderscheidt Google thinking als een afzonderlijke werkmodus van de modellen. De officiële documentatie omschrijft dit als een intern rekenproces dat meerstappe planning en redenering verbetert. Modellen van versie 2.5 (beschreven als «thinking models») zijn in staat intern tussenliggende redeneringsstappen te genereren en te beoordelen voordat ze een definitief antwoord geven. Dit verhoogt de nauwkeurigheid op complexe logische en wiskundige taken aanzienlijk.

Het is belangrijk twee mechanismen te onderscheiden:

  • Ingebouwd denken (Thinking): De basismodus voor de 2.5- en 3-serie modellen, die een verborgen Chain-of-Thought genereert. De API kan thought summaries retourneren — beknopte samenvattingen van interne redeneringen, niet de volledige stroom van «ruwe gedachten». Vanaf model 3.1 Pro wordt het denkbudget geregeld via de parameter thinking_level met waarden van Low tot Max.
  • Deep Think: Een afzonderlijke experimentele uitgebreide redeneermodus, die gebruik maakt van parallelle hypothesegeneratie en aanzienlijk meer rekenkracht vereist. Aangekondigd op Google I/O op 20 mei 2025 en beschikbaar gesteld voor abonnees van AI Ultra op 1 augustus 2025. Deep Think mag niet worden gelijkgesteld aan het basismechanisme van thinking.

Agentmogelijkheden (Agentic Capabilities)

Vanaf versie 2.0 kan Gemini interageren met de buitenwereld: tools aanroepen, zoeken in Google, code uitvoeren en UI-elementen beheren. Google positioneerde Gemini 2.0 expliciet als een model voor een «nieuw agentijdperk» (agentic era) met native ondersteuning van tool use.

Per februari 2026 bevat de Gemini API een formeel vastgelegd laag van agentmogelijkheden met ondersteuning voor de volgende tools: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, en Live API voor tweerichtingsinteractie in realtime.

Evolutie van de Gemini-modellen

De Gemini-familie ontwikkelt zich in een buitengewoon snel tempo: in de periode van december 2023 tot februari 2026 werden vier hoofdgeneraties van modellen uitgebracht.

Gemini 1.0 (december 2023)

De eerste generatie, die de basis legde voor native multimodaliteit. Publiekelijk gepresenteerd op 6 december 2023.

  • Versies: Ultra (vlaggenschip voor de meest complexe taken), Pro (universeel model) en Nano (compact voor mobiele apparaten; onderverdeeld in Nano-1 met 1,8 miljard parameters en Nano-2 met 3,25 miljard).
  • Contextvenster: 32 768 tokens voor alle versies.
  • Prestaties: Gemini 1.0 Ultra was het eerste model dat het expertniveau van mensen op de MMLU-benchmark behaalde en overtrof, met een score van 90,04% (met de CoT@32-techniek — een Chain-of-Thought met 32 steekproeven en meerderheidsstemming; bij standaard 5-shot prompting bedroeg het resultaat ongeveer 83,7%). Behaalde SOTA-resultaten op 30 van 32 academische benchmarks.
  • Einde ondersteuning: Gemini 1.0 Pro werd op 18 februari 2025 verouderd verklaard.

Gemini 1.5 (februari — mei 2024)

Doorbraak in contextlengte en efficiëntie.

  • Architectuur: Overgang van een dense transformer naar Mixture-of-Experts (MoE).
  • Contextvenster: Tot 1 miljoen tokens in productie (2 miljoen via waitlist voor 1.5 Pro, aangekondigd in mei 2024 op Google I/O).
  • Versies: 1.5 Pro (aangekondigd in februari 2024; met kwaliteit op het niveau van 1.0 Ultra tegen aanzienlijk lagere kosten) en 1.5 Flash (een lichtgewicht en snelle versie, toegevoegd in mei 2024).
  • Einde ondersteuning: Alle Gemini 1.5-modellen (Pro, Flash, Flash-8B) werden op 29 september 2025 uit gebruik genomen.

Gemini 2.0 (december 2024 — februari 2025)

Overgang naar het «agentijdperk».

  • Tijdlijn: 11 december 2024 — aankondiging van 2.0 Flash Experimental (multimodale invoer, tekstuitvoer); 5 februari 2025 — brede beschikbaarheid (GA) van 2.0 Flash, release van 2.0 Pro Experimental en 2.0 Flash-Lite.
  • Belangrijkste innovaties: Ingebouwde agentmogelijkheden (tool use), native generatie van afbeeldingen en audio (aanvankelijk in beperkte modus voor early-access partners), focus op agentscenario's.
  • Contextvenster: Tot 2 miljoen tokens (2.0 Pro); tot 1 miljoen tokens (2.0 Flash-Lite).
  • Einde ondersteuning: De modellen 2.0 Flash en Flash-Lite zijn gepland voor uitfasering op 1 juni 2026.

Gemini 2.5 (maart — juni 2025)

Het eerste «denkende model» (thinking model) met instelbaar redeneerbudget.

  • Tijdlijn: 25 maart 2025 — aankondiging van 2.5 Pro Experimental; 17 april — 2.5 Flash (het eerste volledig hybride reasoning-model met schakelbare denkmodus); 20 mei (Google I/O) — updates van 2.5 Pro en Flash, aankondiging van Deep Think; 17 juni 2025 — gelijktijdige GA voor 2.5 Pro en 2.5 Flash; op dezelfde dag een preview van 2.5 Flash-Lite (GA op 22 juli). 1 augustus — Deep Think beschikbaar gesteld voor abonnees van AI Ultra.
  • Belangrijkste innovaties: Ingebouwd «denk»-mechanisme (thinking) met instelbare budgetten; Deep Think als afzonderlijke uitgebreide modus. SOTA-resultaten op complexe wiskundige, logische en programmeer-benchmarks (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% zonder tools).
  • Contextvenster: 1 miljoen tokens invoer, tot 64 000 tokens uitvoer. De beloofde uitbreiding tot 2 miljoen tokens voor 2.5 Pro werd gedurende de levenscyclus van het model niet bevestigd als gerealiseerd.
  • Gespecialiseerde varianten: Gemini 2.5 Flash Image (codenaam «Nano Banana», anoniem verschenen op Arena op 12 augustus, officieel uitgebracht op 26 augustus 2025 — werd viraal dankzij fotorealistische «3D-figuurtjes», trok 10 miljoen nieuwe gebruikers aan); Computer Use Preview (7 oktober 2025, gebaseerd op 2.5 Pro); Text-to-Speech-modellen (2.5 Flash TTS, 2.5 Pro TTS).
  • Technisch rapport: Het gecombineerde rapport Gemini 2.X werd gepubliceerd op arXiv op 7 juli 2025 (arXiv:2507.06261), bevat meer dan 3 300 auteurs en behandelt de modellen 2.5 Pro, 2.5 Flash, 2.0 Flash en 2.0 Flash-Lite.

Gemini 3.x (november 2025 — februari 2026)

De derde generatie markeerde de overgang van basale generatie naar langdurige agentworkflows (agentic workflows) en de oplossing van interdisciplinaire wetenschappelijke vraagstukken.

  • Gemini 3 Pro (18 november 2025): Aangekondigd door Alphabet-CEO Sundar Pichai en DeepMind-directeur Demis Hassabis als «het meest intelligente model van Google». Het eerste Gemini-model dat op de dag van lancering werd ingezet in Google Search. Het eerste model dat de grens van 1500 Elo op LMArena doorbrak (1501 op het moment van lancering). Resultaten: GPQA Diamond — 91,9%; SWE-bench Verified — 76,2%; Humanity's Last Exam — 37,5% (zonder tools); SimpleQA — 72,1%.
  • Gemini 3 Flash (17 december 2025): Werd het standaardmodel in de Gemini-applicatie. Met een prijs van $0,50 / 1M invoertokens overtrof het 3 Pro op SWE-bench Verified (78%) terwijl het 30% minder tokens gebruikte voor redeneertaken. GPQA Diamond — 90,4%; HLE — 33,7%.
  • Gemini 3.1 Pro (19 februari 2026): Het vlaggenschipmodel op de publicatiedatum. De eerste «incrementele» release (.1 in plaats van de vroegere .5). Belangrijkste resultaat — ARC-AGI-2: 77,1% (meer dan twee keer zo hoog als de 31,1% van 3 Pro). AIME 2025 — 91,2%; GPQA Diamond — 94,3%; SWE-bench Verified — 80,6%. Een nieuw denkniveau MEDIUM ingevoerd via de parameter thinking_level. Gespecialiseerd eindpunt gemini-3.1-pro-preview-customtools voor gebruik met bash-terminal en gebruikersfuncties. Het afkapprobleem bij uitvoer bij lange generaties is verholpen. Kanalen: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM.
  • Gemini 3 Deep Think (update 12 februari 2026): Een grote update van de gespecialiseerde «denkende» modus. Ging verder dan wiskunde en programmeren: resultaten op het niveau van gouden medailles op de internationale olympiades voor natuurkunde (IPhO) en scheikunde (IChO) 2025; ARC-AGI-2 — 84,6%; Humanity's Last Exam — 48,4%; CMT-Benchmark (theoretische vastestoffysica) — 50,5%; Codeforces Elo — 3455. Op basis van Deep Think is de onderzoeksagent Aletheia ontwikkeld, die autonoom meerdere open vraagstukken uit de Erdős-database heeft opgelost (waaronder het probleem Erdős-1051).

Overzichtstabel van Gemini-generaties

Evolutie van de belangrijkste kenmerken van de Gemini-modellen
Generatie Uitjaar Belangrijkste versies Max. contextvenster Belangrijkste architecturele innovaties en verbeteringen
Gemini 1.0 2023 Ultra, Pro, Nano 32 768 tokens Native multimodaliteit vanaf de grond; dense transformer; overtreffen van menselijk expertniveau op MMLU (90,04% CoT@32).
Gemini 1.5 2024 Pro, Flash 1 000 000 tokens (2 mln via waitlist) Mixture-of-Experts (MoE)-architectuur; revolutionaire contextvergroting; 99% Needle In A Haystack.
Gemini 2.0 2024–2025 Pro, Flash, Flash-Lite 1 000 000 — 2 000 000 tokens Het tijdperk van «agentic AI»: native tool-integratie, generatie van afbeeldingen en audio, Live API.
Gemini 2.5 2025 Pro, Flash, Flash-Lite 1 000 000 tokens (invoer), 64 000 (uitvoer) «Denkend model» (thinking); instelbare redeneerbudgetten; Deep Think; beeldgeneratie (Nano Banana); Computer Use.
Gemini 3.x 2025–2026 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think 1 000 000 tokens Agentworkflows; parameter thinking_level; doorbraak op ARC-AGI-2 en wetenschappelijke olympiades; Aletheia.

Belangrijkste resultaten en benchmarks

Vanwege de verzadiging van klassieke benchmarks (zoals MMLU) is de prestatiebeoordeling van Gemini-modellen verschoven naar taken met betrekking tot abstract redeneren, wetenschappelijke modellering en autonoom programmeren. Resultaten zijn afkomstig van officiële Google-gegevens (self-reported); vergelijking is alleen geldig bij overeenkomst van inferentiemodus, aan- of afwezigheid van tool use, steekproefmethode (single-attempt vs. majority voting) en specifieke model-id.

Resultaten van Gemini-modellen op belangrijkste benchmarks (gegevens van februari 2026)
Benchmark Beschrijving van de taak Gemini 2.5 Pro (juni 2025) Gemini 3 Pro (nov. 2025) Gemini 3.1 Pro (feb. 2026) Gemini 3 Deep Think (feb. 2026)
MMLU Multitaak taalbegrip
GPQA Diamond Wetenschappelijke vragen op PhD-niveau 84,0% 91,9% 94,3% N.v.t.
Humanity's Last Exam Grensgebied vakkennis 18,8% 37,5% 44,4% 48,4%
ARC-AGI-2 Abstracte logische puzzels 4,9% 31,1% 77,1% 84,6%
SWE-bench Verified Autonoom oplossen van taken in GitHub-repositories 63,8%* 76,2% 80,6% N.v.t.
AIME 2025 Wiskundige olympiadetaken 86,7% 91,2%
Codeforces (Elo) Ranglijst in competitief programmeren 2887 3455

* Het resultaat van 2.5 Pro op SWE-bench is behaald met een aangepaste agentopstelling (custom agent setup).

Posities op LMArena (peildatum eind februari 2026)

LMArena (voorheen Chatbot Arena) is een onafhankelijk platform voor blinde paarsgewijze stemming. Ranglijsten worden dynamisch herberekend; waarden op het moment van modellanciering kunnen afwijken van de actuele waarden.

Overall (peildatum 24 februari 2026)
Model Beoordeling Positie Stemmen Opmerking
Gemini 3.1 Pro Preview 1500 ± 9 #3 4 060 Preliminary
Gemini 3 Pro 1486 ± 4 #5 37 854
Gemini 3 Flash 1473 ± 5 #7 28 847
Gemini 2.5 Pro 1464 ± 3 #9 97 296
Gemini 2.5 Flash 1411 ± 3 #64 96 163

Bij de lancering op 18 november 2025 bereikte Gemini 3 Pro een beoordeling van 1501 Elo, waarmee het het eerste model was dat de grens van 1500 op LMArena doorbrak.

Gespecialiseerde en agentsystemen

Het Gemini-ecosysteem is uitgebreid met modellen en platforms die in staat zijn meerstapsacties uit te voeren in digitale en fysieke omgevingen.

Autonome agenten

  • Jules — een autonome coderingagent die asynchroon werkt in beveiligde virtuele cloudmachines. Maakt branches en pull-requests aan in GitHub. Ging open bèta op Google I/O op 20 mei 2025 (meer dan 140 000 codeverbeteringen tijdens de bètatestperiode), GA — 6 augustus 2025. Tegen eind 2025 werd het een van de grootste bijdragers aan interne Google-repositories.
  • Project Mariner — een onderzoeksprototype van een browseragent voor meerstapstaakwerkzaamheden op het web. Verplaatst naar virtuele cloudmachines met ondersteuning voor maximaal 10 parallelle taken en een functie «Teach & Repeat». Behaalde 83,5% op de WebVoyager-benchmark. De Computer Use-mogelijkheden zijn overgezet naar de Gemini API.
  • Google Antigravity — in november 2025 gepresenteerde geïntegreerde ontwikkelomgeving (IDE) voor het beheren van AI-agenten. Agenten passen code autonoom aan, communiceren met de terminal en de ingebouwde browser, en leveren verifieerbare artefacten (codediffs) ter goedkeuring aan de ontwikkelaar.
  • Agent Aletheia — een gespecialiseerde wiskundige onderzoeksagent op basis van Gemini 3 Deep Think. Uitgerust met een verificator voor natuurlijke taal en webzoektools voor literatuuronderzoek. Begin 2026 loste het autonoom meerdere open wiskundige vraagstukken uit de Erdős-database op en trad het op als medeauteur van wetenschappelijke publicaties.

Consumentgerichte AI-agenten

  • Phone Automations — integratie van een autonome agent op het niveau van het Android-besturingssysteem (bètaversie voor Pixel 10 en Samsung Galaxy S26). Functioneert in een beveiligde geïsoleerde omgeving (secure sandbox) en is in staat door externe applicaties te navigeren op basis van visuele GUI-analyse.
  • Gemini in Chrome (Auto Browse) — een browseragent voor automatisering van meerstapstaken op het web, beschikbaar voor alle Chrome-gebruikers vanaf september 2025 (bijgewerkt naar Gemini 3 in januari 2026).

Computer Use

De Gemini 2.5 Computer Use-modellen zijn geoptimaliseerd voor het bedienen van grafische gebruikersinterfaces (UI). Het systeem neemt schermafbeeldingen en actiegeschiedenis als invoer en genereert coördinaten (x,y) voor programmatische cursorbesturing en toetsenbordinvoeroprachten.

Gemini Robotics

In maart 2025 gepresenteerde modellen van de klasse Vision-Language-Action (VLA) en Embodied Reasoning (ER). Deze architecturen verwerken ruimtelijk-temporele informatie en voorspellen 3D-bewegingsbanen van robotmanipulatoren als native uitvoermodaliteit (arXiv:2503.20020).

Gespecialiseerde generatieve modellen (begin 2026)

  • Nano Banana 2 (Gemini 3.1 Flash Image) — uitgebracht op 26 februari 2026, een visueel model dat de snelheid van de Flash-architectuur combineert met de kwaliteit van Pro. Biedt strikte bewaring van karakteridentiteit (character consistency), native generatie van typografie binnen afbeeldingen en integratie van cryptografische watermerken SynthID met C2PA-metadata.
  • Lyria 3 — een muziekmodel, geïntegreerd in de Gemini-applicatie op 18 februari 2026. Genereert 30 seconden durende muziekcomposities (inclusief vocaal en instrumentaal) op basis van tekstprompts, foto's of video.
  • Veo 3.1 — een videogeneratiemodel. Ondersteunt het maken van clips met gebruik van maximaal drie referentieafbeeldingen («Ingredients to Video»), het genereren van overgangen tussen opgegeven eerste en laatste frames, native rendering van verticale video's (9:16) en upscaling naar 4K-resolutie.
  • Med-Gemini — een domeinspecifiek model voor medische toepassingen (arXiv:2404.18416, arXiv:2405.03162).

Toepassingen en ecosysteem

Google integreert Gemini diepgaand in zijn consumenten- en ontwikkelaarproducten.

Consumentenproducten

  • Gemini-applicatie: Een chatbot (voorheen Bard, hernoemd op 8 februari 2024), die gebruikmaakt van de Gemini-modellfamilie als universele AI-assistent. Per februari 2026 telt het meer dan 750 miljoen actieve gebruikers. De actuele uitrol omvat het model 3.1 Pro. Abonnementen: Google AI Pro ($19,99/mnd., vervangt Google One AI Premium) en Google AI Ultra ($249,99/mnd., met toegang tot Deep Think, Veo 3 en prioriteitsfuncties).
  • Google Workspace: Integratie van Gemini in Gmail, Docs, Sheets, Meet voor hulp bij het schrijven van teksten, gegevensanalyse en contentgeneratie (rebranding van Duet AI).
  • Google Zoeken: De functie AI Overviews genereert samengevatte antwoorden op complexe zoekopdrachten op basis van een gespecialiseerd Gemini-model. AI Mode, gelanceerd op Google I/O 2025, biedt diepgaand zoeken met agentmogelijkheden (reserveringen, aankopen).
  • Android en Pixel: Gemini Nano (v3 op Pixel 10 met Tensor G5-chip, augustus 2025) werkt lokaal op smartphones en biedt slimme antwoorden, samenvatting, detectie van frauduleuze telefoongesprekken en toegankelijkheidsfuncties, terwijl de privacy van gegevens wordt gewaarborgd. ML Kit GenAI API voor ontwikkelaars ondersteunt samenvatting, proeflezen en spraakherkenning op het apparaat.
  • NotebookLM: Geëvolueerd van een notitietool naar een volwaardig creatief platform. Opgenomen in Google Workspace in maart 2025. Ondersteunt interactieve Audio Overviews, Video Overviews, Mind Maps, dia's en infographics. Bijgewerkt naar Gemini 3 in december 2025; volledig contextvenster van 1 miljoen tokens voor chat — vanaf februari 2026.
  • Gemini Live: Camera- en schermdeelingsfuncties uit Project Astra zijn gratis beschikbaar gesteld voor alle Android- en iOS-gebruikers.

Ontwikkelaarsplatforms

  • Google AI Studio en Gemini API: De primaire interfaces voor toegang tot de Gemini-modellen via API. Per februari 2026 worden de volgende capability-blokken ondersteund: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
  • Vertex AI: Een zakelijk platform met uitgebreide beveiligings- en beheermogelijkheden.
  • Google Gen AI SDK: Bereikte GA voor Python, JavaScript/TypeScript, Go en Java in mei 2025, en biedt uniforme toegang tot de Gemini Developer API en Vertex AI. Ondersteunt het Model Context Protocol (MCP).
  • Gemini CLI: Een opdrachtregeltool voor AI-codering in de terminal (gelanceerd in juni 2025).
  • Interactions API: Een uniforme interface voor modellen en agenten (bèta vanaf december 2025).

Levenscyclus van de API en versiebeheer

Gemini-modellen in de API worden onderverdeeld in de categorieën stable, preview, latest en experimental. De specifieke model_id en de modelfamilie zijn niet hetzelfde; voor productiescenario's is het van cruciaal belang om te verwijzen naar een specifieke versie en de bijbehorende ondersteuningsdatums. In de API-documentatie wordt een depreciatie-register bijgehouden met vermelding van de datums van het einde van de ondersteuning.

Ter ondersteuning van langdurige autonome taken zijn de volgende functies geïmplementeerd: Session Resumption (opslag van de sessiestatus op de server tot 24 uur) en Context Compression (een sliding window-mechanisme voor automatische compressie van de context wanneer de limiet wordt overschreden).

In december 2025 verlaagde Google de gratis API-quota met circa 92% (zonder voorafgaande waarschuwing), wat een scherpe reactie veroorzaakte in de ontwikkelaarsgemeenschap. Tegelijkertijd daalden de kosten voor het hosten van Gemini-modellen in 2025 met 78% dankzij optimalisaties.

Beperkingen en openstaande problemen

  • Hallucinaties en confabulaties: De modellen blijven geneigd feitelijk onjuiste informatie te genereren, met name wanneer gronderingsfuncties (Search Grounding) zijn uitgeschakeld. Gemini 3.1 Pro heeft het hallucinatieniveau op de SimpleQA-benchmark verlaagd ten opzichte van eerdere versies, maar het probleem blijft systemisch voor alle LLM's.
  • Onbewust plagiaat (Subconscious Plagiarism): In experimenten met de Aletheia-agent is het probleem vastgesteld van reproductie van niet-triviale bewijzen uit de trainingsset, die worden gepresenteerd als autonome ontdekkingen, wat de validatie van de nieuwheid van AI-onderzoek bemoeilijkt.
  • Degradatie in lange context: Bij het verwerken van contexten met een omvang van 1 miljoen tokens zijn de modellen onderhevig aan het «Lost in the Middle»-effect — een verminderde nauwkeurigheid bij het ophalen van feiten uit het midden van een document.
  • Hoge rekenkosten: Inferentie met maximale Deep Think-instellingen vereist aanzienlijk meer tijd en bronnen (TPU's), wat het gebruik in synchrone realtime-applicaties beperkt.
  • Fout-positieve weigeringen (Over-refusals): Door strikte alignment-algoritmen neigen redeneermodellen ertoe legitieme verzoeken af te wijzen door ze ten onrechte te classificeren als potentieel gevaarlijk (met name in de context van code-analyse en informatiebeveiliging). In de model card worden ook problemen gemeld met een «moraliserend» (preachy) toon bij weigeringen.
  • Beperkingen in redeneren: De model cards van de 2.5- en 3-serie vermelden beperkingen in causaal begrip (causal understanding), complexe logische deductie (complex logical deduction) en contrafeitelijk redeneren (counterfactual reasoning), evenals een onvolledige voorspelbaarheid van de naleving van denkbudgetten.

Ethische aspecten en veiligheid

De inzet van Gemini-modellen gaat gepaard met een meerlaags systeem van veiligheidsmaatregelen.

Algemene kaders

Secure AI Framework (SAIF) — de algemene Google-benadering van de beveiliging van AI-systemen (aangekondigd in juni 2023), die de context van ontwikkeling bepaalt maar geen Gemini-specifieke standaard is. Frontier Safety Framework v3 (september 2025) bestrijkt de domeinen CBRN, cyberbeveiliging, ML R&D, manipulatieve beïnvloeding en een experimentele benadering van misalignment-risico's.

Gemini-specifieke maatregelen

  • Model cards — de primaire informatiebronnen over de beperkingen en veiligheid van specifieke modellen. Bevatten secties Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety. De model card van Gemini 3 Pro bevestigde dat het model geen enkel kritisch capaciteitsniveau (Critical Capability Level) heeft bereikt in de CBRN- en cyberbeveiligingsdomeinen.
  • Testen op vooringenomenheid en toxiciteit: Analyse en beperking van vooringenomenheid in trainingsgegevens en contentgeneratie.
  • Red Teaming: Simulatie van aanvallen om kwetsbaarheden en ongewenst gedrag te identificeren. Onafhankelijke tests op misalignment onthulden «enige toename in situationeel bewustzijn», maar geen kritieke risico's.

Veiligheidssondages (Safety Probes)

Voor het voorkomen van de generatie van schadelijke inhoud wordt classificatie van verborgen activaties toegepast. Om het probleem van signaaldegradatie in lange contexten op te lossen, wordt de MultiMax-architectuur gebruikt: de sonde selecteert de maximale waarde over alle lagen H voor elk token j in de reeks ni:

fextMultiMax(Si)=h=1Hmaxj[ni][vhopyi,j]

Sondes worden gecombineerd met basismodellen tot getrapte classifiers, waardoor de filterprecisie wordt verhoogd bij lage rekenkosten (arXiv:2601.11516).

Cryptografische markering (SynthID)

Audiogegevens gegenereerd via de Live API en afbeeldingen (van de Nano Banana / Flash Image-modellen) worden gemarkeerd met het SynthID-algoritme. Een onzichtbaar watermerk wordt ingesloten op pixel- of audiospectrumniveau, waardoor machinale herkenning van gegenereerde inhoud mogelijk is. Het model Nano Banana 2 (februari 2026) integreert SynthID met C2PA-metadata.

Thinking en de kwestie van transparantie

Modellen met denkmodus (2.5/3-series) kunnen thought summaries retourneren — beknopte samenvattingen van interne redeneringen, niet de volledige stroom van tussenliggende tokens. Dit biedt een zeker niveau van transparantie, maar staat bloot aan kritiek omdat de werkelijke «ruwe» redeneerketens verborgen blijven achter vereenvoudigde samenvattingen.

Regelgevingsaspecten

In het kader van de EU AI Act heeft Google de EU AI Code of Practice ondertekend (gepubliceerd op 10 juli 2025) samen met OpenAI en Anthropic. Gemini wordt geclassificeerd als een AI-model voor algemene doeleinden (GPAI) met systeemrisico, wat aanvullende veiligheidsverplichtingen met zich meebrengt (van kracht vanaf 2 augustus 2025).

Concurrentielandschap

De periode november — december 2025 werd de meest concurrerende cyclus in de geschiedenis van AI: Gemini 3 Pro (18 november), Claude Opus 4.5 van Anthropic (24 november) en GPT-5.2 van OpenAI (11 december) werden binnen 24 dagen uitgebracht. Per februari 2026 domineert geen enkel model in alle categorieën: Gemini 3 Pro leidt op LMArena voor tekst, zicht, zoeken en meertaligheid; GPT-5.2 leidt op pure wiskunde (100% AIME 2025 zonder tools) en SWE-bench Pro; Claude Opus 4.5 is concurrent op SWE-bench Verified. Wat API-kosten betreft is Gemini ongeveer 42% goedkoper dan GPT-5 bij vergelijkbare aanroepen.

Bedrijfsresultaten

Volgens de rapportage van Alphabet over Q4 2025 (gepubliceerd op 4 februari 2026): omzet Google Cloud — $17,7 miljard voor het kwartaal (+48% jaar op jaar); operationele marge — 29,9%; Cloud-orderportefeuille — $240 miljard (verdubbeling op jaarbasis). Meer dan 120 000 bedrijven maken gebruik van Gemini. In januari 2026 kondigde Apple plannen aan voor integratie van Gemini in Siri. Google verwerkt meer dan 10 miljard tokens per minuut via de API. Interne AI-agenten van Google genereren circa 50% van de eigen code van het bedrijf. De kapitaaluitgaven voor 2026 zijn gepland op $175–185 miljard (bijna een verdubbeling ten opzichte van $91,45 miljard in 2025).

Verwijzingen

  • Index van Google DeepMind-modellen
  • Documentatie van de Gemini API voor ontwikkelaars
  • Catalogus van Gemini API-modellen
  • Documentatie van Gemini Thinking
  • Depreciatie-register van Gemini-modellen
  • Index van Google DeepMind model cards

Literatuur

Primaire technische rapporten van Gemini

  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
  • Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
  • Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.

Gespecialiseerde modellen en toepassingen

  • Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
  • Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
  • Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  • Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
  • DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
  • Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.

Literatuur (overzichten en methoden)

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
  • Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
  • Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.

Officiële Google-blogberichten

  • Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
  • Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
  • Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
  • Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
  • Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
  • Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
  • Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
  • The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
  • The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.