Gemini (Google) (HU)
Google Gemini — multimodális nagy nyelvi modellek (LLM) családja, amelyet a Google DeepMind kutatási részlege fejleszt. A 2023 decemberében először bemutatott Gemini modellek neurális hálózati transformer architektúrára épülnek, és natívan támogatják a különböző modalitású adatok feldolgozását és generálását, beleértve a szöveget, képeket, hangot, videót és programkódot.
2026 februárjától a jelenlegi generáció a Gemini 3.x sorozat. Az architektúra fejlesztése az inferencia közbeni skálázható logikai következtetés (inference-time scaling) mechanizmusainak integrálására és a modellek autonóm agentikus rendszerekben (Agentic AI) való használatára való optimalizálásra irányul. A Gemini alkalmazásnak havi több mint 750 millió aktív felhasználója van.
Elnevezés és filozófia
A "Gemini" név (latinul — Ikrek) a Google két vezető kutatócsoportjának — a Google Brain és a DeepMind — egyesítését szimbolizálja a projekt megvalósításában. Jeff Dean, a Google DeepMind technológiai vezérigazgató-helyettese ezt megerősítette a hivatalos blogban (2024 május): „The twins here are the folks in the legacy Brain team and the legacy DeepMind team". A projekt eredeti kódneve „Titan" volt; a „Gemini" nevet Dean javasolta 2023 áprilisában — ugyanabban a hónapban, amelyben a Google Brain és a DeepMind formálisan egyesült. A név emellett a NASA „Gemini" űrprogramjára (1965–1968) is utal, amelynek az Apollo-program előkészítésében betöltött szerepe visszhangra talált a fejlesztőcsapatnál.
A Gemini alapvető jellemzője és filozófiai alapja a natív multimodalitás. Számos korábbi modellel ellentétben, ahol a multimodális képességeket a meglévő szöveges alap fölé rétegezték, a Geminit a kezdetektől fogva különböző típusú információk egyidejű megértésére, kezelésére és kombinálására tervezték. A Gemini 1.0 technikai jelentése (arXiv:2312.11805) megerősíti, hogy a modellt „trained jointly across image, audio, video, and text data". Ez lehetővé teszi a modell számára, hogy ne csupán adatokat konvertáljon a modalitások között, hanem mélyebb, holisztikus megértést alakítson ki róluk.
Architektúra és kulcstechnológiák
A Gemini modellek sikerét és képességeit számos alapvető architekturális döntés határozza meg. A Google nem teszi közzé a Gemini összes belső komponensének teljes, alacsony szintű tervét, azonban nyílt forrásokból megállapítható az architektúra osztálya: az 1.5-ös és újabb verziójú modellek mind sparse mixture-of-experts transformer alapú modellek natív multimodális támogatással (ezt a Gemini 2.5 Flash model card erősíti meg).
Natív multimodális architektúra
A Gemini architektúrája a korai fúzió (early fusion) koncepcióján alapul. A képek pixelpatch-ei, a videók időbeli keretei, a audiogramok és a szöveges tokenek egy egységes látens térbe vetítődnek. A Gemini 2.5 technikai jelentése ezt a megközelítést „Unified Multimodal Token Interleaving"-nek írja le. Mivel a különböző modalitások összes tokenje közös sorozatban kerül feldolgozásra, a standard önfigyelem (self-attention) mechanizmusok természetes módon biztosítják a különböző modalitásokból származó adatok keresztintegrációját minden rétegben. A hangjeleket specializált kódolók dolgozzák fel közvetlenül a hangformából (waveform), megőrizve az akusztikai jellemzőket (intonáció, hangszín, háttérzajok), amelyek elvesznek közbülső Speech-to-Text átírási rendszerek alkalmazásakor.
A transformer osztály alap művelete a figyelemmechanizmus:
ahol — a lekérdezések mátrixa, — a kulcsoké, — az értékeké, — a kulcsok dimenziója.
Ritka szakértői keverék (Sparse MoE)
Az 1.5-ös verziótól kezdve a Gemini modellek a Sparse Mixture-of-Experts (MoE) architektúrát alkalmazzák. A Gemini 1.0 tömör (dense) transformert használt; az MoE-re való áttérés közvetlenül szerepel az 1.5-ös technikai jelentésben: „This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture".
Az MoE architektúrában a standard teljesen összekötött rétegeket (Feed-Forward Networks) specializált alhálózatok — „szakértők" — halmaza váltja fel. Egy bemeneti tokenre a kimenet aktív szakértő kimenetének súlyozott összegeként áll elő (, ahol — a szakértők teljes száma):
ahol — a -adik szakértő nemlineáris függvénye, — a kiválasztott alhálózat indexeinek halmaza, az útválasztási súlyt pedig egy tanult útválasztási függvény (learned routing function) számítja a legnagyobb értékek feletti Softmax függvény alkalmazásával.
Ez a megközelítés lehetővé teszi a modell teljes paraméteres kapacitásának jelentős növelését, miközben a számítási költségeket (FLOPs) alacsony szinten tartja, mivel minden tokenhez csupán a paraméterek egy részhalmaza aktiválódik. A Google nem hozta nyilvánosságra a Gemini modellek tényleges paraméterszámát.
Hosszú kontextus és „Kontextuson belüli tanulás\"
A Gemini 1.5 áttörést hozott, a kontextusablak méretét 1 millió tokenre növelve production módban (kísérleti teszteléssel 10 millió tokenig). Ez nagyságrendekkel több, mint a korábbi modelleknél (például a GPT-4 Turbo 128 ezer tokenjénél). A Google 99%-os eredményt jelentett be a Needle In A Haystack teszten 1 millió tokenes kontextushosszon. A következő generációknál a long context a sorozat egyik kulcsfontosságú jellemzőjévé vált. Az ilyen méretű kontextus lehetővé teszi a modell számára:
- Egész könyvek, többórás videók (akár 3 óra) vagy nagy kódbázisok elemzését egyetlen kérésben.
- „Kontextuson belüli tanulás" (in-context learning) végrehajtását a promptban megadott hatalmas adatmennyiségen, ami rendkívül testreszabott válaszokat tesz lehetővé dohányozás (fine-tuning) nélkül.
„Gondolkodó modellek" és a számítások skálázása inferencia közben
A Gemini 2.5-től kezdve a Google a thinking módot a modellek különálló működési módjaként különíti el. A hivatalos dokumentáció ezt belső számítási folyamatként határozza meg, amely javítja a többlépéses tervezést és következtetést. A 2.5-ös verziójú modellek (amelyeket „thinking models"-ként írnak le) képesek belső közbenső következtetési lépéseket generálni és értékelni a végső válasz megadása előtt. Ez jelentősen növeli a pontosságot összetett logikai és matematikai feladatoknál.
Fontos különbséget tenni két mechanizmus között:
- Beépített gondolkodás (Thinking): A 2.5-ös és 3-as sorozatú modellek alapmódja, amely rejtett gondolkodási láncot (Chain-of-Thought) generál. Az API thought summaries-t — a belső következtetések rövid összefoglalóit — adhat vissza a teljes „nyers gondolatok" folyama helyett. A 3.1 Pro modelltől kezdve a gondolkodási keret a
thinking_levelparaméterrel szabályozható Low-tól Max-ig. - Deep Think: Különálló kísérleti bővített következtetési mód, amely párhuzamos hipotézis-generálást alkalmaz, és lényegesen nagyobb számítási erőforrásokat igényel. 2025. május 20-án a Google I/O-n jelentették be, és 2025. augusztus 1-jén nyílt meg az AI Ultra előfizetők számára. A Deep Think nem azonosítható az alapvető thinking mechanizmussal.
Agentikus képességek (Agentic Capabilities)
A 2.0-s verziótól kezdve a Gemini képes interakcióba lépni a külvilággal: eszközöket hívni, Google-keresést végezni, kódot futtatni és UI-elemeket vezérelni. A Google a Gemini 2.0-t kifejezetten az „új agentikus korszak" (agentic era) modelljéként pozicionálta, natív tool use támogatással.
2026 februárjára a Gemini API formálisan rögzített agentikus képességi réteget tartalmaz az alábbi eszközök támogatásával: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, valamint Live API a valós idejű kétirányú interakcióhoz.
A Gemini modellek fejlődése
A Gemini család rendkívül gyors ütemben fejlődik: 2023 decembere és 2026 februárja között négy fő modellgeneráció jelent meg.
Gemini 1.0 (2023 december)
Az első generáció, amely megalapozta a natív multimodalitást. 2023. december 6-án mutatták be nyilvánosan.
- Verziók: Ultra (zászlóshajó a legösszetettebb feladatokhoz), Pro (univerzális modell) és Nano (kompakt mobileszközökhöz; Nano-1 1,8 milliárd paraméterrel és Nano-2 3,25 milliárd paraméterrel).
- Kontextusablak: 32 768 token minden verzióhoz.
- Eredmények: A Gemini 1.0 Ultra volt az első modell, amely elérte és meghaladta az emberi szakértő szintjét az MMLU benchmarkon 90,04%-os eredménnyel (CoT@32 technikával — 32 mintával és többségi szavazással végzett gondolkodási lánc; standard 5-shot promptinggal az eredmény körülbelül 83,7% volt). 32 akadémiai benchmarkból 30-on SOTA-eredményeket ért el.
- Támogatás megszüntetése: A Gemini 1.0 Pro 2025. február 18-án lett elavultnak nyilvánítva.
Gemini 1.5 (2024 február — május)
Áttörés a kontextushosszon és a hatékonyságon.
- Architektúra: Áttérés a tömör transformerről a Mixture-of-Experts (MoE) architektúrára.
- Kontextusablak: Production módban legfeljebb 1 millió token (2 millió — waitlist alapján az 1.5 Pro-hoz, 2024 májusában a Google I/O-n bejelentve).
- Verziók: 1.5 Pro (2024 februárban bejelentve; az 1.0 Ultra szintű minőséggel, lényegesen alacsonyabb költséggel) és 1.5 Flash (könnyített és gyors verzió, 2024 májusában hozzáadva).
- Támogatás megszüntetése: Az összes Gemini 1.5 modell (Pro, Flash, Flash-8B) 2025. szeptember 29-én lett kivonva a forgalomból.
Gemini 2.0 (2024 december — 2025 február)
Áttérés az „agentikus korszakra".
- Időrend: 2024. december 11. — a 2.0 Flash Experimental bejelentése (multimodális bemenet, szöveges kimenet); 2025. február 5. — a 2.0 Flash általános elérhetősége (GA), a 2.0 Pro Experimental és a 2.0 Flash-Lite kiadása.
- Kulcsinnovációk: Beépített agentikus képességek (tool use), natív kép- és hanggenerálás (kezdetben korlátozott módban early-access partnerek számára), agentikus forgatókönyvekre való összpontosítás.
- Kontextusablak: Legfeljebb 2 millió token (2.0 Pro); legfeljebb 1 millió token (2.0 Flash-Lite).
- Támogatás megszüntetése: A 2.0 Flash és Flash-Lite modellek kivonása 2026. június 1-jére van ütemezve.
Gemini 2.5 (2025 március — június)
Az első „gondolkodó modell" (thinking model) testre szabható következtetési kerettel.
- Időrend: 2025. március 25. — a 2.5 Pro Experimental bejelentése; április 17. — a 2.5 Flash (az első teljesen hibrid reasoning-modell kapcsolható gondolkodási móddal); május 20. (Google I/O) — a 2.5 Pro és Flash frissítései, a Deep Think bejelentése; 2025. június 17. — a 2.5 Pro és 2.5 Flash egyidejű GA-ja; ugyanazon a napon a 2.5 Flash-Lite előnézete (GA: július 22.). Augusztus 1. — a Deep Think megnyílik az AI Ultra előfizetők számára.
- Kulcsinnovációk: Beépített „gondolkodási" (thinking) mechanizmus testre szabható keretekkel; Deep Think mint különálló bővített mód. SOTA-eredmények összetett matematikai, logikai és programozási benchmarkokon (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% eszközök nélkül).
- Kontextusablak: Bemenet legfeljebb 1 millió token, kimenet legfeljebb 64 000 token. A 2.5 Pro esetén ígért 2 millió tokenes bővítés nem lett megerősítve a modell életciklusa alatt.
- Speciális változatok: Gemini 2.5 Flash Image (kódneve „Nano Banana", névtelenül jelent meg az Arénán augusztus 12-én, hivatalosan 2025. augusztus 26-án adták ki — virálissá vált a fotorealisztikus „3D-figurák" révén, 10 millió új felhasználót vonzott); Computer Use Preview (2025. október 7., 2.5 Pro alapon); Text-to-Speech modellek (2.5 Flash TTS, 2.5 Pro TTS).
- Technikai jelentés: Az összevont Gemini 2.X jelentés az arXiv-on jelent meg 2025. július 7-én (arXiv:2507.06261), több mint 3 300 szerzőt tartalmaz, és lefedi a 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite modelleket.
Gemini 3.x (2025 november — 2026 február)
A harmadik generáció az alap generációtól a hosszú agentikus folyamatokra (agentic workflows) és interdiszciplináris tudományos feladatok megoldására való átmenetet jelölte.
- Gemini 3 Pro (2025. november 18.): Az Alphabet vezérigazgatója, Sundar Pichai és a DeepMind vezetője, Demis Hassabis „a Google legintelligensebb modelljének" nevezte. Az első Gemini modell, amelyet az indulás napján a Google Search-be is bevezettek. Ez volt az első modell, amely átlépte az 1500 Elo szintet az LMArénán (1501 az induláskor). Eredmények: GPQA Diamond — 91,9%; SWE-bench Verified — 76,2%; Humanity's Last Exam — 37,5% (eszközök nélkül); SimpleQA — 72,1%.
- Gemini 3 Flash (2025. december 17.): A Gemini alkalmazás alapértelmezett modelljévé vált. $0,50 / 1M bemeneti token áron felülmúlta a 3 Pro-t a SWE-bench Verified-en (78%), miközben 30%-kal kevesebb tokent használt a következtetési feladatokhoz. GPQA Diamond — 90,4%; HLE — 33,7%.
- Gemini 3.1 Pro (2026. február 19.): A publikáció időpontjában aktuális zászlóshajó modell. Az első „inkrementális" kiadás (.1 a korábbi .5 helyett). Kulcsfontosságú eredmény — ARC-AGI-2: 77,1% (több mint kétszerese a 3 Pro 31,1%-ának). AIME 2025 — 91,2%; GPQA Diamond — 94,3%; SWE-bench Verified — 80,6%. Új MEDIUM gondolkodási szint bevezetve a
thinking_levelparaméteren keresztül. Specializáltgemini-3.1-pro-preview-customtoolsvégpont bash-terminállal és egyéni funkciókkal való munkához. Megoldva a kimenet csonkításának problémája hosszú generálások esetén. Csatornák: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM. - Gemini 3 Deep Think (2026. február 12-i frissítés): A speciális „gondolkodó" mód jelentős frissítése. Túllépett a matematikán és programozáson: arany érem szintű eredmények a 2025-ös nemzetközi fizika (IPhO) és kémia (IChO) olimpiákon; ARC-AGI-2 — 84,6%; Humanity's Last Exam — 48,4%; CMT-Benchmark (kondenzált anyagok elméleti fizikája) — 50,5%; Codeforces Elo — 3455. A Deep Think alapján létrehozták az Aletheia kutatási ágenst, amely autonóm módon megoldott néhány nyitott feladatot az Erdős-adatbázisból (beleértve az Erdős-1051 problémát).
A Gemini generációk összefoglaló táblázata
| Generáció | Kiadás éve | Főbb verziók | Max. kontextusablak | Főbb architekturális innovációk és fejlesztések |
|---|---|---|---|---|
| Gemini 1.0 | 2023 | Ultra, Pro, Nano | 32 768 token | Natív multimodalitás a kezdetektől; tömör transformer; emberi feletti teljesítmény az MMLU-n (90,04% CoT@32). |
| Gemini 1.5 | 2024 | Pro, Flash | 1 000 000 token (2 millió waitlist alapján) | Mixture-of-Experts (MoE) architektúra; forradalmi kontextusbővítés; 99% Needle In A Haystack. |
| Gemini 2.0 | 2024–2025 | Pro, Flash, Flash-Lite | 1 000 000 — 2 000 000 token | Az „agentic AI" korszaka: natív eszközintegráció, kép- és hanggenerálás, Live API. |
| Gemini 2.5 | 2025 | Pro, Flash, Flash-Lite | 1 000 000 token (bemenet), 64 000 (kimenet) | „Gondolkodó modell" (thinking); testre szabható következtetési keretek; Deep Think; képgenerálás (Nano Banana); Computer Use. |
| Gemini 3.x | 2025–2026 | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1 000 000 token | Agentikus workflows; thinking_level paraméter; áttörés az ARC-AGI-2-n és tudományos olimpiákon; Aletheia. |
Kulcseredmények és benchmarkok
A klasszikus benchmarkok (mint az MMLU) telítettségével összefüggésben a Gemini modellek teljesítményértékelése az absztrakt következtetés, tudományos modellezés és autonóm programozás feladatai felé tolódott. Az eredmények a Google hivatalos adatai alapján (self-reported) szerepelnek; összehasonlításuk csak azonos inferencia mód, eszközhasználat jelenléte/hiánya, mintavételi módszer (single-attempt vs. majority voting) és konkrét model-id esetén érvényes.
| Benchmark | Feladat leírása | Gemini 2.5 Pro (2025 június) | Gemini 3 Pro (2025 nov.) | Gemini 3.1 Pro (2026 feb.) | Gemini 3 Deep Think (2026 feb.) |
|---|---|---|---|---|---|
| MMLU | Többfeladatos nyelvi megértés | — | — | — | — |
| GPQA Diamond | PhD-szintű tudományos kérdések | 84,0% | 91,9% | 94,3% | N/A |
| Humanity's Last Exam | Frontier szintű szaktudás | 18,8% | 37,5% | 44,4% | 48,4% |
| ARC-AGI-2 | Absztrakt logikai rejtvények | 4,9% | 31,1% | 77,1% | 84,6% |
| SWE-bench Verified | GitHub-tárolókban végzett autonóm feladatmegoldás | 63,8%* | 76,2% | 80,6% | N/A |
| AIME 2025 | Olimpiai szintű matematikai feladatok | 86,7% | — | 91,2% | — |
| Codeforces (Elo) | Versenyszerű programozási besorolás | — | — | 2887 | 3455 |
* A 2.5 Pro SWE-bench eredménye egyéni agent setuppal született.
Helyezések az LMArénán (2026 február végi pillanatkép)
Az LMArena (korábban Chatbot Arena) egy független, vak páros szavazáson alapuló platform. A rangsorok dinamikusan számítódnak újra; a modell indításkori értékek eltérhetnek a jelenlegiektől.
| Modell | Besorolás | Helyezés | Szavazatok | Megjegyzés |
|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 1500 ± 9 | #3 | 4 060 | Előzetes |
| Gemini 3 Pro | 1486 ± 4 | #5 | 37 854 | |
| Gemini 3 Flash | 1473 ± 5 | #7 | 28 847 | |
| Gemini 2.5 Pro | 1464 ± 3 | #9 | 97 296 | |
| Gemini 2.5 Flash | 1411 ± 3 | #64 | 96 163 |
2025. november 18-i indításakor a Gemini 3 Pro 1501 Elo besorolást ért el, elsőként lépve át az 1500-as küszöböt az LMArénán.
Speciális és agentikus rendszerek
A Gemini ökoszisztéma digitális és fizikai környezetben többlépéses műveleteket végrehajtani képes modellekkel és platformokkal bővült.
Autonóm ügynökök
- Jules — autonóm kódolási ügynök, amely aszinkron módon működik védett felhőalapú virtuális gépeken. Ágakat és pull-requesteket hoz létre a GitHubon. 2025. május 20-án, a Google I/O-n nyílt meg a nyilvános bétában (a bétatesztelési időszak alatt több mint 140 000 kódjavítás), GA — 2025. augusztus 6. 2025 végére a Google belső tárolóinak egyik legnagyobb közreműködőjévé vált.
- Project Mariner — kutatási prototípus böngészőügynök többlépéses webes feladatokhoz. Felhőalapú virtuális gépekre költöztetve, legfeljebb 10 párhuzamos feladattal és „Teach & Repeat" funkcióval. 83,5%-ot ért el a WebVoyager benchmarkon. A Computer Use képességek átkerültek a Gemini API-ba.
- Google Antigravity — 2025 novemberében bemutatott integrált fejlesztői környezet (IDE) AI-ügynökök kezelésére. Az ügynökök autonóm módon módosítják a kódot, interakcióba lépnek a terminállal és a beépített böngészővel, és ellenőrizhető leleteket (kóddiffeket) adnak vissza a fejlesztő jóváhagyásra.
- Aletheia ügynök — speciális matematikai kutatási ügynök, Gemini 3 Deep Think alapon. Természetes nyelvű ellenőrzővel és irodalomkutatási webes keresőeszközökkel van felszerelve. 2026 elején autonóm módon megoldott számos nyitott matematikai feladatot az Erdős-adatbázisból, és társszerzőként szerepelt tudományos publikációkban.
Fogyasztói AI-ügynökök
- Phone Automations — autonóm ügynök integrálása az Android operációs rendszer szintjén (béta verzió Pixel 10 és Samsung Galaxy S26 készülékekhez). Biztonságos, elkülönített környezetben (secure sandbox) működik, képes harmadik féltől származó alkalmazásokban navigálni GUI vizuális elemzés alapján.
- Gemini in Chrome (Auto Browse) — böngészőügynök többlépéses webes feladatok automatizálásához, amely 2025 szeptemberétől elérhető az összes Chrome-felhasználó számára (2026 januárban frissítve Gemini 3-ra).
Computer Use
A Gemini 2.5 Computer Use modellek grafikus felhasználói felületek (UI) vezérlésére vannak optimalizálva. A rendszer bemeneti adatként képernyőképeket és művelethistóriát fogad, és koordinátákat generál a kurzor szoftveres szimulálásához és billentyűzetbeviteli parancsokat.
Gemini Robotics
2025 márciusában bemutatott Vision-Language-Action (VLA) és Embodied Reasoning (ER) osztályú modellek. Ezek az architektúrák téridőbeli információkat dolgoznak fel, és robotmanipulátorok 3D mozgáspályáit jósolják meg natív kimeneti modalitásként (arXiv:2503.20020).
Speciális generatív modellek (2026 eleje)
- Nano Banana 2 (Gemini 3.1 Flash Image) — 2026. február 26-án adták ki; vizuális modell, amely a Flash architektúra sebességét kombinálja a Pro minőségével. Szigorú karakterazonosság-megőrzést (character consistency), natív tipográfia generálást képeken belül, és SynthID kriptográfiai vízjel integrációt biztosít C2PA metaadatokkal.
- Lyria 3 — zenei modell, amelyet 2026. február 18-án integráltak a Gemini alkalmazásba. 30 másodperces zenei kompozíciókat generál (énekes és hangszeres részekkel egyaránt) szöveges promptok, fényképek vagy videók alapján.
- Veo 3.1 — videógenerálási modell. Támogatja videók létrehozását legfeljebb három referenciakép segítségével („Ingredients to Video"), átmenetek generálását megadott első és utolsó képkocka között, natív vertikális videók (9:16) renderelését és 4K felbontásra való upscalingot.
- Med-Gemini — doménspecifikus modell orvosi feladatokhoz (arXiv:2404.18416, arXiv:2405.03162).
Felhasználás és ökoszisztéma
A Google mélyen integrálja a Geminit fogyasztói és fejlesztői termékeibe.
Fogyasztói termékek
- Gemini alkalmazás: Chatbot (korábban Bard, 2024. február 8-án átnevezve), amely a Gemini modellcsalád modelljeit használja univerzális AI-asszisztensként. 2026 februárjára több mint 750 millió aktív felhasználóval rendelkezik. Az aktuális bevezetés a 3.1 Pro modellt tartalmazza. Előfizetések: Google AI Pro ($19,99/hó, felváltotta a Google One AI Premiumot) és Google AI Ultra ($249,99/hó, Deep Think, Veo 3 és prioritásos funkciók hozzáféréssel).
- Google Workspace: A Gemini integrálása a Gmailbe, Docs-ba, Sheets-be, Meet-be szövegírási segítséghez, adatelemzéshez és tartalomgeneráláshoz (átmárkázva a Duet AI-ból).
- Google Keresés: Az AI Overviews funkció összefoglaló válaszokat generál összetett lekérdezésekre egy speciális Gemini modell alapján. A 2025-ös Google I/O-n bevezetett AI Mode mélyreható keresést biztosít agentikus képességekkel (foglalás, vásárlás).
- Android és Pixel: A Gemini Nano (v3 a Pixel 10-en Tensor G5 chippel, 2025 augusztus) helyileg fut az okostelefonokon, intelligens válaszokat, összefoglalókat, csaláshívás-felismerést és akadálymentesítést biztosítva, megőrizve az adatvédelmet. Az ML Kit GenAI API fejlesztők számára eszközön végzett összefoglalást, korrektúrát és beszédfelismerést támogat.
- NotebookLM: A jegyzetek eszközéből teljes értékű kreatív platformmá fejlődött. 2025 márciusában a Google Workspace részévé vált. Interaktív Audio Overviews, Video Overviews, Mind Maps, diák, infografikák támogatása. 2025 decemberében Gemini 3-ra frissítve; a teljes 1 millió tokenes kontextusablak a chat számára 2026 februártól elérhető.
- Gemini Live: A Project Astra kamera- és képernyőmegosztási funkciói ingyenessé váltak az összes Android és iOS felhasználó számára.
Fejlesztői platformok
- Google AI Studio és Gemini API: A Gemini modellekhez API-n keresztüli hozzáférés fő felületei. 2026 februárjára a következő képességblokkokat támogatják: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
- Vertex AI: Vállalati platform kibővített biztonsági és irányítási képességekkel.
- Google Gen AI SDK: 2025 májusára elérte a GA állapotot Python, JavaScript/TypeScript, Go és Java esetén, egységes hozzáférést biztosítva a Gemini Developer API-hoz és a Vertex AI-hoz. Támogatja a Model Context Protocol (MCP)-t.
- Gemini CLI: Parancssori eszköz terminálban végzett AI-kódoláshoz (2025 júniusában indítva).
- Interactions API: Egységes felület modellekhez és ügynökökhöz (béta 2025 decembertől).
API életciklus és verziókezelés
A Gemini API-ban lévő modellek stable, preview, latest és experimental kategóriákba sorolódnak. Egy konkrét model_id és egy modellcsalád nem azonos fogalmak; production forgatókönyvekben kritikus fontosságú az adott verzióhoz és a támogatás határidejéhez való kötődés. Az API dokumentációban egy megszüntetési nyilvántartás vezet a támogatás lejárati dátumairól.
A hosszú, autonóm feladatok támogatásához bevezették a következőket: Session Resumption (munkamenet-állapot tárolása a szerveren legfeljebb 24 óráig) és Context Compression (csúszóablak-mechanizmus a kontextus automatikus tömörítéséhez a korlát túllépésekor).
2025 decemberében a Google az ingyenes szintű API-kvótákat körülbelül 92%-kal csökkentette (előzetes figyelmeztetés nélkül), ami éles reakciót váltott ki a fejlesztői közösségből. Ugyanakkor a Gemini modellek karbantartási költsége 78%-kal csökkent 2025 folyamán az optimalizálásoknak köszönhetően.
Korlátok és nyitott problémák
- Hallucinációk és konfabulációk: A modellek hajlamosak maradnak tényszerűen helytelen információk generálására, különösen a horgonyzási funkciók (Search Grounding) kikapcsolt állapotában. A Gemini 3.1 Pro csökkentette a hallucinációk szintjét a SimpleQA benchmarkon az előző verziókhoz képest, azonban a probléma szisztematikusan fennáll valamennyi LLM esetén.
- Tudatalatti plágium (Subconscious Plagiarism): Az Aletheia ügynökkel végzett kísérletekben feltárult a nem triviális bizonyítékok reprodukálásának problémája a tanítókészletből, amelyeket autonóm felfedezésként tüntetnek fel, ami megnehezíti az AI-kutatások újszerűségének validálását.
- Degradáció hosszú kontextusban: 1 millió tokenes kontextusok feldolgozásakor a modellek ki vannak téve a „Lost in the Middle" effektusnak — a dokumentum közepéről való tény-visszakeresés pontosságának csökkenésének.
- Magas számítási költségek: A Deep Think maximális beállításokkal végzett inferenciája lényegesen több időt és erőforrást (TPU) igényel, ami korlátozza a szinkron valós idejű alkalmazásokban való felhasználást.
- Téves elutasítások (Over-refusals): A szigorú igazítási (alignment) algoritmusok miatt az összetett következtetési modellek hajlamosak elutasítani jogos kéréseket, tévesen potenciálisan veszélyesnek minősítve azokat (különösen kódelemzés és információbiztonság kontextusában). A model card emellett a visszautasítások „moralizáló" (preachy) hangnemével kapcsolatos problémákat is jelöl.
- Következtetési korlátok: A 2.5-ös és 3-as sorozat model cardjain fel van sorolva a kauzális megértés (causal understanding), az összetett logikai dedukció (complex logical deduction) és a kontrafaktuális következtetés (counterfactual reasoning) korlátai, valamint a gondolkodási keretek betartásának nem teljes előrejelezhetősége.
Etikai szempontok és biztonság
A Gemini modellek bevezetése többszintű biztonsági intézkedések rendszerével párosul.
Általános keretek
A Secure AI Framework (SAIF) — a Google általános megközelítése az AI-rendszerek biztonságához (2023 júniusában bejelentve), amely a fejlesztés kontextusát alakítja, de nem Gemini-specifikus szabvány. A Frontier Safety Framework v3 (2025 szeptember) lefedi a CBRN, a kiberbiztonság, az ML K+F, a manipulatív befolyásolás területeit, és kísérleti megközelítést alkalmaz az összehangolatlansági (misalignment) kockázatokhoz.
Gemini-specifikus intézkedések
- Model cardok — az egyes modellek korlátaira és biztonságára vonatkozó elsődleges információforrások. Tartalmazzák az Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety szakaszokat. A Gemini 3 Pro model card megerősítette, hogy a modell egyetlen kritikus képességi szintet (Critical Capability Level) sem ért el a CBRN és kiberbiztonság területein.
- Előítélet- és toxicitástesztelés: Az előítélet elemzése és mérséklése a tanítóadatokban és a tartalomgenerálásban.
- Red Teaming (vörös csapatok): Támadások szimulálása sebezhetőségek és nemkívánatos viselkedés feltárására. A összehangolatlansággal kapcsolatos független tesztelés „bizonyos szintű szituatív tudatosság-növekedést" mutatott ki, de nem tárt fel kritikus kockázatokat.
Biztonsági szondák (Safety Probes)
A káros tartalom generálásának megakadályozásához rejtett aktivációs osztályozást alkalmaznak. A hosszú kontextusokban tapasztalt jelvesztés problémájának megoldására a MultiMax architektúrát alkalmazzák: a szonda minden tokenhez a rétegeken átívelő maximális értéket veszi a sorozatban:
A szondákat az alap modellekkel kaszkádolt osztályozókká kombinálják, növelve a szűrés pontosságát alacsony számítási költségek mellett (arXiv:2601.11516).
Kriptográfiai jelölés (SynthID)
A Live API-n keresztül generált hangadatok és a képek (a Nano Banana / Flash Image modellektől) a SynthID algoritmussal kerülnek jelölésre. A láthatatlan vízjel pixel- vagy hangspektrum szinten kerül beágyazásra, biztosítva a generált tartalom gépi felismerhetőségét. A Nano Banana 2 modell (2026 február) C2PA metaadatokkal integrálja a SynthID-et.
Thinking és az átláthatóság kérdése
A thinking módú modellek (2.5/3-as sorozat) thought summaries-t — a belső következtetések rövid összefoglalóit — adhatnak vissza a teljes közbenső token-folyam helyett. Ez bizonyos szintű átláthatóságot biztosít, azonban kritika éri amiatt, hogy a tényleges „nyers" következtetési láncok egyszerűsített összefoglalók mögé rejtőznek.
Szabályozási szempontok
Az EU mesterséges intelligenciáról szóló törvénye (EU AI Act) keretében a Google aláírta az EU AI Gyakorlati Kódexét (2025. július 10-én közzétéve) az OpenAI és az Anthropic mellett. A Gemini általános célú AI-modellként (GPAI) van besorolva rendszerkockázattal, ami kiegészítő biztonsági kötelezettségeket von maga után (2025. augusztus 2-tól hatályos).
Versenyhelyzet
A 2025 novemberi — decemberi időszak az AI-történelem legsűrűbb versenyidőszakává vált: a Gemini 3 Pro (november 18.), az Anthropic Claude Opus 4.5 (november 24.) és az OpenAI GPT-5.2 (december 11.) 24 napon belül jelent meg. 2026 februárjában egyetlen modell sem domináns minden kategóriában: a Gemini 3 Pro vezet az LMArénán szöveg, látás, keresés és többnyelvűség terén; a GPT-5.2 vezet a tiszta matematikában (100% AIME 2025 eszközök nélkül) és a SWE-bench Pro-n; a Claude Opus 4.5 versenyképes a SWE-bench Verified-en. API-költség szempontjából a Gemini körülbelül 42%-kal olcsóbb a GPT-5-nél összehasonlítható hívásoknál.
Üzleti mutatók
Az Alphabet Q4 2025-ös jelentése szerint (2026. február 4-én közzétéve): a Google Cloud negyedéves bevétele — 17,7 milliárd dollár (+48% évente); üzemi árrés — 29,9%; Cloud rendelési portfólió — 240 milliárd dollár (éves megduplázódás). Több mint 120 000 vállalkozás használja a Geminit. 2026 januárjában az Apple bejelentette a Gemini Siri-be való integrálásának terveit. A Google több mint 10 milliárd tokent dolgoz fel percenként az API-n keresztül. A Google belső AI-ügynökei a cég saját kódjának körülbelül 50%-át generálják. A 2026-os tőkekiadások 175–185 milliárd dollárra vannak tervezve (közel kétszeres növekedés a 2025-ös 91,45 milliárd dollárhoz képest).
Hivatkozások
- Google DeepMind modellindex
- Gemini API fejlesztői dokumentáció
- Gemini API modellkatalógus
- Gemini Thinking dokumentáció
- Gemini modell-megszüntetési nyilvántartás
- Google DeepMind model card index
Irodalom
Gemini elsődleges technikai jelentések
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
- Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.
Speciális modellek és alkalmazások
- Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
- Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
- Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
- DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.
Irodalom (áttekintések és módszerek)
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
- Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
- Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.
Google hivatalos blogbejegyzések
- Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
- Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
- Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
- Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
- Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
- Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
- Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
- The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
- The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.