Grote taalmodellen van Google
Grote taalmodellen van Google — dit is een reeks grote taalmodellen (LLM), ontwikkeld door verschillende afdelingen van Google, waaronder Google AI (voorheen Google Brain) en DeepMind. Als een van de pioniers op het gebied van deep learning en de Transformer-architectuur heeft Google een fundamentele bijdrage geleverd aan de ontwikkeling van moderne LLM's. De geschiedenis van de ontwikkeling van deze modellen weerspiegelt de weg van gespecialiseerde systemen voor taalbegrip naar grootschalige multimodale en agentische systemen, die aan de basis liggen van vele Google-producten en de richting bepalen van de gehele AI-industrie.
Geschiedenis en evolutie van Google-modellen
Vroege prestaties en neurale machinevertaling (2011–2016)
De basis voor de ontwikkeling van LLM's bij Google werd gelegd binnen het project Google Brain (2011), dat gewijd was aan de toepassing van diepe neurale netwerken. Een van de eerste doorbraken was het algoritme Word2Vec (2013), ontwikkeld door Tomáš Mikolov. Het maakte het mogelijk woorden voor te stellen als vectoren (embeddings) die hun semantische context weerspiegelen, wat een basismethode werd voor taalbegrip in neurale netwerken.
De volgende stap was de overgang naar sequentiemodellen, zoals seq2seq (2014), die de basis vormden voor Google Neural Machine Translation (GNMT) (2016). De overstap van Google Translate naar een neuraal netwerk op basis van LSTM verbeterde de kwaliteit van machinevertaling aanzienlijk. Tegelijkertijd liet het dochterbedrijf DeepMind, in 2014 overgenomen door Google, de kracht van deep learning zien met de overwinning van AlphaGo op de wereldkampioen go, wat het vertrouwen in het potentieel van AI versterkte.
De Transformer-revolutie en de geboorte van BERT (2017–2018)
In 2017 presenteerden onderzoekers van Google Brain de Transformer-architectuur in het artikel «Attention Is All You Need». Deze architectuur, gebaseerd op het mechanisme van self-attention, maakte het mogelijk reeksen parallel te verwerken in plaats van sequentieel, wat een revolutie betekende in NLP en de basis vormde voor alle moderne LLM's.
In de nasleep van dit succes presenteerde Google in 2018 het model BERT (Bidirectional Encoder Representations from Transformers). BERT was het eerste diep bidirectionele model, dat de context van een woord tegelijkertijd van links en rechts in aanmerking nam. Dit stelde het in staat recordresultaten te behalen op talrijke taalbegripstaken (GLUE, SQuAD) en een nieuwe industriestandaard te vestigen. BERT werd uitgebracht in twee versies (BASE met 110 miljoen parameters en LARGE met 340 miljoen) met open broncode en gewichten, wat bijdroeg aan de wijdverspreide adoptie ervan. Vanaf 2019 werd BERT gebruikt in Google Zoeken voor een beter begrip van zoekopdrachten.
Groei in schaal en het tijdperk van conversatiemodellen (2019–2022)
Na BERT bleef Google experimenteren met schaal en architectuur:
- T5 (Text-to-Text Transfer Transformer, 2019): Een uniform model dat elke NLP-taak behandelt als een «tekst-naar-tekst»-transformatie. Getraind op het gigantische corpus C4 (Colossal Clean Crawled Corpus), werd T5 ook in open access uitgebracht in verschillende groottes (tot 11 miljard parameters).
- Meena (2020): Het eerste gespecialiseerde conversatiemodel van Google met 2,6 miljard parameters, dat een hoge kwaliteit toonde in open dialogen.
- LaMDA (Language Model for Dialogue Applications, 2021): Een familie van conversatiemodellen (tot 137 miljard parameters), getraind op een enorm corpus aan dialogen (1,56 biljoen woorden). LaMDA was gericht op het creëren van meer natuurlijke en zinvolle gesprekken en werd breed bekend nadat een Google-ingenieur beweerde dat het «bewust» was.
- Gopher en Chinchilla (DeepMind, 2021–2022): Tegelijkertijd onderzocht DeepMind de wetten van schaalvergroting. Het model Gopher (280 miljard parameters) liet zien hoe schaal de kwaliteit beïnvloedt. Het model Chinchilla (70 miljard) toonde aan dat voor optimale prestaties niet het maximale aantal parameters, maar de juiste balans tussen modelgrootte en hoeveelheid trainingsdata belangrijker is. Deze conclusie werd bekend als de «Chinchilla-wet» en beïnvloedde de trainingsstrategie van LLM's in de gehele industrie.
Het tijdperk van supergrote en multimodale modellen (2022–heden)
- PaLM (Pathways Language Model, 2022): Op het moment van aankondiging het grootste dense model van Google met 540 miljard parameters, getraind op de nieuwe gedistribueerde infrastructuur Pathways. PaLM toonde baanbrekende capaciteiten op het gebied van logisch redeneren, met name bij gebruik van de techniek Chain-of-Thought (CoT) prompting. Op basis hiervan werden gespecialiseerde versies ontwikkeld, zoals Med-PaLM voor de medische sector. In 2023 werd de verbeterde versie PaLM 2 (~340 miljard parameters) uitgebracht, die de basis vormde voor de vernieuwde chatbot Bard.
- Gemini (2023–heden): Een nieuwe generatie modellen, gecreëerd door het gezamenlijke team van Google DeepMind. Gemini werd vanaf het begin ontworpen als een native multimodaal systeem, in staat tekst, code, afbeeldingen, audio en video te verwerken. Uitgebracht in verschillende versies:
- Gemini Ultra: Het krachtigste model voor complexe taken.
- Gemini Pro: Een universeel model voor een breed scala aan taken.
- Gemini Nano: Een compact model voor gebruik op mobiele apparaten.
In 2024–2025 werd de familie uitgebreid met de versies Gemini 1.5 (met een contextvenster tot 1 miljoen tokens) en Gemini 2.0, dat agentische mogelijkheden heeft gekregen.
Architectuur en technische kenmerken
Fundament: Encoders, decoders en hybrides
Google gebruikt verschillende varianten van de Transformer-architectuur afhankelijk van de taak:
- Encoders (Encoder-only): Modellen van het type BERT. Ze verwerken de volledige tekst in zijn geheel en creëren een rijke contextuele representatie. Ideaal voor taken op het gebied van tekstanalyse en -begrip (classificatie, entiteitsextractie), maar niet voor generatie.
- Decoders (Decoder-only): Modellen van het type LaMDA en PaLM (vergelijkbaar met GPT). Ze zijn autoregressief, dat wil zeggen dat ze tekst token voor token voorspellen. Dit zijn van nature generatoren, uitstekend geschikt voor het voortzetten van tekst, dialogen en het beantwoorden van vragen.
- Encoder-decoders (Encoder-Decoder): Modellen van het type T5 en GNMT. Ze hebben beide onderdelen: de encoder verwerkt de invoerreeks, terwijl de decoder de uitvoer genereert. Dit is een veelzijdige architectuur voor transformatietaken, zoals vertaling of samenvatting.
Schaal: Parameters, data en infrastructuur
Het succes van Google op het gebied van LLM's is grotendeels te danken aan drie factoren:
- Schaal van modellen: Systematische toename van het aantal parameters van miljoenen (BERT) tot honderden miljarden (PaLM, Gemini).
- Schaal van data: Toegang tot een van de grootste datacorpora ter wereld (de webindex van Google, YouTube, Google Books), waardoor modellen getraind kunnen worden op biljoenen tokens.
- Infrastructuur: Gebruik van eigen gespecialiseerde chips — Tensor Processing Unit (TPU) — en het gedistribueerde systeem Pathways, die het mogelijk maken supergrote modellen efficiënt en stabiel te trainen.
Multimodaliteit en agentiviteit
De nieuwste modellen van Google, met name Gemini, bewegen zich in de richting van diepgaande multimodaliteit en agentiviteit.
- Native multimodaliteit betekent dat één model vanaf het begin getraind is om verschillende soorten data (tekst, afbeeldingen, audio) te begrijpen en te combineren, in plaats van losse modules aan elkaar te koppelen.
- Agentiviteit (Agentic AI) — dit is het vermogen van een model om niet alleen op verzoeken te reageren, maar zelfstandig een reeks acties te plannen en uit te voeren om een doel te bereiken (bijvoorbeeld externe tools aanroepen, zoals zoeken of een rekenmachine).
Overzichtstabel van de belangrijkste modellen
| Model | Jaar van uitgifte | Parameters (schatting) | Architectuur | Belangrijkste kenmerken |
|---|---|---|---|---|
| BERT | 2018 | 110–340 miljoen | Encoder | Bidirectioneel contextbegrip, SOTA op NLP-taken. |
| T5 | 2019 | 60 miljoen – 11 miljard | Encoder-decoder | Uniforme «tekst-naar-tekst»-aanpak voor alle taken. |
| LaMDA | 2021 | 137 miljard | Decoder | Specialisatie in open, zinvolle dialogen. |
| PaLM | 2022 | 540 miljard | Decoder | Doorbraak in logisch redeneren (Chain-of-Thought), grootschalige training. |
| Chinchilla | 2022 | 70 miljard | Decoder | «Compute-optimal» model dat het belang van de balans tussen data en parameters aantoont. |
| Gemini 1.0 | 2023 | tot ~1 biljoen (Ultra) | Multimodaal (waarschijnlijk MoE) | Native multimodaliteit, SOTA op meerdere benchmarks (MMLU). |
| Gemini 1.5 | 2024 | Niet bekendgemaakt | Multimodaal (MoE) | Contextvenster tot 1-2 miljoen tokens, hoge efficiëntie. |
| Gemini 2.0 | 2024 | Niet bekendgemaakt | Multimodaal + Tools | Ingebouwde agentische mogelijkheden, generatie van afbeeldingen/audio. |
Toepassing in producten en het ecosysteem
Google integreert zijn LLM's actief in de gehele productlijn:
- Google Zoeken: BERT, MUM en Gemini worden gebruikt voor een beter begrip van complexe zoekopdrachten en het verstrekken van directe antwoorden in het formaat AI Overviews (voorheen SGE).
- Google Assistant en Bard (nu Gemini): De overgang van eenvoudige spraakopdrachten naar volwaardige conversatie-assistenten op basis van LaMDA, PaLM 2 en Gemini.
- Google Workspace: De functies van Duet AI (nu Gemini for Workspace) helpen bij het schrijven van e-mails in Gmail, het maken van teksten in Docs en het genereren van presentaties in Slides.
- Android: Gemini Nano zorgt voor AI-functies die lokaal op apparaten draaien, zoals Pixel, voor meer privacy en snelheid.
- Google Cloud AI: Het platform Vertex AI biedt bedrijven toegang tot de modellen PaLM en Gemini via API voor het bouwen van eigen applicaties.
Rol in de concurrerende omgeving
Google is een van de belangrijkste spelers in de «AI-race», waarbij de voornaamste concurrenten OpenAI (met de steun van Microsoft) en Meta zijn.
- Rivaliteit met OpenAI: Hoewel Google pionier was in veel fundamentele technologieën (waaronder de Transformer), dwong de lancering van ChatGPT eind 2022 Google om zijn producten sneller op de markt te brengen (bijvoorbeeld Bard). De concurrentie speelt zich af op het gebied van modelkwaliteit (Gemini Ultra vs. GPT-4), de grootte van het contextvenster en het gebruiksgemak van de API.
- Contrast met Meta: Meta heeft ingezet op open source (de LLaMA-modellen), waarmee een krachtig alternatief is gecreëerd voor de gesloten modellen van Google en OpenAI. Als reactie daarop begon Google ook open modellen uit te brengen, zoals Gemma, om de ontwikkelaarsgemeenschap te ondersteunen en het ecosysteem niet aan Meta te laten.
- Strategische allianties: Google investeert in andere spelers, zoals de startup Anthropic (makers van het model Claude), om de aanpakken te diversifiëren en zijn positie in de cloudconcurrentie te versterken.
Literatuur
- Vaswani, A. et al. (2017). Attention Is All You Need. NIPS.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR.
- Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
- Hoffmann, R. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. JMLR.
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
Verwijzingen
- Officieel portaal van Google AI
- Officiële website van Google DeepMind