---
title: "Multimodale grote taalmodellen"
source: "https://systems-analysis.info/int/Multimodale_grote_taalmodellen"
wiki: "systems-analysis.info/int"
article: "Multimodale_grote_taalmodellen"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4793
wiki_created_at: 2026-09-06T23:39:58Z
wiki_modified_at: 2026-09-06T23:39:58Z
downloaded_at: 2026-09-07T23:04:39Z
---

# Multimodale grote taalmodellen

**Multimodale grote taalmodellen** (Engels: **Multimodal Large Language Models, MLLMs**) — dit is een klasse van kunstmatige-intelligentiemodellen die informatie in verschillende modaliteiten kunnen verwerken en genereren, waaronder tekst, afbeeldingen, audio en video<sup>[\[1\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-encord_intro-1)</sup>. In tegenstelling tot unimodale taalmodellen die uitsluitend met tekst werken, integreren MLLM informatie uit verschillende bronnen om complexe taken op het gebied van begrip en contentgeneratie op te lossen.

Het kernconcept van MLLM is het creëren van een uniforme vectorrepresentatie (embedding) voor verschillende modaliteiten. Dit stelt het model in staat semantische verbanden te leggen tussen, bijvoorbeeld, een afbeelding en de bijbehorende tekstuele beschrijving<sup>[\[2\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-acm_survey-2)</sup>. De cruciale doorbraak die de basis legde voor moderne MLLM was het gebruik van contrastief leren om visuele en tekstuele representaties uit te lijnen in een gemeenschappelijke feature-ruimte, zoals geïmplementeerd in het model **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-radford2021-3)</sup>.

## Geschiedenis van de ontwikkeling

### Vroege periode (2013–2020)

De conceptuele grondslagen van multimodale AI werden gelegd in 2013, toen onderzoekers van Stanford aantoonden dat zero-shot learning mogelijk was met behulp van vectorrepresentaties van woorden<sup>[\[4\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-deoldify2013-4)</sup>. In 2016 toonde het **FAIR**-team (Meta AI) de effectiviteit aan van het gebruik van beschrijvingen in natuurlijke taal voor het trainen van computer vision-modellen, waarbij een nauwkeurigheid van 11,5% op ImageNet werd bereikt zonder directe training<sup>[\[5\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-openai_fair_2016-5)</sup>.

### Het CLIP-tijdperk (2021)

Een revolutionair moment was de release van het model **CLIP** (*Contrastive Language-Image Pre-training*) door OpenAI in januari 2021. Het model, getraind op 400 miljoen beeld-tekstparen, toonde de mogelijkheid om afbeeldingen te classificeren zonder gespecialiseerde training op specifieke taken. CLIP werd de basis voor veel latere MLLM<sup>[\[6\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-stanford_cs_clip-6)</sup>.

### Opschaling en innovaties (2022–2024)

Na het succes van CLIP verscheen een groot aantal sleutelmodellen:

- **Flamingo** (DeepMind, 2022) — een model van 80 miljard parameters met uitstekende few-shot learning-capaciteiten.
- **BLIP** (Salesforce, 2022) — een uniforme architectuur voor begrip en generatie.
- **GPT-4V** (OpenAI, 2023) — het eerste commerciële multimodale model op deze schaal.
- **LLaVA** (Microsoft, 2023) — een populair open alternatief voor GPT-4V.
- **Gemini** (Google, 2023) — een van nature multimodale architectuur, van meet af aan ontworpen voor het werken met verschillende datatypes.
- **GPT-4o** (OpenAI, 2024) — een model dat tekst, audio en video in realtime kan verwerken met lage latentie<sup>[\[1\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — een model met verbeterde capaciteiten voor de analyse van visuele informatie.

## Architecturale benaderingen

### Dual-Encoder-architectuur

Maakt gebruik van afzonderlijke encoders voor elke modaliteit, die de gegevens projecteren in een gemeenschappelijke representatieruimte. Een prominent voorbeeld is **CLIP**, waarbij een visuele transformer afbeeldingen verwerkt en een tekstuele transformer taalgegevens. De voordelen zijn modulariteit en rekentechnische efficiëntie; het nadeel is beperkte cross-modale interactie<sup>[\[7\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-viso_ai_mllm-7)</sup>.

### Encoder-decoder-architectuur

Een enkele encoder verwerkt de multimodale invoer, terwijl een decoder tekstuele uitvoer genereert. Het model **Flamingo** gebruikt het *Perceiver Resampler*-mechanisme voor het verwerken van visuele invoer van variabele lengte en cross-modale aandachtslagen. Deze benadering biedt rijke intermodale interactie, maar vereist meer rekenbronnen<sup>[\[8\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-determined_ai_arch-8)</sup>.

### Alignment-architectuur

Deze benadering maakt gebruik van bevroren voorgetrainde encoders die via een klein trainbaar uitlijnmodule zijn verbonden. Zo gebruikt **BLIP-2** een **Q-Former** (*Querying Transformer*) als lichtgewicht verbindingselement tussen de bevroren visuele encoder en het taalmodel, waarbij aanzienlijk minder trainbare parameters nodig zijn<sup>[\[9\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-clarifai_blip2-9)</sup>.

## Belangrijkste modellen

### GPT-4V / GPT-4o (OpenAI)

De GPT-4-modelfamilie telt naar schatting tot **1,8 biljoen** parameters (in een mixture-of-experts-architectuur). Het model **GPT-4o**, uitgebracht in mei 2024, ondersteunt realtime verwerking van tekst, afbeeldingen, audio en video. Op de benchmark **MMMU** bereikt het een nauwkeurigheid van **69,1%**<sup>[\[10\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Een van nature multimodale architectuur, van scratch getraind op tekst, afbeeldingen, audio en video. **Gemini 1.5 Pro** ondersteunt een contextvenster van tot **10 miljoen tokens** en overtreft GPT-4 op 30 van de 32 populaire benchmarks<sup>[\[11\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Een modelfamilie (Haiku, Sonnet, Opus) met een contextvenster van tot 200.000 tokens. **Claude 3 Opus** scoort **58,5%** op de MMMU-benchmark. Voor het verbeteren van de veiligheid van de modellen wordt de Constitutional AI-benadering gebruikt<sup>[\[12\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (open model)

Combineert de visuele encoder van CLIP met het taalmodel Vicuna. Beschikbaar in varianten met 7, 13 en 34 miljard parameters. Het model bereikt 85,1% van de relatieve prestaties van GPT-4 op synthetische taken<sup>[\[13\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-llava_paper-13)</sup>.

## Toepassingsgebieden

- **Visuele vraag-en-antwoord (VQA)**: Stelt gebruikers in staat vragen te stellen over visuele content.
- **Documentanalyse**: Moderne MLLM kunnen tot 2000 pagina's per minuut verwerken.
- **Medische beeldvorming**: Modellen zoals **Med-PaLM M** (Google) analyseren medische beelden en klinische gegevens.
- **Robotica**: Modellen zoals **RT-2** (Google DeepMind) stellen robots in staat de visuele omgeving te begrijpen en opdrachten in natuurlijke taal uit te voeren.

## Huidige beperkingen

- **Hallucinaties**: Het hallucinatieniveau in gegenereerde content wordt geschat op 27–46%. Modellen kunnen niet-bestaande objecten beschrijven of visuele informatie onjuist interpreteren<sup>[\[14\]](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_note-arxiv_hallucinations-14)</sup>.
- **Hoge rekenvereisten**: Het trainen en gebruiken van MLLM vereist een aanzienlijke rekeninfrastructuur.
- **Gegevensbias**: Onvoldoende vertegenwoordiging van demografische groepen, talen en culturen in de trainingsdata leidt tot systematische fouten.

## Verwijzingen

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## Literatuur

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## Noten

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodale_grote_taalmodellen#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
