---
title: "Multimodale LLMs"
source: "https://systems-analysis.info/int/Multimodale_LLMs"
wiki: "systems-analysis.info/int"
article: "Multimodale_LLMs"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4792
wiki_created_at: 2026-09-06T23:39:58Z
wiki_modified_at: 2026-09-06T23:39:58Z
downloaded_at: 2026-09-07T23:04:38Z
---

# Multimodale LLMs

**Multimodale große Sprachmodelle** (englisch **Multimodal Large Language Models, MLLMs**) sind eine Klasse von Modellen der künstlichen Intelligenz, die in der Lage sind, Informationen in verschiedenen Modalitäten zu verarbeiten und zu generieren, einschließlich Text, Bildern, Audio und Video<sup>[\[1\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-encord_intro-1)</sup>. Im Gegensatz zu unimodalen Sprachmodellen, die ausschließlich mit Text arbeiten, integrieren MLLMs Informationen aus verschiedenen Quellen, um komplexe Aufgaben des Verstehens und der Generierung von Inhalten zu lösen.

Das Kernkonzept von MLLMs besteht darin, eine einheitliche Vektorrepräsentation (Embedding) für verschiedene Modalitäten zu erstellen. Dies ermöglicht es dem Modell, semantische Verbindungen beispielsweise zwischen einem Bild und seiner textuellen Beschreibung herzustellen<sup>[\[2\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-acm_survey-2)</sup>. Der entscheidende Durchbruch, der die Grundlage für moderne MLLMs legte, war die Anwendung des kontrastiven Lernens zum Abgleich visueller und textueller Repräsentationen in einem gemeinsamen Merkmalsraum, wie es im Modell **CLIP** implementiert wurde<sup>[\[3\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-radford2021-3)</sup>.

## Entwicklungsgeschichte

### Frühe Phase (2013–2020)

Die konzeptionellen Grundlagen multimodaler KI wurden 2013 gelegt, als Forscher aus Stanford die Möglichkeit des Zero-Shot-Lernens unter Verwendung von Wortvektorrepräsentationen demonstrierten<sup>[\[4\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-deoldify2013-4)</sup>. Im Jahr 2016 zeigte das Team von **FAIR** (Meta AI) die Effektivität der Verwendung natürlichsprachlicher Beschreibungen für das Training von Computer-Vision-Modellen und erreichte eine Genauigkeit von 11,5 % auf ImageNet ohne direktes Training<sup>[\[5\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-openai_fair_2016-5)</sup>.

### Die CLIP-Ära (2021)

Ein revolutionärer Moment war die Veröffentlichung des Modells **CLIP** (*Contrastive Language-Image Pre-training*) durch OpenAI im Januar 2021. Das auf 400 Millionen Bild-Text-Paaren trainierte Modell zeigte die Fähigkeit, Bilder ohne spezialisiertes Training für bestimmte Aufgaben zu klassifizieren. CLIP wurde zur Grundlage für viele nachfolgende MLLMs<sup>[\[6\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-stanford_cs_clip-6)</sup>.

### Skalierung und Innovationen (2022–2024)

Nach dem Erfolg von CLIP erschienen zahlreiche Schlüsselmodelle:

- **Flamingo** (DeepMind, 2022) – ein 80-Milliarden-Parameter-Modell, das herausragende Fähigkeiten im Few-Shot-Learning zeigte.
- **BLIP** (Salesforce, 2022) – eine vereinheitlichte Architektur für Verstehen und Generierung.
- **GPT-4V** (OpenAI, 2023) – das erste kommerzielle multimodale Modell dieser Größenordnung.
- **LLaVA** (Microsoft, 2023) – eine beliebte Open-Source-Alternative zu GPT-4V.
- **Gemini** (Google, 2023) – eine nativ multimodale Architektur, die von Grund auf für die Arbeit mit verschiedenen Datentypen konzipiert wurde.
- **GPT-4o** (OpenAI, 2024) – ein Modell, das Text, Audio und Video in Echtzeit mit geringer Latenz verarbeiten kann<sup>[\[1\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) – ein Modell mit verbesserten Fähigkeiten zur Analyse visueller Informationen.

## Architektonische Ansätze

### Dual-Encoder-Architektur

Diese Architektur verwendet separate Encoder für jede Modalität, die die Daten in einen gemeinsamen Repräsentationsraum projizieren. Ein prominentes Beispiel ist **CLIP**, bei dem ein visueller Transformer Bilder und ein Text-Transformer Sprachdaten verarbeitet. Vorteile sind Modularität und Recheneffizienz, ein Nachteil ist die begrenzte cross-modale Interaktion<sup>[\[7\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-viso_ai_mllm-7)</sup>.

### Encoder-Decoder-Architektur

Ein einziger Encoder verarbeitet den multimodalen Input, während ein Decoder die Textausgabe generiert. Das Modell **Flamingo** nutzt den *Perceiver Resampler*-Mechanismus zur Verarbeitung visueller Eingaben variabler Länge sowie cross-modale Attention-Layer. Dieser Ansatz ermöglicht eine reichhaltige intermodale Interaktion, erfordert jedoch hohe Rechenressourcen<sup>[\[8\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-determined_ai_arch-8)</sup>.

### Alignment-Architektur

Dieser Ansatz verwendet eingefrorene (frozen) vortrainierte Encoder, die durch ein kleines, trainierbares Alignment-Modul verbunden sind. Zum Beispiel nutzt **BLIP-2** den **Q-Former** (*Querying Transformer*) als leichtgewichtiges Verbindungselement zwischen einem eingefrorenen visuellen Encoder und einem Sprachmodell, was deutlich weniger trainierbare Parameter erfordert<sup>[\[9\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-clarifai_blip2-9)</sup>.

## Wichtige Modelle

### GPT-4V / GPT-4o (OpenAI)

Die GPT-4-Modellfamilie umfasst schätzungsweise bis zu **1,8 Billionen** Parameter (in einer Mixture-of-Experts-Architektur). Das im Mai 2024 veröffentlichte Modell **GPT-4o** unterstützt die Echtzeitverarbeitung von Text, Bildern, Audio und Video. Im **MMMU**-Benchmark erreicht es eine Genauigkeit von **69,1 %**<sup>[\[10\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Eine nativ multimodale Architektur, die von Grund auf mit Text, Bildern, Audio und Video trainiert wurde. **Gemini 1.5 Pro** unterstützt ein Kontextfenster von bis zu **10 Millionen Token** und übertrifft GPT-4 in 30 von 32 gängigen Benchmarks<sup>[\[11\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Eine Modellfamilie (Haiku, Sonnet, Opus) mit einem Kontextfenster von bis zu 200.000 Token. **Claude 3 Opus** erreicht **58,5 %** im MMMU-Benchmark. Zur Erhöhung der Modellsicherheit wird der Ansatz der [Constitutional AI](https://systems-analysis.info/int/Constitutional_AI "Constitutional AI") verwendet<sup>[\[12\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (Open-Source-Modell)

Kombiniert den visuellen Encoder von CLIP mit dem Sprachmodell Vicuna. Es sind Varianten mit 7, 13 und 34 Milliarden Parametern verfügbar. Das Modell erreicht 85,1 % der relativen Leistung von GPT-4 bei synthetischen Aufgaben<sup>[\[13\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-llava_paper-13)</sup>.

## Anwendungsbereiche

- **Visuelle Frage-Antwort-Systeme (VQA)**: Ermöglichen es Benutzern, Fragen zu visuellen Inhalten zu stellen.
- **Dokumentenanalyse**: Moderne MLLMs können bis zu 2.000 Seiten pro Minute verarbeiten.
- **Medizinische Bildgebung**: Modelle wie **Med-PaLM M** (Google) analysieren medizinische Bilder und klinische Daten.
- **Robotik**: Modelle wie **RT-2** (Google DeepMind) ermöglichen es Robotern, die visuelle Umgebung zu verstehen und Befehle in natürlicher Sprache auszuführen.

## Aktuelle Einschränkungen

- **Halluzinationen**: Die Rate der Halluzinationen im generierten Inhalt wird auf 27–46 % geschätzt. Modelle können nicht existierende Objekte beschreiben oder visuelle Informationen falsch interpretieren<sup>[\[14\]](https://systems-analysis.info/int/Multimodale_LLMs#cite_note-arxiv_hallucinations-14)</sup>.
- **Hohe Rechenanforderungen**: Das Training und der Einsatz von MLLMs erfordern eine erhebliche Recheninfrastruktur.
- **Datenverzerrung (Bias)**: Eine unzureichende Repräsentation demografischer Gruppen, Sprachen und Kulturen in den Trainingsdaten führt zu systematischen Fehlern.

## Weblinks

- <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external text" rel="nofollow">A Comprehensive Guide to Multimodal LLMs (Encord Blog)</a>
- <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external text" rel="nofollow">Multimodal LLMs: The Complete Guide (Viso.ai)</a>

## Literatur

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. <a href="https://arxiv.org/abs/2201.12086" class="external text" rel="nofollow">arXiv:2201.12086</a>.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. <a href="https://arxiv.org/abs/2301.12597" class="external text" rel="nofollow">arXiv:2301.12597</a>.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. <a href="https://arxiv.org/abs/2304.08485" class="external text" rel="nofollow">arXiv:2304.08485</a>.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. <a href="https://arxiv.org/abs/2307.15818" class="external text" rel="nofollow">arXiv:2307.15818</a>.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. <a href="https://arxiv.org/abs/2311.16502" class="external text" rel="nofollow">arXiv:2311.16502</a>.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. <a href="https://arxiv.org/abs/2106.13884" class="external text" rel="nofollow">arXiv:2106.13884</a>.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2306.13549" class="external text" rel="nofollow">arXiv:2306.13549</a>.

## Einzelnachweise

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-encord_intro_1-1)</sup> „A Comprehensive Guide to Multimodal LLMs“. *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-acm_survey_2-0) „A Survey on Multimodal Large Language Models“. *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-radford2021_3-0) Radford, A., et al. „Learning Transferable Visual Models From Natural Language Supervision“. *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-deoldify2013_4-0) DeOldify, J. „Zero-Shot Learning by Predicting Attributes“. *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-openai_fair_2016_5-0) „Learning from captions: A milestone in visual language understanding“. *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-stanford_cs_clip_6-0) „Understanding CLIP“. *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-viso_ai_mllm_7-0) „Multimodal LLMs: The Complete Guide“. *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-determined_ai_arch_8-0) „The Architectures of Multimodal Language Models“. *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-clarifai_blip2_9-0) „Understanding BLIP-2: The New Vision-Language Model“. *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-encord_mmmu_perf_10-0) „MMMU: A New Benchmark for Multimodal LLMs“. *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-daveai_gemini_11-0) „Google Gemini: A Deep Dive“. *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-anthropic_claude3_12-0) „Introducing the Claude 3 Family“. *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-llava_paper_13-0) Liu, H., et al. „Visual Instruction Tuning“. *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodale_LLMs#cite_ref-arxiv_hallucinations_14-0) „Hallucinations in Multimodal Large Language Models“. *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
