---
title: "LLM multimodaux"
source: "https://systems-analysis.info/int/LLM_multimodaux"
wiki: "systems-analysis.info/int"
article: "LLM_multimodaux"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3652
wiki_created_at: 2026-09-06T23:23:58Z
wiki_modified_at: 2026-09-06T23:23:58Z
downloaded_at: 2026-09-07T22:58:07Z
---

# LLM multimodaux

**Les grands modèles de langage multimodaux** (en anglais **Multimodal Large Language Models, MLLM**) sont une classe de modèles d'intelligence artificielle capables de traiter et de générer des informations dans diverses modalités, notamment le texte, les images, l'audio et la vidéo<sup>[\[1\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-encord_intro-1)</sup>. Contrairement aux modèles de langage unimodaux qui fonctionnent exclusivement avec du texte, les MLLM intègrent des informations provenant de différentes sources pour résoudre des tâches complexes de compréhension et de génération de contenu.

Le concept fondamental des MLLM réside dans la création d'une représentation vectorielle unifiée (embedding) pour différentes modalités. Cela permet au modèle d'établir des liens sémantiques entre, par exemple, une image et sa description textuelle<sup>[\[2\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-acm_survey-2)</sup>. L'avancée majeure qui a jeté les bases des MLLM modernes a été l'utilisation de l'apprentissage contrastif pour aligner les représentations visuelles et textuelles dans un espace de caractéristiques commun, comme cela a été mis en œuvre dans le modèle **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-radford2021-3)</sup>.

## Historique du développement

### Débuts (2013–2020)

Les fondements conceptuels de l'IA multimodale ont été posés en 2013, lorsque des chercheurs de Stanford ont démontré la possibilité de l'apprentissage zero-shot (zero-shot learning) en utilisant des représentations vectorielles de mots<sup>[\[4\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-deoldify2013-4)</sup>. En 2016, l'équipe de **FAIR** (Meta AI) a montré l'efficacité de l'utilisation de descriptions en langage naturel pour entraîner des modèles de vision par ordinateur, atteignant une précision de 11,5 % sur ImageNet sans entraînement direct<sup>[\[5\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-openai_fair_2016-5)</sup>.

### L'ère de CLIP (2021)

Le lancement du modèle **CLIP** (*Contrastive Language-Image Pre-training*) par OpenAI en janvier 2021 a marqué un tournant révolutionnaire. Le modèle, entraîné sur 400 millions de paires image-texte, a démontré sa capacité à classifier des images sans entraînement spécialisé sur des tâches spécifiques. CLIP est devenu la base de nombreux MLLM ultérieurs<sup>[\[6\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-stanford_cs_clip-6)</sup>.

### Mise à l'échelle et innovations (2022–2024)

Après le succès de CLIP, de nombreux modèles clés ont vu le jour :

- **Flamingo** (DeepMind, 2022) — un modèle de 80 milliards de paramètres qui a démontré des capacités exceptionnelles d'apprentissage avec peu d'exemples (few-shot learning).
- **BLIP** (Salesforce, 2022) — une architecture unifiée pour la compréhension et la génération.
- **GPT-4V** (OpenAI, 2023) — le premier modèle multimodal commercial de cette envergure.
- **LLaVA** (Microsoft, 2023) — une alternative open source populaire à GPT-4V.
- **Gemini** (Google, 2023) — une architecture nativement multimodale, conçue dès le départ pour fonctionner avec différents types de données.
- **GPT-4o** (OpenAI, 2024) — un modèle capable de traiter le texte, l'audio et la vidéo en temps réel avec une faible latence<sup>[\[1\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — un modèle doté de capacités améliorées pour l'analyse d'informations visuelles.

## Approches architecturales

### Architecture à double encodeur (Dual-Encoder)

Cette approche utilise des encodeurs distincts pour chaque modalité, qui projettent les données dans un espace de représentation commun. Un exemple marquant est **CLIP**, où un transformeur visuel traite les images et un transformeur textuel traite les données linguistiques. Les avantages sont la modularité et l'efficacité computationnelle, tandis que l'inconvénient est une interaction intermodale limitée<sup>[\[7\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-viso_ai_mllm-7)</sup>.

### Architecture encodeur-décodeur

Un encodeur unique traite l'entrée multimodale, tandis qu'un décodeur génère la sortie textuelle. Le modèle **Flamingo** utilise un mécanisme de *Perceiver Resampler* pour traiter les entrées visuelles de longueur variable et des couches d'attention intermodale. Cette approche permet une riche interaction intermodale, mais elle est gourmande en ressources de calcul<sup>[\[8\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-determined_ai_arch-8)</sup>.

### Architecture d'alignement (Alignment)

Cette approche utilise des encodeurs pré-entraînés et gelés, connectés par un petit module d'alignement entraînable. Par exemple, **BLIP-2** utilise un **Q-Former** (*Querying Transformer*) comme un connecteur léger entre un encodeur visuel gelé et un modèle de langage, ce qui réduit considérablement le nombre de paramètres à entraîner<sup>[\[9\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-clarifai_blip2-9)</sup>.

## Modèles principaux

### GPT-4V / GPT-4o (OpenAI)

La famille de modèles GPT-4 est estimée à **1,8 billion** de paramètres (dans une architecture de mélange d'experts). Le modèle **GPT-4o**, lancé en mai 2024, prend en charge le traitement en temps réel du texte, des images, de l'audio et de la vidéo. Sur le benchmark **MMMU**, il atteint une précision de **69,1 %**<sup>[\[10\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Une architecture nativement multimodale, entraînée dès le départ sur du texte, des images, de l'audio et de la vidéo. **Gemini 1.5 Pro** prend en charge une fenêtre de contexte allant jusqu'à **10 millions de tokens** et surpasse GPT-4 sur 30 des 32 benchmarks populaires<sup>[\[11\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Une famille de modèles (Haiku, Sonnet, Opus) avec une fenêtre de contexte allant jusqu'à 200 000 tokens. **Claude 3 Opus** atteint **58,5 %** sur le benchmark MMMU. Pour améliorer la sécurité du modèle, l'approche de l'Constitutional AI est utilisée<sup>[\[12\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (modèle open source)

Combine l'encodeur visuel de CLIP avec le modèle de langage Vicuna. Des variantes avec 7, 13 et 34 milliards de paramètres sont disponibles. Le modèle atteint 85,1 % de la performance relative de GPT-4 sur des tâches synthétiques<sup>[\[13\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-llava_paper-13)</sup>.

## Domaines d'application

- **Questions-réponses visuelles (VQA)** : Permettent aux utilisateurs de poser des questions sur du contenu visuel.
- **Analyse de documents** : Les MLLM modernes peuvent traiter jusqu'à 2000 pages par minute.
- **Imagerie médicale** : Des modèles comme **Med-PaLM M** (Google) analysent des images médicales et des données cliniques.
- **Robotique** : Des modèles comme **RT-2** (Google DeepMind) permettent aux robots de comprendre leur environnement visuel et d'exécuter des commandes en langage naturel.

## Limites actuelles

- **[Hallucinations](https://systems-analysis.info/int/Hallucinations_et_r%C3%A9ponses_incorrectes_des_LLM "Hallucinations et réponses incorrectes des LLM")** : Le taux d'hallucination dans le contenu généré est estimé entre 27 et 46 %. Les modèles peuvent décrire des objets inexistants ou interpréter de manière erronée des informations visuelles<sup>[\[14\]](https://systems-analysis.info/int/LLM_multimodaux#cite_note-arxiv_hallucinations-14)</sup>.
- **Exigences de calcul élevées** : L'entraînement et l'utilisation des MLLM nécessitent une infrastructure de calcul considérable.
- **Biais dans les données** : Une représentation insuffisante de certains groupes démographiques, langues et cultures dans les données d'entraînement conduit à des erreurs systématiques.

## Liens externes

- <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external text" rel="nofollow">A Comprehensive Guide to Multimodal LLMs (Encord Blog)</a>
- <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external text" rel="nofollow">Multimodal LLMs: The Complete Guide (Viso.ai)</a>

## Bibliographie

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. <a href="https://arxiv.org/abs/2103.00020" class="external text" rel="nofollow">arXiv:2103.00020</a>.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. <a href="https://arxiv.org/abs/2204.14198" class="external text" rel="nofollow">arXiv:2204.14198</a>.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. <a href="https://arxiv.org/abs/2201.12086" class="external text" rel="nofollow">arXiv:2201.12086</a>.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. <a href="https://arxiv.org/abs/2301.12597" class="external text" rel="nofollow">arXiv:2301.12597</a>.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. <a href="https://arxiv.org/abs/2304.08485" class="external text" rel="nofollow">arXiv:2304.08485</a>.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. <a href="https://arxiv.org/abs/2303.03378" class="external text" rel="nofollow">arXiv:2303.03378</a>.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. <a href="https://arxiv.org/abs/2307.15818" class="external text" rel="nofollow">arXiv:2307.15818</a>.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. <a href="https://arxiv.org/abs/2311.16502" class="external text" rel="nofollow">arXiv:2311.16502</a>.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. <a href="https://arxiv.org/abs/2106.13884" class="external text" rel="nofollow">arXiv:2106.13884</a>.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. <a href="https://arxiv.org/abs/2305.09617" class="external text" rel="nofollow">arXiv:2305.09617</a>.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. <a href="https://arxiv.org/abs/2306.13549" class="external text" rel="nofollow">arXiv:2306.13549</a>.

## Références

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/LLM_multimodaux#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
