---
title: "Multimodal large language models (IT)"
source: "https://systems-analysis.info/int/Multimodal_large_language_models_(IT)"
wiki: "systems-analysis.info/int"
article: "Multimodal_large_language_models_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4751
wiki_created_at: 2026-09-06T23:39:24Z
wiki_modified_at: 2026-09-06T23:39:24Z
downloaded_at: 2026-09-07T23:04:23Z
---

# Multimodal large language models (IT)

**I modelli linguistici di grandi dimensioni multimodali** (in inglese **Multimodal Large Language Models, MLLMs**) sono una classe di modelli di intelligenza artificiale in grado di elaborare e generare informazioni in diverse modalità, tra cui testo, immagini, audio e video<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-encord_intro-1)</sup>. A differenza dei modelli linguistici unimodali, che lavorano esclusivamente con il testo, gli MLLM integrano informazioni provenienti da fonti diverse per risolvere compiti complessi di comprensione e generazione di contenuti.

Il concetto fondamentale degli MLLM consiste nella creazione di una rappresentazione vettoriale unificata (embedding) per le diverse modalità. Ciò consente al modello di stabilire relazioni semantiche tra, ad esempio, un'immagine e la sua descrizione testuale<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-acm_survey-2)</sup>. La svolta chiave che ha posto le basi degli MLLM moderni è stato l'utilizzo dell'apprendimento contrastivo per allineare le rappresentazioni visive e testuali in uno spazio di caratteristiche comune, come realizzato nel modello **CLIP**<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-radford2021-3)</sup>.

## Storia dello sviluppo

### Periodo iniziale (2013–2020)

Le basi concettuali dell'IA multimodale furono gettate nel 2013, quando ricercatori di Stanford dimostrarono la possibilità di apprendimento zero-shot utilizzando rappresentazioni vettoriali delle parole<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-deoldify2013-4)</sup>. Nel 2016, il team **FAIR** (Meta AI) mostrò l'efficacia dell'utilizzo di descrizioni in linguaggio naturale per addestrare modelli di visione artificiale, raggiungendo l'11,5% di accuratezza su ImageNet senza addestramento diretto<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-openai_fair_2016-5)</sup>.

### L'era di CLIP (2021)

Il momento rivoluzionario fu il rilascio del modello **CLIP** (*Contrastive Language-Image Pre-training*) da parte di OpenAI nel gennaio 2021. Il modello, addestrato su 400 milioni di coppie immagine-testo, dimostrò la capacità di classificare immagini senza addestramento specializzato su compiti specifici. CLIP è diventato la base di molti MLLM successivi<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-stanford_cs_clip-6)</sup>.

### Scalabilità e innovazioni (2022–2024)

Dopo il successo di CLIP, sono emersi numerosi modelli chiave:

- **Flamingo** (DeepMind, 2022) — modello da 80 miliardi di parametri, che ha mostrato eccezionali capacità di apprendimento con pochi esempi.
- **BLIP** (Salesforce, 2022) — architettura unificata per la comprensione e la generazione.
- **GPT-4V** (OpenAI, 2023) — primo modello multimodale commerciale di tale portata.
- **LLaVA** (Microsoft, 2023) — popolare alternativa open source a GPT-4V.
- **Gemini** (Google, 2023) — architettura nativamente multimodale, progettata sin dall'origine per lavorare con diversi tipi di dati.
- **GPT-4o** (OpenAI, 2024) — modello in grado di elaborare testo, audio e video in tempo reale con bassa latenza<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-encord_intro-1)</sup>.
- **Claude 3.5 Sonnet** (Anthropic, 2024) — modello con capacità migliorate di analisi delle informazioni visive.

## Approcci architetturali

### Architettura Dual-Encoder

Utilizza encoder separati per ciascuna modalità, che proiettano i dati in uno spazio di rappresentazione comune. Un esempio emblematico è **CLIP**, in cui un transformer visivo elabora le immagini e uno testuale elabora i dati linguistici. I vantaggi sono la modularità e l'efficienza computazionale; lo svantaggio è la limitata interazione cross-modale<sup>[\[7\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-viso_ai_mllm-7)</sup>.

### Architettura encoder-decoder

Un encoder unificato elabora l'input multimodale, mentre un decoder genera l'output testuale. Il modello **Flamingo** utilizza il meccanismo *Perceiver Resampler* per elaborare input visivi di lunghezza variabile e strati di attenzione cross-modale. Questo approccio garantisce una ricca interazione inter-modale, ma richiede maggiori risorse computazionali<sup>[\[8\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-determined_ai_arch-8)</sup>.

### Architettura di allineamento (Alignment)

Questo approccio utilizza encoder pre-addestrati congelati, collegati tramite un piccolo modulo di allineamento addestrabile. Ad esempio, **BLIP-2** utilizza il **Q-Former** (*Querying Transformer*) come elemento di collegamento leggero tra l'encoder visivo congelato e il modello linguistico, richiedendo un numero significativamente inferiore di parametri addestrabili<sup>[\[9\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-clarifai_blip2-9)</sup>.

## Modelli principali

### GPT-4V / GPT-4o (OpenAI)

La famiglia di modelli GPT-4 conta, secondo le stime, fino a **1,8 trilioni** di parametri (nell'architettura a miscela di esperti). Il modello **GPT-4o**, rilasciato nel maggio 2024, supporta l'elaborazione di testo, immagini, audio e video in tempo reale. Sul benchmark **MMMU** raggiunge il **69,1%** di accuratezza<sup>[\[10\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-encord_mmmu_perf-10)</sup>.

### Gemini (Google)

Architettura nativamente multimodale, addestrata da zero su testo, immagini, audio e video. **Gemini 1.5 Pro** supporta una finestra di contesto fino a **10 milioni di token** e supera GPT-4 in 30 dei 32 benchmark più diffusi<sup>[\[11\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-daveai_gemini-11)</sup>.

### Claude 3 (Anthropic)

Famiglia di modelli (Haiku, Sonnet, Opus) con una finestra di contesto fino a 200.000 token. **Claude 3 Opus** raggiunge il **58,5%** sul benchmark MMMU. Per migliorare la sicurezza dei modelli viene utilizzato l'approccio Constitutional AI<sup>[\[12\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-anthropic_claude3-12)</sup>.

### LLaVA (modello open source)

Combina l'encoder visivo CLIP con il modello linguistico Vicuna. Sono disponibili varianti con 7, 13 e 34 miliardi di parametri. Il modello raggiunge l'85,1% delle prestazioni relative di GPT-4 su compiti sintetici<sup>[\[13\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-llava_paper-13)</sup>.

## Aree di applicazione

- **Visual Question Answering (VQA)**: Consente agli utenti di porre domande su contenuti visivi.
- **Analisi di documenti**: Gli MLLM moderni sono in grado di elaborare fino a 2.000 pagine al minuto.
- **Imaging medico**: Modelli come **Med-PaLM M** (Google) analizzano immagini mediche e dati clinici.
- **Robotica**: Modelli come **RT-2** (Google DeepMind) consentono ai robot di comprendere l'ambiente visivo ed eseguire comandi in linguaggio naturale.

## Limitazioni attuali

- **Allucinazioni**: Il tasso di allucinazioni nei contenuti generati è stimato tra il 27% e il 46%. I modelli possono descrivere oggetti inesistenti o interpretare erroneamente le informazioni visive<sup>[\[14\]](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_note-arxiv_hallucinations-14)</sup>.
- **Elevati requisiti computazionali**: L'addestramento e l'utilizzo degli MLLM richiedono un'infrastruttura computazionale significativa.
- **Bias nei dati**: La scarsa rappresentazione di gruppi demografici, lingue e culture nei dati di addestramento genera errori sistematici.

## Riferimenti

- A Comprehensive Guide to Multimodal LLMs (Encord Blog)
- Multimodal LLMs: The Complete Guide (Viso.ai)

## Bibliografia

- Radford, A. et al. (2021). *Learning Transferable Visual Models From Natural Language Supervision*. arXiv:2103.00020.
- Alayrac, J.-B. et al. (2022). *Flamingo: a Visual Language Model for Few-Shot Learning*. arXiv:2204.14198.
- Li, J. et al. (2022). *BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation*. arXiv:2201.12086.
- Li, J. et al. (2023). *BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models*. arXiv:2301.12597.
- Liu, H. et al. (2023). *Visual Instruction Tuning*. arXiv:2304.08485.
- Driess, K. et al. (2023). *PaLM-E: An Embodied Multimodal Language Model*. arXiv:2303.03378.
- Brohan, A. et al. (2023). *RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control*. arXiv:2307.15818.
- Yue, X. et al. (2023). *MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI*. arXiv:2311.16502.
- Tsimpoukelli, M. et al. (2021). *Multimodal Few-Shot Learning with Frozen Language Models*. arXiv:2106.13884.
- Singhal, K. et al. (2023). *Med-PaLM 2: Towards Expert-Level Medical Question Answering with Large Language Models*. arXiv:2305.09617.
- Yin, S. et al. (2023). *A Survey on Multimodal Large Language Models*. arXiv:2306.13549.

## Note

1.  <span id="cite_note-encord_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-encord_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-encord_intro_1-1)</sup> «A Comprehensive Guide to Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/a-comprehensive-guide-to-multimodal-llms/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acm_survey-2">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-acm_survey_2-0) «A Survey on Multimodal Large Language Models». *ACM Computing Surveys*. <a href="https://dl.acm.org/doi/10.1145/3626125" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-radford2021-3">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-radford2021_3-0) Radford, A., et al. «Learning Transferable Visual Models From Natural Language Supervision». *arXiv:2103.00020*. <a href="https://arxiv.org/abs/2103.00020" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-deoldify2013-4">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-deoldify2013_4-0) DeOldify, J. «Zero-Shot Learning by Predicting Attributes». *arXiv:1312.5650*. <a href="https://arxiv.org/abs/1312.5650" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-openai_fair_2016-5">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-openai_fair_2016_5-0) «Learning from captions: A milestone in visual language understanding». *OpenAI Blog*. <a href="https://openai.com/blog/learning-from-captions/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-stanford_cs_clip-6">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-stanford_cs_clip_6-0) «Understanding CLIP». *Stanford CS231n*. <a href="https://cs231n.github.io/understanding-visual-representations/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-viso_ai_mllm-7">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-viso_ai_mllm_7-0) «Multimodal LLMs: The Complete Guide». *Viso.ai*. <a href="https://viso.ai/deep-learning/multimodal-llms/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-determined_ai_arch-8">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-determined_ai_arch_8-0) «The Architectures of Multimodal Language Models». *Determined AI*. <a href="https://determined.ai/the-architectures-of-multimodal-language-models/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-clarifai_blip2-9">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-clarifai_blip2_9-0) «Understanding BLIP-2: The New Vision-Language Model». *Clarifai Blog*. <a href="https://www.clarifai.com/blog/understanding-blip-2-the-new-vision-language-model" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-encord_mmmu_perf-10">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-encord_mmmu_perf_10-0) «MMMU: A New Benchmark for Multimodal LLMs». *Encord Blog*. <a href="https://encord.com/blog/mmmu-benchmark/" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-daveai_gemini-11">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-daveai_gemini_11-0) «Google Gemini: A Deep Dive». *DaveAI Blog*. <a href="https://dave.ai/blog/google-gemini-a-deep-dive/" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-anthropic_claude3-12">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-anthropic_claude3_12-0) «Introducing the Claude 3 Family». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-llava_paper-13">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-llava_paper_13-0) Liu, H., et al. «Visual Instruction Tuning». *arXiv:2304.08485*. <a href="https://arxiv.org/abs/2304.08485" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-arxiv_hallucinations-14">[↑](https://systems-analysis.info/int/Multimodal_large_language_models_(IT)#cite_ref-arxiv_hallucinations_14-0) «Hallucinations in Multimodal Large Language Models». *arXiv:2308.08726*. <a href="https://arxiv.org/abs/2308.08726" class="external autonumber" rel="nofollow">[14]</a></span>
