LLaMA (Meta AI) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — famiglia di grandi modelli linguistici (LLM) prevalentemente open source, sviluppata dalla divisione di ricerca Meta AI. I modelli LLaMA sono costruiti su un'architettura transformer modificata e sono orientati all'alta efficienza computazionale, alla democratizzazione dell'accesso alle tecnologie AI avanzate e alla facile adattabilità a compiti specializzati. La famiglia si è evoluta dal rilascio iniziale a scopo di ricerca di LLaMA 1 (febbraio 2023) fino ai modelli multimodali LLaMA 4 (rilascio previsto nel 2026).

Nome

L'acronimo LLaMA sta per Large Language Model Meta AI (Grande Modello Linguistico Meta AI).

  • Large Language Model — sottolinea la scala dei modelli, i cui parametri si misurano da miliardi a trilioni.
  • Meta AI — indica il soggetto sviluppatore, il gruppo di ricerca Meta.

Storia

Lo sviluppo di LLaMA è iniziato alla fine del 2022 come risposta strategica di Meta al successo di ChatGPT di OpenAI. Mark Zuckerberg ha formato un team interdisciplinare che include ricercatori del laboratorio FAIR (Facebook AI Research). Un ruolo chiave nella filosofia del progetto è stato svolto da Yann LeCun, responsabile di FAIR, che dal 2013 ha seguito il principio della piena apertura di tutte le ricerche del laboratorio.

La prima versione, LLaMA 1, è stata rilasciata nel febbraio 2023 con una licenza di ricerca. Subito dopo il rilascio, nel marzo 2023, i pesi del modello sono trapelati in rete tramite BitTorrent. Questo evento, contrariamente ai timori, non ha fermato ma anzi ha accelerato lo sviluppo del progetto, poiché ha offerto a ricercatori indipendenti ed appassionati di tutto il mondo la possibilità di sperimentare con il modello. Di conseguenza, sulla piattaforma Hugging Face sono apparsi decine di migliaia di modelli derivati. Le versioni successive, a partire da LLaMA 2, sono state rilasciate con una licenza commerciale[1], consolidando lo status di LLaMA come attore chiave nel mercato dei modelli AI aperti.

Evoluzione dei modelli e cronologia dei rilasci

Cronologia dello sviluppo dei modelli LLaMA
Versione Data di rilascio Intervallo di parametri Innovazioni e caratteristiche principali
LLaMA 1 Febbraio 2023 7B – 65B Architettura di base (RMSNorm, SwiGLU, RoPE). Addestramento su 1,4 trilioni di token. Finestra contestuale di 2048 token. Licenza di ricerca.
LLaMA 2 Luglio 2023 7B – 70B Fine-tuning per i dialoghi (RLHF). Introduzione del Grouped-Query Attention (GQA). Finestra contestuale di 4096 token. Prima licenza commerciale.
Code Llama Agosto 2023 7B – 70B Versione specializzata per il codice. Fine-tuning su 500 miliardi di token di codice. Varianti: base, specializzata in Python, instruction-tuned.
LLaMA 3 Aprile 2024 8B, 70B Addestramento su 15 trilioni di token. Tokenizzatore migliorato con un vocabolario di 128 mila token. Alte prestazioni (82% su MMLU).
LLaMA 3.1 Luglio 2024[2] 8B, 70B, 405B Modello di punta 405B con prestazioni al livello di GPT-4o. Finestra contestuale fino a 128 mila token. Introdotta la capacità di elaborazione delle immagini.
LLaMA 4 (previsto: aprile 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Architettura Mixture-of-Experts (MoE). Multimodalità nativa (testo, immagini, video). Finestra contestuale fino a 10 milioni di token.

Architettura

LLaMA utilizza un'architettura transformer decoder autoregressiva, ma introduce una serie di miglioramenti chiave che aumentano l'efficienza computazionale e la qualità del testo generato:

  • Pre-normalization (Prenormalizzazione). La normalizzazione viene applicata all'ingresso di ogni sottolivello del transformer, anziché all'uscita. Questo approccio stabilizza l'addestramento di reti molto profonde e previene i problemi con i gradienti.
  • RMSNorm (Root Mean Square Layer Normalization). Al posto della LayerNorm standard viene utilizzata RMSNorm. Questa tecnica di normalizzazione elimina l'operazione di sottrazione della media, velocizzando i calcoli del 10–50% mantenendo la stabilità.
  • SwiGLU (Swish-Gated Linear Unit). Come funzione di attivazione, al posto di ReLU o GELU viene utilizzata SwiGLU. Questo meccanismo di gating crea un flusso di gradiente più fluido e migliora la qualità del modello.
  • RoPE (Rotary Position Embeddings, Embedding posizionali rotazionali). Per la codifica delle posizioni dei token vengono utilizzati gli embedding posizionali relativi RoPE, che consentono al modello di estrapolare meglio su sequenze più lunghe di quelle usate durante l'addestramento.
  • GQA (Grouped-Query Attention). Introdotta in LLaMA 2, questa tecnica è un'ottimizzazione dell'attenzione multi-testa che riduce significativamente i requisiti di memoria e accelera la generazione del testo.
  • Mixture-of-Experts (MoE) (previsto in LLaMA 4). Un'architettura che suddivide i parametri del modello in sottoreti "esperte", attivandone solo una piccola parte per ciascuna richiesta. Questo riduce drasticamente i costi computazionali dell'inferenza.

Configurazioni di LLaMA 1

Parametri architetturali dei modelli LLaMA 1
Modello Parametri Dimensione dello stato nascosto N. di livelli N. di teste di attenzione Volume dei dati di addestramento
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

Dati di addestramento

Il volume dei corpus di addestramento è cresciuto da 1,4 trilioni di token per LLaMA 1 a 15 trilioni per LLaMA 3. Per l'addestramento vengono utilizzate fonti pubblicamente disponibili, tra cui Common Crawl (che costituisce fino al 67% dei dati), C4, GitHub, Wikipedia, Books, ArXiv e Stack Exchange. Per LLaMA 3 sono stati utilizzati anche dati privati di alta qualità.

Prestazioni e confronto

  • Sui benchmark: Il modello LLaMA 3.1 (405B) mostra risultati vicini a GPT-4o: sul test MMLU raggiunge l'88,6%, superato da GPT-4o di soli 0,1 punti percentuali. Sul compito di generazione del codice HumanEval, LLaMA 3.1 ottiene l'89% (GPT-4o — 90,2%).
  • Efficienza parametrica: I modelli LLaMA con un numero inferiore di parametri spesso superano modelli più grandi della concorrenza. Ad esempio, LLaMA 1 (13B) ha superato GPT-3 (175B) nella maggior parte dei test.
  • Costo: Con l'hosting locale, il costo dell'inferenza di LLaMA può essere fino a 50 volte inferiore rispetto all'utilizzo di API proprietarie, rendendo la tecnologia accessibile alle piccole e medie imprese.

Licenza

  • LLaMA 1 era distribuita con una licenza di ricerca non commerciale con accesso su richiesta.
  • LLaMA 2 e versioni successive sono distribuite con la licenza Llama Community License, che consente l'uso commerciale e la modifica. Tuttavia, la licenza contiene restrizioni: le aziende con più di 700 milioni di utenti attivi mensili devono ottenere un'autorizzazione speciale da Meta. Ciò alimenta il dibattito sulla piena apertura di LLaMA.

Applicazioni

I modelli LLaMA sono integrati nei prodotti di migliaia di aziende e vengono utilizzati in vari ambiti:

  • Settore aziendale: Zoom utilizza LLaMA in AI Companion per i riassunti delle riunioni; Shopify — per elaborare 40–60 milioni di richieste al giorno per l'arricchimento dei metadati dei prodotti; Instacart — nell'assistente interno Ava.
  • Scienza e società: Meditron (adattamento di LLaMA) viene utilizzato per la diagnosi medica in regioni con risorse limitate;
  • Settore pubblico e industria: Meta ha concluso partnership con Lockheed Martin e Palantir. La NASA utilizza LLaMA 3 sulla ISS come assistente offline per eseguire operazioni critiche senza collegamento con la Terra.

Limitazioni e critiche

  • Bias e sicurezza: Audit indipendenti mostrano che i modelli LLaMA, nonostante le misure di sicurezza, possono riprodurre stereotipi dannosi. La diffusione dei pesi di LLaMA 1 ha acuito le questioni relative al potenziale uso malevolo della tecnologia.
  • Lacune nelle conoscenze: In ambiti altamente specializzati, LLaMA può mostrare lacune. Ad esempio, l'accuratezza sul test medico nephSAP è stata del 17–30% contro il 73% di GPT-4.
  • Consumo energetico: L'addestramento di modelli di grandi dimensioni richiede enormi risorse. L'addestramento di LLaMA 1 ha richiesto 2.638 MWh, equivalente alle emissioni di 1.015 tonnellate di CO₂.

Sviluppi futuri

Meta prevede di investire fino a 65 miliardi di dollari in infrastrutture AI entro il 2025. È in sviluppo il modello LLaMA 4 Behemoth con 2 trilioni di parametri, che supporterà più di 200 lingue e riceverà una profonda integrazione con i prodotti del metaverso.

Vedi anche

  • GPT
  • Grandi modelli linguistici
  • Transformer (architettura di rete neurale)

Bibliografia

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Note

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.