---
title: "Architetture LLM"
source: "https://systems-analysis.info/int/Architetture_LLM"
wiki: "systems-analysis.info/int"
article: "Architetture_LLM"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 440
wiki_created_at: 2026-09-06T22:33:47Z
wiki_modified_at: 2026-09-06T22:33:47Z
downloaded_at: 2026-09-07T22:40:05Z
---

# Architetture LLM

**Le architetture dei modelli linguistici di grandi dimensioni (LLM)** sono i principi fondamentali e le strutture che determinano come i grandi modelli linguistici vengono costruiti, addestrati e funzionano. Gli LLM moderni, capaci di comprendere e generare il linguaggio umano, si basano quasi interamente sull'architettura **Transformer**<sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)</sup>, ma includono numerosi miglioramenti e approcci diversi volti ad aumentare l'efficienza, la scalabilità e le capacità.

## Famiglie di architetture LLM (transformer)

I moderni modelli linguistici di grandi dimensioni si basano sull'architettura transformer<sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)</sup>, ma la utilizzano in modi diversi a seconda dell'obiettivo: comprendere il testo, generare una continuazione o trasformare un testo in un altro. In pratica si distinguono tre famiglie, mantenendo i principi di base del transformer<sup>[\[2\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-2)[\[3\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-3)[\[4\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-4)</sup>.

### 1. Encoder‑only (solo codificatore, solo encoder)

Il modello utilizza solo lo stack degli encoder e considera l'intero testo in ingresso in modo bidirezionale. Il pre-addestramento è solitamente strutturato come masked‑language modeling (MLM, modellazione linguistica con mascheramento): una parte dei token viene nascosta e il modello impara a ripristinarli dal contesto circostante. Grazie al contesto bidirezionale, questi modelli eccellono nei compiti di comprensione e scoring: classificazione, riconoscimento di entità, re-ranking di documenti e QA estrattivo. Non sono progettati per la generazione autoregressiva "da zero".

In pratica vengono applicati anche obiettivi di pre-addestramento alternativi per la famiglia encoder‑only: *replaced token detection (RTD) in ELECTRA* (il modello discriminatore riconosce i token sostituiti) e *apprendimento contrastivo* di bi-encoder per la ricerca semantica/retrieval (InfoNCE/softmax‑loss su coppie «query-documento», come in Dense Passage Retrieval). Quando utilizzati in RAG, gli encoder‑only fungono da *bi-encoder* (codifica separata di query e documento per una rapida ricerca ANN) oppure da *cross-encoder* (codifica congiunta della coppia per un re-ranking preciso).

**Vantaggi:**

- Elevata qualità di comprensione del testo grazie al contesto bidirezionale: classificazione, NER, estrazione di fatti, re-ranking, QA estrattivo.
- Elaborazione parallela e alta velocità di throughput: un singolo passaggio diretto senza auto-regressione; comodo per il batching di scoring massivo.
- Integrazione naturale con la ricerca e RAG: nel ruolo di bi-encoder — ricerca semantica rapida; nel ruolo di cross-encoder — re-ranking preciso.
- Adattamento efficiente: varianti relativamente compatte (≈100–300 milioni di parametri; BERT‑base ≈110 milioni) forniscono alta qualità dopo il fine-tuning mirato.
- Latenza stabile, indipendente dalla lunghezza della risposta generata (nessuna decodifica passo-passo); adatti per lo scoring offline di grandi collezioni.
- Possibilità di aumentare la finestra di contesto degli encoder tramite posizioni relative/rotazionali e/o attention sparse locale (es. Longformer/BigBird), utile per documenti lunghi.

**Svantaggi:**

- Nessuna capacità generativa propria: per dialoghi e risposte articolate è necessario un decoder o un modulo generativo esterno.
- Limitazioni negli scenari interattivi: nessuna generazione graduale con mantenimento dello stato.
- Disallineamento tra l'obiettivo di pre-addestramento e i compiti di generazione libera: MLM si allinea peggio alla generazione rispetto alla modellazione causale.
- Finestra di contesto storicamente limitata (spesso 512 token nelle configurazioni base con posizioni assolute); l'estensione richiede schemi speciali di posizione/attention e/o fine-tuning.
- Per i compiti di retrieval è necessario un fine-tuning contrastivo separato del bi-encoder e/o cross-encoder; senza di esso la qualità di ricerca/re-ranking è di solito inferiore rispetto ai modelli appositamente addestrati.

**Modelli rappresentativi:** BERT e derivati, nonché RoBERTa e DeBERTa (varianti estese encoder‑only); tra gli obiettivi di pre-addestramento alternativi — ELECTRA (RTD). <sup>[\[5\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-5)[\[6\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-6)[\[7\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-7)[\[8\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-8)[\[9\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-9)[\[10\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-10)</sup>

### 2. Decoder‑only (solo decodificatore, solo decoder)

Viene utilizzato solo lo stack dei decoder con attention causale (da sinistra a destra): il modello predice il token successivo dato un prefisso già fornito. Questa modalità di addestramento — causal language modeling (CLM) — rende questi modelli la scelta naturale per la generazione: dialoghi, risposte articolate, testo creativo, codice sorgente. Il compromesso è l'aumento della latenza e della dimensione della KV-cache con prompt lunghi. In pratica, per gli encoder decoder‑only vengono ampiamente utilizzate tecniche ingegneristiche: riduzione della KV-cache tramite MQA e GQA, accelerazione dell'inferenza tramite decodifica speculativa e ottimizzazioni server (PagedAttention/vLLM, continuous batching, chunked prefill).<sup>[\[11\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-11)[\[12\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-12)[\[13\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-13)[\[14\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-14)[\[15\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-15)</sup>

**Vantaggi:**

- Generazione naturale di testo (CLM): forti capacità zero‑shot e few‑shot; scala bene.<sup>[\[16\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-16)</sup>
- Versatilità di applicazione: un singolo modello risolve numerosi compiti tramite istruzioni ed esempi nel prompt; si combina naturalmente con RAG e il richiamo di strumenti (tool use).
- Ecosistema maturo: pratiche di fine-tuning per istruzioni e allineamento del comportamento (RLHF, DPO); disponibili implementazioni open source e commerciali.<sup>[\[17\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-17)[\[18\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-18)</sup>
- Ampio stack di ottimizzazioni per l'inferenza: MQA/GQA riducono la dimensione della KV-cache e aumentano il throughput; la decodifica speculativa accelera l'inferenza senza modificare la distribuzione; PagedAttention/vLLM con continuous batching e chunked prefill aumentano l'utilizzo complessivo della GPU.<sup>[\[19\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-19)[\[20\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-20)[\[21\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-21)[\[22\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-22)[\[23\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-23)</sup>
- Supporto per la generazione strutturata per formati di risposta rigidi (JSON/SQL/DSL), che semplifica l'integrazione con sistemi informativi e API.<sup>[\[24\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-24)[\[25\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-25)</sup>

**Svantaggi:**

- Maggiore latenza di generazione: inferenza sequenziale; il costo di un nuovo token cresce con la lunghezza del contesto già «letto» (KV-cache).
- Meno vantaggioso nel profilo «input lungo – output corto» (riassunto, traduzione) rispetto all'encoder–decoder, dove l'input viene codificato una sola volta.
- Limitazione al contesto unidirezionale: nei compiti di comprensione risulta talvolta inferiore ai modelli con rappresentazione bidirezionale (encoder‑only / encoder–decoder).
- La memoria per la KV-cache può diventare un "collo di bottiglia" con prompt lunghi e batch grandi; <sup>[\[26\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-26)</sup>
- La quantizzazione delle attivazioni/KV (INT8/FP8) accelera l'inferenza ma può peggiorare la qualità su contesti lunghi/codice; richiede una validazione accurata (specialmente con SLA rigidi).

**Modelli rappresentativi:** GPT‑3, GPT‑4 (i dettagli dell'architettura e del dataset non sono resi pubblici), LLaMA e *Llama 3* (8B/70B, 2024).<sup>[\[27\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-27)[\[28\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-28)[\[29\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-29)[\[30\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-30)</sup>

### 3. Encoder–decoder (codificatore–decodificatore, encoder-decoder)

L'architettura combina entrambi i componenti. L'encoder funziona in modalità bidirezionale, mentre il decoder funziona in modo causale. L'encoder analizza l'input una sola volta e forma la sua rappresentazione; il decoder genera l'output facendo riferimento a questa rappresentazione tramite cross‑attention. Questo approccio separato è particolarmente utile quando è necessario trasformare un lungo testo in input in un output breve: traduzione automatica, riassunto, risposte basate su documenti. Sebbene il metodo richieda maggiori costi computazionali complessivi (due stack e cross-attention), il suo vantaggio è una generazione controllata basata sull'analisi completa del testo sorgente; la codifica viene eseguita una sola volta e riutilizzata durante l'intero processo di inferenza.

**Vantaggi:**

- Generazione condizionale: il decoder utilizza la cross-attention sulla rappresentazione dell'input. <sup>[\[31\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-31)</sup>
- Efficiente nello scenario «input lungo → output breve»: l'input viene codificato una sola volta.
- Comodo per il formato «text‑to‑text» e l'inferenza controllata (prefissi di compito, istruzioni speciali). <sup>[\[32\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-32)</sup>
- Stabilità ed efficienza con sorgenti lunghe: nella fase di decodifica cresce solo la self-attention sull'output, mentre la cross-attention riutilizza chiavi/valori fissi dall'encoder (l'input non viene «riletto» ad ogni passo).

**Svantaggi:**

- Due stack aumentano i requisiti di memoria e calcolo durante l'addestramento e l'utilizzo.
- Su sequenze molto lunghe la latenza totale è comparabile al decoder‑only; l'auto-regressione rimane il collo di bottiglia.
- Meno modelli chat universali rispetto al decoder‑only; utilizzati più spesso come motore seq2seq di alta qualità per compiti specifici.
- Con input molto lunghi aumenta la memoria per le chiavi/valori di cross-attention in ogni layer del decoder (su tutta la sorgente), il che richiede un'attenta pianificazione del serving.

**Modelli rappresentativi:** T5 (inclusi T5 v1.1 e la pratica del fine-tuning per istruzioni in *FLAN‑T5*) e BART. <sup>[\[33\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-33)[\[34\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-34)[\[35\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-35)</sup>

## Transformer densi (dense)

L'architettura LLM classica e più diffusa: nell'elaborazione di ogni token partecipa praticamente l'intero insieme dei parametri del modello. A differenza degli approcci sparsi (ad esempio, Mixture‑of‑Experts), non c'è attivazione selettiva delle sotto-reti — ogni blocco funziona per ogni token. <sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)</sup>

### Principio di funzionamento e architettura

**Struttura di base.** Il modello è uno stack di N blocchi transformer identici. Ogni blocco include:

1.  **Attenzione multi-testa (Multi‑Head Self‑Attention).** Per ogni token vengono calcolati tre vettori: Q (query), K (key), V (value); l'attenzione è definita come $\operatorname{softmax}\!\left( \frac{QK^{\top} + M}{\sqrt{d_{k}}} \right) \cdot V$, dove $M$ è la maschera (causale e/o di padding) che esclude le posizioni non ammissibili. Diverse «teste» di attenzione considerano parallelamente aspetti diversi del contesto (H teste, solitamente $d_{head} = \frac{d_{model}}{H}$); il loro numero cresce con la scala del modello. <sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)</sup>
2.  **Rete fully-connected (Feed‑Forward Network, FFN).** Due layer lineari con non-linearità tra di essi (solitamente GELU/SiLU; in alcuni modelli moderni — SwiGLU). La dimensione intermedia è solitamente $\approx 4\, d_{model}$; quando si usa SwiGLU spesso si prende $\approx \frac{8}{3}\, d_{model}$ per mantenere un numero comparabile di parametri. La FFN contiene una quota significativa dei parametri. <sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)[\[36\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-36)</sup>

**Componenti aggiuntivi.** Vengono utilizzate connessioni residuali e normalizzazione dei layer; nei moderni LLM viene più spesso applicato Pre‑LN (normalizzazione prima dei sotto-blocchi) — questo migliora la stabilità dell'addestramento su grandi profondità. Oltre alla classica LayerNorm viene sempre più utilizzata **RMSNorm** (riduce i costi computazionali e funziona bene nei modelli grandi); in alcune famiglie viene applicata anche la normalizzazione nello spazio dell'attenzione (es. normalizzazione Q/K prima del softmax). Le rappresentazioni posizionali possono essere assolute o relative; per i contesti lunghi RoPE è diventato lo standard de facto.

##### Esempi di modelli e scala

- BERT‑Large: 24 layer, dimensione 1024, 16 teste di attenzione, ≈340 milioni di parametri. <sup>[\[37\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-37)</sup>
- GPT‑3 (175B): 96 layer, dimensione 12288, 96 teste di attenzione, ≈175 miliardi di parametri. <sup>[\[38\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-38)</sup>
- LLaMA‑65B: 80 layer, dimensione 8192, 64 teste di attenzione, ≈65 miliardi di parametri. <sup>[\[39\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-39)</sup>
- PaLM‑540B: 118 layer, dimensione dell'ordine di 18432, ≈540 miliardi di parametri. <sup>[\[40\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-40)</sup>

##### Vantaggi

- Blocchi uniformi, modalità di addestramento ben studiate e comportamento prevedibile nella scalabilità.
- La qualità migliora in modo power-law con la crescita dei parametri e dei dati; il regime compute-optimal prevede l'incremento congiunto della dimensione del modello e del volume dei token di addestramento. <sup>[\[41\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-41)[\[42\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-42)</sup>
- La stessa architettura dopo il fine-tuning copre un ampio spettro di compiti senza modifiche a livello di layer.

##### Svantaggi

- La self-attention completa ha complessità quadratica rispetto alla lunghezza della sequenza ($O(n^{2})$), il che limita la finestra di contesto. <sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)</sup>
- Attivazione completa dei parametri al passo di generazione: nel decoder senza MoE il costo dell'inferenza per token cresce approssimativamente in proporzione al numero di parametri.
- Collo di bottiglia — larghezza di banda della memoria (memory‑bound): il caricamento dei pesi dalla HBM spesso limita la velocità di inferenza.

##### Limitazioni di scalabilità e contesto

- La memoria per i parametri cresce linearmente con la dimensione del modello; la memoria di addestramento aumenta a causa dei gradienti e degli stati dell'ottimizzatore.
- Le configurazioni base erano storicamente limitate a 2–4 mila token. I moderni schemi posizionali (RoPE) e le tecniche di estensione (Position Interpolation, YaRN, ecc.) consentono di aumentare la finestra di un ordine di grandezza e oltre, ma al costo di un carico computazionale/di memoria aggiuntivo. <sup>[\[43\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-43)[\[44\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-44)</sup>

### Ottimizzazioni moderne

- **FlashAttention.** Attenzione esatta con considerazione della gerarchia di memoria della GPU; riduce i costi di memoria e accelera l'addestramento/inferenza su sequenze lunghe. <sup>[\[45\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-45)</sup>
- **Riduzione e gestione della KV-cache.** Multi‑Query Attention e Grouped‑Query Attention riducono la dimensione della cache e il traffico di memoria; a livello server PagedAttention (vLLM) aumenta il throughput tramite la gestione paginata della cache. <sup>[\[46\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-46)[\[47\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-47)[\[48\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-48)</sup>
- **Decodifica speculativa.** Un modello bozza (draft) propone una continuazione e il modello principale la verifica rapidamente; si ottiene un'accelerazione senza modificare la distribuzione dell'output. <sup>[\[49\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-49)</sup>

## Modelli sparsi (Sparse Models) e Mixture‑of‑Experts (MoE)

MoE è un modo per aumentare la capacità del modello senza una crescita proporzionale dei calcoli per token. Invece di un unico grande blocco FFN nel layer, viene utilizzato un insieme di «esperti» paralleli (diversi FFN indipendenti), e una rete di routing apprendibile (gating network) per ogni token seleziona i top‑k esperti più rilevanti (solitamente k=1–2; in alcuni modelli k=4). Vengono attivati solo gli esperti selezionati; i loro output vengono pesati e sommati. Così il numero totale di parametri può essere centinaia di miliardi e persino trilioni, ma ad ogni passo viene utilizzata solo una piccola frazione. <sup>[\[50\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Switch-50)[\[51\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-GLAM-51)</sup>

#### Esempi di modelli e scala

- **Switch Transformer (Google)**: fino a ~1.6T parametri; routing top‑1 (un esperto per token). Ha dimostrato che MoE consente di aumentare drasticamente la capacità con costi per token comparabili. <sup>[\[50\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Switch-50)</sup>
- **GLaM (Google)**: 1.2T parametri, 64 esperti per layer, top‑2; per ogni token vengono attivati ≈96.6B parametri (≈8%). <sup>[\[51\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-GLAM-51)</sup>
- **Mixtral 8×7B (Mistral AI)**: ~46.7B parametri totali, ≈12.9B attivi per token, top‑2. <sup>[\[52\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mixtral8x7-52)[\[53\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mixtral8x7_paper-53)</sup>
- **Mixtral 8×22B**: ~141B parametri totali, ≈39B attivi per token, top‑2. <sup>[\[54\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mixtral8x22-54)</sup>
- **DBRX (Databricks)**: 132B parametri totali, ≈36B attivi per token; 16 esperti e routing top‑4 (fine‑grained MoE). <sup>[\[55\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-DBRX-55)</sup>

##### Vantaggi

- Il costo computazionale è determinato dal numero di esperti attivi k, non dal numero totale di parametri: è possibile addestrare e utilizzare modelli su scala trilionaria con costi comparabili a modelli densi di dimensioni notevolmente inferiori. <sup>[\[51\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-GLAM-51)</sup>
- Specializzazione: gli esperti si «adattano» automaticamente a lingue/domini/pattern, migliorando la qualità nei compiti multi-dominio.
- Distribuzione flessibile: è possibile mantenere in memoria gli esperti usati frequentemente e caricare quelli rari (con l'infrastruttura appropriata).

##### Limitazioni

- Bilanciamento del carico: senza regolarizzazione il router può «bloccarsi» su alcuni esperti (router collapse). Sono necessarie auxiliary losses (load‑balancing) e schemi di routing migliorati. <sup>[\[50\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Switch-50)</sup>
- Complessità del calcolo distribuito: richiede expert parallelism e scambi all‑to‑all; i costi di comunicazione e la gestione della memoria diventano il collo di bottiglia. <sup>[\[56\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-NVIDIA_MoE-56)</sup>
- Stabilità dell'addestramento: importanti le impostazioni del router e dei vincoli di capacità (capacity), altrimenti sono possibili degradazioni della qualità/convergenza.

#### Miglioramenti moderni

- **Expert‑Choice routing**: gli esperti «scelgono» i token, migliorando il bilanciamento e la convergenza con costi comparabili. <sup>[\[57\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-ExpertChoice-57)</sup>
- **Fine‑grained MoE**: un maggior numero di esperti più piccoli (come in DBRX) fornisce una granularità fine della specializzazione. <sup>[\[55\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-DBRX-55)</sup>
- **Sparse Upcycling**: la conversione di un modello denso in MoE dal suo checkpoint consente di migliorare significativamente la qualità con costi moderati. <sup>[\[58\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-SparseUpcycling-58)</sup>

#### Opportunità di applicazione di MoE

- Assistenti multi-dominio su larga scala con budget computazionale limitato.
- Addestramento su corpus estesi, dove la specializzazione porta vantaggi.
- Scenari con infrastruttura distribuita avanzata (molte GPU/TPU e reti veloci).

**Quando sono preferibili i modelli densi**: infrastruttura limitata (1–2 GPU), requisiti rigidi di latenza prevedibile e semplicità di distribuzione.

## Retrieval‑Augmented Generation (RAG)

RAG è un **pattern architetturale di sistema** attorno all'LLM, non un'architettura interna del modello stesso. Combina un LLM (componente generativo) con una base di conoscenza esterna (componente di recupero), il che consente di compensare i limiti della «memoria parametrica» del modello.

- **Principio di funzionamento:** Prima della generazione, l'LLM recupera documenti rilevanti da una fonte esterna (wiki, knowledge base aziendale, web) e si basa su di essi per formulare la risposta. <sup>[\[59\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RAG-59)</sup>
- **Vantaggi:**
  - Riduzione delle allucinazioni e miglioramento dell'accuratezza fattuale. <sup>[\[59\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RAG-59)[\[60\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-60)</sup>
  - Aggiornamento senza il riaddestramento completo del modello. <sup>[\[59\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RAG-59)</sup>
  - Citabilità e tracciabilità delle risposte.
- **Applicazione:** Standard de facto per assistenti aziendali e sistemi in cui sono richiesti fatti verificabili e lavoro con dati privati/altamente specializzati. <sup>[\[59\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RAG-59)</sup>

## Meccanismi di attenzione e gestione del contesto

La self-attention di base ha complessità quadratica rispetto alla lunghezza della sequenza ($O(n^{2})$), pertanto sono state sviluppate ottimizzazioni.

- **Attenzione sparsa (Sparse Attention):** Limitazione dell'attenzione a finestre/pattern locali. Esempi: **Longformer**<sup>[\[61\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-61)</sup>, **BigBird**<sup>[\[62\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-62)</sup>.
- **FlashAttention:** Ristrutturazione dell'ordine dei calcoli tenendo conto della gerarchia di memoria della GPU; fornisce un significativo guadagno in termini di tempo e memoria ed è diventata lo standard de facto nell'addestramento di LLM con contesto lungo<sup>[\[63\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-63)[\[64\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-64)[\[65\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-65)</sup>.
- **MQA/GQA (accelerazione della decodifica):** *Multi‑Query Attention* (chiavi/valori condivisi per tutte le teste) riduce il traffico della KV-cache<sup>[\[66\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-66)</sup>. *Grouped‑Query Attention* bilancia qualità/velocità<sup>[\[67\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-67)</sup>.
- **Rappresentazioni posizionali migliorate:**
  - **ALiBi (Attention with Linear Biases):** Bias lineari ai punteggi di attenzione migliorano la generalizzazione a lunghezze maggiori. <sup>[\[68\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-68)</sup>
  - **RoPE (Rotary Position Embeddings):** Informazioni posizionali relative tramite rotazione di Q/K; ampiamente utilizzato nei modelli moderni (es. LLaMA). <sup>[\[69\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-69)[\[70\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-70)</sup>
  - **Estensione del contesto per modelli RoPE:** *Position Interpolation* <sup>[\[71\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-71)</sup>, *YaRN* <sup>[\[72\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-72)</sup>, nonché le modifiche NTK-aware consentono di aumentare efficacemente la finestra di contesto senza modificare l'architettura.

<!-- -->

- **Altri approcci per sequenze lunghe:**
  - **Transformer‑XL:** memoria ricorrente tra segmenti per la modellazione di dipendenze a lungo raggio. <sup>[\[73\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-73)</sup>
  - **Reformer:** LSH‑attention e blocchi residuali reversibili per il risparmio di memoria. <sup>[\[74\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-74)</sup>
  - **Performer:** approssimazione lineare della softmax‑attention (FAVOR+). <sup>[\[75\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-75)</sup>
  - **Linformer:** approssimazione a basso rango della matrice di attenzione. <sup>[\[76\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-76)</sup>

## Ottimizzazioni dei modelli e infrastruttura di addestramento

Per l'addestramento e il deployment degli LLM vengono utilizzate tecniche e framework specializzati.

- **Quantizzazione (Quantization):** La riduzione della precisione dei pesi diminuisce la memoria e accelera l'inferenza. **QLoRA** consente il fine-tuning efficiente di modelli a 4 bit (inclusi 65B) con una qualità vicina alla piena precisione<sup>[\[77\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-77)</sup>.
- **Distillazione della conoscenza (Knowledge Distillation):** Addestramento *Teacher→Student* per modelli compatti<sup>[\[78\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-78)</sup>; esempio — **DistilBERT**<sup>[\[79\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-79)</sup>.
- **Addestramento distribuito:**
  - **DeepSpeed** e **ZeRO** — distribuzione di parametri/gradienti/stati dell'ottimizzatore per l'addestramento di modelli trilionari<sup>[\[80\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-80)</sup>.
  - **Megatron‑LM** — parallelismo tensoriale e a pipeline per transformer di grandi dimensioni<sup>[\[81\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-81)</sup>.
- **Ecosistema e strumenti:** **Hugging Face Transformers** e **Accelerate** forniscono implementazioni standard dei modelli e integrazione con DeepSpeed/FSDP per addestramento e inferenza<sup>[\[82\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-82)[\[83\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-83)</sup>.

## Leggi di scalabilità e addestramento compute‑optimal

Le **leggi di scalabilità** empiriche mostrano che l'errore di cross-entropia diminuisce secondo una legge di potenza con la crescita dei parametri, dei dati e dei calcoli. <sup>[\[84\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-84)</sup> Il lavoro **Chinchilla** ha precisato i regimi **compute‑optimal**: per un'efficienza ottimale, la dimensione del modello e il numero di token di addestramento devono essere scalati congiuntamente (esempio — un modello da 70B addestrato su ~1.4T token supera modelli più grandi ma sotto-addestrati). <sup>[\[85\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-85)</sup>

## Modelli con spazio degli stati (State Space Models, SSM)

**State Space Models (SSM)** sono un'architettura alternativa ai transformer per lavorare con sequenze lunghe. Prende in prestito idee dalla teoria del controllo e dall'elaborazione digitale dei segnali e risolve il problema principale della self-attention: la crescita quadratica dei calcoli all'aumentare della lunghezza del testo.

### Problema principale e soluzione

**Il problema dei transformer.** Il problema principale dei transformer tradizionali è la complessità quadratica dell'attenzione: un testo 10 volte più lungo richiede circa 100 volte più calcoli.

**L'approccio SSM.** Invece di «prestare attenzione a tutte le parole contemporaneamente», il modello percorre il testo in modo sequenziale e mantiene un compatto **stato di memoria** interno che viene aggiornato ad ogni passo. Di conseguenza il tempo e il consumo di memoria crescono approssimativamente in modo lineare con la lunghezza del testo. L'addestramento può essere eseguito in parallelo — tramite la rappresentazione convoluzionale del kernel (alta velocità di throughput su sequenze lunghe). <sup>[\[86\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-S4-86)</sup>

### Principio di funzionamento

Un SSM discreto è descritto dalle equazioni di stato e di uscita:

$x_{t} = Ax_{t - 1} + Bu_{t},\quad y_{t} = Cx_{t} + Du_{t}$

dove $x_{t}$ è lo stato di memoria, $u_{t}$ è l'input (token), $y_{t}$ è l'output. Negli SSM profondi le matrici $A,B,C,D$ vengono parametrizzate in modo da garantire stabilità e calcoli efficienti su sequenze lunghe. Lo stesso layer può essere considerato:

- ricorrente (scansione passo per passo) — inferenza efficiente in memoria senza KV-cache;
- convoluzionale — addestramento parallelo con kernel pre-calcolato. <sup>[\[86\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-S4-86)</sup>

### Architetture principali e ibridi

- **S4 (Structured State Spaces).** Linea di base SSM con parametrizzazione stabile della matrice di stato; dimostra efficienza su sequenze molto lunghe. <sup>[\[86\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-S4-86)</sup>
- **Mamba.** SSM *selettivi*: le regole di aggiornamento della memoria dipendono dall'input corrente (il modello decide autonomamente cosa «tenere in memoria» e cosa «dimenticare»). L'implementazione è orientata alla gerarchia di memoria della GPU; secondo gli autori, si ottiene un multiplo aumento del throughput di inferenza con complessità lineare rispetto alla lunghezza. <sup>[\[87\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mamba-87)</sup>
- **RetNet.** Meccanismo di *retention* con tre modalità: addestramento parallelo, inferenza ricorrente e block-ricorrente. L'obiettivo è combinare addestramento rapido (come nei transformer) con un flusso economico in inferenza (memoria O(1) per token). <sup>[\[88\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RetNet-88)</sup>
- **Ibridi Attention+SSM.** Esempio — **Jamba** (alternanza di layer Transformer e Mamba più MoE): riporta il supporto di contesti dell'ordine di ~256 K token con un requisito di memoria significativamente inferiore rispetto a modelli puramente transformer di classe simile. <sup>[\[89\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Jamba-89)</sup>

#### Vantaggi

- Complessità lineare e risparmio di memoria in inferenza. Nessuna self-attention globale e KV-cache; viene conservato solo uno stato compatto. <sup>[\[87\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RetNet-88)</sup>
- Addestramento parallelo su sequenze lunghe. La modalità convoluzionale aumenta il throughput di addestramento. <sup>[\[86\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-S4-86)</sup>
- Efficienza hardware. Le implementazioni sono orientate alla moderna gerarchia di memoria (HBM/SRAM). <sup>[\[87\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mamba-87)</sup>
- Contesti lunghi e streaming. Gli ibridi SSM+Attention sono pratici per centinaia di migliaia di token con risorse moderate. <sup>[\[89\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Jamba-89)</sup>

#### Limitazioni e pratica corrente

- Maturità dell'ecosistema. Gli strumenti e le «ricette» di scalabilità (istruzioni, RLHF/DPO) sono ancora inferiori allo stack dei transformer. <sup>[\[87\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mamba-87)</sup>
- Qualità e stabilità. In alcuni compiti gli ibridi (Attention+SSM) mostrano un compromesso «qualità/velocità/memoria» più stabile rispetto agli SSM «puri». <sup>[\[89\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Jamba-89)</sup>

#### Confronto degli approcci (sommario)

| Caratteristica                      | Transformer                        | SSM                         | Ibridi (Attention+SSM) |
|-------------------------------------|------------------------------------|-----------------------------|------------------------|
| Complessità rispetto alla lunghezza | Quadratica (self‑attention)        | Lineare (scan/convoluzione) | Vicina alla lineare    |
| Memoria per token (inferenza)       | KV-cache cresce con il contesto    | Stato O(1)                  | Crescita moderata      |
| Contesti lunghi                     | Richiedono ottimizzazioni speciali | Supporto naturale           | Pratici fino a ~256 K  |
| Maturità dell'ecosistema            | Alta                               | In sviluppo                 | In sviluppo            |

#### Applicazioni pratiche

- Analisi di documenti molto lunghi (libri, report, rassegne scientifiche).
- Elaborazione in streaming e scenari chat con lunga cronologia senza aumento dei costi di memoria.
- Ambienti con risorse limitate (dispositivi mobili/edge).
- Serie temporali e altri dati sequenziali.

**Modelli rappresentativi:** S4, Mamba, RetNet; ibridi Attention+SSM (Jamba). <sup>[\[86\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-S4-86)[\[87\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Mamba-87)[\[88\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-RetNet-88)[\[89\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Jamba-89)</sup>

## Evoluzione delle architetture

- 2017 — pubblicato l'articolo «Attention Is All You Need». Presentata l'architettura transformer: la self-attention multi-testa e le codifiche posizionali consentono di addestrare modelli senza ricorrenza e convoluzioni; tuttavia l'attenzione ha complessità quadratica rispetto alla lunghezza del contesto.<sup>[\[1\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-Vaswani2017-1)</sup>

<!-- -->

- 2018 — presentati GPT‑1 e BERT. GPT‑1 utilizza uno stack solo decoder con attention causale per la generazione e il successivo fine-tuning; BERT introduce un encoder bidirezionale e il pre-addestramento MLM per i compiti di comprensione del testo. <sup>[\[90\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-90)[\[91\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-91)</sup>

<!-- -->

- 2019 — proposti metodi per lavorare con sequenze lunghe e scalato il decoder-only. Transformer‑XL aggiunge «memoria» e posizioni relative per superare la finestra fissa; GPT‑2 mostra la crescita delle capacità zero-shot con l'aumento della scala; BART dimostra l'efficacia del pre-addestramento con denoising per seq2seq. <sup>[\[92\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-92)[\[93\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-93)[\[94\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-94)</sup>

<!-- -->

- 2020 — unificato il formato «text‑to‑text» e mostrati metodi per documenti lunghi. T5 formula un approccio unificato encoder–decoder per diversi compiti; Longformer e BigBird utilizzano l'attention sparsa/strutturata per testi lunghi; GPT‑3 conferma l'efficacia della scalabilità del decoder‑only denso. <sup>[\[95\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-95)[\[96\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-96)[\[97\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-97)[\[98\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-98)</sup>

<!-- -->

- 2021 — migliorate le rappresentazioni posizionali e mostrata la sparsità dei parametri (MoE). RoPE e ALiBi migliorano la generalizzazione su lunghezze maggiori; Switch Transformer e GLaM attivano solo una parte degli esperti per token, aumentando la capacità senza un aumento proporzionale del costo di inferenza. <sup>[\[99\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-99)[\[100\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-100)[\[101\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-101)[\[102\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-102)</sup>

<!-- -->

- 2022 — precisato il regime compute‑optimal e accelerata l'inferenza su prompt lunghi. Chinchilla mostra il vantaggio di un maggiore numero di token di addestramento con una dimensione del modello moderata; PaLM con Multi‑Query Attention riduce la dimensione della KV-cache; FlashAttention accelera l'attenzione sulla GPU. <sup>[\[103\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-103)[\[104\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-104)[\[105\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-105)[\[106\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-106)</sup>

<!-- -->

- 2023 — aumentate le finestre di contesto senza modificare i layer e migliorato il serving. La famiglia LLaMA consolida le pratiche (RMSNorm, SwiGLU, RoPE); Position Interpolation e YaRN estendono il contesto; vLLM/PagedAttention gestisce più efficacemente la KV-cache. <sup>[\[107\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-107)[\[108\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-108)[\[109\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-109)[\[110\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-110)[\[111\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-111)[\[112\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-112)</sup>

<!-- -->

- 2023 — GPT‑4 e Gemini mostrano elaborazione e generazione in più modalità all'interno di una stessa famiglia di modelli. <sup>[\[113\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-113)[\[114\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-114)</sup>

<!-- -->

- 2023 — proposti modelli con spazio degli stati (SSM). Mamba e RetNet reintroducono l'elaborazione sequenziale con stato compatto al posto della KV-cache e pongono le basi per architetture ibride. <sup>[\[115\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-115)[\[116\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-116)</sup>

<!-- -->

- 2024 — pubblicati modelli MoE open source e ibridi Attention+SSM; accelerata l'attenzione sulle nuove GPU. Mixtral 8×7B/8×22B e DBRX confermano la praticità di MoE; Jamba combina Transformer e Mamba per contesti molto lunghi; FlashAttention‑3 aumenta il throughput. <sup>[\[117\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-117)[\[118\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-118)[\[119\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-119)[\[120\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-120)[\[121\]](https://systems-analysis.info/int/Architetture_LLM#cite_note-121)</sup>

## Riferimenti

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external free" rel="nofollow">https://jalammar.github.io/illustrated-transformer/</a> The Illustrated Transformer — spiegazione visiva

## Bibliografia

- Vaswani, A. et al. (2017). *Attention Is All You Need*. NIPS. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a>
- Devlin, J. et al. (2019). *BERT*. NAACL. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a>
- Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a>
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a>
- Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a>
- Touvron, H. et al. (2023). *LLaMA*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a>
- Chowdhery, A. et al. (2022). *PaLM: Scaling Language Modeling with Pathways*. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a>
- Dao, T. et al. (2022–2024). *FlashAttention (1/2/3)*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a>
- Shazeer, N. (2019). *MQA*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a>
- Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a>
- Kwon, W. et al. (2023). *PagedAttention / vLLM*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a>
- Leviathan, Y. et al. (2023). *Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a>
- Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a>
- Du, N. et al. (2022). *GLaM*. <a href="https://proceedings.mlr.press/v162/du22c/du22c.pdf" class="external free" rel="nofollow">https://proceedings.mlr.press/v162/du22c/du22c.pdf</a>
- Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a>
- Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a>
- NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a>
- Zhou, Y. et al. (2022). *Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a>
- Komatsuzaki, A. et al. (2022). *Sparse Upcycling*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a>
- Lewis, P. et al. (2020). *RAG*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a>
- Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a>
- Zaheer, M. et al. (2020). *BigBird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a>
- Press, O. et al. (2022). *ALiBi*. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a>
- Su, J. et al. (2021). *RoFormer (RoPE)*. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a>
- Chen, S. et al. (2023). *Position Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a>
- Peng, B. et al. (2023). *YaRN*. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a>
- Dettmers, T. et al. (2023). *QLoRA*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a>
- Rajbhandari, S. et al. (2020). *ZeRO*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a>
- Shoeybi, M. et al. (2019). *Megatron‑LM*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a>
- Kaplan, J. et al. (2020). *Scaling Laws*. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a>
- Hoffmann, J. et al. (2022). *Chinchilla / Compute‑Optimal*. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a>
- Gemini Team (2023). *Gemini*. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a>
- Bai, Y. et al. (2022). *Constitutional AI*. <a href="https://arxiv.org/abs/2212.08073" class="external free" rel="nofollow">https://arxiv.org/abs/2212.08073</a>
- OpenAI (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a>
- OpenAI (2023). *DevDay: GPT‑4 Turbo 128k*. <a href="https://openai.com/index/new-models-and-developer-products-announced-at-devday/" class="external free" rel="nofollow">https://openai.com/index/new-models-and-developer-products-announced-at-devday/</a>
- Zhang, B.; Sennrich, R. (2019). *RMSNorm*. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a>
- Shazeer, N. (2020). *GLU Variants / SwiGLU*. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a>
- Gu, A.; Goel, K.; Ré, C. (2021). *S4: Structured State Spaces*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a>
- Gu, A.; Dao, T. (2023/2024). *Mamba: Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a>
- Sun, Y. et al. (2023). *RetNet*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a>
- Lieber, O. et al. (2024). *Jamba: Hybrid Transformer‑Mamba*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a>
- Dai, Z. et al. (2019). *Transformer‑XL*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a>
- Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a>
- Choromanski, K. et al. (2021). *Performer*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a>
- Wang, S. et al. (2020). *Linformer*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a>

## Note

1.  <span id="cite_note-Vaswani2017-1">↑ <sup>[1.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Vaswani2017_1-6)</sup> Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external free" rel="nofollow">https://arxiv.org/abs/1706.03762</a></span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-2) Devlin, J. et al. (2019). *BERT*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-3) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-4) Raffel, C. et al. (2020). *T5*. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-5) Devlin, J. et al. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-6) Liu, Y. et al. (2019). *RoBERTa: A Robustly Optimized BERT Pretraining Approach*. <a href="https://arxiv.org/abs/1907.11692" class="external free" rel="nofollow">https://arxiv.org/abs/1907.11692</a></span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-7) He, P. et al. (2021). *DeBERTa: Decoding‑enhanced BERT with Disentangled Attention*. <a href="https://arxiv.org/abs/2006.03654" class="external free" rel="nofollow">https://arxiv.org/abs/2006.03654</a></span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-8) Clark, K. et al. (2020). *ELECTRA: Pre‑training Text Encoders as Discriminators Rather Than Generators*. <a href="https://arxiv.org/abs/2003.10555" class="external free" rel="nofollow">https://arxiv.org/abs/2003.10555</a></span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-9) Zaheer, M. et al. (2020). *Big Bird: Transformers for Longer Sequences*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-10) Beltagy, I. et al. (2020). *Longformer: The Long‑Document Transformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-11) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (Multi‑Query Attention). <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-12) Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-13) Leviathan, Y. et al. (2023). *Fast Inference from Transformers via Speculative Decoding*. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-14) Kwon, W. et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention (vLLM)*. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-15) vLLM Docs (2024–2025). *Continuous batching, Chunked prefill, Structured outputs*. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-16) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-17) Ouyang, L. et al. (2022). *InstructGPT (RLHF)*. <a href="https://arxiv.org/abs/2203.02155" class="external free" rel="nofollow">https://arxiv.org/abs/2203.02155</a></span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-18) Rafailov, R. et al. (2023). *Direct Preference Optimization*. <a href="https://arxiv.org/abs/2305.18290" class="external free" rel="nofollow">https://arxiv.org/abs/2305.18290</a></span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-19) Shazeer, 2019. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-20) Ainslie, 2023. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-21) Leviathan, 2023. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
22. <span id="cite_note-22">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-22) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
23. <span id="cite_note-23">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-23) vLLM Docs. <a href="https://docs.vllm.ai/" class="external free" rel="nofollow">https://docs.vllm.ai/</a></span>
24. <span id="cite_note-24">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-24) OpenAI (2024). *Structured Outputs*. <a href="https://openai.com/index/introducing-structured-outputs-in-the-api/" class="external free" rel="nofollow">https://openai.com/index/introducing-structured-outputs-in-the-api/</a></span>
25. <span id="cite_note-25">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-25) vLLM Docs — Structured outputs. <a href="https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html" class="external free" rel="nofollow">https://docs.vllm.ai/en/v0.9.2/features/structured_outputs.html</a></span>
26. <span id="cite_note-26">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-26) Kwon, 2023. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
27. <span id="cite_note-27">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-27) Brown, T. et al. (2020). *Language Models are Few‑Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
28. <span id="cite_note-28">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-28) Touvron, H. et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
29. <span id="cite_note-29">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-29) Achiam, J. et al. (2023). *GPT‑4 Technical Report*. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
30. <span id="cite_note-30">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-30) Meta AI (2024). *Introducing Meta Llama 3*. <a href="https://ai.meta.com/blog/meta-llama-3/" class="external free" rel="nofollow">https://ai.meta.com/blog/meta-llama-3/</a></span>
31. <span id="cite_note-31">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-31) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer (T5)*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
32. <span id="cite_note-32">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-32) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
33. <span id="cite_note-33">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-33) Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
34. <span id="cite_note-34">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-34) Lewis, M. et al. (2019). *BART: Denoising Sequence‑to‑Sequence Pre‑training for NLG, Translation, and Comprehension*. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
35. <span id="cite_note-35">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-35) Chung, H. W. et al. (2022). *Scaling Instruction‑Finetuned Language Models (FLAN‑T5)*. <a href="https://arxiv.org/abs/2210.11416" class="external free" rel="nofollow">https://arxiv.org/abs/2210.11416</a></span>
36. <span id="cite_note-36">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-36) Shazeer, N. (2020). GLU Variants Improve Transformer. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
37. <span id="cite_note-37">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-37) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
38. <span id="cite_note-38">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-38) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
39. <span id="cite_note-39">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-39) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
40. <span id="cite_note-40">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-40) Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
41. <span id="cite_note-41">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-41) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
42. <span id="cite_note-42">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-42) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
43. <span id="cite_note-43">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-43) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
44. <span id="cite_note-44">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-44) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
45. <span id="cite_note-45">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-45) Dao, T. et al. (2022–2024). FlashAttention (1/2/3). <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a> ; <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a> ; <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
46. <span id="cite_note-46">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-46) Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
47. <span id="cite_note-47">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-47) Ainslie, J. et al. (2023). GQA. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
48. <span id="cite_note-48">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-48) Kwon, W. et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
49. <span id="cite_note-49">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-49) Leviathan, Y. et al. (2023). Fast Inference from Transformers via Speculative Decoding. <a href="https://arxiv.org/abs/2211.17192" class="external free" rel="nofollow">https://arxiv.org/abs/2211.17192</a></span>
50. <span id="cite_note-Switch-50">↑ <sup>[50.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Switch_50-0)</sup> <sup>[50.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Switch_50-1)</sup> <sup>[50.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Switch_50-2)</sup> Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). *Switch Transformers*. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
51. <span id="cite_note-GLAM-51">↑ <sup>[51.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-GLAM_51-0)</sup> <sup>[51.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-GLAM_51-1)</sup> <sup>[51.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-GLAM_51-2)</sup> Du, N. et al. (2021). *GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts*. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
52. <span id="cite_note-Mixtral8x7-52">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mixtral8x7_52-0) Mistral AI (2023). *Mixtral of Experts*. <a href="https://mistral.ai/news/mixtral-of-experts/" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-of-experts/</a></span>
53. <span id="cite_note-Mixtral8x7_paper-53">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mixtral8x7_paper_53-0) Jiang, A.Q. et al. (2024). *Mixtral of Experts*. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
54. <span id="cite_note-Mixtral8x22-54">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mixtral8x22_54-0) Mistral AI (2024). *Mixtral 8x22B*. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
55. <span id="cite_note-DBRX-55">↑ <sup>[55.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-DBRX_55-0)</sup> <sup>[55.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-DBRX_55-1)</sup> Databricks (2024). *Introducing DBRX*. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
56. <span id="cite_note-NVIDIA_MoE-56">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-NVIDIA_MoE_56-0) NVIDIA (2024). *Applying Mixture of Experts in LLM Architectures*. <a href="https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/" class="external free" rel="nofollow">https://developer.nvidia.com/blog/applying-mixture-of-experts-in-llm-architectures/</a></span>
57. <span id="cite_note-ExpertChoice-57">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-ExpertChoice_57-0) Zhou, Y. et al. (2022). *Mixture‑of‑Experts with Expert Choice Routing*. <a href="https://arxiv.org/abs/2202.09368" class="external free" rel="nofollow">https://arxiv.org/abs/2202.09368</a></span>
58. <span id="cite_note-SparseUpcycling-58">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-SparseUpcycling_58-0) Komatsuzaki, A. et al. (2022). *Sparse Upcycling: Training Mixture‑of‑Experts from Dense Checkpoints*. <a href="https://arxiv.org/abs/2212.05055" class="external free" rel="nofollow">https://arxiv.org/abs/2212.05055</a></span>
59. <span id="cite_note-RAG-59">↑ <sup>[59.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RAG_59-0)</sup> <sup>[59.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RAG_59-1)</sup> <sup>[59.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RAG_59-2)</sup> <sup>[59.3](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RAG_59-3)</sup> Lewis, P. et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. <a href="https://arxiv.org/abs/2005.11401" class="external free" rel="nofollow">https://arxiv.org/abs/2005.11401</a></span>
60. <span id="cite_note-60">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-60) NVIDIA Blog (2025). *What is Retrieval‑Augmented Generation (RAG)*. <a href="https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/" class="external free" rel="nofollow">https://blogs.nvidia.com/blog/what-is-retrieval-augmented-generation/</a></span>
61. <span id="cite_note-61">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-61) Beltagy, I. et al. (2020). *Longformer*. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
62. <span id="cite_note-62">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-62) Zaheer, M. et al. (2020). *Big Bird*. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
63. <span id="cite_note-63">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-63) Dao, T. et al. (2022). *FlashAttention*. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
64. <span id="cite_note-64">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-64) Dao, T. et al. (2023). *FlashAttention‑2*. <a href="https://arxiv.org/abs/2307.08691" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08691</a></span>
65. <span id="cite_note-65">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-65) Shah, M. et al. (2024). *FlashAttention‑3*. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
66. <span id="cite_note-66">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-66) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
67. <span id="cite_note-67">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-67) Ainslie, J. et al. (2023). *GQA*. <a href="https://arxiv.org/abs/2305.13245" class="external free" rel="nofollow">https://arxiv.org/abs/2305.13245</a></span>
68. <span id="cite_note-68">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-68) Press, O. et al. (2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
69. <span id="cite_note-69">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-69) Su, J. et al. (2021). RoFormer: Rotary Position Embedding. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
70. <span id="cite_note-70">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-70) Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
71. <span id="cite_note-71">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-71) Chen, S. et al. (2023). Extending Context Window via Positional Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
72. <span id="cite_note-72">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-72) Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of LLMs. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
73. <span id="cite_note-73">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-73) Dai, Z. et al. (2019). *Transformer‑XL: Attentive Language Models Beyond a Fixed‑Length Context*. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
74. <span id="cite_note-74">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-74) Kitaev, N.; Kaiser, L.; Levskaya, A. (2020). *Reformer: The Efficient Transformer*. <a href="https://arxiv.org/abs/2001.04451" class="external free" rel="nofollow">https://arxiv.org/abs/2001.04451</a></span>
75. <span id="cite_note-75">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-75) Choromanski, K. et al. (2021). *Rethinking Attention with Performers*. <a href="https://arxiv.org/abs/2009.14794" class="external free" rel="nofollow">https://arxiv.org/abs/2009.14794</a></span>
76. <span id="cite_note-76">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-76) Wang, S. et al. (2020). *Linformer: Self‑Attention with Linear Complexity*. <a href="https://arxiv.org/abs/2006.04768" class="external free" rel="nofollow">https://arxiv.org/abs/2006.04768</a></span>
77. <span id="cite_note-77">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-77) Dettmers, T. et al. (2023). *QLoRA: Efficient Finetuning of Quantized LLMs*. <a href="https://arxiv.org/abs/2305.14314" class="external free" rel="nofollow">https://arxiv.org/abs/2305.14314</a></span>
78. <span id="cite_note-78">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-78) Hinton, G. et al. (2015). *Distilling the Knowledge in a Neural Network*. <a href="https://arxiv.org/abs/1503.02531" class="external free" rel="nofollow">https://arxiv.org/abs/1503.02531</a></span>
79. <span id="cite_note-79">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-79) Sanh, V. et al. (2019). *DistilBERT*. <a href="https://arxiv.org/abs/1910.01108" class="external free" rel="nofollow">https://arxiv.org/abs/1910.01108</a></span>
80. <span id="cite_note-80">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-80) Rajbhandari, S. et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion‑Parameter Models*. <a href="https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/" class="external free" rel="nofollow">https://www.microsoft.com/en-us/research/publication/zero-memory-optimizations-toward-training-trillion-parameter-models/</a></span>
81. <span id="cite_note-81">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-81) Shoeybi, M. et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external free" rel="nofollow">https://arxiv.org/abs/1909.08053</a></span>
82. <span id="cite_note-82">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-82) Hugging Face. *Transformers Documentation*. <a href="https://huggingface.co/docs/transformers" class="external free" rel="nofollow">https://huggingface.co/docs/transformers</a></span>
83. <span id="cite_note-83">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-83) Hugging Face. *Accelerate Documentation*. <a href="https://huggingface.co/docs/accelerate" class="external free" rel="nofollow">https://huggingface.co/docs/accelerate</a></span>
84. <span id="cite_note-84">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-84) Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. <a href="https://arxiv.org/abs/2001.08361" class="external free" rel="nofollow">https://arxiv.org/abs/2001.08361</a></span>
85. <span id="cite_note-85">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-85) Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
86. <span id="cite_note-S4-86">↑ <sup>[86.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-S4_86-0)</sup> <sup>[86.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-S4_86-1)</sup> <sup>[86.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-S4_86-2)</sup> <sup>[86.3](https://systems-analysis.info/int/Architetture_LLM#cite_ref-S4_86-3)</sup> <sup>[86.4](https://systems-analysis.info/int/Architetture_LLM#cite_ref-S4_86-4)</sup> Gu, A.; Goel, K.; Ré, C. (2021). *Efficiently Modeling Long Sequences with Structured State Spaces (S4)*. <a href="https://arxiv.org/abs/2111.00396" class="external free" rel="nofollow">https://arxiv.org/abs/2111.00396</a></span>
87. <span id="cite_note-Mamba-87">↑ <sup>[87.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mamba_87-0)</sup> <sup>[87.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mamba_87-1)</sup> <sup>[87.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mamba_87-2)</sup> <sup>[87.3](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mamba_87-3)</sup> <sup>[87.4](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Mamba_87-4)</sup> Gu, A.; Dao, T. (2023/2024). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
88. <span id="cite_note-RetNet-88">↑ <sup>[88.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RetNet_88-0)</sup> <sup>[88.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RetNet_88-1)</sup> <sup>[88.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-RetNet_88-2)</sup> Sun, Y. et al. (2023). *Retentive Network: A Successor to Transformer for Large Language Models*. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
89. <span id="cite_note-Jamba-89">↑ <sup>[89.0](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Jamba_89-0)</sup> <sup>[89.1](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Jamba_89-1)</sup> <sup>[89.2](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Jamba_89-2)</sup> <sup>[89.3](https://systems-analysis.info/int/Architetture_LLM#cite_ref-Jamba_89-3)</sup> Lieber, O. et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
90. <span id="cite_note-90">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-90) Radford, A. et al. (2018). Improving Language Understanding by Generative Pre‑Training. <a href="https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf" class="external free" rel="nofollow">https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf</a></span>
91. <span id="cite_note-91">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-91) Devlin, J. et al. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. <a href="https://arxiv.org/abs/1810.04805" class="external free" rel="nofollow">https://arxiv.org/abs/1810.04805</a></span>
92. <span id="cite_note-92">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-92) Dai, Z. et al. (2019). Transformer‑XL. <a href="https://arxiv.org/abs/1901.02860" class="external free" rel="nofollow">https://arxiv.org/abs/1901.02860</a></span>
93. <span id="cite_note-93">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-93) Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. <a href="https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf" class="external free" rel="nofollow">https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf</a></span>
94. <span id="cite_note-94">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-94) Lewis, M. et al. (2019). BART. <a href="https://arxiv.org/abs/1910.13461" class="external free" rel="nofollow">https://arxiv.org/abs/1910.13461</a></span>
95. <span id="cite_note-95">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-95) Raffel, C. et al. (2020). T5. <a href="https://jmlr.org/papers/volume21/20-074/20-074.pdf" class="external free" rel="nofollow">https://jmlr.org/papers/volume21/20-074/20-074.pdf</a></span>
96. <span id="cite_note-96">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-96) Beltagy, I. et al. (2020). Longformer. <a href="https://arxiv.org/abs/2004.05150" class="external free" rel="nofollow">https://arxiv.org/abs/2004.05150</a></span>
97. <span id="cite_note-97">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-97) Zaheer, M. et al. (2020). BigBird. <a href="https://arxiv.org/abs/2007.14062" class="external free" rel="nofollow">https://arxiv.org/abs/2007.14062</a></span>
98. <span id="cite_note-98">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-98) Brown, T. et al. (2020). Language Models are Few‑Shot Learners. <a href="https://arxiv.org/abs/2005.14165" class="external free" rel="nofollow">https://arxiv.org/abs/2005.14165</a></span>
99. <span id="cite_note-99">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-99) Su, J. et al. (2021). RoPE. <a href="https://arxiv.org/abs/2104.09864" class="external free" rel="nofollow">https://arxiv.org/abs/2104.09864</a></span>
100. <span id="cite_note-100">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-100) Press, O. et al. (2021/2022). ALiBi. <a href="https://arxiv.org/abs/2108.12409" class="external free" rel="nofollow">https://arxiv.org/abs/2108.12409</a></span>
101. <span id="cite_note-101">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-101) Fedus, W.; Zoph, B.; Shazeer, N. (2021/2022). Switch Transformers. <a href="https://arxiv.org/abs/2101.03961" class="external free" rel="nofollow">https://arxiv.org/abs/2101.03961</a></span>
102. <span id="cite_note-102">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-102) Du, N. et al. (2021). GLaM. <a href="https://arxiv.org/pdf/2112.06905.pdf" class="external free" rel="nofollow">https://arxiv.org/pdf/2112.06905.pdf</a></span>
103. <span id="cite_note-103">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-103) Hoffmann, J. et al. (2022). Chinchilla. <a href="https://arxiv.org/abs/2203.15556" class="external free" rel="nofollow">https://arxiv.org/abs/2203.15556</a></span>
104. <span id="cite_note-104">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-104) Chowdhery, A. et al. (2022). PaLM. <a href="https://arxiv.org/abs/2204.02311" class="external free" rel="nofollow">https://arxiv.org/abs/2204.02311</a></span>
105. <span id="cite_note-105">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-105) Shazeer, N. (2019). Fast Transformer Decoding. <a href="https://arxiv.org/abs/1911.02150" class="external free" rel="nofollow">https://arxiv.org/abs/1911.02150</a></span>
106. <span id="cite_note-106">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-106) Dao, T. et al. (2022). FlashAttention. <a href="https://arxiv.org/abs/2205.14135" class="external free" rel="nofollow">https://arxiv.org/abs/2205.14135</a></span>
107. <span id="cite_note-107">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-107) Touvron, H. et al. (2023). LLaMA. <a href="https://arxiv.org/abs/2302.13971" class="external free" rel="nofollow">https://arxiv.org/abs/2302.13971</a></span>
108. <span id="cite_note-108">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-108) Zhang, B.; Sennrich, R. (2019). RMSNorm. <a href="https://arxiv.org/abs/1910.07467" class="external free" rel="nofollow">https://arxiv.org/abs/1910.07467</a></span>
109. <span id="cite_note-109">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-109) Shazeer, N. (2020). GLU Variants. <a href="https://arxiv.org/abs/2002.05202" class="external free" rel="nofollow">https://arxiv.org/abs/2002.05202</a></span>
110. <span id="cite_note-110">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-110) Chen, S. et al. (2023). Position Interpolation. <a href="https://arxiv.org/abs/2306.15595" class="external free" rel="nofollow">https://arxiv.org/abs/2306.15595</a></span>
111. <span id="cite_note-111">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-111) Peng, B. et al. (2023). YaRN. <a href="https://arxiv.org/abs/2309.00071" class="external free" rel="nofollow">https://arxiv.org/abs/2309.00071</a></span>
112. <span id="cite_note-112">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-112) Kwon, W. et al. (2023). vLLM/PagedAttention. <a href="https://arxiv.org/abs/2309.06180" class="external free" rel="nofollow">https://arxiv.org/abs/2309.06180</a></span>
113. <span id="cite_note-113">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-113) OpenAI (2023). GPT‑4 Technical Report. <a href="https://arxiv.org/abs/2303.08774" class="external free" rel="nofollow">https://arxiv.org/abs/2303.08774</a></span>
114. <span id="cite_note-114">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-114) Gemini Team (2023). Gemini. <a href="https://arxiv.org/abs/2312.11805" class="external free" rel="nofollow">https://arxiv.org/abs/2312.11805</a></span>
115. <span id="cite_note-115">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-115) Gu, A.; Dao, T. (2023). Mamba. <a href="https://arxiv.org/abs/2312.00752" class="external free" rel="nofollow">https://arxiv.org/abs/2312.00752</a></span>
116. <span id="cite_note-116">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-116) Sun, Y. et al. (2023). RetNet. <a href="https://arxiv.org/abs/2307.08621" class="external free" rel="nofollow">https://arxiv.org/abs/2307.08621</a></span>
117. <span id="cite_note-117">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-117) Jiang, A.Q. et al. (2024). Mixtral of Experts. <a href="https://arxiv.org/abs/2401.04088" class="external free" rel="nofollow">https://arxiv.org/abs/2401.04088</a></span>
118. <span id="cite_note-118">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-118) Mistral AI (2024). Mixtral 8x22B. <a href="https://mistral.ai/news/mixtral-8x22b" class="external free" rel="nofollow">https://mistral.ai/news/mixtral-8x22b</a></span>
119. <span id="cite_note-119">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-119) Databricks (2024). Introducing DBRX. <a href="https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm" class="external free" rel="nofollow">https://www.databricks.com/blog/introducing-dbrx-new-state-art-open-llm</a></span>
120. <span id="cite_note-120">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-120) Lieber, O. et al. (2024). Jamba. <a href="https://arxiv.org/abs/2403.19887" class="external free" rel="nofollow">https://arxiv.org/abs/2403.19887</a></span>
121. <span id="cite_note-121">[↑](https://systems-analysis.info/int/Architetture_LLM#cite_ref-121) Shah, M. et al. (2024). FlashAttention‑3. <a href="https://arxiv.org/abs/2407.08608" class="external free" rel="nofollow">https://arxiv.org/abs/2407.08608</a></span>
