Chinchilla (language model) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — è un grande modello linguistico (LLM), sviluppato dal gruppo di ricerca DeepMind e presentato nel marzo 2022[1]. Il modello contiene circa 70 miliardi di parametri ed è stato addestrato su un corpus di testo di 1,4 trilioni di token.

La caratteristica principale di Chinchilla è il suo approccio computazionalmente ottimale all'addestramento. A differenza dei modelli precedenti, in cui l'accento principale era posto sull'aumento del numero di parametri, Chinchilla è stata creata sulla base dell'ipotesi della necessità di scalare proporzionalmente sia la dimensione del modello sia il volume dei dati di addestramento. Grazie a questo approccio, Chinchilla ha dimostrato la sua superiorità rispetto a modelli significativamente più grandi, come Gopher (280 miliardi di parametri) e GPT-3 (175 miliardi), su un ampio spettro di compiti linguistici[2].

Premesse e storia della creazione

Lo sviluppo di Chinchilla è stato il risultato di una ricerca sulla scalabilità degli LLM condotta in DeepMind sulla base della famiglia di modelli Gopher[3]. Il modello Gopher, presentato nel 2021, aveva 280 miliardi di parametri, ma era stato addestrato su un corpus relativamente piccolo di 300 miliardi di token. All'epoca, nel settore dominava l'approccio secondo cui le prestazioni dei modelli crescevano principalmente grazie all'aumento della loro dimensione (numero di parametri), mentre il volume dei dati rimaneva relativamente costante.

Ipotesi sull'addestramento computazionalmente ottimale

I ricercatori di DeepMind hanno formulato l'ipotesi che molti modelli di grandi dimensioni, incluso Gopher, fossero sottoaddestrati (undertrained) rispetto alla loro dimensione. Non raggiungevano la massima qualità possibile con un dato budget computazionale, poiché mancavano di dati di addestramento[2].

L'essenza dell'ipotesi consisteva nel fatto che, per un utilizzo ottimale delle risorse computazionali, la dimensione del modello e il volume dei dati di addestramento devono essere aumentati proporzionalmente l'uno all'altro. In altre parole, raddoppiando il numero di parametri del modello, è necessario aumentare di circa il doppio anche il numero di token di addestramento[1]. Questa conclusione era in contrasto con le ricerche precedenti, che sopravvalutavano il valore dell'aumento della dimensione del modello, poiché venivano condotte con un volume fisso di dati.

Per verificare questa ipotesi, il team di DeepMind ha condotto esperimenti approfonditi, addestrando oltre 400 modelli di dimensioni diverse su set di dati da 5 a 500 miliardi di token. I risultati hanno confermato che la scalabilità parallela è la strategia ottimale. Sulla base di queste conclusioni è stato sviluppato il modello Chinchilla come test pratico del nuovo paradigma[4].

Architettura e addestramento

Caratteristiche architetturali

Chinchilla appartiene alla famiglia dei transformer autoregressivi ed è architetturalmente vicina ai modelli GPT-2/GPT-3[3]. Ha ereditato molte soluzioni da Gopher, ma con differenze fondamentali volte a ridurre le dimensioni mantenendo la profondità della rete:

  • Parametri: ~70 miliardi di parametri, distribuiti su 80 livelli.
  • Larghezza del modello: Il numero di teste di self-attention è stato ridotto a 64 (rispetto alle 128 di Gopher), e la dimensione interna dei livelli è stata ridotta a 8192 (rispetto a ~16384 di Gopher).
  • Ottimizzatore: Viene utilizzato AdamW al posto di Adam, il che migliora la convergenza su set di dati di grandi dimensioni[3].

Tale architettura ha permesso a Chinchilla di mantenere la stessa profondità di rete di Gopher, ma con un numero di parametri significativamente inferiore, riducendo i requisiti di memoria e di risorse computazionali.

Scalabilità e dati per l'addestramento

Per verificare l'ipotesi, Chinchilla è stata addestrata con lo stesso budget computazionale di Gopher, ma con una ridistribuzione delle risorse a favore dei dati. Il modello da 70 miliardi di parametri è stato addestrato su un corpus di 1,4 trilioni di token, circa 4 volte superiore al volume di dati utilizzato per Gopher[1].

Questo rapporto, di circa 20 token per ogni parametro, è diventato noto come punto Chinchilla (Chinchilla Point) ed è un punto di riferimento per l'addestramento computazionalmente ottimale degli LLM moderni[5]. L'esperimento ha confermato che Chinchilla, essendo stata addestrata più vicino a questo limite ottimale, è riuscita a realizzare il suo potenziale in modo più completo rispetto ai modelli sottoaddestrati, sebbene più grandi.

Risultati e prestazioni

Su un ampio set di test standard, Chinchilla ha dimostrato una netta superiorità rispetto ai modelli precedenti. Ha superato agevolmente non solo Gopher, ma anche altri LLM all'epoca all'avanguardia, inclusi OpenAI GPT-3 (175 miliardi di parametri) e Megatron-Turing NLG (530 miliardi di parametri)[1].

Il risultato più significativo è stato ottenuto sul benchmark completo MMLU (Measuring Massive Multitask Language Understanding), che valuta conoscenze e ragionamento in centinaia di compiti eterogenei. Chinchilla ha raggiunto un'accuratezza media del 67,5%, stabilendo un nuovo record per i modelli di questa categoria e superando di 7 punti percentuali il risultato di Gopher[4].

Oltre all'elevata efficienza, Chinchilla ha dimostrato anche economicità nell'utilizzo. Le dimensioni inferiori del modello (70 miliardi rispetto ai 175+ miliardi degli analoghi) significano che per l'inferenza (inference) e il fine-tuning sono necessarie risorse computazionali significativamente inferiori, il che ne semplifica l'applicazione pratica.

Importanza e influenza

La ricerca su Chinchilla ha avuto un'influenza fondamentale sugli approcci all'addestramento dei grandi modelli linguistici.

  • Leggi di scalabilità di Chinchilla (Chinchilla scaling laws): Il rapporto ottimale individuato tra la dimensione del modello e il volume dei dati è diventato uno standard de facto e un punto di riferimento per gli sviluppi successivi nel settore.
  • Spostamento del focus dalla dimensione ai dati: Il lavoro ha stimolato l'industria a prestare maggiore attenzione alla creazione, alla pulizia e all'ampliamento dei corpus di addestramento, piuttosto che al mero aumento indiscriminato del numero di parametri.
  • Applicazione nei sistemi multimodali: Chinchilla è stata utilizzata come componente linguistico principale nel modello multimodale di DeepMind Flamingo, in grado di comprendere immagini e testo[6].

Sebbene il modello Chinchilla stesso non sia stato rilasciato al pubblico, i suoi concetti e i risultati pubblicati nell'articolo scientifico hanno cambiato la traiettoria di sviluppo dell'intero settore degli LLM, indicando la strada verso una crescita più efficiente ed equilibrata delle capacità dell'intelligenza artificiale.

Bibliografia

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

Note

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.