Chinchilla (language model) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — dit is een groot taalmodel (LLM), ontwikkeld door de onderzoeksgroep van DeepMind en gepresenteerd in maart 2022[1]. Het model bevat ongeveer 70 miljard parameters en werd getraind op een tekstcorpus van 1,4 biljoen tokens.

Een belangrijk kenmerk van Chinchilla is haar rekenkundig-optimale benadering van training. In tegenstelling tot eerdere modellen, waarbij de nadruk voornamelijk lag op het vergroten van het aantal parameters, werd Chinchilla ontwikkeld op basis van de hypothese dat zowel de omvang van het model als de hoeveelheid trainingsdata proportioneel moeten worden opgeschaald. Dankzij deze aanpak toonde Chinchilla superioriteit aan ten opzichte van aanzienlijk grotere modellen, zoals Gopher (280 miljard parameters) en GPT-3 (175 miljard), op een breed spectrum aan taaltaken[2].

Achtergrond en geschiedenis

De ontwikkeling van Chinchilla was het resultaat van onderzoek naar de schaalwetten van LLM's, uitgevoerd bij DeepMind op basis van de Gopher-modelfamilie[3]. Het Gopher-model, gepresenteerd in 2021, had 280 miljard parameters, maar werd getraind op een relatief klein corpus van 300 miljard tokens. Destijds domineerde in de sector de opvatting dat de prestaties van modellen voornamelijk verbeterden door het vergroten van hun omvang (het aantal parameters), terwijl de hoeveelheid data relatief constant bleef.

De hypothese van rekenkundig-optimale training

Onderzoekers van DeepMind stelden de hypothese dat veel grote modellen, waaronder Gopher, ondergetraind (undertrained) waren in verhouding tot hun omvang. Ze bereikten niet de maximaal mogelijke kwaliteit bij een gegeven rekenbudget, omdat ze onvoldoende trainingsdata hadden[2].

De kern van de hypothese was dat voor optimaal gebruik van rekenmiddelen de omvang van het model en de hoeveelheid trainingsdata proportioneel aan elkaar moeten worden vergroot. Met andere woorden: als het aantal parameters van een model verdubbelt, moet het aantal trainingstokens ook ongeveer verdubbeld worden[1]. Deze conclusie week af van eerder onderzoek, dat de waarde van het vergroten van de modelomvang overschatte, omdat dat onderzoek werd uitgevoerd met een vaste hoeveelheid data.

Om deze hypothese te toetsen voerde het DeepMind-team uitgebreide experimenten uit, waarbij meer dan 400 modellen van verschillende omvang werden getraind op datasets van 5 tot 500 miljard tokens. De resultaten bevestigden dat parallelle opschaling de optimale strategie is. Op basis van deze bevindingen werd het model Chinchilla ontwikkeld als een praktische test van het nieuwe paradigma[4].

Architectuur en training

Architecturale kenmerken

Chinchilla behoort tot de familie van autoregressieve transformers en is qua architectuur verwant aan de GPT-2/GPT-3-modellen[3]. Het erfde veel ontwerpkeuzes van Gopher, maar met belangrijke verschillen gericht op het verkleinen van de omvang met behoud van de diepte van het netwerk:

  • Parameters: ~70 miljard parameters, verdeeld over 80 lagen.
  • Modelbreedte: Het aantal self-attention-hoofden werd teruggebracht naar 64 (tegenover 128 bij Gopher), en de interne dimensie van de lagen naar 8192 (tegenover ~16384 bij Gopher).
  • Optimizer: Er wordt gebruik gemaakt van AdamW in plaats van Adam, wat de convergentie op grote datasets verbetert[3].

Deze architectuur stelde Chinchilla in staat dezelfde netwerkdiepte te behouden als Gopher, maar met een aanzienlijk kleiner aantal parameters, waardoor de vereisten voor geheugen en rekenmiddelen afnamen.

Opschaling en trainingsdata

Om de hypothese te toetsen werd Chinchilla getraind met hetzelfde rekenbudget als Gopher, maar met een herverdeling van de middelen ten gunste van data. Het model met 70 miljard parameters werd getraind op een corpus van 1,4 biljoen tokens, wat ongeveer vier keer de hoeveelheid data is die voor Gopher werd gebruikt[1].

Deze verhouding, ongeveer 20 tokens per parameter, werd bekend als het Chinchilla-punt (Chinchilla Point) en geldt als richtlijn voor de rekenkundig-optimale training van moderne LLM's[5]. Het experiment bevestigde dat Chinchilla, getraind dichter bij deze optimale grens, haar potentieel vollediger kon benutten dan ondergetrainde, zij het grotere, modellen.

Resultaten en prestaties

Op een brede reeks standaardbenchmarks toonde Chinchilla een significante superioriteit ten opzichte van eerdere modellen. Ze overtrof niet alleen Gopher, maar ook andere toenmalige state-of-the-art LLM's, waaronder OpenAI GPT-3 (175 miljard parameters) en Megatron-Turing NLG (530 miljard parameters)[1].

Het meest veelzeggend was het resultaat op de uitgebreide benchmark MMLU (Measuring Massive Multitask Language Understanding), die kennis en redeneervaardigheden beoordeelt in honderden uiteenlopende taken. Chinchilla behaalde een gemiddelde nauwkeurigheid van 67,5%, wat een nieuw record was voor modellen van deze klasse en 7 procentpunten hoger lag dan het resultaat van Gopher[4].

Naast hoge efficiëntie toonde Chinchilla ook zuinigheid in gebruik. De kleinere modelomvang (70 miljard tegenover 175+ miljard bij vergelijkbare modellen) betekent dat voor inference en fine-tuning aanzienlijk minder rekenmiddelen nodig zijn, wat de praktische toepassing vereenvoudigt.

Betekenis en invloed

Het onderzoek naar Chinchilla heeft een fundamentele invloed gehad op de benaderingen voor het trainen van grote taalmodellen.

  • Chinchilla-schaalwetten (Chinchilla scaling laws): De vastgestelde optimale verhouding tussen modelomvang en datahoeveelheid is de facto standaard geworden en dient als richtlijn voor latere ontwikkelingen in de sector.
  • Verschuiving van focus van omvang naar data: Het werk stimuleerde de industrie meer aandacht te besteden aan het aanmaken, opschonen en uitbreiden van trainingscorpora, in plaats van alleen maar op onsystematische wijze het aantal parameters te vergroten.
  • Toepassing in multimodale systemen: Chinchilla werd gebruikt als de primaire taalcomponent in het multimodale model van DeepMind, Flamingo, dat in staat is zowel afbeeldingen als tekst te begrijpen[6].

Hoewel het Chinchilla-model zelf niet publiekelijk is uitgebracht, hebben de concepten en resultaten die in het wetenschappelijke artikel zijn gepubliceerd de koers van de gehele LLM-sector veranderd, door een weg te wijzen naar effectievere en evenwichtigere groei van de mogelijkheden van kunstmatige intelligentie.

Literatuur

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

Noten

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.