Chinchilla (language model) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — este un model lingvistic de mari dimensiuni (LLM), dezvoltat de echipa de cercetare DeepMind și prezentat în martie 2022[1]. Modelul conține aproximativ 70 de miliarde de parametri și a fost antrenat pe un corpus de text de 1,4 trilioane de token-uri.

Caracteristica principală a lui Chinchilla este abordarea sa eficientă din punct de vedere computațional privind antrenarea. Spre deosebire de modelele anterioare, unde accentul principal era pus pe creșterea numărului de parametri, Chinchilla a fost creată pe baza ipotezei privind necesitatea scalării proporționale atât a dimensiunii modelului, cât și a volumului datelor de antrenare. Datorită acestei abordări, Chinchilla a demonstrat superioritate față de modele semnificativ mai mari, precum Gopher (280 miliarde de parametri) și GPT-3 (175 miliarde), pe un spectru larg de sarcini lingvistice[2].

Premisele și istoricul creării

Dezvoltarea lui Chinchilla a fost rezultatul cercetării privind scalarea LLM, desfășurată la DeepMind pe baza familiei de modele Gopher[3]. Modelul Gopher, prezentat în 2021, avea 280 de miliarde de parametri, dar a fost antrenat pe un corpus relativ mic de 300 de miliarde de token-uri. La acea vreme, în industrie domina abordarea conform căreia performanța modelelor creștea în principal prin mărirea dimensiunii acestora (numărul de parametri), în timp ce volumul datelor rămânea relativ constant.

Ipoteza privind antrenarea eficientă computațional

Cercetătorii DeepMind au formulat ipoteza că multe modele mari, inclusiv Gopher, erau subantrenate (undertrained) în raport cu dimensiunea lor. Acestea nu atingeau calitatea maximă posibilă pentru un buget computațional dat, deoarece le lipseau datele de antrenare[2].

Esența ipotezei consta în faptul că, pentru utilizarea optimă a resurselor computaționale, dimensiunea modelului și volumul datelor de antrenare trebuie mărite proporțional unul față de celălalt. Cu alte cuvinte, la dublarea numărului de parametri ai modelului, este necesar să se dubleze aproximativ și numărul de token-uri de antrenare[1]. Această concluzie contrazicea cercetările anterioare, care supraestimau valoarea creșterii dimensiunii modelului, deoarece erau efectuate cu un volum fix de date.

Pentru verificarea acestei ipoteze, echipa DeepMind a desfășurat experimente extinse, antrenând peste 400 de modele de dimensiuni diferite pe seturi de date cuprinse între 5 și 500 de miliarde de token-uri. Rezultatele au confirmat că scalarea paralelă reprezintă strategia optimă. Pe baza acestor concluzii a fost dezvoltat modelul Chinchilla ca test practic al noii paradigme[4].

Arhitectura și antrenarea

Caracteristici arhitecturale

Chinchilla aparține familiei de transformere autoregresive și, din punct de vedere arhitectural, este apropiată de modelele GPT-2/GPT-3[3]. A moștenit multe soluții de la Gopher, dar cu diferențe esențiale menite să reducă dimensiunea, păstrând în același timp adâncimea rețelei:

  • Parametri: ~70 de miliarde de parametri, distribuiți pe 80 de straturi.
  • Lățimea modelului: Numărul de capete de auto-atenție a fost redus la 64 (față de 128 la Gopher), iar dimensiunea internă a straturilor — la 8192 (față de ~16384 la Gopher).
  • Optimizator: Se utilizează AdamW în locul Adam, ceea ce îmbunătățește convergența pe seturi mari de date[3].

O astfel de arhitectură a permis lui Chinchilla să păstreze aceeași adâncime de rețea ca Gopher, dar cu un număr semnificativ mai mic de parametri, reducând astfel cerințele privind memoria și resursele computaționale.

Scalarea și datele de antrenare

Pentru verificarea ipotezei, Chinchilla a fost antrenat cu același buget computațional ca și Gopher, dar cu o redistribuire a resurselor în favoarea datelor. Modelul cu 70 de miliarde de parametri a fost antrenat pe un corpus de 1,4 trilioane de token-uri, ceea ce depășește de aproximativ 4 ori volumul datelor utilizate pentru Gopher[1].

Acest raport, de aproximativ 20 de token-uri pentru fiecare parametru, a devenit cunoscut sub numele de punctul Chinchilla (Chinchilla Point) și reprezintă un reper pentru antrenarea eficientă computațional a LLM-urilor moderne[5]. Experimentul a confirmat că Chinchilla, fiind antrenat mai aproape de această limită optimă, a reușit să își valorifice potențialul mai complet decât modelele subantrenate, deși mai mari.

Rezultate și performanță

Pe un set larg de teste standardizate, Chinchilla a demonstrat o superioritate semnificativă față de modelele anterioare. A depășit cu ușurință nu doar Gopher, ci și alte LLM-uri moderne la acel moment, inclusiv OpenAI GPT-3 (175 de miliarde de parametri) și Megatron-Turing NLG (530 de miliarde de parametri)[1].

Cel mai relevant a fost rezultatul obținut pe benchmark-ul complex MMLU (Measuring Massive Multitask Language Understanding), care evaluează cunoștințele și raționamentul în sute de sarcini eterogene. Chinchilla a atins o acuratețe medie de 67,5%, stabilind un nou record pentru modelele din această categorie și depășind cu 7 puncte procentuale rezultatul lui Gopher[4].

Pe lângă eficiența ridicată, Chinchilla a demonstrat și economicitate în utilizare. Dimensiunea mai mică a modelului (70 de miliarde față de 175+ miliarde la modele similare) înseamnă că pentru inferență (inference) și fine-tuning sunt necesare semnificativ mai puține resurse computaționale, ceea ce simplifică aplicarea sa practică.

Semnificație și influență

Cercetarea Chinchilla a avut o influență fundamentală asupra abordărilor privind antrenarea modelelor lingvistice de mari dimensiuni.

  • Legile de scalare Chinchilla (Chinchilla scaling laws): Raportul optim identificat între dimensiunea modelului și volumul datelor a devenit standardul de facto și reperul pentru dezvoltările ulterioare din industrie.
  • Deplasarea accentului de la dimensiune la date: Lucrarea a stimulat industria să acorde mai multă atenție creării, curățării și extinderii corpusurilor de antrenare, și nu doar creșterii neselective a numărului de parametri.
  • Aplicarea în sisteme multimodale: Chinchilla a fost utilizat ca principal component lingvistic în modelul multimodal DeepMind Flamingo, care este capabil să înțeleagă imagini și text[6].

Deși modelul Chinchilla în sine nu a fost lansat pentru acces public, conceptele și rezultatele sale, publicate în lucrarea științifică, au schimbat traiectoria de dezvoltare a întregului domeniu al LLM-urilor, indicând calea spre o creștere mai eficientă și mai echilibrată a capacităților inteligenței artificiale.

Bibliografie

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

Note

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.