Chinchilla (language model) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — ito ay isang malaking language model (LLM), na binuo ng pangkat ng mga mananaliksik ng DeepMind at ipinakita noong Marso 2022[1]. Ang modelo ay naglalaman ng humigit-kumulang 70 bilyon na mga parameter at sinanay sa isang corpus ng teksto na may sukat na 1.4 trilyon na mga token.

Ang pangunahing katangian ng Chinchilla ay ang computationally-optimal na diskarte sa pagsasanay. Hindi tulad ng mga nakaraang modelo, kung saan ang pangunahing diin ay inilalagay sa pagdaragdag ng bilang ng mga parameter, ang Chinchilla ay nilikha batay sa hipotesis na kinakailangang proporsyonal na i-scale ang parehong laki ng modelo at ang dami ng datos sa pagsasanay. Salamat sa diskarteng ito, nagpakita ang Chinchilla ng kahusayan kumpara sa mga modelong mas malaki, tulad ng Gopher (280 bilyong parameter) at GPT-3 (175 bilyon), sa malawak na hanay ng mga gawain sa wika[2].

Mga paunang kondisyon at kasaysayan ng paglikha

Ang pagbuo ng Chinchilla ay naging resulta ng pananaliksik sa pag-scale ng LLM, na isinasagawa sa DeepMind batay sa pamilya ng mga modelo ng Gopher[3]. Ang modelo ng Gopher, na ipinakita noong 2021, ay may 280 bilyong parameter, ngunit sinanay sa isang medyo maliit na corpus na 300 bilyong token. Sa panahong iyon, ang industriya ay pinangungunahan ng diskarteng ayon sa kung saan ang pagganap ng mga modelo ay lumago pangunahin sa pamamagitan ng pagdaragdag ng kanilang laki (bilang ng mga parameter), habang ang dami ng datos ay nananatiling relatibong pare-pareho.

Hipotesis ng computationally-optimal na pagsasanay

Ipinagpalagay ng mga mananaliksik ng DeepMind na maraming malalaking modelo, kabilang ang Gopher, ay kulang ang pagsasanay (undertrained) kaugnay ng kanilang laki. Hindi nila naabot ang pinakamataas na posibleng kalidad sa isang naibigay na computational budget, dahil kulang ang datos para sa pagsasanay[2].

Ang kakanyahan ng hipotesis ay ang para sa optimal na paggamit ng mga computational na mapagkukunan, ang laki ng modelo at ang dami ng datos sa pagsasanay ay dapat na dagdagan nang proporsyonal sa isa't isa. Sa madaling salita, kapag nai-double ang bilang ng mga parameter ng modelo, kinakailangan ding halos i-double ang bilang ng mga token sa pagsasanay[1]. Ang konklusyong ito ay sumasalungat sa mga nakaraang pananaliksik, na nagpahalaga nang labis sa pagpapalaki ng laki ng modelo, dahil isinasagawa ang mga ito sa isang nakatakdang dami ng datos.

Upang mapatunayan ang hipotesing ito, nagsagawa ang koponan ng DeepMind ng malawak na mga eksperimento, sinanay ang mahigit 400 modelo ng iba't ibang laki sa mga dataset mula 5 hanggang 500 bilyong token. Kinumpirma ng mga resulta na ang parallel na pag-scale ay ang pinakamainam na estratehiya. Batay sa mga konklusyong ito, binuo ang modelo ng Chinchilla bilang isang praktikal na pagsubok ng bagong paradigma[4].

Arkitektura at pagsasanay

Mga katangian ng arkitektura

Ang Chinchilla ay kabilang sa pamilya ng mga autoregressive transformer at malapit sa arkitektura ng mga modelo ng GPT-2/GPT-3[3]. Minana nito ang maraming solusyon mula sa Gopher, ngunit may mga pangunahing pagkakaiba na naglalayong bawasan ang laki habang pinananatili ang lalim ng network:

  • Mga parameter: ~70 bilyong parameter, ipinamamahagi sa 80 na layer.
  • Lapad ng modelo: Ang bilang ng mga self-attention head ay nabawasan sa 64 (kumpara sa 128 ng Gopher), at ang panloob na dimensyon ng mga layer — sa 8192 (kumpara sa ~16384 ng Gopher).
  • Optimizer: Ginagamit ang AdamW sa halip na Adam, na nagpapabuti ng convergence sa malalaking dataset[3].

Ang ganitong arkitektura ay nagpahintulot sa Chinchilla na mapanatili ang parehong lalim ng network tulad ng Gopher, ngunit sa mas maliit na bilang ng mga parameter, na nagpababa ng mga kinakailangan sa memorya at mga computational na mapagkukunan.

Pag-scale at datos para sa pagsasanay

Upang mapatunayan ang hipotesis, sinanay ang Chinchilla sa parehong computational budget tulad ng Gopher, ngunit may muling pamamahagi ng mga mapagkukunan sa pabor ng datos. Ang modelo na may 70 bilyong parameter ay sinanay sa isang corpus na 1.4 trilyon na token, na humigit-kumulang 4 na beses na lalampas sa dami ng datos na ginamit para sa Gopher[1].

Ang sukatang ito, na humigit-kumulang 20 token para sa bawat parameter, ay naging kilala bilang punto ng Chinchilla (Chinchilla Point) at isang gabay para sa computationally-optimal na pagsasanay ng mga modernong LLM[5]. Kinumpirma ng eksperimento na ang Chinchilla, na sinanay na mas malapit sa pinakamainam na limitasyong ito, ay nagawa nitong mapagtanto ang sarili nitong potensyal nang mas buo kaysa sa mga kulang ang pagsasanay, kahit na mas malalaking, modelo.

Mga resulta at pagganap

Sa malawak na hanay ng mga karaniwang pagsubok, nagpakita ang Chinchilla ng makabuluhang kahusayan kumpara sa mga nakaraang modelo. Malinaw nitong nalampasan hindi lamang ang Gopher, kundi pati na rin ang iba pang mga LLM na kontemporaryo noong panahong iyon, kabilang ang OpenAI GPT-3 (175 bilyong parameter) at Megatron-Turing NLG (530 bilyong parameter)[1].

Ang pinaka-kapansin-pansing resulta ay ang sa komprehensibong benchmark na MMLU (Measuring Massive Multitask Language Understanding), na sumasuri sa kaalaman at pangangatwiran sa daan-daang magkakaibang gawain. Ang Chinchilla ay nakamit ang average na katumpakan na 67.5%, na naging bagong rekord para sa mga modelo ng ganitong klase at lumampas ng 7 puntos ng porsyento sa resulta ng Gopher[4].

Bukod sa mataas na kahusayan, ipinakita rin ng Chinchilla ang kahusayan sa paggamit. Ang mas maliit na laki ng modelo (70 bilyon kumpara sa 175+ bilyon ng mga katulad) ay nangangahulugang ang inference at fine-tuning ay nangangailangan ng mas kaunting computational na mapagkukunan, na pinapasimple ang praktikal na aplikasyon nito.

Kahalagahan at impluwensya

Ang pananaliksik ng Chinchilla ay nagkaroon ng pundamental na impluwensya sa mga diskarte sa pagsasanay ng malalaking language model.

  • Mga batas ng pag-scale ng Chinchilla (Chinchilla scaling laws): Ang natuklasang pinakamainam na ratio sa pagitan ng laki ng modelo at dami ng datos ay naging de-facto na pamantayan at gabay para sa mga kasunod na pag-unlad sa industriya.
  • Paglipat ng pokus mula sa laki patungo sa datos: Hinikayat ng gawa ang industriya na magbigay ng mas maraming pansin sa paglikha, paglilinis at pagpapalawak ng mga corpus sa pagsasanay, at hindi lamang sa walang pagpipiling pagdaragdag ng bilang ng mga parameter.
  • Paggamit sa mga multimodal na sistema: Ang Chinchilla ay ginamit bilang pangunahing language component sa multimodal na modelo ng DeepMind na Flamingo, na kayang umintindi ng mga larawan at teksto[6].

Bagaman ang modelo ng Chinchilla mismo ay hindi inilabas sa pampublikong access, ang mga konsepto at resulta nito, na nailathala sa isang siyentipikong gawa, ay nagbago ng trajectory ng pag-unlad ng buong larangan ng LLM, na nagpapakita ng landas patungo sa mas epektibo at balanseng paglago ng mga kakayahan ng artificial intelligence.

Literatura

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

Mga tala

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.