Pre-training of large language models (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Paunang pagsasanay ng malalaking modelo ng wika (LLM) — ito ang isang pundamental na yugto sa paglikha ng mga modernong malaking modelo ng wika, na kinabibilangan ng pagsasanay sa kanila gamit ang napakalaki at magkakaibang hanay ng hindi naka-label na teksto. Ang prosesong ito ay nagbibigay-daan sa mga modelo na matutunan ang mga pangkalahatang pattern ng wika, kaalaman tungkol sa mundo, at mga semantikong ugnayan, na bumubuo ng tinatawag na pundasyon ng modelo (foundation model), na maaaring i-adapt para sa paglutas ng mga partikular na gawain.

Ano ang pre-training?

Ang pre-training ay kumakatawan sa paunang yugto ng pagsasanay, kung saan ang LLM ay sinasamahan ng pagsasanay sa malalaking hanay ng tekstwal na datos gamit ang mga pamamaraan ng self-supervised learning. Nangangahulugan ito na ang mga signal ng pagsasanay (mga label) ay nabubuo mula sa datos mismo, nang hindi nangangailangan ng manu-manong pag-label ng tao.

Ang pangunahing layunin ng yugtong ito ay ang paghula ng mga nakatagong o hinaharap na bahagi ng teksto. Depende sa arkitektura, dalawang pangunahing gawain ang ginagamit:

  • Causal Language Modeling (CLM): Natututo ang modelo na hulaan ang susunod na salita (token) sa isang pagkakasunud-sunod batay sa lahat ng nauna. Ang pamamaraang ito ang nasa pundasyon ng mga generative na modelo, tulad ng GPT.
  • Masked Language Modeling (MLM): Natututo ang modelo na ibalik ang mga random na "naka-mask" (nakatago) na salita sa teksto, gamit ang nakapaligid na bidireksiyonal na konteksto (mga salita sa kaliwa at kanan). Ang pamamaraang ito ay ginagamit sa mga modelo tulad ng BERT.

Sa pamamagitan ng mga gawaing ito, napipilitan ang modelo na pag-aralan ang syntax, semantics, at mga katotohanang kaalaman tungkol sa mundo upang matagumpay na makagawa ng mga hula.

Datos para sa pre-training

Ang bisa ng pre-training ay malaki ang depende sa kalidad at pagkakaiba-iba ng mga datos ng pagsasanay. Ang mga sumusunod na pangunahing pinagkukunan ay ginagamit:

  • Mga web page: Ang mga hanay ng datos tulad ng Common Crawl at C4 ay nagbibigay ng malawak na hanay ng mga paksa, estilo, at wika, na kumakatawan sa isang "snapshot" ng internet.
  • Mga libro: Ang mga corpus tulad ng BookCorpus at The Pile ay nagbibigay ng nakaayos at magkakaugnay na teksto, na kapaki-pakinabang para sa pag-unawa ng mga pangmatagalang dependency at naratibo.
  • Datos ng pag-uusap: Datos mula sa mga forum (hal., Reddit) at social network, na tumutulong sa mga modelo na matutunan ang impormal na wika at mga pattern ng diyalogo.
  • Espesyalisadong datos: Mga siyentipikong artikulo (mula sa arXiv), source code (mula sa GitHub at The Stack), o mga multilingual na teksto para sa pagpapabuti ng mga tiyak na kakayahan ng modelo.

Mga halimbawa ng distribusyon ng datos

Ginagamit ng iba't ibang modelo ang iba't ibang proporsyon ng mga pinagkukunan, na nakakaapekto sa kanilang mga kakayahan:

  • GPT-3 (175 bilyong parameter):** 16% mga libro, 84% mga web page.
  • PaLM (540 bilyong parameter):** 5% mga libro, 14% mga web page, 50% datos ng pag-uusap, 31% iba pa.
  • LLaMA (65 bilyong parameter):** 5% mga libro, 2% mga web page, 87% datos ng pag-uusap.

Ipinakikita ng mga distribusyong ito na ang pagpili ng datos ay isang estratehikong desisyon na nag-iiba-iba depende sa mga layunin ng modelo.

Mga madalas na ginagamit na corpus

Mga madalas na ginagamit na hanay ng datos para sa pre-training ng LLM
Corpus Laki Pinagkukunan Huling Pag-update
BookCorpus 5GB Mga libro Dis-2015
Gutenberg - Mga libro Dis-2021
C4 800GB Common Crawl Abr-2019
CC-Stories-R 31GB Common Crawl Set-2019
CC-NEWS 78GB Common Crawl Peb-2019
REALNEWS 120GB Common Crawl Abr-2019
OpenWebText 38GB Mga link sa Reddit Mar-2023
Pushshift.io 2TB Mga link sa Reddit Mar-2023
Wikipedia 21GB Wikipedia Mar-2023
The Pile 800GB Iba pa Dis-2020
ROOTS 1.6TB Iba pa Hun-2022

Mga teknik ng pagsasanay

Ang pre-training ng LLM ay nangangailangan ng malaking mapagkukunan ng pagkalkula. Ang mga sumusunod na teknik ay ginagamit para pamahalaan ang prosesong ito:

  • Distributed na pagsasanay: Paggamit ng maraming GPU o TPU para sa parallel na pagproseso.
  • Mixed Precision: Paggamit ng mga numerikong format na may mas mababang katumpakan (hal., 16-bit sa halip na 32-bit) upang mapabilis ang mga kalkulasyon at mabawasan ang paggamit ng memorya.
  • Gradient Checkpointing: Isang teknik para makatipid ng memorya sa pamamagitan ng muling pagkalkula, sa halip na pag-iimbak ng ilang intermediate na activation.
  • Model Parallelism: Pamamahagi ng mismong modelo sa maraming device.

Ang pagsasanay ng isang modelo tulad ng GPT-3 ay maaaring tumagal ng ilang buwan sa libu-libong GPU.

Mga batas ng scaling

Ipinakita ng mga pananaliksik, tulad ng gawa ng OpenAI (Kaplan et al., 2020), na ang pagganap ng mga modelo ng wika ay nagpapabuti nang predictable habang lumalaki ang tatlong salik:

  • Laki ng modelo (bilang ng mga parameter).
  • Dami ng datos.
  • Mga mapagkukunan ng pagkalkula.

Ang mga empirikong dependency na ito, na kilala bilang mga batas ng scaling, ay nagsisilbing gabay para sa mga developer sa disenyo at pagsasanay ng mas malalaki at mas makapangyarihang mga modelo, na nagbibigay-daan sa optimal na pamamahagi ng badyet sa pagkalkula.

Mga hamon at tagumpay

  • Scaling: Ang pangunahing tagumpay ng pre-training ay ang kakayahang balansehin ang laki ng modelo, datos, at pagkalkula upang makamit ang optimal na pagganap.
  • Kalidad ng datos: Ang pagtitiyak ng kalinisan, pagkakaiba-iba, at kawalan ng pagkiling sa mga datos ng pagsasanay ay isang pangunahing hamon.
  • Kahusayan: Ang pagbuo ng mga pamamaraan upang mabawasan ang mga gastos sa pagkalkula, tulad ng tuluy-tuloy na pre-training o mas mahusay na mga arkitektura.
  • Multilingualismo: Ang paglikha ng mga modelo na kayang epektibong pangasiwaan ang maraming wika ay nangangailangan ng maingat na pagpili at pagbabalanse ng datos.

Tingnan din

  • Malalaking modelo ng wika
  • BERT
  • GPT