Pre-training of large language models (TL)
Paunang pagsasanay ng malalaking modelo ng wika (LLM) — ito ang isang pundamental na yugto sa paglikha ng mga modernong malaking modelo ng wika, na kinabibilangan ng pagsasanay sa kanila gamit ang napakalaki at magkakaibang hanay ng hindi naka-label na teksto. Ang prosesong ito ay nagbibigay-daan sa mga modelo na matutunan ang mga pangkalahatang pattern ng wika, kaalaman tungkol sa mundo, at mga semantikong ugnayan, na bumubuo ng tinatawag na pundasyon ng modelo (foundation model), na maaaring i-adapt para sa paglutas ng mga partikular na gawain.
Ano ang pre-training?
Ang pre-training ay kumakatawan sa paunang yugto ng pagsasanay, kung saan ang LLM ay sinasamahan ng pagsasanay sa malalaking hanay ng tekstwal na datos gamit ang mga pamamaraan ng self-supervised learning. Nangangahulugan ito na ang mga signal ng pagsasanay (mga label) ay nabubuo mula sa datos mismo, nang hindi nangangailangan ng manu-manong pag-label ng tao.
Ang pangunahing layunin ng yugtong ito ay ang paghula ng mga nakatagong o hinaharap na bahagi ng teksto. Depende sa arkitektura, dalawang pangunahing gawain ang ginagamit:
- Causal Language Modeling (CLM): Natututo ang modelo na hulaan ang susunod na salita (token) sa isang pagkakasunud-sunod batay sa lahat ng nauna. Ang pamamaraang ito ang nasa pundasyon ng mga generative na modelo, tulad ng GPT.
- Masked Language Modeling (MLM): Natututo ang modelo na ibalik ang mga random na "naka-mask" (nakatago) na salita sa teksto, gamit ang nakapaligid na bidireksiyonal na konteksto (mga salita sa kaliwa at kanan). Ang pamamaraang ito ay ginagamit sa mga modelo tulad ng BERT.
Sa pamamagitan ng mga gawaing ito, napipilitan ang modelo na pag-aralan ang syntax, semantics, at mga katotohanang kaalaman tungkol sa mundo upang matagumpay na makagawa ng mga hula.
Datos para sa pre-training
Ang bisa ng pre-training ay malaki ang depende sa kalidad at pagkakaiba-iba ng mga datos ng pagsasanay. Ang mga sumusunod na pangunahing pinagkukunan ay ginagamit:
- Mga web page: Ang mga hanay ng datos tulad ng Common Crawl at C4 ay nagbibigay ng malawak na hanay ng mga paksa, estilo, at wika, na kumakatawan sa isang "snapshot" ng internet.
- Mga libro: Ang mga corpus tulad ng BookCorpus at The Pile ay nagbibigay ng nakaayos at magkakaugnay na teksto, na kapaki-pakinabang para sa pag-unawa ng mga pangmatagalang dependency at naratibo.
- Datos ng pag-uusap: Datos mula sa mga forum (hal., Reddit) at social network, na tumutulong sa mga modelo na matutunan ang impormal na wika at mga pattern ng diyalogo.
- Espesyalisadong datos: Mga siyentipikong artikulo (mula sa arXiv), source code (mula sa GitHub at The Stack), o mga multilingual na teksto para sa pagpapabuti ng mga tiyak na kakayahan ng modelo.
Mga halimbawa ng distribusyon ng datos
Ginagamit ng iba't ibang modelo ang iba't ibang proporsyon ng mga pinagkukunan, na nakakaapekto sa kanilang mga kakayahan:
- GPT-3 (175 bilyong parameter):** 16% mga libro, 84% mga web page.
- PaLM (540 bilyong parameter):** 5% mga libro, 14% mga web page, 50% datos ng pag-uusap, 31% iba pa.
- LLaMA (65 bilyong parameter):** 5% mga libro, 2% mga web page, 87% datos ng pag-uusap.
Ipinakikita ng mga distribusyong ito na ang pagpili ng datos ay isang estratehikong desisyon na nag-iiba-iba depende sa mga layunin ng modelo.
Mga madalas na ginagamit na corpus
| Corpus | Laki | Pinagkukunan | Huling Pag-update |
|---|---|---|---|
| BookCorpus | 5GB | Mga libro | Dis-2015 |
| Gutenberg | - | Mga libro | Dis-2021 |
| C4 | 800GB | Common Crawl | Abr-2019 |
| CC-Stories-R | 31GB | Common Crawl | Set-2019 |
| CC-NEWS | 78GB | Common Crawl | Peb-2019 |
| REALNEWS | 120GB | Common Crawl | Abr-2019 |
| OpenWebText | 38GB | Mga link sa Reddit | Mar-2023 |
| Pushshift.io | 2TB | Mga link sa Reddit | Mar-2023 |
| Wikipedia | 21GB | Wikipedia | Mar-2023 |
| The Pile | 800GB | Iba pa | Dis-2020 |
| ROOTS | 1.6TB | Iba pa | Hun-2022 |
Mga teknik ng pagsasanay
Ang pre-training ng LLM ay nangangailangan ng malaking mapagkukunan ng pagkalkula. Ang mga sumusunod na teknik ay ginagamit para pamahalaan ang prosesong ito:
- Distributed na pagsasanay: Paggamit ng maraming GPU o TPU para sa parallel na pagproseso.
- Mixed Precision: Paggamit ng mga numerikong format na may mas mababang katumpakan (hal., 16-bit sa halip na 32-bit) upang mapabilis ang mga kalkulasyon at mabawasan ang paggamit ng memorya.
- Gradient Checkpointing: Isang teknik para makatipid ng memorya sa pamamagitan ng muling pagkalkula, sa halip na pag-iimbak ng ilang intermediate na activation.
- Model Parallelism: Pamamahagi ng mismong modelo sa maraming device.
Ang pagsasanay ng isang modelo tulad ng GPT-3 ay maaaring tumagal ng ilang buwan sa libu-libong GPU.
Mga batas ng scaling
Ipinakita ng mga pananaliksik, tulad ng gawa ng OpenAI (Kaplan et al., 2020), na ang pagganap ng mga modelo ng wika ay nagpapabuti nang predictable habang lumalaki ang tatlong salik:
- Laki ng modelo (bilang ng mga parameter).
- Dami ng datos.
- Mga mapagkukunan ng pagkalkula.
Ang mga empirikong dependency na ito, na kilala bilang mga batas ng scaling, ay nagsisilbing gabay para sa mga developer sa disenyo at pagsasanay ng mas malalaki at mas makapangyarihang mga modelo, na nagbibigay-daan sa optimal na pamamahagi ng badyet sa pagkalkula.
Mga hamon at tagumpay
- Scaling: Ang pangunahing tagumpay ng pre-training ay ang kakayahang balansehin ang laki ng modelo, datos, at pagkalkula upang makamit ang optimal na pagganap.
- Kalidad ng datos: Ang pagtitiyak ng kalinisan, pagkakaiba-iba, at kawalan ng pagkiling sa mga datos ng pagsasanay ay isang pangunahing hamon.
- Kahusayan: Ang pagbuo ng mga pamamaraan upang mabawasan ang mga gastos sa pagkalkula, tulad ng tuluy-tuloy na pre-training o mas mahusay na mga arkitektura.
- Multilingualismo: Ang paglikha ng mga modelo na kayang epektibong pangasiwaan ang maraming wika ay nangangailangan ng maingat na pagpili at pagbabalanse ng datos.
Tingnan din
- Malalaking modelo ng wika
- BERT
- GPT