Theoretical foundations of large language models (TL)
Mga Teoretikal na Pundasyon ng Malalaking Modelo ng Wika (batay sa arkitektura ng transformer) — ito ay isang hanay ng mga matematikal, estadistikal, at impormasyong-teoretikal na prinsipyo na siyang pundasyon ng pagpapaandar, pagsasanay, at kakayahan ng mga modernong malalaking modelo ng wika (LLM). Ipinaliliwanag ng mga pundasyon na ito kung paano kayang maunawaan at buuin ng mga modelong itinayo sa arkitektura ng Transformer ang wikang pantao nang may mataas na antas ng koherensi.
Mga Arkitekturang Pundasyon: Arkitektura ng Transformer
Ang mga modernong LLM ay halos ganap na nakabatay sa arkitektura ng Transformer, na inilabas noong 2017 sa papel na «Attention Is All You Need». Tinalikuran ng arkitekturang ito ang mga recurrent na layer (tulad ng sa RNN at LSTM), at inuna ang mekanismo ng attention, na nagpahintulot ng mahusay na pagproseso ng mahahabang sequence at paralelo na pagkalkula.
Mekanismo ng Self-Attention
Ito ang ubod ng arkitektura ng Transformer. Pinapahintulutan ng mekanismo ng self-attention ang modelo na timbangin ang kahalagahan ng bawat salita (token) sa sequence kaugnay ng lahat ng iba pang salita sa parehong sequence. Para sa bawat token, tatlong vector ang nalilikha:
- Query (Q, Tanong): vector na kumakatawan sa kasalukuyang salita.
- Key (K, Susi): vector na kinukumpara sa mga tanong mula sa ibang mga salita.
- Value (V, Halaga): vector na naglalaman ng impormasyon tungkol sa salita na ipapasa sa susunod.
Ang score ng attention ay kinakalkula bilang scaled dot product:
kung saan ang ay ang dimensyon ng mga key vector. Pinapahintulutan ng mekanismong ito ang modelo na makuha ang mga kumplikadong kontekstwal na relasyon, anuman ang distansya sa pagitan ng mga salita.
Multi-Head Attention — ito ang paralelo na pagpapatupad ng ilang ganitong kalkulasyon na may iba't ibang projection matrix, na nagpapahintulot sa modelo na sabay na magtuon sa iba't ibang aspeto ng syntax at semantika.
Mga Uri ng Arkitektura Batay sa Transformer
May tatlong pangunahing paraan ng paggamit ng mga bahagi ng Transformer:
- Encoder-Decoder: Klasikong arkitektura para sa mga gawaing sequence-to-sequence (hal., machine translation). Pinoproseso ng encoder ang input sequence, at binubuo ng decoder ang output. Mga halimbawa: T5, BART.
- Encoder-Only (Encoder lamang): Mga modelong gumagamit lamang ng encoder stack. Angkop ang mga ito para sa mga gawaing nangangailangan ng malalim na pag-unawa sa konteksto ng buong sequence (pag-uuri ng teksto, pagkilala ng mga pinangalanang entidad). Halimbawa: BERT.
- Decoder-Only (Decoder lamang): Mga modelong gumagamit lamang ng decoder stack. Nagtatrabaho ang mga ito nang autoregressive, hinuhulaan ang susunod na token batay sa mga nauna. Ito ang pamantayan para sa mga generative na modelo. Mga halimbawa: GPT, LLaMA, Claude.
Positional Encoding - Positional na Pag-encode
Dahil hindi isinasaalang-alang ng mekanismo ng self-attention ang pagkakasunud-sunod ng mga salita, idinaragdag sa arkitektura ang positional encoding. Ang mga vector na nag-e-encode ng posisyon sa sequence ay idinaragdag sa mga token embedding. Sa orihinal na modelo, ginamit ang mga sinusoidal na function:
Sa mga modernong modelo, ginagamit din ang mga naaral at rotary (Rotary Position Embeddings, RoPE) na positional encoding.
Mga Prinsipyo ng Pagsasanay: Mula sa Probabilidad hanggang sa Optimisasyon
Language Modeling Bilang Probabilistikong Gawain
Sa puso ng LLM ay ang gawain ng language modeling — ang paghula ng probabilidad ng isang sequence ng teksto. Pormal na, para sa isang sequence na , tinatasa ng modelo ang probabilidad na . Sa pamamagitan ng chain rule ng probabilidad, ito ay nalalatag sa produkto ng mga conditional na probabilidad:
Kaya, ang pagsasanay ng modelo ay bumababa sa paghula ng susunod na token na batay sa konteksto ng mga nakaraang token.
Loss Function at Information Theory
Para sa pagsusuri ng kalidad ng mga hula at pagsasanay ng modelo, ginagamit ang cross-entropy loss function. Sinusukat nito ang pagkakaiba sa pagitan ng probabilidad na distribusyon na hinula ng modelo () at ng tunay na distribusyon (), kung saan ang tamang susunod na token ay may probabilidad na 1, at ang iba ay 0.
Ang pag-minimize ng cross-entropy ay katumbas ng pag-maximize ng likelihood ng training data.
Ang kaugnay na sukatan ng kalidad ay ang perplexity, na tinukuyan bilang eksponente ng cross-entropy: . Sa intuisyon, ipinapakita ng perplexity ang average na bilang ng mga opsyon kung saan «pumipili» ang modelo sa bawat hakbang. Habang mas mababa ang perplexity, mas tiwala at tumpak ang modelo.
Optimisasyon
Ang pagsasanay ng LLM ay isang proseso ng pag-minimize ng loss function sa pamamagitan ng pag-aayos ng bilyun-bilyong parameter ng modelo. Para dito, ginagamit ang mga pamamaraan batay sa gradient descent. Ang pinakakaraniwan ay ang optimizer na Adam (Adaptive Moment Estimation) at ang mga variant nito (hal., AdamW), na adaptibong nag-aayos ng learning rate para sa bawat parameter.
Mga Paradigma ng Pagsasanay
- Pre-training (Paunang Pagsasanay): Sinasamahan ang modelo sa napakalaking hindi na-label na text corpus (Common Crawl, The Pile, C4) gamit ang mga self-supervised na gawain, tulad ng:
- Causal Language Modeling (CLM): Paghula ng susunod na token (ginagamit sa GPT).
- Masked Language Modeling (MLM): Pagbawi ng mga random na na-mask na token sa teksto (ginagamit sa BERT).
- Fine-tuning (Karagdagang Pagsasanay): Pagkatapos ng pre-training, iniaangkop ang modelo sa mga tiyak na gawain sa maliliit na may label na dataset.
- Alignment (Pagsasaayos): Espesyal na yugto ng fine-tuning na naglalayong iayon ang gawi ng modelo sa mga kagustuhan at pagpapahalaga ng tao. Ang pangunahing pamamaraan ay RLHF (Reinforcement Learning from Human Feedback), kung saan ang modelo ay karagdagang sinasamahan gamit ang reward signal mula sa modelong humuhula ng mga kagustuhan ng tao.
Mga Batas ng Scaling at Mga Emergent na Kakayahan
Ipinakita ng mga empirikal na pananaliksik na ang pagganap ng LLM ay mapaghulaang nagpapabuti sa pagtaas ng tatlong salik: laki ng modelo (bilang ng mga parameter, ), laki ng training dataset (), at dami ng pagkalkula (). Ang dependency na ito ay inilarawan ng mga batas ng kapangyarihan (scaling laws).
Ang batas na iminungkahi sa papel ng OpenAI (Kaplan et al., 2020) ay nagpapakita na ang loss function na ay bumababa bilang isang power function ng , at . Ang mas bagong papel ng DeepMind (Hoffmann et al., 2022) ay nagpino ng mga batas na ito (mga batas ng Chinchilla), na nagpapakita na para sa pinakamainam na pagsasanay, kinakailangang balanse na dagdagan ang parehong laki ng modelo at dami ng data.
Isang mahalagang kahihinatnan ng scaling ay ang paglitaw ng mga emergent na kakayahan — mga kalidad na pagtalon sa pagganap, kapag nagsimula nang malutas ng modelo ang mga gawaing hindi ito malinaw na itinuro (hal., aritmetika, lohikal na pangangatwiran, pagsulat ng code). Ang mga kakayahang ito, bilang panuntunan, ay wala sa mga mas maliliit na modelo at lumalabas lamang pagkatapos maabot ang isang tiyak na threshold ng scale.
Pagbuo ng Teksto: Mga Estratehiya ng Decoding
Pagkatapos ng pagsasanay, ang modelo ay bumubuo ng teksto sa pamamagitan ng iteratibong paghula ng susunod na token. Ang pagpili ng susunod na token mula sa probabilistikong distribusyon na ibinibigay ng modelo ay isinasagawa gamit ang iba't ibang estratehiya ng decoding:
- Greedy Search (Matakaw na Paghahanap): Palaging pinipili ang pinaka-malamang na token. Mabilis, ngunit madalas na nagbubunga ng paulit-ulit at nakakainis na teksto.
- Beam Search (Paghahanap sa Sinag): Sa bawat hakbang, ang pinakamalamang na sequence ay pinananatili, na nagpapahintulot ng paghanap ng mas mainam na pandaigdigang solusyon.
- Temperature Sampling (Sampling na may Temperatura): Ang mga probabilidad ng token ay inaayos ng parameter ng temperatura (). Sa , ang distribusyon ay nagiging mas pantay (mas maraming pagkamalikhain), sa — mas nakaturo (mas kaunting randomness).
- Top-k Sampling: Sa bawat hakbang, ang sampling ay limitado sa pinakamalamang na mga token.
- Top-p (Nucleus) Sampling: Ang sampling ay limitado sa pinakamaliit na hanay ng mga token na ang kabuuang probabilidad ay lumagpas sa threshold na . Nagpapahintulot ito ng dinamikong pag-aayos ng laki ng pool ng mga kandidato.
Mga Teoretikal na Problema at Limitasyon
- Hallucination (Maling Paniniwala): Ang hilig ng mga modelo na bumuo ng faktwal na maling ngunit kapani-paniwalang tumataginting na impormasyon. Ito ay kaugnay ng katotohanang ang mga modelo ay nag-o-optimize ng probabilidad ng teksto, hindi ng katotohanan nito.
- Bias (Pagkiling): Ang mga LLM ay nagmamana at nagpapalaki ng mga panlipunan, kultural, at iba pang pagkiling na naroroon sa training data.
- Interpretability — «Black Box» (Kapaliwanagan — «Itim na Kahon»): Dahil sa napakaraming parameter, napakahirap maunawaan kung paano eksakto gumagawa ng desisyon ang modelo, na nagpapalubha ng pag-debug at lumilikha ng mga panganib.
- Computational Complexity (Kumplikasyon ng Pagkalkula): Ang mekanismo ng self-attention ay may quadratic na kumplikasyon ayon sa haba ng sequence (), na nagtatakda ng maximum na haba ng naprosesong konteksto.
Tingnan Din
- Malalaking Modelo ng Wika
- BERT
- GPT
Literadura
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Brown, T. B. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
- Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. DOI:10.1145/3442188.3445922.