PaLM (Pathways Language Model) (TL)
PaLM (Pathways Language Model) — ito ay isang pamilya ng malalaking language model (LLM), na binuo ng kumpanyang Google. Ang unang bersyon ng modelo, na ipinakita noong Abril 2022, ay naglalaman ng 540 bilyong parameter at naging isa sa pinakamalaking language model sa mundo noon, na nagpakita ng mga makabagong kakayahan bilang resulta ng napakalaking scaling[1].
Ang pangunahing teknolohikal na pundasyon ng PaLM ay ang Pathways — isang bagong arkitektura ng mga sistema ng Machine Learning mula sa Google, na nagbibigay-daan sa mahusay na koordinasyon ng distributed na pagkukuwenta sa libu-libong accelerator chip[2]. Ang PaLM ang naging unang malakihang demonstrasyon ng sistemang ito, na nagpakita ng walang kapantay na kahusayan sa pagsasanay sa napakalaking sukat.
Pathways System: Pundasyon para sa Scaling
Ang konsepto ng Pathways, na ipinakita ng Google noong 2021, ay naglalayong lumikha ng isang neural network na kayang mahusay na pangkalahatin ang kaalaman para sa iba't ibang domain at magsagawa ng libu-libong gawain nang sabay-sabay. Ang PaLM ang naging unang malakihang aplikasyon ng sistemang ito: ang pagsasanay nito ay na-parallelize sa 6144 espesyalisadong processor na TPU v4, na pinagsama sa dalawang cloud cluster (TPU v4 Pods)[1].
Noong panahon ng paglikha nito, ito ang pinakamalaking configuration ng TPU na ginamit para sa pagsasanay ng isang modelo. Nakamit ng sistema ang rekord na kahusayan sa paggamit ng hardware (57.8% FLOPs), na nagpapahintulot na malampasan nang malaki ang mga nakaraang proyekto at matagumpay na magsanay ng modelo na may higit sa kalahating trilyon na parameter[3].
Arkitektura at Data sa Pagsasanay
Arkitektura ng Modelo
Ang PaLM ay isang siksik (hindi sparse) na language model na may arkitekturang "decoder lamang" (decoder-only), katulad ng mga modelo ng serye ng GPT. Ang ganitong arkitektura ay nakatuon sa mga gawain ng paghula ng susunod na token at angkop para sa pagbuo ng teksto. Hindi tulad ng karaniwang transformer na arkitektura, gumagamit ang PaLM ng ilang pangunahing pagbabago upang mapahusay ang kahusayan[1]:
- Parallel na Layer: Ang mga mekanismo ng attention at fully-connected layer ay kinukuwenta nang sabay-sabay, na nagpapabilis ng pagsasanay ng humigit-kumulang 15%.
- SwiGLU Activation: Ang paggamit ng activation function na SwiGLU sa halip ng karaniwang ReLU, na nagpapahusay nang malaki sa kalidad ng modelo.
Data sa Pagsasanay
Ang PaLM ay sinanay sa mataas na kalidad na corpus ng data na may sukat na 780 bilyong token. Ang dataset ay multilingual at magkakaiba, kasama ang[1]:
- Mataas na kalidad na mga web document at libro.
- Mga artikulo mula sa Wikipedia.
- Mga diyalogo mula sa mga social network (50% ng corpus).
- Source code mula sa GitHub (5% ng corpus).
Mga 78% ng data ay nasa wikang Ingles, at ang natitirang 22% ay isang multilingual na set. Para sa tokenization, ginamit ang espesyal na "lossless" na pamamaraan, na nagpapanatili ng lahat ng espasyo (kritikal para sa code) at hinahati ang mga hindi kilalang simbolo ng Unicode sa mga byte.
Mga Kakayahan at Resulta
Emergent na Kakayahan at Few-Shot na Pagsasanay
Ipinakita ng PaLM na ang pagpapalaki ng sukat ng modelo, dami ng data at kapangyarihan sa pagkukuwenta ay maaaring humantong sa emergent (hindi inaasahang lumitaw) na kakayahan. Sa maraming gawain, ang pagganap ng modelo ay mabilis at di-linear na tumataas lamang kapag naabot ang pinakamataas na sukat, na nagpapahiwatig ng paglitaw ng mga bago at hindi pa nakikitang kakayahan[3].
Ang modelo ay sinuri sa mode ng few-shot na pagsasanay (walang fine-tuning, na may ilang halimbawa sa prompt) at nalampasan ang mga nakaraang malalaking modelo (tulad ng GPT-3 at LaMDA) sa 28 sa 29 na sikat na NLP benchmark. Sa komprehensibong set ng gawain na BIG-bench ang PaLM ang naging unang modelo na ang mga resulta ay nalampasan ang average na antas na ipinakita ng mga taong tester[1].
Chain-of-Thought Reasoning
Isa sa pinaka-kapansin-pansing tagumpay ng PaLM ay ang kakayahan para sa multi-step na lohikal na pag-iisip gamit ang teknik na "chain-of-thought" prompting[1]. Ang pamamaraang ito ay binubuo ng pagbibigay sa modelo ng mga halimbawa kung saan ang solusyon sa problema ay naka-detalye ayon sa mga hakbang. Pagkatapos matuto mula sa ganitong mga halimbawa, nagawa ng PaLM na bumuo ng sarili nitong "chain-of-thought" para sa paglutas ng mga bagong kumplikadong gawain, tulad ng:
- Mga Gawaing Matematika: Sa pagsubok na GSM8K (mga gawain sa antas ng elementarya) nalutas ng PaLM ang 58% ng mga gawain, na nalampasan ang nakaraang state-of-the-art na resulta na nakamit ng isang fine-tuned na modelo.
- Mga Gawain sa Common Sense: Nagawa ng modelo na bumuo ng mga detalyadong paliwanag para sa mga hindi karaniwang gawain, halimbawa, ang pagbibigay ng interpretasyon ng mga bago at hindi pa nakikitang biro.
Ang kakayahang ito ay nagpagawa ng proseso ng "pag-iisip" ng modelo na mas malinaw at katulad ng tao.
Pagbuo ng Code at Multilinguality
Kahit na ang source code ay 5% lamang ng data sa pagsasanay, ipinakita ng PaLM ang antas na maihahambing sa espesyalisadong modelo ng OpenAI Codex sa mga gawain ng pagbuo at pagbabago ng code. Nagpakita rin ang modelo ng matibay na kakayahan sa mga multilingual na gawain, kasama ang pagsasalin[3].
Ebolusyon at mga Kahalili: Pamilya ng PaLM
Ang PaLM ay naging pundasyon para sa isang buong pamilya ng mga modelo na binuo ng Google.
PaLM 2
Ipinakita noong Mayo 2023, ang PaLM 2 ay naging mas mahusay at multilingual na kahalili. Sa halip na maghanap ng mas maraming parameter, ang diin ay inilipat sa kalidad ng data sa pagsasanay at kahusayan ng arkitektura. Ang PaLM 2 ay sinanay sa teksto sa higit sa 100 wika at nagpapakita ng pinahusay na kakayahan sa lohika, programming at pagsasalin[4]. Ang modelo ay inilalabas sa apat na sukat (mula pinakamaliit hanggang pinakamalaki): Gecko, Otter, Bison at Unicorn. Ang pinakamaliksi na variant (Gecko) ay magaan enough upang gumana sa mga mobile device sa offline na mode.
Mga Espesyalisadong Bersyon
Batay sa PaLM at PaLM 2, nilikha ang mga bersyon para sa mga tiyak na domain:
- Med-PaLM 2: Espesyalisadong modelo para sa medisina. Naging unang sistema ng AI na umabot sa antas ng eksperto sa mga tanong ng lisensya na pagsubok para sa mga doktor sa USA (USMLE)[4].
- Sec-PaLM 2: Modelo na nakatuon sa cybersecurity, na sinanay upang matukoy ang mga kahinaan at suriin ang mapaminsalang code[5].
PaLM-E: Multimodal na Bersyon
Ang PaLM-E (Pathways Language Model Embodied) — ito ay isang multimodal na modelo na pinagsama ang language model ng PaLM sa visual na data mula sa Vision Transformer (ViT). Nagbibigay-daan ito sa modelo na maproseso ang parehong teksto at mga larawan, at malutas ang mga gawaing nauugnay sa pisikal na mundo, halimbawa, para sa pagkontrol ng mga robot[6].
Mga Etikal na Aspeto at Limitasyon
Binibigyang-diin ng mga lumikha ng PaLM ang pangangailangan ng responsableng diskarte sa pagbuo ng malalaking language model. Sa opisyal na siyentipikong artikulo, isinagawa ang isang pagsusuri ng mga posibleng pagkiling at toxicity sa nilikhang teksto. Para sa transparency, nag-publish ang Google ng Model Card at Datasheet para sa PaLM, kung saan dokumentado ang mga katangian ng dataset, mga resulta ng pagsubok at natukoy na mga limitasyon[1]. Ang mga hakbang na ito ay naaayon sa mga modernong kasanayan ng responsableng AI at naglalayong bawasan ang mga panganib na nauugnay sa mga pagkiling at pagbuo ng mapaminsalang nilalaman.
Mga Sanggunian
- Opisyal na blog ng Google tungkol sa PaLM
- PaLM API para sa mga developer
Panitikan
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]