PaLM (Pathways Language Model) (RO)
PaLM (Pathways Language Model) — este o familie de modele lingvistice mari (LLM), dezvoltată de compania Google. Prima versiune a modelului, prezentată în aprilie 2022, conținea 540 de miliarde de parametri și a devenit unul dintre cele mai mari modele lingvistice din lume la acel moment, demonstrând capabilități revoluționare rezultate din scalarea masivă[1].
Fundamentul tehnologic cheie al PaLM a fost Pathways — o nouă arhitectură a sistemelor de Machine Learning de la Google, care permite coordonarea eficientă a calculelor distribuite pe mii de cipuri acceleratoare[2]. PaLM a devenit prima demonstrație la scară largă a acestui sistem, dovedind o eficiență fără precedent a antrenării la scale enorme.
Sistemul Pathways: Baza pentru scalare
Conceptul Pathways, prezentat de Google în 2021, presupunea crearea unei singure rețele neuronale capabile să generalizeze eficient cunoștințele pentru diferite domenii și să execute mii de sarcini simultan. PaLM a reprezentat prima aplicare la scară largă a acestui sistem: antrenarea sa a fost paralelizată pe 6144 de procesoare specializate TPU v4, reunite în două clustere cloud (TPU v4 Pods)[1].
La momentul creării sale, aceasta era cea mai mare configurație TPU utilizată vreodată pentru antrenarea unui singur model. Sistemul a atins o eficiență record în utilizarea resurselor hardware (57,8% FLOPs), ceea ce a permis depășirea semnificativă ca scară a proiectelor anterioare și antrenarea cu succes a unui model cu peste jumătate de trilion de parametri[3].
Arhitectura și datele de antrenare
Arhitectura modelului
PaLM este un model lingvistic dens (nerarefiat) cu arhitectură „doar decodor" (decoder-only), similară modelelor din seria GPT. Această arhitectură este orientată spre sarcini de predicție a următorului token și este bine adaptată pentru generarea de text. Spre deosebire de arhitectura standard a transformer-ului, PaLM utilizează câteva modificări cheie pentru creșterea eficienței[1]:
- Straturi paralele: Mecanismele de atenție și straturile complet conectate sunt calculate în paralel, ceea ce a permis accelerarea antrenării cu aproximativ 15%.
- Activare SwiGLU: Utilizarea funcției de activare SwiGLU în locul standardului ReLU, ceea ce a îmbunătățit semnificativ calitatea modelului.
Datele de antrenare
PaLM a fost antrenat pe un corpus de date de înaltă calitate cu un volum de 780 de miliarde de tokeni. Setul de date a fost multilingv și divers, incluzând[1]:
- Documente web de înaltă calitate și cărți.
- Articole din Wikipedia.
- Dialoguri din rețelele sociale (50% din corpus).
- Cod sursă de pe GitHub (5% din corpus).
Aproximativ 78% din date erau în limba engleză, iar restul de 22% — un set multilingv. Pentru tokenizare a fost utilizată o metodică specială „fără pierderi", care păstra toate spațiile (critic pentru cod) și descompunea caracterele Unicode nerecunoscute în octeți.
Capabilități și rezultate
Abilități emergente și few-shot learning
PaLM a demonstrat că creșterea scalei modelului, a volumului de date și a resurselor de calcul poate conduce la abilități emergente (apărute în mod neașteptat). Pentru multe sarcini, performanța modelului creștea brusc și neliniar doar la atingerea scalei maxime, indicând apariția unor capabilități noi, neobservate anterior[3].
Modelul a fost evaluat în regim de few-shot learning (fără fine-tuning, cu câteva exemple în prompt) și a depășit modelele mari anterioare (precum GPT-3 și LaMDA) pe 28 din 29 de benchmark-uri NLP populare. Pe setul complex de sarcini BIG-bench, PaLM a devenit primul model ale cărui rezultate au depășit nivelul mediu demonstrat de testerii umani[1].
Raționament prin lanț de gândire (Chain-of-Thought)
Una dintre cele mai remarcabile realizări ale PaLM a fost capacitatea de raționament logic în mai mulți pași prin utilizarea tehnicii de promptare „lanț de gândire" (chain-of-thought prompting)[1]. Această metodică constă în furnizarea modelului a unor exemple în care rezolvarea sarcinii este detaliată pas cu pas. Învățând din astfel de exemple, PaLM a putut genera propriul „lanț de gândire" pentru rezolvarea unor sarcini noi și complexe, precum:
- Probleme matematice: Pe testul GSM8K (probleme de nivel școlar primar) PaLM a rezolvat 58% din sarcini, depășind rezultatul anterior de tip state-of-the-art obținut de un model cu fine-tuning.
- Sarcini de bun-simț: Modelul a putut genera explicații detaliate pentru sarcini nebanale, de exemplu, interpretarea unor glume întâlnite pentru prima dată.
Această capacitate a făcut procesul de „gândire" al modelului mai transparent și mai similar cu cel uman.
Generarea de cod și multilingvism
Deși codul sursă reprezenta doar 5% din datele de antrenare, PaLM a demonstrat un nivel comparabil cu modelul specializat OpenAI Codex pe sarcini de generare și transformare a codului. Modelul a demonstrat, de asemenea, abilități puternice în sarcini multilingve, inclusiv traducere[3].
Evoluție și succesori: Familia PaLM
PaLM a devenit baza pentru o întreagă familie de modele dezvoltate de Google.
PaLM 2
Prezentată în mai 2023, PaLM 2 a devenit un succesor mai eficient și mai multilingv. În loc să urmărească numărul de parametri, accentul a fost mutat pe calitatea datelor de antrenare și eficiența arhitecturii. PaLM 2 este antrenat pe texte în peste 100 de limbi și demonstrează abilități îmbunătățite în logică, programare și traducere[4]. Modelul este disponibil în patru dimensiuni (de la cel mai mic la cel mai mare): Gecko, Otter, Bison și Unicorn. Varianta cea mai compactă (Gecko) este suficient de ușoară pentru a funcționa pe dispozitive mobile în mod offline.
Versiuni specializate
Pe baza PaLM și PaLM 2 au fost create versiuni pentru domenii specifice:
- Med-PaLM 2: Model specializat pentru medicină. A devenit primul sistem AI care a atins nivelul de expert la întrebările din examenul de licențiere medicală din SUA (USMLE)[4].
- Sec-PaLM 2: Model orientat spre securitate cibernetică, antrenat să identifice vulnerabilități și să analizeze cod malițios[5].
PaLM-E: Versiunea multimodală
PaLM-E (Pathways Language Model Embodied) — este un model multimodal care combină modelul lingvistic PaLM cu date vizuale provenind din Vision Transformer (ViT). Aceasta permite modelului să proceseze atât text, cât și imagini, rezolvând sarcini legate de lumea fizică, de exemplu pentru controlul roboților[6].
Aspecte etice și limitări
Creatorii PaLM subliniază necesitatea unei abordări responsabile în dezvoltarea modelelor lingvistice mari. În articolul științific oficial a fost realizată o analiză a posibilelor distorsiuni și toxicități în textul generat. Pentru asigurarea transparenței, Google a publicat o fișă a modelului (Model Card) și un pașaport al datelor (Datasheet) pentru PaLM, unde sunt documentate caracteristicile dataset-ului, rezultatele testelor și limitările identificate[1]. Aceste măsuri sunt conforme cu practicile moderne de AI responsabil și urmăresc reducerea riscurilor legate de prejudecăți și generarea de conținut nociv.
Referințe
- Blogul oficial Google despre PaLM
- PaLM API pentru dezvoltatori
Bibliografie
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]