PaLM (Pathways Language Model) (NL)
PaLM (Pathways Language Model) — is een familie van grote taalmodellen (LLM), ontwikkeld door Google. De eerste versie van het model, gepresenteerd in april 2022, bevatte 540 miljard parameters en was op dat moment een van de grootste taalmodellen ter wereld, met baanbrekende mogelijkheden als resultaat van massieve opschaling[1].
De belangrijkste technologische basis van PaLM was Pathways — een nieuwe architectuur voor Machine Learning-systemen van Google, waarmee gedistribueerde berekeningen op duizenden versnellingschips efficiënt gecoördineerd kunnen worden[2]. PaLM was de eerste grootschalige demonstratie van dit systeem en toonde ongekende trainingsefficiëntie op enorme schaal.
Pathways-systeem - Basis voor opschaling
Het concept van Pathways, in 2021 door Google gepresenteerd, voorzag in de creatie van één neuraal netwerk dat kennis effectief kan generaliseren voor verschillende domeinen en duizenden taken tegelijk kan uitvoeren. PaLM was de eerste grootschalige toepassing van dit systeem: de training werd geparallelliseerd over 6144 gespecialiseerde processors TPU v4, ondergebracht in twee cloudclusters (TPU v4 Pods)[1].
Ten tijde van de ontwikkeling was dit de grootste TPU-configuratie die ooit voor het trainen van één model werd gebruikt. Het systeem bereikte een recordefficiëntie van hardwarebenutting (57,8% FLOPs), waardoor het voorgaande projecten in schaal aanzienlijk overtrof en het model met meer dan een half biljoen parameters succesvol getraind kon worden[3].
Architectuur en trainingsdata
Modelarchitectuur
PaLM is een dense (niet-sparse) taalmodel met een uitsluitend decoder-architectuur (decoder-only), vergelijkbaar met modellen uit de GPT-serie. Deze architectuur is gericht op taken voor het voorspellen van het volgende token en is goed geschikt voor tekstgeneratie. In tegenstelling tot de standaard transformer-architectuur gebruikt PaLM een aantal belangrijke modificaties om de efficiëntie te verhogen[1]:
- Parallelle lagen: De attention-mechanismen en volledig verbonden lagen worden parallel berekend, wat de training met ongeveer 15% versnelde.
- SwiGLU-activatie: Het gebruik van de SwiGLU-activatiefunctie in plaats van de standaard ReLU verbeterde de kwaliteit van het model aanzienlijk.
Trainingsdata
PaLM werd getraind op een hoogwaardig gegevenscorpus van 780 miljard tokens. De dataset was meertalig en gevarieerd, met daarin[1]:
- Hoogwaardige webdocumenten en boeken.
- Artikelen uit Wikipedia.
- Dialogen uit sociale netwerken (50% van het corpus).
- Broncode van GitHub (5% van het corpus).
Ongeveer 78% van de gegevens was in het Engels, terwijl de overige 22% een meertalige set betrof. Voor tokenisatie werd een speciale 'verliesvrije' methode gebruikt, die alle spaties bewaarde (cruciaal voor code) en niet-herkende Unicode-tekens omzette naar bytes.
Mogelijkheden en resultaten
Emergente vermogens en few-shot leren
PaLM toonde aan dat het vergroten van de modelschaal, de hoeveelheid data en de rekenkracht kan leiden tot emergente (onverwacht opkomende) vermogens. Bij veel taken nam de prestatie van het model pas sterk en niet-lineair toe bij het bereiken van de maximale schaal, wat wees op het ontstaan van nieuwe, eerder niet waargenomen mogelijkheden[3].
Het model werd geëvalueerd in de modus van few-shot leren (zonder fine-tuning, met enkele voorbeelden in de prompt) en overtrof eerdere grote modellen (zoals GPT-3 en LaMDA) op 28 van de 29 populaire NLP-benchmarks. Op de uitgebreide takenset BIG-bench was PaLM het eerste model waarvan de resultaten het gemiddelde niveau van menselijke testers overtroffen[1].
Redeneren via gedachteketen (Chain-of-Thought)
Een van de meest opvallende prestaties van PaLM was het vermogen tot meerstaps logisch redeneren bij gebruik van de chain-of-thought prompting-techniek[1]. Deze methode houdt in dat het model voorbeelden krijgt aangeboden waarbij de oplossing stap voor stap wordt uitgewerkt. Na het leren van dergelijke voorbeelden kon PaLM zijn eigen 'gedachteketen' genereren om nieuwe complexe taken op te lossen, zoals:
- Wiskundige vraagstukken: Op de test GSM8K (vraagstukken op basisschoolniveau) loste PaLM 58% van de opgaven op, wat het vorige state-of-the-art resultaat van een fijnafgestemd model overtrof.
- Gezond-verstandtaken: Het model kon uitgebreide verklaringen genereren voor niet-triviale taken, zoals het duiden van eerder niet-geziene grappen.
Dit vermogen maakte het 'denkproces' van het model transparanter en meer gelijkend op dat van mensen.
Codegeneratie en meertaligheid
Ondanks het feit dat broncode slechts 5% van de trainingsdata uitmaakte, presteerde PaLM op een vergelijkbaar niveau als het gespecialiseerde model OpenAI Codex bij taken voor codegeneratie en codetransformatie. Het model toonde ook sterke capaciteiten bij meertalige taken, waaronder vertaling[3].
Evolutie en opvolgers - De PaLM-familie
PaLM vormde de basis voor een hele familie modellen ontwikkeld door Google.
PaLM 2
In mei 2023 gepresenteerd, is PaLM 2 een efficiëntere en meertalige opvolger. In plaats van het nastreven van meer parameters werd de nadruk verlegd naar de kwaliteit van de trainingsdata en de efficiëntie van de architectuur. PaLM 2 is getraind op teksten in meer dan 100 talen en toont verbeterde vermogens op het gebied van logica, programmeren en vertaling[4]. Het model wordt uitgebracht in vier formaten (van kleinste naar grootste): Gecko, Otter, Bison en Unicorn. De meest compacte variant (Gecko) is licht genoeg om op mobiele apparaten offline te draaien.
Gespecialiseerde versies
Op basis van PaLM en PaLM 2 werden versies voor specifieke domeinen ontwikkeld:
- Med-PaLM 2: Een gespecialiseerd model voor de geneeskunde. Het werd het eerste AI-systeem dat het niveau van een expert bereikte op vragen van het Amerikaanse artsexamen (USMLE)[4].
- Sec-PaLM 2: Een model gericht op cyberveiligheid, getraind om kwetsbaarheden te identificeren en kwaadaardige code te analyseren[5].
PaLM-E - Multimodale versie
PaLM-E (Pathways Language Model Embodied) is een multimodaal model dat het PaLM-taalmodel combineert met visuele data van de Vision Transformer (ViT). Hierdoor kan het model zowel tekst als afbeeldingen verwerken en taken uitvoeren die verband houden met de fysieke wereld, bijvoorbeeld voor de aansturing van robots[6].
Ethische aspecten en beperkingen
De makers van PaLM benadrukken de noodzaak van een verantwoorde aanpak bij de ontwikkeling van grote taalmodellen. In het officiële wetenschappelijke artikel werd een analyse uitgevoerd van mogelijke vooroordelen en toxiciteit in de gegenereerde tekst. Om transparantie te waarborgen publiceerde Google een modelkaart (Model Card) en een datarapport (Datasheet) voor PaLM, waarin de kenmerken van de dataset, testresultaten en vastgestelde beperkingen zijn gedocumenteerd[1]. Deze maatregelen zijn in lijn met de huidige praktijken op het gebied van verantwoorde AI en zijn bedoeld om de risico's van vooroordelen en het genereren van schadelijke inhoud te verminderen.
Verwijzingen
- Officiële Google-blog over PaLM
- PaLM API voor ontwikkelaars
Literatuur
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Noten
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]