PaLM (Pathways Language Model) (FR)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) est une famille de grands modèles de langage (LLM) développée par Google. La première version du modèle, présentée en avril 2022, contenait 540 milliards de paramètres et est devenue l'un des plus grands modèles de langage au monde à l'époque, démontrant des capacités révolutionnaires résultant d'une mise à l'échelle massive[1].

La base technologique clé de PaLM était Pathways — une nouvelle architecture de systèmes d'apprentissage automatique de Google, permettant de coordonner efficacement le calcul distribué sur des milliers de puces d'accélération[2]. PaLM a été la première démonstration à grande échelle de ce système, montrant une efficacité d'entraînement sans précédent à une très grande échelle.

Le système Pathways : La base de la mise à l'échelle

Le concept de Pathways, présenté par Google en 2021, visait à créer un réseau de neurones unique capable de généraliser efficacement les connaissances à travers différents domaines et d'exécuter des milliers de tâches simultanément. PaLM a été la première application à grande échelle de ce système : son entraînement a été parallélisé sur 6144 processeurs spécialisés TPU v4, répartis en deux clusters cloud (TPU v4 Pods)[1].

Au moment de sa création, il s'agissait de la plus grande configuration TPU jamais utilisée pour l'entraînement d'un seul modèle. Le système a atteint une efficacité record d'utilisation de la puissance de calcul matérielle (57,8 % de FLOPs), ce qui a permis de dépasser considérablement l'échelle des projets précédents et d'entraîner avec succès un modèle de plus d'un demi-billion de paramètres[3].

Architecture et données d'entraînement

Architecture du modèle

PaLM est un modèle de langage dense (non-creux) avec une architecture de type « décodeur seul » (decoder-only), similaire aux modèles de la série GPT. Cette architecture est orientée vers les tâches de prédiction du token suivant et est bien adaptée à la génération de texte. Contrairement à l'architecture standard du transformeur, PaLM utilise plusieurs modifications clés pour améliorer son efficacité[1] :

  • Couches parallèles : Les mécanismes d'attention et les couches entièrement connectées sont calculés en parallèle, ce qui a permis d'accélérer l'entraînement d'environ 15 %.
  • Activation SwiGLU : Utilisation de la fonction d'activation SwiGLU au lieu de la ReLU standard, ce qui a considérablement amélioré la qualité du modèle.

Données d'entraînement

PaLM a été entraîné sur un corpus de données de haute qualité de 780 milliards de tokens. L'ensemble de données était multilingue et varié, incluant[1] :

  • Des documents web et des livres de haute qualité.
  • Des articles de Wikipédia.
  • Des dialogues provenant de réseaux sociaux (50 % du corpus).
  • Du code source de GitHub (5 % du corpus).

Environ 78 % des données étaient en anglais, les 22 % restants constituant un ensemble multilingue. Pour la tokenisation, une méthode spéciale « sans perte » a été utilisée, qui préservait tous les espaces (essentiel pour le code) et décomposait les caractères Unicode non reconnus en octets.

Capacités et résultats

Capacités émergentes et apprentissage few-shot

PaLM a démontré que l'augmentation de l'échelle du modèle, du volume des données et de la puissance de calcul peut conduire à des capacités émergentes (apparaissant de manière inattendue). Sur de nombreuses tâches, les performances du modèle ont augmenté de manière abrupte et non linéaire uniquement lorsque l'échelle maximale a été atteinte, ce qui indique l'émergence de nouvelles capacités non observées auparavant[3].

Le modèle a été évalué en mode d'apprentissage few-shot (sans fine-tuning, avec quelques exemples dans le prompt) et a surpassé les modèles de grande taille précédents (tels que GPT-3 et LaMDA) sur 28 des 29 benchmarks NLP populaires. Sur l'ensemble de tâches complexes BIG-bench, PaLM est devenu le premier modèle dont les résultats ont dépassé le niveau moyen atteint par les testeurs humains[1].

Raisonnement par chaîne de pensée (Chain-of-Thought)

L'une des avancées les plus remarquables de PaLM a été sa capacité au raisonnement logique en plusieurs étapes grâce à l'utilisation de la technique de prompting « chaîne de pensée » (chain-of-thought prompting)[1]. Cette méthode consiste à fournir au modèle des exemples où la solution d'un problème est décomposée étape par étape. En s'entraînant sur de tels exemples, PaLM a pu générer sa propre « chaîne de pensée » pour résoudre de nouvelles tâches complexes, telles que :

  • Problèmes mathématiques : Sur le test GSM8K (problèmes de niveau école primaire), PaLM a résolu 58 % des problèmes, surpassant le précédent résultat de l'état de l'art atteint par un modèle ayant bénéficié d'un fine-tuning.
  • Tâches de bon sens : Le modèle a été capable de générer des explications détaillées pour des problèmes non triviaux, par exemple en interprétant des blagues qu'il n'avait jamais rencontrées.

Cette capacité a rendu le processus de « pensée » du modèle plus transparent et similaire à celui de l'être humain.

Génération de code et multilinguisme

Bien que le code source ne représente que 5 % des données d'entraînement, PaLM a démontré un niveau de performance comparable à celui du modèle spécialisé OpenAI Codex sur des tâches de génération et de transformation de code. Le modèle a également montré de solides capacités dans les tâches multilingues, y compris la traduction[3].

Évolution et successeurs : La famille PaLM

PaLM est devenue la base de toute une famille de modèles développés par Google.

PaLM 2

Présenté en mai 2023, PaLM 2 est un successeur plus efficace et multilingue. Plutôt que de viser une augmentation du nombre de paramètres, l'accent a été mis sur la qualité des données d'entraînement et l'efficacité de l'architecture. PaLM 2 est entraîné sur des textes dans plus de 100 langues et démontre des capacités améliorées en logique, en programmation et en traduction[4]. Le modèle est disponible en quatre tailles (de la plus petite à la plus grande) : Gecko, Otter, Bison et Unicorn. La version la plus compacte (Gecko) est suffisamment légère pour fonctionner sur des appareils mobiles en mode hors ligne.

Versions spécialisées

Sur la base de PaLM et PaLM 2, des versions ont été créées pour des domaines spécifiques :

  • Med-PaLM 2 : Un modèle spécialisé pour la médecine. Il est devenu le premier système d'IA à atteindre le niveau d'expert aux questions de l'examen de licence médicale des États-Unis (USMLE)[4].
  • Sec-PaLM 2 : Un modèle axé sur la cybersécurité, entraîné pour détecter les vulnérabilités et analyser le code malveillant[5].

PaLM-E : Version multimodale

PaLM-E (Pathways Language Model Embodied) est un modèle multimodal qui combine le modèle de langage PaLM avec des données visuelles provenant d'un Vision Transformer (ViT). Cela permet au modèle de traiter à la fois du texte et des images pour résoudre des tâches liées au monde physique, par exemple pour le contrôle de robots[6].

Aspects éthiques et limitations

Les créateurs de PaLM soulignent la nécessité d'une approche responsable dans le développement de grands modèles de langage. Dans l'article scientifique officiel, une analyse des biais et de la toxicité potentiels dans le texte généré a été menée. Pour garantir la transparence, Google a publié une carte de modèle (Model Card) et une fiche de données (Datasheet) pour PaLM, documentant les caractéristiques de l'ensemble de données, les résultats des tests et les limitations identifiées[1]. Ces mesures sont conformes aux pratiques actuelles de l'IA responsable et visent à réduire les risques liés aux préjugés et à la génération de contenu préjudiciable.

Liens externes

Bibliographie

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

Références

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]