PaLM (Pathways Language Model) (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) es una familia de modelos de lenguaje grandes (LLM) desarrollada por Google. La primera versión del modelo, presentada en abril de 2022, contenía 540 mil millones de parámetros y se convirtió en uno de los modelos de lenguaje más grandes del mundo en ese momento, demostrando capacidades revolucionarias que fueron el resultado de una escala masiva[1].

La base tecnológica clave de PaLM fue Pathways, una nueva arquitectura de sistemas de aprendizaje automático de Google que permite coordinar eficientemente el cálculo distribuido en miles de chips aceleradores[2]. PaLM se convirtió en la primera demostración a gran escala de este sistema, mostrando una eficiencia de entrenamiento sin precedentes a escalas masivas.

El sistema Pathways: La base para la escalabilidad

El concepto de Pathways, presentado por Google en 2021, proponía la creación de una única red neuronal capaz de generalizar eficientemente el conocimiento en diferentes dominios y realizar miles de tareas simultáneamente. PaLM fue la primera aplicación a gran escala de este sistema: su entrenamiento se paralelizó en 6144 procesadores especializados TPU v4, organizados en dos clústeres en la nube (TPU v4 Pods)[1].

En el momento de su creación, esta fue la configuración de TPU más grande jamás utilizada para entrenar un solo modelo. El sistema alcanzó una eficiencia récord en el uso de la capacidad del hardware (57,8 % de FLOPs), lo que permitió superar significativamente en escala a proyectos anteriores y entrenar con éxito un modelo con más de medio billón de parámetros[3].

Arquitectura y datos de entrenamiento

Arquitectura del modelo

PaLM es un modelo de lenguaje denso (no disperso) con una arquitectura de «solo decodificador» (decoder-only), similar a los modelos de la serie GPT. Esta arquitectura está orientada a tareas de predicción del siguiente token y es muy adecuada para la generación de texto. A diferencia de la arquitectura Transformer estándar, PaLM utiliza varias modificaciones clave para mejorar la eficiencia[1]:

  • Capas paralelas: Los mecanismos de atención y las capas totalmente conectadas se calculan en paralelo, lo que permitió acelerar el entrenamiento en aproximadamente un 15 %.
  • Activación SwiGLU: Se utiliza la función de activación SwiGLU en lugar de la ReLU estándar, lo que mejoró significativamente la calidad del modelo.

Datos de entrenamiento

PaLM fue entrenado en un corpus de datos de alta calidad de 780 mil millones de tokens. El conjunto de datos era multilingüe y diverso, e incluía[1]:

  • Documentos web de alta calidad y libros.
  • Artículos de Wikipedia.
  • Diálogos de redes sociales (50 % del corpus).
  • Código fuente de GitHub (5 % del corpus).

Alrededor del 78 % de los datos estaba en inglés, y el 22 % restante era un conjunto de datos multilingüe. Para la tokenización se utilizó una técnica especial «sin pérdidas» que conservaba todos los espacios en blanco (crítico para el código) y dividía los caracteres Unicode no reconocidos en bytes.

Capacidades y resultados

Habilidades emergentes y aprendizaje few-shot

PaLM demostró que el aumento en la escala del modelo, el volumen de datos y la capacidad computacional puede conducir a habilidades emergentes (que surgen inesperadamente). En muchas tareas, el rendimiento del modelo aumentaba de manera drástica y no lineal solo al alcanzar la escala máxima, lo que indicaba la aparición de nuevas capacidades no observadas previamente[3].

El modelo fue evaluado en modo de aprendizaje few-shot (sin ajuste fino, con algunos ejemplos en el prompt) y superó a modelos grandes anteriores (como GPT-3 y LaMDA) en 28 de los 29 benchmarks populares de NLP. En el conjunto de tareas integral BIG-bench, PaLM se convirtió en el primer modelo cuyos resultados superaron el nivel promedio mostrado por los evaluadores humanos[1].

Razonamiento en cadena de pensamiento (Chain-of-Thought)

Uno de los logros más notables de PaLM fue su capacidad para el razonamiento lógico de varios pasos utilizando la técnica de prompts de «cadena de pensamiento» (chain-of-thought prompting)[1]. Esta metodología consiste en proporcionar al modelo ejemplos donde la solución de una tarea se desglosa paso a paso. Al aprender de tales ejemplos, PaLM pudo generar su propia «cadena de pensamiento» para resolver nuevas tareas complejas, tales como:

  • Problemas matemáticos: En la prueba GSM8K (problemas de nivel de escuela primaria), PaLM resolvió el 58 % de las tareas, superando el resultado de vanguardia anterior logrado por un modelo con ajuste fino.
  • Tareas de sentido común: El modelo pudo generar explicaciones detalladas para tareas no triviales, como interpretar chistes que no había visto antes.

Esta capacidad hizo que el proceso de «pensamiento» del modelo fuera más transparente y similar al humano.

Generación de código y multilingüismo

Aunque el código fuente constituía solo el 5 % de los datos de entrenamiento, PaLM mostró un rendimiento comparable al del modelo especializado OpenAI Codex en tareas de generación y transformación de código. El modelo también demostró sólidas capacidades en tareas multilingües, incluida la traducción[3].

Evolución y sucesores: La familia PaLM

PaLM se convirtió en la base de toda una familia de modelos desarrollados por Google.

PaLM 2

Presentado en mayo de 2023, PaLM 2 se convirtió en un sucesor más eficiente y multilingüe. En lugar de buscar un mayor número de parámetros, el énfasis se puso en la calidad de los datos de entrenamiento y la eficiencia de la arquitectura. PaLM 2 fue entrenado con textos en más de 100 idiomas y demuestra capacidades mejoradas en lógica, programación y traducción[4]. El modelo se lanza en cuatro tamaños (de menor a mayor): Gecko, Otter, Bison y Unicorn. La variante más compacta (Gecko) es lo suficientemente ligera como para funcionar en dispositivos móviles en modo sin conexión.

Versiones especializadas

Sobre la base de PaLM y PaLM 2 se crearon versiones para dominios específicos:

  • Med-PaLM 2: Un modelo especializado para la medicina. Se convirtió en el primer sistema de IA en alcanzar el nivel de experto en las preguntas del examen de licencia médica de los Estados Unidos (USMLE)[4].
  • Sec-PaLM 2: Un modelo orientado a la ciberseguridad, entrenado para identificar vulnerabilidades y analizar código malicioso[5].

PaLM-E: Versión multimodal

PaLM-E (Pathways Language Model Embodied) es un modelo multimodal que combina el modelo de lenguaje PaLM con datos visuales de un Vision Transformer (ViT). Esto permite al modelo procesar tanto texto como imágenes, resolviendo tareas relacionadas con el mundo físico, como el control de robots[6].

Aspectos éticos y limitaciones

Los creadores de PaLM enfatizan la necesidad de un enfoque responsable en el desarrollo de modelos de lenguaje grandes. En el artículo científico oficial, se realizó un análisis de posibles sesgos y toxicidad en el texto generado por el modelo. Para garantizar la transparencia, Google publicó una tarjeta del modelo (Model Card) y una hoja de datos (Datasheet) para PaLM, donde se documentan las características del conjunto de datos, los resultados de las pruebas y las limitaciones identificadas[1]. Estas medidas se alinean con las prácticas modernas de IA responsable y tienen como objetivo reducir los riesgos asociados con los prejuicios y la generación de contenido malicioso.

Enlaces externos

Bibliografía

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

Referencias

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]