LLaMA (Meta AI) (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) es una familia de grandes modelos de lenguaje (LLM) predominantemente de código abierto, desarrollada por la división de investigación de Meta AI. Los modelos LLaMA se basan en una arquitectura transformer modificada y están orientados a una alta eficiencia computacional, la democratización del acceso a tecnologías de IA avanzadas y una fácil adaptación a tareas especializadas. La familia ha evolucionado desde el lanzamiento inicial de investigación LLaMA 1 (febrero de 2023) hasta los modelos multimodales LLaMA 4 (cuyo lanzamiento está previsto para 2025).

Nombre

La abreviatura LLaMA significa Large Language Model Meta AI (Gran Modelo de Lenguaje de Meta AI).

  • Large Language Model — destaca la escala de los modelos, cuyos parámetros se miden en miles de millones hasta billones.
  • Meta AI — indica el desarrollador, el grupo de investigación de Meta.

Historia de su creación

El desarrollo de LLaMA comenzó a finales de 2022 como una respuesta estratégica de Meta al éxito de ChatGPT de OpenAI. Mark Zuckerberg formó un equipo interdisciplinario que incluía a investigadores del laboratorio FAIR (Facebook AI Research). Un papel clave en la filosofía del proyecto fue desempeñado por Yann LeCun, director de FAIR, quien desde 2013 ha seguido el principio de apertura total en todas las investigaciones del laboratorio.

La primera versión, LLaMA 1, fue lanzada en febrero de 2023 con una licencia de investigación. Poco después de su lanzamiento, en marzo de 2023, los pesos del modelo se filtraron en internet a través de BitTorrent. Este evento, en contra de los temores, no detuvo, sino que, por el contrario, impulsó el desarrollo del proyecto, ya que dio a investigadores independientes y entusiastas de todo el mundo la oportunidad de experimentar con el modelo. Como resultado, aparecieron decenas de miles de modelos derivados en la plataforma Hugging Face. Las versiones posteriores, a partir de LLaMA 2, se lanzaron con una licencia comercial[1], consolidando el estatus de LLaMA como un actor clave en el mercado de modelos de IA abiertos.

Evolución de los modelos y cronología de lanzamientos

Cronología del desarrollo de los modelos LLaMA
Versión Fecha de lanzamiento Rango de parámetros Innovaciones y características clave
LLaMA 1 Febrero de 2023 7B – 65B Arquitectura base (RMSNorm, SwiGLU, RoPE). Entrenamiento con 1,4 billones de tokens. Ventana de contexto de 2048 tokens. Licencia de investigación.
LLaMA 2 Julio de 2023 7B – 70B Reentrenamiento para diálogos (RLHF). Implementación de Grouped-Query Attention (GQA). Ventana de contexto de 4096 tokens. Primera licencia comercial.
Code Llama Agosto de 2023 7B – 70B Versión especializada para código. Reentrenamiento con 500 mil millones de tokens de código. Variantes: base, especializada en Python, ajustada por instrucciones (instruction-tuned).
LLaMA 3 Abril de 2024 8B, 70B Entrenamiento con 15 billones de tokens. Tokenizador mejorado con un vocabulario de 128 mil tokens. Alto rendimiento (82% en MMLU).
LLaMA 3.1 Julio de 2024[2] 8B, 70B, 405B Modelo insignia de 405B con un rendimiento a la par de GPT-4o. Ventana de contexto de hasta 128 mil tokens. Se introdujo la capacidad de procesar imágenes.
LLaMA 4 (previsto: abril de 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Arquitectura Mixture-of-Experts (MoE). Multimodalidad nativa (texto, imágenes, video). Ventana de contexto de hasta 10 millones de tokens.

Arquitectura

LLaMA utiliza una arquitectura de transformador decodificador autorregresivo, pero introduce una serie de mejoras clave que aumentan la eficiencia computacional y la calidad del texto generado:

  • Pre-normalization (Normalización previa). La normalización se aplica a la entrada de cada subcapa del transformador, en lugar de a la salida. Este enfoque estabiliza el entrenamiento de redes muy profundas y previene problemas con los gradientes.
  • RMSNorm (Root Mean Square Layer Normalization). En lugar de la LayerNorm estándar, se utiliza RMSNorm. Esta técnica de normalización elimina la operación de resta de la media, lo que acelera los cálculos entre un 10% y un 50% manteniendo la estabilidad.
  • SwiGLU (Swish-Gated Linear Unit). Como función de activación, en lugar de ReLU o GELU, se utiliza SwiGLU. Este mecanismo de compuerta (gating mechanism) crea un flujo de gradiente más suave y mejora la calidad del modelo.
  • RoPE (Rotary Position Embeddings, Incrustaciones posicionales rotatorias). Para codificar las posiciones de los tokens, se aplican incrustaciones posicionales relativas RoPE, que permiten al modelo extrapolar mejor a secuencias más largas que las utilizadas durante el entrenamiento.
  • GQA (Grouped-Query Attention). Introducida en LLaMA 2, esta técnica es una optimización de la atención multicabeza que reduce significativamente los requisitos de memoria y acelera la generación de texto.
  • Mixture-of-Experts (MoE) (previsto en LLaMA 4). Una arquitectura que divide los parámetros del modelo en subredes "expertas", activando solo una pequeña parte de ellas para cada consulta. Esto reduce drásticamente los costos computacionales de la inferencia.

Configuraciones de LLaMA 1

Parámetros arquitectónicos de los modelos LLaMA 1
Modelo Parámetros Dimensión del estado oculto N.º de capas N.º de cabezales de atención Volumen de datos de entrenamiento
7B 6.7B 4096 32 32 1.0T de tokens
13B 13.0B 5120 40 40 1.0T de tokens
33B 32.5B 6656 60 52 1.4T de tokens
65B 65.2B 8192 80 64 1.4T de tokens

Datos de entrenamiento

El volumen de los corpus de entrenamiento ha crecido de 1,4 billones de tokens para LLaMA 1 a 15 billones para LLaMA 3. Para el entrenamiento se utilizan fuentes de acceso público, como Common Crawl (que constituye hasta el 67% de los datos), C4, GitHub, Wikipedia, Books, ArXiv y Stack Exchange. Para LLaMA 3 también se utilizaron datos privados de alta calidad.

Rendimiento y comparación

  • En benchmarks: El modelo LLaMA 3.1 (405B) muestra resultados cercanos a los de GPT-4o: en la prueba MMLU, alcanza un 88,6%, quedando solo 0,1 puntos porcentuales por detrás de GPT-4o. En la tarea de generación de código HumanEval, LLaMA 3.1 obtiene un 89% (GPT-4o — 90,2%).
  • Eficiencia paramétrica: Los modelos LLaMA con un menor número de parámetros a menudo superan a los modelos más grandes de la competencia. Por ejemplo, LLaMA 1 (13B) superó a GPT-3 (175B) en la mayoría de las pruebas.
  • Costo: En un alojamiento local, el costo de la inferencia de LLaMA puede ser hasta 50 veces menor en comparación con el uso de API propietarias, lo que hace que la tecnología sea accesible para pequeñas y medianas empresas.

Licenciamiento

  • LLaMA 1 se distribuyó bajo una licencia de investigación no comercial con acceso previa solicitud.
  • LLaMA 2 y versiones posteriores se distribuyen bajo la Llama Community License, que permite el uso comercial y la modificación. Sin embargo, la licencia contiene restricciones: las empresas con más de 700 millones de usuarios activos mensuales deben obtener un permiso especial de Meta. Esto genera debates sobre si LLaMA es un modelo completamente abierto.

Aplicaciones

Los modelos LLaMA están integrados en los productos de miles de empresas y se utilizan en diversas esferas:

  • Sector corporativo: Zoom utiliza LLaMA en su AI Companion para resumir reuniones; Shopify lo usa para procesar entre 40 y 60 millones de solicitudes diarias para enriquecer los metadatos de los productos; Instacart lo implementa en su asistente interno Ava.
  • Ciencia y sociedad: Meditron (una adaptación de LLaMA) se utiliza para el diagnóstico médico en regiones con recursos limitados;
  • Sector público e industria: Meta ha establecido alianzas con Lockheed Martin y Palantir. La NASA utiliza LLaMA 3 en la Estación Espacial Internacional como un asistente offline para realizar operaciones críticas sin conexión con la Tierra.

Limitaciones y críticas

  • Sesgos y seguridad: Auditorías independientes muestran que los modelos LLaMA, a pesar de las medidas de seguridad, pueden reproducir estereotipos perjudiciales. La filtración de los pesos de LLaMA 1 agudizó las preocupaciones sobre el posible uso malintencionado de la tecnología.
  • Lagunas de conocimiento: En áreas muy especializadas, LLaMA puede mostrar lagunas. Por ejemplo, su precisión en la prueba médica nephSAP fue del 17-30% en comparación con el 73% de GPT-4.
  • Consumo de energía: El entrenamiento de modelos grandes requiere enormes recursos. El entrenamiento de LLaMA 1 consumió 2 638 MWh, lo que equivale a la emisión de 1 015 toneladas de CO₂.

Futuro

Meta planea invertir hasta 65 mil millones de dólares en infraestructura de IA para 2025. Actualmente se está desarrollando el modelo LLaMA 4 Behemoth con 2 billones de parámetros, que soportará más de 200 idiomas y tendrá una profunda integración con los productos del metaverso.

Véase también

Bibliografía

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Referencias

  1. La licencia de LLaMA no cumple con todos los criterios de software de código abierto, ya que impone restricciones al uso comercial por parte de las empresas más grandes y requiere la divulgación de información sobre las modificaciones.
  2. LLaMA 3.1 fue anunciada y lanzada en julio de 2024. Véase el anuncio oficial de Meta.