Gemma (Google) (ES)
Gemma es una familia de modelos de lenguaje de libre acceso, desarrollados y publicados por Google (división Google DeepMind). Los modelos Gemma se basan en la misma investigación y tecnología que la familia insignia Gemini, y se posicionan como sus versiones ligeras y de alto rendimiento[1]. El nombre proviene de la palabra latina gemma, que significa «piedra preciosa»[2].
Gemma pertenece a la categoría de modelos abiertos (*open models*): Google publica los pesos de los modelos, lo que permite a investigadores y desarrolladores usarlos, reentrenarlos y distribuirlos libremente, incluso en proyectos comerciales, siempre que se cumplan las condiciones de uso responsable[2]. Esta es una diferencia clave con los modelos Gemini, cuyo acceso solo es posible a través de API en la nube. Los modelos Gemma pueden funcionar localmente en hardware de consumo (portátiles, ordenadores de sobremesa con GPU), y no solo en centros de datos[3].
Desarrollo y lanzamientos
La familia Gemma incluye varias generaciones de modelos, cada una de las cuales ha introducido mejoras en la arquitectura, el rendimiento y las capacidades.
Primera generación: Gemma 1
La primera versión de Gemma fue lanzada el 21 de febrero de 2024[4]. Incluía dos modelos de texto basados en la arquitectura de transformador de solo decodificador:
- Gemma 2B (2 mil millones de parámetros)
- Gemma 7B (7 mil millones de parámetros)
En el momento de su lanzamiento, Google afirmó que estos modelos superaban a sus análogos considerablemente más grandes en benchmarks clave[2]. Los modelos originales eran predominantemente en inglés, pero se entrenaron con una variedad de datos, incluyendo documentos web, código de programación y problemas matemáticos[1]. Ambos modelos se lanzaron en dos variantes: una básica (*pre-trained*) y otra ajustada por instrucciones (*instruction-tuned*) para seguir mejor los comandos del usuario[2].
Segunda generación: Gemma 2
Gemma 2 se anunció el 27 de junio de 2024 y trajo consigo mejoras significativas[1].
- Tamaños de los modelos: Se lanzaron modelos de 9 y 27 mil millones de parámetros. Las variantes más pequeñas se entrenaron utilizando la técnica de destilación de conocimiento de un modelo más grande para mejorar la calidad[5].
- Ventana de contexto: Se amplió significativamente a 80 000 tokens (en comparación con los 8192 de la primera versión)[6][7].
- Mejoras arquitectónicas: Se introdujeron mecanismos de atención de consulta agrupada (*grouped-query attention*) y un esquema alterno de atención local y global para trabajar eficientemente con contextos largos[1].
Tercera generación: Gemma 3
Gemma 3 se presentó en marzo de 2025 como el siguiente paso en el desarrollo de la familia, con un enfoque en la multimodalidad y una cobertura de tareas ampliada[6].
- Multimodalidad: Los modelos obtuvieron soporte para imágenes y video como datos de entrada, además de texto.
- Tamaños e idiomas: La gama de modelos abarca cuatro tamaños (1B, 4B, 12B, 27B) y admite hasta 140 idiomas[6].
- Ventana de contexto: Aumentada a 128 000 tokens[6].
Según Google, Gemma 3 27B demostró resultados a la par de los mejores modelos abiertos de su tiempo, siendo superada en las clasificaciones solo por modelos especializados como DeepSeek-R1[6].
Arquitectura y características técnicas
Los modelos Gemma se basan en la arquitectura de transformador en una configuración de «solo decodificador» (*decoder-only*), similar a los modelos GPT[7]. Esto significa que el modelo genera texto de forma autorregresiva, prediciendo el siguiente token basándose en todos los anteriores. Las soluciones técnicas clave incluyen:
- Incrustaciones posicionales rotatorias (RoPE): En lugar de incrustaciones posicionales absolutas, se utilizan RoPE, lo que permite codificar la información posicional de manera eficiente.
- Atención multi-query y grouped-query: Para acelerar y ahorrar memoria en los modelos más pequeños (por ejemplo, Gemma 2B), se utiliza la atención multi-consulta (*multi-query attention*) (una única clave/valor para todas las cabezas de atención). En Gemma 2 se implementó el mecanismo de atención de consulta agrupada (*grouped-query attention*), donde las consultas se dividen en grupos, lo que representa un compromiso entre velocidad y calidad[1][7].
- Esquema de atención alterno: En Gemma 2 se implementa un esquema donde las capas con autoatención global se alternan con capas de «ventana deslizante» limitada, lo que permite procesar eficientemente contextos largos[1].
Familia de modelos y variantes
Además de los modelos base de propósito general, Google ha lanzado varias versiones derivadas de Gemma, optimizadas para tareas específicas.
- CodeGemma: Un modelo para la generación y completado de código de programación, que soporta C++, C#, Go, Java, JavaScript, Python, Rust y otros lenguajes[1].
- DataGemma: Una familia de modelos reentrenados para la integración con datos externos utilizando técnicas de RAG. El modelo es capaz de realizar consultas a bases de datos (por ejemplo, Google Data Commons) para mejorar la precisión factual de las respuestas[1].
- PaliGemma: Un modelo multimodal capaz de recibir imágenes y texto como entrada. Está diseñado para tareas de preguntas y respuestas visuales, como la descripción de imágenes y el reconocimiento de objetos[1].
- RecurrentGemma: Una variante experimental con una arquitectura híbrida Griffin, que combina atención local y conexiones recurrentes lineales. Esto permite acelerar significativamente la generación de secuencias largas[7].
- MedGemma: Una versión especializada de Gemma 3 para el campo de la medicina. Incluye modelos multimodales (4B) y de texto (27B) para el análisis de imágenes médicas (radiografías, cortes) y documentos clínicos. Los modelos se distribuyen como abiertos, pero no están destinados para uso clínico directo sin validación adicional[8].
- DolphinGemma: Un proyecto de investigación sobre la aplicación de las tecnologías de Gemma para descifrar la comunicación de los delfines. El modelo ha sido entrenado con grabaciones de audio de varios años y se utiliza para identificar patrones en el lenguaje animal[9].
Disponibilidad y aplicación
Los modelos Gemma están disponibles en las plataformas Kaggle y Hugging Face, y también están integrados en los servicios Google Colab y Vertex AI Model Garden[2]. Para acelerar la inferencia, Google, en colaboración con NVIDIA, ha adaptado los modelos para TensorRT. Los términos de la licencia de Gemma permiten el uso comercial y la modificación de los modelos, lo que los diferencia de otros proyectos abiertos. La distribución se rige por la licencia Responsible AI License, que impone restricciones de uso en ciertas áreas (por ejemplo, el desarrollo de armamento) y exige que los productos derivados cumplan con los principios de aplicación segura y ética de la IA[3].
Seguridad y responsabilidad
Los desarrolladores prestaron gran atención a las cuestiones de seguridad, dado el carácter abierto de los modelos.
- Filtrado de datos: Durante la preparación de los conjuntos de datos de entrenamiento, se filtraron automáticamente datos personales y otra información sensible para reducir el riesgo de fugas[2].
- Alineación (*Alignment*): Las versiones ajustadas por instrucciones de los modelos pasaron por una alineación multifásica utilizando técnicas de ajuste fino supervisado (*Supervised Fine-Tuning*, SFT) y RLHF (aprendizaje por refuerzo con retroalimentación humana) para consolidar los estilos de respuesta preferidos[1].
- Red Teaming: Antes de su lanzamiento, los modelos fueron sometidos a pruebas exhaustivas de resistencia a prompts maliciosos. Los expertos intentaron provocar la generación de contenido peligroso o no deseado para identificar vulnerabilidades[3].
- Kit de herramientas de IA Responsable (*Responsible AI Toolkit*): Junto con los modelos, Google lanzó un conjunto de herramientas para facilitar una implementación segura, incluida la utilidad Gemma Debugger para analizar los estados internos del modelo y clasificadores de contenido no deseado[2].
- ShieldGemma: Un modelo-filtro especializado diseñado para prevenir la generación de contenido no seguro en las versiones multimodales de Gemma[6].
Enlaces externos
Bibliografía
- Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
- Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
- Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
- Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
- Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
- Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
- Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.
Referencias
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
- ↑ 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
- ↑ «Google launches two new open LLMs». TechCrunch. [4]
- ↑ «Gemma 2: Improving Open Language Models at a Practical Size». Google.
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
- ↑ 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
- ↑ «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
- ↑ «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]