Gemini (Google) (ES)

From Systems analysis Wiki
Jump to navigation Jump to search

Google Gemini es una familia de grandes modelos de lenguaje (LLM) multimodales desarrollada por la división de investigación Google DeepMind. Los modelos Gemini, presentados por primera vez en diciembre de 2023, están construidos sobre una arquitectura de redes neuronales Transformer con soporte nativo para el procesamiento y la generación de datos en múltiples modalidades, incluyendo texto, imágenes, audio, vídeo y código de programación.

A fecha de febrero de 2026, la generación actual es la línea Gemini 3.x. El desarrollo arquitectónico se centra en la integración de mecanismos de razonamiento escalable durante la inferencia (inference-time scaling) y la optimización de los modelos para su uso dentro de sistemas agentes autónomos (Agentic AI). La aplicación Gemini cuenta con más de 750 millones de usuarios activos mensuales.

Denominación y filosofía

El nombre "Gemini" (del latín — Gemelos) simboliza la unión de dos grupos de investigación líderes de Google — Google Brain y DeepMind — para la creación de este proyecto. Jeff Dean, codirector técnico de Google DeepMind, lo confirmó en una publicación oficial del blog (mayo de 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». El proyecto tenía originalmente el nombre en clave «Titan»; Dean propuso el nombre «Gemini» en abril de 2023, el mismo mes en que se formalizó la fusión de Google Brain y DeepMind. El nombre también hace referencia al programa espacial Gemini de la NASA (1965–1968), cuyo papel en la preparación del programa Apolo resonó entre el equipo de desarrollo.

La característica clave y el fundamento filosófico de Gemini es la multimodalidad nativa. A diferencia de muchos modelos anteriores, donde las capacidades multimodales se añadían sobre una base textual existente, Gemini fue diseñado desde cero para la comprensión, operación y combinación simultánea de diferentes tipos de información. El informe técnico de Gemini 1.0 (arXiv:2312.11805) confirma que el modelo fue «trained jointly across image, audio, video, and text data». Esto permite al modelo no solo traducir datos entre modalidades, sino formar una comprensión más profunda y holística de los mismos.

Arquitectura y tecnologías clave

Las capacidades de los modelos Gemini están definidas por una serie de decisiones arquitectónicas fundamentales. Google no publica el diseño completo de bajo nivel de todos los componentes internos de Gemini; sin embargo, las fuentes públicas permiten establecer la clase de arquitectura: todos los modelos de la familia 1.5 en adelante son modelos basados en transformers de mezcla dispersa de expertos (sparse mixture-of-experts transformer-based models) con soporte multimodal nativo (confirmado por la ficha del modelo Gemini 2.5 Flash).

Arquitectura multimodal nativa

La arquitectura de Gemini se basa en el concepto de fusión temprana (early fusion). Los parches de píxeles de las imágenes, los fotogramas temporales del vídeo, los audiogramas y los tokens de texto se proyectan en un espacio latente unificado. El informe técnico de Gemini 2.5 describe este enfoque como «Unified Multimodal Token Interleaving». Dado que todos los tokens de diferentes modalidades se procesan dentro de una secuencia compartida, los mecanismos estándar de autoatención (self-attention) proporcionan naturalmente la integración cruzada de datos de diferentes modalidades en cada capa. Las señales de audio se procesan mediante codificadores especializados directamente a partir de la forma de onda (waveform), lo que preserva las características acústicas (entonación, timbre, ruido de fondo) que se pierden al utilizar sistemas intermedios de transcripción Speech-to-Text.

Para la clase de transformers, la operación fundamental es el mecanismo de atención:

Attention(Q,K,V)=softmax(QKdk)V

donde Q es la matriz de consultas, K la de claves, V la de valores, y dk la dimensionalidad de las claves.

Mezcla dispersa de expertos (Sparse MoE)

A partir de la versión 1.5, los modelos Gemini utilizan una arquitectura Sparse Mixture-of-Experts (MoE). Gemini 1.0 empleaba un transformer denso; la transición a MoE está descrita explícitamente en el informe técnico de la versión 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».

En la arquitectura MoE, las capas estándar de redes completamente conectadas (Feed-Forward Networks) se sustituyen por un conjunto de subredes especializadas — «expertos». Para un token de entrada xd, la salida y se calcula como la suma ponderada de las salidas de k expertos activos (kE, donde E es el número total de expertos):

y=i𝒯k(x)gi(x)Ei(x)

donde Ei(x) es la función no lineal del i-ésimo experto, 𝒯k(x) es el conjunto de índices de las k subredes seleccionadas, y el peso de enrutamiento gi(x) se calcula mediante una función de enrutamiento aprendida (learned routing function) aplicando la función Softmax sobre los k valores más altos.

Este enfoque permite aumentar significativamente la capacidad paramétrica total del modelo manteniendo los costes computacionales (FLOPs) en un nivel bajo, ya que solo se activa un subconjunto de parámetros para cada token. Google no ha revelado el número real de parámetros de los modelos Gemini.

Contexto largo y aprendizaje en contexto

Gemini 1.5 logró un avance revolucionario al ampliar la ventana de contexto hasta 1 millón de tokens en modo de producción (con pruebas experimentales de hasta 10 millones de tokens). Esto es un orden de magnitud superior a los modelos anteriores (por ejemplo, GPT-4 Turbo con 128.000 tokens). Google informó de un resultado del 99% en la prueba Needle In A Haystack con una longitud de contexto de 1 millón de tokens. Para las generaciones posteriores, el contexto largo se consolidó como una de las características clave de la línea. Este contexto a gran escala permite al modelo:

  • Analizar libros completos, vídeos de varias horas (hasta 3 horas) o grandes bases de código dentro de una sola consulta.
  • Realizar aprendizaje en contexto (in-context learning) sobre grandes volúmenes de datos proporcionados en el prompt, lo que permite obtener respuestas altamente personalizadas sin necesidad de ajuste fino (fine-tuning).

Modelos «pensantes» y escalado computacional durante la inferencia

A partir de Gemini 2.5, Google designa el thinking como un modo de operación independiente. La documentación oficial lo define como un proceso computacional interno que mejora la planificación y el razonamiento de múltiples pasos. Los modelos de la versión 2.5 (descritos como «thinking models») son capaces de generar y evaluar internamente pasos intermedios de razonamiento antes de producir una respuesta final. Esto mejora significativamente la precisión en tareas lógicas y matemáticas complejas.

Es importante distinguir entre dos mecanismos:

  • Pensamiento integrado (Thinking): El modo base para los modelos de las series 2.5 y 3, que genera una cadena oculta de razonamiento (Chain-of-Thought). La API puede devolver thought summaries — resúmenes breves del razonamiento interno en lugar del flujo completo de «pensamientos» en bruto. A partir del modelo 3.1 Pro, el presupuesto de pensamiento se regula mediante el parámetro thinking_level con valores de Low a Max.
  • Deep Think: Un modo experimental avanzado de razonamiento independiente que utiliza la generación paralela de hipótesis y requiere recursos computacionales significativamente mayores. Fue anunciado en Google I/O el 20 de mayo de 2025 y puesto a disposición de los suscriptores de AI Ultra el 1 de agosto de 2025. Deep Think no debe confundirse con el mecanismo base de thinking.

Capacidades agentes (Agentic Capabilities)

A partir de la versión 2.0, Gemini puede interactuar con el mundo exterior: invocar herramientas, realizar búsquedas en Google, ejecutar código y controlar elementos de la interfaz de usuario. Google posicionó explícitamente Gemini 2.0 como un modelo para la «nueva era agente» (agentic era) con soporte nativo de uso de herramientas (tool use).

A fecha de febrero de 2026, la API de Gemini incluye una capa formalmente establecida de capacidades agentes con soporte para herramientas: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, así como Live API para interacción bidireccional en tiempo real.

Evolución de los modelos Gemini

La familia Gemini evoluciona a un ritmo extraordinariamente rápido: entre diciembre de 2023 y febrero de 2026 se lanzaron cuatro generaciones principales de modelos.

Gemini 1.0 (diciembre de 2023)

Primera generación, que sentó las bases de la multimodalidad nativa. Presentada públicamente el 6 de diciembre de 2023.

  • Versiones: Ultra (modelo insignia para las tareas más complejas), Pro (modelo de propósito general) y Nano (compacto para dispositivos móviles; subdividido en Nano-1 con 1.800 millones de parámetros y Nano-2 con 3.250 millones).
  • Ventana de contexto: 32.768 tokens para todas las versiones.
  • Logros: Gemini 1.0 Ultra se convirtió en el primer modelo en alcanzar y superar el rendimiento de un experto humano en el benchmark MMLU con un resultado del 90,04% (utilizando la técnica CoT@32 — cadena de razonamiento con 32 muestras y votación por mayoría; con prompting estándar de 5 ejemplos, el resultado fue de aproximadamente 83,7%). Obtuvo resultados SOTA en 30 de 32 benchmarks académicos.
  • Fin del soporte: Gemini 1.0 Pro fue declarado obsoleto el 18 de febrero de 2025.

Gemini 1.5 (febrero — mayo de 2024)

Avance revolucionario en longitud de contexto y eficiencia.

  • Arquitectura: Transición de transformer denso a Mixture-of-Experts (MoE).
  • Ventana de contexto: Hasta 1 millón de tokens en producción (2 millones por lista de espera para 1.5 Pro, anunciado en Google I/O en mayo de 2024).
  • Versiones: 1.5 Pro (anunciado en febrero de 2024; calidad a la par de 1.0 Ultra con un coste significativamente menor) y 1.5 Flash (versión ligera y rápida, añadida en mayo de 2024).
  • Fin del soporte: Todos los modelos de Gemini 1.5 (Pro, Flash, Flash-8B) fueron retirados el 29 de septiembre de 2025.

Gemini 2.0 (diciembre de 2024 — febrero de 2025)

Transición a la «era agente».

  • Cronología: 11 de diciembre de 2024 — anuncio de 2.0 Flash Experimental (entrada multimodal, salida de texto); 5 de febrero de 2025 — disponibilidad general (GA) de 2.0 Flash, lanzamiento de 2.0 Pro Experimental y 2.0 Flash-Lite.
  • Innovaciones clave: Capacidades agentes integradas (tool use), generación nativa de imágenes y audio (inicialmente en modo limitado para socios de acceso anticipado), orientación hacia escenarios agentes.
  • Ventana de contexto: Hasta 2 millones de tokens (2.0 Pro); hasta 1 millón de tokens (2.0 Flash-Lite).
  • Fin del soporte: Los modelos 2.0 Flash y Flash-Lite están programados para su retirada el 1 de junio de 2026.

Gemini 2.5 (marzo — junio de 2025)

Primer «modelo pensante» (thinking model) con presupuestos de razonamiento configurables.

  • Cronología: 25 de marzo de 2025 — anuncio de 2.5 Pro Experimental; 17 de abril — 2.5 Flash (primer modelo de razonamiento completamente híbrido con pensamiento conmutable); 20 de mayo (Google I/O) — actualizaciones de 2.5 Pro y Flash, anuncio de Deep Think; 17 de junio de 2025 — GA simultánea de 2.5 Pro y 2.5 Flash; mismo día — vista previa de 2.5 Flash-Lite (GA el 22 de julio). 1 de agosto — Deep Think disponible para suscriptores de AI Ultra.
  • Innovaciones clave: Mecanismo integrado de «pensamiento» (thinking) con presupuestos configurables; Deep Think como modo avanzado independiente. Resultados SOTA en benchmarks complejos de matemáticas, lógica y programación (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% sin herramientas).
  • Ventana de contexto: 1 millón de tokens de entrada, hasta 64.000 tokens de salida. La ampliación prometida a 2 millones de tokens para 2.5 Pro nunca se confirmó como implementada durante el ciclo de vida del modelo.
  • Variantes especializadas: Gemini 2.5 Flash Image (nombre en clave «Nano Banana», apareció anónimamente en la Arena el 12 de agosto, lanzado oficialmente el 26 de agosto de 2025 — se hizo viral por imágenes fotorrealistas de «figuras 3D», atrayendo 10 millones de nuevos usuarios); Computer Use Preview (7 de octubre de 2025, basado en 2.5 Pro); modelos de Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS).
  • Informe técnico: El informe combinado Gemini 2.X fue publicado en arXiv el 7 de julio de 2025 (arXiv:2507.06261), con más de 3.300 autores, cubriendo los modelos 2.5 Pro, 2.5 Flash, 2.0 Flash y 2.0 Flash-Lite.

Gemini 3.x (noviembre de 2025 — febrero de 2026)

La tercera generación marcó la transición de la generación básica a flujos de trabajo agentes de larga duración (agentic workflows) y la resolución de problemas científicos interdisciplinarios.

  • Gemini 3 Pro (18 de noviembre de 2025): Anunciado por el CEO de Alphabet, Sundar Pichai, y el CEO de DeepMind, Demis Hassabis, como «el modelo más inteligente de Google». Primer modelo Gemini desplegado en Google Search en el día de su lanzamiento. Se convirtió en el primer modelo en superar la barrera de 1.500 Elo en LMArena (1.501 en el lanzamiento). Resultados: GPQA Diamond — 91,9%; SWE-bench Verified — 76,2%; Humanity's Last Exam — 37,5% (sin herramientas); SimpleQA — 72,1%.
  • Gemini 3 Flash (17 de diciembre de 2025): Se convirtió en el modelo predeterminado en la aplicación Gemini. A un precio de $0,50/1M tokens de entrada, superó a 3 Pro en SWE-bench Verified (78%) utilizando un 30% menos de tokens en tareas de razonamiento. GPQA Diamond — 90,4%; HLE — 33,7%.
  • Gemini 3.1 Pro (19 de febrero de 2026): Modelo insignia a la fecha de publicación. Primera versión incremental «.1» (las generaciones anteriores usaban intervalos .5). Resultado clave — ARC-AGI-2: 77,1% (más del doble del 31,1% de 3 Pro). AIME 2025 — 91,2%; GPQA Diamond — 94,3%; SWE-bench Verified — 80,6%. Introdujo un nuevo nivel de pensamiento MEDIUM a través del parámetro thinking_level. Endpoint dedicado gemini-3.1-pro-preview-customtools para terminal bash y funciones personalizadas. Resolvió problemas de truncamiento de salida en generaciones largas. Canales: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM.
  • Gemini 3 Deep Think (actualizado el 12 de febrero de 2026): Actualización mayor del modo «pensante» especializado. Se expandió más allá de las matemáticas y la programación: resultados a nivel de medalla de oro en las Olimpiadas Internacionales de Física (IPhO) y Química (IChO) de 2025; ARC-AGI-2 — 84,6%; Humanity's Last Exam — 48,4%; CMT-Benchmark (física teórica de materia condensada) — 50,5%; Codeforces Elo — 3.455. El agente de investigación Aletheia, basado en Deep Think, resolvió autónomamente varios problemas abiertos de la colección de Erdős (incluyendo la conjetura Erdős-1051).

Tabla resumen de generaciones de Gemini

Evolución de las características clave de los modelos Gemini
Generación Año de lanzamiento Versiones clave Ventana de contexto máx. Innovaciones arquitectónicas clave y mejoras
Gemini 1.0 2023 Ultra, Pro, Nano 32.768 tokens Multimodalidad nativa desde cero; transformer denso; superación del experto humano en MMLU (90,04% CoT@32).
Gemini 1.5 2024 Pro, Flash 1.000.000 de tokens (2M por lista de espera) Arquitectura Mixture-of-Experts (MoE); ampliación revolucionaria del contexto; 99% en Needle In A Haystack.
Gemini 2.0 2024–2025 Pro, Flash, Flash-Lite 1.000.000–2.000.000 de tokens Era «agentic AI»: integración nativa de herramientas, generación de imágenes y audio, Live API.
Gemini 2.5 2025 Pro, Flash, Flash-Lite 1.000.000 de tokens (entrada), 64.000 (salida) «Modelo pensante» (thinking model); presupuestos configurables de razonamiento; Deep Think; generación de imágenes (Nano Banana); Computer Use.
Gemini 3.x 2025–2026 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think 1.000.000 de tokens Flujos de trabajo agentes; parámetro thinking_level; avances en ARC-AGI-2 y olimpiadas científicas; Aletheia.

Resultados clave y benchmarks

Con la saturación de los benchmarks clásicos (como MMLU), la evaluación del rendimiento de los modelos Gemini se ha desplazado hacia tareas de razonamiento abstracto, modelización científica e ingeniería de software autónoma. Los resultados se basan en datos oficiales de Google (auto-reportados); las comparaciones son válidas solo cuando coinciden el modo de inferencia, la presencia/ausencia de uso de herramientas, el método de muestreo (intento único vs. votación por mayoría) y el model-id específico.

Resultados de los modelos Gemini en benchmarks clave (datos a febrero de 2026)
Benchmark Descripción de la tarea Gemini 2.5 Pro (jun. 2025) Gemini 3 Pro (nov. 2025) Gemini 3.1 Pro (feb. 2026) Gemini 3 Deep Think (feb. 2026)
MMLU Comprensión multitarea del lenguaje
GPQA Diamond Preguntas científicas de nivel doctorado 84,0% 91,9% 94,3% N/D
Humanity's Last Exam Conocimientos fronterizos en dominios especializados 18,8% 37,5% 44,4% 48,4%
ARC-AGI-2 Rompecabezas lógicos abstractos 4,9% 31,1% 77,1% 84,6%
SWE-bench Verified Resolución autónoma de problemas en repositorios de GitHub 63,8%* 76,2% 80,6% N/D
AIME 2025 Problemas matemáticos de nivel olímpico 86,7% 91,2%
Codeforces (Elo) Clasificación en programación competitiva 2.887 3.455

* El resultado de 2.5 Pro en SWE-bench se obtuvo con una configuración de agente personalizado (custom agent setup).

Posiciones en LMArena (instantánea de finales de febrero de 2026)

LMArena (anteriormente Chatbot Arena) es una plataforma independiente de votación ciega por pares. Las clasificaciones se recalculan dinámicamente; los valores en la fecha de lanzamiento de un modelo pueden diferir de los actuales.

Overall (instantánea: 24 de febrero de 2026)
Modelo Puntuación Posición Votos Nota
Gemini 3.1 Pro Preview 1.500 ± 9 #3 4.060 Preliminar
Gemini 3 Pro 1.486 ± 4 #5 37.854
Gemini 3 Flash 1.473 ± 5 #7 28.847
Gemini 2.5 Pro 1.464 ± 3 #9 97.296
Gemini 2.5 Flash 1.411 ± 3 #64 96.163

En su lanzamiento el 18 de noviembre de 2025, Gemini 3 Pro alcanzó una puntuación de 1.501 Elo, convirtiéndose en el primer modelo en superar la barrera de 1.500 en LMArena.

Sistemas especializados y agentes

El ecosistema Gemini se ha ampliado con modelos y plataformas capaces de realizar acciones de múltiples pasos en entornos digitales y físicos.

Agentes autónomos

  • Jules — agente de codificación autónomo que opera de forma asíncrona en máquinas virtuales seguras en la nube. Crea ramas y pull requests en GitHub. Entró en beta pública en Google I/O el 20 de mayo de 2025 (más de 140.000 mejoras de código durante el período de beta); GA el 6 de agosto de 2025. A finales de 2025, se convirtió en uno de los mayores contribuyentes a los repositorios internos de Google.
  • Project Mariner — prototipo de investigación de un agente basado en navegador para tareas web de múltiples pasos. Migrado a máquinas virtuales en la nube con soporte para hasta 10 tareas en paralelo y una función «Teach & Repeat». Alcanzó un 83,5% en el benchmark WebVoyager. Las capacidades de Computer Use se portaron a la API de Gemini.
  • Google Antigravity — entorno de desarrollo integrado (IDE) para la gestión de agentes de IA, presentado en noviembre de 2025. Los agentes modifican código de forma autónoma, interactúan con el terminal y un navegador integrado, devolviendo artefactos verificables (por ejemplo, diffs de código) para la aprobación del desarrollador.
  • Agente Aletheia — agente de investigación matemática especializado basado en Gemini 3 Deep Think. Equipado con un módulo de verificación en lenguaje natural y herramientas de búsqueda web para la revisión bibliográfica. A principios de 2026, resolvió autónomamente varios problemas matemáticos abiertos de la colección de Erdős y fue coautor de publicaciones científicas.

Agentes de IA para consumidores

  • Phone Automations — integración de un agente autónomo a nivel del sistema operativo Android (beta para Pixel 10 y Samsung Galaxy S26). Opera dentro de un sandbox seguro, capaz de navegar por aplicaciones de terceros basándose en el análisis visual de la interfaz gráfica.
  • Gemini in Chrome (Auto Browse) — agente de navegador para la automatización de tareas web de múltiples pasos, disponible para todos los usuarios de Chrome desde septiembre de 2025 (actualizado a Gemini 3 en enero de 2026).

Computer Use

Los modelos Gemini 2.5 Computer Use están optimizados para el control de interfaces gráficas de usuario (GUI). El sistema recibe capturas de pantalla y un historial de acciones como entrada, generando coordenadas (x,y) para la simulación programática del cursor y comandos de entrada de teclado.

Gemini Robotics

Modelos de clase Vision-Language-Action (VLA) y Embodied Reasoning (ER) presentados en marzo de 2025. Estas arquitecturas procesan información espaciotemporal y predicen trayectorias 3D del movimiento de manipuladores robóticos como una modalidad de salida nativa (arXiv:2503.20020).

Modelos generativos especializados (principios de 2026)

  • Nano Banana 2 (Gemini 3.1 Flash Image) — lanzado el 26 de febrero de 2026; modelo visual que combina la velocidad de la arquitectura Flash con la calidad de Pro. Proporciona una estricta consistencia de personajes entre diferentes escenas, generación nativa de tipografía dentro de las imágenes e integración de marcas de agua criptográficas SynthID con metadatos C2PA.
  • Lyria 3 — modelo musical integrado en la aplicación Gemini el 18 de febrero de 2026. Genera composiciones musicales de 30 segundos (incluyendo voz e instrumentos) a partir de prompts de texto, fotos subidas o vídeos.
  • Veo 3.1 — modelo de generación de vídeo. Soporta la creación de clips utilizando hasta tres imágenes de referencia («Ingredients to Video»), generación de transiciones entre primer y último fotograma especificados, renderizado nativo de vídeo vertical (9:16) y escalado a resolución 4K.
  • Med-Gemini — modelo específico de dominio para tareas médicas (arXiv:2404.18416, arXiv:2405.03162).

Aplicaciones y ecosistema

Google integra profundamente Gemini en sus productos de consumo y para desarrolladores.

Productos de consumo

  • Aplicación Gemini: Chatbot (anteriormente Bard, renombrado el 8 de febrero de 2024) que utiliza modelos de la familia Gemini como asistente universal de IA. A febrero de 2026, cuenta con más de 750 millones de usuarios activos. El despliegue actual incluye el modelo 3.1 Pro. Suscripciones: Google AI Pro ($19,99/mes, sustituyó a Google One AI Premium) y Google AI Ultra ($249,99/mes, con acceso a Deep Think, Veo 3 y funciones prioritarias).
  • Google Workspace: Integración de Gemini en Gmail, Docs, Sheets y Meet para asistencia en redacción, análisis de datos y generación de contenido (rebautizado desde Duet AI).
  • Google Search: La función AI Overviews genera respuestas resumidas a consultas complejas utilizando un modelo Gemini especializado. AI Mode, lanzado en Google I/O 2025, proporciona búsqueda profunda con capacidades agentes (reservas, compras).
  • Android y Pixel: Gemini Nano (v3 en Pixel 10 con chip Tensor G5, agosto de 2025) se ejecuta localmente en los smartphones, proporcionando respuestas inteligentes, resúmenes, detección de llamadas fraudulentas y funciones de accesibilidad, preservando la privacidad de los datos. Las API ML Kit GenAI para desarrolladores soportan resúmenes, corrección y reconocimiento de voz en el dispositivo.
  • NotebookLM: Evolucionó de una herramienta de notas a una plataforma creativa completa. Se incorporó a Google Workspace en marzo de 2025. Soporta Audio Overviews interactivos, Video Overviews, mapas mentales, diapositivas e infografías. Actualizado a Gemini 3 en diciembre de 2025; ventana de contexto completa de 1 millón de tokens para chat desde febrero de 2026.
  • Gemini Live: Las funciones de cámara y pantalla compartida de Project Astra se hicieron gratuitas para todos los usuarios de Android e iOS.

Plataformas para desarrolladores

  • Google AI Studio y Gemini API: Interfaces principales para acceder a los modelos Gemini a través de la API. A febrero de 2026, soportan bloques de capacidades: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
  • Vertex AI: Plataforma empresarial con capacidades avanzadas de seguridad y gestión.
  • Google Gen AI SDK: Alcanzó GA para Python, JavaScript/TypeScript, Go y Java en mayo de 2025, proporcionando acceso unificado a la API de desarrolladores de Gemini y Vertex AI. Soporta Model Context Protocol (MCP).
  • Gemini CLI: Herramienta de línea de comandos para codificación con IA en el terminal (lanzada en junio de 2025).
  • Interactions API: Interfaz unificada para modelos y agentes (beta desde diciembre de 2025).

Ciclo de vida de la API y gestión de versiones

Los modelos Gemini en la API se clasifican en categorías stable, preview, latest y experimental. Un model_id específico y una familia de modelos no son lo mismo; para escenarios de producción, es crítico vincularse a una versión concreta y a sus plazos de soporte. La documentación de la API mantiene un registro de depreciaciones con fechas de cierre.

Para soportar tareas autónomas de larga duración, se introdujeron: Session Resumption (almacenamiento del estado de sesión en el servidor durante hasta 24 horas) y Context Compression (mecanismo de ventana deslizante para la compresión automática del contexto cuando se exceden los límites).

En diciembre de 2025, Google redujo las cuotas del nivel gratuito de la API en aproximadamente un 92% (sin aviso previo), lo que provocó una fuerte reacción de la comunidad de desarrolladores. Paralelamente, los costes unitarios de servicio de Gemini se redujeron un 78% a lo largo de 2025 gracias a optimizaciones de los modelos.

Limitaciones y problemas abiertos

  • Alucinaciones y confabulaciones: Los modelos mantienen una tendencia a generar información factualmente incorrecta, especialmente cuando las funciones de anclaje (Search Grounding) están desactivadas. Gemini 3.1 Pro redujo las tasas de alucinación en el benchmark SimpleQA en comparación con versiones anteriores, pero el problema sigue siendo sistémico en todos los LLM.
  • Plagio subconsciente (Subconscious Plagiarism): Los experimentos con el agente Aletheia revelaron un problema en el que el modelo reproduce demostraciones no triviales de su conjunto de entrenamiento, presentándolas como descubrimientos autónomos, lo que complica la validación de la novedad en la investigación con IA.
  • Degradación en contexto largo: Al procesar contextos de 1 millón de tokens o más, los modelos son susceptibles al efecto «Lost in the Middle» — una reducción de la precisión en la extracción de hechos ubicados en la parte media del documento.
  • Altos costes computacionales: La inferencia con la configuración máxima de Deep Think requiere un tiempo y unos recursos (TPU) significativamente mayores, lo que limita su aplicación en escenarios síncronos en tiempo real.
  • Rechazos falsos positivos (Over-refusals): Debido a los estrictos algoritmos de alineación (alignment), los modelos de razonamiento tienden a rechazar solicitudes legítimas clasificándolas erróneamente como potencialmente peligrosas (especialmente en el contexto del análisis de código y la seguridad informática). Las fichas de modelo también señalan problemas con un tono «moralizante» (preachy) en los rechazos.
  • Limitaciones del razonamiento: Las fichas de modelo de las series 2.5 y 3 enumeran limitaciones en la comprensión causal (causal understanding), las deducciones lógicas complejas (complex logical deduction) y el razonamiento contrafactual (counterfactual reasoning), así como una predictibilidad incompleta en el cumplimiento de los presupuestos de pensamiento.

Aspectos éticos y seguridad

El despliegue de los modelos Gemini está acompañado de un sistema de seguridad multinivel.

Marcos generales

Secure AI Framework (SAIF) es el enfoque general de Google para la seguridad de los sistemas de IA (anunciado en junio de 2023), que forma el contexto de desarrollo pero no es un estándar específico de Gemini. Frontier Safety Framework v3 (septiembre de 2025) cubre los dominios CBRN, ciberseguridad, I+D en ML, manipulación dañina y un enfoque exploratorio para los riesgos de desalineación (misalignment).

Medidas específicas de Gemini

  • Fichas de modelo (Model cards) son las fuentes primarias de información sobre limitaciones y seguridad de modelos específicos. Contienen secciones sobre Uso Previsto y Limitaciones, Ética y Seguridad del Contenido, y Seguridad Fronteriza. La ficha del modelo Gemini 3 Pro confirmó que el modelo no alcanzó ningún Nivel de Capacidad Crítica (Critical Capability Level) en los dominios CBRN y ciberseguridad.
  • Pruebas de sesgo y toxicidad: Análisis y mitigación del sesgo en los datos de entrenamiento y la generación de contenido.
  • Equipos rojos (Red Teaming): Simulación de ataques para identificar vulnerabilidades y comportamientos indeseados. Las pruebas independientes de desalineación encontraron «cierto aumento en la conciencia situacional» pero ningún riesgo crítico.

Sondas de seguridad (Safety Probes)

Para prevenir la generación de contenido dañino, se utiliza la clasificación de activaciones ocultas. Para abordar la pérdida de señal en contextos largos, se emplea la arquitectura MultiMax: la sonda extrae el valor máximo a través de todas las capas H para cada token j en la secuencia ni:

fMultiMax(Si)=h=1Hmaxj[ni][vhyi,j]

Las sondas se combinan con los modelos base en clasificadores en cascada, mejorando la precisión del filtrado con bajo coste computacional (arXiv:2601.11516).

Marcado criptográfico (SynthID)

Los datos de audio generados a través de la Live API y las imágenes (de los modelos Nano Banana / Flash Image) se marcan con el algoritmo SynthID. Una marca de agua invisible se incrusta a nivel de píxeles o del espectro de audio, permitiendo la detección automática del contenido generado. El modelo Nano Banana 2 (febrero de 2026) integra SynthID con metadatos C2PA.

Thinking y la cuestión de la transparencia

Los modelos con modo de pensamiento (series 2.5/3) pueden devolver thought summaries — resúmenes breves del razonamiento interno en lugar del flujo completo de tokens intermedios. Esto proporciona un cierto nivel de transparencia, pero ha sido criticado porque las cadenas de razonamiento «en bruto» reales quedan ocultas tras resúmenes simplificados.

Aspectos regulatorios

En el marco de la Ley de Inteligencia Artificial de la UE (EU AI Act), Google firmó el Código de Prácticas de la UE sobre IA (publicado el 10 de julio de 2025) junto con OpenAI y Anthropic. Gemini está clasificado como un modelo de IA de propósito general (GPAI) con riesgo sistémico, lo que conlleva obligaciones adicionales de seguridad (en vigor desde el 2 de agosto de 2025).

Panorama competitivo

El período de noviembre a diciembre de 2025 se convirtió en el ciclo competitivo más comprimido de la historia de la IA: Gemini 3 Pro (18 de noviembre), Claude Opus 4.5 de Anthropic (24 de noviembre) y GPT-5.2 de OpenAI (11 de diciembre) se lanzaron en un plazo de 24 días. A febrero de 2026, ningún modelo domina en todas las categorías: Gemini 3 Pro lidera LMArena en texto, visión, búsqueda y multilingüismo; GPT-5.2 lidera en matemáticas puras (100% AIME 2025 sin herramientas) y SWE-bench Pro; Claude Opus 4.5 compite en SWE-bench Verified. En cuanto a precios de la API, Gemini es aproximadamente un 42% más barato que GPT-5 para llamadas comparables.

Indicadores de negocio

Según el informe de resultados de Alphabet del Q4 de 2025 (publicado el 4 de febrero de 2026): los ingresos de Google Cloud fueron de $17.700 millones en el trimestre (+48% interanual); el margen operativo fue del 29,9%; la cartera de pedidos de Cloud alcanzó los $240.000 millones (duplicándose interanualmente). Más de 120.000 empresas utilizan Gemini. En enero de 2026, Apple anunció planes para integrar Gemini en Siri. Google procesa más de 10.000 millones de tokens por minuto a través de la API. Los agentes internos de IA de Google generan aproximadamente el 50% del código propio de la empresa. Los gastos de capital para 2026 están previstos en $175.000–185.000 millones (casi el doble de los $91.450 millones de 2025).

Enlaces externos

Bibliografía

Informes técnicos primarios de Gemini

  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
  • Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
  • Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.

Modelos especializados y aplicaciones

  • Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
  • Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
  • Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  • Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
  • DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
  • Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.

Literatura de referencia (revisiones y métodos)

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
  • Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
  • Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.

Publicaciones oficiales del blog de Google