gemma 4 los nuevos modelos de ia de google que puedes ejecutar en tu propio hardware y ahora con licencia apache 2 0

Gemma 4: los nuevos modelos de IA de Google que puedes ejecutar en tu propio hardware (y ahora con licencia Apache 2.0)

Google lleva un tiempo jugando en 2 frentes con su estrategia de IA: por un lado, Gemini, sus modelos de uso comercial alojados en la nube; por otro, Gemma, los modelos de pesos abiertos que los desarrolladores pueden descargar, modificar y ejecutar en local. El problema es que Gemma 3 ya tiene más de un año y el mundo de los modelos de lenguaje no espera a nadie. Hoy, Google presenta Gemma 4, y trae novedades que van bastante más allá de un simple salto de versión.


Qué es Gemma 4 y en qué se diferencia de lo que había antes

Gemma 4 llega en 4 variantes con perfiles muy distintos, pensadas para cubrir un rango amplio de casos de uso: desde el servidor con una GPU de 80 GB hasta el smartphone que llevas en el bolsillo.

Los 2 modelos grandes son el 26B Mixture of Experts (MoE) y el 31B Dense. Ambos están diseñados para ejecutarse sin cuantizar sobre una sola Nvidia H100 de 80 GB, que con lo que cuesta en el mercado (alrededor de 30.000 € en Europa) es «hardware local» solo en un sentido bastante específico de la palabra. Dicho esto, si los cuantizas para reducir su precisión numérica, pueden correr perfectamente en GPUs de consumo más asequibles.

La diferencia entre los 2 modelos grandes es de enfoque:

  • 26B MoE prioriza la velocidad. Aunque tiene 26.000 millones de parámetros en total, solo activa 3.800 millones durante la inferencia. Esto se traduce en más tokens por segundo, lo que lo hace especialmente útil en aplicaciones donde la latencia importa.
  • 31B Dense sacrifica algo de velocidad a favor de calidad de respuesta. Google lo presenta como una buena base para hacer fine-tuning y adaptarlo a tareas específicas.

Los otros 2 modelos, E2B (Effective 2B) y E4B (Effective 4B), van en la dirección opuesta: están diseñados para dispositivos móviles. El equipo de Pixel trabajó junto a Qualcomm y MediaTek para optimizarlos en plataformas como smartphones Android, Raspberry Pi o Jetson Nano. Google promete «latencia casi cero» y un consumo de memoria y batería inferior al de Gemma 3. Suena prometedor, aunque ya sabrás que esas afirmaciones hay que tomarlas con cierta cautela hasta ver resultados reales en condiciones de uso cotidiano.


Rendimiento: ¿cuánto mejor es realmente?

Google afirma que Gemma 4 supera a Gemma 3 en todos los frentes y sitúa al modelo 31B en el puesto 3 del ranking Arena de modelos abiertos, por detrás de GLM-5 y Kimi 2.5. El dato relevante aquí no es solo la posición, sino el contexto: Gemma 31B ocupa ese puesto con un número de parámetros muy inferior al de los modelos que tiene por encima, lo que en términos prácticos significa un coste de ejecución considerablemente menor.

En cuanto a capacidades, Gemma 4 mejora en razonamiento, matemáticas y seguimiento de instrucciones. También da un paso importante hacia los flujos de trabajo agénticos, que es básicamente el enfoque donde un modelo de IA no solo responde preguntas, sino que coordina tareas, llama a herramientas externas y gestiona procesos de forma más autónoma. Para eso, Gemma 4 incorpora soporte nativo para function calling, salida estructurada en JSON e instrucciones para APIs y herramientas comunes.

Otro área donde Google dice haber mejorado es la generación de código. Los modelos grandes de Gemma 4 estarían, según Google, a un nivel comparable a Gemini Pro o Claude Code en entornos offline, siempre que tengas el hardware para ejecutarlos. Eso es una afirmación grande, y yo esperaría ver benchmarks independientes antes de darlo por hecho, pero el rumbo está claro.

También hay mejoras en procesamiento visual (OCR, comprensión de gráficos) y en reconocimiento de voz para los modelos edge. El soporte de idiomas alcanza los 140, y las ventanas de contexto han crecido: 128.000 tokens para E2B y E4B, y 256.000 tokens para los modelos grandes. No está mal para ejecución local, aunque los modelos cloud de Gemini siguen siendo mucho más generosos con 1 millón de tokens.


El cambio que más importa: adiós a la licencia Gemma, hola Apache 2.0

Aquí es donde Gemma 4 puede tener su mayor impacto real, y no tiene nada que ver con los benchmarks.

Las versiones anteriores de Gemma utilizaban una licencia propia de Google que muchos desarrolladores encontraban problemática. La licencia de Gemma 3, por ejemplo, incluía una política de uso prohibido que Google podía modificar unilateralmente. Además, obligaba a los desarrolladores a extender esas restricciones a todos los proyectos derivados. Y había una cláusula especialmente polémica: podía interpretarse que cualquier modelo entrenado con datos sintéticos generados por Gemma también quedaba bajo esa licencia. Eso, para quien quiere construir sobre esos modelos con tranquilidad, es una barrera importante.

Apache 2.0 es otra historia. Es una licencia permisiva, bien conocida en el ecosistema de software, sin restricciones comerciales y sin cláusulas que Google pueda redefinir según le convenga. Los desarrolladores saben exactamente a qué atenerse desde el primer día. Para alguien que quiera usar Gemma como base de un producto, o integrar los modelos en un sistema complejo, esto elimina una capa importante de incertidumbre legal.

Es un movimiento inteligente por parte de Google. No solo porque reduce fricciones, sino porque el ecosistema de modelos abiertos se ha vuelto competitivo: Meta con Llama, Mistral, y ahora varios actores chinos con modelos muy capaces. Si Google quiere que Gemma sea una opción real para los desarrolladores, necesitaba una licencia que no generase dudas.


Gemini Nano 4: el siguiente paso para la IA en smartphones

Hay otra parte de este anuncio que no debería pasarse por alto. Los modelos E2B y E4B no son solo versiones pequeñas para experimentar: son la base de la próxima generación de Gemini Nano, el motor que hace funcionar funciones de IA local en los Pixel y otros dispositivos Android.

Gemini Nano es lo que permite a un Pixel detectar llamadas fraudulentas, resumir notas o generar resúmenes de conversaciones telefónicas sin enviar datos a ningún servidor externo. Google ha confirmado que Gemini Nano 4 tendrá variantes de 2B y 4B parámetros basadas directamente en Gemma 4 E2B y E4B. Es la primera vez que Google reconoce oficialmente que habrá una nueva versión de Nano.

Los desarrolladores ya pueden empezar a prototipar flujos agénticos en el AI Core Developer Preview usando E2B y E4B, con la ventaja de que lo que construyan ahora será compatible hacia adelante con Nano 4 cuando llegue. Es probable que sepamos más en Google I/O, que está a pocas semanas.


Dónde encontrar y probar Gemma 4

Los modelos están disponibles ya desde hoy:

  • 31B y 26B MoE: en AI Studio de Google.
  • E2B y E4B: en AI Edge Gallery.
  • Pesos completos: descargables desde Hugging Face, Kaggle y Ollama.
  • En la nube: Google también ofrece acceso a estos modelos a través de Google Cloud, por si prefieres no montar la infraestructura local.

Es una disponibilidad amplia y sin fricciones, lo que encaja perfectamente con el espíritu del cambio a Apache 2.0. Google parece haber entendido que la forma de construir un ecosistema alrededor de sus modelos abiertos no es poniendo barreras, sino todo lo contrario.

Noticias similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *