9 min leer
Google Gemma 4 bajo Apache 2.0: qué cambia para los agentes de IA empresariales

Categoría
El mundo de la IA
Compartir artículo
Google ha lanzado recientemente Gemma 4 bajo la licencia Apache 2.0. Cuatro tamaños de modelo, desde dispositivos periféricos (edge) hasta un modelo denso de 31B que actualmente ocupa el puesto número 3 en la tabla de clasificación de Arena AI.
Los benchmarks son impresionantes. Sin embargo, el cambio de licencia es lo que realmente importa para los equipos empresariales.
Los lanzamientos anteriores de Gemma se publicaron bajo una licencia personalizada de Google con restricciones de uso comercial y políticas de contenido. Esto generaba desconfianza en los departamentos legales y ralentizaba los procesos de compra. Gemma 4 se distribuye bajo la misma licencia permisiva que Linux, Kubernetes y la mayor parte del stack de software que las empresas ya ejecutan. Sin umbrales de uso, sin restricciones geográficas y sin políticas de uso aceptable más allá de lo que la ley ya exige.
Para los equipos que desarrollan agentes de IA en producción, esta es la primera vez que un modelo abierto del top 3 llega al mercado sin ningún tipo de fricción de licencias.
Qué incluye realmente Gemma 4
Cuatro tamaños de modelo, cada uno diseñado para un escenario de despliegue diferente:
Gemma 4 31B Dense es el modelo de referencia. Obtiene un 85,2 % en MMLU Pro, un 89,2 % en los benchmarks matemáticos de AIME 2026 y un 80,0 % en LiveCodeBench v6. En la tabla de clasificación de Arena AI se sitúa en 1452 puntos, superando a modelos que multiplican por 20 su número de parámetros. Este es el modelo idóneo para ajustar (fine-tune) y destinar a tareas de agentes específicos de un sector o dominio.
Gemma 4 26B MoE (Mixture of Experts) sacrifica una pequeña cantidad de calidad a cambio de una latencia significativamente mejor. Activa solo 3,8 mil millones de sus 25,2 mil millones de parámetros durante la inferencia, lo que se traduce en una mayor velocidad de tokens por segundo con un menor coste de computación. Alcanza los 1441 puntos en Arena AI, una cifra tan cercana al modelo de 31B que la mayoría de las cargas de trabajo en producción no notarán la diferencia. Para una orquestación de agentes de alto rendimiento donde se ejecutan docenas de llamadas simultáneas, esta es la opción más práctica.
Gemma 4 E4B y E2B son los modelos para edge devices (dispositivos periféricos). El E2B se ejecuta en menos de 1,5 GB de memoria con cuantización de 2 y 4 bits, lo que significa que cabe en un teléfono móvil, una Raspberry Pi o una NVIDIA Jetson Orin Nano. Ambos modelos de edge admiten una ventana de contexto de 128K y funcionan completamente offline con una latencia cercana a cero. Para las empresas que necesitan capacidades de agentes en plantas de producción, operaciones sobre el terreno o cualquier lugar donde una conexión de ida y vuelta a la nube no sea viable, estos modelos lo hacen posible sin necesidad de construir una infraestructura personalizada.
Los cuatro tamaños comparten las mismas mejoras de arquitectura: alternancia de capas de atención local de ventana deslizante y global de contexto completo, junto con una nueva técnica llamada Per-Layer Embeddings que añade una vía de condicionamiento paralelo junto al flujo residual principal. El resultado práctico es un mejor rendimiento por parámetro en todos los niveles.
La llamada nativa a funciones (Native Function Calling) cambia las reglas de juego para los agentes
La característica más importante para las plataformas de agentes de IA es la llamada nativa a funciones en los cuatro tamaños de modelo.
Gemma 4 permite definir herramientas mediante esquemas de JSON, y el modelo genera de forma nativa llamadas a herramientas estructuradas como respuesta. Sin trucos de ingeniería de prompts, sin parseo de outputs y sin tener que confiar en que el modelo siga las instrucciones de formato. Usted define la interfaz y el modelo la llama correctamente.
Esto funciona de forma conjunta con la salida estructurada en JSON y la planificación de múltiples pasos. En la práctica, esto significa que se puede diseñar un flujo de trabajo de agente en el que el modelo recibe una tarea, la desglosa en pasos, realiza llamadas a APIs externas en cada paso y devuelve resultados estructurados. Todo de forma nativa, sin la frágil infraestructura que la mayoría de los frameworks de agentes de código abierto requieren actualmente.
Para los equipos de TI corporativos, la salida estructurada es la característica que determina si un modelo está listo para producción o si se quedará permanentemente en fase de prototipo. Cuando un agente procesa una factura, redirige un ticket de soporte o puntúa a un candidato, el sistema receptor necesita datos estructurados. No explicaciones en prosa ni textos del estilo "aquí está mi análisis". Necesita un objeto JSON con los campos que su sistema espera, siempre.
Gemma 4 ofrece esto directamente a nivel de modelo en lugar de como una capa de postprocesamiento. Esto elimina por completo una categoría entera de fallos de producción en los que el modelo genera un razonamiento válido pero con un formato de salida incorrecto.
El modo de pensamiento extendido (extended thinking mode) también está disponible: el modelo puede configurarse para razonar sobre problemas complejos paso a paso antes de producir una respuesta definitiva. Para tareas de agentes que implican decisiones multicriterio, lógica condicional o entradas ambiguas, esta es la diferencia entre un agente que resuelve el 80% más fácil y uno que gestiona el 20% más complejo, que es el que realmente aporta valor.
La brecha de licencias de la que nadie habla
Los modelos de IA de código abierto tienen un problema de licencias que la mayoría de las evaluaciones técnicas ignoran por completo.
Llama 4 de Meta, la otra gran familia de modelos abiertos, se distribuye bajo la Licencia Comunitaria Llama 4. Aunque proporciona acceso a los pesos del modelo, impone restricciones reales: las aplicaciones que superen los 700 millones de usuarios activos mensuales requieren un acuerdo comercial independiente. Además, su Política de Uso Aceptable restringe categorías enteras de aplicaciones. La Open Source Initiative ha declarado en repetidas ocasiones que la licencia de Llama no cumple con la Definición de Código Abierto.
Para una startup que desarrolla una aplicación de consumo, puede que estas restricciones nunca importen. Pero para una gran empresa que despliega agentes de IA en todas sus operaciones comerciales, generan una fricción en el proceso de adquisición que retrasa la adopción durante meses.
Los equipos legales corporativos evalúan las licencias de los modelos de IA de la misma manera que analizan cualquier otra dependencia de software. ¿Podemos modificarlo? ¿Podemos distribuir obras derivadas? ¿Hay umbrales de uso que podamos superar? ¿La política de uso aceptable entra en conflicto con alguna de nuestras actividades comerciales? Con Llama, la respuesta a varias de estas preguntas es "depende" o "consúltelo con Meta". Con Apache 2.0, la respuesta es siempre "sí, adelante".
Google no es el primero en utilizar Apache 2.0 para modelos de IA; Qwen 3.6 y Mistral Small 4 también la utilizan. Pero Gemma 4 es el primer modelo con licencia Apache 2.0 que se sitúa en el top 3 mundial. Esa combinación de alta capacidad y claridad en la licencia no existía antes del 2 de abril.
Qué significa esto para los equipos de agentes de IA en las empresas
Tres implicaciones fundamentales para los equipos que ejecutan flujos de trabajo de agentes en producción:
Ajuste fino (fine-tuning) sin revisión legal. Apache 2.0 significa que puede ajustar Gemma 4 con sus datos patentados y desplegar el modelo resultante con fines comerciales sin necesidad de adquirir licencias adicionales. Para las empresas que desarrollan agentes específicos de dominio para finanzas, recursos humanos o compras, esto elimina la carga legal que hacía inviable el fine-tuning de modelos abiertos. Su organización es propietaria del modelo ajustado de la misma forma que lo es de cualquier código que escriba.
El despliegue en dispositivos periféricos (edge) se hace realidad. Los modelos E2B y E4B no son meras versiones reducidas del modelo grande. Están diseñados específicamente para la inferencia en dispositivos locales, dotados de capacidades multimodales, funcionamiento offline y un consumo de memoria que se adapta al hardware estándar. Para operaciones de fabricación, logística o servicios sobre el terreno, esto significa llevar la inteligencia de los agentes directamente al punto de trabajo. Sin dependencia de la nube, sin latencia y sin que los datos salgan del dispositivo.
La orquestación multimodelo gana una nueva alternativa. La mayoría de los sistemas de agentes en producción ya utilizan múltiples modelos para diferentes tareas. Un modelo de razonamiento para decisiones complejas, un modelo rápido para clasificación y un modelo de codificación para salidas estructuradas. La gama de Gemma 4, de 2B a 31B, bajo una misma arquitectura y licencia, le permite construir un stack coherente de múltiples modelos a partir de una única familia. El 31B gestiona el razonamiento complejo, el 26B MoE se encarga de la clasificación de alto rendimiento y el E4B resuelve la inferencia en el edge. El mismo método de ajuste fino, el mismo formato de salida y la misma licencia para todos ellos.
El debate de la velocidad
La comunidad ha señalado un aspecto que conviene tener en cuenta: la velocidad de inferencia. Los primeros benchmarks muestran que el modelo de 31B se ejecuta de forma más lenta que otros competidores de tamaño similar en ciertos proveedores. El modelo de 26B MoE soluciona esto para cargas de trabajo sensibles a la latencia activando solo 3,8B de parámetros por iteración, pero los equipos que evalúen Gemma 4 deberían realizar pruebas de rendimiento en su hardware específico antes de comprometerse con su despliegue en producción.
Se trata de un problema que tiene solución. La cuantización, la optimización de los proveedores y la variante MoE ofrecen vías para lograr una latencia óptima. No obstante, es un factor real, y omitirlo no ayudaría a nadie que planifique una implementación.
Una perspectiva más amplia
La familia Gemma ha superado los 400 millones de descargas, con más de 100.000 variantes creadas por la comunidad. La llegada de Gemma 4 bajo la licencia Apache 2.0 no hará sino acelerar esta tendencia.
Pero la verdadera noticia no es el lanzamiento de un modelo concreto. Se trata de cómo se está reduciendo la distancia entre los modelos propietarios y los abiertos. Hace un año, elegir un modelo abierto implicaba aceptar un rendimiento notablemente inferior. Hoy, un modelo de 31B parámetros que puede ejecutar en sus propios servidores, entrenar con sus propios datos y desplegar sin restricciones legales supera a modelos que multiplican por 20 su tamaño.
Para las empresas que crean agentes de IA, la cuestión ya no es si los modelos abiertos son lo suficientemente robustos. Radica en si las ventajas operativas de gestionar sus propios modelos (privacidad de datos, control de latencia, previsibilidad de costes y personalización total) superan la comodidad del acceso exclusivo vía API.
Con la llegada de Gemma 4, la balanza se inclina todavía más a favor de operar su propia infraestructura tecnológica (stack).





