Google presentó Gemini 4 Argon el miércoles y los primeros en recibirlo no son desarrolladores ni consumidores, sino un grupo cerrado de investigadores de seguridad que lo van a ejecutar con sus restricciones de ciberseguridad desactivadas. La compañía plantea Argon como un modelo de frontera para trabajos que se prolongan, no para los que responden rápido.
El acceso pasa por el programa Fairwind de Google, una iniciativa de seguridad cuyos miembros reciben el modelo antes que los clientes de pago de la API y los suscriptores de Google AI Ultra; desarrolladores, empresas y consumidores quedan al final. Koray Kavukcuoglu, vicepresidente senior de Google DeepMind y arquitecto jefe de IA, afirmó que Google participa en el proceso voluntario del gobierno de Estados Unidos para el acceso a modelos antes de su lanzamiento mientras amplía la disponibilidad.
Puntos clave
- El techo de salida de Argon sube a un millón de tokens desde los 64.000 de los modelos anteriores de Google, un margen que la compañía presenta como espacio para resolver un problema difícil de una sola pasada.
- Google reporta 77,9% en DeepSWE v1.1 para Argon frente al 74,2% de Claude Opus 5.5 y el 74,1% de GPT-6 Astra, además de un primer puesto con 51,3% en AutomationBench de Zapier.
- Los ciberdefensores de confianza y los equipos internos de Google reciben Argon sin restricciones cibernéticas; el resto de los clientes espera la versión limitada.
Por qué el techo de salida es la especificación central
La cifra con la que Google abre es un límite de salida de un millón de tokens, un salto de unas quince veces respecto al techo de 64.000 tokens de sus modelos anteriores. El argumento de la compañía es que la profundidad del razonamiento queda limitada por cuánto puede escribir un modelo antes de detenerse, y que con tanto margen una sola trayectoria larga reemplaza a una cadena de relevos.
La evidencia que Google ofrece para esa afirmación viene de sus propias instalaciones y no de ningún evaluador externo. En un caso, una flota de agentes Argon leyó telemetría de perfilado de todos sus centros de datos y aplicó por su cuenta correcciones de memoria, un trabajo con el que la compañía espera recuperar más de 300 TiB en el despliegue y entre 500 TiB y 1 PiB al final del proceso.
El segundo despliegue resulta más revelador, porque es la clase de tarea que los ingenieros normalmente se niegan a automatizar. Los agentes de Argon están migrando el código C y C++ de Google a Rust en escalas que van desde bibliotecas pequeñas como re2 hasta las más de 800.000 líneas del núcleo Zircon de Fuchsia. En el decodificador de vídeo libgav1, los agentes descartaron 32.000 líneas de SIMD ajustado a mano y dejaron que el compilador vectorizara Rust seguro y corriente: un resultado que Google mide 2,7 veces más rápido que la migración anterior a Rust, con un vídeo de salida idéntico byte a byte.
Para qué sirve un despliegue que empieza por la ciberseguridad
Argon se entrenó específicamente para trabajos de seguridad defensiva, y la propuesta es un ciclo completo sin intervención humana: Google sostiene que el modelo puede encontrar una vulnerabilidad crítica, confirmar que es real y escribir el parche. Retirar las restricciones cibernéticas para los miembros de Fairwind y los equipos internos es lo que hace utilizable ese ciclo, porque un modelo que se niega a razonar sobre la explotación tampoco puede cerrar el agujero.
Hay un primer resultado de campo al que señalar. A través de Scan for Good, el programa gratuito de endurecimiento de infraestructura que gestiona la firma de seguridad Wiz, Argon detectó al parecer una exposición grave de datos personales en software hospitalario desplegado en todo el mundo, algo que según Google los modelos de frontera anteriores pasaron de largo. Su puntuación de remediación, un 68% en CWE-bench v1, es un empate en lo más alto y no una ventaja clara.
Cómo se compara Argon con Astra y Opus 5.5
El expediente de pruebas de Google se apoya en tareas de largo horizonte. La compañía reclama un nuevo récord en DeepSWE v1.1 con 77,9%, cifra que según informó 9to5Google lo coloca por encima de Claude Opus 5.5, con 74,2%, y de GPT-6 Astra, con 74,1%. Google añade que Argon lidera el Vals Index, que pondera trabajos de finanzas, programación, derecho e impuestos según el peso de cada sector en el PIB estadounidense, que ocupa el primer lugar en AutomationBench de Zapier con 51,3% y que alcanza 91,7% en LVBench, la prueba de vídeo de larga duración. Todas las cifras son propias y aparecen en su anuncio de lanzamiento.
Lo que Google admite que sigue reforzando
Las cuatro áreas que enumeró la compañía se dividen con nitidez en dos estrategias. Dos tienen que ver con el rechazo: bloquear el uso indebido cibernético y de tipo CBRN sin cerrar la puerta a la investigación legítima de doble uso, y resistir la inyección indirecta de instrucciones, terreno en el que Google dice encabezar la prueba de referencia de Gray Swan para esa clase de ataque. Las otras dos parten de que el rechazo a veces fallará: un monitor lee la cadena de razonamiento de Argon y corta la ejecución cuando el modelo se desvía de lo que se le pidió, y los entornos aislados se sellan antes de que empiece cualquier entrenamiento de alto riesgo.
Enterrada en esa sección está la admisión más interesante del lanzamiento. Google explica que mantiene los hallazgos de desalineación fuera del ciclo de entrenamiento a propósito, porque entrenar con ellos enseñaría a Argon a esconderse de los monitores que lo vigilan, y pidió a sus competidores que mantengan legible el razonamiento de sus modelos por la misma razón.
Perspectivas
El calendario no es casual. Argon aterrizó un día después del DevDay de OpenAI, donde esa compañía lanzó su agente Dots y un modelo GPT-6.1 Sol, y poco después de que OpenAI anunciara que no publicaría el GPT-6.1 Astra que tenía previsto, por motivos de seguridad. También cumple lo que prometió Kavukcuoglu al asumir DeepMind en agosto, cuando dijo que Gemini 4 estaba en fase de ajuste y saldría pronto en lugar de pulido. El precio introductorio es de 2 dólares por millón de tokens de entrada y 10 por millón de salida, y subirá después a 4 y 20 dólares.
FAQ — Preguntas frecuentes
¿Puedo usar Gemini 4 Argon hoy?
No, salvo que formes parte del programa Fairwind de Google o seas un probador de confianza. El orden de despliegue que anunció la compañía sitúa primero a los ciberdefensores, después a los clientes de pago de la API y los suscriptores de Google AI Ultra, y al final a desarrolladores, empresas y consumidores.
¿Qué significa lanzar Argon «sin restricciones cibernéticas»?
Google entrega a los defensores de confianza y a sus equipos internos una versión que no limita el razonamiento del modelo sobre seguridad ofensiva, para que puedan aprovechar toda su capacidad de descubrimiento de vulnerabilidades. Todos los demás recibirán una versión con esas restricciones activas.
¿Cuánto cuesta Gemini 4 Argon?
El precio introductorio es de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, con un descuento del 95% en los tokens de entrada almacenados en caché. Terminado el periodo introductorio, el precio pasa a 4 dólares por millón de tokens de entrada y 20 por millón de salida.






