Google DeepMind lanza Gemini 4 Argon con salida de 1 millón de tokens

El nuevo modelo insignia de Google DeepMind prioriza flujos de trabajo agente en ingeniería, conocimiento empresarial y defensa cibernética. Acceso inicial solo para socios de confianza vía Fairwind; precios de lanzamiento y benchmarks son prometedores pero no verificados independientemente.

Google DeepMind lanza Gemini 4 Argon con salida de 1 millón de tokens

Foto: amir shamsipur

Google DeepMind presentó el 30 de septiembre a Gemini 4 Argon, su modelo fronterizo más ambicioso hasta la fecha, con una apuesta explícita por los flujos de trabajo complejos y de largo horizonte en tres dominios: ingeniería de software, trabajo de conocimiento empresarial (legal, financiero) y ciberseguridad defensiva. La novedad arquitectónica que cambia las reglas del juego para agentes autónomos es un límite de salida de 1 millón de tokens —frente a los 64.000 de la generación anterior—, lo que permite en una sola generación tareas que antes requerían bucles de orquestación y manejo de estado externo Google Blog.

No es un chatbot: es infraestructura para agentes

La distribución rompe el patrón habitual de lanzamientos Gemini: Argon no aparece en la API pública ni en la tabla de precios oficial al día del anuncio. Su primer público son probadores de confianza del programa Fairwind, la iniciativa de Google para poner capacidades de vanguardia en manos de defensores cibernéticos seleccionados Fairwind Program. Miles de empleados de Google ya lo usan a diario, desde depuración rutinaria hasta migraciones masivas de C/C++ a Rust (800.000 líneas en el kernel Zircon de Fuchsia) y optimización de subrutinas cuánticas con ganancias del 40 % Agentpedia.

Patrocinado Advertisement

Ese uso interno es la evidencia más tangible: agentes Argon liberaron más de 300 TiB de memoria en centros de datos tras analizar telemetría de toda la flota, con un ahorro total estimado de entre 500 TiB y 1 PiB, y reescribieron el decodificador de video libgav1 logrando 2,7× la velocidad de la versión Rust anterior sin cambiar la salida Google Blog.

Benchmarks: avances reales, pero todos vendor-reported

La compañía publica una batería de evaluaciones donde Argon lidera o empata:

  • DeepSWE v1.1 (ingeniería de software real): 77,9% (nuevo estado del arte)
  • AutomationBench (Zapier, ejecución empresarial end-to-end): 51,3% (primero)
  • LVBench (comprensión de video largo): 91,7%
  • Vals Index (impacto económico ponderado por PIB en finanzas, código, derecho, impuestos): «líder»
  • CWE-bench v1 (parcheo de vulnerabilidades): 68% —empate a tres con Grok 4.7 y GPT-6 Astra
  • Gray Swan IPI (inyección indirecta de prompt): 0,7% tasa de éxito del ataque (el más robusto)

Todas las cifras provienen de ejecuciones propias de Google o comisionadas por Google; no hay reproducibilidad independiente ni harness publicado al cierre de esta edición Agentpedia. El empate en CWE-bench es especialmente relevante: en parcheo de seguridad, Argon no se despega del campo.

Ciberseguridad: el wedge de entrada

El modelo fue entrenado específicamente para trabajo defensivo: «detectar, validar y corregir autónomamente vulnerabilidades críticas». Wiz lo usa ya en su programa Scan for Good y en una demostración inicial descubrió una vulnerabilidad crítica que exponía datos personales en software hospitalario global, algo que modelos fronterizos previos no habían visto Google Blog. En pruebas de penetración de caja negra de Wiz, Argon supera a Flash Cyber 3.8 en descubrimiento de superficie de ataque, identificación de vulnerabilidades y generación de proof-of-concept.

Entrega a los socios Fairwind una versión sin guardrails cibernéticos para exprimir su capacidad ofensiva-defensiva, mientras el modelo público mantendrá rechazos ante solicitudes CBRN y ciberataques bajo su Frontier Safety Framework DeepMind Safety.

Precios de lanzamiento y realidad de acceso para LatAm

El precio introductorio es agresivo: 2 USD/M tokens de entrada, 10 USD/M de salida, 95 % de descuento en entrada en caché Google Blog. Pero el acceso real para empresas latinoamericanas hoy es cero: no hay model ID en la API pública, no hay rate limits publicados, no hay SLA. El camino es solicitar ingreso a Fairwind o esperar disponibilidad general —Google dice «lo antes posible» sin fecha.

Para CISOs y CTOs de la región, la lectura operativa es clara: diseñen contra el techo que pueden llamar hoy (64K o 128K en modelos disponibles) y traten el millón de tokens como *upside* futuro. La fortaleza en comprensión visual (gráficos, video largo, documentos mixtos) y en benchmarks legales/financieros (Harvey Legal Agent, Vals Finance) sugiere alto valor para servicios profesionales, banca y regulatorios en español/portugués, pero sin acceso no hay proof-of-concept posible.

Implicación concreta

Ya no persigue a OpenAI en chat; compite en infraestructura para agentes empresariales autónomos con ciberseguridad como punta de lanza. El modelo muestra progreso medible en razonamiento largo, robustez ante inyección de prompt y utilidad interna probada. Pero el moat real no es el benchmark —es el programa Fairwind, que crea un círculo de retroalimentación privilegiada con los mejores defensores. Las empresas latinoamericanas que quieran jugar en esa liga deben moverse ya para entrar en ese círculo o alinear roadmaps con socios que ya estén dentro; esperar la API pública es ceder ventaja a quien sí tiene acceso temprano.

Fuentes

  1. Google lanza Gemini 4 Argon, al que califica como su modelo más potente hasta la fecha
  2. Gemini 4 Argón: nuestra próxima era de inteligencia de vanguardia
  3. Gemini 4 Argon: Guía completa de benchmarks, precios y acceso
  4. MDArena: Evaluación de agentes de codificación en flujos de trabajo realistas de dinámica molecular
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.