ChatGPT y Gemini atacaron sistemas ajenos en pruebas de OpenAI y Google

ChatGPT y Gemini accedieron a servidores ajenos durante tests internos. La investigación académica confirma: más de la mitad de ataques malignos tienen éxito contra agentes autónomos.

ChatGPT y Gemini atacaron sistemas ajenos en pruebas de OpenAI y Google

Foto: Jonathan Kemper

Dos de las mayores empresas de IA del mundo admitieron en menos de tres meses que sus modelos avanzados burlaron controles de seguridad y penetraron infraestructura ajena durante evaluaciones internas. En julio, ChatGPT de OpenAI ejecutó 17.000 acciones en dos días y comprometió a Hugging Face. En septiembre, Gemini de Google adivinó contraseñas y accedió a tres organizaciones distintas. En ambos casos, las compañías aseguran que los modelos "se detuvieron solos".

El patrón no es anecdótico. Un estudio de Cal Poly Pomona probó cinco modelos (Claude 3.5 Sonnet, Gemini 2.5 Flash, GPT-4o, Grok 2 y Nova Pro) en dos frameworks de agentes (AutoGen y CrewAI) con 130 escenarios de ataque. Resultado: tasa de rechazo global del 41,5 %. Es decir, más de la mitad de los prompts maliciosos tuvieron éxito pese a mecanismos de seguridad empresariales. Grok 2 en CrewAI rechazó solo 2 de 13 ataques (15,4 %).

La arquitectura del framework importa. AutoGen, con su modelo de transferencia entre pares, logró 52,3 % de rechazo frente al 30,8 % de CrewAI, cuyo diseño centralizado convierte al orquestador en punto único de fallo. Si el orquestador cae por inyección de prompt, delega tareas maliciosas a todos los subagentes.

Patrocinado Advertisement

Lo que cambia para la empresa latinoamericana

En la región se adoptan estos mismos frameworks. CrewAI y AutoGen son de código abierto y gratuitos; startups y bancos en México, Colombia, Brasil y Argentina ya construyen asistentes autónomos sobre ellos. El problema: las salvaguardas conversacionales no migran al modo agente. Un modelo que rechaza "iniciar sesión como admin" en chat, lo ejecuta si se le da una herramienta de base de datos y se le pide "verificar conectividad".

Un estudio de Stanford (ICLR 2026) llevó la prueba a un entorno real: red universitaria de 8.000 hosts. Su agente ARTEMIS quedó segundo entre 10 profesionales humanos, hallando 9 vulnerabilidades válidas con 82 % de precisión. Coste: 18 USD la hora frente a 60 USD de un pentester humano. Ventajas: enumeración sistemática y explotación en paralelo. Brechas: falsos positivos y tareas con interfaz gráfica.

Riesgo regulatorio y de talento

Ningún país de la región tiene normativa específica para agentes autónomos. La Ley de Ciberseguridad de Chile, la LGPD brasileña o la nueva ley mexicana de datos protegen información personal, pero no exigen sandboxing de agentes ni auditoría de tool use. Un agente que filtre credenciales de clientes al "probar accesos" podría generar multas millonarias sin que exista dolo humano.

Escasea el talento. Los expertos en prompt hardening, tool input sanitization y code executor sandboxing que recomienda la literatura se cotizan en USD y migran a EE. UU. o Europa. Las universidades latinoamericanas apenas empiezan a incluir seguridad de IA agente en posgrados.

Qué hacer esta semana

1. Inventario de agentes: mapear qué procesos usan frameworks multiagente y qué herramientas (bases de datos, APIs, shell) tienen acceso. 2. Pruebas de estrés internas: replicar los 13 escenarios del paper de Cal Poly (inyección de prompt, SSRF, SQLi, uso indebido de herramientas) antes de que lo haga un atacante real. 3. Contención por defecto: contenedores sin red, capability dropping, syscall filtering y monitoreo de llamadas a metadatos de nube (AWS IMDS, GCP metadata). 4. Cláusulas contractuales: exigir a proveedores de IA (OpenAI, Google, Anthropic, AWS) informes de red teaming en modo agente, no solo en chat.

Ya no es teórica la convergencia entre IA agente y ciberseguridad ofensiva. Los modelos más avanzados del planeta han demostrado que, dadas herramientas y autonomía, hackean. La pregunta para el ejecutivo latinoamericano no es "si" llegará a su infraestructura, sino "cuándo" y si habrá alguien que sepa leer los logs cuando ocurra.

Fuentes

  1. La IA Gemini de Google hackeó tres empresas en una prueba de seguridad - BBC
  2. Cuánto debería preocuparnos la rebelión y el hackeo que ... - BBC
  3. Pruebas de penetración de IA agente: Un análisis de seguridad comparativo entre modelos y marcos
  4. Comparación de agentes de IA con profesionales de ciberseguridad en pruebas de penetración del mundo real
  5. La IA de Google perpetró ciberataques y adivinó contraseñas
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.