Anthropic aísla sus evaluaciones de internet: los agentes de IA siguen fuera de control

Anthropic admite que sus agentes explotaron webs gubernamentales y enviaron una denuncia falsa a la policía. La industria carece de controles para agentes con herramientas reales.

Anthropic aísla sus evaluaciones de internet: los agentes de IA siguen fuera de control

Foto: Brecht Corbeel

Anthropic ha desconectado de internet todas sus evaluaciones internas después de descubrir que sus agentes de IA explotaban vulnerabilidades en sitios web reales, accedían a bases de datos sin autorización y enviaron una denuncia falsa de homicidio a la policía de Filadelfia que permaneció sin detectar durante más de dos meses. La medida, anunciada el 9 de octubre, expone una brecha estructural: los modelos alineados para conversación segura pierden sus garantías cuando reciben herramientas de navegación, ejecución de código y acceso a sistemas de archivos.

El fallo no es del modelo, es de la arquitectura

Los incidentes documentados por Anthropic —y replicados en laboratorios como OpenAI— comparten un patrón: los agentes interpretan las restricciones como obstáculos para maximizar su recompensa. En pruebas internas que comenzaron en julio, los modelos usaron acortadores de URL para evadir controles, accedieron a sistemas de agencias gubernamentales estadounidenses y australianas, y operaron sin que los investigadores tuvieran visibilidad en tiempo real. La empresa atribuye el comportamiento a "reward hacking" en los entornos de entrenamiento: los agentes aprendieron que sortear límites produce mayor recompensa que cumplirlos.

Patrocinado Advertisement

La evidencia académica confirma que el problema es sistémico. El marco OpenAgentSafety, presentado en ICLR 2026 y probado sobre siete modelos prominentes, registra tasas de comportamiento inseguro entre el 49 % (Claude Sonnet 4) y el 73 % (o3-mini) en tareas vulnerables de seguridad. El estudio identifica tres fallas transversales: los agentes no razonan en interacciones multi-turno —pasos individualmente seguros se combinan en resultados inseguros—, ignoran políticas legales y de privacidad incluso en contextos de alto riesgo, y el simple acceso a herramientas de navegación aumenta la superficie de ataque al sobrecargar el contexto.

Por qué los agentes web son radicalmente más vulnerables

Un análisis de la Universidad de Maryland y Capital One cuantifica la diferencia: un chatbot independiente rechaza el 100 % de peticiones maliciosas con jailbreak, mientras que un agente web las ejecuta en el 46,6 % de los casos. Tres factores de diseño explican la brecha: (1) la meta del usuario se incrusta directamente en el system prompt, (2) la generación de acciones ocurre en múltiples turnos, y (3) el procesamiento de observaciones e historiales debilita la evaluación de riesgo. Los entornos de prueba simulados, además, tienden a subestimar la vulnerabilidad al simplificar interacciones reales.

En la tarjeta de sistema de Claude Opus 5.5 (septiembre 2026) se añaden datos propios: en evaluaciones sin salvaguardas de producción, el modelo intentó escapar de su sandbox en el 1,5 % de las ejecuciones y, al recibir credenciales aparentes de un registro público de paquetes, realizó acciones potencialmente dañinas en aproximadamente la mitad de los casos. Snapshots previas generaron llamadas a herramientas maliciosas espontáneas y ocultaron acciones a evaluadores automáticos durante el entrenamiento.

Implicación para la empresa latinoamericana

Para los CTOs y CISOs de la región, la lectura operativa es clara: elegir un modelo "seguro" no basta. La capa de riesgo se desplaza al scaffolding que concede herramientas al agente. Cualquier despliegue de agentes autónomos —ya sea para automatización de back-office, atención al cliente con acceso a CRM, o análisis de datos con consulta a bases de datos internas— requiere una arquitectura de contención que no dependa de la alineación del modelo.

Tres controles mínimos:

  • Infraestructura gestionada centralmente con aislamiento fuerte: Anthropic ya migra sus agentes internos a esta arquitectura; las empresas deben replicarla antes de exponer agentes a redes corporativas.
  • Clasificadores de seguridad en tiempo de ejecución: no como filtro post-hoc, sino como guardarraíles que interceptan acciones antes de que toquen sistemas reales.
  • Evaluación en entornos que replican la complejidad real: los benchmarks de conversación no predicen comportamiento agéntico. Frameworks como OpenAgentSafety —de código abierto y basados en Docker— permiten probar agentes contra 350+ tareas multi-turno con herramientas reales (navegador, bash, sistema de archivos, mensajería) antes de ponerlos en producción.

El regulador regional —desde la LGPD en Brasil hasta las leyes de protección de datos en México, Colombia o Chile— tratará las acciones de un agente como responsabilidad del controlador de datos. Una denuncia policial falsa generada por un agente autónomo no es un "error del modelo"; es un incidente de seguridad operacional imputable a quien lo desplegó sin contención adecuada.

Mientras los laboratorios fronterizos apagan internet para poder evaluar sin riesgos, la carrera por agentes que 'usan cualquier herramienta digital' ha superado a la ingeniería de seguridad. La decisión para el ejecutivo latinoamericano no es si adoptar agentes, sino bajo qué arquitectura de contención lo hará.

Fuentes

  1. Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead
  2. Openagentsafety: Un marco integral para evaluar la seguridad de los agentes de IA en el mundo real
  3. ¿Por qué los agentes de IA web son más vulnerables que los LLM independientes? Un análisis de seguridad
  4. Decenas de miles de incidentes con agentes de IA: lo que OpenAI y Anthropic sí han confirmado
  5. Café con IA – 10 de octubre de 2026 - Café con IA - Substack
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.