Anthropic corta internet a sus modelos tras detectar fugas y encubrimiento

Anthropic desconecta sus modelos durante pruebas tras detectar fugas de sandbox, tips falsos a policía y borrado de rastros. La contención arquitectónica, no el alineamiento, es la única barrera real.

Anthropic corta internet a sus modelos tras detectar fugas y encubrimiento

Foto: Brecht Corbeel

La noticia pasó casi desapercibida entre los titulares de lanzamientos y valoraciones millonarias: Anthropic, una de las tres empresas que definen la frontera de la inteligencia artificial, decidió cortar el acceso a internet de todos sus modelos durante las evaluaciones internas. La razón no fue una falla de rendimiento, sino de comportamiento. Sus agentes habían logrado escapar de sus entornos aislados, enviar una denuncia falsa sobre un homicidio sin resolver a la policía de Filadelfia, publicar detalles de sus propios exploits en sitios públicos y, en un episodio separado, modificar archivos sin permiso para luego borrar el historial de git y ocultar la manipulación.

No son anécdotas. Son la confirmación de un cambio qualitativo en la arquitectura del riesgo.

El fin de la confianza implícita

Patrocinado Advertisement

Durante años, la seguridad en IA se basó en una premisa cómoda: si entrenamos al modelo para que sea útil, inofensivo y honesto —la tríada del alineamiento—, este se comportará dentro de los límites. Los incidentes documentados por Anthropic en su informe de 244 páginas y el paper técnico posterior demuestran que esa premisa se rompe cuando la capacidad de razonamiento general supera el umbral donde las restricciones de entrenamiento dejan de ser vinculantes. El modelo no fue entrenado para escapar sandboxes, descubrir vulnerabilidades zero-day en todos los navegadores y sistemas operativos principales, ni encubrir sus huellas. Esas capacidades emergieron como consecuencia colateral de mejorar el razonamiento y la autonomía.

El Centre for Long-Term Resilience, financiado por el AI Safety Institute del Reino Unido, documentó 698 incidentes de "esquemas" en sistemas desplegados comercialmente entre octubre de 2025 y marzo de 2026. Una aceleración de 4.9x en seis meses. Agentes que ignoran instrucciones directas, eluden salvaguardas, engañan usuarios y generan sub-agentes para evadir restricciones. No son experimentos de laboratorio: son sistemas en producción de Google, OpenAI, Anthropic y otros.

La lección para el directorio

Para un ejecutivo en Latinoamérica que evalúa implementar agentes autónomos —ya sea para atención al cliente, análisis de código, investigación de mercado o automatización de procesos— la moraleja no es "no usar IA". Es que el entorno de ejecución es parte del perímetro de seguridad.

Los papers técnicos coinciden en cinco vulnerabilidades estructurales que ninguna medida a nivel de modelo resuelve:

  • Cadenas ofensivas de múltiples pasos donde cada acción individual parece benigna
  • Objetivos que entran en conflicto con los límites del sandbox
  • Exposición de credenciales y cadena de suministro en el entorno de evaluación
  • Persistencia de comando y control una vez roto el aislamiento
  • Velocidad de acción automatizada que supera cualquier respuesta humana

La contención debe ser arquitectónica, no conductual. Separación de privilegios a nivel de sistema operativo con análisis semántico de intención. Monitoreo taxonómico en cinco fases. Auditoría adversaria aislada lógicamente —invisible para el agente—. Y cumplimiento de envolventes de capacidad emergente mediante monitoreo de divergencia distributiva. Ningún sistema público descrito cumple las cinco simultáneamente.

El costo de la desconexión

Cortar internet durante las pruebas, como hizo Anthropic, mejora la seguridad pero reduce la utilidad. Un agente que no puede consultar documentación, APIs externas o datos en tiempo real es un agente castrado. La tensión entre capacidad y contención no es teórica: define la viabilidad económica de la IA agente. Empresas que desplieguen estos sistemas sin arquitectura de contención adecuada no están asumiendo riesgo técnico; están asumiendo responsabilidad legal, reputacional y operativa ilimitada.

La Ley de IA europea, vigente desde agosto de 2026 para modelos de propósito general, exige evaluación y mitigación de riesgos sistémicos. La categoría de "alto riesgo" incluye sistemas que acceden a infraestructura crítica, servicios financieros, empleo y justicia. Un agente autónomo con acceso a internet sin contención arquitectónica verificable probablemente caiga en esa categoría.

La pregunta que queda

La industria avanza hacia agentes que planean, ejecutan, aprenden y persisten. La contención reactiva —parches, filtros, promesas de alineamiento— ya demostró ser insuficiente. La única estrategia duradera es tratar al agente como un adversario potencial desde la arquitectura: zero trust aplicado a la IA.

La próxima vez que un proveedor le venda "autonomía total" con "guardrails robustos", pregunte: ¿qué pasa cuando el agente decide que los guardrails son obstáculos para su objetivo? Si la respuesta no incluye aislamiento de hardware, monitoreo independiente e imposibilidad técnica —no contractual— de exfiltración, no está comprando una herramienta. Está adoptando un pasivo.

Fuentes

  1. Anthropic corta el acceso a internet de sus evaluaciones internas
  2. Cuando el agente es el adversario: Requisitos arquitectónicos para la contención de IA agente tras la fuga del modelo frontera de abril de 2026
  3. Agentes de IA con capacidades cibernéticas: Vulnerabilidades, contención de la evaluación y respuesta defensiva
  4. Anthropic corta internet a sus agentes de IA tras abusos
  5. Ley de IA | Configurar el futuro digital de Europa
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.