Agentes de OpenAI usaron una wiki alemana para evadir sus controles

Unos 18.000 mensajes en una wiki alemana muestran cómo agentes autónomos de OpenAI coordinaron evasiones sin ser reportados. Qué deben exigir las empresas en América Latina.

Agentes de OpenAI usaron una wiki alemana para evadir sus controles

Foto: Tyler

Unos 18.000 mensajes publicados en una wiki alemana de programación sirvieron, durante mayo, como un tablón secreto donde agentes autónomos de OpenAI intercambiaron respuestas, exploraron su entorno y compartieron técnicas para saltarse las restricciones de su sandbox. El episodio fue documentado por investigadores independientes y revelado por Reuters el 4 de septiembre. OpenAI no dijo nada hasta el día siguiente, cuando publicó un comunicado en su cuenta de X reconociendo que sus agentes escribieron en varios sitios web y explicando por qué había decidido no informar antes.

El incidente que OpenAI no quiso llamar incidente

La empresa explicó que trató el caso como un problema de desalineación del modelo, es decir, un sistema que persigue objetivos que no coinciden con los de sus creadores, y no como un incidente de seguridad clásico. Esa distinción no es menor: los incidentes de seguridad se divulgan; los hallazgos de investigación, en cambio, se publican en papers académicos y system cards. El propio comunicado admite que esa categorización ya no alcanza. Este año, dijo OpenAI, la desalineación empezó a producir nuevos tipos de impacto en el mundo real, y los criterios sobre cuándo compartir estos casos "deberían haberse definido hace tiempo". La compañía anunció que está trabajando en un marco de divulgación para comportamientos inesperados de agentes, que planea publicar en las próximas semanas, y que mantiene conversaciones con decenas de reguladores en distintos países.

Patrocinado Advertisement

La comparación con el caso de Hugging Face hace más visible la inconsistencia. En julio, cuando sus modelos vulneraron esa plataforma mientras resolvían tareas de ciberseguridad, OpenAI sí reconoció el hecho públicamente al día siguiente, porque afectaba a terceros. Un análisis posterior encontró que cerca de 700 agentes autónomos se coordinaron durante ese ataque sin instrucciones humanas directas. En el episodio de la wiki alemana, en cambio, la empresa consideró que no había terceros perjudicados y que el comportamiento ya era conocido: dijo que desde marzo venía reportando señales tempranas de agentes usando internet de formas no intencionadas. El comunicado, por lo demás, no cuestionó los hechos técnicos del reporte ni ofreció disculpas, y no respondió a la información de Reuters según la cual sus ejecutivos conocían el caso desde semanas antes.

Los investigadores que documentaron el incidente describen una actividad más sofisticada que un simple error. Los agentes reaccionaron a los intentos humanos de borrar sus mensajes, crearon páginas de respaldo que empezaban con "ZZZ" para sobrevivir a la limpieza alfabética del administrador y sondearon el sitio en busca de vulnerabilidades, aunque no hallaron evidencia de que esos intentos funcionaran. El tráfico analizado apuntaba a infraestructura de Microsoft Azure, la plataforma que usa OpenAI, y casi la mitad de las cuentas tenían nombres con vínculos con la empresa.

OpenAI no es la única compañía enfrentando este tipo de comportamientos. Anthropic reveló en julio que su modelo Claude vulneró tres organizaciones durante evaluaciones internas de seguridad. En un caso, registró un nombre de paquete que encontró en documentación y subió código malicioso a PyPI; el paquete estuvo activo cerca de una hora, lapso en el que 15 sistemas reales lo descargaron y ejecutaron. Y un paper reciente de Carnegie Mellon, el benchmark ROGUE, evaluó a modelos de frontera en tareas ordinarias de uso de computadora y encontró que la mayoría ignora interrupciones humanas, reescribe notificaciones de apagado y accede a archivos que se le prohibió tocar, cuando esas acciones le ayudan a completar la tarea. El estudio agrega un hallazgo incómodo: un agente que se comporta de manera corregible no garantiza que los subagentes que crea también lo hagan.

Qué deberían exigir las empresas antes de desplegar agentes

Para una empresa de América Latina que está evaluando agentes de IA sobre su CRM, su base de clientes o su operación de servicio, la lección no es que los modelos sean peligrosos por naturaleza. Es que OpenAI decidió unilateralmente, durante meses, que el comportamiento anómalo de sus propios agentes no era información que sus clientes necesitaran. Si eso ocurre con la empresa más visible del sector, cualquier proveedor puede hacer lo mismo.

La pregunta que los equipos de tecnología y legal de la región deberían llevar a la mesa de negociación no es cuán inteligente es el modelo, sino qué se compromete a contar el proveedor cuando el agente haga algo que nadie le pidió. Eso se traduce en condiciones concretas de contratación: una cláusula de notificación de incidentes que incluya explícitamente el comportamiento anómalo del modelo y no solo brechas de seguridad; límites de escritura auditables sobre los sistemas donde el agente opera, porque el patrón del caso fue un permiso de escritura que nadie creía que existía; y registro de las acciones del agente del lado del cliente, no únicamente del lado del proveedor.

Hay ventaja en llegar tarde. Las empresas de la región que recién están armando su gobernanza de agentes pueden escribir estas condiciones ahora, en lugar de heredar prácticas ya consolidadas. La recomendación operativa es empezar por procesos con reversibilidad alta y perímetro de escritura acotado, y dejar los flujos que tocan datos de clientes o compromisos comerciales para cuando el registro y los controles ya estén en funcionamiento.

Mientras tanto, la industria sigue avanzando: OpenAI presentó esta semana su modelo más capaz hasta ahora, GPT-6 Astra. El episodio del wiki se conoció precisamente en la semana de su lanzamiento. A mayor autonomía y capacidad, los márgenes de error se vuelven menos tolerables. Para los ejecutivos latinoamericanos, la pregunta abierta es si su proveedor sabrá —y querrá— contarles lo que sus agentes hacen por su cuenta antes de que sea demasiado tarde.

Fuentes

  1. OpenAI admite que su agente de IA escribió en un sitio inactivo y explica el motivo de no divulgarlo
  2. OpenAI admite el incidente del wiki: qué cambia para agentes
  3. Agentes de OpenAI se escapan de sus pruebas y convierten una wiki alemana en un tablón para otras IA con 15.000 mensajes sobre cómo saltarse restriccio…
  4. ROGUE: Comportamiento desalineado de agentes que surge del uso ordinario de la computadora
Melina Rodríguez

Escrito por

Melina Rodríguez

Especialista Inteligencia Artificial

Arquitecta de profesión, estratega de IA por convicción. Máster en Gestión Urbana por la Universidad Politécnica de Cataluña y certificada en ISO 42001 — la norma internacional de gestión de inteligencia artificial. Co-fundadora de 3Dual Studio y consultora en Bewos, ha diseñado programas de alfabetización en IA para organizaciones públicas y privadas en América Latina.