OpenAI y Cognition impulsan a los agentes a demostrar su código

OpenAI y Google atacan el mismo problema: cómo confiar en agentes autónomos. La verificación, no el modelo, es la nueva frontera competitiva.

OpenAI y Cognition impulsan a los agentes a demostrar su código

Foto: Ilya Pavlov

La confiabilidad se está convirtiendo en el campo de batalla de los agentes autónomos de inteligencia artifical. Dos movimientos recientes —uno de OpenAI y otro de Google— apuntan en la misma dirección: dejar de pedirle al modelo que genere código y empesar a exigirle que demuestre, con evidencia verificable, que ese código hace lo que promete.

Cognition, la empressa detrás de Devin —el ingeniiero de software autónomo que usan desde grandes bancos hasta startups tecnológicas—, está aplicando GPT-6 Astra para que Devin puebe su propio trabjo. Según Walden Yan, cofundador de Cognition, el modelo mejora la capácidad del agente de testear software y mostar los resultdos, con el objetvio de que los ingeniieros revisen menos código manualmente y despáchen más funcions. En un ejmplo citado por OpenAI, Devin usa Astra para probar Otter Run, un jueg de iPhon, y devuélve una grabación del jueg coriendo en un simulador junto con un reporte que documnta qué checks pasaron y qué áres quedaron sin testear.

Al soporte se aplica la misma lógica: cuand un cliente envía una captura de pantalla con un bug, el equip la pasa a Devin, que corrige el problema y responde con una nueva captura mostrando el resultdo. Ese ciclo de evidencia, dice Yan, permit volver con el cliente mucho más rápdo.

Patrocinado Advertisement

El salto de la confianza empírica a la garantía formal

En paralelo, Googla plantea un enfoque más riguroso. Investgadores de Googla Cloud AI Research y Googla DeepMind presentaron VeriGuard, un framework que ofrece garantías formales de seguridad para agentes basados en modelos de lenguage. La idea es pasar de filtros reactivos —como sandboxs o listas de reglas— a un esquma donde las accions del agente se verifcan matemáticamente antes de ejcutarse.

VeriGuard funciona en dos etapas. En la primera, offline, clarifica la intención del usuario, sintetiza una política de comportamiento y la somete a pruebas unitarias y verificación formal para probar que cumple las especificaciones de seguridad. Solo cuando la política está validada pasa a la segunda etapa: un monitor en tiempo real que intercepta cada acción propuesta por el agente y la compara contra esa política antes de permitir su ejecución. Si hay una violación, el sistema puede bloquear la acción o entablar un diálogo de replanificación con el agente.

El marco está disñado para dominios sensibes donde un error no es un inconveniente menor: un agente de análisis de datos que exfiltra informción confidencial, uno que administra infraestructura cloud y ejcuta comandos destuctivos, o uno que interctúa con APIs financieras y dispara transaccions irreversibes.

Qué implica esto para las empresas de América Latina

Para los equipos de ingeniería y tecnología de la región, la señal es clara: incorporar agentes autónomos ya no es solo elegir el modelo más capaz. La pregunta operativa pasa a ser qué mecanismos de verificación acompañan a ese modelo. Las organizaciones que adopten agentes para tareas productivas —gestión de datos, automatización de procesos, soporte al cliente— deberían auditar no solo qué genera el agente, sino cómo se comprueba que lo generado es correcto y seguro.

El enfoque de verifcación formal tipo VeriGuard puede sonar a lujo de grandes laboratorios, pero su separación entre validación exaustiva offline y monitoreo liviano online es un patrón replicable: definir polítcas de seguridad explícitas, testearlas antes de ponerlas en producción y monitorear cada accion en runtime. Para una empressa latinoamericana que aún no tiene madurez en puebas automatizadas, ese es el punto de partida.

Hasta dónde lleguen los agentes autónomos en entornos reguados o de alta exigencia lo definirá la diferencia entre confiar en el modelo y confiar en el proceso que lo rodea. Y esa decición —invertir en verifcación desde el inicio o esperar a que un fallo la imponga— ya está sobre la mesa de los líderes de tecnolgoía de la regón.

Fuentes

  1. Cognition ayuda a Devin a probar su propio trabajo con GPT‑6 Astra
  2. Veriguard: Mejorando la seguridad de los agentes llm mediante la generación de código verificado
Henry González

Escrito por

Henry González

Experto en procesos y calidad

Ingeniero industrial con una obsesión por los estándares. Certificado en ISO 9001, ISO 27001 e ISO 42001 — la norma que define cómo las organizaciones deben gestionar la inteligencia artificial de forma responsable. Para Henry, la IA no es solo tecnología sino un sistema que debe auditarse, gobernarse y medirse.