Frank Hidalgo, CTO de StackAI en Asana, tenía un problema de ingeniería clásico: su agente de navegador —esa pieza que entra a webs, rellena formularios y extrae datos sin código— quemaba tokens a ritmo de startup en serie A. Cada ejecución costaba unos 36 dólares en el modelo que usaban en producción (el "Modelo B" del estudio). A escala de 170.000 clientes, la factura era insostenible.
En lugar de contratar más ingenieros o esperar al siguiente modelo milagroso, Hidalgo le pidió a GPT‑6 Astra —el agente de codificación de OpenAI que corre dentro de Codex— que investigara el código, propusiera arreglos y corriera los experimentos. Lo que estimaba en uno o dos meses de trabajo manual se resolvió en una semana: "Ponía un /goal antes de dormir y revisaba los resultados a la mañana siguiente", cuenta Hidalgo.
El resultado, publicado en un estudio de 144 ejecuciones controladas en cuatro modelos frontera, es el tipo de dato que hace pausar al CTO más escéptico: 76 veces menos costo y 5 veces más velocidad en la configuración óptima sobre GPT‑6.1 Sol. El costo promedio por ejecución cayó a 0,47 USD.
El culpino no era el modelo, era la arquitectura
El agente funcionaba como la mayoría: en cada paso añadía una captura de pantalla y el texto de la página al historial que reenviaba al modelo. Para no estallar el contexto, recortaba capturas antiguas y podaba texto en cada paso. Eso rompía el prefijo de la petición y invalidaba la caché. Resultado: cada llamada pagaba precio completo por historia que ya había viajado antes.
La solución tuvo tres patas, ninguna requirió un modelo más listo:
- Caché extendida al historial (no solo al prompt del sistema y las herramientas).
- Presupuesto de historial mayor: 480.000 caracteres frente a 120.000, para que el modelo no tuviera que podar texto prematuramente.
- Poda en lote de capturas: en lugar de borrar una captura por paso, se acumulaban hasta 20 y luego se recortaban a la más reciente (política 20:1). Entre recortes, 19 llamadas consecutivas reutilizan el mismo prefijo cachado.
Con eso, el 89 % de los tokens de entrada llegaron de caché a el 5 % del precio sin caché. En el Modelo B la optimización sola bajó el costo 29x (de ≥$36.21 a $1.24). Cambiar a GPT‑6.1 Sol con la misma arquitectura recortó otro 2.6x, hasta los $0.47. En todos los modelos probados —incluidos dos de otro proveedor— la configuración óptima ganó siempre.
GPT‑6.1 Sol: el modelo "barato" que casi empata al buque insignia
OpenAI lanzó GPT‑6.1 Sol posicionándolo como el modelo para agentes: rendimiento cercano a Astra (su tope de gama) a una quinta o séptima parte del costo. La tarifa pública es agresiva: 2 USD / M tokens de entrada, 0,10 USD / M en caché y 10 USD / M de salida. Disponible hoy en Codex y ChatGPT Work para suscriptores de pago.
En benchmarks de ingeniería real (DeepSWE v1.1) y control de escritorio (OSWorld 2.0), Sol queda a tiro de piedra de Astra. En AutomationBench —procesos empresariales de varios pasos— supera a Claude Opus 5.5 a ~un tercio del costo. Para una empresa que dispara miles de peticiones diarias, la diferencia entre 0,47 USD y 3+ USD por ejecución define si el caso de negocio cierra o no.
Lo que el paper de ArXiv no dice (y debería importar en LatAm)
Un trabajo paralelo de Aram Vardanyan (FillApp) —"Building Browser Agents: Architecture, Security, and Practical Solutions"— analiza un año de operación en producción de un agente navegador. Su conclusión chirría con la narrativa de "los modelos ya son lo bastante listos": la capacidad del LLM no es el cuello de botella; la arquitectura sí.
Cuatro hallazgos que todo CTO latinoamericano debería tatuarse en la pared:
1. Gestión de contexto híbrida (árbol de accesibilidad + visión selectiva) supera a solo visión o solo texto. Alcanzaron ~85 % de éxito en WebGames (53 retos diversos) vs ~50 % de agentes previos. 2. Seguridad programática, no delegada al LLM. Los ataques de inyección de prompt siguen funcionando incluso tras múltiples rondas de mitigación. Cuando un agente tiene acceso a banca, email y SaaS corporativo, un 1 % de tasa de fallo es inaceptable. La defensa debe estar en la capa de herramientas (políticas de dominio, permisos, same-origin policy), no en que el modelo "se dé cuenta".
3. Especialización > generalización. Agentes hechos a medida para flujos concretos (facturación, conciliación, onboarding) son más seguros y baratos que "navegadores universales". 4. Latencia y costo son restricciones de arquitectura, no de modelo. La poda inteligente de historial y la versión de referencias a elementos DOM son decisiones de ingeniería, no de prompt engineering.
¿Qué cambia para una empresa en México, Colombia o Chile?
- Economía unitaria viable: A $0.47 por ejecución compleja (32 ítems extraídos, formularios, navegación), automatizar procesos de back-office —conciliación bancaria, scraping de proveedores, llenado de portales gubernamentales— deja de ser experimento y entra en hoja de cálculo de OpEx.
- Riesgo regulatorio: Si tu agente toca datos financieros (CNBV, Superfinanciera, CMF) o de salud, la lección de seguridad del paper de ArXiv no es opcional. No expongas un agente generalista a portales transaccionales sin capa de ejecución restringida.
- Talento local: El estudio de Asana muestra que un ingeniero senior dirigiendo a GPT‑6 Astra en Codex comprime meses de I+D en días. La habilidad crítica pasa de "saber entrenar modelos" a "saber diseñar arquitecturas de agentes y evaluar trazas". Eso se recluta y forma en la región.
- Multi-modelo como estrategia: El estudio probó cuatro modelos de dos proveedores. La configuración óptima (caché + presupuesto + poda en lote) ganó en todos. Eso reduce dependencia de un solo vendor y da poder de negociación.
La pregunta que debería hacerse el director de operaciones
Si hoy tienes un equipo humano haciendo clic en portales para extraer 200 facturas al mes, ¿cuánto cuesta esa hora-hombre frente a 0,47 USD por ejecución autónoma y auditable? La brecha ya no es tecnológica; es de arquitectura y gobernanza. Asana no descubrió un truco de modelo; descubrió que la ingeniería de sistemas —caché, poda, presupuestos de contexto— sigue siendo el multiplicador real.
La próxima vez que un proveedor te venda "agentes autónomos" con una demo brillante, pide ver la arquitectura de contexto, la política de poda y la capa de seguridad programática. Si no la tienen, no compras un agente; compras un pasivo.