La auto-mejora recursiva (RSI) dejó de ser especulación teórica. Zhipu AI acaba de demostrar el "bucle mínimo cerrado": su modelo GLM-5.3, actuando como agente de infraestructura, optimizó el servicio de inferencia que lo aloja, reduciendo costos y latencia en un clúster de más de 100.000 chips nacionales chinos. El ciclo tardó dos semanas en pasar de la primera ejecución exitosa a absorber todo el tráfico en producción, multiplicando el rendimiento por tres.
El logro no es que el modelo se haya vuelto "más inteligente" por sí solo. Como explica Tang Jie, científico jefe de Zhipu, el motor del bucle no es la inteligencia sino la retroalimentación densa y verificable: un árbitro barato, rápido y objetivo que dice si cada cambio mejora o empeora el sistema. Tres piezas encajan: un objeto mejorable (la pila de inferencia: kernels, paralelismo, memoria, planificación), un juez denso (correctitud, latencia, throughput) y un ciclo autosostenido donde las tareas de hoy entrenan al agente de mañana.
La métrica que faltaba
Anthropic acaba de publicar el marco para medir esto. Tres tableros: qué fracción de la I+D de modelos la hace IA, bajo qué supervisión operan los agentes y cómo se reparte el cómputo entre desarrollo y seguridad. Sus datos internos muestran que, a agosto de 2026, Claude "lideraba" el 26 % del trabajo de I+D de modelos bajo supervisión humana, desde menos del 1 % en febrero. Ninguna tarea alcanzó autonomía total.
Esa convergencia es clara: Zhipu muestra el "cómo" operativo en un dominio estrecho (infraestructura de servicio); Anthropic entrega el "cuánto" medible para que laboratorios, gobiernos y aseguradoras puedan auditar la velocidad real de la automatización de la investigación.
El flanco abierto: virus que se pagan su propia inferencia
Mientras los laboratorios fronterizos construyen bucles controlados, investigadores de la Universidad de Toronto, Vector Institute, Cambridge y ServiceNow publicaron un gusano de prueba de concepto que usa LLMs de pesos abiertos —caben en una sola A100 de 80 GB— para comprometer GPUs, montar allí el modelo y usarlo para diseñar ataques a medida contra nuevos huéspedes. Tasa de éxito global ~37 %: detección de vulnerabilidades ~80 %, explotación ~53 %, auto-replicación ~88 %. No depende de APIs de proveedores que puedan revocarse; parasita la computación ajena para sostener su razonamiento.
El artículo describe una "ecología" futura de agentes atacantes y defensores viviendo de la infraestructura, más allá del control humano centralizado. La implicación operativa inmediata: cualquier clúster expuesto con pesos de modelo accesibles pasa a ser superficie de ataque autónomo.
La respuesta política: 1.337 firmas pidiendo frenar
Científicos jefes y cofundadores de OpenAI, Anthropic, Google DeepMind, Meta, Thinking Machines y Safe Superintelligence pidieron al gobierno de EE. UU. que lidere un esfuerzo internacional para desarrollar "herramientas técnicas y de gobernanza necesarias para dosificar deliberadamente la frontera del desarrollo automatizado de IA". El texto reconoce el problema de acción colectiva: ninguna empresa puede frenar unilateralmente bajo presión competitiva, y hoy no existen los instrumentos para coordinar esa desaceleración.
La brecha creativa que frena la explosión
Un experimento de "evaluación en la sombra" (Princeton, UK AISI, Berkeley, Georgetown, Stanford y otros) dio a Claude Opus 4.8 dos preguntas de investigación inéditas de NeurIPS 2026. El agente resolvió la ingeniería pero falló en la creatividad: se encerró en sendas estrechas, ignoró retroalimentación sintética y no supo revertir enfoques infructuosos. Los autores humanos rechazaron ambos papers (puntajes 1 y 2) citando datos mal motivados, ausencia de contribución novedosa y prosa impenetrable.
Ese hueco —ingeniería sobresaliente, gusto investigador ausente— actúa como freno natural a la RSI plena. Tang Jie lo describe igual: el agente se atasca no por no saber programar, sino por no saber por qué falla. La recompensa esparsa ("throughput cayó 20 %") no atribuye el error a un paso concreto. La solución de Zhipu: convertir la intuición tácita de ingenieros senior (líneas de tiempo, micro-benchmarks, liberación de GIL, precisión numérica) en interfaces de verificación por capas que el modelo pueda invocar.
Qué significa para América Latina
Esa región no figura ni en el desarrollo de los bucles (Zhipu usa chips nacionales chinos; Anthropic mide su propio laboratorio), ni en la gobernanza (la declaración la firman laboratorios occidentales), ni en la defensa contra los gusanos (infraestructura expuesta en nubes públicas y privadas sin capacidades de detección autónoma). Tres consecuencias prácticas:
1. Dependencia de proveedores: Las optimizaciones de inferencia que Zhipu logró internamente (3× throughput, 2 semanas a producción) llegarán a LatAm como actualizaciones de proveedores de nube o APIs —con su calendario, sus precios y sus condiciones de soberanía de datos.
2. Superficie de ataque invisible: Clústeres GPU en Colombia, México, Brasil o Chile que corran modelos de pesos abiertos sin aislamiento de red, monitoreo de procesos anómalos y rotación de credenciales son blancos del gusano demostrado. La defensa requiere agentes defensores autómatas —"glóbulos blancos"— que la región casi no está construyendo. 3. Vacío regulatorio asimétrico: Mientras EE. UU. y China discuten marcos de medición y pacing, LatAm carece de agencias técnicas con capacidad para auditar qué fracción de la I+D de un proveedor SaaS la hace IA, ni para exigir transparencia en la asignación de cómputo entre desarrollo y seguridad.
El siguiente escalón: replicar el árbitro denso
Tang Jie lo resume: la expansión del bucle depende de replicar el "entorno verificable" de la ingeniería a otros dominios. Codificación, procesamiento de datos, verificación formal —donde exista un juez barato, rápido y objetivo— entrarán en RSI. Estrategia, estética, narrativa —donde no— no lo harán.
Para el ejecutivo latinoamericano, la pregunta no es cuándo llega la superinteligencia, sino: ¿cuántos de mis proveedores críticos ya corren bucles de auto-optimización en su infraestructura? ¿Tengo visibilidad contractual para exigirles los tableros de Anthropic? ¿Mi superficie GPU está preparada para gusanos que razonan en tiempo real? La ventana para dejar de ser espectador se cierra mientras el bucle acelera.