Memoria infinita para robots: Nvidia lleva el contexto visual a 8.000 pasos

Un nuevo modelo de Nvidia logra que robots aprendan de videos humanos en una sola toma y ejecuten tareas de 5 minutos sin fallar, con un 87 % más de rendimiento que la línea base.

Memoria infinita para robots: Nvidia lleva el contexto visual a 8.000 pasos

Los robots industriales y de servicio enfrentan un cuello de botella persistente: su memoria visual es corta. La mayoría de los modelos fundacionales de robótica actuales operan con uno o unos pocos pasos de contexto visomotor, lo que limita su capacidad para ejecutar secuencias largas o adaptarse sobre la marcha. Un equipo de investigadores de Nvidia, Stanford y la Universidad de Texas en Austin acaba de publicar un trabajo que rompe esa barrera. Se llama RoboTTT (Test-Time-Training Robot Policies) y escala el contexto visomotor a 8.000 pasos de tiempo, tres órdenes de magnitud más que los modelos de vanguardia, sin incrementar la latencia de inferencia.

La clave está en integrar el entrenamiento en tiempo de prueba (Test-Time Training, TTT) dentro de las políticas de visión-lenguaje-acción (VLA) que usan los robots. RoboTTT no almacena el historial en un buffer de memoria externa, sino que lo comprime en unos "pesos rápidos" que se actualizan mediante descenso de gradiente tanto durante el entrenamiento como en la inferencia. Esto permite que el robot retenga la información relevante de una secuencia densa de observaciones y acciones —como un video de cinco minutos— y la use para decidir el siguiente movimiento, sin que el costo computacional crezca con la longitud del historial, como ocurre con los transformers tradicionales incluso usando caché KV.

Resultados concretos en el mundo real

Patrocinado Advertisement

Los números que reporta el paper son contundentes. En tareas de manipulación real, RoboTTT mejora el rendimiento general en un 87 % respecto a la línea base de un solo paso de contexto. Completa completamente una tarea de ensamblaje de diez etapas que dura más de cinco minutos, algo que ningún modelo de referencia logró. Cuando se le da una sola demostración en video de un humano realizando una tarea nueva, el robot la imita exitosamente en 6 de cada 10 intentos, mientras que los métodos de referencia fallan por completo. Frente a perturbaciones externas —como mover un objeto de lugar durante la ejecución— RoboTTT tiene éxito en el 83 % de los ensayos, frente al 53 % del mejor modelo de contexto corto.

Uno de los hallazgos más relevantes para la industria es que el rendimiento mejora de manera consistente al escalar la longitud del contexto durante el preentrenamiento: el modelo entrenado con 8.000 pasos obtiene un puntaje de finalización de tareas un 63 % más alto que el mismo modelo entrenado con 1.000 pasos. Esto sugiere que la longitud del contexto se perfila como un nuevo eje de escalamiento para los modelos fundacionales de robótica, análogo a lo que ha ocurrido con los grandes modelos de lenguaje.

El ecosistema se acelera

RoboTTT no llega en el vacío. Mientras el paper circulaba, Nvidia y Hugging Face anunciaron la integración de varias herramientas de Nvidia en LeRobot, la biblioteca de robótica open-source de Hugging Face. Isaac GR00T 1.7, un modelo VLA abierto para robots humanoides, y el framework Isaac Teleop para captura de datos ya están disponibles. Además, está previsto que llegue Cosmos 3, un modelo fundacional de mundo para IA física que permitirá generar datos sintéticos de entrenamiento. La colaboración conecta a los 3 millones de desarrolladores de robótica de Nvidia con los 16 millones de constructores de IA de Hugging Face.

En paralelo, otras iniciativas avanzan. Alibaba lanzó tres modelos de IA para robótica bajo su familia Qwen, y en junio de 2026, según eWeek, apareció un nuevo modelo de IA encarnada cada 48 horas. La velocidad de innovación es tal que el problema ya no es solo técnico: es logístico y de costos.

¿Qué significa esto para América Latina?

Para las empresas y ejecutivos de la región, estas señales son una alerta y una oportunidad. Hasta ahora, la adopción de robótica inteligente en Latinoamérica ha sido tímida, limitada a brazos industriales programados para tareas fijas. Pero un robot que puede aprender de un video humano en una sola toma y adaptarse sobre la marcha cambia las reglas del juego. Ya no se requiere un equipo de ingenieros de robótica para reprogramar una celda de trabajo; basta con mostrarle la tarea. Esto reduce drásticamente la barrera de entrada en sectores como la manufactura, la logística y el agro.

El costo de la inferencia constante sigue siendo un factor a considerar. RoboTTT mantiene la latencia fija gracias a los pesos rápidos, pero el hardware necesario —GPU como las Jetson Thor que ya están integradas en LeRobot— tiene un precio que puede ser prohibitivo para pymes latinoamericanas. Sin embargo, la tendencia hacia modelos más eficientes y abiertos (GR00T es comercialmente viable y open-source) sugiere que el costo caerá. La pregunta para los CTO y líderes de innovación en la región es si estarán en posición de aprovechar esta ventana cuando la ecuación de costos sea favorable, o si las empresas que ya están integrando estos modelos —muchas en Asia y Norteamérica— habrán consolidado su ventaja competitiva.

Un nuevo eje de escalamiento

El artículo de RoboTTT deja una tesis clara: del mismo modo que los grandes modelos de lenguaje escalaron en parámetros y tokens, la robótica está empezando a escalar en contexto temporal. Un robot que "recuerda" ocho mil pasos de interacción no solo ejecuta mejor una tarea larga: puede aprender de la experiencia pasada durante la misma sesión, corregir errores y adaptarse a cambios de entorno sin intervención humana. Para una fábrica en México o un centro de distribución en Brasil, eso podría traducirse en menos paradas, menos reprocesos y más horas productivas por robot.

La integración de plataformas como LeRobot y la apertura de modelos como GR00T y Cosmos 3 ponen estas capacidades al alcance de la comunidad global, incluyendo startups y laboratorios de investigación latinoamericanos. El desafío, como siempre, será construir la infraestructura y el talento local para no quedarse mirando desde afuera.

Fuentes

  1. RoboTTT: Escalado de contexto para políticas de robots
  2. NVIDIA y Hugging Face traen nuevos modelos y marcos de trabajo a LeRobot
  3. Cada 48 horas, llegó un nuevo modelo de IA incorporada en junio de 2026
  4. Alibaba's Qwen lanzó tres modelos de IA diseñados para conducir robots
  5. Trabajo Fin de Grado La Inteligencia Artificial en la sociedad - TTT
Valmis Di Carlo

Escrito por

Valmis Di Carlo

Especialista en infraestructura

Especialista en administración de sistemas UNIX/Linux, ciberseguridad e infraestructura tecnológica, con experiencia en consultoría TI, investigación computacional y operación de entornos críticos. Desde DICATECH, SRL, combina dominio técnico en OpenBSD, FreeBSD, Solaris y GNU/Linux con una mirada práctica sobre seguridad, continuidad y arquitectura de servicios, ayudando a organizaciones a construir plataformas más estables, seguras, auditables, escalables y resilientes.