Los modelos de lenguaje grande resolvieron su problema de datos ingiriendo internet entero. La robótica humanoide no tiene esa suerte. Mientras la IA generativa avanzaba a golpe de terabytes de texto, los robots necesitan entender física, gravedad, causa-efecto y contacto —cosas que no se aprenden leyendo, sino tocando y viendo—, y los datos para enseñárselo brillan por su ausencia.
"Un niño de cuatro años tiene unas cinco veces más comprensión que un LLM", resume Sce Pike, vicepresidenta de IA en Telus Digital, citando la conocida analogía de Yann LeCun. "El niño aprende por entrada visual y sensorial. Eso no se consigue solo leyendo texto" fuente.
La brecha de escala es abismal
La industria robótica recopiló unas 100.000 horas de entrenamiento en 2024 y cerca de un millón en 2025. Para 2026 se esperan 20 millones, pero eso seguiría representando menos del 0,04 % de lo que los investigadores calculan necesario fuente. El cuello de botella ya no es el cómputo, sino "la escala y diversidad de datos de habilidad del mundo real", según Siddharth Srivastava, cabeza del laboratorio de robótica de Instawork en APAC.
Tres factores encarecen y ralentizan la captura:
- Volumen y coste de video: el almacenamiento y procesamiento de footage multimodal a escala industrial es prohibitivo.
- Heterogeneidad de sensores: cámaras, lidar, infrarrojos y tacto generan flujos que no se alinean bien; "está causando mucho ruido", dice Pike.
- Riesgo físico: un mal dato en un chatbot da una respuesta errónea; en un robot de 80 kilos en un centro comercial, una caída descontrolada es un problema de seguridad y responsabilidad legal.
Tres rutas para generar la capa faltante
Mientras los grandes laboratorios (Nvidia, Meta, Google DeepMind) persiguen world models que simulen física, el mercado está creando infraestructura de captura real por tres vías complementarias:
1. Trabajadores humanos con wearables Instawork lanzó Instacore en India: un arnés con cinco cámaras y sensores en cabeza, pecho y muñecas que graba a operarios haciendo su trabajo normal en cocinas, almacenes, hoteles y fábricas. La meta: pasar de 6.000 a 60.000 recolectores en uno o dos años, aprovechando su bolsa de 10 millones de trabajadores fuente. El modelo paga a empresas y empleados por hora de dato capturado, sin coste de hardware inicial.
2. Teleoperación masiva con robots reales El dataset Humanoid Everyday (USC + Toyota Research) reúne 10.300 trayectorias, 3 millones de frames y 260 tareas en 7 categorías —incluyendo locomoción bípeda, manipulación bimanual e interacción humano-robot— usando robots Unitree G1/H1 teleoperados vía Apple Vision Pro. Su pipeline multiproceso reduce a la mitad el tiempo de captura frente al sistema oficial y sincroniza RGB, profundidad, LiDAR, tacto, IMU y lenguaje natural a 30 Hz fuente. Es el único dataset público que marca todas las casillas: sensor LiDAR, manos diestras, locomoción bípeda, interacción humano-robot y evaluación en la nube.
3. Aprendizaje desde video humano monocular HDMI (Carnegie Mellon) evita la teleoperación costosa: extrae trayectorias 3D de humano y objeto desde video RGB simple, re-targetea a robot y entrena política de refuerzo que co-rastrea robot y objeto. En un Unitree G1 real logró 67 cruces de puerta consecutivos y 6 tareas de loco-manipulación; 14 en simulación fuente. La promesa: escalar datos de interacción usando el archivo de video humano ya existente.
La oportunidad latinoamericana
El modelo Instawork —marketplace laboral + wearables de captura— es directamente trasplantable a la región. México, Colombia, Brasil y Argentina tienen:
- Fuerza de trabajo masiva y de bajo coste en manufactura, logística, retail y servicios donde las tareas de manipulación son idénticas a las que necesitan los robots.
- Infraestructura de gig economy madura (Rappi, Uber, Cornershop) que ya gestiona onboarding, pagos y trazabilidad de trabajadores.
- Zonas francas y parques industriales donde la captura de datos no choca con regulaciones estrictas de privacidad (la ley chilena o la LGPD brasileña exigen anonimización, pero Instawork ya difumina rostros y añade metadatos de consentimiento).
- Talento de ingeniería para construir el pipeline de procesamiento: anonimización, sincronización multimodal, control de calidad, etiquetado semántico.
Goldman Sachs proyecta 38.000 millones USD en el mercado de humanoides para 2035; Grand View Research estima 17.000 millones en recolección y etiquetado de datos para 2030 fuente. América Latina no va a fabricar los robots, pero puede ser el proveedor global de la capa de datos humanos que esos robots necesitan para dejar de caer.
Qué debería hacer un ejecutivo de la región hoy
1. Mapear procesos físicos repetitivos en su operación que generen datos de manipulación valiosos (picking, packing, ensamblaje, limpieza, carga/descarga). 2. Pilotear captura con wearables en una línea o turno; el hardware ya es commodity (cámaras RGB-D, IMU, marcadores de muñeca). 3. Estandarizar formatos y metadatos desde el día uno: sincronía temporal, calibración de sensores, consentimiento documentado. Evitar el "ruido" de sensores heterogéneos que denuncia Pike. 4. Explorar alianzas con startups de datos (estilo Shaip, que ya vende catálogos de demostración humana, video egocéntrico, movimiento y destreza fuente) o con laboratorios universitarios que necesiten datos locales. 5. Presupuestar el dato como activo, no como gasto: cada hora de video multimodal bien etiquetado tiene valor de reventa a múltiples desarrolladores de robots.
La carrera de la IA física no la ganará quien tenga el mejor hardware, sino quien alimente a los modelos con la experiencia física más diversa, limpia y barata. Esa materia prima está en los pisos de fábrica y almacenes de América Latina. La pregunta es quién la empaca primero.