De la IA generativa a la IA encarnada: por qué el cuerpo es el siguiente cuello de botella
La convergencia de modelos de visión-lenguaje a gran escala, aprendizaje de políticas condicionadas a la acción y modelado generativo del mundo ha catalizado un cambio de paradigma en la inteligencia artificial encarnada. Los modelos VLA (Vision-Language-Action) representan una nueva clase de modelos fundacionales que mapean directamente observaciones visuales e instrucciones en lenguaje natural a acciones de robot, permitiendo manipulación, navegación e interacción de propósito general en diversos embodiments. Paralelamente, los modelos de mundo —redes neuronales entrenadas para predecir estados futuros del entorno dadas observaciones y acciones actuales— han emergido como herramientas poderosas para planificación, aprendizaje por refuerzo aumentado con imaginación y simulación realista de entornos.
Pero la encuesta exhaustiva de Megrez Plus sobre VLA y modelos de mundo, publicada en julio de 2026, revela que la arquitectura del cerebro no basta: hace falta resolver la representación de la acción (tokenización, diffusion policies, flow matching), el chunking temporal para consistencia en horizontes largos y la fusión multimodal (early, late, cross-attention, embodiment-aware). Los modelos más avanzados —RT-2, π0/π0.5 de Physical Intelligence, GR-2, Octo, OpenVLA— logran generalización cross-task y cross-embodiment en benchmarks, pero el paso del benchmark al robot físico expone una brecha distinta.
La brecha de encarnación: cuando el modelo no basta para el cuerpo
El trabajo del National Institute of Advanced Industrial Science and Technology (AIST), publicado en agosto de 2026, formaliza esta tensión bajo el concepto de embodiment gap: la distancia entre modelos, representaciones o datos reutilizables entre robots y su ejecución en el cuerpo y sistema de control de un robot objetivo. Un modelo puede generalizar en simulación o en un cuerpo de referencia, pero convertir esa generalización en movimiento físico fiable requiere trabajo adicional en el robot destino: conexión de skills o APIs, calibración y alineación de interfaces de control, ejecución de contacto y fuerza, seguridad y recuperación ante fallos.
Esta brecha no es nueva en robótica industrial —los integradores de sistemas la resuelven con conocimiento tácito—, pero reaparece con fuerza al desplegar modelos fundacionales en nuevos cuerpos. El paper de AIST propone un mapa de dos ejes: el horizontal ordena la estructura compartida por su distancia a la ejecución (semántica y tareas → percepción y affordances → interacción con objetos → acciones y skills → sharing morfology-aware); el vertical muestra en qué etapa queda el trabajo principal (plan-a-skill → control-interface alignment → contact-rich execution → safety/recovery). Los métodos que comparten semántica dejan trabajo en todas las etapas; los que comparten acciones o skills dejan trabajo en alineación de interfaz y ejecución de contacto; los que proveen información morfológica al modelo (morphology-aware) reducen la brecha más cerca de la ejecución.
Acciones universales: una vía para cerrar la brecha de heterogeneidad
UniAct, paper presentado en CVPR 2025, ataca el problema desde el espacio de acción. Los datasets encarnados crowdsourced exhiben heterogeneidad significativa en espacios de acción debido a embodiments y interfaces de control distintos, dificultando el entrenamiento de modelos fundacionales cross-domain. UniAct aprende acciones universales que capturan comportamientos atómicos genéricos aprovechando características estructurales compartidas entre robots, y se traducen eficientemente a comandos accionables heterogéneos añadiendo detalles embodiment-specific. Su instancia de 0,5B parámetros supera a modelos SOTA 14x mayores en evaluaciones cross-embodiment extensivas, demostrando que factorizar la acción en una capa universal + adaptador específico es más eficiente que escalar ciegamente parámetros y datos heterogéneos.
Actores clave y arquitecturas: la carrera por el cuerpo y el cerebro
En el frente comercial, Tesla Optimus apuesta por integración vertical full-stack (hardware, actuadores propios, compute FSD, datos de flota). Figure combina hardware propio con modelos fundacionales de OpenAI y Microsoft. 1X (Halodi) se centra en seguridad y compliance para entorno doméstico. Unitree —la china que debutó en la bolsa de Shanghái el 19 de agosto de 2026 con una subida del 629 % intradía, cerrando en +460 % y una capitalización de ~43.700 millones de euros— domina la fabricación masiva: vendió más de 5.500 humanoides en 2025, facturó 1.700 millones de yuanes (218 M €) y ganó 278 M yuanes (35,7 M €), algo raro en el sector.
Su modelo H2 Plus integra computación Jetson T5000 (2.070 TFLOPS FP4), manos de 5 dedos con tacto Dual SharpaWave (22 DoF activos en manos, 75 totales), torque máximo 120 Nm en brazos y 360 Nm en piernas, y 3 horas de autonomía. Su perro robot As2 alcanza 5 m/s, 13 km de autonomía y operación IP54 en exteriores.
AgiBot es el otro gran vendedor chino (5.000+ unidades en 2025). UBTech recibió 18 M $ del gobierno de Guangxi para un centro de entrenamiento en Liuzhou donde >100 humanoides generan datos vía teleoperación con visores y mandos hápticos; instructores novatos necesitan ~300 intentos para una tarea útil, expertos ~50. El centro depende de subvenciones y carece de vía clara a rentabilidad.
En open source, Octo, OpenVLA, Open X-Embodiment (RT-X) y HPT (Heterogeneous Pre-training Transformers) democratizan el acceso a políticas generalistas y datasets multi-embodiment, pero heredan la brecha de encarnación al desplegar en hardware propio.
Cadena de valor y cuellos de botella: actuadores, tacto, compute en el edge, datos
Esa euforia bursátil (Unitree valorada en 57.200 M € en pico intradía) compra expectativa de fabricación masiva que reduzca costes, pero los cuellos de botella físicos persisten:
- Actuadores: densidad de par, backdrivability, coste unitario. Los actuadores de Unitree (torque 120/360 Nm) son competitivos pero la cadena de suministro china (Lingyi iTech "superfábrica" en Beijing E-Town con objetivo 10k unidad/año fase 1, 500k/año 2030) aún madura.
- Sensores táctiles: la manipulación fina requiere tacto de alta resolución (Dual SharpaWave de Unitree, pieles táctiles taxel-dense). La integración multimodal (visión estéreo cabeza, cámaras muñeca, IMU, micrófonos array) sigue siendo ingeniería a medida por robot.
- Compute en el edge: Jetson T5000 (2.070 TFLOPS FP4) o equivalentes (Thor, Orin) permiten inferencia VLA onboard, pero la latencia end-to-end (percepción → world model → policy → control) debe caber en ciclos de control de 1-10 kHz para contacto estable.
- Datos de entrenamiento: el "problema de los últimos 10 cm, último cm, último mm" (Jia Baoxiong, Beijing GAIR). Los datos de teleoperación son caros y lentos; la recolección autónoma y la generación sintética via world models (NVIDIA Cosmos, Genie 2, UniSim, Sora as world model, GameNGen, Oasis) prometen escalar, pero el sim-to-real gap en dinámica de contacto y fricción sigue abierto.
Casos de uso reales hoy: logística, manufactura, retail, asistencia doméstica temprana
Esa realidad operativa dista de las demos de kung-fu y volteretas. Según Reuters/Forbes, los ~20.000 humanoides vendidos globalmente en 2025 (95 % fabricantes chinos) van mayoritariamente a universidades, centros de I+D, demos y pilotos. En fábrica, los brazos robóticos especializados siguen siendo más baratos, fiables y extendidos. Los nichos donde la forma humanoide aporta valor son entornos diseñados para humanos (escaleras, puertas, herramientas estándar):
- Logística/almacén: mobile manipulation (base móvil + brazos) para picking, packing, palletizing no estructurado.
- Manufactura: líneas de montaje flexibles, cambio de herramientas, tareas de acabado que requieren destreza bimanual.
- Retail/hospitalidad: reposición estanterías, atención guiada, limpieza.
- Inspección/mantenimiento: State Grid planea invertir 1.000M $ en humanoides, robots de doble brazo y cuadrúpedos para mantenimiento de red e inspección de subestaciones (ahorro estimado 74-119k $/año/unidad en costes laborales y reducción de riesgo).
- Asistencia doméstica: el "momento ChatGPT" predicho por Wang Xingxing (Unitree) y Wang He (Galbot) para 2028 —robot en hogar desconocido completando 70-80% tareas con comandos de voz— sigue a 2-10 años; Unitree reconoce que "los humanoides aún no son lo suficientemente capaces para despliegue masivo".
Dual-use y defensa: exoesqueletos, centinelas autónomos y "human-on-the-loop"
Esa rivalidad tecnológica EE. UU.-China ha llegado a la robótica humanoide. En julio de 2026, EE. UU. prohibió la importación de nuevos modelos chinos de humanoides y cuadrúpedos alegando seguridad nacional (interrupción de cadena de suministro IA y ciberataques). La medida afecta a futuros modelos de Unitree (>40 % ingresos exterior, ~13 % EE. UU. en 2025).
Investigadores militares chinos exploran usos en sistemas de armamento futuros. La doctrina "human-on-the-loop" (supervisión humana en decisiones letales) choca con la latencia de decisión en entornos dinámicos. Exoesqueletos para aumento de carga y resistencia (ya probados en logística militar) son el dual-use más maduro; centinelas autónomos y enjambres humanoide-cuadrúpedo plantean cuestiones de responsabilidad, atribución y escalada que la regulación militar (DoD Directive 3000.09, NATO AI Strategy) empieza a abordar sin consenso global.
Regulación, responsabilidad y seguridad funcional: ISO 13482, AI Act, normas militares
Ese marco regulatorio es fragmentado:
- ISO 13482:2014 (robots de servicio personal) y ISO 10218 / TS 15066 (robots industriales/colaborativos) exigen validación de seguridad funcional (PL d, SIL 2) para contacto humano-robot. Los humanoides de propósito general borran la frontera entre categorías.
- AI Act europeo (en vigor progresivo 2025-2027) clasifica sistemas de IA en robots como "alto riesgo" si operan en espacios públicos o afectan seguridad física; exige evaluación de conformidad, gestión de riesgos, datos de entrenamiento transparentes, supervisión humana.
- Normas militares (STANAG 4586, DoD 3000.09) requieren cadenas de mando claras, auditoría de decisiones autónomas, "kill switches" físicos.
- Responsabilidad civil: ¿quién responde cuando un humanoide falla en contacto rico —fabricante, integrador, operador, proveedor del modelo VLA? La opacidad de modelos fundacionales (black box) complica la atribución de causalidad.
China avanza su propio marco (MIIT, SASAC) con estándares nacionales para "embodied intelligence" y certificaciones de seguridad para despliegue masivo en red eléctrica (State Grid) y clúster Shenzhen (objetivo 15.000 M $, 1.200+ empresas para 2027).
Hoja de ruta 2025-2030: coste por unidad, fiabilidad (MTBF) y umbral de viabilidad comercial
Esa convergencia de tres curvas definirá el punto de inflexión:
1. Coste unitario (BOM + fabricación): BofA proyecta 1,2 M unidades/año global 2030. China apuesta por economías de escala (superfábricas, cadena suministro vertical) para bajar de 50-100 k $/unidad actual a <20 k $, compitiendo con coste laboral en manufactura avanzada. 2. Fiabilidad (MTBF / MTTR): hoy, tareas industriales requieren MTBF > 2.000 h y MTTR < 30 min. Demos logran éxito tras decenas/centenas de intentos; fábrica exige éxito en primer intento > 99,9 % en turno continuo. La brecha de encarnación (calibración, alineación control, recuperación contacto) es el principal freno.
3. Inteligencia generalista (VLA + world models): el "momento ChatGPT" requiere políticas que generalicen a tareas, entornos y embodiments no vistos con fine-tuning mínimo (few-shot/zero-shot). UniAct (0,5B params, 14x SOTA) y π0.5 sugieren que arquitectura de acción universal + world model pre-training es camino más prometedor que escalar ciegamente.
Umbral de viabilidad comercial: cuando coste total de propiedad (TCO) del humanoide < coste laboral equivalente ajustado por riesgo y flexibilidad, en tareas donde la forma humanoide es habilitadora (no sustituible por brazo fijo + AGV). Ese cruce, según analistas, llega 2027-2029 en nichos estructurados de alto riesgo/valor (inspección nuclear, logística defensa, manufactura flexible low-volume/high-mix); 2030+ en doméstico masivo.
Esa consolidación del sector —"Juegos del Hambre" per Lizzi Lee (Asia Society)— ya empezó. Unitree y UBTech perfilan como supervivientes; decenas de startups chinas dependen de subvenciones locales que se secarán si no hay revenue real. La burbuja bursátil (Unitree +629 % debut) refleja apuesta macro por la próxima frontera post-LLM, no fundamentos micro actuales. La tecnología subyacente (VLA, world models, universal actions) avanza rápido; el cuerpo —actuadores, tacto, edge compute, ingeniería de integración— es el cuello de botella real. Quien cierre la brecha de encarnación con ingeniería invisible, no solo demos vistosas, capturará el valor.