Robótica e IA física: la apuesta multimillonaria que redefine la automatización

Una convergencia de capital soberano, venture capital y avances en modelos visión-lenguaje-acción impulsa la robótica como nueva frontera industrial. Pero cuellos de botella en datos, energía y regulación marcarán el ritmo real.

Robótica e IA física: la apuesta multimillonaria que redefine la automatización

Foto: Hyundai Motor Group

Del software al átomo: por qué la IA física es el nuevo frente de inversión global

La inteligencia artificial ha vivido su primera gran ola en el mundo de los bits: modelos de lenguaje, generación de imágenes, agentes de código. La siguiente, y posiblemente más transformadora, ocurre en el mundo de los átomos. La "IA física" —la fusión de modelos fundacionales multimodales con cuerpos robóticos capaces de percibir, razonar y actuar en entornos reales— ha dejado de ser una promesa de laboratorio para convertirse en el mayor imán de capital de la década.

Desde los Estados llega la señal más nítida. Corea del Sur ha anunciado una cartera de inversiones públicas y privadas que, sumada a lo largo de varios años, supera el billón de dólares con el objetivo declarado de situarse entre las tres potencias mundiales de IA física antes de 2030. El plan no es solo robótica: incluye una apuesta paralela de 576.000 millones de dólares en semiconductores (cuatro nuevas plantas de Samsung y SK Hynix, más un clúster de empaquetado avanzado) y 550 billones de wones iniciales en centros de datos (8,4 GW para 2028, 18,4 GW para 2035).

Patrocinado Advertisement

Pero el tercer pilar —comercializar robots humanoides en diez grandes sectores en 2028 y formar a 10.000 especialistas— es el que revela el cambio de paradigma: la automatización ya no es solo brazos articulados en jaulas, sino plataformas móviles, bípedas o sobre ruedas, que operan junto a personas.

Esa ambición no nace en el vacío. Corea ya ostenta la mayor densidad robótica industrial del mundo: 1.220 unidades por cada 10.000 trabajadores manufactureros, según la Federación Internacional de Robótica. Su ventaja comparativa no es el volumen absoluto —China instaló el 54% de los 542.000 robots nuevos de 2024—, sino la convergencia única de electrónica, automoción, memoria avanzada y chaebols capaces de coordinar inversiones de largo plazo. Goldman Sachs estima que la cadena de suministro surcoreana podría respaldar 74.000 humanoides en 2030 y 412.000 en 2035. Hyundai Motor Group, dueño de Boston Dynamics desde 2021, planea desplegar robots Atlas en su planta de Georgia desde 2028 con una capacidad de 30.000 unidades anuales, empezando por secuenciación de piezas y tareas de riesgo.

Anatomía de la apuesta: flujos de capital, rondas megadeal y valoraciones en 2024-2025

El dinero privado sigue la misma brújula. Andreessen Horowitz (a16z) sitúa a la robótica y la IA física como segunda categoría de inversión en startups por valor agregado, solo por detrás de IA generativa, habiendo eclipsado a fintech y biotech. El primer trimestre de 2026 marcó un récord: ≈16.000 millones de dólares en cerca de 500 operaciones, el doble en número y 4,5 veces en valor respecto al período 2021-2025. La tesis de a16z es clara: "la robótica va a ser la mayor industria en la historia" porque la IA desbloquea software que impulsa hardware, ampliando la demanda hacia "tareas" del mundo real que el software solo no puede abordar.

Ese flujo masivo está forzando salidas a bolsa prematuras. Agility Robotics (robot Digit) ha optado por una SPAC con Churchill Capital para cotizar rápido; SEER Robotics ya debutó en Hong Kong, y Unitree o Agibot anuncian planes similares. La historia reciente de SPACs en biotecnología y cuántica advierte: las expectativas se inflan y el escrutinio público las corrige con dureza. Pero la ventana de liquidez está abierta y los founders la usan para financiar la escala.

En paralelo, los strategics mueven ficha. Morgan Stanley ha revisado al alza su pronóstico para China: 50.000 humanoides enviados en 2026 (frente a 28.000 previos) y un mercado de 15.000 millones de dólares y 446.000 unidades anuales en 2030. Tesla habría elevado el objetivo de Optimus de 50.000 a 70.000 unidades con capacidad a largo plazo de 1,5 millones; BYD planea 20.000 robots para uso interno a finales de 2026. Figure AI ya tiene robots Figure 02 ensamblando 30.000 coches en BMW y despliega Figure 03 con Helix 02 para logística de contenedores no ordenados. Apptronik presenta Apollo 2 con actuadores propios de >90% eficiencia energética, baterías intercambiables para operación 7×22 y pila de percepción-control-flota.

Arquitecturas emergentes: modelos de base (VLA), simulación a escala y gemelos digitales

Los modelos Visión-Lenguaje-Acción (VLA) son el motor técnico de esta oleada: arquitecturas que unifican percepción visual, comprensión lingüística y generación de comandos de control en un solo flujo end-to-end. Dos grandes encuestas académicas —una en IEEE Access (2025) y otra en arXiv (2025)— y un estudio empírico en Nature Machine Intelligence (2026) convergen en la taxonomía y los cuellos de botella.

Dos paradigmas principales distingue la literatura:

  • Modelos monolíticos: integran percepción, lenguaje y acción en una sola red (single-system) o usan un backbone VLM + un action expert que intercambian representaciones latentes (dual-system). Ejemplos: RT-2, π₀, OpenVLA, GR-1/2.
  • Modelos jerárquicos: separan planificación (que emite representaciones interpretables: sub-tareas, keypoints, programas, mapas de asequibilidad) de ejecución (política que traduce a torque/velocidad). Permiten entrenamiento desacoplado y mayor explicabilidad.

Con 8 *backbones* VLM, 4 arquitecturas de política y >600 experimentos, el estudio de Li et al. (Nature, 2026) identifica tres decisiones críticas de diseño: qué *backbone* elegir, cómo formular la arquitectura VLA y cuándo inyectar datos *cross-embodiment. Su hallazgo central: los modelos VLA superan consistentemente a pipelines desacoplados (VLM + política separada) cuando el backbone es lo bastante grande y se entrena con datos multi-cuerpo desde el inicio. El marco abierto RoboVLMs* permite reproducir y extender esa receta.

El entrenamiento real se complementa con la simulación a escala y los gemelos digitales. General Intuition ha captado 320 millones de dólares a 2.300 millones de valoración entrenando agentes con cientos de millones de horas de *gameplay (clips de Medal) para transferir de juego → simulación → robot físico. Robbyant publica LingBot-Map, un modelo fundacional feed-forward de reconstrucción 3D en streaming a 20 FPS estable sobre secuencias de 10.000+ frames. Humanoid demuestra con KinetIQ Ascend mejoras de +42% en alimentación de máquina, +85% throughput y salto del 80% al 98% de éxito en handover* usando aprendizaje por refuerzo directamente sobre hardware real.

Cuellos de botella críticos: hardware, datos propietarios, cadena de suministro y talento

Contra restricciones físicas brutales choca la euforia capitalista. La encuesta IEEE Access enumera tres frenos fundamentales:

1. Escasez y desalineamiento de datos. Los datasets visión-lenguaje web (COCO, LAION) carecen de grounding motor; los datasets robóticos (Open X-Embodiment, BridgeData v2, CALVIN, BDRBench20) son caros de recoger (teleoperación) y estrechos en variabilidad lingüística. Añadir tacto, audio o 3D agrava el problema. 2. Transferencia de *embodiment. Cada morfología (brazos, bípedos, ruedas, manos de 4/5 dedos, sensores propioceptivos distintos) define su propio espacio de acción y observación. Aprender políticas que generalicen entre cuerpos sigue sin resolverse; los datos humanos son abundantes pero cinemáticamente incompatibles. 3. Restricciones computacionales y energéticas*. Los VLA grandes exigen GPUs de inferencia en el robot o latencia de nube baja; ambos casos demandan energía y disipación térmica que los factores de forma móviles dificultan.

A nivel macro, Corea del Sur ilustra el nudo energético: las cuatro plantas de semiconductores previstas necesitarán 6,3 GW de electricidad y 650.000 toneladas métricas de agua; los centros de datos exigirán aún más. El Ministerio de Clima y Energía promete suministro, pero la ejecución depende de suelo, red y permisos, no solo de capital.

Otro estrangulamiento es el talento. Corea forma 10.000 especialistas en cinco años; en Occidente, la competencia por robotics ML engineers eleva salarios y vacía departamentos universitarios. La cadena de suministro de actuadores de alto par, manos dextreras, sensores hápticos y baterías de alta densidad sigue concentrada en pocos proveedores (mayoritariamente chinos y japoneses), creando riesgo geopolítico.

Casos de uso con tracción real: logística, manufactura flexible, salud y entornos no estructurados

No es uniforme la adopción. Los primeros despliegues masivos ocurren donde la tarea es repetitiva, el entorno semi-estructurado y el ROI claro:

  • Logística y secuenciación: Figure 03 en BMW (recogida de totes desordenados, carga de carros), Agility Digit con GXO y Mercado Libre, Apptronik Apollo en pilotos de almacén.
  • Automoción flexible: Hyundai/Atlas en Georgia (secuenciación de piezas, tareas ergonómicamente duras); Tesla Optimus en celdas de batería y general assembly; BYD en líneas finales.
  • Manipulación dextrera en industria: ABB + PSYONIC usan datos de prótesis (Ability Hand) en cobots GoFa para transferir tacto, fuerza y movimiento a tareas delicadas; Humanoid KinetIQ Ascend logra +85% *throughput* y 99% éxito en manipulación bimanual de *totes*.
  • Salud y asistencia: Aún en fase piloto; la regulación human-in-the-loop y la certificación médica frenan la escala. Los datos de prótesis (PSYONIC) son un proxy valioso para destreza fina.
  • Entornos no estructurados (construcción, agricultura, *last-mile*): General Intuition apuesta por agentes entrenados en simulación masiva para generalizar a exteriores; DEEPX + Sixfab lanzan AI HAT+ para Raspberry Pi 5, llevando inferencia local a robots pequeños y prototipos.

Donde hay datos propietarios de alta calidad (flotas propias, teleoperación masiva, simulación validada), la automatización avanza; donde no, se estanca: esa es la regla empírica.

Marco regulatorio y seguridad: responsabilidad, certificación y el debate 'human-in-the-loop'

Para no quedarse fuera de la partida, la Unión Europea intenta simplificación normativa. La Directiva Omnibus I (2026/470) reduce en 90% las empresas sujetas a reporte CSRD (≈5.000 en Europa) y limita la presión regulatoria en cascada a pymes. La EU Inc. (Régimen 28) busca constituir una sociedad paneuropea en <48 h, <100 €, operando bajo un solo corpus legal en los 27 Estados —objetivo: retener startups tecnológicas que huyen a Delaware. La Ley de Datos (Data Act) exime a micro y pequeñas empresas de interfaces de acceso, pero impone access-by-design desde septiembre 2026 para productos conectados.

El Pasaporte Digital de Producto (DPP) —baterías 2026-27, textil/electrónica 2027, resto hasta 2030— unifica trazabilidad ESG pero exige datos limpios y sensores en toda la cadena, coste que las pymes difícilmente absorben.

En robótica, la certificación de seguridad funcional (ISO 10218, ISO/TS 15066, futura ISO 22166 para robots móviles) sigue exigiendo paradas de emergencia cableadas, zonas de seguridad por hardware y *human-in-the-loop* para tareas críticas. Apptronik ya integra zonas de seguridad por hardware en Apollo 2. Los sindicatos —el de Hyundai en Corea votó huelga ante el despliegue de humanoides sin acuerdo previo— exigen negociación colectiva previa, reciclaje y garantías de no sustitución neta. La tensión laboral es tan real como la técnica.

Escenarios a 5 años: consolidación de plataformas, commoditización del hardware y nuevos modelos de negocio

Hacia 2030 emergen tres trayectorias plausibles:

1. Consolidación de plataformas VLA *full-stack. Pocos ganadores (NVIDIA GR00T, Google DeepMind RT-X, Figure Helix, Tesla FSD-adaptado, RoboVLMs open-source) proveerán backbones preentrenados; los integradores añadirán fine-tuning propietario y fleet management. El valor migrará del hardware al software-defined robot. 2. Commoditización del hardware base. Actuadores, manos, sensores LiDAR/ToF, compute modules (Jetson Orin, Thor, chips DEEPX) seguirán curvas de coste tipo solar/baterías. Unitree, Fourier, EngineAI, Apptronik, Agility competirán en bill of materials y fiabilidad (MTBF >10.000 h). 3. Modelos de negocio Robotics-as-a-Service (RaaS)*. Pago por turno/hora/tarea completada, con SLA de uptime y actualizaciones over-the-air. Elimina CapEx del cliente, alinea incentivos de fiabilidad y genera datos de uso para reentrenamiento continuo —el flywheel de datos que hoy falta.

La energía será el factor de coherencia. Quien resuelva compute-per-watt en el borde (chips neuromórficos, inferencia 4-bit, actuadores de alta eficiencia) y asegure suministro verde para mega-fabs y data centers marcará el tempo. Corea lo tiene claro: su apuesta de billón de dólares es, en el fondo, una apuesta energética e industrial integrada. Occidente, fragmentado entre Inflation Reduction Act, Chips Act y regulación UE, aún no ha articulado su respuesta sistémica.

No es una burbuja la IA física: es la industrialización de la inteligencia. Los próximos cinco años dirimirán si la promesa de "generalización cross-embodiment" se cumple o si nos quedamos en islas de automatización brillantes pero frágiles. El capital ya ha votado; la física y la regulación votarán después.

Fuentes

  1. Corea del Sur se suma a la carrera de la robótica con una inversión ...
  2. La salida a bolsa de las startups de robótica
  3. La nueva revolución de la robótica ya está aquí: de los brazos ...
  4. Ana Fernández-Tresguerres (notaria): "La capacidad normativa de la UE ha llevado a una excesiva regulación que disminuye la competitividad"
  5. Modelos de visión-lenguaje-acción para robótica: Una revisión hacia aplicaciones del mundo real
  6. Grandes modelos de visión-lenguaje-acción basados en VLM para manipulación robótica: Una revisión
  7. Qué importa al construir modelos de visión-lenguaje-acción para robots generalistas
  8. Cinco tendencias en robótica para 2024 según IFR - Asociación ...
Shalem Pérez

Escrito por

Shalem Pérez

Desarrollador fullstack

Developer que habla humano. Conoce el código por dentro pero prefiere explicar lo que hace la tecnología a lo que dice el código. Especialista en herramientas de IA, flujos de automatización y tendencias que están redefiniendo cómo trabajamos y construimos. Si existe una nueva herramienta de IA, Shalem ya la probó — y tiene una opinión sobre ella.