Modelos de mundo predicen movimiento físico sin datos masivos

La industria apuesta por modelos que entienden la física, pero la adopción empresarial sigue frenada por costos, datos y la brecha entre demostraciones y producción.

Modelos de mundo predicen movimiento físico sin datos masivos

Foto: Louis Reed

La carrera de la inteligencia artificial ha cambiado de carril. Los grandes modelos de lenguaje (LLM) como ChatGPT o Claude ya son commodity: resumen textos, redactan correos y programan. La apuesta actual de Google, Meta, Nvidia y startups como World Labs o Skild AI son los modelos de mundo (LWM), sistemas entrenados con datos espaciotemporales —vídeo, LiDAR, sensores— para predecir qué ocurre en la realidad física, no solo en el texto El País.

Del lenguaje a la física

Un LWM no genera palabras, sino que anticipa el siguiente "token" físico: la trayectoria de un brazo robótico, la presión para agarrar un vaso sin romperlo, la aparición de un niño detrás de una pelota que el coche autónomo aún no ve El País. Nvidia lanzó Cosmos para robots y vehículos; Meta mostró V-JEPA 2 interactuando con objetos nunca vistos. En Alemania, los centros de innovación ya llaman a esto Physical AI: robots que perciben y actúan, no solo chatbots Zukunftszentrum KI NRW.

Patrocinado Advertisement

El cuello de botella no es solo técnico

Los avances académicos confirman que el progreso real está en el post-entrenamiento: fine-tuning, aprendizaje por refuerzo y escalado en tiempo de inferencia para que los modelos razonen y no solo imiten IEEE. Pero los mismos problemas que frenaron a los LLM en 2025 reaparecen aquí:

  • Datos físicos escasos y caros: no hay equivalentes a Common Crawl para vídeo LiDAR sincronizado de fábricas latinoamericanas.
  • Costos de cómputo: entrenar modelos multimodales espaciotemporales multiplica la factura de GPU.
  • Brecha piloto-producción: la "gran pausa" de 2025 mostró que la mayoría de proyectos de IA no escalan por datos sucios, procesos rígidos y falta de alineación organizativa Paréntesis Media.

Qué significa para América Latina

La región no necesita chatbots mejores; necesita robots que operen en minas chilenas, líneas de ensamble mexicanas, centros logísticos colombianos o campos agrícolas argentinos. Physical AI encaja en la matriz productiva real. Pero tres condiciones son innegociables: 1. Infraestructura de datos propia: capturar vídeo, telemetría y LiDAR de operaciones locales para entrenar o afinar modelos base. 2. Talento híbrido: ingenieros que entiendan robótica, visión por computadora y fine-tuning de modelos abiertos (Cosmos, V-JEPA 2). 3. Regulación anticipada: normas de seguridad y responsabilidad para robots autónomos antes de que lleguen los proveedores.

Sin esa base, los LWM serán otra capa de software importado que se queda en pruebas de concepto, igual que pasó con la primera oleada generativa.

Fuentes

  1. ChatGPT y compañía – ¿o viene algo más?
  2. Entrenamiento posterior de LLM: una inmersión profunda en los grandes modelos de lenguaje de razonamiento
  3. El salto que viene en la IA generativa: los grandes modelos para ...
  4. La gran pausa de la IA, lo que 2025 enseñó sobre expectativas y ...
Henry González

Escrito por

Henry González

Experto en procesos y calidad

Ingeniero industrial con una obsesión por los estándares. Certificado en ISO 9001, ISO 27001 e ISO 42001 — la norma que define cómo las organizaciones deben gestionar la inteligencia artificial de forma responsable. Para Henry, la IA no es solo tecnología sino un sistema que debe auditarse, gobernarse y medirse.