Investigación VLMs avanzados fallan en pruebas básicas de física
Tres evaluaciones independientes revelan que los VLMs más avanzados no logran rastrear propiedades físicas invariantes ni estimar magnitudes cinemáticas. El rendimiento ronda el azar.
En una guardería, un niño ve cómo vierten agua de un vaso ancho a uno estrecho y sabe que la cantidad no cambió. Un modelo de visión y lenguaje (VLM) de última generación, entrenado con miles de millones de imágenes y textos, falla esa misma prueba. No es una anécdota: es el resultado sistemático de dos benchmarks independientes publicados en 2026 que evalúan la capacidad de estos modelos para razonar sobre el mundo físico.
El experimento de la conservación
El equipo de Dezhi Luo y Yijiang Li (Universidad de Michigan, UC San Diego, Berkeley y otras siete instituciones) presentó en ICML 2026 ConservationBench: 192 vídeos que muestran transformaciones físicas —verter líquido, separar monedas, aplastar plastilina, estirar pajitas— y sus versiones non-conserving donde la cantidad sí cambia. Evaluaron 112 VLMs en 23.040 preguntas. El resultado: el rendimiento se mantiene cerca del azar. Lo que parece acierto en tareas de conservación es solo un sesgo por defecto hacia la invariancia; cuando la cantidad sí cambia, los modelos siguen respondiendo que no lo hizo ConservationBench.
Ni aumentar la resolución temporal, ni rediseñar los prompts, ni curar las muestras mueve la aguja. Los modelos no construyen representaciones invariantes a la transformación; explotan atajos lingüísticos y visuales.
De la cualitativa a la cuantitativa: QUANTIPHY
Mientras ConservationBench pregunta «¿cambió la cantidad?», QUANTIPHY (Stanford, CVPR 2026) exige números: dada una magnitud previa —tamaño, velocidad o aceleración en unidades reales—, estima las demás a partir del vídeo. Más de 3.300 instancias vídeo-texto con ground truth numérico. Los VLMs de frontera (GPT-4o, Gemini-1.5 Pro) muestran una brecha abismal entre plausibilidad verbal y corrección numérica. Se apoyan en conocimiento previo entrenado, no en la evidencia visual que tienen delante QUANTIPHY.
El agujero espacial
El tercer golpe viene de Edimburgo: SRBench aísla cuatro componentes del razonamiento espacial —relaciones, orientación/navegación, rotación mental, visualización— y prueba 13 VLMs en imágenes sintéticas y reales. La precisión media roza el azar. Fallan en rotar mentalmente un cubo, predecir el patrón de agujeros al desplegar un papel o navegar referenciándose a hitos SRBench.
¿Qué significa para una empresa en Latinoamérica?
La promesa de los VLMs como cerebros de robots, vehículos autónomos, inspección visual en líneas de ensamblaje o logística de última milla choca con un suelo firme: no entienden la física elemental. Un brazo robótico que no distingue entre «el vaso se ve más lleno» y «hay más agua» rompe piezas. Un sistema de conteo de inventario que confunde dispersión con cantidad genera stockouts fantasmas. Un camión que estima mal la velocidad de un peatón por confiar en priors de entrenamiento en lugar de en lo que ve atropella.
En la región, donde los presupuestos de IA son acotados y el talento escaso, comprar «visión inteligente» que razona a nivel de azar es un riesgo operativo caro. La regulación incipiente (Chile, Brasil, Colombia) empezará a exigir trazabilidad y robustez en sistemas críticos; un modelo que falla en conservación del volumen no pasa una auditoría de seguridad.
No se trata de esperar a GPT-5. Es arquitecturar con escepticismo: usar VLMs para lo que sí hacen bien (descripción semántica, zero-shot classification, generación de código de control) y acoplarles módulos clásicos —filtros de Kalman, SLAM, simuladores físicos diferenciales— que sí conservan magnitudes. La hibridación, no la end-to-end pura, es la apuesta pragmática hoy.
Para el ejecutivo, la pregunta no es «¿cuándo lo arreglarán?», sino «¿qué parte de mi pipeline físico estoy delegando hoy a un modelo que no distingue verter de añadir?»