La curva que convenció a Yuri Milner, a SoftBank y a medio Senado estadounidense de que la inteligencia artificial seguía una ley de Moore propia tiene un problema: su eje vertical es una estimación estadística, no una medición física. El gráfico de "horizontes temporales" de METR —la organización que el New York Times llamó "el árbitro informal de la IA"— muestra un crecimiento exponencial: de segundos en 2020 a casi 17 horas en mayo de 2026. Pero tres análisis independientes publicados en los últimos meses coinciden en que la métrica es mucho menos precisa de lo que su popularidad sugiere.
Qué mide realmente el horizonte temporal
METR define el horizonte temporal del 50 % como el tiempo que le tomaría a un ingeniero humano resolver una tarea que un modelo de IA completa autónomamente con probabilidad del 50 %. La idea es brillante: anclar la capacidad abstracta en una unidad comprensible —minutos u horas de trabajo humano—. El benchmark HCAST, su versión más reciente, incluye 189 tareas de ingeniería de software, ciberseguridad, machine learning y razonamiento general, con 563 líneas de base humanas que suman más de 1.500 horas de trabajo METR.
Los resultados actuales: los mejores agentes resuelven 70-80 % de las tareas que a humanos les toman menos de una hora, y menos del 20 % de las que exceden cuatro horas. Pero Thomas Kwa, coautor principal de METR, escribió en enero de 2026 que "realmente no tengo idea si el horizonte 'verdadero' de Claude es 3,5 h o 6,5 h" METR. Los intervalos de confianza del 95 % abarcan un factor de 10: de 1 hora 49 minutos a 20 horas 25 minutos para el mismo modelo.
El supuesto lineal que no se sostiene
Nguyen y Fithian, de UC Berkeley, reanalizaron los 228 tareas y 26 modelos de METR usando splines y teoría de respuesta al ítem (IRT) para relajar el supuesto central: que la dificultad para la IA crece linealmente con el logaritmo del tiempo humano arXiv. Encontraron que la función de conversión es "casi plana" entre 2 y 30 minutos: un salto de 3 a 30 minutos (10x) es estadísticamente trivial, mientras que de 30 minutos a 5 horas (otro 10x) es sustancialmente más difícil. El modelo lineal fuerza una recta donde hay una curva, inflando el progreso aparente en la zona media.
Sus estimaciones puntuales superan al modelo base de METR bajo reglas de validación cruzada, y sus gráficos de diagnóstico revelan que la relación tiempo-dificultad tiene una "muesca" clara que el método original ignora. La implicación práctica: un modelo que parece haber avanzado 10x en horizonte temporal puede haber apenas cruzado la zona plana.
La teoría de respuesta al ítem no fue hecha para esto
Un estudio de simulación de Jiang et al. (Johns Hopkins, UIUC, UCLA) probó cuatro estimadores IRT comunes sobre seis benchmarks reales de LLM bajo 18.000 condiciones arXiv. La configuración de evaluación de IA invierte el régimen psicométrico clásico: decenas de modelos (examinados) frente a miles de ítems, con distribuciones de capacidad multimodales o sesgadas, no normales. Resultado: los estimadores clásicos (MML-EM, MCMC) se vuelven computacionalmente inviables; los escalables (inferencia variacional, redes neuronales) producen inferencias poco fiables sobre rankings y parámetros de ítems cuando el conjunto de modelos es pequeño o no normal.
Esa revisión de literatura del mismo estudio identificó 19 trabajos que aplican IRT a benchmarks de IA, la mayoría usando 2PL unidimensional. Ninguno validó sistemáticamente la recuperación de parámetros bajo las condiciones reales de evaluación de IA. Como resume el paper: "la adopción ha superado a la validación".
Lo que METR admite que no sabe
Kwa enumera limitaciones que rara vez aparecen en las presentaciones a inversores:
- El horizonte temporal no es el tiempo que una IA puede trabajar independientemente, sino el trabajo humano serial que reemplaza al 50% de éxito. Cuando tienen éxito, las IAs son mucho más rápidas que humanos.
- Varía por órdenes de magnitud entre dominios: 40-100x menor para uso visual de computadoras por problemas de percepción. El horizonte real de "hacer café" de Claude 4.5 Sonnet es ~2 minutos.
- No se aplica a toda distribución de tareas: en SWE-Lancer, el valor monetario de una tarea (proxy de horas de ingeniero) no correlaciona con la tasa de éxito del modelo.
- Un horizonte del 50% de X horas no significa que podamos delegar tareas bajo X horas: tareas críticas requieren 98%+ de fiabilidad, y duplicar el horizonte no duplica la automatización.
- Los horizontes al 99% de fiabilidad no se pueden estimar sin ~300 tareas altamente diversas por cubeta temporal.
Qué significa para un ejecutivo en México, Colombia o Chile
Esa tentación es usar el gráfico de METR como hoja de ruta de inversión: "en 2030 tendremos IAs de horizonte mensual, así que preparemos la organización". Pero los datos dicen que la pendiente de largo plazo (un doble cada 6-7 meses) es lo único robusto; el horizonte exacto de cualquier modelo hoy es ruido.
Para empresas latinas que compran, no construyen, modelos fundacionales, la lección es triple:
1. No compres capacidad por horizonte temporal. Un modelo con horizonte de 4 horas no automatiza tareas de 3 horas de forma fiable. Pide tasas de éxito en tus tareas reales, no en benchmarks académicos. 2. Exige evaluaciones en tu dominio. El horizonte de ingeniería de software no predice el de análisis legal, contabilidad fiscal local o atención a clientes en español. METR mismo admite que sus tareas son de bajo contexto, bien definidas y no "sucias" —lo opuesto al trabajo real en la región.
3. Desconfía de rankings basados en IRT sin diagnósticos. Si un proveedor te vende un "ranking científico" de modelos, pregunta cuántos modelos evaluaron, cómo validaron la recuperación de parámetros y si publicaron sus gráficos de diagnóstico. La literatura dice que con menos de 100 modelos, las inferencias IRT son frágiles.
Esa curva de METR seguirá siendo citada en memorandos de estrategia y discursos de política pública. Ahora sabes que su eje vertical tiene barras de error que abarcan un factor de 10, que su supuesto lineal oculta una meseta y que la maquinaria estadística debajo no fue validada para este régimen. El árbitro informal tiene credenciales, pero su silbato suena desafinado. La pregunta para tu organización no es "cuál es el horizonte de GPT-5", sino "cómo mido si esta herramienta resuelve mis problemas mañana".