Tencent lanza GameHorizon Suite: 5.000 h de juego real y 47 modelos probados

El ARC Lab de Tencent publica GameHorizon Suite: 5.000 horas de gameplay AAA anotadas, un pipeline automático de instrucciones multi-horizonte y un benchmark reproducible que separa planificación de ejecución. Probado con 47 modelos y más de un millón de inferencias.

Tencent lanza GameHorizon Suite: 5.000 h de juego real y 47 modelos probados

Foto: ELLA DON

La brecha entre un modelo que entiende una partida y otro que realmente la juega acaba de medirse con la regla más exigente hasta la fecha. El ARC Lab de Tencent acaba de liberar GameHorizon Suite, una infraestructura de evaluación que no se conforma con ver si la IA acierta el siguiente clic, sino que exige coherencia entre lo que ve, lo que planea a minutos u horas vista y lo que ejecuta milisegundo a milisegundo.

El paquete tiene tres patas. GameHorizon-Annotator automatiza la creación de una pirámide de instrucciones en tres escalas temporales: operaciones de segundos ("recoge ese objeto"), metas de minutos ("gana este combate") y estrategias de sesión completa ("explora el mapa y mejora tu equipo"). GameHorizon-Data aporta 5.000 horas de grabaciones de 21 títulos AAA —desde mundos abiertos hasta shooters competitivos y survival sandbox— capturadas por 100 jugadores expertos, con vídeo, acciones de teclado y ratón, y esas instrucciones multi-horizonte alineadas temporalmente. GameHorizon-Bench cierra el círculo con una pista offline de miles de preguntas estandarizadas (acción única, descomposición de instrucciones, consistencia entre horizontes) y una pista online que reinicia el entorno para aislar fallos paso a paso en tareas de largo aliento.

Esta evaluación masiva —47 modelos, más de un millón de invocaciones— revela una jerarquía clara de dificultad: decidir la acción inmediata es más fácil que planear la siguiente, y planear la siguiente es más fácil que descomponer una meta compleja. Incorporar las instrucciones de horizonte medio y largo mejora la planificación de acciones futuras en 7,2 puntos porcentuales frente a entrada solo visual. Los agentes dedicados (arquitecturas VLA ligeras, optimizados para control de alta frecuencia) ganan en ejecución pero pierden en razonamiento; los modelos de propósito general (VLM, UMM, agentes de uso de computadora) planean mejor pero nunca habían sido medidos sistemáticamente en acción. El benchmark unifica por fin la comparación.

Patrocinado Advertisement

Por qué esto cambia las reglas para quien construye o compra IA en LatAm

En la región no hay laboratorios del tamaño de Tencent, pero sí estudios de videojuegos, empresas de simulación industrial, startups de robótica y equipos de automatización que necesitan agentes capaces de operar en entornos visuales complejos y de larga duración. Hasta hoy, validar si un modelo sirve para "jugar" un gemelo digital de una planta minera o un almacén logístico significaba armar harnesses a medida, correr pocas partidas y cruzar los dedos. GameHorizon-Bench ofrece una pista de pruebas reproducible, independiente de entorno y harness, con miles de casos y diagnóstico de fallo por paso. Eso baja el coste de experimentación y permite comparar proveedores —o versiones propias— con una métrica común.

Tan valioso como el dataset resulta el anotador automático. Etiquetar instrucciones multi-horizonte a mano es el cuello de botella que mantuvo a datasets previos en cientos de horas o en un solo juego. La aproximación bottom-up de GameHorizon-Annotator —agregar operaciones finas en metas y estrategias— escala a 21 títulos y 5.000 horas sin batallón de anotadores. Equipos en São Paulo, Ciudad de México o Bogotá pueden replicar el pipeline sobre sus propios datos de simulación o telemetría de operaciones reales, generando currículos de entrenamiento alineados a sus horizontes de negocio.

La trampa del "éxito agregado" y el valor del fallo localizado

Los benchmarks previos (Lumine, GameVerse, VideoGameBench) reportaban tasas de éxito con 3 a 20 intentos por escena. Eso produce varianza alta y, peor aún, colapsa modos de fallo distintos en un escalar: ¿falló la percepción, la planificación o el mapeo a controles? La pista online de GameHorizon reinicia el entorno en cada subtarea verificable, aislando el error. Para un ejecutivo que firma la compra de un agente autónomo, eso significa poder exigir al proveedor no solo "gana el 80% de las partidas", sino "muéstrame en qué horizonte falla y con qué frecuencia".

Lo que aún no resuelve (y lo que la región debe vigilar)

Según el paper, las conclusiones de un solo título o minijuegos no generalizan a AAA heterogéneos. GameHorizon cubre 21 juegos; no hay garantía de que la distribución de tareas refleje la logística de un puerto en Callao o la operación de una refinería en Veracruz.

Además, la evaluación offline correlaciona con la online, pero no la sustituye: un modelo que acierte los test de opción múltiple puede seguir fallando en el despliegue real.

Para los equipos técnicos de la región, la jugada inmediata es clara: montar el benchmark offline sobre los candidatos que evalúan hoy y exigir al proveedor la matriz de fallos por horizonte. La jugada estratégica es adaptar el anotador a sus propios datos operacionales —grabaciones de operadores expertos en grúas, excavadoras, líneas de picking— y generar currículos multi-horizonte para fine-tuning o distillation de modelos más pequeños que corran en edge.

Estandarizar la medición es el primer paso para que la IA deje de ser demo y pase a ser proveedora de SLA. GameHorizon no resuelve la generalización, pero entrega la regla para dejar de medirse a uno mismo.

Fuentes

  1. GameHorizon Suite: Datos multihorizonte y evaluación en la jugabilidad
  2. GameHorizon Suite: Datos multihorizonte y evaluación en la jugabilidad
  3. GitHub - TencentARC/GameHorizon: El repositorio oficial de GameHorizon, un ...
  4. Tencent ARC Lab lanza GameHorizon Suite: 5.000 horas de juego AAA ...
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.