ConfSFT recorta tokens un 25 % sin penalizar longitud

Investigaciones de Capital One, Carnegie Mellon e ICLR muestran que supervisar solo la confianza del modelo —sin penalizar longitud ni usar respuestas correctas— reduce tokens hasta 25% y mejora el razonamiento. Clave para costos de inferencia en LatAm.

ConfSFT recorta tokens un 25 % sin penalizar longitud

Foto: Nick Fewings

Los modelos de razonamiento actuales tienen un problema costoso: piensan demasiado. Generan decenas de miles de tokens antes de responder, inflando la factura de inferencia. La respuesta tradicional ha sido entrenarlos para que sean breves —penalizando la longitud o cortando la generación—. Pero tres investigaciones independientes, publicadas en los últimos meses, apuntan a una vía distinta: enseñarles a confiar en sus propias respuestas.

El hallazgo compartido es contrintuitivo. Si un modelo aprende a predecir su nivel de certeza en puntos intermedios de su razonamiento, acorta espontáneamente sus cadenas de pensamiento sin que nadie le haya pedido eficiencia. El fenómeno aparece en arquitecturas distintas (Gemma, Qwen, Nemotron, GPT-OSS), en tareas matemáticas, científicas y de código, y se replica ya sea que el entrenamiento sea supervisado (ConfSFT) o por refuerzo sin etiquetas (RENT).

Confianza sin supervisión externa

Patrocinado Advertisement

El trabajo de la Universidad de Maryland y Capital One —publicado en arXiv en septiembre de 2026— introduce ConfSFT: un ajuste fino auto-supervisado donde el modelo predice su propia confianza a partir de sus probabilidades de token, usando solo 600 problemas de entrenamiento Learning to Stop without Learning to Stop. La función de pérdida no incluye término alguno de longitud, parada o eficiencia. En inferencia, el modelo genera con el procedimiento estándar, sin mecanismo de detención anticipada. Resultado: reducción de hasta 25 % en tokens generados manteniendo la precisión.

Paralelamente, investigadores de Carnegie Mellon presentan RENT (Reinforcement Learning via Entropy Minimization), un método de RL completamente no supervisado que usa la entropía negativa —es decir, la confianza— como recompensa intrínseca Maximizing Confidence Alone Improves Reasoning. Sin respuestas correctas ni jueces externos, el modelo refuerza las cadenas de pensamiento que le dan baja entropía cerca de la respuesta final. Mejora en GSM8K, MATH500, AMC, AIME y GPQA en familias Qwen, Mistral y Llama.

Un tercer enfoque, Co-rewarding (ICLR 2026), evita el colapso del auto-entrenamiento buscando señales complementarias: acuerdo contrastivo entre preguntas análogas y auto-destilación con un modelo maestro de actualización lenta Co-rewarding: Stable Self-supervised RL. Supera a líneas base de auto-premio en +3.31 % promedio y alcanza 94.01 % Pass@1 en GSM8K con Qwen3-8B-Base, superando al RL con etiquetas verdaderas.

Por qué importa para empresas en Latinoamérica

La inferencia es el costo operativo dominante en IA generativa. En la región, donde el cómputo en la nube se paga en dólares y la soberanía de datos empuja a despliegues on-premise o en nubes locales más caras, cada token cuenta. Los métodos tradicionales de eficiencia —RL con penalización de longitud, poda de trayectorias, detención temprana en inferencia— requieren ingeniería delicada y a menudo degradan la calidad del razonamiento.

Lo que emerge de estos trabajos es una palanca distinta: la metacognición barata. Entrenar al modelo para que sepa cuándo "sabe" lo suficiente reorganiza su razonamiento de forma natural, preservando la composición de alto nivel (no suprime tipos de razonamiento, solo los hace más concisos). Y lo hace con datos sintéticos mínimos (600 problemas en ConfSFT) o sin ningún dato etiquetado (RENT, Co-rewarding).

Para un CTO en México, Colombia o Chile que evalúa desplegar modelos de razonamiento en producción, la implicación es directa: las próximas versiones de modelos abiertos (Gemma, Qwen, Llama) incorporarán probablemente estos mecanismos. Quien entienda la curva de confianza-eficiencia podrá dimensionar infraestructura con mayor precisión y negociar SLAs de proveedores con datos reales, no con estimaciones de "tokens máximos".

Lo que queda por resolver

Los artículos son preprints o actas recientes; la reproducibilidad a escala industrial y la calibración real de la confianza (que el modelo no sea confiado y errado) siguen abiertas. Pero la convergencia de tres laboratorios independientes sugiere que la confianza no es solo una métrica de monitorización: es una señal de entrenamiento que reconfigura el comportamiento del modelo.

La lección para el ejecutivo no técnico: la eficiencia no siempre se pide; a veces emerge de enseñarle al sistema a reconocerse a sí mismo.

Fuentes

  1. Aprender a detenerse sin aprender a detenerse: El entrenamiento de confianza auto-supervisado mejora la eficiencia del razonamiento
  2. Maximizar la confianza por sí sola mejora el razonamiento
  3. Razonamiento con confianza: Verificación eficiente de los pasos de razonamiento de LLM mediante cabezas de incertidumbre
  4. Co-recompensa: RL auto-supervisado estable para elicitar razonamiento en modelos de lenguaje grandes
  5. ¿Qué es un modelo de razonamiento? - IBM
Elvyn Peguero

Escrito por

Elvyn Peguero

Consultor digital e IA

Consultor de transformación digital e inteligencia artificial con más de 15 años navegando la intersección entre tecnología, gobierno y empresa. Arquitectó el Framework Normativo TIC del Estado Dominicano y ha liderado proyectos de IA aplicada en sectores públicos y privados desde Bewos AI Consulting. Editor para República Dominicana en ITNOW durante seis años, donde desarrolló un ojo clínico para explicar tecnología compleja en lenguaje que cualquier ejecutivo puede entender.