La optimización de segundo orden lleva décadas prometiendo convergencia más rápida que el gradiente descendente, pero su adopción en aprendizaje profundo real ha chocado contra tres paredes: el costo de invertir o resolver sistemas con la hessiana completa, la falta de garantías globales cuando se usan aproximaciones, y la complejidad de parámetros adaptativos que exigen subproblemas internos costosos. Dos publicaciones recientes —una en arXiv y otra en ICLR 2026— rompen esas barreras desde ángulos complementarios y dibujan una ruta concreta hacia entrenamientos más eficientes, algo que en América Latina se traduce directo en dólares de GPU.
Aceleración primal: O(1/k³) con un solo solve lineal
Nikita Doikov (Cornell) presenta en "Primal Acceleration of Newton's Method" un esquema que generaliza el método del gradiente acelerado de Nesterov incorporando la hessiana (o su aproximación) de la forma más natural:
x_{k+1} = y_k - (H_k + (1/α_k)I)^{-1} ∇f(y_k) y_{k+1} = x_{k+1} + β_k(x_{k+1} - x_k)
Con H_k = ∇²f(y_k) y una calendarización predeterminada α_k = (k+1)(k+2)/(3L₂R(k+3)), β_k = k/(k+4), el método alcanza tasa global O(L₂R³/k³) en funciones convexas con hessiana L₂-Lipschitz. Es, hasta donde se sabe, el primer método de segundo orden que logra esa tasa sin resolver subproblemas regularizados (regularización cúbica), sin búsquedas de parámetros no lineales y sin correcciones extragradientes en el dual. Solo un sistema lineal por iteración.
Esa tabla del paper lo deja crudo: Newton clásico no converge globalmente; regularización cúbica y regularización de gradiente se quedan en O(1/k²); el óptimo teórico O(1/k^{7/2}) exige subproblemas no lineales por iteración. La aceleración primal sienta en medio: O(1/k³) con trabajo por iteración idéntico a un paso de Newton amortiguado.
Además, el esquema admite implementación "hessian-free" usando solucionadores lineales inexactos (gradientes conjugados, por ejemplo) preservando la tasa rápida, y se extiende a geometrías arbitrarias vía divergencias de Bregman y a problemas compuestos.
Suavidad normalizada por gradiente: garantías globales con hessianos aproximados
El segundo trabajo, de Andrei Semenov, Martin Jaggi y el propio Doikov (ICLR 2026), ataca el flanco opuesto: ¿qué pasa cuando no tenemos la hessiana exacta? Introducen la suavidad normalizada por gradiente (GNS), una noción que mide el radio máximo de una bola alrededor del punto actual donde la hessiana aproximada sigue siendo una buena aproximación relativa del campo de gradientes.
GNS no depende de la clase de funciones (convexas, no convexas, auto-concordantes, etc.) y conecta intrínsecamente la calidad de la aproximación de hessiana con la linealización del gradiente. Eso permite algoritmos de segundo orden aproximados con garantías globales universales, recuperando tasas estado del arte para hessianas Hölder-continuas, terceras derivadas, funciones cuasi-auto-concordantes y clases suaves de primer orden —todo de forma automática y extendiéndose a funciones auto-concordantes generalizadas.
Aplicaciones directas: tasas lineales globales en regresión logística y softmax con hessianas aproximadas, y optimización no convexa usando aproximaciones de Fisher y Gauss-Newton. En la práctica, abre la puerta a usar hessianas factorizadas, diagonalizadas o de bajo rango sin perder certificados de convergencia.
Por qué esto importa en América Latina
Entrenar o afinar modelos fundacionales en la región sigue siendo una decisión económica: cada hora de H100/A100 en la nube cuesta entre 2 y 4 USD; un clúster propio amortiza en años pero exige CAPEX que pocas startups o universidades pueden absorber. La optimización de primer orden (Adam, Lion, Shampoo) domina porque es barata por iteración, pero necesita muchas iteraciones. La de segundo orden promete menos iteraciones, pero su sobrecarga por paso la ha mantenido en papeles teóricos.
Estos dos avances cambian la ecuación:
- Menos iteraciones certificadas: O(1/k³) vs O(1/k²) del gradiente acelerado significa que, para la misma precisión, se requieren radicalmente menos pasos. Si cada paso cuesta ~1 solve lineal (parable a un forward-backward en capas lineales grandes), la ganancia neta es real.
- Hessian-free viable: El método de Doikov tolera solvers lineales iterativos truncados. En GPUs, un solve de conjugate gradients con precondicionado diagonal es barato y se paraleliza bien. No hace falta formar ni almacenar la hessiana densa.
- Aproximaciones con garantías: GNS valida usar hessianas de Fisher, Gauss-Newton, K-FAC o incluso diagonalizadas sin cruzar los dedos. Eso habilita pipelines donde la curvatura se estima en bloques (por capa, por head, por expert) y se reutiliza por decenas de pasos.
- Composición natural: Ambos marcos admiten términos no suaves (L1, restricciones de caja, proyección a simplejos) vía operadores proximales o geometría de Bregman. Eso encaja con fine-tuning con regularización estructurada o alineación con preferencias (DPO, RLHF) donde la función objetivo es compuesta.
Riesgos de implementación y hoja de ruta práctica
No todo es ganancia neta. Tres puntos de fricción:
1. Constantes ocultas: La tasa O(1/k³) es asintótica; para dimensiones moderadas (d < 10⁴) el overcabeza del solve lineal puede superar la ganancia en iteraciones. La cruzada está en el régimen de parámetros de modelos grandes (d > 10⁶) donde la curvatura domina. 2. Precondicionado es todo: Un solve lineal mal precondicionado anula la ventaja. La literatura sugiere precondicionadores diagonales por capa (estilo Shampoo) o bloques de bajo rango actualizados cada m pasos. 3. Estimación de L₂: El schedule α_k requiere conocer (o sobre-estimar) la constante de Lipschitz de la hessiana. En la práctica se usa backtracking barato o estimación en línea con power iteration sobre la hessiana-vector product.
Cierre proyectivo
Esta convergencia de dos frentes —aceleración primal exacta y teoría robusta para aproximaciones— sugiere que en 24-36 meses veremos librerías de optimización de segundo orden (¿Optax? ¿PyTorch Optim?) exponiendo "Newton acelerado" como opción de primera clase junto a AdamW.
Para equipos en México, Colombia, Chile o Argentina que afinan Llama-3-70B o entrenan modelos propios desde cero, la diferencia entre 3 semanas y 10 días de cluster no es académica: es la diferencia entre caber en el presupuesto trimestral o tener que pedir extensión de crédito. La optimización de segundo orden dejó de ser "bonita en teoría" para convertirse en palanca de costos. La pregunta operativa ya no es si sirve, sino cuándo el stack de software (compiladores, autodiff, solucionadores lineales por lotes) la hace trivial de activar.