Negocios HBM escasea y dispara costos de inferencia en IA
La inferencia de IA ya no está limitada por cómputo sino por memoria. HBM escasea, precios se disparan y surgen arquitecturas disagregadas que separan memoria de cómputo. Clave para decisiones de nube y soberanía en LatAm.
La era de la inferencia de IA ha llegado, y con ella un cambio fundamental: el cuello de botella ya no es la capacidad de cómputo, sino la memora. Como señala Jim McGregor de Tirias Research, "pensamos en IA como una sola carga de trabajo, y no lo es. Son miles, millones, miles de millones de cargas diferentes" Arquitectando memora y almacenamiento en la era de la IA. Esta realida d obliga a repensar la infraestructura desde sus cimientos.
La pared de memoria tiene dos caras
Para escalar sistemas de IA, la memoria de alto ancho de banda (HBM) se ha convertido en el principal estrangulamiento. Los hiperscal adores —AWS, Google, Meta, Microsoft— han disper ado los precios al redirig ir capacidad de producción de DRAM convencional hacia HBM para GPUs de centr os de datos Reframing AI Memory. Kingston reportó un aum ento del 246 % interanual en precios de wafers NAND en Q1 2026. Los fabricant es de segundo nivel como Nanya o Winbond han vist o sus aciones multiplicarse por seis en seis meses.
Pero el problema es más profundo que el precio. Hsien-Hsin S. Lee identifica dos dimensiones ortogonales del "muro de memoria": ancho de banda para inf erencia activa y capacida d para retención de contexto largo. El caché KV (key-value) —que evita recál culos repetitivos en generación de tokens— crece con la longitud de contexto. Modelos como Qwen3 (128K tokens) y DeepSeek-R1 (160K) exigen capacida des que desbordan la HBM local Reframing AI Memory.
La respuesta arquitectónica: desagregar memoria y cómputo
Nvidia adquirió Groq por 20.000 millones de dólares —triplicando su valoración previa— para integrar sus LPU (Language Processing Units) basadas en SRAM, que entregan 150 TB/s de ancho de banda. La arquitectura desagregada resultante mantiene capas de atención en GPUs Rubin mientras descarga redes feed-forward a LPUs, comunicándose vía switches Spectrum-X con óptica co-empaquetada Reframing AI Memory.
Microsoft Research va más allá con FengHuang: una plataforma de memoria compartida multinivel que introduce LPDDR6 conectada vía Tensor Addressable Bridge (TAB), accesible por todos los aceleradores (xPUs). Simulaciones muestran reducción del 93 % en capacidad de memoria local, 50 % de ahorro en cómputo GPU y comunicación inter-GPU 16x a 70x más rápida frente a NVLink FengHuang: Next-Generation Memory Orchestration for AI Inferencing. La clave: escalar memoria independientemente del cómputo.
El almacenamiento deja de ser secundario
Se difumina la frontera entre memoria y almacenamiento. Nvidia CMX (Context Memory Storage) permite cachés KV fríos en flash conectado por Ethernet (JBOF) —un nuevo nivel G3.5 entre SSD local (G3) y almacenamiento de red compartido (G4)— gestionado por BlueField DPUs Reframing AI Memory. YANSEN subraya que la IA "no usa menos memoria, la usa de forma distinta", exigiendo DDR empresarial y arquitecturas SSD que soporten patrones de acceso impredecibles y latencias deterministas La IA no usa menos memoria.
Qué significa para Latinoamérica
En la región no se fabrica HBM ni SRAM, ni se diseñan LPUs. Su infraestructura de IA vive en la nube de hiperscal adores globales. Tres implicaciones directas:
Costos de nube indexados a escasez global. Los 80.000 millones de USD (Microsoft), 65.000 millones de USD (Meta), 75.000 millones de USD (Google) y 100.000 millones de USD (Amazon) en CapEx 2025 FengHuang: Next-Generation Memory Orchestration for AI Inferencing se traducirán en precios de instancias GPU y servicios gestionados. Las empresas latinoamericanas pagan la prima de memoria sin control sobre la cadena de suministro.
Arqui tecturas disagregadas cambian la ecuación de "lift-and-shift". FengHuang demuestra que la mitad de GPUs basta con memoria compartida eficiente. Proveedores cloud que adopten estas arqui tecturas —o las construyan— ofrecerán mejor rendimiento por dólar. Evaluar proveedores por su roadmap de memoria, no solo por SKUs de GPU, será diferenciador.
Soberanía de datos y caché KV. El almacenamiento de contexto largo (CMX/JBOF) implica que historiales de conversación y razonamiento extenso residan en capas de almacenamiento de red. ¿Dónde físicamente viven esos datos? ¿Bajo qué jurisdicción legal? Para sectores regulados —banca, salud, gobierno— la ubicación del nuevo nivel G3.5/G4 es una pregunta de cumplimiento, no solo técnica.
La pregunta que el ejecutivo debe hacerse
No es "qué GPU compro" —pocos en la región compran GPUs—. Es: ¿mi proveedor cloud está arqui tectando para el muro de memoria o solo apilando más HBM sobre el mismo modelo? La respuesta determinará si su costo por token inferido baja en los próximos 18 meses o sigue subiendo al ritmo de la escasez de HBM.