HBM escasea y dispara costos de inferencia en IA

La inferencia de IA ya no está limitada por cómputo sino por memoria. HBM escasea, precios se disparan y surgen arquitecturas disagregadas que separan memoria de cómputo. Clave para decisiones de nube y soberanía en LatAm.

HBM escasea y dispara costos de inferencia en IA

Foto: Winston Chen

La era de la inferencia de IA ha llegado, y con ella un cambio fundamental: el cuello de botella ya no es la capacidad de cómputo, sino la memora. Como señala Jim McGregor de Tirias Research, "pensamos en IA como una sola carga de trabajo, y no lo es. Son miles, millones, miles de millones de cargas diferentes" Arquitectando memora y almacenamiento en la era de la IA. Esta realida d obliga a repensar la infraestructura desde sus cimientos.

La pared de memoria tiene dos caras

Para escalar sistemas de IA, la memoria de alto ancho de banda (HBM) se ha convertido en el principal estrangulamiento. Los hiperscal adores —AWS, Google, Meta, Microsoft— han disper ado los precios al redirig ir capacidad de producción de DRAM convencional hacia HBM para GPUs de centr os de datos Reframing AI Memory. Kingston reportó un aum ento del 246 % interanual en precios de wafers NAND en Q1 2026. Los fabricant es de segundo nivel como Nanya o Winbond han vist o sus aciones multiplicarse por seis en seis meses.

Patrocinado Advertisement

Pero el problema es más profundo que el precio. Hsien-Hsin S. Lee identifica dos dimensiones ortogonales del "muro de memoria": ancho de banda para inf erencia activa y capacida d para retención de contexto largo. El caché KV (key-value) —que evita recál culos repetitivos en generación de tokens— crece con la longitud de contexto. Modelos como Qwen3 (128K tokens) y DeepSeek-R1 (160K) exigen capacida des que desbordan la HBM local Reframing AI Memory.

La respuesta arquitectónica: desagregar memoria y cómputo

Nvidia adquirió Groq por 20.000 millones de dólares —triplicando su valoración previa— para integrar sus LPU (Language Processing Units) basadas en SRAM, que entregan 150 TB/s de ancho de banda. La arquitectura desagregada resultante mantiene capas de atención en GPUs Rubin mientras descarga redes feed-forward a LPUs, comunicándose vía switches Spectrum-X con óptica co-empaquetada Reframing AI Memory.

Microsoft Research va más allá con FengHuang: una plataforma de memoria compartida multinivel que introduce LPDDR6 conectada vía Tensor Addressable Bridge (TAB), accesible por todos los aceleradores (xPUs). Simulaciones muestran reducción del 93 % en capacidad de memoria local, 50 % de ahorro en cómputo GPU y comunicación inter-GPU 16x a 70x más rápida frente a NVLink FengHuang: Next-Generation Memory Orchestration for AI Inferencing. La clave: escalar memoria independientemente del cómputo.

El almacenamiento deja de ser secundario

Se difumina la frontera entre memoria y almacenamiento. Nvidia CMX (Context Memory Storage) permite cachés KV fríos en flash conectado por Ethernet (JBOF) —un nuevo nivel G3.5 entre SSD local (G3) y almacenamiento de red compartido (G4)— gestionado por BlueField DPUs Reframing AI Memory. YANSEN subraya que la IA "no usa menos memoria, la usa de forma distinta", exigiendo DDR empresarial y arquitecturas SSD que soporten patrones de acceso impredecibles y latencias deterministas La IA no usa menos memoria.

Qué significa para Latinoamérica

En la región no se fabrica HBM ni SRAM, ni se diseñan LPUs. Su infraestructura de IA vive en la nube de hiperscal adores globales. Tres implicaciones directas:

Costos de nube indexados a escasez global. Los 80.000 millones de USD (Microsoft), 65.000 millones de USD (Meta), 75.000 millones de USD (Google) y 100.000 millones de USD (Amazon) en CapEx 2025 FengHuang: Next-Generation Memory Orchestration for AI Inferencing se traducirán en precios de instancias GPU y servicios gestionados. Las empresas latinoamericanas pagan la prima de memoria sin control sobre la cadena de suministro.

Arqui tecturas disagregadas cambian la ecuación de "lift-and-shift". FengHuang demuestra que la mitad de GPUs basta con memoria compartida eficiente. Proveedores cloud que adopten estas arqui tecturas —o las construyan— ofrecerán mejor rendimiento por dólar. Evaluar proveedores por su roadmap de memoria, no solo por SKUs de GPU, será diferenciador.

Soberanía de datos y caché KV. El almacenamiento de contexto largo (CMX/JBOF) implica que historiales de conversación y razonamiento extenso residan en capas de almacenamiento de red. ¿Dónde físicamente viven esos datos? ¿Bajo qué jurisdicción legal? Para sectores regulados —banca, salud, gobierno— la ubicación del nuevo nivel G3.5/G4 es una pregunta de cumplimiento, no solo técnica.

La pregunta que el ejecutivo debe hacerse

No es "qué GPU compro" —pocos en la región compran GPUs—. Es: ¿mi proveedor cloud está arqui tectando para el muro de memoria o solo apilando más HBM sobre el mismo modelo? La respuesta determinará si su costo por token inferido baja en los próximos 18 meses o sigue subiendo al ritmo de la escasez de HBM.

Fuentes

  1. Diseñando memoria y almacenamiento en la era de la IA
  2. Replanteando la memoria de la IA
  3. Fenghuang: orquestación de memoria de próxima generación para inferencia de IA
  4. La IA no usa menos memoria, sino que la usa de forma diferente: qué significa para la arquitectura DDR y SSD empresarial - YANSEN
  5. Synology amplía la protección híbrida e IA en ActiveProtect Manager 2.0
Shalem Pérez

Escrito por

Shalem Pérez

Desarrollador fullstack

Developer que habla humano. Conoce el código por dentro pero prefiere explicar lo que hace la tecnología a lo que dice el código. Especialista en herramientas de IA, flujos de automatización y tendencias que están redefiniendo cómo trabajamos y construimos. Si existe una nueva herramienta de IA, Shalem ya la probó — y tiene una opinión sobre ella.