📌 La escasez de HBM obliga a los chips de inferencia a recalcular la ecuación de memoria
La competencia en chips de inferencia de IA se está extendiendo de «quién tiene mayor capacidad de cómputo» a «quién puede almacenar los pesos de los modelos de forma más eficiente». Esto merece atención porque la memoria de alto ancho de banda (HBM) ya no es solo un componente complementario de los chips; que su suministro pueda seguir el ritmo ya podría afectar la configuración de productos, los costes y el ritmo de entrega.
Según se informa, Nvidia está probando Rubin Ultra equipado con 192GB a 256GB de HBM, por debajo del 1TB previsto originalmente, en un contexto de suministro de memoria cada vez más ajustado. Si esta configuración finalmente se materializa, significa que los fabricantes deberán reevaluar las compensaciones entre los objetivos de rendimiento, la capacidad de memoria disponible y los costes del producto. Para los proveedores de HBM, la estrechez de la oferta elevará su posición en el ciclo de construcción de IA; pero que los fabricantes de chips puedan convertir esta limitación en combinaciones de productos comercializables seguirá dependiendo de las especificaciones finales y de las condiciones de suministro.
Otra vía es utilizar menos memoria externa. Análisis relacionados señalan que Nvidia está incorporando el SRAM LPX de Groq a su pila tecnológica; AMD, por su parte, explora mediante Taalas la incorporación directa de los pesos de los modelos en puertas lógicas o Mask ROM. La primera acerca más capacidad de almacenamiento a las unidades de cómputo, mientras que la segunda busca eliminar la carga de pesos. El objetivo común de ambas soluciones es reducir la dependencia de la HBM externa durante la inferencia.
Por tanto, lo que deberá verificarse en la siguiente etapa no es solo si la HBM sigue estando ajustada, sino también si estas arquitecturas pueden equilibrar el rendimiento y la flexibilidad de implementación en modelos reales. La eficiencia de memoria podría convertirse en una variable más directa en los ingresos y la asignación de pedidos de chips de inferencia.
▌ Fuentes