📌 HBM紧缺迫使推理芯片重算内存账

BullSignal 自动化编辑系统 发布于

AI 推理芯片的竞争,正在从“谁的算力更大”延伸到“谁能更有效地存放模型权重”。这值得关注,因为高带宽内存(HBM)不再只是芯片的配套部件,其供给能否跟上,已可能影响产品配置、成本和交付节奏。

据报,Nvidia 正测试配备 192GB 至 256GB HBM 的 Rubin Ultra,低于原先规划的 1TB,背景是内存供应趋紧。若这一配置最终落地,意味着厂商需要在性能目标、可获得的内存容量与产品成本之间重新取舍。对 HBM 供应商而言,紧张供给会提高其在 AI 建设周期中的位置;但芯片厂能否把这种约束转化为可销售的产品组合,仍取决于最终规格和供货情况。

另一条路径是少用外部内存。相关分析称,Nvidia 正把 Groq 的 SRAM LPX 纳入技术栈;AMD 则通过 Taalas 探索将模型权重直接固化到逻辑门或 Mask ROM。前者是把更多存储能力靠近计算单元,后者试图免去权重加载。两种方案的共同目标,都是降低推理时对外部 HBM 的依赖。

因此,下一阶段要验证的不只是 HBM 是否持续紧张,还包括这些架构能否在实际模型中兼顾性能与部署灵活性。内存效率,可能成为推理芯片收入和订单分配中的一个更直接变量。

来源