0
权重不再搬家:MRAM 存算融合能否改写大模型推理的带宽瓶颈
寒序科技公布的 uHBM 与 uLPU 路线,把 MRAM、片内高带宽访问和矩阵—向量计算放在同一套推理架构中,提出首代 uHBM 片内读取带宽 24 TB/s、面向 4B 多模态模型超过 2000 token/s 的目标。数字很醒目,真正值得讨论的却是其技术逻辑:大模型解码阶段为何受权重搬运约束,非易失性 MRAM 如何承担权重驻留,存内或近存计算能节省哪些数据流,又会引入怎样的容量、精度、良率、散热和软件适配问题。现阶段公开数据主要来自企业披露,尚不足以证明其可替代 HBM 与 GPU,但它提供了一条值得验证的专用推理路线。