导航菜单
首页 服务 OPC项目 AI资讯 AI应用市场 OPC市场 OPC导航 工具推荐 关于 OPC城市 北京OPC 上海 广州 深圳 杭州 注册指南 OPC完全指南 AI副业
⚡ 创客OPC ← 返回资讯
寒序科技发布uHBM与uLPU:大模型推理从“权重搬得更快”迈向“让权重尽量不搬”

大模型推理正在经历一场范式级的转变。过去几年,行业把大部分精力花在把权重“搬得更快”上:HBM带宽从几TB/s一路爬升,互联协议不断升级,推理引擎反复优化KV Cache命中率,目的只有一个——让海量参数尽快流经计算单元。但寒序科技最新发布的uHBM与uLPU架构,试图回答一个更本质的问题:为什么一定要搬?

一、从“搬权重”到“让权重不搬”:推理瓶颈的重新定义

大模型推理之所以被内存带宽卡住,根源在于自回归解码过程:每生成一个Token,模型都要把全部权重从存储介质读取一遍,而每个权重在一次解码中往往只被使用一次。这意味着推理系统的有效计算密度被权重搬运速率牢牢锁死,计算单元大量时间处于饥饿等待状态。业界应对思路无非堆带宽、压权重、摊成本三条路,都有效,但都在“搬运”这个前提上打转。

寒序科技的思路是釜底抽薪:把权重和计算放到同一个物理域内,让权重几乎不发生片外搬运。uHBM不是对传统HBM的简单改良,而是将存算一体思想注入高带宽存储堆栈,使权重读出带宽的设计值达到24TB/s。作为参照,主流HBM3E单片带宽约1.2TB/s量级,多堆叠聚合带宽也通常不过十余TB/s。24TB/s意味着在同等功耗与面积约束下,权重供给能力提升一个数量级,自回归解码的访存瓶颈被大幅后移。

uLPU则是与uHBM配套的推理计算单元,二者构成一套完整推理架构。uLPU面向4B多模态主干设定Decode目标超2000 Tokens/s。需要说明的是,这一数字针对的是多模态主干解码路径,并非端到端生成速率,但它仍然极具指标意义:对于4B规模模型,单设备达到2000+ Tokens/s的解码吞吐,已远超当前单卡主流水平,甚至接近部分云端多卡集群的聚合效果。首代工程产品已进入流片前收敛阶段,意味着这不是停留在纸面的概念,而是有明确落地时间表的工程路径。

二、技术拆解:uHBM与uLPU如何协同实现“不搬”

理解这套架构,需要拆开看三个层面。

第一,存储侧:uHBM把权重读出从“总线搬运”变为“堆内直达”。传统HBM的带宽受限于TSV与逻辑die之间的接口宽度和时钟,数据需要从存储阵列经接口再进入计算die。uHBM通过在存储堆栈内嵌入更宽的计算接口与近存计算路径,让权重读出带宽设计值达到24TB/s,其关键在于缩短数据通路、提高并行度,而不是单纯提高接口频率。这相当于把“城市主干道”改成了“社区内直达通道”,权重不必绕行片外总线。

第二,计算侧:uLPU围绕解码特性重构算子与流水。自回归解码对单Token延迟敏感,对计算单元利用率的要求与训练完全不同。uLPU针对Decode阶段的高访存密度、低算术强度特征,设计了更适配的权重驻留策略与脉动式执行流水,使得高带宽供给能够真正转化为Token吞吐,而不是变成空转的带宽数字。面向4B多模态主干的2000+ Tokens/s目标,正是这种计算与存储协同设计的直接体现。

第三,系统侧:“少搬权重”带来的连锁收益。权重搬运减少后,功耗中用于数据传输的比例显著下降,系统对HBM容量与功耗配比的需求也随之变化。在多卡互联场景下,减少权重搬运还能缓解NVLink类互连的压力,把宝贵带宽留给激活、梯度与KV Cache等真正需要跨设备流动的数据。这使得uHBM与uLPU的组合不仅是一个单点突破,更可能重塑整机系统的功耗与互联预算。

三、与现有方案的对比:存算一体的差异化定位

与英伟达H100/H200、AMD MI300X等主流GPU方案相比,寒序科技的路线差异明显。GPU方案的优势在于生态成熟、通用性强,但其推理性能高度依赖HBM带宽与片上SRAM的配比,权重每解码一步都要穿越片外总线。寒序的方案把权重读出带宽推高到24TB/s量级,在纯解码吞吐维度上具备数量级潜力,但代价是需要专用软件栈与算子库配合,通用性弱于GPU生态。

与Groq的LPU方案相比,二者都强调“让权重不搬”的理念。Groq通过超大SRAM把权重常驻片上,推理延迟极低,但SRAM容量有限,难以承载大模型全量权重。uHBM路线则利用DRAM堆叠提供大容量驻留,理论上可以覆盖更大规模模型,同时保持高带宽读取。可以理解为:Groq选择“全放片上”,寒序选择“在存储堆内就近算”,后者在容量与带宽之间找到了新的平衡点。

四、产业意义:推理成本曲线可能被重新定义

如果24TB/s带宽与2000+ Tokens/s解码目标在量产芯片上兑现,产业影响将是系统性的。首先是单位Token成本:高带宽意味着单设备可支撑更高并发、更低时延,推理服务的边际成本显著下降,直接利好大模型应用的规模化落地。其次是部署形态:高吞吐单设备方案可能催生更紧凑的边缘推理盒子与端侧设备,让大模型推理从云端走向更多现场场景。再次是芯片格局:“GPU一统推理”的局面可能出现裂口,面向推理场景的专用架构获得更明确的商业验证机会。

当然,理性看待也是必要的:设计值不等于量产实测值,24TB/s与2000+ Tokens/s仍需经受流片与客户实测的考验,软件生态与工具链成熟度也决定其能否从benchmark走向生产环境。但方向本身值得肯定:大模型推理正在从“把权重搬得更快”的军备竞赛,走向“让权重尽量不搬”的架构重构。寒序科技用uHBM与uLPU给出了一个严肃而完整的答案,接下来的流片与量产,将验证这条路线能否真正改写推理成本曲线。

本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理

微信搜一搜「北京安迪哥OPC」
上一篇
中关村 AI 原点社区“一人公司”涌现:AI 正在重塑创业的...
下一篇
Gartner发布2026中国数据AI技术成熟度曲线:代理型...
需要落地支持?

从网站 / 小程序开发到 AI 工具链企业培训,提供全栈交付与落地方案;也可以先看看一个人如何用 AI 工具链撑起专业级交付。本页内容整理的是一线实践,具体项目按需评估。

查看服务与报价 → AI 工具链 + FDE 实战 →