数据中心单卡功耗冲到 400 到 700 瓦、整机普遍超过 1 千瓦,而研究显示传统芯片执行 AI 任务时超过九成的能量不是花在计算上,而是花在把数据从内存搬到计算单元的路上。正是这个被反复提及的"搬运账单",让存算一体(存内计算)在 AI 推理场景被重新摆上桌面。先给结论:存算一体真正要解决的是数据搬运带来的功耗瓶颈,它在能效密度上确有想象空间;但对企业选型来说,能否落地取决于两件更现实的事——精度损失能否控制,以及软件栈是否成熟到能把现有模型顺利跑起来。换句话说,能效是它的卖点,精度与生态才是它的门槛。

先看懂瓶颈:数据搬运为什么这么贵

要理解存算一体的价值,得先回到冯·诺依曼架构的老问题。可以把传统计算机想象成一个厨师和一间远在走廊尽头的仓库:食材(数据)存在仓库里,厨师(计算单元)每做一道菜都要跑一趟去取、再跑一趟放回去。菜谱越复杂、重复动作越多,厨师就有越多时间耗在走廊上而不是灶台前。AI 推理恰恰是"重复动作极多"的典型——核心运算是大规模、规则且高度可并行的矩阵乘法,权重要被反复读取,输入输出要频繁流转。

这就是业内常说的"存储墙"和"功耗墙":当计算与存储物理分离,频繁的数据搬运既占满带宽,又吃掉大部分电量。存算一体的思路很直接——把灶台直接搬进仓库,让计算在存储单元内部就地发生,从体系结构层面减少搬运。对于权重稳定、计算重复的推理场景,这种"就地计算"在能效密度与并行性上的优势最容易兑现。

两条技术路线:模拟与数字的分野

存算一体并非单一技术,内部至少分化出模拟与数字两种实现,二者的权衡差异很大,直接影响适用场景。

模拟存内计算:能效极致,但精度是硬骨头

模拟路线利用电信号的物理特性,在存储阵列内并行完成向量-矩阵运算,用电流、电导这类连续量直接"算"出结果,能耗可以压得很低。它的另一个工程优势常被提及:相比高度依赖先进制程的 GPU,模拟存算一体有望基于 28nm 及以上成熟工艺量产,绕开对 EUV 等先进光刻设备的强依赖,在成本和供应链上更可控。

代价也很明确。模拟计算的精度和一致性难以控制,是它长期停留在实验室、工程化极难的根本原因。器件工艺波动、信号噪声都会直接污染计算结果,这也是为什么业内把精度视为模拟存算一体商业化路上的一座"大山"。

数字存内计算:精度友好,容量受限

数字路线在存储单元内用数字逻辑完成计算,天然规避了模拟信号的噪声问题,精度更可控、更容易与现有量化方案对接。但它同样面临容量约束:依靠新型存储(RRAM、MRAM、PCM)或 SRAM 搭建的存算原型,单片容量大多仅在 MB 级别,而存算一体的核心理念又要求"存"与"算"深度融合、不宜外挂存储。这意味着能承载的模型规模受到结构性限制,大模型整模放入单片存算阵列目前并不现实。

正因如此,不少方案走向折中,用近存计算、存算分离与存算一体组合的分层架构,在能效、精度、灵活性和成熟度之间寻找平衡,而不是指望单一路线通吃。

存算一体芯片内部存储与计算融合的概念示意图

企业评估的三个可验证维度

脱离具体指标谈"颠覆"没有意义。对负责算力采购和硬件选型的人来说,建议把评估收敛到三个能验证的维度上。

维度一:能效,看单位能耗下的有效计算量

在大规模推理场景,真正的挑战已经从"峰值算力有多高"转向"单位能耗下能做多少有效计算"。因此评估存算一体时,不要只看厂商宣传的 TOPS 峰值,而要盯住能效指标(如 TOPS/W)以及它在你真实模型、真实 batch 下的表现。存算一体减少带宽占用、降低能耗的收益,在权重稳定、计算重复的工作负载上最明显;如果你的业务是频繁切换模型、权重不断更新的场景,收益会打折扣。

维度二:精度,先确认量化方案与误差补偿

精度是存算一体能否进入生产环境的分水岭。模拟路线尤其需要追问:芯片支持什么量化精度(INT8、INT4 还是更低)?是否提供误差补偿机制?在你的模型上做过量化后,端到端精度掉了多少?对分类、检测这类有一定容错空间的任务,适度精度损失或许可接受;对金融风控、医疗辅助等对输出高度敏感的场景,就必须用自己的数据集实测,而不能采信通用 benchmark。

维度三:软件生态,评估模型映射与工具链成熟度

这是最容易被低估、却往往决定项目成败的一环。现有 AI 框架、编译器和算子库主要围绕 CPU、GPU、NPU 设计,而存算一体需要全新的模型映射方法、数据流调度策略、量化方案和误差补偿机制。选型时要具体核实:是否有配套编译器把主流框架的模型转换过来?算子库覆盖了哪些层、不支持的算子如何回退?调试、性能分析工具是否齐备?生态不成熟意味着大量模型迁移和手工调优的隐性成本,这部分投入常常远超芯片本身的差价。

落到应用判断:谁该用,谁该等

存算一体不是通用 GPU 的替代品,而是场景互补。基于目前的技术成熟度,可以这样划分分工:

方案核心优势典型适用
通用 GPU生态成熟、精度与灵活性高、支持训练大模型训练、需频繁迭代、算子多变的推理
边缘 NPU功耗与成本平衡、工具链较完善终端侧通用推理、对生态要求较高的量产产品
存算一体能效密度高、带宽占用低权重稳定、计算重复的低功耗边缘推理

从公开信息看,存算一体更现实的落地方向集中在低功耗边缘计算、本地工业智能推理、车载智能等对能耗敏感、模型相对固定的场景。对这类产品负责人,可以启动小规模验证,用自己的模型跑通精度与能效闭环再决定规模化。而对需要训练、模型频繁更新或强依赖成熟工具链的团队,当前阶段更稳妥的做法是继续以 GPU/NPU 为主,持续观察存算一体在容量、精度和软件栈上的进展,不急于替换。

【软盟资讯观察】

趋势判断:存算一体的走红不是偶然,而是算力发展从"堆规模"转向"拼能效"的必然产物。当推理成为数据中心主要能耗来源,任何能把九成"搬运电费"省下来的架构都值得认真对待。行业市场规模已超 80 亿美元并保持高增速,三星、英特尔等巨头与国内一批企业同步布局,说明这条路线正从实验室走进工程化阶段,方向上的确定性在增强。

冷思考:确定的是方向,不确定的是时间表和兑现方式。模拟路线的精度与一致性仍是公认的"大山",单片容量只有 MB 级别也限制了可承载的模型规模,而最被低估的瓶颈其实是软件生态——没有成熟的编译器、算子库和量化方案,再高的理论能效也难以转化为可用算力。对企业而言,理性的姿态是把它当作特定场景的"能效利器"而非通用解药:用能效、精度、软件生态三把尺子去量,用自己的真实负载去验,别把厂商的峰值指标直接当成选型结论。真正值得警惕的,是在生态尚未补齐时为"颠覆叙事"过早支付迁移成本。