算力成本降30%企业预算怎么算?

话题来源: 2026年9月13日:多家AI企业同步发布新一代大模型,算力成本下降30%

9月13日那轮集中发布,最值得企业关注的不是榜单名次,而是成本被摆上台面。多家厂商在同一窗口推出新一代模型,共同强调单位 Token 效率、调用价格与运行速度;据证券日报报道,OpenAI、xAI、Meta 等厂商的新一轮模型已转向以更低成本稳定完成任务,国内也有平台依托国产算力底座优化调度,单位算力消耗成本下降约三成。预算需要重算,但这个数字不能直接抄进表格。

降幅降在哪一层

降幅往往来自不同口径的叠加。模型与推理侧的思路是让推理不再全量激活,稀疏化架构、低精度量化、缓存复用、并行解码等手段指向同一目标:在质量大致可接受的前提下减少单次请求的算力消耗——单次便宜一点,乘以每天调用量就是另一套账。平台侧的收益不止于单价,据科技日报 7 月的报道,已有平台汇聚超过 300 款主流模型并按业务诉求自动匹配,接入统一网关即可按需调用,省下的对接、运维与供应商管理成本往往比单价更可观。硬件与集群侧,采购端从追逐单一极致性能转向关注芯片能效比与集群调度效率;降本不等于硬件需求萎缩,门槛降低反而可能放大总算力消耗。

预算表上要改的位置

省下来的额度不会自动变成收益。模型选型应从榜单分数、参数规模,换成单位任务综合成本与输出稳定性,并用自身业务样本做小规模对照测试。自研与采购的边界也要重划:核心数据与关键流程保留自研或私有化部署,营销内容生成、内部知识问答等长尾场景优先走按量付费接口。此前被成本劝退的场景,可以重排优先级。

考核指标同样要换,从“每百万 Token 多少钱”改为“每完成一个业务动作多少钱”,不同模型输出冗长度差异大,单价低不等于总成本低。同时建立调用量与支出的对应看板,避免预算从一次性采购变成无上限的浮动支出,并把数据合规、服务等级协议与供应商集中度放进同一张评估表。

这轮降价是效率提升还是阶段性补贴,仍需判断。可盯三类信号:厂商官方定价页与限流规则是否正式更新,决定降本能否落进合同;上游资本开支方向,决定成本曲线能否持续;统一网关、模型路由等中间层的成熟度,决定中小企业能否低成本获得多模型能力。也要留意,降幅来自特定平台、口径和时间窗口,价格表里往往藏着上下文长度、并发限制、缓存命中等条件。先用真实业务流量做小规模验证,再以厂商官方公告为准。

发表回复

登录后才能评论