【软盟资讯·新闻导读】2026年9月13日,多家AI企业集中发布新一代大模型。与以往主打榜单排名不同,这一轮发布的共同关键词是成本:单位Token效率、调用价格、运行速度和综合成本被摆到了更靠前的位置。据证券日报此前报道,OpenAI、xAI、Meta等厂商的新一轮模型已明显转向“以多低的成本稳定完成任务”;国内也有模型平台依托国产算力底座优化调度逻辑,单位算力消耗成本下降约三成。对正在做AI预算的企业来说,这是一次需要重新算账的信号。

一次“同步发布”,把竞争焦点从能力移向成本
9月13日这轮发布最容易被忽略的,其实是节奏本身。多家企业在同一时间窗口推出新一代模型,说明产品迭代已经从“单点突破”变成了“周期性换挡”。当不同模型在通用能力上的差距持续收窄,发布会的叙事重心自然会转移:过去讲能做什么,现在讲做完一件事要花多少钱、要等多久、能不能稳定跑通。
证券日报在7月的报道中已经把这一变化概括得很明确:新一轮模型更强调单位Token效率、调用价格、运行速度与综合成本,大模型的“进化”方向正从“能力有多强”转向“以多低成本稳定完成任务”。9月13日的集中发布,可以看作这条趋势曲线上的又一次抬升。
这里需要区分三类信息。厂商公布的模型参数量、定价档次、开放区域和速率限制,属于官方信息,以官方公告与文档为准;行业媒体披露的调用价格变化与平台数据,属于可靠媒体报道,可作为参考;而关于技术路径与商业影响的推断,属于分析判断,不等同于厂商口径。本文按照这一边界展开。
30%的降幅,究竟降在哪里
“算力成本下降30%”是个好记的数字,但它往往来自不同口径的叠加。把公开信息拆开看,大致可以归到三个层面。
模型与推理侧:同样的任务,用更少的算力
模型侧降本的常见做法,是让推理过程不要“全量激活”。稀疏化架构、低精度量化、缓存复用、并行解码等工程手段,目标都是同一件事:在结果质量大致可接受的前提下,减少一次请求实际消耗的算力。这也是新一轮模型普遍强调单位Token效率的原因——单次调用便宜一点,乘以每天数百万次调用,就是完全不同的成本结构。
平台侧:模型路由与统一网关
科技日报7月的报道提到,有平台已汇聚超过300款主流模型,系统会根据客户的业务诉求自动匹配最优模型,兼顾效果与成本两方面需求;企业接入统一网关后即可按需调用全部模型资源,不必重复对接多家厂商。这条路径降低的不只是算力单价,还包括技术对接、运维监控和供应商管理的隐性成本。对中型企业而言,后者的节省经常比单价本身更可观。
硬件与集群侧:能效比取代单纯堆卡
下游客户不再盲目追逐单一极致性能,会倒逼采购端更关注芯片能效比、服务器集成度和集群调度效率。沿产业链向上看,能真正降低系统能耗、提升算力利用率的厂商,议价能力会更强;仅靠同质化扩产和低价竞争的企业,则容易面临毛利率压力。需要厘清的是,降本并不等于硬件需求萎缩,反而可能因为调用门槛降低而放大总体算力消耗。
企业该怎么调:三笔账要重算
成本下降不会自动变成收益,关键是把省下来的额度重新分配到更合适的位置。以下三个维度值得在近期重新评估。
| 决策维度 | 过去的判断依据 | 成本下降后的判断依据 | 建议动作 |
|---|---|---|---|
| 模型选型 | 榜单分数、参数规模 | 单位任务综合成本与输出稳定性 | 用自身业务样本做小规模对照测试 |
| 自研与采购 | 数据安全、能力上限 | 推理的单位经济性与迭代速度 | 核心场景自研或微调,长尾场景走API |
| 场景排序 | 只做高价值场景 | 此前被成本劝退的场景是否已跑通 | 重排试点优先级,先做可量化收益的场景 |
具体到执行层面,有三点比较实际。第一,把考核指标从“每百万Token多少钱”换成“每完成一个业务动作多少钱”,因为不同模型的输出冗长度差异很大,单价低不等于总成本低。第二,建立调用量与实际支出的对应看板,避免预算从一次性采购变成无上限的浮动支出。第三,把数据合规、服务等级协议和供应商集中度纳入同一张评估表,价格只是其中一行。
接下来值得盯住的信号
短期看,有几类信息会直接影响判断。一是厂商官方定价页与限流规则的正式更新,这决定降本能否真正落到合同上;二是上游硬件与数据中心的资本开支方向,它决定这轮降价是可持续的效率提升,还是阶段性的市场补贴;三是行业统一网关、模型路由这类中间层服务的成熟度,它决定中小企业能否低成本获得多模型能力。
中期看,还需要关注与AI相关的合规要求、数据使用边界和行业准入政策的变化。这些因素不体现在价格表里,却经常决定一个场景能不能真正上线。
【软盟观察】
这轮“同步发布+成本下探”的组合,最值得企业注意的不是某一家厂商的参数又涨了多少,而是估值与决策的锚点在换。过去两年,资本市场给技术领先者很高的稀缺性溢价,企业选型也习惯先看榜单。当能力差距收窄、企业端进入规模化部署阶段,竞争重点就转向“做一次多少钱、能否跑通商业闭环”。衡量一家大模型企业价值的关键指标,正在从智能测评分数转向每一单位算力能创造多少有效收入;衡量一家应用企业AI投入是否合理的标准,也在从“用了什么模型”转向“省了多少人力与时间”。
对采购方而言,这意味着不必再为“最强模型”支付普遍性溢价,而应为“够用且稳定”付费。一个务实的做法是分层:涉及核心数据与关键流程的场景,保留自研或私有化部署;营销内容生成、内部知识问答、客服辅助等长尾场景,优先使用按量付费的API,并保留随时切换供应商的能力。
对产业链而言,降本的传导方向值得留意。大模型处在枢纽位置,上游连着芯片、服务器、光模块,下游连着千行百业。成本压力向上传导,会推动硬件厂商从“卖产品”转向“交付更高效率的算力”;成本下降向下传导,则可能带来“单价下降、应用爆发、总算力需求再放大”的循环。真正受益的,往往不是价格最低的那一环,而是能把效率转化为稳定交付的那一环。
同时也要保持审慎。30%这类数字通常来自特定平台、特定口径和特定时间窗口,不同厂商的统计方式并不统一,价格表中也常隐藏着上下文长度、并发限制、缓存命中等附加条件。企业在做预算调整前,应先用真实业务流量做一轮小规模验证,并以厂商官方公告作为最终依据。降本是趋势,但趋势落到具体合同上,仍然需要逐项核验。
(本文涉及的产品发布、价格与平台数据均以公开报道和厂商官方信息为准,分析性判断仅供决策参考。)
关于文章版权的声明:
https://news.softunis.com/75559.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

