大模型竞争转向成本性能比

话题来源: 【每日AI必读资讯】AI智能体与大模型最新动态精选10条(2025年3月2日)

模型发布会过去的关键词是能力上限,现在越来越多讨论围绕同一件事:单位成本能买到多少有效能力。GPT-4.5 的争议是个标志性事件——在 Aider Polyglot 编码基准上,它的性价比不及 DeepSeek-V3,被指智能提升有限而价格昂贵,纽约大学教授马库斯等人据此批评 OpenAI 优势不再。评价一个前沿模型的坐标,正在从绝对分数转向分数与价格之比。

成本侧的账本也被摆上台面。DeepSeek 公布其推理系统每日总成本为 87072 美元,若按 R1 价格计费,每日总收入可达 562027 美元,成本利润率 545%;但同一份披露也说明,实际收入会因 V3 定价更低、部分服务免费和夜间折扣而大幅下降。

理论利润率与实际收入之间的落差,本身就是竞争设计的一部分。低价、免费额度、时段折扣是获客与填充算力的手段,毛利高不等于现金多。把两者分开看,才能理解成本性能比并非单纯的财务指标,而是模型定位与定价机制的组合。

能力维度并未因此失效。OpenAI 首席研究官强调 GPT-4.5 在创意写作等场景表现较好,并认为规模扩展仍有空间。更准确的读法是任务分层:可验证、可批量、验收标准明确的任务,对单位成本最敏感;开放式写作与复杂推理这类高价值场景,仍有支付意愿。用一把尺子量所有模型,结论必然失真。

使用方的选型逻辑也要跟着改。调用量大、结果容易校验的任务,交给成本曲线更陡的模型;容错低、难以自动验收的任务,留给能力上限更高的模型。预算里还要把推理成本的可变部分算进去,定价机制、免费额度和折扣时段都会影响实际支出。

降本也不只发生在模型侧。Meta 的 Aria Gen 2 用自研芯片做端侧处理以换取更快响应,阿里玄铁推进开源 RISC-V 架构的服务器级 CPU IP 核,指向的是算力生态的底层成本。这些动作与模型侧降价,是同一件事的不同侧面。

谷歌联合创始人谢尔盖·布林要求团队加快步伐,说明头部厂商仍把能力上限当作竞赛目标。两条线并不矛盾:能力上限决定天花板,成本性能比决定谁能被真正大规模用起来。接下来值得盯的不是单次跑分,而是同一任务上单位成本换到的完成质量,以及这个比值下降的速度。

发表回复

登录后才能评论