软盟资讯 | AI前沿
DeepSeek单日吞下8万亿Token,OpenAI降价80%也追不上
海外开发者开源项目团队OpenCode发文称,其平台上DeepSeek V4 Flash的调用量大幅飙升,单日处理Token达8万亿(8T)。其中5万亿为免费试用额度消耗,3万亿为开发者通过OpenCode平台付费使用。
与此同时,模型API分发平台OpenRouter的最新数据显示,上周(7月27日至8月2日),DeepSeek V4 Flash以7.22万亿Token的周调用量位居全球第一。在全球调用量排名中,前五名均为中国AI大模型。
8万亿Token是什么概念?约等于5600万本《三体》三部曲的文字量,或4万部完整电影剧本的体量。以普通用户日常使用场景计算,这一调用量相当于数百万开发者同时高频调用同一模型。
而就在几天前,OpenAI刚刚宣布将GPT-5.6 Luna降价80%——即便如此,DeepSeek的单任务成本仍比降价后的Luna低约60%。
一、8万亿Token:一个惊人的数字
单日8万亿Token,这个数字有多夸张?
作为对比,大模型路由平台OpenRouter接入了400多款模型,每月处理约200万亿Token,平均每天约6.6万亿。也就是说,DeepSeek V4 Flash一个模型在OpenCode一个平台上的单日处理量,已经超过了OpenRouter全平台400多款模型的日均处理量。
OpenCode是一个面向程序员的终端AI编程工具,其附带的Zen、OpenCode Go网关聚焦代码开发场景,基于使用需求精选适配模型。DeepSeek V4 Flash在代码开发这一垂直场景中单日消耗8万亿Token,意味着它已经成为大量开发者的默认编程助手。
OpenCode CEO Jay在8月1日发文称,DeepSeek V4 Flash上线后,使用量单日增长了30%,OpenCode Go的新订阅用户也增长了30%。
从数据来看,DeepSeek V4 Flash正式版7月31日上线公测,不到一周时间便交出了单日8万亿Token、周调用量7.22万亿Token的成绩单。这种爆发式增长的背后,是开发者用“用脚投票”做出的选择。
二、OpenAI降价80%,开发者却不买账
DeepSeek的强势表现,直接触发了OpenAI的紧急应对。
7月31日,OpenAI宣布GPT-5.6 Luna降价80%——输出价格从每百万Token 6美元直接砍到1.2美元,输入价格从1美元降至0.2美元。另一款模型Terra也同步下调20%。这一价格调整距离两款模型正式推出仅约三周。
然而,开发者的反应并不如OpenAI所愿。
在OpenCode的评论区,OpenAI核心产品与平台负责人Tibo亲自下场,打起了GPT-5.6 Luna的广告。但开发者并未买账,有人直言:“我们希望得到DeepSeek的价格。”
这一幕让人哭笑不得。OpenAI的产品负责人亲自推销,却被开发者集体“婉拒”——不是Luna不好,而是DeepSeek的性价比太强。
即便OpenAI将Luna价格下调80%,DeepSeek V4 Flash在其自有API上的单任务成本仍比前者低约60%。
关键原因在于DeepSeek提供了约98%的缓存命中折扣——即命中缓存的Token仅按标价2%计费,远超业内普遍的90%折扣水平。在代码补全、错误检测等开发场景中,大量请求是重复或相似的,高缓存命中率带来的成本优势被成倍放大。
定价方面,DeepSeek V4 Flash输入命中缓存仅0.2元/百万Token,未命中输入1元/百万Token,输出2元/百万Token。在Artificial Analysis智能指数中,DeepSeek V4 Flash获得50分,仅比GPT-5.6 Luna的51分低1分,但成本却只有后者的不到一半。
三、中国AI大模型包揽全球前五,已连续十四周领跑
OpenRouter的数据还揭示了一个更宏观的趋势:在全球调用量排名中,前五名均为中国AI大模型。
这意味着,在全球开发者生态中,中国AI大模型已经成为最活跃、最被广泛使用的模型。DeepSeek V4 Flash以7.22万亿Token的周调用量登顶榜首,环比增长13%。
这一趋势已持续十四周。行业分析师指出,当开源模型在性能追平闭源模型的同时,通过架构创新构建起新的成本壁垒,这标志着全球AI竞争进入“超性价比”阶段。
OpenCode平台数据显示,其用户中同时使用中美模型的开发者比例,已从年初的67%下降至目前的23%。开发者生态正在发生结构性转变——越来越多的人正在从“多模型并用”转向“中国模型优先”。
四、DeepSeek V4 Flash为何能“吞”下8万亿Token?
8万亿Token的单日处理量,背后是DeepSeek V4 Flash在架构层面的硬核支撑。
MoE(混合专家)架构——V4 Flash并非每次推理都激活全部参数,而是根据输入任务动态选择最相关的“专家”模块。总参数284B,但每次激活仅13B,大幅降低了单次推理的计算开销。
高稀疏激活率——每层激活的参数量仅占模型总参数的极小比例,使得模型能用更少的计算量完成同等质量的推理,直接提升了单位时间内的Token处理上限。
FP8混合精度训练——全链路支持FP8精度训练与推理,将单次运算的显存占用和带宽消耗压缩至传统FP16的一半,显著提升了GPU的并行处理能力。
推理引擎深度定制——针对Flash系列模型特点,自研推理引擎实现了算子融合、KV Cache压缩及动态批处理,单卡推理速度较前代模型提升显著。
98%的缓存命中折扣——这是DeepSeek在成本控制上的“杀手锏”。在代码开发等高重复场景中,大量请求命中缓存,成本被降至极低水平。
尾声:AI竞争进入“超性价比”时代
DeepSeek V4 Flash单日8万亿Token的数据,是中国AI大模型在全球市场上的一个里程碑。
它证明了一件事:在AI模型的竞争中,性能不是唯一的标准,性价比才是决定开发者“用脚投票”的关键。
当OpenAI以更低价格仍无法在成本与用户心智方面取胜时,国产开源模型正在将传统性价比概念带入全新的竞争阶段。这不是一场简单的“价格战”,而是一场由架构创新驱动的“价值战”。
正如一位开发者所言:“我不在乎模型是美国还是中国造的,我只在乎它好不好用、便不便宜。DeepSeek两个都做到了。”
这或许就是DeepSeek单日吞下8万亿Token的真正原因。
(本文数据综合自OpenCode官方发文、OpenRouter平台数据、第一财经、CNMO科技、ITBEAR等公开报道。)
关于文章版权的声明:
https://news.softunis.com/66692.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

