【软盟资讯 · 7×24快讯】据澎湃新闻9月8日报道,DeepSeek V4.1-Flash悄然宣布开启中间版本内测,采用新的模型结构,原生多模态支持、能力更强、速度更快且成本更低。开发者保持base_url不变,将模型名设置为deepseek-v4.1-flash-expires-on-0910即可调用,当前计费与deepseek-v4-flash相同,账号限20并发。
从外界反馈看,此次上新的最大特点是速度极快。ITBear科技资讯、财法观天下等媒体实测显示,常规文本输出最高达507 tokens/s,部分测试环境测得1538 tokens/s,远超V4 Flash标称的155 tokens/s;技术层面,V4.1 Flash内置DSpark投机解码模块,一次预测多个候选token、批量验证,大幅缩短逐token解码的等待时间。多模态方面,此前的V4-Flash-Vision-Exp已在Agent Benchmark上实现大幅跃升,多模态Agent能力接近Opus-4.8,V4.1 Flash在此基础上进一步集成原生多模态。
值得关注的是,该版本名称中的日期标识“expires-on-0910”显示其将于9月10日自动终止服务,定位更接近技术验证的过渡版本。结合DeepSeek近期高频迭代——7月31日V4 Flash公测、8月13日V4 Pro与Harness开源、8月31日Vision-Exp开源——DeepSeek正以“快速试错+开源生态”的打法加速追平多模态短板。
(新闻来源:澎湃新闻/看点资讯,2026年9月8日;ITBear科技资讯、财法观天下/搜狐,2026年9月9日)
【软盟观察】 DeepSeek V4.1 Flash最值得玩味的是“DSpark投机解码”这个技术细节:用一个小模型抢先预测多个token、主模型批量验证,接受率超90%就等效提速数倍——这是典型的中式工程智慧,不硬怼算力,而是用算法技巧在同等算力下压出更高吞吐。原生多模态补齐了DeepSeek此前最大的短板,500 tokens/s的实测速度直接把长文等待压到分钟级,对实时语音、弹幕互动、高频客服等场景意义重大。但“expires-on-0910”的过渡定位也提醒我们:速度与能力兼得的路线仍在验证中,V4.1的真正形态要等正式版揭晓。国产模型在性价比上的内卷,正在把国际大模型的定价空间一步步压缩。(新闻来源:澎湃新闻、ITBear科技资讯、财法观天下)