推理成本
-
多模态模型降价加速应用落地:企业试点应先选择哪些任务
多模态模型降价降低了企业试点门槛,但首轮应用不宜盲目追求自动化,应优先选择输入明确、结果可核验且人工可兜底的任务,如结构化信息提取、内容分类、视觉质检和短音视频整理,并通过真实样本验收稳定性,综合评估调用、审核与返工成本。
-
大模型竞争从参数规模转向效率:GLM-5.3-Flash释放了什么产品信号
GLM-5.3-Flash以320B总参数、18B激活参数和混合注意力架构,体现大模型竞争由参数规模转向推理效率、长上下文成本与部署可行性。其原生多模态、开源及适配信息,为企业评估智能体、编程和自动化场景时同步衡量能力、成本与交付能力提供样本。
-
国产大模型 MiniMax M3 在长上下文任务中的表现评测
MiniMax M3面向超长上下文,API最高支持100万Token,开放权重版本上线时支持50万Token;其长程任务和信息检索能力较强,成本定位有吸引力,但并非全面领先,适合文档整理与长对话,法律、财务等场景仍需人工复核。
-
OpenRouter 报告:词元经济学如何重塑大模型定价策略
文章分析词元经济如何改变大模型定价与采购:不能只看每百万词元单价,还要核算输入、输出、上下文、重试及多轮调用的任务总成本。以DeepSeek V4 Flash为例,因缺少官方价格和性能资料,应结合真实任务测试、质量与人工修订成本审慎评估。
-
Gemini 3.8 Flash单任务成本上升四成:大模型价格战为何转向真实用量
Gemini3.8Flash任务成本0.58美元,较Gemini3.7Flash的0.40美元涨四成,因输出词元增30%且交互轮次增多。单价不变并不等于账单下降,企业应以任务级词元消耗和业务效果评估模型,而非仅看每百万词元标价。
-
AI应用用户越来越多却留存不足:从MiniMax半年报看B端转向的现实逻辑
MiniMax2026年上半年总收入1.17亿美元,同比增长283.1%;开放平台及其他AI企业服务收入7392.9万美元,同比增长703.1%,B端约占80%,首次超过AI原生产品。文章指出,用户增长不等于留存付费,B端放量仍需观察续约、客户结构、毛利与盈利能力。
-
DeepSeek拟采购16万颗昇腾950DT:推理基础设施为何成为新竞争焦点
据报道,DeepSeek拟采购并部署至少16万颗华为昇腾950DT,主要用于模型推理,但采购、交付和投运尚未确认。该计划凸显推理基础设施的重要性,项目仍面临供应、软件适配、集群协同及需求匹配等考验,训练端目前仍主要依赖英伟达。
-
智谱GLM-5.3 Flash与国产芯片集群:推理成本下降如何影响模型服务竞争
智谱在由10万张以上国产芯片组成的集群上实现规模化推理,GLM-5.3 Flash由该集群承载,单位Token推理成本较年初下降80%。文章分析模型、芯片、框架与服务协同如何降低端到端成本,并影响API定价、企业采购和模型服务竞争。
-
9月生成式AI服务价格观察:Grok Bot与Gemini 3.7 Flash带来哪些选型问题
9月生成式AI服务价格变化有限,选型却更复杂:Grok Bot侧重智能体任务执行,Gemini 3.7 Flash关联代码生成与自动化工作流。个人用户应结合使用频率、额度和功能比较,开发者与企业还需核算API成本、审核、稳定性及管理风险。
-
Google发布Gemini 3.8 Flash:代码能力与价格性能比成为看点
文章围绕Gemini 3.8 Flash的代码能力与价格性能比展开分析,指出轻量模型应在真实项目中检验上下文理解、多轮修改、测试辅助和稳定性,并结合任务成功率、重试次数、人工介入及调用规模评估总成本。由于官方价格和技术参数尚未完整公开,企业采购仍需以实际评测和后续信息为准。
-
每日经济新闻数据解读:为何中国AI大模型调用量连续19周领先美国?
9月7日《每日经济新闻》援引OpenRouter数据称,中国AI大模型周调用量达56.72万亿Token,环比增长2.83%,连续第十九周超过美国。全球前五中四款来自中国,腾讯混元Hy4 preview居首。领先背后是模型能力、推理成本、算力投入与应用场景的协同演进。
-
OpenAI发布‘自动化研究实习生’文件,智能体工作量提升124倍
OpenAI确认已实现“自动化研究实习生”目标,研究团队每名员工每个工作日对应3.1个智能体工作日,工作量提升124倍。智能体已进入编码、排障等执行环节,中位研究人员每日推理成本超600美元,重度用户达7000美元以上。企业可借鉴其任务拆解与人工验收结构。
