智能体技术
-
AI应用竞争从模型参数转向基础设施:9月最新产业动向释放了哪些信号?
AI产业竞争焦点正从单一模型参数转向终端、芯片、存储及协作软件等基础设施。模型竞争重点由静态输出转向动态任务完成能力,算力竞争则从峰值性能转向系统可用性。同时,AI应用正从软件协作延伸至具身智能等物理世界,模型、算力与能源的闭环成为核心。
-
模型更便宜、智能体更强只是二级资料判断:企业该如何核验AI更新价值?
围绕Claude Fable 5.1成本下降与AutomationBench表现提升的说法,文章提醒企业将其视为二级资料线索,不能直接作为采购依据。核验时应拆分缓存命中与真实总成本,并用脱敏业务任务测试调用量、延迟、稳定性和任务成功率,综合评估模型价值。
-
从金融模型到编程模型:垂直场景正在成为大模型发布的新主线吗?
文章指出,大模型竞争正从通用能力和统一榜单转向场景适配:金融重可信、合规与审计,编程重代码执行、工具协同和迭代,智能体重任务闭环、稳定性与总成本。模型价值取决于能否融入真实业务流程,而非单项测试排名。
-
GLM-5.3与GLM-5.3-Flash接连受到关注,开源模型竞争正在转向编码和智能体能力吗?
GLM-5.3聚焦复杂编程、长程任务和智能体执行,GLM-5.3-Flash则突出原生多模态、视觉编程与低成本交互。两款模型表明,开源竞争正从参数规模转向软件工程、工具调用和真实任务交付,选型应依据任务复杂度与开发场景。
-
Meta发布实时语音感知模型:80毫秒分段处理如何改变AI语音交互
Meta于2026年9月1日发布实时音频感知模型Muse Voice Transcribe,以80毫秒片段持续处理语音,整合流式转写、说话人区分和句边界识别,支持多语言及长时音频。模型参数、训练数据来源和权重尚未公开,实际效果与部署成本仍待独立评估。
-
Meta发布Muse Spark 1.3:低价与快速迭代能否撬动模型市场
Meta发布Muse Spark 1.3,主攻编程与AI智能体任务,支持最长约100万Token上下文,并通过减少工具调用和Token消耗降低多步骤任务成本。评测成绩受配置和任务影响,企业仍应以真实工作流验证成本与稳定性。
-
Astra的“电脑使用”能力会怎样影响AI应用开发:开发者需要重新评估什么
电脑使用型AI把应用评估从单次问答准确率扩展到完整任务链的可靠性、安全边界与人工接管。开发者应围绕最终目标测试多步骤执行、异常恢复和状态追踪,并按数据与动作风险设置权限、日志、确认点及可恢复的中途纠偏机制。
-
10万块GPU训练Astra意味着什么:大模型竞争进入工程规模较量
Astra首次在超过10万块GPU上完成训练,显示大模型竞争已从算法能力延伸至集群调度、网络存储、数据中心和组织协作。文章还分析其软件操作与安全对齐能力,并提醒训练规模不等于模型效果或AGI,行业门槛升高后,中小团队仍可在应用层寻找机会。
-
能力升级与安全暂停同时出现:Anthropic事件给智能体部署什么提醒
该事件表明,智能体风险不只取决于模型能力,更取决于评测环境、工具权限与上线审批的边界。企业应落实最小权限、身份与操作追踪,明确外部评测范围和终止条件,并通过分阶段审批、隔离测试、持续监测及快速回滚,降低越权操作扩散风险。
-
Anthropic下调缓存上下文费用:常驻型智能体的成本逻辑变了吗
Anthropic将ClaudeFable5.1的缓存上下文费用下调75%,对多轮、长期运行的常驻型智能体可显著降低重复输入成本。缓存命中依赖前缀稳定,企业需在上下文设计上保持规则、工具等部分不变,以便把降价转化为整体成本优势。
-
Meta发布Muse Spark 1.3:代码与智能体能力成为本轮升级重点
Meta于9月2日发布Muse Spark 1.3,升级重点转向代码与智能体长任务,强调持续上下文、工具调用、计划修正和主动澄清;相较1.2,内部比较显示工具调用约减少20%、令牌使用量约减少25%,并支持一百万令牌上下文,同时接入Muse Code与Meta Model API。
-
从端侧小模型到293B基座:科大讯飞星火X2.5的产品布局怎么看
科大讯飞星火X2.5以端侧小模型与293B基座模型构成分层布局:1.7B和4B面向车载、智能硬件等本地交互,原生支持最长100万Token上下文;293B-A30B面向云端开发与企业应用,强化代码、智能体等能力。
