Anthropic于美国时间2026年9月28日发布Claude Sonnet 5.5,相关消息于北京时间9月29日传播。Anthropic称,新模型相较Sonnet 5的输出速度提升30%以上;在其测试中,完成任务的成本最高可降低30%。这并非API单价下调:报道显示,Sonnet 5.5的每百万输入、输出Token价格分别为2美元和10美元,与Sonnet 5持平。厂商将成本变化归因于完成任务所需Token和工具调用减少。
智能体编码测试中超过Opus 5.5
Anthropic公布的Terminal-Bench 4.0结果显示,Sonnet 5.5得分为70.6%,高于Opus 5.5的66.4%;同一资料列出的Sonnet 5成绩为10.3%。这项基准主要考察智能体完成终端环境中的编码任务,结果说明Sonnet 5.5在该测试设置下表现突出,但不能据此认定它在所有编程任务中都优于Opus。

在其他测试中,Sonnet 5.5于GDPval-AA v2.1取得1844分,与Opus 5.5的1846分接近;在评估计算机操作能力的OSWorld 2.1中得分为80.1%,高于Sonnet 5的57.0%。这些数据均来自Anthropic公布的评测结果,反映的是特定基准、任务和测试条件下的表现,不等于独立机构对实际开发效果的全面验证。
成本优势要看完整任务账单
Sonnet 5.5的单价与Sonnet 5相同,任务成本下降的说法,重点在于模型可能用更少的Token和工具调用完成工作。Decrypt报道提到,一名独立测试者观察到该模型的Token消耗高于其此前测过的模型;现有资料未提供足以判断测试任务、设置和样本范围的完整细节,因此这一发现同样不宜直接推广到所有使用场景。
对企业和开发团队而言,比较模型不能只看单价或单项基准分数。实际成本还受任务成功率、重试次数、上下文长度、工具调用量和人工复核时间影响。更快的输出也不必然代表端到端开发周期按相同比例缩短,尤其是需要多轮调试、理解大型代码库或满足严格质量要求的任务。
选型前用自己的任务验证
评估Claude Sonnet 5.5时,可以选取团队真实、可重复的代码任务,与当前使用的模型进行对照:固定提示、工具权限和验收标准,记录完成率、修复质量、耗时、Token用量及人工介入情况。对于边界清楚的修复、常规实现等任务,可重点检验速度和任务成本;涉及复杂架构判断、开放式需求或高风险变更时,则应单独评估模型的稳定性与审查负担。
【软盟资讯观察】
这次更新值得关注的,不只是编码基准分数上升,而是中档模型能否以更低的任务成本承担更多日常工作。如果速度提升和Token节省能在真实项目中复现,开发团队就可能重新划分模型使用层级:常规任务优先测试成本更合适的模型,复杂任务保留更强模型或人工把关。但厂商测试、独立测试和企业生产环境并非同一条件,基准领先也不能替代代码安全、可维护性和需求匹配度的检验。企业在采购或迁移前,应以自身任务建立基线,核算完整调用与复核成本,并设置回退机制;在缺少可比的独立验证时,不宜仅凭单项成绩作出全面替换决定。
相关话题
关于文章版权的声明:
https://news.softunis.com/83742.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

