基准测试
-
GPT-6 Astra突破10万GPU训练规模,OpenAI宣称AGI已到来
GPT-6 Astra以超10万张GPU完成预训练,首次在训练中大量使用此前模型参与监督,并具备直接操作计算机完成任务的能力。其网络安全能力达Critical级,FrontierMath Tier 4得分97.6%。OpenAI宣称AGI已到来,但产业内部对此尚无统一结论,更应视为对AGI定义权的争夺。
-
DeepSeek V4 Flash正式版上线:Agent能力”以下克上”,小模型干翻自家Pro版
2026年7月31日,DeepSeek通过API文档更新日志宣布,DeepSeek-V4-Flash正式版API上线公测。模型保持284B总参、13B激活参数的MoE架构不变,仅通过后训练优化即实现Agent能力全面跃升。在9项Agent基准测试中,Flash正式版成绩全面超越自家V4-Pro-Preview,Terminal Bench达82.7分,DeepSWE从7.3飙升至54.4。同时原生支持Responses API并适配Codex生态,开发者可无缝接入主流编程工具,标志着大模型竞争从“堆参数”进入“精调时代”。
-
美国封禁中国开源AI政策陷僵局:Kimi K3高性价比搅动白宫博弈
近日,围绕是否封禁以Kimi K3为代表的中国高性价比开源AI模型,特朗普政府内部正陷入激烈分歧,此前被搁置近一年的相关限制方案被重新摆上台面,但多轮讨论后仍未形成最终决议。这场博弈的背后,是中国开源AI技术快速落地后,美国本土企业的真实需…
-
Meta宣布推迟新一代AI模型”牛油果”发布,因内部测试性能未达预期
来源:软盟资讯 作者:编辑部 发布时间:2026年3月13日 3月13日,据《纽约时报》援引三位知情人士消息,美国科技巨头Meta原定于本月发布的新一代前沿AI大模型”Avocado”(牛油果),因内部测试性能未达预…
-
JetBrains 推出首个 AI 编码基准平台
JetBrains 推出了业内首个开放式 AI 编码基准平台 DPAI Arena,旨在用真实工程任务评估各类智能体对开发效率的贡献。首个试点基准为 Spring 项目基准(Spring Benchmark),涵盖多个开源 Spring 应用和真实任务。平台计划捐献给 Linux Foundation,实现中立治理,并支持多语言、多种工作流扩展。这一举措为 AI 编码工具引入透明、标准化的评估体系,对行业未来发展具有深远意义。
