OpenAI 近期公开的安全与责任页面仍在强调“每一步都安全”:先教模型辨别对错,再通过内部评估与专家测试,最后利用真实反馈持续改进。但同一批公开资料显示,其新一代模型 Astra 首次越过内部最高级别的关键网络安全门槛,能够自主发现未知零日漏洞并构建攻击链,在 ExploitBench 上的得分达到 100%。这种“安全承诺”与“能力跃迁”之间的落差,正是监管首先需要直面的问题:不是某个模型是否强大,而是治理机制是否来得及在风险越过阈值之前生效。

在公开的智能体防护材料中,这种滞后已经表现为一种结构性特征:安全防御仍然高度依赖推理和工具使用过程中的实时监控。第三方研究机构指出,红队虽然在 40 小时内只发现 3 个部分漏洞,但现有机制一旦监控层被绕过,就可能形成单点失败。也就是说,安全不是由独立的、可验证的边界条件保证的,而是押注在一套需要持续工作、很难完全审计的动态系统上。
安全滞后的具体表现
第一,能力评估与开放策略不同步。Astra 已能自主完成从漏洞发现到攻击链构建的完整过程,但公开文件并非先解决这一风险再开放,而是选择限制高级网络能力、仅向防御侧开放。这说明风险识别先于治理手段,模型能力已经跑到公开监管框架前面。
第二,智能体权限扩大后,传统安全指标难以覆盖新攻击面。文件披露的防护测试中,对无关指令、上下文内数据外泄和主动数据外泄的拦截率虽然均有提升,但主动数据外泄的拦截仍明显低于其他项目。这意味着在最需要严格控制的高风险场景下,防护并不均衡,仍有数据被逐步带出的空间。
第三,生物与化学等跨界风险被识别为“高级能力”后,仍主要依靠在线分类器和推理监控器。公开材料显示,系统对生产流量进行全部扫描,并使用主题分类器识别生物相关内容、推理监控器识别潜在武器化意图。这虽然形成了一定防线,但外部独立验证和持续反馈仍处于早期,尚不能视为成熟的跨域治理机制。
风险一旦越过监控,可能带来哪些危害
文件本身已经给出几条清晰的后果链。如果智能体在访问银行、邮箱等敏感场景时被诱导,用户一旦切换页面,攻击者可能利用逐步数据泄露方式取得账号控制权。正因为此,OpenAI 在发布阶段采取了冻结敏感操作、关闭记忆功能、限制终端网络请求等措施。但这些措施从侧面说明,只要智能体拥有浏览器、工具和账户访问权,被攻破的代价就从“一次错误回答”升级为“持续的数据外泄和越权操作”。
更远期看,当模型能自主发现零日漏洞时,传统上由安全研究人员和厂商共同维持的补丁节奏会被打破。防御方可能尚未完成评估,攻击链已经可以自动化展开。生物风险方面,文件还披露了模型能够综合公开文献内容,虽然没有发现明确的武器化能力,但这一风险类型已经被纳入内部预警。对监管而言,这意味着不能只盯着传统的网络安全指标,也必须把生物、化学等跨域风险纳入同一套评估体系。
监管框架应当回应的几个关键点
第一,把“能力阈值”作为触发监管审查的硬门槛。当一个系统达到能自主发现并利用未知漏洞,或在生物化学领域被评估为高级能力时,仅靠企业自查已经不够,应当进入更严格的外部评估、能力披露和权限限制。文件中“仅向防御侧开放”是一种临时缓解,但不是可复制、可验证的制度安排。
第二,要求高风险智能体具备可审计的最小权限。文件中的做法——访问敏感页面时冻结操作、禁止危险请求、限制网络请求类型——具有参考价值。监管可以将其转化为强制性基线,而不是自愿选项,并定期检查第三方兼容情况,避免安全能力只被少数内部系统覆盖。
第三,建立攻防时效与外部验证机制。模型在 ExploitBench 达到 100%,意味着漏洞利用速度可能超过传统披露周期。监管需要明确:具备这类能力的系统,其漏洞发现信息是否必须同步给受影响的防御方;对能自动发现零日漏洞的能力,是否需要独立红队、漏洞赏金或跨机构验证作为持续条件,而不能只停留在发布前测试。
第四,把生物与化学等跨域风险纳入前置审查。公开资料已经显示,即使尚未确认武器化,也需要在线分类器、推理监控器和专项赏金计划共同作用。这类风险不应由企业自行决定阈值,而应纳入公共卫生、生物安全等部门的联合评估,在模型进入高风险使用场景前完成跨领域审核。
这些公开信号的价值不在于归因,而在于暴露时间差。安全页面说“安全不会停”,但真正的问题是,当模型越过关键门槛后,监管、审计和第三方制衡是否能同步启动。过早禁止会限制防御性研究,过晚介入又可能错过修补窗口。对监管机构而言,眼下最需要的不是等待一个完整答案,而是把已经可见的能力信号变成可执行、可验证的触发条件。
关于文章版权的声明:
https://news.softunis.com/72958.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!
