智能体供应商尽调看什么?

话题来源: 网信办《实施意见》提出健全智能体合规服务体系:企业采购不能只看模型能力

智能体供应商尽调,核心不是确认“模型答得好不好”,而是判断供应商能否让系统在真实业务中安全、稳定、可追溯地运行。智能体具备自主感知、记忆、决策、交互和执行能力,其风险取决于模型、数据、权限、外部工具、人工复核和运行环境的组合。采购方因此应把尽调从产品演示前移到业务边界、技术架构和持续运营能力。

先看业务边界与权限控制

供应商必须清楚说明智能体适用哪些任务、禁止执行哪些任务,能够访问哪些数据、系统和工具,以及权限如何授予、收回和审计。尤其要核验高风险操作是否设置人工确认、异常中止和回滚机制。

对能够发送邮件、修改业务数据、执行交易或控制设备的智能体,不能只依赖提示词约束。更可靠的判断标准是:是否遵循最小权限原则,是否限制工具调用范围,是否保留完整日志,是否能在异常时冻结账号、关闭工具或切换人工流程。

再看测试是否覆盖任务闭环

供应商提供的测试不能停留在单次问答准确率或演示效果,而应覆盖“理解任务—规划步骤—调用工具—完成结果—人工复核”的完整链路。采购方应要求其说明测试范围、方法、样本和限制条件,并重点检查四类风险:

  • 结果是否可靠,引用依据和输出格式是否符合业务要求;
  • 遇到恶意指令、冲突指令、异常权限或信息不完整时,是否会越权;
  • 是否记录输入、关键决策、工具调用、人工干预和最终结果;
  • 模型、知识库、插件或接口变更后,是否重新评估。

如果发生错误,企业还应能区分问题来自模型判断、数据质量、权限配置还是工具接口,而不是只能得到一条无法复盘的结果。

重点核验持续服务能力

检测评估、风险监测、预警响应和咨询支持,不应被当作一张孤立的合规证书。尽调时应追问:供应商能否持续发现敏感信息暴露、越权调用、错误执行和服务波动;重大风险由谁通知、多久响应;是否支持暂停服务、撤销权限和版本回滚;认证或评估针对的是具体产品、版本、场景,还是某一时间点。

上述要求应写入合同和服务级别协议,并形成可验收交付物,例如评估报告、风险清单、监测报表、事件通报和版本变更说明。最终要判断的不是供应商能否承诺“安全”,而是风险能否被发现、异常能否被控制、问题能否被复盘。只有形成这一闭环,智能体才具备持续进入业务系统的条件。

发表回复

登录后才能评论