企业智能体验收中最常见的偏差,是把功能演示通过等同于具备生产运行条件。演示只能证明系统在预设路径上能够返回结果,却无法回答两个更关键的问题:它是否能在连续业务任务中保持质量稳定,以及它是否能在出错、越权或指标波动时被有效管理。因此,生产运行验收不能只围绕“能不能完成”,而应同时检验“能不能运营”。
验收指标至少需要分成三个层次。功能验收判断任务是否按要求完成、输入输出格式是否合规、异常分支是否可处理;质量验收关注准确性、一致性、时效性和人工修改比例,并需要明确指标如何抽样与复核;运营验收则检查权限、日志、告警、版本管理、数据隔离、人工接管和问题响应机制是否已经建立。功能层最容易被供应商的演示和测试用例覆盖,运营层才是生产环境与试用环境的真正分界。如果只有功能演示通过,项目文件中应明确标注为阶段性结果,避免被包装成正式上线。
在可运营性指标中,有效完成率比完成率更有解释力。智能体返回了结果,与结果不需要大量返工,是两件不同的事。人工接管发生在哪些环节、错误类型如何分布、单位任务成本是否随使用规模变化,这些问题比单纯的调用次数更能反映系统是否真正承接了业务。调用量上升既可能代表使用扩大,也可能源于失败重试增多,因此必须与有效任务数、用户留存和业务结果质量结合起来解释。
权限治理是生产运行指标中不能后补的部分。智能体可能读取数据、调用工具并执行动作,验收时需要确认是否按用户、角色、部门和任务分配最小权限,高风险操作是否设置人工审批或双重确认,访问与调用是否留有审计记录,敏感信息是否脱敏隔离,以及异常任务的暂停、回滚和责任归属是否清晰。缺少这些控制,即使质量指标暂时达标,也不应被视为具备生产运行条件。
这些指标不能脱离业务场景统一打分。客服场景更看重响应质量与升级率,研发场景更关注代码审查与缺陷情况,财务或供应链场景则对权限、可追溯性和错误代价更敏感。生产运行验收的本质,不是给智能体一个通用分数,而是确认它在既定任务边界、责任边界和数据边界内,能够被持续审计、维护和复盘。