企业级 AI 智能体的验收,不能以“完成一次演示”为标准。真正需要验证的是:在不同输入、权限和系统状态下,智能体能否反复推进真实业务流程;遇到异常时能否及时停止并交给合适的人;最终结果能否被审计、衡量,并在可接受的成本内持续产生业务价值。
验收对象不是模型,而是任务闭环
一项合格的验收,首先要定义任务的输入、目标、约束、输出和失败条件。任务规划必须能够映射到业务流程,明确哪些步骤可自动执行、哪些步骤需要审批,以及每个关键节点如何验证。只有“计划完整”而没有状态记录和结果校验,不能证明任务具备交付能力。
工具调用则要重点检查业务系统是否真的发生了正确变化。参数需要经过校验,查询、修改、发送和删除应具有不同权限边界;调用失败时不能无限重试;关键操作还应保留日志、返回结果和责任信息。若智能体只是生成结果,再由员工手动录入系统,其本质仍是内容生成,而非流程自动化。
异常与人工接管必须纳入验收
企业上线后面对的通常不是顺利路径,而是数据缺失、重复记录、权限不足、接口超时和规则冲突。验收应区分可自动恢复、需要重新规划和必须人工介入的异常,并统计异常率、自动恢复率、误处理率和转人工率。一个“完成”但结果错误的任务,风险可能高于明确失败。
人工接管也不是补丁,而是企业级系统的组成部分。验收时应确认触发条件、责任人、响应时限和接管上下文是否清晰。人工需要看到已完成步骤、调用记录和待处理问题,并能够批准、驳回、修改或重新分派。接管后的处理时长与错误率,同样属于核心指标。
用业务结果完成最终判定
验收指标至少应覆盖四类:过程指标,如完成率、耗时和工具调用成功率;质量指标,如准确性、返工率和人工修改比例;经济指标,如单任务成本、节省工时和返工成本;组织指标,如使用频率、接管效率和员工接受度。
试点前应建立人工基线,试点中专门测试缺失、冲突、超权限等非正常样本,上线前则要确认日志审计、成本拆分、灰度范围、暂停开关和退出方案均已具备。闭环验收的核心,不是追求全流程无人化,而是证明智能体能在明确边界内自主推进,在不确定时及时停下,并把足够的信息交给人处理。