接口返回成功,只能证明一次调用在技术层面完成,并不代表用户提出的任务已经完成。对于 AI 智能体而言,模型、检索、工具和状态更新可能都正常返回,但最终结果仍可能缺少依据、违反业务规则,甚至执行了错误操作。把“成功”直接等同于“完成”,是生产系统中最容易被忽略的判断错误。
成功至少有四个层次
第一层是技术成功:请求没有超时,模型或工具返回了结果。第二层是流程成功:智能体按规定步骤执行,没有跳过权限校验、违反状态机,或在重试中陷入循环。第三层是内容合格:回答事实一致、格式符合要求,并能说明依据。第四层才是业务有效:用户的真实目标已经达成,或者任务被可靠地转交人工处理。
因此,一个 HTTP 状态正常的请求,仍可能在后面三层失败。例如工具返回了格式正确但内容异常的数据,智能体据此生成了看似合理的回答;又或者模型成功输出了文本,却没有完成订单更新、通知发送等实际动作。此时监控若只记录请求成功率,就无法识别“成功返回的错误结果”。
判断任务是否完成,要看结果而非状态码
生产链路应把一次请求拆解为模型调用、知识检索、工具执行、权限决策、状态更新和最终响应等步骤,并通过统一链路标识关联。每个步骤都需要记录输入输出摘要、状态、错误原因、版本和终止原因。对于重试、循环和并行调用,还要保留调用序号及父子关系,否则总耗时正常也可能掩盖了无效重复执行。
质量评估也不能只看模型是否生成答案。应同时检查任务完成度、依据充分性、工具选择正确性、格式合规性和安全策略遵守情况。关键业务可以使用固定样本、历史故障样本和线上抽样进行持续评估,并将结果与模型、提示词、知识库及工具版本绑定,避免质量下降时无法定位变更来源。
把业务结果纳入验收标准
真正可靠的判断是:任务是否完成了预期动作,是否产生了正确且可审计的结果,是否在权限和成本边界内结束。若工具失败,应明确重试、降级、转人工或终止;若循环次数、工具调用次数或成本异常,应及时止损。只有把流程、内容、业务、安全和成本共同纳入监控,系统才不会被“成功返回”制造出的假象误导。