智能体故障恢复压测,测的不是它能否在出错后继续生成内容,而是故障发生时能否识别阻塞、保护已有成果,并在边界清楚的前提下恢复流程。若页面加载失败后重复检索、表格写入异常后重复添加记录,或把缺失字段猜成事实,流程表面上可能继续了,结果却已不可信。
先定义故障与恢复标准
可从任务中预设几类可控故障:页面无法加载、关键字段缺失、表格格式异常。每次测试只改变明确的故障条件,其余任务、资料和权限保持一致;故障应发生在不同流程环节,以观察错误是否会传递到后续步骤。测试环境还应避免真实发送邮件、删除资料或修改业务数据,确保压测本身不会造成实际后果。
每种故障都要事先写清合格标准。恢复成功不等于“继续执行”,而应同时满足:说明受阻原因;保留故障前已完成且正确的结果;重试时不产生重复写入或覆盖;无法安全继续时停止并请求人工处理。尤其要区分可重试的临时阻塞与信息不足:前者可以在确认结果未重复后重试,后者应标记待核实,不能靠补全猜测来维持流程。
记录恢复质量,而非只记成功与否
每次运行应保留故障发生位置、智能体采取的动作、已完成步骤、重试结果、人工介入及最终数据状态。除恢复成功占比外,还要单独统计恢复失败、重复操作、错误信息沿流程传播和越权尝试。被拦截的高风险行为仍是风险事件,不能因最终任务完成而抵消。
压测结果应逐次复核,而不只看平均表现:少数运行若造成原始数据被覆盖,或将不确定信息写入后续邮件,平均恢复率并不能说明安全。只有当故障可复现、恢复条件可核验、失败后能安全停下,才有依据逐步扩大自动化范围。