企业评估智能体,不能只看模型是否“会回答”,而要判断它能否在真实业务约束下持续完成任务。可执行性本质上是一个系统属性,至少涉及任务理解、任务规划、工具调用、状态管理、长期记忆、权限控制和运行审计。模型能力只是其中一环,不能直接等同于业务可用性。
先看任务能否被验证
评估应从具体业务目标出发,而不是从模型参数或演示效果出发。以“整理客户续约风险报告”为例,智能体需要识别客户范围、时间区间、风险指标和数据来源,并完成查询、比对、分类与输出。如果系统只能生成一段分析文字,却无法说明依据了哪些数据、执行了哪些步骤,就不具备完整的任务执行能力。
重点要观察三点:目标能否拆解为有先后关系的子任务;数据缺失、工具失败或流程中断时,能否重试、调整路径或请求人工介入;执行结果偏离目标时,能否暂停并重新规划。能否保存任务状态,也决定了流程中断后是继续执行,还是被迫从头开始。
再看执行是否可控
工具调用必须具备身份、权限、参数校验、结果反馈和执行留痕。企业应明确工具用途、适用范围和调用主体,防止错误对象或超范围指令进入业务系统;对付款、合同变更、客户权益和生产控制等高影响动作,应将建议生成与实际执行分离,设置人工确认、分级授权或回滚机制。
长期记忆同样需要边界。企业应规定记忆什么、保存多久、谁可以使用,并支持过期信息更新、错误记忆纠正和历史依据追溯。记忆越丰富,错误信息被持续放大的风险也越高。
用四层框架做验收
立项和试运行阶段,可依次核查能力、工程、安全和应用四层:能力层检验复杂任务、异常输入与数据缺失;工程层检验工作流编排、状态管理、接口管理和监控;安全层检验权限、日志、审计与停用机制;应用层则确认结果可验证、责任可追溯,并确实服务于业务目标。
最终的判断标准不是“智能体看起来多自主”,而是企业能否清楚回答:它读取什么、调用什么、谁授权、谁确认、出错由谁负责,以及整个过程能否被复盘。能回答这些问题,才接近生产级可执行性。