企业智能体从试点进入生产,真正的难点不是“能否完成一次任务”,而是能否在复杂、持续变化的业务环境中稳定承担责任。生产治理应围绕三个问题展开:是否只在授权范围内行动,任务成本能否核算,出现错误后能否还原过程并明确责任。这三项分别对应可控性、可核算性与可追责性。
先把任务拆成可验证节点
企业不能只用最终成功率评估智能体。一次“查询并处理”可能包含身份识别、数据读取、规则判断、工具调用、系统写入和通知发送。评估时应分别检查:意图是否识别正确,读取的数据是否必要且合规,工具选择和参数是否符合规则,结果是否可验证,人工复核是否完成,以及写入操作是否正确、可逆。
高风险流程尤其要区分结果质量与过程合规。一次越权调用,即使最终被人工纠正,也应记录为治理事件,而不能简单计入成功任务。
权限、成本与数据必须同时治理
智能体权限应绑定具体任务、用户身份、数据范围和操作场景,而不是笼统授予一个智能体。权限可以分为只读、建议、受限写入和高风险操作;涉及付款、合同、客户权益或生产环境变更时,应设置人工确认。同时限制工具调用次数、顺序和参数格式,连续失败时触发熔断,跨系统写入采用幂等设计,避免重复执行。
成本核算也不能只看模型输入输出产生的费用。工具调用、检索、失败重试、人工复核和异常处理都应纳入单任务或单个有效结果的成本。若几乎每个输出都需要员工重新核验,智能体可能只是改变了工作界面,并未形成稳定收益。
数据隔离则要覆盖上下文、检索结果、临时缓存、调用日志和最终输出。企业应明确不同部门和业务线的数据边界,防止多轮任务串联泄露信息,并设置脱敏、最小化留存、访问审计和异常告警。
用分阶段准入替代一次性上线
较稳妥的路径是先影子运行,只观察真实数据下的错误、越权和成本变化;再开放低风险、可撤销的有限自动化,高风险动作保留人工确认;达到预设标准后进入受控生产,并持续保留抽样审计、版本回滚和人工接管能力。
模型、提示词、知识库、工具接口或业务规则发生重要变化时,原有评估不能自动延续,关键任务必须重新验证。最终,企业验收的应当不是一段顺畅演示,而是权限清单、失败样本、成本明细和审计记录。只有做到“出错可停、过程可查、责任可定”,智能体才真正跨过生产门槛。