AI滥用风控的核心,不是判断某个模型“危险不危险”,而是识别模型如何进入企业的业务链路。模型一旦连接客户数据、代码仓库、邮件系统、社交账号或生产环境,生成能力就可能转化为传播、欺诈、数据泄露和自动化攻击能力。因此,风控对象应从单一模型扩展为“模型—数据—身份—权限—执行结果”的完整链条。
Anthropic披露的相关案例覆盖虚假新闻网络、社交媒体监控、影响行动、网络诈骗和恶意软件等场景。对企业而言,重要启示并不是把个案直接视为行业规模,而是观察风险如何落到自身流程:谁能调用AI,模型能读取什么,输出是否经过核验,异常操作能否被发现,事件发生后由谁负责处置。
闭环的四个控制点
第一是事前准入。企业应建立AI资产台账,记录使用的模型、智能体、API及其数据连接,并按业务风险划定边界。涉及付款、身份验证、客户数据、源代码、生产部署和对外传播的场景,应设置更严格的权限与人工审批。模型能读取资料,不代表它可以导出、转发或修改资料;能生成代码,也不代表它可以直接执行代码。
第二是事中核验与监测。涉及品牌声明、客户承诺、财务数据、法律合规和公共事件的内容,必须核对来源、人物、时间和数据,不能只看文字是否通顺。监测重点也不能停留在输出内容本身,还要关联账户、设备、数据访问和执行动作。异常时间调用、无关数据读取、批量发送相似内容、应用权限突然扩大,都应触发进一步核查。
第三是事后响应。发现疑似滥用时,应先确认涉及的账户、模型、数据和传播渠道,再暂停异常账户、撤销凭证、切断高风险连接,同时保留访问日志、输入输出记录及沟通证据。安全、法务、公关、人力和业务负责人需要按照预设流程分级协同,而不是临时寻找责任人。
真正有效的闭环,还必须回到复盘:问题究竟源于账户被盗、权限过宽、审核失效,还是员工受到社会工程诱导?只有把原因反馈到准入、权限、核验和监测环节,企业才能避免同类事件反复发生。AI风控的边界,最终由它能接触什么、能代表谁、能执行什么来决定。