AI试点最容易犯的错误,是先展示模型能做什么,再寻找它能解决什么。这样做往往只能证明功能可用,却无法证明业务改善。业务基线的作用,正是把“AI看起来有效”转化为“流程确实变好了”:在试点开始前,先记录任务量、处理时间、质量、成本和实际使用情况,才能判断变化是否来自AI,以及变化是否足以抵消投入。
基线决定项目能否验收
“效率提升”“准确率提高”“体验更好”都不是可直接验收的目标。以合同处理、售后工单分类或供应商资料初审为例,至少要先知道一段连续周期内处理了多少任务、平均和中位处理时长是多少、返工与错误的比例如何、涉及多少人工工时。
其中,不能只看某个局部动作。AI生成内容的速度变快,不代表整体流程更快;分类结果更准确,也不代表后续复核和返工减少。真正有意义的指标,应覆盖从任务进入到最终完成的完整流程。对于波动较大的业务,还要同时关注最长等待时间,避免平均值掩盖高峰期问题。
质量基线同样不能被模型测试准确率替代。真实业务中存在缺失信息、异常格式和复杂样本,试点数据应尽量覆盖这些情况。否则,项目可能在演示中表现良好,进入实际流程后却增加人工修改和复核负担。
基线也是责任边界
基线不仅用于计算收益,还用于明确谁对结果负责。项目开始前,应写清楚AI负责提取、分类还是提出建议,哪些结果必须人工确认,异常任务由谁处理,错误发生后由谁纠正。没有责任归属,即使指标有所改善,也可能因为一线人员不敢使用而无法落地。
更稳妥的做法,是先限定一个部门、一类任务或一段流程,保留人工复核和原有处理方式,连续记录AI输出、人工修改、最终结果与异常情况。试点结束后,再将实际数据与上线前基线对照,判断是继续扩大、调整方案,还是及时停止。
因此,业务基线不是项目文档里的前置形式,而是AI试点的判断依据。它让企业在投入之前说清楚问题是否值得解决,在试点之后判断改善是否真实,也让失败能够被定位为数据、流程、责任或方案问题,而不是笼统归因于“AI还不成熟”。