AI客服上线后,最容易被误判的不是“有没有效果”,而是把会话量、响应率和互动率当成了效果。真正的验证对象应是:AI是否改变了用户从咨询到加购、从加购到成交、从成交到复购的行为,并且这种变化能否排除大促、投放和季节因素的干扰。
第一段:咨询到加购,先确认意图有效
总会话量不能代表商业价值。应先按会话内容区分售前咨询、售后查询、比价议价和无明确意图,再重点观察“有效咨询率”与“咨询到加购转化率”。有效咨询可限定为涉及尺寸、材质、库存、优惠等商品属性的问题。
加购还要区分主动与被动。用户主动点击商品详情页的加购按钮,更能反映推荐价值;由优惠券弹窗带来的加购,应单独统计,否则会高估AI导购能力。
第二段:加购到成交,验证订单归因
加购只是意愿,不等于AI促成了付款。可以通过会话ID关联订单,观察会话结束后30分钟到24小时内的支付;也可以将用户咨询过的SKU与后续成交商品关联,识别跨会话贡献。
但归因不等于增量。更可靠的方法是随机分流:一组使用AI客服或AI导购,另一组使用传统客服或标准自助流程,比较两组成交率、客单价差异。差值才接近AI带来的真实增量。
第三段:成交到复购,追踪行为而非满意度
满意度是态度指标,复购才是结果指标。应把领取会员权益、收藏店铺、加入粉丝群、点击复购提醒等关键动作回传至数据后台,再与30天、60天、90天内的复购订单关联。
同时观察复购率、复购周期和关联商品客单价。若复购周期缩短,或AI推荐带来关联购买,可能构成增量;但必须标注大促等外部活动影响,不能把同期自然增长全部归功于AI。
第四段:用对照验证“真实增量”
最终判断不能只看总GMV和订单量。除随机对照外,还可采用“AI初答、人工兜底”的混合模式,比较AI独立解决会话与转人工会话的成交表现。如果转人工后的成交率明显更高,说明AI的话术或商品匹配仍有短板。
执行前要先完成埋点,并保留上线前基线;测试周期应覆盖完整购买决策周期。复盘时只问三个问题:AI在哪个环节低于人工,哪里高于人工,哪些低价值会话不值得继续占用机器人资源。这样,团队评估的就不再是AI有多忙,而是它究竟创造了多少原本不会发生的生意。