大模型在顾客评价分析中最被看好的能力,是理解自然语言的语境、指代和复合情绪,从一段话里拆出多个独立观点。但正是在"语境理解"这一环,误判反而最容易发生。原因不在于模型不够强,而在于顾客评价本身是一种高度依赖情境的语言,而模型拿到的往往只是被剥离了情境的一段文本。
一个典型的失准来源是复合与转折结构。像"菜品好吃但等位太久"这类评价,正负观点并存,模型需要同时完成情绪切分与维度归属。一旦句子出现多重转折、让步或条件从句,模型可能把情绪错误地整体归到某一个维度上,导致"服务差评"被误记成"菜品差评"。维度越细,这种错配带来的统计偏差越明显。
更隐蔽的是反讽、夸张与行业黑话。顾客用"服务好到让人害怕""这价格也是没谁了"表达的真实态度,与字面情绪常常相反。模型若只做字面情绪判断,就会把负面当成正面,或把中性调侃计入负面。这类表达没有稳定的语法标志,依赖的是说话人与场景的共同背景,而这些背景并不包含在评论文本里。
指代与省略同样是误判高发区。评价中的"它""这家""上次那个"往往指向模型看不到的上下文——可能是另一条评论、一次历史消费,或平台默认的对象。当身份、门店、消费场景没有被充分关联时,模型只能基于孤立文本猜测指代,猜错就会把问题归到错误的门店或环节。
还有一层来自数据侧的放大效应。评价进入模型之前要经过归集、清洗与过滤,而过滤规则和标签体系都由人定义。如果有效内容的判定口径偏窄,或问题标签设计得过粗,模型即便抽取正确,也会被迫映射到不贴切的标准标签上;脏数据与模糊标签会把个别误判沉淀成系统性偏差。
因此,减少语境误判并不是单纯换一个更大的模型,而是要在三处同时发力:为评价补足门店、订单、会员等情境字段,让指代有迹可循;用运营知识持续校准过滤规则与标签体系;并保留人工复核的出口,让一线对可疑结论做判断。模型负责把问题说清楚,但判断它是否说对了,仍需要情境和人的参与。
