长上下文评测不能只看模型标称的上下文窗口。真正需要测量的是:输入变长后,模型能否找到关键信息、依据证据完成推理,并在业务允许的时间和成本内稳定输出。上下文容量属于规格指标,不能直接等同于任务效果。
核心指标首先是长文本理解与召回质量。评测应记录事实准确率、关键证据召回率和引用完整性,并把关键信息分别放在文档开头、中间、结尾以及多个文档之间,观察是否出现明显的位置偏差。知识库问答还应加入版本冲突、跨文档关联和无答案问题;合同审阅要检查主合同、附件与补充协议之间的条款关系;代码分析则要验证跨文件调用、异常路径和问题定位。模型“读完了”不等于“找对了”。
第二类指标是可靠性与可审计性。应关注无依据结论比例、拒答质量,以及模型能否明确指出结论对应的条款、代码位置或知识来源。对于高风险任务,答案是否看起来完整并不重要,能否区分确定信息与不确定判断更重要。若模型在缺少证据时仍然强行作答,长上下文只会扩大错误传播范围。
第三类是系统效率。除了平均响应延迟,还要记录长尾延迟、单任务成本、失败重试、工具调用失败,以及多轮对话中的信息丢失。输入规模增加后,延迟、调用成本和上下文重复传递可能同步上升。因此,评测不能只比较一次回答的质量,还要观察不同长度梯度下效果何时开始下降,以及下降是否稳定可预测。
最后是数据安全与运营边界。合同、源代码和内部制度进入模型后,应核验数据保存、日志审计、权限控制、租户隔离及第三方处理范围。较完整的评测流程应采用脱敏真实样本,在短、中、长输入下进行盲测,再通过小流量运行观察人工修改率、成本和安全事件。
判断长上下文是否值得采用,关键不是“最多能塞多少内容”,而是模型在目标任务中能否稳定召回、准确引用、合理拒答,并在可接受的成本和风险内完成工作。