“支持百万Token”只能说明系统允许承载更长输入,不能证明模型会稳定使用其中的信息。超长上下文的验收,核心不是测一次能否返回答案,而是确认关键信息在不同位置、不同噪声和不同版本条件下,是否仍能被准确提取、正确关联,并在成本与时延可控的情况下完成业务任务。
先定义可验收的任务
验收对象应从“回答质量”改为完整业务任务。例如,针对会议材料,可要求模型从录音、会议文档和图片中识别决策事项、责任人、截止日期及存在冲突的内容;针对长文档,则应要求它定位依据、区分不同版本,并明确哪些结论缺少证据。
每项任务都要预先规定结果字段和错误边界,包括关键信息召回情况、事实错误、遗漏、人工返工比例,以及无法判断时是否能够主动说明不确定性。笼统评价“摘要流畅”没有验收价值,因为语言自然并不代表信息完整。
用扰动测试检验稳定性
同一份材料至少应进行多轮位置和内容扰动:将关键事实分别放在上下文开头、中间和结尾;加入重复段落、版本差异、无关材料和相互矛盾的信息;改变提问方式,但保持任务目标不变。比较各轮输出是否保持一致,尤其要观察模型是否遗漏中段信息、误采信旧版本,或把无关内容当成依据。
测试还应逐步增加输入规模,记录响应时间、失败率、重试情况和实际成本。输入越长,系统越需要验证是否出现性能下降、输出截断或成本不可预测,而不能仅依据接口允许的最大容量作判断。
验收必须包含降级与安全边界
生产系统不应把超长上下文当作默认路径。应明确设置超过处理能力、信息冲突、字段缺失或模型无法确认时的处理方式,例如自动切分、检索、转人工或仅生成待审核草稿。涉及会议录音、客户资料、代码和内部文档时,还要检查数据保存、访问权限、日志审计和敏感信息暴露风险。
最终验收应以真实样本的小规模压测为起点,比较模型输出与人工基准,并在灰度运行中持续记录错误类型。只有当准确性、稳定性、成本和安全边界同时满足业务要求时,超长上下文才算具备生产价值;“能塞进去”只是容量测试,不是稳定性验收。