“能在设备上运行”只能证明技术路径成立,不能证明端侧模型具备生产可用性。企业真正要验证的是:模型能否在指定硬件、真实数据、既定权限和网络条件下,持续完成目标任务,并且具备可接受的风险、成本与维护机制。
先定义任务,再谈模型能力
生产验证不能从参数规模或离线宣传开始,而应从业务任务开始。文档分类、摘要、语音转写、指令识别、内部知识检索和弱网环境下的固定流程,对准确性、延迟、功耗、上下文处理和数据更新的要求并不相同。公开演示中的单轮问答,不能代表模型能够理解企业术语,也不能证明它能在多步骤流程中稳定执行。
验证时应建立与业务一致的测试集,覆盖正常输入、边界输入、敏感内容和模型无法判断的情况。除了任务成功率,还要记录错误类型、人工复核比例、连续运行后的性能变化,以及模型在不确定时是否会暂停确认,而不是继续执行错误操作。
四项核验决定能否上线
第一是隐私。需要确认推理、日志、遥测、错误上报、远程运维和模型更新分别在哪里完成;“本地运行”不等于所有数据都留在设备或内网。输入、输出、缓存和临时文件的保存、清理、加密与审计同样属于验证范围。
第二是端到端延迟。不能只看单次推理速度,还要纳入数据预处理、检索、权限判断、工具调用和结果返回。离线智能体还应测试网络中断、恢复和多步任务失败时的行为。
第三是全生命周期成本。比较端侧与云端方案时,不能只计算推理费用,还应纳入硬件、存储、适配、授权、运维、更新、能耗、安全管理和业务失败成本。可采用统一口径:总成本等于硬件与部署成本、运维成本、模型更新成本、安全合规成本和业务失败成本之和。
第四是治理与回退。上线前必须明确访问权限、操作留痕、输出审核、版本回滚、故障恢复和责任边界。优先选择低风险、可量化、可逆的任务开展小范围试点,暂不把未经验证的模型用于不可逆决策或关键生产控制。只有测试条件可复现、结果可追溯、失败可回退,端侧模型才算真正跨过生产门槛。