大模型推理速度如何公平复测?

话题来源: NaiveAI发布3090亿参数开源权重模型:最高每秒推理2000个词元,指标如何核验?

复测大模型推理速度,关键不是把两个峰值数字放在一起,而是让模型在同一负载、同一计量口径和可追溯配置下接受测试。NaiveAI公布的每秒2000个词元是“最高”速度;在没有完整测试配置时,它不能直接代表单次对话体验,也不足以支持模型间公平排名。

先定义测的是什么

单请求生成速度与多请求整体吞吐不是一回事:前者更接近用户等待答案时的体验,后者反映系统同时处理请求的能力。复测前应明确报告哪一种,并同时记录首词元延迟、完整响应时间和生成速度,避免只挑对结论有利的指标。速度统计还应说明是单次结果还是多轮测试的汇总。

固定负载与部署条件

比较模型时,应统一输入长度、输出长度、并发请求数、批处理方式和解码设置,并记录GPU型号与数量、精度、推理框架及运行时配置。对支持长上下文的模型,还应区分常规输入测试与长输入测试;不能用短输入下的结果推断百万词元上下文场景的表现。

同一模型复测也要固定这些条件。若采用FP8或投机解码等不同优化方式,结果应分开呈现,不能把优化后的峰值与另一模型的常规部署结果直接比较。测试脚本、配置和原始日志应一并公开,方便他人确认负载是否一致、结果能否重现。

公平复测不止看速度。精度或部署方式变化可能影响任务质量,因此还应在相同任务上核对答案质量、失败情况、显存占用与算力成本。对生产选型而言,稳定可复现的吞吐和成本,通常比一次最高速度更有决策价值。

发表回复

登录后才能评论