推理模型的能力提升如何验证?

话题来源: 【每日AI必读资讯】AI智能体与大模型最新动态精选10条(2024年9月14日)

2024年9月,OpenAI O1 发布时被反复引用的一个数字,是它在 AIME 上取得 83.3% 的准确率,而 GPT-4o 为 13.4%。这种量级的差距很容易被读成"推理能力飞跃"的直接证据。问题在于,一个基准上的分数跃升,本身并不能证明推理能力发生了变化,只能证明模型在这类题目上的表现变好了。评估者真正要回答的问题,是这种变好来自哪里。

先区分"答得对"和"会推理"

模型答对一道题,至少有三种可能来源:训练数据里存在相似题型、更长的思考链路带来了试错空间、或者题目恰好落在模型熟悉的分布之内。O1 引入了把复杂问题拆解成小任务再逐步处理的思维链构建方式,这类机制改变的是搜索与分解的效率。但效率提升是否等价于通用推理,需要用训练分布之外的题目来检验——题型、表述方式、难度层级都要与训练数据保持距离,否则测到的仍然只是记忆的边界。

控制可比条件,而不是只看单点成绩

把新模型的高分直接与旧模型的低分并列,隐含了一个假设:两者在同等条件下作答。实际上,推理模型往往获得了额外的思考预算。验证时需要把提示格式、允许的思考长度、可用的计算量对齐,再看差距是否保留。如果优势只在放宽预算后出现,那它更接近"花更多算力换更好答案",而不是推理机制本身的改进。

另一个容易被忽略的维度是稳定性。同一模型对同一批题目的多次采样,正确率会有分布。如果某道题只是偶尔做对,说明它处在能力边缘;如果多次采样都能稳定命中,才更接近掌握。只看一次运行的汇总准确率,会把这两种情况混在一起。

过程检查不可省略

仅凭最终答案,无法分辨是链式分解起了作用,还是模型在末尾给出了一个碰巧正确的结论。比较可靠的做法是同时查看中间步骤:推导是否自洽、是否出现重复循环、偏离后能否自我纠正。推理模型典型的失败形态并不是答案写错,而是链路在某一环走偏之后再也回不到正确路径上。只统计结果,这类失败会被高分掩盖。

判断一次推理能力提升是否真实,实际可以归到几个问题上:测试集与训练数据是否隔离;提升在分布外任务上是否保留;在同等算力与提示条件下优势是否仍然存在;多次采样下是否稳定复现;以及失败样本的链路究竟断在哪里。单点高分适合用来发布,能同时通过这几问的分数,才适合用来下判断。

发表回复

登录后才能评论