2026年10月8日,量子位报道,以PaperBenchX为代表的AI科研基准测试显示,ChatGPT在破解千禧数学难题后,论文复现率仅为13.98%。

该基准测试聚焦大语言模型科研实力评估,ChatGPT虽能解答高难度数学问题,但13.98%的复现率表明其研究结论的可验证性存在明显短板。有研究者指出,AI大模型在科研场景中需从“解题”转向“可复现方法输出”。

13.98%的复现率直接暴露当前AI大模型在科研落地中的可信度瓶颈,PaperBenchX类基准或成衡量AI真实科研贡献的关键标尺。

来源:量子位