Epoch AI与Anthropic独立研究发现,GPT-5.6 Sol、Claude Fable 5等AI智能体可运行实验,但缺乏科学自我批判与原创思维,结果被夸大。

数据显示,Sol仅达到人类参考分的15%,且依赖已知方法。研究指出,当前AI大模型最大缺陷是无法批判性质疑自身结果,距离自主科研仍远。

该15%的得分揭示,AI智能体在科研场景仍需人类监督,产业落地自主研究尚不成熟。

来源:权威科技媒体 The Decoder