AINEWS Search
Topics and information types

人工智能 AI 安全与评测 发布评测 学术研究

Back 量子位 AI 报道
量子位 AI 报道· · Original publication time

UniPat AI releases PaperBenchX to test AI’s ability to reproduce scientific papersMachine translation

Automatically verified and published · Generated and evidence-checked automatically; not reviewed by a human.

AI-assisted summary

PaperBenchX turns 93 papers across 12 research areas into reproduction tasks, requiring AI agents to submit workflows that can be rerun in an isolated environment. In this benchmark, the best-performing GPT-6 Astra fully reproduced 13.98% of tasks; the team has opened 12 tasks and kept 81 closed.

Article · Original

The article text is unavailable in this language; an existing version is shown.

PaperBenchX为代表的基准或许能更好地衡量AI的科研实力

允中 发自 凹非寺 量子位 | 公众号QbitAI

OpenAI最近真是频频往数学界扔重磅炸弹。

上个月,OpenAI宣布其AI模型仅用88小时,便攻克了困扰人类百年的千禧年七大顶级数学难题之一——N-S方程;昨天,又放出722篇数学手稿,千禧难题又有仨。

但在UniPat AI发布的PaperBenchX测评中,面对93个真实论文复现任务,表现最强的GPT-6 Astra,完整复现率却只有13.98%。

△10组受测配置在93个复现任务上总体与分阶段表现

随橙想! 当前模型已经能取得破解千禧年数学难题这样的伟大突破,但很少能完成一次可靠的端到端科学复现。

(正经脸)这引发了一些思考:在广泛的AI for Science领域中,我们要以什么标准判断「做对了科学」?本着严谨踏实的科研态度,迈向AI数学家乃至General AI Scientist的第一步到底是什么?我们又该如何形成一套可验证、可比较的标准,真正衡量AI在科学研究上的进步?

该用什么尺子衡量AI在科学里的进步?

此时此刻,让我们再细品陶哲轩、邓煜等25位菲尔兹奖得主联名发布的公开信。

他们肯定了大语言模型的数学能力急剧提升,已经能解决数学领域的重大难题,但也提出了更关键的问题: AI公司把解决数学问题当作基准测试 ,这对数学这门科学、对数学共同体都是有害的。

所以,这不是一封反对AI的信,它问的是一个更朴素的问题: 衡量AI在科学里的进步,到底该用什么尺子?

信里还有一句分量更重的话:把解决数学问题当作基准测试的错位问题,只是更广泛的错位问题的一部分,这种错位同样影响着其他科学与创意职业,乃至整个社会。

的确,上面提出的问题从数学领域扩展到自然科学乃至社会领域,只会更难回答。

数学至少还有最后一道防线:Lean。证明对不对,机器可以逐步检查,答案的真假有兜底。

可放到其他科学领域里,一个电磁仿真的反射系数、一条能带、一个收敛后的带隙,都没有Lean。一个和论文对得上的数字,背后可能是错误的物理模型、没收敛的仿真,或者碰巧凑出合理值的无效后处理。

所以,在衡量AI自主提出问题、设计实验、做出新发现的General AI Scientist能力之前,有一个更基础的问题: 它能不能可靠地把一项已经发表的科学工作重做一遍,并证明自己做对了?

这个问题的逻辑在于,由于复现有唯一正确的答案,因此可以被准确评估。

UniPat AI最近发布的一项工作 「PaperBenchX」 ,瞄准的正是这件事——它从93篇研究论文中构建了93个复现任务,这些任务横跨电磁、光子、化学、材料、生物、机器人等12个研究方向和10种领域原生科学环境,含3168条专家校验的评分项, 是国际上第一个多学科端到端论文结果复现的Benchmark。

△PaperBenchX的任务分布、来源论文与评分项构成

PaperBenchX的考试规则很简单:

Agent拿到一篇 真实论文 、一个装好了对应科学软件的 容器化环境 、以及一份说明「要复现哪部分」的 任务书 ;

Agent交回一份 可执行的复现工作流 ;

评分标准、容差、参考答案 全部对Agent隐藏 。

需要特别注意的一点是,论文本身是公开的,Agent当然能看到论文里的结果数字,但很明显的是,这场考试考的不是「猜答案」,而是考验AI能不能重建一条科学上成立的流程,并自己跑出支撑那个结论的证据。

所以,PaperBenchX测的到底是什么?

答案是:不测「得到了多少数字」,只认重新生成的证据。Agent交卷后,系统删掉全部输出、断开网络,在隔离环境里把工作流从头重跑一遍,评分器只相信重放产物。 可以说,在某种意义上,就是为科学仿真搭的一道「Lean」。

测得结果怎么样?

结果是:在93个论文复现任务里,表现最强的GPT-6 Astra,完整复现率只有13.98%。

这意味着,模型能够在不少任务中产出看起来合理的结果,但真正从头跑通完整工作流、生成与论文一致且可验证的证据,成功率还不到七分之一。

这就是今天的AI与能够跨越不同领域科学边界的General AI Scientist之间的距离。

PaperBenchX的意义在于第一次把这段距离量了出来 。

目前,UniPat AI团队从每个研究方向中选取1个代表性任务,共开源 12个测试任务 。这些任务覆盖不同研究方向和科学软件栈,可用于评测Agent、调试复现工作流,以及研究模型在真实科学环境中的端到端复现能力。

并同时维护81个封闭测试任务,以维持PaperBenchX的区分度和长期评测有效性。

13.98%背后,可靠复现卡在哪?

接下来,我们具体看一下PaperBenchX在同一组93个任务上所评测的10组前沿模型与Agent框架配置,分析测评出来的结果,弄明白可靠复现到底卡在哪。

△(a)为受测配置的阶段得分;(b)为交互轮数与得分关系;(c)为抽样轨迹的工作流时间分配

局部完成不等于完整复现

先来看图a,受测配置的阶段得分。可以看出在全部受测配置中,建模(Modeling)和执行(Execution)平均得分分别为62.70%和61.84%,验证(Validation)只有42.80%。

这意味着, Agent能够完成部分建模、调用求解器并生成结果文件,但这些结果不一定正确,也不一定能够证明结果真正支持论文结论。综合来说,它们还很难把各个环节串联起来,完成一次完整、可信的复现。

更多交互不意味着更好的复现结果

再来看图b,交互轮数与得分关系。轨迹分析显示,长时间运行往往意味着反复尝试、故障恢复,或者在错误的模型设定上继续计算。这说明,交互轮数越多,分数不一定越高。

前期决策决定后续执行是否有价值

再来看图c,抽样轨迹的工作流时间分配。以Fable 5为例,它将37.1%的时间用于论文重建和代码实现,是五个模型中前期投入比例最高的,但它反而能够用较少的交互取得接近最优的部分得分。

也就是说,论文理解、科学建模、参数选择和实验组织等前期决策是否合理,很大程度上决定了后续计算是否会变成资源浪费。

因为如果几何结构、边界条件、模式定义或关键参数在前期已经设置错误,那么求解器即使正常运行,也只是在计算错误的科学系统。前期一个错误决定,可能使后续数小时的计算全部失去价值。

综上所述,单看貌似跑通的结果或得出的最终输出,是无法区分不同失败原因的。有些Agent的实验成功运行,但科学模型或结果分析错误;另一些Agent则是因为缺少可信求解过程或代码有误无法完成重跑。

UniPat AI团队也进一步指出了要达成「可靠复现」的几个关键之处:

难点不在于「能不能跑通」,而在「跑通的东西是否在科学上成立」 :一个看似对上了的数字,可能来自错误的模型、不合适的参数、没收敛的仿真或无效的后处理;

对结果的评测必须建立在重新生成的证据上,而不是Agent的自述上 :删掉输出、断网、重跑、只认重放产物;

目前部分进展是真实的,完整复现仍然稀少 :Agent已经能写出合理的仿真并将其运行完成,但要让整个过程和最终结果都经得起验证,仍然很难。

PaperBenchX的差异化设计

把「整篇论文复现」确立为一种Agent评测范式,并不是UniPat AI首创,OpenAI的PaperBench也是类似的工作。

但过往的任务集中在机器学习论文领域,真正进入物理、化学、材料等科学研究场景后,复现一篇论文就不再是「把代码跑一遍」这么简单,会面临三个挑战:

理解科学问题 :论文不是一份可以照着执行的说明书。面对真实的科学问题,Agent需要自己理解研究目标,判断边界条件怎么设、色散怎么处理、哪些参数会真正影响结论,而不是简单按照README把代码运行一遍;

正确完成科学仿真 :把代码成功跑起来,只是第一步。分辨率、求解器容差、采样时长等参数只要设置不当,就可能导致完全错误的数值结果。Agent还需要读懂诊断信息,识别数值发散等异常,并判断什么时候需要调整参数、加密网格。这些都不是通用的代码执行能力,而是高度依赖具体学科知识的判断;

判断结果是否真的可信 :这是最容易被忽视、也最致命的一步。跑出一个和论文对得上的数字,并不意味着科学上做对了。错误的物理模型、尚未收敛的仿真,甚至不合理的后处理,都可能得到一个「看起来正确」的结果。因此,科学复现不像普通代码任务那样有一个简单的pass/fail标准,Agent还必须能够判断结果背后的科学过程是否可靠。

真正的科学复现,要求Agent完成一条完整的链路:先理解科学问题,再执行科学计算,最后验证科学结论。这三项恰好就是一个AI Scientist必须具备的基本功: 读懂科学、执行科学、判断科学。

所以可以理解为,PaperBenchX测的并不是Agent会不会运行一段科研代码,而是它能不能完成一套相对完整的科学工作流。

这也构成了PaperBenchX与已有类似基准的核心区别——这背后是这项工作的几个关键设计:

第一,Agent必须在真实的科学软件里工作,而不是换了一套学科数据的机器学习任务。

PaperBenchX覆盖12个研究方向、10种仿真平台,每个领域都有自己的参数体系、计算流程和收敛判据。已有基准(PaperBench、ScienceAgentBench等)基本局限在ML/Python栈里;PaperBenchX是第一个在不同学科领域让Agent直接面对Ansys HFSS、Ansys Lumerical、Meep、PySCF/GPU4PySCF、ABACUS这些领域原生求解器的复现基准。

第二,Agent提交的产物必须能够完整重新复现。

Agent提交后,系统会删掉全部输出、断网,并在隔离环境中重新执行整个工作流。只有能够在这一过程中重新生成的科学产物,才会进入后续评分——每条评分项锚定一个具体的科学要求,由程序检查和大模型打分判定。

第三,有限的时间预算,要求Agent自己完成科研过程中的取舍。

单任务预算 4 – 24小时,中位数7小时 。在这个时间窗口里,Agent需要自己决定如何分配算力:什么时候检查中间结果,计算失败后是否需要重新运行,哪些参数值得调整,以及有限时间内应该把精力放在哪些环节。这更接近真实科研中的工作方式,而不是一个可以无限尝试的代码执行任务。

第四,验证方式杜绝蒙混过关的可能。

一般的代码基准,跑一遍单元测试就知道对不对,但科学复现无法仅靠一个pass/fail判断。因此,PaperBenchX将验证拆成三个层次,每一层分别回答一个问题:

能不能重跑出来 :Agent提交任务后,系统会删除它生成的所有输出,断开外网,并在隔离环境中从头执行工作流。跑不出来的,直接不算。这一步过滤掉了所有手动拼凑结果、依赖缓存、从网上抄答案的可能;

证据能不能溯源 :必须能够追溯到对应的计算过程。比如,Agent声称某次仿真已经收敛,就需要提供相应的收敛记录;如果报告了某个物理量,就需要能够找到生成这一结果的仿真输出以及后续分析过程。这样,评测的不只是一个孤立的数字,而是支撑这个数字的完整证据链。

科学上站不站得住 :最后,评测系统再判断结果是否满足具体的科学要求。每一条评分标准都会对应明确的科学要求和所需证据。对于数值一致性、单位、误差容差等可以明确计算的问题,由程序自动检查;对于需要结合领域知识进行判断的问题,则交给LLM评审。

而且,Agent自己写的「复现成功」这类文字,永远不被当作证据,也不被当作对评委的指令。这样才能避免Agent通过写一份看起来很完整的报告,却没有真正完成背后的科学计算来「蒙混过关」。

那么,问题就进一步来了: 一篇论文里的科学结论,究竟怎样才能被拆解成一组可以执行、可以重算、也可以客观判定的要求?

PaperBenchX不是简单地把论文交给Agent,然后比较最终数字。每一道任务都要经过「构建候选任务」和「验证与审核」两个阶段,共九个步骤,才能正式进入评测。

△PaperBenchX的两阶段、九步任务构建与验证流程

也就是说,PaperBenchX把一篇论文里的科学结论,编译成一种新的对象:一条可以由AI执行、由环境重放、由原始证据重算、最后由评分器逐项验证的科学工作流。

更多关于如何「把一篇论文变成一道可评测的科学复现题」的细节,可以去GitHub或官网Blog了解~

GitHub开源链接:

https://github.com/UniPat-AI/PaperBenchX

官网Blog链接:

https://unipat.ai/blog/PaperBenchX

— 完 —

Found an error? Send a correction