科研洞察 / 行业观点
行业观点

如果论文可以使用 Paper2Agent 变成能协作的智能体:对研究者的可能影响与执行、判断的分工

发布日期2026-09-28
阅读时长约 11 分钟
出品理文协同科研团队

2026 年 9 月 16 日 Nature 刊出的 Paper2Agent,尝试把论文与代码转换成可调用的智能体,45 分钟、约 14 美元即可复现一个新方法。若这条路走得通,执行可以交出去,方向与证据的判断仍由研究者负责。

2026 年 9 月 16 日,Nature 发表了一篇开放获取论文《Reimagining research papers as interactive and reliable AI agents》,提出一个设想:把一篇论文连同它的代码与数据,重构成可以交互、可以被校验的智能体。在论文给出的 AlphaGenome 案例里,这套流水线生成了 22 个可调用工具,耗时 45 分钟、成本约 14 美元,全部通过自动校验。

论文把这种产出称为「虚拟通讯作者」:如果转换成功,正文、补充材料、数据集、代码与工作流会被组织成可以直接调用的形态,作者给它的名字是「智能体原生知识」(agent-native knowledge)——知识不再以静态文本的形式等人来读,而是以一个能响应查询的实体形式等人来用。

有一点需要先说明:这仍是一次方法学探索,还没有成为行业共识。在论文的规模测试中,100 篇计算生物学论文有 26 篇未能完成转换,能否转换取决于它的代码能否在受控环境中复现它自己声明的结果。也就是说,并非所有论文都能变成智能体,「论文可以被调用」目前更接近一个值得认真对待的方向。

这里还需要一句概念上的说明。这类智能体以 MCP(Model Context Protocol,模型上下文协议)服务器的形式交付:论文里的方法被包装成一组标准化工具,接入 Claude Code 这类对话式科研工具后,就能用自然语言调用。在此之前,一篇计算类论文是否「可复用」,取决于作者有没有写完整文档、读者愿不愿意花几周排错,两件事都没有机制去约束。

  • 论文信息Nature,2026 年 9 月 16 日,DOI: 10.1038/s41586-026-11044-y(开放获取)
  • 研究团队斯坦福大学 Jiacheng Miao、Joe R. Davis、Yaohui Zhang、Jonathan K. Pritchard、James Zou
  • 规模测试100 篇计算生物学论文,74 篇完成转换(26 篇未能转换),599 个候选工具中 593 个通过校验
  • 校验口径数值误差 3% 以内、图像感知哈希汉明距离小于 20、每条函数最多 6 次尝试
  • 论文的分工设计人类科学家提出高层级的科学假设,智能体负责执行与交叉验证
能力拆解
四项能力

Paper2Agent 尝试接过去的工作:四项能力与交付前的验收

按论文与公开说明的表述,这套流水线尝试接过去的是四件事。它们的共同点是,每一项都要落到可执行、可核对的证据上。

  • 生成假设沿着论文自身的脉络,提出值得检验的新猜想
  • 提出验证策略给出可操作的实验或分析设计,而不是停留在设想
  • 规模化执行分析把论文里的方法真正跑起来,并对新数据批量应用
  • 可靠与可重复每个工具交付前先跑测试,对照原论文结果校验

每一项能力都要对着原论文的数字验收

第三项是与「把论文读一遍」最本质的区别:在这套设计里,方法的可执行性被写进了交付标准。论文的六步流水线中,第四步是让代码在隔离环境中端到端跑通并记录参考输出,之后所有步骤都要对着这份基准验收。

验收线是具体的:预期文件必须出现;数值误差要在 3% 以内;图像要通过感知哈希比对,汉明距离小于 20;每条函数最多获得 6 次尝试机会,反复失败的会被排除在最终交付之外。转换过程因此同时是一次自动化审计:一篇论文能否变成可调用的智能体,取决于它的代码能否在受控环境中复现它自己声明的结果。

规模测试给出了实际通过率:100 篇计算生物学论文中 74 篇完成转换,提出的 599 个候选工具里 593 个通过校验;在 300 道由教程派生的基准题上,准确率为 91.2% ± 1.6%,而把同一个代码仓库直接交给通用编码工具为 80.3% ± 2.3%。AlphaGenome 案例的 22 个工具全部通过校验,运行时间的中位数比直接调用代码仓库缩短约 1.9 倍,全程没有人工干预。

同样的模型、同样的代码仓库,唯一的差别是方法有没有被组织成一份带校验、可调用的说明书。

基于 Miao et al., Nature, 2026 中 91.2% 与 80.3% 对照结果的分析
路径推演
三点推演

如果这条路继续走:论文形态可能被改写的三点

把视野拉远一点,这项工作可能的意义不止在工具层面。如果「方法可被调用」这件事继续推进,论文被生产、被使用、被评价的方式可能出现三方面的变化。以下三点更接近推演,还不是已经发生的事实。

一、从静态文档到可调用的实体

过去,一篇论文的终点是发表:一份 PDF、一份补充材料、一个代码仓库链接。如果方法被转换成接口,论文的存在方式可能从「被阅读的对象」变成「能响应请求的实体」,可以被查询、被调用,也可以被校验。

这一层还可能反向影响投稿本身。论文作者预判,期刊未来或许会要求在 data availability、code availability 之外,增加一项 agent availability 声明。如果这成为惯例,可能被改写的不只是投稿清单,还有「什么算发表了」这条边界。同一时间,关于 AI 如何进入评审流程的规则边界也在被讨论,可参考AI 与同行评审:为什么出版社的“禁令”失效。

二、从个人使用到智能体之间互相调用

第二条线索更具提示性:智能体可以在没有人为编排的情况下互相配合。论文把三篇论文的智能体串起来——AlphaGenome 的智能体、一个 MPRA 偶联 scCRISPRi 筛选的智能体、一个 Perturb-seq 的智能体——让它们交叉比对预测与实验数据、自行查阅手稿与补充表格,为银屑病位点 rs887314 排序候选因果基因,最终指向 GPR137,在刺激条件下与实验数据的相关系数 ρ = 0.613(P = 3.79×10⁻³),静息状态下则不显著。

这已经超出「工具调用」的范畴。如果方法论文的智能体与数据论文的智能体之间能自行分工,跨学科连接的带宽就可能不再完全由研究者个人的时间决定。

三、从描述结果到可扩展的研究资产

第三条线索涉及论文的价值形态:能被调用的方法会获得额外的使用与复用机会,论文也因此有机会从「一次性描述结果的文档」变成「可以持续被支取的研究资产」。

但扩展性有代价,这部分需要如实看待。在 26 篇数据与发现类论文的 100 道综合题上,Paper2Agent 的准确率为 89.0% ± 3.1%,对照为 82.0% ± 3.8%,同时成本低 34 倍、速度快 15 倍。89.0% 意味着大约每十次查询就有一次答案不对,而在一个被包装成「可靠智能体」的界面里,使用者通常不会为这个比例预留心理余量。

同期公开的 ScienceIDE 项目(arXiv:2609.19134)把这件事写进了评分规则:严格成功要求通过私有的科学校验,仅完成编译或运行不算数;其修复得分定义为 r = max(0, (r − f) / (1 − f)),其中 f 是未修复版本的得分,「什么都没改」因此得零分。可运行、可复现、结果正确,是三个需要分开检查的层次。

实验暴露出的,是可运行的代码与经过验证的科学执行之间的差距。

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments, arXiv:2609.19134, 2026
人在回路
分工与边界

人在回路:方向与证据的判断由谁负责

论文对这种协作模式有一个明确的命名:human-in-the-loop,人在回路。按作者的设计,人类科学家负责提出高层级的科学假设,AI 合作者负责执行与交叉验证。这不只是一种措辞上的谨慎,它对应着流程里两条不同的责任线。

  • 它可以做生成假设、设计验证、规模化执行分析,并提升方法的可重复与复用
  • 你负责选择研究方向,评估证据的质量与可靠性
  • 它的定位增强科学发现的工具,而不是自主或权威的科学结论来源

一个位点的因果基因,指向了两种答案

这条责任线为什么无法省略,论文里有一个细节可以说明。团队让 AlphaGenome 的智能体重新审视一个问题:为什么单碱基变异 chr1:109274968:G>T 与坏胆固醇相关?智能体把 SORT1 排在首位,而原论文强调的是 CELSR2 与 PSRC1。

看起来像是智能体答错了。GTEx 数据给出的答案却是:这三个基因在肝脏都有显著 eQTL,SORT1 的 P 值为 1.1×10⁻⁶⁵。不是它答错了,而是这类位点的因果基因指派本身就困难,不同证据链会支持不同的候选。Zou 把这一点视为优势:研究者可以用它重新评估已发表的结论,而不必先设计一套全新实验。

同一件事也从另一面说明:一个能正确复现方法、正确调用数据的智能体,仍然会把选项摆到一个需要人来判断的岔路口。它把可能性列了出来,做判断的是研究者。

它是增强科学家的工具,而不是自主产出科学结论的工具;「能复现」不等于「结论正确」。

Miao et al.《Reimagining research papers as interactive and reliable AI agents》, Nature, 2026(DOI: 10.1038/s41586-026-11044-y)中作者的自我定位

给研究者的三件事

如果这条路径继续推进,研究者可以做的动作很具体,而且都不在工具层面。

  • 先想清楚要回答什么问题,再让工具去执行。把论文交给智能体之前,先写下你要验证的假设,以及它成立所依赖的前提。方向由人给出,工具才有一个可校验的目标。
  • 想清楚凭什么相信它的证据。逐条验收证明的是方法能被复现,不是结论一定成立。当一次查询存在约十分之一的出错率时,判断证据质量的能力比调用工具的能力更关键。
  • 在把方法交给工具之前,先把论证交给同行。哪些论证站得住、哪些会被质疑、哪些需要修改,属于另一类问题:它既不在流水线里,也不在任何一份可执行文件里。

这类判断有一个特点:越靠近自己的作品,越难看清。投稿前的准备因此不只是把方法整理成可调用的形态,还包括在正式评审之前,让另一个人以审稿人的视角读一遍论证。

理文的协同科研与卓越科研服务从诊断问题出发:协同科研会匹配同领域科研专家通读文章、初稿或研究计划,定位制约研究进展的关键因素并给出专属方案;卓越科研则一路托管到投稿。如果只有一篇稿件需要一轮系统检查,可以从科研文章评议开始:由同领域具名科学家交付哪些论证站得住、哪些会被质疑、哪些需要修改。参与评议的科学家在科研专家页面实名可查;也可以先看我们协助作者完成高影响力期刊发表的真实成功案例。

原始研究:Miao, J., Davis, J. R., Zhang, Y., Pritchard, J. K. & Zou, J.《Reimagining research papers as interactive and reliable AI agents》, Nature, 2026, DOI: 10.1038/s41586-026-11044-y(开放获取)。文中 Paper2Agent 的能力、准确率、成本与耗时数据均引自该文及其公开代码库,尚未经第三方独立复现;ScienceIDE 的评分规则引自其 2026 年预印本(arXiv:2609.19134)。

参考来源
常见问题
FAQ

常见问题解答

什么是 Paper2Agent?它和普通的文献阅读工具有什么区别?

它的目标是把论文变成可调用的方法,而不只是可读的文本。Paper2Agent 会把正文、补充材料、数据集、代码与工作流一起处理,产出以 MCP 服务器形式交付的工具与工作流,尝试生成假设、提出验证策略、规模化执行分析;每个工具交付前都要跑测试,并对照原论文结果校验。需要说明的是,这仍是一次方法学探索:100 篇测试论文中有 26 篇未能完成转换,基准题准确率为 91.2%,直接访问同一代码仓库的通用工具为 80.3%。

Paper2Agent 会自主产出科学结论吗?

论文给出的定位是增强科学发现的工具,而不是自主或权威的科学结论来源。作者把这种协作写成 human-in-the-loop:人类科学家提出高层级的科学假设,AI 合作者负责执行与交叉验证。研究者仍需对研究方向的选择、证据质量的评估负最终责任。这个分工不针对某项具体能力,它划分的是流程里两条不同的责任线。

如果论文可以被调用,对作者可能意味着什么?

如果这类工具真的可用,最直接的影响是复用门槛下降:方法以接口形式交付后,其他研究者可以在新数据上直接调用,论文获得额外的使用与复用机会。更深一层的影响在投稿口径上,论文作者预判期刊未来可能要求在 data availability、code availability 之外增加一项 agent availability 声明。若这类声明成为惯例,「什么算发表了」的边界会被重新讨论。

论文的方法能被调用起来,就说明结论可靠吗?

不等于。交付前的校验是能否对上原论文的数字,数值误差在 3% 以内、图像通过感知哈希比对即算通过,验的是可复现性而不是正确性。论文披露 100 篇测试论文中有 26 篇无法完成转换,资源层准确率约 89%。可运行、可复现、结果正确是三个需要分开检查的层次,结论是否成立要另行判断。

青年研究者应该怎样使用这类工具?

先想清楚要回答什么问题、凭什么相信它的证据,再把方法交给工具去执行。论文给出的分工是:人负责提出高层级的科学假设与判断证据质量,智能体负责执行、交叉验证与规模化分析。此外,投稿前值得让同领域科学家以审稿人视角读一遍全文——哪些论证站得住、哪些会被质疑、哪些需要修改,属于工具不参与判断的那一类问题。

相关阅读
下一步

论文被调用之后,判断仍然在研究者手里

理文的协同科研服务从诊断问题出发,匹配同领域科研专家定位制约研究进展的关键因素;如果只有一篇稿件需要系统检查,可以从科研文章评议开始。