2026 年 9 月 16 日 Nature 刊出的 Paper2Agent,尝试把论文与代码转换成可调用的智能体,45 分钟、约 14 美元即可复现一个新方法。若这条路走得通,执行可以交出去,方向与证据的判断仍由研究者负责。
2026 年 9 月 16 日,Nature 发表了一篇开放获取论文《Reimagining research papers as interactive and reliable AI agents》,提出一个设想:把一篇论文连同它的代码与数据,重构成可以交互、可以被校验的智能体。在论文给出的 AlphaGenome 案例里,这套流水线生成了 22 个可调用工具,耗时 45 分钟、成本约 14 美元,全部通过自动校验。
论文把这种产出称为「虚拟通讯作者」:如果转换成功,正文、补充材料、数据集、代码与工作流会被组织成可以直接调用的形态,作者给它的名字是「智能体原生知识」(agent-native knowledge)——知识不再以静态文本的形式等人来读,而是以一个能响应查询的实体形式等人来用。
有一点需要先说明:这仍是一次方法学探索,还没有成为行业共识。在论文的规模测试中,100 篇计算生物学论文有 26 篇未能完成转换,能否转换取决于它的代码能否在受控环境中复现它自己声明的结果。也就是说,并非所有论文都能变成智能体,「论文可以被调用」目前更接近一个值得认真对待的方向。
这里还需要一句概念上的说明。这类智能体以 MCP(Model Context Protocol,模型上下文协议)服务器的形式交付:论文里的方法被包装成一组标准化工具,接入 Claude Code 这类对话式科研工具后,就能用自然语言调用。在此之前,一篇计算类论文是否「可复用」,取决于作者有没有写完整文档、读者愿不愿意花几周排错,两件事都没有机制去约束。
按论文与公开说明的表述,这套流水线尝试接过去的是四件事。它们的共同点是,每一项都要落到可执行、可核对的证据上。
第三项是与「把论文读一遍」最本质的区别:在这套设计里,方法的可执行性被写进了交付标准。论文的六步流水线中,第四步是让代码在隔离环境中端到端跑通并记录参考输出,之后所有步骤都要对着这份基准验收。
验收线是具体的:预期文件必须出现;数值误差要在 3% 以内;图像要通过感知哈希比对,汉明距离小于 20;每条函数最多获得 6 次尝试机会,反复失败的会被排除在最终交付之外。转换过程因此同时是一次自动化审计:一篇论文能否变成可调用的智能体,取决于它的代码能否在受控环境中复现它自己声明的结果。
规模测试给出了实际通过率:100 篇计算生物学论文中 74 篇完成转换,提出的 599 个候选工具里 593 个通过校验;在 300 道由教程派生的基准题上,准确率为 91.2% ± 1.6%,而把同一个代码仓库直接交给通用编码工具为 80.3% ± 2.3%。AlphaGenome 案例的 22 个工具全部通过校验,运行时间的中位数比直接调用代码仓库缩短约 1.9 倍,全程没有人工干预。
同样的模型、同样的代码仓库,唯一的差别是方法有没有被组织成一份带校验、可调用的说明书。
基于 Miao et al., Nature, 2026 中 91.2% 与 80.3% 对照结果的分析把视野拉远一点,这项工作可能的意义不止在工具层面。如果「方法可被调用」这件事继续推进,论文被生产、被使用、被评价的方式可能出现三方面的变化。以下三点更接近推演,还不是已经发生的事实。
过去,一篇论文的终点是发表:一份 PDF、一份补充材料、一个代码仓库链接。如果方法被转换成接口,论文的存在方式可能从「被阅读的对象」变成「能响应请求的实体」,可以被查询、被调用,也可以被校验。
这一层还可能反向影响投稿本身。论文作者预判,期刊未来或许会要求在 data availability、code availability 之外,增加一项 agent availability 声明。如果这成为惯例,可能被改写的不只是投稿清单,还有「什么算发表了」这条边界。同一时间,关于 AI 如何进入评审流程的规则边界也在被讨论,可参考AI 与同行评审:为什么出版社的“禁令”失效。
第二条线索更具提示性:智能体可以在没有人为编排的情况下互相配合。论文把三篇论文的智能体串起来——AlphaGenome 的智能体、一个 MPRA 偶联 scCRISPRi 筛选的智能体、一个 Perturb-seq 的智能体——让它们交叉比对预测与实验数据、自行查阅手稿与补充表格,为银屑病位点 rs887314 排序候选因果基因,最终指向 GPR137,在刺激条件下与实验数据的相关系数 ρ = 0.613(P = 3.79×10⁻³),静息状态下则不显著。
这已经超出「工具调用」的范畴。如果方法论文的智能体与数据论文的智能体之间能自行分工,跨学科连接的带宽就可能不再完全由研究者个人的时间决定。
第三条线索涉及论文的价值形态:能被调用的方法会获得额外的使用与复用机会,论文也因此有机会从「一次性描述结果的文档」变成「可以持续被支取的研究资产」。
但扩展性有代价,这部分需要如实看待。在 26 篇数据与发现类论文的 100 道综合题上,Paper2Agent 的准确率为 89.0% ± 3.1%,对照为 82.0% ± 3.8%,同时成本低 34 倍、速度快 15 倍。89.0% 意味着大约每十次查询就有一次答案不对,而在一个被包装成「可靠智能体」的界面里,使用者通常不会为这个比例预留心理余量。
同期公开的 ScienceIDE 项目(arXiv:2609.19134)把这件事写进了评分规则:严格成功要求通过私有的科学校验,仅完成编译或运行不算数;其修复得分定义为 r = max(0, (r − f) / (1 − f)),其中 f 是未修复版本的得分,「什么都没改」因此得零分。可运行、可复现、结果正确,是三个需要分开检查的层次。
实验暴露出的,是可运行的代码与经过验证的科学执行之间的差距。
ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments, arXiv:2609.19134, 2026论文对这种协作模式有一个明确的命名:human-in-the-loop,人在回路。按作者的设计,人类科学家负责提出高层级的科学假设,AI 合作者负责执行与交叉验证。这不只是一种措辞上的谨慎,它对应着流程里两条不同的责任线。
这条责任线为什么无法省略,论文里有一个细节可以说明。团队让 AlphaGenome 的智能体重新审视一个问题:为什么单碱基变异 chr1:109274968:G>T 与坏胆固醇相关?智能体把 SORT1 排在首位,而原论文强调的是 CELSR2 与 PSRC1。
看起来像是智能体答错了。GTEx 数据给出的答案却是:这三个基因在肝脏都有显著 eQTL,SORT1 的 P 值为 1.1×10⁻⁶⁵。不是它答错了,而是这类位点的因果基因指派本身就困难,不同证据链会支持不同的候选。Zou 把这一点视为优势:研究者可以用它重新评估已发表的结论,而不必先设计一套全新实验。
同一件事也从另一面说明:一个能正确复现方法、正确调用数据的智能体,仍然会把选项摆到一个需要人来判断的岔路口。它把可能性列了出来,做判断的是研究者。
它是增强科学家的工具,而不是自主产出科学结论的工具;「能复现」不等于「结论正确」。
Miao et al.《Reimagining research papers as interactive and reliable AI agents》, Nature, 2026(DOI: 10.1038/s41586-026-11044-y)中作者的自我定位如果这条路径继续推进,研究者可以做的动作很具体,而且都不在工具层面。
这类判断有一个特点:越靠近自己的作品,越难看清。投稿前的准备因此不只是把方法整理成可调用的形态,还包括在正式评审之前,让另一个人以审稿人的视角读一遍论证。
理文的协同科研与卓越科研服务从诊断问题出发:协同科研会匹配同领域科研专家通读文章、初稿或研究计划,定位制约研究进展的关键因素并给出专属方案;卓越科研则一路托管到投稿。如果只有一篇稿件需要一轮系统检查,可以从科研文章评议开始:由同领域具名科学家交付哪些论证站得住、哪些会被质疑、哪些需要修改。参与评议的科学家在科研专家页面实名可查;也可以先看我们协助作者完成高影响力期刊发表的真实成功案例。
原始研究:Miao, J., Davis, J. R., Zhang, Y., Pritchard, J. K. & Zou, J.《Reimagining research papers as interactive and reliable AI agents》, Nature, 2026, DOI: 10.1038/s41586-026-11044-y(开放获取)。文中 Paper2Agent 的能力、准确率、成本与耗时数据均引自该文及其公开代码库,尚未经第三方独立复现;ScienceIDE 的评分规则引自其 2026 年预印本(arXiv:2609.19134)。
以下为本文涉及的一手来源与官方依据,供读者与研究者进一步核验。
它的目标是把论文变成可调用的方法,而不只是可读的文本。Paper2Agent 会把正文、补充材料、数据集、代码与工作流一起处理,产出以 MCP 服务器形式交付的工具与工作流,尝试生成假设、提出验证策略、规模化执行分析;每个工具交付前都要跑测试,并对照原论文结果校验。需要说明的是,这仍是一次方法学探索:100 篇测试论文中有 26 篇未能完成转换,基准题准确率为 91.2%,直接访问同一代码仓库的通用工具为 80.3%。
论文给出的定位是增强科学发现的工具,而不是自主或权威的科学结论来源。作者把这种协作写成 human-in-the-loop:人类科学家提出高层级的科学假设,AI 合作者负责执行与交叉验证。研究者仍需对研究方向的选择、证据质量的评估负最终责任。这个分工不针对某项具体能力,它划分的是流程里两条不同的责任线。
如果这类工具真的可用,最直接的影响是复用门槛下降:方法以接口形式交付后,其他研究者可以在新数据上直接调用,论文获得额外的使用与复用机会。更深一层的影响在投稿口径上,论文作者预判期刊未来可能要求在 data availability、code availability 之外增加一项 agent availability 声明。若这类声明成为惯例,「什么算发表了」的边界会被重新讨论。
不等于。交付前的校验是能否对上原论文的数字,数值误差在 3% 以内、图像通过感知哈希比对即算通过,验的是可复现性而不是正确性。论文披露 100 篇测试论文中有 26 篇无法完成转换,资源层准确率约 89%。可运行、可复现、结果正确是三个需要分开检查的层次,结论是否成立要另行判断。
先想清楚要回答什么问题、凭什么相信它的证据,再把方法交给工具去执行。论文给出的分工是:人负责提出高层级的科学假设与判断证据质量,智能体负责执行、交叉验证与规模化分析。此外,投稿前值得让同领域科学家以审稿人视角读一遍全文——哪些论证站得住、哪些会被质疑、哪些需要修改,属于工具不参与判断的那一类问题。
理文的协同科研服务从诊断问题出发,匹配同领域科研专家定位制约研究进展的关键因素;如果只有一篇稿件需要系统检查,可以从科研文章评议开始。