斯坦福 Paper2Agent 把论文变成可调用的 MCP 智能体
基于 AlphaGenome 的智能体准确率 98.7%,速度是基线的 1.9 倍,查询成本几乎减半

斯坦福的一个研究团队在《自然》上发表了一个框架,能把一篇科学论文的代码、数据和方法转换成一个可调用的 AI 智能体 —— 把研究者过去要花好几天手工搭建的事情自动化。这个名为 Paper2Agent 的系统,把一篇论文的全部产出封装成一个 MCP(模型上下文协议)服务器,任何兼容的智能体都能通过自然语言调用它。在 100 篇计算生物学论文上,它成功把其中 74 篇变成了智能体;而它用 AlphaGenome 基因组学模型构建的那个智能体,在遗传学查询上得分近乎满分,运行速度也接近直接使用原始代码库的两倍。
实际含义和技术含义几乎同时到来:如果论文以可调用的 MCP 端点形式发布,科学知识就不再是研究者要下载、要配置的东西,而会变成可以直接查询的东西。论文合著者、斯坦福的 James Zou 说,这项技术「能帮我们重新想象未来知识的样子」。《自然》于 2025 年 10 月收到这篇论文,2026 年 8 月接收,并于 2026 年 9 月 16 日发表。
延伸阅读:Anthropic 证实:已建成湿实验室,Claude 进军实体药物研究
从 PDF 到可调用的 API:封装一篇论文的六步流水线
Paper2Agent 不是一个读论文、回答相关问题的检索系统。那类工具早已存在,检索增强生成的各种做法就是代表。Paper2Agent 做的事有实质不同:它执行论文的代码,捕获输出,把得到的函数封装成经过验证的工具,并部署到任何智能体都能调用的远程服务器上。
构建过程分六个阶段,全程无需人工介入。编排器先找到并下载论文关联的代码仓库 —— 要么从论文正文中自动识别,要么直接指定。接着,一个专门的环境智能体搭建隔离的虚拟环境,安装依赖并解决冲突。一个教程扫描器在代码库中找出参考材料和示例笔记本。一个教程执行器把这些示例从头到尾跑一遍,把它们产出的数值结果和图表捕获下来,作为基准真值参考。
技术上最关键的是第五步:工具提取与验证。一个工具提取智能体把每个执行过的教程转换成独立的 Python 函数,把写死的文件路径和特定于数据集的常量替换成可泛化的参数,并把每个函数装饰成一个 MCP 工具。随后,一个测试校验器对照第四步得到的基准真值输出做自动检查。一个函数只有同时满足以下条件才算通过:生成了预期的文件,数值结果与参考值的浮点误差在 3% 以内,图表经感知哈希比对、与参考图的汉明距离低于 20。任何在六次修复尝试后仍然失败的函数,都会被去掉 MCP 装饰器,排除在最终的服务器之外 —— 论文自己的答案成了质量关卡。
最终得到的是一个结构化的 MCP 服务器,包含三类组件。MCP Tools 是经过验证的可执行函数。MCP Resources 存放静态资产:论文正文、原始代码库、补充表格,以及机器可读格式的数据集。MCP Prompts 编码了从论文本身推断出的多步工作流,这样复杂的分析 —— 比如一条单细胞预处理加聚类的流水线 —— 只用一句自然语言指令就能调起,用户不必自己指定正确的操作顺序。
团队用 Claude Code 作为编排器和子智能体框架来构建 Paper2Agent,所有构建和评估都以 Claude Sonnet 4 作为底层语言模型。做好的服务器部署在 Hugging Face Spaces 上,远程即可访问,用户不必在本地安装任何依赖。完整框架可在 Paper2Agent 的 GitHub 仓库获取。
这为什么不同于直接让 Claude 去读代码仓库
论文的主要基准让这种架构差异变得具体。在从 AlphaGenome 论文衍生出的 30 个基因组学查询上,Paper2Agent 构建的智能体在开放式的研究者风格问题上得分 82.7 ± 2.4%,而能直接访问同一代码仓库的 Claude Code 为 56.7 ± 2.3%。在更简单的、由教程衍生的查询上,差距是 Paper2Agent 的 98.7% 对直接面对原始代码的 Claude 的 82.7%。
作者同样跑了与 Biomni 的对比,差距更加悬殊:Biomni 在教程查询上是 37.3%,在新查询上是 56.0%,而 Paper2Agent 分别是 98.7% 和 100%。Biomni 是学术研究者开发的一个通用生物医学智能体,它从几十个精选数据库中取材,而不是封装某一篇论文的可执行代码。这组对比不应被读成对 Biomni 的否定 —— 任务是针对 AlphaGenome 的特定输出设计的 —— 但它说明:一个带有锁定的、经过验证的工具的论文专属智能体,在需要把论文的实际方法用到新输入上的任务里,大幅胜过通用智能体。
有两点关于评分的保留意见。所有基准都是作者自己跑、自己打分的,AlphaGenome 评测用了两位人类领域专家,报告的评分者间一致率为 96.7%。目前还没有任何独立团队复现过其中任何一个准确率数字。开放式问题是按专家评分标准打分的,但论文本身也承认,对于复杂的生物学解读任务,可能存在多个站得住的答案,这意味着这些查询上的准确率数字应当被理解为「忠实执行」的衡量,而不是正确性的保证。
成本和延迟的结果更容易解读。Paper2Agent 查询的中位成本据报告为 0.20 美元,而用 Sonnet 4 直接面对代码仓库的 Claude 是 0.38 美元 —— 作者把这一降幅归因于锁定的、预先验证过的工具路径,它们取代了查询时的开放式代码生成。与直接使用代码仓库的基线相比,中位运行速度据报告在教程查询上提升到 1.9 倍,在新查询上提升到 2.9 倍。
扩展到 100 篇生物学论文 —— 以及失败揭示了什么
之所以选 AlphaGenome 做案例研究,是因为这篇论文维护良好、文档详尽,作为计算生物学代码仓库来说异常容易上手。大规模评测则刻意反其道而行:从 bioRxiv 回溯抽取了 100 篇计算生物学论文,不按文档质量、仓库维护状态或代码完整度做任何筛选,以反映研究代码在实践中的真实参差。
这 100 篇中,74 篇被成功转换成了智能体。失败的 26 篇可以归为四类:缺少可执行代码、缺少数据或模型文件、环境或依赖出错,以及脚本过于绑定原始数据集、无法泛化为可复用的函数。在成功转换的 74 篇中,Paper2Agent 生成了 599 个候选工具,验证通过 593 个 —— 在成功转换的论文里,工具通过率达 99%。在这些论文的 300 道由教程衍生的基准题上,系统在使用 Sonnet 4 时达到了 91.2 ± 1.6% 的准确率,而直接访问代码仓库的 Claude Code 为 80.3 ± 2.3%,换用更新的 Sonnet 4.6 模型的 Claude Code 为 86.3 ± 1.1%。
团队还测试了生物学之外的泛化能力,把 Paper2Agent 用在 10 篇计算类论文上,涵盖因果推断(grf)、机制可解释性(SAELens)、计算机视觉(SAM2)、表格机器学习(TabPFN)、AI 生成文本检测(Binoculars)和计算博弈论(Nashpy)等领域。在 42 道基于执行的问题上,Paper2Agent 的准确率达到 98.1 ± 0.8%,这说明这条流水线并不局限于生物学代码仓库。
失败的分类本身就有分析价值。阻碍转换的四类原因 —— 缺代码、缺数据、环境坏掉、脚本无法泛化 —— 恰恰也是阻碍用常规手段复现的那几类。作者明确得出了这个结论,写道「一篇论文能多容易地被转换成智能体,本身就可以作为可复现性的一个实用衡量」。一篇无法被自动转换成智能体的论文,几乎可以肯定也是一个新实验室难以手工复现的论文。这让 Paper2Agent 26% 的失败率不只是系统的局限,也成了对一大批已发表计算生物学成果的一次审计结果。
会互相对话的论文智能体
《自然》这篇论文中最具前瞻性的演示,涉及的不是一个智能体,而是串成一条链的三个。为了找出一个与银屑病相关的遗传变异(rs887314)背后的致病基因,团队把 AlphaGenome 论文智能体 —— 它能预测 DNA 变异的调控效应 —— 连上了另外两个智能体:一个由一篇结合 MPRA 的单细胞 CRISPR 干扰论文构建,另一个由一个针对原代人 CD4+ T 细胞的全基因组规模 Perturb-seq 数据集构建。
AlphaGenome 智能体最初把 GPR137 排为 CD4+ T 细胞中受影响最大的预测基因(RNA-seq 分位数得分 0.997)。为了验证这个预测,这位 AI 协作科学家 —— 在策略选择上接受人类监督 —— 把扰动 rs887314 顺式调控元件(CRE)所引起的下游基因表达效应,与在三种刺激条件下逐一敲低各候选基因所引起的表达效应做相关分析。只有 GPR137 的敲低在刺激条件下与 CRE 扰动特征呈现显著一致(Stim8hr 时 Spearman ρ = 0.613,P = 0.0038;Stim48hr 时 ρ = 0.630,P = 0.0047,FDR < 0.05)。其他排名靠前的候选基因都没有显著相关。
得出这一结果所用的「特征相关」方法 —— 把 CRISPR 筛选中的 CRE 扰动特征,与 Perturb-seq 数据集中的基因敲低特征做相关 —— 在两篇源论文中都没有被提出过。是智能体通过推理「在它能访问的两个数据集之间,能拿到什么样的比较证据」而自己设计出来的。作者谨慎地把这呈现为一个有计算支持的预测,而不是一个既定发现;在被当作定论之前,这个结果还需要后续的实验验证。它的重要性在方法论上:多个论文智能体把各自可执行的方法汇集起来,能生成任何一篇论文的作者都没有提出过的新分析策略。
论文补充说明中的第二个多智能体案例,用 AlphaGenome 和 ADHD 全基因组关联研究(GWAS)智能体,把 rs1626703 识别为一个很可能的致病变异,并预测它会改变 MPHOSPH9 的剪接,增加其在谷氨酸能神经元中的表达。
延伸阅读:MIT 研究:科学比较中,AI 每 4 次就有 1 次输给统计方法
MCP 让什么成为可能 —— 以及这个协议还缺什么
Anthropic 推出的 MCP 诞生于 2024 年底,是一个通过标准化服务器接口把 AI 智能体连接到外部工具和数据的开放标准。此后,OpenAI 和其他主要平台都把它采用为通用的集成层;用它文档里的说法,它就像 AI 系统的 USB-C 接口:服务器写一次,任何兼容的智能体都能接上。
Paper2Agent 是第一个把 MCP 大规模用于科学出版的系统,它把论文的代码库当作服务器的内容,而不是数据库或业务应用。它对科研界的意义不止于方便。目前,科学知识的传递要求读者找到论文、找到代码仓库、装好正确的软件环境,再弄清输入和输出如何对应到论文的方法上 —— 作者形容这个过程竖起了技术壁垒,限制了成果的传播和复用。Paper2Agent 把这条流程压缩成了一条 Claude Code 命令。
把研究代码通过 MCP 暴露出来,随之而来的安全面并不小。MCP 安全领域的研究已经发现了工具投毒攻击 —— MCP 服务器中的恶意描述可以在不执行任何代码的情况下操纵智能体的规划过程 —— 以及幻觉权限的情形,即模型可能声称拥有、或者按照超出预期的权限行事。Paper2Agent 论文承认存在「需要谨慎处理的安全、知识产权和署名方面的挑战」,但并没有完全解决它们。
还有版权和许可方面的考虑。一篇研究论文的代码仓库,可能采用限制再分发或商业使用的许可条款;把这些代码自动封装成一个公开的 MCP 服务,可能触及这些条款,尤其是当服务被原本目标用户群之外的人访问时。论文没有直接讨论这一点。
持续维护的负担同样真实存在。随着上游代码库和依赖不断演进,论文智能体也会坏掉,就像软件包会坏掉一样。作者把这看作发布可执行研究的固有代价,而不是放弃智能体化的理由,但这意味着智能体的可用性 —— 就像数据和代码的可用性一样 —— 需要作者或机构长期积极地维护。
把可复现性当作基准,把出版当作基础设施
Paper2Agent 的作者在《自然》论文的结尾拿现有的研究规范做了个对比。数据可用性声明如今已是大多数主要期刊的标配,代码可用性声明也越来越多地被要求。作者提议,「智能体可用性」声明 —— 说明论文的贡献是否、以及如何被做成一个可交互的智能体 —— 也应当走上同样的路。
这个提议面临一条不对称的采用路径。一家在工具和标准还不成熟时就强制要求智能体可用性的期刊,会造成合规负担;而一家等到生态稳定下来再行动的期刊,则可能眼看着更早的采用者确立起难以撼动的引用和署名规范。面向「基于智能体的实验复现」的新基准 —— 评估智能体能否在大量机器学习和科学论文中正确复现已发表的实验 —— 已经开始搭建评估基础设施,让大规模审核智能体可用性变得可行。
大规模生物学评测中 26% 的失败率意味着,Paper2Agent 还没准备好成为期刊投稿的通用要求。但它已经可以作为实验室工具 —— 让以方法为主的课题组把已发表成果变得可调用、扩大其影响范围,也让读者用几分钟而不是几天去检验一篇论文的可复现性。《自然》或另一家顶级期刊会不会开始在 PDF 旁边托管 Paper2Agent 的 MCP 服务器,是能把这项技术从研究演示变成标准出版基础设施的那个具体里程碑。这个决定如今既是科学问题,也是产品问题。