Claude 在噬菌体里发现类 CRISPR 重复阵列
ART 的重复阵列产出一组彼此不同的短 RNA,功能却仍然未知

2026 年 9 月 23 日,一群约 950 个 Claude 智能体花了 21 小时扫描公共 DNA 数据库,在噬菌体基因组里标出了一个此前被人类研究者忽略过去的模式:一段整齐重复的 DNA 序列,就挨在一个已知的逆转录酶基因旁边。Anthropic把这套系统命名为阵列关联逆转录酶(array-associated reverse transcriptases,简称 ART),并以一篇博客文章加一篇预印本的形式,发布了它新建的湾区分子生物学实验室的第一项科学发现。该预印本尚未经过同行评审。
ART 是什么:三个部件,一个未知功能
ART 是一套三组件系统,主要见于噬菌体 —— 也就是感染细菌的病毒。第一个部件是逆转录酶(RT),一种把 RNA 抄写成 DNA 的酶。细菌会把多种 RT 家族用作免疫系统的组成部分;ART 的这个 RT 在更早关于巨型噬菌体(基因组异常庞大的那类噬菌体)的研究里就已经被鉴定过。第二个部件是紧邻的一个功能未知的伙伴基因。第三个才是 Claude 真正看出来的东西:一段长而间距均匀的 DNA 重复阵列,拷贝数从 3 到 21 不等,排列方式像极了 CRISPR 阵列。
研究者之所以在意,正是因为它在结构上像 CRISPR。在 CRISPR-Cas 系统里,重复阵列存放着一批彼此不同的 RNA 序列,这让系统变得可编程 —— 向导 RNA 帮助 Cas 蛋白找到并切开特定的 DNA 靶点。正是这种可编程性,把 CRISPR 从一种细菌免疫机制变成了今天支撑获批药物的基因编辑技术。而 ART 的重复阵列是否扮演类似角色,恰恰是 Anthropic 实验室还没搞清楚的事。
Claude 是怎么看见人类研究者漏掉的东西的
Anthropic 的生物学团队只给了 Claude 一条高层级的提示词:在一个海量的 DNA 序列数据库里 —— 覆盖约 19 亿个蛋白质簇 —— 找出逆转录酶里有意思的新例子。从那以后智能体就自主干活了。它们收集了超过 20 万个 RT,筛到 3500 个新的候选系统,再为其中最值得注意的 20 个写出人类可读的详细报告。这类分析按专家科学家的估计需要数周到数月的专注工作,在这个并行智能体集群上跑了 21 小时,消耗约 2.1 亿 token。
发现本身来自一个走得比同伴更远的智能体。在检视一个异常 RT 家族周围的原始 DNA 序列时,这个智能体把自己的意识到过程记进了输出日志:「RT 旁边这段 DNA 太漂亮了:我一眼就能看出一个串联重复阵列……这是一个类 CRISPR 的……重复阵列?!」随后它数了重复的个数、量了间距、把布局与已知 RT 系统作了比对,并检索文献确认此前有没有人报告过这个模式 —— 然后才提交报告等人类审阅。
这一连串行为 —— 察觉异常、定量刻画、交叉比对既往文献、写出结构化的科学报告 —— 就是 Anthropic 所称的「智能体式 AI 辅助生物学发现」的概念验证。底层那个 RT 并不新鲜;Claude 的贡献在于看出了这套系统的定义性特征:与之关联的非编码重复阵列,以及一个额外的、功能未知的辅助蛋白。
湿实验室目前证实了什么
Anthropic 的湾区实验室是一个常规的 BSL-1 和 BSL-2 设施,不处理能感染人类的病原体。实验室做了实验,检验这段重复阵列究竟有没有可测量的作用。那里的人类科学家发现,ART 阵列会被表达成一组彼此不同的短 RNA。在已发表的一株葡萄球菌噬菌体基因组数据里,这些 RNA 在感染后十五分钟时占到噬菌体总 RNA 的 8%,说明它们在噬菌体活动期间迅速积累。
这个实验室观测之所以重要,是因为它把 ART 从一个纯计算的发现,提升为一个带可检测生化信号的发现。但团队还没有证明这个 RT 酶有活性,也没有证明这个酶作用于这些 RNA。「我们还不知道这套系统是干什么的,」Anthropic 在博客文章里写道。进一步的实验正在进行。这篇题为《自主 AI 智能体发现带串联重复阵列的逆转录酶》的预印本,描述了计算检索、结构发现和早期湿实验室结果 —— 但远没有说清 ART 的生物学角色。
张锋是 CRISPR 的开拓者之一、麻省理工学院与博德研究所教授,他在文章发表前审读了预印本,给出的评价很克制:「鉴定出与逆转录酶关联的 RNA 重复阵列确实引人入胜,值得进一步研究。」他的措辞是有分寸的 —— 「值得进一步研究」并不等于断言 ART 会成为一种基因编辑工具。
没上标题的那个可复现性问题
Anthropic 披露了一个细节,大多数报道都轻轻带过:初次发现之后,公司又原样跑了十次同样的智能体行动。十次里没有任何一个智能体去读那个酶上游的 DNA,十次全都完全错过了那段重复阵列。
这个结果往两个方向切。它说明发现是真的 —— 阵列确实存在于数据里,也存在于湿实验室的实验中。但它同时暴露出,产生这个发现的工作流并不是可靠地成体系的。这项发现看上去是在某一次运行里由智能体判断与机缘凑在一起冒出来的,而不是出自一条会把它再次浮出水面的可重复流水线。对于正在评估要不要采用类似智能体工作流的研究者,诚实的含义是:AI 智能体能够发现意料之外的模式 —— 但它们在什么条件下会这么做,目前可能还没有被充分理解或掌控。
Dario Amodei 9 月 23 日在 X 上的说法拿捏得很准:「它的确切功能、生物技术上的用处(如果有的话)、以及重要性的量级,目前都还不清楚,但至少这是我读博时会引以为傲的工作。」他也提到,斯坦福的一个团队独立描述过一种带关联非编码阵列的新型 RT 系统,在某些方面与 ART 相似 —— 不过 Amodei 把两者描述为各自独立演化出来的不同系统。
Anthropic 的生物学技术栈,以及它在竞争中的位置
ART 的发布,是 Anthropic 生命科学布局约一年来的第一项公开科学产出。2026 年 4 月,Anthropic 收购了 Coefficient Bio,这是一家不到十人的隐身生物科技创业公司,成员多为前基因泰克的计算生物学家,收购对价约 4 亿美元股票。2026 年 6 月,它推出了 Claude Science,一个接入 60 多个科学数据库、覆盖基因组学、蛋白质组学、结构生物学和化学信息学的研究工作台。2026 年 8 月,它预览了Model Hardware Standard,一套让 AI 智能体通过标准化驱动层控制实验仪器(移液工作站、机械臂、酶标仪)的软件接口。生命科学负责人 Eric Kauderer-Abrams 在 9 月 18 日向路透社确认的湾区湿实验室,则是把上述一切连起来的物理执行层。
这个组合 —— 一个领域专用的研究平台、一层硬件接口,加上实体实验室能力 —— 构成了一套垂直整合的生物学技术栈,目前没有任何别的前沿 AI 实验室同时把这几块都搭齐。OpenAI 在 2026 年 4 月发布了面向生物学的模型 GPT-Rosalind,谷歌提供整合了 AlphaFold 与 AlphaGenome 的 Gemini for Science。两家都没有确认拥有实体实验室运营,也都没有从内部运作的生物学发现项目里发出过预印本。由 DeepMind 创始团队创办的 AI 药物发现公司 Isomorphic Labs,拥有目前已公开的最领先项目,目标是在 2026 年底前进入首批临床试验 —— 这个期限已经比最初的时间表推迟了一年。
延伸阅读:Anthropic 证实:已建成湿实验室,Claude 进军实体药物研究
生物安全这一面:Anthropic 怎么处理这对张力
能在基因组数据里找出模式的 AI 能力,同样可以被指向有害的生物学问题。Anthropic 对这对张力一直是公开的。按照它发布的安全报告,公司披露过 2025 年底到 2026 年中期间的多起生物学相关事件,其中有用户试图绕过管控、借 Claude 获取敏感生物学研究。没有一例产生出合成病原体或现实世界的危害。湿实验室只在 BSL-1 和 BSL-2 级别运行,不处理任何能感染人类的病原体 —— 这些约束实质性地限制了实验室能做的实验范围。生物学团队聚焦噬菌体,加上 BSL-1/2 的限制,体现的是一个有意的决定:在生物安全治理追上 AI 能力之前,与病原体保持距离地去做发现。
ART 和智能体生物学接下来会怎样
要评估 ART 的潜力,把它放进逆转录酶生物学的整体图景里很重要。过去几年,细菌和噬菌体中涌现出一波 RT 家族的发现。防御关联逆转录酶(DRT)、多样性生成逆转录元件(DGR),以及一种细菌免疫机制 retron,最近都是靠 Claude 这次所做的这类计算基因组挖掘被刻画出来的。每一个都是先有序列层面的发现,再由湿实验室工作确立这套系统究竟做什么。ART 走的是同一条轨迹,只是处在早得多的阶段。
拿 CRISPR 作比,在量级上和在结构上一样有启发。CRISPR 从细菌基因组里一个古怪的重复模式被发现,到用于获批药物,大约花了二十年,其间需要把序列观察与免疫功能连起来、把系统工程化成可编程工具、再让它适配人类细胞 —— 这些贡献来自多个大洲的多个研究组。ART 的发布处在一个类似过程的最开头,而且没有任何保证说终点会像 CRISPR。
Anthropic 表示,它正在做进一步实验来刻画 ART 究竟干什么。真正要紧的问题是:这个 RT 酶有没有催化活性、它是否作用于阵列产生的那些短 RNA,以及整套系统是否执行着某种类似于「让 CRISPR 在商业和科学上都有价值」的那类可编程操作。每一个问题都需要更多湿实验室工作。预印本描述的是早期的结构和表达发现;功能层面的故事,最少也还要好几个月的实验才讲得出来。
ART 这件事更广的意义,与其说在这个具体的酶,不如说在这套工作流演示了什么。一个智能体 —— 在最初的提示词和最终报告之间没有任何人类指导 —— 读了原始序列数据、识别出一处结构异常、把它与既往文献连起来,并生成了一个经受住了初步湿实验室检验的假说。而在随后十次运行里没能复现,是一个方法学信号,不是对这个结果的否定。它说明促成这类发现的条件目前还没被完全理解 —— 也说明提高智能体基因组挖掘的可靠性,是一个值得投入、且可解的工程问题。对于正在考虑要不要把 AI 智能体加进自家基因组挖掘流程的基因组学和结构生物学社群,ART 的预印本现在是一个具体的参照点。等同行评审版本出来,科学界才会知道这些结构与表达证据到底有多重的分量 —— 以及 ART 究竟会加入那份为数不多的可编程生物系统名录,还是只留成一个有趣的脚注,注在一次「AI 智能体被指向正确的数据时能找到什么」的演示上。