OpenAI 发布 Rosalind Workbench,把生命科学研究整合进一个环境
GPT-Rosalind 驱动的引导式任务、原生生物数据查看器与可溯源的 NGS 分析,收进同一个屋檐下

OpenAI 于 2026 年 8 月 28 日发布 Rosalind Workbench,把它的生命科学 AI 模型、引导式研究模板、原生生物数据查看器和新一代测序流水线,装进 ChatGPT 应用内一个可审计的环境。这个产品标志着一次显著转变:GPT-Rosalind 自 4 月起是一个独立模型,如今变成了更接近完整实验室软件环境的东西 —— 研究者可以从原始 FASTQ 文件走到经过质控的计数矩阵,或从一个蛋白结构文件走到带注释的分析,全程不必离开界面,也不必手工记录是哪个工具产出了哪个结果。
Workbench 现已开放研究预览。多步骤的高级生物工作流需要经过验证的机构访问权限;OpenAI 表示个人研究者的访问在计划中。
除了底层模型,Workbench 还加了什么
GPT-Rosalind 于 2026 年 4 月发布,是 OpenAI 首个领域专用模型,为跨生物学、药物化学、基因组学和湿实验方案的推理而建。6 月,OpenAI 更新了该模型,整合了 GPT-5.5 的智能体编码能力,并新增两个 Codex 插件 —— 生命科学研究与生命科学 NGS 分析 —— 以及针对生物文件格式的交互式查看器。Rosalind Workbench 把这些组件组织进一个连贯的科研工作空间,配有引导式任务模板、工具调用执行前的结构化审批环节,以及对产出物的持续溯源追踪。
那套溯源追踪不只是一项工作流功能。要接入药物研发的研究工作流,必须能逐步说明:哪个工具、在什么条件下、处理了哪个文件。OpenAI 把这套系统描述为保留「产物与溯源信息,以便结果可被审阅和修订」—— 这个措辞与《良好实验室规范》(GLP)的要求相契合,尽管 OpenAI 并未宣称获得 GxP 认证。
引导式任务库覆盖六个研究方向:蛋白设计、小分子设计、安全性与成药性、结构与序列、基因组学与病理学,以及实验验证。每项任务给出一个结构化的起点 —— 设计 PD-L1 纳米抗体的研究者可以从候选排序直接推进到实验规划和结合实验报价,中间不必重新拼接上下文。
这条技术流水线是怎么跑的
Rosalind Workbench 的执行层跑在 Codex 上。GPT-Rosalind 充当编排者:它理解一个生物学问题、判断该调用哪些工具,并产出一份必须由研究者批准才能继续执行的计划。这个「人在环内」的关卡,是 Workbench 与全自主流水线的区别所在。
三个原生生物查看器嵌在对话里。分子结构查看器以三维方式渲染 PDB 文件;在 OpenAI 的演示中,它打开了 PDB 5LF3 —— 与硼替佐米结合的人源 20S 蛋白酶体 —— 并标注了 α 环入口、催化腔和药物结合位点。生物序列与比对查看器对齐蛋白序列并高亮功能上重要的残基;示例展示了 GFP 变体(avGFP、EGFP、EBFP、ECFP)并标注了发色团位置。病理切片查看器则允许在对话内浏览组织切片,标记出需要进一步检查的区域。
NGS 分析工作台承接了此前需要定制生物信息学流水线的那些步骤。研究者上传 FASTQ 文件,系统用 FastQC 做质控、生成 MultiQC 报告、处理样本元数据匹配、重复样本识别和统计设计选择,然后返回批量 RNA-seq 的计数矩阵,或单细胞分析的细胞类型注释。OpenAI 举的实例是一组地塞米松处理的气道 RNA-seq 数据集:一项带生物学重复、需要识别处理条件、下游要做差异表达分析的研究。这些是标准但并不轻松的生物信息学任务 —— 目前跑它们需要命令行功底、Snakemake 或 Nextflow 之类的工作流管理器,以及大量的计算环境搭建。Workbench 把这一切抽象掉了,同时返回业界认可的输出格式。
厂商自测的基准,以及它们能证明什么
OpenAI 报告称 GPT-Rosalind 在 LifeSciBench、MedChemBench、GeneBench 和 LabWorkBench 上均优于 GPT-5.5。这些结果由该公司自行评测,尚无独立复现发表。
LifeSciBench 是 OpenAI 自己的基准,由领域专家评审在六个生命科学工作流维度上打分。据 OpenAI 的 Yunyun Wang 解释,LabWorkBench 由真实科学家对实验方案所做的改动构建而成,要求模型指出正确的方案调整 —— 这种设计更难被刷分,测的是实务推理而非教科书式记忆。在 GeneBench 上效率增益最明显:GPT-Rosalind 比 GPT-5.5 少用 31% 的 token,同时准确率更高。在 MedChemBench 和 LabWorkBench 上,token 节省幅度更温和,但准确率提升是一致的。所有数字均为厂商自报,对企业负载而言方向上有意义,但需要独立验证。
访问分级,以及它背后的生物安全架构
探索模式面向一般科学问题广泛开放。研究模式 —— 启用完整的多步生物推理、工具编排和 NGS 流水线能力 —— 需要经过验证的机构访问权限。这个区分反映了 OpenAI 在双重用途生物风险上有据可查的立场。GPT-Rosalind 的可信访问审核要求机构在获得研究模式之前,证明其研究用途正当、并具备适当的生物安全治理 —— 这实际上落实了生物安全研究者所倡议的「了解你的客户」审查框架。
竞争格局:模型层面的对手,和一个较少被注意的平台威胁
三家前沿 AI 实验室如今在生命科学 AI 上各占一块。Isomorphic Labs—— 从谷歌 DeepMind 分拆出的 AI 药物发现公司 —— 于 2026 年 5 月融资 21 亿美元,凭 AlphaFold 3 及其药物设计引擎主导结构预测。但 IsoDDE 不是对话式的,多数研究团队接触不到,也不延伸到基因组学或湿实验规划。Anthropic 于 2025 年 10 月推出Claude for Life Sciences,支持研究者完成文献综述、假说生成和数据分析工作流。Anthropic 原生生物数据查看器的公开技术规格(如果有的话)尚未详细到能与 Workbench 内嵌的 PDB、序列和病理查看器做直接能力对比的程度。
较少被注意的那个竞争品类,是中端生物信息学 SaaS 平台。围绕「FASTQ 到结果」流水线、多样本质控、差异表达和单细胞注释构建的工具,服务研究团队已有多年。如果一个研究组现在能在 ChatGPT 里跑完同一条 NGS 流水线 —— 有引导、有 AI 协助、输出结构化 —— 那么独立生物信息学软件的价值主张,在预算讨论中会变得明显更难辩护。目前依赖命令行流水线或生物信息学公共平台的学术研究者,面对的是同一个转变:做一次称职的 RNA-seq 分析,门槛正在降到「申请机构访问权限,然后照着引导模板走」。
OpenAI 尚未解决的那个可复现性上限
Rosalind Workbench 的溯源追踪,相比无结构的 AI 辅助研究是一次真实改进。更难的问题在于:受监管环境下的制药工作流要求**确定性**可复现 —— 相同输入、相同方法、相同输出,逐比特一致,每次运行皆然,并且能被一位当时不在场的监管者审计。而 AI 模型本质上是非确定性的。相同的提示、相同的文件、相同的工具配置,在连续多次运行中会产生统计上相似但并不完全相同的输出。OpenAI 没有直接回应这一点,而这也正是为什么即便是拿到资质的 GPT-Rosalind 企业团队,也很可能把这个模型留在「顾问」这条车道上,而不是放进监管申报所需的确定性分析路径。
LabWorkBench 这个基准的设计,是一次诚实的、去测量某种实务意义的尝试。但在某一时点评估推理质量,与保证这种推理在多次运行间的一致性,并不是一回事 —— 而后者才是 GxP 合规最终要求的那道门槛。
接下来的节点会是什么
OpenAI 的公告描述了一个未来状态:「多个智能体组成的团队在这些领域间协同工作」—— 由多个专门化的子智能体在同一个研究项目上协作。这个架构不在当前的 Workbench 里;今天是单个 GPT-Rosalind 模型编排全部工具调用。
更近的一个节点,是个人研究者对研究模式的访问权限。在那扇门打开之前,Workbench 最强的功能仍然只对企业开放 —— 这对安进和诺和诺德是有意义的,但对最可能从引导式 NGS 分析和 AI 辅助实验规划中受益的学术实验室、早期创业公司和独立研究者来说,仍然够不着。OpenAI 放开这个访问的速度,将决定 Rosalind Workbench 究竟是生命科学研究的一次真正普及,还是一个高端企业平台外挂了一个消费级探索模式。而科学共同体是否愿意把它的溯源记录当作真实研究决策的依据 —— 靶点弃选、患者分层、实验的上马与否 —— 才是那个基准表格和合作公告都替代不了的验证点。