GPT-6 Astra 刷爆了一位独立开发者用编程智能体造的多模态基准
80.46 分说明,自动生成的游戏引擎环境确实能给出真实的强化学习信号

当 OpenAI 的 GPT-6 Astra 这个月通过 Kaggle 的模型评测平台开放时,一位独立开发者正在跑一个冷门的多模态智能体基准,他看到了意料之外的一幕:他的基准被刷爆了,而他挺高兴。
AgentArk Bench 由开发者 Jack Liang(用户名 P90-RushB)托管在 Kaggle 上,目前涵盖 14 个公开任务环境和六个模型。在这些条件下,9 月 4 日向所有付费用户开放的 GPT-6 Astra,按 Liang 的 Kaggle 看板显示拿到了 80.46 的综合分,拉开了他所说的「非常明显的差距」,超过此前在同一批环境上评测过的所有模型。作为背景:GPT-6 Astra 是 OpenAI 迄今最大的一次训练 —— 公司称在其位于得克萨斯州的 Stargate 设施上用了超过 10 万块 GPU 训练,模型带有 105 万 token 的上下文窗口,定价为每百万输入 token 10 美元、每百万输出 token 50 美元。在业内要求最高的交互式基准 ARC-AGI-3 上,Astra 在标准化的、与厂商无关的评测框架下得 62.7%(其前代 GPT-5.6 Sol 是 7.8%),而在一个能在动作之间保留推理状态的厂商适配框架下达到 99.9%。
对 Liang 来说,AgentArk Bench 的这个结果不是这套基准该退场的信号,而是一个证据:它底层的做法 —— 用编程智能体自动生成多模态智能体的训练与评测环境 —— 确实能产出有意义、可解、并且对真实能力差异敏感的任务。这正是他一直在等的那个实际验证。
Astra 在 AgentArk Bench 上的表现,与它在更广泛评测中的画像一致。在测试智能体完成真实操作系统任务的计算机使用基准 OSWorld 2.0 上,OpenAI 报告 Astra 在一个离线的部分评测子集上得 72.6%,而 GPT-5.6 Sol 在同样条件下是 65.7%。在覆盖终端环境中软件工程与系统配置任务的 Terminal-Bench 4.0 上,Astra 得 57.9%,Sol 是 37.3%。在研究者本以为多年内都攻不下的高等数学题集 FrontierMath Tier 4 上,Astra 达到 97.6%。独立评测机构 Artificial Analysis 发现,Astra 在他们的智能指数上落后于 Claude Fable 5.1 —— 在可比的努力档位下,Fable 5.1 是 66,Astra 是 61 —— 而在编程智能体指数上 Astra 领先,67 对 70,整体图景比 OpenAI 发布材料所呈现的更参差。各项基准贯穿的一条主线是:在需要跨陌生问题域持续多步执行的任务上,Astra 明显更强 —— 而这恰恰是 AgentArk Bench 和 ARC-AGI-3 这类交互式环境所要施压的那类能力。
延伸阅读:GPT-6 Astra 发布:OpenAI 首个「关键」级网络安全 AI,附带一处监控退步
这是环境的问题,不是算法的问题
智能体 AI 研究面临的大挑战,是造出能真正从交互经验中学习的模型:探索一个未知环境、对它的规则形成假设,并随时间调整行为。拖住这个目标的不是训练算法(它们已经有长足进展),而是环境的供给。编程智能体 —— 为软件工程任务优化的系统 —— 有现成的基础设施可用:代码仓库、编译器、单元测试、终端输出。而那些必须解读视觉观察、在陌生 3D 空间中导航、操作受物理规律支配的物体、或者在没有自然语言指令的情况下与图形界面交互的多模态智能体,可用于大规模强化学习的环境要少得多。
这种不对称有结构性的原因。为多模态智能体造一个可用于强化学习的环境,远不只是写个游戏。这个环境必须提供随机化和种子控制以生成新的回合、可靠的重置与回放行为以保证可复现、一个在每一步都正确更新的奖励函数、覆盖所有异常模式的错误处理,以及 —— 最关键的 —— 一套验证机制,确认任务确实可解、且智能体的观察里含有成功所需的信息。一个能跑起来、不崩溃的静态游戏关卡,离「可用于强化学习」还差得远。
AgentArk 的答案是把编程智能体当作环境工厂。当前的大型编程系统,已经足以产出一个基于 Unity 的游戏环境所需的大部分脚手架;AgentArk 的工作流把这种能力包在若干验证步骤里,逐条检查一个可用于强化学习的环境真正需要的那些性质。这个数据集以 CC-BY-NC-4.0 许可证发布在 HuggingFace 上,覆盖各类任务的 200 多个环境。
编程智能体写任务,游戏引擎判分
AgentArk 的架构围绕 Task Mods 搭建 —— 那是可独立加载、接入共享运行时的环境定义。每个 Mod 自带任务说明、观察格式(可以包括 RGB 帧、多帧视频、界面截图、文字描述、动作历史、错误日志和此前的尝试得分)、动作 API、奖励或计分逻辑、终止条件,以及逐回合的随机化。运行时只提供执行基础设施、交互循环和工作进程管理,不需要知道任何一个 Mod 究竟在要求智能体做什么。
这种统一是有意为之的。同样这 200 多个环境,既作为评测基准(通过 Kaggle 上的 AgentArk Bench 开放),也作为强化学习的训练场,供使用兼容框架的研究者使用。一个任务造一次,两边都能用,不必再平行实现一遍。在一个「多数多模态基准只用于评测、多数强化学习环境只用于训练」的生态里,这种兼顾减少了重复劳动,也让评测条件与训练条件保持一致。
奖励验证这一关 —— 历来是大规模多模态强化学习的瓶颈之一 —— 是靠 Liang 称之为「易判、难决」的结构性性质来解决的。AgentArk 任务中的智能体只能看到渲染出来的视觉输出,而环境底层的游戏引擎握有完整的数值状态:相机位置向量、物体坐标、速度场、碰撞标志和刚体数据。对于一个「判断两个物体中哪一个离相机更近」的空间任务,智能体必须从一张 2D 图像里推理深度、透视和遮挡;而环境计算基准真值,只是对位置向量做一次直接的算术比较。对于一个「把抛射物打进目标区域」的物理任务,智能体必须从多次尝试累积的视觉反馈中估计弹道;校验器只需判断抛射物的最终坐标是否落在目标边界内。判定结果不需要任何外部语言模型 —— 游戏引擎本来就知道答案。
这一点对训练成本很关键。在一次 GRPO 训练中,若让一个视觉—语言模型在每一步 rollout 上充当奖励裁判,每个回合都要多付出可观的算力;而对着游戏引擎状态查询一次位置比较函数,成本基本为零。对于想大规模训练多模态智能体的研究者来说,「用 VLM 当裁判」还是「用可计算的基准真值校验器」,可能就是训练预算可行与不可行之间的差别。
把代码当作动作,并把报错反馈进循环
AgentArk 的动作接口是为语言模型、而不是传统强化学习策略设计的。标准的强化学习环境暴露的是一个固定的离散动作空间 —— 从查找表里选出的整数动作。对于输出「已知动作集上的概率分布」的神经网络来说,这是合适的;但它扔掉了语言模型身上最有特色的那项能力:写代码。
AgentArk 把动作暴露为函数调用,在更复杂的任务里则暴露为完整的代码提交。一个控制物理仿真的模型,可能会发出 Launch(force=12.5, angle=47) 这样的结构化函数调用;一个解决开放式控制任务的模型,则可能提交一整段程序。两种情况下,提交的代码都是被拿到环境里执行,而不是被当作索引去查表。每个阶段的错误 —— JSON 模式不合法、编译失败、运行时异常 —— 都会被捕获,并在下一步作为观察返回给模型。模型可以读编译器诊断或异常栈,据此修改下一次提交。
这个设计利用了语言模型区别于早期强化学习策略的一项核心能力:无需在两次尝试之间更新权重,就能从结构化的文字报错中自我纠正。一个产生了有用报错信息的失败动作,本身就是训练信号。
GRPO 训练如何用上同一批环境
在群体相对策略优化(GRPO)下 —— 它是 2025 和 2026 年开源框架中占主导地位的智能体强化学习算法 —— 同一任务的多次 rollout 会被并行采集,然后在组内相互比较以计算相对优势。表现高于组内平均的轨迹获得正向梯度信号,低于平均的受到惩罚。省掉单独的价值网络,使 GRPO 在大规模下比 actor-critic 方法便宜得多。
AgentArk 的环境服务器负责分配任务标识、随机种子、回合重置、预热的工作进程池和沙箱隔离。训练代码 —— 无论跑在 ms-swift(Modelscope 的 SWIFT 框架)还是 verl(火山引擎的分布式强化学习库,2026 年在开源智能体强化学习中被广泛使用)上 —— 都通过 HTTP 与环境服务器通信,让训练代码与底层的 Unity 进程管理解耦。
对基于组的算法来说,同一批次内种子一致很重要。如果同一个 GRPO 组内的不同成员遇到的是同一任务的不同随机初始化,那么奖励的差异反映的是环境的随机性而不是策略的好坏,梯度信号就被稀释了。AgentArk 会给一个组里的所有 rollout 分配相同的任务标识和随机种子,确保组内结果的差别来自模型的行为,而不是环境抽签的运气。
竞争格局:多模态智能体训练还有什么可用
AgentArk 所处的「环境生成」这个细分相当稀疏。现有的多模态智能体评测基础设施大多落在两类里:一类是真实世界中的落地环境,智能体与真实的操作系统、网站或硬件交互;另一类是静态评测基准,任务集在发布时就固定下来,不再扩充。
OSWorld 2.0(OpenAI 报告 Astra 成绩所用的那个离线部分评测)代表的是真实落地那一类:它在涉及真实应用和文件系统的实际操作系统任务上评测智能体。WebArena 及其后继者在网页交互上走的是类似路线。这些环境的生态效度很高 —— 它们反映真实的部署条件 —— 但维护昂贵、难以随机化,而且因为状态不可逆,并不适合用于强化学习训练。
ARC-AGI-3 代表的是一批经过人工精心验证的抽象交互环境,设计上要排除任何可能来自既有训练的模式匹配捷径,检验真正新颖的适应性行为。它的任务集是固定且半私有的,不是为强化学习训练设计的。Agentick 是最近出现的一个基准,明确支持包括强化学习在内的多种范式,但任务分布更窄。
AgentArk 占的是另一块地方:基于游戏引擎的环境,随机化便宜、重置容易、可由引擎的基准真值状态自动验证、可由编程智能体持续扩充,而且评测与训练共用。代价是生态效度较低 —— 这些环境是抽象的游戏任务,不是真实世界的工作流 —— 而且在验证流水线实现更充分的自动化之前,它依赖一位开发者的质量判断。
像 verl-agent 和 uni-agent(出自 veRL 项目)这样的框架,提供的强化学习训练基础设施可以消费 AgentArk 产出的环境;这两个项目是互补而非竞争的关系。OpenEnv 和 Prime Intellect 的 Environments Hub 关注的是把已有环境标准化和分发,而不是生成新环境,处理的是这条流水线上的另一个环节。
以当前形态看,AgentArk 的实际受众相当窄:那些正在多模态模型上跑智能体强化学习实验、并且发现现有环境库覆盖不了自己想训练或评测的能力维度的研究者和机器学习工程师。一个想提升模型 3D 空间推理能力、物理控制能力,或者对图形界面反馈的响应能力的团队,基本找不到任何一个既现成可用、又支持 GRPO 训练的环境库。AgentArk 提供了这样一个库的早期版本,但要记住几条重要限制:环境数量仍然有限,验证流水线需要持续维护,而整个项目依赖一位开发者的持续投入。对于有工程余力向项目回馈环境的团队来说,CC-BY-NC-4.0 许可证和公开的 GitHub 仓库让参与在技术上并不困难。目前还看不到的,是除 Kaggle 评测提交之外任何外部开发者采用的证据。
生成任务是必要的;验证才是真正的瓶颈
AgentArk 这套做法最重要的但书是:为一个环境生成代码,和生成一个有效的智能体任务,不是一回事。Liang 描述了一条多阶段的验证流水线:一个 Coordinator 负责调度开发工作;一个 Designer 把能力缺口翻译成任务规格;一个 Builder 实现环境;一个 Reviewer 检查视觉可观测性(从智能体的相机角度,它真的看得到它需要看到的东西吗?)、在真实 rollout 条件下的可解性、重置的稳定性和回放的一致性。
即便过了 Reviewer 这一关,流水线还包含一次黑盒智能体试玩(Black-box Agent Playtest)。一个模型被放进任务里,条件与评测时的模型完全一样,对环境的设计意图一无所知。目的是暴露那些能通过代码评审、却在实际运行中崩掉的失效模式:从智能体的相机角度根本看不见的目标、稀疏到在合理回合预算内无法学习的奖励反馈,或者任务描述准确、实际动力学却让人摸不着头脑的机制。Liang 打的比方是:一个糟糕的试玩分数,就像玩家说「我能动,但我到底该干什么?」—— 这是代码正确性检查给不出的信息。
这层验证开销,才是「2026 年底做到 1000 个环境」的真正约束。编程智能体已经足以可靠地产出环境脚手架;瓶颈在于可靠地自动验证每个环境对智能体评测而言是否设计得当。200 个环境这个数字,代表的是项目自 2026 年 7 月开源以来约两个月的开发量。要把差距补到 1000,需要加速的是验证步骤,而不是代码生成。
80.46 分证明了什么,又没证明什么
Liang 说,他对 Astra 拿到 80.46 的反应,与其说是被验证的欣慰,不如说是松了一口气。在 Astra 之前,他面对的是早期基准常见的一个解释难题:当所有模型在所有任务上都得分很低时,你很难判断这些任务究竟是难而有意义,还是根本就坏了。设计坏掉的任务产生低分,和能力不足产生低分,一样可靠。而 Astra 在同一批环境上相对此前模型的大幅跃升,至少解开了一部分模糊:任务对足够强的模型是可解的,奖励信号是正常工作的,设计上预留的能力空间是真实存在的。
Astra 的高分没有确立的是:每一个具体任务都设计得当、当前公开的 14 个任务构成了对多模态智能体能力的全面评测,或者 80.46 这个综合分精确到小数位都可靠。这个基准目前覆盖 14 个任务上的六个模型 —— 是一个数据点,不是一份权威排名。80.46 这个分数由开发者依据 Kaggle 评测平台自行报告,尚未被任何独立评测研究引用。任何把它当作既定事实、而不是「开发者自报的评测结果」的分析,都应当照此打折。
Astra 这个结果更经得起时间的启示是方向性的:面对基准被刷爆,恰当的反应不是让这个基准退场,而是加入更难、更古怪、要求更高、模型当前能力还不够用的环境。Liang 说,正是这个逻辑让他把重心更集中到与 ARC-AGI-3 相邻的任务,以及其他「失败模式有意思而不是无聊」的领域上。
让环境与它们训练的模型一同演化
Liang 对 AgentArk 的长期设想,是一条反馈回路:评测中的失败自动生成下一轮环境开发的规格。在当前环境集上训练出的模型接受评测;它的失败轨迹被分析出能力缺口 —— 深度估计吃力、无法把学到的规则迁移到不同的视觉语境、在陌生状态空间中的规划视野不足;这些缺口被转化成新的任务规格,由编程智能体实现、由验证流水线核验。结果是一套随模型一同演化、而不是固定不变的课程。
闭合这条回路的现实瓶颈,与限制环境数量的是同一个验证问题:从 rollout 轨迹自动分析能力缺口并不简单,而自动设计试玩需要对环境有理解的推理能力,当前系统在这件事上时灵时不灵。1000 个环境这个目标,是通往共演化回路的基础设施,而不是回路本身。
GPT-6 Astra 在 AgentArk Bench 和 ARC-AGI-3 上的表现,把一件事说具体了:这条回路里能力那一侧的推进速度,快过环境供给。2026 年 3 月,前沿模型在 ARC-AGI-3 的任务上得分不到 1%,而每一个受测人类都能轻松解开。六个月后,同类抽象交互环境在先进框架下已接近饱和分,而标准框架下 62.7% 这个底数,代表着大约百倍的提升。对搭建多模态训练基础设施的研究者来说,实际含义是难点已经转移:当下紧要的瓶颈不再是算法设计或模型规模,而是产出环境 —— 要有量、要有可验证的奖励信号、要覆盖真正陌生的任务分布,并且难到足以驱动下一轮能力提升。AgentArk 这条「编程智能体加验证」的流水线,能不能按这个领域现在要求的速度供给这些环境,是接下来几个月才会开始有答案的问题。