Raven V0.2.0 开源:让 AI 改写自己的运行层
实验性的 Curator 模块让 AI 不碰模型权重就能改写自身行为

由盛大集团孵化的 AI 公司 EverMind 于 2026 年 9 月 23 日发布了 Raven V0.2.0 —— 这是对其开源多智能体 AI 框架的一次重大修订,公司把它描述为「框架的框架」(Harness of Harnesses):一套用来编排专职 AI 智能体、跨会话保留经验、并通过反馈改进自身操作流程的系统,而这一切都不需要重训底层模型。该版本采用 Apache-2.0 许可,已在 GitHub 上提供。
这个框架的核心主张,挑战的是这个领域通常怎么理解递归自我改进。关于 AI 自我改进的讨论大多聚焦在模型权重上 —— 也就是编码着语言模型知道什么、如何推理的那些内部参数。EverMind 借用的则是认知神经科学里的互补学习系统理论:海马体快速吸收具体经验,皮层缓慢地把一般性知识固化下来。在 Raven 的框架里,模型权重类比于皮层 —— 适合慢速固化 —— 而掌管模型如何规划、如何用工具、如何管理记忆与执行动作的框架层,则应该像海马体那样:适应得快,并且对 AI 驱动的修改是开放的。
由此得到的,是一个把「AI 模型知道什么」与「它怎么工作」分开的框架。Raven V0.2.0 的设计让 AI 可以改写后者 —— 更新提示词、工具可用性、策略代码和 playbook 结构 —— 而不碰前者。
延伸阅读:RSI:AI 加速 AI —— 瓶颈已从能力转移到验证
框架的框架:编排专职智能体
Raven 的架构建立在一个两层结构上。外层是一个宿主智能体 —— 也就是 Raven 本身 —— 它接下一个复杂目标,把它分解成一张任务的有向无环图,把每个节点指派给某个专职智能体,并管理依赖、交接和结果。内层则是每个专职智能体带着自己的执行机制、工具和记忆去做分派到的活。
Raven V0.2.0 内置四个专职智能体:负责深度研究与文献分析的 Raven-Research;负责编码、调试与数据分析的 Raven-Code;负责演示文稿、网页、视觉交付物和品牌素材的 Raven-Design;以及负责长时间实验与持续执行任务的 Raven-Oncall。第五个智能体 Raven-PPT 作为一个隐藏引擎存在,Raven-Design 会把 PowerPoint 相关的活路由给它。
外部智能体 —— 包括 Claude Code、OpenAI 的 Codex 等 —— 通过 Agent Connector 接入,它支持 Agent Communication Protocol、标准命令行接口和 OpenAI 兼容 API。这个连接器会先用一条真实提示词测试每个智能体,然后才把它标记为可用,这样连接失败或认证问题会立刻暴露,而不是等到任务跑到一半。接入之后,外部智能体接收任务分派、返回交付物的方式与内置智能体相同;编排层对它们一视同仁。
实际后果是:一张 Raven 任务图可以把研究子任务路由给 Raven-Research、把编码子任务交给 Claude Code、把设计子任务给 Raven-Design,各自的输出再喂进下一个环节。EverMind 用一个悬臂梁仿真场景演示了这一点:Raven-Research 确定方法,Raven-Code 实现仿真,Raven-Oncall 跑实验并监控收敛结果。任务图会跟踪每个下游节点需要哪些上游输出,当前置节点失败时跳过依赖它的节点,同时让互不依赖的分支继续走下去。
Playbook —— 也就是用户可以保存并复用的任务图 —— 让团队能把一条跑通的多智能体工作流固化下来,之后按名字再次调用。EverMind 把它定位成写自动化脚本之外的另一条路:playbook 是在任务第一次运行时交互式地建起来的,然后就可供后续调用,而不需要开发者把它形式化成代码。
Curator:AI 改写自己的运行层
V0.2.0 里架构上更新颖的一项增补是 Curator,它作为实验性功能放在仓库的 experimental/curator 目录下。Curator 这个组件会读取当前的框架配置,审阅任务结果和用户反馈,对四类框架要素生成修改提案 —— 提示词与 playbook 内容、工具可用性与放行策略、策略代码,以及模块组合 —— 并在一轮校验之后把这些修改装上去。
EverMind 把框架中可修改的要素组织成四个策略接口:记忆(某次对话能访问哪些上下文)、规划(决定任务顺序的排序逻辑)、能力(模型在任一时刻可以调用哪些工具)和动作(某个动作执行前要做哪些检查)。Curator 会生成这些接口的 Python 类实现,把它们绑定到既有的回调点上,并在把任何东西写入磁盘之前跑一遍预安装检查。如果安装失败,前一个框架版本会自动恢复。
整个过程不需要改动 Raven 核心的源代码。所有变更都落在 EverMind 为 AI 驱动的修改而设计的扩展点上:智能体的主目录、插件槽位和公开的策略协议接口。
为了演示 Curator 的运作,EverMind 公布了一个模拟案例研究 —— experimental/simulation/cases/s0925c —— 其中一位虚构的旅行社老板提供素材、扮演客户,并在每次模拟会话后给出反馈。Curator 仅凭最初的素材就生成了流程代码和评分细则检查,随后在多轮之中把用户反馈转化成对正在运行的框架的具体调整。到第三轮评估时,该评估中全部 11 条红线标准都通过了。EverMind 明确说明,这只是一个模拟案例,不是统计意义上的验证,Curator 仍属实验性质。跨场景的稳健性测试、以及与模型权重层面更新的整合,都还没有完成。
延伸阅读:OpenAI 首席科学家警告:在 RSI 到来之前,AI 监控正在失效
基准结果:厂商自报的成绩,以及点名的对比对象
EverMind 随版本发布了一份日期为 2026 年 9 月 27 日的技术报告,涵盖编排、研究、编码、设计和长时实验任务上的基准。下文所有数字除另有说明外均来自 EverMind 自己的评测;独立复现尚未得到确认。
在多智能体编排上 —— 衡量系统生成任务图的准确度 —— Raven 报告了在相同底座模型下对比 Hermes 和 Claude Code 的结果。以 Qwen3.8-27B 为底座时,Raven 的节点 F1 为 0.923、边 F1 为 0.812、偏序准确率 0.950、完全匹配率 0.711;以 DS-V4-Flash-0731 为底座时,对应分数是 0.963、0.897、0.918 和 0.867。EverMind 称两者在相同模型下都高于被对比的系统。
在合并了 BrowseComp、FRAMES、HLE 和 xBench-DeepSearch 的深度研究基准上,Raven-Research 用 Qwen3.6-35B 得 56.3%、用 Qwen3.5-397B 得 59.3%、用 DS-V4-Flash 得 76.5%,而 DeepSeek-Harness 基线对应为 49.7%、56.0% 和 68.9%。
在解决真实软件问题的编码基准 SWE-bench Pro 上,Raven-Code 用 Qwen3.8-27B 报告 54.4% 的问题解决率,对比 Claude Code 的 52.4%。在 SWE-bench Verified 上用 DS-V4-Flash,Raven-Code 报告 91.0%,对比 DeepSeek-Harness 的 90.4% 和 OpenCode 的 90.2%。在代码质量基准 SWE-Refactor 上,DS-V4-Flash 配置下 Raven-Code 得 16.5,Claude Code 为 7.0;用 GPT5.6-Luna Max 时 Raven-Code 得 13.5,Codex 为 10.5。在 DataAgentBench 实时榜单上,Raven-Code 用 Opus-5 报告 Pass@1 为 0.8762,次名系统为 0.8713。
在一项长时实验任务上 —— 用两块 A800 80GB GPU 跑 Nanochat 50M 预训练的 AI4AI 评测 —— Raven-Oncall 在七轮、172 次训练运行中把验证集 bits-per-byte(val_bpb,衡量语言模型困惑度的指标,越低越好)相对降低了 5.8%,且每次运行的算力预算固定为每 GPU 20 分钟。
在一项内部的 AI4S 科学基准上,Raven-Oncall 用 Opus-5 报告 82.35% 的任务成功率,而同样用 Opus-5 的 Claude Code 为 64.71%。
RSI 的实践:AI 改进 AI 的研究方法
在 Curator 之外,EverMind 另做了一个 Raven RSI 实验:让 Raven 自主开展预训练实验,把 val_bpb 作为它不被允许修改的目标。Raven 规划了七轮中的每一轮,写训练代码、启动实验,并根据结果选择调整方向。在 172 次训练运行中相对提升 5.8%、且没有一次训练崩溃,是这个实验的标志性结果。
EverMind 还用 Raven 制作了 V0.2.0 版本自己的宣传素材:一个基于浏览器的物理游戏、一份 16 页的产品资料、中英文海报,以及一份项目 README。公司把这当作一个演示,说明四个专职智能体可以在一张任务图里组合起来,覆盖从代码、内容、视觉到文档的完整生产流程。
平台细节
Raven V0.2.0 引入了由 raven web 提供的网页界面,取代了此前只有终端的形态。这个界面包含对话视图、一个涵盖提供商/技能/插件/渠道/记忆与调度的设置对话框、一个管理外部智能体连接的 Agent Connector,以及一个带文件、智能体和任务面板的工作台。仓库随附 Docker 镜像和 Compose 文件,支持容器化部署。安装器现已支持 Linux、macOS、WSL2 和原生 Windows。
EverMind 的记忆层 EverOS 为用户上下文、智能体经验和世界知识提供跨会话持久化。SkillForge 则按需从本地技能库、EverOS 记忆和一个 SkillHub 目录中检索相关技能。两者都包含在默认安装里。
EverMind 计划在 2026 年 10 月通过其 EverMe 产品推出 Raven 的云托管版本。
完整代码库、安装说明、文档和 Curator 的模拟案例都在 github.com/EverMind-AI/Raven。