Sapiens AI 发布 Agnes-3.0-Flash:以 Apache 2.0 开源的 33B 多模态模型,支持 262K 上下文
混合 delta 规则设计把 KV 缓存层压到 25%,让 262K 上下文可在单卡上部署

总部位于新加坡的 Sapiens AI 于 9 月 11 日发布了 Agnes-3.0-Flash —— 该公司首个以 Apache 2.0 许可证开放权重的多模态模型,拥有 330 亿参数和 262144 token 的上下文窗口,单张 NVIDIA H200 或 H100 就能装下。这个模型最具决定性的工程选择在于架构:它没有堆叠 72 个标准注意力层 —— 那样会积累起一份随每个新增 token 不断增长的键值缓存 —— 而是把其中 54 层做成门控 delta 规则循环单元,无论输入多长,它们都只保持一个固定大小的状态。只有余下的 18 层会产生那种随上下文长度增长、让长上下文推理变得昂贵的 KV 缓存。这个 3 比 1 的循环层与注意力层之比,并不是从别家实验室设计里继承来的折中;它反映出一个刻意的架构押注:循环线性注意力已经成熟到足以大规模承载生产负载。
Agnes-3.0-Flash 要缩减的,是 KV 缓存问题
要理解 Agnes-3.0-Flash 在技术上新在哪里,先得理解标准 Transformer 架构在长上下文下带来的代价。在常规注意力模型里,每一层都必须为它处理过的每个 token 存下键向量和值向量。随着序列增长 —— 从 8000 个 token 到 128000,再到 262000 —— 这份键值缓存会在所有层上同时累积。对一个大模型来说,在最大上下文长度下,每个注意力层可能就要占用数十 GB,这限制了一块 GPU 能同时服务的请求数,也让不做大量额外工程就在单卡上跑 262K token 变得不切实际。
过去两年研究中被广泛探索的替代方案,是线性循环注意力:每个循环层不再对全部历史做注意力,而是维护一个紧凑的、固定大小的状态矩阵,并用一条加权的「擦除—写入」规则随每个新 token 更新它。状态不会增长。代价是表达力:纯循环层在超长文档上的精确回忆能力不如全注意力,因为它必须把全部历史压缩进一个有界的表示里。
Agnes-3.0-Flash 采用的方案 —— 也是近期研究一再验证的方案 —— 是混合。通过在以循环层为主的层堆叠中按固定间隔穿插全注意力层,模型对上下文中确实需要精确注意力的那部分保留了这种能力,同时把产生缓存的层数从 72 减到 18。Agnes-3.0-Flash 把 KV 缓存的累积限制在 25% 的层上,与同参数规模的全注意力模型相比,长上下文下的内存占用大幅降低。
delta 规则循环层究竟怎么运作
Agnes-3.0-Flash 使用的具体循环机制,是 delta 规则的一个门控变体 —— 一种根植于经典神经网络学习理论的记忆更新原理。在现代线性注意力的语境下,delta 规则更新层的隐状态矩阵时,先擦除它之前在当前键地址上存下的内容,再写入新信息。用数学表达,每个 token 的状态更新可以压缩为:新状态 = 旧状态 ×(单位矩阵 − β × 键与自身的外积)+ β × 值与键的外积 —— 其中 β 是一个逐 token 学习得来的写入强度。
实际的后果是,循环状态会修正自己之前的估计,而不是简单地不断叠加写入,这让它对序列中会变化的信息更准确。Gated DeltaNet 机制 由一篇 ICLR 2025 论文提出,它加入了一个逐层的遗忘门,让模型可以让无关的历史逐渐衰减,而不是无限期地保留 —— 这一机制借自传统的门控循环网络,并针对线性注意力体制做了改造。
在 Agnes-3.0-Flash 公布的架构中,54 个循环层各有 16 个键头和 48 个值头,头维度为 128,前面接一个因果卷积核,并配有门控归一化。18 个全局注意力层则采用更常规的分组查询设置 —— 24 个查询头对 4 个 KV 头,6 比 1 的比例缩小了每个注意力层产生的 KV 缓存 —— 并在计算注意力之前对查询和键都做 RMS 归一化。
前馈结构还有一个不寻常之处:每一层在把输入投影到 17408 中间维度的标准 SwiGLU 之外,还并行运行一个维度为 2048 的较小 SwiGLU 分支。这两条路径是同时执行的,而不是先后执行。一些近期模型采用这种并行前馈设计,用来在不按比例增加延迟的前提下,提升每一层的表达力。
多模态流水线与推理控制
Agnes-3.0-Flash 通过一个随附的视觉塔接收文本、图像和视频:27 个 transformer 层,以 16 的 patch 尺寸处理,并经过 2×2 空间合并,再投影到 5120 维的模型隐藏维度。位置编码系统使用一种三轴旋转位置编码 —— 分别为文本、图像高度和图像宽度设置旋转维度 —— 让模型能表示视觉输入中的空间关系,而不必把它们压扁成纯序列形式。
对话接口提供三个具名推理档位 —— 高、中、低 —— 对应不同的推理预算,另有一个关闭思考的模式,为延迟敏感的应用完全跳过扩展推理。这种对推理算力的分级控制在强推理模型中越来越常见,让开发者可以根据工作负载在回答质量与速度之间取舍。工具调用遵循一套显式语法,使用 <tool_call> 块:模型输出这些块,应用解析它们来执行函数并返回结果,与其他主要模型家族的函数调用约定一致。
该模型同时提供兼容 OpenAI 的 Chat Completions API、兼容 Anthropic 的 Messages API,以及一个 Responses API —— 一次部署里提供三种不同的接口约定,这降低了已在使用其中任何一种格式的团队的集成成本。完整的 API 文档可在 Agnes AI 开发者中心查阅。
基准分数:能证明什么,不能证明什么
Agnes AI 的模型卡给出了一张参考基准表,把 Agnes-3.0-Flash 与另外九个模型进行对比,包括 Qwen3.6-35B-A3B、Kimi K2.5、Muse Glimmer 和 Gemini 3.5 Flash。模型卡对这张表明确加了限定:「表头的参数数字混用了总参数量与激活参数量,各来源所用的评测框架和快照日期也不相同,因此请把跨列比较当作参考值,而不是一次受控的正面评测。」这条自我限定值得认真对待。
在 GPQA Diamond 上 —— 一套由领域专家编写、共 198 道研究生水平的生物、化学和物理多选题,设计上要求真正的推理而非网络检索 —— Agnes-3.0-Flash 取得了公司汇编的 85.05 分。已获得或正在攻读相关领域博士学位的领域专家在这个基准上的得分约为 65–70%,所以按这一衡量标准,80 多分明显高于人类专家水平。不过,这个基准在 2026 年排行榜的头部已基本饱和,一些闭源模型的得分超过 92,所以 85 分把 Agnes-3.0-Flash 放在 2026 年强模型的中间梯队,而非前沿 —— 这一定位与一个 330 亿参数开放权重模型实际应有的水平相符。
在 IFBench 上 —— 一项衡量模型遵循复杂规格可靠程度的指令遵循评测 —— 公司汇编的参考分数为 74.20,在同一张表上高于 Qwen3.6-35B-A3B(64.4)等模型,但低于 Qwen3.8-27B(79.5)和 MiniMax M3(82.9)。
Artificial Analysis 智能指数 36 分还带有另一个重要限定:Artificial Analysis 平台上的条目明确标注为估算值,并注明「独立评测即将进行」。这个分数取自 10 项评测的综合 —— 包括编程、智能体任务完成、长上下文检索和科学推理 —— 反映的是部分测量,而非一次已完成的独立审计。Artificial Analysis 在 Agnes AI 的 API 上测得的输出速度为每秒 237 个 token,远高于同价位推理模型每秒 144.8 个 token 的中位数。不过首 token 延迟为 1.84 秒,而同类中位数是 0.95 秒 —— 对于能明显感知响应开始速度的交互式应用,这一延迟差距很要紧。
Agnes-3.0-Flash 在开放权重多模态版图中的位置
截至 2026 年 9 月,开放权重模型版图中有好几个 30B 级、上下文窗口在 262K 左右的选项,各自有不同的架构和许可取舍。
Qwen3.6-35B-A3B 来自阿里的通义千问团队,是架构上最接近的同类:它同样采用把 Gated DeltaNet 线性注意力与全注意力层结合的混合设计,同样有 262K 上下文窗口、采用 Apache 2.0 许可。它与 Agnes-3.0-Flash 的关键区别在于采用混合专家结构,每个 token 只激活 350 亿总参数中的约 30 亿。这种稀疏激活相对 Agnes-3.0-Flash 大幅降低了推理算力 —— 后者每次前向传播都要跑满全部 330 亿参数。对于吞吐敏感的部署,Qwen3.6-35B-A3B 的每 token 成本可能更低;对于看重稠密模型质量特性、或 MoE 路由开销会带来麻烦的部署,Agnes-3.0-Flash 是另一个选择。
Qwen3.8-27B 是通义千问家族中规模相近的稠密成员,采用 Apache 2.0 许可的纯注意力设计,但没有混合架构带来的 KV 缓存缩减。对于想要一个 30B 级、Apache 许可、又不想要混合架构复杂性的团队,它仍是一个可行的基线。
Llama 4 Scout 把上下文扩展得远得多 —— 理论上可达 1000 万 token —— 但它采用 Llama 4 社区许可证,该许可证不允许欧盟境内的开发者获取多模态权重,并要求月活跃用户超过 7 亿的产品另签协议。Agnes-3.0-Flash 的 Apache 2.0 许可证没有这类限制:商用、再分发和微调都被允许,没有地域排除,也没有用户数门槛。
混合架构本身,正在成为 2026 年强开放权重模型之间趋同的设计选择。Qwen3.6 和 Agnes-3.0-Flash 都把门控 delta 规则机制作为承重的架构元素,让一项起初只是 ICLR 2025 论文的研究技术,在大约一年内进入了生产级的开放权重模型。这种趋同表明,这一架构所做的取舍 —— 用有界的循环状态换取对 KV 缓存的控制 —— 正在跨过纯理论论证无法决定的质量门槛。
新加坡、Apache 2.0,以及「第三选项」定位
Sapiens AI 是 Agnes AI 产品线背后的新加坡公司,它的公开定位建立在一个明确的主张之上:一个强大的 AI 模型可以诞生于主导前沿 AI 发展的中美双头格局之外。创始人兼 CEO Bruce Yang 是新加坡国立大学的 AI 博士研究者,曾任职于微软和领英,他于 2026 年 2 月完成 1000 万美元 A 轮融资,由 LOOK FORWARD VCC 领投,使报道的累计融资额达到约 2000 万美元。到 2026 年 3 月,该公司报告其年度经常性收入已接近 2000 万美元 —— 对这个融资量级的公司来说,变现速度很快。Sapiens Technology 于 9 月 9 日、即本次模型发布两天前发布新闻稿,宣布入选《福布斯》亚洲「2026 年值得关注 100 家企业」榜单。
该公司的商业模式,把 Agnes AI API 定位为一个用单一账号和 API 密钥覆盖文本、图像和视频推理的统一端点,定价为每百万输入 token 0.05 美元、每百万输出 token 0.15 美元 —— 这三类推理目前都处在一个未公布结束日期的免费推广期内,可免费使用。开放权重发布则是它的补充:想要完全掌控模型的团队 —— 包括微调、离线部署和数据主权保障 —— 可以直接下载权重并自行托管。
这一定位与新加坡国家人工智能战略 2.0 高度契合。该战略于 2023 年 12 月推出,把 AI 能力建设列为国家战略优先事项。国家人工智能理事会于 2026 年 2 月在总理黄循财领导下成立,政府承诺在 2030 年前投入超过 10 亿新元用于公共 AI 研究和人才培养。Agnes-3.0-Flash 以 Apache 2.0 开放权重的形式发布,是一个商业里程碑,但它同时也代表着这一战略更大抱负所依赖的那种可验证的能力标杆 —— 一个源自新加坡、可以被独立评测,并与阿里、Meta 或 OpenAI 的模型并列部署的模型。
部署约束,以及独立评测尚待确认的部分
Agnes-3.0-Flash 的硬件要求对许多团队来说是实实在在的约束。运行 bf16 检查点需要约 66 GB 磁盘空间、一块 141 GB HBM 的 H200 或 80 GB 的 H100,以及 128 GB 主机内存。在张量并行度 2 下 —— 拆分到两块 GPU 上 —— 可用上下文和并发会增加,但硬件门槛也相应提高。没有高端加速卡的团队需要等待量化版本,或者使用 API。该模型还附带自己的定制实现,通过 Hugging Face Transformers 加载时需要设置 trust_remote_code=True —— 对于与 Transformer 基类差异较大的架构,这是常规做法,但谨慎的部署在上生产之前会想先审计一下这个标志。
在推理吞吐方面,每秒 237 个 token 的输出速度在这个价位上有竞争力,但 1.84 秒的首 token 延迟 —— 几乎是同类中位数的两倍 —— 对于用户要等第一个 token 出来才能看到任何输出的应用,会造成明显的延迟差距。这对多轮工具调用串联的交互式智能体工作流尤其相关,首 token 延迟会在多轮之间累积。
最主要的未决不确定性是智能指数分数。Artificial Analysis 给出的 36 分是反映部分评测的估算值 —— 该平台明确标注,对 Agnes-3.0-Flash 的完整独立评测即将进行。在那项评测完成之前,GPQA Diamond、IFBench 以及对比表中的数字,仍是由不同评测框架和模型快照拼出的公司汇编参考值,而非受控的独立审计。Agnes-3.0-Flash 的架构新颖性,意味着独立复现其基准表现比平时更重要:研究者会想验证,在需要长文档检索的任务上,delta 规则循环层在 262K 上下文下是否如描述那样工作 —— 那正是循环层固定状态压缩最可能与全注意力行为出现偏差的地方。
这个模型下一个有意义的检查点,是 Artificial Analysis 完成其完整的综合评测。那个结果将决定公司表格中的参考基准分数,在标准化测量条件下能否站得住 —— 以及 Agnes-3.0-Flash 的混合架构,能否产出关于 Gated DeltaNet 混合模型的研究文献所预言的那种推理质量取舍。如果能,Sapiens AI 就会以一个真正宽松的许可证,交付 30B 规模上最强的开放权重混合循环模型 —— 而此时前沿的其余部分,还没有就这种架构的价值达成共识。