OpenAI 投的 Harvey,把自研法律 AI 模型建在了 Kimi K3 上,而不是 OpenAI 的模型上
在 Kimi K3 上做异步强化学习,法律任务完成率接近翻倍,成本只有闭源模型 API 的四分之一

法律 AI 平台 Harvey 正在洽谈新一轮融资,据报估值 155 亿美元。该公司于 8 月 20 日宣布,其首个自研 AI 模型 —— Harvey Tenet —— 是在 Kimi K3 之上做后训练得到的,后者是中国实验室月之暗面于 7 月发布的开放权重模型。OpenAI 创业基金是 Harvey 的投资方之一,而它的首个自有模型跑的不是 GPT,而是一个中国的开放权重架构,由美国推理基础设施伙伴 Fireworks AI 协同开发。
这个决定出于经济账和竞争暴露,不是出于立场。Harvey 每月代 1300 多家客户机构处理超过 13 万亿 token —— 这些客户是分布在 60 多个国家的律所和企业法务部门 —— 而其中每一个 token,历来都是由第三方基础模型供应商计费的。在这个量级上,OpenAI、Anthropic 或谷歌的按 token 定价不是一个成本科目,而是一项结构性成本,而且模型厂商可以随时重新定价。当这些厂商自己开始进入 Harvey 的市场时,问题变得更加紧迫:OpenAI 已经着手在法律 AI 企业市场上直接竞争,Anthropic 发布了法律专用的 Claude 插件。Harvey 的供应商正在变成它的竞争对手 —— 而 Harvey 在为对方的弹药买单。
拥有模型权重改变了这笔账。按 Harvey 的说法,Tenet 的单 token 成本不到同档闭源前沿模型的四分之一,而在法律专项基准上,Harvey 称它在执业律师最看重的那些任务上超过了 Fable 5 和 GPT-5.6 Sol。该公司明确指出了这两件事之间的关系:在后训练阶段同时为成本和质量做协同优化、而不是只优化质量,是一个刻意的架构选择,它会影响此后每一次推理。
延伸阅读:月之暗面就 Kimi K3 向 Azure、AWS 和谷歌云索要收入分成
Harvey 选的基座模型,以及它为什么合适
按参数量算,Kimi K3 是目前开发者能拿到的最大的开放权重模型。月之暗面发布了它的完整权重,时间是 7 月 27 日,采用修改版 MIT 许可 —— 附带一条商业协议要求:任何以 K3 为基础的服务,年收入超过 2000 万美元的运营方须另行签署商业协议。Harvey 年化收入超过 3.5 亿美元,稳稳高于这条线,也就意味着这家公司几乎肯定已经或正在与月之暗面谈一份商业协议。
这个模型的架构使它特别适合法律工作。K3 采用混合专家(MoE)设计,总参数 2.8 万亿,含 896 个独立的专家子网络,对任意输入 token 只激活其中 16 个。每 token 的有效计算量接近 1040 亿参数 —— 这正是它在 Harvey 这个量级上算得过账的原因。让 2.8 万亿参数对每个 token 全部参与计算,在商业上不可行;让 1040 亿有效参数通过稀疏激活参与,可行。
K3 能以商业可行的延迟撑住一百万 token 上下文窗口,关键在于月之暗面称之为 Kimi Delta Attention(KDA)的一套架构。标准 Transformer 注意力的开销随序列长度的平方增长,使超长上下文窗口在计算上难以承受。KDA 以 3:1 的比例交错排布全注意力层与线性注意力层 —— 更便宜的线性注意力承担大部分计算负载,全注意力则留给最需要它的位置。结果是在超长上下文下仍能快速解码,且键值缓存占用大幅下降。对于动辄要审阅数千页并购协议文件、尽调数据室或诉讼材料的法律任务而言,一个真能以生产级延迟运行的百万 token 窗口不是一个跑分数字,而是一项功能性硬要求。
Harvey 正是按这个标准评估 K3 与其他备选的。Meta 的 Llama 4 是前沿档里另一个认真的开放权重选项,但缺少法律领域最苛刻的任务所需要的长上下文架构。阿里的 Qwen3.8-Max 以 2.4 万亿参数也是有力的备选,但尚未获得 K3 那样广度的独立评测。在由Artificial Analysis在受控独立评测中运行的 Harvey 自家法律智能体基准(Legal Agent Benchmark)上,K3 在全通过率这项指标上得分 26.7% —— 接近次优开放权重模型的两倍 —— 而这还是在任何 Harvey 专项后训练之前。这意味着 K3 出厂时自带的法律素养,高于 Harvey 当时能选的任何其他开放权重模型。
Harvey 怎么训练 Tenet:法律规模上的异步强化学习
Harvey 所用的后训练方法 —— 在该公司 8 月 20 日的技术博客中详述,作者为 Gabe Pereyra、Calvin Qi 及另外三位研究员 —— 说明了今天要在没有前沿级算力的情况下造一个前沿档的领域模型,需要什么。
Harvey 与 Fireworks AI 从 K3 权重出发,采用一种叫做群组序列策略优化(GSPO)的方法做异步强化学习。GSPO 的核心思路是:对每个训练任务,系统生成一组彼此独立的智能体尝试 —— 也就是同一个法律问题的不同解题轨迹 —— 各自对照专家撰写的评分细则打分,再从组内的相对表现中学习。这比在单条轨迹上训练更稳定,因为学习信号反映的是比较出来的优劣,而不是一个可能带噪声的绝对分数。
训练环境由执业律师构建,不取自公开法律数据库或既有判例档案。每个环境包含一条合伙人级别的任务指令 —— 一段自然语言请求,写得像是资深合伙人交办的,通常 50 词上下 —— 配上一份模拟的客户事项,里面混着关键文件和边缘文件,再加一份细颗粒度的专家评分细则,全部是二元的通过/不通过项。平均每项任务包含 50 条独立标准,最大的环境有数百条。一条标准可能是问:智能体有没有正确识别出某个虚构并购标的在环保披露中的某项特定风险;引用相关条款时精度对不对;从证据到结论的推理链在内部是否自洽。
任务要判为通过,智能体必须满足**全部**标准,而不是大部分。漏掉一项风险或引错一处,整个任务即判失败。Harvey 说 Tenet 的任务完成率相对 K3 基座「接近翻倍」,指的就是这套全通过结构下的数字:成功的门槛极高,而在这个门槛上的提升具有实际运营意义。
强化学习使用了秩为 64 的 LoRA 适配器 —— 把低秩矩阵对插入所有注意力层、前馈层,以及 K3 的 896 个路由专家层中的每一层,总计适配约 50 万个专家张量。对一个 2.8 万亿参数的模型做全参数微调,所需的 GPU 显存和训练时间远高于 LoRA;LoRA 把更新约束在一个低维子空间里,同时让原始权重的主体保持不动。结果是一个既保留了 K3 通用法律知识与推理能力、又在 Harvey 训练环境所奖励的那些具体行为上显著改善的模型:彻底遍历文件、精确引用、组织好长时程的工作产物,以及不浪费 token 的高效工具使用。
在 RL 上训练一个大型 MoE 模型,其基础设施难题值得一说,因为它并不简单。强化学习要求生成轨迹的那个模型,与计算梯度更新的那个模型在数值上足够接近。而对一个在有限精度下运行的大型 MoE 架构 —— 其路由决策由一个学习出来的门控网络给出,并非确定性的 —— 服务系统与训练系统之间极微小的数值差异,都可能导致梯度反映的是另一个策略,而不是实际产生数据的那个。这被称为离策略误差,严重时会让训练失稳。
Fireworks AI 的解法是在内核层面同时构建训练端与轨迹服务端的部署,让两者的数值行为对齐。一套 token 进 token 出的接口配合路由重放,保证训练端在重算对数概率时用的是当初产生该轨迹的同一组路由决策。每完成一次 GSPO 优化步,新权重会被热加载进服务集群而无需重启 —— 于是生成轨迹的 GPU 集群从不空转,训练循环在为期两个月的运行中保持连续。整个训练过程消耗约 150 块英伟达 B300 GPU,这个数字比从零预训练一个同等能力的模型所需要的低了大约三个数量级。
基准分:Harvey 的数字说明了什么,又没说明什么
按任何合理标准衡量,Harvey Tenet 的基准结果都是实打实的,但对要据此做技术或采购决策的读者来说,解读它们的背景很重要。
头条数字来自 Harvey 自家的法律智能体基准(LAB)—— 一套开源测试集,含 24 个执业领域、1200 多项智能体法律任务。这个基准由 Harvey 设计并运营,不是第三方标准。在 LAB 的留出集上(模型在训练中没见过的任务),Tenet 完成的任务数接近 K3 基座的两倍,全通过率的绝对值提高了 9 个百分点。在覆盖 500 项企业法务合同工作(起草、审阅、谈判)的 LAB: Contracts 扩展集上,Tenet 排名第一,全通过率较 K3 基座提高 2 个百分点。
「模型由 Harvey 在 Harvey 自己设计的基准上测出的成绩」与「经独立验证的结果」之间的区别,Harvey 自己的研究员也是承认的。LAB 评测框架在不同外部评测方之间存在方法学上的差异:Vals 用自己的智能体基础设施跑 Harvey 的基准;Artificial Analysis 用自己的 stirrup 框架和一个 Gemini 3.1 Pro 打分器;Harvey 给自己打分时用的是自家内部框架。这些差异会明显改变分数。
更具独立可信度的数据点,来自 Harvey 没有控制的那些评测。Mercor运营的 APEX Agents 基准由执业律师撰写、面向专业服务类智能体任务,它在企业律师子集上评测了 Tenet,结果排名榜首 —— 优于所有其他受测模型。Mercor 用自己的基础设施和评分体系跑完了这次评测,在公布之前没有向 Harvey 披露任务内容或任务级分数。Crosby 的 Redline Bench 是一套多轮合同谈判基准,对照律师撰写的评分细则打分;在 Harvey 按 Crosby 标准配置运行的评测中,Tenet 同样大幅优于 K3 基座。
Tenet 表现不亮眼的地方也值得说清楚。在 PRBench 的困难子集上 —— Scale AI 面向法律与金融高风险专业推理的基准 —— Tenet 相对 K3 基座的提升不具统计显著性,标准通过率从 36.0% 到 36.8%。Harvey 对此有明确承认。在 LegalBench(含 162 项法律推理任务的既有学术基准)上的提升也很小,Harvey 同样报告了这一点,但把它解释为可接受:LegalBench 测的是静态法律知识而非智能体任务完成度,而 Tenet 是为后者优化的。
Artificial Analysis 在独立测试中记录到的 K3 基座 51% 的幻觉率,并没有针对 Tenet 得到解决 —— Harvey 没有公布其后训练模型的任何幻觉率数据。对要做部署决策的律所来说,这处空白很要紧。一个在智能体任务完成度上排名第一、却在知识检索场景中以相当比例给出自信错误答案的模型,会制造下游的责任敞口。
更大的图景:Kimi 正在成为首选的开放权重基座
Harvey 不是孤例。就在 Harvey 的公告在法律 AI 圈内传开的同一周,对开放权重模型格局的分析记录到一个一致的模式:2026 年的大部分时间里,可获得的最大且性能最强的开放权重模型,出自中国实验室而非美国实验室 —— 而一些参数量在千亿以上的美国模型发布,是建立在中国实验室的产物之上或受其影响的。
这个模式跨行业成立。Cursor 的 Composer 2 编码模型(2026 年早些时候由开发者通过 API 探查揭示)跑在 Kimi K2.5 基座上。Cognition 在 7 月底 K3 权重发布后,把它集成进了 Devin Desktop 和 CLI。Perplexity 在 K2 开放权重发布后立即评测了它的表现并着手后训练。在基础设施层面,据 CNBC 7 月的一篇报道,中国模型在 OpenRouter 上占企业路由 token 的比例,于 2026 年年中峰值达到 46.4% —— 而此前十二个月的均值是 11%。中国开源模型的定价比美国前沿闭源模型低约 60% 到 90%,这个差额在 Harvey 每月 13 万亿 token 的量级上会被放大。
Kimi 之所以跨行业被选作后训练基座,其结构性逻辑不是它在每一项基准上都胜过所有备选,而是 K3 同时具备三项性质 —— 这三项单独看美国的备选也有,但目前还没有在同一档位上凑齐:一个在生产可行延迟下的超长上下文窗口(由 KDA 的线性注意力混合架构支撑);一次允许深度改造(包括对所有专家张量做 LoRA)的开放权重发布;以及一个在任何微调之前就已在领域智能体评测上表现强劲的预训练数据分布。这套组合,加上一个反映开放权重经济学而非闭源 API 毛利的价格,正是 Harvey、Cursor 和 Cognition 各自选择以 Kimi 为起点时所优化的东西。
这对垂直 AI 的基座模型经济学意味着什么
Harvey Tenet 最深层的意义,不在于一家 OpenAI 被投企业选了中国模型 —— 尽管这个视角吸引了大部分评论。更深的意义是结构性的:Harvey 走的这条路,任何拥有足够专家数据和约 150 块高端 GPU 的领域 AI 公司都可以复制。
从零预训练一个前沿模型需要数万块 GPU 连续运行数月、数亿到数十亿美元的资本承诺,以及互联网规模的训练数据。Harvey 没有这么做。Harvey 把 K3 的预训练权重当作地基 —— 一份由月之暗面以巨大成本编码好的、关于语言、法律与推理的表征 —— 再用领域专家的强化学习把这些能力重塑到特定的专业行为上。总算力约为 150 块 B300 GPU 跑两个月。数据来自执业律师编造虚构案情、并按专业标准给模型输出打分。
这对那些向专业细分市场出售 API 访问的基座模型公司,经济含义是重大的。如果一家垂直 AI 公司能靠在开放权重基座上用专家数据做后训练,以低于 API 的推理成本达到前沿档的领域表现,那么支付溢价 API 价格的理由就大幅收窄了。Harvey 自己也说得明白,Tenet 是一张谈判筹码:这个模型与 Harvey 的 Claude 和 GPT 集成并存而非取代它们,但拥有一个成本上有竞争力的替代方案,改变了 Harvey 与那些供应商谈判时的条件。
联合创始人 Gabe Pereyra 在随公告发布的技术文章中直白地说出了更长期的目标:Harvey 打算让律所有能力在 Tenet 之上构建自己的专有模型 —— 用某家律所自己的判例先例、案件档案和机构知识做微调。那将把法律智能的所有权从 Harvey 的共享平台,转移到单家律所的基础设施上,形成竞争对手无法从公开训练数据中复制的专有模型。
投产之前尚未解决的问题
8 月 20 日的公告被明确标注为研究预览,不是生产版本。Harvey 把 Tenet 描述为展现了「初步的可期结果」,而非可部署的系统。该公司表示计划把算力从约 1000 块 GPU 扩到 10000 块,以推进全参数微调 —— 那将用对所有参数的直接修改,取代 LoRA 那种高效但受限的适配,通常能提升任务表现,代价是训练算力大幅上升。
对正在把 Tenet 作为未来平台组件来评估的律所,有几个问题仍然实质性地悬着。
幻觉问题没有得到公开解决。K3 基座测试中 51% 的幻觉率,是一家可信的独立评测方记录在案的。Harvey 的后训练奖励了彻底引用与落地依据,理论上应该降低这个比例,但该公司没有公布对 Tenet 幻觉行为的任何独立测量。承担 AI 生成工作产物执业责任风险的律所,在投产部署之前需要对这个问题有一个可信的答案。
与月之暗面的商业关系,制造了一层超出 Harvey 自身服务条款的合规问题。Kimi K3 的修改版 MIT 许可要求任何以 K3 为基础的服务、年收入超过 2000 万美元的运营方,须与月之暗面签署商业协议 —— 而月之暗面是一家总部位于北京、受中国《国家情报法》管辖的公司。Harvey 的推理完全跑在自家基础设施上,Tenet 运行期间客户事项数据不经过月之暗面的服务器。但 Harvey 与月之暗面之间若存在商业关系,这层关系本身就会形成一条文件链,而律所自己的数据安全审查将需要对它作出评估。Harvey 没有公开披露任何此类协议的条款。
美国企业使用中国开放权重 AI 的监管环境正在收紧。Anthropic 于 2026 年 2 月公开指控月之暗面是三家中国实验室之一,涉嫌使用超过 24000 个欺诈账号对 Claude 发动工业规模的蒸馏攻击。截至 8 月 28 日,尚无针对月之暗面的执法行动或实体清单认定被公开宣布。但美中 AI 政策的走向意味着,美国企业使用基于 Kimi K3 的产品所涉的合规影响,将需要持续的法律监测。模型权重一旦以开放许可分发出去,不会因为后续的认定而被收回 —— 但 Harvey 与月之暗面之间任何持续商业关系的性质与条款,可能会受监管格局变化的影响。
下一个值得关注的竞争节点,不是又一个基于 Kimi 的模型。而是 Harvey 在后训练基础设施与训练方法上的投入,能否产出能力提升更广泛的通用模型 —— 以及该公司描述的 10000 块 GPU 扩容,能否支撑起全参数微调,从而在 PRBench 这类 Tenet 当前提升尚不具统计显著性的基准上补齐与 K3 基座的差距。而整个行业正在用实验回答的那个更大的问题是:150 块 GPU 的领域专家强化学习,究竟是一个可复制的模板,还是一道天花板 —— 而 Harvey Tenet 是对这个假说的第一次大规模法律领域检验。