Laya 速度胜过 Jev,陌生任务却接近瞎猜
4.21 亿参数的 ModernBERT 单题 10.7 毫秒出答案,0.766 的分数却已越过基准自身的标签噪声上限

Laya,是 Convai Innovations 在 TypeSafe AI 推出闭源 Jev API 三天后、发布到 Hugging Face 上的 Apache 2.0 决策模型,如今已是新兴的「System One」类别里最受关注的开源替代品之一。9 月 22 日发布的一份独立评测则显示,它的优势其实很窄。测试者证实了 Laya 的速度,但发现基础模型在留出的钓鱼邮件上接近瞎猜;而那个能赢过 Jev 的微调检查点,分数已经越过了基准自身的标签所能支撑的上限。
这个结果的意义不止于一个仓库。Laya 证明了 TypeSafe 当作一类新模型来推销的那套接口 —— 输入程序状态和带类型的问题,一次前向传播输出校准过的概率 —— 用现成的编码器几天就能重建出来。它没有证明的,恰恰是决策 API 值得付费的那项能力:回答运行时才定义、没有事先训练过的问题。
Laya 比 Jev 晚三天出现,连词汇表都照搬
TypeSafe AI在 9 月 15 日结束隐身状态,带来了 Jev —— 一个从不生成文字的托管模型,开发者定义什么问题,它就针对该问题返回一个选项、一个分数,或者一个是否的概率。据报道该公司拿到了 DCVC 领投的 4000 万美元种子轮,创始人 Diogo Almeida 说他在 OpenAI 期间参与构建了 ChatGPT 背后的指令遵循方法。Jev 按每百万输入 token 0.042 美元计价、输出免费,TypeSafe 自报响应时间 70 到 500 毫秒,权重和架构细节则一概未公开。
Laya 的 GitHub 仓库出现在 9 月 18 日。它照搬了 Jev 的三个原语 —— choice、score 和 noul —— 并沿用了 TypeSafe 为自家训练方法起的名字:面向校准决策的强化学习(RLCD)。截至发稿,该仓库约有 4500 颗星、403 次 fork,Hugging Face 页面上列出了 22 个社区微调版本和 21 个量化版本。
开发者 Nandakishor M 把这次发布说成是一次正名,他在一篇 Dev.to 帖子里主张,自己更早的研究就预见了 TypeSafe 的想法。他引的论文只是相关,并不等价:2025 年 3 月的一篇 arXiv 预印本(arXiv:2503.23303)是用 GPT-4o 合成对话训练出的 Azure OpenAI 嵌入来预测销售转化概率,2025 年 9 月的另一篇预印本则提出按生成前的置信度来路由 LLM 请求。两者确实都落在决策概率这个领域里,但都算不上同一种接口设计。
Laya 如何在不生成一个字的情况下给选项打分
英文检查点把 ModernBERT-large(一个 3.95 亿参数的双向编码器)和一个从零训练的决策头配在一起:两层 transformer、一个选项打分器,外加一个「执行还是上报」的头,总计 4.21 亿参数。多语言版本放在 convaiinnovations/laya-multilingual,用的是 3.22 亿参数的 mmBERT-base 编码器,覆盖 100 多种语言。
关键机制在于选项怎么进入模型。每个问题被打包成一条序列,每个允许的答案前面放一个 [MASK] token,后面接上被判断的状态 —— 比如一封邮件或一张 JSON 工单。编码器和决策头处理完整条序列后,每个 [MASK] 位置上的隐状态被投影成一个分数,再对这些分数做 softmax,就得到每个选项的概率。因为答案是在提示词内部定义的,开发者不重新训练也能造出一套新 schema,而且格式错误的输出在构造上就不可能出现。
这也是 Laya 快的原因。自回归 LLM 一次生成一个 token,每个 token 都要再过一遍网络;编码器把整条序列读一次,而 Laya 会把关于同一状态的所有问题批进这一次前向传播里。Convai 报告称,在英伟达 T4 上单个问题耗时 39.5 毫秒,多语言检查点上十个问题批处理时平均每题 7.2 毫秒。英文权重约占 808 MB,CPU 推理大约需要 193 到 464 毫秒,而不预加载就切换语言会强制触发 7 到 10 秒的模型重载。
训练环节才是 Laya 最依赖 TypeSafe 那套说法的地方。策略输出一个概率分布,探索过程给选项分数加上零均值高斯噪声,奖励则是一个严格恰当评分规则 —— 一种只有在报告的概率与真实概率一致时期望值才最大的打分函数。Laya 把对数评分和球面评分结合起来,对序数类问题再减去一个排序概率评分,然后用 REINFORCE 对着组均值基线更新,也就是 GRPO 用的那套方差缩减思路。此外,微调后的 typed-decisions 检查点还加了对教师标签分布的软交叉熵,所以它的训练并不是纯粹的强化学习。
Laya 的基准胜利,落在它自己的噪声上限之上
Laya 拿来做主打对比的是 typed-decisions,这是 Hugging Face 上的一个合成基准,覆盖发票处理、安全事件、客户服务和智能体轨迹可观测性。它的金标签来自对一个大语言模型教师采样三次,而这个教师与自己的一致率只有 73.5%。这个数字构成了可恢复信号的上限,数据集作者也警告说,分数远高于 0.75 就意味着模型学到的是教师的怪癖,而不是任务本身。
按基准公布的结果,从没见过该数据集的 Jev 零样本拿到 0.727。Laya 的基础检查点只有 0.362,勉强高于 0.318 的随机基线,还低于「每题都猜最常见答案」所能达到的 0.461。只有在该基准 1200 条训练样本上微调之后,Laya 才到了 0.766 —— 这个数字被那位独立测试者复现为 0.767,他随后提醒说,越过上限之后模型「记的是噪声」。Convai 自己的模型卡如今也写着,Laya「是一个可供专门化的快速底座,不是零样本决策引擎」。
即便在这个基准内部,谁赢也取决于看哪个数字。Laya 的微调检查点更常选中教师的首选答案,但 Jev 更贴合教师的整个概率分布,软准确率 0.580 对 Laya 的 0.471。对于按阈值分支、而不是只看单个最可能标签的软件来说,真正驱动行为的输出正是那个分布。
自发布以来,说法也在变。9 月 18 日那篇 Dev.to 帖子拿 83.8% 的 Laya 分数对比 67.8% 的 Jev 数字 —— 独立测试者指出,这两个数来自两个不同的基准。Convai 在自家模型卡上承认,Jev 在 Banking77 上领先,0.870 对 0.425,原因是 Laya 的选项共用固定的 256 token 预算,一道题有 77 个答案时,每个标签只分得三四个 token。Jev 则支持最多 255 个选项。
RLCD 本该保证的校准性,同样需要外部帮忙。模型卡的标题打着「数学上校准过的概率」,可同一页又写明检查点出厂时是过度自信的:只有在留出数据上按问题类型各自重新拟合一个温度之后,平均预期校准误差才从 0.466 降到 0.081。恰当评分规则奖励的是在训练分布上说实话,并不保证换个分布还说实话。英文检查点在高棉语上准确率为零,报告的置信度却有 95.2%。
延伸阅读:TypeSafe 的 Jev 不生成一个字,直接给出结构化决策
独立探测发现 Laya 栽在否定句和改名的选项上
9 月 22 日那次评测在一块 RTX 5090 上跑,发现 Laya 的速度说法站得住,单个问题中位数 10.7 毫秒。准确率则是另一回事。在 PhishNChips 数据集的 2000 封均衡邮件上,未经微调的 Laya 准确率 0.505 —— 因为它几乎把所有邮件都标成了正常,只抓出 1.2% 的钓鱼邮件。
底层的排序能力并没有坏。Laya 的 AUROC —— 衡量分数在不看阈值的情况下把两类分开的程度 —— 是 0.678,接近 Jev 公布的 0.689。温度缩放动不了决策阈值,于是测试者在一半邮件上拟合了一个 Platt 偏置项,把准确率提到 0.611,对比 Jev 公布的原始值 0.626 和 Claude Haiku 4.5 公布的 0.813。
一组 11 条断言的探测暴露出更深的问题。问一张工单是否需要人工介入、以及机器人能否自行解决,Laya 给这两个选项的概率加起来只有 0.09;把问题和它的否定形式配对提问,两边都被以 94% 和 97% 的置信度答成「否」。在不改变含义的前提下给路由选项改个名字,结论就翻转了。Laya 有 7 条没通过,不过测试者强调这套题是他自写的探测,不是基准。
拿 BoolQ、SQuAD v2 和自然语言推理数据集里的 18 万条公开样本做微调后,探测失败降到一到两条,typed-decisions 准确率提到 0.676 —— 仍然低于 Jev 的零样本成绩。而且它让钓鱼检测变得更差,选项改名的不稳定依旧没解决,还因为其中两个训练数据集带非商用许可,产出的检查点只能非商用。
开放权重改变的是成本账,不是泛化难题
对于 schema 固定、又有标注样本的团队,Laya 给得出 Jev 给不了的东西:能在内网里跑的权重,没有按 token 计费,客户数据也不出本地。Convai 的 notebook 在 Kaggle 免费的两块 T4 上四到五小时就能微调出一个检查点。这让它足以取代那些目前要调用前沿 LLM 的路由或内容审核分类器。不过自托管并不免费 —— GPU 容量、把每个检查点都预加载好、以及随叫随到的运维,都是真实成本,而那个「0 美元」的对比把这些略去了。
延伸阅读:本地跑 LLM 比你以为的贵:账单由硬件决定,不是电费
Laya 也不是独一份。Jev 发布后一周之内,开发者就放出了 OpenJev —— 一个建立在 ModernBERT 系 GLiClass 分类器之上的 1.51 亿参数模型,以及一个在领域内训练后于 typed-decisions 上拿到 0.697 的开源复现。两者都承自一长串基于编码器的零样本分类器,这说明 System One 这套接口本身不会长期专有下去。Jev 的立身之本是它尚未让外部充分检验的泛化能力:基准仍由厂商自己跑,typed-decisions 的参考标签由模型生成,服务也还在早期访问阶段。
所以现实中的分界线并不是开源对闭源。如果问题和选项在运行时变化、超过 20 个左右的选项、或者以没测试过的措辞出现,Laya 自己的文档就会把开发者指向别处。如果一条工作流稳定到足以标注,那么一个微调过的编码器现在已经能在普通硬件上给出 40 毫秒以内的决策。
下一个值得盯的里程碑是留出 schema 测试:训练中从没见过的新问题和新选项集,用人工而非 LLM 教师的标签来评分。TypeSafe 没有为 Jev 公布过这类结果,Laya 的基础模型也没通过过。哪个 System One 模型先跨过这条线,才算证明了它真的在做决策 —— 而不只是学会了复现一个打标签的人。