TypeSafe 的 Jev 不生成一个字,直接给出结构化决策
Vercel 几天内就换上这个每百万 token 0.042 美元的模型,替掉 OpenAI 分类器,速度更快

Vercel 是为 AI 智能体构建基础设施的公司之一,它的开发者在生产环境中把一个 OpenAI 分类器换成了一个完全不生成任何文本的模型 —— 而且过程中结果还快了五到十八倍。他们换用的模型叫 Jev,由 TypeSafe AI 于 2026 年 9 月 15 日发布;它之所以成为今年开发者圈里讨论最多的 AI 发布之一,恰恰是因为它拒绝做大多数 AI 模型被造出来要做的事:产出语言。
TechCrunch 在 9 月 18 日确认了 Vercel 这个案例,同时还确认了 Bryo AI 的第二处部署:在那里,该模型的输出成本比它所替代的 Gemini 方案低了十到二十倍。发布之后的几天里,TypeSafe 的 API 一度宕机,因为开发者的需求超出了系统准备好承接的量。公司此后恢复了服务,并正在把用户从等待名单上放行。这种早期热度 —— 真实的生产部署、服务过载、OpenRouter 上的 beta 版本 —— 正是现在、而不是在发布当天写它的理由:这已经不只是一则公告,而是一场正在进行的实验,检验当你不再生成句子时,软件智能的经济账是否会变得根本不同。
Jev 不是大语言模型 —— 不生成文本正是它的全部要点
TypeSafe 创始人 Diogo Almeida 曾在 OpenAI 参与合著 InstructGPT 论文,并参与开发了基于人类反馈的强化学习 —— 正是这项训练技术把 GPT-3 变成了后来成为 ChatGPT 的那个助手。大约两年前离开 OpenAI 之后,他在隐身期里试图解决一个他在内部亲眼看到的具体问题:模型在对话上已经超越人类,但它们本应带来的自动化并没有大规模到来。
他的诊断,也是 Jev 背后的组织原则,是:自然语言对软件来说是错误的输出格式。当一套代码需要做决定时 —— 把这张客服工单派给谁、给这份求职申请打多少分、判断这个 AI 智能体的工具调用是否可疑 —— 它必须解析文本、校验结构,并处理语言模型可能产出的每一种变体。很多自动化流水线正是在这一层解析上失败的。Jev 把这一层去掉了。
Jev 不按顺序生成 token,而是接收一块状态 —— 一个 JSON 对象、一段文本、一条日志,开发者想传什么都行 —— 外加一组带类型的问题。它在一次并行的前向传播中同时评估所有这些问题,返回带类型的值:从预先定义的列表中选出的一项、指定区间内的一个数字,或者一个是/否的概率。没有字符串要解析,也没有校验步骤。模式在调用之前就定义好了,输出要么符合它,要么在数学上根本不可能产生。TypeSafe AI 确认,这个模型可以通过自家 API 使用,并自 9 月 16 日起可以通过 Vercel 的 AI Gateway 调用。
TypeSafe 目前提供的三种输出类型叫 Choice、Score 和 Noul。Choice 负责分类,最多支持 255 个选项。Score 返回开发者指定范围内的一个数值。Noul 是带校准概率的二元是/否 —— 这个名字是 TypeSafe 自造的。每个答案都附带自己的置信度,由返回的概率分布的形状推导而来。分布越集中,意味着置信度越高;分布平坦,则意味着真正的不确定。
这套架构如何做到毫秒级决策
Jev 宣称的延迟优势 —— 端到端 70 到 500 毫秒,而前沿语言模型在同类任务上是 3 到 329 秒 —— 直接来自它抛弃了顺序生成。今天生产环境中的每一个大语言模型,都是一次一个 token 地产出输出。每个 token 的概率都依赖于此前所有 token,这迫使整个过程严格串行:在第 46 个 token 确定之前,你无法产出第 47 个。正是这个约束,让哪怕很短的大模型回复也要花上几秒,让长回复要花上几分钟。
Jev 的并行采样器在一次查询中评估所有输出值。由于答案空间是预先定义、并被约束在模式之内的,模型不需要生成开放式的可能性。没有了顺序依赖,整个响应可以一次性算出来,算术成本也低得多。正是这更低的计算成本,让输出 token 实际上变成了免费:输出 token 数量极少,生成又极其便宜,于是 TypeSafe 按每百万输入 token 0.042 美元计费,输出不收费。
作为对比,GPT-5.6 Terra 的价格是每百万输入 token 2.00 美元、每百万输出 token 12.00 美元。Claude Fable 5.1 的基础输入价格是每百万 10 美元,输出要贵得多。在 TypeSafe 公布的工作流评测中 —— 涵盖客服分流、发票处理等四类任务 —— Jev 每例成本约为 0.0004 美元,Terra 为 0.0304 美元,Claude Opus 5 为 0.1761 美元。所有数字都由 TypeSafe 依据自家内部基准自行报告。
Almeida 公开披露的架构信息是:Jev 基于 transformer,不过他对具体细节刻意含糊。外部观察者猜测这个模型可能建立在某个开放权重基座之上,对此 Almeida 拒绝回答。它的训练方法 —— TypeSafe 称之为「面向校准决策的强化学习」(Reinforcement Learning for Calibrated Decisions,RLCD)—— 只有概念上的描述,没有公开论文。奖励函数、校准流程和训练基础设施都没有披露。
RLCD 训练:它与 RLHF、RLVR 的区别在哪
要理解 RLCD,先要理解它是针对什么设计的。RLHF —— Almeida 在 OpenAI 参与构建的那项技术 —— 训练模型产出人类评分者更偏好的输出,优化目标是人类对一段文本回复的满意度。RLVR,即带可验证奖励的强化学习,训练模型产出可以用程序检查对错的输出。这适用于数学证明、能跑或不能跑的代码,以及其他那些「标准答案」很容易算出来的问题。
对于在模糊输入上做大批量分类来说,这两套框架都不是合适的工具。客服分流器需要在大多数时候判断正确,但更重要的是,它需要知道自己什么时候没有把握。经过 RLHF 训练的模型在被要求估计自身置信度时,会系统性地过度自信、前后不一 —— 这是生产环境 AI 部署中被广泛记录的一种失效模式。如果一个分类器 94% 的情况下是对的,却无法指出它可能出错的那 6%,那它就无法被安全地自动化:你只能每一例都复核。
TypeSafe 的 RLCD 优化的是另一样东西:校准过的概率。目标不是孤立地把准确率做到最高,而是让模型的置信度真正反映它的准确率 —— 使得一例被判为 90% 可能属于账单问题的工单,确实大约有 90% 的时候该归到账单;而一例判为 55% 的,确实就是值得升级处理的掷硬币。实际后果是,开发者可以基于自己的数据设定一个置信度阈值,把明确的情形自动化,把不确定的交给人工复核或更重的模型。
Earendil 的 CTO Armin Ronacher(这家公司开发开源模型运行框架 Pi)这样向 TechCrunch 描述这一设计:「说到底,它把幻觉问题稍微转嫁给了用户。用户得自己判断:好吧,如果它返回的概率只有 50%,那这可能就是掷硬币,我不理它;但如果是 95%,那行,我可以拿它做点什么。」这个说法是准确的:Jev 把可靠性问题从「模型对不对?」换成了「模型有没有自信到可以据此行动?」—— 对生产工程师来说,这是一个更好处理的设计问题。
这套方法也有实实在在的局限。TypeSafe 没有公开 RLCD 算法、它的奖励函数,也没有公开校准曲线。独立分析师 Anthony Maio 审阅了发布材料后写道,截至 9 月 15 日,TypeSafe 只描述了 RLCD 想要达到什么效果,却没有公开足以让任何人把它当作一个算法来评估的内容。Choice 和 Score 输出的置信度取自概率分布的形状 —— 但 TypeSafe 没有说明用的是哪个统计量。在分布外的输入上,分布集中并不自动等于值得信任;依赖 Jev 置信度的开发者,在把它放进自动化流程之前,需要用自己的数据验证校准情况。
基准数字哪些站得住,哪些站不住
TypeSafe 公布了一份涵盖四类工作流的评测:安全事件响应、智能体轨迹可观测性、发票处理和客服分流。在准确率上 —— 衡量方式是与 GPT-6 Astra 和 Claude Fable 5.1 的平均预测的一致程度 —— Jev 得分 67.8%,GPT-5.6 Terra 得分 67.9%,基本打平。GPT-5.6 Sol 达到 74.1%,Claude Opus 5 达到 73.1%。这些数字全部由 TypeSafe 依据自家评测设施自行报告。
这里的前提很重要。TypeSafe 明确承认,它的参考答案是 OpenAI 和 Anthropic 旗舰模型的平均值,而不是真实标注。把「准确率」定义为与这些模型的一致程度,意味着 Jev 被衡量的是它有多接近当前最强系统的共识 —— 而不是它的决策本身是否正确。这些工作流也是由 TypeSafe 自己的模型能力团队设计的,公司也承认这会引入潜在偏差。截至今天,还没有任何独立方在中立的评测框架上复现过这些准确率数字。
在结构化输出和工具调用的可靠性上,情况没那么含糊。TypeSafe 报告 Jev 的结构化输出出错率为 0%,这一点可以从第一性原理推出来:如果合法输出是预先定义的,而模型被约束为只能产出这些输出,那么非法输出在数学上就不可能出现。问题不在于 Jev 会不会产生类型错误 —— 它不会 —— 而在于它在合法空间里给出的那个答案对不对。这是两种不同的失效模式,而准确率基准只针对后者。
其他模型在结构化输出上的对比数字很扎眼。在 TypeSafe 自家的评测框架上,Claude Haiku 4.5 的结构化输出出错率为 45.5%,GPT-5.6 Sol 的工具调用出错率为 17.0%。The Register 的 Thomas Claburn 指出,虽然 Jev 所说的「无幻觉」和这个词通常的含义是两回事 —— Jev 不能编造法律引注,是因为它根本不能生成文本 —— 但在深层依赖链的语境下,类型安全这项保证确实是另一回事,也比乍看上去更有价值。
真实用例,以及它们真正说明了什么
发布之后这四天里出现的部署模式,有的落在 TypeSafe 的预料之中,至少还有一种不在其中。
被讨论最多的是模型路由。由于前沿大模型的调用既贵又慢,用一个前沿模型去决定该用哪个模型,本身就很矛盾。Jev 每百万输入 token 0.042 美元的价格和亚秒级延迟,让实时路由在经济上说得通。Ronacher 向 TechCrunch 表示,这是一个关键的预期用例。Vercel 的案例 —— 用它替换原本负责审查智能体命令安全性的 OpenAI 分类器 —— 正是这一更广模式的现成例子:把 Jev 当作其他 AI 组件之上的一道快速闸门,而不是当作主要的智能层。
Almeida 正在推广的第二大用例是智能体监控。当 AI 智能体执行长链条的多步任务时,工具调用、日志条目和中间输出不断累积,上下文窗口随之膨胀,推理成本层层叠加。有开发者报告说,他们用 Jev 给智能体轨迹里的每一次工具调用打相关性分数,丢掉相关性低的条目,在一次快速的 Jev 调用里就把智能体的工作上下文从数百万 token 压缩到几万 token。这解决了生产环境智能体系统中一个真实的痛点,而且不需要再调用一次前沿大模型。
TypeSafe 用来展示实时能力的 Doom 演示,让 Jev 以每秒约十次决策的速度,对着结构化的游戏状态运行 —— 推理成本约为每小时 7 美元。这个演示处理的是游戏状态的文本编码,而不是原始像素输入;Jev 目前不直接接受图像或视频。对于用户一开始设想的机器人和计算机视觉应用来说,这个限制很关键。TypeSafe 暗示过未来会支持多模态输入,但没有公布时间表。
Jev 做不到什么,以及这会让你付出什么代价
Jev 不会写出一段分析、不会写函数、不会总结文档,也不会解释自己的推理。这不是一个等着被修补的缺陷 —— 它就是这个模型围绕着建立起来的架构承诺。需要知道一份贷款申请为什么被标记出来的开发者,无法从 Jev 那里得到答案。需要为监管检查准备一份推理审计轨迹的合规团队,也拿不出任何理由说明。对于任何需要开放式生成、需要文字解释、或者答案空间无法事先定义的任务,Jev 都是错误的工具。
缺少自然语言理由,也造成了一个调试上的空白。当分类器以高置信度把某个案例分错时,开发者无法追问 Jev 的推理 —— 因为根本不存在可供检视的推理面。多数分析师建议的缓解方式是:把 Jev 用在高流量、定义明确的决策层,把低置信度或被标记出来的案例升级给能给出解释的大模型。这种分层架构既保住了吞吐量上的好处,又在工程师和合规团队需要的地方留下了一条理由链。
架构披露上的空白,给企业买家带来另一个问题。当一个受监管的机构把第三方 AI 模型接入信贷决策、保险核保流程或医疗分诊工作流时,多数司法辖区的监管机构都期望该机构理解模型是如何得出输出的。TypeSafe 没有公开 RLCD 的奖励函数和模型架构细节,也没有任何第三方对其校准主张的审计。在公司拿出更多技术文档之前 —— 一篇公开论文、校准曲线,或者一次独立审计 —— 受监管行业的采购团队面对的,仍是他们在任何黑箱 AI 供应商那里都会遇到的不透明问题,而且还叠加了这类模型本身的新颖性。
在定价可持续性上,TypeSafe 自己倒是很坦率:它无法证明这个价格没有被补贴。公司预计价格会随时间下降而不是上涨 —— 理由是杰文斯悖论,也就是这个模型名字的由来 —— 但这项服务的长期经济账,取决于尚未在大规模生产环境中确立的基础设施成本走势。把 Jev 当作依赖来构建系统的开发者,应当把当前价格视为一个合理但可能变动的估计,而不是一个长期承诺的费率。
杰文斯式的赌注,以及它对智能体基础设施意味着什么
Jev 这个名字是对 19 世纪英国经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)的刻意致敬。他提出的悖论指出:燃煤蒸汽机效率的提升,反而增加了煤炭的总消耗量,而不是减少它。每一次效率提升,都让煤炭在此前够不着的场景里变得有用,需求面扩张的速度超过了效率节省所能抵消的幅度。
Almeida 的论点是,AI 的 token 消耗会走同一条路。AI 决策成本每下降一个数量级,就会有多出几个数量级的决策变得值得去做 —— 不只是给重要的客服工单分流,而是给发票上的每一个条目打分、给代码评审流水线里的每一次提交打分、给聊天线程里的每一条消息打分。按现在的大模型价格,这些微决策大多在经济上不成立;按 Jev 的价格,其中很多成立了。
「我们认为,智能软件将会以一种涌现而分散的方式,遍布各个角落,」Almeida 对 TechCrunch 说。他用这一愿景对照当下主导 AI 部署思路的「超级应用」模式。
Ronacher 提醒说,一旦 Jev 的用处变得明显,竞争者就会跟进 —— 他指出这个洞见「本该更早被看到」,而廉价、被补贴的大模型消解了在架构上另辟蹊径的压力。Jev 所代表的模型品类如今已经被定义出来。TypeSafe 能否凭借 RLCD 的校准、价格和可靠性,在更大的实验室造出同类模型时守住先发优势,是接下来一年要回答的商业问题。而技术问题 —— 校准过的结构化决策能否成为生产 AI 流水线中可靠的一层 —— 正在真实部署中得到回答。早期数据对 TypeSafe 有利,但独立基准的复现和价格能否维持,仍是决定 Jev 会不会重塑智能体软件构建方式的两个未知变量。