SpaceXAI 发布 Grok 4.7:价格不变,独立编程测试低于自家说法
马斯克称智能体编程排在 Anthropic 和 OpenAI 之后位列第三,独立测试则指出它很费 token

SpaceXAI 于 2026 年 9 月 21 日发布了 Grok 4.7,称它是公司在编程和知识工作上能力最强的模型,定价则与前代完全一致:每百万输入 token 2 美元、每百万输出 token 6 美元。公司表示,这个新模型在困难任务上会工作更久、更仔细地检查自己的结果,并带有迄今校准得最好的安全防护,而服务的价格和速度与 Grok 4.6 相同。
埃隆·马斯克很快为这次发布定了调。在 X 上的一条贴文中,他写道「Grok 4.7 让 @SpaceXAI 在智能体编程上排到第三,仅次于 Anthropic 和 OpenAI」,并补充说这个模型的速度和更低的成本让它成为日常使用的有力选项。同一天发布的独立评测支持了这个说法的一部分,但也显示:Grok 4.7 最好的编程成绩高度依赖 SpaceXAI 自家的智能体软件,而它较低的单 token 价格并不会自动变成一张低账单。
Grok 4.7 可以在 Cursor(SpaceXAI 现已收购的 AI 编程公司)和 SpaceXAI 自家的编程智能体 Grok Build 中使用,也可以通过 Grok API 以模型 ID grok-4.7 调用,或通过第三方编程框架、模型路由器和云平台使用。GitHub 表示,Grok 4.7 正在 GitHub Copilot 中逐步开放,覆盖 Copilot Pro、Pro+、Max、商业版和企业版套餐,支持 Visual Studio Code、Visual Studio、Copilot CLI、Copilot 云端智能体、JetBrains、Xcode 和 Eclipse。
SpaceXAI 还提供一个 Fast 变体,称其输出速度是两倍、价格也是两倍。据 VentureBeat 报道,Cursor 把 Grok 4.7 Fast 标价为每百万输入 4 美元、每百万输出 12 美元,并在 Pro 及以上套餐中把 Fast 设为默认,不过 SpaceXAI 和 Cursor 都没有公布它具体的每秒 token 数。
延伸阅读:Grok Bot 拿到 X 的原生接入权,X 的 API 价格成了对手甩不掉的劣势
底层改了什么
按 SpaceXAI 的说法,Grok 4.7 建立在一个比 Grok 4.6 更大的新基座模型上,随后用更长的强化学习、在更难的任务组合上训练,权重偏向那些需要数小时才能完成的问题。公司称,结果是一个更善于验证自己工作、也更善于管理长上下文的模型。
SpaceXAI 还表示,它训练 Grok 4.7 原生理解 Grok Bot 背后的框架 —— Grok Bot 是它面向专业工作的智能体产品 —— 公司称这改善了对话任务和一般知识工作。SpaceXAI 的发布文章没有给出 Grok 4.7 的参数量。包括 Android Headlines 在内的一些报道提到基座模型约 2.1 万亿参数,而前代是 1.5 万亿;这个数字在发布前就在流传,但并未出现在公司的公告里。
上下文窗口是 50 万 token,Artificial Analysis 指出这与 Grok 4.6 相同。缓存输入折扣到每百万 0.50 美元,也与上一代一致。
这次发布比马斯克此前暗示的要晚。他原本指向 9 月 12 日前后,后来又说模型需要更多时间,因为团队发现强化学习对回答长度的惩罚过重,导致模型在难题上过早放弃、跳过对自己答案的仔细复核。正式发布比最初的目标晚了九天。
SpaceXAI 自家的跑分
公司发布时的对比表,把 xhigh 推理档下的 Grok 4.7 与 Grok 4.6、OpenAI 的 GPT-5.6 Sol Max 和 Anthropic 的 Claude Fable 5.1 Max 放在一起。所有这些数字都由 SpaceXAI 自行报告。
在偏重长时间编程任务的 CursorBench 4.0 上,Grok 4.7 得 46.3%,高于 Grok 4.6 的 40.4%,也高于 GPT-5.6 Sol Max 的 41.7%,但落后于 Fable 5.1 Max 的 51.8%。在 DeepSWE v1.1 上,Grok 4.7 在高努力档下达到 71.0%,GPT-5.6 Sol Max 是 72.7%,Fable 5.1 Max 是 70.0%。
这个模型在两项专门测试上领先。它在电气工程基准 EEBench 上得 64.0%,Fable 5.1 Max 是 56.4%;在 Harvey 法律智能体基准上得 19.6%,Fable 5.1 Max 是 6.7%,GPT-5.6 Sol Max 是 2.5%。
其他项目上它落后。SpaceXAI 列出的 Grok 4.7,在考察数小时终端作业的 Terminal-Bench 4.0 上是 38.0%,远低于 Fable 5.1 Max 的 57.9%;在考察临床推理的 HealthBench Professional 上是 56.7%,低于 GPT-5.6 Sol Max 的 60.5% 和 Fable 5.1 Max 的 62.1%。
独立测试讲出的故事更复杂
自己跑标准化评测的 Artificial Analysis,给了 Grok 4.7 智能指数 46 分,只比 Grok 4.6 高两分。该指数的领先者 Claude Fable 5.1 和 OpenAI 的 GPT-6 Astra 都在 53 分。Artificial Analysis 表示,这个结果让 SpaceXAI 跻身前四的 AI 实验室之列。
编程这块的结论取决于怎么测。当 Artificial Analysis 把 Grok 4.7 与 Grok Build 搭配时,模型在该机构的编程智能体指数上得 56 分,比 Grok 4.6 高九分。在这个指数内部,Terminal-Bench 4.0 从 18% 升到 33%,DeepSWE v1.1 从 65% 升到 73%,SWE-Atlas-QnA 从 58% 升到 63%。在以各自原生框架受测的模型中,Grok 4.7 加 Grok Build 排第四,位于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5 之后。
这个排名解释了马斯克说的「第三」:排在 Grok 4.7 前面的三个模型中有两个来自 Anthropic,所以按实验室而不是按模型计,SpaceXAI 排第三。
Artificial Analysis 强调,它的 Grok Build 结果与智能指数是分开的 —— 后者在所有模型上使用统一的标准化评测框架。VentureBeat 报道称,在那套标准化设置下,Artificial Analysis 测得 Grok 4.7 在 Terminal-Bench 4.0 上约为 26%,而 GPT-6 Astra 是 59.6%,Claude Opus 5 在最高努力档下约 49%。
另一家独立评测机构 Vals AI 在自己的基准套件上评测了 Grok 4.7,得到的结果更不乐观。Vals 在 X 上的一条贴文中表示,Grok 4.7 在 Vals 指数上以 54.2% 排第 24 位,比 Grok 4.6 低 5 分 —— 后者以 59.2% 排第 14 位。Vals 把下滑主要归因于金融和研究密集型任务,并指出即便在 xhigh 档,Grok 4.7 在它这套题上用掉的推理 token 还不到 Grok 4.6 的一半。Vals 同时表示,在若干法律和医学基准上,Grok 4.7 是它迄今表现最好的 Grok 模型。
延伸阅读:GPT-6 Astra 发布:OpenAI 首个「关键」级网络安全 AI,附带一处监控退步
知识工作是最清楚的进步
改进最有力的独立证据来自长程的办公工作。在 Artificial Analysis 针对数小时专业任务的私有基准 AA-Briefcase 上,Grok 4.7 拿到 1657 Elo,在高努力档下比 Grok 4.6 高 111 分,仅次于 Claude Opus 5 和 Claude Fable 5.1。Artificial Analysis 表示,提升主要来自分析质量 —— 它从 1690 Elo 升到 1994 Elo,而呈现质量基本持平。
在要求模型产出文档、表格、幻灯片等实用工作成果的 GDPval-AA 上,Grok 4.7 得 1695 Elo,比 Grok 4.6 高 90 分。SpaceXAI 自家的 GDPval 图表把这个结果放在 Fable 5.1 的 1735 和 GPT-6 Astra 的 1542 之间。
Artificial Analysis 还发现它在 AA-Omniscience 测试上的幻觉率更低,为 29%,Grok 4.6 是 34%,而准确率大体不变。不过该机构表示,在智能体式知识工作之外,Grok 4.7 与前代大体相当,部分测试小幅提升,在 AA-LCR 和 AutomationBench-AA 上则有退步。
token 便宜,任务不便宜
按挂牌价,Grok 4.7 大幅低于它最接近的对手。Claude Fable 5.1 和 GPT-6 Astra 都标价每百万输入 10 美元、每百万输出 50 美元,也就是说 Grok 4.7 的输入便宜五倍,输出便宜八倍以上。
token 消耗把这个差距拉回来了一些。Artificial Analysis 发现,Grok 4.7 在 xhigh 档下,智能指数每道任务用掉约 8.1 万个输出 token,而高努力档的 Grok 4.6 是 3.6 万、最高努力档的 GPT-6 Astra 是 2.7 万。这比 Grok 4.6 多 125%,比 GPT-6 Astra 多 196%。
Artificial Analysis 把智能指数每道任务的平均成本定在:Grok 4.7 在 xhigh 档约 3.74 美元、在高档约 2.73 美元。VentureBeat 指出,同一组对比中 GPT-5.6 Sol Max 每道任务约 1.99 美元,尽管它的挂牌价高得多,为 4 美元和 20 美元。Vals AI 同样报告,Grok 4.7 在 Vals 指数每道题上的花费略高于 Grok 4.6,为 4.78 美元对 4.34 美元。
支持者看的是另一个指标。在 SpaceXAI 的 CursorBench 4.0 成本对比中 —— 这组数字由 AI 评论者 @haider1 放大传播,并被 VentureBeat 引用 —— Grok 4.7 在 xhigh 档以每道任务约 6.01 美元拿到 46.3%,而中等努力档的 Fable 5.1 是 7.05 美元拿到 46.8%,GPT-5.6 Sol Max 是 8.23 美元拿到 41.7%。对工程团队来说,结论是:决定真实账单的是每完成一项任务的成本,而不是价目表。
速度仍是强项。Artificial Analysis 测得 Grok 4.7 在长提示词下的回答输出速度约为每秒 188 个 token,不过由于它 token 用量大,智能指数每道任务平均耗时约 7.1 分钟。
一套新的安全防护栈
SpaceXAI 称 Grok 4.7 配了一套全新的安全防护栈,并称它是公司在拒答和抗越狱上测试过的最强模型。公司报告该模型在 LatchBio 的生物安全基准上以 62.4% 居首;在 SpaceXAI 内部用于评估高风险和恶意网络任务的 HackerBench v0.3 上,它只放行了 3.3% 的高风险两用提示词,同时很少拦截正当的安全工作。
这些都是公司自报的结果,尚未被独立复现。SpaceXAI 还表示,它已开始向部分网络安全合作方开放 Grok 4.7 红队能力的邀请制访问,用于防御研究。
框架和模型如今是捆着卖的
Grok 4.7 在 Grok Build 下的分数与它在标准化设置下的成绩之间的落差,指向前沿 AI 编程系统竞争方式上的一个更大转变。SpaceXAI 专门为自家的 Grok Bot 框架训练了 Grok 4.7,并首先通过它控制的两个产品 Grok Build 和 Cursor 推向市场。Anthropic 和 OpenAI 也在走类似的路线,把自家模型与自家编程智能体配对。
对开发者来说,这让测试设置成为任何跑分主张的一部分。在厂商自家智能体内部测出的排行榜分数,可能与在中立框架下测出的差很多 —— Grok 4.7 的 Terminal-Bench 结果就是例子。VentureBeat 给工程负责人的建议是:用有代表性的内部任务去测模型,并在 API 费率之外,同时跟踪每次成功完成的成本、token 消耗、延迟、重试次数和所需的人工干预。
Grok 4.8 已经在路上
马斯克已经在谈下一次发布了。在 Grok 4.7 出货之前的 9 月 13 日,他在 X 上表示,Grok 4.8 是一个 2.5 万亿参数的模型,在 SpaceXAI 新的 C++ 软件栈上训练,并将在那一周完成初始训练、转入强化学习阶段。他还说 Grok 4.9 很可能达到 OpenAI 的 Astra 和 Anthropic 的 Fable 这一档,并把 Grok 5 定位为公司冲击前沿领先地位的一搏。
SpaceXAI 没有就 Grok 4.8 发布任何公告、模型卡、定价或发布日期,它的规格目前仍是马斯克的说法,而不是已确认的产品细节。就现在而言,Grok 4.7 把 SpaceXAI 放在前沿稍下方的位置,靠价格和速度竞争,而独立测试者仍在衡量:它的表现在自家工具之外还能剩下多少。