StepFun 上线 Step 5 Preview:6000 亿参数 MoE 旗舰,百万 token 仅 1 美元
稀疏 MoE 每个 token 只激活 6000 亿参数中的 270 亿,权重要等到 10 月 15 日才放出

StepFun 是中国六家领先 AI 实验室之一,它于 2026 年 9 月 20 日推出 Step 5 Preview,开放了一个 6000 亿参数稀疏混合专家(MoE)模型的 API —— 这个模型是为长程智能体工作设计的。按 Artificial Analysis 的独立测量,它的定价是每百万输入 token 1.00 美元、每百万输出 token 2.70 美元,明显低于同类推理模型的价格中位数。95% 的缓存折扣把重复输入压到每百万约 0.05 美元。开放权重目前还没有公开;StepFun 把 10 月 15 日定为放出权重的日期,而管理商业部署与微调的许可证尚未披露。
对开发者来说,实际含义很简单:Step 5 Preview 今天可以调用,但不能自托管,而 10 月 15 日才是真正决定它会成为基础设施、还是只是又一个 API 的那个节点。
延伸阅读:DeepSeek V4 Flash Vision Exp:以文本模型的价格打开多模态智能体工作流
StepFun 如何设计一个只靠自身 4.5% 参数运行的 6000 亿模型
Step 5 Preview 建立在稀疏混合专家架构之上,这种设计在 2026 年已经成为中国大型 AI 实验室发布的核心。它不是在每一次前向传播中激活全部 6000 亿参数,而是把每个 token 路由给一部分专门的参数块 —— 也就是「专家」。StepFun 称每个 token 约有 270 亿参数被激活,占总参数池的 4.5%。
这个比例之所以重要,有两个原因。第一是推理的经济账:生成每个 token 所需的计算量,与被激活的参数成正比,而不是与总参数成正比。一个 6000 亿参数的稠密模型,在每一步生成时实际上要动用整套权重;而 Step 5 Preview 的稀疏设计,让 StepFun 能以其中一小部分的单 token 计算成本,提供 6000 亿参数模型的表示广度。第二个原因是这个比例并不意味着什么:它并不等于部署时就像跑一个 270 亿参数的模型。整套 6000 亿参数的权重仍然必须待在服务系统的某个地方。在 BF16 精度下,6000 亿参数大约是 1.2 TB 的权重数据 —— 这还不算运行时的额外开销 —— 所以分布式推理基础设施仍然是必需的,10 月 15 日的开放权重也只有对拥有相当规模 GPU 集群的团队才具有实际意义。
StepFun 还做了一个与近期其他大型 MoE 模型不同的架构选择:不是把网络做宽,而是做深。按 Pandaily 对这次发布的报道,公司称 Step 5 Preview 采用了 92 层窄而深的 Transformer 布局。给出的理由是:更深的堆叠在长上下文预填充阶段能提供更长的信息通路 —— 也就是智能体在给出回应之前,通读工具输出、代码库或财务文件的那个阶段。在那个阶段,智能体模型必须把跨越数十万 token 的信息整合起来,而 StepFun 认为,在维持多跳推理链上,深度比宽度更有帮助。这个架构主张没有得到独立验证,但它与关于 transformer 深度与组合式推理的一个更广的研究假设是一致的。
该模型支持 100 万 token 的上下文窗口,接受文本和图像输入,并具备扩展推理能力 —— 也就是 Artificial Analysis 归类为思维链处理的那种。按 Artificial Analysis 通过 StepFun 自家 API 做的独立测量,输出速度约为每秒 99.8 个 token,首 token 时间为 2.96 秒,两项都优于同价位段可比推理模型的中位数。
独立评分究竟说明了什么,又没说明什么
目前可获得的、对 Step 5 Preview 最可靠的第三方评估,是 Artificial Analysis 的智能指数(Intelligence Index),该模型在其综合量表上得 44 分。这个分数让 Step 5 Preview 在该指数追踪的 653 个模型中排第 27 位;指数纳入了十项评测,包括 AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam 等。
Artificial Analysis 算出,跑完整个指数评测,这个模型花掉了 922.84 美元 —— 对于估算生产成本的开发者来说,这是一个有意义的参考点。该平台还标出了一个值得注意的特点:话多。Step 5 Preview 在指数评测中生成了 1.6 亿个输出 token,而可比推理模型的中位数是 9200 万。一个长篇推理的模型,会把它在单 token 价格上的一部分优势花在更长的输出上,这意味着真实的工作负载经济账,很大程度上取决于它在生产中的推理链会变得多啰嗦。按任务计算的成本,仍然让 Step 5 Preview 处在同等能力水平里价格较优的一档,但跑输出密集型应用的开发者,应当把这个话多效应明确算进去。
StepFun 随发布一同公布的自家跑分表提供了更多对比数字,不过这些需要小心解读。公司报告 DeepSWE v1.1 得 67.7、StepCodeBench 得 49,在这两项上领先 Kimi K3 和 GLM-5.3。StepCodeBench 由 StepFun 自己主办,覆盖 553 个代码仓库、九类任务和 33 种编程语言。覆盖面确实可信地广,但买家无法独立复现它。在同时出现在 Artificial Analysis 指数中的 Terminal-Bench v4 上,Step 5 Preview 公司自报的 33.3 分落后于 GLM-5.3 的 41.9、Claude Opus 5 的 52.3 和 GPT-6 Astra 的 57.9 —— 对需要长时间使用终端的智能体任务来说,这个差距意味着实打实的能力差别。
金融是 Step 5 Preview 相对美国竞品表现最好的领域。在 FrontierFinance 上,StepFun 报告 Step 5 Preview 得 66.4,GPT-6 Astra 为 55,Claude Opus 5 为 69.7。在另一项金融评测 DRACO 上,报告的数字是 Step 5 Preview 83.3、GPT-6 Astra 76.8、Claude Opus 5 87.6。这些都是公司自行组织的对比,而不是中立的统一测试,但相对 GPT-6 Astra 的金融优势在两项独立评测上都成立,对构建金融研究智能体的团队来说值得一提。
StepFun 还在发布材料中公布了两项 24 小时自主智能体实验。第一项里,公司称 Step 5 Preview 在大约 22 小时的自主工作之后,把一个推理内核在英伟达 H100 上优化到 508 TFLOPS,而 Claude Opus 5 是 493 TFLOPS。第二项里,该模型跑了一条自动化的后训练流程,把 Qwen3-30B-A3B 基座模型的 AIME24 准确率从 53.3% 提到 60%,在用更少标注 token 的情况下与 Claude Opus 5 持平。作为「能持续执行智能体任务」的方向性证据,这些演示很有说服力,但实验设置由 StepFun 自己定义和运行,关于评分过程的方法细节有限。另一项主张 —— 约 70% 的内部和外部专家认为该模型能自主完成中等复杂度的编程任务 —— 同样难以核实,因为参与人数、任务集合和评估标准都没有披露。
Step 5 Preview 在中国前沿模型竞赛中的位置
StepFun 是中国六家主要 AI 实验室之一,这几家有时被称为「六小虎」。按 The Wire China 2025 年的一篇人物报道,姜大昕在微软工作了 16 年,参与过 Bing、Cortana 和 Azure 认知服务,并在布法罗大学拿到计算机科学博士学位,随后在 ChatGPT 掀起生成式 AI 浪潮后不久的 2023 年 4 月创立了 StepFun。这家公司获得了强劲的机构支持:据 TechNode 报道,2026 年 1 月宣布的 B+ 轮融资超过 7.18 亿美元,投资方包括腾讯、启明创投和上海的国有资本基金。
Step 5 Preview 进入的这个市场,中国前沿实验室之间的跑分竞争正在加剧。月之暗面在 2026 年 7 月发布了 Kimi K3 —— 一个 2.8 万亿参数的稀疏 MoE 模型,激活参数 1040 亿,上下文窗口 100 万 token,在 Artificial Analysis 智能指数上得 44 分,与 Step 5 Preview 在该项上打平。阿里已经预览了总参数 2.4 万亿的 Qwen3.8-Max。Z.ai 的 GLM-5.3 尽管账面参数量更小,却在 Terminal-Bench v4 上胜过 Step 5 Preview。
最重要的竞争事实,与其说是跑分,不如说是产品策略。Kimi K3 在 2026 年 7 月 27 日之前就以宽松的分发条款放出了完整的开放权重;Step 5 Preview 还没有这么做。在到 10 月 15 日为止的这三周半里,Step 5 Preview 是一个排名第 27 的闭源 API 模型,社区对它的评估只能局限于从托管 API 推断出来的东西。一旦权重落地,评估的性质会发生实质变化:独立研究者可以测量显存需求、评估量化表现、尝试微调,并依据适用的许可条款判断商业衍生作品是否被允许。
StepFun 在执行一套有意为之的双轨策略。开放的一侧是 Step 3.5 Flash —— 一个 1960 亿参数的稀疏 MoE 模型,激活参数 110 亿,上下文窗口 25.6 万 token,于 2026 年 2 月以 Apache 2.0 许可证发布,可自由部署和修改用于商业用途,这一点由 Artificial Analysis 的模型数据予以确认。Step 5 Preview 位于其上,是一个 StepFun 通过计量 API 提供的闭源旗舰。这个结构与其他中国实验室处理「社区采用」与「商业收入」之间张力的方式相似:用开放的小模型建立开发者信任,用闭源的旗舰模型去抓企业预算。
定价、缓存,以及智能体工作负载的真实经济账
1 美元输入、2.70 美元输出的定价,已由 Artificial Analysis 独立核实;该平台可比推理模型的中位数是输入 1.88 美元、输出 10.00 美元,这两个数字都明显更高。启用缓存后的有效输入价格约为每百万 0.05 美元 —— 对任何「大部分上下文在多轮之间重复」的智能体架构来说,这个数字都很关键。
智能体的工作负载往往非常适合缓存。一个在固定代码库上工作的编程智能体,每一轮都要发送同样的仓库头部、系统指令和项目上下文。一个金融研究智能体会反复引用同一批财报或政策文件。如果一个百万 token 上下文里有 90% 是稳定的系统提示词内容,那么每百万 0.05 美元的缓存输入价格,会让单任务成本的估算比 1 美元的挂牌输入价所暗示的要划算得多。
延伸阅读:阿里上线 Qwen3.8-Omni-Flash:音视频智能体 API,百万 token 0.15 美元
话虽如此,话多这个特点起的是反方向的作用。在给出最终答案之前大量展开思维链的推理模型,会生成大量输出 token。Step 5 Preview 在 Artificial Analysis 指数评测中用掉 1.6 亿个输出 token —— 而可比模型的中位数是 9200 万 —— 说明它的推理长度大约是典型水平的 1.7 倍。在每百万输出 token 2.70 美元的价格下,每项任务上的长篇推理会侵蚀掉输入侧的单 token 优势。构建高吞吐流水线的开发者,需要先在自己的任务分布上测量这个话多效应,再去推算成本节省。
该模型还提供了一个兼容 OpenAI 的 API 端点,降低了已经在用那套客户端格式的团队的集成工作量。速率限制、地域访问限制和企业档定价尚未公布。
10 月 15 日真正会改变什么
9 月 20 日的 API 发布,让 Step 5 Preview 可以被调用,也能通过托管基础设施被独立地跑分。但它并不能让这个模型可部署。10 月 15 日的发布会改变这一点 —— 但前提是几个目前还无法评估的条件成立。
第一,许可条款。「开放权重」是一个很宽泛的说法,从允许无限制商业使用的 Apache 2.0 许可证,到禁止衍生模型、限制部署地域或禁止商业微调的自定义协议,都能被它涵盖。在 10 月 15 日实际的许可证公布之前,把 Step 5 Preview 纳入企业部署评估的团队,无法完全判断自托管在他们的场景下是否合法可行。
第二,部署要求。正如 Orca Router 对这次公告的分析所指出的,Hugging Face 上的 stepfun-ai/Step-5-Preview-BF16 仓库已经存在,但里面只有一个 .gitattributes 文件 —— 没有权重,没有模型卡,也没有配置。等权重到位之后,团队需要评估可用的量化选项、受支持的推理栈、多机需求,以及在自己实际运行的硬件上能达到的实用吞吐量。6000 亿参数的权重集合即便是稀疏激活,也需要可观的内存带宽和高速互联,才能高效地做多机服务。StepFun 会不会在 BF16 权重之外同时放出优化过的量化版本,目前未知。
第三,微调的可及性。稀疏 MoE 模型给标准微调流程带来了技术上的复杂性:像 LoRA 这样的参数高效方法需要针对专家门控架构做适配,而对一个 6000 亿参数的模型做全量微调,无论许可条款如何,都超出了大多数机构的资源。StepFun 会不会发布微调指南、适合改造的架构变体,或者便于蒸馏的检查点,都还是未知数。
因此,对研究与开发社区来说最要紧的一步不是这次 API 发布 —— 而是三周半之后会发生什么。API 让 Step 5 Preview 成为智能体模型市场上的一个新价格点;而开放权重的发布,才决定它会不会成为别人可以在上面继续建设的地基。