本地跑 LLM 比你以为的贵:账单由硬件决定,不是电费
苹果 Mac Studio M5 Ultra 9 月 22 日发货,而云端 MoE 的价格已经压到本地电费之下

苹果新款 Mac Studio M5 Ultra 于 8 月 25 日发布、9 月 22 日开始发货,恢复了 256GB 和 512GB 两档内存配置 —— 今年早些时候,在全球 LPDDR5 短缺期间,公司曾悄悄把它们下架。同一场短缺把 RTX 5090 显卡从 1999 美元的建议零售价推到了 3000 美元以上的市场价,也把 DDR5 内存条价格抬到 2024 年低点的五倍。M5 Ultra 的到来,让现在成了审视一笔账的合适时机 —— 这笔账是多数本地 AI 硬件讨论绕开的:问题不是前沿开源权重模型能不能在桌面硬件上跑起来,而是当云端 API 以每百万 token 不到一美元的价格提供同样的模型时,这么做在经济上还讲不讲得通。
简短的答案是:电费在这个决策里几乎无关紧要。硬件摊销占每月本地推理账单的 85% 到 98%。而云端最便宜的选项,如今每 token 的价格已经接近本地单算电费的水平 —— 这还没算进一分钱的硬件折旧。
为什么 MoE 架构改变了本地推理的这笔账
要理解当下的经济账,先得理解混合专家(Mixture-of-Experts)架构对推理成本做了什么。稠密 Transformer 生成每一个 token 都要激活全部参数。MoE 模型则维护一大池专门化的子网络,每个 token 只路由到其中很小一部分。DeepSeek V4 Flash 0731 —— 它在 8 月下旬的 OpenRouter 周度模型使用量排行榜上登顶,拿下全球第一 —— 总参数 2840 亿,但每个 token 只激活约 130 亿。
这种稀疏性改变了硬件在推理时实际在做的事。全部 2840 亿参数必须常驻内存(4 位量化下约 145GB),但每个 token 消耗的内存带宽只与被激活的那部分成正比。决定生成速度的是内存带宽 —— 不是算力 FLOPS,也不是参数量。在 NVIDIA DGX Spark 的 273 GB/s 上,一个每 token 激活 3.5GB 的 MoE 模型,理论解码吞吐约为每秒 78 个 token。把同一台硬件换去跑稠密的 70B 模型 —— 每个 token 都得把 40GB 权重流一遍 —— 这个上限就塌到每秒 7 个 token 左右。2026 年 8 月的实测数据印证了这一点:单台 DGX Spark 跑 DeepSeek V4 Flash 实测约每秒 26 个 token,双机配置达到 82。
苹果的 M5 Ultra 达到 1.2 TB/s —— 是 DGX Spark 273 GB/s 的 4.4 倍,是 AMD Strix Halo 迷你主机 256 GB/s 的 4.7 倍。对激活比例很小的 MoE 模型来说,这个带宽优势会被摊薄。对稠密模型,它几乎线性地转化为生成速度。苹果发布时宣称的「AI 峰值性能是 M3 Ultra 的 4.3 倍」是一个算力指标,不是生成速度数字 —— 该公司自己的 MLX 基准测试显示,持续生成只提升了 19% 到 27%,而预填充(prefill,即受算力约束的输入处理阶段)最高提升 4 倍。
跑一个模型每 token、每月究竟花多少钱
按 PG&E 的 E-TOU-C 居民电价表 计算 —— 混合谷段电价约合每度 0.40 美元 —— 特定硬件与模型组合的边际电费很容易算出来。一台 96GB 的 Mac Studio 跑激活参数约 50 亿的 MoE 模型,在每秒 40 token、120 瓦的条件下,电费约合每百万混合 token 0.09 美元(按输入输出 3:1 计)。一台 RTX 5090 台式机跑 27B 模型,500 瓦、每秒 45 token,电费约为每百万混合 token 0.33 美元。
这些数字对已经完全折旧的硬件是准确的。它们描述的是边际成本。至于你该不该买这套硬件,它们什么也没说。
按四年折旧算,一台 3300 美元的 Strix Halo 迷你主机(128GB,Minisforum MS-S1 Max 或同级)在生成任何 token 之前,每月成本就约为 69 美元。一台 5000 美元的 RTX 5090 台式机约为每月 104 美元。5499 美元的 96GB Mac Studio M5 Ultra 是每月 115 美元。256GB 配置要多花大约 4000 美元,光折旧就到每月约 198 美元。以每月 3000 万混合 token 计 —— 这对一个活跃的个人开发者是现实的量 —— 每月总账单从 Strix Halo 的 75 美元到 256GB Mac Studio 的 206 美元不等。所有配置里,这笔账的 85% 到 98% 都是硬件折旧。电费是个可以忽略的零头。
这个成本结构还解释了一个反直觉的结果:在中等使用量下,加内存以便跑更好的模型会推高、而不是压低每 token 的实际成本。从 5499 美元的 Mac Studio(96GB)跳到约 9500 美元的 256GB 配置,每月折旧几乎翻倍,而每次会话生成的 token 数并没有变多。256GB 机器的优势在能力 —— 能加载那些 96GB 硬件根本装不下的模型 —— 不在成本效率。在这个市场上,硬件升级买到的是能力余量,不是更低的单位经济性。
延伸阅读:内存成本冲上 AI 栈顶,英伟达 AI 服务器价格上调超过 15%
开发者在 OpenRouter 上实际付的价
OpenRouter 截至 2026 年 8 月下旬的周度排行榜,可以当成一次显示性偏好实验来读。用量最高的模型 —— DeepSeek V4 Flash 0731 —— 在标准供应商处的输入挂牌价是每百万 token 0.14 美元,但平台上最便宜的供应商目前把它压到每百万输入 token 不到 0.07 美元,输出低至每百万 0.10 美元。按 3:1 的混合 token 比例、并计入 OpenRouter 5.5% 的充值手续费之后,做过成本优化的路由能把混合有效价压到每百万 token 0.10 美元以下。按量排第四的模型 GLM-5.3-Flash —— 已公开确认就是此前匿名的 Ox Alpha 端点背后那个模型 —— 价格与之相当。小米的 MiMo-V2.5 在同期排名第五。
这对本地硬件的对比意味着什么,是精确的:云端 MoE 的价格已经与「在本地硬件上跑同等模型的纯电费」持平,甚至更低。中等用量下,把全部成本算进去的 Mac Studio 方案要比云端路由贵得多 —— 而一旦把云端能提供、本地硬件给不了的东西算进来,这点差距就彻底消失了:131 万 token 的上下文窗口,以及不设限的并发请求。
OpenRouter 的预付费模式 也回应了一种担忧:API 费用不可控。按 key 设置额度上限、可按日或按月重置,再加上模型白名单,意味着一个配置出错的智能体循环,在五美元的日额度下就正好停在五美元。「本地推理能避免账单失控」这个论点,只对电费那一行成立 —— 而正如折旧分析所示,钱并不花在那里。
上下文窗口:多数硬件对比忽略掉的那个变量
相对云端,本地硬件最重要的结构性弱点不是生成速度,是上下文窗口。标称 128K 或 256K 上下文的模型,在多数本地硬件上达不到那个长度,因为 KV 缓存 —— 存放整段上下文已算注意力状态的内存结构 —— 随上下文长度线性增长,并且与模型权重直接争抢同一块物理内存。
学术界的实测把 LLaMA-3.1-405B 在 128K 上下文下的 KV 缓存需求定在约 123GB —— 比模型权重本身还多。一台 96GB 的 Mac Studio 跑 120B 的 MoE 模型,加载完权重后大约还剩 14GB 内存。这 14GB 的缓存余量,离该模型标称支持的 128K 上下文上限差得很远。Ollama 用自动上下文选择把这个现实固化了下来:GPU 可访问内存低于 24GB 时默认 4K 上下文;24 到 48GB 默认 32K;48GB 及以上默认 256K。这些阈值针对的是 GPU 可访问内存,而不是统一内存总量 —— 一台 36GB 的 Mac 在 macOS 下分配给 GPU 的大约是 24GB。
256GB 的 M5 Ultra 是第一款实质改变这一点的桌面配置。加载一个 145GB 的 MoE 模型后,还剩约 60GB 给 KV 缓存 —— 足以支撑实用的长上下文操作,不过仍远低于同样这些模型在云端端点上可用的 131 万 token 窗口。在超长上下文下,缓存读取也会越来越主导推理时间:2026 年的一项实测发现,128K 上下文时注意力操作占单 token 延迟的 84.7%,到 100 万 token 时升至 97.9%。
什么时候本地推理在结构上是说得通的
以上这些并不否定本地推理的理由。它们只是把这个理由到底是什么,说清楚了。
最强的一种情形:硬件本来就是为别的主要用途买的 —— 视频制作、科学计算、3D 渲染 —— 推理只按边际电费跑。以每百万 token 约 0.09 美元的电费计,本地推理胜过任何云端选项。折旧早已记到另一条预算线上去了。
第二种情形:真实存在的数据主权约束。OpenRouter 上用量最高的几个模型中,有几个出自中国的 AI 实验室。对于那些数据不能经由非本国端点流转的受监管行业组织 —— 政府、国防、医疗、部分金融服务 —— 256GB 的 Mac Studio 是第一款能在本地完整加载 DeepSeek V4 Flash 那 145GB 权重的桌面配置。至于它跑得效率如何,要等 9 月 22 日 M5 Ultra 发货之后,独立测试者才量得出来。
有一项技术进展在本地这一层改变了稠密模型的图景,值得单独说。多 token 预测(Multi-Token Prediction,一种投机解码)已于 2026 年 5 月 16 日并入 llama.cpp 主线。在双 RTX 5090 的配置上,MTP 把一个 270 亿参数的稠密 Qwen 模型从每秒 51 个 token 推到 117 个,2.3 倍加速 —— 做法是每次前向传播预测并验证多个 token,而不是逐个顺序生成。对稠密模型来说,内存带宽对生成的约束远比 MoE 模型严重,而 MTP 部分绕开了这个瓶颈。在统一内存硬件上跑稠密 70B 模型,速度一直落后于云端端点;MTP 在不升级硬件的前提下缩小了这个差距。
延迟确定的离线运行、分类和抽取这类短上下文高频任务,以及不随 token 用量变化的固定月成本,凑齐了其余那些真实成立的用例。经不起全成本分析的是这样一个前提:为推理专门买硬件,主要是一步省钱的棋。在 2026 年 9 月个人和小团队的使用量级上,云端 MoE 的价格已经与本地电费持平或更低。要靠专门买硬件来压低 token 开销,得先把用量做到每月 10 亿混合 token 以上,折旧才开始追平这个差距 —— 而到了那个量级,单请求串行推理本身又成了瓶颈。
延伸阅读:FreeToken 重写本地 MoE 推理:在合适的硬件上比 Ollama 快一倍
贯穿 2026 年、重塑了硬件定价的这场内存危机,也把「本地 AI 推理到底是为什么而存在」这件事说清楚了。它的价值从来就不主要在电费单上。它一直在于那些你不能、或者选择不发到别人服务器上的东西 —— 而且越来越在于:为了让数据完全留在自己手里,你具体需要跑哪些模型。2026 年真正重要的基准不是每百万 token 多少度电,而是:你需要的那个模型,在你需要的上下文长度下,究竟还能不能合法且实际地跑在别的任何地方。