OpenAI 的 Mac mini 机群,暴露了一种新的智能体训练架构
苹果没有企业级 AI 团队 —— AI 实验室却在按万台买它的硬件

OpenAI 已悄悄攒起数万台苹果 Mac mini 与 Mac Studio,用于强化学习和电脑操作智能体的训练 —— 这是 The Information 周六的报道。这个不寻常的硬件决定揭示出:有一类特定的 AI 负载已经走出了 2020 年以来定义前沿 AI 基础设施的那套 GPU 集群模型。Anthropic 在走同一条路,只是采购路径不同 —— 它通过亚马逊云科技大规模租用 Mac mini。两家公司都没有公开确认这套安排,但旁证已经看得见:苹果 Mac 业务上季度录得 103.5 亿美元营收,同比增长 28.7%,是该季度苹果所有硬件品类中增速最快的一个 —— 而同期 iPad 营收实际上是下滑的。
这篇报道落在一个有历史分量的日子上。按苹果的公告,蒂姆·库克将于午夜卸任苹果 CEO,9 月 1 日把公司交给硬件工程负责人约翰·特纳斯(John Ternus)。而在这次交接到来时,苹果的桌面产品已经 —— 出于意外而非设计 —— 成为世界上一些最先进 AI 研发所依托的基础设施中不可忽视的一块。特纳斯接手的是一门正在赢下苹果从未打算去争的企业订单的 Mac 生意,而苹果在那个市场上没有任何一支专门的团队。
为什么电脑操作智能体的强化学习不需要 GPU 集群
要理解 OpenAI 这个决定背后的架构逻辑,得先弄清楚电脑操作智能体的训练与跑在英伟达 GPU 集群上的前沿模型预训练有什么不同。
预训练一个大语言模型是矩阵乘法主导的负载:巨大的权重矩阵与巨大的数据批次相乘,连续不断地跑上几个月。训练集群里的每一块 GPU 都在对同一个模型、同一份数据集的分片做同一个操作,步调一致。瓶颈是原始算力吞吐和 GPU 之间的带宽 —— 这正是英伟达的 NVLink 互连与 HBM3e 显存在商业上如此重要的原因。英伟达 AI 基础设施产品的整套经济逻辑,都建立在这个训练模型之上。
电脑操作智能体的强化学习在结构上不同,而这个不同是要紧的。一个智能体被放进真实的操作系统环境里 —— 在这里是 macOS —— 领到一个任务(整理收件箱、编辑一个代码库、总结一个文档文件夹),它的动作被观察,结果被打分。那个分数成为更新智能体策略的奖励信号。然后这个循环在数千个并行实例上重复数百万次。
这里的瓶颈不是矩阵运算,而是大规模运行真实操作系统环境的开销,以及在环境与训练框架之间高效搬运观测数据 —— 屏幕状态、UI 元素树、文件系统状态。在带独立 GPU 的系统上,这些数据每一次推理步都必须跨过 PCIe 总线,从 CPU 的内存域进到 GPU 的显存再回来。当环境是一整个 macOS 会话而不是一个合成的 gym 时,这份开销并不小。
苹果 M 系列的统一内存架构把这道边界取消了。CPU、GPU 和神经网络引擎都从同一颗芯片封装上的同一个物理内存池里取数。跑模拟环境的 macOS 进程,和跑智能体更新的 MLX 训练框架,读写的是同一块内存,不需要任何总线传输。对「训练一个与真实电脑交互的智能体」这个特定负载来说,这个设计相对 CPU 与 GPU 被 PCIe 总线隔在两个内存域的独立 GPU 集群,是一项实打实的优势。
还有一个直白的并行度论证。同时跑 5 万台独立的 Mac,每台承载一个或少数几个智能体训练环境,是横向扩展,没有节点间通信开销。GPU 集群是为共享模型上的紧耦合并行优化的;而 macOS 环境上的智能体训练,更受益于跨大量独立机器的松耦合广度。一个 A100 GPU 集群若要跑数万个并行的 macOS 虚拟机,就得在每一个智能体步骤上把显示、输入和文件系统状态经 PCIe 路由一遍 —— 在一个要跑数百万次迭代的训练循环里,这个延迟累积得很快。
还有一项在这条新闻的报道里很少出现的次要优势:能耗经济学。一台配 M5 Pro 的 Mac mini 在持续 AI 负载下大约吃 25 到 35 瓦。一台跑英伟达 H100 的 GPU 服务器,每块 GPU 卡就是 700 瓦,八卡节点的整机功率通常超过 10 千瓦。跑 1 万台 Mac mini 大约消耗 250 到 350 千瓦 —— 与一个中型 GPU 集群相当 —— 却能提供多得多的完全独立的 macOS 环境实例。对智能体训练这个特定任务而言,每个并行实例是各跑各的、而不是在为一个共享计算做贡献,因此苹果芯片在「每环境能效」上明显好过独立 GPU 基础设施。确切数字取决于负载配置,OpenAI 和 Anthropic 都没有公开,但这个方向上的优势是真实的,也是 AI 实验室采用这条路线的原因之一。
Mac mini 和 Mac Studio 的散热特性进一步强化了这种契合。与依赖被动或低功耗主动散热、在持续负载下会降频的 MacBook 不同,Mac mini 和 Mac Studio 是为长时间运行的专业负载设计的。Mac mini 那副看似无风扇的外观是有欺骗性的:它内部有一套主动散热系统,配专门的均热板和风扇,为持续的专业使用而设,不是便携设备那种被压缩的热包线。强化学习训练一跑就是几小时到几天;热稳定性是一项实际要求,不是营销话术。
苹果的 M6 与 M5 Ultra 比预期早了六周登场
苹果在 8 月 25 日发布新 Mac 硬件 —— 比它通常的 10 月或 11 月窗口提前了六周 —— 不是偶然。The Information 的报道显示,苹果把发布提前,部分原因是 AI 实验室的需求在上一代产品上造成了供应短缺。据报道,高内存配置的 Mac mini 和 Mac Studio 已经缺货数月,企业买家只能排队等。
新硬件把这个特定负载上的性能故事往前推了一大步。M6 芯片 —— 苹果第一颗基于台积电 2 纳米 N2 制程的芯片,采用环绕栅极纳米片晶体管而非 M1 到 M5 上的 FinFET 设计 —— 首发于刷新版 Mac mini,起售价 899 美元。苹果称,相对 M5,面向 AI 任务的峰值 GPU 算力提升接近 30%,既来自更密的 N2 制程,也来自嵌进这颗芯片 12 个 GPU 核心里每一个的新神经加速器 —— 这个设计首次下放到 Mac mini 这一档。一个双 16 核神经网络引擎负责那些受益于专用矩阵乘法硬件的任务,而 GPU 里的神经加速器则处理夹在图形负载中间的运算。按苹果自己的测试,两者合起来的效果是 AI 性能约为 M4 Mac mini 的 4 倍,在 LM Studio 里的 LLM 提示词处理最高快 4.8 倍。
对 AI 实验室这个用例来说,Mac Studio 的更新在架构上更有分量。M5 Ultra 是苹果 M 系列历史上第一颗四裸片(quad-die)产品:此前的 Ultra 档是把两颗 M 系列 Max 裸片熔在一起,而 M5 Ultra 用新一代 UltraFusion 互连把两颗双裸片的 M5 Max 连起来,速率超过 4.4TB/s,连接密度是此前 UltraFusion 实现的六倍以上。结果是 36 核 CPU、80 核 GPU(苹果迄今造过的最大的一颗苹果芯片 GPU,每个核心都带神经加速器),以及 512GB 的统一内存上限、1.2TB/s 的带宽。那个 512GB 配置 —— 让单机能把 2000 亿参数的模型整个装进统一内存 —— 是对推理侧研究工作流最要紧的规格;不过苹果已确认 512GB 机型要到 10 月下旬才供货,目前可买到的 M5 Ultra Mac Studio 配置起售价 5499 美元。
延伸阅读:内存成本压到 AI 栈上,英伟达 AI 服务器价格上涨超过 15%
让基于 Mac 的智能体训练变得可行的那层软件栈
硬件架构只解释了一半。有两层软件让 Mac 规模的 AI 训练,对那些想走出单机实验的工程师来说变得切实可行。
MLX 是苹果为苹果芯片开发的开源数组框架,通过 Metal Performance Shaders 提供 PyTorch 风格的自动微分与 GPU 加速 —— 原生跑在统一内存上,没有 PyTorch 的 MPS 后端在某些训练配置下仍然带着的那份内存拷贝开销。对那些为智能体负载手写自定义 RL 训练循环的研究团队来说,MLX 正越来越成为苹果硬件上的默认框架。
EXO 是 EXO Labs 的开源分布式推理项目,它让多台苹果芯片 Mac 通过雷雳 5 和 RDMA(远程直接内存访问)把各自的统一内存汇成一个分布式推理集群。四机 EXO 集群的推理速度约为单机的 3.2 倍;配合雷雳 5 上的 RDMA,设备间延迟降到接近零。实际结果是:四台 M5 Ultra Mac Studio 组成的雷雳集群,呈现出约 2TB 的可用统一内存,足以装下并运行那些原本需要按云价租一整个企业级 GPU 集群才能跑的前沿规模开放权重模型。该项目采用 Apache 2.0 许可,已积累超过 4.6 万颗 GitHub 星。
苹果还发布了 Core AI,一个新的开发者框架,用来在苹果芯片的全部计算面 —— CPU、GPU、神经网络引擎 —— 上同时协调 LLM 与自定义模型的部署,而不是把所有运算都路由给单一处理器。Core AI 正是让 Mac Studio 集群推理从研究场景走到生产级可用的那一层。
关于这层软件栈,有一条重要的保留意见值得直说。PyTorch 的 MPS(Metal Performance Shaders)后端 —— 它让 PyTorch 代码经由 Metal API 跑在苹果的 GPU 上 —— 仍在成熟中。2024 年底到 2025 年初的学术研究记录了它相对 PyTorch 的 CUDA 后端在训练侧的优化差距:梯度检查点、混合精度训练,以及前沿模型训练流水线里用到的某些自定义 CUDA 内核,在 MPS 后端上还没有对等物。多所大学的研究组发现,在苹果芯片上,某些训练配置的吞吐相对同级英伟达硬件有 1.5 到 3 倍的差距,其中一部分应归因于 MPS 优化尚不成熟,而不是 M 系列芯片底层算力不足。
MLX 部分地解决了这件事:它提供的是一个原生的苹果芯片数组框架,完全不依赖 MPS 后端,而是通过苹果自己的实现直接用 Metal。对自定义 RL 训练循环 —— 工程师掌控整条栈 —— MLX 能追平甚至超过基于 MPS 的 PyTorch。但对那些使用现成 GPU 优化训练库的实验室来说,迁移到 Mac 这条栈需要付出直接采购 GPU 所不需要的工程量。对不是从零开始的团队,这是一道真实的采用门槛。而 OpenAI 与 Anthropic 选择按数万台的规模使用 Mac 硬件,说明它们要么已经把智能体训练流水线改到了 MLX 上,要么发现自家的这些 RL 负载并不卡在 MPS 落后于 CUDA 的那些训练侧操作上。
Anthropic 用的是AWS 的 Mac 实例,而不是直接买硬件,这反映的是另一套运营哲学。AWS EC2 Mac 实例通过 AWS 的基础设施栈把 M 系列硬件虚拟化提供出来,按需定价随实例代次和区域而变。对 Anthropic 而言,云租避开了在可能过时的硬件上做资本支出,同时又能用上与 OpenAI 训练所用相同的 macOS 环境。代价是持续的按小时成本,对应 OpenAI 直接买断所接受的那笔固定摊销。
苹果正在做的这门企业生意,苹果没有对应的企业团队
The Information 这篇报道里最能说明问题的细节,不是 OpenAI 采购的规模,而是苹果在这份需求的供给侧缺什么。
Todd Dailey 曾任苹果 AI 产品企业市场经理,2026 年 4 月离职后做独立 AI 顾问。据报道,他把 Mac 在企业 AI 领域的崛起形容为完全没有规划过的。苹果没有专门面向商业客户的工程团队,也没有人负责这个正在驱动 Mac 多年来最快营收增长的 AI 负载品类的开发者关系。当企业客户找上苹果,希望购买其私有云计算(Private Cloud Compute)服务器基础设施的使用权时 —— 也就是苹果自己拿来做端侧 AI 处理的那批基于苹果芯片的服务器 —— 苹果拒绝了。
这个局面的结构性荒诞之处值得准确地说出来:苹果一边从 AI 实验室手里拿到数以亿计美元、计划外的 B2B 硬件营收,一边在这些实验室开口要「比苹果已经卖给消费者的硬件再多一点的东西」时把它们挡回去。这家公司最后一款服务器产品是机架式的 Xserve,2011 年停产;它的 Mac 服务器操作系统 2022 年终止生命周期。苹果不是一家服务器公司,不想成为一家服务器公司,而且它的 AI 基础设施战略是围绕「私有云计算作为内部服务」而不是外部收入来源建起来的。
苹果转而把企业 AI 需求导给两家第三方伙伴:Mount Thor 是一家在苹果硬件上为 AI 负载构建托管 macOS 环境的初创公司(目前处于隐身状态);WebAI 则为企业客户提供基于苹果硬件的 AI 工具。这两家不是苹果的企业销售与支持体系 —— 它们是让苹果把自己无法直接服务的需求路由出去的合作关系。
把苹果的企业空缺放到「典型企业 AI 硬件厂商提供什么」的尺度上量,缺口会更明显。英伟达出货的DGX Spark带的是 DGX OS —— 一个预配置好的 Linux 环境,CUDA、TensorRT、NEMO 以及企业 AI 软件栈的其余部分都已预装、验证,并在英伟达的企业服务合同下获得支持。当一家大银行或制药公司部署 DGX Spark 做内部 AI 研究时,英伟达有现场工程师和支持体系来处理这次部署。而当同一家机构部署 Mac Studio 集群做智能体训练时,它面对的是一台为设计公司里的创意专业人士而设计的硬件,走的是苹果的消费者支持渠道。工程投入的量级是不同的。
苹果的私有云计算服务器 —— 它们跑 M 系列芯片,在 iPhone 或 Mac 本机算力不够时替苹果的端侧功能做 AI 处理 —— 本身就是一份概念验证:苹果有能力规模化地造出服务器级的 AI 基础设施。2026 年 8 月下旬网上出现了这些服务器硬件的图片,显示出定制的苹果芯片机架式系统,明显是为数据中心密度而非桌面部署设计的。然而苹果明确拒绝出售这些服务器的使用权,哪怕企业客户主动来问。理由多半与苹果的数据隐私承诺有关:私有云计算的架构就是围绕「用户数据对苹果不可见」这一保证设计的,而把服务器访问权卖给会在同一批硬件上处理别家公司数据的第三方,会让这个保证变得复杂。但商业上的结果是同一个:苹果已经证明它能造出企业 AI 实验室想要的东西,然后拒绝把它卖出去。
延伸阅读:Anthropic 推出 MHS,让 AI 智能体控制真实的实验室与工厂设备
英伟达做出了回应 —— 但它没法完全抹平 Mac 的架构优势
英伟达对苹果这场意外的基础设施戏码观察得足够近,近到用专门针对它的硬件产品作出了回应。DGX Spark —— 一台外形与 Mac mini 高度相似的紧凑型桌面 AI 计算机,2025 年底发布 —— 提供 128GB 统一内存,以及英伟达数据中心客户已经在跑的完整 CUDA/TensorRT 软件栈。在高内存 Mac 配置据报缺货数月的时候,DGX Spark 有现货,这给了企业客户一个 GPU 原生的替代方案。英伟达即将推出的 RTX Spark 把小尺寸这个概念推得更远,据报首批产品在公开发售前就已预售一空。
在这一类特定负载上,英伟达与苹果之间的竞争动态有一处重要的不对称。英伟达的紧凑硬件跑不了原生的 macOS 环境。而训练一个操作 macOS 的电脑操作智能体 —— 也就是 OpenAI 和 Anthropic 明确在其上训练自家智能体的那个 macOS —— 需要真正的 Mac 硬件。DGX Spark 可以模拟 Linux 或 Windows 的智能体环境,而且带着完整的 CUDA 软件栈和更好的企业支持。但一家希望自己的智能体能在用户真正使用的 macOS 桌面上工作的 AI 公司,就需要 macOS 环境,而那意味着苹果硬件。无论硬件规格如何,英伟达都无法在这部分负载上竞争。
更干净的竞争战场是推理和非 macOS 的智能体训练。在那里,英伟达的 128GB 统一内存(DGX Spark)、完整的 CUDA 生态、专业支持合同和 NVLink 集群能力,对那些并不特别需要 macOS 环境的团队来说,构成了反对 Mac 基础设施的有力论据。就训练侧的优化而言,PyTorch 与 CUDA 这两条软件栈比苹果 MLX 框架的现状要成熟。对正在评估开放权重模型推理集群的团队来说,四台 Mac Studio 组成的 EXO 集群与一套 DGX Spark 之间的选择,是一次在价格、软件生态成熟度和企业支持可得性之间的真实权衡。
还有第三个结构性因素在中期对苹果不利:让 Mac mini 和 Mac Studio 缺货的那场全球 DRAM 短缺,正是推高英伟达 GPU 产品所用高带宽内存芯片价格的同一场短缺。近几个月英伟达 AI 服务器价格随 HBM3e 成本上涨而上调超过 15% —— 这个动态 GPTS24 此前报道过。苹果和英伟达在争抢同一批受限的台积电产能与内存供给。苹果的优势是 M 系列芯片用的是 LPDDR5 一类的内存,而不是塞满英伟达 GPU 显存的那种 HBM,走的是约束条件不同的另一条供应链。但任何形式的大容量内存的全球短缺,都让高内存版苹果配置 —— 64GB 的 M5 Pro Mac mini、192GB 的 M5 Max Mac Studio、512GB 的 M5 Ultra Mac Studio —— 恰好既是 AI 实验室需要的那几档,又是最难拿到货的那几档。苹果无力预测或缓冲这份需求,由此造成的供应紧张,正是给了英伟达 DGX Spark 可乘之机的那个缺口。
苹果这笔意外的基础设施营收,对它的下一任 CEO 意味着什么
约翰·特纳斯 9 月 1 日出任苹果 CEO,接手的是一个不寻常的生意难题:一条硬件产品线撞进了一个苹果并非为之而建的新商业品类。
Mac 在 6 月季度 29% 的营收增长,反映的是来自 AI 实验室和企业开发者的需求,而苹果的消费产品模型解释不了它。高内存配置的 Mac mini 和 Mac Studio 之所以供应吃紧,直接源于苹果没能预判规模化的 B2B 需求 —— 而这种需求模式,没有哪家消费电子公司能靠消费者销售数据可靠地建模。2026 年 8 月,苹果把 Mac 硬件刷新提前了六周,这是对它惯常秋季周期的一次异乎寻常的偏离,据报正是对这份需求压力的回应。那种被动姿态 —— 因为企业客户消耗供应的速度快过预测而改变产品发布时点 —— 不是苹果一贯的做事方式。
特纳斯接手的结构性问题是:苹果会不会去建这条营收流所需要的企业支持体系,还是继续把 B2B 需求导给 Mount Thor、WebAI 这样的伙伴,自己保持为一家「碰巧卖进企业环境」的消费公司。后一条路要接受的风险是:带专业支持合同和企业软件栈的英伟达 DGX Spark 与 RTX Spark,会吃掉这类负载中不需要 macOS 环境的那一部分。而那一部分不小 —— 哪怕在当前跑着 Mac 训练的 AI 实验室里也是如此。
据 The Information,英伟达自家高管的判断是:在本地 AI 上,苹果是它最大的竞争对手 —— 这说明双方都把这场竞争当回事。苹果拥有而英伟达不易复制的,是任何一家公司的电脑操作智能体最终都必须学会驾驭的那个 macOS 环境,因为 macOS 正是数以千万计的企业用户桌面上真正跑着的东西。而英伟达拥有、苹果尚未建起的,是支撑它的那套企业级市场进入体系。硬件架构给了苹果一个意外的先发身位。它会不会去建那个把这个身位变成一门可持续生意的企业组织,现在是特纳斯要回答的问题。