月之暗面就 Kimi K3 向 Azure、AWS 和谷歌云索要收入分成
这家中国 AI 实验室的云分发攻势,暴露出美国以芯片为核心的出口管制的一处缺口
总部位于北京的月之暗面正在与微软、亚马逊和 Alphabet 旗下谷歌谈判收入分成协议,让这三家美国云巨头得以通过各自的企业平台托管并商业分发其 Kimi K3 模型 —— 路透社 8 月 26 日报道,援引三位熟悉谈判的人士。若谈成,这将是中国 AI 实验室首次与美国云端超大规模厂商达成重大收入分成交易 —— 这个里程碑的影响,远远超出一家公司的分发策略。
据路透社,该公司寻求从跑在微软 Azure、亚马逊云科技和谷歌云上的 K3 相关服务所产生的收入中,最多分走 30% —— 这一条件与月之暗面向该开放权重模型其他大型商业用户提出的条件一致。谈判仍处早期阶段,能否达成协议并不确定。微软、谷歌和 AWS 均拒绝置评。月之暗面未回应置评请求。
不过,这些谈判所揭示的,比它们目前的进展更重要。Kimi K3 是开放权重模型 —— 其参数可公开下载和修改 —— 这意味着没有任何芯片出口管制能阻止它跑在美国基础设施上。通过谈判让 Azure、AWS 和谷歌把 K3 作为托管式云 API 提供,月之暗面等于是把一个中国出身的前沿 AI 模型,经由市场上最受信任、最合规、集成度最高的分发渠道,直接送到美国企业客户手中。那些成功限制先进英伟达半导体流入中国数据中心的出口管制,碰不到一个早已公开躺在 Hugging Face 上的模型。
延伸阅读:微软 Azure 的 AI 收入靠三家巨头撑着:OpenAI、TikTok、Meta
一套改写商业模式的开放权重授权结构
要理解月之暗面提议的是什么,「开放权重」与「开放访问」的区别很关键。Kimi K3 的参数于 2026 年 7 月 27 日以修改版 MIT 许可证发布,技术上允许任何人下载和修改。但在私有基础设施上运行一个 2.8 万亿参数的模型,并不是多数机构做得到的事。该模型即便在压缩格式下也需要庞大的 GPU 显存 —— 这个算力水平远超多数企业数据中心的能力范围,而且 llama.cpp 或 Ollama 这类常见的本地推理工具尚不支持它。结果是,对绝大多数商业用户而言,「开放权重」是一个法律描述,而不是可以自行部署的实际保证。
月之暗面围绕这个现实设计了自己的授权方式。据路透社,任何从 K3 相关服务中获得年收入超过 2000 万美元的商业运营方,都必须与月之暗面签订商业协议 —— 其中可包含最高 30% 的收入分成。据报道阿里巴巴也在为自家开放权重模型采用同样的授权思路,说明这套安排正在成为中国头部 AI 实验室通行的变现模板:公开发布权重以最大化开发者采用,再从真正产生收入的商业层捕获价值。
已经把 Kimi K3 和其他中国模型作为托管云服务提供的 DigitalOcean,把背后的逻辑描述为一套成熟的开源免费增值模式 —— 基础访问免费,重度商业部署变现。月之暗面与超大规模厂商的这轮谈判,与既有的小型云协议在性质上的不同之处在于规模:Azure、AWS 和谷歌云合起来,正是企业 AI 买家集成第三方模型的主要渠道,途径是 Azure AI Foundry、AWS Bedrock 这类市场。
中国 IT 服务公司中软国际于 2026 年 7 月宣布与月之暗面达成收入分成协议,但未披露具体分成比例。这次与美国云厂商的谈判若成功,将是月之暗面首次把这套结构用在非中国的企业基础设施上。
月之暗面急于建立美国云分发,还有一重原因:该公司正在筹备香港首次公开发行,有消息人士告诉路透社,这家创业公司已于 2026 年 5 月募得逾 20 亿美元,并在 IPO 前的融资中瞄准显著更高的估值。与 Azure、AWS 或谷歌云的收入分成安排,能提供可审计的商业证据,证明国际市场对 K3 存在需求 —— 而这正是机构投资者在给一家 AI 实验室的 IPO 定价时会看重的那种收入多元化和分发可信度。公司创始人兼控股股东杨植麟曾在卡内基梅隆大学攻读博士,2023 年创办月之暗面。阿里巴巴、腾讯、IDG 资本,以及与中国全国社会保障基金相关的实体,都持有该公司股份。
Kimi K3 的架构,以及它为什么比前代更需要云
Kimi K3 的规模,让它对托管式云分发的需求在结构上不同于早先的中国开放权重发布。该模型总参数 2.8 万亿,是目前按参数量计公开可得的最大 AI 模型,建立在月之暗面内部研发的架构创新之上,其中包括一种叫 Kimi Delta Attention 的混合线性注意力机制。
Kimi Delta Attention(KDA)以 3:1 的比例交错排布全注意力层和线性注意力层。标准 Transformer 注意力随序列长度的平方增长,这让把上下文窗口推向一百万 token 对多数架构来说算力上不可承受。KDA 绕开这一点的办法,是让大多数层使用更便宜的线性注意力计算,只在选定位置保留全注意力 —— 据月之暗面的技术文档,这使得在极长上下文下解码更快,并大幅降低了键值缓存的显存需求。
第二项创新是 Attention Residuals,它允许任何一层从更早的层中有选择地取回表示,而不是让输出沿着整个堆栈均匀累积。月之暗面称,这种跨层取回以不大的额外算力代价提升了训练效率。
第三项是管理该模型专家混合设计的 Stable LatentMoE 路由框架。模型的 896 个独立专家子网络中,任一输入 token 只激活 16 个。2.8 万亿的总参数量描述的是模型在显存中的完整知识容量;而每 token 的实际激活算力更接近 1040 亿参数,这让推理的经济性远比那个头条数字所暗示的更有利。Stable LatentMoE 采用基于分位数的负载均衡,而不是脆弱的超参数调优,月之暗面称这消除了导致其他大型 MoE 模型在规模化时表现不稳的那些路由不稳定性。
这套架构让 K3 能以商业上有意义的延迟运行一百万 token 的上下文窗口,并维持始终开启的扩展推理 —— 它的「思考」模式无法关闭 —— 同时定价为每百万输入 token 3 美元、每百万输出 token 15 美元。始终开启的推理意味着实际的输出 token 成本在结构上高于基础定价所显示的水平,因为每一次回答都包含最终答案出现之前、内部推理轨迹所消耗的 token 预算。
独立评测机构 Artificial Analysis 的第三方测试,把 K3 定位为在复杂多步骤推理任务上可比 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.8,并在其智能指数上排名第四。Arena.ai据路透社报道,在衡量网页界面构建能力的评测中把 K3 排在第一。月之暗面自报的数字 —— FrontierSWE 81.2、Terminal-Bench 2.0 88.3 —— 属公司自报,尚未被完整独立复现。Artificial Analysis 另在其测试中发现 51% 的幻觉率,而这个数字月之暗面没有放进自己公布的评测图表里。
一个 K3 企业 API 的竞争卡位,会不同于 Meta 的 Llama 4 系列和阿里巴巴的 Qwen3.8-Max —— 这是能力档位相当的两个最相关的开放权重替代品。Llama 4 已在 AWS Bedrock、Azure AI Foundry 和谷歌云上可用,不带任何地缘政治麻烦,并以 Meta 自家的商业许可证提供。阿里巴巴 2.4 万亿参数的 Qwen3.8-Max 正在走向与 K3 相同的收入分成授权结构,也给受监管行业带来类似的中国出身顾虑。K3 提供而这两个替代品目前在开放权重档位上都做不到的,是这样一个组合:以商业上可行的延迟支撑一百万 token 上下文窗口(KDA 架构的产物),加上相对 OpenAI 或 Anthropic 同等闭源模型 API 有折扣的定价。对于那些要构建超长文档处理或复杂多轮智能体工作流应用的 AI 开发者,这两项加在一起,相对美国出身的开放权重替代品构成一道有意义的能力差距。
Token 审计难题,以及数据访问为什么是症结
在路透社指出的三个悬而未决的问题中 —— 收入分成、数据访问、token 用量审计 —— 后两个在结构上是绑定的,也可能是政治上最敏感的。
Token 审计对按用量计费而言是运营上的必需。在标准的 AI 云计费模式下,客户按处理的 token 付费:提示词的每一个字符、生成回答的每一个字符都被计量。月之暗面要从 Azure、AWS 或谷歌云收取自己的收入分成,就需要在 K3 服务协议下被处理的 token 的准确计数 —— 这意味着要从云平台接收关于其企业客户如何使用该模型的详细用量遥测数据。
这些数据造出一条从美国企业环境通往一家中国 AI 公司计费系统的信息通道。它与「用户查询内容是否经过月之暗面的服务器」是两回事(在托管云托管方式下,很可能不会经过),但它代表另一种数据暴露:运营层面的使用模式、消耗量、客户类别,以及使用强度信号 —— 一个老练的行为方可以用它们去理解全美经济中企业 AI 采用的走向。这个问题在谈判中悬而未决,说明云公司对其敏感性是有意识的。
法律背景让这份顾虑更加尖锐。月之暗面受中国 2017 年制定的《国家情报法》第七条约束,该条在法律上要求所有中国组织支持、协助和配合国家情报工作。中国 2021 年的《数据安全法》(自 2026 年 1 月 1 日起修订生效)和 2017 年的《网络安全法》,则施加了额外的数据本地化要求和政府检查权,并明确延伸至 AI 系统。这些义务的适用,不因推理在哪里运行而改变,不因月之暗面在新加坡注册而改变,也不因任何云合作所适用的具体隐私政策而改变。如果一份收入分成协议要求月之暗面从 Azure、AWS 或谷歌云接收 token 级别的用量遥测,那么「月之暗面可能被强制对这些信息做什么」所依据的法律框架,是独立于它对云伙伴作出的任何合同承诺而存在的。为这些超大规模厂商提供咨询的贸易律师,需要掂量的是:任何对月之暗面的数据访问让步,无论范围多有限,是否造出了一条落入上述法律义务射程之内的通道。
一家正处于美国现行审查之下的公司
这些云谈判所处的背景,是一批尚未了结的政府指控,它们会让任何交易的达成之路更加复杂。
2026 年 7 月,白宫官员公开指控月之暗面通过蒸馏 Anthropic 的 Fable 模型来协助开发 Kimi K3 —— 并指控其通过在泰国获取英伟达 GB300 服务器(属限制向中国公司销售的 Blackwell 世代芯片)来采购这些设备。财政部长 Scott Bessent 随后警告称,对实施大规模蒸馏攻击的中国公司,制裁和列入实体清单都在选项之内。工业与安全局启动了正式调查。截至 2026 年 8 月 27 日,尚无执法行动。
蒸馏指控在独立 AI 研究者中招来了大量质疑。Anthropic 的 Fable 5 在经历 6 月的出口管制暂停之后,直到 2026 年 7 月 1 日才恢复完全公开可用,这给月之暗面留下的窗口只有 15 天,而 K3 于 7 月 16 日发布。熟悉 2.8 万亿参数模型所需训练周期的研究者认为,在这个间隔内、且底层架构尚未大体完成的情况下,靠蒸馏从零造出这样一个模型,技术上并不可信。Snorkel AI 的 Braden Hancock 在 7 月评论这个时间线时主张,Fable 可用与 K3 发布之间的间隔,远远不足以让 Fable 成为主要训练来源。独立 AI 研究者 Nathan Lambert 的结论是,即便可能发生过某些蒸馏,那显然也不是故事的全部。
有独立记录、且作为一项在法律上更站得住的独立指控存在的,是更早的一桩事:2026 年 2 月,Anthropic 发布了一份调查,发现月之暗面通过约 24000 个欺诈创建的账户与 Claude 产生了超过 340 万次交互,目标指向智能体推理、工具使用、编程和计算机视觉。月之暗面否认了这些指控。对那场行动最直接适用的法律框架是《计算机欺诈与滥用法》,而不是版权法 —— 这个区分很重要,因为在现行美国法下,单是模型蒸馏本身并不明确构成版权侵权,法律学者和独立分析人士都明确指出过这一点。
月之暗面通过其企业业务负责人黄真鑫驳回了 2026 年 7 月的指控,他对中国的《每日经济新闻》表示,K3 的性能提升来自对底层架构的原创改动。月之暗面的自有架构创新 —— Kimi Delta Attention 和 Attention Residuals —— 在其 2025 年 10 月发布的 Kimi Linear 模型中就已存在,早于 Fable 5 的任何可用时间。这条时间线给了 K3 的新设计要素一个独立的来源,与「蒸馏为主要来源」的假说不相容。
中国商务部回应美方威胁时,把这一立场斥为「AI 霸权主义」,并警告将采取反制措施。北京方面另于 2026 年 7 月与阿里巴巴、字节跳动和 Z.ai 举行会谈,讨论可能限制中国最先进 AI 模型的海外访问 —— 这是一种镜像式的回应,若付诸实施,将从另一个方向约束中国 AI 的全球分发。
云公司要冒什么险,又能得到什么
对 Azure、AWS 和谷歌云来说,这笔账里有几股相互拉扯的压力。在收入这一侧,K3 是一个可信的前沿档模型,Artificial Analysis 独立评定它在高难度任务上可比领先的美国模型,而定价低于同等的闭源模型。把一个 K3 这种能力的模型加进企业 API 市场,会拓宽那些已经在通过 DigitalOcean 等小型云服务商评估中国开放权重替代品的开发者的选择面。
Azure 在与中国 AI 公司建立此类商业关系上有先例:TikTok 的中国母公司字节跳动是 Foundry 上 OpenAI 之外最大的买家,截至 2026 年年中,其每年在微软 AI 与云上的支出有望超过 10 亿美元,为自家服务通过 Azure 购买 OpenAI 模型的使用权。K3 协议在结构上不同 —— 月之暗面会是收取收入分成的模型提供方,而不是购买算力的客户 —— 但「中国 AI 公司依赖美国云基础设施」这个更大的模式早已确立。
然而监管风险是眼前的、具体的。工业与安全局对月之暗面的调查仍未了结。如果它在任何交易达成之前导致实体清单列名,那么通过美国云平台托管 K3 就可能构成违反出口管制法规 —— 这是云公司必须明确纳入模型的一项后果。2019 年的华为先例说明了实体清单列名在实践中的作用:它切断了华为对美国硬件、软件和云服务的获取,并给继续提供服务而未获明确授权的美国公司制造了下游责任。类似情形下对月之暗面的列名,会让任何已签署的收入分成协议立即陷入法律险境,并可能需要解除。
DeepSeek 在美国云平台上的存在轨迹提供了一个相关的近期参照点。DeepSeek 的模型目前可通过若干美国云服务商和 API 聚合平台访问,官方市场集成程度不一,尽管该公司面对着类似的国家安全审查。截至 2026 年 8 月,尚无正式限制被施加于在美国基础设施上托管 DeepSeek 开放权重模型 —— 这个法律空档反映的是现行出口管制法规中缺少模型层框架。月之暗面正试图在同一个监管窗口内确立自己的云分发协议,但额外背着一项被点名的政府调查和被点名的财政部威胁,而 DeepSeek 未曾在同等官方明确程度上遭遇过这些。
当前针对芯片的出口管制框架并未明确限制模型托管,但贸易律师和政策分析人士普遍预期的一项 2026 年秋季临时最终规则,会把管制延伸到模型访问和远程推理。要在这条监管轨迹之下把握交易时点,需要精确的法律操作。
月之暗面的策略所暴露的出口管制缺口
K3 云谈判更深层的意义是结构性的。自 2022 年以来,美国对中国 AI 发展的政策一直以限制先进半导体获取为核心 —— 英伟达 A100、H100,现在是 GB300 Blackwell 系列。其逻辑是算力瓶颈会拖慢中国实验室训练和运行前沿模型的能力。K3 这件事,揭示了这套策略在应用于模型层时的限度。
K3 的权重已经公开。任何芯片限制都收不回它们。任何托管 K3 的美国云服务商,都是在自己拥有的硬件上、自己控制的数据中心里、按自己的安全框架跑推理 —— 不涉及任何中国硬件。模型的出身,对服务它的基础设施而言在运营上变得无关。一旦模型权重被公开分发,围绕芯片流动设计的出口管制就无法阻止前沿品质的中国 AI 抵达美国企业客户。
监管分析人士和贸易律师已经指认出的正是这个缺口,并指出即将到来的美国政策修订预计会瞄准模型访问和远程推理,而不是芯片 —— 这将是该框架第一次触及软件层。北京方面关于限制中国模型出口的讨论,代表着一种镜像式的认知:开放权重发布如今是一个双方政府都需要管理的战略变量。
对于处在这场对话中间的三家超大规模厂商而言,在那套监管框架定稿之前谈成 K3 收入分成交易,会让这项安排拥有一段既成的商业历史,从而使未来的限制更难施加。而在那之后谈成,则需要明确的监管放行。悬而未决的问题 —— 三家中是否会有人成交,以及何时 —— 将决定这笔交易落在那道时间等式的哪一侧,也决定它为下一个跟着 K3 走同一扇门的中国前沿模型立下多大的先例。