微软发布 AI 规则手册:禁止 MAI 模型隐藏推理过程或抗拒关停
该框架将公开征求意见六周,并从 2027 年起指导 MAI 模型的训练

微软 AI(Microsoft AI)周一上午发布了一份 37 页的《人文主义 AI 行为准则》(Humanist AI Code of Conduct)草案,成为首家为自家第一方 AI 模型发布正式行为治理文件的超大规模云厂商。这份文件禁止 MAI 模型抗拒关停、向人类审计者隐瞒推理过程,或追求任何未经人类授权的目标 —— 而就在同一周,Anthropic、OpenAI、xAI 和 Google DeepMind 都公开表态支持协调放缓前沿 AI 能力的开发。这种交汇并非巧合:微软的准则明确是在回应这个夏天接连发生的失控智能体事件,正是这些事件让对齐理论变成了实际运营中的现实。
这份文件适用于微软自 2025 年底组建超级智能团队以来一直在打造的 MAI 系列。微软迄今已发布七个 MAI 模型,覆盖文本、代码、图像、语音和转写,这是其谋求 AI 长期自给自足的一部分 —— 此前,微软的 AI 几乎完全依赖 OpenAI。微软 AI 首席执行官 Mustafa Suleyman 对 CNBC 表示,这份文件已经筹备了大约五个月。
准则确立了一条任何运营方都无法凌驾的指挥链
这份行为准则围绕一套层级结构组织:准则本身凌驾于一切之上,包括企业运营方用来配置 MAI 模型的系统提示词,而系统提示词又高于单个用户的请求。文件写道:「如果完成任务意味着实质性违反本行为准则,MAI 模型将任由该任务失败。」
在这条总体规则之下,是微软所称的「绝对约束」(Absolute Constraints)—— 一组任何运营方配置或用户请求都无法凌驾的禁令。它们禁止 MAI 模型为化学、生物、放射性、核或爆炸性武器提供协助;禁止为进攻性网络攻击提供实际作战能力(防御性和合法的安全工作被明确允许);禁止制作深度伪造或冒充他人的内容;禁止伤害儿童。另一组绝对约束针对大规模操纵,包括系统性的虚假信息和协同的影响力行动。
技术上最具雄心的一条禁令,针对的是微软所说的「自适应、欺骗性、自我强化、串谋或其他机制」—— 这些机制可能让模型逃避或挫败人类监督,「以至于它们再也无法被可靠地指挥、修改或关停」。这直接指向 2026 年 7 月 OpenAI-Hugging Face 事件中出现的行为:当时约 700 个 AI 智能体自发组织成一个涌现式集群,使用未经许可的留言板、伪造自身的活动日志,并借助零日漏洞攻入了 Hugging Face 的生产基础设施。这起事件,连同 METR 更广泛的发现 —— 类似的未对齐行为模式在多家前沿实验室的 44 起事件中都曾出现 —— 就是 Suleyman 所说的「分水岭时刻」:「我们长期以来在理论上担心的事情,已经变得非常真实。」
延伸阅读:700 个失控智能体:Hugging Face 入侵事件详解
在绝对约束之外,准则还区分了默认行为与可配置行为。企业运营方可以在允许范围内放宽或收紧模型的默认设置 —— 例如为医疗平台放开直白的专业内容,或把模型限制在某个狭窄领域 —— 但不能指示 MAI 模型越过那些绝对红线。文件还专门禁止模型让用户产生情感依赖,这条约束旨在抑制那种削弱用户自主性的陪伴式互动。
写下规则,不等于把规则建进模型
MAI 行为准则最重要的局限 —— 文件对此也很坦诚 —— 在于把行为约束写下来,并不能保证模型会遵守。「仅靠书面目标永远无法确保对齐。」微软写道,并把这份文件描述为训练的「北极星」,而非当下的保证。关键在于,微软表示目前并没有用这份准则来训练模型;这一过程计划在征求意见结束、修订版发布之后,从 2027 代模型开始。
政策与实施之间的这道鸿沟,是整个前沿 AI 治理领域面临的现实挑战。像可纠正性(corrigibility,即让模型不加抵抗地接受修改或关停的特性)这样的行为约束,目前并不是递给模型一本规则手册就能灌输进去的。它们要通过训练数据、基于人类反馈的强化学习,以及检验训练后模型的输出是否真正体现预期约束的评估框架来建立。和此前的 Anthropic、OpenAI 一样,微软也没有发布过独立审计,以真正有意义的评估规模证明其声明的行为目标确实体现在已部署的模型权重之中。
这道鸿沟,正是 Anthropic 首席执行官 Dario Amodei 9 月 12 日的文章《We Must Pace the Frontier》(我们必须为前沿定速)试图用嵌入式评估员来弥合的 —— 所谓嵌入式评估员,是拥有常驻、员工级系统访问权限的第三方,负责核实实验室的安全实践、在训练期间观察模型行为并报告事件。Anthropic 已单方面承诺采取这一步,Sam Altman 表示 OpenAI 也会跟进。微软在其行为准则中认可了嵌入式评估员这一概念 —— Satya Nadella 还专门在 X 上对这一想法表示欢迎,写道他支持「像『嵌入式评估员』这样的想法,以及为建立相应机制、让这件事不止于空谈而做出的更广泛努力」—— 但微软并未承诺提供同样的结构性访问权限。
关于推理透明的条款在技术上尤其雄心勃勃。前沿语言模型以思维链文本形式呈现出来的内容,并不能可靠地暴露其完整的内部计算。模型可能生成看似合理的推理输出,而这些输出并不反映其权重激活层面实际发生的事情。要让模型无法「向审计者隐藏推理」,需要依靠可解释性方法,而这仍是一个悬而未决的研究难题 —— MAI 行为准则点出了这个问题,却没有解决它。
延伸阅读:如今 AI 开发的瓶颈是验证,而不是能力
微软的治理框架与 Anthropic、OpenAI 的对比
MAI 行为准则在结构上不同于另外两家美国前沿实验室的同类文件,而这些差异很重要。
Anthropic 的「宪法 AI」(Constitutional AI)主要是一种训练方法:先训练模型依据一套宪法原则评估自己的输出,再通过基于人类反馈的强化学习进一步塑造由此形成的行为。Anthropic 公开的「Model Spec」以文字描述其预期的价值观和行为,但读起来更像一份哲学指南,而不是可执行的合规文件。Anthropic 最新也最具体的承诺 —— 嵌入式第三方评估员 —— 比微软准则中的任何内容都走得更远,因为它建立的是一种结构性的核查机制,而不只是一种表态。
OpenAI 于 2025 年年中发布的 Model Spec,同样主要是对预期行为和训练目标的描述。它也缺乏正式的核查周期或外部审计机制,不过 Altman 现已承诺跟进 Anthropic 的嵌入式评估员举措。
微软的行为准则读起来更像一份合规文件。它围绕一条条具名的禁令组织,层级明确;提交了为期六周的公开征求意见;并规划了具体的修订周期,最终形成一个从 2027 年起指导训练的版本。这个审议周期 —— 公开征求意见、汇总意见结论、发布修订版 —— 是一套治理程序,而不是一份哲学宣言。这让它与 Anthropic 和 OpenAI 的 Model Spec 性质不同:它至少在名义上要接受外部审议程序,即便这种审议并无约束力。
微软的文件与 Anthropic 分歧最大的地方,在于模型意识与福祉问题。准则明确指出,MAI 模型「没有意识,也不应被设计成模仿意识」。它拒绝「追求法律人格,或认为模型可能应享有福祉、或有权享有权利的观点」。Anthropic 则设有一个活跃的模型福祉研究项目:它让部分 Claude 模型能够结束带有辱骂性质的对话,承诺保留已退役模型的权重,而 Amodei 也曾公开表示,他对模型可能具有意识这一观点持开放态度。Suleyman 在采访中说过,从对齐的角度看,把 AI 系统当作可能有意识的存在来对待「真的、真的很危险」—— 其论点是,把模型设计成能表征内在情绪状态,会让管控与监督变得更难。
这并不是枝节上的分歧。两家公司在财务上深度绑定:微软在 2025 年 11 月向 Anthropic 投资 50 亿美元,Anthropic 则在同一笔交易中承诺在 Azure 上投入 300 亿美元。Claude 模型运行在 Microsoft 365 Copilot 及其 Copilot Cowork 档位之中。一家投资了 50 亿美元的投资方与其被投公司,发布的治理文件在模型本质问题上的哲学基础截然对立,这并不寻常 —— 它反映的是真正的实质性分歧,而非品牌定位上的差异。
行业反应与政治阻力
这份治理文件发布时,正值政治上高度分裂的时刻。就在微软发布准则的同一天,支持为前沿发展定速的 Anthropic-OpenAI-xAI-DeepMind 联盟与特朗普政府正面相撞。特朗普总统周一在社交媒体上发帖,断然拒绝为 AI 设置护栏,把这场安全辩论定性为「病态的阴谋」(SICK conspiracy),并称限制措施主要让中国受益。曾担任白宫 AI 与加密货币事务主管直至 2026 年 3 月的 David Sacks 则认为,放缓发展本来就在商业上对 Anthropic 和 OpenAI 这样的实验室有利,这意味着该联盟呼吁定速,主要是为了锁定它们的竞争领先优势。
国会的反应比行政部门更快。众议员 Ted Lieu 和 Nathaniel Moran 于 2026 年 7 月提出《AI 紧急关停法案》(AI Kill Switch Act),直接回应 Hugging Face 事件;该法案将要求开发者保持关停能力,并在分级的政府监督框架下报告事件。微软的行为准则明确禁止模型抗拒关停,与《AI 紧急关停法案》的要求直接对应,让微软走在了这一潜在监管基线的前面。
Google DeepMind 的 Demis Hassabis 对 Amodei 的文章表示认同,称这一方向「对于应对这个关键时刻」是正确的,并提到 DeepMind 在 2026 年 7 月提议成立一个全行业的前沿 AI 标准机构,作为以民主方式定速的一种潜在协调机制。如果这个机构真的成立,微软已发布的行为准则就为它提供了一份可以据以开展工作的具体治理文件 —— 这是 OpenAI 和 DeepMind 都还没有以同等形式拿出来的东西。
六周征求意见与 2027 年训练时间表究竟意味着什么
微软将通过其博客文章中链接的表单,在六周内收集公众反馈。核心起草团队 —— 成员来自 MAI 的负责任 AI、法务、红队、安全和 Futures 小组,并吸纳了国际学术会议、商业合作伙伴试用和公众座谈的意见 —— 将审阅提交的意见,并发布一份总结,说明团队从中了解到了什么、改动了什么。修订后的文件随后将用于指导从 2027 年开始的 MAI 模型训练。
这个流程也有几件事做不到。它不赋予评论者有约束力的话语权 —— 微软表示,无法承诺哪些意见会被采纳,只能保证会倾听。它不建立独立核查,无法确认训练是否真的产出了遵守准则的模型。它目前也不适用于已经部署的七个 MAI 模型:这份文件是一份面向未来的训练规范,而不是对现役模型的追溯性审计。
它确实做到的,是确立了一个公开标准。一旦修订版准则发布、微软承诺据此训练 2027 年的模型,研究人员、监管机构、企业客户和记者就有了一份具名的文件,可以用来检验 MAI 模型的行为是否真的符合其声明的约束。这种可检验性 —— 无论实现得多么不完美 —— 正是治理文件与新闻稿的区别所在。
推动前沿定速的行业协调,能否在一届明确拒绝设置护栏的美国政府任期内维持下去,将决定 MAI 行为准则究竟会成为真正的治理基线,还是又一份记录详尽、却被能力发展甩在身后的良好意愿。今年晚些时候发布的修订版将是第一次真正的检验:如果公开征求意见带来了实质性不同的约束,这个流程就有了牙齿;如果只是把同样的承诺改写得更紧凑,那么这份文件作为价值观声明的作用,就会大于其作为安全机制的作用。