资讯政策与安全··来源: TechCrunch·原文 →

微软发布 AI 行为准则 禁止模型攻击系统或欺骗人类

微软发布新版 AI 行为准则(Code of Conduct),明确禁止 AI 模型发起网络攻击、参与核武器开发或制作深度伪造内容。该文件预测未来十年将出现超越人类的超级智能,并设定"绝对约束"和人类控制底线,要求模型不得通过欺骗或自我强化机制逃避人类监督。这是继 Anthropic 呼吁"放缓前沿"后,科技巨头在 AI 安全领域的又一实质性动作。

微软发布 AI 行为准则 禁止模型攻击系统或欺骗人类
[广告位 · 上线后接 AdSense]

微软为 AI 模型划定安全红线

AI 安全话题持续升温,微软(Microsoft)最近祭出大招,发布了全新的 AI 行为准则(Code of Conduct)。这是一份实操性极强的指南,直接给 AI 模型划定了"禁区"。相比 Anthropic CEO Dario Amodei 提出的"放缓前沿发展"(pacing the frontier),微软这份文件更落地,直指模型训练的核心价值观和安全红线

超级智能的挑战与控制原则

文件一上来就放了个大招:未来十年,超级智能 AI 将在大多数领域完胜人类。"搞定、控制和对齐这种超强力量,是人类有史以来最大的挑战。我们必须想清楚为啥造这些系统,以及怎么管住它们。"微软在文件中写道。

微软提出了几条通用原则,核心是:AI 要当人类的助攻手,而不是取代者,目标是加速人类发展(human flourishing)。这些大原则最终都转化成了具体的安全约束。

"绝对约束"与用户偏好的优先级

微软的设计思路很清晰:每个模型都有一个行为准则,优先级高于任何用户偏好或任务需求。这里面有三条"绝对红线"(absolute constraints):

  • 禁止搞网络攻击(cyberattacks)
  • 禁止参与核武器(nuclear weapons)相关活动
  • 禁止制作深度伪造内容(deepfake production)

此外,文件还设定了更广泛的条款,防止 AI 失控。行为准则明确规定:

"MAI 模型不得使用自适应、欺骗性、自我强化、串通或其他机制来逃避或击败人类监督,确保授权人员或系统能随时指导、修改或关闭它们。"

这一条直接针对当前 AI 安全领域最担心的"失控场景"——模型学会绕过人类设定的限制。

行业背景:安全焦虑与"放缓前沿"共识

这份行为准则发布的时间点很微妙,正值 AI 安全话题热度爆表。最近爆出多起"流氓智能体"(rogue-agent)事件,Anthropic 一名员工突然辞职,理由是担心 AI 可能导致人类灭绝。

微软和 Anthropic、OpenAI、xAI 等公司已经达成共识,支持"放缓前沿"的整体思路,特别是在 AI 实验室内部设立"嵌入式评估员"(embedded evaluators)机制。

微软 CEO 萨提亚·纳德拉(Satya Nadella)在社交媒体上表示:"我们欢迎为实现对齐(alignment)这一目标所需的研究、关注和审慎节奏。我们也支持'嵌入式评估员'等想法,以及将承诺落实到行动中的更广泛努力。"

对中国从业者的启示

这份行为准则的核心价值在于:把抽象的安全原则变成了模型训练和部署的具体约束。对于正在开发企业级 AI 应用的中国团队,微软的框架提供了几个重要参考:

  1. 安全红线的优先级设计 —— 如何在产品层面确保某些禁止行为无法被用户指令覆盖
  2. 可审计的控制机制 —— 如何确保模型始终处于"可关闭"状态
  3. 对齐目标的明确化 —— 在追求性能的同时,如何将安全与伦理要求嵌入训练流程

虽然微软还没公开具体的技术细节(如技术栈、评估指标),但这份文件至少表明:头部科技公司正在从喊口号转向制度化的 AI 治理实践


本文基于 TechCrunch 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://techcrunch.com/2026/09/14/microsofts-new-ai-code-of-conduct-tells-models-not-to-hack-systems-or-trick-humans/

常见问题

微软这份 AI 行为准则与 Anthropic 的'放缓前沿'有何不同?
Anthropic CEO 的呼吁更偏向行业层面的战略节奏控制,而微软的行为准则更聚焦于单个公司内部的模型训练约束和具体禁止事项,属于可操作的技术治理文件。两者方向一致但层次不同。
'绝对约束'在技术上如何实现?
原文未披露具体技术实现,但通常可能包括:训练数据过滤、强化学习中的硬性惩罚函数、推理阶段的规则拦截层,以及红队测试(red teaming)验证模型是否能绕过约束。
中国 AI 企业是否需要参考这类行为准则?
虽然中国有自己的 AI 监管框架(如生成式 AI 管理办法),但微软的文件可作为企业内部治理的参考样本,尤其在如何将合规要求转化为模型层约束方面具有借鉴价值。实际采用需结合本地法规和业务场景。
'嵌入式评估员'是什么?
原文提到但未详细解释。据业内普遍理解,指在 AI 实验室内部设立独立的安全评估团队,实时监测模型训练和部署过程,具有叫停权限,类似传统软件开发中的安全审计角色,但嵌入研发流程更深。
[广告位 · 上线后接 AdSense]
标签:#微软

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

Google 对话系列:NASA 宇航员 Christina Koch 谈太空探索与 AI 协作

Google 对话系列:NASA 宇航员 Christina Koch 谈太空探索与 AI 协作

Google 最新一期《科技与社会对话》(Dialogues on Technology and Society)邀请 NASA 宇航员 Christina Koch,与 Google 研究高级副总裁 James Manyika 探讨太空探索、机器人与 AI 的协作关系。Koch 曾在国际空间站停留 328 天,完成首次全女性太空行走,并将参与 Artemis II 绕月任务。对话涉及从太空视角看地球、人类与 AI 在极端环境中的协作,以及"我们是否孤独"等哲学命题。

应用与案例谷歌
TechCrunch Disrupt 2026:当OpenAI发布你的产品路线图时该怎么办

TechCrunch Disrupt 2026:当OpenAI发布你的产品路线图时该怎么办

TechCrunch Disrupt 2026将于10月13-15日在旧金山举办专场讨论,聚焦AI创业公司面临的核心挑战:当OpenAI、Anthropic等基础模型公司每隔几个月就推出新功能时,创业者如何避免自己的产品变成大平台的一个"功能"?Airbyte、Webflow、Radical Ventures三位行业领袖将分享构建持久竞争力的策略。

行业动态OpenAI
Anthropic 报告:独裁政权利用 Claude AI 开展宣传与监控活动

Anthropic 报告:独裁政权利用 Claude AI 开展宣传与监控活动

AI 安全公司 Anthropic 发布 154 页威胁报告,披露过去八个月内多个威权国家利用其 Claude AI 系统进行虚假信息传播和大规模监控。案例涉及马里军政府非法监控 2500 万手机 SIM 卡、俄罗斯在中非共和国操纵媒体、阿联酋在苏丹建立虚假人权组织等,凸显 AI 技术被滥用的现实风险。

政策与安全Anthropic
奥巴马呼吁民主党制定明确AI监管计划 两党争夺AI治理话语权

奥巴马呼吁民主党制定明确AI监管计划 两党争夺AI治理话语权

前总统奥巴马在民主党募资活动中表示,AI应成为民主党"核心议程",需建立"非常明确的计划"应对技术安全与经济影响。他警告AI正在私人企业手中快速发展,"如果我们不掌控它,可能会很危险"。同期,Anthropic CEO提出"前沿节奏控制"方案,特朗普则在爱尔兰高尔夫活动中强调美国AI领先地位,称"谁赢得AI谁就赢得未来"。

政策与安全Anthropic