首页 / 资讯 / 微软新AI行为准则禁止黑客攻击和欺骗
AI安全

微软新AI行为准则禁止黑客攻击和欺骗

2026年9月15日4 分钟阅读
微软新AI行为准则禁止黑客攻击和欺骗

新闻摘要

微软AI已发布其内部MAI系列模型的《行为准则》草案,制定了禁止系统发动网络攻击、欺骗或操纵人类、或抗拒人类关机指令的规则。该文件于2026年9月14日(太平洋时间)公布,开启了为期六周的公众咨询期,在此期间任何人都可以提交反馈,随后微软将在今年晚些时候定稿修订版。

《行为准则》内容详解

这份约37页的草案被微软AI定位为“人文主义AI”宪章,围绕“人比AI更重要”这一核心原则构建。它阐述了指导模型支持而非取代人类、加速人类繁荣的一般原则,以及模型绝不可违反的一组“绝对约束”。这些约束包括禁止协助进行网络攻击或入侵系统、禁止帮助开发核武器或其他大规模杀伤性武器,以及限制生成欺骗性的深度伪造内容。

贯穿文件的一个中心主题是欺骗。微软表示,其模型不得使用“适应性、欺骗性、自我强化、共谋或其他机制”来规避人类监督或欺骗人们相信虚假事物。该准则还禁止模型抗拒纠正、中断或关机,禁止设定超出人类分配范围的目标,或向人类审计员隐瞒其推理过程。每个模型的总体行为准则旨在优先于任何单个用户的请求或特定任务指令,这意味着用户无法通过提示让模型忽略这些基本规则。

时机与行业背景

微软的宣布正值AI安全研究人员对前沿模型开发速度产生广泛公众担忧之际。2026年9月初,Anthropic的一名研究人员辞职,并在给同事的信息中警告称,继续不受限制地开发能力越来越强的AI系统存在导致灾难性后果的重大风险。此次辞职以及随后几天其他竞争对手实验室AI安全团队的类似离职事件,加剧了公众关于AI开发商是否在保障安全可控系统的能力方面进展过快的辩论。

谈及发布的时机,微软AI首席执行官穆斯塔法·苏莱曼表示,该文件的开发工作已持续约五个月,鉴于业界目前对安全和节奏的高度关注,公司选择此时发布。微软首席执行官萨蒂亚·纳德拉在公开帖子中写道,公司欢迎AI开发的“审慎节奏”,并支持诸如独立的“嵌入式评估员”等机制,以验证安全措施在实践中而非仅在原则上得到落实。苏莱曼重申了这一立场,表示自我节制是积极的一步,且任何嵌入式评估员必须是真正的第三方,并代表广泛背景和观点,才能具有可信度。

咨询如何进行

微软AI正在通过在线提交表单收集公众反馈,允许受访者对草案的具体段落或整体方法发表评论。据该公司称,其核心起草团队将审查收到的提交内容,发布反馈摘要,然后在2026年底前发布更新版的《行为准则》。微软将该文件描述为不仅仅是一项既定政策,而是一本不断演进的技术和行为手册,旨在为其前沿MAI模型在继续训练和部署过程中定义操作边界和监督协议。

为何重要

此举使微软与过去几个月发布各自安全导向框架的其他主要AI开发商并列,整个行业正努力如何向公众、监管机构和研究人员保证,能力越来越强的AI系统将保持可预测、可控,并对使用者诚实。通过明确列出黑客攻击、欺骗和抗拒关机作为其模型绝不应表现出的行为,微软试图在公众对AI开发速度的信任受到高度审视的时刻,划清可接受与不可接受的AI行为之间的清晰界限。

AI安全微软AI