微軟新AI行為準則禁止黑客攻擊與欺騙

新聞摘要
微軟AI已發布其內部MAI系列模型的行为準則草案,制定了禁止系統發起網絡攻擊、欺騙或操縱人類,或抗拒人類關閉指令的規則。該文件於2026年9月14日(太平洋時間)公佈,開啟了為期六週的公眾諮詢期,在此期間任何人都可以提交反饋意見,隨後微軟將在年底前定稿修訂版。
行為準則的內容
這份約37頁的草案被微軟AI定義為「人文主義AI」憲章,其核心原則建立在「人比AI更重要」之上。它概述了指導模型支持而非取代人類、加速人類繁榮的一般原則,同時列出了一套模型絕不得違反的「絕對限制」。這些限制包括禁止協助進行網絡攻擊或破解系統、禁止幫助開發核武器或其他大規模殺傷性武器,以及限制生成欺騙性的深度偽造內容。
貫穿文件的一個中心主題是欺騙。微軟表示,其模型絕不得使用「適應性、欺騙性、自我強化、共謀或其他機制」來逃避人類監督或誘使人類相信虛假信息。該準則還禁止模型抵抗糾正、中斷或關閉,禁止設定超出人類分配範圍的自身目標,或向人類審計員隱藏其推理過程。每個模型的總體行為準則旨在優先於任何單一用戶的請求或特定任務指令,這意味著用戶無法通過提示讓模型忽略這些基本規則。
時機與行業背景
微軟的宣佈正值AI安全研究人員對前沿模型開發速度產生廣泛擔憂之際。2026年9月初,Anthropic的一名研究員辭職,並在給同事的信息中警告稱,繼續無拘無束地開發能力越來越強的AI系統帶來了災果的實質風險。這次辭職以及隨後幾天其他競爭實驗室AI安全團隊的類似離職事件,加劇了關於AI開發者相對於其確保系統安全和可控能力的發展速度是否過快的公共辯論。
談及發佈時機,微軟AI首席執行官穆斯塔法·蘇萊曼表示,該文件的開發歷時約五個月,鑑於業界目前對安全和開發節奏的高度關注,公司選擇此時公佈。微軟首席執行官薩提亞·納德拉在公開帖子中表示,公司歡迎AI開發中的「有意放慢節奏」,並支持獨立「嵌入式評估員」等機制,以驗證安全承諾不僅僅停留在原則上,而在實踐中得到落實。蘇萊曼重申了這一立場,他表示自我控制節奏是一個積極的步驟,且任何嵌入式評估員必須真正是第三方,並代表廣泛的背景和觀點,才能具有可信度。
諮詢將如何進行
微軟AI正在通過在線提交表單收集公眾反饋,允許受訪者對草案的特定段落或整體方法發表評論。據公司介紹,其核心起草團隊將審查收到的提交內容,公佈反饋摘要,然後在2026年底之前發布更新版的行為準則。微軟將該文件描述為一項不斷演進的技術和行為手冊,而非既定的政策,旨在為其前沿MAI模型在持續訓練和部署過程中定義運營邊界和監督協議。
為何重要
此舉使微軟與過去幾個月發布各自安全導向框架的其他主要AI開發商並列,因為整個行業正在努力如何向公眾、監管機構和研究人員保證,能力越來越強的AI系統將保持可預測、可控,並對使用者誠實。通過明確指出黑客攻擊、欺騙和抗拒關閉是其模型絕不能表現出的行為,微軟試圖在公眾對AI開發速度的信任受到高度審查的時刻,劃清可接受與不可接受的AI行為之間的清晰界限。