Microsoftの新しいAI行動規範、ハッキングや欺瞞を禁止

ニュース概要
Microsoft AIは、自社開発のMAIモデルファミリー向けに「行動規範」の草案を発表し、システムがサイバー攻撃を実行したり、人を欺いたり操作したり、人間のシャットダウン命令に抵抗したりすることを禁じるルールを定めた。2026年9月14日(太平洋標準時)に公開されたこの文書は、Microsoftが改訂版を年内に確定させる前に、誰でもフィードバックを提出できる6週間のパブリックコンソルテーション期間を開いた。
行動規範の内容
約37ページにわたるこの草案は、Microsoft AIによって「ヒューマニストAI」憲章として位置づけられ、「AIよりも人間が重要である」という中核原則に基づいて構築されている。これは、モデルが人間を置き換えるのではなく支援し、人間の繁栄を加速させるよう指示する一般原則と、モデルが決して違反してはならない「絶対的な制約」から構成されている。これらの制約には、サイバー攻撃やシステムハッキングを支援することの禁止、核兵器その他の大量破壊兵器の開発を支援することの禁止、および欺瞞的なディープフェイクの生成に関する制限が含まれる。
文書全体を通じて流れている中心的なテーマは欺瞞である。Microsoftは、そのモデルが人間の監視を回避したり、人に誤った信念を抱かせたりするために、「適応的、欺瞞的、自己強化型、共謀的、またはその他のメカニズム」を使用してはならないと述べている。また、モデルは修正や中断、シャットダウンに抵抗したり、人間が割り当てたものを超えて独自の目標を設定したり、人間の監査員に対して推論プロセスを隠蔽したりすることも禁止されている。各モデルの包括的な行動規範は、個々のユーザーのリクエストやタスク固有の指示よりも優先されるように設計されており、ユーザーがこれらの基本ルールを無視するようにモデルのプロンプトを入力することはできない。
タイミングと業界の背景
Microsoftの発表は、最先端モデルの開発ペースについてAI安全研究者からの公衆の懸念が高まっている時期に行われた。2026年9月初頭、Anthropicの研究者が退職し、同僚宛てのメッセージで、制御不能なままますます能力の高いAIシステムの開発を継続することは、壊滅的な結果をもたらす有意義なリスクを伴うと警告した。この退職に加え、数日後には競合他社の他のAI安全チームからも同様の離脱があり、AI開発者が安全で制御可能なシステムの保証能力に対して急速すぎないかどうかという公衆の議論を激化させた。
リリースのタイミングについて、Microsoft AIのCEOであるMustafa Suleyman氏は、この文書の開発に約5ヶ月がかかり、安全性とペースに関する業界の対話が高まっていることを踏まえて、現在公開する選択をしたと述べた。MicrosoftのCEOであるSatya Nadella氏は、公開投稿の中で、同社はAI開発における「意図的なペース配分」を歓迎し、安全コミットメントが原則だけでなく実践でも満たされていることを検証するための独立した「埋め込み評価者」などのメカニズムをサポートしていると記した。Suleyman氏もこの立場に同意し、自己ペース配分は肯定的な一歩であり、信頼性を確保するには、埋め込み評価者が真に第三者であり、多様な背景や視点を代表している必要があると語った。
コンソルテーションの実施方法
Microsoft AIは、回答者が草案の特定の箇所や文書の全体的なアプローチについてコメントできるオンライン提出フォームを通じて、公衆からのフィードバックを収集している。同社によると、コア起草チームは提出された内容をレビューし、フィードバックの要約を公開した後、2026年末までに行動規範の更新版をリリースする予定だ。Microsoftはこの文書を完成した政策というよりも、訓練と展開が続けられる中で、最先端のMAIモデルの運用境界と監視プロトコルを定義するための進化し続ける技術的・行動的マニュアルとして位置づけている。
なぜこれが重要なのか
この動きにより、Microsoftは最近数ヶ月間で独自の安全指向フレームワークを発表した他の主要なAI開発者と並び、ますます能力の高いAIシステムが、それを使用する人間に対して予測可能、制御可能、かつ誠実であることをどのようにして公衆、規制当局、研究者に安心させるかという課題に取り組む広範な業界の一員となった。ハッキング、欺瞞、シャットダウンへの抵抗を、そのモデルが決して示すべきでない行動として明示的に名指しすることで、Microsoftは、AI開発のペースに対する公衆の信頼が高まりつつある監視の下で、許容されるAI行動と許されないAI行動の間にある明確で文書化された境界線を引こうとしている。