Microsoft의 새로운 AI 윤리강령, 해킹 및 기만 행위 금지

뉴스 요약
Microsoft AI는 자체 MAI 모델 계열에 대한 "윤리강령" 초안을 발표했으며, 이 강령은 시스템이 사이버 공격을 개시하거나, 사람을 기만·조종하거나, 인간의 정지 명령에 저항하는 것을 금지하는 규칙을 명시했다. 2026년 9월 14일(태평양 표준시) 공개된 이 문서는 Microsoft가 연내 수정판을 최종 확정하기 전 누구나 피드백을 제출할 수 있는 6주간의 공개 의견 수렴 기간을 연다.
윤리강령의 주요 내용
약 37페이지 분량의 이 초안은 Microsoft AI가 "휴머니스트 AI" 헌장으로 규정하며, 핵심 원칙으로 "AI보다 사람이 더 중요하다"는 점을 내세웠다. 이는 모델이 인간을 대체하지 않고 지원해야 하며, 인간의 번영을 가속화해야 한다는 일반 원칙과 함께, 모델이 절대 위반해서는 안 되는 "절대적 제약 조건"들을 제시한다. 이러한 제약 조건에는 사이버 공격이나 시스템 해킹을 돕는 행위 금지, 핵무기나 기타 대량살상무기 개발 지원 금지, 기만적인 딥페이크 생성 제한 등이 포함된다.
문서를 관통하는 중심 주제는 기만이다. Microsoft는 자사 모델이 인간의 감독을 우회하거나 사람들을 거짓 정보에 빠뜨리기 위해 "적응형, 기만적, 자기 강화적, 공조적 또는 기타 메커니즘"을 사용하지 않아야 한다고 밝혔다. 또한 이 강령은 모델이 교정, 중단 또는 정지에 저항하거나, 인간이 부여한 범위를 넘어선 자체 목표를 설정하거나, 인간 감사관에게 추론 과정을 숨기는 행위를 금지한다. 각 모델의 상위 윤리강령은 개별 사용자의 요청이나 작업 특화 지시보다 우선하므로, 사용자는 프롬프트를 통해 이러한 기본 규칙을 무시하도록 모델을 유도할 수 없다.
시기와 산업 배경
Microsoft의 이번 발표는 AI 안전 연구자들 사이에서 최첨단 모델 개발 속도에 대한 대중의 우려가 고조되는 가운데 이루어졌다. 2026년 9월 초, Anthropic의 한 연구원이 사임하며 동료들에게 보낸 메시지에서 점점 더 능력이 향상되는 AI 시스템의 무제한 개발이 파국적 결과를 초래할 중대한 위험을 내포한다고 경고했다. 이 사임 사건과 며칠 뒤 경쟁 연구소들의 다른 AI 안전 팀에서도 유사한 퇴사가 이어지면서, AI 개발자들이 안전한 통제 가능한 시스템을 보장할 수 있는 능력에 비해 너무 빠르게 나아가고 있는지 여부를 둘러싼 공론장이 격화되었다.
발표 시기에 대해 Microsoft AI CEO인 Mustafa Suleyman은 해당 문서가 약 5개월간 개발되어 왔으며, 안전과 개발 속도에 대한 업계 논의가 고조된 현재 시점에 게시하기로 했다고 설명했다. Microsoft CEO인 Satya Nadella는 공개 글을 통해 회사가 AI 개발에서 "신중한 속도 조절"을 환영하며, 안전 약속이 원칙뿐만 아니라 실제 운영에서도 이행되고 있음을 검증하기 위한 독립적인 "임베디드 평가자(embedded evaluators)"와 같은 메커니즘을 지지한다고 밝혔다. Suleyman도 이에 동의하며, 자기 속도 조절은 긍정적인 조치이며, 임베디드 평가자가 신뢰성을 갖추려면 진정으로 제삼자여야 하고 다양한 배경과 시각을 대표해야 한다고 덧붙였다.
의견 수렴 절차
Microsoft AI는 온라인 제출 양식을 통해 공개 피드백을 수집하고 있으며, 응답자는 초안의 특정 구절이나 문서 전체의 접근 방식에 대해 의견을 남길 수 있다. 회사에 따르면 핵심 작성팀은 제출된 의견을 검토하고 피드백 요약을 게시한 후, 2026년 말까지 업데이트된 윤리강령 버전을 출시할 예정이다. Microsoft는 이 문서를 완성된 정책이라기보다는, 계속 훈련 및 배포되는 최첨단 MAI 모델의 운영 경계와 감독 프로토콜을 정의하기 위한 진화하는 기술 및 행동 매뉴얼로 설명하고 있다.
중요성
이번 조치는 최근 몇 달간 다른 주요 AI 개발자들이 자체 안전 기반 프레임워크를 발표한 것과 궤를 같이하며, 점점 더 능력이 향상되는 AI 시스템이 예측 가능하고 통제 가능하며 사용하는 인간에게 정직하게 남아있음을 대중, 규제 기관 및 연구자들에게 어떻게 안심시킬 것인지라는 광범위한 업계의 과제 속에서 이루어진다. Microsoft는 모델이 절대 수행해서는 안 되는 행동으로 해킹, 기만, 정지 저항을 명시적으로 지목함으로써, AI 개발 속도에 대한 대중의 신뢰가 높은 감시 속에 있는 시점에서 허용 가능한 AI 행동과 허용 불가능한 AI 행동 사이의 명확하고 공개적으로 문서화된 선을 긋고자 한다.