/ 뉴스 / 오픈AI, 자체 최고 사이버 위험 기준 도달 후 아스트라 모델 잠금
AI 안전

오픈AI, 자체 최고 사이버 위험 기준 도달 후 아스트라 모델 잠금

2026년 8월 8일4 분 소요
오픈AI, 자체 최고 사이버 위험 기준 도달 후 아스트라 모델 잠금

뉴스 요약

오픈AI는 이번 주에 내부적으로 아스트라(Astra)라는 이름의 차세대 모델이 자사 준비 프레임워크(Preparedness Framework)에서 정의한 사이버 능력 '치명적' 등급에 진입했을 수 있다고 밝혔다. 이는 오픈AI가 자사 모델에 대해 이러한 판단을 내린 첫 번째 사례다. 2026년 8월 7일 금요일(미국 동부 시간)에 공개된 이 발표는 새로 강화된 보안 요구 사항을 충족하지 못하는 개발 활동을 중단하고, 추가 테스트를 격리된 샌드박스 환경으로 옮기는 등 일련의 내부 안전장치를 촉발했다.

오픈AI 프레임워크에서 '치명적'의 의미

오픈AI의 준비 프레임워크는 생물학, 화학, 핵, 사이버 보안 능력 등 여러 영역에 걸쳐 다양한 위험 범주를 정의한다. 내부 평가에서 모델이 심각하고 알려지지 않은 소프트웨어 취약점(일반적으로 제로데이 익스플로잇이라고 함)을 자율적으로 발견하고 악용하거나, 의미 있는 인간의 지도 없이 잘 방어된 대상을 상대로 복잡한 다단계 사이버 공격을 독립적으로 수행할 가능성을 배제할 수 없을 때 모델이 사이버 보안 '치명적' 기준에 도달한 것으로 분류된다. 이 등급에 도달했다고 해서 모델이 확실히 이러한 능력을 보유했다는 것을 확인하는 것은 아니다. 오히려 평가자들이 그 가능성을 배제할 수 없었다는 뜻이며, 이는 오픈AI 자체 정책상 더 넓은 개발이나 출시를 계속하기 전에 추가 예방 조치를 요구하기에 충분하다.

마련된 안전장치

오픈AI에 따르면 아스트라를 작업하는 팀은 아직 강화된 보안 기준을 충족하지 못하는 내부 활동을 모두 중단했다. 앞으로 모델의 개발과 테스트는 네트워크 접근이 제한된 격리된 환경, 모델이 호출할 수 있는 도구에 대한 더 엄격한 통제, 모델 가중치의 추가 암호화 및 보호, 위험하거나 잘못된 동작을 포착하도록 설계된 확장된 모니터링 환경에서 진행될 것이다. 회사는 또한 때때로 사고 사슬(chain-of-thought)이라고 불리는 모델의 내부 추론 흔적에 대한 자동 검토를 추가하여, 의심스러운 계획 활동이 실제 행동으로 이어지기 전에 플래그를 지정하고 중단할 수 있도록 했다고 밝혔다.

외부 검토 및 정부 협력

오픈AI는 내부 테스트에만 의존하지 않고 외부 그룹과 협력하여 모델의 실제 능력을 독립적으로 검증할 의사가 있다고 밝혔다. 여기에는 관련 정부 사이버 보안 기관과 공격적 보안 능력 평가를 전문으로 하는 소수의 외부 AI 안전 기관과의 협력이 포함된다. 회사는 또한 제3자 평가자에게 권장 보안 통제를 공유하여 모델 능력에 대한 실습 테스트가 실제 세계 위험을 실질적으로 증가시키지 않고 수행될 수 있도록 할 계획이라고 밝혔다.

이번 공개가 주목받는 이유

최첨단 AI 연구소들은 수년 동안 능력 기준과 안전 프레임워크를 발표해 왔지만, 실제로 곧 출시될 특정 모델에 대해 프레임워크의 최상위 등급을 적용하는 것은 드문 일이다. AI 안전 정책을 추적하는 연구자들은 이번 조치가 공격적 사이버 보안과 같은 전문 기술 영역에서 모델 능력이 얼마나 빠르게 발전하고 있는지, 그리고 적어도 한 주요 연구소가 고정된 일정에 맞춰 출시하기보다는 공개적으로 출시를 늦출 의향이 있음을 보여준다고 지적했다. 이번 사건은 AI 연구 커뮤니티에서 능력 평가가 어떻게 수행되어야 하는지, 얼마나 많은 세부 사항이 공개적으로 공개되어야 하는지, 그리고 정부와 독립 연구자들이 이러한 시스템을 구축하는 연구소들의 주장을 어떻게 의미 있게 검증할 수 있는지에 대한 논의를 다시 불러일으킬 것으로 보인다.

다음 단계

오픈AI는 아스트라가 추가 검토 프로세스를 완료하거나 더 널리 사용 가능해질 확정 날짜를 제시하지 않았다. 회사는 중단이 모델에 대한 모든 작업을 중단하는 것이 아니라 새로운 보안 요구 사항에 미치지 못하는 활동에만 특별히 적용된다고 밝혔으며, 아스트라의 최종 출시는 위에서 설명한 확장된 내부 및 외부 평가 결과에 달려 있을 것이라고 말했다.

AI 안전사이버 보안