/ 뉴스 / Google DeepMind, 최첨단 AI 모델 최초의 이중맹검 평가 실시
AI 평가

Google DeepMind, 최첨단 AI 모델 최초의 이중맹검 평가 실시

2026년 8월 29일5 분 소요
Google DeepMind, 최첨단 AI 모델 최초의 이중맹검 평가 실시

뉴스 요약

Google DeepMind는 2026년 8월 27일(태평양 표준시)에 하드웨어 암호화 컴퓨팅 환경을 사용하여 모델의 내부 가중치와 외부 평가자의 테스트 프롬프트를 동시에 서로에게 숨긴 채, 독점 최첨단급 AI 모델에 대한 최초의 이중맹검 평가를 시범 운영했다고 밝혔다. 이번 시범 평가에서는 Gemini 계열의 경량 모델인 Gemini 2.5 Flash Lite를 테스트했으며, 싱가포르 AI 안전 연구소(AISI), 프라이버시 컴퓨팅 비영리 단체 OpenMined, AI 벤치마킹 컨소시엄 MLCommons, 평가 기업 AVERI와 함께 진행했다.

문제: AI 테스트의 구조적 상충 관계

독립 평가는 대규모 언어 모델이 실제로 얼마나 유능하고 안전한지를 확인하는 주요 견제 수단 중 하나여야 한다. 그러나 DeepMind와 파트너들에 따르면, 이 과정은 오랫동안 어색한 상충 관계 위에 놓여 있었다. 엄격한 외부 테스트를 실행하기 위해 평가자는 전통적으로 두 가지 선택지가 있었다. 기밀 벤치마크 질문을 모델 개발자에게 넘겨 개발자가 내부적으로 모델을 실행하게 하거나, 개발자에게 모델의 독점 가중치를 평가자 자신의 인프라에 노출하도록 요청하는 것이다. 어느 쪽도 편안한 선택이 아니다. 벤치마크 프롬프트를 사전에 공유하면 "오염" 위험이 있다. 모델이나 개발자가 의도적이든 아니든 이미 본 질문에 맞춰 성능을 조정하여, 높은 점수가 진짜 능력보다는 테스트에 대한 친숙도를 반영하게 될 수 있다는 우려다. 한편 모델 가중치를 공유하면 기업의 핵심 지식재산이 노출되고 양측 모두에게 보안 및 데이터 주권 문제가 생긴다. 역사적으로 평가는 이러한 노출을 관리하기 위해 계약, 비밀유지계약, 제도적 신뢰에 의존해 왔으며, 기술적 보장은 없었다.

이중맹검 방식의 작동 원리

이번 시범 평가의 해법은 신뢰를 방정식에서 제거하고 이를 암호학적 강제로 대체하는 것이었다. DeepMind는 Google Cloud의 기밀 컴퓨팅 포트폴리오에 속한 제품인 Confidential Space 안에서 평가를 실행했다. 이 제품은 하드웨어 기반 신뢰 실행 환경(TEE)을 사용하여 데이터를 봉인하므로 인프라 운영자조차 내부에서 무엇이 실행되는지 들여다볼 수 없다. 이 구성에서 Gemini 2.5 Flash Lite의 모델 가중치와 평가자의 벤치마크 프롬프트가 동시에 동일한 봉인된 엔클레이브에 로드되었으며, 각 당사자의 데이터는 상대방으로부터 암호화되었다. 평가자의 질문은 엔클레이브 내부에서 모델을 대상으로 실행되었고, 기본 가중치나 프롬프트가 아닌 결과 점수만 외부로 공개되었다. 기술 설계에 대한 설명에 따르면, OpenMined의 PySyft 프레임워크를 사용하여 엔클레이브 내부에서 실행되는 코드가 승인되지 않은 외부 네트워크 호출을 할 수 없도록 강제했으며, 이는 어느 당사자의 보호 데이터도 부채널을 통해 외부로 복사되는 것을 방지하기 위한 것이다. 암호학적 증명을 통해 각 측은 엔클레이브가 올바르게 구성되었는지, 그리고 모델 제공자와 평가자 모두 상대방의 보호 자료를 볼 수 없었는지를 독립적으로 검증할 수 있다. 이를 통해 "이중맹검" 속성이 정책으로 약속된 것이 아니라 하드웨어로 강제된 속성이 된다.

무엇을 테스트했나

이 프레임워크에서 두 가지 평가가 실행되었다. 첫 번째는 AVERI, MLCommons, OpenMined가 주도하여 프롬프트나 모델 내부를 상대방에게 노출하지 않은 채 기밀 테스트 세트를 대상으로 Gemini 2.5 Flash Lite를 벤치마킹했다. 두 번째는 싱가포르 AI 안전 연구소가 별도로 실행하여, 싱가포르의 규제 및 문화적 맥락과 관련된 방식으로 유해 콘텐츠에 대한 모델의 처리 방식을 자체 기밀 프롬프트로 조사했으며, 이 역시 어느 쪽도 상대방의 보호 데이터를 볼 수 없게 진행되었다. DeepMind는 Gemini 2.5 Flash Lite를 Gemini 모델 계열의 가볍고 효율적인 구성원으로 설명해 왔으며, 이 접근 방식이 더 큰 최첨단 모델로 확장되기 전에 최초의 시범 평가를 위한 상대적으로 저비용 후보가 되었다.

이것이 중요한 이유

벤치마크 오염은 공개 리더보드와 평가 스위트가 게시되고 스크래핑되며, 일부 경우 의도치 않게 또는 의도적으로 학습 데이터에 포함되면서 AI 업계 전반에서 점점 더 가시적인 우려 사항이 되고 있다. 독립 검증 기관, 안전 연구소, 연구자들은 널리 알려진 벤치마크에서 모델이 받은 점수가 진짜 능력보다는 해당 벤치마크가 학습 데이터에 얼마나 유출되었는지를 더 많이 말해줄 수 있다고 반복적으로 지적해 왔다. 암호학적으로 강제된 이중맹검 방식은 평가 콘텐츠를 개발자로부터 기밀로 유지하면서도, 개발자에게는 자신의 독점 모델 가중치가 외부 평가자에게 복사되거나 노출되지 않는다는 확신을 제공하는 방법을 제시한다. DeepMind와 파트너들은 이번 시범 평가를 정부 안전 연구소를 포함한 독립 기관이 어느 쪽도 데이터 주권, 보안, 지식재산을 양보하지 않고도 고급 모델을 엄격하게 테스트할 수 있게 하는 방향으로 나아가는 한 걸음으로 설명한다.

다음 단계

DeepMind와 MLCommons는 시범 평가의 세부 사항을 동시에 발표하며, 이를 완성된 평가 표준이라기보다 초기 개념 증명으로 설명했다. 관련 기업과 연구소들은 기밀 이중맹검 접근 방식을 더 넓은 벤치마크 세트로, 그리고 궁극적으로는 이번 첫 실행에 사용된 경량 Gemini 2.5 Flash Lite를 넘어 더 크고 유능한 최첨단 모델로 확장하는 데 관심을 표명했다. 더 넓은 도입은 다른 AI 개발자와 평가자가 유사한 하드웨어 보안 환경을 통해 자체 모델과 벤치마크를 실행하는 데 동의하는지, 그리고 신뢰 실행 환경이 실제로 부채널을 완전히 차단할 수 있는지에 대한 지속적인 검증에 달려 있을 가능성이 크다.

AI 평가Google DeepMind