Google DeepMind는 테스트 프롬프트나 모델 가중치를 노출하지 않고 Gemini Flash Lite 모델을 평가하기 위해 암호화된 이중 맹검(double-blind) 벤치마킹을 사용하는 파일럿 프로그램을 출시했습니다. 이 평가는 Google Cloud의 Confidential Space 내에서 실행되므로, 평가자는 모델을 볼 수 없고 모델은 질문을 볼 수 없습니다. 이는 AI 성능 보고서의 신뢰성을 회복할 수 있는 접근 방식입니다.

벤치마크 오염이 중요한 이유

모델이 나중에 벤치마크에 등장할 데이터를 학습하게 되면, 그 점수는 추론 능력을 측정하는 것이 아니라 암기 능력을 측정하게 됩니다. 따라서 오염된 테스트에서 얻은 완벽한 결과는 실제 역량에 대해 아무것도 알려주지 않습니다. 연구자들은 오랫동안 역설적인 상황에 직면해 왔습니다. 벤치마크를 검증하기 위해 모델 제공자에게 테스트 데이터를 전달하면 조기 노출의 위험이 있고, 독점적인 가중치를 보호하기 위해 외부 접근을 거부하면 감사가 검증되지 않은 상태로 남게 됩니다. 최근 ARC-AGI 벤치마크에서 Anthropic의 Fable 5 평가가 지연된 사례는 엄격한 데이터 보유 정책이 어떻게 독립적인 평가를 저해할 수 있는지를 보여줍니다.

암호화 솔루션

이번 파일럿은 법적 계약과 "제로 로깅(zero-logging)" 약속 대신 기술적 안전장치를 도입했습니다. Confidential Space는 Gemini Flash Lite 모델이 실행되는 하드웨어 격리 엔클레이브(enclave)를 생성합니다. 평가자가 테스트 세트를 업로드하면, 엔클레이브는 이를 모델이 열 수 없는 암호화된 "상자" 안에 봉인합니다. 동시에 모델의 가중치는 엔클레이브 내부에서 암호화된 상태로 유지되어 평가자에게 보이지 않습니다. 엔클레이브는 추론 과정에서 모델이 프롬프트에 전혀 접근하지 않았음을 증명하는 수학적 증명을 생성합니다. 그 결과, 양측 모두 비밀을 유지하면서 제3자는 검증 가능한 성능 지표를 받는 진정한 이중 맹검 실행이 가능해집니다.

수혜 대상

  • 규제 기관 및 감사인은 이제 제공자에게 영업 비밀 공개를 강요하지 않고도 역량에 대한 증거를 요구할 수 있습니다.
  • 사이버 보안, 국방 또는 기밀 데이터를 다루는 모든 분야의 기업은 데이터 유출 위험 없이 AI 도구를 테스트할 수 있습니다.
  • 모델 개발자는 경쟁 우위를 유지할 수 있습니다. 더 이상 개방성과 보호 사이에서 선택할 필요가 없습니다.

이 접근 방식이 확장된다면, 업계를 신뢰 기반의 계약에서 수학 기반의 보증으로 전환하며 프런티어 모델을 인증하는 기본 방법이 될 수 있습니다.

잠재적 마찰 지점

이 시스템은 Google Cloud의 기밀 컴퓨팅(confidential computing) 스택에 의존하므로, 다른 클라우드 제공업체를 선호하는 조직은 통합 과정에서 어려움을 겪을 수 있습니다. 엔클레이브 내에서 모델을 실행하면 지연 시간이 발생하고 사용 가능한 하드웨어 가속기에 제한이 생겨 벤치마크 점수에 영향을 미칠 수 있습니다. 또한, 암호화 증명이 모델이 프롬프트를 보지 않았음을 보장하더라도, 테스트 시작 후 미세 조정(fine-tuning)과 같은 다른 조작을 방지하지는 못합니다. 비판론자들은 이 솔루션이 광범위한 재현성 문제 중 아주 좁은 부분만을 해결한다고 주장할 수 있습니다.

향후 주목할 점

  • 파일럿 이후의 도입 – 다른 AI 연구소와 클라우드 벤더들이 호환 가능한 엔클레이브를 구축하여, 플랫폼 간에 모델을 감사할 수 있는지 테스트할 수 있습니다.
  • 표준 설정 기구 – AI 안전 그룹이 이중 맹검 암호화 감사를 인증 프레임워크의 일부로 명문화할 수 있습니다.
  • 성능 트레이드오프 – 실제 벤치마크 실행을 통해 기밀 실행의 오버헤드가 대규모 모델에 수용 가능한 수준인지 드러날 것입니다.

요약

테스트 데이터와 모델을 모두 상호 불투명한 암호화 환경에 가둠으로써, Google DeepMind의 파일럿은 신뢰할 수 있는 AI 벤치마킹을 위한 구체적인 경로를 제시합니다. 이 방법이 모든 감사 과제를 해결하는 것은 아니지만, 어느 한 쪽도 가장 가치 있는 자산을 포기하게 만들지 않으면서 가장 눈에 띄는 편향의 원인인 벤치마크 오염을 제거합니다. 커뮤니티가 이 기술을 받아들인다면, 향후 AI 발전 보고서는 마침내 있는 그대로 신뢰받을 수 있을 것입니다.