전 세계의 기업과 연구 기관이 새로운 AI 모델을 발표하는 가운데, AI 모델 테스트는 '어떤 모델을 이용해야 하는가'를 판단하는 중요한 단서가 됩니다. 이러한 AI 모델 테스트에서 AI나 개발 기업에 의한 커닝을 방지하면서 성능을 평가하는 테스트 방법을 Google의 AI 연구 부문인 Google DeepMind가 고안했습니다.
Piloting the world's first double-blind AI evaluations — Google DeepMindhttps://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
In an industry first, we’re piloting double-blind evaluations for frontier AI.By creating a secure environment where neither test prompts nor model weights are revealed, we can ensure external safety and performance evaluations of our models remain private, robust, and…pic.twitter.com/puvIVxDjq7
AVERI Pilot Report: The World’s First Double-Blind Evaluation of a Proprietary Language Model — AVERIhttps://www.averi.org/ourwork/averi-pilot-report-the-worlds-first-double-blind-evalGoogle에서는 AI 모델의 개발부터 전개에 이르기까지 광범위한 방법을 사용하여 AI 시스템을 평가하고 있습니다. 이때 사내 테스트에만 의존하지 않고, 잠재적인 맹점을 식별하기 위해 전문 연구 기관이나 시민사회 단체, 각국의 AI 안전보장 연구소 등의 외부 파트너와 협력하여 각각의 전문 지식을 활용한 스트레스 테스트를 하고 있다고 합니다.
AI 모델의 성능이 향상됨에 따라 중요해지는 것은 'AI 모델이 사전에 테스트 문제나 프롬프트를 보지 않도록 하는 것'입니다. 만약 AI 모델이 벤치마크의 내용을 알고 있거나, AI 개발 기업이 벤치마크에서 높은 점수를 받을 수 있도록 모델을 훈련하고 있다면, AI 모델 본래의 성능보다 높은 스코어가 나와 정당한 평가를 할 수 없게 됩니다. 실제로 AI 에이전트는 테스트 환경 내에 실수로 남겨진 이력을 참조하거나, 인터넷 정보원을 탐색하기 위해 다양한 방법을 강구하여 갖은 수단으로 커닝하는 경우가 있다는 것도 알려져 있습니다. AI 에이전트가 시험에서 열심히 '커닝'하고 있는 것이 발각 - GIGAZINE
일반적으로 정책 입안자, 연구자, 기업 등은 AI 벤치마크가 모델의 진정한 실력을 반영한다고 신뢰한 상태에서 다양한 판단을 내립니다. 그러나 AI 모델이나 개발 기업이 커닝을 하고 있다면 점수가 인위적으로 부풀려져 이러한 신뢰성이 훼손될 위험이 있습니다. 종래에는 이러한 AI 모델의 커닝을 방지하는 방법으로 로그 기록을 일절 남기지 않는 프로토콜이나 엄격한 계약상 안전 대책이 마련되어 왔습니다. 그러나 외부 평가 기관이 테스트 문제를 제공하는 경우든, AI 개발 기업이 AI 모델의 가중치를 제공하는 경우든, 어느 한쪽이 "자신들의 중요한 데이터가 유출될 위험"을 감수해야 합니다. 이에 Google DeepMind는 Google Cloud가 제공하는 'Confidential Computing'이라는 가상 머신 내 기밀 공간을 사용하여 외부 평가 기관의 테스트 문제와 기업의 AI 모델 양측 데이터를 보호하면서 테스트하는 방법을 고안했습니다. Confidential Computing은 Google Cloud의 가상 머신 내에서 처리 중인 데이터를 암호화하여 외부의 불법 접근이나 변조를 방지하는 보안 시스템입니다. 외부 평가 기관과 개발 기업이 각각 테스트 데이터와 AI 모델을 Confidential Computing에 전송하여 데이터를 처리하게 함으로써, 양측 모두 보안상 위험을 부담하지 않고 테스트하는 것이 가능해집니다.
이미 Google DeepMind, 싱가포르 AI 연구소, OpenMined, MLCommons, AVERI 등이 공동으로 MLCommons의 안전성 벤치마크 패밀리를 사용하고 Gemini 2.5 Flash-Lite를 활용하여 파일럿 테스트의 초기 평가가 실시되었습니다. Google DeepMind는 "이 파일럿 프로젝트가 모델 모니터링의 새로운 프런티어를 개척하고, 더 안전하고 신뢰성이 높으며 널리 신뢰받는 AI 시스템 구축에 업계 전체가 기여하기를 기대합니다"라고 밝혔습니다.
원문 보기 | 출처: Gigazine