[연구]구글, 암호화 기반 '이중 맹검' AI 벤치마크 파일럿 공개
구글이 모델 개발사와 평가 기관 모두 서로의 핵심 자산을 볼 수 없게 보호하는 '이중 맹검' AI 평가 파일럿을 공개했습니다. 구글 클라우드의 기밀 컴퓨팅 기술을 활용해 평가 기관의 시험 문제 유출과 모델 가중치 유출을 동시에 방지하는 방식입니다.
전문 읽기접기
무슨 일이야
구글이 싱가포르 AI 안전 연구소(Singapore AI Safety Institute), OpenMined, AVERI, MLCommons와 협력해 Gemini Flash Lite 모델을 대상으로 이중 맹검(Double-blind) 평가를 진행했습니다.
그동안 외부 기관이 AI 모델을 평가할 때는 딜레마가 있었습니다. 평가 기관이 테스트 프롬프트를 넘겨 모델 개발사에 문제가 사전 유출되거나(벤치마크 오염), 반대로 모델 개발사가 가중치를 넘겨 지식재산권이 노출되는 트레이드오프가 존재했습니다.
이번 파일럿은 구글 클라우드의 'Confidential Space' 환경을 활용해 양측의 데이터를 암호화된 공간에 격리했습니다. 이를 통해 평가자는 Gemini의 모델 가중치를 볼 수 없고, 구글 역시 평가자의 비공개 테스트 프롬프트를 사전에 볼 수 없도록 기술적으로 보장했습니다.
왜 중요해
AI 모델 성능을 측정할 때 벤치마크 오염(데이터 오염)은 측정 신뢰도를 떨어뜨리는 고질적인 문제입니다. 이번 기술적 격리 방식을 도입하면 모델이 시험 문제를 미리 '컨닝'해 점수가 부풀려지는 문제를 원천 차단할 수 있습니다.
특히 사이버 보안이나 정부 기관이 다루는 민감한 고위험 평가 영역에서, 데이터 주권과 보안을 유지하면서도 독립적인 외부 기관의 엄격한 검증을 받을 수 있는 표준 경로가 열렸다는 점에서 의미가 있습니다.
짚고 넘어갈 점
이번 평가는 Gemini Flash Lite 모델을 대상으로 한 파일럿 성격으로, 향후 더 다양한 프론티어급 모델과 대규모 외부 벤치마크로 이 평가 방식이 확장 및 정착될 수 있을지는 지켜볼 필요가 있습니다.
참고: DeepMind
댓글 0
첫 댓글을 남겨보세요.