딥마인드, 업계 최초 이중맹검 AI 평가 시범 도입

최근 30일 조회수 — 좋아요 —

핵심 요약

구글 딥마인드가 암호화 기술로 벤치마크 오염을 막는 이중맹검 평가 방식을 Gemini Flash Lite에 시범 적용했다.

구글 딥마인드가 자사 프런티어급 모델을 대상으로 업계 최초의 이중맹검(double-blind) AI 평가를 시범 도입했다고 27일 밝혔다. 싱가포르 AI 안전연구소(Singapore AI Safety Institute), OpenMined, AVERI, MLCommons와 협력해 Gemini Flash Lite 모델을 비공개 벤치마크로 테스트하는 방식이며, 평가 문항과 모델 가중치를 암호화된 “박스” 안에 가둬 서로에게 노출되지 않도록 한 것이 핵심이다.1

이 방식이 겨냥하는 문제는 벤치마크 오염(benchmark contamination)이다. 모델이 사전에 시험 문제를 학습 과정에서 접했다면, 이후 그 문제로 측정한 점수는 실제 능력을 반영하지 못한다. 딥마인드는 이를 “시험 문제를 미리 훔쳐본 학생의 만점”에 비유했다. 지금까지 외부 평가기관은 두 가지 선택지 중 하나를 골라야 했다. 평가 문항을 모델 개발사에 넘겨 사전 유출 위험을 감수하거나, 반대로 모델 개발사가 가중치를 평가기관에 공개해 지식재산 유출 위험을 지는 것이다. 로그를 남기지 않는 제로 로깅(zero-logging) 프로토콜과 계약상 안전장치가 그동안 이 문제를 완화해왔지만, 딥마인드는 이번에 암호화 기술을 더해 한 단계 더 나아갔다고 설명했다.

기술적으로는 구글 클라우드의 컨피덴셜 컴퓨팅(Confidential Computing) 포트폴리오 중 하나인 컨피덴셜 스페이스(Confidential Space)를 활용한다. 이 환경에서는 외부 평가 데이터와 딥마인드의 모델이 각각 소유자에게만 비공개로 유지된다는 사실을 암호학적으로 검증할 수 있다. 즉 평가기관은 Gemini 모델의 가중치를 볼 수 없고, 구글은 평가기관의 테스트 문항을 볼 수 없다. 딥마인드는 이 구조가 평가기관과 모델 개발사 양쪽 모두 데이터 주권이나 보안을 양보하지 않고도 엄격한 검증을 가능하게 한다고 설명했다.

딥마인드는 모델이 더 강력해질수록 이런 검증이 사이버보안 평가나 정부 기관이 수행하는 민감한 테스트에서 특히 중요해진다고 강조했다. 회사는 이번 시범이 업계 전반에 새로운 모델 감독 기준을 세우는 계기가 되길 기대한다고 밝혔으며, 방법론과 결과는 별도의 기술 보고서로 공개했다.

다만 이번 발표는 딥마인드 자체 블로그를 통한 것으로, Gemini Flash Lite라는 단일 모델을 대상으로 한 시범 사례에 그친다. 다른 프런티어 모델 개발사들이 같은 방식을 채택할지, 또 이 암호화 검증이 대규모 평가 체계에서도 실효성을 유지할지는 아직 확인되지 않았다.

Footnotes

  1. Google DeepMind Blog, “Piloting the world’s first double-blind AI evaluations” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Piloting the world's first double-blind AI evaluations — Google DeepMind Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.