LLM 추론 과정 암호화 블록, 복호화 공격에 뚫려
최근 30일 조회수 — 좋아요 —핵심 요약
제공업체가 감춘 AI 추론 과정을 강한 모델에서 약한 모델로 암호화 블록을 주입해 평문으로 복원하는 공격 기법이 공개됐다.
주요 LLM 제공업체가 API로는 드러내지 않는 모델의 추론 과정, 즉 체인 오브 소트(chain-of-thought)를 암호화된 블록 형태로 클라이언트에 돌려주고 있는데, 이 블록을 복호화해 추론 내용을 그대로 복원하는 공격 기법이 공개됐다. 보안 전문가 브루스 슈나이어가 자신의 블로그에서 이 연구를 소개했다.1
OpenAI, Anthropic, Google 같은 제공업체는 추론 트레이스를 서버에 저장하는 대신 암호화된 텍스트 블록으로 만들어 클라이언트에 넘기고, 클라이언트는 다음 요청을 보낼 때 이 블록을 다시 함께 전송한다. 지식재산과 정보 유출을 막기 위한 설계지만, 연구팀은 여기서 구조적 결함을 찾아냈다. 같은 제공업체 생태계 안에서라면 이 암호화 블록이 세션·사용자·모델을 가리지 않고 서로 호환된다는 점이다.
연구팀은 이 호환성을 이용해 강력한 모델에서 나온 암호화된 추론 트레이스를 같은 제공업체의 더 약하고 보호 수준이 낮은 모델에 주입했다. 그러면 약한 모델이 이 블록을 복호화해 평문으로 그대로 출력한다. 강한 모델 자체를 직접 탈옥(jailbreak)할 필요 없이, 약한 모델을 우회 경로로 삼아 추론 내용을 빼내는 방식이다.
이 취약점은 네 가지 공격으로 이어진다.
- 증류 방지 장치 우회: 증류(distillation)를 막기 위해 감춘 추론 과정을 그대로 끌어낼 수 있다. 연구팀은 Anthropic, OpenAI, Google 세 곳의 모델에서 모두 이를 시연했다.
- 대규모 개인정보 추출: 개발자들이 공개 저장소에 세션 로그를 올릴 때 암호화 블록 안에 무엇이 들어있는지 모르는 경우가 많다. 연구팀이 이렇게 수집한 추론 블록 31만 5,320개를 복호화한 결과 개인식별정보(PII) 367건과 자격증명(credential) 182건이 나왔다.
- 은폐된 위험 정보 노출: 모델의 최종 응답이 악의적 요청을 안전하게 거부하더라도, 그 이전 추론 과정 안에는 위험한 정보가 그대로 남아 있는 경우가 확인됐다.
- 비가시적 프롬프트 인젝션: 공격자가 암호화 블록 안에 악성 페이로드를 심어, 공개된 에이전트 실행 로그를 오염시킬 수 있다.
연구팀은 책임 있는 공개(responsible disclosure) 절차를 거쳐 이 사실을 각 제공업체에 먼저 알렸고, 암호학적 조치와 시스템 수준의 완화책을 함께 제안했다고 밝혔다. 다만 이번 내용은 슈나이어의 블로그가 논문 초록을 인용해 전한 것으로, 논문의 저자와 소속, 발표 시점 등 세부 정보는 이 자료만으로는 확인되지 않는다.
Footnotes
-
Schneier on Security, “Stealing AI Reasoning Traces” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Stealing AI Reasoning Traces - Schneier on Security — Schneier on Security
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.