블랙박스 상호작용만으로 LLM 에이전트 능력 훔친다

2분 LLM 에이전트보안AgentLeakAI 안전
최근 30일 조회수 — 좋아요 —

핵심 요약

연구진이 실행 격차 관찰만으로 강한 LLM 에이전트의 절차적 지식을 약한 에이전트에 복제하는 공격 기법 AgentLeak을 공개했다.

연구진이 독점적(proprietary) LLM 에이전트의 능력을 흑박스(black-box) 상호작용만으로 훔쳐내는 새로운 공격 기법을 공개했다. 능력이 떨어지는 공격자 에이전트가 더 강한 상대 에이전트의 문제 해결 능력을 복제할 수 있음을 보인 이번 연구는 arXiv에 지난 9월 7일 게재됐다.1

기존에 알려진 ‘스킬 탈취(skill-stealing)’ 공격은 에이전트가 실행 과정에서 만들어낸 명시적인 스킬 산출물(artifact) 자체를 빼내는 방식이었다. 연구진은 이 방식의 한계를 짚었다. 공격자 에이전트가 같은 스킬 산출물을 확보해도 작업을 그대로 재현하지는 못한다는 것이다. 강한 에이전트의 실행 능력에는 명시적인 스킬만으로 설명되지 않는 절차적 지식(procedural knowledge)이 암묵적으로 녹아 있고, 이 부분은 산출물을 복사하는 것만으로는 옮겨지지 않기 때문이다.

연구진이 제안한 ‘AgentLeak’은 이 절차적 지식을 다른 경로로 빼낸다. 핵심 아이디어는 ‘스킬 실행 격차’ 자체가 정보 유출 통로가 된다는 점이다. 피해자 에이전트의 성공한 실행과 공격자 에이전트의 실패한 실행을 비교하면, 그 차이에서 공격자에게 빠진 행동이 드러난다. AgentLeak은 이 관찰 가능한 차이로부터 능력에 결정적인 행동을 식별하고, 이를 공격자 쪽 스킬에 반영한다. 이 과정에서 공격자의 모델, 실행 하네스, 도구는 전혀 바꾸지 않는다. 즉 더 좋은 모델을 가져오거나 시스템을 새로 짜는 게 아니라, 기존 약한 에이전트 그대로 피해자의 행동 패턴만 흡수시키는 방식이다.

연구진은 이 기법을 20개 작업 시나리오, 600개 인스턴스, 다양한 에이전트 시스템과 여러 백본 모델에 걸쳐 검증했다. 그 결과 AgentLeak은 단순히 탈취한 스킬을 그대로 재사용하는 방식보다 작업 통과율을 40% 이상 끌어올렸고, 피해자와 공격자 사이의 능력 격차를 80% 이상 회복했다고 밝혔다.1 이는 명시적 스킬 산출물만 보호해서는 충분하지 않다는 뜻이다. 에이전트의 실행 로그나 동작 자체가 관찰 가능하다면, 그 관찰만으로도 값비싼 독점적 작업 수행 능력을 재구성할 수 있다는 얘기다.

연구진은 이 결과를 LLM 에이전트의 기밀성 위험으로 규정했다. 스킬 코드나 프롬프트 같은 산출물을 아무리 잘 숨겨도, 실행 과정에서 드러나는 행동 차이 자체가 새로운 공격 표면이 된다는 지적이다. 다만 이번 논문은 공격 기법 제시에 초점을 맞춘 것으로, 이에 대응하는 방어 기법이나 탐지 방법은 자료에 언급되지 않았다.

Footnotes

  1. arXiv (cs.CR), “AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing” ↩ ↩2

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing — arXiv (cs.CR)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.