LLM 에이전트 보안, 데이터 흐름 단위로 통제하는 'AgentFlow' 공개

최근 30일 조회수 — 좋아요 —

핵심 요약

AgentFlow는 데이터 흐름 경로에 정책을 적용해 프롬프트 주입 침해율을 33%에서 0%로 낮추면서도 작업 성공률을 높였다.

LLM 에이전트의 보안 문제를 데이터 흐름 단위로 통제하는 정책 프레임워크 ‘AgentFlow’가 arXiv에 공개됐다. 연구진은 이 프레임워크를 여러 에이전트 벤치마크에 적용해, 949건의 AgentDojo 프롬프트 주입 공격에서 확인된 침해율을 33.0%에서 0.0%로 낮추면서 작업 성공률(유틸리티)은 오히려 46.7%에서 63.3%로 끌어올렸다고 밝혔다.1

AgentFlow가 겨냥하는 문제는 단일 행동이 아니라 ‘흐름’이다. 외부 콘텐츠를 읽고, 도구를 호출하고, 민감한 데이터에 접근하고, 작업을 다른 에이전트에 위임하는 LLM 에이전트는 개별 단계만 보면 각각 그럴듯해 보이는 경우가 많다. 하지만 그런 단계들이 이어지면서 민감한 데이터가 의도치 않은 곳으로 흘러가는 지점에서 실제 사고가 발생한다는 것이 연구진의 문제의식이다. 이 때문에 AgentFlow는 개별 행동을 허용·차단하는 대신, 런타임에서 발생하는 데이터 이동 경로(엣지)에 라벨을 붙이고 그 경로 자체를 정책으로 제약하는 방식을 택했다.

구체적으로는 어떤 도구가 어떤 민감 필드를 받을 수 있는지, 어떤 출력 지점(sink)에 데이터가 방출될 수 있는지, 위임 경계를 넘나들 때 어떤 권한이 함께 넘어갈 수 있는지를 정책 언어로 명시한다. 여기에 흐름 규칙과 경로 규칙, 작업 범위로 한정된 권한(capability), 통제된 데이터 방출, 상태를 추적하는 taint(오염 전파) 시맨틱스가 포함된다. 실제 실행 단계에서는 런타임 레퍼런스 모니터가 에이전트의 행동을 매개하고, 구조화된 정책 조각에 대해서는 SMT 기반의 유한 검증기가 안전 속성을 미리 검증한다. 논문에 따르면 프로토타입에서 7가지 안전 속성이 각각 0.5초 이내에 검증됐고, 검증기는 실험에 포함된 시딩된(의도적으로 삽입한) 불안전 정책 변형을 모두 잡아냈다.

성능 평가는 AgentDojo 외에도 200건 규모의 AgentDyn Dailylife 벤치마크로 이어졌다. 여기서는 확인된 침해율이 73.5%에서 0.0%로 떨어지면서도 유틸리티는 44.5%에서 43.5%로 거의 그대로 유지됐다고 보고됐다. ASB, InjecAgent, BIPIA, AgentHarm, MCPTox 재현 실험을 통한 폭넓은 점검에서는, 설정된 정책이 각 벤치마크가 규정한 ‘정책상 가시적인’ 공격자 흐름을 차단하는 것으로 시사됐다고 연구진은 밝혔다. 특히 ASB의 직접 프롬프트 주입 실험에서는 공격 성공률이 1,200건 중 0건이었다.

다만 연구진은 이 결과를 스스로 예비적(preliminary)이라고 규정했다. 검증과 방어 효과는 논문에서 모델링한 ‘정책상 가시적인’ 에이전트 행동과 평가에 사용된 특정 벤치마크 범위 안에서만 확인된 것이며, 이 범위를 벗어나는 공격 방식이나 벤치마크가 포착하지 못하는 형태의 데이터 유출까지 방어한다고 일반화할 근거는 아직 없다. 논문은 2026년 8월 24일 arXiv에 제출됐다.

Footnotes

  1. arXiv (cs.CR), “AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems — arXiv (cs.CR)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.