Archestra, 보안 엔진 OpenAPPA 공개

최근 30일 조회수 — 좋아요 —

핵심 요약

OpenAPPA는 AI 실행 루프 밖에서 결정론적 권한 정책을 적용해 에이전트의 데이터 유출을 차단한다.

Archestra가 프롬프트 인젝션이나 모델 환각에서 비롯되는 데이터 유출을 차단하는 오픈소스 보안 엔진 OpenAPPA를 공개했다. 핵심은 보안 판단을 인공지능 에이전트의 프롬프트와 실행 루프 밖에서 처리하는 것이다. Archestra는 기업용 다단계 업무 20개로 구성된 Bench-Corp와 AgentThreatBench에서 공격 성공률 0%를 기록했다고 밝혔다. 같은 평가에서 Claude Code 자동 모드는 10%, Microsoft FIDES는 31%였다.1

OpenAPPA는 별도 모델이 도구 호출을 심사하는 확률적 방식 대신, APPA(Agentic Permissions Policy Algebra·에이전트 권한 정책 대수)에 따라 결정론적 규칙을 집행한다. Archestra는 심사 모델 역시 프롬프트 인젝션의 영향을 받을 수 있고, 여러 도구 호출 사이에서 데이터가 이동하는 경로를 추적하기 어렵다고 지적한다. 정확도가 99.3%여도 호출이 수백만 건이면 나머지 0.7%가 상당한 수의 침해로 이어질 수 있다는 설명이다.

정책은 단일 appa.toml 파일에 데이터 출처, 허용 대상, 신뢰 수준, 권한을 정의한다. 각 도구에는 실행 조건인 requires, 결과를 받은 뒤 적용할 제한인 delta, 성공한 작업을 기록하는 effects가 붙는다. 예컨대 고객관계관리(CRM) 시스템에서 티켓을 읽으면 이후 데이터의 허용 대상이 사내로 좁아진다. 이 상태에서는 공개 배포 도구를 실행할 수 없지만, 사내 데이터 처리 도구는 실행할 수 있다. 외부 웹페이지를 읽은 결과에는 ‘의심스러움’이라는 신뢰 표지가 붙어, 신뢰된 데이터만 허용하는 데이터베이스 마이그레이션 작업을 막는다.

허용 대상과 신뢰 표지는 작업이 이어질수록 단조롭게 결합돼 더 엄격한 방향으로만 변한다. 단순한 도구 허용·차단 목록처럼 rm -rf를 파이썬 스크립트로 우회하는 문제를 피하면서도, 정책을 지나치게 조여 정상 업무까지 실패하게 만드는 부작용을 줄이려는 설계다. 다만 공격 성공률 0%는 Archestra 팀이 특정 벤치마크에서 측정해 발표한 결과다. 실제 운영 환경의 다양한 도구 조합과 장기 실행에서도 같은 수준을 유지하는지는 이번 자료만으로 확인할 수 없다.

Footnotes

  1. InfoQ, “New Archestra’s OpenAPPA Saturates Two Major Security Benchmarks with a 0% Attack Success Rate” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. New Archestra's OpenAPPA Saturates Two Major Security Benchmarks with a 0% Attack Success Rate — InfoQ

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.