LLM 에이전트 리눅스 권한상승 자동화 능력, 531개 시나리오로 측정
최근 30일 조회수 — 좋아요 —핵심 요약
연구팀이 도커 기반 벤치마크 PrivEscalate로 6종 LLM의 리눅스 권한상승 자동화 능력을 평가하고 전용 에이전트 래퍼를 공개했다.
LLM 에이전트가 리눅스 시스템에서 권한을 상승시키는 공격을 얼마나 실제로 자동화할 수 있는지를 대규모로 측정한 연구가 나왔다. 연구팀은 이를 위해 531개의 도커 기반 시나리오로 구성된 벤치마크 ‘PrivEscalate’를 만들고, 6종의 LLM을 3가지 에이전트 아키텍처로 평가했다.1
리눅스 권한상승은 공격자가 초기 침투에 성공한 뒤 시스템 전체를 장악하기 전 거치는 핵심 단계다. 그동안에도 LLM의 공격 능력을 재는 시도는 있었지만, 기존 평가는 시나리오 수가 15개 미만에 그쳐 모델 간 능력 차이를 실행 검증 기반으로 비교하기에는 규모가 부족했다고 연구팀은 지적한다. PrivEscalate는 이런 한계를 메우기 위해 14개 취약점 하위 범주에 걸쳐 531개의 도커화된 시나리오를 구축했고, 여기에 환경 조건을 바꾼 329개의 매개변수화 변형을 추가해 모델이 환경적 교란 요소에 얼마나 민감하게 반응하는지도 함께 측정했다.
평가 결과는 세 가지로 요약된다. 첫째, 모델별 능력은 취약점 범주마다 다르게 나타났고, 발생 빈도가 높은 범주들 전반에서 압도적으로 우세한 단일 모델은 없었다. 연구팀은 이를 근거로 하나의 지표만으로 모델의 위협도를 판단하기보다 다차원적인 위험 평가가 필요하다고 강조한다. 둘째, LLM의 공격 성공률은 환경 변화에 민감해서 설정을 교체하는 식의 대응(configuration rotation)이 일부 공격 시도를 무력화하긴 하지만, 측정된 위험 자체를 없애지는 못했다. 셋째, 어떤 에이전트 아키텍처를 쓰느냐에 따라 성공률이 크게 달라지고 모델 간 순위도 뒤바뀔 수 있었는데, 그 변화 폭은 모델마다 달랐다.
이런 관찰을 바탕으로 연구팀은 일반적인 ReAct 에이전트에 결정론적 열거(enumeration), 범주 매칭, 단계별 계획 수립 기능을 더한 도메인 특화 래퍼 ‘PrivEscAgent’를 함께 공개했다. PrivEscAgent는 기반 LLM 자체를 수정하지 않고도 기존 리눅스 권한상승 에이전트 베이스라인보다 높은 성공률을 보였다고 밝혔다. 즉 모델 자체의 성능을 끌어올리지 않아도, 에이전트 설계만으로 공격 성공률을 상당히 높일 수 있다는 뜻이다.
연구팀은 PrivEscalate를 오픈소스 도커 기반 측정 도구로 공개하면서, 이를 LLM 에이전트 평가뿐 아니라 방어 도구 검증과 레드팀 훈련에도 쓸 수 있다고 설명했다. 공격 자동화 능력을 측정하는 벤치마크가 동시에 방어 훈련 자료로 제공되는 구조인 셈인데, 이 도구가 실제로 방어 측 대응을 얼마나 앞당길 수 있을지는 이번 논문만으로는 확인되지 않는다.
Footnotes
-
arXiv (cs.CR), “PrivEscalate: Measuring and Augmenting the Threat of LLM-Automated Linux Privilege Escalation”, 2026-09-08 ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- PrivEscalate: Measuring and Augmenting the Threat of LLM-Automated Linux Privilege Escalation — arXiv (cs.CR)
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.