LLM 에이전트 오류 관찰자 운영 배포

최근 30일 조회수 — 좋아요 —

핵심 요약

그럴듯한 실패 관찰자가 알려진 회귀는 탐지했지만 새로운 장애와 실제 정밀도 검증에는 한계를 보였다.

프로덕션 대규모언어모델(LLM) 에이전트가 내부 오류를 자연스럽고 그럴듯한 답변으로 감춰 내보내는 ‘그럴듯한 실패(fail-plausible failure)’를 탐지하는 관찰자 시스템이 실제 운영 환경에 배포됐다. 연구진은 사전 등록한 절차에 따라 26일간의 섀도 모드와 12일간의 차단 모드를 운영했다. 다만 차단 모드에서는 경보가 한 번도 발생하지 않아, 실제 환경에서의 정밀도는 아직 계산할 수 없다고 밝혔다.1

이 연구는 앞선 장기 관찰에서 출발했다. 당시 프로덕션 LLM 에이전트의 조용한 실패 가운데 약 70%는 수천 개의 테스트와 거버넌스 검사를 통과한 상태에서, 사람이 사용자처럼 제품을 살펴보다 발견했다. 연구진은 사람이 결과물을 보고 이상을 감지하는 과정의 일부를 자동화하려 했다.1

관찰자는 두 단계로 작동한다. 먼저 장애 사후 분석에서 추출한 결정론적 신호 다섯 개가 의심 사례를 선별한다. 이어 LLM 판정기가 해당 사례를 검사하되, 판정 근거로 원문 증거를 그대로 인용하지 못하면 결과를 폐기한다. 평가 자료는 운영 장애 사후 분석 24건이다. 이 가운데 16건은 출력 내용만 읽는 관찰자로는 구조적으로 탐지할 수 없는 사례라고 연구진은 명시했다.1

오프라인 평가에서 결정론적 탐지기는 과거에 알려진 회귀 사례 6건을 모두 잡았고, 정상 사례 4건에서는 오탐을 내지 않았다. 각 탐지 신호를 고의로 훼손하는 사보타주 시험을 거쳐 모든 신호가 실제로 필요한지도 확인했다. 그러나 처음 보는 장애 패턴 4건은 하나도 탐지하지 못했다. 현재 관찰자는 새로운 실패를 예측하는 장치라기보다, 이미 알려진 실패가 되풀이되는지 검사하는 회귀 탐지기에 가깝다.1

배포 과정에서도 한계가 드러났다. 첫 섀도 모드 실행에서 체계적인 오탐 하나를 찾아 제거한 뒤 26일 동안 추가 문제가 없었고, 전환 기준과 분석 절차는 결과를 보기 전에 고정했다. 이후 12일간의 차단 모드에서 판정이 전혀 나오지 않았지만, 연구진은 이를 성공으로 해석하지 않고 실제 정밀도를 ‘정의할 수 없음’으로 보고했다. 관찰자 자체에서도 조용한 실패 10건이 발생해, LLM 판정기 역시 자신이 감시하는 에이전트와 같은 실패 유형을 물려받는다는 점이 확인됐다.1

연구진은 말뭉치와 탐지기, 평가표를 실행 가능한 벤치 형태로 공개했다. 이번 배포가 입증한 범위는 사람의 반복적인 회귀 점검을 일부 덜어낼 수 있다는 데까지다. 새로운 장애를 찾아내는 능력은 여전히 검증되지 않았지만, 적어도 고정된 규칙 아래 측정할 수 있는 문제로 바뀌었다.1

Footnotes

  1. arXiv, 「Mechanizing the User’s Eye: Pre-Registered Deployment of a Sabotage-Validated Fail-Plausible Observer in a Production LLM Agent Runtime」 ↩ ↩2 ↩3 ↩4 ↩5 ↩6

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Mechanizing the User's Eye: Pre-Registered Deployment of a Sabotage-Validated Fail-Plausible Observer in a Production LLM Agent Runtime — arXiv (cs.SE)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.