HERA, AI 에이전트 거절 정확도 개선
최근 30일 조회수 — 좋아요 —핵심 요약
실행 불가능한 작업을 식별해 거절하도록 훈련하는 HERA가 거절 정확도를 61.7%에서 83.3%로 높였다.

AI 에이전트가 애초에 실행할 수 없는 작업을 억지로 시도하지 않고 거절하도록 훈련하는 프레임워크 HERA(Harness-Environment Co-Evolution for Reliable Agentic Abstention)가 공개됐다. 연구진은 HERA로 개선한 에이전트 하네스가 별도 평가 과제에서 거절 정확도를 61.7%에서 83.3%로 높였다고 보고했다. 실행 가능한 작업의 완료율도 68.3%에서 76.7%로 올랐다.1
여기서 ‘에이전트 거절(agentic abstention)’은 유해한 요청을 차단하는 안전 기능과는 다르다. 주어진 도구와 환경으로는 유효한 해법이 없는 작업을 에이전트가 식별하고, 무리하게 실행하는 대신 불가능하다고 판단하는 능력을 뜻한다. 도구를 사용하는 대규모 언어 모델(LLM) 에이전트의 역량은 커졌지만, 풀 수 없는 문제에서도 계속 행동하다 실패하는 신뢰성 문제가 남아 있다는 것이 연구진의 문제의식이다.
실패 사례가 다음 훈련 환경을 만든다
기존 접근법은 대체로 고정된 작업 집합에 맞춰 모델이나 에이전트 하네스를 최적화했다. 하네스는 모델에 도구와 실행 규칙, 작업 절차를 연결하는 운영 계층이다. 연구진은 이런 방식이 훈련 때 보지 못한 실패 유형으로 일반화되기 어렵다고 지적한다.1
HERA는 하네스와 실행 환경을 함께 진화시킨다. 먼저 풀 수 있는 작업의 환경을 통제된 방식으로 변형해, 정답을 실행할 수 있는 과제와 반드시 거절해야 하는 과제를 자동으로 짝지어 만든다. 이어 이전 과제에서 드러난 실패를 바탕으로 하네스를 수정하고, 그 약점을 다시 시험할 새로운 환경과 과제를 생성한다. 정답 가능 여부를 검증할 수 있는 과제 쌍을 쓰기 때문에, 에이전트가 적절히 거절했는지도 판별할 수 있다.
논문에 따르면 HERA의 최종 하네스는 비교 대상 가운데 거절 정확도와 실행 가능한 작업 완료율 모두 가장 높았다. 특정 모델에 맞춰 별도로 최적화하지 않고 다른 LLM 19종에 적용했을 때도 거절 정확도가 평균 15.3%포인트 상승했다. 연구진은 작은 모델이 더 강력한 모델과 비슷한 성능을 내면서 추정 비용을 85% 줄였다고도 밝혔다.1
다만 이 결과는 2026년 10월 5일 제출된 arXiv 초판 논문의 저자 보고치다. 제공된 자료에는 평가 과제의 규모와 구성, 비교 모델 목록, 비용 산정 방식이 나오지 않아 수치가 실제 서비스 환경에서도 그대로 재현되는지는 확인할 수 없다.
Footnotes
읽기 목록은 이 브라우저에 저장됩니다.
출처
- HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention — arXiv (cs.AI/cs.CL/cs.LG)
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.