AI 에이전트 실제 작업 검증 벤치마크 공개

2분 ThinkingBoxAI 에이전트벤치마크MCP
최근 30일 조회수 — 좋아요 —

핵심 요약

마이크로소프트와 허깅페이스가 AI 에이전트의 답변 대신 실행 후 데이터 상태를 검증하는 ThinkingBox를 공개했다.

마이크로소프트와 허깅페이스가 AI 에이전트의 작업 완료 주장과 실제 백엔드 상태를 대조하는 벤치마크 ThinkingBox를 공개했다. ThinkingBox는 고객 지원처럼 데이터가 계속 바뀌는 업무에서 에이전트의 답변이나 도구 호출 형식이 아니라, 실행이 끝난 뒤 데이터베이스에 남은 값과 부수 효과를 검사한다. “처리했다”는 말보다 실제 기록을 증거로 삼겠다는 접근이다.1

공동 블로그가 소개한 사례는 이 차이를 선명하게 보여준다. 배송 예정일보다 15일 늦어진 745달러짜리 주방기기를 두고 고객이 문의하자, 에이전트는 주문·배송 조회와 환불 정책 검색, 티켓 생성 등 도구를 아홉 번 호출했다. 고객이 지연 보상 대상이 아니라는 정책도 정확히 읽었다. 그러나 운송업체의 예외 상태가 해소되지 않았는데도 티켓을 solved로 닫고 문의가 해결됐다고 답했다. 정답은 후속 처리를 기다리는 hold 상태였다. 호출 과정만 보면 정상적이지만, 데이터베이스에는 잘못된 결과가 남은 셈이다.1

ThinkingBox는 이런 실패를 507개 상태 기반 비즈니스 업무에서 측정한다. 각 업무는 여러 대규모 언어 모델(LLM)을 대상으로 초기 상태가 같은 격리된 모델 컨텍스트 프로토콜(MCP) 도구 세션에서 20번씩 실행된다. 이후 실행 가능한 검사 코드가 필드 값, 필요한 변경의 누락, 의도하지 않은 추가 변경을 판정한다. 벤치마크는 OpenEnv를 통해 직접 실행할 수 있으며, 블로그의 배송 사례도 공개된 테스트와 논문 부록의 실행 기록으로 확인할 수 있다.1

결과는 정상 종료와 업무 성공이 같은 뜻이 아님을 보여준다. 12개 모델과 12만1,680건의 유효한 실행을 분석한 공통 과제 실험에서 7만9,853건이 검사에 실패했다. 이 실패 가운데 67.24%는 상태를 바꾸는 도구를 호출하고 최종 도구 오류 없이 정상 종료했다. 그런데 실행 후 상태를 살펴보니 77.61%에서 필드 값이 틀렸고, 43.30%에는 불필요한 부수 효과가 있었으며, 25.36%는 필요한 변경을 남기지 못했다. 세 비율은 서로 겹친다.1

ThinkingBox는 성공률도 한 가지 숫자로 압축하지 않는다. pass@1은 전체 시도 중 성공 비율, pass@20은 20번 가운데 한 번이라도 성공한 업무의 비율이다. 여기에 실제로 20번 모두 통과한 업무 수인 Observed 20/20을 함께 제시한다. 한 번 성공할 능력과 매번 정확히 처리할 신뢰성을 구분하기 위해서다. 다만 공개 자료에 제시된 수치는 특정 벤치마크와 실행 조건에서 나온 결과다.

Footnotes

  1. Hugging Face Blog, 「The Agent Said It Was Done. The Database Disagreed.」 ↩ ↩2 ↩3 ↩4

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. The Agent Said It Was Done. The Database Disagreed. — Hugging Face Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.