AI 에이전트 비용, 모델보다 하네스가 좌우한다

최근 30일 조회수 — 좋아요 —

핵심 요약

세 벤치마크에서 동일 모델도 하네스에 따라 토큰 소모가 최대 70배 차이 나는 것으로 나타났다.

개별 코딩 에이전트를 도입할 때 대부분은 어떤 모델을 쓰느냐부터 따진다. 그런데 최근 나온 세 건의 벤치마크는 정작 비용을 좌우하는 쪽이 모델을 감싸는 하네스, 즉 에이전트를 작업 단계별로 이끄는 소프트웨어일 수 있다는 결과를 내놨다. 더뉴스택이 2026년 8월 27일 보도한 내용에 따르면, 동일한 모델로 같은 작업을 시켰을 때 하네스 종류에 따라 토큰 소모량이 최대 70배까지 벌어졌다1.

세 벤치마크는 각기 다른 방식으로 이 문제를 들여다봤다. 6월에 나온 한 독립 벤치마크는 두 개 모델로 동일한 파이썬 작업 12개를 12개 하네스 설정에 돌렸다. Aider, Claude Code, Codex, Goose, Hermes, Kilo, Kimi Code, Nanobot, OpenClaw, Opencode, Qwen Code가 대상이었고 Aider는 아키텍트 모드를 따로 집계했다. 모든 설정이 OpenRouter를 통해 같은 API와 모델(DeepSeek V4 Flash, 이후 Nvidia Nemotron 3 Ultra)로 실행됐기 때문에 하네스 외 변수는 통제된 셈이다.

결과는 해결한 작업당 토큰 수 기준으로 Aider 아키텍트 모드가 약 3,500개, OpenClaw가 약 29만 2,000개였다. 두 모델에서 순위가 거의 그대로 유지됐다는 점이 이 격차를 모델 특성이 아니라 하네스 자체의 문제로 보게 만드는 근거다.

원인은 이른바 ‘시작 비용’에 있다. 프롬프트가 실제 작업을 시작하기도 전에 하네스는 시스템 프롬프트, 도구 설명, 환경 설정값을 함께 실어 보낸다. 벤치마크는 이 초기 부담이 Aider 아키텍트 모드에서 약 700토큰, OpenClaw에서는 약 2만 6,000토큰이라고 밝혔다. 문제는 이 부담이 한 번으로 끝나지 않는다는 점이다. 매 턴마다 이전 맥락을 다시 보내거나 재구성해야 하므로, 2만 6,000토큰짜리 기반을 가진 하네스가 15턴을 거치면 스캐폴딩에만 약 39만 입력 토큰을 쓰게 된다. 실제로 시작 비용에 턴 수를 곱한 값은 해결 작업당 토큰 수를 두 모델 모두에서 결정계수(R²) 0.99로 예측했다.

같은 시기 Composio는 DeepSeek V4 Flash로 8개 하네스를 비교했다. Airtable, Gmail, Google Calendar, Google Sheets, GitHub, Slack, PostHog를 아우르는 엔터프라이즈 워크플로 30개를 대상으로 900초 제한을 두고 프로그램 방식 검증기로 채점했다. 240회 실행 중 129개 워크플로가 성공했고, 성공한 작업 하나당 비용은 Pi Agent가 0.028달러로 가장 낮았고 Claude Code가 0.195달러로 가장 높았다. DeepAgents는 Claude Code와 동일한 성공률을 기록하면서 성공당 비용은 4분의 1 수준이었다. 다만 Composio 스스로 밝혔듯 Pi는 두 모델 제공사에서 서로 다른 추론 설정을 썼고 Prime Agent는 30개 중 24개만 채점 가능한 결과를 냈다. 이 때문에 이 비교를 완전한 단일 변수 실험이라고 부르기는 어렵다.

Artificial Analysis는 더 큰 표본으로 같은 질문에 접근한다. DeepSWE, Laude Institute의 Terminal-Bench v2.1, Scale AI의 SWE-Atlas-QnA를 합쳐 326개 작업을 각 3회씩 시도해 평균 성공률을 낸다. 여기에 하네스별 비용, 토큰 사용량, 소요 시간을 함께 공개하고, Claude Opus 4.7 모델을 고정한 채 Claude Code, Cursor CLI, Opencode를 바꿔가며 비교한 결과도 별도로 제공한다.

세 벤치마크의 방법론은 서로 다르지만 방향은 일치한다. 에이전트 비용을 줄이려면 모델 교체보다 먼저 하네스의 프롬프트 크기와 대화 턴 수부터 점검하라는 것이다.

Footnotes

  1. The New Stack, “Aider, Claude Code, and OpenClaw ran an identical model. Token use varied 70-fold.” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Aider, Claude Code, and OpenClaw ran an identical model. Token use varied 70-fold. — The New Stack

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.