Neon, AI 모델 42개 토큰 비용·정확도 벤치마크 공개

1분 NeonAI 벤치마크토큰 비용LLM
최근 30일 조회수 — 좋아요 —

핵심 요약

Neon이 고객 지원 티켓 100건으로 42개 AI 모델의 비용, 속도, 정확도를 비교한 벤치마크를 공개했다.

Neon이 42개 AI 모델에 똑같은 업무를 맡기고 토큰 비용과 처리 품질을 비교하는 벤치마크를 공개했다. 실험은 가상의 고객 지원 티켓 100건에 답하는 작업을 놓고, 각 모델이 얼마를 쓰고 얼마나 빨리, 얼마나 정확하게 끝내는지 측정하는 방식으로 진행됐다.[^1]

Neon 블로그에 따르면 결과는 모델별로 크게 갈렸다. 가장 저렴하게 작업을 끝낸 모델은 GPT-5 Nano로, 일부 오픈 웨이트 모델보다도 비용이 낮았고 처리 시간도 3분 정도로 빨랐다. 반면 처리 속도만 놓고 보면 Llama 3.1 8B Instruct가 1분 18초로 가장 빨랐지만, 정작 정답 판정 기준을 통과한 응답은 100건 중 34건에 그쳐 결과물 대부분을 실제로 쓸 수 없었다.

비용이 가장 많이 든 모델은 GPT-5.5 Pro로 100건 처리에 8.34달러가 들었고, 완료까지 57분이 걸려 다른 모델과 비교해 유독 느렸다. Neon은 이를 일회성 지연일 가능성도 있다고 덧붙이면서도, 이 정도로 지연된 사례는 다른 모델에서는 없었다고 밝혔다. 토큰을 가장 많이 소모한 모델은 Qwen3.5 122B-A10B였는데, 이 모델 역시 통과율은 35건에 머물렀다. 정확도 기준으로는 GPT-5.3 Codex가 100건 중 82건을 한 번에 맞혀 가장 높은 통과율을 기록했다.

Neon은 이 결과를 실제 조직 규모에 대입해 비용 차이를 계산했다. 세 번째로 저렴한 모델인 Llama 3.1 8B Instruct와 세 번째로 비싼 Claude Fable 5를 비교했을 때, 엔지니어 한 명이 하루 100만 토큰 규모의 에이전트 작업을 한 건씩 수행한다고 가정하면 엔지니어 50명 조직에서는 월 1만 8천 달러, 500명 조직에서는 월 18만 8천 달러 차이가 발생한다. 모델 선택 하나만으로 86배에 달하는 비용 격차가 벌어질 수 있다는 계산인데, Neon은 이마저 극단적인 값을 고른 비교는 아니라고 덧붙였다.

다만 Neon은 이번 결과를 일반적인 모델 순위로 받아들여서는 안 된다고 선을 그었다. 실험은 단일 업무에 대한 것이고, 통제된 실험실이 아니라 현실적인 조건에서 소규모로 진행됐다는 점을 명시했다. 그럼에도 에이전트가 실무에 더 깊이 들어올수록 토큰 경제성이 조직의 비용 구조에 미치는 영향이 커질 것이라는 게 이번 실험의 결론이다.

벤치마크에 쓰인 티켓 100건은 청구, 제품 문의, 보안 사고, 계정 접근, 환불 등 20가지 시나리오를 고객의 어조(직설적, 긴급, 불만, 다음 단계 요청, 비기술자용)에 따라 다섯 가지 변형으로 작성한 것이다. 모든 요청에는 동일한 시스템 프롬프트와 JSON 응답 형식, 계정 정보, 정책 지침, 기대되는 처리 방향이 포함됐고, 이를 기준으로 응답의 사용 가능 여부를 판정했다. Neon은 이 실험 결과를 인터랙티브 차트와 리포트 형태로 공개했으며, 정기적으로 데이터를 업데이트할 계획이라고 밝혔다.

[^1]: Neon Blog, "Comparing token economics across 42 AI models"

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Comparing token economics across 42 AI models - Neon — Neon Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.