토스, 자체 LLM 벤치마크 'Toss Benchmark' 구축 공개

3분 TossLLM벤치마크한국어평가
최근 30일 조회수 — 좋아요 —

핵심 요약

토스가 공개 리더보드와 실제 서비스 성능 간 격차를 검증하기 위해 한국어·추론설정·도메인지식을 반영한 자체 벤치마크 구축 과정을 공개했다.

토스가 자체 벤치마크 ‘Toss Benchmark’ 구축 과정을 공개했다. 공개 리더보드에서 1등을 차지한 대형언어모델(LLM)이 실제 서비스에서도 같은 성능을 내는지 검증하기 위한 작업으로, LLM Modeling 팀이 한정된 GPU 자원으로 서빙할 모델을 고르고 자체 파운데이션 모델인 Toss Foundation이 갖춰야 할 능력을 정하는 기준으로 만들었다고 토스테크는 16일 밝혔다.1

토스는 상품 카탈로그 생성, 카드 약관 분석, 광고 검수는 물론 토스쇼핑 입점 판매자를 응대하는 음성 에이전트, 고객 정보를 조회하는 상담 에이전트까지 금융·커머스·광고·사내 개발 영역 전반에 LLM을 쓰고 있다. Toss Benchmark는 이런 업무의 실제 데이터와 프롬프트를 모아 성능을 측정하며, 한국어 범용 성능과 토스 도메인 성능을 함께 본다.

토스테크에 따르면 문제는 두 갈래다. 첫째는 언어다. 같은 수학·코딩 문제를 영어 원문과 한국어 번역본으로 각각 평가했더니 순위가 뒤집혔다. 영어 점수 81.74점을 받은 gemma-4-26B-A4B-it은 79.74점이던 Qwen3.6-27B에 한국어 수학에서 밀렸고, 코딩에서도 영어 점수가 더 높았던 Qwen3.5-122B-A10B가 한국어에서는 Qwen3.6-27B에 뒤졌다. 지식 평가에서는 아예 다른 벤치마크를 썼는데, 영어 평가에서 앞섰던 Qwen3.5-122B-A10B와 Qwen3.5-35B-A3B 대신 한국어권 지식과 문화적 맥락을 다루는 평가에서는 gemma-4-26B-A4B-it이 가장 높은 점수를 받았다.

둘째는 추론(Reasoning) 설정이다. 답변 전에 추론 과정을 생성하는 Reasoning 모드는 문제 해결에 도움이 될 수 있지만, 실제 서비스에서는 비용과 응답 시간 때문에 끄거나 최소화하는 경우가 많다. 토스테크가 같은 코딩 평가를 Reasoning을 켠 상태와 끈 상태로 비교한 결과, 모델별 하락 폭 차이가 컸다. GLM-5.1은 30.6점, Kimi-K2.6은 26.4점 떨어진 반면 gemma-4-26B-A4B-it은 6.0점만 떨어졌다. 순위도 뒤집혔다. Reasoning을 켰을 때는 GLM-5.1(78.7점)이 DeepSeek-v4-pro(76.9점)보다 앞섰지만, 껐을 때는 DeepSeek-v4-pro(57.8점)가 GLM-5.1(48.1점)을 앞질렀다. 추론을 허용한 평가에서 고른 모델이 실제 운영 설정에서는 최선이 아닐 수 있다는 뜻이다.

언어와 추론 설정을 서비스 환경에 맞춰도 도메인 지식은 별도로 검증해야 한다고 토스테크는 설명한다. 예로 든 상품 카탈로그 작업에서는 “캐치프레소 모비오 더블 에스프레소 멜로아 캡슐 3슬리브, 총 255g”라는 상품명을 브랜드·상품명·호환 기기·수량·총중량 속성으로 분리해야 하는데, ‘모비오’는 캡슐의 맛이 아니라 호환되는 머신 이름이고 ‘더블’은 묶음 수가 아니라 커피 종류를 가리킨다. 한 슬리브에 캡슐 10개가 들어간다는 카테고리별 지식이 있어야 ‘3슬리브’를 ‘30EA’로 정확히 환산할 수 있다. 토스테크는 이런 해석이 범용 문자열 처리만으로는 안정적으로 되지 않고, 카테고리별 상품 지식과 서비스 정책을 함께 알아야 한다고 밝혔다.

결국 Toss Benchmark는 공개 리더보드 순위를 대체하기보다, 한국어·추론 설정·도메인 지식이라는 세 조건을 실제 서비스 기준에 맞춰 다시 측정하는 보완 장치로 만들어졌다. 토스테크는 평가 대상을 계속 추가하고 있다고 전했다.

Footnotes

  1. Toss Tech, 「리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기」 ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. 리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기 — Toss Tech

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.