GLM-5.3 캐스케이드, DeepSWE 80.9%를 57% 싼값에 해결

3분 GLM-5.3DeepSWETogether AI모델 캐스케이드
최근 30일 조회수 — 좋아요 —

핵심 요약

Together AI 테스트에서 GLM-5.3 Flash 우선 후 전체 모델로 넘기는 캐스케이드가 DeepSWE 벤치마크 점수와 비용을 동시에 개선했다.

GLM-5.3 Flash를 먼저 돌리고, 테스트가 답을 거부할 때만 전체 모델 GLM-5.3으로 넘기는 방식(캐스케이드)을 쓰면 DeepSWE 벤치마크 과제의 80.9%를 건당 1.70달러에 풀 수 있다. GLM-5.3 단독으로는 69.0%를 건당 3.99달러에 푼다. Together AI가 2026년 8월 28일 블로그에 공개한 이 결과는, 점수는 12점 오르고 비용은 57% 낮아진 조합이다.

DeepSWE는 여러 유형의 과제와 여러 프로그래밍 언어에 걸쳐 모델의 소프트웨어 엔지니어링 능력을 측정하는 벤치마크다. GLM-5.3과 GLM-5.3 Flash는 같은 계열의 두 크기로, GLM-5.3이 공개 가중치 전체 모델이고 Flash는 이를 증류한 경량판이다. Together AI는 공개된 시행별 기록을 바탕으로 두 모델을 DeepSWE 113개 과제 전부에 대해 각각 네 번씩 돌려 총 900회 롤아웃(전체 모델 452회, Flash 448회)을 수집해 비교했다. 이 수치는 회사가 직접 실행한 결과로, 다른 공개된 GLM-5.3 대 GLM-5.3 Flash 채점표와는 다를 수 있다고 밝혔다.

단발 시도(pass@1)에서는 전체 모델이 69.0%로 Flash의 63.4%보다 5.6점 앞선다. 하지만 이 격차는 첫 시도에서만 두드러지는 현상이다. 두 번 시도(pass@2)하면 격차가 4점으로, 네 번 시도(pass@4)하면 87.6% 대 85.0%로 2.6점까지 좁혀진다. 즉 재시도를 허용하는 작업이라면 품질 차이는 3점 미만인데 비용은 17분의 1이다. 가격 자체도 롤아웃당 3.99달러 대 0.24달러로 17배 차이가 나며, 100달러를 쓴다고 가정하면 전체 모델은 17개 과제를, Flash는 264개 과제를 푸는 셈이다.

Together AI는 이 pass@1과 pass@4 격차의 차이를 증류가 실제로 깎아낸 것이 ‘능력’이 아니라 ‘일관성’이라는 근거로 든다. 각 과제를 네 번 시행 모두 실패(월), 일부만 성공(플레이키), 모두 성공(솔리드)으로 분류해 비교한 결과, 전체 모델이 네 번 다 성공한 48개 과제 중 Flash에서 완전히 풀리지 않게 된 과제는 하나도 없었다. 절반은 여전히 완전히 안정적으로 풀렸고, 나머지 절반만 일관성을 잃었다. 전체 모델이 최소 한 번이라도 푼 99개 과제 기준으로는 Flash가 그중 93개, 94%를 여전히 풀었다. Flash는 오히려 전체 모델이 불안정했던 15개 과제를 안정화시켰고, 전체 모델이 아예 풀지 못한 3개 과제도 뚫었다.

다만 Flash가 만능은 아니다. 결과가 들쭉날쭉한 과제에서 더 오래 실행한 쪽이 실제로 통과할 확률은 전체 모델이 61%인 데 반해 Flash는 46%로, 동전 던지기(50%)에도 못 미친다. 시간을 더 들인다고 해서 Flash가 그만큼 성공률로 전환하지는 못한다는 뜻이다. 회귀도 한 가지 확인됐다. 이미 통과하던 기준 테스트를 다시 깨뜨리는 비율이 Flash는 6.9%, 전체 모델은 4.4%로, Flash 쪽이 더 높다. Together AI는 이 때문에 Flash를 쓸 때는 회귀 테스트로 걸러내야 한다고 권고했다.

속도 면에서는 통상적인 경량 모델의 트레이드오프—토큰당 처리는 느리지만 저렴하다는 공식—가 나타나지 않았다. Flash는 평균 26분 만에 작업을 마쳐 전체 모델의 35분보다 빠르다. 그렇다고 단계를 건너뛰는 것도 아니어서, 실행 스텝 수는 Flash가 123개, 전체 모델이 125개로 거의 같다. Together AI는 속도 차이 전부가 스텝당 지연 시간에서 나오며, 그 차이는 12라고 설명했다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing — Together AI Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.