Qwen, 오픈웨이트 최대 모델 Qwen3.8-2.4T-A95B 공개
최근 30일 조회수 — 좋아요 —핵심 요약
Qwen 팀이 2.4조 파라미터에 활성 파라미터 950억 개인 하이브리드 MoE 모델을 오픈웨이트로 공개했다.
Qwen 팀이 8월 12일 콴-맥스(Qwen-Max)급 모델을 처음으로 오픈웨이트로 공개했다. AWS 머신러닝 블로그에 따르면 이번에 나온 ‘Qwen3.8-2.4T-A95B’는 총 2.4조 개 파라미터를 갖췄으면서 토큰당 실제로 활성화되는 파라미터는 950억 개뿐인 구조로, 지금까지 가중치가 공개된 콴 시리즈 중 가장 크고 성능이 높은 모델이다.1
Qwen3.8-2.4T-A95B는 미세 단위 전문가 혼합(fine-grained MoE) 구조를 쓴다. 512개의 라우팅 전문가와 1개의 공유 전문가로 구성돼 있고, 토큰마다 이 중 10개만 활성화된다. 큰 전문가 몇 개를 두는 대신 작은 전문가를 촘촘히 배치해 라우팅 효율과 전문화를 높인 방식이다. 서빙 비용은 전체 2.4조 파라미터가 아니라 실제 활성화되는 950억 파라미터를 기준으로 계산된다는 점이 이 구조의 핵심이다.
92개 레이어는 “게이티드 델타넷(Gated DeltaNet) 3개 → MoE, 게이티드 어텐션(Gated Attention) 1개 → MoE”를 반복하는 하이브리드 배열을 따른다. 92개 레이어 중 69개는 선형 어텐션인 게이티드 델타넷으로, KV 캐시가 계속 커지는 대신 크기가 고정된 순환 상태(recurrent state)를 쓴다. 나머지 23개는 완전한 2차 어텐션인 게이티드 어텐션으로 토큰 간 관계를 정밀하게 계산한다. 이 3대1 비율 덕분에 컨텍스트가 늘어나도 연산량과 메모리 사용량이 일정 범위 안에 묶인다. 네이티브 컨텍스트 윈도우는 26만 2144토큰이고 최대 101만 토큰까지 확장할 수 있는데, 도구 호출 결과나 코드, 추론 과정을 여러 턴에 걸쳐 계속 쌓아가는 에이전트형 작업에서는 이 확장성이 실질적인 차이를 만든다.
모델은 멀티 토큰 예측(Multi-Token Prediction, MTP) 드래프트 헤드를 기본으로 포함해 별도 모델 없이도 추측 디코딩(speculative decoding)이 가능하다. 추론 강도를 조절하는 reasoning_effort 파라미터(low/medium/high)도 제공돼, 어려운 다단계 문제에는 강도를 올리고 처리량이 중요한 작업에는 낮추는 식으로 요청 단위로 연산량을 조절할 수 있다.
가중치는 허깅페이스(Hugging Face)에 표준 트랜스포머(Transformers) 포맷으로 공개됐고, 커뮤니티가 만든 MXFP4·NVFP4(W4A4) 양자화 버전은 용량이 약 1.2TB로 줄어 8-GPU 노드 한 대에 올라갈 수 있다. AWS 블로그는 이 양자화 버전을 엔비디아(NVIDIA) B300 블랙웰 울트라 GPU 8장을 탑재한 ml.p6-b300 인스턴스에서 vLLM으로 서빙하는 방법을 다뤘으며, 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)에 클러스터를 구성하는 것부터 NVFP4 양자화, 도구 호출, MTP 추측 디코딩을 적용한 OpenAI 호환 엔드포인트를 띄우는 것까지 전 과정을 소개했다. 이는 앞서 다룬 키미 K3(Kimi K3) 배포 사례에 이어 조 단위 파라미터 오픈모델을 하이퍼팟에 올리는 시리즈의 두 번째 글이다.
벤더가 공개한 벤치마크에서는 연구형 작업을 평가하는 페이퍼벤치(PaperBench)에서 93.0점, 지시 이행을 보는 IFBench에서 82.8점을 기록했고, 터미널 기반 코딩 벤치마크 점수는 86점대로 소개됐다. 다만 이 수치는 모두 벤더 측 발표 자료를 인용한 것으로, 독립적인 검증 결과는 아직 확인되지 않았다.
Footnotes
-
AWS Machine Learning Blog, “Deploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLM” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Deploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLM | Amazon Web Services — AWS Machine Learning Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.