NVIDIA NIM 최적화로 Nemotron 3 Ultra 동시 사용자 2.5배 증가

3분 NVIDIANIMNemotron추론 최적화
최근 30일 조회수 — 좋아요 —

핵심 요약

NVIDIA가 NIM 2.0.12 최적화 스택으로 Nemotron 3 Ultra 서빙 시 B200 GPU 환경에서 처리량을 초당 718토큰에서 1,997토큰으로 늘렸다고 밝혔다.

NVIDIA는 자사 개발자 블로그를 통해 Nemotron 3 Ultra 모델을 서빙할 때 NIM(NVIDIA Inference Microservice) 최적화 스택을 적용하면 동일한 GPU 인프라에서 동시 사용자 처리량을 최대 2.5배 늘릴 수 있다고 밝혔다. B200 GPU 4장으로 구성한 벤치마크 환경에서 최적화를 적용하지 않은 오픈소스 기반 서빙 스택은 초당 718토큰을 처리했지만, NIM 2.0.12로 최적화한 스택은 초당 1,997토큰을 처리했다.

이번 벤치마크는 에이전틱(agentic) AI 워크로드를 가정해 설계됐다. 컨텍스트 길이 64K, 요청당 400토큰, KV 캐시 재사용률 76%, 사용자당 초당 50토큰(추론 간 지연시간 20ms) 조건을 적용했다. NVIDIA는 에이전틱 워크로드가 프롬프트가 길고 단계마다 컨텍스트를 재사용하며 응답을 스트리밍으로 길게 이어가는 특성이 있어, 이런 조건에서의 서빙 효율이 특히 중요하다고 설명했다.

NVIDIA에 따르면 2.5배라는 수치는 단일 기능이 아니라 여러 최적화가 맞물려 나온 결과다. 정밀도 조정과 GPU에 맞춘 커널 오토튜닝이 우선 꼽힌다. Nemotron 3 Ultra처럼 전문가 혼합(MoE)과 맘바(Mamba) 구조를 섞은 하이브리드 아키텍처를 NVIDIA Blackwell GPU에 효율적으로 매핑하도록 커널을 자동 조정했다. 병렬 실행 측면에서는 텐서 병렬화로 모델을 4개 GPU에 분산하고, MoE 레이어의 GPU 활용도를 높이는 전문가 인지형 실행 방식을 함께 적용했다.

프리픽스와 모델 상태 재사용도 핵심 축이다. 반복되는 컨텍스트를 다시 계산하지 않는 프리픽스 캐싱, 프리픽스 일부만 일치해도 재사용 효과를 살리는 부분 일치 매칭, 그리고 맘바 구조에 맞춘 상태 캐시 튜닝이 여기에 해당한다. 여기에 동시 처리 시퀀스 수, 배치 토큰 한도, 블록 크기, GPU 메모리 할당을 조정하는 스케줄러·배칭·메모리 튜닝이 더해져 지연시간 목표를 넘기지 않으면서 더 많은 작업을 동시에 처리하도록 만든다. 마지막으로 MTP(Multi-Token Prediction) 추측 디코딩과 관련 수정 사항도 이번 최적화 스택에 포함됐는데, NVIDIA는 이 기법의 효과가 토큰 수용률과 남는 메모리 여유에 따라 달라진다고 설명했다.

NVIDIA는 이 수치가 모든 애플리케이션에 그대로 적용된다는 보장은 아니라고 선을 그었다. 공개한 성능 곡선은 시작점일 뿐이며, 실제 적합성을 확인하려면 자신의 트래픽을 재현해 지연시간 지표 기준으로 파레토 곡선을 직접 그려봐야 한다고 권고했다. 이를 위해 NIM 2.0.12 이상 버전을 정확히 배포할 것을 권장 사항으로 제시했다.

NIM은 모델과 GPU에 맞는 서빙 설정을 검증된 형태로 패키징한 마이크로서비스다. 개발자가 빈 런타임 설정에서 시작하는 대신 NVIDIA가 검증한 서빙 구성과 지원되는 배포 경로를 받아 쓸 수 있으며, 필요하면 자신의 트래픽으로 벤치마크해 조정할 수 있다. 프로덕션 환경을 위한 NIM Certified는 여기에 정기적인 추론 스택 업데이트, CVE 대응, 더 넓은 하드웨어 검증, NVIDIA AI Enterprise를 통한 상업적 지원을 추가로 제공한다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. How Full-Stack NIM Optimizations Deliver 2.5x More Users on Nemotron 3 Ultra | NVIDIA Technical Blog — NVIDIA Technical Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.