NVIDIA, Dynamo-Triton에 TensorRT 멀티 GPU 추론 통합

3분 NVIDIADynamo-TritonTensorRTCosmos
최근 30일 조회수 — 좋아요 —

핵심 요약

NVIDIA가 TensorRT 멀티 디바이스 추론을 Dynamo-Triton에 통합해 단일 gRPC 호출로 여러 GPU 분산 서빙을 지원한다.

TensorRT 멀티 디바이스 추론(multi-device inference)은 NCCL 기반 분산 집합 연산을 사용해 하나의 TensorRT 네트워크를 여러 GPU에서 실행하는 기능이다. Dynamo-Triton은 이 과정을 서버 쪽으로 옮겼다. KIND_MODEL 인스턴스 하나가 여러 GPU를 소유하면서 랭크별 TensorRT 실행 컨텍스트, CUDA 스트림, NCCL 통신자를 만들고, 요청이 들어올 때마다 모든 랭크를 함께 구동하는 구조다. 즉 애플리케이션은 이름 붙은 모델 하나를 호출할 뿐이고, 랭크와 통신자의 생명주기 관리 코드는 클라이언트 밖으로 빠진다. NVIDIA는 이를 통해 팀들이 GPU 자원을 더 투입하는 대가로 요청 지연 시간을 줄이면서도, 애플리케이션 인터페이스와 주변 워크플로는 그대로 유지하고 엔진을 버전이 붙은 Triton 모델로 패키징할 수 있다고 설명한다.

블로그는 이 통합을 NVIDIA Cosmos 3 Nano 비디오 생성 모델로 시연했다. Diffusers가 프롬프트, 잠재변수(latent), 분류자유guidance(CFG), 스케줄링, VAE 디코딩, 프레임 후처리를 계속 담당하는 동안, 36개 레이어로 구성된 디노이징 트랜스포머는 Dynamo-Triton이 서빙한다. 이 트랜스포머는 단일 GPU 기준 전체 생성 시간의 93.4%를 차지해 가속 효과가 가장 큰 구간으로 지목됐다. 35단계 디노이징 스텝마다 CFG를 위해 조건 없는 예측과 프롬프트 조건부 예측을 각각 한 번씩 수행해야 하므로, Diffusers 프록시는 스텝당 두 번씩 Triton을 호출해 생성 한 건당 총 70회의 트랜스포머 RPC가 발생한다.

분산 방식은 Ulysses 컨텍스트 병렬화(context parallelism)를 사용한다. Cosmos 3 Nano의 고정 프로파일은 4만 4,160개의 비디오 토큰을 만들어내는데, 8개 GPU로 나누는 CP8 구성에서는 랭크마다 어텐션 바깥 구간에서 5,520개 토큰을 처리한다. 상대적으로 짧은 2,992개 토큰짜리 텍스트 경로는 각 랭크에 복제해 두며, 36개 트랜스포머 레이어 안에서 Ulysses는 어텐션을 사이에 두고 파티셔닝 축을 전환하는 방식을 쓰는데, 그 구체적인 전환 방식까지는 자료에 명시되어 있지 않다.

이 분산 그래프는 배포 전 TensorRT 플랜 자체에 컴파일된다. Dynamo-Triton 설정은 이미 컴파일된 분산 플랜을 활성화하는 역할만 하며, 단일 GPU용 엔진을 런타임에 분산 엔진으로 바꿔주지는 않는다. 실제로 블로그가 공개한 8-GPU(CP8) config.pbtxt 예시를 보면, backend는 "tensorrt" 그대로이고 instance_group에 KIND_MODEL을 지정한 뒤 enable_multi_device를 "true"로, multi_device_gpus에 "0,1,2,3,4,5,6,7"을 넣는 식으로 참여할 GPU 랭크를 명시한다. 단일 GPU 베이스라인은 GPU 0 하나만 쓰는 표준 모델 인스턴스이고, 2·4·8 GPU 구성은 이 방식대로 랭크 수만 늘려가는 구조다.

이번 사례는 이전 게시물 “Scaling AI Inference Across Multiple GPUs Using NVIDIA TensorRT with Multi-Device Inference Support”에서 다룬 TensorRT 멀티 디바이스 기능을, 실제 추론 서버 제품에 통합해 서비스 형태로 소비 가능하게 만든 후속편에 해당한다. 다만 이번 자료에는 CP2·CP4·CP8 구성별 구체적인 지연 시간이나 처리량 수치는 제시되지 않았다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Simplifying Model Serving Across Multiple GPUs with NVIDIA TensorRT Multi-Device Integration in NVIDIA Dynamo-Triton | NVIDIA Technical Blog — NVIDIA Technical Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.