NVIDIA, 기밀 컴퓨팅으로 LLM 추론 성능 손실 5% 이내 억제
최근 30일 조회수 — 좋아요 —핵심 요약
NVIDIA가 TensorRT LLM과 기밀 컴퓨팅을 최적화해 DeepSeek-R1 추론에서 처리량을 96~98% 수준으로 유지했다고 밝혔다.
NVIDIA가 신뢰 실행 환경에서 대규모 언어 모델(LLM) 추론을 돌리면서도 성능 손실을 최소화하는 방법을 공개했다. NVIDIA 테크니컬 블로그에 따르면, 회사는 자사의 기밀 컴퓨팅(Confidential Computing, CC) 기술과 추론 프레임워크 TensorRT LLM을 함께 최적화해, 데이터 암호화로 인한 처리량 저하를 최소화하는 방법론을 제시했다.1
배경은 이렇다. 개인용·기업용·규제 산업용 LLM 추론이 민감한 데이터와 독점 모델 정보를 다루는 경우가 늘면서, 이런 워크로드는 신뢰할 수 있는 환경 안에서 처리돼야 한다는 요구가 커지고 있다. NVIDIA CC는 메모리를 암호화한 기밀 가상머신(Confidential VM), 기밀 GPU, 암호화된 NVLink를 조합해 이 요구를 충족시키는 경로를 제공한다. 문제는 이런 보안 계층을 켜면 메모리 이동, 타이밍, 스케줄링, 다중 GPU 통신에 관한 기존 가정이 달라진다는 점이다. 추론 런타임이 이 변화에 맞춰 조정되지 않으면 성능 오버헤드가 발생하기 때문에, NVIDIA는 CC 환경과 TensorRT LLM을 함께 튜닝하는 방식을 택했다.
성능 영향을 정확히 측정하려면 오버헤드가 잘 드러나는 워크로드를 골라야 한다. 요청량이 많으면 암호화로 인한 고정 비용이 다른 작업과 겹쳐 흡수되면서 오버헤드가 잘 보이지 않는다. 반대로 입력 컨텍스트가 길고, 출력 생성이 길며, 동시 요청 수가 적은 조건에서는 이 비용이 뚜렷하게 나타난다. 긴 컨텍스트는 프리필(prefill) 단계의 데이터 이동 부담을 키우고, 긴 생성 구간은 토큰당 작은 CC 오버헤드를 누적시키며, 낮은 동시성은 여러 요청에 비용을 분산시킬 여지를 줄이기 때문이다. NVIDIA 성능 엔지니어링팀은 이 세 조건을 갖춘 워크로드로 nvidia/DeepSeek-R1-0528-NVFP4 모델을 골라, 입력 32K·출력 1K 토큰 시퀀스에 동시 요청 수를 1, 2, 4, 8, 16으로 바꿔가며 테스트했다. 하드웨어는 NVIDIA B200 GPU 8기로 구성된 DGX B200 한 대, 병렬화는 텐서 병렬 8(TP=8)을 적용했고 KV 캐시는 FP8로 운용했다.
측정 방식은 같은 워크로드를 CC를 끈 상태와 켠 상태에서 각각 돌려 비교하는 것이다. 모델, 하드웨어, 프레임워크 버전, 시퀀스 길이, 병렬화, 동시성은 모두 고정하고 CC 활성화 여부만 바꿔, 출력 토큰당 처리량 유지율과 토큰당 지연시간(Time Per Output Token, TPOT) 증가율 두 지표로 오버헤드를 계산했다. 플랫폼은 인텔 TDX(Trust Domain Extensions)를 기반으로 했고, 호스트는 우분투 25.10, 게스트 VM은 우분투 24.04.4 LTS에 256개 가상 CPU를 배정했다. TensorRT LLM은 1.3.0rc22 버전, CUDA 13.2, NCCL v2.30을 사용했다.
결과는 동시 요청 116 구간에서 CC를 켰을 때 출력 토큰 처리량이 CC를 껐을 때 대비 96.198.2%를 유지하는 것으로 나타났다. 즉 기밀 컴퓨팅을 활성화해도 처리량 손실이 2~4% 수준에 그쳤다는 뜻이다. 다만 자료에서 확인할 수 있는 내용은 이 처리량 수치까지이며, TPOT 증가율의 구체적인 값은 공개된 원문 발췌에 포함돼 있지 않아 확인할 수 없다.
이번 결과는 NVIDIA가 자체 실시한 벤치마크이자 발표 자료에 근거한 것으로, 단일 모델(DeepSeek-R1)과 단일 하드웨어 세대(Blackwell 기반 B200)에서 나온 수치라는 한계가 있다. 다른 모델 크기나 워크로드 특성에서도 같은 수준의 오버헤드 억제가 재현되는지는 별도 검증이 필요하다.
Footnotes
-
NVIDIA Technical Blog, “Enabling Private High-Performance Production AI Inference with NVIDIA Confidential Computing” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Enabling Private High-Performance Production AI Inference with NVIDIA Confidential Computing | NVIDIA Technical Blog — NVIDIA Technical Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.