NVIDIA, AI 팩토리용 인프라 5종 동시 공개
최근 30일 조회수 — 좋아요 —핵심 요약
NVIDIA가 네트워크·전력 병목을 겨냥한 스펙트럼-X, 블루필드-4, 베라 루빈, 베라 CPU, DSX MaxLPS를 하루에 발표했다.
NVIDIA가 2026년 8월 24일 하루 동안 기술 블로그에 AI 팩토리용 신규 인프라 다섯 건을 한꺼번에 공개했다. 스펙트럼-X(Spectrum-X) 이더넷, 블루필드-4(BlueField-4) 기반 Scale-In 네트워크, 베라 루빈(Vera Rubin) NVL72와 블랙웰(Blackwell) GB300의 전력 대비 성능 벤치마크, 에이전틱 워크로드용 베라(Vera) CPU, 전력 배분 기술 DSX MaxLPS다. 다섯 발표 모두 초거대 GPU 클러스터를 운영할 때 병목이 되는 지점—네트워크, 보안·데이터 이동, 전력—을 겨냥한다.
전통적인 이더넷은 ECMP 해시 라우팅으로 다수의 소규모 트래픽을 분산하도록 설계됐지만, AI 학습 트래픽은 All-Reduce·All-Gather 같은 소수의 대형 동기화 플로우로 이뤄져 해시 충돌, 손실·무손실 전환 문제, 느린 혼잡 제어, 테넌트 격리 실패가 발생한다. NVIDIA에 따르면1 DeepSeek-V3 학습 시뮬레이션에서 표준 이더넷은 단독 실행 시 학습 스텝 시간이 735ms였다가 배경 트래픽이 섞이면 1.18초로 1.6배 늘었지만, 스펙트럼-X 이더넷은 단독·혼잡 조건 모두에서 668ms로 사실상 성능 저하가 없었다.
두 번째 발표는 블루필드-4 DPU와 DOCA, 스펙트럼-X 이더넷으로 구성되는 Scale-In이다2. NVIDIA는 이를 스케일업(NVLink), 스케일아웃(스펙트럼-X/퀀텀 인피니밴드), 스케일어크로스(스펙트럼-XGS)에 이은 다섯 번째 네트워킹 축으로 설명한다. 보안, 데이터 이동, 테넌트 격리, 운영 같은 north-south 트래픽 처리를 호스트 CPU에서 떼어 DPU로 전담시키는 것이 핵심으로, 에이전트와 외부 데이터 소스가 끊임없이 상호작용하는 에이전틱 AI 팩토리에서 이 트래픽이 늘면서 나온 대응이다.
세 번째 글은 SemiAnalysis의 오픈소스 벤치마크 InferenceX 산하 AgentX 결과를 인용한다3. AgentX는 고정 길이 프롬프트 대신 실제 Claude Code 세션을 재생해 프리필, KV 캐시 재사용, 도구 호출 지연 같은 에이전틱 워크로드 특성을 반영해 메가와트당 토큰 처리량을 측정한다. 이 벤치마크에서 베라 루빈 NVL72 프리뷰는 GB300 NVL72 대비 메가와트당 처리량이 최대 30배 높았고, 블랙웰 GB300 NVL72는 이전 세대 대비 자릿수 단위로 앞서던 메가와트당 처리량 우위를 동적 에이전틱 워크로드에서도 그대로 유지했다.
네 번째 글은 에이전트 오케스트레이션과 툴 실행을 맡는 CPU 쪽 문제를 다룬다4. NVIDIA가 16만3594건의 에이전틱 세션을 텔레메트리로 분석한 결과 97% 이상이 서로 다른 실행 궤적을 보였고, 대부분의 시간은 순차적 추론 체인이 차지하면서 간헐적으로 병렬 작업이 터지는 패턴이었다. 특정 툴 호출 시나리오에 맞춰 CPU를 세분화하기보다 순차 경로의 단일 스레드 성능과 팬아웃 구간의 동시성을 함께 갖춘 단일 균형점이 필요하다는 게 NVIDIA의 설명이고, 베라 CPU를 그 설계로 제시했다.
마지막은 전력 배분이다5. NVIDIA가 제시한 100MW 규모 AI 팩토리 사례에서는 시설 오버헤드에 20MW, 랙 손실에 10MW, 장애·재시작·체크포인팅 같은 운영 비효율에 10MW가 빠져나가 실제 컴퓨트에 쓰이는 전력은 60MW에 그친다. 기존 방식은 각 랙에 최대 부하를 가정해 전력을 정적으로 배분해, 한 랙에서 남는 여유 전력을 다른 랙이 쓰지 못하고 묶여 있었다. DSX MaxLPS는 개발자 프리뷰 단계인 Dynamic Power Software로 유틸리티부터 랙·노드·GPU까지 전력 토폴로지를 모델링해 여유 전력을 실시간 재배분하고, 45도 온수 냉각으로 냉각 오버헤드를 줄여 같은 전력 예산 안에서 더 많은 컴퓨트를 끌어낸다.
다섯 건 모두 NVIDIA 자체 기술 블로그에 실린 발표이며, 성능 수치는 NVIDIA가 진행했거나 인용한 벤치마크(AgentX, DeepSeek-V3 시뮬레이션)에 근거한다. 독립적인 제3자 검증 결과는 아직 확인되지 않았다.
Footnotes
-
NVIDIA Technical Blog, “Giga-Scale AI and the Ethernet Evolution: How Spectrum-X Ethernet Rewrites the Rules” ↩
-
NVIDIA Technical Blog, “NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories” ↩
-
NVIDIA Technical Blog, “NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt” ↩
-
NVIDIA Technical Blog, “Solving Agentic AI Fleet Challenges with NVIDIA Vera CPU” ↩
-
NVIDIA Technical Blog, “Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Giga-Scale AI and the Ethernet Evolution: How Spectrum-X Ethernet Rewrites the Rules | NVIDIA Technical Blog — NVIDIA Technical Blog
- NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories | NVIDIA Technical Blog — NVIDIA Technical Blog
- NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt | NVIDIA Technical Blog — NVIDIA Technical Blog
- Solving Agentic AI Fleet Challenges with NVIDIA Vera CPU | NVIDIA Technical Blog — NVIDIA Technical Blog
- Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS | NVIDIA Technical Blog — NVIDIA Technical Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.