NVIDIA, NVLink 6로 AI 팩토리 다층 장애 복원력 강화
최근 30일 조회수 — 좋아요 —핵심 요약
NVIDIA가 물리·시스템·소프트웨어 계층을 아우르는 NVLink 6의 다층 복원력 프레임워크로 AI 팩토리 장애를 탐지·격리·복구한다고 밝혔다.
NVIDIA가 차세대 인터커넉트 NVLink 6를 통해 AI 팩토리의 다층 장애 복원력을 대폭 강화했다고 밝혔다. NVIDIA 테크니컬 블로그에 따르면 NVLink 6는 물리 계층부터 애플리케이션 계층까지 하드웨어·시스템 설계·소프트웨어를 통합한 다층 복원력 프레임워크를 통해 순간적인 신호 오류를 원천에서 탐지, 격리, 복구한다.
대규모 AI 훈련에서는 클러스터 내 모든 GPU가 초당 수천 건의 집합 연산(collective operation)에 걸쳐 그래디언트를 동기화해야 하고, 추론 단계에서는 예기치 못한 다운타임이 곧바로 처리 가능한 요청량 감소로 이어져 매출에 직접 영향을 준다. NVIDIA는 이런 초대형 배치 환경에서 일시적 오류, 링크 성능 저하, 노드 중단이 “수학적으로 필연”이라고 설명하며, 패킷 손실 없는 무손실(lossless) 패브릭이 프로덕션 AI 인프라의 전제 조건이라고 강조했다.
이 기술은 NVIDIA의 차세대 풀스택 AI 팩토리 플랫폼 Vera Rubin의 핵심 구성 요소다. 플랫폼의 랙 스케일 컴퓨팅 엔진인 Vera Rubin NVL72는 NVLink 6 스케일업 네트워킹 패브릭으로 Rubin GPU 72개를 하나의 스케일업 도메인으로 연결해, 이들이 단일 컴퓨팅 유닛처럼 작동하게 한다.
NVIDIA는 이 복원력을 세 개 층으로 구분해 설명한다. 첫째, 물리·링크 계층에서는 순방향 오류 정정(FEC, Forward Error Correction), 물리 계층 재시도(PLR, Physical Layer Retry), 범용 물리 계층(UPHY, Universal Physical Layer) 복구 기법을 결합해 빠른 오류 정정과 링크 안정성을 확보한다. 여기에 크레딧 기반 흐름 제어(CBFC, Credit-Based Flow Control)로 패킷 드롭을 수학적으로 제거하고, 능동적 오류 격리로 결함이 확산되기 전에 즉시 차단한다. NVIDIA는 이 지점에서 범용 네트워킹 패브릭이 쓰는 표준 FEC 알고리즘이 처리 오버헤드와 다중 홉 지연을 유발한다고 지목하며, NVLink 6는 밀결합 스케일업 AI 워크로드에 맞춰 설계돼 이런 무거운 방식을 피한다고 밝혔다.
둘째, 시스템 설계 계층에서는 단일 장애점(SPOF)을 없애는 데 중점을 뒀다. 중복 스위치 트레이, 분산된 NMX 컨트롤러, 이중화된 아웃오브밴드 관리 경로를 갖춰 개별 구성 요소가 손실돼도 도메인 전체는 계속 작동한다.
셋째, 애플리케이션·소프트웨어 계층에서는 Dynamo Shadow Engine Recovery가 사전에 준비된 복제 프로세스를 활용해 거의 즉각적인 장애 전환(failover)을 수행하고, 애플리케이션 수준의 체크포인트·복구 메커니즘으로 장시간 실행되는 작업이 중단 없이 보존되도록 한다.
NVIDIA는 이런 통합적 다층 접근이 하드웨어 이상을 매끄럽게 격리하고 실행 중인 워크로드를 방해 없이 보호하는 유일하게 검증된 방식이라고 주장한다. 다만 이는 NVIDIA 자체 발표에 담긴 설명으로, 실제 대규모 배치 환경에서의 성능 검증이나 제3자 측정치는 이번 블로그 글에 포함돼 있지 않다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- How NVIDIA NVLink 6 Delivers Multi-Layer Resiliency for AI Factories | NVIDIA Technical Blog — NVIDIA Technical Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.