NVIDIA, GPU 클러스터 검증·변경 오픈소스 도구 공개

2분 NVIDIA쿠버네티스GPU 클러스터오픈소스
최근 30일 조회수 — 좋아요 —

핵심 요약

NVIDIA가 대규모 GPU 클러스터의 사전 검증용 NVCRE와 운영 중 안전한 구성 변경용 노드라이트를 오픈소스로 공개했다.

NVIDIA가 대규모 GPU 클러스터를 AI 워크로드에 투입하기 전 상태를 검증하고 운영 중에도 안전하게 구성을 바꿀 수 있는 오픈소스 도구 두 종을 공개했다. NVIDIA 클러스터 준비 엔진(NVCRE, NVIDIA Cluster Readiness Engine)과 노드라이트(NodeWright)로, 두 프로젝트 모두 2026년 9월 23일 NVIDIA 테크니컬 블로그를 통해 소개됐다.

NVCRE는 쿠버네티스 위에서 동작하는 컨트롤러다. 문제의 출발점은 헬스체크 통과와 실제 워크로드 성능이 별개라는 점이다. GPU, 네트워크 링크, 파드가 모두 정상으로 표시돼도 512개 GPU 규모의 학습 작업이 느려지거나 실패할 수 있다. 느려진 GPU 하나, 부하가 걸릴 때만 열화되는 링크, 트래픽을 조용히 느린 경로로 보내는 설정이 원인이 될 수 있는데, 이런 문제는 작업이 몇 시간 진행된 뒤에야 발견되거나 고객 티켓으로 처음 드러나는 경우가 많다. 그러면 운영팀은 원인을 찾기 위해 며칠씩 클러스터를 이분 탐색해야 하고, 그동안 용량은 놀게 된다.

NVCRE는 실제 분산 워크로드를 토폴로지 인식 노드 그룹 단위로 돌려 결과를 측정하고, 어떤 노드가 어떤 테스트에서 실패했는지 짚어준다. Slurm에서는 srun 명령 하나로 되는 일이지만 쿠버네티스에는 이에 대응하는 기본 기능이 없어, GPU·RDMA 자원 요청과 네트워크 페브릭에 맞춘 NCCL 설정, 충분한 공유 메모리 볼륨, 파드 동시 기동 보장을 직접 구성해야 했다. NVCRE는 이를 Certification, Workflow, Job 세 계층의 커스텀 리소스(CRD)로 표준화해 kubectl과 GitOps 워크플로로 관리할 수 있게 했다. 각 계층의 결과는 위로 전파돼, 예를 들어 gpu-01이 NCCL 도중 하드웨어 결함을 냈고 gpu-02는 대역폭 목표를 못 채웠다는 식으로 노드와 카테고리별로 원인이 특정된다.

노드라이트는 검증이 끝난 뒤의 문제, 즉 노드 자체를 안전하게 바꾸는 작업을 다룬다. 커널 설정, 시스템 패키지, 스토리지 구성, 보안 에이전트 같은 호스트 수준 변경은 지금까지 Ansible이나 자체 스크립트, 수작업 런북으로 처리돼 왔다. 그러나 GPU 노드는 폐기하고 새로 띄우기 어렵고 교체에 시간이 걸리며, 장시간 학습 작업을 함부로 재스케줄할 수도 없다. NVIDIA는 이를 “노드가 아니라 플릿 전체가 변경의 단위”라는 문제로 정의하고, 노드라이트를 쿠버네티스 네이티브 패키지 매니저로 만들었다. PodDisruptionBudget, 노드 셀렉터, taint·toleration을 인식해 작업을 방해하지 않고 순차적으로 변경을 굴린다. 노드라이트는 NVIDIA 내부에서 ‘스카이훅(Skyhook)‘이라는 이름으로 이미 프로덕션에 쓰이던 프로젝트이며, 이번 발표는 이를 노드라이트라는 이름으로 정식 오픈소스화한 것이다.

두 도구는 NVIDIA가 밝힌 DSX OS의 ‘AI-Ready Foundation’ 구성 요소로, GPU Operator·Network Operator·Topograph·DRA Driver·NVSentinel과 함께 가속 쿠버네티스 인프라를 정의·구성·검증·보증하는 오픈소스 포트폴리오에 속한다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Validate GPU Cluster Readiness Before AI Workloads Land | NVIDIA Technical Blog — NVIDIA Technical Blog
  2. Manage Kubernetes Node Fleets with NodeWright | NVIDIA Technical Blog — NVIDIA Technical Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.