CUDA 툴킷 13.4 출시, 윈도우 온 암 지원 추가
최근 30일 조회수 — 좋아요 —핵심 요약
NVIDIA가 CUDA 툴킷 13.4를 공개하며 Windows on Arm 지원과 차세대 GPU 루빈 사전 지원, MPS V3 개편을 담았다.
CUDA 툴킷 13.4가 출시됐다. NVIDIA 테크니컬 블로그에 따르면 이번 버전의 핵심은 Windows on Arm 지원 추가다. CUDA 애플리케이션은 그동안 Linux 기반 Arm 플랫폼에서는 동작했지만, Windows on Arm에서는 지원되지 않았다. 13.4부터 이 범위가 확장된다.
이번 릴리스에는 차세대 GPU 아키텍처 Rubin(루빈)에 대한 개발자용 사전 지원도 포함됐다. 컴퓨트 능력(compute capability) 107로 분류되는 Rubin은 정식 출시(GA) 전 프리뷰 단계로 CUDA 13.4에 기능적으로 반영됐으며, 개발자들이 정식 지원이 나오기 전에 미리 애플리케이션 이식 작업을 시작할 수 있게 하는 목적이다. NVIDIA는 Rubin을 “에이전틱 AI 시대를 이끌 차세대 GPU 아키텍처”로 소개하고 있다.
공유 GPU 관리 기능도 크게 손봤다. 멀티 프로세스 서비스(Multi-Process Service, MPS)가 V3로 개편되면서 스크립트로 다룰 수 있는 CLI, 이름을 지정한 서버 인스턴스, 네임스페이스를 통한 워크로드 구분 기능이 추가됐다. 여기에 TOML 설정 지원, 스트리밍 멀티프로세서(SM) 파티션 제어, cgroup과 연동되는 GPU 메모리 제한까지 더해져 컴퓨트 성능과 메모리 경계, 실행 우선순위를 프로그래밍 방식으로 세밀하게 정의할 수 있게 됐다. NVIDIA는 이 변화가 컨테이너 환경에서 하드웨어 활용도를 높이면서도 프로세스별 자원 격리는 엄격하게 유지하도록 설계됐다고 밝혔다.
멀티 GPU 시스템을 겨냥한 저수준 통신 기능도 새로 들어갔다. CUDA Compute Fabric Transport(CFT)는 NVLink 패브릭을 통해 대규모로 데이터를 옮기는 통신 라이브러리 개발자를 위한 기능이다. 기존 방식처럼 원격 GPU의 메모리 영역을 프로세스의 가상 주소 공간에 전부 매핑하는 대신, 엔드포인트 ID와 오프셋으로 지정된 논리적 엔드포인트를 대상으로 비동기 put·get·reduction 연산을 GPU에서 직접 실행하는 구조다. 이를 통해 대규모 멀티 GPU 시스템에서 가상 주소 공간에 걸리는 부담을 줄이고, 유니캐스트와 멀티캐스트 통신 패턴을 지원하며, 전송 실패 시 재시도나 우회 경로를 판단할 수 있는 완료·오류 상태 보고도 제공한다. 다만 CFT는 CUDA 드라이버 API를 통해서만 쓸 수 있고, NVIDIA는 대부분의 애플리케이션 개발자에게는 NCCL이나 NVSHMEM 같은 상위 레벨 통신 라이브러리를 쓰는 편이 낫다고 안내했다.
이 밖에 GPU 내 SM과 디바이스 메모리 묶음을 가리키는 ‘로컬리티 도메인(locality domain)’ 개념이 프로그램 수준에서 노출돼, 같은 도메인 안에 메모리를 할당하고 연산 자원을 배치해 지역성(locality)을 높일 수 있게 됐다. 통합 메모리(unified memory)의 실제 물리적 위치를 조회하는 API도 추가돼, 불필요한 페이지 이전이나 원격 메모리 접근을 피해야 하는 고성능 라이브러리·런타임 개발에 도움을 준다. NVIDIA는 이번 업데이트에 CUDA Python, CCCL(CUDA Core Compute Libraries), Nsight 개발자 도구, 핵심 수학 라이브러리 전반의 기능 확장도 함께 포함됐다고 밝혔으나, 구체적인 변경 내역은 이번 발표 자료에 상세히 나열되지 않았다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- CUDA Toolkit 13.4 Adds Windows on Arm Support and Greater Control over Shared GPUs | NVIDIA Technical Blog — NVIDIA Technical Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.