ZLUDA와 ROCm으로 CUDA 앱 AMD GPU 구동 오픈소스 공개
최근 30일 조회수 — 좋아요 —핵심 요약
ZLUDA와 AMD ROCm/HIP를 결합해 CUDA 전용 윈도우 앱을 AMD GPU에서 구동하는 오픈소스 프로젝트가 RX 9060 XT로 PPO 학습 검증을 마쳤다.
ZLUDA와 AMD ROCm/HIP를 결합해 CUDA 전용 윈도우 애플리케이션을 AMD GPU에서 구동하는 오픈소스 프로젝트가 공개됐다. 개발자 Speedstu가 깃허브에 올린 ‘CUDA-for-AMD-Windows’로, 별도의 비공개 또는 유출 DLL 없이 공개된 업스트림 구성 요소만으로 재현 가능한 스택을 만들었다는 점을 내세운다.1
이 프로젝트는 CUDA 애플리케이션과 AMD GPU 사이에 ZLUDA를 끼워 넣고, 그 아래 계층에서 cuBLAS·cuSPARSE·cuFFT 같은 CUDA 라이브러리 호출을 rocBLAS·hipBLASLt·rocSPARSE 등 AMD HIP 라이브러리로 넘기는 구조다. 검증에 사용한 조합은 ZLUDA v6-preview.69, AMD HIP SDK 6.4, cu118 빌드의 LibTorch 2.3.0이며, 하드웨어는 RDNA4 아키텍처(gfx1200)의 RX 9060 XT 한 종뿐이다. 다른 AMD GPU는 아직 검증되지 않은 후보로 분류돼 있고, 프로젝트 쪽은 사용자가 다른 카드로 테스트한 결과를 GPU 호환성 리포트로 제보해 달라고 요청하고 있다.
동작 확인은 단순한 구동 테스트를 넘어선다. 220만 개 파라미터 규모의 PPO(근접 정책 최적화) 강화학습 네트워크를 CUDA 대상 장치에서 학습시켜 순전파와 추론, 옵티마이저 연산까지 정상 작동했고, 6만 5,536 타임스텝짜리 학습 반복 하나를 이 저장소가 만든 런타임으로 완주했다. 이 워크로드는 애초에 프로젝트를 시작하게 만든 학습 작업과 동일한 것이라고 저장소 문서(docs/VALIDATION.md)는 설명한다. 설치 스크립트(install.ps1)는 AMD GPU와 gfx 타깃을 자동 감지하고 드라이버·HIP SDK 버전을 확인한 뒤, ZLUDA 빌드와 약 2.66GB 용량의 LibTorch를 내려받아 SHA-256 해시로 무결성을 검증하고 cuda_check.exe로 최종 동작을 점검한다.
다만 한계도 명확하게 밝혀져 있다. 현재 안정 버전의 윈도우용 HIP SDK는 MIOpen을 포함한 전체 ROCm AI 라이브러리 스택을 제공하지 않아, cuDNN을 필요로 하는 합성곱 연산 위주 소프트웨어는 별도의 나이틀리 HIP 스택이나 추가 작업이 필요할 수 있다. 반면 이번에 검증한 PPO 워크로드처럼 GEMM(행렬 곱) 연산 비중이 높은 LibTorch 학습 작업은 cuDNN 없이도 완주했다는 점을 프로젝트는 구분해서 설명한다. 즉 이 스택이 모든 CUDA 프로그램이나 AI 모델을 그대로 돌려준다는 뜻은 아니며, 실제 지원 범위는 어떤 CUDA API와 라이브러리를 얼마나 쓰느냐에 따라 갈린다.
Footnotes
-
Hacker News, GitHub - Speedstu/CUDA-for-AMD-Windows: Run CUDA-targeted Windows applications on AMD GPUs with ZLUDA + ROCm/HIP. ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- GitHub - Speedstu/CUDA-for-AMD-Windows: Run CUDA-targeted Windows applications on AMD GPUs with ZLUDA + ROCm/HIP. — Hacker News
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.