PyTorch·vLLM, 헬리온 백엔드 통합

2분 PyTorchvLLM헬리온GPU
최근 30일 조회수 — 좋아요 —

핵심 요약

헬리온이 선형 연산 알고리즘을 입력별로 자동 튜닝해 호퍼 GPU 일부 작업의 처리량을 10% 이상 높였다.

PyTorch·vLLM, 헬리온 백엔드 통합 — 기사 주제를 표현한 AI 생성 개념 삽화
AI 생성 개념 삽화 · 실제 사건을 촬영한 사진이 아닙니다.

PyTorch와 vLLM이 자동 튜닝 커널 도메인 특화 언어(DSL)인 헬리온(Helion)을 vLLM의 선형 연산 백엔드에 통합했다. 하나의 범용 행렬 곱셈(GEMM) 구현으로 표준 GEMM과 Split-K, Swap-AB 같은 여러 알고리즘을 처리하고, 입력 형태마다 가장 빠른 방식과 설정을 자동으로 고르는 구조다. PyTorch 측은 엔비디아 호퍼(Hopper) GPU에서 평가한 모델 전반에 걸쳐 vLLM의 기본 CUTLASS·DeepGEMM 백엔드보다 높은 성능을 냈으며, 일부 작업에서는 처리량이 10% 넘게 늘었다고 밝혔다.1

vLLM은 대규모 언어 모델(LLM)의 추론·서빙 프레임워크다. FP8, INT8, INT4, NVFP4처럼 양자화한 선형 계층에는 CUTLASS, DeepGEMM, FlashInfer 등 하드웨어 최적화 라이브러리를 연결한 전용 백엔드를 쓴다. 다만 작업 형태나 하드웨어가 달라질 때마다 최적화한 커널을 별도로 구현하고 관리해야 한다.

헬리온은 이 부담을 줄이는 데 초점을 맞췄다. 개발자는 파이썬에 가까운 타일 프로그래밍 방식으로 커널을 한 번 작성하고, 헬리온의 사전(AOT) 자동 튜너가 메모리 배치와 실행 스케줄부터 알고리즘 선택까지 탐색한다. 이를 통해 같은 구현을 여러 작업과 하드웨어에 맞춰 특화할 수 있다. 대규모 언어 모델을 활용해 탐색 효율을 높이는 방식도 지원한다.

이번 백엔드는 입력 형태별 튜닝과 하이브리드 디스패치를 결합했다. 모든 환경에 하나의 고정 커널을 강제하는 대신, 각 형태에 맞는 변형과 설정을 골라 실행하는 접근이다. 일반적인 모델을 겨냥한 기본 커널을 넘어 사용자가 자신의 배포 환경에 맞춰 최적화할 수 있다는 점도 의미가 있다.

다만 자동화가 비용을 없애는 것은 아니다. PyTorch 블로그는 세밀한 AOT 튜닝에 수 시간이 걸릴 수 있다고 설명한다. 공개된 성능 결과 역시 엔비디아 호퍼 GPU와 평가 대상 모델에 한정돼 있어, 다른 하드웨어에서도 같은 우위가 이어지는지는 이번 자료만으로 확인할 수 없다.

Footnotes

  1. PyTorch Blog, “Building a High-Performance and Portable vLLM Linear Backend with Helion” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Building a High-Performance and Portable vLLM Linear Backend with Helion — PyTorch Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.