세이지메이커 하이퍼팟서 SkyRL로 VLM 강화학습
최근 30일 조회수 — 좋아요 —핵심 요약
AWS가 SkyRL과 세이지메이커 하이퍼팟으로 시각 언어 모델을 강화학습시켜 미로 찾기 성공률을 43.75%에서 95% 이상으로 높였다.
SkyRL(오픈소스 강화학습 프레임워크)을 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)에서 돌려, 시각 언어 모델(vision-language model)이 미로를 찾아가는 과제를 강화학습으로 학습시켰더니 성공률이 43.75%에서 95% 이상으로 뛰었다. AWS 머신러닝 블로그가 9월 25일 공개한 결과다.1
블로그가 다룬 건 Qwen3-VL-8B 모델이다. VisGym이라는 지도학습(SFT) 체크포인트에서 출발해, GRPO(Group Relative Policy Optimization) 방식으로 후속 학습을 거쳤다. 64개 미로로 구성된 고정 평가셋에서 측정한 성공률이 43.75%에서 95% 이상으로 올랐다는 수치가 이번 실험의 핵심 결과다.
RL 후속학습(post-training)은 언어 모델 에이전트를 만드는 과정에서 이제 표준 단계로 자리잡고 있다고 AWS는 설명한다. 모델이 여러 단계에 걸쳐 궤적(trajectory)을 생성하고 보상을 받으며 정책을 갱신하는 방식인데, 이를 훈련 한 번에 수백 GPU시간이 들어가는 규모로 돌리려면 다중 노드에 걸친 지속형 클러스터 인프라가 필요하다. 긴 작업을 버텨내고, 하드웨어 장애가 나도 진행 상황을 잃지 않고 복구하며, 학습이 진행되는 동안 그 과정을 들여다볼 수 있어야 한다는 조건이다.
세이지메이커 하이퍼팟은 아마존 EKS(Elastic Kubernetes Service) 위에서 이런 조건을 충족하도록 설계된 인프라다. 클러스터 복원력 기능으로 노드 상태를 계속 감시하다가 장애가 난 노드를 자동으로 교체하므로, 하드웨어 하나가 죽어도 클러스터 전체가 멈추지 않는다. 여기에 체크포인팅을 결합하면 학습 작업이 마지막으로 저장된 단계에서 이어 돌아갈 수 있다. 다중 노드로 오래 도는 RL 작업에서는 이 부분이 특히 중요한데, 그렇지 않으면 장애 한 번으로 몇 시간 치 롤아웃(rollout) 진행분이 날아가기 때문이다. 여기에 하이퍼팟의 Ray 지원 기능을 더하면 세이지메이커 스튜디오에서 Ray 클러스터를 만들고, 보안 연결로 원격 작업을 제출하고, 하이퍼팟 옵저버빌리티 EKS 애드온이 자동으로 구성해주는 아마존 매니지드 그라파나(Amazon Managed Grafana) 대시보드로 학습 과정을 모니터링할 수 있다.
이번 실험이 다룬 것은 멀티턴(multi-turn) RL이다. 단일 턴 RL이 모델의 출력 하나에 보상을 매기는 방식이라면, 멀티턴 RL은 에이전트가 상태를 관찰하고 행동하고 피드백을 받아 다음 상태로 넘어가는 일련의 과정 전체를 학습 대상으로 삼는다. 정책은 한 단계가 아니라 에피소드 전체에 걸쳐 쌓인 보상으로 학습된다. 2D 미로 예시로 보면, 에피소드 하나는 미로 한 판을 도는 것이고 턴 하나는 이동 한 번이다. 모델이 현재 미로 화면을 보고 방향을 고르거나 멈추기를 결정하면 환경이 갱신된 화면을 돌려주는 식이다. 보상은 희소(sparse)해서, 정해진 이동 횟수 안에 실제로 목표에 도달했을 때만 1.0을 받고 그 외에는 아무 보상도 받지 못한다. 이동 하나하나를 채점할 정답지가 없고, 어떤 움직임이 좋았는지는 그 앞뒤 움직임에 달려 있기 때문이다.
실습을 재현하려면 요구 조건이 적지 않다. EKS로 오케스트레이션되는 하이퍼팟 클러스터에 최소 ml.g7e.12xlarge 인스턴스 3대와 ml.r5d.16xlarge 인스턴스 1대가 필요하고, KubeRay 오퍼레이터·하이퍼팟 옵저버빌리티 EKS 애드온·하이퍼팟 Ray 엔드포인트 오퍼레이터(원격 작업 제출용)를 클러스터에 설치해야 한다. 여기에 Amazon FSx for Lustre CSI 드라이버와 이를 기반으로 한 PersistentVolume·PersistentVolumeClaim(ReadWriteMany)이 필요한데, 학습 작업은 이 저장소를 /shared 경로에 마운트해 체크포인트 저장, LoRA(Low-Rank Adaptation) 어댑터 동기화, 평가 결과 출력에 쓴다. 세이지메이커 스튜디오 도메인과 toolkit-for-ray-on-sagemaker-ai 패키지 설치도 전제 조건이다.
이 글은 AWS가 자사 블로그에 공개한 벤치마크로, 하이퍼팟과 SkyRL 조합의 실제 운영 환경 성능이나 다른 RL 인프라와의 비교는 다뤄지지 않는다. 성공률 개선폭이 큰 만큼 구체적인 학습 시간, GPU 소모량, 장애 복구가 실제로 발동한 사례 등은 이번 발췌 자료에는 나오지 않아 확인이 필요하다.
Footnotes
-
AWS Machine Learning Blog, “Accelerate multimodal RL training with SkyRL on Amazon SageMaker HyperPod” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Accelerate multimodal RL training with SkyRL on Amazon SageMaker HyperPod | Amazon Web Services — AWS Machine Learning Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.