AWS 세이지메이커 AI, GPU 인스턴스 우선순위 목록 기능 추가
최근 30일 조회수 — 좋아요 —핵심 요약
AWS가 세이지메이커 AI 학습·프로세싱 작업에 최대 5개 GPU 인스턴스를 우선순위로 지정해 자동 시작하는 기능을 도입했다.
AWS가 세이지메이커 AI(Amazon SageMaker AI) 학습 작업과 프로세싱 작업에 “인스턴스 선호 목록(Instance Preference Lists)” 기능을 추가했다고 9월 15일 공식 블로그를 통해 밝혔다. 작업을 생성할 때 GPU 인스턴스 타입을 하나만 지정하던 방식에서 벗어나, 최대 5개까지 우선순위가 매겨진 인스턴스 타입 목록을 제출할 수 있게 됐다. 세이지메이커 AI는 이 목록을 순서대로 검토해 가용 용량이 있는 첫 번째 타입에서 작업을 자동으로 시작한다.
지금까지는 학습 작업이 특정 GPU 구성 하나에 고정돼 있었기 때문에, 수요가 몰리는 시기에 원하는 인스턴스를 확보하지 못하면 팀이 직접 다른 타입으로 재시도하거나 기다리는 수밖에 없었다. AWS는 이런 상황에서 팀들이 작업 상태를 폴링하고 멈춘 요청을 취소한 뒤 다른 인스턴스 타입으로 재제출하는 커스텀 재시도 스크립트를 만들어 대응해왔다고 설명한다. 문제는 이런 스크립트가 예약형 용량 옵션인 FTP(Flexible Training Plan, 유연 학습 플랜)와 연동되지 않고, 학습 작업이 반복될 때마다 운영 부담이 그만큼 쌓인다는 점이다.
AWS가 든 예시는 세 가지다. 수십억 파라미터급 모델을 학습하는 팀이 특정 인스턴스 용량을 찾으려 여러 작업 요청을 동시에 보내는 동안, 동등한 성능을 내는 다른 인스턴스 타입에는 이미 여유 용량이 있는 경우. 야간 데이터 처리 파이프라인이 단일 인스턴스 타입에 고정된 탓에 새벽 2시에 InsufficientCapacityError로 실패하는 경우. 그리고 FTP를 보유한 조직이 예약 용량을 먼저 소진한 뒤, 재제출 없이 온디맨드 대체 타입으로 자연스럽게 넘어가길 원하는 경우다. AWS는 세 사례 모두 해법이 동일하다고 말한다. 작업 생성 시점에 플랫폼이 API 호출 한 번으로 여러 인스턴스 타입을 스스로 평가하게 두는 것이다.
인스턴스 선호 목록은 이 요구를 그대로 구현한 기능이다. 사용자는 단일 인스턴스 타입 대신 우선순위가 매겨진 목록을 제출하고, 세이지메이커 AI가 목록을 순서대로 검토해 가용 용량이 확인되는 첫 번째 타입으로 작업을 시작한다. AWS는 이를 통해 수동 재시도 루프와 별도의 모니터링 스크립트, 재제출 로직을 구축하는 데 드는 시간을 없앨 수 있다고 설명한다. 결과적으로 작업 시작이 빨라지고 용량 활용률이 높아지며, 엔지니어링 인력이 용량 관리보다 모델 개발에 시간을 쓸 수 있다는 것이 AWS의 발표 요지다.
다만 이번 발표문에는 목록에 포함할 수 있는 인스턴스 타입 간 호환 요건이나 요금 처리 방식, 적용 리전 같은 구체적인 운영 세부사항은 담겨 있지 않다. 실제 구현 방식과 제약 조건은 별도 문서나 콘솔에서 추가로 확인해야 할 것으로 보인다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Announcing instance preference lists for Amazon SageMaker AI training jobs | Amazon Web Services — AWS Machine Learning Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.