SageMaker AI, 동시성 스윕으로 GPU 인스턴스 규모 자동 산출

3분 AWSSageMakervLLMMoE
최근 30일 조회수 — 좋아요 —

핵심 요약

AWS가 SageMaker AI에 동시 요청 부하를 단계적으로 늘려 처리량·지연 시간의 포화점을 찾는 동시성 스윕 기능을 추가했다.

SageMaker AI가 생성형 AI 모델 엔드포인트의 적정 인스턴스 규모를 자동으로 찾아주는 기능을 내놨다. AWS는 22일(현지시간) 자사 머신러닝 블로그에서 “동시성 스윕(concurrency sweep)“이라는 벤치마킹 방식을 Amazon SageMaker AI Inference Recommendations에 내장했다고 밝혔다. 별도의 부하 테스트 인프라를 만들지 않고도 엔드포인트가 처리할 수 있는 동시 요청 수의 한계를 자동으로 찾아낼 수 있다는 설명이다.

지금까지 생성형 AI 엔드포인트의 규모를 정하는 작업은 배포와 수동 부하 테스트, 조정을 반복하는 과정이었다. AWS는 이 방식의 위험을 구체적으로 짚었다. ml.g7e.2xlarge 인스턴스 한 대면 될 작업에 다섯 대를 투입하면 GPU가 놀면서 예산만 소모하고, 반대로 인스턴스를 너무 적게 잡으면 요청이 대기열에 쌓이면서 지연 시간이 치솟아 사용자 경험이 나빠진다. 동시성 스윕은 이 두 극단 사이의 적정 지점을 실험으로 찾아내는 도구다.

동작 방식은 이렇다. 엔드포인트에 동시 요청 수를 64건에서 256건, 1,024건 식으로 단계적으로 늘려가며 트래픽을 흘려보내고, 각 단계에서 처리량(초당 토큰 수)과 지연 시간을 함께 측정한다. 이 수치를 이어 그리면 동시 요청이 더 늘어나도 처리량은 더 이상 늘지 않고 지연 시간만 나빠지는 ‘포화점’이 드러난다. 결과적으로 동시성 스윕은 세 가지 값을 준다. 처리량은 최대화하면서 지연 시간은 허용 범위 안에 있는 ‘이상적 균형점’, 지연 시간이 서비스수준협약(SLA) 기준을 넘어서는 ‘한계점’, 그리고 인스턴스 한 대당 처리 능력을 기준으로 피크 트래픽을 감당하려면 몇 대가 필요한지 계산한 ‘적정 규모’다.

전체 작업 흐름은 네 단계로 이뤄진다. 먼저 vLLM 네이티브 컨테이너로 모델을 SageMaker AI 엔드포인트에 배포하고, 입력·출력 토큰 수와 스트리밍 여부 같은 워크로드 프로필을 설정한 뒤, CreateAIBenchmarkJob API로 동시성 스윕을 실행하고, 마지막으로 결과를 분석해 최적 동시성 수준과 필요 인스턴스 수를 산출한다.

AWS는 이 과정을 NVIDIA의 Nemotron-3 Nano 30B 모델로 시연했다. 이 모델은 전체 파라미터는 300억 개지만 실제 추론 시 활성화되는 파라미터는 30억 개뿐인 전문가 혼합(Mixture-of-Experts, MoE) 구조다. 블로그는 이를 NVIDIA Blackwell GPU 기반 ml.g7e.2xlarge 인스턴스에 배포했다며, 이 인스턴스가 추론 워크로드에서 가격 대비 성능이 좋다고 설명했다. 배포에는 SageMaker AI용 vLLM 딥러닝 컨테이너를 SM_VLLM_* 환경 변수로 구성해 사용했다. 이 가운데 SM_VLLM_ENFORCE_EAGER 플래그는 Nemotron-3 Nano가 맘바-트랜스포머 하이브리드 구조를 쓰기 때문에 이거(eager) 실행 모드가 필요해 켜야 한다고 밝혔고, GPU 메모리 사용률은 여유분을 남기기 위해 0.85로 설정했다고 전했다.

이번 기능은 실험 자체를 표준화된 API 호출로 대체해, 엔드포인트 사이징을 사람이 반복해서 조정하던 작업에서 재현 가능한 측정 절차로 옮겨놓은 셈이다. 다만 자료에는 동시성 스윕의 실행 비용이나 소요 시간, 다른 모델·인스턴스 조합에서의 결과는 나와 있지 않다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Right-size generative AI endpoints with concurrency sweeps on Amazon SageMaker AI | Amazon Web Services — AWS Machine Learning Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.