AWS, 세이지메이커 검색 에이전트용 MTRL 공개
최근 30일 조회수 — 좋아요 —핵심 요약
AWS가 검색 궤적 전체를 최적화해 소형 모델의 검색 행동을 개선하는 세이지메이커 AI 구현을 공개했다.

AWS가 검색 에이전트를 다중 턴 강화학습(Multi-Turn Reinforcement Learning·MTRL)으로 미세조정하는 세이지메이커 AI(SageMaker AI) 구현을 공개했다. 검색 과정의 개별 응답이 아니라 여러 차례 이어지는 검색 궤적 전체를 최적화해, 소형 언어 모델에서도 도구와 운영 환경에 맞는 검색 행동을 학습시키는 방식이다.1
검색 에이전트는 사용자를 대신해 검색어와 검색 전략을 정하고, 앞서 찾은 내용을 바탕으로 다음 행동이나 검색 종료 시점을 판단한다. AWS는 이런 다단계 행동을 프롬프트만으로 소형 모델에 안정적으로 구현하기 어렵다고 설명한다. 고성능 프런티어 모델은 더 잘 작동할 수 있지만 지연시간과 비용이 커진다. 미세조정은 소형 모델의 속도·비용과 검색 행동의 신뢰성을 함께 노리는 선택지다.
기존 학습법에도 제약이 있다. 지도 미세조정(Supervised Fine-Tuning·SFT)은 이상적인 검색 과정을 담은 전문가 시연이 필요하지만, 특정 도구와 환경에 맞는 자료를 모으려면 비용이 많이 든다. 검증 가능한 보상을 쓰는 강화학습(RLVR) 같은 단일 턴 방식은 응답 하나씩 점수를 매기므로, 앞선 검색 결과가 다음 판단에 영향을 주는 의존 관계를 충분히 반영하지 못한다.
MTRL은 에이전트 작업을 연속된 의사결정으로 보고 다중 턴 롤아웃으로 학습 데이터를 만든 뒤 정책 경사 알고리즘으로 모델을 최적화한다. 중간 단계마다 정답을 줄 필요 없이 최종 검색 결과의 품질을 보상으로 삼을 수 있다는 점이 핵심이다. AWS가 공개한 구성은 사용자 정의 보상과 도구 루프를 넣는 모듈형 인터페이스, GPU 클러스터를 직접 운영하지 않는 서버리스 실행, 생성과 경사 업데이트를 병렬화하는 비동기 궤적 수집을 지원한다.
알고리즘은 PPO(Proximal Policy Optimization), CISPO(Clipped Importance Sampling Policy Optimization), 중요도 샘플링 손실 가운데 고를 수 있고, GRPO와 RLOO 등 그룹 기반 이점 추정기를 조합할 수 있다. 장기 학습을 여러 작업으로 나눠 재개할 수 있으며, 세이지메이커가 관리하는 MLflow에서 턴별 행동과 보상을 확인한다. 배포 전 평가 작업은 보상, pass@k, 궤적 지표를 보고하며, 학습한 모델은 세이지메이커 엔드포인트나 아마존 베드록으로 배포할 수 있다.
다만 공개 자료가 설명하는 성능과 신뢰성 개선은 AWS가 자체 구현에서 관측한 결과다. 다른 검색 도구나 데이터 환경에서도 같은 효과가 나는지는 별도 검증이 필요하다.
Footnotes
-
AWS Machine Learning Blog, “Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI | Amazon Web Services — AWS Machine Learning Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.