MS, 에이전트 라이트닝 1.0 공개

최근 30일 조회수 — 좋아요 —

핵심 요약

실제 에이전트 실행 환경을 유지한 채 강화학습을 지원하는 3,500줄 규모의 오픈소스 프레임워크다.

MS, 에이전트 라이트닝 1.0 공개 — 기사 주제를 표현한 AI 생성 개념 삽화
AI 생성 개념 삽화 · 실제 사건을 촬영한 사진이 아닙니다.

마이크로소프트 리서치 아시아(Microsoft Research Asia)가 실제 배포에 쓰는 에이전트 실행 환경을 그대로 두고 강화학습(RL)을 진행하는 오픈소스 프레임워크 ‘에이전트 라이트닝 1.0(Agent Lightning v1.0)’을 공개했다. 약 3,500줄로 강화학습 제어 계층을 구현했으며, 쿠버네티스(Kubernetes) 환경에서 에이전트를 표준 작업으로 실행할 수 있도록 설계했다.1

에이전트는 이제 언어 모델 하나가 아니라 문맥 관리, 도구 호출 규약, 실행 로직과 각종 의존성을 묶은 시스템에 가깝다. 그러나 기존 에이전트 강화학습 프레임워크는 모델이 행동을 만들고 환경이 관측값을 돌려주는 상호작용 루프를 직접 통제한다. 이 때문에 verl, AReaL, slime 같은 초기 시스템에서 학습하려면 에이전트의 실행 루프를 프레임워크 안에 다시 구현해야 했다. mini-SWE-agent, OpenHands, OpenCode, Claude Code, Codex처럼 저마다 다른 실행 환경을 쓰는 코딩 에이전트에는 개발 부담이 크고, 재구현한 학습용 에이전트가 실제 배포판과 다르게 작동할 가능성도 있다.1

에이전트 라이트닝 1.0은 이를 ‘하네스 기반 에이전트 강화학습(Harnessed Agentic RL)’으로 풀었다. 여기서 하네스는 모델 바깥에서 문맥과 도구, 실행 과정을 조율하는 환경을 뜻한다. 기존 에이전트가 모델 API를 호출하던 주소를 에이전트 라이트닝의 대규모 언어 모델(LLM) 프록시로 바꾸면, 프레임워크가 모델 호출을 관찰하고 기록한다. 에이전트 코드는 손대지 않으면서 배포에 쓰는 하네스 자체를 학습 과정에 참여시키는 방식이다.1

실행 인프라도 특정 유료 샌드박스 서비스에 묶지 않았다. 자체 관리 클러스터와 클라우드 쿠버네티스는 물론 로컬 인프라에서도 롤아웃을 확장할 수 있다는 것이 마이크로소프트의 설명이다. 공개된 코딩 에이전트 파이프라인에서는 오픈소스 데이터셋을 바탕으로 약 6,000개 학습 샘플을 사용해 Qwen3.5-9B의 SWE-bench Verified Pass@1을 41.8%에서 56.4%로 높였다. 절대 상승 폭은 14.6%포인트다.1

다만 이 수치는 마이크로소프트가 제시한 하나의 코딩 에이전트 실험 결과다. 자료에는 다른 모델이나 일반 목적 에이전트에서도 같은 효율과 성능 향상이 재현되는지는 제시되지 않았다. 1.0의 의미는 특정 벤치마크 점수 자체보다, 학습용으로 에이전트를 다시 만들지 않고 실제 실행 환경과 강화학습을 연결하는 구조를 작은 코드베이스로 공개했다는 데 있다.

Footnotes

  1. Microsoft Research, Agent Lightning: Lightweight RL agent-training framework ↩ ↩2 ↩3 ↩4

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Agent Lightning: Lightweight RL agent-training framework — Microsoft Research

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.