AWS, AI 에이전트 생애주기 추적 도구 공개

3분 AWSAI 에이전트AgentCoreobservability
최근 30일 조회수 — 좋아요 —

핵심 요약

AWS가 에이전트 응답 평가와 장애 자동 조사를 결합해 조용한 실패를 잡는 모니터링 사례를 공개했다.

AWS가 9월 11일 공식 블로그를 통해 프로덕션 환경에서 AI 에이전트의 전체 생애주기를 추적하는 사례를 공개했다. 핵심은 두 가지 도구의 조합이다. 에이전트 응답 품질을 지속적으로 채점하는 ‘AgentCore Evaluations’와, 인프라 장애를 자율적으로 조사하는 ‘AWS DevOps Agent’다. AWS는 이 두 계층을 실제 프로덕션 항공 예약 시스템에 적용해 구축했다.1

AWS가 이 조합을 만든 이유는 명확하다. Amazon CloudWatch 같은 기존 인프라 모니터링은 시스템이 “정상적으로 실행됐는지”는 보여주지만 에이전트가 “사용자 목표를 달성했는지”는 보여주지 못한다. 블로그가 든 예시는 이렇다. 감독(supervisor) 에이전트의 프롬프트 범위가 잘못 설정되면 오류율은 그대로인데 요청의 20%가 엉뚱한 전문 에이전트로 라우팅된다. 또 IAM 권한이 누락돼도 500 오류 없이 빈 응답만 돌아오거나, 예약 에이전트가 세 단계 아래 호출 체인에서 조용히 실패해도 로그상으로는 도구 실행이 모두 성공한 것으로 남는다. 다중 에이전트 시스템은 고정된 실행 그래프가 없고 실패가 여러 핸드오프 지점에서 예측 불가능하게 전파되기 때문에 이런 문제가 더 커진다.

이를 해결하기 위해 AgentCore Evaluations는 LLM-as-a-Judge 방식으로 실시간 상호작용을 채점해 잘못된 도구 선택, 작업 실패, 품질 저하를 잡아낸다. AWS DevOps Agent는 CloudWatch 로그와 IAM 정책, 호출 로그, 오케스트레이션 트레이스를 서비스 경계를 넘어 자동으로 연결해 근본 원인을 분석하고 대응 방안까지 제시한다. 시스템은 Amazon Bedrock(언어 모델), AgentCore 런타임(OpenTelemetry 기반 오케스트레이션), FAST(Fullstack AgentCore Solution Template, 프런트엔드 배포 템플릿), Strands Agents SDK로 구성됐다.

공교롭게도 비슷한 시기 InfoQ는 이와 같은 문제의식을 다른 방식으로 다룬 사례를 보도했다. CNCF 회원 포스트에서 StackGen의 수석 엔지니어 사비스 K 수피(Sabith K Soopy)는 지난 8월 4일 “만들기보다 잘못됐을 때 무엇을 하고 있는지 파악하는 게 더 어렵다”고 밝히며, Langfuse로 LLM 호출·도구 실행·서브 에이전트 위임을 중첩된 세션 트레이스로 기록하는 방식을 소개했다.2

두 접근은 강조점이 다르다. AWS 방식은 관리형 플랫폼 안에서 평가와 장애 조사를 통합한 반면, StackGen 방식은 Langfuse·OpenTelemetry·Prometheus 등 오픈소스 조합으로 트레이스와 지표를 분리해 쌓는다. StackGen 포스트는 특히 반복 도구 호출과 비용 폭주를 막기 위해 실행 전 반복 횟수 상한과 동일 호출 차단을 두고, 세션 비용을 에이전트별 평균과 비교해 이상 징후를 잡는 방법을 권고했다. 또한 동적 세션 ID를 지표 라벨에 넣으면 카디널리티가 폭증해 지표 서버가 다운될 수 있다며 “트레이스는 디버깅용, 지표는 알림용”이라는 원칙을 제시했다.

두 사례 모두 결론은 같다. 인프라가 정상이어도 에이전트는 조용히 실패할 수 있고, 이를 잡으려면 요청-응답 단위가 아니라 도구 호출과 위임 체인 전체를 추적하는 별도 계층이 필요하다는 것이다.

Footnotes

  1. AWS Machine Learning Blog, “Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations” ↩

  2. InfoQ, “Session Traces and Cost Controls Help Diagnose AI Agent Failures” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Monitoring production agent lifecycle with AWS DevOps Agent and AgentCore Evaluations | Amazon Web Services — AWS Machine Learning Blog
  2. Session Traces and Cost Controls Help Diagnose AI Agent Failures — InfoQ

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.