AI 에이전트 '플래시벡터', 유니티 광고 서빙 성능 2배 개선

2분 FlashVectorUnity모델 서빙AI 에이전트
최근 30일 조회수 — 좋아요 —

핵심 요약

유니티 벡터 광고 플랫폼에 투입된 AI 에이전트 플래시벡터가 GPU 커널부터 피처 서비스까지 서빙 스택 전반을 최적화해 처리량을 최대 2배 끌어올렸다.

유니티(Unity)의 광고 플랫폼 벡터(Vector)에 실제로 투입돼 모델 서빙 성능을 최대 2배까지 끌어올린 AI 에이전트 시스템이 공개됐다. 연구진은 9월 15일 arXiv에 공개한 논문에서 이 시스템을 “플래시벡터(FlashVector)“라고 이름 붙이고, GPU 커널부터 피처 처리 서비스까지 모델 서빙 스택 전 계층을 에이전트가 직접 최적화한다고 밝혔다.1

모델 서빙은 프로덕션 추천 시스템에서 비용을 가장 크게 좌우하는 요소 중 하나다. 처리량을 끌어올리려면 GPU 커널, ML 프레임워크의 연산 그래프, 모델 서버, 실시간 피처 처리까지 여러 층을 넘나들며 최적화해야 하는데, 각 층마다 요구되는 전문 지식이 다르다. 이런 교차 계층 전문성은 습득하기 어렵고 계속 성장·변화하는 워크로드를 따라가지 못해, 상당한 비용 효율 개선 여지가 방치돼 있었다고 연구진은 지적한다.

최근 AI 에이전트가 단일 GPU 커널 최적화에서 사람 전문가 수준의 효율을 보인 사례는 여럿 나왔지만, 서빙 스택의 나머지 부분을 자동으로 튜닝하는 연구는 거의 다뤄지지 않았다. 플래시벡터는 이 단일 커널 최적화 에이전트 패러다임을 이종(異種) 기술 스택 전반으로 일반화할 수 있는 확장형 프레임워크를 핵심 기여로 내세운다. 즉 커널 하나만 고치는 게 아니라, 서로 다른 언어와 구조로 짜인 여러 시스템 컴포넌트를 하나의 에이전트 체계로 다루겠다는 것이다.

성과는 실제 배포 결과로 제시됐다. 유니티 벡터 광고 플랫폼에 적용한 결과 모델 서버에서 처리량은 최대 2배, 지연 시간은 최대 1.98배 개선됐고, 피처 스토어의 처리량은 최대 1.6배 늘었다.1 눈에 띄는 대목은 이 개선이 GPU 커널이나 연산 그래프 수준에 그치지 않았다는 점이다. 논문에 따르면 최적화는 엔비디아(NVIDIA) 트리톤(Triton) 기반의 C++로 짜인 모델 서버 코드베이스와, 파이썬(Python)으로 작성된 실시간 피처 변환 서비스에서도 각각 발견됐다.1

이는 플래시벡터가 언어와 컴포넌트 종류를 가리지 않고 최적화 지점을 찾아냈다는 뜻으로, 연구진은 이를 더 복잡한 시스템 아키텍처로도 확장 가능하다는 근거로 제시했다. 다만 논문은 유니티 벡터라는 단일 프로덕션 환경에서의 배포 결과를 다루고 있어, 다른 서빙 스택 구성이나 다른 하드웨어 환경에서도 같은 폭의 개선이 재현되는지는 이번 자료만으로는 확인되지 않는다.

Footnotes

  1. arXiv, “FlashVector: Agent for Hierarchical Model Serving Stack Optimization” ↩ ↩2 ↩3

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. FlashVector: Agent for Hierarchical Model Serving Stack Optimization — arXiv (cs.AI/cs.CL/cs.LG)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.