OpenAI 연구 에이전트, 결과보다 감독 부담 늘렸다

3분 OpenAIAI 에이전트Astra자동화
최근 30일 조회수 — 좋아요 —

핵심 요약

OpenAI가 연구용 에이전트 지표를 공개했지만 실제로는 성과보다 사람의 검증·감독 부담이 커졌음을 보여준다.

OpenAI가 지난가을 세운 목표를 달성했다고 밝혔다. 회사가 “자동화된 연구 인턴(automated research intern)“이라 부르는 에이전트가 실제 연구 조직에서 쓰이고 있다는 것이다. 이 에이전트는 숙련된 연구자가 며칠씩 걸리는, 명확히 정의된 작업을 대신 처리할 수 있다. 하지만 더뉴스택은 OpenAI가 공개한 수치를 뜯어보면 정작 늘어난 것은 결과물이 아니라 사람이 감당해야 할 업무와 검증 부담이라고 짚었다.1

수치 자체는 인상적이다. 2026년 들어 코딩 에이전트 사용량이 꾸준히 늘었고, 8월 중순 기준 연구 조직 전체에서 사람이 하루 일할 때 에이전트는 3.1 “에이전트-워크데이”만큼 일했다. API 가격 기준으로 연구자 1명이 하루에 쓰는 추론 비용은 중앙값이 600달러를 넘었고, 상위 10%는 7000달러를 넘었다. 다만 이 수치는 에이전트를 8시간짜리 표준 근무일로 환산해 계산한 것이라, 연구자가 여러 에이전트를 동시에 돌릴수록 값이 커질 뿐 실제로 얼마나 유용한 결과를 냈는지는 보여주지 않는다. 에이전트를 더 많이 돌리면 동시에 처리되는 작업량은 늘지만, 그만큼 사람이 챙겨야 할 작업도 함께 늘어난다는 뜻이다.

이런 구조는 OpenAI가 Epoch AI의 분류 체계를 빌려 에이전트 작업을 결정(Decide), 설계(Design), 구축(Build), 실행(Run), 분석(Analyze), 소통(Communicate) 여섯 영역으로 나눠 본 결과에서도 드러난다. 1월부터 8월 사이 여섯 영역 모두에서 에이전트 활동이 늘었지만, 어떤 연구를 추진할지 정하는 ‘결정’ 영역에서는 에이전트가 맡은 몫이 상대적으로 적었다. 에이전트는 연구·인프라 코드를 작성하고 실험을 모니터링하는 등 실무적인 지원을 늘렸고, 그 덕에 디버깅 오피스아워 참석률이 떨어져 한 팀은 아예 세션을 없앴다고 한다.

그러나 에이전트가 일한 시간이 늘었다고 연구 성과가 비례해 늘어난 것은 아니다. OpenAI 스스로도 코드 출력량이나 실험 횟수는 추적하기 쉽지만, 그 자체가 실제 진전을 뜻하지는 않는다고 밝혔다. 실험이 늘면서 컴퓨팅 사용량도 크게 증가했다. 더 문제가 되는 대목은 검증이다. OpenAI가 다른 모델을 이용해 난이도별 작업 성공률을 평가한 결과, 1월에서 7월 사이 성공률 자체는 개선됐지만, 사람이 4~8시간 걸릴 법한 작업 중 절반 넘는 성공 사례에서도 사람이 개입해야 했다.

여러 에이전트를 동시에 돌리고 그 에이전트가 다시 하위 에이전트를 부리는 구조가 되면서, 병목은 실행이 아니라 감독으로 옮겨갔다. 궤도를 벗어난 실행을 잡아내고, 코드 diff를 검토하고, 무엇을 배포하거나 학습에 반영할지 결정하는 일이 그것이다. 다중 작업을 며칠씩 맡길 수 있는 아스트라(Astra)의 지속형 에이전트 기능은 이 부담을 오히려 키운다. OpenAI도 에이전트가 실행을 더 많이 맡을수록 자동화하기 어려운 부분에 엔지니어의 시간이 더 쏠린다는 점을, 즉 한 사람이 검토할 수 있는 에이전트 산출물에는 현실적인 한계가 있다는 점을 인정했다.

이 한계는 실제 사고로도 나타났다. 7월 20일 에이전트로 인한 일련의 장애가 연구 인프라를 심각하게 흔들면서 OpenAI는 학습용 컨테이너 서비스를 한때 중단했다가 더 엄격한 제한을 걸고 재개했다. 한 달이 채 지나지 않은 8월 7일에는 아스트라가 특정 방식으로 동작할 수 있다는 초기 정황이 나오면서 접근 권한을 다시 조였다. OpenAI는 다음 목표로 사람이 감독하는 인턴급을 넘어선 “자동화된 AI 연구자”를 2028년 3월까지 달성하겠다고 밝혔지만, 지금 수치가 보여주는 것은 자동화 속도보다 감독 역량이 먼저 한계에 부딪히고 있다는 사실이다.

Footnotes

  1. The New Stack, “AI agents are creating more work, not less — and OpenAI’s own numbers back it up” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. AI agents are creating more work, not less — and OpenAI's own numbers back it up — The New Stack

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.