엔비디아 AVO, 클로드 오퍼스5 감싸 ARC-AGI-3 100% 달성

3분 NVIDIAAVOClaude Opus 5ARC-AGI-3
최근 30일 조회수 — 좋아요 —

핵심 요약

엔비디아의 에이전트 아키텍처 AVO가 클로드 오퍼스 5와 결합해 단독 실행 30.2%였던 ARC-AGI-3 점수를 100%로 끌어올렸다.

엔비디아가 자체 개발한 에이전트 아키텍처 AVO(Agentic Variation Operators)에 앤스로픽의 클로드 오퍼스 5(Claude Opus 5)를 결합해 추론 벤치마크 ARC-AGI-3 공개 세트에서 100% 성적을 냈다. 같은 모델을 단독으로 실행했을 때의 점수는 30.2%였다1. 모델 자체는 손대지 않고 그 모델을 감싸는 에이전트 시스템만 바꿔 점수를 세 배 이상 끌어올렸다는 것이 이번 결과의 핵심이다.

AVO는 코드를 살펴보고 수정하고, 명령을 실행하고, 문서를 참고하고, 실행 결과로 작업을 검증하는 범용 코딩 에이전트 시스템이다. 단발성 응답으로 코드를 생성하는 대신, 여러 단계에 걸친 장기 작업을 끊김 없이 이어가는 데 초점을 맞췄다고 엔비디아는 설명한다2. 이 아키텍처는 GPU 커널 최적화와 소프트웨어 엔지니어링 작업에서 먼저 검증됐고, 이후 ARC-AGI-3라는 전혀 다른 환경에 그대로 이식됐다. 코드와 컴파일러를 다루는 작업과, 낯선 상호작용 환경에서 목표 자체를 추론해야 하는 게임형 작업은 표면적으로 다르지만 불완전한 근거로 가설을 세우고, 외부 인터페이스로 행동하고, 결과를 관찰하고, 유용한 상태를 보존하며, 잘못된 가정을 되짚어 수정하는 계산 패턴은 동일하다는 게 엔비디아 팀의 설명이다1.

ARC-AGI-3는 작업 완료 여부와 인간 기준 대비 행동 효율성을 결합한 RHAE(Relative Human Action Efficiency) 지표로 성능을 매긴다. AVO는 공개 세트 25개 환경, 183개 레벨 전체에서 100.00 RHAE를 기록했다1. 비영리 연구기관 ARC Prize가 지난 7월 발표한 분석에 따르면 클로드 오퍼스 5는 고(high) 추론 강도로 단독 실행했을 때 ARC-AGI-3에서 30.2%, 최대(Max) 추론 강도에서는 ARC-AGI-1 97.5%, ARC-AGI-2(세미-프라이빗) 90.4%를 기록했다1.

벤치마크클로드 오퍼스 5 단독AVO+클로드 오퍼스 5
ARC-AGI-197.5% (Max)—
ARC-AGI-2 (semi-private)90.4% (Max)—
ARC-AGI-3 (public)30.2% (high)100.00 RHAE

이 아키텍처는 GPU 커널 최적화 실험에서 먼저 실력을 보였다. 어텐션 커널 연구에서 AVO는 7일간 연속으로 작동하며 500개 이상의 최적화 방향을 탐색해 40개의 커널 버전을 커밋했고, DGX B200 시스템에서 나온 결과물은 cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 높은 처리량을 냈다. 이후 그룹 쿼리 어텐션(GQA)에 맞춰 커널을 적응시키는 데는 약 30분이 걸렸다2.

이렇게 장시간 작업을 이어가는 데는 두 가지 장치가 쓰인다. 이전 구현, 평가 결과, 컴파일러·프로파일러 출력, 축적된 추론 과정을 보존해 매번 처음부터 탐색을 재구성하지 않게 하는 지속 메모리, 그리고 정체되거나 반복적으로 비생산적인 흐름을 감지해 다른 전략으로 방향을 트는 감독(supervisor) 모듈이다2.

다만 이번 결과는 엔비디아 자체 블로그를 통해 공개된 발표이며, 더뉴스택이 이를 취재해 보도한 것이다1. 30.2%라는 기준선은 ARC Prize가 별도로 측정한 수치이고, 100%라는 AVO 결과는 엔비디아 팀이 자체 실행한 것이어서 두 수치가 동일한 조건에서 나온 것인지, 제3자의 독립 검증을 거쳤는지는 두 자료만으로는 확인되지 않는다.

Footnotes

  1. The New Stack, “Claude Opus 5 scored 30% on ARC-AGI-3. Wrapped in Nvidia’s AVO, it hit 100%.” ↩ ↩2 ↩3 ↩4 ↩5

  2. NVIDIA Technical Blog, “NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents” ↩ ↩2 ↩3

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents | NVIDIA Technical Blog — NVIDIA Technical Blog
  2. Claude Opus 5 scored 30% on ARC-AGI-3. Wrapped in Nvidia's AVO, it hit 100%. — The New Stack

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.