TasteVal서 Opus 5.5 인간 기준선 넘어
최근 30일 조회수 — 좋아요 —핵심 요약
AI의 실험 설계·해석 능력을 평가한 TasteVal에서 Opus 5.5가 인간 전문가 기준선을 웃돌았다.

AI가 흥미로운 실험을 고르고 결과에서 타당한 결론을 끌어내는 능력을 인간 전문가와 비교하는 벤치마크 테이스트밸(TasteVal)이 공개됐다. 10월 5일 arXiv에 제출된 논문에서 연구진은 2023~2026년에 출시된 모델 20종을 평가했으며, 가장 높은 성적을 낸 Opus 5.5가 인간 전문가 기준선을 넘어섰다고 밝혔다.1
테이스트밸이 말하는 ‘연구 안목’은 풀 만한 문제를 고르고, 실험을 설계하며, 결과를 해석하는 능력이다. 다만 이번 벤치마크는 연구 문제를 미리 고정한 뒤 모델이 실험을 반복 설계하고 결과에서 결론을 내리는 능력만 측정한다. 코딩 실력이 점수에 섞이지 않도록 평가 대상 모델은 ‘연구자(Researcher)’ 역할만 맡고, 별도의 고정된 ‘코더(Coder)’ 에이전트가 실험을 구현해 결과를 전달한다.
평가에는 최전선 AI 연구개발을 본뜬 새롭고 개방형인 과제 8개가 쓰였다. 연구자는 엔비디아 H100 기준 직렬 실험 연산량 40시간 또는 실제 경과 시간 120시간 중 하나를 소진할 때까지 실험을 이어간다. 인간 기준선은 과제마다 최소 2명씩, 모두 24명의 전문가를 모집한 뒤 각 과제의 최고 성적을 택해 만들었다.
핵심 지표는 같은 성과에 도달하는 데 필요한 직렬 실험 연산량이다. 예컨대 인간 전문가와 같은 점수를 절반의 연산량으로 얻으면 실험 안목을 2배로 계산한다. 이 기준에서 Opus 5.5의 연산 승수는 2.3배였고, 95% 신뢰구간은 1.15~4.37배였다. 연구진은 이 모델의 회당 비용이 인간 기준선 참여자의 평균 회당 비용보다 약 30분의 1이라고 보고했다.
20232026년 출시 모델을 비교하면 최상위 모델의 연산 승수는 2023년부터 2025년 12월까지 약 14개월마다 두 배가 됐지만, 이후에는 약 3개월마다 두 배로 빨라졌다. 후자의 95% 신뢰구간은 1.75.0개월이다. 반면 최종 정규화 성능은 이런 변곡을 보이지 않았고 약 14.6개월마다 두 배가 됐다. 즉 최종 점수 자체보다 제한된 연산량을 어디에 투입하는지가 최근 모델에서 빠르게 개선됐다는 해석이다.
다만 테이스트밸은 오염을 막겠다며 과제 내용을 공개하지 않았다. 외부 연구자가 과제 구성을 직접 살피거나 결과를 독립적으로 재현하기 어렵다는 뜻이다. 논문은 arXiv 제출본이며, ‘연구 안목’ 전체가 아니라 고정된 문제 안에서 드러나는 실험 능력을 측정한다는 범위도 분명하다.
Footnotes
-
arXiv, “TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts — arXiv (cs.AI/cs.CL/cs.LG)
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.