앤스로픽, AI가 AI 정렬 개선하는 초기 사례 공개

2분 AnthropicAI alignment자기개선AAR
최근 30일 조회수 — 좋아요 —

핵심 요약

앤스로픽 연구원이 자동화 시스템이 사람보다 저렴하고 빠르게 AI 정렬 성능을 개선한 논문을 발표했다.

앤스로픽(Anthropic) 펠로우 프로그램 연구원이 AI가 스스로 다른 AI 모델의 정렬(alignment) 성능을 개선하는 초기 사례를 담은 논문을 공개했다. 지난 금요일 발표된 이 논문 “Automated Researchers Can Reliably Mitigate Alignment Failures”에 따르면, 자동화 연구 시스템은 정렬 실패 유형을 측정하는 10개 벤치마크 전부에서 전반적인 성능 저하 없이 점수를 끌어올리는 데 성공했다.1

연구를 이끈 앤스로픽 펠로우 첸 유에한(Chen Yueh-Han)의 시스템은 사람 연구자의 작업 방식을 그대로 흉내 낸다. 자동화 시스템(Automated Alignment Researcher, AAR)은 기존 문헌을 검색해 개선 방법을 제안하고, 그 방법으로 모델을 30분간 학습시킨 뒤 벤치마크 점수를 확인한다. 이 과정을 여러 차례 반복하면서 효과가 있는 방법은 남기고 그렇지 않은 방법은 버리는 식으로, 빠른 속도와 대규모 실험을 동시에 확보했다.1

논문은 이 시스템의 성능을 사람 연구자와 직접 비교했다. “가장 뛰어난 AAR 방법은 평균 6시간 안에 숙련된 사람 연구자가 제안한 방법을 능가했다”고 밝혔으며, “사람이 제시한 연구 방향은 더 강한 성능으로 이어지지 않았다”고 덧붙였다. 비용 차이도 명시했는데, AAR을 API 추론 비용으로 운영하면 시간당 약 4달러가 드는 반면 사람 연구자에게는 시간당 150달러를 지불하고 있다고 밝혔다.1

이 결과는 AI가 자기 자신의 학습 과정을 개선하는 재귀적 자기개선(recursive self-improvement)으로 가는 한 걸음으로 읽힌다. 정렬 학습을 스스로 고도화할 수 있다면, 학습 방법론 전반으로 그 능력이 확장될 가능성도 있다는 뜻이고, 이는 결국 사람 AI 연구자의 역할이 축소되는 시나리오로 이어진다는 것이 TechCrunch의 해석이다.1

다만 논문 스스로도 한계를 인정했다. 자동화 시스템의 성능 개선은 벤치마크가 실제 정렬 목표를 얼마나 정확히 반영하느냐에 좌우되며, 그 벤치마크를 구축하고 유지하는 작업 자체에 상당한 노력이 필요하다. 자동화 연구자가 참조하는 문헌을 지속적으로 확충하고 관리하는 문제도 남아 있다고 밝혔다.1

Footnotes

  1. TechCrunch, An Anthropic researcher just gave us a peek at self-improving AI ↩ ↩2 ↩3 ↩4 ↩5

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. An Anthropic researcher just gave us a peek at self-improving AI | TechCrunch — TechCrunch

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.