Pathway, 트랜스포머 대체할 신경망 BDH 개발…AWS 하이퍼팟 활용

3분 BDHTransformerAWSSageMaker HyperPod
최근 30일 조회수 — 좋아요 —

핵심 요약

Pathway가 사고 사슬 대신 잠재 공간에서 추론하는 신경망 아키텍처 BDH를 세이지메이커 하이퍼팟으로 개발 중이라고 AWS가 밝혔다.

Pathway는 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)에서 트랜스포머(Transformer)를 대체할 신경망 아키텍처 BDH(Dragon Hatchling)를 개발하고 있다고 AWS 머신러닝 블로그가 2026년 9월 8일 밝혔다. BDH는 추론 과정을 텍스트로 풀어 쓰는 사고 사슬(chain-of-thought) 대신, 잠재 공간(latent space) 안에서 답을 다듬어가는 방식을 쓴다.

지금의 대형언어모델(LLM)은 답을 낼 때 중간 추론 과정을 토큰으로 하나씩 생성해 다시 입력으로 되먹이는 방식을 쓴다. 이 과정에서 토큰이 늘어날수록 연산량도 함께 불어난다. BDH는 이 단계를 생략하고, 뇌의 신경세포처럼 희소하고 국소적인 상호작용으로 연결된 그래프 구조 위에서 시냅스와 비슷한 연결에 상태를 저장하며 추론한다. AWS에 따르면 이 상태는 테스트 시점에 가중치를 다시 학습시키지 않아도 문맥에 맞춰 스스로 조정되며, 추론이 미치는 범위도 고정된 컨텍스트 윈도우 크기나 사고 사슬 토큰 양에 매여 있지 않다.

AWS 블로그는 트랜스포머의 구조적 한계를 상당히 구체적으로 짚었다. 학습 단계에서는 훈련 데이터 범위를 벗어난 일반화, 특히 긴 사고 사슬 추론에서 취약해 이를 데이터양과 연산량으로 메워야 한다. 모델이 커질수록 밀집 연산과 전체 역전파(back-propagation)에 드는 비용이 기하급수적으로 늘어나는 점도 문제로 지목됐다. 뉴런 단위 활성화 같은 미시적 동작과 모델이 실제로 내놓는 답이라는 거시적 결과 사이의 연결고리가 불분명하다는 지적도 있다. 새 지식을 넣으려면 전체를 재학습하거나 파인튜닝해야 하는데, 이 과정에서 기존에 학습한 내용을 잊어버리는 이른바 파괴적 망각(catastrophic forgetting) 문제도 되풀이된다.

추론 단계의 문제는 다른 축에서 나타난다. 어텐션(attention) 메커니즘 구조가 확장성을 제약하고, 전문가 혼합(Mixture of Experts) 기법을 쓰더라도 밀집 활성화 패턴 탓에 연산량과 메모리 대역폭 소모가 과도하다. 고정된 컨텍스트 윈도우와 계속 커지는 KV 캐시는 처리 가능한 시퀀스 길이 자체를 제한한다. 여기에 트랜스포머 내부 상태가 닫혀 있어 추론 과정을 들여다보거나 감시하기 어렵다는 점은, 규제가 엄격한 산업에서 신뢰성과 안전성 문제로 이어진다고 AWS는 설명했다. 블로그는 이런 한계들이 구현 방식의 문제가 아니라 아키텍처 설계 자체에서 비롯된 것이라며, 그래서 다른 접근이 필요하다는 논지를 폈다.

Pathway는 BDH를 파이토치(PyTorch)와 통합해 개발하고 있으며, 학습 확장을 위해 세이지메이커 하이퍼팟을 쓰고 있다. AWS는 하이퍼팟이 Pathway의 응용 AI 과학자들이 컴퓨팅 자원을 회복력 있고 확장 가능하며 비용 효율적으로 공유하도록 돕는다고 설명했다. BDH의 변형인 BDH-CQ는 순환 잠재 상태(recurrent latent state) 안에서 반복 연산을 수행해 추론 중 내부 메모리를 갱신하고, 후보 답만 디코딩하는 방식으로 동작한다. 이 방식이 실제 벤치마크에서 트랜스포머 대비 얼마나 성능이나 효율 차이를 내는지는 이번 자료에 구체적인 수치로 제시되지 않았다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Pathway’s brain-inspired architecture development on Amazon SageMaker HyperPod | Amazon Web Services — AWS Machine Learning Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.