LLM, 문맥 학습 시 내부에 믿음 상태 기하 구조 형성

2분 LLMin-context learningbelief stateHMM
최근 30일 조회수 — 좋아요 —

핵심 요약

LLM 6종의 내부 활성값에서 HMM 믿음 상태가 선형적으로 읽히며 예측 행동을 실제로 이끄는 표상임이 확인됐다.

대형언어모델(LLM)이 문맥 안에서 새로운 패턴을 학습할 때, 내부적으로 확률 상태에 대한 기하학적 지도를 스스로 만들어낸다는 연구 결과가 나왔다. 논문 “Large Language Models Develop Belief State Geometry In-Context”에 따르면, 오픈소스 LLM 6종의 내부 활성값에서 은닉 마르코프 모델(HMM, Hidden Markov Model)의 ‘믿음 상태(belief state)‘—관측된 토큰 이력이 주어졌을 때 숨은 상태에 대한 사후 확률 분포—가 선형적으로 읽어낼 수 있는 형태로 존재했다.

연구진은 뚜렷한 믿음 구조를 갖도록 고른 HMM 40개에서 데이터를 생성해 이를 LLM에 문맥으로 제시한 뒤, 잔차 스트림(residual stream) 활성값에 선형 프로브(probe)를 걸어 믿음 상태를 복원할 수 있는지 살폈다. 그 결과 HMM과 LLM 조합에 따라 프로브의 $R^2$ 값이 최고 0.83에서 0.99에 달했고, 이 신호는 얕은 층부터 깊은 층까지 폭넓게 나타났다.

단순히 상관관계를 확인하는 데 그치지 않고, 연구진은 프로브가 찾아낸 부분공간(subspace)에 직접 개입했다. 패칭(patching)과 스티어링(steering) 기법으로 이 부분공간의 값을 인위적으로 바꿔 넣었을 때, 모델의 다음 토큰 예측 품질은 손대지 않은 원래 모델과 비슷한 수준을 유지했다. 반면 대조군에서는 예측 성능이 크게 떨어졌다. 이는 해당 부분공간이 단지 믿음 상태와 상관된 부산물이 아니라, 실제로 모델의 예측 행동을 이끄는 기능적 표상이라는 근거가 된다.

이 결과가 가리키는 것은 문맥 내 학습(in-context learning, ICL)의 작동 방식 자체다. 연구진은 오픈소스 LLM의 ICL이 문맥에서 추론한 생성 모델에 대해 최적에 가까운 베이즈 예측을 근사하고 있다는 표상 수준의 증거라고 설명한다. 즉 모델이 문맥을 볼 때마다 그 문맥을 만들어냈을 법한 숨은 규칙을 암묵적으로 추정하고, 그 추정치를 갱신해가며 다음 토큰을 예측한다는 뜻이다.

논문은 이 발견을 기존 연구의 연장선에 놓는다. HMM 데이터로 명시적으로 훈련시킨 소형 토이 네트워크에서 입력 분포의 구조가 활성값의 기하학적 배치로 이어진다는 결과는 이미 보고된 바 있는데, 이번 연구는 그 관찰이 실제 서비스 규모의 LLM에서도 그대로 성립함을 보였다는 데 의미가 있다. 다만 이번 실험은 HMM이라는 통제된 합성 환경에서 이뤄졌고, 대상도 오픈소스 모델 6종에 한정된다는 점은 그대로 남는 한계다.

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Large Language Models Develop Belief State Geometry In-Context — arXiv (cs.AI/cs.CL/cs.LG)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.