LLM, 규모 커질수록 연산 오류 복원력 향상
최근 30일 조회수 — 좋아요 —핵심 요약
결함 환경에서 학습한 LLM은 규모가 클수록 오류 복원력이 높아져 저전력 하드웨어 활용 가능성을 보였다.
대규모 언어 모델(LLM)을 연산 오류가 발생하는 디지털 하드웨어에서 작동하도록 학습하면, 모델 규모가 커질수록 오류 복원력이 오히려 높아진다는 연구 결과가 나왔다. 연구진은 이를 토대로 에너지 효율은 높지만 신뢰성이 낮은 하드웨어에서도 안정적으로 추론하는 ‘결함 허용 파운데이션 모델’ 학습법을 제안했다.1
이번 연구의 출발점은 하드웨어의 에너지 효율과 신뢰성 사이에 생기는 맞교환 관계다. 새로 등장하는 일부 컴퓨팅 하드웨어는 소비 전력을 줄이는 대신 연산 오류 가능성을 감수한다. 연구진은 학습 단계부터 결함이 있는 디지털 연산 환경을 모사해 LLM이 오류에 적응하도록 했다.
연구진은 모의 결함 하드웨어에서 총 4만 GPU시간에 걸쳐 학습 실험을 진행하고, 그 결과를 반영한 수정 신경 스케일링 법칙을 도출했다. 이 법칙은 모델이 커질수록 오류에 더 취약해지는 것이 아니라 복원력이 높아지는 경향을 수치화한다. 연구진의 해석에 따르면 모델은 학습 과정에서 오류를 견딜 수 있는 ‘좋은’ 오류 정정 코드 안에서 계산하는 방법을 익히는 것으로 보인다. 특히 오류를 바로잡는 데 필요한 상대적 오버헤드가 모델 크기와 함께 끝없이 커지지 않고 유한한 수준에 머문다는 점이 핵심이다.
이 결과가 중요한 이유는 LLM의 대형화가 결함 허용성을 해치지 않으면서 저전력 하드웨어 활용 가능성을 넓힐 수 있기 때문이다. 신뢰성을 다소 낮춰 에너지를 절약한 장치에서도 모델이 안정적으로 추론할 수 있다면, 현재 방식보다 추론 전력 소비를 크게 줄일 경로가 생긴다.
다만 논문이 보여준 결과는 실제 결함 하드웨어가 아니라 모의 환경에서 얻은 것이다. 적절히 학습한 LLM이 수학적으로 엄밀한 결함 허용성을 갖출 수 있다는 주장과 상당한 에너지 절감 가능성도 연구진이 제시한 추측이지, 아직 입증된 결론은 아니다. 실제 장치에서 오류 유형과 빈도가 달라져도 같은 스케일링 경향이 유지되는지는 후속 검증이 필요하다.1
Footnotes
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Fault-tolerant foundation models — arXiv (cs.AI/cs.CL/cs.LG)
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.