Multiverse, 4비트 양자화 모델이 원본 성능 능가하는 회복 기법 공개
최근 30일 조회수 — 좋아요 —핵심 요약
Multiverse Computing이 원본 모델에서 직접 증류하는 QAH 기법으로 4비트 압축 모델이 풀프리시전 원본을 능가하는 결과를 냈다.
Multiverse Computing가 압축한 대형언어모델을 4비트로 양자화하면서도 원본 모델보다 성능이 높은 결과를 냈다고 밝혔다. 회사가 25일 허깅페이스 블로그에 공개한 논문 「Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs」에 따르면, GPT-OSS 120B 모델을 60B 파라미터로 구조적 압축한 뒤 MXFP4 4비트로 양자화하고 이 회복 기법을 적용한 결과, 9개 벤치마크 중 7개에서 압축 전 풀프리시전(bfloat16) 원본을 웃돌았다. 크기와 연산 비용을 줄이면서도 정확도까지 높인 모델이 나온 셈이다.
이 결과는 4비트 모델이 원본보다 성능이 뒤처지는 것을 당연하게 여겨온 통념을 뒤집는다. 회사가 이런 결과를 낸 배경에는 회복(healing) 단계를 다시 설계한 접근이 있다. 일반적인 경량화 파이프라인은 구조 압축, 양자화, 회복의 세 단계를 거치며, 방법 간 차이는 마지막 회복 단계에서 갈린다.
가장 널리 쓰이는 방식은 양자화 인식 학습(QAT, Quantization-Aware Training)이다. 순전파 과정에 가짜 양자화 연산을 넣고 태스크 손실로 계속 미세조정해 가중치가 저정밀도 표현에 적응하도록 만드는 방식이다. 문제는 이미 지도 미세조정, RLHF, 에이전틱 튜닝까지 거친 값비싼 다단계 후처리 과정을 노이즈가 낀 저정밀도 순전파로 다시 돌려야 한다는 점이다. 비용이 클 뿐 아니라, 이 논문에 따르면 최적점을 지나 학습을 계속하면 불안정해질 수도 있다.
대안으로 쓰이는 양자화 인식 증류(QAD, Quantization-Aware Distillation)는 이 재학습 부담을 피한다. 태스크 손실 대신 고정된 풀프리시전 교사 모델의 출력 로짓을 KL발산 손실로 양자화된 학생 모델에 증류하는 방식이다. 단순 양자화만 거친 경우엔 동일한 모델의 진짜 풀프리시전 버전이 교사로 존재하기 때문에 이 방법이 잘 작동한다. 하지만 구조 압축까지 거쳐 레이어·헤드·뉴런 수 자체가 줄어든 모델에는 이 전제가 무너진다. 독립적으로 학습된, 축소된 구조의 풀프리시전 버전이 애초에 존재하지 않기 때문이다. 남은 후보 교사는 앞서 회복 단계를 거친 bfloat16 체크포인트뿐인데, 이 체크포인트 자체가 이미 원본을 근사한 증류 결과물이다. 여기서 다시 증류하면 학생 모델은 이미 손상된 목표에 묶이고, 정확도는 그 회복 체크포인트의 한계를 넘지 못한다. 논문은 구조 압축과 양자화를 동시에 거친 모델을 어떻게 회복시킬지가 그동안 사실상 미해결 문제로 남아 있었다고 지적한다.
Multiverse Computing이 제시한 양자화 인식 힐링(QAH, Quantization-Aware Healing)은 이 한계를 하나의 변경으로 없앤다. 회복된 중간 체크포인트가 아니라 압축 이전의 원본 모델에서 직접 증류하는 것이다. 교사와 학생은 아키텍처조차 공유하지 않는다. 교사는 전체 크기의 풀프리시전 모델이고, 학생은 절반 크기에 MXFP4로 동작한다. 교사의 출력 분포는 아키텍처와 무관하게 정의되기 때문에 크기나 구조가 달라도 지식 전달에는 문제가 없으며, 학생 모델은 정답 레이블 없이 교사의 출력 분포만 KL발산으로 학습한다.
이는 양자화 단계의 역할 자체를 바꿔놓는다. QAH 아래에서 양자화는 회복이 끝난 뒤 덧붙이는 손실 처리 단계가 아니라, 원본 교사를 상대로 한 두 번째 완전한 증류 과정이 된다. bfloat16 체크포인트는 받은 적 없는 지도 신호다. 즉 4비트 학생 모델은 양자화로 잃은 정보를 보완하는 게 아니라, 앞선 회복 단계가 시간이나 데이터 부족으로 미처 전달하지 못한 정보를 새로 받는 셈이다.
여기에 안정성 측면의 이점도 따라붙는다. KL 증류는 학생을 고정된 교사 분포에 묶어두기 때문에 학생이 교사를 따라잡은 뒤에는 더 밀어붙일 방향이 없다. 반면 교차엔트로피 태스크 손실은 정답 레이블 쪽으로 학습을 끝없이 밀어붙인다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original — Hugging Face Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.