허깅페이스, 트랜스포머스에서 GGUF 양자화 모델 직접 구동 지원
최근 30일 조회수 — 좋아요 —핵심 요약
허깅페이스가 트랜스포머스 라이브러리에 llama.cpp GGUF 양자화 모델을 애플 실리콘에서 변환 없이 바로 추론하는 기능을 추가했다.
허깅페이스가 트랜스포머스(Transformers) 라이브러리에서 llama.cpp의 GGUF 양자화 모델을 직접 구동하는 기능을 공개했다. from_pretrained 함수에 GGUF 파일 경로만 넘기면 별도 변환 없이 바로 추론을 돌릴 수 있다.1
llama.cpp는 Ollama, LM Studio, Jan 같은 로컬 AI 도구들의 추론 엔진으로 쓰이며, MLX와 함께 개인 컴퓨터에서 언어 모델을 돌리는 방식을 실용적인 수준으로 끌어올린 프로젝트로 꼽힌다. 이 프로젝트가 만든 GGUF 포맷은 모델 가중치와 토크나이저 정보, 채팅 템플릿을 하나의 파일에 담고 다양한 압축 수준을 지원하는 로컬 추론용 표준 형식이다. ggml-org 계정을 비롯해 Unsloth, LM Studio Community, bartowski 같은 배포자들이 다양한 양자화 버전의 GGUF 체크포인트를 허깅페이스 허브에 올려두고 있고, 누적 다운로드 수는 수백만 건에 이른다.
트랜스포머스 팀은 이번 업데이트에서 llama.cpp의 ggml 커널을 kernels 라이브러리를 통해 그대로 재사용하는 방식을 택했다. 단순히 GGUF 파일을 읽어들이는 데 그치지 않고, 실행 속도를 llama.cpp 수준에 가깝게 맞추는 것이 목표라는 설명이다. 초기 지원 범위는 애플 실리콘(Apple Silicon)에서의 로컬 추론이며, 모델 아키텍처는 Qwen3.5부터 시작한다.
양자화 정도에 따라 파일 크기와 정밀도가 어떻게 갈리는지는 Unsloth가 배포한 Qwen3.5-4B 모델로 확인할 수 있다.
| GGUF 버전 | 파일 크기 | 특징 |
|---|---|---|
| BF16 | 8.42 GB | 비양자화 기준 모델 |
| Q6_K | 3.53 GB | 소형 버전 대비 높은 정밀도 |
| Q5_K_M | 3.14 GB | 크기와 정밀도의 중간 지점 |
| Q4_K_M | 2.74 GB | 로컬 추론의 실용적 출발점 |
블로그는 Q4_K_M을 기본 시작점으로 권장하고, 메모리 여유가 있다면 Q5_K_M이나 Q6_K를 시도해보라고 안내한다. 더 공격적인 양자화는 큰 모델을 작은 메모리에 욱여넣는 데 도움이 되지만, 품질 저하 폭은 모델과 작업 종류에 따라 달라지므로 실제 쓰려는 작업 기준으로 직접 평가해봐야 한다고 덧붙였다.
사용 방법은 간단하다. 애플 실리콘 맥, PyTorch 최신 두 버전 중 하나, 그리고 트랜스포머스 메인 브랜치와 호환되는 kernels 버전을 준비하면 된다.
pip install -U "git+https://github.com/huggingface/transformers.git" kernels
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "unsloth/Qwen3.5-4B-GGUF"
filename = "Qwen3.5-4B-Q4_K_M.gguf"
tokenizer = AutoTokenizer.from_pretrained(model_id, gguf_file=filename)
model = AutoModelForCausalLM.from_pretrained(model_id, gguf_file=filename)
from_pretrained에 gguf_file 인자만 추가하면 되고, 이후 텍스트 생성 과정은 기존 트랜스포머스 API와 동일하다. 가중치가 Metal 위에 그대로 올라가 있으면 트랜스포머스가 자동으로 호환되는 ggml/Metal 커널과 ggml-org/ggml-attn 어텐션 구현을 불러오며, 해당 커널을 받아오지 못하면 경고와 함께 sdpa 방식으로 대체된다. attn_implementation="sdpa"를 직접 지정해 강제로 전환하는 것도 가능하다.
NOTE
이번 지원은 애플 실리콘과 Qwen3.5 아키텍처로 범위가 한정돼 있어, 다른 운영체제나 모델 계열까지 넓어질지는 이번 발표만으로는 확인되지 않는다.
Footnotes
-
Hugging Face Blog, “Transformers now runs llama.cpp quants” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Transformers now runs llama.cpp quants — Hugging Face Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.