버클리·MIT, 소비자 GPU용 MoE 추론 엔진 FreeToken 공개

1분 FreeTokenMoE로컬LLM추론엔진
최근 30일 조회수 — 좋아요 —

핵심 요약

UC버클리·MIT 연구진이 동적 스케줄링으로 소비자 하드웨어에서 프런티어급 MoE 모델을 구동하는 오픈소스 추론 엔진 FreeToken을 발표했다.

UC버클리와 MIT 연구진이 소비자용 하드웨어에서 프런티어급 MoE(Mixture-of-Experts) 모델을 구동하는 오픈소스 추론 엔진 FreeToken을 공개했다. InfoQ에 따르면 이 프로젝트는 데이터브릭스 공동창업자 마테이 자하리아(Matei Zaharia)와 이온 스토이카(Ion Stoica), 그리고 송한(Song Han), 커트 코이처(Kurt Keutzer) 등이 공동 저술했다.[^1] 개인용 컴퓨터를 용량이 제한된 데이터센터 노드의 축소판으로 취급하던 기존 접근과 달리, FreeToken은 이를 탄력적이고 이질적인 컴퓨팅 자원으로 관리하는 방향으로 설계됐다.

MoE 아키텍처는 토큰마다 전체 파라미터 중 일부만 계산하지만, 디코딩 과정에서는 수천억 개에 달하는 비활성 가중치 사이를 오가며 라우팅해야 한다. 데이터센터에서는 NVLink 같은 고대역폭 인터커넥트가 이 전송 부담을 가려주지만, 소비자용 하드웨어는 PCIe 대역폭(초당 16~64GB)과 호스트 RAM 지연이 발목을 잡는다. 기존 엣지 런타임은 비활성 가중치를 시스템 RAM에 두고 활성화 시점에 GPU로 동기적으로 스트리밍하는 정적 오프로딩 방식을 쓰는데, 캐시 미스가 발생하면 실행 자체가 멈춰버린다.

FreeToken은 이 문제를 q* 정책이라 부르는 동적 공동 스케줄링으로 풀었다. 캐시 미스마다 GPU를 세우는 대신, 실시간 인터커넥트 처리량에 맞춰 토큰 연산을 CPU 코어와 GPU 텐서 코어에 나눠 배분한다. 여기에 FTW(fast weight format)라는 고속 가중치 포맷과 레이어 전체 단위의 더블 버퍼링을 결합해, PCIe를 통한 가중치 스트리밍이 활성 레이어 연산과 완전히 겹치도록 만든다. VRAM은 KV 캐시와 상주 전문가(expert) 슬롯 사이에서 모델 재로딩 없이 실시간 재할당된다. 코딩 어시스턴트나 자율 에이전트처럼 프롬프트가 자주 바뀌는 워크로드를 위해서는 시맨틱 앵커 체크포인팅을 도입해, 논리적 작업 경계마다 어텐션 상태를 캐시해두고 에이전트가 툴 호출 인자를 수정하거나 실행 결과를 주입해도 전체 시퀀스를 다시 계산하지 않는다.

기존 런타임과 비교하면 성격 차이가 뚜렷하다.

| 런타임 | 특징 | FreeToken 대비 |
|---|---|---|
| Ollama·llama.cpp | GGUF 양자화, 레이어 단위 오프로딩 | 디코드 3~4배, 프리필 6~30배 빠름 |
| vLLM·SGLang | 페이지드 어텐션, 연속 배칭, 고대역폭 전제 | 이종 메모리 계층 미고려 |
| KTransformers | 정적 CPU/GPU 오프로딩 규칙 | FreeToken은 레이어별 실시간 최적 분할 계산 |

논문 벤치마크에 따르면 8GB RTX 4060 노트북에서 Qwen3.6-35B가 초당 약 39토큰으로 동작했고, RTX 5090 데스크톱에서는 2840억 파라미터 규모의 DeepSeek-V4-Flash를, 워크스테이션 GPU 한 장에서는 7530억 파라미터 규모의 GLM-5.2를 서빙했다. CLI와 데스크톱 클라이언트는 FlashML.ai와 깃허브 저장소에서 받을 수 있으며, 리눅스·윈도우에서 RTX 30·40·50 시리즈를 지원한다.

해커뉴스와 레딧 LocalLLaMA 포럼에서는 로컬 하드웨어로 프런티어급 추론 에이전트를 클라우드 API 비용 없이 돌릴 수 있다는 점에 기대가 크다. 중고 RTX 3090이나 4080에 일반 DDR4·DDR5 램을 조합해도 대역폭 적응형 MoE 서빙이 가능해지면서 셀프 호스팅 진입장벽이 낮아졌다는 반응이다. 다만 실제 엣지 환경에서의 스케줄링 동작을 두고는 기술적 검증이 더 필요하다는 지적도 함께 나온다.

[^1]: InfoQ, "FreeToken Unlocks Frontier MoE Inference on Consumer Hardware via Dynamic Co-Execution"

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. FreeToken Unlocks Frontier MoE Inference on Consumer Hardware via Dynamic Co-Execution — InfoQ

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.