24GiB 맥북서 20만 토큰 로컬 LLM 추론, JustFit 공개

2분 JustFit로컬 LLM메모리 최적화Qwen3
최근 30일 조회수 — 좋아요 —

핵심 요약

연구진이 KV 캐시 압축과 즉시 메모리 관리로 24GiB 맥북에서 20만 토큰 넘는 컨텍스트를 처리하는 추론 런타임 JustFit을 공개했다.

24GiB 메모리 맥북에서 20만 토큰 넘는 컨텍스트로 로컬 LLM을 돌릴 수 있는 추론 런타임이 공개됐다. 연구진이 arXiv에 게재한 논문에 따르면, ‘JustFit’이라는 이름의 이 시스템은 24GiB M4 Pro 맥북에서 Qwen3.8-27B MXFP4 모델을 구동해 입력 196,608토큰, 출력 16,384토큰, 총 212,992토큰짜리 단일 요청을 세 차례 독립 실행으로 완주시켰다.1

비교 기준이 된 mlx-vlm 베이스라인은 같은 하드웨어에서 30,720토큰까지만 처리할 수 있었다. JustFit은 이를 6.93배로 늘렸다. 별도로 진행된 두 개 요청 실험에서는 합산 229,376토큰까지 컨텍스트를 유지했다.

핵심은 메모리를 아끼는 세 가지 메커니즘이다. KVExec는 압축된 상태로 KV 캐시를 실행하고, PhaseSwap은 모델의 각 구성 요소가 메모리에 상주하는 시점을 관리하며, StateTrans는 서빙 도중 상태를 유지한 채 전환을 처리한다. 논문은 이 세 메커니즘이 “재구성을 융합하고 즉시(just-in-time) 방식의 메모리 할당과 해제를 조율한다”고 설명하며, 이 접근이 모델 가중치 양자화와는 독립적으로 작동한다는 점을 강조한다. 즉 양자화로 모델 크기를 줄이는 것과는 별개로, 실행 중 발생하는 컨텍스트·상태 메모리를 따로 압축해 절약한다는 것이다.

성능 측정에서는 입력 32K, 출력 64토큰짜리 짧은 작업 기준 초당 19.11토큰을 처리했고, 32K 입력에 6K를 반복 추가하는 워크로드에서는 프로세스 메모리 사용량 중앙값이 16,374MiB로 나타났다. 24GiB(약 24,576MiB) 메모리 한도 안에서 여유를 두고 돌아간다는 뜻이다.

논문은 실사용성을 보여주는 지표로 AIME 2026 문제 30개 중 29개를 정답 처리한 결과도 제시했다.

다만 이 결과는 아직 동료 심사를 거치지 않은 사전공개 논문 단계이고, 테스트 모델도 Qwen3.8-27B 한 종류로 한정돼 있다. 다른 모델 아키텍처나 다른 하드웨어에서도 같은 배율의 메모리 절감이 재현되는지는 논문만으로는 확인되지 않는다.

Footnotes

  1. arXiv, “JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management — arXiv (cs.AI/cs.CL/cs.LG)

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.