LiquidAI, VLM용 추측 디코딩 모델 LFM2.5-VL-DSpark 공개

3분 LiquidAIspeculative-decodingVLMLFM2.5
최근 30일 조회수 — 좋아요 —

핵심 요약

LiquidAI가 비전-언어모델 디코딩 속도를 최대 3.13배 높이는 드래프트 모델 LFM2.5-VL-DSpark를 공개했다.

LiquidAI가 비전-언어모델(VLM)용 추측 디코딩 드래프트 모델 LFM2.5-VL-DSpark를 공개했다. 허깅페이스 블로그에 따르면 이 드래프트 모델을 붙이면 디코딩 속도가 기기에서 최대 3.13배, H100 GPU에서 최대 2.66배 빨라지고, 전체 응답 지연은 각각 최대 2.62배와 2.27배 줄어든다.1

추측 디코딩(speculative decoding)은 작은 드래프트 모델이 먼저 여러 토큰을 예측하고 본체 모델이 이를 한 번에 검증해 채택 여부를 정하는 방식으로, 검증이 통과할 때마다 여러 토큰을 한 번의 순전파로 확정해 디코딩 단계를 앞당긴다. LFM2.5-VL-DSpark는 앞서 나온 텍스트 전용 LFM2.5-DSpark 드래프트 모델과 같은 구조를 쓴다. 본체 모델의 특정 층에서 은닉 상태(hidden state)를 뽑아 이를 조건으로 k개의 후보 토큰 블록을 예측하는 방식인데, 이미지 패치와 텍스트 토큰이 해당 층에 들어가기 전 같은 표현 공간으로 투영되기 때문에 드래프트 모델 입장에서는 입력이 이미지든 텍스트든 같은 차원의 벡터로 보인다. 그 결과 추론 알고리즘 자체는 텍스트 모델과 달라지지 않는다.

드래프트 모델은 비전-언어 SFT 데이터로 학습했으며, 3·4·5층 구성을 비교한 끝에 어텐션만 쓰는 4층 구조에 블록 크기 9를 채택했다. 파라미터는 디코더 스택 193.0M, 은닉 상태 투영 21.0M, 마르코프 헤드(Markov head) 65.5M 등을 합쳐 총 279.5M으로, 3B 규모인 본체 LFM2.5-VL-3B 대비 8.9% 늘어나는 수준이다.

성능은 MMSpec 벤치마크의 일반 VQA, 텍스트 VQA, 이미지 캡셔닝, 차트 VQA, 복합 추론, 멀티턴 대화 등 여섯 개 비전 과제로 측정했다.

환경디코딩 속도종단 지연 개선
MLX, M5 Max (온디바이스)2.30x~3.13x1.56x~2.62x
llama.cpp, M3 Ultra (온디바이스)1.57x~2.14x1.30x~1.77x
H100 (GPU)최대 2.66x1.64x~2.27x

다만 추측 디코딩은 디코딩 단계만 앞당길 뿐 이미지 인코딩과 프리필(prefill) 단계는 그대로다. VLM은 이미지가 비전 인코더를 거친 뒤 수백 개의 시각 토큰이 텍스트 프롬프트와 함께 언어 모델에 들어가기 때문에 프리필 비중이 크고, 특히 연산 자원이 적은 엣지 기기에서는 전체 지연에서 프리필이 차지하는 비율이 더 커진다. 이 부분이 가속되지 않는 이상 디코딩을 아무리 빠르게 해도 종단 지연 개선폭은 암달의 법칙(Amdahl’s law)에 따라 한계에 부딪힌다고 블로그는 설명한다. M5의 코어별 GPU 신경망 가속기는 이 격차를 어느 정도 줄여준다고 덧붙였다.

LFM2.5-VL-DSpark는 공개 첫날부터 llama.cpp, MLX-VLM, SGLang을 지원한다. SGLang에서 쓰려면 LFM2 타깃용 DSpark를 지원하는 빌드(PR #40651)가 필요하며, 서버 실행은 다음과 같다.

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

이후 http://localhost:30000/v1의 OpenAI 호환 엔드포인트로 질의하면 되며, 블록 크기는 하드웨어에 따라 8 또는 9를 권장한다.

Footnotes

  1. Hugging Face Blog, “Accelerating vision-language models with LFM2.5-VL-DSpark” ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Accelerating vision-language models with LFM2.5-VL-DSpark — Hugging Face Blog

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.