리퀴드 AI, 엣지용 의사결정 모델 공개
최근 30일 조회수 — 좋아요 —핵심 요약
한 번의 순전파로 텍스트·이미지·오디오를 처리해 엣지 기기에서 빠른 판단을 지원한다.

리퀴드 AI(Liquid AI)가 엣지 기기용 오픈 의사결정 모델 d1-3B와 d1-omni-600M을 공개했다. 두 모델은 답변 토큰을 차례로 생성하는 대신 한 번의 순전파로 결과를 내놓는다. 텍스트뿐 아니라 이미지·오디오를 입력받을 수 있어, 엣지 기기에서 빠른 판단이 필요한 환경을 겨냥했다.1
d1-3B는 디코더 전용 비전언어모델(VLM) LFM2.5-VL-3B를 바탕으로 하며 텍스트와 이미지를 처리한다. d1-omni-600M은 양방향 인코더 LFM2.5-Encoder-350M에 비전·오디오 인코더를 더했다. 텍스트와 이미지 또는 텍스트와 오디오를 조합해 입력할 수 있다. 다만 리퀴드 AI는 d1-omni-600M을 초기 연구 공개판으로 규정했다.
회사가 독해, 유해성 탐지, 의도 분류, 의료 질의응답, 다국어 이해 등 공개 데이터셋 7개에서 측정한 평균 점수는 다음과 같다.1
| 모델 | 매개변수 | 평균 점수 |
|---|---|---|
d1-3B | 30억 | 82.9 |
d1-omni-600M | 6억 | 78.4 |
Decider 4B | 40억 | 81.1 |
Decider 2B | 20억 | 77.1 |
d1-3B는 네 모델 가운데 평균이 가장 높았다. d1-omni-600M도 매개변수가 약 3.3배 많은 Decider 2B를 1.3점 앞섰다. 별도 평가인 디시전 인덱스(Decision Index) 0.2.1에서는 d1-3B가 48.57점을 기록해 Decider 35B-A3B의 47.11점을 웃돌았으며, 리퀴드 AI는 이를 100억 매개변수 미만 모델 중 최고 성적이라고 밝혔다.
속도 측정에서도 순전파 방식의 이점이 드러난다. 질문 하나를 처리하는 데 젯슨 AGX 토르(Jetson AGX Thor)는 16ms, AGX 오린 64GB는 26ms, 오린 나노는 50ms가 걸렸다. RTX 4090과 AMD MI325X에서는 각각 8ms와 9ms였다. 토르에서 질문 수를 하나에서 세 개로 늘려도 처리 시간은 16ms에서 20ms로만 증가했다.
다만 멀티모달 성능을 수치로 비교할 근거는 아직 부족하다. 리퀴드 AI는 d1-3B가 기반 모델의 비전 능력을 유지하고 d1-omni-600M이 세 가지 양식을 처리한다고 검증했지만, 비전·오디오 벤치마크 결과는 공개하지 않았다. 디시전 인덱스 0.3의 비전 평가가 비공개 데이터로 구성돼 있고 오디오 의사결정 벤치마크도 정립되지 않았다는 설명이다. 따라서 공개된 수치는 주로 텍스트 중심 의사결정 성능과 d1-3B의 실행 속도를 보여준다.
Footnotes
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Multimodal open d1 decision models for the edge — Hugging Face Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.