[모델]Liquid AI, VLM 가속 위한 드래프트 모델 공개
Liquid AI가 자사 비전-언어 모델(VLM)인 'LFM2.5-VL-3B'의 추론 속도를 높여주는 드래프트 모델 'LFM2.5-VL-DSpark'를 공개했습니다. 투기적 디코딩(Speculative Decoding) 방식을 적용해 출력 품질 저하 없이 디코딩 속도를 최대 3배 이상 끌어올렸습니다. SGLang, llama.cpp, MLX-VLM 등 주요 추론 엔진에서 바로 쓸 수 있습니다.
전문 읽기접기
무슨 일이야
Liquid AI가 소형 비전-언어 모델 LFM2.5-VL-3B를 위한 실험적 투기적 디코딩 모델 'LFM2.5-VL-DSpark'를 선보였습니다. 이번 드래프트 모델은 약 2억 8,000만(280M) 파라미터 크기로, 기존 타깃 모델 대비 파라미터 수가 8.9%만 늘어납니다. 이미지 패치와 텍스트 토큰이 공유 표현으로 투영된 뒤 고정된 레이어의 히든 스테이트를 참조해 후보 토큰 블록을 생성하는 구조입니다.
성능 테스트 결과 환경에 따라 유의미한 속도 개선이 확인됐습니다. M5 Max 기반 MLX 환경에서는 작업에 따라 디코딩 속도가 2.30배에서 3.13배, 엔드투엔드(E2E) 지연 시간은 1.56배에서 2.62배 단축됐습니다. M3 Ultra의 llama.cpp에서는 디코딩 속도가 최대 2.14배, H100 GPU 환경에서는 최대 2.66배 빨라졌습니다.
새 드래프트 모델은 오픈소스로 허깅페이스에 Safetensors 및 GGUF 포맷으로 등록됐습니다. 출시 시점부터 SGLang, llama.cpp, MLX-VLM을 지원해 각 프레임워크의 빌드에 맞춰 온디바이스와 데이터센터 환경 모두에서 구동할 수 있습니다.
왜 중요해
온디바이스 환경에서 비전-언어 모델을 돌릴 때 가장 큰 걸림돌이었던 디코딩 지연 시간을 메모리 부담을 최소화하면서 크게 줄였습니다. 투기적 디코딩 방식의 특성상 타깃 모델이 후보 토큰을 최종 검증하므로 그리디 디코딩 기준 원본 모델과 완전히 동일한 출력 품질을 유지합니다.
짚고 넘어갈 점
비전 모델의 특성상 암달의 법칙(Amdahl's law)에 따른 한계가 존재합니다. 투기적 디코딩은 텍스트를 생성하는 디코드 단계만 가속할 뿐, 이미지 인코딩이나 프리필(prefill) 단계는 줄이지 못합니다. 특히 연산 성능이 제한된 엣지 기기에서는 프리필 단계가 전체 지연 시간의 상당 부분을 차지하므로, 디코딩이 대폭 빨라져도 전체 체감 성능 개선 폭은 제한적일 수 있습니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.