[모델]리퀴드 AI, VLM 추론 최대 3배 빨라지는 드래프트 모델 공개
리퀴드 AI가 비전-언어 모델(VLM)을 위한 추측 디코딩 드래프트 모델 'LFM2.5-VL-3B-DSpark'를 공개했습니다. 279.5M 크기의 초소형 모델로, 기존 LFM2.5-VL-3B의 디코딩 속도를 최대 3.13배까지 끌어올립니다. 탐욕적 디코딩 환경에서는 원래 모델과 완전히 동일한 결과물을 내면서 추론 시간만 줄여줍니다.
전문 읽기접기
무슨 일이야
리퀴드 AI가 자사 비전-언어 모델 LFM2.5-VL-3B의 추론을 가속하는 전용 드래프트 모델 'LFM2.5-VL-3B-DSpark'를 선보였습니다. 모델 파라미터는 279.5M 수준으로 매우 가볍게 설계되었습니다.
속도 향상 폭은 상당합니다. 하드웨어별 테스트 결과 Apple M5 Max 환경에서는 최대 3.13배, 엔비디아 H100 GPU 환경에서는 최대 2.66배 빠른 디코딩 속도를 기록했습니다.
더불어 추측 디코딩(Speculative Decoding)을 적용하더라도 탐욕적 디코딩(greedy decoding) 조건에서는 메인 모델과 정확히 일치하는 출력 결과를 보장합니다. 오픈소스 생태계 지원도 곧바로 이뤄져 llama.cpp, MLX-VLM, SGLang에서 바로 사용할 수 있습니다.
왜 중요해
비전-언어 모델은 멀티모달 특성상 연산량이 많아 온디바이스나 로컬 환경에서 구동하기에 속도 부담이 컸습니다. 이번 드래프트 모델 배포로 동일한 출력 품질을 유지한 채 로컬(애플 실리콘)부터 데이터센터(H100)까지 폭넓게 서빙 비용과 지연 시간을 대폭 줄일 수 있게 되었습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.