[모델]Liquid AI, 양자화 증류 적용한 LFM2.5 Q4_0 체크포인트 공개
Liquid AI가 양자화 인식 증류(QAD) 기술을 적용한 LFM2.5 시리즈의 4비트(Q4_0) GGUF 체크포인트를 공개했습니다. 이번 모델들은 기존 4비트 양자화에서 발생하던 성능 저하를 크게 줄여, 원본 BF16 대비 96~97% 수준의 성능을 유지하면서도 더 빠른 속도를 냅니다.
전문 읽기접기
무슨 일이야
Liquid AI가 LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, LFM2.5-2.6B 총 4종의 모델에 대해 QAD(Quantization-Aware Distillation)를 적용한 Q4_0 체크포인트를 배포했습니다.
추론, 지시 이행, 도구 사용 등을 측정하는 벤치마크 평가 결과, QAD 체크포인트는 원본 BF16 성능의 96.5%~97.4%를 보존하는 것으로 나타났습니다. 기존 사후 양자화(PTQ) 방식과 비교했을 때 성능 방어율이 크게 향상되었습니다.
실제 엣지 하드웨어(MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5) 테스트에서도 속도 개선이 확인되었습니다. 230M과 350M 모델은 Q5_K_M 수준의 품질을 유지하면서 디코드 처리량이 4~33% 빨라졌고, 1.2B와 2.6B 모델은 Q4_K_M 품질을 내면서 처리량이 3~14% 증가했습니다.
왜 중요해
엣지 디바이스나 로컬 환경에서 소형 모델을 돌릴 때 메모리 절약과 추론 속도를 위해 4비트 양자화를 쓰면 품질 하락이 불가피했습니다. 이번 QAD 체크포인트는 llama.cpp 등 표준 GGUF Q4_0를 지원하는 런타임에서 성능 저하 걱정 없이 가볍고 빠른 모델을 바로 활용할 수 있게 해줍니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.