[도구]단일 GPU로 753B MoE 돌리는 서빙 엔진 'FreeToken
단일 워크스테이션 GPU에서 753B 파라미터 규모의 GLM-5.2 모델을 구동할 수 있는 엣지 네이티브 MoE 서빙 엔진 'FreeToken'이 공개됐습니다. FreeToken은 MoE 캐시 미스가 발생할 때 PCIe 전송과 CPU 연산을 효율적으로 분할 처리해 프론티어 모델의 로컬 실행을 지원합니다.
전문 읽기접기
무슨 일이야
단일 워크스테이션 GPU 환경에서 753B 규모의 초대형 MoE(Mixture-of-Experts) 모델인 GLM-5.2를 구동할 수 있는 서빙 엔진 'FreeToken'이 등장했습니다.
FreeToken은 MoE 구조에서 캐시 미스(cache miss)가 발생할 때, 측정된 대역폭을 기반으로 PCIe를 통한 데이터 전송과 CPU 실행을 지능적으로 분할하는 방식을 취합니다. 이를 통해 GPU VRAM의 한계를 극복하고 로컬 환경에서도 거대 MoE 모델을 서빙할 수 있도록 돕습니다.
왜 중요해
기존에는 수천억 파라미터급의 프론티어 MoE 모델을 돌리려면 대규모 클러스터나 여러 대의 고가 엔터프라이즈 GPU가 필수적이었습니다. 단일 GPU 워크스테이션에서도 이러한 모델을 실행할 수 있게 되면, 로컬 인프라를 활용한 연구 및 온프레미스 서빙 비용이 크게 줄어들 것으로 보입니다.
짚고 넘어갈 점
초대형 모델을 단일 GPU와 CPU 메모리를 혼용해 구동하는 구조인 만큼, 실제 토큰 생성 속도(TPS)나 레이턴시가 실 서비스에 적용할 수 있는 수준인지에 대한 구체적인 벤치마크 결과는 추가로 확인이 필요해 보입니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.