[연구]물리학의 스핀 모델로 LLM 레이어를 최적 제거하는 기법 등장
Multiverse Computing 연구진이 대규모 언어 모델의 레이어를 통째로 잘라내는 깊이 프루닝 문제를 통계물리학의 이징 글래스(Ising glass) 최적화로 풀어냈습니다. 블록 간의 상호작용을 헤시안 행렬로 계산해 에너지 최소화 문제로 바꾼 결과, Llama-3.3-70B-Instruct를 50% 압축했을 때 기존 프루닝 방식 대비 MMLU 점수를 약 23%p 끌어올렸습니다.
전문 읽기접기
무슨 일이야
LLM의 추론 속도와 메모리를 동시에 아끼는 방법 중 하나는 트랜스포머 블록 전체를 날리는 깊이 프루닝(depth pruning)입니다. 하지만 특정 블록을 제거했을 때 생기는 영향은 어떤 다른 블록과 함께 잘려 나가는지에 따라 크게 달라집니다. 기존 기법들은 블록을 개별적으로 평가해 순위를 매기거나 연속된 레이어만 자르는 등 상호작용을 무시하는 한계가 있었습니다.
연구진은 이 문제를 통계물리학의 스핀 시스템인 '이징 글래스' 기반의 제약 이진 최적화(CBO) 문제로 재정의했습니다. 블록의 유지 여부를 0과 1의 이진 변수(스핀)로 두고 손실 함수를 2차 테일러 전개해 헤시안(Hessian) 행렬을 구했습니다. 행렬의 대각 성분은 개별 블록의 중요도를, 비대각 성분은 블록 간의 결합(상호작용)을 나타냅니다.
이렇게 구한 시스템의 에너지는 실제 벤치마크 성능과 밀접하게 연동됩니다. 즉, 매번 무거운 모델을 돌려보지 않고도 에너지 수식($x^TH^0x$)만 빠르게 계산해 가장 성능이 좋을 최적의 블록 조합을 찾아낼 수 있습니다.
왜 중요해
작은 캘리브레이션 데이터셋으로 헤시안을 딱 한 번만 계산해 두면, 여러 압축률 목표에 맞춰 재사용할 수 있어 비용이 매우 저렴합니다. 몇 백만 개의 조합은 단일 GPU에서 몇 초 만에 탐색할 수 있으며, 실제 Llama-3.3-70B-Instruct를 절반 크기로 깎아내는 극한의 압축 환경에서도 경쟁 프루닝 방식보다 MMLU 점수에서 23%p 가까이 높은 수치를 기록했습니다.
짚고 넘어갈 점
탐색 공간이 지나치게 커지면 브루트포스(완전 탐색) 방식은 한계에 부딪힙니다. Llama-3.3-70B의 80개 블록 중 8개를 제거하는 경우만 해도 약 290억 개의 조합이 나와 단일 GPU로 약 이틀이 걸렸으며, 더 깊은 탐색을 위해서는 양자 혹은 양자 영감(quantum-inspired) 솔버 같은 근사 최적화 도구가 필수적입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.