[연구]스케줄링 순서만 바꿔 GPU 가동률 최대 33%p 개선
동일한 하드웨어 환경에서 작업 할당 알고리즘을 개선하는 것만으로 GPU 가동률을 최대 33%p 끌어올린 벤치마크 결과가 공개됐습니다. 기존 선착순(FIFO) 방식의 비효율을 제약 조건 인식 스케줄러로 대체해 우선순위 가중치 산출량을 최대 105%까지 높였습니다.
전문 읽기접기
무슨 일이야
Dharma-AI 연구진은 기존 선착순(FIFO) 방식 스케줄러를 대체하는 제약 조건 인식(Constraint-aware) GPU 할당기를 개발하고, 7가지 벤치마크 시나리오에서 성능을 테스트했습니다. 하드웨어나 작업 부하를 전혀 바꾸지 않고 스케줄링 순서와 할당 방식만 최적화한 결과, GPU 가동률이 최대 33%p 증가했습니다.
연구진에 따르면 GPU 클러스터의 비효율은 크게 고정 예약과 배치 순서에서 발생합니다. 실시간 추론은 트래픽 변화에 따라 유연하게 대응해야 하지만, FIFO 방식에서는 피크 타임에 맞춰 하루 종일 GPU를 고정 예약해 두면서 유휴 자원을 낭비합니다. 여기에 도착 순서대로만 자원을 나누어 주다 보니 중요한 작업이 뒤로 밀리는 문제가 겹쳤습니다.
새로 설계된 할당기는 실시간 추론 수요를 고정값이 아닌 변동 곡선으로 처리하고, 학습과 배치 추론 등 중단 없는 GPU 블록이 필요한 작업들을 우선순위 기반으로 재배치했습니다. 그 결과 8개 GPU 환경의 학습 중심 워크로드에서 가동률이 53.6%에서 87.0%로 올랐고, 우선순위 가중치 산출량은 105% 증가했습니다.
왜 중요해
엔터프라이즈 AI 환경에서 GPU 인프라 부족이 심화되는 가운데, 추가 하드웨어 구매 없이 소프트웨어 스케줄링 개선만으로 가동률을 52~85% 수준에서 72~88% 수준까지 끌어올릴 수 있음을 보여줬습니다. 특히 트래픽 변동이 큰 실시간 서비스와 장기 배치 학습을 한 클러스터에서 동시에 운영하는 기업에 직접적인 인프라 비용 절감 효과를 기대하게 합니다.
짚고 넘어갈 점
실제 서비스 환경에서 트래픽 급증이 예측 범위를 벗어날 경우, 동적으로 회수한 GPU를 즉각 재확보하는 과정에서 실시간 추론의 지연 시간(레이턴시)에 어떤 영향을 미치는지에 대한 상세 분석은 추가 검증이 필요해 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.