[도구]엔비디아, 로컬 AI 분산 라우터 PAIR 공개
엔비디아가 홈 네트워크에 연결된 여러 기기로 AI 추론 요청을 분산하는 오픈소스 라우터 'PAIR(Personal AI Router)'를 공개했습니다. 기존 Ollama나 LM Studio 엔드포인트를 그대로 프록시해 별도 수정 없이 RTX, DGX Spark, Mac 등 다양한 노드를 묶어 쓸 수 있습니다.
전문 읽기접기
무슨 일이야
엔비디아가 공개한 PAIR는 로컬 네트워크에 흩어져 있는 여러 머신의 자원을 활용해 추론 부하를 나눠 주는 가상 추론 라우터입니다. 기존 Ollama나 LM Studio 환경의 프록시 역할을 하기 때문에, 사용 중인 에이전트 도구의 설정을 크게 바꿀 필요 없이 바로 연동할 수 있습니다.
PAIR의 스케줄러는 노드의 준비 상태, 엔진 상태, 요청된 모델의 존재 여부, 현재 작업 부하, 그리고 GPU 사용률 등을 종합적으로 확인해 요청을 보낼 최적의 기기를 선택합니다. 엔비디아가 진행한 5개 서브에이전트 시연에서는 단일 RTX Spark 노트북에서 평균 18분이 걸리던 작업이 3대 기기 클러스터 환경에서는 8분 48초로 단축되었습니다. 다만 엔비디아는 이 수치를 공식 벤치마크가 아닌 비공식 시연 결과로 명시했습니다.
왜 중요해
집이나 사무실에 흩어져 있는 PC, 맥북 등을 묶어 로컬 LLM 추론 클러스터처럼 활용할 수 있는 길이 열렸습니다. 특히 복잡한 서브에이전트를 여럿 띄워 병렬로 처리해야 하는 개발자라면, 고가의 단일 고성능 장비를 맞추지 않고도 기존 기기들을 연결해 작업 시간을 크게 줄일 수 있습니다.
짚고 넘어갈 점
아직 한계도 뚜렷합니다. 스케줄링 정책이 단일 방식으로 제한적이며, 각 노드의 VRAM 잔여량이나 모델의 웜업(warmness) 상태까지는 세부적으로 감지하지 못합니다. 환경에 따라 부하 분산이 항상 최적의 효율을 내지 못할 가능성도 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.