엔비디아, 유휴 맥·PC 묶는 로컬 추론 라우터 PAIR 베타 공개
최근 30일 조회수 — 좋아요 —핵심 요약
엔비디아가 Ollama·LM Studio 요청을 여러 기기에 분산시켜 에이전트 병목을 줄이는 로컬 추론 라우터 PAIR를 베타로 출시했다.
엔비디아가 집 안에 놀고 있는 맥과 PC를 하나의 로컬 추론 네트워크로 묶어주는 소프트웨어 ‘PAIR(Personal AI Router)‘를 베타로 공개했다. 지난 9월 3일 공개된 PAIR는 새로운 추론 엔진이 아니라, 각 기기에 이미 설치된 Ollama나 LM Studio를 그대로 활용해 요청을 분산시키는 라우터다. mDNS로 같은 네트워크의 기기를 찾아내고, 어떤 기기가 요청을 처리할 준비가 됐는지 확인한 뒤 적합한 노드 하나에 작업을 배정한다.12
엔비디아가 이 제품을 내놓은 배경은 에이전트 작업 방식의 변화다. 하나의 리드 에이전트가 복잡한 작업을 여러 서브에이전트에 쪼개 맡기는 방식이 흔해지면서, 동시에 여러 추론 요청이 GPU 하나에 몰리는 병목이 생기고 있다. PAIR는 이런 요청들을 주 PC 외에 워크스테이션, 노트북, DGX Spark 같은 다른 기기로 분산시켜 큐가 쌓이는 걸 줄인다. 엔비디아 기술 블로그는 이를 “워크로드 단위의 병렬 처리”라고 설명한다.1
에이전트 입장에서 달라지는 건 없다. 요청은 기존에 쓰던 Ollama나 LM Studio 인터페이스 그대로 나가고, PAIR가 프록시로 받아 엔진과 모델 요구사항을 확인한 뒤 적합한 노드에 붙여준다. 새로운 API를 배울 필요도, 에이전트 하니스를 고칠 필요도 없다. 더뉴스택은 이 방식이 NemoClaw, OpenClaw, Hermes 같은 에이전트의 서브에이전트 병렬 실행을 가속하는 데 초점이 맞춰져 있다고 전했다.2
지원 하드웨어는 윈도우·맥OS·리눅스를 아우른다. 엔비디아 지포스 RTX 20 시리즈 이상, RTX PRO 워크스테이션 GPU(튜링 아키텍처 이상), DGX Spark, 그리고 애플 M4 이상 칩이 최소 기준이다. 맥을 정식 지원 대상에 넣은 점은 눈에 띄는데, 엔비디아 GPU를 쓰지 않는 맥이 로컬 에이전트 구동 플랫폼으로 이미 자리 잡았다는 걸 인정한 셈이다.2
다만 한계도 분명하다. PAIR는 여러 GPU의 VRAM을 하나로 묶거나 단일 추론 요청을 여러 기기에 쪼개 실행하지 않는다. 요청 하나는 반드시 노드 하나에서 시작부터 끝까지 처리된다. 엔비디아가 제시한 예시에서는 RTX 5090(32GB, 현재 시세 약 5000달러) 탑재 PC 두 대로 Qwen3.6 35B A3B 모델을 돌리고 서브에이전트 다섯 개를 병렬 실행했을 때 약 1.6배 속도 향상이 나왔다. 더뉴스택은 이런 고사양 카드를 여러 대 갖춘 가정은 드물다며, 맥 스튜디오나 맥 미니 여러 대를 섞은 조합에서 실제로 어느 정도 효과가 날지는 아직 검증되지 않았다고 지적했다.2
PAIR는 각 기기에 개별 설치해야 하며, Ollama나 LM Studio가 없는 기기에는 PAIR가 직접 설치와 모델 다운로드를 도와준다. 오픈소스로 공개됐고 현재는 베타 단계다.
Footnotes
읽기 목록은 이 브라우저에 저장됩니다.
출처
- NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network | NVIDIA Technical Blog — NVIDIA Technical Blog
- Nvidia PAIR lets you put your idle Macs and PCs to work for AI agents — The New Stack
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요.