
AI 摘要
- PAIR 可把本地 AI 推理工作分配至同一網絡內的多部電腦。
- PAIR 支援 Ollama 及 LM Studio,無需修改現有程式碼。
- PAIR 目前處於公開測試階段。
NVIDIA 於 2026 年 9 月 6 日公布免費工具 PAIR(Personal AI Router),可偵測同一網絡內的相容電腦,並自動將 AI 推理工作分配至多部裝置處理。該工具主要針對多代理人工作流程的運算瓶頸,支援 Ollama 及 LM Studio 等本機 AI 執行環境,用戶無需修改現有程式碼即可使用。
針對多代理人工作流程的 GPU 瓶頸
AI 代理人可以將複雜任務拆分成多個較小工作,再交由不同的子代理人處理。當用戶同時執行多個 AI 代理人時,大量請求可能會在同一時間傳送至單一 GPU,造成運算瓶頸。
Ollama 與 LM Studio 一般會在用戶選定的單一裝置上執行模型。PAIR 則會搜尋同一網絡內的其他參與裝置,在符合模型及執行環境條件時,把工作分配至合適節點,完成後再將結果傳回發出請求的來源。
代理伺服器自動選擇運算節點

PAIR 透過代理伺服器接收請求,先識別所需的引擎與模型條件,再選擇合適的運算節點。節點執行請求後,會把結果回傳給 PAIR,再交由原本發出請求的應用程式使用。
AI 代理人本身不需要自行選擇節點,只要送出請求即可,其餘工作由 PAIR 處理。由於 PAIR 的代理伺服器相容於 Ollama 及 LM Studio,用戶不需要新增 API。
當系統處於閒置狀態時,PAIR 亦會自動把不需要的節點關機或轉入休眠狀態,以減少耗電。
以 mDNS 搜尋裝置,透過 mTLS 保護傳輸
根據 NVIDIA 官方技術網誌,PAIR 使用 mDNS 技術在本機網絡自動搜尋裝置。配對時需要輸入 6 位數 PIN 碼,以建立信任連線,確保只有獲授權的裝置可以加入叢集。
節點之間的推理流量則採用雙向 TLS(mTLS)進行加密及雙方身份驗證。NVIDIA 表示,提示內容、檔案及代理人上下文均會保留在用戶的本機網絡內,不會傳送至雲端推理服務。
NVIDIA 實測:叢集處理時間縮短

NVIDIA 使用 AI 代理人管理工具 Hermes Desktop,配合 Ollama 及 PAIR 執行 5 個子代理人的示範測試。測試採用阿里巴巴開放模型 Qwen 3.6-35B-A3B,量度 5 個子代理人完成工作負載所需的時間。
測試把 RTX Spark 電腦、DGX Spark 工作站及 RTX 5090 電腦共 3 部裝置透過 PAIR 組成叢集,平均需時 8 分 48 秒完成。相比之下,只使用單一 RTX Spark 電腦處理時,平均需時 18 分鐘。
上述結果反映,在該測試情境下,多部裝置組成的叢集可縮短完成 5 個子代理人工作負載所需的時間。不過,實際效能仍會受模型、網絡環境、裝置配置及工作負載影響。
系統要求與相容裝置
PAIR 支援的作業系統包括 Windows 11、DGX OS、Ubuntu 14.04 及 macOS Tahoe。顯示卡及裝置支援範圍如下:
- GeForce RTX 20 系列或以上型號。
- 採用 Turing 架構或以上的 RTX PRO 工作站顯示卡。
- DGX Spark 及 DGX Spark GB10。
- 採用 Mac M4 或以上晶片的裝置。
系統最低需要 8 GB 記憶體及 20 GB 可用儲存空間。網絡連線只用於下載模型,實際推理運算過程不需要連接互聯網。
目前仍處於公開測試階段
NVIDIA 指出,PAIR 是一款開放原始碼工具,目前處於公開測試階段,未來會持續擴大支援的裝置範圍。對需要同時執行多個本地 AI 代理人的用戶而言,PAIR 提供另一種利用現有電腦組成運算叢集的方式,但其適用程度仍取決於相容硬件及本機網絡條件。
Reference Link : unwire.hk




