Nvidia開源 Nemotron 3.5 Lightning 與模型路由工具 Switchyard

Nvidia於周二(8月11日)宣布開源AI模型 Nemotron 3.5 Lightning 及模型路由工具 NeMo Switchyard。前者可協助AI代理人執行特定工作,後者則能根據任務內容,自動從多款模型中選擇最適合的模型。

Nemotron 3.5 Lightning針對代理人工作最佳化

Nemotron是Nvidia專為AI代理人開發的開放模型系列。Nvidia去年12月推出Nemotron 3家族,後續陸續發布Nano、Super及Ultra版本;此次新增的Nemotron 3.5 Lightning仍屬於Nemotron 3家族。

Nemotron 3.5 Lightning與Nemotron 3 Nano相同,採用300億參數、每次啟用30億參數的設計,但進一步針對AI代理人的大量、高頻率工作進行最佳化。模型加入多Token預測、推測式解碼及代理人框架最佳化訓練,主要應用於工具呼叫、結果驗證及子代理人分派等任務。

Nvidia宣稱,Nemotron 3.5 Lightning的輸出速度最高可達同等規模開放模型的4倍。在PinchBench測試中,該模型以86%的準確率完成1萬項代理任務,準確率與Qwen3.6 35B相近,但所需時間縮短30%。

Switchyard可依任務自動分派模型

NeMo Switchyard是一套供AI代理人使用的開源模型路由工具,能依照每項工作的內容,自動從多款AI模型中選擇合適的對象。組織可同時納入Nvidia模型、其他開放模型或專有模型,將複雜規畫交給大型前沿模型,並把工具呼叫、格式整理及結果驗證等例行工作分派給Nemotron 3.5 Lightning等較小型模型。

組織可自行設定Switchyard的模型分派原則,例如優先選擇準確率較高、回應速度較快或成本較低的模型,也能利用內部資料訓練路由器,讓程式開發、財務及客服等不同工作自動交由相應模型處理。Switchyard亦可直接整合至既有AI代理系統,無需改寫原有應用程式。

測試顯示可降低代理任務成本

Nvidia內部測試顯示,與把所有工作交給Opus 4.8相比,Switchyard會將較簡單的工作分派給成本較低的模型。在準確率相近的情況下,整體任務成本可降至約三分之一。

合作夥伴測試也呈現不同程度的成本節省。Ramp利用Switchyard將較簡單的程式開發工作交給成本較低的模型,在維持整體表現的情況下,成本降低58%,執行時間縮短33%。

LangChain則採取更積極的節省策略,只將7%的請求交給前沿模型,結果成本降低74%,但準確率也下降6個百分點。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles