NVIDIA 推出 Nemotron 3.5 Lightning 與 NeMo Switchyard,擴大 Agent 開放模型布局

NVIDIA 於 8 月 11 日公布一系列開放模型與平台更新,核心包括輕量級開放模型 Nemotron 3.5 Lightning,以及針對代理式 AI(Agent)工作流程設計的開源函式庫 NeMo Switchyard。公司也同步擴大 DGX、RTX、DGX Spark 與 Jetson 平台對開放權重模型、生成式 AI 工具及多機協作功能的支援。

這些更新反映 NVIDIA 持續強化從地端 PC、工作站到資料中心與雲端的 AI 開發生態系,讓開發者能依照模型能力、延遲、成本與部署位置,調整 Agent 應用的執行方式。

Nemotron 3.5 Lightning 主打長時間 Agent 工作負載

Nemotron 3.5 Lightning 是 Nemotron 3 系列的新成員,採用混合專家(Mixture of Experts,MoE)架構,擁有 300 億(30B)參數,主要針對需要長時間運作的代理式 AI 工作負載設計。

根據 NVIDIA 提供的資料,Nemotron 3.5 Lightning 相較於其他同級模型,輸出速度最高可提升 4 倍,並可讓 Agent 任務完成速度提升 30%。不過,相關數據屬於 NVIDIA 的效能比較結果,實際表現仍可能受到硬體、軟體環境、提示內容與工作負載類型影響。

在部署彈性方面,Nemotron 3.5 Lightning 可運行於 RTX PC、DGX Spark、DGX Station 與 Jetson 等地端 AI 系統,也能延伸至邊緣裝置、RTX PRO 工作站、資料中心及雲端環境。

NeMo Switchyard 以智慧路由控制模型使用方式

NVIDIA 同步推出 NeMo Switchyard,這是一套專為 Agent 工作流程打造的開源函式庫,主要功能是根據每項請求的需求,將任務導向最適合且具備相應能力的模型。

開發者可使用不同路由演算法,或自行調整路由器設計,使系統在模型品質、反應延遲與運算成本之間取得平衡。這種架構可讓企業不必讓所有請求都交由單一大型模型處理,而是依據任務複雜度分配模型資源。

NVIDIA 的內部基準測試顯示,NeMo Switchyard 在維持先進模型等級準確率的同時,任務完成成本可降至單獨使用 Claude Opus 4.8 的近三分之一。由於這項比較來自 NVIDIA 內部測試,外部部署時仍需依實際模型組合、請求類型與基礎設施進一步驗證。

強調模型權重、訓練資料與技術透明度

NVIDIA 表示,Nemotron 系列採取較為透明的開發方式,除公開模型權重外,也盡可能提供訓練資料與相關技術資訊,讓模型具備可追溯性並支援稽核,也可作為訓練其他模型的基礎。

Nemotron 3.5 Lightning 搭配 NeMo Switchyard 後,開發者能更直接掌控 AI 的部署方式、執行位置與運作效率,涵蓋個人電腦、工作站、資料中心及雲端環境。

DGX 與 RTX 擴大支援開放權重模型

除了新模型與函式庫,NVIDIA 也為 DGX 與 RTX 平台提供多項更新,並宣布支援下列開放權重模型:

  • Cosmos 3 Edge:4B
  • MiniMax-H3:3.3B
  • Laguna S 2.1:118B
  • DeepSeek V4-Flash:284B
  • Wan-Animate-2:14B
  • Inkling-Small:276B

Meta 新推出的 Muse Glimmer 也針對 DGX 與 RTX 平台進行最佳化,並支援 Jetson 平台。NVIDIA 表示,Muse Glimmer 在單張 RTX 5090 GPU 上每秒可處理超過 200 個 token,讓 Agent 能在地端環境執行任務。

Unsloth Desktop 整合地端 AI 開發功能

DGX 與 RTX 平台也支援 Unsloth 的新工具 Unsloth Desktop。這款桌面應用程式整合地端模型推理、圖像與影片擴散、模型微調、Agent 整合、網路搜尋及程式碼執行等功能,目標是將多項 AI 開發與應用工作集中於同一套桌面工具中。

LTX-2.5 影片生成模型針對 NVIDIA 硬體最佳化

生成式 AI 方面,NVIDIA 介紹全新的 LTX-2.5 影片生成模型。該模型採用新的擴散式影片解碼器,並與變分自動編碼器搭配,以提升影片生成品質。

LTX-2.5 已針對 DGX Spark、DGX Station 及 RTX GPU 進行最佳化。NVIDIA 表示,在使用 RTX PRO 6000 GPU 進行影片創作時,可提升 20% 效能並節省 40% 記憶體。相關結果同樣取決於實際影片生成設定、模型版本與工作流程。

DGX Spark 強化多機連接與資源監控

針對 DGX Spark,NVIDIA 更新 NVIDIA Sync 應用程式,讓多台 DGX Spark 更容易連接,藉此增加處理大型模型所需的記憶體容量、推理能力與運算能力。這項多機連接功能可在 Windows 與 macOS 系統使用。

DGX Spark 也能安裝以原生 ARM64 Linux 建置的 Google Chrome,使用者可直接透過 DGX OS 上的 DGX Dashboard 進行安裝。

此外,NVIDIA 推出 NVIDIA Sync Resource Monitor,提供 CPU 與 GPU 使用率的即時檢視及歷史紀錄,並可跨單一 DGX Spark 或由多台設備組成的叢集查看資源狀態。

開放模型與硬體生態系同步擴張

從 Nemotron 3.5 Lightning、NeMo Switchyard,到 DGX、RTX 與 DGX Spark 的平台支援,NVIDIA 此次更新同時涵蓋模型、工具、部署環境與硬體協作。對開發者而言,開放權重模型與可調整的 Agent 路由機制,有助於依據任務需求配置不同模型,並在效能、成本與部署彈性之間進行取捨。

然而,模型支援數量增加並不代表所有應用都能直接獲得相同效能。實際導入仍須評估硬體記憶體、模型大小、推理速度、路由策略及軟體相容性。NVIDIA 此次布局則顯示,開放模型與地端 AI 運算正成為其 DGX、RTX 及 Jetson 生態系的重要發展方向。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles