輝達推出 NeMo Switchyard AI 路由方案,主張最高可降企業任務成本 74%

輝達(Nvidia)本週宣布推出 NeMo Switchyard,以及 Nemotron 3.5-30B-A3B-Lightning 與 Nemotron Parse 兩款模型,試圖以「模型路由」方式協助企業控制日益增加的人工智慧支出。相關方案於 2026 年 8 月 13 日公布,核心概念並非持續將所有工作交由單一大型模型處理,而是在推論伺服器 API 與模型之間加入一層代理服務,依照任務需求選擇適合的模型。

NeMo Switchyard 如何進行模型分流

NeMo Switchyard 的定位類似 AI 工作流中的路由器。當企業系統收到請求後,會根據任務難度、延遲要求與成本等條件,將工作動態分配給較小、成本較低,或部署於企業本地環境的模型;只有在需要較強推理能力時,才將任務交給大型模型。

輝達指出,這種方法應以「完成任務的總成本」作為評估基準,而不只是比較每個 Token 的價格。若低價模型需要產生更多 Token 才能完成相同工作,最終支出未必低於使用高階模型。因此,路由系統需要同時考量模型價格、輸出效率、準確率與任務完成結果。

輝達宣稱最高可降低 74% 成本

根據輝達提供的說法,與單獨依賴 Claude Opus 4.8 相比,採用模型分流策略後,企業任務完成成本最高可降低 74%;代價是準確率約減少 6 個百分點。這項數字屬於輝達提出的比較結果,實際效益仍會受到工作負載、模型選擇、部署方式及評測標準影響。

輝達舉例,產生標題卡與網頁摘要等相對基礎的工作,通常不一定需要大型模型處理。若將這類任務交給小型模型,昂貴的大型模型便能集中處理複雜推理或需要較高準確度的工作。

同步推出兩款 Nemotron 模型

為配合模型路由架構,輝達同步推出兩款用途不同的模型:

  • Nemotron 3.5-30B-A3B-Lightning:這是一款擁有 300 億參數的 Mixture-of-Experts(MoE)開放權重模型,主打低延遲與通用性,可獨立運作,也能在路由架構中與更大型模型協同處理任務。
  • Nemotron Parse:這款任務專用模型聚焦 PDF 內容處理,強調解析圖表、表格及複雜文件脈絡,目標是在維持應用準確度的同時,降低企業處理文件的成本。

模型路由並非全新概念

模型路由在產業中已有先例。來源資料指出,OpenAI 過去曾在 GPT-4 與 ChatGPT 中,依任務複雜度動態分配不同版本的模型。電信業者 AT&T 導入智慧路由器後,則在部分應用中改用開放權重模型,並稱相關成本節省幅度達 80% 至 90%。

目前 AT&T 約有 25% 的 AI 工作負載由開放模型支撐,未來幾年的目標是將比例提高至 70% 至 80%。這顯示企業可能逐步採用混合模型架構,而非將所有工作負載集中在單一商用大型模型上。

真正難題在於判斷模型選擇時機

模型路由的主要挑戰,在於如何準確判斷特定任務應交由小型模型或大型模型處理。若路由器誤判,可能導致低階模型無法完成任務,或讓原本可由小型模型處理的工作被送往成本更高的模型。

輝達提出的方向是結合 AI 代理與程式碼助理。這些系統可透過反覆執行任務與生成工作流程,逐步學習何時指派小型任務模型,以及何時將工作交由大型前沿模型統籌。輝達軟體與模型資深總監 Joey Conway 表示,「代理與子代理」的分工模式,類似企業由不同專才與協調者共同完成複雜工作的組織結構。

企業導入仍需衡量準確率與總體成本

NeMo Switchyard 反映出企業 AI 基礎架構可能從「單一大型模型」轉向多模型協作。對於工作內容穩定、規模龐大的企業應用,將簡單任務交給小型或本地模型,理論上有機會降低推論支出與延遲;但若任務對準確率、文件理解或複雜推理要求較高,企業仍須保留大型模型介入的能力。

因此,模型路由方案的實際價值,不只取決於單一模型的效能,也取決於路由判斷、任務評測、錯誤修正與整體工作流設計。輝達公布的成本與準確率數據,仍需要在不同企業場景及工作負載中進一步驗證。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles