隨著生成式人工智慧與代理式人工智慧(Agentic AI)持續發展,AI 系統對運算、記憶體與網路傳輸的需求同步提高。AMD 在 Advancing AI 2026 發表會上提出最新 AI 網路與運算基礎架構藍圖,並指出資料移動效率已成為決定 AI 系統能否持續擴展的關鍵因素。
AMD 網路技術事業群資深副總裁 Soni Jiandani 表示,未來 AI 基礎架構不能只依賴更強大的 CPU 或 GPU,網路架構也必須同步升級。為此,AMD 發表機架級(Rackscale)AI 基礎架構 Helios,從前端網路(Front-End)、向上擴展(Scale-Up)到向外擴展(Scale-Out)三個層面,重新設計 AI 系統中的資料傳輸與管理方式。

代理式 AI 推升資料同步與長上下文需求
根據 AMD 的市場觀察,到了 2026 年,具備推理能力的代理式 AI 模型參數規模預估將突破 10 兆(10T+)。模型規模擴大後,分散式訓練與推論需要處理更大量的資料同步,也必須支援長時間在線(Always-On)的 AI 服務與更長的文件上下文。
在此規模下,網路基礎架構的角色已接近 CPU、GPU、記憶體與儲存設備。網路延遲可能直接影響整體吞吐量與 GPU 使用率。AMD 指出,目前 AI 基礎架構的主流標準已逐步轉向乙太網路,網路頻寬約每 18 至 24 個月翻倍,速度也正從 400G 推進至 800G,並朝未來的 1.6T 發展。

Helios 聚焦三個 AI 網路維度
前端網路:第三代 Pensando Salina DPU
在前端網路部分,AMD 發表第三代 Pensando Salina DPU。該 DPU 支援 400G 線速多服務加速,AMD 宣稱其效能較前一代提升一倍,並較 NVIDIA BlueField-3 提供 1.4 倍效能領先。
Salina 可將網路、安全與儲存相關工作從 CPU 下放至 DPU,包括硬體加密與 NVMe over Fabrics 等功能,使 CPU 核心能保留給 AI 運算。AMD 表示,在微軟等雲端服務供應商的實際部署中,Salina 最多可為基礎架構節省 22 個 CPU 核心的資源,並支援超過 100 萬個 KV Cache 的擴充上下文儲存。
上述數據由 AMD 提供,實際效益仍會受到工作負載、軟體架構與部署方式影響。

向上擴展:UALoE 連結 72 個 GPU
針對單一叢集內的 GPU 互連,AMD 推出第一代 UALoE(Ultra Accelerator Link over Ethernet)架構。該方案可將 72 個 GPU 整合為單一運算節點,提供 31TB 的 HBM4 統一記憶體空間,以及最高 260TB/s 的頻寬。AMD 表示,這相較過往方案帶來 3 倍頻寬提升。
為降低長時間訓練任務因硬體或網路故障而中斷的風險,AMD 同時導入軟體定義的 Fabric Manager。此管理系統支援零接觸自動化管理與「虛擬 POD(Virtual PODs)」配置,能夠隔離不同故障網域,提升機架級 AI 系統的容錯能力與可靠性。
向外擴展:Vulcano AI NIC 提供 800G 頻寬
在跨叢集資料傳輸方面,AMD 發表第二代 Pensando Vulcano AI NIC(智慧網卡)。Vulcano 支援 800G 頻寬與 PCIe Gen 6,每顆 GPU 最多可配置 3 張網卡,提供每個 GPU 最高 2.4Tbps 的頻寬。AMD 宣稱,這項設計可讓向外擴展能力增加 50%。
Vulcano 也支援多平面智慧封包分配、MRC 與自訂傳輸協定。AMD 表示,透過這些功能,Vulcano 可讓大型語言模型(LLM)訓練速度提升 13%,並有望讓網路交換成本降低最多 33%。這些效能與成本數字仍屬 AMD 公布的預估或測試結果,實際表現需視網路拓撲、模型與工作負載而定。
Helios 將整合 EPYC Venice 與 Instinct MI455X
Helios 不僅涵蓋 AI 網路元件,也將搭載 AMD 第六代 EPYC「Venice」處理器與第五代 Instinct MI455X GPU。AMD 強調,透過處理器、GPU、網路與軟體的整合,Helios 在每美元生成 Token 數量(Tokens / $)方面,較 NVIDIA Rubin NVL72 高出 30%。
這項比較反映 AMD 對整體系統成本效益的定位,但最終結果仍可能受到 GPU 利用率、能源成本、軟體最佳化、模型類型及雲端部署模式等因素影響。
微軟、Meta、OpenAI 與甲骨文加入生態系
AMD 表示,其開放網路架構已獲得多家大型科技公司的採用,包括微軟、Meta、OpenAI 以及甲骨文。甲骨文雲端基礎架構(OCI)網路資深副總裁 Raj Subramaniyan 在活動中表示,甲骨文與 Pensando 已合作 10 年,並透過 DPU 提供整合式的安全與網路加速功能。

對雲端服務供應商而言,DPU、AI NIC 與高速乙太網路的整合,可能有助於將網路、安全與儲存處理工作從通用 CPU 分離,並提高 AI 伺服器的資源使用效率。不過,這類架構也需要相應的軟體支援、管理工具與開發者生態系,才能在不同雲端與資料中心環境中實現預期效益。
網路成為 AI 擴展的核心基礎
AMD 此次公布的 Helios 藍圖,顯示 AI 基礎架構競爭已從單一 GPU 效能,延伸至機架級互連、資料同步、故障隔離與整體成本效益。隨著代理式 AI 模型規模與上下文需求增加,能否降低資料移動延遲、提高 GPU 使用率並維持系統可靠性,將成為大規模訓練與推論平台的重要評估指標。
目前 AMD 公布的多項效能、頻寬與成本數據主要來自官方說法,實際產品上市時程、完整規格與第三方測試結果,仍有待後續進一步公開。




