AI與HPC網路競逐升溫:InfiniBand、乙太網路迎來新架構挑戰

隨著人工智慧應用快速成長,高效能網路的需求已從高效能運算(HPC)領域擴散至一般企業資料中心。過去主要用於HPC環境的200Gbps、400Gbps以上高速網路,逐漸成為AI基礎設施的重要組成,也讓InfiniBand與乙太網路的競爭延伸至企業應用市場。

目前InfiniBand與乙太網路的頻寬規格都已發展至800Gbps。兩者雖然具備相同等級的頻寬,但在資料鏈結層、流量控制與組網方式上存在差異,使InfiniBand在效能與可靠性方面仍具優勢;乙太網路則以較低成本及更開放的產品生態系統取勝。

InfiniBand與乙太網路成為主流選項

以TOP500超級電腦榜單來看,目前高效能運算領域主要採用InfiniBand、乙太網路、Omni-Path與SlingShot等四種網路規格。其中,InfiniBand與乙太網路在TOP500使用者中的合計占比超過八成,明顯高於另外兩種規格,因此也成為AI高效能網路進入企業端後的主要競爭架構。

從應用需求來看,將效能置於首位的頂級使用者,通常更傾向選擇InfiniBand;對成本較敏感的企業,則較可能採用乙太網路。不過,兩者的產品供應模式並不相同。乙太網路具備相對開放且競爭充分的產品生態系統,而InfiniBand的產品生態主要由Nvidia及其旗下Mellanox主導,可能限制使用者在供應商與產品之間的選擇彈性。

UEC試圖以新一代乙太網路挑戰InfiniBand

為改善乙太網路在AI與HPC工作負載下的效能,Intel、AMD、Broadcom等網路與晶片大廠,以及主導InfiniBand的Nvidia,於2023年7月共同組成超乙太網路聯盟(Ultra Ethernet Consortium,UEC)。聯盟的目標,是建立兼具乙太網路開放性與高效能特徵的新傳輸架構,藉此挑戰InfiniBand在AI及高效能運算市場的地位。

UEC工作小組的核心任務,是制定超乙太網路傳輸(Ultra Ethernet Transport,UET)協定。UET可視為RoCE(RDMA over Converged Ethernet)的後繼架構。RoCE是將InfiniBand的遠端直接記憶體存取(RDMA)架構移植至乙太網路,試圖同時取得RDMA的低延遲與乙太網路的低成本優勢。

較早的RoCEv1結合InfiniBand的傳輸層與網路層,以及乙太網路的實體層與資料鏈結層;目前較普遍使用的RoCEv2,則將網路層改為UDP/IP,使封包能夠進行路由,適用於更大規模的環境,但也為壅塞控制與負載平衡帶來新的問題。

UET鎖定壅塞控制與多供應商支援

UET的設計方向,是透過新的傳輸層改善壅塞管理,同時強化延遲、安全性及多供應商支援的應用程式介面。其規劃中的功能包括:

  • 多路徑封包噴灑(Multi-path packet spraying),協助改善負載平衡。
  • 彈性排序(Flexible ordering),以適應不同資料傳輸需求。
  • 改進的壅塞控制機制,以及端到端遙測(End-to-end telemetry)。
  • 多種傳輸交付型式服務,以因應不同應用情境與系統規模。
  • 強化網路傳輸安全性。

UEC原定於2024年第三季發布1.0版規範,AMD也在2024年10月推出全球首款「UEC Ready」網路卡Pensando Pollara 400。不過,UEC規範制定工作出現延遲,首版協定發布時間已延後至2025年第一季。

特斯拉以TTPoE另闢高效能乙太網路路線

在UEC規範延後之際,特斯拉於Hot Chips 2024大會發表為Dojo超級電腦開發的TTPoE(Tesla Transport Protocol over Ethernet)協定,提供另一種以乙太網路為基礎的高效能網路架構。

TTPoE與UEC相似,都是從傳輸層著手改善效能。該協定沿用乙太網路的實體層與資料鏈結層,並以特斯拉自有的TTP取代TCP/IP。特斯拉認為,建立在優先流量控制機制上的RDMA存取架構,雖然能降低壅塞造成的封包遺失,但整體設計較為複雜,可能影響效能,因此TTPoE改採較簡單直接的壅塞控制方法,並加入多項降低延遲的設計。

TTPoE是一種完全以硬體執行的點對點傳輸層協定,僅涉及Layer 2傳輸,不需要特殊交換器。與RoCEv2不同,TTPoE採用「有損」傳輸方式,在發生壅塞或錯誤時丟棄封包並重新傳送;同時由各端點獨立處理壅塞控制,透過封包丟棄降低架構複雜度。

此外,TTPoE採用由硬體執行的傳輸層狀態機,藉此縮短等待狀態。實際運作時,TTPoE由整合於FPGA內的IP區塊執行,位置介於網路晶片(NOC)與乙太網路MAC之間。

Mojo網路卡強調簡化與成本

特斯拉也同步推出搭配Dojo超級電腦使用的Mojo網路卡。該網路卡內含TTP乙太網路控制器與Dojo DMA引擎,特斯拉將其形容為「笨」網路卡,採用PCIe 3.0 x16介面及8GB DDR4記憶體等成熟技術,設計取向是簡化架構並控制成本,傳輸速度可達100Gbps。

根據特斯拉自行進行的測試,以單向存取延遲為比較基準,TTPoE的表現比InfiniBand與NVLink低40%,約為標準TCP/IP的四百分之一;此外,其延遲不到RoCEv2的三分之一。不過,這些數據屬於特斯拉自行測試結果,實際表現仍可能受到硬體、軟體、網路拓撲及工作負載差異影響。

兩種路線可能形成互補

UEC與TTPoE代表兩種不同的高效能乙太網路發展方向。UEC希望在開放性基礎上,支援更廣泛的應用情境、多供應商環境、壅塞管理與安全性;TTPoE則以Dojo超級電腦的需求為出發點,透過較簡化的硬體傳輸機制降低延遲與系統複雜度。

特斯拉已宣布將開放TTPoE協定,並計畫加入UEC聯盟。若相關計畫落實,TTPoE與UEC未來可能形成互補,為AI與HPC市場提供不同於傳統InfiniBand及RoCE的高效能乙太網路選擇。然而,兩種架構的實際採用程度,仍取決於規範成熟度、硬體與軟體支援、供應商生態系統,以及在大規模部署下的效能與可靠性表現。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles