輝達 RTX Pro 6000 Blackwell Server Edition 正式供貨,vGPU 19.0 導入支援

輝達(NVIDIA)採用 Blackwell 架構的新一代伺服器 GPU 加速卡 RTX Pro 6000 Blackwell Server Edition(以下簡稱 RTX Pro 6000 BSE),近期出現正式上市進展。輝達在產品網頁上將供貨狀態由「即將推出」更新為「現正供貨中」,並在 Nvidia Qualified System Catalog 合格伺服器型錄中,列出搭配 Dell PowerEdge XE7745 的合格系統。

這項進展適逢年度 SIGGRAPH 大會舉行。輝達也在 8 月第一週發布 vGPU 軟體第 19 版,當中唯一新增支援的產品就是 RTX Pro 6000 BSE,以及以此 GPU 組成的 RTX Pro Server 伺服器平臺。

Blackwell 伺服器 GPU 規格與效能微幅上修

輝達今年 3 月 GTC 大會宣布 3 款採用 Blackwell 架構的商用 GPU,並統一稱為 RTX Pro Blackwell 系列。其中兩款為桌上型工作站 GPU,另一款便是資料中心產品 RTX Pro 6000 BSE。該產品在 6 月 11 日於 VivaTech 2025 期間舉行的 GTC Paris 正式亮相,之後於 8 月 SIGGRAPH 大會推出完整的 RTX Pro Server 解決方案。

目前公布的硬體配置,包括 CUDA 核心、Tensor 核心、RT 核心數量,以及 GPU 記憶體類型、容量和頻寬,均與先前預告內容相同。不過,輝達對部分運算效能數字進行微幅上修:

項目最新標示先前標示
FP4最高 4 PFLOPS3.7 PFLOPS
FP32 單精度120 TFLOPS117 TFLOPS
RT 核心處理能力355 TFLOPS354.5 TFLOPS

RTX Pro 6000 BSE 採用第五代 Tensor 核心、第二代 Transformer Engine,以及第四代 RT 核心,並支援 FP4 與 NVIDIA NVFP4 等運算格式。輝達表示,FP4 可在降低記憶體用量的同時加快 AI 模型處理;相較前一代 GPU,AI 推論效能最高可提升至 6 倍。

鎖定 AI、數位雙生與圖形渲染

以採用 Ada Lovelace 架構的資料中心 GPU L40S 為比較基準,輝達公布 RTX Pro 6000 BSE 在多種工作負載上的效能改善,包括代理型 AI 大型語言模型處理吞吐量最高提升 5 倍、基因體學定序速度最高提升 7 倍,其中 Smith-Waterman 演算法可達 6.8 倍;文字生成影片速度提升至 3.3 倍,推薦系統推論效能接近 2 倍,著色處理速度則超過 2 倍。

輝達在 vGPU 19.0 發表資訊中進一步指出,RTX Pro 6000 BSE 執行 Llama 3 70B 模型時,效能最高可達 L40S 的 5.6 倍;Omniverse 著色處理約為 3.5 倍,Autodesk Arnold 著色處理約為 1.9 倍,Siemens UFX 與 Dassault Abaqus 等模擬工作負載則可提升至 2 倍。

在圖形處理方面,第四代 RT 核心可讓圖像擬真著色效能提升至 4 倍,光線與三角形相交處理速度提升 1 倍。搭配 RTX Mega Geometry 技術後,輝達宣稱光線追蹤三角形繪製數量可達 100 倍以上,應用場景包括工廠數位雙生、機器人模擬與大規模合成資料產生。

RTX Pro Server 整合 8 張 GPU 與 ConnectX-8 SuperNIC

RTX Pro Server 是輝達在 2025 年推出的資料中心伺服器平臺,可視為 OVX 系統的後繼方案,主要針對 Omniverse 工業數位雙生、機器人學習與模擬,以及企業級 AI 與圖形工作負載。每臺伺服器最多可配置 8 張 RTX Pro Blackwell GPU,並搭配 BlueField-3 DPU,以及整合 ConnectX-8 SuperNIC 與 PCIe 6.0 交換器的 I/O 主機板。

在台北國際電腦展的展示中,輝達列出 8 張 RTX Pro 6000 BSE 組成的 RTX Pro Server 具備以下能力:

  • FP4 AI 運算效能最高達 30 PFLOPS。
  • Omniverse 數位雙生即時模擬效能達 3 PFLOPS。
  • GPU 記憶體容量達 800 GB,記憶體頻寬為 13 TB/s。
  • 透過 ConnectX-8 SuperNIC Switch 進行多 GPU 互連時,總頻寬可達 800 GB/s。

輝達也以每 500 萬美元成本與單一使用者兩種情境比較每秒產生的符元數量。採用 Llama 70B 模型時,RTX Pro Server 最高可達 H100 伺服器的 1.7 倍;採用 DeepSeek R1 模型時,最高可達 H100 伺服器的 4 倍。這些數字屬於輝達公布的比較結果,實際表現仍會受模型、軟體版本、功耗設定與系統配置影響。

CoreWeave 已提供 RTX Pro 6000 BSE 雲端執行個體

與輝達關係密切的 AI 運算服務供應商 CoreWeave 在 7 月宣布,已正式提供搭配 RTX Pro 6000 BSE 的雲端執行個體,成為首家採用這款伺服器級 GPU 並提供相關運算服務的雲端平臺。

CoreWeave 的單一執行個體配備 2 顆第五代 Intel Xeon Scalable 處理器、8 張 RTX Pro 6000 BSE GPU,以及多個 BlueField-3 DPU。該公司公布的測試數據包括:Llama 3 70B 大型語言模型推論效能最高提升 5.6 倍、文字生成影片速度提升 3.5 倍,FP4 運算效能為 3.8 PFLOPS。

MIG 與 vGPU 支援虛擬化多租戶架構

RTX Pro Blackwell 系列中的 RTX Pro 6000 與 RTX Pro 5000 支援 GPU 多執行個體(MIG)。透過硬體分割機制,單張 RTX Pro 6000 BSE 可切分為多個彼此隔離的 GPU 執行個體,各自配置記憶體、快取、運算引擎與串流多處理器,讓不同工作負載維持較穩定的服務品質。

當 MIG 與 vGPU 軟體提供的分時共用機制結合後,每個 GPU 執行個體可建立多租戶服務架構。輝達表示,RTX Pro Blackwell 系列啟用 MIG 並搭配 vGPU 19.0 時,單張 GPU 加速卡最多可同時支援 48 臺配置 GPU 資源的虛擬機器,具體配置為 4 個 GPU 執行個體,每個執行個體支援 12 臺採用分時共用 GPU 資源的虛擬機器。

這項彈性讓企業可在同一套 GPU 基礎架構上執行業務應用、視訊串流、圖形渲染、產品設計與 AI 開發等工作負載。不過,實際可支援的虛擬機器數量與效能,仍取決於虛擬機器配置、工作負載類型、記憶體需求及資源隔離策略。

ConnectX-8 主機板降低 I/O 複雜度

RTX Pro Server 的另一項重點,是將 ConnectX-8 SuperNIC 與 PCIe 6.0 交換器整合在同一張 I/O 主機板上。輝達在不同場合將其稱為「ConnectX-8 SuperNIC Switch」或「MGX PCIe Switch Board with ConnectX-8 SuperNIC」。

這張主機板可支援乙太網路 400 Gb、200 Gb、100 Gb、50 Gb 與 25 Gb 速率,也支援 800 Gb、400 Gb、200 Gb 與 100 Gb 的 InfiniBand 連線;主機介面採用 PCIe 6.0,最多提供 48 個通道。輝達表示,主機板背部配置 8 個網路連接埠,正面提供 9 個 PCIe 介面卡插槽,ConnectX-8 可在 GPU 與網路之間提供高頻寬連接。

以雙路伺服器搭配 8 張 GPU、4 張 ConnectX-7 網路卡與 1 張 BlueField-3 DPU 的傳統架構為例,系統可能需要 2 至 4 個 PCIe 交換器,分別處理 GPU 對 GPU,以及 GPU 對網路介面的連結。改用整合 PCIe 6.0 交換器與 ConnectX-8 SuperNIC 的設計後,輝達表示每張 GPU 最高可取得 400 Gb/s 網路頻寬,並可降低系統複雜度、減少 I/O 瓶頸。

在輝達的測試與說明中,這種架構可讓 GPU、網路介面與儲存裝置之間的資料搬移更有效率,並使 NCCL 多 GPU、多節點集體通訊效能提升至 2 倍。至於實際收益,仍會受到網路拓撲、應用程式通訊模式及儲存系統配置影響。

伺服器合作夥伴擴大,2U 機型預計稍晚推出

輝達在台北國際電腦展宣布 RTX Pro Server 進入量產階段,當時共有 18 家伺服器廠商響應;到了 8 月 SIGGRAPH 大會,合作廠商數量增加至 20 家。合作品牌涵蓋 Cisco、Dell Technologies、HPE、Lenovo,以及研華、永擎、華碩、仁寶、鴻海、技嘉、英業達、神雲、微星、和碩、雲達、Supermicro、緯創與緯穎等。

目前相關伺服器機型涵蓋 3U、4U 與 5U 尺寸,部分系統最多可安裝 10 張 GPU。輝達也表示,採用 4U 機箱、配置 8 張 RTX Pro Blackwell GPU 的伺服器已開始供應,機型包括技嘉 XL44-SX2-AAS1 與永擎 4UXGM-TURIN2 等。

至於 2U 尺寸的 RTX Pro Server,輝達預告將於 2025 年稍晚推出。Supermicro 已先行推出 SYS-212GB-NR;HPE 預計讓 DL385 Gen11 於 9 月開始出貨,Dell 將推出 PowerEdge R7725 與 R770,Lenovo 則預計在第四季開放 ThinkSystem SR650a V4 訂購。

整體而言,RTX Pro 6000 BSE 的正式供貨與 vGPU 19.0 支援,代表輝達正將 Blackwell 架構從 AI 加速卡進一步延伸至企業虛擬化、圖形渲染與資料中心整合平臺。其實際市場影響,仍須觀察各家伺服器的供貨規模、雲端服務價格,以及企業在功耗、軟體相容性與整體部署成本上的採用情況。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles