輝達(NVIDIA)採用 Blackwell 架構的新一代伺服器 GPU 加速卡 RTX Pro 6000 Blackwell Server Edition(以下簡稱 RTX Pro 6000 BSE),近期出現正式上市進展。輝達在產品網頁上將供貨狀態由「即將推出」更新為「現正供貨中」,並在 Nvidia Qualified System Catalog 合格伺服器型錄中,列出搭配 Dell PowerEdge XE7745 的合格系統。
這項進展適逢年度 SIGGRAPH 大會舉行。輝達也在 8 月第一週發布 vGPU 軟體第 19 版,當中唯一新增支援的產品就是 RTX Pro 6000 BSE,以及以此 GPU 組成的 RTX Pro Server 伺服器平臺。
Blackwell 伺服器 GPU 規格與效能微幅上修

輝達今年 3 月 GTC 大會宣布 3 款採用 Blackwell 架構的商用 GPU,並統一稱為 RTX Pro Blackwell 系列。其中兩款為桌上型工作站 GPU,另一款便是資料中心產品 RTX Pro 6000 BSE。該產品在 6 月 11 日於 VivaTech 2025 期間舉行的 GTC Paris 正式亮相,之後於 8 月 SIGGRAPH 大會推出完整的 RTX Pro Server 解決方案。
目前公布的硬體配置,包括 CUDA 核心、Tensor 核心、RT 核心數量,以及 GPU 記憶體類型、容量和頻寬,均與先前預告內容相同。不過,輝達對部分運算效能數字進行微幅上修:
| 項目 | 最新標示 | 先前標示 |
|---|---|---|
| FP4 | 最高 4 PFLOPS | 3.7 PFLOPS |
| FP32 單精度 | 120 TFLOPS | 117 TFLOPS |
| RT 核心處理能力 | 355 TFLOPS | 354.5 TFLOPS |
RTX Pro 6000 BSE 採用第五代 Tensor 核心、第二代 Transformer Engine,以及第四代 RT 核心,並支援 FP4 與 NVIDIA NVFP4 等運算格式。輝達表示,FP4 可在降低記憶體用量的同時加快 AI 模型處理;相較前一代 GPU,AI 推論效能最高可提升至 6 倍。
鎖定 AI、數位雙生與圖形渲染
以採用 Ada Lovelace 架構的資料中心 GPU L40S 為比較基準,輝達公布 RTX Pro 6000 BSE 在多種工作負載上的效能改善,包括代理型 AI 大型語言模型處理吞吐量最高提升 5 倍、基因體學定序速度最高提升 7 倍,其中 Smith-Waterman 演算法可達 6.8 倍;文字生成影片速度提升至 3.3 倍,推薦系統推論效能接近 2 倍,著色處理速度則超過 2 倍。
輝達在 vGPU 19.0 發表資訊中進一步指出,RTX Pro 6000 BSE 執行 Llama 3 70B 模型時,效能最高可達 L40S 的 5.6 倍;Omniverse 著色處理約為 3.5 倍,Autodesk Arnold 著色處理約為 1.9 倍,Siemens UFX 與 Dassault Abaqus 等模擬工作負載則可提升至 2 倍。
在圖形處理方面,第四代 RT 核心可讓圖像擬真著色效能提升至 4 倍,光線與三角形相交處理速度提升 1 倍。搭配 RTX Mega Geometry 技術後,輝達宣稱光線追蹤三角形繪製數量可達 100 倍以上,應用場景包括工廠數位雙生、機器人模擬與大規模合成資料產生。
RTX Pro Server 整合 8 張 GPU 與 ConnectX-8 SuperNIC
RTX Pro Server 是輝達在 2025 年推出的資料中心伺服器平臺,可視為 OVX 系統的後繼方案,主要針對 Omniverse 工業數位雙生、機器人學習與模擬,以及企業級 AI 與圖形工作負載。每臺伺服器最多可配置 8 張 RTX Pro Blackwell GPU,並搭配 BlueField-3 DPU,以及整合 ConnectX-8 SuperNIC 與 PCIe 6.0 交換器的 I/O 主機板。
在台北國際電腦展的展示中,輝達列出 8 張 RTX Pro 6000 BSE 組成的 RTX Pro Server 具備以下能力:
- FP4 AI 運算效能最高達 30 PFLOPS。
- Omniverse 數位雙生即時模擬效能達 3 PFLOPS。
- GPU 記憶體容量達 800 GB,記憶體頻寬為 13 TB/s。
- 透過 ConnectX-8 SuperNIC Switch 進行多 GPU 互連時,總頻寬可達 800 GB/s。
輝達也以每 500 萬美元成本與單一使用者兩種情境比較每秒產生的符元數量。採用 Llama 70B 模型時,RTX Pro Server 最高可達 H100 伺服器的 1.7 倍;採用 DeepSeek R1 模型時,最高可達 H100 伺服器的 4 倍。這些數字屬於輝達公布的比較結果,實際表現仍會受模型、軟體版本、功耗設定與系統配置影響。

CoreWeave 已提供 RTX Pro 6000 BSE 雲端執行個體
與輝達關係密切的 AI 運算服務供應商 CoreWeave 在 7 月宣布,已正式提供搭配 RTX Pro 6000 BSE 的雲端執行個體,成為首家採用這款伺服器級 GPU 並提供相關運算服務的雲端平臺。
CoreWeave 的單一執行個體配備 2 顆第五代 Intel Xeon Scalable 處理器、8 張 RTX Pro 6000 BSE GPU,以及多個 BlueField-3 DPU。該公司公布的測試數據包括:Llama 3 70B 大型語言模型推論效能最高提升 5.6 倍、文字生成影片速度提升 3.5 倍,FP4 運算效能為 3.8 PFLOPS。

MIG 與 vGPU 支援虛擬化多租戶架構
RTX Pro Blackwell 系列中的 RTX Pro 6000 與 RTX Pro 5000 支援 GPU 多執行個體(MIG)。透過硬體分割機制,單張 RTX Pro 6000 BSE 可切分為多個彼此隔離的 GPU 執行個體,各自配置記憶體、快取、運算引擎與串流多處理器,讓不同工作負載維持較穩定的服務品質。
當 MIG 與 vGPU 軟體提供的分時共用機制結合後,每個 GPU 執行個體可建立多租戶服務架構。輝達表示,RTX Pro Blackwell 系列啟用 MIG 並搭配 vGPU 19.0 時,單張 GPU 加速卡最多可同時支援 48 臺配置 GPU 資源的虛擬機器,具體配置為 4 個 GPU 執行個體,每個執行個體支援 12 臺採用分時共用 GPU 資源的虛擬機器。
這項彈性讓企業可在同一套 GPU 基礎架構上執行業務應用、視訊串流、圖形渲染、產品設計與 AI 開發等工作負載。不過,實際可支援的虛擬機器數量與效能,仍取決於虛擬機器配置、工作負載類型、記憶體需求及資源隔離策略。

ConnectX-8 主機板降低 I/O 複雜度
RTX Pro Server 的另一項重點,是將 ConnectX-8 SuperNIC 與 PCIe 6.0 交換器整合在同一張 I/O 主機板上。輝達在不同場合將其稱為「ConnectX-8 SuperNIC Switch」或「MGX PCIe Switch Board with ConnectX-8 SuperNIC」。
這張主機板可支援乙太網路 400 Gb、200 Gb、100 Gb、50 Gb 與 25 Gb 速率,也支援 800 Gb、400 Gb、200 Gb 與 100 Gb 的 InfiniBand 連線;主機介面採用 PCIe 6.0,最多提供 48 個通道。輝達表示,主機板背部配置 8 個網路連接埠,正面提供 9 個 PCIe 介面卡插槽,ConnectX-8 可在 GPU 與網路之間提供高頻寬連接。
以雙路伺服器搭配 8 張 GPU、4 張 ConnectX-7 網路卡與 1 張 BlueField-3 DPU 的傳統架構為例,系統可能需要 2 至 4 個 PCIe 交換器,分別處理 GPU 對 GPU,以及 GPU 對網路介面的連結。改用整合 PCIe 6.0 交換器與 ConnectX-8 SuperNIC 的設計後,輝達表示每張 GPU 最高可取得 400 Gb/s 網路頻寬,並可降低系統複雜度、減少 I/O 瓶頸。
在輝達的測試與說明中,這種架構可讓 GPU、網路介面與儲存裝置之間的資料搬移更有效率,並使 NCCL 多 GPU、多節點集體通訊效能提升至 2 倍。至於實際收益,仍會受到網路拓撲、應用程式通訊模式及儲存系統配置影響。


伺服器合作夥伴擴大,2U 機型預計稍晚推出
輝達在台北國際電腦展宣布 RTX Pro Server 進入量產階段,當時共有 18 家伺服器廠商響應;到了 8 月 SIGGRAPH 大會,合作廠商數量增加至 20 家。合作品牌涵蓋 Cisco、Dell Technologies、HPE、Lenovo,以及研華、永擎、華碩、仁寶、鴻海、技嘉、英業達、神雲、微星、和碩、雲達、Supermicro、緯創與緯穎等。
目前相關伺服器機型涵蓋 3U、4U 與 5U 尺寸,部分系統最多可安裝 10 張 GPU。輝達也表示,採用 4U 機箱、配置 8 張 RTX Pro Blackwell GPU 的伺服器已開始供應,機型包括技嘉 XL44-SX2-AAS1 與永擎 4UXGM-TURIN2 等。
至於 2U 尺寸的 RTX Pro Server,輝達預告將於 2025 年稍晚推出。Supermicro 已先行推出 SYS-212GB-NR;HPE 預計讓 DL385 Gen11 於 9 月開始出貨,Dell 將推出 PowerEdge R7725 與 R770,Lenovo 則預計在第四季開放 ThinkSystem SR650a V4 訂購。
整體而言,RTX Pro 6000 BSE 的正式供貨與 vGPU 19.0 支援,代表輝達正將 Blackwell 架構從 AI 加速卡進一步延伸至企業虛擬化、圖形渲染與資料中心整合平臺。其實際市場影響,仍須觀察各家伺服器的供貨規模、雲端服務價格,以及企業在功耗、軟體相容性與整體部署成本上的採用情況。





