NVIDIA在今年3月GTC大會宣布,旗下3款商用GPU產品導入Blackwell架構,並統一納入RTX Pro Blackwell系列。其中兩款桌上型工作站GPU於5月推出,另一款則是資料中心產品RTX Pro 6000 Blackwell Server Edition,以下簡稱RTX Pro 6000 BSE。
隨著SIGGRAPH年度大會舉行,NVIDIA更新RTX Pro 6000 BSE產品頁面,將上市狀態由「即將推出」改為「現正供貨中」,並公布更完整的技術規格文件。NVIDIA Qualified System Catalog也已將這款GPU列入合格產品,現階段標示的搭配系統為Dell PowerEdge XE7745。

Blackwell架構與效能規格
RTX Pro 6000 BSE採用Blackwell架構,搭載第五代Tensor核心、第四代RT核心,以及第二代Transformer引擎。硬體配置大致延續NVIDIA先前預告的內容,包括24,064個CUDA核心、752個Tensor核心、188個RT核心、96GB GDDR7記憶體,以及1,597GB/s記憶體頻寬。
在效能數據方面,NVIDIA近期公布的資料較早期預告略有調整。FP4最高運算效能由先前的3.7 PFLOPS上修至4 PFLOPS;FP32單精度效能由117 TFLOPS上修至125 TFLOPS;RT核心效能則由354.5 TFLOPS調整至355 TFLOPS。不過產品資訊表列出的FP32單精度效能為120 TFLOPS,實際數值可能取決於文件版本或標示方式。


AI、基因體學與圖形工作負載
NVIDIA以採用Ada Lovelace架構的資料中心GPU L40S作為比較基準,宣稱RTX Pro 6000 BSE在多項工作負載可帶來數倍提升。針對代理型AI的大型語言模型處理,吞吐量最高可提升至5倍;基因體學定序速度最高可提升至7倍,其中Smith-Waterman演算法處理效能約為6.8倍。
在文字生成影片工作負載,效能提升至3.3倍;推薦系統推論效能接近提升兩倍;著色處理效能則超過兩倍。NVIDIA稍後公布的資料亦指出,RTX Pro 6000 BSE執行Llama 3 70B模型時,效能增長最高可達5.6倍,Omniverse著色處理為3.5倍,Autodesk Arnold著色處理為1.9倍,Siemens UFX與Dassault Abaqus模擬效能則提升至2倍。

八卡RTX Pro Server平台
在5月台北國際電腦展的主題演講中,NVIDIA共同創辦人暨執行長黃仁勳介紹RTX Pro 6000 BSE,以及與伺服器廠商合作打造的RTX Pro Server平台。
根據簡報資料,配置8張RTX Pro 6000 BSE的RTX Pro Server,使用NVIDIA FP4格式時,AI運算效能可達30 PFLOPS;執行Omniverse數位孿生即時模擬時,效能為3 PFLOPS。整台伺服器可提供800GB GPU記憶體與13TB/s GPU記憶體頻寬,並透過ConnectX-8 SuperNIC Switch支援多GPU互連,總頻寬可達800GB/s。
在每秒產生Token的測試中,NVIDIA以每5百萬美元成本與單一使用者兩種情境展示效能走勢。採用Llama 70B模型時,RTX Pro Server最高可達H100伺服器的1.7倍;採用DeepSeek R1模型時,則可達H100伺服器的4倍。



CoreWeave率先提供雲端執行個體
7月初,AI運算服務供應商CoreWeave宣布,正式推出搭載RTX Pro 6000 BSE的雲端執行個體,成為首家採用這款伺服器級GPU並提供相關運算服務的雲端平台。
CoreWeave的每個執行個體配置2顆第五代Intel Xeon Scalable處理器、8張RTX Pro 6000 BSE GPU,以及多個BlueField-3資料處理器。該公司公布的測試數據顯示,Llama 3 70B模型推論效能最高提升至5.6倍,文字生成影片速度提升至3.5倍,FP4運算效能則為3.8 PFLOPS。





第二代Transformer引擎與新一代RT核心
RTX Pro 6000 BSE的第五代Tensor核心支援FP4運算精度,可在處理AI模型時降低記憶體用量。NVIDIA表示,相較前一代GPU,AI推論效能最高可提升至6倍。
在以Llama Nemotron Super等模型驅動的AI代理工作負載中,NVIDIA以支援FP8的H100作為比較基準,表示RTX Pro 6000 Blackwell透過NVFP4格式可帶來3倍的性價比優勢。這項數據屬於NVIDIA公布的比較結果,實際表現仍會受到模型、軟體、批次大小與系統配置影響。
圖形處理方面,RTX Pro 6000 BSE導入第四代RT核心,NVIDIA表示圖像擬真著色效能最高可提升至4倍,光線與三角形相交的處理速度提升1倍。搭配RTX Mega Geometry技術後,光線追蹤可處理的三角形數量達到100倍以上,主要應用於高精度3D設計、工廠數位孿生、機器人模擬與大規模合成資料生成。
以採用L40S的系統為比較對象,NVIDIA宣稱RTX Pro Server在相關工廠數位孿生、機器人模擬及合成資料工作流程中可提供4倍速度。相較於單純採用CPU的2U伺服器,面對資料分析、模擬、影片處理與圖形著色工作負載時,RTX Pro Server則被標示為可提供45倍效能、18倍能源使用效率,並具備較低的總持有成本。


MIG與vGPU支援虛擬化部署
RTX Pro 6000 BSE支援多執行個體GPU(MIG)與vGPU技術。透過MIG的硬體分割機制,單張GPU可劃分為多個彼此隔離的GPU執行個體,各自配置記憶體、快取、運算引擎及串流多處理器,讓不同工作負載能維持一定的服務品質,降低彼此干擾或中斷的風險。
若再搭配vGPU軟體提供的分時共用機制,企業可在各GPU執行個體中建立多租戶架構,支援業務應用、視訊串流、圖形渲染、產品設計與AI開發等工作負載。
NVIDIA於8月第一週推出vGPU軟體第19版,RTX Pro 6000 BSE是該版本唯一新增支援的產品。NVIDIA表示,啟用MIG並搭配vGPU 19.0後,單張RTX Pro Blackwell系列GPU最多可同時支援48台配置GPU資源的虛擬機器:硬體可分為4個GPU執行個體,每個執行個體再支援12台採用分時共用GPU資源的虛擬機器。




RTX Pro 6000 Blackwell Server Edition規格
| 項目 | 規格 |
|---|---|
| 原廠 | NVIDIA |
| 建議售價 | 廠商未提供 |
| 外形 | 雙槽;長10.5吋、高4.4吋 |
| GPU架構 | Blackwell |
| CUDA核心 | 24,064個 |
| Tensor核心 | 752個,第五代Tensor核心 |
| RT核心 | 188個,第四代RT核心 |
| 記憶體 | 96GB GDDR7 |
| 記憶體頻寬 | 1,597GB/s |
| 連接介面 | PCIe 5.0 x16 |
| NVLink | 不支援 |
| FP32效能 | 120 TFLOPS |
| RT核心效能 | 355 TFLOPS |
| AI運算效能 | FP4最高4 PFLOPS |
| 視訊連接埠 | 4個DisplayPort 2.1 |
| 視訊處理引擎 | 4個第9代NVENC、4個第6代NVDEC |
| MIG配置 | 4個24GB記憶體執行個體、2個48GB記憶體執行個體,或1個48GB加2個24GB執行個體 |
| 耗電量 | 600瓦 |
RTX Pro 6000 BSE目前已被納入NVIDIA合格伺服器產品目錄,並開始透過合作系統與雲端平台供貨。其定位不僅涵蓋AI推論與高效能運算,也延伸至圖形渲染、數位孿生及多租戶虛擬化環境;不過建議售價仍未公布,實際效能與部署成本則需d視硬體配置、軟體版本及工作負載而定。







