輝達重啟 Rubin CPX:改用 168GB HBM4,專攻超長上下文 AI 預填充

BlueSky

AI 摘要

  • 輝達據報重啟 Rubin CPX 專用 AI 加速器專案。
  • Rubin CPX 改用 168GB HBM4 記憶體。
  • Rubin CPX 主要負責超長上下文的預填充。

隨著大型語言模型(LLM)與 AI Agent 的參數規模持續擴大,傳統通用 GPU 在處理長 Context Window 時,可能受到記憶體頻寬、KV 快取容量與推論流程資源競爭等因素限制。根據天風國際供應鏈分析師郭明錤(Ming-Chi Kuo)透露的產業消息,輝達(NVIDIA)先前一度暫緩的 Rubin CPX 專用 AI 加速器專案已重新啟動。

Rubin CPX 的硬體規劃據報出現重大調整,從原先規劃的 128GB GDDR7 顯示記憶體,改為容量達 168GB 的 HBM4 高頻寬記憶體。這項變更主要針對長文本輸入、KV 快取與超長上下文預填充等工作負載,但目前來源未提供正式產品發表日期、售價或上市規格。

Rubin CPX 分擔預填充工作

大型語言模型推論通常可分為預填充(Prefill)與解碼(Decode)兩個階段。預填充負責處理使用者輸入的上下文並建立 KV 快取;解碼則負責依序產生輸出內容。若由同一顆 GPU 同時處理兩類工作,可能造成運算與記憶體資源互相競爭。

輝達在 Rubin 世代導入解耦推論(Disaggregated Inference)概念,據報將大量輸入 Context 與 KV 快取的預處理工作交由 Rubin CPX 負責,常規 Rubin GPU 則專注於解碼與 Token 生成。在標準叢集規劃中,負責解碼的機架將以 CPX GPU 與常規 Rubin GPU 1:1 的比例配置。

在資料中心部署方面,Rubin CPX 預計以獨立機架模組化配置,單一機架可依算力需求擴充至 64 至 256 顆 CPX GPU。標準配置下,配備 8 顆 CPX GPU 的機架托盤,據報可處理最高 1.34TB 的超長上下文預填充資料與相關 KV 快取。

168GB HBM4 對應大容量快取需求

Rubin CPX 改用 168GB HBM4,反映其設計重點從一般通用運算,轉向處理需要大量記憶體容量與頻寬的推論工作。對長篇對話、多輪 AI Agent 規劃,以及大規模程式碼庫理解等情境而言,較大的記憶體空間有助於容納上下文資料與 KV 快取。

不過,從 GDDR7 改用 HBM4 也代表基板、封裝與散熱設計需要重新規劃。市場預期輝達可能進一步與台積電(TSMC)合作,採用 CoWoS-S 或 CoWoS-L 先進封裝,處理邏輯晶片與 HBM4 堆疊之間的高密度互連及散熱需求。這部分目前仍屬市場預期,並非輝達已正式確認的量產資訊。

單晶片設計提供 30 PFLOPS 推論算力

在微架構方面,消息指出 Rubin CPX 採用單晶片(Monolithic)設計,並可提供最高 30 PFLOPS 的 NVFP4 推論算力。NVFP4 屬於低精度數值格式,主要用於降低推論工作負載的資料表示成本,實際效能仍會受到模型、軟體支援與資料中心系統配置影響。

除了 Transformer 推論引擎,Rubin CPX 也據報整合 4 組 NVENC 視訊編碼引擎與 4 組 NVDEC 視訊解碼引擎。這讓系統在處理影片、語音與影像等多模態輸入時,可由加速器執行部分硬體解碼與前處理,減少頻繁透過 PCIe 匯流排要求主機端 CPU 介入轉碼的需求。

專用加速器仍待正式資訊確認

若上述規劃最終落地,Rubin CPX 將與常規 Rubin GPU 分工,分別處理超長上下文預填充與輸出解碼,有機會成為輝達針對大型模型推論流程進行硬體切分的產品。不過,目前相關資訊主要來自供應鏈分析師透露,輝達尚未公布 Rubin CPX 的正式產品規格、部署時程、價格或實際效能測試。

Reference Link : techbang.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles