長上下文推論引爆記憶體壓力:通用CXL記憶體擴充先行,AI分層架構邁入驗證期

BlueSky

AI 摘要

  • AI推論的長上下文與高併發請求推升動態資料量,導致KV Cache容易突破GPU HBM容量上限。
  • 業界正利用通用CXL擴充可定址記憶體並推動池化架構,同時在AI推論領域測試分層儲存與KV Cache重載。
  • CXL生態系帶動Retimer、交換器與控制器需求,供應鏈與伺服器ODM的平台整合複雜度顯著提高。

隨著人工智慧推論應用迅速朝向長上下文(Long Context)、多輪對話以及大規模併發請求(Concurrent Requests)發展,資料中心伺服器的記憶體子系統面臨前所未有的負載挑戰。過去以儲存模型權重為主的靜態需求,已轉變為由動態生成的鍵值快取(KV Cache)主導的容量瓶頸。業界正加速推進基於 Compute Express Link(CXL)的通用記憶體擴充方案,並在 AI 推論架構中評估導入選擇性記憶體分層技術。

長上下文與高併發放大 KV Cache 負載

在大型語言模型(LLM)推論過程中,模型權重所需佔用的記憶體容量相對固定,然而 KV Cache 的規模會隨著輸入上下文長度及同時發起之請求數量呈倍數擴增。在每張 GPU 配備的高頻寬記憶體(HBM)容量受到硬體規格上限限制的情況下,高負載場景下的動態資料往往快速逼近 HBM 總量極限。

根據伺服器架構分析,當推論服務處理極長文本時,動態累積的 KV Cache 邏輯容量甚至可能超越標準 8-GPU 系統所配置的 HBM 總和。若單純依賴昂貴且容量受限的 HBM,將導致部署成本劇增並限制伺服器的吞吐量。因此,將推論資料依據存取頻率進行分層配置(Tiered Memory Configuration)成為架構設計的重要方向。

通用 CXL 記憶體擴充技術路徑

為克服傳統 CPU 主記憶體(DIMM)插槽與走線擴充受限的問題,CXL 技術提供了直接擴增可定址記憶體容量的標準化介面:

  • CXL Type 3 裝置:主要用於增加主機處理器可定址之記憶體空間,在現有本機記憶體之外提供高容量補充。
  • CXL Switch 與記憶體池化:透過交換器(Switch)建立共享記憶體池(Memory Pooling),實現多主機動態分配記憶體資源,大幅提升資料中心整體記憶體利用率。

通用型 CXL 記憶體架構目前以常規雲端工作負載與 CPU 主記憶體擴充為主要既有部署用途,並已在部分超大規模資料中心展開實體導入;相較之下,AI 推論端則以 KV Cache 保存、卸載與重載為新興驗證情境,仍處於特定架構測試階段。

雲端服務商與晶片業者佈局進度

全球主要資料中心營運商與半導體供應商正從不同面向驗證 CXL 在分層記憶體中的可行性:

廠商 / 領域發展重心與推進現況
Meta已於實際資料中心伺服器環境中部署通用 CXL 記憶體架構。
微軟(Microsoft)持續驗證記憶體擴充、池化(Pooling)及多節點共享技術路徑。
三星電子(Samsung)與 SK 海力士(SK hynix)推進 AI 應用驗證,實測 CXL 記憶體裝置在 KV Cache 儲存與重載的延遲表現。

零組件供應鏈與平台工程整合需求

CXL 記憶體生態系已從單一記憶體模組與裝置,延伸至控制器(Controller)、CXL 交換器、以及訊號重計時器(Retimer)等多類伺服器平台元件。隨著實體通道長度增加與高速訊號傳輸要求提升,Retimer 的配置比例顯著增長。

台灣供應鏈廠商主要從高速介面訊號與平台工程切入,例如群聯電子(Phison)藉由長期累積的 PCIe 高速訊號能力進入 CXL 相關市場。此外,由於 CXL 記憶體池化及 Fabric 架構大幅提高平台設計複雜度,伺服器 ODM 業者承擔之系統整合與散熱佈局責任同步加重,硬體客製化能力將成為決定供應鏈工程價值的核心指標。

Reference Link : digitimes.com.tw

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles