AI 應用通常需要處理龐大資料集,因此儲存空間長期以來主要由獨立且可擴展的外部儲存設備提供。GPU 伺服器內接 SSD 通常只負責作業系統與應用程式,實際可用容量不少,但大部分時間處於閒置狀態。
近半年多來,平行檔案系統業者 Hammerspace 與 WEKA 先後提出新的部署方式,將多臺 GPU 伺服器的內接 NVMe SSD 組成儲存叢集,並透過平行檔案系統提供高可用性、資料保護與跨伺服器資源管理能力。這類架構試圖在本機 SSD 的低延遲與外部儲存的可管理性之間取得平衡。
典型的AI應用儲存架構

未被充分使用的GPU伺服器內接SSD

內接與外部儲存各有優勢
GPU 伺服器的儲存資源大致可分為兩類:伺服器自身配置的 NVMe SSD,以及透過網路連接的外部儲存設備。兩者在延遲、容量與擴展能力方面各有取捨。
- 內接 NVMe SSD:由於距離 GPU 較近,資料傳輸路徑較短,存取延遲可達數十微秒等級。不過,GPU 伺服器機箱通常只能配置約 8 至 16 臺 SSD,容量、整體頻寬與擴展能力受限,單一伺服器通常只能匯聚出數十 GB/s 等級的傳輸頻寬。此外,內接 SSD 原本只能供該伺服器使用,容易形成資源孤島,也缺乏完整的高可用性與資料保護機制。
- 外部儲存設備:容量與擴展能力不受單一伺服器機箱限制,還能透過儲存軟體平台提供高可用性、資料保護及跨伺服器資源調派。不過,資料必須經由網路傳輸,存取延遲通常較高,最低也多在數百微秒至毫秒等級。
外部儲存的效能可透過 RDMA 或 GPUDirect 等遠端直連技術改善,再搭配由大量儲存節點與 SSD 組成的分散式平行檔案系統,匯聚出數百 GB/s,甚至 TB/s 等級的傳輸頻寬。因此,分散式或平行檔案系統外部儲存目前仍是 AI 應用的主流架構。
將閒置 SSD 轉化為 GPU 伺服器端儲存叢集
新的 GPU 伺服器端儲存架構,會利用儲存叢集平台軟體,將每臺 GPU 伺服器視為一個儲存節點,再透過網路互連多臺伺服器,將各自的內接 NVMe SSD 納入集中管理,形成分散式儲存空間。
這種做法可在不額外添購專用儲存設備的情況下,利用既有的 SSD、CPU 與網路資源,為內接 SSD 增加高可用性、資料保護及跨節點管理能力。部分方案也能與外部儲存叢集結合,形成橫跨 GPU 伺服器內部與外部設備的分層式 AI 儲存架構。
這類架構的主要訴求包括:
- 充分利用原本閒置的 GPU 伺服器內接 SSD。雖然單臺伺服器容量有限,但多臺 GPU 伺服器累積後,仍可形成具規模的儲存空間。
- 分攤部分 AI 應用的儲存需求,降低對外部儲存設備的依賴,但並非完全取代外部儲存。
- 利用內接 NVMe SSD 的低延遲特性,縮短資料送往 GPU 或將運算結果寫回儲存空間所需的時間。
來源資料指出,內接 NVMe SSD 的延遲約為數十微秒,外部儲存設備則通常為數百微秒至毫秒,兩者可能存在 10 倍至 100 倍以上的差距。因此,GPU 伺服器內接 SSD 可被用作 AI 工作負載的高速儲存層。
檢查點寫入是重要應用場景
Hammerspace 提出的使用案例之一,是把 GPU 伺服器內接 SSD 作為 AI 模型檢查點的高速寫入層。檢查點用來保存每個 GPU 上的模型訓練狀態,方便日後復原或偵錯。
AI 模型可能每小時寫入一次檢查點,每個 GPU 產生的資料量從數 MB 到數 GB 不等。當數十或上百個 GPU 同時寫入時,會形成高度突發的寫入工作負載。來源資料指出,傳統檢查點寫入每次至少可能耗時 5 至 10 分鐘,期間 GPU 可能處於等待狀態。
Hammerspace 表示,若由 GPU 伺服器內接 SSD 先承接檢查點資料,可將寫入時間由 200 秒縮短至幾秒鐘,減少 GPU 因等待儲存作業而暫停的時間,也讓應用程式有機會提高檢查點建立頻率,降低故障復原時的工作損失。上述數據屬於 Hammerspace 提供的使用案例說法,實際效能仍會受到硬體配置與工作負載影響。
Hammerspace Tier 0:納入全域資料平台的高速層
Hammerspace 在 2024 年 11 月發布的 Global Data Platform(GDP)5.1 版中,推出整合 GPU 伺服器內接 SSD 的 Tier 0 功能。Tier 0 代表位於資料存取路徑最前端、速度最快的儲存層,外部儲存則可作為 Tier 1、Tier 2 及歸檔層。
在這個架構中,多臺 GPU 伺服器的內接 SSD 會被納入 Hammerspace GDP,為 GPU 提供比網路連接外部儲存更低的存取延遲。Hammerspace 認為,這能提高閒置 SSD 的使用率,並在部分情境下減少外部儲存設備的容量、機架空間、冷卻與電力需求。
Hammerspace 另提供 Local-IO 軟體元件,用於加速 Linux 本機存取。該元件已整合至 6.12 版 Linux Kernel,可繞過 Linux Kernel 中的 NFS 與網路堆疊,降低本機存取延遲。Hammerspace 表示,Local-IO 能在 GPU 與 SSD 之間進行免記憶體複製的資料傳輸;多臺 SSD 聚合時,傳輸頻寬可超過 100 GB/s,效能可達數千萬 IOPS,並維持數微秒等級延遲。
Tier 0 不只可服務 GPU 運算,也能在地端或雲端環境部署,並可應用於 x86 虛擬機器。由於它是 GDP 多層資料平台的一部分,內接 SSD 所形成的空間也能透過檔案與物件介面提供給其他用戶端,並與外部儲存設備共同實現自動分層。

WEKA NeuralMesh Axon:直接建立 GPU 伺服器儲存池
WEKA 在 2025 年 7 月推出 NeuralMesh Axon,這是其 AI 儲存架構 NeuralMesh 的 GPU 伺服器端延伸版本。NeuralMesh Axon 利用 GPU 伺服器既有的 NVMe SSD、CPU 與網路資源,建立分散式儲存叢集。
NeuralMesh Axon 支援 NFS、SMB、S3 等標準存取協定,也支援 WEKA 自有的平行存取用戶端協定。功能包括自動修復、動態平衡 I/O、自動擴展、Erasure Coding,以及快速重建等資料保護機制。
WEKA 表示,NeuralMesh Axon 可支援超過 100 臺 GPU 伺服器組成叢集,並將資料、metadata 及讀寫作業分散至所有 GPU 節點,以實現線性效能擴展。透過 Erasure Coding,系統最多可容許 4 臺節點同時失效。
此外,NeuralMesh Axon 支援 WEKA 的 Augmented Memory Grid(AMG)功能,可利用儲存叢集空間,為大型語言模型推論提供擴展的 KV 快取容量。
與 WEKA 合作的雲端 AI 服務商 CoreWeave 已在其環境部署 NeuralMesh Axon。CoreWeave 的實測結果顯示,每臺架構中的 GPU 節點可提供 30 GB/s 讀取吞吐率與 12 GB/s 寫入吞吐率,IOPS 達 100 萬,並具備微秒等級存取延遲。NeuralMesh Axon 目前已向部分特定用戶提供,WEKA 預定於 2025 年秋季全面上市。

兩種架構的核心差異
| 項目 | Hammerspace Tier 0 | WEKA NeuralMesh Axon |
|---|---|---|
| 基本概念 | 將 GPU 伺服器內接 SSD 納入平行檔案系統,作為高速儲存層。 | 利用多臺 GPU 伺服器的內接 SSD 建立分散式儲存叢集。 |
| 整體定位 | Global Data Platform 多層儲存架構中的 Tier 0。 | 部署於 GPU 伺服器端的獨立儲存叢集架構。 |
| 外部儲存整合 | 可與外部 NVMe、硬碟、磁帶及其他儲存層搭配,支援自動分層。 | 來源資料強調其 GPU 伺服器端儲存池定位,未描述與外部儲存整合的自動分層功能。 |
| 額外軟體或功能 | 搭配 Local-IO,加速 Linux 本機資料存取。 | 支援自動修復、動態 I/O 平衡、Erasure Coding、快速重建與 AMG。 |
效能與資源干擾仍是採用關鍵
GPU 伺服器端儲存叢集的優點,在於可直接利用既有硬體,無需另建專用儲存節點,並以內接 NVMe SSD 提供較低延遲的資料存取。對於檢查點寫入、暫存資料或需要快速供應 GPU 的工作負載,這種高速儲存層可能具備吸引力。
不過,這類架構也存在明確限制。GPU 伺服器必須同時擔任儲存叢集節點,儲存軟體會占用部分 CPU、記憶體與網路資源,可能對同一伺服器上的 AI 訓練、推論或其他應用工作負載造成影響。GPU 伺服器內接 SSD 的容量與節點數也受既有硬體配置限制,難以完全取代容量更大、資源管理更集中且擴展性更高的外部儲存設備。
因此,GPU 伺服器端儲存叢集較可能被視為外部儲存之外的補充層,而非全面替代方案。未來實際導入時,除了比較延遲與吞吐率,也需要評估 CPU、記憶體及網路資源的額外消耗、故障時的資料保護能力,以及儲存與運算工作負載之間的干擾程度。




