隨著 AI 訓練資料量持續增加,儲存裝置與 GPU 伺服器之間的資料傳輸效率,已成為影響 AI 應用整體效能的重要環節。Nvidia 推出的 GPUDirect Storage(GDS)架構,透過儲存裝置與 GPU 之間的直連傳輸,逐漸成為 AI 資料傳輸的主流架構,目前已有超過 15 家廠商、近 20 種儲存平臺支援。
然而,GDS 主要在檔案系統層級運作,導致採用 S3、Swift、REST 或 HTTP 等協定的物件儲存無法直接納入其架構。近幾個月,MinIO、Cloudian 與 DDN 等廠商陸續發展基於物件儲存協定的 GPU 直連傳輸方案,為物件儲存切入 AI 儲存應用提供另一條技術路徑。
GDS 解決資料經由 CPU 的傳輸瓶頸
GPU 直連傳輸的核心目的,是在儲存裝置與 GPU 之間建立直接記憶體存取(Direct Memory Access,DMA)。傳統資料傳輸通常需要經過主機 CPU 與系統記憶體的回彈緩衝區(Bounce Buffer),可能產生額外的資料複製作業,並增加延遲與 CPU 負荷。
GDS 允許儲存裝置直接將資料載入 GPU 記憶體,繞過主機 CPU 與系統記憶體的中介,因此可望降低存取延遲、減輕 CPU 負載並提高傳輸頻寬。GDS 可支援 GPU 伺服器本機 SSD、外部掛載的區塊儲存,以及網路附加儲存設備(NAS)。
不過,這些儲存資源最終都必須以檔案系統形式提供給 GDS 存取。本機 SSD 與外部區塊儲存區通常需要格式化為 EXT4 或 XFS;相容的 NAS 則可透過修改後的 NFS 協定(NFS over RDMA)或 InfiniBand 建立 GDS 存取。
物件儲存長期被排除在 GDS 之外
物件儲存以 S3 等物件傳輸協定存取資料,並非以檔案系統掛載方式運作,因此無法直接使用 GDS 的傳輸機制。這使物件儲存即使具備大量儲存節點與高頻寬網路介面,例如 400GbE,在資料傳往 GPU 伺服器時仍可能需要經過主機 CPU 與系統記憶體。
在 CPU 負載較低時,是否使用 GPU 直連傳輸,對資料傳輸率與存取延遲的影響約為 20% 至 30%。但當 CPU 處於高負載狀態,是否繞過 CPU 進行 GPU 直連,可能使傳輸效能與延遲出現數倍差距,成為物件儲存投入 AI 工作負載時的主要限制。
物件儲存本身仍具備高度擴展性,以及適合搜尋與檢索工作的彈性 metadata 管理能力。在大規模非結構化資料場景中,物件儲存甚至可能比檔案儲存更具優勢,因此儲存業者開始自行尋找與 GPU 建立直連傳輸的方法。
目前可行的三種物件儲存 GPU 直連方式
以檔案協定繞開物件協定限制
部分新型儲存平臺同時支援物件與檔案存取協定。即使 GDS 無法直接相容於物件協定,這些平臺仍可改用檔案協定建立 GDS 傳輸。Pure Storage FlashBlade、Quantum Myriad,以及 Weka、VAST Data 的物件儲存平臺,都提供此類能力。
這種做法能讓使用者透過檔案介面取得 GDS 傳輸效益,但本質上是避開物件儲存協定限制,並未真正解決物件儲存缺乏 GPU 直連支援的問題。
在物件儲存前端加入檔案系統層
另一種方法是在物件儲存平臺前端加入相容於 GDS 的檔案系統層,先將物件儲存空間掛載到檔案系統,再由該檔案系統與 GPU 伺服器建立直連傳輸。Hammerspace 曾表示,其 Hyperscale NAS 可為後端不具備 GDS 連接能力的儲存設備提供 GDS 直連存取服務。
此方法理論上可適用於既有、未支援 GDS 的儲存設備,但中介檔案系統層也會增加資料傳輸路徑,可能導入額外延遲與新的效能瓶頸,因而折損 GPU 直連的部分效益。
以 S3 與 RDMA 建立原生物件傳輸路徑
第三種方法是在 GDS 框架之外,建立基於 S3 物件儲存協定的 GPU 直連傳輸架構,讓 GPU 伺服器透過 RDMA 遠端存取物件儲存資料。這也是近期 MinIO、Cloudian 與 DDN 等業者投入的方向。

MinIO、Cloudian 與 DDN 陸續布局
目前已有三家物件儲存或高效能運算儲存業者公布相關發展:
- MinIO:在 2024 年 11 月中旬,為 Object Store 物件儲存平臺引進 S3 over RDMA。
- Cloudian:在 2024 年 11 月稍晚,為 HyperStore 物件儲存平臺新增 GPUDirect for Object Storage。
- DDN:在 2025 年 2 月底發表 Infinia 2.0 物件儲存平臺時,表示後續將支援 GPUDirect for Object。
DDN 當時尚未公開 GPUDirect for Object 的技術細節。從 MinIO 已揭露的 S3 over RDMA,以及 Cloudian 公布的 GPUDirect for Object Storage 資訊來看,兩者採取的方式與 GDS 不同。
透過 GPUDirect RDMA 連接物件儲存與 GPU
GDS 在檔案系統層級運作,外部儲存設備的檔案系統會透過核心修改與 Nvidia 的 nvidia-fs.ko 軟體元件連接,使外部檔案系統具備對 GPU 記憶體進行 DMA 存取的能力。
相較之下,S3 over RDMA 與 GPUDirect for Object Storage 被認為是透過網路卡的 GPUDirect RDMA 功能,建立物件儲存平臺與 GPU 之間的直連傳輸。GPU 伺服器可經由支援 RDMA 的網路卡,以 S3 協定存取物件儲存資料,讓資料直接進入 GPU 記憶體,不必經過主機 CPU 與系統記憶體。
這類架構也能將部分資料傳輸工作卸載至網路卡,降低儲存端與 GPU 伺服器端的 CPU 負荷,從而改善高負載 AI 工作環境下的延遲與傳輸效率。
硬體相容性與標準化仍是限制
基於 S3 與 RDMA 的 GPU 直連架構仍存在兩項主要限制。
- 可能受限於特定網路卡:Cloudian 表示,其 GPUDirect for Object Storage 是搭配 Nvidia ConnectX 網路卡與 BlueField DPU 建立。這意味著實際部署時,使用者可能需要採用特定的網路硬體組合。
- 尚未形成共通標準:GDS 是由 Nvidia 先行提出,再推廣至儲存廠商,支援產品也有 Nvidia 官方認證。物件儲存領域的 GPU 直連架構則主要由各家業者自行發展,目前缺乏 Nvidia 官方認證,彼此之間也未形成統一標準。
因此,現階段不同物件儲存平臺的 GPU 直連方案,可能在網路卡、DPU、軟體堆疊與支援協定方面存在差異,企業在導入前仍需確認硬體與軟體的相容性。
物件儲存能否成為 AI 儲存的重要選項
過去物件儲存因缺乏 GPU 直連能力,資料傳輸必須經過主機 CPU 與系統記憶體,容易造成延遲增加、CPU 負荷攀升與傳輸頻寬受限。以 Cloudian 的 GPUDirect for Object Storage 為例,其設計是透過 RDMA 網路卡與 GPU 建立直連,再以 S3 協定直接存取 GPU 記憶體,藉此避開傳統傳輸路徑的瓶頸。
MinIO、Cloudian 與 DDN 等業者的投入,顯示物件儲存廠商正試圖補足 AI 儲存環境中的傳輸能力。由於 GPU 直連對高 CPU 負載情境下的傳輸效能與延遲具有明顯影響,相關支援程度也可能成為物件儲存平臺競爭 AI 工作負載的重要條件。
目前這些方案仍處於生態系擴充與標準化發展階段。若後續有更多物件儲存業者採用基於 S3 的 GPU 直連傳輸,業界才可能逐步形成共通規格,進一步降低 AI 儲存部署的整合難度。




