AMD ROCm 10 正式發布:導入 ROCm.AI 代理架構,推論效能大幅躍升

BlueSky

AI 摘要

  • AMD 正式推出 ROCm 10 運算平台並全面上線 ROCm.AI 原生軟體體驗。
  • 新版本導入自主代理工具,在同等硬體下推論效能較 ROCm 7 提升 3.3 倍。
  • 生態系整合 Hyperloom、AMD Skills 與跨平台 CLI 工具以簡化模型調校與部署。

AMD 正式發表代號為 AMD ROCm 10 的全新開源軟體堆疊,象徵其運算軟體生態系邁入第 10 週年。伴隨此版本釋出,AMD 亦宣布先前於 Advancing AI 大會亮相的「ROCm.AI」原生開發體驗正式邁入全面可用(General Availability, GA)階段,旨在簡化開發者在 AMD 硬體上的模型部署與運算最佳化作業。

導入 AI 原生最佳化:推論與訓練效能顯著增長

根據 AMD 公布的測試基準資料,ROCm.AI 藉由核心程式(Kernels)、記憶體配置與工作排程導入 AI 驅動的最佳化演算法。在維持相同硬體配置的前提下,配備 ROCm.AI 的系統相較於先前的 ROCm 7 版本,推論效能平均提升達 3.3 倍,訓練工作負載效能亦平均增長 2.4 倍。

AMD 指出,ROCm.AI 整合了三大關鍵工具模組,涵蓋推論調校、開發支援及硬體負載部署等階段:

  • AMD Hyperloom:自主代理式最佳化系統。
  • AMD Skills:將 AMD 軟硬體專家知識整合至主流程式輔助工具中。
  • ROCm CLI:統一化的跨平台環境管理與命令列工具。

核心組件解析:Hyperloom 與 AMD Skills 代理生態

作為 ROCm.AI 的關鍵核心,AMD ROCm Hyperloom 是一套具備自主分析能力的代理工具,專注於針對主機端(Host code)與 GPU 核心運算進行端對端推論調校。該系統具備自動化工作負載剖析、瓶頸識別、程式碼調整建議及效能基準驗證功能。

隨著 ROCm 10 發布,Hyperloom 擴大對 AMD Instinct 系列 GPU 的支援,並原生整合 vLLM 與 SGLang 推論框架。開發人員可藉此調校 HIP、Triton 及 FlyDSL 程式碼,系統亦會輸出具體建議與預期效能分析報告。使用者能選擇以獨立流程執行 Hyperloom,或透過 AMD Skills 架構呼叫其代理最佳化能力。

在開發環境整合方面,AMD Skills 將經過驗證的工程最佳實踐匯入 Claude Code、Cursor 及 Codex 等 AI 輔助開發工具中。該目錄劃分為三大核心領域:

  1. 客戶端原生工作流程:針對本機端 AI 模型與應用整合。
  2. 跨堆疊工作流程:涵蓋系統診斷、資料路由、回放分析與全域效能最佳化。
  3. 伺服器原生工作流程:專為 AMD Instinct GPU 與 AMD EPYC 伺服器處理器量身打造,涵蓋微服務部署與效能遙測評估。

ROCm CLI 技術預覽:簡化環境管理與即時遙測

為了解決過去跨平台環境部署的複雜度,AMD 推出技術預覽階段的 ROCm CLI。該工具提供適用於 Windows 與 Linux 的預先編譯二進位檔案,開發者無需預先安裝完整 ROCm 堆疊即可獨立運作。

ROCm CLI 支援多版本 Runtime 並存、啟動切換與回復(Rollback)機制,並整合模型推論服務配置。目前介面已納入客戶端系統的 Lemonade 轉接器,以及 Instinct GPU 上的 vLLM 自動部署流程。

此外,CLI 內建名為 ROCm Console(前身為 dash)的即時監控介面,可追蹤 GPU 核心負載、高頻寬記憶體(HBM)使用量、系統功耗,以及「每瓦每秒 Token 數」(Tokens per second per Watt)等關鍵能耗指標。此工具相容於 ROCm 7.13 以上版本,並將於 ROCm 10 生態系中提供正式支援。

模組化架構與生態系拓展

除了代理工具外,AMD ROCm 10 奠基於模組化設計的 ROCm Core SDK,重新調整了核心編譯器、運算函式庫、分散式框架與主流機器學習框架的整合機制。此舉反映出 AMD 加速追趕 AI 運算市場需求,並透過自動化代理軟體降低開發者移轉至其硬體平台的門檻。

Reference Link : techbang.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles