LLM記憶體需求暴增,GPU容量追不上:多元記憶體架構成解方

大型語言模型(Large Language Model,LLM)近年在模型規模、上下文區間與內容生成能力上持續擴張,能處理數百甚至上千頁資料,並生成數萬至數十萬字的回應。然而,模型能力提升也帶來更高的硬體成本,尤其是記憶體容量需求,已逐漸成為限制LLM訓練與推論效能的主要瓶頸。

當GPU記憶體無法容納模型參數、訓練狀態或推論所需的KV快取時,系統必須從較慢的外部儲存裝置載入資料,或重新計算未能保留的中間結果。這不僅會降低LLM反應速度,也可能造成GPU閒置,增加運算與維運成本。

訓練與推論的記憶體需求不同

LLM在訓練與推論階段,所需的記憶體組成並不相同。訓練階段主要包括模型權重(Weights)、梯度(Gradients)、啟動反應表徵(Activations)與優化器狀態(Optimizer States);推論階段則主要涉及模型權重與KV快取。

模型參數數量與計算精度,是影響記憶體占用的基本因素。參數越多、精度越高,模型權重、梯度與優化器狀態所需的空間也會按比例增加。

在訓練過程中,Activations是重要的記憶體消耗來源,其需求與自注意力機制及輸入內容長度有關。內容長度增加時,部分自注意力運算的記憶體需求可能呈平方成長;例如,訓練32K長度內容所需的記憶體容量,可能是4K長度內容的64倍。

在推論階段,KV快取則會隨輸入與輸出Token數量增加而擴大。上下文區間越長,模型可保存的內容越多,但同時也需要更多記憶體資源。

模型參數與上下文區間快速擴大

以OpenAI的GPT系列為例,2018年GPT-1約有1.17億個參數,2019年GPT-2增加至15億個,2020年GPT-3再提升至1,750億個。GPT-3.5維持相近的參數規模,而GPT-4之後的數字則主要來自外界估計,並非OpenAI官方公布資料。

外界估計GPT-4約含1.76兆個參數,2025年推出的GPT-4.5則可能介於4兆至5兆個參數。若從GPT-1到GPT-4.5計算,模型參數量在約8年間增加超過3萬倍;若只比較GPT-3與GPT-4.5,仍增加約20至30倍。

上下文區間同樣快速成長:

  • GPT-1:512個Token
  • GPT-2:1,024個Token
  • GPT-3:2,048個Token
  • GPT-3.5:4,096個Token
  • GPT-4:32,768個Token
  • GPT-4 Turbo、GPT-4o與GPT-4.5:128,000個Token
  • GPT-4.1:100萬個Token

GPT-4.1的上下文區間相較GPT-1增加近2,000倍,從GPT-3計算也增加近500倍。這種成長會直接推高訓練Activations與推論KV快取的記憶體需求。

Meta的開源Llama系列也呈現類似趨勢。最初的Llama約有652億個參數,Llama 2與Llama 3維持在700億個左右,Llama 3.1的最大版本增加至4,050億個參數。2025年推出的Llama 4中,Maverick版本約有4,000億個參數,Behemoth版本則據稱有2兆個參數,但後者尚未正式推出。

Llama的上下文區間則從最初的2,048個Token,依序擴大至Llama 2的4,096個、Llama 3的8,192個,以及Llama 3.1的128,000個。Llama 4的Maverick版本支援100萬個Token,Scout版本更達到1,000萬個Token,分別較初代Llama增加近500倍與5,000倍。

MOE可降低運算量,卻無法等比例降低記憶體需求

為了在擴大模型規模的同時控制運算量,部分新一代LLM採用混合專家模型(Mixture of Experts,MOE)架構。MOE由多個專家單元組成,每個Token只啟用部分專家與活躍參數,因此能降低單次運算所需的計算量。

來源資料指出,GPT-4據稱採用8個220B或16個110B專家單元,總參數量約1.76兆個,但一次運算可能只啟用約2,800億個活躍參數。Llama 4也採用MOE架構,依版本不同配置16個或128個專家單元,總參數量從1,090億至4,000億個,實際活躍參數則低於總參數量。

不過,MOE的運算效率優勢並不代表記憶體占用會同步下降。由於路由器會根據每個Token選擇專家,系統難以預先確定下一步需要哪些參數。為避免運作期間頻繁從外部儲存裝置載入資料,通常仍需將所有專家單元的參數載入記憶體。因此,MOE主要改善運算量與成本,對總記憶體容量的節省有限。

GPU HBM容量成長,仍落後LLM需求

供給端方面,資料中心級GPU的HBM容量過去多年確實持續增加,但增幅仍遠低於LLM記憶體需求。

GPU產品 推出時間 最大記憶體容量
Nvidia V100 2017年 32GB HBM2
Nvidia A100 2020年 80GB HBM2e
Nvidia H100 2022年 80GB HBM2e,後續版本達94GB HBM3
Nvidia H200 2023年 141GB HBM3e
Nvidia B200 2024年 192GB HBM3e
Nvidia B300 2025年 288GB HBM3e
AMD MI100 2020年 32GB HBM2
AMD MI200系列 2021年 128GB HBM2e
AMD MI300系列 2023年 192GB HBM3
AMD MI325X 2024年 256GB HBM3e
AMD MI350 2025年 288GB HBM3e

以Nvidia HGX系列來看,V100至B300的GPU記憶體容量在約8年間增加9倍;AMD Instinct系列則從MI100至MI350,在約5年間增加9倍。相較之下,LLM參數量在近年增加數十倍,部分上下文區間更增加數百至數千倍,供需落差因而持續擴大。

即使是小型模型,也可能需要TB級記憶體

以80億參數的8B模型為例,在FP16精度下,僅載入模型參數便約需16GB記憶體。若再加入梯度、Activations與自注意力相關資料,訓練所需的總記憶體可能擴大至數百GB,甚至TB等級。

對於更大型的模型,需求更為可觀。175B規模的GPT-3在FP16精度下,僅模型參數便約需350GB;405B規模的Llama 3.1則約需800GB。若計入訓練過程中的其他狀態,整體記憶體需求將達到數TB。

推論作業除了載入模型參數,還必須保存KV快取。當上下文區間達到128K個Token以上,或同時處理大量批次資料時,KV快取可能占用數百GB,甚至高於模型參數本身數倍。

「節流」技術可降低消耗,但存在取捨

面對記憶體瓶頸,第一類方法是降低LLM本身的記憶體消耗。訓練階段可使用Activation重新計算,放棄保存部分中間狀態,待需要時重新計算,以運算時間換取記憶體空間。

針對推論階段的KV快取,常見方法包括量化、稀疏化與滑動窗口。量化是將高精度資料轉換為較低精度格式;稀疏化則只保存部分KV快取值;滑動窗口可讓輸入內容持續增加,同時限制快取不超出GPU記憶體容量。

自注意力機制也有多種優化方向,包括共用KV快取的多查詢注意力(MQA)、分組查詢注意力(GQA)、可在非連續記憶體空間保存資料的PagedAttention,以及只保存潛在向量以壓縮KV快取的多頭潛在注意力(MLA)。

這些技術可在不同環節降低數十個百分比至數倍的記憶體消耗,但通常伴隨精度、運算時間或模型能力方面的折衷,並非適用於所有訓練與推論情境。隨著LLM持續擴大規模,並加入文字、圖像與語音等多模態資料,節省記憶體的效果也可能被新增需求抵銷。

從GPU外部擴展記憶體資源

第二類方法是增加可用記憶體,也就是將記憶體資源與GPU本身適度脫鉤。現行AI伺服器通常透過多GPU叢集整合HBM容量,主流配置為8路GPU,並使用NVLink或Infinity Fabric等高速互連技術。單一8路GPU伺服器可提供約1至2TB的HBM記憶體,但若要容納大模型訓練所需的完整狀態,仍可能需要更多伺服器。

增加GPU數量雖能同時獲得更多運算力與記憶體,卻不一定符合實際需求。若系統瓶頸只是記憶體容量,而非運算能力,採購整組昂貴GPU將造成資源浪費。

因此,部分解決方案改以CPU DRAM或透過網路連接的NVMe快閃儲存裝置,提供GPU以外的記憶體空間。這類方案可獨立擴充容量,彈性較高,但傳輸頻寬通常低於直接整合在GPU上的HBM,必須在容量、成本與效能之間取得平衡。

高頻寬快閃記憶體成為另一條路線

另一項發展方向是高頻寬快閃記憶體(High Bandwidth Flash,HBF)。這類架構延續記憶體與GPU緊密整合的設計,但以儲存密度較高的NAND快閃記憶體取代部分基於DRAM的HBM,目標是在維持高傳輸頻寬的同時,提供高出HBM數倍、甚至十多倍的容量。

HBF的優勢在於能直接對應GPU的高頻寬需求,並以更高密度擴充記憶體空間;限制則是它仍與GPU整合,無法像外部記憶體裝置一樣獨立、彈性地擴展。外部記憶體擴充與HBF因此代表兩種不同取向:前者偏重容量彈性與成本,後者則更重視傳輸頻寬與GPU整合效能。

記憶體架構將成為LLM系統設計重點

LLM的參數量與上下文區間成長速度,已明顯超過單一GPU HBM容量的提升幅度。單靠模型量化、KV快取優化或重新計算等「節流」技術,難以完全抵銷需求增長;單純增加GPU數量,又可能帶來高昂成本與運算資源浪費。

未來LLM基礎架構將更重視多層次記憶體配置,透過GPU HBM、CPU DRAM、NVMe快閃儲存與新型高頻寬快閃記憶體的搭配,依照不同資料的存取頻率與延遲需求進行分層。這些方案能否在容量、頻寬、延遲、成本與模型精度之間取得平衡,將是支撐長上下文、多模態與大規模LLM持續發展的關鍵。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles