大型語言模型(Large Language Model,LLM)近年在模型規模、上下文區間與內容生成能力上持續擴張,能處理數百甚至上千頁資料,並生成數萬至數十萬字的回應。然而,模型能力提升也帶來更高的硬體成本,尤其是記憶體容量需求,已逐漸成為限制LLM訓練與推論效能的主要瓶頸。
當GPU記憶體無法容納模型參數、訓練狀態或推論所需的KV快取時,系統必須從較慢的外部儲存裝置載入資料,或重新計算未能保留的中間結果。這不僅會降低LLM反應速度,也可能造成GPU閒置,增加運算與維運成本。
訓練與推論的記憶體需求不同
LLM在訓練與推論階段,所需的記憶體組成並不相同。訓練階段主要包括模型權重(Weights)、梯度(Gradients)、啟動反應表徵(Activations)與優化器狀態(Optimizer States);推論階段則主要涉及模型權重與KV快取。
模型參數數量與計算精度,是影響記憶體占用的基本因素。參數越多、精度越高,模型權重、梯度與優化器狀態所需的空間也會按比例增加。
在訓練過程中,Activations是重要的記憶體消耗來源,其需求與自注意力機制及輸入內容長度有關。內容長度增加時,部分自注意力運算的記憶體需求可能呈平方成長;例如,訓練32K長度內容所需的記憶體容量,可能是4K長度內容的64倍。
在推論階段,KV快取則會隨輸入與輸出Token數量增加而擴大。上下文區間越長,模型可保存的內容越多,但同時也需要更多記憶體資源。
模型參數與上下文區間快速擴大
以OpenAI的GPT系列為例,2018年GPT-1約有1.17億個參數,2019年GPT-2增加至15億個,2020年GPT-3再提升至1,750億個。GPT-3.5維持相近的參數規模,而GPT-4之後的數字則主要來自外界估計,並非OpenAI官方公布資料。
外界估計GPT-4約含1.76兆個參數,2025年推出的GPT-4.5則可能介於4兆至5兆個參數。若從GPT-1到GPT-4.5計算,模型參數量在約8年間增加超過3萬倍;若只比較GPT-3與GPT-4.5,仍增加約20至30倍。
上下文區間同樣快速成長:
- GPT-1:512個Token
- GPT-2:1,024個Token
- GPT-3:2,048個Token
- GPT-3.5:4,096個Token
- GPT-4:32,768個Token
- GPT-4 Turbo、GPT-4o與GPT-4.5:128,000個Token
- GPT-4.1:100萬個Token
GPT-4.1的上下文區間相較GPT-1增加近2,000倍,從GPT-3計算也增加近500倍。這種成長會直接推高訓練Activations與推論KV快取的記憶體需求。
Meta的開源Llama系列也呈現類似趨勢。最初的Llama約有652億個參數,Llama 2與Llama 3維持在700億個左右,Llama 3.1的最大版本增加至4,050億個參數。2025年推出的Llama 4中,Maverick版本約有4,000億個參數,Behemoth版本則據稱有2兆個參數,但後者尚未正式推出。
Llama的上下文區間則從最初的2,048個Token,依序擴大至Llama 2的4,096個、Llama 3的8,192個,以及Llama 3.1的128,000個。Llama 4的Maverick版本支援100萬個Token,Scout版本更達到1,000萬個Token,分別較初代Llama增加近500倍與5,000倍。
MOE可降低運算量,卻無法等比例降低記憶體需求
為了在擴大模型規模的同時控制運算量,部分新一代LLM採用混合專家模型(Mixture of Experts,MOE)架構。MOE由多個專家單元組成,每個Token只啟用部分專家與活躍參數,因此能降低單次運算所需的計算量。
來源資料指出,GPT-4據稱採用8個220B或16個110B專家單元,總參數量約1.76兆個,但一次運算可能只啟用約2,800億個活躍參數。Llama 4也採用MOE架構,依版本不同配置16個或128個專家單元,總參數量從1,090億至4,000億個,實際活躍參數則低於總參數量。
不過,MOE的運算效率優勢並不代表記憶體占用會同步下降。由於路由器會根據每個Token選擇專家,系統難以預先確定下一步需要哪些參數。為避免運作期間頻繁從外部儲存裝置載入資料,通常仍需將所有專家單元的參數載入記憶體。因此,MOE主要改善運算量與成本,對總記憶體容量的節省有限。
GPU HBM容量成長,仍落後LLM需求
供給端方面,資料中心級GPU的HBM容量過去多年確實持續增加,但增幅仍遠低於LLM記憶體需求。
| GPU產品 | 推出時間 | 最大記憶體容量 |
|---|---|---|
| Nvidia V100 | 2017年 | 32GB HBM2 |
| Nvidia A100 | 2020年 | 80GB HBM2e |
| Nvidia H100 | 2022年 | 80GB HBM2e,後續版本達94GB HBM3 |
| Nvidia H200 | 2023年 | 141GB HBM3e |
| Nvidia B200 | 2024年 | 192GB HBM3e |
| Nvidia B300 | 2025年 | 288GB HBM3e |
| AMD MI100 | 2020年 | 32GB HBM2 |
| AMD MI200系列 | 2021年 | 128GB HBM2e |
| AMD MI300系列 | 2023年 | 192GB HBM3 |
| AMD MI325X | 2024年 | 256GB HBM3e |
| AMD MI350 | 2025年 | 288GB HBM3e |
以Nvidia HGX系列來看,V100至B300的GPU記憶體容量在約8年間增加9倍;AMD Instinct系列則從MI100至MI350,在約5年間增加9倍。相較之下,LLM參數量在近年增加數十倍,部分上下文區間更增加數百至數千倍,供需落差因而持續擴大。
即使是小型模型,也可能需要TB級記憶體
以80億參數的8B模型為例,在FP16精度下,僅載入模型參數便約需16GB記憶體。若再加入梯度、Activations與自注意力相關資料,訓練所需的總記憶體可能擴大至數百GB,甚至TB等級。
對於更大型的模型,需求更為可觀。175B規模的GPT-3在FP16精度下,僅模型參數便約需350GB;405B規模的Llama 3.1則約需800GB。若計入訓練過程中的其他狀態,整體記憶體需求將達到數TB。
推論作業除了載入模型參數,還必須保存KV快取。當上下文區間達到128K個Token以上,或同時處理大量批次資料時,KV快取可能占用數百GB,甚至高於模型參數本身數倍。
「節流」技術可降低消耗,但存在取捨
面對記憶體瓶頸,第一類方法是降低LLM本身的記憶體消耗。訓練階段可使用Activation重新計算,放棄保存部分中間狀態,待需要時重新計算,以運算時間換取記憶體空間。
針對推論階段的KV快取,常見方法包括量化、稀疏化與滑動窗口。量化是將高精度資料轉換為較低精度格式;稀疏化則只保存部分KV快取值;滑動窗口可讓輸入內容持續增加,同時限制快取不超出GPU記憶體容量。
自注意力機制也有多種優化方向,包括共用KV快取的多查詢注意力(MQA)、分組查詢注意力(GQA)、可在非連續記憶體空間保存資料的PagedAttention,以及只保存潛在向量以壓縮KV快取的多頭潛在注意力(MLA)。
這些技術可在不同環節降低數十個百分比至數倍的記憶體消耗,但通常伴隨精度、運算時間或模型能力方面的折衷,並非適用於所有訓練與推論情境。隨著LLM持續擴大規模,並加入文字、圖像與語音等多模態資料,節省記憶體的效果也可能被新增需求抵銷。
從GPU外部擴展記憶體資源
第二類方法是增加可用記憶體,也就是將記憶體資源與GPU本身適度脫鉤。現行AI伺服器通常透過多GPU叢集整合HBM容量,主流配置為8路GPU,並使用NVLink或Infinity Fabric等高速互連技術。單一8路GPU伺服器可提供約1至2TB的HBM記憶體,但若要容納大模型訓練所需的完整狀態,仍可能需要更多伺服器。
增加GPU數量雖能同時獲得更多運算力與記憶體,卻不一定符合實際需求。若系統瓶頸只是記憶體容量,而非運算能力,採購整組昂貴GPU將造成資源浪費。
因此,部分解決方案改以CPU DRAM或透過網路連接的NVMe快閃儲存裝置,提供GPU以外的記憶體空間。這類方案可獨立擴充容量,彈性較高,但傳輸頻寬通常低於直接整合在GPU上的HBM,必須在容量、成本與效能之間取得平衡。
高頻寬快閃記憶體成為另一條路線
另一項發展方向是高頻寬快閃記憶體(High Bandwidth Flash,HBF)。這類架構延續記憶體與GPU緊密整合的設計,但以儲存密度較高的NAND快閃記憶體取代部分基於DRAM的HBM,目標是在維持高傳輸頻寬的同時,提供高出HBM數倍、甚至十多倍的容量。
HBF的優勢在於能直接對應GPU的高頻寬需求,並以更高密度擴充記憶體空間;限制則是它仍與GPU整合,無法像外部記憶體裝置一樣獨立、彈性地擴展。外部記憶體擴充與HBF因此代表兩種不同取向:前者偏重容量彈性與成本,後者則更重視傳輸頻寬與GPU整合效能。
記憶體架構將成為LLM系統設計重點
LLM的參數量與上下文區間成長速度,已明顯超過單一GPU HBM容量的提升幅度。單靠模型量化、KV快取優化或重新計算等「節流」技術,難以完全抵銷需求增長;單純增加GPU數量,又可能帶來高昂成本與運算資源浪費。
未來LLM基礎架構將更重視多層次記憶體配置,透過GPU HBM、CPU DRAM、NVMe快閃儲存與新型高頻寬快閃記憶體的搭配,依照不同資料的存取頻率與延遲需求進行分層。這些方案能否在容量、頻寬、延遲、成本與模型精度之間取得平衡,將是支撐長上下文、多模態與大規模LLM持續發展的關鍵。




