大型語言模型(LLM)近年持續提升處理長篇文本與複雜對話的能力,但更長的會話也帶來日益嚴重的記憶體壓力。模型在推理過程中用於保存既有Token的Key-Value cache(KV快取),其需求隨著上下文窗口擴大而快速增加,逐漸成為限制LLM效能與應用規模的關鍵瓶頸。
KV快取是LLM推理的短期記憶
LLM生成會話文本時,會先將內容拆解成個別Token,再根據已計算出的Token,逐步推算下一個Token。若每次推理都重新計算整個序列中的所有Token,將造成大量重複運算。
KV快取的作用,是將先前推理過程計算出的Token,以Key-Value形式保存於GPU記憶體中。後續推理可直接取用這些資料,避免反覆計算已處理的內容,因此能夠降低運算資源消耗,並縮短模型產生回應的延遲。
- 節省運算資源:模型可直接使用KV快取中的既有Token,減少重複計算。
- 降低回應延遲:取得先前Token資料後,模型可更快推算並產生下一個Token。
上下文窗口擴大,KV快取需求同步攀升
更大的KV快取容量,代表LLM能保存更多上下文Token,進而支援更長的會話內容,並有助於生成更完整、詳細的回覆。然而,GPU內建的高頻寬記憶體(HBM)容量有限,模型本身的參數與運算資料又會占用大量空間,留給KV快取的容量因此受到限制。
來源資料指出,Meta於2023年推出的Llama 1最多支援2,048個Token的上下文區間;至2025年推出的Llama 4,支援的上下文區間已達100萬個Token。上下文能力大幅提升的同時,模型需要保存的KV快取資料量也隨之增加。對目前的LLM而言,單次會話所需的KV快取記憶體可能達到數GB以上。
這形成一項明顯矛盾:LLM需要更大的上下文窗口以處理複雜任務,但GPU記憶體容量並未同步無限擴張。當KV快取空間不足時,部分既有Token會被移出快取;模型日後若再次需要這些資料,就必須重新計算會話序列中的前置Token,導致GPU耗用額外運算時間,也增加整體推理延遲。
外部KV快取成為新興基礎架構類別
目前一項主要解法,是將KV快取卸載至GPU以外、具備可擴展性的外部記憶體或儲存裝置,作為GPU HBM的補充,甚至在部分情境下扮演替代性記憶體空間。
透過外部裝置保存更多Token資料,GPU有限的內建記憶體便不再是KV快取容量的唯一限制。當模型需要處理更長上下文或更多並行會話時,外部資源也能提供額外的擴展空間。近幾個月來,市場上因此陸續出現多種外部KV快取技術與解決方案,逐漸形成AI推理基礎架構中的新興類別。
擴展KV快取可減少重複運算
在沒有足夠外部快取空間的情況下,當KV快取耗盡,部分Token被移除後,模型在後續需要相關內容時,必須重新計算先前的會話序列。這不僅會增加GPU負載,也可能讓長篇會話的推理流程出現明顯延遲。
若透過外部裝置擴展KV快取,便可保存更多甚至完整的Token資料,降低因快取淘汰而產生的重算需求。其預期效益包括節省GPU運算時間、提高長上下文處理效率,以及減少推理延遲。不過,實際效能仍取決於外部記憶體或儲存裝置的存取速度、網路連線與整體系統架構。

以NVMe SSD與高速網路建構外部快取
來源資料所示的WEKA增強型記憶體網格(Augmented Memory Grid,AMG),是一種外部KV快取架構範例。WEKA平台透過RDMA網路連接前端GPU伺服器,再將以NVMe SSD為基礎的儲存空間掛載至GPU伺服器,作為擴展的KV快取空間,以支援LLM推理工作。
另一項來源資料提及的案例為Pliops,其示意架構同樣聚焦於透過外部裝置保存KV快取,避免模型因快取空間不足而反覆計算既有Token。這類方案的核心並非單純增加儲存容量,而是要在容量、資料傳輸速度與推理延遲之間取得平衡。
容量擴展之外,系統設計仍是關鍵
外部KV快取能緩解GPU HBM容量不足的問題,但並不代表所有推理瓶頸都能直接消除。KV資料若需要經由網路或外部儲存裝置傳輸,資料存取路徑、RDMA網路效能及儲存媒體延遲,都可能影響最終結果。
因此,外部KV快取的價值,將取決於其是否能在擴大上下文容量的同時,維持足夠低的資料存取延遲。隨著LLM持續朝更長上下文、更複雜工作流程與更高並行度發展,如何有效管理KV快取,預料將成為AI推理平台設計的重要課題。




