每次你問 AI 問題時,表面下方都會發生一些很棒的事情。模型不只是「思考」,它還記得。它會追蹤對話中的每個字、每個關係、每個細微差別。那種記憶是一項投資。其以 GB 為單位,以毫秒為單位消耗,而且正悄悄成為當今 AI 基礎設施中最有價值的單一資產。這稱為 KV 快取,而且不僅不斷成長。它是複合的。
什麼是詞元,為什麼您應該關心其「紅利」?
詞元是系統用來表示、處理或驗證資訊的最小資料單位,視應用程式而定。將詞元視為 AI 的貨幣。您輸入的每個字詞、音節或標點符號都會轉換成詞元,這是大型語言模型(LLM)的基本意義單位。當模型產生回應時,它不只是查看您最新的訊息。它會查看所有內容,包括整個對話歷史,並使用所謂的注意力機制(即模型的工作記憶體)來計算每個詞元之間的關係。
「KV 快取是 AI 產生的每個詞元的記憶體紅利,這種投資會不斷累積,最終形成上下文、連貫性和連續性。」
為了避免這些關係從頭開始與產生的每個新字重新計算,模型將中間數學表示、鍵(K)和值(V)向量儲存在所謂的 KV 快取中。用來管理其大小的公式是不寬容的:
圖層 × 磁頭 × 頭_維度 × 序列_長度 × 每個元素的位元組
以下是詞元經濟學的現實檢驗:快取無法平滑擴充。在 Llama-3.3-70B 這樣的 70B 等級模型上,單一 100K 個詞元的請求就已經需要數十 GB 的 KV 快取。擴展至 Llama 405B 等尖端級模型,單個 100 萬個詞元的上下文在一個系統上,對於一個用戶而言,就已經需要超過 2 TB 的 HBM 和 DRAM 組合。現在乘以數十個並行用戶。單一中等規模的部署就需要數十 TB 的 KV 快取。這就是每個伺服器的現實。從整個艦隊來看,情況要大得多,而且成長速度很快。
而且問題也進一步惡化:推理模型(目前最強大的 AI 助理所使用的模型)內部產生的詞元數量是返回給使用者的詞元數量的 3 到 10 倍。每個詞元都必須快取,大幅增加每個要求的記憶體空間。
目前 GPU 平台上的 HBM 每個節點最多 288 GB,仍無法保留所有 KV 快取以進行並行長內容工作階段。總得有所改變。
不容忽視的宏觀變革
在我們探討解決方案之前,有必要先了解即將到來的巨浪的規模之大。現今的 AI 運算大致分為 AI 訓練和 AI 推理兩部分。在未來幾年內,推理將成為主要的工作負載量,佔所有 AI 運算的三分之二。[1]到 2030 年,預計推理將佔所有 AI 運算需求的 70% 至 90%。
推論是 AI 業務。記憶體和儲存屬於推斷經濟學範疇。
從單一伺服器的視角放大到整個產業,發展軌跡就變得清晰可見。2023 年至 2025 年間,領先模型上下文視窗每年增長約 30 倍,從 12.8 萬個詞元增長到 100 萬個詞元,並且還在繼續增長。[2]如今,只有一小部分部署使用長上下文視窗。隨著多重文件推理、大型軟體儲存庫、代理工作流程和多模態應用程式的推動,此比例不斷增長,全球推理叢集的 KV 快取總需求也同步加速成長。我們不是在談論記憶體容量的逐步壓力。我們正討論的是整個 AI 產業記憶體和儲存裝置需求的重大變革。
演算法的改進持續減少每個詞元的 KV 快取。但關鍵在於:每提高效率,就會立即重新投入更長的上下文、更多的並行用戶和更複雜的智慧體工作負載量。光是 AI 智慧體,就需要比標準推論多 10–40 倍的記憶體容量。對記憶體和儲存裝置的需求並未減少。它正在加速。
金字塔式收益複利
該解決方案並非單一記憶體技術。這是一個五層層次結構,一個金字塔讓 KV 快取資料隨著時間推移向下流動,每一層都是專門為推理生命週期中的特定時刻而建構的。每個區段列出了適用的記憶體或儲存產品、KV 快取儲存大小、資料頻寬以及 KV 快取通常駐留以供召回的時間。
記憶體和儲存裝置層
| 每個 GPU 的 KV 快取儲存 | 每個 GPU 的頻寬 | 目的(資料居住地) | 記憶體類別 | 記憶體解決方案 |
|---|---|---|---|---|
| 10–100 GB | 1–20 TB/s | 有效詞元產生(毫秒至秒) | 近記憶體 | Micron HBM4 和 HBM3E、Micron GDDR7——最靠近 GPU 和其他加速器的記憶體需要極高的頻寬才能支援 LLM 訓練和推理。 |
| 200–400 GB | 100–500 GB/s | 長內容查詢(秒到分鐘) | 主記憶體 | 美光高容量 DDR5 RDIMM 和美光 SOCAMM2:主要記憶體需要在容量和頻寬之間取得平衡,以便為 CPU 和 GPU 提供資料 |
| 100s GB 到 TB | 100–200 GB/s | 查詢排程、內容切換(從分鐘到小時) | 擴張記憶體 | 美光高容量 DDR5 RDIMM 的分離式記憶體陣列-網路附加內存,可提供彈性池化容量,以在保持效能相當的前提下擴展主記憶體容量。 |
| 10 秒至 100 秒的 TB | 20–200 GB/s | 快節奏多轉工作流程(小時到天) | 內容記憶體儲存 | Micron 9650 SSD、Micron 7600 SSD — 推論系統可以避免在長時脈多轉工作流程中重新運算 |
| PB | <10 GB/s | RAG 與儲存(天至年) | 網路化資料湖 | Micron 6600 ION SSD——網路檔案或物件儲存上的資料湖可以儲存大量數據,並提供服務多個 AI 伺服器所需的效能 |
| 註:隨著時間推移,KV 快取會被逐級向下驅逐 | ||||
表:推論中的 KV 快取記憶體和儲存分層
1 級:近記憶體(HBM),交易區
美光 HBM4、HBM3E、GDDR7 | 每個 GPU 10–100 GB 的 KV 資料 | 1–20 TB/s | 毫秒到秒
高頻寬記憶體位於頂端,其為 AI 領域速度最快、價格最昂貴的資源。這是主動生成詞元的地方:即時注意力計算和即時推理。HBM 的頻寬高達 20 TB/s,是詞元經濟的交易平台。每微秒計數,且每個位元組必須立即存取。
但這有限且昂貴。模型權重本身就佔據了 HBM 的很大一部分空間,剩下的空間就只能由 KV 快取來競爭了。隨著模型的擴大和背景視窗的擴大,HBM 壓力會增強。當需求超過容量時,KV 快取必須向下流動,或推斷停止。
第 2 級:主要記憶體(DDR5 / LPDDR),營運資金
美光高容量 DDR5、SOCAMM2 LPDDR | 200–400 GB KV | 100–500 GB/s | 秒至分鐘
當長上下文查詢超出 GPU 的直接處理範圍時,KV 快取會流入主記憶體。將此視為營運資金:高度流動且比 HBM 大得多,但仍受頻寬限制所約束。美光的高容量 DDR5 RDIMM 和 LPDDR SOCAMM2 模組在容量和頻寬之間取得平衡,能夠流暢地為 CPU 以及 GPU 提供資料。
長上下文查詢(用於複雜的文件分析、法律審查或多輪研究會議)在活動處理期間都位於此處。隨著部署規模向 100 萬個以上的詞元上下文邁進,這一層級正面臨越來越大的壓力。
第 3 級:擴張記憶體(分散式DDR5),信用額度
分解式美光高容量 DDR5 RDIMM | 100 GB 至 TB 的 KV | 每秒 100–200 GB | 分鐘至小時
擴張記憶體是詞元經濟的彈性信貸額度,其由網路連接的分散式記憶體池組成,當查詢調度和上下文切換需要的記憶體超過單一伺服器 DRAM 所能提供的記憶體時,這些記憶體池可以吸收溢出。此層在多個使用者共用基礎架構和工作負載量動態變化的多租用戶環境中至關重要。隨著上下文長度和並發性的增加,此層成為了單一伺服器能夠容納的內容與 AI 服務實際需要交付的內容之間的橋樑。
第 4 級:上下文記憶體儲存(NVMe SSD),長期帳戶
Micron 9650 SSD、Micron 7600 SSD | KV 的 10s–100s TB | 每秒 20–200 GB | 小時至數天
隨著 AI 從單轉聊天機器人發展為多步驟智慧體工作流程,KV 快取會從瞬時結構轉變為持久性儲存問題。管理複雜企業任務的 AI 智慧體無法承受每次採取新行動步驟時重新計算其整個推理歷史的代價。這種重新計算速度緩慢、昂貴,而且經濟上無法大規模持續。
美光的資料中心工作負載量工程(DCWE)團隊在數百個測試配置中驗證了基於 NVMe SSD 的 KV 快取卸載,且零輸送量損失。智慧體工作負載量比標準推論需要多出 10–40 倍的容量,而橫跨數小時至數天的多轉工作流程,使得此層級的角色任務至關重要。隨著 AI 智慧體成為主流,情境記憶體儲存裝置已設定為整個階層中容量成長最快的部分。
第 5 級:網路化資料湖,資料寶庫
美光 6600 ION SSD | 千兆位元 KV | <10 GB/s | 數天到數年
金字塔底部是最寬、最深的一層,位於網路數據湖。這是詞元經濟的寶庫,檢索增強生成(RAG)、長期智慧體記憶體和企業知識庫的 KV 快取可以在此處存放數天、數週甚至更長時間。美光 6600 ION SSD 專為同時從網路檔案或物件型儲存為多個 AI 伺服器提供服務而設計,可提供 PB 級 AI 記憶體所需的密度和耐用性。隨著 RAG 架構的擴散和企業建立持續的 AI 知識商店,這一層的容量需求將是其中最驚人的。
核心要點
KV 快取記憶體是 AI 產生的每個詞元的記憶體紅利,將投資融入脈絡、連貫性和連續性之中。紅利同時在各個方向增加:每個請求更多的詞元、更長的背景、更同時的使用者,以及更持久性的代理工作階段。
沒有任何單一記憶體技術可以單獨提供這項紅利。從頂端的 HBM 到底部的網路化資料湖,整個層次結構必須協同工作,每一層都發揮自己的作用,KV 快取複合價值隨著時間的推移在金字塔中流動。
隨著推理成為 AI 運算的主要形式,並且隨著 KV 快取成為推理的主要記憶體消耗者,那些優化整個記憶體和儲存層次結構的公司將決定誰能夠大規模、快速且可持續地為 AI 提供服務。
金字塔不只是一個架構。它是大規模 AI 的經濟基礎,以及每個效能提升、每個效率獲勝,以及每個總體擁有成本(TCO)優勢都來自正確實現此階層。金字塔的每個層級都是美光的產品。
參考資料
[1] Deloitte Insights,2025 年 11 月。「為什麼 AI 的下一個階段可能需要更多的運算能力,而不是更少。」
[2] Epoch AI,2025 年 6 月。「LLM 現在接受較長的輸入,最好的模型可以更有效地使用它們。」