FMS 2026 | 第 2 部分(共 4 部分)
同一個大腦,兩個記憶體系統
我使用了第 1 部分解釋代理式 AI 如何在兩個運算堆疊上執行,而不是一個。GPU 的原因、產生和計畫。CPU 協調、行動和執行計畫。如果沒有為其功能設計的記憶體,兩者都無法正常工作。
我在那裡強調了問題的規模:在並發情況下,背景可以成長到數十 TB,而代理式工作流程可以將基礎設施流量推高到傳統基線的 100 倍。現在,讓我們來看看推理堆疊如何管理 KV 快取,然後再看看執行堆疊的要求。
KV 快取的最佳化層級結構
KV 快取不是一個位置。這是一個關鍵的推論物件,必須能夠為解碼管道的下一個迭代提供資料。如果保留,系統必須快速擷取,才能持續進行推論。如果丟棄了,系統就必須重新計算,這會耗費時間、能源和運算資源來重複它已經完成的工作。這使得 KV 快取放置成為系統級設計選擇:保留什麼、儲存的位置以及何時擷取比重新計算更有效率。某些系統可能僅使用兩個儲存層。此處所示的五層架構代表了最佳化的未來狀態,每一層都有不同的容量和擷取時間權衡。近記憶體或 HBM 擁有最接近 GPU 的最活躍 KV。主要記憶體可增加活動上下文的容量。分散的記憶體池提供節點以外的更大工作集。上下文記憶體儲存提供持久性,並且比重新計算能更快地調用資訊。網路 KV 湖泊將階層擴展到 exabyte 的長期背景。資料中心架構師將配置其 KV 快取層,以針對其獨特的工作負載和應用程式基礎進行最佳化,效率將來自於在正確的時間將 KV 快取放置在正確的層,並且優化協調檢索、驅逐和重新計算。
現在來看負責執行的一端
推理只完成了一半的工作。代理式 AI 需要行動,而這正是運動皮質發揮作用的地方。主記憶體支援操作執行:即時推理、產生和決定。分散式記憶體可用於擴展記憶體佔用空間,以確保 CPU 記憶體需求不會超出裝置容量,因為我們寧願擴展系統,也不願讓其被閒置。內容記憶體儲存可讓應用程式暫停和恢復,並持續儲存本機資料。聯網資料湖提供了大規模儲存所需的空間,用於從資料中心取得和儲存資料。智慧體在 CPU 上執行每個操作時都會用到所有四個層級。兩個堆疊上都出現類似的記憶體和儲存技術,但壓力來自不同的方向。推理端必須確保解碼管道的持續運作。執行端必須保留狀態並將決策轉化為行動。這兩種堆疊都推動了對更多更快記憶體和儲存的需求。
每個層級,兩個堆疊
這是打破記憶體障礙的架構:一個可擴展到五層的最佳化推理層次結構,以及一個四層執行堆疊。並非每個系統都會實施每個層級,最佳設計取決於工作負載量規模、延遲目標和擷取與重新計算的成本。有意識地在兩個堆疊中設計層級結構,壁壘就會被打破。在第 3 部分中,我將探討美光產品如何滿足兩個堆疊中整個層級結構的需求。