FMS 2026 | 第 1 部分(共 4 部分)
AI 面臨的下一個限制因素不僅僅是算力
AI 面臨的下一個限制因素將不僅僅是算力。關鍵在於記憶體:即系統能容納多少上下文資訊、資料傳輸的速度,以及在代理程式持續運作的同時,系統能以多高的效率複用這些資訊。
多年來,業界一直將此稱為「記憶體牆」:即處理器運算速度與系統向其輸送資料的效率之間日益擴大的差距。這道「牆」早已在制約 AI 的效能表現。代理式 AI 提升了問題的嚴峻性,因為它將記憶體這一要素從元件層面的瓶頸,轉變為系統層面的設計限制。
傳統的推論模式圍繞著一種互動展開:使用者提出問題,模型產生回答,隨後工作階段便基本結束。代理程式的行為模式各不相同。它們能夠追蹤目標、保留更多上下文資訊、呼叫工具、與其他代理程式協作、查詢資料來源,並跨多個步驟持續執行工作。這種持續的活動將記憶體與儲存裝置推向了 AI 基礎設施的核心位置。
代理程式改變了基礎設施需要記憶的內容
這種轉變已體現在對領先 AI 系統的描述方式之中。Anthropic 運算部門負責人 James Bradbury 解釋稱,Claude 正從單純回答問題轉向實際執行工作,包括通讀程式碼庫、規劃後續步驟、呼叫工具以及適時調整方向。上述每一個步驟都會增加系統需要保留並重複使用的上下文資訊量。
這就是架構層面的轉變。隨著代理程式能力日益增強,基礎設施必須能夠支援持久、可重複使用且具備智慧分層特性的上下文資訊,而不僅僅是更快的運算能力。記憶體與儲存裝置必須向運算單元靠攏,且其層級架構的運作方式不應再像是一組彼此分離的層級,而應更像一個協同運作的統一系統。
從一次性 AI,到即時 AI,再到全時 AI
觀察這種變化的一個途徑是著眼於時間。訓練是一次性的:構建模型,完成執行,然後繼續進行下一步。推論變成了即時過程:使用者輸入提示詞,等待獲取答案。代理式 AI 則是持續進行的。代理程式能夠進行推理、呼叫 API、使用工具、查詢資料庫、與其他智慧體協作,並跨越多個步驟持續推進工作。
這一轉變正在迅速推進。Gartner 預測,到 2026 年底,將有多達 40% 的企業應用程式整合針對特定工作的 AI 代理程式,而這一比例在 2025 年尚不足 5%。關鍵點不僅僅在於有多少應用程式新增了代理程式。這就是那些代理程式對基礎設施所做的事情:它們將孤立的提示轉化為持久的工作。
兩個堆疊架構,一個記憶體難題
很容易將此問題歸結為 GPU 擴充性問題。但更有意義的視角是著眼於整個系統:代理式 AI 依賴於兩個受記憶體頻寬限制的堆疊架構協同運作。
GPU 堆疊負責推理與產生。它需要快速存取模型權重、活躍詞元和上下文。CPU 堆疊負責統籌協調工作:包括工具呼叫、資料庫查詢、代理程式協作、狀態管理以及圍繞模型展開的工作流程。代理式 AI 同時給雙方施加了持續的壓力。
如果推理部分停滯,模型就會等待。如果執行端停滯,代理程式就會等待。無論哪種情況,使用者體驗都會受損,利用率也會下降。正因如此,記憶體牆問題在代理式 AI 中出現了兩次:一次是在推理環節,另一次是在執行環節。
為什麼 KV 快取成為了關鍵驅動因素
KV 快取使得推理側的壓力變得具體可感。如圖 3 所示,對於單一工作階段,256,000 個詞元的上下文視窗可能需要大約 22 GB 的 KV 快取。單獨來看,這或許顯得尚可應對,但 AI 服務的設計初衷正是為了支援併發處理。它們同時服務於眾多使用者,以保持基礎設施的利用率。
在 64 個併發使用者的情況下,同樣的工作負載量可能會擴充至約 1.4 TB。當使用者達到 1,000 名時,資料量可達約 22 TB。對於包含 100 萬個詞元的上下文,單一工作階段可能需要約 88 GB 記憶體,而 1,000 個併發工作階段則需近 90 TB 記憶體。
正因如此,僅靠 GPU 記憶體無法承擔全部負載。對於那些最熱門、最活躍的詞元而言,HBM 至關重要。DRAM 能夠為更大的工作集提供容量。NAND 提供了持久性和可擴充性。設計挑戰在於如何讓這些層級協同運作,並將資料部署在能實現效能、容量與效率最佳組合的位置。
執行端面臨著自身的記憶體牆問題
執行環節構成了第二個壓力點。代理程式不僅僅進行推理,還會付諸行動。它們呼叫 API、搜尋文件、擷取資料、更新計畫,並跨工具協調工作。每個操作都會在 GPU 堆疊之外引發記憶體移動和儲存裝置存取。
這改變了 CPU 堆疊周圍的流量模式。傳統應用程式可能會圍繞使用者請求產生突發性的活動。代理式工作負載量能夠在多個步驟中持續開展活動,從而產生遠超傳統流程的工具呼叫、資料庫查詢及文件儲存存取操作。
因此,解決方案不能僅僅是增加 GPU 算力。CPU 端同樣需要足夠的頻寬、容量和儲存效能,以確保代理程式持續執行,同時維持推理堆疊的資料供應。推理與執行能力必須同步擴充。
打破這堵牆需要協調一致的層級結構。
記憶體牆是由物理定律造成的。代理式 AI 正同時從推理和執行兩個方向對其施加壓力。實現突破,絕非僅僅靠單純增加各項要素的數量就能做到。這將源於在恰當的時間、針對恰當的工作,將恰當的記憶體置於恰當的位置。
這就需要在 HBM、DRAM、NAND 以及代理程式所依賴的資料基礎設施之間,建立一種協調一致的層級結構。記憶體與儲存已不能再被視為背景中的基礎設施元件。它們是 AI 系統的策略性設計要點。
在第 2 部分中,我將探討該架構需要演進的方向,並闡述為何未來的發展路徑在於構建一個協同的記憶體層級結構──即讓 HBM、DRAM 和 NAND 協同運作,從而確保代理程式能夠高效地進行推理、行動與擴充。