儲存裝置

記憶體牆,第 3 部分:為代理式 AI 打造每個層級

Jeremy Werner

抽象的資料串流和人工智慧 (AI) 技術的數位視覺化

FMS 2026 | 第 3 部分(共 4 部分)

記憶體與儲存裝置如何讓受限的基礎架構執行更多實用的 AI 工作負載


第 1 部分建構了代理式 AI 時代的記憶體牆。第 2 部分列出階層:用於推理的最佳化五層堆疊、用於執行的四層堆疊,以及類似記憶體和儲存技術在不同壓力下執行不同工作。現在,相同的放置邏輯必須延伸到 KV 快取之外,再延伸到其他基礎架構:我們如何讓資料中心內每個受限的資源產生更實用的 AI 工作負載? 這就是產品組合的重要性所在。逐層構建,映射到兩個堆疊,每個產品解決了不同的問題。它們共同提高整個系統的生產力利用率。

重點不是美光在每個類別都有產品。就是現在這些類別彼此相互依賴。代理式 AI 不會因為在已經受限的資料中心中加入多股運算而獲勝。將通過提高生產力利用率來贏得勝利:利用我們已經擁有的功率、空間和矽,獲得更多有用的工作。HBM 讓最熱門的背景持續移動。SOCAMM2 和 RDIMM 讓較大的工作集保持足夠接近至關重要。CXL 混合記憶體讓閒置容量恢復運作。SSD 會保留狀態。高密度資料湖儲存可保持長期上下文資訊可用。這不是零件的集合。這是代理式 AI 所需的架構。

美光 36GB 12 位元 HBM4 記憶體產品

36GB 12 層高階 HBM4 提供業界領先的能源效率。

按一下圖像以展開

飛躍過程從離 CPU 最近的點開始。

推論通常與頻寬有關。即使是最快的 XPU,也代表包含 GPU、TPU 和自訂 AI 矽在內的完整 AI 加速器,可以閒置等待資料,而且只新增運算並無法修正此問題。頻寬可以。這就是為什麼 HBM 對詞元經濟如此重要的原因:當活躍上下文是最熱且最接近加速器時,它可以保持解碼管道的正常運作。在記憶體密集型推理工作負載量中,更高的 HBM 頻寬可以帶來超過頻寬增加本身的詞元吞吐量提升。這樣做的好處在於,同樣的 XPU 可以變得更有效率。正因如此,我們正在大規模生產 36 GB、12 層 HBM4,每個堆疊可提供超過 2.8 TB/s 的頻寬,與上一代產品相比,能源效率提高了 20% 以上。後代更進一步。自訂 HBM 也可以將選定的邏輯移近記憶體堆疊,從而減輕 XPU 的壓力,並為成本、功耗或系統級優化創造更多空間。記憶體曾經放在 XPU 旁邊等待輪到被使用。越來越多的人會更直接地參與工作。這就是飛躍。

美光 512GB RDIMM 和 256GB SOCAMM2 記憶體模組

512GB RDIMM 和 256GB SOCAMM2 提供領先業界的容量。

按一下圖像以展開

沒有人看到的門檻即將到來

多年來,業界將基礎架構視為運算優先對話:處理器的速度有多快? 這不再是正確的問題。真正的問題是系統是否將正確的資料保存在正確的位置。在 AI,幾乎有足夠的記憶體是您可以打造的最昂貴的配置。錯過閾值和效能不會正常拒絕。它會塌陷在溢出、驅逐和重新計算中。SOCAMM2 的存在在於解決以下問題:在與 XPU 相同的系統中,高容量層位於 HBM 下方。執行堆疊需要相同層級的相同容量,只需饋送不同的處理器即可。RDIMM 為 CPU 執行這項工作,就像 SOCAMM2 為 XPU 執行一樣。相同層級、相同想法、任一側都有不同的晶片。

4U 機架規模系統提供 440TB DDR5 記憶體

4U 系統中的 440TB DDR5 記憶體容量。

按一下圖像以展開

將盒子安裝到智慧體

即使是慷慨的記憶體,一旦鎖定在一個伺服器內,也會有天花板。閒置的東西就會閒置,無論旁邊的伺服器多麼需要它。目標是不要縮小智慧體以符合系統。這是為了展開系統以符合智慧體。在需要時,動態地匯集整個機架的記憶體:主動式記憶體,而不是冷的溢位,針對工作負載量進行調整。基於 CXL 的混合記憶體建立在相同的前提上。在單一 4U 機箱中,機架規模系統可以暴露高達 40 TB 的 DDR5,並且為記憶體密集型 AI、HPC 和資料庫工作負載量在機架中擴充超過 160 TB。在美光和生態系統演示中,分離式記憶體已在每秒詞元數方面取得了巨大進步,同時降低了受限工作負載量的 XPU 資源消耗。這就是最純淨形式的高生產力利用率:不再是 XPU、更好的 XPU。執行堆疊出於同樣的原因使用相同的資源池,因此 CPU 記憶體需求也不必局限於單一容器內。

Micron 9650 PCIe Gen6 和 Micron 7600 PCIe Gen5 資料中心 SSD

具備液體冷卻功能的 Micron 9650 PCIe Gen6 和 Micron 7600 PCIe Gen5 SSD。

按一下圖像以展開

專為您尚未看到的工作負載量而打造

沒有什麼比 HBM 和主記憶體更勝於原始速度。然而,每個人擁有的資料都超過該處能容納的數量,而且這些資料必須在某個地方保存的時間比單一會話的時間更長。下一層負責處理該工作:持久、速度仍然快速,比需要的工作負載量提前佈建。

我們在大量生產前一年多的時間試用了我們的 Micron 9650、 PCIe® Gen6 SSD。這種先發優勢讓生​​態系統有時間做好準備,也有助於解釋為什麼這次的過渡速度比以往的世代更迭更快。該產品的推出時機是為了迎接下一波代理式 AI 平台的到來,而不是為了在這些平台出現之後進行追趕。對我們來說,領導力意味著儘早將產品交到客戶的手中,以便生態系統做好準備。最新的 XPU 平台需要能夠滿足資料移動需求的儲存裝置,而 PCIe Gen6 儲存裝置專為該角色而設計。

效率案例也一樣直接。以前需要八個 PCIe Gen5 硬碟才能達到目標讀取性能的系統,現在可能只需四個 Micron 9650 硬碟就能達到同樣的性能水平,因為 Micron 9650 的讀取性能是 Gen5 硬碟的兩倍,而且每瓦性能也顯著更高。這意味著更少的驅動器、更低的功耗、更小的空間,以及在相同容量下完成更多有用的工作。Micron 9650 也支援 E1.S 規格尺寸的液體冷卻,並提供 E1.S 和 E3.S 規格尺寸。專為 AI 資料中心的熱實而設計,同時仍支援需要以最新硬體更新現有基礎架構的氣冷環境。我們的 PCIe Gen5 SSD Micron 7600 為尚未需要 Gen6 的工作負載量提供了更完整的產品組合。

執行堆疊依賴相同的驅動器,但原因不同:允許代理暫停和恢復,並非重新開始。每次重新啟動都會浪費時間、運算和背景。持續的本機狀態將浪費的動作轉回具生產力的工作。

美光 6600 ION 245TB 高容量 SSD

245TB 的美光 6600 ION SSD 提供密集的儲存空間。

按一下圖像以展開

正在重建資料湖基礎

在層級結構的最底層是資料湖,代理式 AI 在其中儲存和調用所有資料,將冷資料轉化為洞察的頻率遠高於過去。推理堆疊是基於長期背景。執行堆疊以相同的基礎為基礎,為真實企業資料中的每個動作奠定基礎。將資料合併到更少、更密集的硬碟是正確的做法,因為這可以讓資料中心在相同的空間內進行更多工作。隨著容量密度增加和儲存頻寬需求增加,儲存架構也需要更強大的彈性,包括支援快速路徑容錯移轉的雙連接埠組態。硬碟無法隨著這個時代擴充:每 TB 的效能恰恰在工作負載量需要更多效能時下降。我們的 245 TB Micron 6600 ION 硬碟是當今的答案:全球容量最高的商用 SSD,每機架可支援超過 176 PB。我們正在為下一波的資料成長打造雲端儲存最佳化 SSD:每瓦頻寬更高、每機架容量更高,而且更小的實體空間也能進行更實用的 AI 工作。

牆一層一層地倒塌。

推理側的五個層級。執行側有四個。類似的記憶體和儲存技術在不同的壓力下執行不同的工作。這就是資料中心內部為每個層級建構架構的意義。打破記記憶體的重點在於將受限的基礎架構變成更實用的 AI 輸出:更多的詞元、更多的使用者、更多的狀態保留和更長期的可用背景,這一切都在顧客面臨的強大功能和空間現實中。牆下的基礎必須先建立,牆才能掉落。第 4 部分在我們的牆外上提出相同的問題,也就是 AI 在離開的地方執行。

核心資料中心業務部門資深副總裁暨總經理

Jeremy Werner

Jeremy Werner 是美光核心資料中心業務部門(CDBU)的資深副總裁暨總經理,該部門專注於 OEM 資料中心客戶的記憶體解決方案,以及所有資料中心客戶的儲存裝置解決方案。 Jeremy 是一位經驗豐富的儲存裝置技術高階主管,擁有超過 25 年的產業經驗,領導美光超大規模、雲端和企業市場資料中心記憶體和儲存裝置系列產品策略和執行。 在加入美光之前,他曾在 KIOXIA America 擔任 SSD 企業總經理,並在 SandForce、MetaRAM 和 Tidal Systems 等新創公司擔任過十年的銷售和行銷領導階層職務。 Jeremy 擁有 B.S.E.E. 來自康乃爾大學,是史丹佛商學院校友,是 25 項以上已發行或待決專利的發明家。

相關部落格