FMS 2026 | 第 3 部分(共 4 部分)
記憶體與儲存裝置如何讓受限的基礎架構執行更多實用的 AI 工作負載
第 1 部分建構了代理式 AI 時代的記憶體牆。第 2 部分列出階層:用於推理的最佳化五層堆疊、用於執行的四層堆疊,以及類似記憶體和儲存技術在不同壓力下執行不同工作。現在,相同的放置邏輯必須延伸到 KV 快取之外,再延伸到其他基礎架構:我們如何讓資料中心內每個受限的資源產生更實用的 AI 工作負載? 這就是產品組合的重要性所在。逐層構建,映射到兩個堆疊,每個產品解決了不同的問題。它們共同提高整個系統的生產力利用率。
重點不是美光在每個類別都有產品。就是現在這些類別彼此相互依賴。代理式 AI 不會因為在已經受限的資料中心中加入多股運算而獲勝。將通過提高生產力利用率來贏得勝利:利用我們已經擁有的功率、空間和矽,獲得更多有用的工作。HBM 讓最熱門的背景持續移動。SOCAMM2 和 RDIMM 讓較大的工作集保持足夠接近至關重要。CXL 混合記憶體讓閒置容量恢復運作。SSD 會保留狀態。高密度資料湖儲存可保持長期上下文資訊可用。這不是零件的集合。這是代理式 AI 所需的架構。
飛躍過程從離 CPU 最近的點開始。
推論通常與頻寬有關。即使是最快的 XPU,也代表包含 GPU、TPU 和自訂 AI 矽在內的完整 AI 加速器,可以閒置等待資料,而且只新增運算並無法修正此問題。頻寬可以。這就是為什麼 HBM 對詞元經濟如此重要的原因:當活躍上下文是最熱且最接近加速器時,它可以保持解碼管道的正常運作。在記憶體密集型推理工作負載量中,更高的 HBM 頻寬可以帶來超過頻寬增加本身的詞元吞吐量提升。這樣做的好處在於,同樣的 XPU 可以變得更有效率。正因如此,我們正在大規模生產 36 GB、12 層 HBM4,每個堆疊可提供超過 2.8 TB/s 的頻寬,與上一代產品相比,能源效率提高了 20% 以上。後代更進一步。自訂 HBM 也可以將選定的邏輯移近記憶體堆疊,從而減輕 XPU 的壓力,並為成本、功耗或系統級優化創造更多空間。記憶體曾經放在 XPU 旁邊等待輪到被使用。越來越多的人會更直接地參與工作。這就是飛躍。
沒有人看到的門檻即將到來
多年來,業界將基礎架構視為運算優先對話:處理器的速度有多快? 這不再是正確的問題。真正的問題是系統是否將正確的資料保存在正確的位置。在 AI,幾乎有足夠的記憶體是您可以打造的最昂貴的配置。錯過閾值和效能不會正常拒絕。它會塌陷在溢出、驅逐和重新計算中。SOCAMM2 的存在在於解決以下問題:在與 XPU 相同的系統中,高容量層位於 HBM 下方。執行堆疊需要相同層級的相同容量,只需饋送不同的處理器即可。RDIMM 為 CPU 執行這項工作,就像 SOCAMM2 為 XPU 執行一樣。相同層級、相同想法、任一側都有不同的晶片。
將盒子安裝到智慧體
即使是慷慨的記憶體,一旦鎖定在一個伺服器內,也會有天花板。閒置的東西就會閒置,無論旁邊的伺服器多麼需要它。目標是不要縮小智慧體以符合系統。這是為了展開系統以符合智慧體。在需要時,動態地匯集整個機架的記憶體:主動式記憶體,而不是冷的溢位,針對工作負載量進行調整。基於 CXL 的混合記憶體建立在相同的前提上。在單一 4U 機箱中,機架規模系統可以暴露高達 40 TB 的 DDR5,並且為記憶體密集型 AI、HPC 和資料庫工作負載量在機架中擴充超過 160 TB。在美光和生態系統演示中,分離式記憶體已在每秒詞元數方面取得了巨大進步,同時降低了受限工作負載量的 XPU 資源消耗。這就是最純淨形式的高生產力利用率:不再是 XPU、更好的 XPU。執行堆疊出於同樣的原因使用相同的資源池,因此 CPU 記憶體需求也不必局限於單一容器內。
專為您尚未看到的工作負載量而打造
沒有什麼比 HBM 和主記憶體更勝於原始速度。然而,每個人擁有的資料都超過該處能容納的數量,而且這些資料必須在某個地方保存的時間比單一會話的時間更長。下一層負責處理該工作:持久、速度仍然快速,比需要的工作負載量提前佈建。
我們在大量生產前一年多的時間試用了我們的 Micron 9650、 PCIe® Gen6 SSD。這種先發優勢讓生態系統有時間做好準備,也有助於解釋為什麼這次的過渡速度比以往的世代更迭更快。該產品的推出時機是為了迎接下一波代理式 AI 平台的到來,而不是為了在這些平台出現之後進行追趕。對我們來說,領導力意味著儘早將產品交到客戶的手中,以便生態系統做好準備。最新的 XPU 平台需要能夠滿足資料移動需求的儲存裝置,而 PCIe Gen6 儲存裝置專為該角色而設計。
效率案例也一樣直接。以前需要八個 PCIe Gen5 硬碟才能達到目標讀取性能的系統,現在可能只需四個 Micron 9650 硬碟就能達到同樣的性能水平,因為 Micron 9650 的讀取性能是 Gen5 硬碟的兩倍,而且每瓦性能也顯著更高。這意味著更少的驅動器、更低的功耗、更小的空間,以及在相同容量下完成更多有用的工作。Micron 9650 也支援 E1.S 規格尺寸的液體冷卻,並提供 E1.S 和 E3.S 規格尺寸。專為 AI 資料中心的熱實而設計,同時仍支援需要以最新硬體更新現有基礎架構的氣冷環境。我們的 PCIe Gen5 SSD Micron 7600 為尚未需要 Gen6 的工作負載量提供了更完整的產品組合。
執行堆疊依賴相同的驅動器,但原因不同:允許代理暫停和恢復,並非重新開始。每次重新啟動都會浪費時間、運算和背景。持續的本機狀態將浪費的動作轉回具生產力的工作。
正在重建資料湖基礎
在層級結構的最底層是資料湖,代理式 AI 在其中儲存和調用所有資料,將冷資料轉化為洞察的頻率遠高於過去。推理堆疊是基於長期背景。執行堆疊以相同的基礎為基礎,為真實企業資料中的每個動作奠定基礎。將資料合併到更少、更密集的硬碟是正確的做法,因為這可以讓資料中心在相同的空間內進行更多工作。隨著容量密度增加和儲存頻寬需求增加,儲存架構也需要更強大的彈性,包括支援快速路徑容錯移轉的雙連接埠組態。硬碟無法隨著這個時代擴充:每 TB 的效能恰恰在工作負載量需要更多效能時下降。我們的 245 TB Micron 6600 ION 硬碟是當今的答案:全球容量最高的商用 SSD,每機架可支援超過 176 PB。我們正在為下一波的資料成長打造雲端儲存最佳化 SSD:每瓦頻寬更高、每機架容量更高,而且更小的實體空間也能進行更實用的 AI 工作。
牆一層一層地倒塌。
推理側的五個層級。執行側有四個。類似的記憶體和儲存技術在不同的壓力下執行不同的工作。這就是資料中心內部為每個層級建構架構的意義。打破記記憶體的重點在於將受限的基礎架構變成更實用的 AI 輸出:更多的詞元、更多的使用者、更多的狀態保留和更長期的可用背景,這一切都在顧客面臨的強大功能和空間現實中。牆下的基礎必須先建立,牆才能掉落。第 4 部分在我們的牆外上提出相同的問題,也就是 AI 在離開的地方執行。