DRAM

當記憶體改變了平衡:我們在資料中心應用 LPDDR 的心得體會

Khayam Anjam

霓虹燈資料中心伺服器走廊

隨著 AI 工作負載量日益主導資料中心的請求,通用伺服器與 AI 伺服器所面臨的關鍵制約因素也正在發生變化。決定機架能完成多少有效工作的,日益取決於功耗與散熱預算,而不僅僅是原始運算。這正是 LPDDR5X 與新型 SOCAMM2 模組化外形規格開始在資料中心領域展現顯著優勢的關鍵切入點。SOCAMM2 將低功耗 DRAM 的高能效與高密度特性融入專為伺服器設計的模組化、易維護模組之中,從而開啟了此前在實際應用中難以實現的系統架構新可能。

但在投影片上的好點子,並不等同於已被證實可行的點子。因此,我們著手回答一個更具挑戰性的問題:當將這種記憶體應用於實際的資料中心工作負載時,它會帶來怎樣的差異?

要令人信服地做到這一點,需要密切協作:美光的資料中心工作負載工程團隊與 Meta 的工程師緊密合作,使用了 Meta 的開放原始碼 DCPerf 基準套件;該套件能夠反映超大規模基礎設施集群中的生產環境狀況。正是這種合作關係使得這些結果值得關注:相關測量基於能夠反映現實資料中心環境的工作負載。

我們考察了決定某種記憶體技術是否適用於資料中心的各項指標:頻寬、延遲、容量和能效。我們的研究闡明了 LPDDR5X(包括大容量配置)如何分別對各項產生影響。我們的部分發現令人驚訝,尤其是當為受容量限制的工作負載提供充足的執行記憶體時所發生的情況。

結論很簡單:資料中心關於記憶體的探討,已不再僅僅局限於追求速度最快或容量最大。關鍵在於將合適的記憶體與合適的工作負載量相匹配,而 SOCAMM2 為系統設計者提供了一個真正全新的選擇。

我不會在這裡劇透細節。完整詳細資料(包括方法論、工作負載量及各項資料)均收錄在我們與 Meta 聯合發佈的白皮書中。如果您正面臨電力上限、容量限制或 AI 基礎設施擴充的成本效益等難題,我認為這非常值得您花時間瞭解。

Systems Performance Engineer, Micron

Khayam Anjam

Khayam Anjam is a Staff Engineer at Micron Technology. As part of Micron’s Data Center Workload Engineering team, he works on characterizing and optimizing modern AI workloads across GPU-accelerated and data center platforms. He also contributes to technical papers, internal reports, and customer-facing collateral. Prior to Micron, Khayam designed AI systems for computer vision and anomaly detection. At Dell Technologies, he authored six patents while contributing to ML, analytics, and reliability initiatives. He brings more than 10 years of industry experience spanning performance engineering, generative AI, and distributed systems. Khayam holds an M.S. in Computer Engineering from Clemson University.

相關部落格