AI

即便 XPU 已滿載執行,依然可能存在算力浪費

Jeremy Werner

雙手在筆記型電腦上打字,上方疊加顯示著數位 AI 聊天機器人的介面
對比圖表展示:一套高效 XPU 系統的生產性利用率為 80%,另一套資源浪費型系統僅為 30%;圖中還包含必要開銷、空閒損耗與主動損耗。

按一下以展開

本文中 XPU 指代全部類型的 AI 加速器,包含 GPU、TPU 以及自訂化 AI 晶片。無論架構如何,利用率都是領導者監測的核心指標之一。這很合理。加速器不僅成本高昂、能耗巨大,往往還是資料中心內最稀缺的資源。

問題就在這裡。利用率只能反映晶片是否處於運作狀態。它無法告訴我們,這種工作是否產生了對客戶有價值的 AI 成果。XPU 在等待資料、移動資料、重建被置換出的上下文、重新計算先前工作、處理開銷或產生最終未交付給使用者的工作時,可能看起來處於滿載狀態。

產業亟需一套更優指標,我將其命名為生產性利用率:即在滿足工作負載的品質、延遲與服務目標前提下,加速器用於產生有效輸出的時間佔比。

處於繁忙狀態的 XPU 未必能帶來高效產出。

高效利用率是一個管理框架,而非既定的產業標準或通用公式。它旨在將系統設計與基礎設施經濟學聯系起來。

核心問題不僅僅是:「我的加速器有多忙?」 而是「對於投入的每一小時加速器執行時間、每一瓦特電力以及每一美元基礎設施成本,我能獲得多少有效產出?」

這種區分至關重要,因為利用率這一概念可能會模糊三個截然不同的類別。有用的產出能夠交付給使用者,並滿足工作負載在品質和服務方面的目標。必要的開銷能保持系統的可靠性。可避免的浪費是指那些無助於改善最終交付成果的工作,或者是透過更優設計即可消除、且不犧牲品質或可靠性的工作。

可避免的浪費以兩種方式表現出來。閒置造成的浪費顯而易見:XPU 在等待記憶體、儲存裝置、通訊排程或是工作排程。主動浪費則更難察覺。利用率圖表看起來很健康,但加速器實際上是在重建狀態、重複之前的計算,或者產生對最終結果毫無貢獻的輸出。

該雙欄圖表定義了「閒置浪費」與「主動浪費」:前者指 XPU 等待記憶體、儲存裝置、通訊或排程資源;後者則指重新計算被驅逐的狀態、重複既往工作,或在交付前丟棄輸出結果。

按一下以展開

KV 快取揭示了為何活躍度可能具有誤導性

最明顯的範例是鍵值緩存,通常稱為 KV 快取。當模型處理提示和先前的對話時,它會建立有助於產生下一個答案的內部狀態。這一初次遍歷通常被稱為預填充。如果狀態保持可存取,系統可以複用它。如果它被驅逐或丟棄,系統可能必須重建它。

預填充和解碼對系統造成的壓力不同。預填充根據提示詞和上下文構建狀態。解碼模組逐詞元產生回覆內容。生產性利用率取決於兩點:避免重複預填充、為解碼模組高效供給資料。

重建該狀態會使 XPU 保持活躍。但這對於改善結果可能毫無助益。使用者得到的結果與複用狀態時相同,但營運商卻再次付出了加速器時間、功耗和容量方面的成本。

這屬於主動浪費。它看起來往往像是一個運算問題。在實踐中,根本原因通常是記憶體容量、頻寬、資料局部性、快取行為或資料移動。XPU 之所以持續運算,是因為系統無法在合適的位置維持正確的狀態。

在合適的工作負載下,設計良好的記憶體和儲存裝置層級能夠比重新運算更高效地擷取可重用的狀態。這並不意味著獲取在所有情況下都更好。答案取決於模型、上下文長度、硬體、拓撲結構、工作負載模式和服務目標。

邏輯重用和實體重用之間也存在差異。追蹤記錄可能會顯示提示詞或上下文應該是可重用的。但如果底層緩存被逐出、碎片化或移動到無法觸及的地方,系統仍然會產生重新運算的成本。有效利用率必須衡量基礎設施實際交付的內容,而不是工作負載理論上可以重用的內容。

道理很簡單。驅逐可能將加速器活動變成一種稅負。重用可以將相同的基礎設施轉化為更有用的產出。

記憶體將容量轉化為產出

在 AI 基礎設施中,記憶體與儲存裝置並非次要問題。記憶體和儲存裝置這套機制,決定了加速器的算力有多少可以轉化為有效工作。

HBM 為高頻存取資料與正在執行的工作提供頻寬。大容量主記憶體與記憶體擴張功能,確保了更多上下文資訊和運作狀態可隨時存取。高效能 NVMe 儲存裝置可大規模儲存可複用狀態,在適配的工作負載場景下,減少不必要的重複運算。

儲存裝置層級至關重要,因為 AI 工作並非同質化運算。有些資料必須緊鄰加速器。有些狀態必須在較長的互動過程中保持可用。部分可複用計算的價值,不止用於產生下一個詞元。將所有資料一概視為熱資料或冷資料,會忽略工作負載的實際執行方式。

解碼往往受限於系統移動權重、KV 狀態和中間資料的速度,而不僅僅是峰值運算能力。這就是頻寬與資料局部性對有效輸出至關重要的原因。

容量同樣重要。當 KV 狀態佔用大量可用記憶體時,排程器可能會降低併發工作數量。業務需求依舊存在,加速器算力也足夠,但系統無法留存足夠的運作狀態,難以高效服務更多使用者。

這正是美光擁有有益視角之處。我們提供 HBM、DRAM、記憶體擴充以及 NVMe 儲存方案。借此我們可以從系統層面觀察:在資料與狀態流轉的全過程中,生產性利用率在哪裡提升、在哪裡損耗。

結果很簡單明瞭。低生產性利用率可能表現為運算問題,但其根本原因通常是記憶體頻寬、IOPS 或容量不足。如果系統無法為其提供資料、就近儲存狀態、保留可重用工作並高效移動資料,加速器就無法產生有用的輸出。

該框架展示了衡量生產性產出的三個指標:每加速器小時、每瓦特以及每美元基礎設施投入所對應的有效產出。

按一下以展開

衡量每加速器小時、每瓦特和每美元的產出

領導者應持續追蹤利用率。這很有用。它能揭示閒置資源、排程問題以及基礎編排層面的問題。但它不應被視為衡量經濟回報的標準。

更好的營運問題會更精準。每消耗一小時加速器算力能產生多少有效產出? 每瓦功耗對應多少產出? 每投入一美元基礎設施資金的產出是多少? 我們有多少次重建了本可重複使用的基礎設施? 有多少工作是必要開銷,又有多少是可以避免的?

有效輸送量(Goodput)是朝著這個方向邁出的重要一步。NVIDIA AIPerf 將有效輸送量(Goodput)定義為每秒完成且滿足指定服務等級目標(例如首字延遲和字間延遲)的請求數。這將效能與使用者體驗聯絡了起來。生產性利用率提出了一個後續的經濟問題:付費加速器使用時長中,有多少比例創造了符合這些目標的有效產出?

這一答案應當決定設計選擇:領導者如何設定記憶體規模、評估儲存裝置層級、調整工作負載、擴充容量,以及決定何時真正需要更多的加速器。

下一代 AI 基礎設施的優劣,將不再以其 XPU 看上去有多繁忙來評判,而是以每個加速器小時、每瓦功耗和每一美元產生了多少有用的智慧成果來衡量。強大的記憶體和儲存裝置層級架構正是將活動轉化為產出的關鍵。

現實問題不僅僅在於是否購買更多的加速器。這關乎系統是否具備合適的記憶體和儲存裝置效能、容量及分層技術,以將昂貴的加速器週期轉化為有效利用,並最終實現有用的產出。

核心資料中心業務部門資深副總裁暨總經理

Jeremy Werner

Jeremy Werner 是美光核心資料中心業務部門(CDBU)的資深副總裁暨總經理,該部門專注於 OEM 資料中心客戶的記憶體解決方案,以及所有資料中心客戶的儲存裝置解決方案。 Jeremy 是一位經驗豐富的儲存裝置技術高階主管,擁有超過 25 年的產業經驗,領導美光超大規模、雲端和企業市場資料中心記憶體和儲存裝置系列產品策略和執行。 在加入美光之前,他曾在 KIOXIA America 擔任 SSD 企業總經理,並在 SandForce、MetaRAM 和 Tidal Systems 等新創公司擔任過十年的銷售和行銷領導階層職務。 Jeremy 擁有 B.S.E.E. 來自康乃爾大學,是史丹佛商學院校友,是 25 項以上已發行或待決專利的發明家。

相關部落格