隨著 AI 的採用速度加快,推論逐漸成為 許多大型語言模型(LLM)部署背後主導的工作負載。每個 聊天機器人回應、搜尋結果、程式碼建議和翻譯 要求取決於人工智慧模型的即時執行。因為這些 工作負載規模,支援其所需的基礎架構正逐漸成為 和模型本身一樣重要。在本部落格中,我們探討了 不同的 LLM 查詢類型如何對 GPU 記憶體 頻寬、功率、輸送量和能源效率提出不同的要求。
瞭解 AI 推論
與透過處理大型資料集來教導模型的訓練不同,
推論是驅動現實世界 AI
應用的運作工作負載。每一次推論請求都需要在運算、
記憶體和儲存資源之間移動大量資料,才能及時提供
結果。隨著人工智慧的採用率持續成長,推論已成為
基礎設施需求的其中一個主要驅動因素,使記憶體容量、
頻寬、效能和能源效率對於
大規模實現 AI 至關重要。
大型語言模型推論是使用經過訓練的 AI
模型,根據新的輸入內容產生輸出。當使用者提交提示時,
模型分析請求並預測最可能的
詞元序列以建立回應。每次聊天機器人對話、文字摘要
翻譯、推薦或生成的內容由
LLM 推論所推動。
LLM 推論的隱藏複雜性
單一 LLM 查詢的能源成本最多可相差 7 倍,具體取決於 提示類型(見下表 1)。這種變異 對基礎設施規劃有著真正的影響,這一切都歸功於 記憶體。
大多數人認為 LLM 推論是一個簡單的程序:您輸入 提示後,模型便會輸出詞元。然而,其本質是 複雜且高度可變的運算流程。查詢類型 傳送至 LLM 從根本上改變資源要求, 包括消耗多少記憶體頻寬、GPU 所需的工作量、消耗多少功率,以及功率 轉化為有效輸出的效率。
這對基礎架構規劃來說非常重要。美光執行長 Sanjay Mehrotra 指出,「沒有資料,就沒有 AI」, 如果沒有正確的記憶體和儲存基礎架構,就沒有 高效推論。瞭解不同查詢類型如何驅動 不同的需求,是容量規劃、功耗預算和 成本優化發揮作用的關鍵。
測試方法
為了量化這些差異,我們使用 GPT-OSS-120B 橫跨六個不同的詢問類別(醫療保健、 技術、科學、程式設計、翻譯和角色扮演)進行推論測試。我們 收集了 GPU 使用率、記憶體頻寬、耗電量、 輸送量和能源效率的即時指標。
- 使用的模型是 GPT-OSS-120B,透過 NIM 部署 容器。
- 使用自訂 Python Gradio 介面 並結合 NVIDIA® nvidia-smi 進行即時 GPU 遙測來收集指標數據。
- 由一個 15TB Micron® 9550 NVMe™ SSD 提供儲存空間,用於高速模型和資料集載入。Micron 9550 SSD 的高順序讀取輸送量對於快速載入模型權重和減少 部署期間的冷啟動延遲至關重要。
- 使用的伺服器平台是 HPE ProLiant® DL384 Gen12。
六個查詢類別
選擇六個類別來代表常見的真實世界 LLM 使用案例,每個案例都有不同的運算特徵:
醫療保健:需要結構化事實召回的簡明、實證醫療詢問。
提示樣本:"列出影響心血管風險的基於證據的因素;保持簡潔。"
技術:需要領域知識和結構化輸出的技術總結。
提示樣本:"以重點總結 HBM3E 和 HBM4 的主要差異。"
科學:需要使用精確技術性語言的解釋性查詢,不要簡化。
提示樣本:"解釋 CRISPR 的核心機制,沒有類比。"
程式設計:需要分析、推理和產生程式碼的程式碼最佳化任務。
提示樣本:"優化此功能以提高速度,並僅解釋瓶頸。"
翻譯:多語言翻譯需要大型內容視窗和較長的內容生成。
提示樣本:"將此段落翻譯為日文,無評論。"
角色扮演:創意創作,具有對象限制和風格要求。
提示樣本:"作為超載的太空船 AI......撰寫簡短的內部狀態記錄。"
主要結果:資源要求差異極大
跨類別的績效摘要
按查詢類別分類的 LLM 推論資源需求
| 類別 | 提示詞元 | 完成詞元 | TTFT (秒) | 解碼 TPS | 平均功率 (W) | 解碼 能量(J) | 效率 (詞元/焦耳) |
|---|---|---|---|---|---|---|---|
| 健康 | 64 | 257 | 2.286 | 55.35 | 170.5 | 792 | 0.3246 |
| 技術 | 68 | 436 | 7.188 | 62.48 | 172.3 | 1203 | 0.3625 |
| 科學 | 65 | 259 | 1.513 | 69.76 | 179.5 | 666 | 0.3886 |
| 程式設計 | 244 | 1082 | 2.004 | 57.12 | 170.6 | 3232 | 0.3348 |
| 翻譯 | 1150 | 1588 | 3.373 | 58.81 | 171.6 | 4634 | 0.3427 |
| 角色扮演 | 93 | 255 | 1.294 | 64.88 | 182.5 | 717 | 0.3555 |
表 1:六個查詢類別的解碼階段效能 摘要(不包括預填充)
記憶體頻寬:推論的核心
記憶體頻寬通常是 LLM 推論的主要限制。我們的測量顯示各類別的峰值記憶體頻寬需求範圍從 348 GB/s(健康)到 475 GB/s(角色扮演)皆有。如此大的差異意味著基礎架構應針對其中要求最高的工作負載進行配置,而非針對平均工作負載。
圖 2 中的時間序列資料顯示,預填充階段中的高突發性記憶體頻寬使用情況。觀察記憶體頻寬使用情況發現,在預填(提示處理)階段會出現峰值,而在解碼階段則呈現更穩定的模式。由於這種突發行為,平均頻寬利用率明顯低估了實際的峰值要求。
這強調了記憶體技術的重要性。美光 HBM3E 等高頻寬記憶體解決方案,專為提供 AI 推論工作負載所需的持續頻寬而設計。在 GH200 等平台上,HBM 與作為 CPU 端記憶體的美光 LPDDR5X 一起工作,以保持資料流經統一的記憶體架構。單一角色扮演查詢的峰值為 475 GB/s,約為 GH200 的 4.9 TB/s HBM3e 頻寬的 10%,因此一次大約十個可以使記憶體匯流排飽和。這有助於說明為何記憶體頻寬會隨著模型規模而成為推論效能的主要限制。
主要見解:需要高達 475 GB/s 的記憶體頻寬來處理需求最高的工作負載。即使是健康問與答等「簡單」問題,在尖峰時段也需要 348 GB/s。記憶體頻寬通常是推論輸送量的限制因素。
註:單一時間序列圖足以描述隨著時間推移的記憶體頻寬使用率,因為在像這樣的記憶體密集型推論工作負載中,記憶體頻寬、GPU 使用率和功耗密切相關。其以鎖定方式移動:當預先填充期間記憶體頻寬飆升時,GPU 串流多處理器(SM)活動和功耗會隨著飆升而飆升。當頻寬在解碼期間穩定下來時,其他兩個也是。僅追蹤記憶體頻寬即可為 GPU 使用率和功耗提供可靠的代理伺服器,因為時間模式實際上完全相同,因此為 GPU 使用率和功耗提供可靠的代理伺服器。它們有著相同的根本原因:GPU 在推論過程中的每個時刻都努力工作。
GPU 使用率:突發性的性質
下面的箱形圖顯示不同查詢類別的 GPU 使用率的差異。分佈範圍越廣,表示工作負載量的突發性越強,預測性越差。
關鍵見解:GPU 的需求是突發性的,而不是穩定狀態。如果根據平均利用率規劃佈建,系統將在高峰需求期間佈建不足。箱形圖清楚說明:在單一推論請求中,使用率大幅波動,這意味著在容量規劃方面,傳統的「平均使用率」指標可能具有誤導性。
功耗和能源效率
功耗因查詢類型而有顯著差異。雖然各類別(170W 至 183W)的平均 GPU 功耗相對一致,但每個查詢消耗的總能量變化高達 7.0 倍,從 666J(科學)到 4634J(翻譯),如圖 2 所示。此差距主要是由每個查詢的持續時間及其產生的詞元數量所驅動。
詞元數量與時間:實際成本驅動因素
不同類別之間的最大差異出現在詞元數量和總處理時間中。翻譯產生的完成詞元數量是角色扮演的 6.2 倍,而且解碼時間增加 6.9 倍,而解碼能耗增加 6.5 倍(表 1)。程式設計查詢產生的完成詞元數量是科學查詢的 4.2 倍。
能源效率:每焦耳詞元
如圖 6 所示,查詢期間效率不一。在預填充期間,GPU 正在消耗電力但尚未產生任何詞元,此時數值較低;隨著輸出的增加會逐漸改善。由於前期預填充能量分散在更多詞元上,因此程式設計和翻譯等較長查詢最終會達到最有效率(~0.33 詞元/焦耳)。簡短或預先填入內容過多的查詢會降至較低。對於管理電力預算和永續發展目標的團隊,這項指標也越來越重要。
能源效率是以每單位能量產生的詞元來測量,範圍從 0.3246 詞元/焦耳(醫療保健)到 0.3886 詞元/焦耳(科學)不等。科學查詢達到最高效率,因為其在產生相對低的電力額外負荷的同時,維持相對較低的高解碼輸送量。對於管理電力預算和永續發展目標的資料中心營運商而言,這項指標變得越來越重要。
結論
此分析明確了一件事:LLM 推論的 工作負載量遠非平均分佈。查詢類型從根本上塑造資源 概況,從記憶體頻寬和 GPU 使用模式到功耗 消耗和能源效率。
資料顯示工作負載很複雜,GPU 需求也很龐大。 規劃平均使用率將導致 在高峰需求期間效能降低。相反地,以下是團隊應關注的重點:
- 考慮部署組合中最嚴苛工作負載 的資源需求
- 考慮突發 GPU 使用率和平均值
- 考慮預期組合中最壞情況查詢類別 的功率預算
- 監控每個類別的指標以識別最佳化 機會
- 考慮最壞情況的功耗需求,並安排 合適的功率預算
透過瞭解每個查詢類型的資源指紋, 組織可以建立更有效率、更具成本效益且回應迅速的 AI 基礎設施。隨著推論工作負載的擴展, 在正確的記憶體和儲存基礎上建立高頻寬 HBM3E、 高容量 LPDDR5X 和高輸送量 NVMe SSD 十分重要。
準備好最佳化 AI 基礎架構了嗎? 探索 美光的資料 中心記憶體和儲存解決方案組合 專為 美光 AI 解決方案的 AI 工作負載而設。
技術註腳
1 所有推論測試都是在 NVIDIA GH200 平台上進行,其配備整合了 72 核心 Grace Arm CPU + Hopper H200 GPU,並採用統一記憶體架構(480GB LPDDR5X + 144GB HBM3E)。效能結果基於內部測試,可能會因系統配置、工作負載特性和軟體版本而異。
2 美光 9550 NVMe SSD 帶來的儲存效能。深入瞭解 Micron 9550 NVMe SSD