邊緣 AI 轉變
生成式 AI 正在融入日常工作中。從簡單的聊天互動開始,演變成能夠代表使用者推理、規劃、記住背景和執行日益複雜任務的系統。這些進展大多由雲端運算所推動,而這樣的成功也逐漸形成業界普遍的預設認知:智慧存在於資料中心,而裝置只是存取這些智慧的窗口。但是,隨著 GenAI 更深入地融入日常工作流程中,這種假設的侷限也逐漸浮現。每次互動都取決於連網能力。敏感資料必須離開裝置。成本隨使用而擴展。延遲受限於往返時間。對自身資訊的控制是有限的。對於許多應用而言,這些權衡是合理的。對其他人來說,這個問題比較困難。該模型是否永遠擴展?
這個問題啟發了一波創新者探索如果智慧資料更貼近使用者,AI 會是什麼樣子。OpenClaw 是最早且最有雄心的回答之一,其爲開放原始碼的自主 AI 代理程式,可以在本機硬體上執行整個推理迴圈。它不只是另一個聊天機器人。它會將智慧資料從資料中心轉移到裝置本身,以供未來參考,即具備強大功能的 AI 是私有、持久且永遠可用,無需持續的雲端連線。
OpenClaw 體現了產業已投身其中的一場變革。如今,各大晶片廠商均已出貨搭載 NPU 的處理器,作業系統正增加對本地推論的原生支援,而 OEM 廠商在設計平台時,也將裝置端 AI 視為基礎能力,而非頂級特性。代理將持續變更。而它們建立的硬體需求則不會。
如果您正在打造次世代的 PC、行動裝置或嵌入式系統,重點不再是本機 AI 是否會重塑平台的問題。而是您的硬體在執行時是否已經就緒。使用者裝置的工作負載量與現今的 AI 助理不相似,而此轉變會對一個元件造成直接、可測量的後果,特別是記憶體。
什麼讓它與眾不同
之前提供的大多數本機 AI 工具都具有基本特性:功能被動且單一。裝置端語言翻譯、語音聽寫、相片標記和背景雜訊抑制是當時僅有的功能。您啟用這些功能後,它們會執行單一的小型模型數秒,接著便停止運作。這類互動彼此獨立、執行時間短,而且記憶體占用量有限且可預測。
OpenClaw 打破了這個模式。這是能夠追求目標、在長週期的多步驟工作流程中維持狀態,並能處理職業與個人任務的自主代理,且僅需極少的指令引導。
重要的是,OpenClaw 不需要在本機執行。其旨在與任何相容 OpenAI 規範的模型端點進行通訊,許多用戶將其指向雲端大語言模型(LLM)。但使用者對邊緣用例(涵蓋隱私權、成本控制、全天候可用性和真正具備強大算力的本地運算能力的出現)的熱情,正推動社群日益傾向於在本機託管的大語言模型(LLM)伺服器(如 LM Studio、Ollama、llama.cpp 和 vLLM)上運行這些模型。代理型架構是開放原始碼。其背後的智慧如今運行在用戶自己的晶片上。
自主權是它強大的原因。這也是其對本地硬體資源消耗極大的原因——其資源需求遠超邊緣設備通常需要承擔的大多數工作負載量。
其實際運作方式:本機 LLM 伺服器為腦部
迴圈說明硬體的需求。
OpenClaw 本身就是協調:排程器、工具帶、記憶體儲存區,以及一組針對您的行事曆、收件匣、檔案、瀏覽器和終端機的連接器。它不含自己的情報。每次代理需要思考時,都會對 LLM 發出推論請求。當該 LLM 在本機託管時,迴圈看起來像這樣:
- 觸發:排程、事件或使用者目標會啟動程序。
- 原因:代理程式會將目標及其累積的上下文傳送至本機 LLM 伺服器,其執行駐留在 DRAM 中的模型,並傳回下一步操作。
- 行動:代理程式調用工具:讀取收件匣、查詢檔案、執行組建、呼叫 API。
- 觀察。結果會附加到內容中。
- 再來一次。返回步驟 2、數十或數百次,直到達成目標。
傳統的聊天機器人完成一次通過該迴圈並停止。自動代理程式可以連續執行數小時。每個動作都會重新讀取模型權重、延伸對話內容,並增加鍵值(KV)快取,讓模型避免重新計算已經看到的所有內容。每個動作,首先且最本質上都是一次記憶體操作。
這就是為什麼邊緣的有趣限制不是加速器的原因。這是其下方的 DRAM。
使用案例光譜
考慮到這個迴圈,看看平台的功能,因為這個範圍比大多數人預期的更寬。
在個人層面,其處理那些曾經需要人類持續關注的日常認知負擔。根據您的資訊來源精心整理並彙總而成的晨間簡報,而且整個過程中沒有任何查詢請求離開您的裝置。收件匣在您坐下之前已被閱讀、排定優先順序和起草。已研究、比較、預訂並自動新增至行事曆的差旅。篩選出最重要的內容,並蒸餾成您實際有時間閱讀的內容
在專業領域,圖片會觸及更雄心勃勃的區域。在本地硬體上進行私密投資研究,即時監測市場訊號,並且結合完整背景挖掘投資機會。由一個將整個專案(從第一行程式碼到最後一次提交)全程載入記憶體的代理程式編寫、測試、偵錯並部署的程式碼。基於自然語言簡報產生的演示文稿,由能夠理解受眾、核心訊息及格式需求的系統進行建構與內容填充。開發的端對端應用程式,無需雲端相依性或 API 額外負荷。
這些任務都不是單一要求。每個都是數百個本機推論呼叫,每個呼叫都包含比上一個內容更多的內容。
此頻譜不是靜態的。隨著本地模型的能力不斷增強且參數效率日益提升,其用例也在不斷擴展——這些用例目前仍需依賴雲端規模的資源,但未來將能夠順暢且私密地在邊緣運行。
記憶體為何是關鍵變數
有效智能體的每一個組件都駐留在 DRAM 中:模型權重、KV 快取、動態演進的推理狀態和累積的會話歷程記錄。當以上任何一項被擠壓時,代理程式會減速、忘記或完全失敗。因此,DRAM 並不是本機 AI 的支援元件;而是能力上限。
容量可設定代理程式的功能。較大的參數計數表示有更好的推理。內容越長,表示記憶體運作越好。兩者均以 GB 為單位支付。吞吐量決定了其思考速度。
這就是統一記憶體架構(UMA) 變得具有決定性,而不僅僅是有趣的。在 UMA 設計中,CPU、GPU 和神經網路引擎共享同一塊 DRAM 記憶體池,而不是來自各自使用獨立的專用記憶體區域。這對本地 AI 是一大優勢,因為模型無需局限於獨立顯示卡顯存的固定劃分區域;這意味著利用單一的大型顯存池,便能運行在傳統顯示卡上根本無法加載的大型模型。另一方面,沒有第二個備用池可供依靠。作業系統、瀏覽器、IDE 和常駐的多十億參數模型都爭奪相同的實體 DRAM。在 UMA 平台上,安裝記憶體總量實際上是您可以執行的模型大小,以及可保留的內容長度。
美光的 LPDDR5X 是記憶體基礎,讓頂尖 OEM 合作夥伴的廣泛 AI 工作站得以實現。配置範圍從較輕工作負載量的 16GB 到最嚴苛的專業部署的 192GB 統一記憶體。在該範圍內,美光的 LPDDR5X 提供輸送量,讓代理的推理引擎能夠以持續多步驟推論需求的步調運作,最新一代的資料速率高達 10.7 Gbps。
跟隨 OpenClaw 體驗其職業生涯中的典型一天,此需求的面貌便清晰可見。模型在首個任務之前載入到統一記憶體池中。隨著每一則訊息的處理、每一次日曆交叉引用,以及針對上下文中完整程式碼庫進行的每一個偵錯迭代,KV 快取都會不斷擴展。等到準備隔日簡報時,單次會話產生的累積足跡已遠超過先前本地 AI 工作負載所產生的任何規模。美光 LPDDR5X 產品系列涵蓋了 AI 工作站所需的各種容量、外形規格和速度等級,確保無論任務在何處運行,底層的 DRAM 都能完美適配當下的需求。
隨著模型的進步和背景視窗的擴大,這些要求條件將隨著它們而擴展。軌跡指向同一個方向。邊緣 AI 代理對記憶體的需求將持續、大幅且快速地成長,其速度超出了大多數硬體路線圖目前的預期。
雲端和邊緣,共同進步
獨立邊緣代理的崛起與雲端 AI 沒有競爭關係。它位於其旁邊。雲端處理龐大、共用和複雜的問題。邊緣負責處理個人、私人和即時事務。兩者都同時進步,每代產品都變得更有能力且更耗用記憶體。
對美光而言,此涵蓋從資料中心 GPU 所使用的 HBM 到邊緣設備所使用的 LPDDR 等儲存層級各個層面的平行發展態勢,並非需要權衡的矛盾。這是一個跨現代 AI 運算領域提供服務的機會。
展望未來
邊緣 AI 花了數年才變得有趣。現在,它變得至關重要。
上述使用案例,從收件匣管理到全端開發,從私人研究到精良的交付成果,並本地代理程式的極限。它們是起點。後續的每一代模型都會推動它。每個獲得的參數將擴大可能的範圍。而本地 DRAM 容量、速度和功耗效率的每項進展,都將比過去更進一步地突破界限。
邊緣 AI 正在發揮其作用。而讓它成為現實的記憶體只是開始而已。
探索邊緣的力量
現今最強大的邊緣 AI 代理效能完全取決於其本身的記憶體架構。美光的 LPDDR5X 和 LPDDR5 DRAM 解決方案專為滿足這些需求而設計,提供當地 AI 工作負載量所需的容量、速度和能源效率。無論您是要打造邊緣 AI 產品、評估平台架構,或只是瞭解實現次世代本機智慧所需的關鍵技術,都歡迎您探索美光完整的 DRAM 解決方案產品組合,並看看選對記憶體能帶來多大的不同。