美光技術詞彙表

資料湖

大廳三樓的霓虹燈

當需要儲存海量的原始資料時,資料湖賦予了組織安全儲存及管理這些資料的能力。

攜手美光,深入瞭解資料湖為何以及如何助力各行各業的組織;您也可以聯絡我們的銷售支援團隊,以獲取更多詳細資料。

什麼是資料湖?

資料湖定義:資料湖是一種集中式儲存庫,使組織能夠以任意規模儲存大量的原始資料 - 包括結構化、半結構化和非結構化資料。與傳統資料庫不同,資料湖無需預先定義模式,這使其成為靈活資料攝取、探索性分析以及機器學習的理想之選。各類組織利用資料湖來儲存:

  • 結構化資料(例如 SQL 資料庫)
  • 半結構化資料(例如 CSV 檔案、HTML)
  • 非結構化資料(例如多媒體檔案、文件、社交媒體貼文)

這種彈性使組織能夠以原始格式攝取原始資料 - 無論是定量資料(例如感應器讀數、銷售資料)還是定性資料(例如調查回覆、客戶意見回饋) - 並在後續階段將其結構化以便進行分析。例如,一家製造商可以在同一個資料湖中,從工廠感應器收集溫度讀數,從電商平台匯出客戶訂單,並分析視訊評論。

不妨將資料湖視為一座巨大的水庫 - 能夠容納來自不同源頭的多種類型的水(資料)。您無需在儲存前對水進行淨化;您可以根據需要對其進行處理並使用。這使得資料湖對於管理多樣化且不斷演進的資料集的組織而言,尤具價值。

隨著資料需求的日益複雜,各類組織正以此為基礎,構建「網路化資料湖」 - 即一種聯邦式或互聯互通的系統,能夠跨部門或跨平台連接多個資料湖。這些系統允許資料保持分散式狀態,同時仍可透過統一的框架進行存取,從而實現了跨組織共用、集中化治理以及可擴充的分析能力 - 不妨將「網路化資料湖」想像為一套由管道相互連接的水庫系統。這些相互關聯的系統增強了:

  • 安全性:針對分散式資料源實施集中式治理與存取控制,能夠提升資料保護水平及長期可靠性
  • 可擴充性: 無縫擴充,以適應不斷增長的資料量
  • 無障礙:按需構建用於分析的原始資料

資料湖作為各類多樣且不斷演進的資料集的靈活、可擴充儲存庫,其所扮演的這一基礎性角色,也促成了「資料湖倉」(Data Lakehouse)的興起 - 這是一種次世代架構,將資料湖的原始儲存能力與資料倉庫的效能、治理及交易處理特性融為一體。透過整合這些優勢,湖倉支援即時分析、結構化與非結構化資料,以及企業級可靠性。

這一演進順應了資料密集型產業日益增長的需求 - 在這些領域,美光高容量 SSD 等解決方案能夠提供所需的效能、效率與容量,從而為 AI 資料湖、高效能運算及進階分析工作負載提供強勁動力。

資料湖是如何運作的?

資料湖支援關聯式(表格型)和非關聯式(非表格型)兩種資料格式。它們實現了:

  • 大數據分析
  • 即時資料處理
  • 機器學習應用

這些能力有助於組織挖掘洞察、實現客戶體驗個人化,並提升決策水平。例如,將來自資料湖的結構化資料(如電話號碼)與同一資料湖中的非結構化資料(如影像)相結合,能夠實現更深層次的客戶行為分析。

資料湖從眾多不同來源(如應用程式、裝置、網站和資料庫)收集原始資料,且無需預先對其進行整理。這意味著企業可以按原樣儲存所有資料,並根據想要解答的問題,在日後決定如何加以利用。這種彈性使得對大量資訊進行快速探索與分析變得更加容易。為了保持井井有條,資料湖採用各類工具對資料進行標記與編目,從而確保在需要時能夠更輕鬆地查找與使用這些資料。

網路化資料湖透過連接跨不同團隊或位置的多個資料湖,將這一理念向前推進了一步。這有助於組織分享洞察、處理更龐大的資料集,並支援人工智慧 (AI) 等技術,這些技術依賴龐大資料來進行精准預測並優化營運。

資料湖的歷程記錄是怎樣的?

理解資料湖的歷程記錄,意味著要認識到整個資料儲存與資料庫的歷史。

  • 20 世紀 70 年代,資料庫的首次應用: 資料庫使組織能夠內部收集、儲存和分析資料。關聯式資料庫使企業能夠利用結構化查詢語言 (SQL) 來分析結構化資料。
  • 20 世紀 80 至 90 年代,資料倉庫與資料孤島:二十年來的技術進步促成了更多的資料收集,進而產生了儲存需求。資料倉庫和資料孤島應運而生,為儲存碎片化資料提供了安全、去中心化的解決方案。
  • 2000 年代,大數據: 大數據是指傳統資料處理工具無法分析的更為複雜的資料集。資料湖因其能夠儲存海量且多樣化的資料,而成為了備受追捧的解決方案。
  • 2010 年代,資料湖泊出現:「資料湖」一詞於 2010 年被提出,將其比作一片不斷有溪流匯入的廣闊水域。對於產生海量資料的組織而言,資料湖迅速成為了通用的資料儲存解決方案。

資料湖架構的主要類型有哪些?

組織可以考慮不同類型的資料湖架構:

就地部署

就地部署資料湖位於組織的內部基礎設施中。它們為儲存資料提供了更大的彈性和控制權。然而,由於維護和營運成本較高,它們通常不如基於雲端的資料湖架構具有成本效益。

雲端式

基於雲端的資料湖架構無需預設模式,因此在儲存大數據方面具有彈性與優勢。

AmazonTM、MicrosoftTM 和 GoogleTM 等公司,為各類企業提供各種基於雲端的資料湖儲存解決方案。

混合式

混合式資料湖結合了就地部署與雲端解決方案,兼具成本效益與控制能力。然而,由於融合了不同的資料湖架構,管理混合資料湖可能會更為複雜。

資料湖是如何被使用的?

資料湖有幾種常見的用途:

娛樂流媒體平台利用網路化資料湖來儲存個人資料與資訊,從而能夠洞察客戶行為。資料湖賦予了組織將這一洞察轉化為自訂化流式推薦的能力。

資料湖也被用於醫療保健領域。它們能夠儲存並管理複雜的資料集,為醫療專業人員提供一條簡化的途徑,以改善患者護理並降低成本。

金融產業從資料湖中獲益匪淺,尤其是在增強機器學習和人工智慧 (AI) 能力方面。投資公司利用資料湖更有效地管理投資組合,即時分析財務風險,並更快地識別市場趨勢。

例如,一家對沖基金可能會利用聯網資料湖來攝取並分析來自全球證券交易所的流式資料,從而使其 AI 模型能夠在毫秒級的時間內偵測異常並調整交易策略。

常見問答

資料湖常見問答

資料湖的維護工作可能會限制其功能。存取或刪除大量儲存資料可能具有挑戰性。

是的。資料湖旨在處理任何格式(無論是結構化還是非結構化)的大量資料。與要求在儲存前對資料進行清洗和整理的資料倉庫不同,資料湖儲存原始資料,並允許使用者在進行分析時再定義資料結構。這使其在應對不斷增長的資料需求時,具備高度的彈性和可擴充性。

資料湖以多種格式儲存原始、非結構化的資料,使其在機器學習和即時分析等工作中具有高度靈活性。資料倉庫儲存經過清洗且結構化的資料,可用於快速產生報告並獲取商業洞察。雖然資料倉庫在查詢方面通常速度更快,但資料湖在探索龐大且多樣化的資料集時,提供了更高的多功能性。