人工智慧(AI)無疑是過去一百年來最重要的技術發展之一,應用範圍廣泛,而且能提升各種產業和系統的效能和效率。
隨機森林是基於機器學習的 AI 演算法,可以應用於整個板上,可全方位應用於將各種異質資料轉化為對未來的預測。隨機森林演算法具有高度準確的可能性,改變了我們與資料的互動方式。
什麼是隨機森林?
隨機森林的定義:隨機森林是一種機器學習演算法,使用多個決策樹進行預測和決策。
隨機森林是獨特的機器學習演算法,運作方式不同於 AI 中的其他演算法。其以決策樹演算法為基礎,利用多個決策樹共同合作,得出更準確的預測結果或分類。決策樹是監督式學習演算法,設計用於對資料進行分類,並根據階層式樹狀結構進行預測。要掌握隨機森林,理解決策樹至關重要。
這種演算法與類似的機器學習模型和演算法不同,因為其會降低過度擬合的風險。雖然決策樹僅限於訓練資料內的特定樣本,但隨機森林內的大量決策樹和潛在樣本可以提供更大的靈活性和與資料的互動性。
隨機森林如何運作?
隨機森林演算法將多個決策樹整合在一起,透過更複雜的分類流程推送資料。完成後,就能得出更準確的預測和決策。
在決策樹中,資料從根節點經由內部節點饋送至輸出葉節點。雖然根節點是核心輸入資料,但分葉節點代表資料集的所有可能結果。
超參數是機器學習中的組態變數,可控制模型的行為方式,因此結果會受到超參數設定的影響。隨機森林演算法有三種超參數需要預先設定:
- 節點大小:節點大小指定決策樹的深度。
- 決策樹數目:此超參數表示資料處理中將使用多少決策樹。
- 抽樣的功能數量:功能取樣會影響決策樹中的準確度和偏差。
隨機森林由個別決策樹組成,每個決策樹都有自己從輸入資料中抽取的資料樣本。每個決策樹只有最初輸入模型的訓練資料樣本,而決策樹透過功能抽樣保持獨特且與眾不同。
這種對資料進行抽樣、並利用多棵決策樹來處理同一資料集不同面向的機制,正是確保其具備隨機性,且預測結果比單一決策樹更具多樣性的關鍵。結果的差距使得隨機森林成為更準確、更深入分析的機器學習演算法。
隨機森林演算法的歷史是什麼?
隨機森林演算法是最新的技術,雖然其根植於 AI 和深度學習技術。
- 1990 年代,隨機分配決策樹:1993 年,Steven Salzberg 和 David Heath 發起了隨機決策樹建立演算法的一般概念。此概念由 Tin Kam Ho 於 1995 年進一步開發,並建立功能取樣以提升準確度。
- 1990 年代中期,引入隨機性:Yali Amit 和 Geman 兄弟(Stuart 和 Donald)對機器學習領域有重大貢獻,導致隨機森林的開發,並在各個決策樹之間引入了差異。
- 2000 年代,將概念編入演算法:2000 年代,Leo Breiman 和 Adele Cutler 將隨機森林註冊為商標,並透過開發「bagging」技術和隨機特徵採樣方法,對該演算法進行了規範。
隨機森林演算法的關鍵類型是什麼?
隨機森林演算法根據其目標分為兩類:
- 迴歸隨機森林用於根據輸入資料進行預測。
- 分類器隨機森林用於根據分類進行預測。
如何使用隨機森林?
隨機森林作為機器學習演算法,在各行各業都有廣泛的應用。利用隨機森林技術進行創新的一些關鍵行業是醫療保健、金融、貿易和電子商務。
隨機森林演算法用於改善病患照護。例如,視病史而定,多個決策樹會根據病史來分析患者對特定治療的潛在反應。同樣地,在藥學中,隨機森林可以幫助識別正確的成分組合,以提高效率和安全性。
在金融產業中,銀行使用隨機森林來分析人們的銀行歷史和信用記錄,以確定哪些客戶可能和不可能支付債務,從而做出更明智的貸款決策。在交易中,股票交易者根據歷史資料,使用隨機森林預測股票或市場未來可能表現的狀況。
電子商務零售商利用隨機森林來提升客戶體驗與滿意度,因為此演算法能預測購物習慣,並以更貼近客戶需求的方式來推薦產品。
隨機森林是一種多功能的機器學習演算法,可用於分類和迴歸。這表示輸出資料可被分類為特定群組,如是或否,或在尺度內呈現細微差別。
隨機森林演算法受到監督,這意味著輸入資料經過標記,以訓練演算法並實現預測結果和模式識別。