強化學習

ε-貪心(epsilon-greedy)

/ EP-sih-lon GREE-dee /

ε-貪心是對「探索還是利用」這一兩難最簡單也最誠實的答案,簡單到幾乎令人難為情:大多數時候,做你當前認為最好的事(貪心);但以一個很小的機率——稱它為 ε,比如 10%——拋開你的判斷,改挑一個隨機動作。那偶爾的一次擲骰,就是智能體全部的探索預算,它保證了智能體會不斷去採樣那些本來或許永不會再光顧的選項。

ε 不過是一個旋鈕,調的是「要多愛冒險」。ε 等於 0.1 意思就是「十次裡探索一次」。一種常見的改良是讓 ε 起初很高——在一無所知時大量探索——再隨著智能體的估計逐漸安定而衰減趨零,於是它從一個好奇的新手,漸漸變成一個自信的行家。整套東西不過寥寥幾行程式碼。

它的長處在於簡單;它的短處在於粗笨。當 ε-貪心決定探索時,它的探索是全然隨機的——它去試一個災難性著法的機率,和去試一個大有可為、卻尚未驗證的著法的機率一樣大,而且它會把探索浪費在那些它早已學到很糟糕的動作上。更聰明的方法會在不確定性最高處探索,而非均勻地撒網。但論純粹的可靠與省事,ε-貪心仍是預設值得頭一個去試的辦法,而且它出乎意料地常常奏效。

當 ε 等於 0.1,智能體每一回合擲一枚十面骰。擲到 1,它就挑一個完全隨機的動作(探索)。擲到 2 到 10,它就挑當前價值估計最高的動作(利用)。一局下來,大約十步裡有九步是「最佳猜測」,一步是出其不意。

以機率 ε 隨機行動,否則貪心行動。ε 常常起初較高,並在訓練中衰減。

ε-貪心是盲目探索的:它一旦探索,就在所有動作裡均勻地挑,連那些早已知道很糟的也照挑不誤。這使它效率低下——它會反覆去試那些明擺著很差的著法——但它那個「永不停止嘗試一切」的死簡單保證,恰恰是它至今仍是一條可靠基線的原因。

又稱
ε-greedyepsilon greedyε-贪婪策略