强化学习

ε-贪心(epsilon-greedy)

/ EP-sih-lon GREE-dee /

ε-贪心是对「探索还是利用」这一两难最简单也最诚实的答案,简单到几乎令人难为情:大多数时候,做你当前认为最好的事(贪心);但以一个很小的概率——称它为 ε,比如 10%——抛开你的判断,改挑一个随机动作。那偶尔的一次掷骰,就是智能体全部的探索预算,它保证了智能体会不断去采样那些本来或许永不会再光顾的选项。

ε 不过是一个旋钮,调的是「要多爱冒险」。ε 等于 0.1 意思就是「十次里探索一次」。一种常见的改良是让 ε 起初很高——在一无所知时大量探索——再随着智能体的估计逐渐安定而衰减趋零,于是它从一个好奇的新手,渐渐变成一个自信的行家。整套东西不过寥寥几行代码。

它的长处在于简单;它的短处在于粗笨。当 ε-贪心决定探索时,它的探索是全然随机的——它去试一个灾难性着法的概率,和去试一个大有可为、却尚未验证的着法的概率一样大,而且它会把探索浪费在那些它早已学到很糟糕的动作上。更聪明的方法会在不确定性最高处探索,而非均匀地撒网。但论纯粹的可靠与省事,ε-贪心仍是默认值得头一个去试的办法,而且它出乎意料地常常奏效。

当 ε 等于 0.1,智能体每一回合掷一枚十面骰。掷到 1,它就挑一个完全随机的动作(探索)。掷到 2 到 10,它就挑当前价值估计最高的动作(利用)。一局下来,大约十步里有九步是「最佳猜测」,一步是出其不意。

以概率 ε 随机行动,否则贪心行动。ε 常常起初较高,并在训练中衰减。

ε-贪心是盲目探索的:它一旦探索,就在所有动作里均匀地挑,连那些早已知道很糟的也照挑不误。这使它效率低下——它会反复去试那些明摆着很差的着法——但它那个「永不停止尝试一切」的死简单保证,恰恰是它至今仍是一条可靠基线的原因。

又称
ε-greedyepsilon greedyε-贪婪策略