探索
波茲曼探索(Boltzmann exploration)
epsilon-貪婪把每個非最佳動作都當成同樣值得隨機一試,這看起來很浪費——一個接近最佳的動作,理應比一個明顯很糟的動作更值得關注。波茲曼探索修正了這點,它按各動作估計價值的 softmax 比例來選動作:價值越高的動作越可能被挑中,但每個動作都保有非零的機率。探索的程度,是依各選項看起來有多有希望來分級的。
一個溫度(temperature)參數決定大膽的程度。溫度高時分布幾乎均勻,智能體幾乎什麼都探索;溫度往零下降時,它會集中到最好的動作、表現得貪婪,所以訓練過程中調低溫度,就如同模擬退火。問題在於它只用估計價值來評判動作,而不看那個估計有多不確定,所以它可能持續過度抽樣一個只是看起來好的選項,卻忽略一個真正還沒探索過的。
\pi(a\mid s)=\frac{e^{Q(s,a)/\tau}}{\sum_{a'}e^{Q(s,a')/\tau}}
動作以其價值的 softmax 抽樣,由溫度 tau 控制隨機程度。
又称
另见