探索

epsilon-貪婪探索(epsilon-greedy exploration)

這是最樸素的探索技巧。大部分時候智能體會利用(exploit)——挑出當前估計說最好的動作。但以一個小機率 epsilon,它會把那些估計丟到一旁,完全隨機挑一個動作。那一點點隨機性保證每個動作都持續被嘗試,於是智能體永遠不會永久鎖死在一個只是碰巧看起來好的選擇上。

epsilon 是一個介於謹慎與貪婪之間的旋鈕:大代表更多隨機探索,小代表更多利用。常見做法是讓 epsilon 一開始很高、隨時間衰減,早期廣泛探索,等估計變得銳利後再安定下來。它的弱點是這種探索是無方向的——一個隨機動作重新造訪熟悉狀態的機率,跟抵達一個真正新狀態的機率一樣高,這讓它很慢,在困難的稀疏獎勵任務裡往往毫無希望。

\pi(a\mid s)=\begin{cases}1-\epsilon+\epsilon/|A| & a=\arg\max_{a'}Q(s,a')\\ \epsilon/|A| & \text{otherwise}\end{cases}

以一減 epsilon 的機率採取貪婪動作;否則均勻隨機挑一個。

又稱
ε-greedyepsilon-greedy