蒙地卡羅與時間差分學習
表格式 Q-learning(tabular Q-learning)
表格式 Q-learning 保有一張單純的查找表,每個狀態–動作配對各占一格,存放對該配對長期價值的估計。智能體愛怎麼探索就怎麼探索,每走一步後就更新它剛用過的那一格:把舊值朝「收到的獎勵,加上新狀態裡最好動作的折扣價值」挪過去。久了之後,這張表會收斂到最佳動作價值,照著它貪婪地行動就得到最佳策略。
它的決定性特徵是目標裡的那個 max。因為更新假設智能體從下一個狀態起會以最佳方式行動,所以即使智能體正忙著用例如 epsilon-貪婪規則探索,它學的仍是最佳策略——這正是 Q-learning 屬於離策略(off-policy)的原因。只要每個狀態–動作配對都被夠頻繁地造訪,且步長適當地衰減,它可證明會收斂。「表格式」這個詞點出它的極限:一格對應一個配對,只有在狀態與動作都不多時才行得通。
Q(s,a)\leftarrow Q(s,a)+\alpha\,[\,r+\gamma\max_{a'}Q(s',a')-Q(s,a)\,]
Q-learning 更新:從下一步最好的動作自助,無論實際採取了什麼動作。
又称
另见