強化學習是什麼
回合制與持續性任務(episode vs continuing task)
有些任務有自然的結尾。一盤棋以勝、負或和告終;機器人的一次操作在杯子放好或掉落時結束。每一段從頭到尾、自成一體的歷程就是一個回合(episode),結束後世界重置,再開始全新的一回合。這類是回合制任務,我們通常在意一個回合裡收集到的總獎勵。
另一些任務則一直跑下去,看不到重置——調節大樓的恆溫器、平衡電網的系統、無限期服務流量的機器人。這類是持續性任務(continuing task)。把獎勵在無限長的時間上相加會發散,所以我們通常對未來獎勵打折扣,愈遠的看得愈輕一點,好讓總和保持有限而明確。
G_t=\sum_{k=0}^{\infty}\gamma^{k}R_{t+k+1}
在持續性任務中,打過折扣的未來獎勵(0 ≤ γ < 1)會加總成一個有限的值。
又稱
另見