馬可夫決策過程

折扣因子(discount factor, γ)

折扣因子決定智能體有多在乎未來、相對於當下。當 γ 接近零,它沒耐性,只抓眼前能拿到的獎勵;當 γ 接近一,它有遠見,樂意放棄眼前小甜頭,換取許多步之後更大的報酬。它扮演的角色就像金錢的利率:晚一點到手的獎勵,比今天同樣的獎勵價值略低。

具體而言,從現在算起第 k 步才到的獎勵,在加進回報前要先乘上 γ 的 k 次方。一個小於一的值能讓那個無窮級數保持有限且良好定義,這在互動永不結束時至關重要。設定 γ 是一個真實的建模選擇:太低,智能體目光短淺;太高,功勞被攤得太薄,學習因而變慢且不穩定。

G_t=\sum_{k=0}^{\infty}\gamma^{k}\,r_{t+k+1},\quad 0\le\gamma<1

未來獎勵以幾何方式衰減;γ 調節視野的遠近。

又称
gamma