回報、價值與策略

基線相減(baseline subtraction)

想像替學生評分時,不看原始分數,而是看每個人落在班級平均之上或之下多遠。基線相減對動作做的是同一件事:不用原始回報來評判一個動作,而是減去一個參考值——基線——再用差值來評判。如果這個選擇贏過基線,它仍會被往上推;不如基線,就被往下壓,只是數字更小、更穩。

關鍵事實是:減去任何不依賴於動作的基線,都不會改變策略梯度更新的期望值——它不引入偏差——卻能戲劇性地削減那個更新的變異。最自然的基線是狀態價值,用它就把原始回報變成了優勢。這就是為什麼許多演算法估計一個價值函數純粹是當作基線:不是拿去直接行動,而是讓學習訊號雜訊小得多。

\nabla_\theta J=\mathbb{E}\big[(G_t-b(s_t))\,\nabla_\theta\log\pi_\theta(a_t\mid s_t)\big]

減去只依賴狀態的基線,能保持梯度無偏,卻降低它的變異。

又称
baselinecontrol variate