強化學習是什麼

延遲獎勵(delayed reward)

在許多問題裡,好動作的回報出現得很晚,而不是當下就來。西洋棋裡一步高明的開局,也許要到二十步之後才看得出價值;今晚用功,要到下個月考試才見效。一個動作之後立刻拿到的獎勵,常常說不出這動作到底明不明智——它真正的後果還在下游。

延遲獎勵(delayed reward)是強化學習的一大標誌性難題,也是它需要特殊工具的原因。智能體必須把一個獎勵接回到當初賺到它的那些較早的決策,而且必須看重未來的獎勵,而不只是即時的滿足。折扣因子和價值函數的存在,很大程度上就是為了處理這件事:它們讓智能體即使在真正的獎勵還很遙遠時,也能估出一個動作的長期價值。