馬可夫決策過程

獎勵函數(reward function)

獎勵函數是計分板。每一步之後,環境遞給智能體一個數字,說明那個時刻有多好:達成目標為正,撞毀為負,也許每流逝一秒就扣一點。這個訊號就是「我們想要什麼」的全部定義,智能體沒有別的成功概念。

形式上,獎勵是附在狀態、狀態-動作對或一次轉移上的期望值。智能體從不優化單一獎勵;它優化的是它們的長期總和,也就是回報。由於獎勵是你的意圖唯一進入系統的地方,草率的設計會被鑽漏洞:智能體可能找到一個既堆高獎勵、又違背你本意的取巧之道。

獎勵說的是要達成什麼,而非怎麼做;把「怎麼做」講清楚是策略的工作。

又稱
reward signalR