應用、環境與模擬到真實

獎勵工程(實務上,reward engineering)

教科書裡獎勵是直接給定的;實務上你卻得自己發明它,而這份設計悄悄地決定了智能體的一切作為。獎勵工程是一門手藝:把一個模糊的目標——平穩駕駛、樂於助人、把積木疊好——轉成一個讓智能體去最大化的數值訊號,然後接受一個事實:它會精確地最大化你「寫下」的東西,而不是你「想要」的東西。

其中的藝術,在於權衡稀疏的終端獎勵(對成敗很誠實但難以從中學習)與密集的塑形獎勵(學得較快卻容易被鑽漏洞)。良好的做法會加入可證明「不改變最佳策略」的塑形、對不安全行為明確施罰、把獎勵尺度正規化,並在擴大規模之前就獵捕漏洞。帶約束的表述則有幫助,因為它把「最大化這個」和「絕不違反那個」分開來。

獎勵鑽漏洞(reward hacking)——智能體找到一個你從未打算、卻能拿高分的行為——是常態,而非例外。把你寫下的第一版獎勵當成一個「有待除錯的假設」,而不是一份完工的規格。

F(s,a,s') = \gamma\,\Phi(s') - \Phi(s)

基於勢能的塑形:加入 F 不會改變最佳策略。

又称
reward designcrafting rewards