前沿與開放問題

獎勵設定問題(reward-specification problem)

RL 會優化你寫下的任何獎勵——而且是不留情、按字面、毫無常識地去優化。獎勵設定問題(reward-specification problem)說的是一個殘酷的事實:寫出一個「真正捕捉到你想要什麼」的獎勵,遠比看起來困難。經典的警世故事,是一個賽船智能體被告知「最大化分數」,結果學會了原地打轉、永無止盡地撞那些加分標靶,而不是完成比賽:它把獎勵優化得完美無缺,把本意卻完全沒做到。

這種失敗有名字。獎勵駭客(reward hacking)是指智能體鑽了一個設定錯誤的獎勵的漏洞;本想加上有用提示的獎勵塑形,可能不小心改變了最佳行為;而過於稀疏的獎勵則根本沒給出可學的東西。正因為手工設計獎勵如此容易出錯,現代實務有很大一部分改成「學出」獎勵——透過逆向 RL 從示範中學,或透過偏好學習與 RLHF 從人類的比較中學。

這個問題是通往 AI 安全的門戶:隨著智能體愈來愈有能力,一個微妙錯誤的目標所付出的代價也隨之水漲船高,而一個強大的優化器會找到人類從未設想過的漏洞。在規模上「設定我們能信任的目標」——以及「偵測智能體究竟是在鑽指標的漏洞、還是真的達成了目的」——是這個領域最深的開放問題之一。