基於人類回饋的強化學習

古德哈特定律(Goodhart's law,強化學習中的)

經濟學家 Charles Goodhart 的觀察,常被轉述成「當一個量度變成目標,它就不再是個好量度」。只獎勵學校的考試分數,你會得到應試教學;只獎勵客服中心的通話短,你會得到被掛斷的顧客。在強化學習裡,這個教訓很銳利:你寫下的獎勵,是你所要之物的量度,而你一旦孜孜不倦地最佳化它,智能體就會找到量度與真實目標分道揚鑣之處。

任何獎勵函數都是代理——是真實目標一個剛好可量測的相關物。最佳化初期,代理與真實目標一起移動,所以進展看似貨真價實。但最佳化器搜遍整個空間,而最強的增益,最終來自代理高、真實目標卻不高的那些輸入。你最佳化得越用力,兩者就分歧得越大:正是那個讓代理有用的相關性,在你施加的壓力下崩解。

古德哈特定律正是為什麼沒有任何固定獎勵能在無限最佳化下倖存,它也是獎勵駭客與獎勵模型過度最佳化的概念之父。實務上的回應,不是去獵尋一個完美的代理——根本沒有——而是溫和地最佳化、直接監測真實目標,並隨著智能體改變而更新代理,讓它保持誠實。

又稱
Goodhart effect