基於人類回饋的強化學習

基於人類回饋的強化學習(RL from human feedback, RLHF)

有些目標很容易辨認,卻幾乎不可能寫成獎勵函數——「要有幫助」、「聽起來自然」、「別無禮」。RLHF 繞開了「寫出獎勵」這個難題,改成去問人。你讓智能體產生行為,請人類判斷哪個比較好,再把這些判斷轉成智能體要最佳化的獎勵。實際上,人類就成了那份你怎麼也寫不進程式碼的規格。

經典的流程分三階段。先從一個用一般監督式學習訓練好的模型出發。蒐集人類對它輸出的比較,並配適一個獎勵模型,去預測人會偏好哪個輸出。然後用強化學習——通常是 PPO——針對那個學到的獎勵改進策略,同時用一個懲罰項防止它偏離起點太遠。獎勵模型正是那個放大器,讓區區幾千筆人類標註,得以推廣到數百萬個全新情境。

現代聊天助理之所以被塑造得有幫助又無害,靠的就是 RLHF,實務上效果出奇地好。但它承襲了每個組成部分的弱點:獎勵模型只是人類價值的不完美代理,把它最佳化得太用力,就會冒出獎勵駭客與古德哈特效應。它是一套強大、實用的配方——而不是價值對齊已經完工的解答。

又称
RLHF