基於人類回饋的強化學習

基於偏好的強化學習(preference-based reinforcement learning)

經典強化學習假設環境在每一步都遞給智能體一個數值獎勵。但許多真實任務根本沒有這種數字——一個「看起來自然」的後空翻,獎勵該是多少?基於偏好的強化學習丟掉「獎勵已給定」這個假設,純粹從比較回饋學習:偶爾拿兩個行為給人類(或其他神諭)看,由他說哪個比較好,智能體則必須只從這些判斷裡,找出一個好策略。

標準做法交織著兩個迴圈。智能體行動、蒐集經驗;一位老師比較成對的行為,常常是整段軌跡或短片段;一個獎勵模型被配適到那些比較上;智能體再針對目前的獎勵模型做一般的強化學習——然後循環重來,為智能體如今造訪的情境查詢新的比較。語言模型的 RLHF 是著名的個案,但這個框架是通用的、早於大型模型,根源在機器人學與控制。

核心的研究問題是回饋效率:人類比較很貴,那你該問哪些對?好的基於偏好強化學習會明智地花用它的查詢預算——主動學習、不確定性抽樣、只問那些答案最能改變策略的地方——並誠實面對:學到的獎勵不過是老師的一個模型,承擔著隨之而來的每一分過度最佳化風險。

又稱
PbRL