基於人類回饋的強化學習

軌跡偏好回饋(trajectory preference feedback)

要一個人說某一個關節扭矩、或某一個詞元好不好,是很難的——那些選擇只有在脈絡裡才說得通。讓他看兩個完整行為演完、再說比較喜歡哪個,就容易多了。軌跡偏好回饋正是如此:人類比較的是整段行為序列——一整套機器人動作、一段完整對話、一段遊玩片段——而不是一步一步辛苦地評判。

人比較的是軌跡,但獎勵模型通常替個別狀態或步驟評分;連接兩者的橋樑,是「一條軌跡的總價值等於它各步獎勵之和」這個假設。於是兩個片段之間的偏好,變成對獎勵總和的一個約束,而配適獎勵模型——透過對軌跡報酬和的 Bradley-Terry——就把單一個粗略判斷,分攤到裡頭所有步驟上。這正是區區幾個片段比較,如何能教出一個稠密、步驟層級的獎勵。

這份便利藏著一個棘手的功勞分配問題:若你偏好片段 A,它眾多時刻裡,究竟哪一個才真正配得到功勞?長軌跡讓這更糟,而人可能只憑一個顯眼時刻、或像流暢度這種表面特徵來判斷。較短的片段與精選的比較有幫助,但把軌跡層級的偏好攤到步驟層級的獎勵,本質上就模稜兩可,獎勵模型只能去猜。

P(\tau_1\succ\tau_2)=\sigma\Big(\sum_{t}r(s_t,a_t)\big|_{\tau_1}-\sum_{t}r(s_t,a_t)\big|_{\tau_2}\Big)

片段之間的偏好,約束了它們獎勵總和之差。

又稱
segment preference feedback