對齊理論

遞迴獎勵建模(recursive reward modeling)

假設你想為一個你無法完全判斷的工作獎勵一個 AI,比方說,替一本厚重的技術書寫出一份好摘要。一種做法是:先打造一些讓這份工作變得「可評斷」的 AI 助手,一個會抽出關鍵主張、並標出摘要哪裡寫錯的助手,這樣你只需要為一件你如今真的能核對的東西評分。遞迴獎勵建模就是用「同一套技術」一層疊一層地打造這些助手。

精確地說,一般的獎勵建模(Leike 等人,DeepMind,2018)指的是從人類回饋中學出一個獎勵模型,再訓練一個智能體去最大化它,而不是手寫死獎勵。遞迴獎勵建模加上了自我拉拔:用你已經在較簡單任務上訓練好、且對齊好的智能體,去協助人類評估較困難的任務;這份有協助的人類回饋訓練出針對較難任務的獎勵模型;而這些新訓練出的智能體又去協助評估更難的任務。你一級一級往上爬,每一級都站在下一級所建立的、對齊好的智能體之上。

它之所以重要,是因為它是通往可擴展監督的「獎勵模型路線」,與迭代放大和辯論密切相關。誠實的但書承襲自獎勵建模本身:獎勵模型是人類偏好的一個「學到的代理」,而不是偏好本身,因此它可能被鑽漏洞(古德哈特定律與獎勵過度優化)。在這之上,每一個遞迴層都可能把它底下各層的錯誤一併放大,因此它仍是一個研究階段的途徑,而非已部署的解法。

要訓練一個模型把研究論文摘要寫好,你先訓練一個會抽出並查核每篇論文關鍵主張的助手,再用這個助手讓人類能可靠地為摘要評分,而這個分數就用來訓練那個摘要模型。

對齊好的助手讓更難的任務變得可評估,一層接一層。

獎勵模型是人類判斷的代理,而非真貨,因此可能被過度優化與鑽漏洞。遞迴獎勵建模並不消除這個風險,而層層堆疊還可能讓小錯誤逐步累積。

又称
RRMrecursive reward modelling遞迴獎勵模型