對齊理論

可擴展監督(scalable oversight)

批改一個孩子的算術很容易,因為你可以親自核對每一個答案。批改一篇你從未涉足之領域的博士論文,就難得多。當 AI 系統開始做一些對人類而言太龐大、太專精、或太大量而無法直接核對的任務時,我們就撞上一道牆:當我們再也無法可靠地判斷它的工作時,要怎麼繼續給它正確的回饋與獎勵?可擴展監督就是這整個挑戰的名稱。

精確地說,可擴展監督是一個總括性的問題:為那些「無外援的人類無法完全判斷」的任務,提供可信賴的訓練信號與評估。各種被提出的方法背後,主導的想法是用 AI 來幫助人類監督 AI:迭代放大把難題拆成可核對的小塊;AI 辯論讓兩個 AI 互相對抗、由人類當裁判;遞迴獎勵建模訓練出能讓困難輸出變得「可評估」的輔助模型;而弱到強泛化則研究弱的監督者能否仍從更強的模型中引出良好行為。研究者用「夾心實驗」(sandwiching)來測試這些方法,也就是找一個對非專家人類來說很難、但專家可核對的任務,看看某個方法能否讓非專家也監督得好。

它之所以重要,是因為外部對齊的成敗繫於訓練信號的品質。沒有可擴展監督,一個用於超人類任務的獎勵模型就會變成一個不可靠的代理,被系統悄悄鑽漏洞,又是古德哈特陷阱。誠實的現況:這是一個活躍的研究議程,可說是對齊「能力極強之系統」最核心的實務瓶頸,而目前還沒有任何被提出的方法被認為能完全解決它。

要為一個 AI「替一本人類沒讀過的九百頁書寫摘要」這件事打分,可擴展監督的方法會找來其他 AI 來點出關鍵段落、查核說法,好讓人類能評斷一件他獨力無法評斷的任務。

借助 AI 的協助,去評斷超出人類獨力所及的工作。

可擴展監督是「問題」,不是「解法」:迭代放大、辯論、遞迴獎勵建模與弱到強泛化都是針對它提出的途徑,而每一種都有尚未解決的弱點。

又称
scalable supervision可擴展監督問題