對齊與人類回饋強化學習(RLHF)
可擴展監督(scalable oversight)
可擴展監督,要處理的是這個問題:當任務太難、太大、或太專門,人類無法直接查核時,要怎麼監督模型。RLHF 預設人能判斷兩個答案哪個比較好,但面對一份書本長度的證明、一座龐雜的程式庫、或一個標註者不懂的領域裡的主張,這個前提就崩了。如果你連輸出都看不懂,又怎麼訓練模型在上面誠實且正確?
目前提出的答案,都是想放大有限的人類判斷,而非取代它。你可以把難任務拆成小而可查核的片段;讓模型產出人類能抽查的批評或逐步推理;讓兩個模型互相辯論,使外行評審也能跟上爭點;或用一個可信的較弱模型協助監督較強的模型。憲法式 AI 與 RLAIF 的部分動機,正是同樣想把稀缺的人類監督撐得更遠。
對於在某些領域已超越人類能力的系統,可擴展監督是對齊的核心未解問題之一。它要處理的隱憂很具體:一個「在我們查得到的地方對、在我們查不到的地方悄悄錯」的模型,正是好的監督必須抓出來的失敗。
又稱
另見