人工智慧安全與對齊

可擴展監督(scalable oversight)

可擴展監督探討的問題是:當一項任務的正確與否人類難以可靠判斷時,該如何監督模型——因為要查驗答案所需的專業、時間或證據,已超出人類所能負荷。想像要評閱一份上千頁的資安稽核,或一個新穎的數學證明:在被評判的那項任務上,模型本身可能就強過監督者。研究目標是設計出即使系統能力超越其監督者、仍能保持可信的訓練與評估訊號。

共通策略是把困難的判斷拆解成有限的人類能查驗的片段,或引入人類可稽核的 AI 協助。具體提案包括:辯論,由兩個模型互相爭辯、再由較弱的評審裁決;遞迴獎勵建模與任務分解,把問題切成子問題、再由子答案組合而成;AI 輔助批判,由模型指出缺陷供人類審視;以及過程監督,去評分推理步驟而非無從查驗的最終答案。

它之所以重要,是因為來自人類回饋的對齊保證,恰恰在賭注最高、任務超越人類之處開始瓦解。尚待解決的隱憂是:分解可能在接縫處洩漏錯誤,而協助你判斷的 AI 也可能與它本應揭露的失效共享同一個盲點。因此人們用「夾心」實證實驗——讓一個強模型被刻意設定的弱人類監督——來檢驗某方法是否真的縮小了這道落差。

又称
可擴展監督scalable supervision